AI Data Engineering
RAG-Pipelines, Chunking, Embeddings, Feature Stores und Orchestrierung für KI/ML-Datensysteme
Getestet · Funktioniert
Was es kann
Leitet den Aufbau von Dateninfrastrukturen für KI/ML-Systeme an: RAG-Pipelines (Ingestion, Chunking, Embedding, Retrieval, RAGAS-Evaluierung), Feature Stores (Feast), Embedding-Pipelines und Orchestrierung (Dagster, Prefect, Airflow, dbt). Wird ausgelöst beim Aufbau von RAG- oder Semantic-Search-Backends, beim Einrichten von ML-Feature-Serving oder beim Erstellen von Embedding- und Datentransformations-Pipelines. Liefert Referenzdokumente, ausführbare Beispielprojekte (LangChain, LlamaIndex, Feast, Dagster) und eigenständige Chunking-/Evaluierungs-/Setup-Skripte.
Testbericht
SKILL.md abgerufen und 3 referenzierte Pfade über raw fetch stichprobenartig geprüft (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) – alle HTTP 200 mit echtem, substanziellem Code, keine Sicherheitslücken (nach curl|sh, base64, os.system, exfil gesucht). In ein temporäres HOME installiert; SKILL.md landete am korrekten Zielpfad. Für den Output habe ich zwei Chunker geschrieben und beide auf einem 2232 Zeichen langen Beispiel ausgeführt: Der Baseline-Fixed-512-Zeichen-Splitter schnitt Chunk 0 mitten im Wort ("...vector store.\n\nChunking ") mit null Überlappung, während der Skill-konforme rekursive-Separator-Chunker (512/50 pro Skill-Body) Chunk 0 sauber an der "\n\n"-Grenze beendete und Chunk 1 mit einer 50-Zeichen-Überlappung begann, plus strukturiertem chunk_id/source/metadata-Output – ein konkreter Unterschied in der Abrufqualität, keine Wiederholung von Regeln.
Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src mkdir -p ~/.claude/skills cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering # SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md # Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py, # evaluate_rag.py, setup_qdrant.py) need Python deps to run: # pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster # Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.
Befehle & Beispiel-Prompts
/ai-data-engineeringRAG-Pipelines, Chunking, Embeddings, Feature Stores und Orchestrierung für KI/ML-Datensysteme
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Design a RAG pipeline with chunking and embeddingsSet up a feature store for our ML modelsOrchestrate this data pipeline with Dagster