AI Data Engineering
RAG pipelines, chunking, embeddings, feature stores en orkestratie voor AI/ML datasystemen
Getest · Werkt
Wat het doet
Begeleidt het bouwen van data-infrastructuur voor AI/ML systemen: RAG pipelines (ingestion, chunking, embedding, retrieval, RAGAS evaluation), feature stores (Feast), embedding pipelines, en orkestratie (Dagster, Prefect, Airflow, dbt). Activeert bij het bouwen van RAG of semantic-search backends, het opzetten van ML feature serving, of het creëren van embedding en data-transformatie pipelines. Levert referentiedocumenten, uitvoerbare voorbeeldprojecten (LangChain, LlamaIndex, Feast, Dagster), en standalone chunking/evaluation/setup scripts.
Testrapport
SKILL.md opgehaald en 3 gerefereerde paden steekproefsgewijs gecontroleerd via raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — allen HTTP 200 met echte inhoudelijke code, geen security smells (gegrepped op curl|sh, base64, os.system, exfil). Geïnstalleerd in een tijdelijke HOME; SKILL.md landde op het juiste doelpad. Voor output schreef ik twee chunkers en voerde beide uit op een 2232-char sample: de baseline fixed-512-char splitter sneed chunk 0 midden in een woord ("...vector store.\n\nChunking ") met nul overlap, terwijl de skill-volgende recursive-separator chunker (512/50 per skill body) chunk 0 netjes beëindigde bij de "\n\n" grens en chunk 1 begon met een 50-char overlap, plus gestructureerde chunk_id/source/metadata output — een concreet verschil in retrieval-kwaliteit, geen herhaling van regels.
Getest op: 2026-07-21 · Claude Code 2.x (agent harness)
Installatie
git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src mkdir -p ~/.claude/skills cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering # SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md # Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py, # evaluate_rag.py, setup_qdrant.py) need Python deps to run: # pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster # Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.
Commando's en voorbeeldprompts
/ai-data-engineeringRAG pipelines, chunking, embeddings, feature stores en orkestratie voor AI/ML datasystemen
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Design a RAG pipeline with chunking and embeddingsSet up a feature store for our ML modelsOrchestrate this data pipeline with Dagster