AI Data Engineering

RAG pipelines, chunking, embeddings, feature stores en orkestratie voor AI/ML datasystemen

Door ancoleman · ancoleman/ai-design-components

Getest · Werkt ★ 8.8/10

AI Data Engineering — RAG pipelines, chunking, embeddings, feature stores en orkestratie voor AI/ML datasystemen

Wat het doet

Begeleidt het bouwen van data-infrastructuur voor AI/ML systemen: RAG pipelines (ingestion, chunking, embedding, retrieval, RAGAS evaluation), feature stores (Feast), embedding pipelines, en orkestratie (Dagster, Prefect, Airflow, dbt). Activeert bij het bouwen van RAG of semantic-search backends, het opzetten van ML feature serving, of het creëren van embedding en data-transformatie pipelines. Levert referentiedocumenten, uitvoerbare voorbeeldprojecten (LangChain, LlamaIndex, Feast, Dagster), en standalone chunking/evaluation/setup scripts.

Testrapport

SKILL.md opgehaald en 3 gerefereerde paden steekproefsgewijs gecontroleerd via raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — allen HTTP 200 met echte inhoudelijke code, geen security smells (gegrepped op curl|sh, base64, os.system, exfil). Geïnstalleerd in een tijdelijke HOME; SKILL.md landde op het juiste doelpad. Voor output schreef ik twee chunkers en voerde beide uit op een 2232-char sample: de baseline fixed-512-char splitter sneed chunk 0 midden in een woord ("...vector store.\n\nChunking ") met nul overlap, terwijl de skill-volgende recursive-separator chunker (512/50 per skill body) chunk 0 netjes beëindigde bij de "\n\n" grens en chunk 1 begon met een 50-char overlap, plus gestructureerde chunk_id/source/metadata output — een concreet verschil in retrieval-kwaliteit, geen herhaling van regels.

Getest op: 2026-07-21 · Claude Code 2.x (agent harness)

Installatie

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Commando's en voorbeeldprompts

  • /ai-data-engineeringRAG pipelines, chunking, embeddings, feature stores en orkestratie voor AI/ML datasystemen

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster