AI Data Engineering

RAG-pipelines, chunking, embeddings, feature stores og orkestrering for AI/ML-datasystemer

av ancoleman · ancoleman/ai-design-components

Bestått ★ 8.8/10

AI Data Engineering — RAG-pipelines, chunking, embeddings, feature stores og orkestrering for AI/ML-datasystemer

Hva den gjør

Veileder i bygging av datainfrastruktur for AI/ML-systemer: RAG-pipelines (inntak, chunking, embedding, gjenfinning, RAGAS-evaluering), feature stores (Feast), embedding-pipelines og orkestrering (Dagster, Prefect, Airflow, dbt). Utløses ved bygging av RAG- eller semantisk søk-backends, oppsett av ML feature serving, eller oppretting av embedding- og datatransformasjons-pipelines. Leveres med referansedokumenter, kjørbare eksempelprosjekter (LangChain, LlamaIndex, Feast, Dagster) og frittstående chunking-/evaluerings-/oppsettsskript.

Testrapport

Hentet SKILL.md og sjekket 3 refererte stier via rå henting (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — alle HTTP 200 med reell substansiell kode, ingen sikkerhetsfeil (grep for curl|sh, base64, os.system, exfil). Installert i en midlertidig HOME; SKILL.md landet på riktig målsti. For utdata skrev jeg to chunkere og kjørte begge på et 2232-tegn utvalg: baseline fixed-512-char splitter kuttet chunk 0 midt i ordet ("...vector store.\n\nChunking ") med null overlapping, mens den ferdighetsfølgende recursive-separator chunkeren (512/50 per ferdighetskropp) avsluttet chunk 0 rent ved "\n\n"-grensen og startet chunk 1 med en 50-tegn overlapping, pluss strukturert chunk_id/source/metadata-utdata — en konkret gjenfinningskvalitetsforskjell, ikke en gjentakelse av regler.

Testet på: 2026-07-21 · Claude Code 2.x (agent harness)

Installer

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Kommandoer og eksempelprompter

  • /ai-data-engineeringRAG-pipelines, chunking, embeddings, feature stores og orkestrering for AI/ML-datasystemer

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster