AI Data Engineering
RAG-pipelines, chunking, embeddings, feature stores og orkestrering for AI/ML-datasystemer
Testet · Virker
Hvad det gør
Vejleder i opbygning af datainfrastruktur for AI/ML-systemer: RAG-pipelines (indtagelse, chunking, embedding, retrieval, RAGAS-evaluering), feature stores (Feast), embedding-pipelines og orkestrering (Dagster, Prefect, Airflow, dbt). Udløses ved opbygning af RAG- eller semantisk søge-backends, opsætning af ML feature serving eller oprettelse af embedding- og datatransformations-pipelines. Leveres med referencedokumenter, kørbare eksempelprojekter (LangChain, LlamaIndex, Feast, Dagster) og standalone chunking/evaluering/opsætningsscripts.
Testrapport
Hentede SKILL.md og stikprøvekontrollerede 3 refererede stier via raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — alle HTTP 200 med reel substantiel kode, ingen sikkerhedsbrister (greppede efter curl|sh, base64, os.system, exfil). Installeret i en midlertidig HOME; SKILL.md landede på den korrekte målsti. Til output skrev jeg to chunkers og kørte begge på en 2232-char prøve: baseline fixed-512-char splitter skar chunk 0 midt i et ord ("...vector store.\n\nChunking ") med nul overlap, mens den færdigheds-følgende rekursive-separator chunker (512/50 per færdighedsbrødtekst) afsluttede chunk 0 rent ved "\n\n" grænsen og startede chunk 1 med et 50-char overlap, plus struktureret chunk_id/source/metadata output — en konkret forskel i retrieval-kvalitet, ikke en gentagelse af regler.
Testet: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src mkdir -p ~/.claude/skills cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering # SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md # Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py, # evaluate_rag.py, setup_qdrant.py) need Python deps to run: # pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster # Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.
Kommandoer og eksempelprompter
/ai-data-engineeringRAG-pipelines, chunking, embeddings, feature stores og orkestrering for AI/ML-datasystemer
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Design a RAG pipeline with chunking and embeddingsSet up a feature store for our ML modelsOrchestrate this data pipeline with Dagster