AI Data Engineering

RAG pipeline, chunking, embeddings, feature stores a orchestrace pro AI/ML datové systémy

od ancoleman · ancoleman/ai-design-components

Otestováno · Funguje ★ 8.8/10

AI Data Engineering — RAG pipeline, chunking, embeddings, feature stores a orchestrace pro AI/ML datové systémy

Co umí

Vede k budování datové infrastruktury pro AI/ML systémy: RAG pipeline (ingesce, chunking, embedding, retrieval, RAGAS evaluation), feature stores (Feast), embedding pipeline a orchestrace (Dagster, Prefect, Airflow, dbt). Spouští se při budování RAG nebo sémantických vyhledávacích backendů, nastavování ML feature serving nebo vytváření embedding a datově-transformačních pipeline. Dodává referenční dokumenty, spustitelné příklady projektů (LangChain, LlamaIndex, Feast, Dagster) a samostatné skripty pro chunking/evaluation/setup.

Testovací report

SKILL.md a 3 odkazované cesty získány přes raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) – vše HTTP 200 se skutečným podstatným kódem, žádné bezpečnostní rizika (prohledáno na curl|sh, base64, os.system, exfil). Nainstalováno do dočasného HOME; SKILL.md se umístil na správnou cílovou cestu. Pro výstup jsem napsal dva chunkery a spustil oba na vzorku o délce 2232 znaků: základní splitter s pevnou délkou 512 znaků rozsekl chunk 0 uprostřed slova ("...vector store.\n\nChunking ") s nulovým překrytím, zatímco chunker s rekurzivním oddělovačem (512/50 podle těla dovednosti) ukončil chunk 0 čistě na hranici "\n\n" a začal chunk 1 s 50znakovým překrytím, plus strukturovaný výstup chunk_id/source/metadata – konkrétní rozdíl v kvalitě načítání, nikoli přeformulování pravidel.

Testováno: 2026-07-21 · Claude Code 2.x (agent harness)

Instalace

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Příkazy a ukázkové prompty

  • /ai-data-engineeringRAG pipeline, chunking, embeddings, feature stores a orchestrace pro AI/ML datové systémy

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster