AI Data Engineering

Potoki RAG, chunking, embeddingi, magazyny cech i orkiestracja dla systemów danych AI/ML

Autor: ancoleman · ancoleman/ai-design-components

Testowano · Działa ★ 8.8/10

AI Data Engineering — Potoki RAG, chunking, embeddingi, magazyny cech i orkiestracja dla systemów danych AI/ML

Co robi ten skill

Prowadzi budowę infrastruktury danych dla systemów AI/ML: potoki RAG (ingestion, chunking, embedding, retrieval, RAGAS evaluation), magazyny cech (Feast), potoki embeddingów i orkiestracja (Dagster, Prefect, Airflow, dbt). Uruchamia się podczas budowania backendów RAG lub wyszukiwania semantycznego, konfigurowania serwowania cech ML lub tworzenia potoków embeddingów i transformacji danych. Dostarcza dokumentację referencyjną, uruchamialne przykładowe projekty (LangChain, LlamaIndex, Feast, Dagster) oraz samodzielne skrypty do chunkingu/ewaluacji/konfiguracji.

Raport z testu

Pobrano SKILL.md i sprawdzono 3 odwołane ścieżki przez raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — wszystkie HTTP 200 z rzeczywistym, merytorycznym kodem, brak luk bezpieczeństwa (przeszukano pod kątem curl|sh, base64, os.system, exfil). Zainstalowano w tymczasowym HOME; SKILL.md wylądował w prawidłowej ścieżce docelowej. Dla OUTPUT napisałem dwa chunkery i uruchomiłem oba na próbce 2232 znaków: bazowy splitter o stałej długości 512 znaków przeciął chunk 0 w środku słowa („...vector store.\n\nChunking ”) z zerowym nakładaniem się, podczas gdy chunker z rekurencyjnym separatorem (512/50 zgodnie z treścią umiejętności) zakończył chunk 0 czysto na granicy „\n\n” i rozpoczął chunk 1 z 50-znakowym nakładaniem się, plus ustrukturyzowane wyjście chunk_id/source/metadata — konkretna różnica w jakości wyszukiwania, a nie powtórzenie zasad.

Testowano: 2026-07-21 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Komendy i przykładowe prompty

  • /ai-data-engineeringPotoki RAG, chunking, embeddingi, magazyny cech i orkiestracja dla systemów danych AI/ML

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster