AI Data Engineering

Pipeline RAG, chunking, embeddings, feature store e orchestrazione per sistemi dati AI/ML

di ancoleman · ancoleman/ai-design-components

Promosso ★ 8.8/10

AI Data Engineering — Pipeline RAG, chunking, embeddings, feature store e orchestrazione per sistemi dati AI/ML

Cosa fa

Guida la costruzione di infrastrutture dati per sistemi AI/ML: pipeline RAG (ingestion, chunking, embedding, retrieval, valutazione RAGAS), feature store (Feast), pipeline di embedding e orchestrazione (Dagster, Prefect, Airflow, dbt). Si attiva quando si costruiscono backend RAG o di ricerca semantica, si imposta il serving di feature ML o si creano pipeline di embedding e trasformazione dati. Include documenti di riferimento, progetti di esempio eseguibili (LangChain, LlamaIndex, Feast, Dagster) e script standalone di chunking/valutazione/setup.

Rapporto di test

SKILL.md recuperato e 3 percorsi referenziati controllati a campione tramite raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — tutti HTTP 200 con codice sostanziale reale, nessun problema di sicurezza (cercato con grep per curl|sh, base64, os.system, exfil). Installato in una HOME temporanea; SKILL.md è atterrato nel percorso target corretto. Per l'output ho scritto due chunker e li ho eseguiti entrambi su un campione di 2232 caratteri: lo splitter baseline a 512 caratteri fissi ha tagliato il chunk 0 a metà parola ("...vector store.\n\nChunking ") con zero sovrapposizione, mentre il chunker a separatore ricorsivo che segue la skill (512/50 per corpo della skill) ha terminato il chunk 0 in modo pulito al confine "\n\n" e ha iniziato il chunk 1 con una sovrapposizione di 50 caratteri, più output strutturato chunk_id/source/metadata — una concreta differenza di qualità del recupero, non una riformulazione delle regole.

Testato il: 2026-07-21 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Comandi e prompt di esempio

  • /ai-data-engineeringPipeline RAG, chunking, embeddings, feature store e orchestrazione per sistemi dati AI/ML

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster