AI Data Engineering
Pipelines RAG, chunking, embeddings, feature stores y orquestación para sistemas de datos AI/ML
Probado · Funciona
Qué hace
Guía la construcción de infraestructura de datos para sistemas AI/ML: pipelines RAG (ingesta, chunking, embedding, recuperación, evaluación RAGAS), feature stores (Feast), pipelines de embedding y orquestación (Dagster, Prefect, Airflow, dbt). Se activa al construir backends RAG o de búsqueda semántica, configurar el servicio de características de ML o crear pipelines de embedding y transformación de datos. Incluye documentos de referencia, proyectos de ejemplo ejecutables (LangChain, LlamaIndex, Feast, Dagster) y scripts independientes de chunking/evaluación/configuración.
Informe de la prueba
SKILL.md obtenido y verifiqué 3 rutas referenciadas a través de fetch raw (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — todos HTTP 200 con real substantive code, sin problemas de seguridad (grepped for curl|sh, base64, os.system, exfil). Instalado en un temp HOME; SKILL.md aterrizó en la correct target path. Para la salida, escribí two chunkers y ejecuté both on a 2232-char sample: el baseline fixed-512-char splitter cut chunk 0 mid-word ("...vector store.\n\nChunking ") con zero overlap, mientras que el skill-following recursive-separator chunker (512/50 per skill body) ended chunk 0 cleanly at the "\n\n" boundary y started chunk 1 with a 50-char overlap, plus structured chunk_id/source/metadata output — una diferencia concrete retrieval-quality, not a restatement of rules.
Probado el: 2026-07-21 · Claude Code 2.x (agent harness)
Instalación
git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src mkdir -p ~/.claude/skills cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering # SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md # Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py, # evaluate_rag.py, setup_qdrant.py) need Python deps to run: # pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster # Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.
Comandos y prompts de ejemplo
/ai-data-engineeringPipelines RAG, chunking, embeddings, feature stores y orquestación para sistemas de datos AI/ML
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Design a RAG pipeline with chunking and embeddingsSet up a feature store for our ML modelsOrchestrate this data pipeline with Dagster