AI Data Engineering

Pipelines RAG, chunking, embeddings, feature stores y orquestación para sistemas de datos AI/ML

Por ancoleman · ancoleman/ai-design-components

Probado · Funciona ★ 8.8/10

AI Data Engineering — Pipelines RAG, chunking, embeddings, feature stores y orquestación para sistemas de datos AI/ML

Qué hace

Guía la construcción de infraestructura de datos para sistemas AI/ML: pipelines RAG (ingesta, chunking, embedding, recuperación, evaluación RAGAS), feature stores (Feast), pipelines de embedding y orquestación (Dagster, Prefect, Airflow, dbt). Se activa al construir backends RAG o de búsqueda semántica, configurar el servicio de características de ML o crear pipelines de embedding y transformación de datos. Incluye documentos de referencia, proyectos de ejemplo ejecutables (LangChain, LlamaIndex, Feast, Dagster) y scripts independientes de chunking/evaluación/configuración.

Informe de la prueba

SKILL.md obtenido y verifiqué 3 rutas referenciadas a través de fetch raw (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — todos HTTP 200 con real substantive code, sin problemas de seguridad (grepped for curl|sh, base64, os.system, exfil). Instalado en un temp HOME; SKILL.md aterrizó en la correct target path. Para la salida, escribí two chunkers y ejecuté both on a 2232-char sample: el baseline fixed-512-char splitter cut chunk 0 mid-word ("...vector store.\n\nChunking ") con zero overlap, mientras que el skill-following recursive-separator chunker (512/50 per skill body) ended chunk 0 cleanly at the "\n\n" boundary y started chunk 1 with a 50-char overlap, plus structured chunk_id/source/metadata output — una diferencia concrete retrieval-quality, not a restatement of rules.

Probado el: 2026-07-21 · Claude Code 2.x (agent harness)

Instalación

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Comandos y prompts de ejemplo

  • /ai-data-engineeringPipelines RAG, chunking, embeddings, feature stores y orquestación para sistemas de datos AI/ML

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster