AI Data Engineering

Pipelines RAG, découpage, embeddings, feature stores et orchestration pour les systèmes de données AI/ML

par ancoleman · ancoleman/ai-design-components

Testé · Fonctionne ★ 8.8/10

AI Data Engineering — Pipelines RAG, découpage, embeddings, feature stores et orchestration pour les systèmes de données AI/ML

Ce que fait

Guide la construction d'infrastructures de données pour les systèmes AI/ML : pipelines RAG (ingestion, découpage, embedding, récupération, évaluation RAGAS), feature stores (Feast), pipelines d'embedding, et orchestration (Dagster, Prefect, Airflow, dbt). Se déclenche lors de la construction de backends RAG ou de recherche sémantique, de la mise en place de services de fonctionnalités ML, ou de la création de pipelines d'embedding et de transformation de données. Fournit des documents de référence, des projets d'exemple exécutables (LangChain, LlamaIndex, Feast, Dagster), et des scripts autonomes de découpage/évaluation/configuration.

Rapport de test

SKILL.md récupéré et 3 chemins référencés vérifiés via raw fetch (scripts/chunk_documents.py, references/rag-architecture.md, examples/langchain-rag/basic_rag.py) — tous HTTP 200 avec du code substantiel réel, pas de failles de sécurité (recherché curl|sh, base64, os.system, exfil). Installé dans un HOME temporaire ; SKILL.md a atterri au bon chemin cible. Pour la sortie, j'ai écrit deux chunkers et les ai exécutés tous les deux sur un échantillon de 2232 caractères : le splitter de base à 512 caractères fixes a coupé le chunk 0 au milieu d'un mot ("...vector store.\n\nChunking ") avec zéro chevauchement, tandis que le chunker à séparateur récursif suivant la compétence (512/50 per skill body) a terminé le chunk 0 proprement à la limite "\n\n" et a commencé le chunk 1 avec un chevauchement de 50 caractères, plus une sortie structurée chunk_id/source/metadata — une différence concrète de qualité de récupération, pas une reformulation des règles.

Testé le: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/ancoleman/ai-design-components.git /tmp/ai-data-engineering-src
mkdir -p ~/.claude/skills
cp -R /tmp/ai-data-engineering-src/skills/ai-data-engineering ~/.claude/skills/ai-data-engineering
# SKILL.md lands at ~/.claude/skills/ai-data-engineering/SKILL.md
# Skill guidance is usable as-is. The bundled example projects and scripts (scripts/chunk_documents.py,
# evaluate_rag.py, setup_qdrant.py) need Python deps to run:
#   pip install langchain langchain-core langchain-openai langchain-voyageai langchain-qdrant qdrant-client ragas datasets feast dagster
# Some examples also need API keys (OPENAI_API_KEY / VOYAGE_API_KEY) and a running Qdrant instance.

Commandes et exemples de prompts

  • /ai-data-engineeringPipelines RAG, découpage, embeddings, feature stores et orchestration pour les systèmes de données AI/ML

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Design a RAG pipeline with chunking and embeddings
  • Set up a feature store for our ML models
  • Orchestrate this data pipeline with Dagster