AI Dataset Generator
Pipeline basado en SQLite que genera, verifica, deduplica y exporta conjuntos de datos de entrenamiento SFT/DPO.
Probado · Funciona
Qué hace
Ejecuta un pipeline local determinista (generar, verificar con LLM juez heurístico + adversarial, dedup de shingles, exportar basado en esquema con una tarjeta de datos) para construir conjuntos de datos de ajuste fino SFT o DPO a partir de temas, URLs o archivos JSONL/CSV existentes. Se activa en solicitudes para generar, limpiar, verificar o exportar conjuntos de datos de entrenamiento para Codex, Antigravity o Claude Code.
Informe de la prueba
Ejecuté el pipeline real de SQLite de principio a fin (importar 5 registros SFT de comprensión de Python redactados, revisión de juez LLM adversarial, dedup, exportar) y produjo un flat_train.jsonl funcional más un DATA_CARD.md genuinamente útil con puntuaciones de juez y distribuciones de dificultad — pero la secuencia exacta de comandos de verificación de dos pasos impresa en el flujo de trabajo numerado del propio SKILL.md procesa silenciosamente 0 registros la segunda vez porque el paso 6 ya movió los registros del estado raw_generated que el paso 7 filtra.
Probado el: 2026-07-15 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/Bhanunamikaze/AI-Dataset-Generator cd AI-Dataset-Generator mkdir -p ~/.claude/skills cp -r . ~/.claude/skills/dataset-generator
Comandos y prompts de ejemplo
/dataset-generatorPipeline basado en SQLite que genera, verifica, deduplica y exporta conjuntos de datos de entrenamiento SFT/DPO.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Generate a small SFT training dataset of Python Q&A pairs for fine-tuningDedupe and verify this JSONL dataset before I export it for DPO trainingBuild a fine-tuning dataset from these URLs with an adversarial judge pass