AI Dataset Generator
Pipeline basé sur SQLite qui génère, vérifie, déduplique et exporte des jeux de données d'entraînement SFT/DPO.
Testé · Fonctionne
Ce que fait
Exécute un pipeline local déterministe (générer, vérifier par heuristique + juge LLM contradictoire, dédupliquer par shingles, exporter piloté par schéma avec une carte de données) pour construire des jeux de données de fine-tuning SFT ou DPO à partir de sujets, d'URL ou de fichiers JSONL/CSV existants. Se déclenche sur les demandes de génération, de nettoyage, de vérification ou d'exportation de jeux de données d'entraînement pour Codex, Antigravity ou Claude Code.
Rapport de test
A exécuté le véritable pipeline SQLite de bout en bout (importer 5 enregistrements SFT de compréhension Python rédigés, revue par juge LLM contradictoire, déduplication, exportation) et il a produit un flat_train.jsonl fonctionnel plus un DATA_CARD.md véritablement utile avec des distributions de score de juge et de difficulté - mais la séquence exacte de commandes de vérification en deux étapes imprimée dans le flux de travail numéroté du SKILL.md lui-même traite silencieusement 0 enregistrement la deuxième fois car l'étape 6 a déjà déplacé les enregistrements du statut raw_generated sur lequel l'étape 7 filtre.
Testé le: 2026-07-15 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Bhanunamikaze/AI-Dataset-Generator cd AI-Dataset-Generator mkdir -p ~/.claude/skills cp -r . ~/.claude/skills/dataset-generator
Commandes et exemples de prompts
/dataset-generatorPipeline basé sur SQLite qui génère, vérifie, déduplique et exporte des jeux de données d'entraînement SFT/DPO.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Generate a small SFT training dataset of Python Q&A pairs for fine-tuningDedupe and verify this JSONL dataset before I export it for DPO trainingBuild a fine-tuning dataset from these URLs with an adversarial judge pass