AI Dataset Generator

Pipeline basé sur SQLite qui génère, vérifie, déduplique et exporte des jeux de données d'entraînement SFT/DPO.

par Bhanunamikaze · Bhanunamikaze/AI-Dataset-Generator

Testé · Fonctionne ★ 8.8/10

AI Dataset Generator — Pipeline basé sur SQLite qui génère, vérifie, déduplique et exporte des jeux de données d'entraînement SFT/DPO.

Ce que fait

Exécute un pipeline local déterministe (générer, vérifier par heuristique + juge LLM contradictoire, dédupliquer par shingles, exporter piloté par schéma avec une carte de données) pour construire des jeux de données de fine-tuning SFT ou DPO à partir de sujets, d'URL ou de fichiers JSONL/CSV existants. Se déclenche sur les demandes de génération, de nettoyage, de vérification ou d'exportation de jeux de données d'entraînement pour Codex, Antigravity ou Claude Code.

Rapport de test

A exécuté le véritable pipeline SQLite de bout en bout (importer 5 enregistrements SFT de compréhension Python rédigés, revue par juge LLM contradictoire, déduplication, exportation) et il a produit un flat_train.jsonl fonctionnel plus un DATA_CARD.md véritablement utile avec des distributions de score de juge et de difficulté - mais la séquence exacte de commandes de vérification en deux étapes imprimée dans le flux de travail numéroté du SKILL.md lui-même traite silencieusement 0 enregistrement la deuxième fois car l'étape 6 a déjà déplacé les enregistrements du statut raw_generated sur lequel l'étape 7 filtre.

Testé le: 2026-07-15 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Bhanunamikaze/AI-Dataset-Generator
cd AI-Dataset-Generator
mkdir -p ~/.claude/skills
cp -r . ~/.claude/skills/dataset-generator

Commandes et exemples de prompts

  • /dataset-generatorPipeline basé sur SQLite qui génère, vérifie, déduplique et exporte des jeux de données d'entraînement SFT/DPO.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Generate a small SFT training dataset of Python Q&A pairs for fine-tuning
  • Dedupe and verify this JSONL dataset before I export it for DPO training
  • Build a fine-tuning dataset from these URLs with an adversarial judge pass