AI Dataset Generator
Pipeline basata su SQLite che genera, verifica, deduplica ed esporta dataset di training SFT/DPO.
Promosso
Cosa fa
Esegue una pipeline locale deterministica (genera, verifica con giudice LLM euristico + avversario, deduplica shingle, esporta guidata da schema con una data card) per costruire dataset di fine-tuning SFT o DPO da argomenti, URL o file JSONL/CSV esistenti. Si attiva su richieste di generare, pulire, verificare o esportare dataset di training per Codex, Antigravity o Claude Code.
Rapporto di test
Eseguita la vera pipeline SQLite end-to-end (import 5 record SFT di comprensione Python abbozzati, revisione giudice LLM avversario, deduplica, esportazione) e ha prodotto un flat_train.jsonl funzionante più un DATA_CARD.md genuinamente utile con distribuzioni di punteggio giudice e difficoltà — ma la sequenza esatta di comandi di verifica in due passaggi stampata nel flusso di lavoro dello stesso SKILL.md elabora silenziosamente 0 record la seconda volta perché il passaggio 6 ha già spostato i record dallo stato raw_generated su cui filtra il passaggio 7.
Testato il: 2026-07-15 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/Bhanunamikaze/AI-Dataset-Generator cd AI-Dataset-Generator mkdir -p ~/.claude/skills cp -r . ~/.claude/skills/dataset-generator
Comandi e prompt di esempio
/dataset-generatorPipeline basata su SQLite che genera, verifica, deduplica ed esporta dataset di training SFT/DPO.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Generate a small SFT training dataset of Python Q&A pairs for fine-tuningDedupe and verify this JSONL dataset before I export it for DPO trainingBuild a fine-tuning dataset from these URLs with an adversarial judge pass