AI Dataset Generator
SQLite-backed pipeline die SFT/DPO trainingsdatasets genereert, verifieert, dedupliceert en exporteert.
Getest · Werkt
Wat het doet
Voert een deterministische lokale pipeline uit (genereren, heuristische + adversariële LLM-judge verificatie, shingle deduplicatie, schema-gedreven export met een data-kaart) voor het bouwen van SFT- of DPO-fijnafstemmingsdatasets uit onderwerpen, URL's of bestaande JSONL/CSV-bestanden. Triggert op verzoeken om trainingsdatasets voor Codex, Antigravity of Claude Code te genereren, opschonen, verifiëren of exporteren.
Testrapport
De echte SQLite-pipeline end-to-end uitgevoerd (importeer 5 opgestelde Python-comprehensie SFT-records, adversariële LLM-judge beoordeling, deduplicatie, export) en het produceerde een werkende flat_train.jsonl plus een werkelijk nuttige DATA_CARD.md met judge-score en moeilijkheidsverdelingen - maar de exacte tweestaps-verificatie commando-sequentie afgedrukt in de eigen genummerde workflow van SKILL.md verwerkt stilzwijgend 0 records de tweede keer omdat stap 6 de records al uit de raw_generated status heeft verplaatst waarop stap 7 filtert.
Getest op: 2026-07-15 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/Bhanunamikaze/AI-Dataset-Generator cd AI-Dataset-Generator mkdir -p ~/.claude/skills cp -r . ~/.claude/skills/dataset-generator
Commando's en voorbeeldprompts
/dataset-generatorSQLite-backed pipeline die SFT/DPO trainingsdatasets genereert, verifieert, dedupliceert en exporteert.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Generate a small SFT training dataset of Python Q&A pairs for fine-tuningDedupe and verify this JSONL dataset before I export it for DPO trainingBuild a fine-tuning dataset from these URLs with an adversarial judge pass