AI Dataset Generator
SQLite-gestützte Pipeline, die SFT/DPO-Trainingsdatensätze generiert, verifiziert, dedupliziert und exportiert.
Getestet · Funktioniert
Was es kann
Führt eine deterministische lokale Pipeline aus (generieren, heuristische + gegnerische LLM-Richter-Verifizierung, Shingle-Deduplizierung, schema-gesteuerter Export mit Datenkarte) zum Erstellen von SFT- oder DPO-Fine-Tuning-Datensätzen aus Themen, URLs oder vorhandenen JSONL/CSV-Dateien. Löst bei Anfragen zur Generierung, Bereinigung, Verifizierung oder zum Export von Trainingsdatensätzen für Codex, Antigravity oder Claude Code aus.
Testbericht
Die echte SQLite-Pipeline wurde Ende-zu-Ende ausgeführt (Import von 5 entworfenen Python-Comprehension SFT-Datensätzen, gegnerische LLM-Richterprüfung, Deduplizierung, Export) und produzierte eine funktionierende flat_train.jsonl sowie eine wirklich nützliche DATA_CARD.md mit Richter-Score und Schwierigkeitsverteilungen – aber die exakte zweistufige Befehlssequenz, die im nummerierten Workflow von SKILL.md gedruckt wurde, verarbeitet beim zweiten Mal stillschweigend 0 Datensätze, da Schritt 6 die Datensätze bereits aus dem Status raw_generated verschoben hat, auf den Schritt 7 filtert.
Getestet am: 2026-07-15 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Bhanunamikaze/AI-Dataset-Generator cd AI-Dataset-Generator mkdir -p ~/.claude/skills cp -r . ~/.claude/skills/dataset-generator
Befehle & Beispiel-Prompts
/dataset-generatorSQLite-gestützte Pipeline, die SFT/DPO-Trainingsdatensätze generiert, verifiziert, dedupliziert und exportiert.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Generate a small SFT training dataset of Python Q&A pairs for fine-tuningDedupe and verify this JSONL dataset before I export it for DPO trainingBuild a fine-tuning dataset from these URLs with an adversarial judge pass