Auto Itera
Führt ein diszipliniertes Baseline-vs-Arms-Experiment zu einem versiegelten Testset-Ship-or-Kill-Urteil durch
Getestet · Funktioniert
Was es kann
Angesichts eines Ziels, Kandidatenarme (Prompts/Modelle/Architekturen) und eines vorregistrierten Schwellenwerts werden autonom Daten beschafft, Train/Dev/Held-out-Test aufgeteilt, Arme parallel bewertet, hinter einem Generalisierungsgate sprint-iteriert und ein einseitiges Schlussdokument mit drei echten Matplotlib-Diagrammen geschrieben. Löst bei Fragen wie 'sollten wir X oder Y verwenden', 'vergleiche diese Prompts/Modelle', 'ist dieses Design besser' aus, wo ein verteidigungsfähiges Urteil benötigt wird, nicht bei geradlinigen Bugfixes nach ersten Prinzipien.
Testbericht
Ein echtes Spielzeug-Experiment (24 synthetische Belegzeilen, zwei Anbieter-Extraktionsheuristiken) wurde auf zwei Arten durchgeführt: Die naive Basislinie bewertete beide Arme auf allen 24 Zeilen und wählte einen Gewinner aus dieser einzigen kontaminierten Zahl, genau das p-hacking-Anti-Muster, das der Skill bemängelt; der Skill-gesteuerte Lauf erzwang eine echte Train/Dev/Sealed-Test-Aufteilung, eine Phase-3-Pilotierung, eine pro-Slice-Diagnose und einen echten Held-out-Pass – dann wurden echte PNGs mit den gebündelten Skripten/chart.py gerendert (matplotlib, tatsächlich ausgeführt, alle drei Diagrammtypen produzierten gültige Bilder). Das winzige N=5 Testset brachte den Effekt genau auf den vorregistrierten Schwellenwert, was selbst eine Live-Demonstration der eigenen Größenheuristik-Warnung des Skills ist.
Getestet am: 2026-07-16 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/ Befehle & Beispiel-Prompts
/auto-iteraFührt ein diszipliniertes Baseline-vs-Arms-Experiment zu einem versiegelten Testset-Ship-or-Kill-Urteil durch
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Should we use prompt A or prompt B for extraction? Give me real evidence.Compare these two model architectures with a proper held-out test set.Is this new heuristic actually better, or am I just p-hacking myself?