Auto Itera

Führt ein diszipliniertes Baseline-vs-Arms-Experiment zu einem versiegelten Testset-Ship-or-Kill-Urteil durch

von clfhaha1234 · clfhaha1234/auto-itera

Getestet · Funktioniert ★ 9.6/10

Auto Itera — Führt ein diszipliniertes Baseline-vs-Arms-Experiment zu einem versiegelten Testset-Ship-or-Kill-Urteil durch

Was es kann

Angesichts eines Ziels, Kandidatenarme (Prompts/Modelle/Architekturen) und eines vorregistrierten Schwellenwerts werden autonom Daten beschafft, Train/Dev/Held-out-Test aufgeteilt, Arme parallel bewertet, hinter einem Generalisierungsgate sprint-iteriert und ein einseitiges Schlussdokument mit drei echten Matplotlib-Diagrammen geschrieben. Löst bei Fragen wie 'sollten wir X oder Y verwenden', 'vergleiche diese Prompts/Modelle', 'ist dieses Design besser' aus, wo ein verteidigungsfähiges Urteil benötigt wird, nicht bei geradlinigen Bugfixes nach ersten Prinzipien.

Testbericht

Ein echtes Spielzeug-Experiment (24 synthetische Belegzeilen, zwei Anbieter-Extraktionsheuristiken) wurde auf zwei Arten durchgeführt: Die naive Basislinie bewertete beide Arme auf allen 24 Zeilen und wählte einen Gewinner aus dieser einzigen kontaminierten Zahl, genau das p-hacking-Anti-Muster, das der Skill bemängelt; der Skill-gesteuerte Lauf erzwang eine echte Train/Dev/Sealed-Test-Aufteilung, eine Phase-3-Pilotierung, eine pro-Slice-Diagnose und einen echten Held-out-Pass – dann wurden echte PNGs mit den gebündelten Skripten/chart.py gerendert (matplotlib, tatsächlich ausgeführt, alle drei Diagrammtypen produzierten gültige Bilder). Das winzige N=5 Testset brachte den Effekt genau auf den vorregistrierten Schwellenwert, was selbst eine Live-Demonstration der eigenen Größenheuristik-Warnung des Skills ist.

Getestet am: 2026-07-16 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Befehle & Beispiel-Prompts

  • /auto-iteraFührt ein diszipliniertes Baseline-vs-Arms-Experiment zu einem versiegelten Testset-Ship-or-Kill-Urteil durch

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?