Auto Itera

Voert een gedisciplineerd baseline-vs-arms experiment uit tot een verzegelde testset ship-or-kill verdict.

Door clfhaha1234 · clfhaha1234/auto-itera

Getest · Werkt ★ 9.6/10

Auto Itera — Voert een gedisciplineerd baseline-vs-arms experiment uit tot een verzegelde testset ship-or-kill verdict.

Wat het doet

Gezien een doel, kandidaat-armen (prompts/modellen/architecturen), en een vooraf geregistreerde drempelwaarde, worden autonoom gegevens verzameld, train/dev/held-out-test gesplitst, armen parallel gescoord, sprint-geïtereerd achter een generalisatiedrempel, en wordt een conclusiedocument van één pagina met drie echte matplotlib-grafieken geschreven. Wordt geactiveerd bij vragen als 'should we use X or Y', 'compare these prompts/models', 'is this design better' waarbij een verdedigbaar oordeel nodig is, niet bij rechttoe rechtaan first-principles bugfixes.

Testrapport

Een echt speelgoedexperiment uitgevoerd (24 synthetische bonrijen, twee leveranciers-extractieheuristieken) op twee manieren: de naïeve baseline scoorde beide armen op alle 24 rijen en koos een winnaar uit dat enkele gecontamineerde getal, precies het p-hacking anti-patroon dat de skill uitroept; de skill-geleide run dwong een echte train/dev/sealed-test split af, een Fase-3 pilot, per-slice diagnose, en een echte held-out pass - vervolgens werden echte PNG's gerenderd met de gebundelde scripts/chart.py (matplotlib, daadwerkelijk uitgevoerd, alle drie de grafiektypen produceerden geldige afbeeldingen). De kleine N=5 testset landde het effect precies op de vooraf geregistreerde drempelwaarde, wat zelf een live demonstratie is van de eigen waarschuwing voor sizing-heuristieken van de skill.

Getest op: 2026-07-16 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Commando's en voorbeeldprompts

  • /auto-iteraVoert een gedisciplineerd baseline-vs-arms experiment uit tot een verzegelde testset ship-or-kill verdict.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?