Auto Itera
Kör ett disciplinerat baseline-vs-arms-experiment till ett förseglat test-set ship-or-kill-beslut
Testad · Fungerar
Vad den gör
Givet ett mål, kandidat-armar (prompter/modeller/arkitekturer) och en förregistrerad tröskel, hämtar autonomt data, delar upp tränings-/utvecklings-/hållna-testdata, poängsätter armar parallellt, sprint-itererar bakom en generaliserings-gate och skriver ett en-sidigt slutsatsdokument med tre riktiga matplotlib-diagram. Triggas på 'ska vi använda X eller Y', 'jämför dessa prompter/modeller', 'är denna design bättre'-liknande frågor där ett försvarbart beslut behövs, inte på raka förstaprincip-felsökningar.
Testrapport
Körde ett verkligt leksaksexperiment (24 syntetiska kvittorader, två leverantörsextraktionsheuristiker) på två sätt: den naiva baslinjen poängsatte båda armarna på alla 24 rader och valde en vinnare från det enda kontaminerade numret, exakt anti-mönstret för p-hacking som färdigheten pekar ut; den färdighetsstyrda körningen upprätthöll en verklig tränings-/utvecklings-/förseglad-testuppdelning, en Fas-3-pilot, per-slice-diagnostik och en genuin hållt-igenom-passering – renderade sedan riktiga PNG-filer med de medföljande skripten/chart.py (matplotlib, exekverad på riktigt, alla tre diagramtyperna producerade giltiga bilder). Den lilla N=5 testuppsättningen landade effekten exakt vid den förregistrerade tröskeln, vilket i sig är en levande demonstration av färdighetens egen storleksheuristikvarning.
Testad: 2026-07-16 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/ Kommandon och exempelprompter
/auto-iteraKör ett disciplinerat baseline-vs-arms-experiment till ett förseglat test-set ship-or-kill-beslut
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Should we use prompt A or prompt B for extraction? Give me real evidence.Compare these two model architectures with a proper held-out test set.Is this new heuristic actually better, or am I just p-hacking myself?