Auto Itera

Kjører et disiplinert baseline-vs-arms eksperiment til en forseglet test-sett ship-or-kill dom.

av clfhaha1234 · clfhaha1234/auto-itera

Bestått ★ 9.6/10

Auto Itera — Kjører et disiplinert baseline-vs-arms eksperiment til en forseglet test-sett ship-or-kill dom.

Hva den gjør

Gitt et mål, kandidat-armer (prompter/modeller/arkitekturer), og en forhåndsregistrert terskel, anskaffer autonomt data, deler opp train/dev/held-out-test, scorer armer parallelt, sprint-itererer bak en generaliserings-gate, og skriver et én-sides konklusjonsdokument med tre ekte matplotlib-diagrammer. Utløses på 'bør vi bruke X eller Y', 'sammenlign disse promptene/modellene', 'er dette designet bedre'-stil spørsmål der en forsvarlig dom er nødvendig, ikke på rett-frem første-prinsipper feilrettinger.

Testrapport

Kjørte et ekte leketøy-eksperiment (24 syntetiske kvitteringsrader, to leverandør-ekstraksjonsheuristikker) på to måter: den naive baselinen scoret begge armene på alle 24 radene og valgte en vinner fra det ene kontaminerte tallet, nøyaktig p-hacking anti-mønsteret ferdigheten kaller ut; den ferdighetsstyrte kjøringen håndhevet en ekte train/dev/sealed-test split, en Fase-3 pilot, per-slice diagnose, og en ekte held-out pass – deretter gjenga ekte PNG-er med de bundlete scriptene/chart.py (matplotlib, utført i praksis, alle tre diagramtypene produserte gyldige bilder). Det lille N=5 testsettet landet effekten nøyaktig ved den forhåndsregistrerte terskelen, som i seg selv er en live demonstrasjon av ferdighetens egen størrelses-heuristikk-advarsel.

Testet på: 2026-07-16 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Kommandoer og eksempelprompter

  • /auto-iteraKjører et disiplinert baseline-vs-arms eksperiment til en forseglet test-sett ship-or-kill dom.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?