Auto Itera

Kører et disciplineret baseline-vs-arms eksperiment til en forseglet test-sæt ship-or-kill dom.

Af clfhaha1234 · clfhaha1234/auto-itera

Testet · Virker ★ 9.6/10

Auto Itera — Kører et disciplineret baseline-vs-arms eksperiment til en forseglet test-sæt ship-or-kill dom.

Hvad det gør

Givet et mål, kandidat-arme (prompts/modeller/arkitekturer), og en forudregistreret tærskel, anskaffer autonomt data, splitter train/dev/held-out-test, scorer arme parallelt, sprint-itererer bag en generaliserings-gate, og skriver et én-sides konklusionsdokument med tre rigtige matplotlib-diagrammer. Udløses ved 'skal vi bruge X eller Y', 'sammenlign disse prompts/modeller', 'er dette design bedre' stilspørgsmål, hvor en forsvarlig dom er nødvendig, ikke ved ligetil first-principles fejlrettelser.

Testrapport

Kørte et rigtigt legetøjseksperiment (24 syntetiske kvitteringsrækker, to leverandør-udvindingsheuristikker) på to måder: den naive baseline scorede begge arme på alle 24 rækker og valgte en vinder ud fra det ene kontaminerede tal, præcis anti-mønsteret for p-hacking som skill'en kalder ud; det skill-guided run håndhævede en rigtig train/dev/sealed-test split, en Fase-3 pilot, per-slice diagnose, og en ægte held-out pass - derefter gengav rigtige PNG'er med de bundtede scripts/chart.py (matplotlib, udført i virkeligheden, alle tre diagramtyper producerede gyldige billeder). Det lille N=5 test-sæt landede effekten præcis ved den forudregistrerede tærskel, hvilket i sig selv er en live demonstration af skill'ens egen sizing-heuristik-advarsel.

Testet: 2026-07-16 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Kommandoer og eksempelprompter

  • /auto-iteraKører et disciplineret baseline-vs-arms eksperiment til en forseglet test-sæt ship-or-kill dom.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?