Auto Itera

Esegue un esperimento disciplinato baseline-vs-arms fino a un verdetto di spedizione o eliminazione su set di test sigillato

di clfhaha1234 · clfhaha1234/auto-itera

Promosso ★ 9.6/10

Auto Itera — Esegue un esperimento disciplinato baseline-vs-arms fino a un verdetto di spedizione o eliminazione su set di test sigillato

Cosa fa

Dato un obiettivo, bracci candidati (prompt/modelli/architetture) e una soglia pre-registrata, reperisce autonomamente dati, divide train/dev/held-out-test, valuta i bracci in parallelo, itera sprint dietro un gate di generalizzazione e scrive un documento di conclusione di una pagina con tre grafici matplotlib reali. Si attiva su domande del tipo 'dovremmo usare X o Y', 'confronta questi prompt/modelli', 'questo design è migliore' dove è necessario un verdetto difendibile, non su correzioni di bug basate su principi primi.

Rapporto di test

Ho eseguito un vero esperimento giocattolo (24 righe di ricevute sintetiche, due euristiche di estrazione fornitori) in due modi: la baseline ingenua ha valutato entrambi i bracci su tutte le 24 righe e ha scelto un vincitore da quel singolo numero contaminato, esattamente l'anti-pattern di p-hacking che l'abilità segnala; l'esecuzione guidata dall'abilità ha imposto una vera divisione train/dev/sealed-test, un pilota di Fase 3, diagnosi per slice e un vero passaggio held-out - quindi ha renderizzato PNG reali con gli script inclusi scripts/chart.py (matplotlib, eseguito realmente, tutti e tre i tipi di grafici hanno prodotto immagini valide). Il minuscolo set di test N=5 ha fatto atterrare l'effetto esattamente alla soglia pre-registrata, che è essa stessa una dimostrazione dal vivo dell'avviso sull'euristica di dimensionamento dell'abilità stessa.

Testato il: 2026-07-16 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Comandi e prompt di esempio

  • /auto-iteraEsegue un esperimento disciplinato baseline-vs-arms fino a un verdetto di spedizione o eliminazione su set di test sigillato

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?