Auto Itera

Spouští disciplinovaný experiment baseline vs. ramena k rozhodnutí o odeslání nebo zrušení do zapečetěné testovací sady.

od clfhaha1234 · clfhaha1234/auto-itera

Otestováno · Funguje ★ 9.6/10

Auto Itera — Spouští disciplinovaný experiment baseline vs. ramena k rozhodnutí o odeslání nebo zrušení do zapečetěné testovací sady.

Co umí

Vzhledem k cíli, kandidátským ramenům (prompty/modely/architektury) a předem registrovanému prahu autonomně získává data, rozděluje trénovací/dev/držené testovací sady, paralelně skóruje ramena, iteruje za bránou generalizace a píše jednostránkový závěrečný dokument se třemi skutečnými grafy matplotlib. Spouští se na otázky typu 'máme použít X nebo Y', 'porovnejte tyto prompty/modely', 'je tento design lepší', kde je potřeba obhajitelné rozhodnutí, nikoli na přímočaré opravy chyb založené na prvních principech.

Testovací report

Spustil jsem skutečný malý experiment (24 syntetických řádků účtenek, dvě heuristiky pro extrakci dodavatele) dvěma způsoby: naivní základ ohodnotil obě ramena na všech 24 řádcích a vybral vítěze z tohoto jediného kontaminovaného čísla, přesně ten anti-vzor p-hacking, který dovednost označuje; řízený běh dovednosti vynutil skutečné rozdělení train/dev/sealed-test, pilotní fázi 3, diagnostiku na slice a skutečné držení – pak vygeneroval skutečné PNG s přiloženými skripty/chart.py (matplotlib, skutečně spuštěno, všechny tři typy grafů vyprodukovaly platné obrázky). Malá testovací sada N=5 dosáhla efektu přesně na předem registrovaný práh, což je samo o sobě živou demonstrací varování dovednosti o heuristice velikosti.

Testováno: 2026-07-16 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Příkazy a ukázkové prompty

  • /auto-iteraSpouští disciplinovaný experiment baseline vs. ramena k rozhodnutí o odeslání nebo zrušení do zapečetěné testovací sady.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?