Auto Itera
Przeprowadza zdyscyplinowany eksperyment porównawczy baseline-vs-arms do zamkniętego werdyktu testowego ship-or-kill
Testowano · Działa
Co robi ten skill
Biorąc pod uwagę cel, kandydatów (prompty/modele/architektury) i wstępnie zarejestrowany próg, autonomicznie pozyskuje dane, dzieli je na zestawy treningowe/deweloperskie/testowe, ocenia kandydatów równolegle, iteruje w sprintach za bramką generalizacji i pisze jednotronicowe podsumowanie z trzema rzeczywistymi wykresami matplotlib. Aktywuje się na pytania typu 'czy powinniśmy użyć X czy Y', 'porównaj te prompty/modele', 'czy ten projekt jest lepszy', gdzie potrzebny jest uzasadniony werdykt, a nie na proste poprawki błędów pierwszych zasad.
Raport z testu
Przeprowadzono rzeczywisty eksperyment zabawkę (24 syntetyczne wiersze paragonów, dwie heurystyki ekstrakcji dostawcy) na dwa sposoby: naiwna podstawa oceniła obu kandydatów na wszystkich 24 wierszach i wybrała zwycięzcę na podstawie tej pojedynczej skażonej liczby, dokładnie wzorzec anty-p-hacking, który umiejętność wywołuje; przebieg sterowany przez umiejętność wymusił rzeczywisty podział train/dev/sealed-test, pilotaż fazy 3, diagnozę per-slice i prawdziwe przejście przez zamknięty test - a następnie wyrenderował rzeczywiste pliki PNG za pomocą dołączonych skryptów scripts/chart.py (matplotlib, wykonany w rzeczywistości, wszystkie trzy typy wykresów wygenerowały prawidłowe obrazy). Mały zestaw testowy N=5 dokładnie trafił w efekt przy wstępnie zarejestrowanym progu, co samo w sobie jest żywą demonstracją ostrzeżenia umiejętności o heurystyce rozmiaru.
Testowano: 2026-07-16 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/ Komendy i przykładowe prompty
/auto-iteraPrzeprowadza zdyscyplinowany eksperyment porównawczy baseline-vs-arms do zamkniętego werdyktu testowego ship-or-kill
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Should we use prompt A or prompt B for extraction? Give me real evidence.Compare these two model architectures with a proper held-out test set.Is this new heuristic actually better, or am I just p-hacking myself?