Auto Itera

Przeprowadza zdyscyplinowany eksperyment porównawczy baseline-vs-arms do zamkniętego werdyktu testowego ship-or-kill

Autor: clfhaha1234 · clfhaha1234/auto-itera

Testowano · Działa ★ 9.6/10

Auto Itera — Przeprowadza zdyscyplinowany eksperyment porównawczy baseline-vs-arms do zamkniętego werdyktu testowego ship-or-kill

Co robi ten skill

Biorąc pod uwagę cel, kandydatów (prompty/modele/architektury) i wstępnie zarejestrowany próg, autonomicznie pozyskuje dane, dzieli je na zestawy treningowe/deweloperskie/testowe, ocenia kandydatów równolegle, iteruje w sprintach za bramką generalizacji i pisze jednotronicowe podsumowanie z trzema rzeczywistymi wykresami matplotlib. Aktywuje się na pytania typu 'czy powinniśmy użyć X czy Y', 'porównaj te prompty/modele', 'czy ten projekt jest lepszy', gdzie potrzebny jest uzasadniony werdykt, a nie na proste poprawki błędów pierwszych zasad.

Raport z testu

Przeprowadzono rzeczywisty eksperyment zabawkę (24 syntetyczne wiersze paragonów, dwie heurystyki ekstrakcji dostawcy) na dwa sposoby: naiwna podstawa oceniła obu kandydatów na wszystkich 24 wierszach i wybrała zwycięzcę na podstawie tej pojedynczej skażonej liczby, dokładnie wzorzec anty-p-hacking, który umiejętność wywołuje; przebieg sterowany przez umiejętność wymusił rzeczywisty podział train/dev/sealed-test, pilotaż fazy 3, diagnozę per-slice i prawdziwe przejście przez zamknięty test - a następnie wyrenderował rzeczywiste pliki PNG za pomocą dołączonych skryptów scripts/chart.py (matplotlib, wykonany w rzeczywistości, wszystkie trzy typy wykresów wygenerowały prawidłowe obrazy). Mały zestaw testowy N=5 dokładnie trafił w efekt przy wstępnie zarejestrowanym progu, co samo w sobie jest żywą demonstracją ostrzeżenia umiejętności o heurystyce rozmiaru.

Testowano: 2026-07-16 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Komendy i przykładowe prompty

  • /auto-iteraPrzeprowadza zdyscyplinowany eksperyment porównawczy baseline-vs-arms do zamkniętego werdyktu testowego ship-or-kill

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?