Arbor
Iteracyjnie ulepsza rzeczywisty artefakt względem ewaluatora, wykorzystując udoskonalanie drzewa hipotez.
Tested · Didn't pass
Co robi ten skill
Autonomicznie ulepsza rzeczywisty artefakt (kod, przepis treningowy, harness agenta, pipeline danych, prompt) względem celu i ewaluatora, wykorzystując Hypothesis Tree Refinement (HTR) z artykułu Arbor. Używaj tego, gdy ktoś chce iteracyjnie optymalizować coś w wielu eksperymentach bez przeuczenia (overfitting) — np. „podnieś wynik ewaluacji mojego modelu”, „popraw tego agenta/harness”, „dostrój tego…
Raport z testu
Przetestowano instalację (czysty dosłowny clone; ścisły frontmatter YAML oraz wszystkie cztery pliki referencyjne plus czysto standardowy `scripts/tree.py` obecne i działające), baterię promptów wyzwalających względem precyzyjnego opisu przypadku użycia oraz żywy test A/B wyników na zadaniu luki dev/test klasyfikatora spamu, przeprowadzonym przez pełną pętlę drzewa hipotez (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Gałąź ze skillem dała poprawny, w pełni audytowalny wynik (dev 50->100, test 30->90) z propagacją wniosków i bramką scalania na zbiorze wydzielonym (held-out merge gate), ale w tym małym zadaniu z 3 kandydatami doraźna iteracja gałęzi bazowej dorównała jej na dev i przebiła ją na faktycznym zbiorze wydzielonym test (dev 100/test 100 wobec dev 100/test 90 skilla). Struktura HTR dodała realną audytowalność, ale nie dała tu lepszego wyniku, ponieważ zabawkowy budżet nigdy nie uruchomił reżimu wielu eksperymentów i długiego horyzontu, do którego skill jest zbudowany.
Testowano: 2026-07-11 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/K-Dense-AI/scientific-agent-skills cd scientific-agent-skills mkdir -p ~/.claude/skills cp -r skills/arbor ~/.claude/skills/arbor
Komendy i przykładowe prompty
/arborIteracyjnie ulepsza rzeczywisty artefakt względem ewaluatora, wykorzystując udoskonalanie drzewa hipotez.
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Improve this model's eval score over many runsTune this pipeline against our benchmark without overfittingRun a search over prompt variants and keep the best