Arbor

Iterativně vylepšuje reálný artefakt vůči evaluátoru pomocí zjemňování stromu hypotéz.

od K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Iterativně vylepšuje reálný artefakt vůči evaluátoru pomocí zjemňování stromu hypotéz.

Co umí

Autonomně vylepšuje reálný artefakt (kód, tréninkový recept, agentí harness, datovou pipeline, prompt) vůči cíli a evaluátoru pomocí Hypothesis Tree Refinement (HTR) z paperu Arbor. Použijte kdykoliv chce někdo iterativně optimalizovat něco přes mnoho experimentů bez overfittingu — např. „zvedni eval skóre mého modelu“, „vylepši tohoto agenta/harness“, „vylaď tento…

Testovací report

Otestována instalace (čistý doslovný clone; striktní YAML frontmatter a všechny čtyři reference plus čistě-stdlib scripts/tree.py přítomné a funkční), baterie triggerů proti přesnému popisu use-case a živý výstupní A/B na úloze s dev/test mezerou u spam klasifikátoru prohnaný celou smyčkou hypothesis-tree (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Běh se skillem vyprodukoval korektní, plně auditovatelný výsledek (dev 50->100, test 30->90) s propagací poznatků a held-out merge gate, ale na této malé úloze se 3 kandidáty se ad-hoc iterace základního běhu vyrovnala na dev a dokonce mírně předstihla na skutečném held-out testu (dev 100/test 100 vs. dev 100/test 90 u skillu). Struktura HTR přinesla skutečnou auditovatelnost, ale zde nevedla k lepšímu číslu, protože testovací rozpočet nikdy nevyzkoušel režim mnoha experimentů a dlouhého horizontu, pro který je skill stavěný.

Testováno: 2026-07-11 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Příkazy a ukázkové prompty

  • /arborIterativně vylepšuje reálný artefakt vůči evaluátoru pomocí zjemňování stromu hypotéz.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best