Arbor

Förbättrar iterativt en riktig artefakt mot en utvärderare med hypotesträd-förfining.

av K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Förbättrar iterativt en riktig artefakt mot en utvärderare med hypotesträd-förfining.

Vad den gör

Förbättra autonomt en riktig artefakt (kod, träningsrecept, agent-harness, datapipeline, prompt) mot ett mål och en utvärderare, med hjälp av Hypothesis Tree Refinement (HTR) från Arbor-artikeln. Använd det här när någon vill optimera något iterativt över många experiment utan overfitting — t.ex. "höj min modells eval-poäng", "förbättra den här agenten/harnesset", "finjustera den…

Testrapport

Testade installation (ren installation ord för ord; strikt YAML-frontmatter och alla fyra referenser plus det rena stdlib-skriptet scripts/tree.py finns och fungerar), ett trigger-batteri mot en precis användningsfallsbeskrivning, och en live-utdata-A/B på en dev/test-gap-uppgift för en spamklassificerare körd genom hela hypotesträd-loopen (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Skill-armen producerade ett korrekt, fullt granskningsbart resultat (dev 50->100, test 30->90) med insiktspropagering och en hold-out-mergegrind, men på den här lilla 3-kandidatuppgiften matchade bas-armens ad hoc-iteration den på dev och gick om den på den faktiska hold-out-testen (dev 100/test 100 mot skillens dev 100/test 90). HTR-strukturen gav genuin granskningsbarhet men gav inget bättre resultat här, eftersom leksaksbudgeten aldrig utnyttjade det regime med många experiment och lång tidshorisont som skillen är byggd för.

Testad: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Kommandon och exempelprompter

  • /arborFörbättrar iterativt en riktig artefakt mot en utvärderare med hypotesträd-förfining.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best