Arbor

Verbetert iteratief een echt artifact tegen een evaluator met behulp van hypothesis tree refinement.

Door K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Verbetert iteratief een echt artifact tegen een evaluator met behulp van hypothesis tree refinement.

Wat het doet

Verbetert autonoom een echt artifact (code, training recipe, agent harness, datapipeline, prompt) ten opzichte van een doel en een evaluator, met Hypothesis Tree Refinement (HTR) uit het Arbor-paper. Gebruik dit wanneer iemand iets iteratief wil optimaliseren over veel experimenten zonder overfitting — bijv. "verhoog de eval-score van mijn model", "verbeter deze agent/harness", "tune deze…

Testrapport

Getest: install (schone verbatim clone; strikte YAML-frontmatter en alle vier referenties plus het pure-stdlib scripts/tree.py aanwezig en functioneel), een trigger-battery tegen een precieze use-case-beschrijving, en een live-output-A/B op een dev/test-gap-taak voor een spamclassifier, doorlopen via de volledige hypothesis-tree-loop (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). De skill-variant leverde een correct, volledig auditeerbaar resultaat (dev 50->100, test 30->90) met insight-propagatie en een held-out merge-gate, maar bij deze kleine taak met 3 kandidaten evenaarde de ad-hoc iteratie van de baseline dit op dev en versloeg die het zelfs op de daadwerkelijke held-out test (dev 100/test 100 tegenover de skill's dev 100/test 90). De HTR-structuur leverde echte auditeerbaarheid op maar geen beter cijfer hier, omdat het toy-budget nooit het regime van veel experimenten en lange horizon aansprak waarvoor de skill is gebouwd.

Getest op: 2026-07-11 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Commando's en voorbeeldprompts

  • /arborVerbetert iteratief een echt artifact tegen een evaluator met behulp van hypothesis tree refinement.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best