Arbor
Verbessert ein reales Artefakt iterativ gegen einen Evaluator mittels Hypothesis Tree Refinement.
Tested · Didn't pass
Was es kann
Verbessert autonom ein reales Artefakt (Code, Trainingsrezept, Agent-Harness, Datenpipeline, Prompt) gegen ein Ziel und einen Evaluator, mittels Hypothesis Tree Refinement (HTR) aus dem Arbor-Paper. Einsetzen, wann immer jemand etwas über viele Experimente hinweg iterativ optimieren möchte, ohne zu overfitten — z. B. „meinen Modell-Eval-Score verbessern“, „diesen Agenten/dieses Harness verbessern“, „das hier tunen…“
Testbericht
Installation getestet (sauberer Verbatim-Clone; striktes YAML-Frontmatter und alle vier Referenzen plus das reine Stdlib-Skript scripts/tree.py vorhanden und funktionsfähig), eine Trigger-Batterie gegen eine präzise Use-Case-Beschreibung, und ein Live-Output-A/B bei einer Spam-Classifier-Dev/Test-Gap-Aufgabe durch die vollständige Hypothesis-Tree-Schleife (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Der Skill-Arm lieferte ein korrektes, vollständig nachvollziehbares Ergebnis (dev 50->100, test 30->90) mit Insight-Propagation und einem Held-out-Merge-Gate, aber bei dieser kleinen 3-Kandidaten-Aufgabe zog die Ad-hoc-Iteration des Base-Arms auf dev gleich und schlug den Skill sogar beim tatsächlichen Held-out-Test (dev 100/test 100 gegenüber dev 100/test 90 beim Skill). Die HTR-Struktur brachte echte Nachvollziehbarkeit, aber hier keine bessere Zahl, da das Spielzeug-Budget nie das Viele-Experimente-Langzeit-Regime durchlief, für das der Skill gebaut ist.
Getestet am: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/K-Dense-AI/scientific-agent-skills cd scientific-agent-skills mkdir -p ~/.claude/skills cp -r skills/arbor ~/.claude/skills/arbor
Befehle & Beispiel-Prompts
/arborVerbessert ein reales Artefakt iterativ gegen einen Evaluator mittels Hypothesis Tree Refinement.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Improve this model's eval score over many runsTune this pipeline against our benchmark without overfittingRun a search over prompt variants and keep the best