Arbor

Forbedrer iterativt et virkeligt artefakt mod en evaluator ved hjælp af hypothesis tree refinement.

Af K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Forbedrer iterativt et virkeligt artefakt mod en evaluator ved hjælp af hypothesis tree refinement.

Hvad det gør

Forbedrer autonomt et virkeligt artefakt (kode, træningsopskrift, agent-harness, datapipeline, prompt) mod et mål og en evaluator ved hjælp af Hypothesis Tree Refinement (HTR) fra Arbor-papiret. Brug dette, når nogen vil optimere noget iterativt over mange eksperimenter uden overfitting — f.eks. "få mit models eval-score op", "forbedre denne agent/harness", "tune denne…

Testrapport

Testede installationen (ren verbatim clone; streng YAML-frontmatter og alle fire referencer plus det rene stdlib-script scripts/tree.py til stede og funktionelt), et trigger-batteri mod en præcis use-case-beskrivelse, og en live-output-A/B på en spam-klassifikator dev/test-gap-opgave kørt gennem det fulde hypothesis-tree-loop (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Skill-forsøget producerede et korrekt, fuldt auditerbart resultat (dev 50->100, test 30->90) med insight-propagation og en held-out merge-gate, men på denne lille opgave med 3 kandidater matchede basisforsøgets ad-hoc-iteration det på dev og var marginalt bedre på den faktiske held-out test (dev 100/test 100 mod skillets dev 100/test 90). HTR-strukturen gav reel auditerbarhed, men gav ikke et bedre tal her, da det legetøjsagtige budget aldrig satte det mange-eksperimenter, lang-horisont-regime i spil, som skillet er bygget til.

Testet: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Kommandoer og eksempelprompter

  • /arborForbedrer iterativt et virkeligt artefakt mod en evaluator ved hjælp af hypothesis tree refinement.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best