Arbor

Forbedrer iterativt et ekte artefakt mot en evaluator ved hjelp av hypotesetre-forfining.

av K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Forbedrer iterativt et ekte artefakt mot en evaluator ved hjelp av hypotesetre-forfining.

Hva den gjør

Forbedre autonomt et ekte artefakt (kode, treningsoppskrift, agent-harness, datapipeline, prompt) mot et mål og en evaluator, ved hjelp av Hypothesis Tree Refinement (HTR) fra Arbor-artikkelen. Bruk dette når noen ønsker å iterativt optimalisere noe over mange eksperimenter uten overtilpasning — f.eks. "få opp modellens eval-score", "forbedre denne agenten/dette harnesset", "tun denne…

Testrapport

Testet installasjon (ren verbatim clone; streng YAML-frontmatter og alle fire referanser pluss det rene stdlib-skriptet scripts/tree.py til stede og funksjonelt), triggerbatteri mot en presis brukstilfellebeskrivelse, og en live output-A/B på en spam-klassifiserer dev/test-gap-oppgave kjørt gjennom hele hypotesetre-løkken (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Skill-armen produserte et korrekt, fullt etterprøvbart resultat (dev 50->100, test 30->90) med innsiktspropagering og en holdt-utenfor merge-gate, men på denne lille 3-kandidat-oppgaven matchet base-armens ad-hoc-iterasjon den på dev og var marginalt bedre på selve den holdt-utenfor testen (dev 100/test 100 mot skillets dev 100/test 90). HTR-strukturen ga reell etterprøvbarhet, men ga ikke et bedre tall her, siden det leketøysaktige budsjettet aldri utfordret det mange-eksperiment, lang-horisont-regimet skillet er bygget for.

Testet på: 2026-07-11 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Kommandoer og eksempelprompter

  • /arborForbedrer iterativt et ekte artefakt mot en evaluator ved hjelp av hypotesetre-forfining.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best