Arbor

Migliora iterativamente un artefatto reale rispetto a un evaluator usando il raffinamento ad albero di ipotesi.

di K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Migliora iterativamente un artefatto reale rispetto a un evaluator usando il raffinamento ad albero di ipotesi.

Cosa fa

Migliora in autonomia un artefatto reale (codice, training recipe, harness per agenti, pipeline dati, prompt) rispetto a un obiettivo e a un evaluator, usando l'Hypothesis Tree Refinement (HTR) del paper Arbor. Da usare ogni volta che qualcuno vuole ottimizzare iterativamente qualcosa attraverso molti esperimenti senza overfitting — ad es. "alza il punteggio di valutazione del mio modello", "migliora questo agente/harness", "ottimizza questo…

Rapporto di test

Testate l'installazione (clone verbatim pulito; frontmatter YAML rigoroso e tutti e quattro i riferimenti più lo script puro-stdlib scripts/tree.py presenti e funzionanti), una batteria di trigger contro una descrizione precisa del caso d'uso, e un A/B in output dal vivo su un task di dev/test-gap per un classificatore di spam eseguito attraverso l'intero ciclo hypothesis-tree (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Il braccio con lo skill ha prodotto un risultato corretto e pienamente verificabile (dev 50->100, test 30->90) con propagazione degli insight e un merge gate su un held-out, ma su questo piccolo task a 3 candidati l'iterazione ad-hoc del braccio base lo ha eguagliato sul dev e lo ha superato sul vero test held-out (dev 100/test 100 contro il dev 100/test 90 dello skill). La struttura HTR ha aggiunto una vera verificabilità ma non ha prodotto un numero migliore in questo caso, poiché il budget ridotto del task giocattolo non ha mai messo alla prova il regime a molti esperimenti e lungo orizzonte per cui lo skill è pensato.

Testato il: 2026-07-11 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Comandi e prompt di esempio

  • /arborMigliora iterativamente un artefatto reale rispetto a un evaluator usando il raffinamento ad albero di ipotesi.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best