Arbor
Migliora iterativamente un artefatto reale rispetto a un evaluator usando il raffinamento ad albero di ipotesi.
Tested · Didn't pass
Cosa fa
Migliora in autonomia un artefatto reale (codice, training recipe, harness per agenti, pipeline dati, prompt) rispetto a un obiettivo e a un evaluator, usando l'Hypothesis Tree Refinement (HTR) del paper Arbor. Da usare ogni volta che qualcuno vuole ottimizzare iterativamente qualcosa attraverso molti esperimenti senza overfitting — ad es. "alza il punteggio di valutazione del mio modello", "migliora questo agente/harness", "ottimizza questo…
Rapporto di test
Testate l'installazione (clone verbatim pulito; frontmatter YAML rigoroso e tutti e quattro i riferimenti più lo script puro-stdlib scripts/tree.py presenti e funzionanti), una batteria di trigger contro una descrizione precisa del caso d'uso, e un A/B in output dal vivo su un task di dev/test-gap per un classificatore di spam eseguito attraverso l'intero ciclo hypothesis-tree (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Il braccio con lo skill ha prodotto un risultato corretto e pienamente verificabile (dev 50->100, test 30->90) con propagazione degli insight e un merge gate su un held-out, ma su questo piccolo task a 3 candidati l'iterazione ad-hoc del braccio base lo ha eguagliato sul dev e lo ha superato sul vero test held-out (dev 100/test 100 contro il dev 100/test 90 dello skill). La struttura HTR ha aggiunto una vera verificabilità ma non ha prodotto un numero migliore in questo caso, poiché il budget ridotto del task giocattolo non ha mai messo alla prova il regime a molti esperimenti e lungo orizzonte per cui lo skill è pensato.
Testato il: 2026-07-11 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/K-Dense-AI/scientific-agent-skills cd scientific-agent-skills mkdir -p ~/.claude/skills cp -r skills/arbor ~/.claude/skills/arbor
Comandi e prompt di esempio
/arborMigliora iterativamente un artefatto reale rispetto a un evaluator usando il raffinamento ad albero di ipotesi.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Improve this model's eval score over many runsTune this pipeline against our benchmark without overfittingRun a search over prompt variants and keep the best