Arbor
Améliore itérativement un artefact réel face à un évaluateur via un raffinement en arbre d'hypothèses.
Tested · Didn't pass
Ce que fait
Améliorer de façon autonome un artefact réel (code, recette d'entraînement, harnais d'agent, pipeline de données, prompt) au regard d'un objectif et d'un évaluateur, en utilisant le Hypothesis Tree Refinement (HTR) de l'article Arbor. À utiliser dès que quelqu'un veut optimiser itérativement quelque chose sur de nombreuses expériences sans surapprentissage — par ex. « améliorer le score d'évaluation de mon modèle », « améliorer cet agent/harnais », « régler ce…
Rapport de test
Testé : installation (clone verbatim propre ; frontmatter YAML strict et les quatre références plus le scripts/tree.py en pur stdlib présents et fonctionnels), une batterie de déclenchement contre une description de cas d'usage précise, et un A/B en sortie réelle sur une tâche d'écart dev/test d'un classifieur de spam exécutée à travers la boucle complète d'arbre d'hypothèses (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). Le bras avec skill a produit un résultat correct et entièrement auditable (dev 50->100, test 30->90) avec propagation des enseignements et un merge-gate en hold-out, mais sur cette petite tâche à 3 candidats, l'itération ad hoc du bras de base a égalé le score dev et l'a légèrement dépassé sur le vrai test hold-out (dev 100/test 100 contre dev 100/test 90 pour le skill). La structure HTR a apporté une réelle auditabilité mais n'a pas produit de meilleur chiffre ici, le budget jouet n'ayant jamais exercé le régime à nombreuses expériences et long horizon pour lequel le skill est conçu.
Testé le: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/K-Dense-AI/scientific-agent-skills cd scientific-agent-skills mkdir -p ~/.claude/skills cp -r skills/arbor ~/.claude/skills/arbor
Commandes et exemples de prompts
/arborAméliore itérativement un artefact réel face à un évaluateur via un raffinement en arbre d'hypothèses.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Improve this model's eval score over many runsTune this pipeline against our benchmark without overfittingRun a search over prompt variants and keep the best