Arbor

Mejora iterativamente un artefacto real frente a un evaluador usando refinamiento de árbol de hipótesis.

Por K-Dense-AI · K-Dense-AI/scientific-agent-skills

Tested · Didn't pass

Arbor — Mejora iterativamente un artefacto real frente a un evaluador usando refinamiento de árbol de hipótesis.

Qué hace

Mejora de forma autónoma un artefacto real (código, receta de entrenamiento, arnés de agente, pipeline de datos, prompt) frente a un objetivo y un evaluador, usando Hypothesis Tree Refinement (HTR) del paper de Arbor. Se activa siempre que alguien quiera optimizar algo iterativamente a lo largo de muchos experimentos sin sobreajustar — por ejemplo, «sube la puntuación de evaluación de mi modelo», «mejora este agente/arnés», «ajusta este…»

Informe de la prueba

Se probó la instalación (clone literal limpio; frontmatter YAML estricto y las cuatro referencias más el script puro-stdlib scripts/tree.py presentes y funcionales), una batería de disparo contra una descripción precisa de caso de uso, y un A/B de salida en vivo sobre una tarea de brecha dev/test de un clasificador de spam ejecutada a través del ciclo completo de árbol de hipótesis (init/observe/ideate/dispatch/backpropagate/prune/merge-gate). El brazo con skill produjo un resultado correcto y totalmente auditable (dev 50->100, test 30->90) con propagación de insights y una puerta de fusión sobre un conjunto retenido, pero en esta tarea pequeña de 3 candidatos la iteración ad-hoc del brazo base la igualó en dev y la superó en el test retenido real (dev 100/test 100 frente al dev 100/test 90 de la skill). La estructura HTR aportó auditabilidad genuina pero no produjo un mejor número aquí, ya que el presupuesto de juguete nunca puso a prueba el régimen de muchos experimentos y largo horizonte para el que está construida la skill.

Probado el: 2026-07-11 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/K-Dense-AI/scientific-agent-skills
cd scientific-agent-skills
mkdir -p ~/.claude/skills
cp -r skills/arbor ~/.claude/skills/arbor

Comandos y prompts de ejemplo

  • /arborMejora iterativamente un artefacto real frente a un evaluador usando refinamiento de árbol de hipótesis.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Improve this model's eval score over many runs
  • Tune this pipeline against our benchmark without overfitting
  • Run a search over prompt variants and keep the best