Agent Benchmark
Metodología para puntuar la calidad de la salida del agente y detectar regresiones contra las líneas base.
Funciona con configuración
Qué hace
Un documento de metodología para medir la calidad de la respuesta del agente con scoring rubrics, ground-truth fixtures y timestamped baselines para detectar regresiones. Se activa al evaluar cambios en la definición del agente, auditar la calidad o establecer performance baselines. Solo incluye la especificación — cada comando `node run.mjs` documentado depende de un runner script que debe ser creado primero.
Informe de la prueba
Se listó el repo tree a través de la GitHub API y se obtuvo skills/agent-benchmark/SKILL.md raw; el directorio contiene solo SKILL.md. El frontmatter se analiza limpiamente con name+description y sin problemas de seguridad (no curl|sh, base64 o exfiltración). Se verificaron los scripts referenciados: run.mjs devuelve 404 tanto en skills/agent-benchmark/run.mjs como en benchmarks/run.mjs, y no se incluyen directorios fixtures/ground-truth/rubrics/baselines — por lo que cada comando `node ~/.claude/benchmarks/run.mjs` documentado no es funcional de fábrica (canavar-cli.mjs, referenciado para la integración del ledger, sí existe en hooks/dist/). No pude producir un artefacto de benchmark-run porque el scoring engine está ausente y no puede derivarse de la habilidad, por lo que outputMeasured=false y el paso manual faltante es la creación de run.mjs más todos los fixtures/ground-truth.
Probado el: 2026-07-21 · Claude Code 2.x (agent harness)
Instalación
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Comandos y prompts de ejemplo
/agent-benchmarkMetodología para puntuar la calidad de la salida del agente y detectar regresiones contra las líneas base.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent