Agent Benchmark

Metodología para puntuar la calidad de la salida del agente y detectar regresiones contra las líneas base.

Por vibeeval · vibeeval/vibecosystem

Funciona con configuración ★ 5.6/10

Agent Benchmark — Metodología para puntuar la calidad de la salida del agente y detectar regresiones contra las líneas base.

Qué hace

Un documento de metodología para medir la calidad de la respuesta del agente con scoring rubrics, ground-truth fixtures y timestamped baselines para detectar regresiones. Se activa al evaluar cambios en la definición del agente, auditar la calidad o establecer performance baselines. Solo incluye la especificación — cada comando `node run.mjs` documentado depende de un runner script que debe ser creado primero.

Informe de la prueba

Se listó el repo tree a través de la GitHub API y se obtuvo skills/agent-benchmark/SKILL.md raw; el directorio contiene solo SKILL.md. El frontmatter se analiza limpiamente con name+description y sin problemas de seguridad (no curl|sh, base64 o exfiltración). Se verificaron los scripts referenciados: run.mjs devuelve 404 tanto en skills/agent-benchmark/run.mjs como en benchmarks/run.mjs, y no se incluyen directorios fixtures/ground-truth/rubrics/baselines — por lo que cada comando `node ~/.claude/benchmarks/run.mjs` documentado no es funcional de fábrica (canavar-cli.mjs, referenciado para la integración del ledger, sí existe en hooks/dist/). No pude producir un artefacto de benchmark-run porque el scoring engine está ausente y no puede derivarse de la habilidad, por lo que outputMeasured=false y el paso manual faltante es la creación de run.mjs más todos los fixtures/ground-truth.

Probado el: 2026-07-21 · Claude Code 2.x (agent harness)

Instalación

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Comandos y prompts de ejemplo

  • /agent-benchmarkMetodología para puntuar la calidad de la salida del agente y detectar regresiones contra las líneas base.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent