Agent Benchmark

Methodologie voor het scoren van agent output kwaliteit en het vangen van regressies tegen baselines

Door vibeeval · vibeeval/vibecosystem

Werkt met setup ★ 5.6/10

Agent Benchmark — Methodologie voor het scoren van agent output kwaliteit en het vangen van regressies tegen baselines

Wat het doet

Een methodologiedocument voor het meten van de kwaliteit van agentantwoorden met scoringsrubrieken, ground-truth fixtures en tijdgestempelde baselines om regressies te detecteren. Activeert bij het evalueren van wijzigingen in agentdefinities, het controleren van kwaliteit of het vaststellen van prestatiebaselines. Levert alleen de specificatie — elk gedocumenteerd `node run.mjs` commando is afhankelijk van een runner script dat eerst moet worden geschreven.

Testrapport

De repo tree via de GitHub API opgevraagd en skills/agent-benchmark/SKILL.md raw opgehaald; de directory bevat alleen SKILL.md. Frontmatter parseert schoon met name+description en geen beveiligingsrisico's (geen curl|sh, base64, of exfiltratie). Steekproefsgewijs gecontroleerde genoemde scripts: run.mjs retourneert 404 op zowel skills/agent-benchmark/run.mjs als benchmarks/run.mjs, en er worden geen fixtures/ground-truth/rubrics/baselines directories meegeleverd — dus elk gedocumenteerd `node ~/.claude/benchmarks/run.mjs` commando is out-of-the-box niet functioneel (canavar-cli.mjs, genoemd voor de ledger integratie, bestaat wel op hooks/dist/). Ik kon geen benchmark-run artefact produceren omdat de scoring engine afwezig is en niet kan worden afgeleid van de vaardigheid, dus outputMeasured=false en de ontbrekende handmatige stap is het schrijven van run.mjs plus alle fixtures/ground-truth.

Getest op: 2026-07-21 · Claude Code 2.x (agent harness)

Installatie

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Commando's en voorbeeldprompts

  • /agent-benchmarkMethodologie voor het scoren van agent output kwaliteit en het vangen van regressies tegen baselines

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent