Agent Benchmark
Methodologie voor het scoren van agent output kwaliteit en het vangen van regressies tegen baselines
Werkt met setup
Wat het doet
Een methodologiedocument voor het meten van de kwaliteit van agentantwoorden met scoringsrubrieken, ground-truth fixtures en tijdgestempelde baselines om regressies te detecteren. Activeert bij het evalueren van wijzigingen in agentdefinities, het controleren van kwaliteit of het vaststellen van prestatiebaselines. Levert alleen de specificatie — elk gedocumenteerd `node run.mjs` commando is afhankelijk van een runner script dat eerst moet worden geschreven.
Testrapport
De repo tree via de GitHub API opgevraagd en skills/agent-benchmark/SKILL.md raw opgehaald; de directory bevat alleen SKILL.md. Frontmatter parseert schoon met name+description en geen beveiligingsrisico's (geen curl|sh, base64, of exfiltratie). Steekproefsgewijs gecontroleerde genoemde scripts: run.mjs retourneert 404 op zowel skills/agent-benchmark/run.mjs als benchmarks/run.mjs, en er worden geen fixtures/ground-truth/rubrics/baselines directories meegeleverd — dus elk gedocumenteerd `node ~/.claude/benchmarks/run.mjs` commando is out-of-the-box niet functioneel (canavar-cli.mjs, genoemd voor de ledger integratie, bestaat wel op hooks/dist/). Ik kon geen benchmark-run artefact produceren omdat de scoring engine afwezig is en niet kan worden afgeleid van de vaardigheid, dus outputMeasured=false en de ontbrekende handmatige stap is het schrijven van run.mjs plus alle fixtures/ground-truth.
Getest op: 2026-07-21 · Claude Code 2.x (agent harness)
Installatie
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Commando's en voorbeeldprompts
/agent-benchmarkMethodologie voor het scoren van agent output kwaliteit en het vangen van regressies tegen baselines
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent