Agent Benchmark

Metodik för att poängsätta agentutdatakvalitet och fånga regressioner mot baslinjer

av vibeeval · vibeeval/vibecosystem

Fungerar med konfiguration ★ 5.6/10

Agent Benchmark — Metodik för att poängsätta agentutdatakvalitet och fånga regressioner mot baslinjer

Vad den gör

Ett metodikdokument för att mäta agentens svarskvalitet med poängsättningsrubriker, ground-truth-fixturer och tidsstämplade baslinjer för att upptäcka regressioner. Utlöses vid utvärdering av agentdefinitionsändringar, kvalitetsgranskning eller etablering av prestandabaslinjer. Levereras endast med specifikationen — varje dokumenterat `node run.mjs`-kommando beror på ett körskript som måste författas först.

Testrapport

Listade repoträdet via GitHub API och hämtade skills/agent-benchmark/SKILL.md rått; katalogen innehåller endast SKILL.md. Frontmatter parsas rent med name+description och inga säkerhetsbrister (ingen curl|sh, base64 eller exfiltrering). Stickprovskontrollerade refererade skript: run.mjs returnerar 404 på både skills/agent-benchmark/run.mjs och benchmarks/run.mjs, och inga fixtures/ground-truth/rubrics/baselines-kataloger levereras — så varje dokumenterat `node ~/.claude/benchmarks/run.mjs`-kommando är icke-funktionellt direkt (canavar-cli.mjs, refererad för ledger-integrationen, existerar på hooks/dist/). Jag kunde inte producera en benchmark-körningsartefakt eftersom poängsättningsmotorn saknas och inte kan härledas från färdigheten, så outputMeasured=false och det saknade manuella steget är att författa run.mjs plus alla fixtures/ground-truth.

Testad: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Kommandon och exempelprompter

  • /agent-benchmarkMetodik för att poängsätta agentutdatakvalitet och fånga regressioner mot baslinjer

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent