Agent Benchmark

Metodologi for at score agent outputkvalitet og fange regressioner mod baselines

Af vibeeval · vibeeval/vibecosystem

Virker med opsætning ★ 5.6/10

Agent Benchmark — Metodologi for at score agent outputkvalitet og fange regressioner mod baselines

Hvad det gør

Et metodologidokument til måling af agentens svar kvalitet med scoring rubrics, ground-truth fixtures og tidsstemplede baselines for at detektere regressioner. Udløses ved evaluering af agentdefinitionsændringer, auditering af kvalitet eller etablering af performance baselines. Leverer kun specifikationen — hver dokumenteret `node run.mjs` kommando afhænger af et runner script, der skal forfattes først.

Testrapport

Listede repo-træet via GitHub API'en og hentede skills/agent-benchmark/SKILL.md rå; mappen indeholder kun SKILL.md. Frontmatter parses rent med name+description og ingen sikkerhedsbrister (ingen curl|sh, base64 eller exfiltration). Stikprøvekontrollerede refererede scripts: run.mjs returnerer 404 på både skills/agent-benchmark/run.mjs og benchmarks/run.mjs, og ingen fixtures/ground-truth/rubrics/baselines mapper leveres — så hver dokumenteret `node ~/.claude/benchmarks/run.mjs` kommando er ikke-funktionel ud af boksen (canavar-cli.mjs, refereret til ledger-integrationen, eksisterer på hooks/dist/). Jeg kunne ikke producere en benchmark-run artefakt, fordi scoring-motoren mangler og ikke kan udledes fra færdigheden, så outputMeasured=false og det manglende manuelle trin er at forfatte run.mjs plus alle fixtures/ground-truth.

Testet: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Kommandoer og eksempelprompter

  • /agent-benchmarkMetodologi for at score agent outputkvalitet og fange regressioner mod baselines

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent