Agent Benchmark
Metodologi for at score agent outputkvalitet og fange regressioner mod baselines
Virker med opsætning
Hvad det gør
Et metodologidokument til måling af agentens svar kvalitet med scoring rubrics, ground-truth fixtures og tidsstemplede baselines for at detektere regressioner. Udløses ved evaluering af agentdefinitionsændringer, auditering af kvalitet eller etablering af performance baselines. Leverer kun specifikationen — hver dokumenteret `node run.mjs` kommando afhænger af et runner script, der skal forfattes først.
Testrapport
Listede repo-træet via GitHub API'en og hentede skills/agent-benchmark/SKILL.md rå; mappen indeholder kun SKILL.md. Frontmatter parses rent med name+description og ingen sikkerhedsbrister (ingen curl|sh, base64 eller exfiltration). Stikprøvekontrollerede refererede scripts: run.mjs returnerer 404 på både skills/agent-benchmark/run.mjs og benchmarks/run.mjs, og ingen fixtures/ground-truth/rubrics/baselines mapper leveres — så hver dokumenteret `node ~/.claude/benchmarks/run.mjs` kommando er ikke-funktionel ud af boksen (canavar-cli.mjs, refereret til ledger-integrationen, eksisterer på hooks/dist/). Jeg kunne ikke producere en benchmark-run artefakt, fordi scoring-motoren mangler og ikke kan udledes fra færdigheden, så outputMeasured=false og det manglende manuelle trin er at forfatte run.mjs plus alle fixtures/ground-truth.
Testet: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Kommandoer og eksempelprompter
/agent-benchmarkMetodologi for at score agent outputkvalitet og fange regressioner mod baselines
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent