Agent Benchmark

Metodikk for å score agentutdata-kvalitet og fange regresjoner mot baselines

av vibeeval · vibeeval/vibecosystem

Krever oppsett ★ 5.6/10

Agent Benchmark — Metodikk for å score agentutdata-kvalitet og fange regresjoner mot baselines

Hva den gjør

Et metodikkdokument for måling av agentrespons-kvalitet med scoringsrubrikker, ground-truth fixtures og tidsstemplede baselines for å oppdage regresjoner. Utløses ved evaluering av agentdefinisjonsendringer, kvalitetsrevisjon eller etablering av ytelsesbaselines. Leveres kun med spesifikasjonen — hver dokumenterte `node run.mjs`-kommando avhenger av et runner-skript som må forfattes først.

Testrapport

Listet repo-treet via GitHub API og hentet skills/agent-benchmark/SKILL.md raw; katalogen inneholder kun SKILL.md. Frontmatter parses rent med name+description og ingen sikkerhetsbrudd (ingen curl|sh, base64, eller eksfiltrering). Stikkprøvekontrollerte refererte skript: run.mjs returnerer 404 på både skills/agent-benchmark/run.mjs og benchmarks/run.mjs, og ingen fixtures/ground-truth/rubrics/baselines kataloger følger med — så hver dokumenterte `node ~/.claude/benchmarks/run.mjs`-kommando er ikke-funksjonell ut av boksen (canavar-cli.mjs, referert for ledger-integrasjonen, eksisterer på hooks/dist/). Jeg kunne ikke produsere en benchmark-run artefakt fordi scoringsmotoren mangler og kan ikke utledes fra ferdigheten, så outputMeasured=false og det manglende manuelle trinnet er å forfatte run.mjs pluss alle fixtures/ground-truth.

Testet på: 2026-07-21 · Claude Code 2.x (agent harness)

Installer

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Kommandoer og eksempelprompter

  • /agent-benchmarkMetodikk for å score agentutdata-kvalitet og fange regresjoner mot baselines

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent