Agent Benchmark

Metodologia per valutare la qualità dell'output dell'agente e rilevare regressioni rispetto alle baseline.

di vibeeval · vibeeval/vibecosystem

Richiede configurazione ★ 5.6/10

Agent Benchmark — Metodologia per valutare la qualità dell'output dell'agente e rilevare regressioni rispetto alle baseline.

Cosa fa

Un documento di metodologia per misurare la qualità della risposta dell'agente con rubriche di punteggio, fixture di verità di base e baseline con timestamp per rilevare le regressioni. Si attiva quando si valutano modifiche alla definizione dell'agente, si verifica la qualità o si stabiliscono baseline di performance. Fornisce solo la specifica — ogni comando `node run.mjs` documentato dipende da uno script runner che deve essere creato per primo.

Rapporto di test

Elencato l'albero della repo tramite l'API GitHub e recuperato skills/agent-benchmark/SKILL.md raw; la directory contiene solo SKILL.md. Il frontmatter si analizza in modo pulito con name+description e nessun problema di sicurezza (nessun curl|sh, base64 o esfiltrazione). Controllati a campione gli script di riferimento: run.mjs restituisce 404 sia in skills/agent-benchmark/run.mjs che in benchmarks/run.mjs, e nessuna directory fixtures/ground-truth/rubrics/baselines viene fornita — quindi ogni comando `node ~/.claude/benchmarks/run.mjs` documentato non è funzionante out of the box (canavar-cli.mjs, referenziato per l'integrazione del ledger, esiste in hooks/dist/). Non ho potuto produrre un artefatto di esecuzione benchmark perché il motore di punteggio è assente e non può essere derivato dalla skill, quindi outputMeasured=false e il passaggio manuale mancante è la creazione di run.mjs più tutte le fixture/ground-truth.

Testato il: 2026-07-21 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Comandi e prompt di esempio

  • /agent-benchmarkMetodologia per valutare la qualità dell'output dell'agente e rilevare regressioni rispetto alle baseline.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent