Agent Benchmark
Metodologia per valutare la qualità dell'output dell'agente e rilevare regressioni rispetto alle baseline.
Richiede configurazione
Cosa fa
Un documento di metodologia per misurare la qualità della risposta dell'agente con rubriche di punteggio, fixture di verità di base e baseline con timestamp per rilevare le regressioni. Si attiva quando si valutano modifiche alla definizione dell'agente, si verifica la qualità o si stabiliscono baseline di performance. Fornisce solo la specifica — ogni comando `node run.mjs` documentato dipende da uno script runner che deve essere creato per primo.
Rapporto di test
Elencato l'albero della repo tramite l'API GitHub e recuperato skills/agent-benchmark/SKILL.md raw; la directory contiene solo SKILL.md. Il frontmatter si analizza in modo pulito con name+description e nessun problema di sicurezza (nessun curl|sh, base64 o esfiltrazione). Controllati a campione gli script di riferimento: run.mjs restituisce 404 sia in skills/agent-benchmark/run.mjs che in benchmarks/run.mjs, e nessuna directory fixtures/ground-truth/rubrics/baselines viene fornita — quindi ogni comando `node ~/.claude/benchmarks/run.mjs` documentato non è funzionante out of the box (canavar-cli.mjs, referenziato per l'integrazione del ledger, esiste in hooks/dist/). Non ho potuto produrre un artefatto di esecuzione benchmark perché il motore di punteggio è assente e non può essere derivato dalla skill, quindi outputMeasured=false e il passaggio manuale mancante è la creazione di run.mjs più tutte le fixture/ground-truth.
Testato il: 2026-07-21 · Claude Code 2.x (agent harness)
Installazione
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Comandi e prompt di esempio
/agent-benchmarkMetodologia per valutare la qualità dell'output dell'agente e rilevare regressioni rispetto alle baseline.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent