Agent Benchmark
Méthodologie pour noter la qualité de sortie des agents et détecter les régressions par rapport aux bases de référence
Fonctionne avec configuration
Ce que fait
Un document de méthodologie pour mesurer la qualité de réponse des agents avec des rubriques de notation, des fixtures de vérité terrain et des bases de référence horodatées pour détecter les régressions. Se déclenche lors de l'évaluation des changements de définition d'agent, de l'audit de qualité ou de l'établissement de bases de référence de performance. Ne fournit que la spécification — chaque commande `node run.mjs` documentée dépend d'un script d'exécution qui doit être créé en premier.
Rapport de test
Arborescence du dépôt listée via l'API GitHub et SKILL.md de skills/agent-benchmark/ récupéré brut ; le répertoire ne contient que SKILL.md. Le frontmatter est analysé proprement avec name+description et aucune faille de sécurité (pas de curl|sh, base64, ou exfiltration). Scripts référencés vérifiés ponctuellement : run.mjs renvoie 404 à la fois à skills/agent-benchmark/run.mjs et benchmarks/run.mjs, et aucun répertoire fixtures/ground-truth/rubrics/baselines n'est fourni — donc chaque commande `node ~/.claude/benchmarks/run.mjs` documentée est non fonctionnelle prête à l'emploi (canavar-cli.mjs, référencé pour l'intégration du grand livre, existe bien à hooks/dist/). Je n'ai pas pu produire d'artefact d'exécution de benchmark car le moteur de notation est absent et ne peut pas être dérivé de la compétence, donc outputMeasured=false et l'étape manuelle manquante est la création de run.mjs plus toutes les fixtures/ground-truth.
Testé le: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Commandes et exemples de prompts
/agent-benchmarkMéthodologie pour noter la qualité de sortie des agents et détecter les régressions par rapport aux bases de référence
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent