Agent Benchmark

Méthodologie pour noter la qualité de sortie des agents et détecter les régressions par rapport aux bases de référence

par vibeeval · vibeeval/vibecosystem

Fonctionne avec configuration ★ 5.6/10

Agent Benchmark — Méthodologie pour noter la qualité de sortie des agents et détecter les régressions par rapport aux bases de référence

Ce que fait

Un document de méthodologie pour mesurer la qualité de réponse des agents avec des rubriques de notation, des fixtures de vérité terrain et des bases de référence horodatées pour détecter les régressions. Se déclenche lors de l'évaluation des changements de définition d'agent, de l'audit de qualité ou de l'établissement de bases de référence de performance. Ne fournit que la spécification — chaque commande `node run.mjs` documentée dépend d'un script d'exécution qui doit être créé en premier.

Rapport de test

Arborescence du dépôt listée via l'API GitHub et SKILL.md de skills/agent-benchmark/ récupéré brut ; le répertoire ne contient que SKILL.md. Le frontmatter est analysé proprement avec name+description et aucune faille de sécurité (pas de curl|sh, base64, ou exfiltration). Scripts référencés vérifiés ponctuellement : run.mjs renvoie 404 à la fois à skills/agent-benchmark/run.mjs et benchmarks/run.mjs, et aucun répertoire fixtures/ground-truth/rubrics/baselines n'est fourni — donc chaque commande `node ~/.claude/benchmarks/run.mjs` documentée est non fonctionnelle prête à l'emploi (canavar-cli.mjs, référencé pour l'intégration du grand livre, existe bien à hooks/dist/). Je n'ai pas pu produire d'artefact d'exécution de benchmark car le moteur de notation est absent et ne peut pas être dérivé de la compétence, donc outputMeasured=false et l'étape manuelle manquante est la création de run.mjs plus toutes les fixtures/ground-truth.

Testé le: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Commandes et exemples de prompts

  • /agent-benchmarkMéthodologie pour noter la qualité de sortie des agents et détecter les régressions par rapport aux bases de référence

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent