Agent Benchmark
Methodik zur Bewertung der Agenten-Ausgabequalität und zum Erkennen von Regressionen gegenüber Baselines
Funktioniert mit Setup
Was es kann
Ein Methodikdokument zur Messung der Agenten-Antwortqualität mit Bewertungsrubriken, Ground-Truth-Fixtures und zeitgestempelten Baselines zur Erkennung von Regressionen. Wird ausgelöst beim Evaluieren von Agenten-Definitionsänderungen, beim Auditieren der Qualität oder beim Festlegen von Performance-Baselines. Liefert nur die Spezifikation – jeder dokumentierte `node run.mjs`-Befehl hängt von einem Runner-Skript ab, das zuerst erstellt werden muss.
Testbericht
Den Repo-Baum über die GitHub API aufgelistet und skills/agent-benchmark/SKILL.md raw abgerufen; das Verzeichnis enthält nur SKILL.md. Frontmatter wird sauber mit name+description geparst und keine Sicherheitsbedenken (kein curl|sh, base64 oder Exfiltration). Referenzierte Skripte stichprobenartig überprüft: run.mjs gibt 404 sowohl bei skills/agent-benchmark/run.mjs als auch bei benchmarks/run.mjs zurück, und es werden keine fixtures/ground-truth/rubrics/baselines-Verzeichnisse mitgeliefert – daher ist jeder dokumentierte `node ~/.claude/benchmarks/run.mjs`-Befehl out-of-the-box nicht funktionsfähig (canavar-cli.mjs, referenziert für die Ledger-Integration, existiert unter hooks/dist/). Ich konnte kein Benchmark-Run-Artefakt produzieren, da die Scoring-Engine fehlt und nicht aus dem Skill abgeleitet werden kann, daher outputMeasured=false und der fehlende manuelle Schritt ist das Erstellen von run.mjs plus aller fixtures/ground-truth.
Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Befehle & Beispiel-Prompts
/agent-benchmarkMethodik zur Bewertung der Agenten-Ausgabequalität und zum Erkennen von Regressionen gegenüber Baselines
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent