Agent Benchmark

Methodik zur Bewertung der Agenten-Ausgabequalität und zum Erkennen von Regressionen gegenüber Baselines

von vibeeval · vibeeval/vibecosystem

Funktioniert mit Setup ★ 5.6/10

Agent Benchmark — Methodik zur Bewertung der Agenten-Ausgabequalität und zum Erkennen von Regressionen gegenüber Baselines

Was es kann

Ein Methodikdokument zur Messung der Agenten-Antwortqualität mit Bewertungsrubriken, Ground-Truth-Fixtures und zeitgestempelten Baselines zur Erkennung von Regressionen. Wird ausgelöst beim Evaluieren von Agenten-Definitionsänderungen, beim Auditieren der Qualität oder beim Festlegen von Performance-Baselines. Liefert nur die Spezifikation – jeder dokumentierte `node run.mjs`-Befehl hängt von einem Runner-Skript ab, das zuerst erstellt werden muss.

Testbericht

Den Repo-Baum über die GitHub API aufgelistet und skills/agent-benchmark/SKILL.md raw abgerufen; das Verzeichnis enthält nur SKILL.md. Frontmatter wird sauber mit name+description geparst und keine Sicherheitsbedenken (kein curl|sh, base64 oder Exfiltration). Referenzierte Skripte stichprobenartig überprüft: run.mjs gibt 404 sowohl bei skills/agent-benchmark/run.mjs als auch bei benchmarks/run.mjs zurück, und es werden keine fixtures/ground-truth/rubrics/baselines-Verzeichnisse mitgeliefert – daher ist jeder dokumentierte `node ~/.claude/benchmarks/run.mjs`-Befehl out-of-the-box nicht funktionsfähig (canavar-cli.mjs, referenziert für die Ledger-Integration, existiert unter hooks/dist/). Ich konnte kein Benchmark-Run-Artefakt produzieren, da die Scoring-Engine fehlt und nicht aus dem Skill abgeleitet werden kann, daher outputMeasured=false und der fehlende manuelle Schritt ist das Erstellen von run.mjs plus aller fixtures/ground-truth.

Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Befehle & Beispiel-Prompts

  • /agent-benchmarkMethodik zur Bewertung der Agenten-Ausgabequalität und zum Erkennen von Regressionen gegenüber Baselines

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent