Agent Benchmark

Metodologia oceny jakości wyników agenta i wykrywania regresji względem bazowych

Autor: vibeeval · vibeeval/vibecosystem

Działa po konfiguracji ★ 5.6/10

Agent Benchmark — Metodologia oceny jakości wyników agenta i wykrywania regresji względem bazowych

Co robi ten skill

Dokument metodologiczny do mierzenia jakości odpowiedzi agenta za pomocą rubryk oceny, danych referencyjnych (ground-truth fixtures) i bazowych punktów odniesienia z znacznikami czasu do wykrywania regresji. Uruchamia się podczas oceny zmian definicji agenta, audytu jakości lub ustalania bazowych punktów odniesienia wydajności. Dostarcza tylko specyfikację — każda udokumentowana komenda `node run.mjs` zależy od skryptu uruchamiającego, który musi zostać najpierw napisany.

Raport z testu

Wylistowano drzewo repozytorium za pośrednictwem GitHub API i pobrano skills/agent-benchmark/SKILL.md w formie surowej; katalog zawiera tylko SKILL.md. Frontmatter parsował czysto z name+description i bez zagrożeń bezpieczeństwa (brak curl|sh, base64 ani eksfiltracji). Sprawdzono referencyjne skrypty: run.mjs zwraca 404 zarówno w skills/agent-benchmark/run.mjs, jak i benchmarks/run.mjs, i nie ma katalogów fixtures/ground-truth/rubrics/baselines — więc każda udokumentowana komenda `node ~/.claude/benchmarks/run.mjs` jest niefunkcjonalna od razu po wyjęciu z pudełka (canavar-cli.mjs, odwołujący się do integracji z księgą, istnieje w hooks/dist/). Nie mogłem wyprodukować artefaktu uruchomienia benchmarku, ponieważ silnik oceniający jest nieobecny i nie może być wyprowadzony z umiejętności, więc outputMeasured=false, a brakującym krokiem manualnym jest napisanie run.mjs plus wszystkich fixtures/ground-truth.

Testowano: 2026-07-21 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src
mkdir -p ~/.claude/skills
cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark
# SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool.
# The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404).
# No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all
# benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works.
# The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.

Komendy i przykładowe prompty

  • /agent-benchmarkMetodologia oceny jakości wyników agenta i wykrywania regresji względem bazowych

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Benchmark this agent change against the baseline
  • Check for quality regressions in the latest agent update
  • Establish a performance baseline for this agent