Agent Benchmark
Metodologia oceny jakości wyników agenta i wykrywania regresji względem bazowych
Działa po konfiguracji
Co robi ten skill
Dokument metodologiczny do mierzenia jakości odpowiedzi agenta za pomocą rubryk oceny, danych referencyjnych (ground-truth fixtures) i bazowych punktów odniesienia z znacznikami czasu do wykrywania regresji. Uruchamia się podczas oceny zmian definicji agenta, audytu jakości lub ustalania bazowych punktów odniesienia wydajności. Dostarcza tylko specyfikację — każda udokumentowana komenda `node run.mjs` zależy od skryptu uruchamiającego, który musi zostać najpierw napisany.
Raport z testu
Wylistowano drzewo repozytorium za pośrednictwem GitHub API i pobrano skills/agent-benchmark/SKILL.md w formie surowej; katalog zawiera tylko SKILL.md. Frontmatter parsował czysto z name+description i bez zagrożeń bezpieczeństwa (brak curl|sh, base64 ani eksfiltracji). Sprawdzono referencyjne skrypty: run.mjs zwraca 404 zarówno w skills/agent-benchmark/run.mjs, jak i benchmarks/run.mjs, i nie ma katalogów fixtures/ground-truth/rubrics/baselines — więc każda udokumentowana komenda `node ~/.claude/benchmarks/run.mjs` jest niefunkcjonalna od razu po wyjęciu z pudełka (canavar-cli.mjs, odwołujący się do integracji z księgą, istnieje w hooks/dist/). Nie mogłem wyprodukować artefaktu uruchomienia benchmarku, ponieważ silnik oceniający jest nieobecny i nie może być wyprowadzony z umiejętności, więc outputMeasured=false, a brakującym krokiem manualnym jest napisanie run.mjs plus wszystkich fixtures/ground-truth.
Testowano: 2026-07-21 · Claude Code 2.x (agent harness)
Instalacja
git clone --depth 1 https://github.com/vibeeval/vibecosystem.git /tmp/agent-benchmark-src mkdir -p ~/.claude/skills cp -R /tmp/agent-benchmark-src/skills/agent-benchmark ~/.claude/skills/agent-benchmark # SKILL.md is the only file that ships. It is a methodology/spec, NOT a runnable tool. # The runner it invokes everywhere (node ~/.claude/benchmarks/run.mjs) does NOT exist in the repo (HTTP 404). # No fixtures/, ground-truth/, rubrics/, or baselines/ ship either — you must author run.mjs and all # benchmark data yourself using the JSON/rubric templates in the SKILL body before any bash command works. # The Canavar integration it mentions (~/.claude/hooks/dist/canavar-cli.mjs) does ship separately under hooks/dist/.
Komendy i przykładowe prompty
/agent-benchmarkMetodologia oceny jakości wyników agenta i wykrywania regresji względem bazowych
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Benchmark this agent change against the baselineCheck for quality regressions in the latest agent updateEstablish a performance baseline for this agent