Skill Eval Harness
Python CLI, který měří kauzální přínos dovednosti: spuštění s/bez, lintování úniku, ablace
Funguje s nastavením
Co umí
Python CLI (`skill-benchmark`) nezávislý na repozitáři, který měří kauzální přínos dovednosti agenta spuštěním stejného případu s dovedností i bez ní, deterministickým hodnocením výstupů a reportováním párového přínosu, úniku, ablací, četnosti spouštění a nákladů. Je to vývojářský nástroj, který vyvoláváte z manifestu evals/ repozitáře dovednosti, nikoli samoaktivující se dovednost Claude. Použijte jej, když chcete prokázat, že dovednost skutečně zlepšuje výstupy, namísto pouhého vizuálního posouzení.
Testovací report
Načten rekurzivní strom, README (v0.6.0), pyproject.toml a jediný skutečný SKILL.md (examples/demo-skill/skills/demo/SKILL.md) plus jeho references/checklist.md — obojí existuje a parsuje; závislosti jsou pouze pyyaml, MIT-licencované, žádné exfiltraci/skryté instrukce/base64 payloady nebyly nalezeny. Produkt je CLI instalované přes `uv tool install skill-eval-harness`, takže je inertní jako dovednost zkopírovaná dovnitř a nemohu měřit jeho výstup bez instalace externího nástroje (sníženo o 1 instalační bod). Spouštění posuzováno na demo-reviewer fixture — MĚLO BY se spustit: „Zkontroluj tento diff a označ, jak vážné je každé zjištění“, „Prohlédni mou navrhovanou změnu kódu a označ, která zjištění blokují“, „Projdi tento PR a roztřiď problémy podle závažnosti“; NEMĚLO BY se spustit: „Napiš novou funkci pro stránkování pro API“, „Shrň tento blogový příspěvek“ — všech 5 volání bych udělal správně, ale samotný harness nemá autonomní spouštěč (vyvolává se z CLI), proto 4.
Testováno: 2026-07-20 · Claude Code 2.x (agent harness)
Instalace
uv tool install skill-eval-harness # external Python CLI (Python 3.10+, uv) — NOT installed here per policy
Příkazy a ukázkové prompty
/skill-eval-harnessPython CLI, který měří kauzální přínos dovednosti: spuštění s/bez, lintování úniku, ablace
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Evaluate this skill against a paired baseline variantRun trace artifacts through the skill eval harnessCompare two skill variants to see which one performs better