Advanced Evaluation
Nastavuje hodnocení LLM-as-judge, párové porovnání a eval rubriky s ohledem na bias.
Funguje s nastavením
Co umí
Tento skill se má použít, když uživatel žádá „implementovat LLM-as-judge“, „porovnat výstupy modelů“, „vytvořit evaluační rubriky“, „zmírnit bias v hodnocení“, nebo zmíní přímé skórování, párové porovnání, position bias, evaluační pipeline nebo automatizované hodnocení kvality.
Testovací report
Doslovná instalace proběhla čistě: jeden samostatný SKILL.md s platným frontmatterem, žádné externí závislosti ani API klíče. V A/B výstupním testu (párové hodnocení se zmírněním position-swap biasu) běh se skillem správně dodržel zdokumentovaný protokol, ale základní běh bez skillu přinesl stejně rigorózní a stejně správný výsledek — pokyny skillu jsou solidní, ale na této úloze nepřinesly žádný měřitelný přínos. Popis triggeru je poněkud příliš široký ('create evaluation rubrics', 'automated quality assessment' se mohou falešně spustit i mimo kontext LLM) a dokumentace uvádí nepodložené statistiky spolehlivosti (např. '15-25% improvement').
Testováno: 2026-07-11 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Příkazy a ukázkové prompty
/advanced-evaluationNastavuje hodnocení LLM-as-judge, párové porovnání a eval rubriky s ohledem na bias.
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias