Advanced Evaluation

Nastavuje hodnocení LLM-as-judge, párové porovnání a eval rubriky s ohledem na bias.

od sickn33 · sickn33/antigravity-awesome-skills

Funguje s nastavením ★ 6.4/10

Advanced Evaluation — Nastavuje hodnocení LLM-as-judge, párové porovnání a eval rubriky s ohledem na bias.

Co umí

Tento skill se má použít, když uživatel žádá „implementovat LLM-as-judge“, „porovnat výstupy modelů“, „vytvořit evaluační rubriky“, „zmírnit bias v hodnocení“, nebo zmíní přímé skórování, párové porovnání, position bias, evaluační pipeline nebo automatizované hodnocení kvality.

Testovací report

Doslovná instalace proběhla čistě: jeden samostatný SKILL.md s platným frontmatterem, žádné externí závislosti ani API klíče. V A/B výstupním testu (párové hodnocení se zmírněním position-swap biasu) běh se skillem správně dodržel zdokumentovaný protokol, ale základní běh bez skillu přinesl stejně rigorózní a stejně správný výsledek — pokyny skillu jsou solidní, ale na této úloze nepřinesly žádný měřitelný přínos. Popis triggeru je poněkud příliš široký ('create evaluation rubrics', 'automated quality assessment' se mohou falešně spustit i mimo kontext LLM) a dokumentace uvádí nepodložené statistiky spolehlivosti (např. '15-25% improvement').

Testováno: 2026-07-11 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Příkazy a ukázkové prompty

  • /advanced-evaluationNastavuje hodnocení LLM-as-judge, párové porovnání a eval rubriky s ohledem na bias.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias