Advanced Evaluation
Sätter upp LLM-as-judge-poängsättning, parvisa jämförelser och biasmedvetna utvärderingsrubriker.
Fungerar med konfiguration
Vad den gör
Den här skillen ska användas när användaren ber om att 'implementera LLM-as-judge', 'jämföra modellutdata', 'skapa utvärderingsrubriker', 'mildra utvärderingsbias', eller nämner direkt poängsättning, parvis jämförelse, positionsbias, utvärderingspipelines eller automatiserad kvalitetsbedömning.
Testrapport
Installation ord för ord fungerade utan kirurgi: en enda självständig SKILL.md med giltig frontmatter, inga externa beroenden eller API-nycklar. I A/B-utdatatestet (parvis bedömning med positionsbytesmitigering av positionsbias) följde skillens gren det dokumenterade protokollet korrekt, men basgrenen utan skill producerade ett lika rigoröst, lika korrekt resultat — skillens vägledning är solid men gav inget mätbart lyft på den här uppgiften. Triggerbeskrivningen är något för bred ('skapa utvärderingsrubriker', 'automatiserad kvalitetsbedömning' kan felaktigt avfyras i sammanhang som inte rör LLM:er), och dokumentet citerar okällbelagd tillförlitlighetsstatistik (t.ex. '15–25 % förbättring').
Testad: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Kommandon och exempelprompter
/advanced-evaluationSätter upp LLM-as-judge-poängsättning, parvisa jämförelser och biasmedvetna utvärderingsrubriker.
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias