Advanced Evaluation
Opsætter LLM-as-judge-scoring, parvise sammenligninger og bias-bevidste evalueringsrubrikker.
Virker med opsætning
Hvad det gør
Dette skill bør bruges, når brugeren beder om at "implementere LLM-as-judge", "sammenligne modeloutput", "oprette evalueringsrubrikker", "afbøde evalueringsbias", eller nævner direkte scoring, parvis sammenligning, positionsbias, evalueringspipelines eller automatiseret kvalitetsvurdering.
Testrapport
Verbatim install virkede rent: én selvstændig SKILL.md med gyldig frontmatter, ingen eksterne afhængigheder eller API-nøgler. I A/B-outputtesten (parvis dømmekraft med position-swap-bias-afbødning) fulgte skill-armen den dokumenterede protokol korrekt, men basisarmen uden skillet producerede et lige så grundigt, lige så korrekt resultat — skillets vejledning er solid, men tilførte ingen målbar gevinst på denne opgave. Trigger-beskrivelsen er noget for bred ('oprette evalueringsrubrikker', 'automatiseret kvalitetsvurdering' kan fejlfyre på ikke-LLM-kontekster), og dokumentet citerer ukildede pålidelighedsstatistikker (f.eks. '15-25% forbedring').
Testet: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Kommandoer og eksempelprompter
/advanced-evaluationOpsætter LLM-as-judge-scoring, parvise sammenligninger og bias-bevidste evalueringsrubrikker.
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias