Advanced Evaluation
Zet LLM-as-judge-scoring, pairwise vergelijkingen en bias-bewuste evalrubrics op.
Werkt met setup
Wat het doet
Deze skill moet worden gebruikt wanneer de gebruiker vraagt om "implement LLM-as-judge", "compare model outputs", "create evaluation rubrics", "mitigate evaluation bias", of direct scoring, pairwise comparison, position bias, evaluatiepipelines of geautomatiseerde kwaliteitsbeoordeling noemt.
Testrapport
Letterlijke installatie werkte schoon: één op zichzelf staande SKILL.md met geldige frontmatter, geen externe dependencies of API-keys. In de A/B-outputtest (pairwise judging met position-swap-biasmitigatie) volgde de skill-variant het gedocumenteerde protocol correct, maar de base-variant zonder skill leverde een even rigoureus, even correct resultaat op — de richtlijnen van de skill zijn solide maar leverden geen meetbare winst op voor deze taak. De triggeromschrijving is enigszins te breed ('create evaluation rubrics', 'automated quality assessment' kunnen vals afvuren in niet-LLM-contexten), en de doc citeert niet-onderbouwde betrouwbaarheidsstatistieken (bijv. '15-25% improvement').
Getest op: 2026-07-11 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Commando's en voorbeeldprompts
/advanced-evaluationZet LLM-as-judge-scoring, pairwise vergelijkingen en bias-bewuste evalrubrics op.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias