Advanced Evaluation
Setter opp LLM-as-judge-scoring, parvise sammenligninger, og bias-bevisste evalueringsrubrikker.
Krever oppsett
Hva den gjør
Denne skillen bør brukes når brukeren ber om å «implement LLM-as-judge», «compare model outputs», «create evaluation rubrics», «mitigate evaluation bias», eller nevner direkte scoring, parvis sammenligning, posisjonsbias, evalueringspipeliner, eller automatisert kvalitetsvurdering.
Testrapport
Verbatim-installasjonen fungerte rent: én selvstendig SKILL.md med gyldig frontmatter, ingen eksterne avhengigheter eller API-nøkler. I A/B-outputtesten (parvis dømming med bias-reduksjon via posisjonsbytte) fulgte skillarmen den dokumenterte protokollen korrekt, men base-armen uten skillen produserte et like grundig, like korrekt resultat — skillens veiledning er solid, men ga ingen målbar forbedring på denne oppgaven. Triggerbeskrivelsen er noe for bred («create evaluation rubrics», «automated quality assessment» kan feiltrigge i ikke-LLM-kontekster), og dokumentasjonen siterer ukildede pålitelighetstall (f.eks. «15-25% improvement»).
Testet på: 2026-07-11 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Kommandoer og eksempelprompter
/advanced-evaluationSetter opp LLM-as-judge-scoring, parvise sammenligninger, og bias-bevisste evalueringsrubrikker.
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias