Advanced Evaluation

Setter opp LLM-as-judge-scoring, parvise sammenligninger, og bias-bevisste evalueringsrubrikker.

av sickn33 · sickn33/antigravity-awesome-skills

Krever oppsett ★ 6.4/10

Advanced Evaluation — Setter opp LLM-as-judge-scoring, parvise sammenligninger, og bias-bevisste evalueringsrubrikker.

Hva den gjør

Denne skillen bør brukes når brukeren ber om å «implement LLM-as-judge», «compare model outputs», «create evaluation rubrics», «mitigate evaluation bias», eller nevner direkte scoring, parvis sammenligning, posisjonsbias, evalueringspipeliner, eller automatisert kvalitetsvurdering.

Testrapport

Verbatim-installasjonen fungerte rent: én selvstendig SKILL.md med gyldig frontmatter, ingen eksterne avhengigheter eller API-nøkler. I A/B-outputtesten (parvis dømming med bias-reduksjon via posisjonsbytte) fulgte skillarmen den dokumenterte protokollen korrekt, men base-armen uten skillen produserte et like grundig, like korrekt resultat — skillens veiledning er solid, men ga ingen målbar forbedring på denne oppgaven. Triggerbeskrivelsen er noe for bred («create evaluation rubrics», «automated quality assessment» kan feiltrigge i ikke-LLM-kontekster), og dokumentasjonen siterer ukildede pålitelighetstall (f.eks. «15-25% improvement»).

Testet på: 2026-07-11 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Kommandoer og eksempelprompter

  • /advanced-evaluationSetter opp LLM-as-judge-scoring, parvise sammenligninger, og bias-bevisste evalueringsrubrikker.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias