Advanced Evaluation

Sätter upp LLM-as-judge-poängsättning, parvisa jämförelser och biasmedvetna utvärderingsrubriker.

av sickn33 · sickn33/antigravity-awesome-skills

Fungerar med konfiguration ★ 6.4/10

Advanced Evaluation — Sätter upp LLM-as-judge-poängsättning, parvisa jämförelser och biasmedvetna utvärderingsrubriker.

Vad den gör

Den här skillen ska användas när användaren ber om att 'implementera LLM-as-judge', 'jämföra modellutdata', 'skapa utvärderingsrubriker', 'mildra utvärderingsbias', eller nämner direkt poängsättning, parvis jämförelse, positionsbias, utvärderingspipelines eller automatiserad kvalitetsbedömning.

Testrapport

Installation ord för ord fungerade utan kirurgi: en enda självständig SKILL.md med giltig frontmatter, inga externa beroenden eller API-nycklar. I A/B-utdatatestet (parvis bedömning med positionsbytesmitigering av positionsbias) följde skillens gren det dokumenterade protokollet korrekt, men basgrenen utan skill producerade ett lika rigoröst, lika korrekt resultat — skillens vägledning är solid men gav inget mätbart lyft på den här uppgiften. Triggerbeskrivningen är något för bred ('skapa utvärderingsrubriker', 'automatiserad kvalitetsbedömning' kan felaktigt avfyras i sammanhang som inte rör LLM:er), och dokumentet citerar okällbelagd tillförlitlighetsstatistik (t.ex. '15–25 % förbättring').

Testad: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Kommandon och exempelprompter

  • /advanced-evaluationSätter upp LLM-as-judge-poängsättning, parvisa jämförelser och biasmedvetna utvärderingsrubriker.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias