Advanced Evaluation
Richtet LLM-as-Judge-Scoring, paarweise Vergleiche und bias-bewusste Eval-Rubriken ein.
Funktioniert mit Setup
Was es kann
Dieser Skill sollte eingesetzt werden, wenn der Nutzer „LLM-as-Judge implementieren“, „Modell-Outputs vergleichen“, „Evaluationsrubriken erstellen“, „Evaluationsbias mindern“ verlangt oder Direct Scoring, Pairwise Comparison, Position Bias, Evaluationspipelines oder automatisierte Qualitätsbewertung erwähnt.
Testbericht
Verbatim-Installation lief sauber: eine einzelne, in sich geschlossene SKILL.md mit gültigem Frontmatter, keine externen Abhängigkeiten oder API-Keys. Im A/B-Output-Test (Pairwise Judging mit Position-Swap-Bias-Minderung) folgte der Skill-Arm korrekt dem dokumentierten Protokoll, doch der Basis-Arm ohne Skill lieferte ein ebenso rigoroses, ebenso korrektes Ergebnis — die Anleitung des Skills ist solide, brachte bei dieser Aufgabe aber keinen messbaren Zugewinn. Die Trigger-Beschreibung ist etwas zu weit gefasst („Evaluationsrubriken erstellen“, „automatisierte Qualitätsbewertung“ können in Nicht-LLM-Kontexten fälschlich feuern), und das Dokument zitiert unbelegte Zuverlässigkeitswerte (z. B. „15-25% improvement“).
Getestet am: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Befehle & Beispiel-Prompts
/advanced-evaluationRichtet LLM-as-Judge-Scoring, paarweise Vergleiche und bias-bewusste Eval-Rubriken ein.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias