Advanced Evaluation

Richtet LLM-as-Judge-Scoring, paarweise Vergleiche und bias-bewusste Eval-Rubriken ein.

von sickn33 · sickn33/antigravity-awesome-skills

Funktioniert mit Setup ★ 6.4/10

Advanced Evaluation — Richtet LLM-as-Judge-Scoring, paarweise Vergleiche und bias-bewusste Eval-Rubriken ein.

Was es kann

Dieser Skill sollte eingesetzt werden, wenn der Nutzer „LLM-as-Judge implementieren“, „Modell-Outputs vergleichen“, „Evaluationsrubriken erstellen“, „Evaluationsbias mindern“ verlangt oder Direct Scoring, Pairwise Comparison, Position Bias, Evaluationspipelines oder automatisierte Qualitätsbewertung erwähnt.

Testbericht

Verbatim-Installation lief sauber: eine einzelne, in sich geschlossene SKILL.md mit gültigem Frontmatter, keine externen Abhängigkeiten oder API-Keys. Im A/B-Output-Test (Pairwise Judging mit Position-Swap-Bias-Minderung) folgte der Skill-Arm korrekt dem dokumentierten Protokoll, doch der Basis-Arm ohne Skill lieferte ein ebenso rigoroses, ebenso korrektes Ergebnis — die Anleitung des Skills ist solide, brachte bei dieser Aufgabe aber keinen messbaren Zugewinn. Die Trigger-Beschreibung ist etwas zu weit gefasst („Evaluationsrubriken erstellen“, „automatisierte Qualitätsbewertung“ können in Nicht-LLM-Kontexten fälschlich feuern), und das Dokument zitiert unbelegte Zuverlässigkeitswerte (z. B. „15-25% improvement“).

Getestet am: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Befehle & Beispiel-Prompts

  • /advanced-evaluationRichtet LLM-as-Judge-Scoring, paarweise Vergleiche und bias-bewusste Eval-Rubriken ein.

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias