Advanced Evaluation

Ustawia ocenianie LLM-as-judge, porównania parami i macierze ewaluacji uwzględniające obciążenia (bias).

Autor: sickn33 · sickn33/antigravity-awesome-skills

Działa po konfiguracji ★ 6.4/10

Advanced Evaluation — Ustawia ocenianie LLM-as-judge, porównania parami i macierze ewaluacji uwzględniające obciążenia (bias).

Co robi ten skill

Ten skill należy używać, gdy użytkownik prosi o „implementację LLM-as-judge”, „porównanie wyników modeli”, „stworzenie macierzy ewaluacji”, „ograniczenie obciążeń w ewaluacji”, albo wspomina o ocenianiu bezpośrednim, porównaniu parami, obciążeniu pozycji, pipeline'ach ewaluacyjnych lub automatycznej ocenie jakości.

Raport z testu

Dosłowny install zadziałał czysto: pojedynczy samowystarczalny SKILL.md z poprawnym frontmatterem, brak zależności zewnętrznych czy kluczy API. W teście wyjściowym A/B (ocenianie parami z ograniczaniem obciążenia przez zamianę pozycji) wariant ze skillem poprawnie zastosował udokumentowany protokół, ale wariant bazowy bez skilla wyprodukował równie rzetelny, równie poprawny wynik — wskazówki skilla są trafne, ale nie dały mierzalnej przewagi na tym zadaniu. Opis triggera jest nieco zbyt szeroki („stworzenie macierzy ewaluacji”, „automatyczna ocena jakości” mogą fałszywie uruchamiać się w kontekstach niezwiązanych z LLM), a dokumentacja przytacza niepotwierdzone źródłowo statystyki wiarygodności (np. „poprawa o 15-25%”).

Testowano: 2026-07-11 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Komendy i przykładowe prompty

  • /advanced-evaluationUstawia ocenianie LLM-as-judge, porównania parami i macierze ewaluacji uwzględniające obciążenia (bias).

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias