Advanced Evaluation
Ustawia ocenianie LLM-as-judge, porównania parami i macierze ewaluacji uwzględniające obciążenia (bias).
Działa po konfiguracji
Co robi ten skill
Ten skill należy używać, gdy użytkownik prosi o „implementację LLM-as-judge”, „porównanie wyników modeli”, „stworzenie macierzy ewaluacji”, „ograniczenie obciążeń w ewaluacji”, albo wspomina o ocenianiu bezpośrednim, porównaniu parami, obciążeniu pozycji, pipeline'ach ewaluacyjnych lub automatycznej ocenie jakości.
Raport z testu
Dosłowny install zadziałał czysto: pojedynczy samowystarczalny SKILL.md z poprawnym frontmatterem, brak zależności zewnętrznych czy kluczy API. W teście wyjściowym A/B (ocenianie parami z ograniczaniem obciążenia przez zamianę pozycji) wariant ze skillem poprawnie zastosował udokumentowany protokół, ale wariant bazowy bez skilla wyprodukował równie rzetelny, równie poprawny wynik — wskazówki skilla są trafne, ale nie dały mierzalnej przewagi na tym zadaniu. Opis triggera jest nieco zbyt szeroki („stworzenie macierzy ewaluacji”, „automatyczna ocena jakości” mogą fałszywie uruchamiać się w kontekstach niezwiązanych z LLM), a dokumentacja przytacza niepotwierdzone źródłowo statystyki wiarygodności (np. „poprawa o 15-25%”).
Testowano: 2026-07-11 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Komendy i przykładowe prompty
/advanced-evaluationUstawia ocenianie LLM-as-judge, porównania parami i macierze ewaluacji uwzględniające obciążenia (bias).
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias