Advanced Evaluation

Configura lo scoring LLM-as-judge, i confronti a coppie e le rubriche di valutazione attente ai bias.

di sickn33 · sickn33/antigravity-awesome-skills

Richiede configurazione ★ 6.4/10

Advanced Evaluation — Configura lo scoring LLM-as-judge, i confronti a coppie e le rubriche di valutazione attente ai bias.

Cosa fa

Questo skill va usato quando l'utente chiede di "implementare LLM-as-judge", "confrontare output di modelli", "creare rubriche di valutazione", "mitigare bias di valutazione", o menziona scoring diretto, confronto a coppie, position bias, pipeline di valutazione o valutazione automatizzata della qualità.

Rapporto di test

Installazione verbatim pulita: un solo SKILL.md autonomo con frontmatter valido, nessuna dipendenza esterna né chiave API. Nel test A/B di output (giudizio a coppie con mitigazione del position bias tramite inversione) il braccio con lo skill ha seguito correttamente il protocollo documentato, ma il braccio base senza skill ha prodotto un risultato altrettanto rigoroso e altrettanto corretto — le indicazioni dello skill sono solide ma non hanno aggiunto alcun guadagno misurabile su questo task. La descrizione di trigger è un po' troppo ampia ("creare rubriche di valutazione", "valutazione automatizzata della qualità" possono attivarsi erroneamente su contesti non legati agli LLM), e il documento cita statistiche di affidabilità senza fonte (ad es. "miglioramento del 15-25%").

Testato il: 2026-07-11 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Comandi e prompt di esempio

  • /advanced-evaluationConfigura lo scoring LLM-as-judge, i confronti a coppie e le rubriche di valutazione attente ai bias.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias