Advanced Evaluation
Configura lo scoring LLM-as-judge, i confronti a coppie e le rubriche di valutazione attente ai bias.
Richiede configurazione
Cosa fa
Questo skill va usato quando l'utente chiede di "implementare LLM-as-judge", "confrontare output di modelli", "creare rubriche di valutazione", "mitigare bias di valutazione", o menziona scoring diretto, confronto a coppie, position bias, pipeline di valutazione o valutazione automatizzata della qualità.
Rapporto di test
Installazione verbatim pulita: un solo SKILL.md autonomo con frontmatter valido, nessuna dipendenza esterna né chiave API. Nel test A/B di output (giudizio a coppie con mitigazione del position bias tramite inversione) il braccio con lo skill ha seguito correttamente il protocollo documentato, ma il braccio base senza skill ha prodotto un risultato altrettanto rigoroso e altrettanto corretto — le indicazioni dello skill sono solide ma non hanno aggiunto alcun guadagno misurabile su questo task. La descrizione di trigger è un po' troppo ampia ("creare rubriche di valutazione", "valutazione automatizzata della qualità" possono attivarsi erroneamente su contesti non legati agli LLM), e il documento cita statistiche di affidabilità senza fonte (ad es. "miglioramento del 15-25%").
Testato il: 2026-07-11 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Comandi e prompt di esempio
/advanced-evaluationConfigura lo scoring LLM-as-judge, i confronti a coppie e le rubriche di valutazione attente ai bias.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias