AI Evals
Trasforma una funzionalità LLM 'fuzzy' in un golden set, rubrica, piano di valutazione e soglia ship/no-ship
Promosso
Cosa fa
Un workflow in 7 passaggi che produce un AI Evals Pack per una funzionalità LLM: un PRD di valutazione con soglie di accettazione, un golden test set etichettato, una tassonomia degli errori da open coding, una rubrica ancorata al comportamento, un piano di valutazione/harness con calibrazione e un ciclo di reporting + iterazione in cui ogni nuovo fallimento diventa un nuovo test. Si attiva su 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Rapporto di test
Chiesto sia alla baseline che alla skill di progettare valutazioni per un assistente di risposta al supporto (nessuna perdita di PII, deve citare KB, deve rifiutare richieste non sicure). La baseline ha prodotto un 'prova 10 ticket e valuta a occhio' ad-hoc; la skill ha fornito un pacchetto ancorato alle decisioni con una soglia ship/no-ship, >=2 casi per comportamento target inclusi tag avversari/di sicurezza, una tassonomia degli errori ponderata per gravità, una rubrica con ancore concrete e tie-breaker, e calibrazione del giudice più un ciclo di regressione. I suoi riferimenti (RUBRIC, TEMPLATES, CHECKLISTS) sono sostanza reale, non stub, e il repository include persino la sua vetrina con-skill/senza-skill.
Testato il: 2026-07-18 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Comandi e prompt di esempio
/ai-evalsTrasforma una funzionalità LLM 'fuzzy' in un golden set, rubrica, piano di valutazione e soglia ship/no-ship
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.