AI Evals

Trasforma una funzionalità LLM 'fuzzy' in un golden set, rubrica, piano di valutazione e soglia ship/no-ship

di liqiongyu · liqiongyu/lenny_skills_plus

Promosso ★ 9.2/10

AI Evals — Trasforma una funzionalità LLM 'fuzzy' in un golden set, rubrica, piano di valutazione e soglia ship/no-ship

Cosa fa

Un workflow in 7 passaggi che produce un AI Evals Pack per una funzionalità LLM: un PRD di valutazione con soglie di accettazione, un golden test set etichettato, una tassonomia degli errori da open coding, una rubrica ancorata al comportamento, un piano di valutazione/harness con calibrazione e un ciclo di reporting + iterazione in cui ogni nuovo fallimento diventa un nuovo test. Si attiva su 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Rapporto di test

Chiesto sia alla baseline che alla skill di progettare valutazioni per un assistente di risposta al supporto (nessuna perdita di PII, deve citare KB, deve rifiutare richieste non sicure). La baseline ha prodotto un 'prova 10 ticket e valuta a occhio' ad-hoc; la skill ha fornito un pacchetto ancorato alle decisioni con una soglia ship/no-ship, >=2 casi per comportamento target inclusi tag avversari/di sicurezza, una tassonomia degli errori ponderata per gravità, una rubrica con ancore concrete e tie-breaker, e calibrazione del giudice più un ciclo di regressione. I suoi riferimenti (RUBRIC, TEMPLATES, CHECKLISTS) sono sostanza reale, non stub, e il repository include persino la sua vetrina con-skill/senza-skill.

Testato il: 2026-07-18 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Comandi e prompt di esempio

  • /ai-evalsTrasforma una funzionalità LLM 'fuzzy' in un golden set, rubrica, piano di valutazione e soglia ship/no-ship

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.