AI Evals
Przekształca niewyraźną funkcję LLM w złoty zestaw, rubrykę, plan oceny i próg ship/no-ship
Testowano · Działa
Co robi ten skill
7-etapowy przepływ pracy, który tworzy pakiet AI Evals Pack dla funkcji LLM: PRD oceny z progami akceptacji, oznaczony złoty zestaw testowy, taksonomia błędów z otwartego kodowania, rubryka zakotwiczona behawioralnie, plan oceny/uprzęży z kalibracją oraz pętla raportowania + iteracji, gdzie każda nowa awaria staje się nowym testem. Uruchamia się na 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Raport z testu
Poproszono zarówno linię bazową, jak i umiejętność o zaprojektowanie ocen dla asystenta odpowiedzi wsparcia (bez wycieku PII, musi cytować KB, musi odmawiać niebezpiecznych żądań). Linia bazowa wyprodukowała ad-hoc 'try 10 tickets and eyeball it'; umiejętność dostarczyła pakiet zakotwiczony w decyzjach z progiem ship/no-ship, >=2 przypadkami dla każdego docelowego zachowania, w tym tagami adversarial/safety, taksonomią błędów ważoną według ważności, rubryką z konkretnymi kotwicami i rozstrzygaczami, oraz kalibracją oceny plus pętlą regresji. Jej odniesienia (RUBRIC, TEMPLATES, CHECKLISTS) to prawdziwa treść, a nie zaślepki, a repozytorium nawet dostarcza własną prezentację z umiejętnością/bez umiejętności.
Testowano: 2026-07-18 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Komendy i przykładowe prompty
/ai-evalsPrzekształca niewyraźną funkcję LLM w złoty zestaw, rubrykę, plan oceny i próg ship/no-ship
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.