AI Evals
Zet een vage LLM-feature om in een golden set, rubric, judge plan en ship/no-ship drempel
Getest · Werkt
Wat het doet
Een 7-stappen workflow die een AI Evals Pack produceert voor een LLM-feature: een eval PRD met acceptatiedrempels, een getagde golden test set, een fouttaxonomie uit open codering, een gedragsmatig verankerde rubric, een judge/harness plan met kalibratie, en een rapportage + iteratielus waarbij elke nieuwe fout een nieuwe test wordt. Activeert op 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Testrapport
Zowel baseline als skill gevraagd om evals te ontwerpen voor een support-reply assistent (geen PII-lekkage, moet KB citeren, moet onveilige verzoeken weigeren). Baseline produceerde ad-hoc 'try 10 tickets and eyeball it'; de skill leverde een beslissingsgericht pakket met een ship/no-ship drempel, >=2 gevallen per doelgedrag inclusief adversarial/safety tags, een op ernst gewogen fouttaxonomie, een rubric met concrete ankers en tie-breakers, en judge kalibratie plus een regressielus. De referenties (RUBRIC, TEMPLATES, CHECKLISTS) zijn echte inhoud, geen stubs, en de repo levert zelfs een eigen with-skill/without-skill showcase.
Getest op: 2026-07-18 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Commando's en voorbeeldprompts
/ai-evalsZet een vage LLM-feature om in een golden set, rubric, judge plan en ship/no-ship drempel
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.