AI Evals

Zet een vage LLM-feature om in een golden set, rubric, judge plan en ship/no-ship drempel

Door liqiongyu · liqiongyu/lenny_skills_plus

Getest · Werkt ★ 9.2/10

AI Evals — Zet een vage LLM-feature om in een golden set, rubric, judge plan en ship/no-ship drempel

Wat het doet

Een 7-stappen workflow die een AI Evals Pack produceert voor een LLM-feature: een eval PRD met acceptatiedrempels, een getagde golden test set, een fouttaxonomie uit open codering, een gedragsmatig verankerde rubric, een judge/harness plan met kalibratie, en een rapportage + iteratielus waarbij elke nieuwe fout een nieuwe test wordt. Activeert op 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Testrapport

Zowel baseline als skill gevraagd om evals te ontwerpen voor een support-reply assistent (geen PII-lekkage, moet KB citeren, moet onveilige verzoeken weigeren). Baseline produceerde ad-hoc 'try 10 tickets and eyeball it'; de skill leverde een beslissingsgericht pakket met een ship/no-ship drempel, >=2 gevallen per doelgedrag inclusief adversarial/safety tags, een op ernst gewogen fouttaxonomie, een rubric met concrete ankers en tie-breakers, en judge kalibratie plus een regressielus. De referenties (RUBRIC, TEMPLATES, CHECKLISTS) zijn echte inhoud, geen stubs, en de repo levert zelfs een eigen with-skill/without-skill showcase.

Getest op: 2026-07-18 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Commando's en voorbeeldprompts

  • /ai-evalsZet een vage LLM-feature om in een golden set, rubric, judge plan en ship/no-ship drempel

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.