AI Evals
Forvandl en uklar LLM-funktion til et gyldent sæt, rubrik, dommerplan og ship/no-ship tærskel
Testet · Virker
Hvad det gør
En 7-trins workflow, der producerer en AI Evals Pack for en LLM-funktion: en eval PRD med accepttærskler, et tagget gyldent testsæt, en fejl-taksonomi fra åben kodning, en adfærdsbaseret rubrik, en dommer-/harness-plan med kalibrering og en rapporterings- + iterationsloop, hvor hver ny fejl bliver en ny test. Udløses ved 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Testrapport
Bad både baseline og skill om at designe evals for en support-svarsassistent (ingen PII-lækage, skal citere KB, skal afvise usikre anmodninger). Baseline producerede ad-hoc 'try 10 tickets and eyeball it'; skill'en leverede en beslutningsforankret pakke med en ship/no-ship tærskel, >=2 tilfælde pr. målrettet adfærd inklusive adversarial/safety tags, en alvorlighedsvægtet fejl-taksonomi, en rubrik med konkrete ankre og tie-breakers, og dommerkalibrering plus en regressionsloop. Dens referencer (RUBRIC, TEMPLATES, CHECKLISTS) er reel substans, ikke stubs, og repoet leverer endda sin egen with-skill/without-skill showcase.
Testet: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Kommandoer og eksempelprompter
/ai-evalsForvandl en uklar LLM-funktion til et gyldent sæt, rubrik, dommerplan og ship/no-ship tærskel
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.