AI Evals
Gjør en uklar LLM-funksjon om til et gyllent sett, rubrikk, dommerplan og ship/no-ship terskel
Bestått
Hva den gjør
En 7-trinns arbeidsflyt som produserer en AI Evals Pack for en LLM-funksjon: en eval PRD med akseptterskler, et tagget gyllent testsett, en feiltaksonomi fra åpen koding, en atferdsforankret rubrikk, en dommer-/seleplan med kalibrering, og en rapporterings- + iterasjonsløkke der hver ny feil blir en ny test. Utløses på 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Testrapport
Ba både baseline og ferdighet om å designe evalueringer for en støtte-svar-assistent (ingen PII-lekkasje, må sitere KB, må nekte usikre forespørsler). Baseline produserte ad-hoc 'try 10 tickets and eyeball it'; ferdigheten leverte en beslutningsforankret pakke med en ship/no-ship terskel, >=2 tilfeller per målatferd inkludert fiendtlige/sikkerhets-tags, en alvorlighetsvektet feiltaksonomi, en rubrikk med konkrete ankere og tie-breakers, og dommerkalibrering pluss en regresjonsløkke. Dens referanser (RUBRIC, TEMPLATES, CHECKLISTS) er ekte substans, ikke stubber, og repoet leverer til og med sin egen med-ferdighet/uten-ferdighet showcase.
Testet på: 2026-07-18 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Kommandoer og eksempelprompter
/ai-evalsGjør en uklar LLM-funksjon om til et gyllent sett, rubrikk, dommerplan og ship/no-ship terskel
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.