AI Evals

Forvandl en uklar LLM-funktion til et gyldent sæt, rubrik, dommerplan og ship/no-ship tærskel

Af liqiongyu · liqiongyu/lenny_skills_plus

Testet · Virker ★ 9.2/10

AI Evals — Forvandl en uklar LLM-funktion til et gyldent sæt, rubrik, dommerplan og ship/no-ship tærskel

Hvad det gør

En 7-trins workflow, der producerer en AI Evals Pack for en LLM-funktion: en eval PRD med accepttærskler, et tagget gyldent testsæt, en fejl-taksonomi fra åben kodning, en adfærdsbaseret rubrik, en dommer-/harness-plan med kalibrering og en rapporterings- + iterationsloop, hvor hver ny fejl bliver en ny test. Udløses ved 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Testrapport

Bad både baseline og skill om at designe evals for en support-svarsassistent (ingen PII-lækage, skal citere KB, skal afvise usikre anmodninger). Baseline producerede ad-hoc 'try 10 tickets and eyeball it'; skill'en leverede en beslutningsforankret pakke med en ship/no-ship tærskel, >=2 tilfælde pr. målrettet adfærd inklusive adversarial/safety tags, en alvorlighedsvægtet fejl-taksonomi, en rubrik med konkrete ankre og tie-breakers, og dommerkalibrering plus en regressionsloop. Dens referencer (RUBRIC, TEMPLATES, CHECKLISTS) er reel substans, ikke stubs, og repoet leverer endda sin egen with-skill/without-skill showcase.

Testet: 2026-07-18 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Kommandoer og eksempelprompter

  • /ai-evalsForvandl en uklar LLM-funktion til et gyldent sæt, rubrik, dommerplan og ship/no-ship tærskel

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.