AI Evals

Förvandla en luddig LLM-funktion till en gyllene uppsättning, bedömningsmatris, domarplan och leverans-/icke-leveranströskel

av liqiongyu · liqiongyu/lenny_skills_plus

Testad · Fungerar ★ 9.2/10

AI Evals — Förvandla en luddig LLM-funktion till en gyllene uppsättning, bedömningsmatris, domarplan och leverans-/icke-leveranströskel

Vad den gör

Ett 7-stegs arbetsflöde som producerar ett AI Evals Pack för en LLM-funktion: en eval PRD med acceptanströsklar, en taggad gyllene testuppsättning, en fel-taxonomi från öppen kodning, en beteendemässigt förankrad bedömningsmatris, en domar-/harness-plan med kalibrering, och en rapporterings- + iterationsloop där varje nytt fel blir ett nytt test. Utlöses av 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Testrapport

Bad både baslinjen och färdigheten att designa utvärderingar för en support-svarassistent (ingen PII-läcka, måste citera KB, måste vägra osäkra förfrågningar). Baslinjen producerade ad-hoc 'try 10 tickets and eyeball it'; färdigheten levererade ett beslutsförankrat paket med en leverans-/icke-leveranströskel, >=2 fall per målbeteende inklusive adversarial/safety-taggar, en svårighetsgradsviktad fel-taxonomi, en bedömningsmatris med konkreta ankare och tie-breakers, och domarkalibrering plus en regressionsloop. Dess referenser (RUBRIC, TEMPLATES, CHECKLISTS) är verklig substans, inte stumpar, och repot levererar till och med sin egen med-färdighet/utan-färdighet-showcase.

Testad: 2026-07-18 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Kommandon och exempelprompter

  • /ai-evalsFörvandla en luddig LLM-funktion till en gyllene uppsättning, bedömningsmatris, domarplan och leverans-/icke-leveranströskel

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.