AI Evals

Przekształca niewyraźną funkcję LLM w złoty zestaw, rubrykę, plan oceny i próg ship/no-ship

Autor: liqiongyu · liqiongyu/lenny_skills_plus

Testowano · Działa ★ 9.2/10

AI Evals — Przekształca niewyraźną funkcję LLM w złoty zestaw, rubrykę, plan oceny i próg ship/no-ship

Co robi ten skill

7-etapowy przepływ pracy, który tworzy pakiet AI Evals Pack dla funkcji LLM: PRD oceny z progami akceptacji, oznaczony złoty zestaw testowy, taksonomia błędów z otwartego kodowania, rubryka zakotwiczona behawioralnie, plan oceny/uprzęży z kalibracją oraz pętla raportowania + iteracji, gdzie każda nowa awaria staje się nowym testem. Uruchamia się na 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Raport z testu

Poproszono zarówno linię bazową, jak i umiejętność o zaprojektowanie ocen dla asystenta odpowiedzi wsparcia (bez wycieku PII, musi cytować KB, musi odmawiać niebezpiecznych żądań). Linia bazowa wyprodukowała ad-hoc 'try 10 tickets and eyeball it'; umiejętność dostarczyła pakiet zakotwiczony w decyzjach z progiem ship/no-ship, >=2 przypadkami dla każdego docelowego zachowania, w tym tagami adversarial/safety, taksonomią błędów ważoną według ważności, rubryką z konkretnymi kotwicami i rozstrzygaczami, oraz kalibracją oceny plus pętlą regresji. Jej odniesienia (RUBRIC, TEMPLATES, CHECKLISTS) to prawdziwa treść, a nie zaślepki, a repozytorium nawet dostarcza własną prezentację z umiejętnością/bez umiejętności.

Testowano: 2026-07-18 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Komendy i przykładowe prompty

  • /ai-evalsPrzekształca niewyraźną funkcję LLM w złoty zestaw, rubrykę, plan oceny i próg ship/no-ship

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.