AI Evals
Přemění nejasnou funkci LLM na zlatou sadu, rubriku, plán posuzování a práh pro nasazení/nenasazení
Otestováno · Funguje
Co umí
7krokový pracovní postup, který vytváří AI Evals Pack pro funkci LLM: eval PRD s prahovými hodnotami přijatelnosti, označenou zlatou testovací sadu, taxonomii chyb z otevřeného kódování, rubriku ukotvenou v chování, plán posuzování/harness s kalibrací a smyčku pro reportování + iteraci, kde každé nové selhání se stává novým testem. Spouští se na 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Testovací report
Požádal jsem základní linii i dovednost, aby navrhly hodnocení pro asistenta pro odpovědi na podporu (žádný únik PII, musí citovat KB, musí odmítnout nebezpečné požadavky). Základní linie vytvořila ad-hoc 'vyzkoušejte 10 tiketů a zkontrolujte je od oka'; dovednost dodala balíček založený na rozhodování s prahovou hodnotou pro nasazení/nenasazení, >=2 případy pro každé cílové chování včetně adverzních/bezpečnostních značek, taxonomii chyb váženou podle závažnosti, rubriku s konkrétními kotvami a rozhodčími kritérii a kalibraci posuzovatele plus regresní smyčku. Její reference (RUBRIC, TEMPLATES, CHECKLISTS) jsou skutečnou substancí, nikoli zástupnými symboly, a repozitář dokonce dodává vlastní ukázku s dovedností/bez dovednosti.
Testováno: 2026-07-18 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Příkazy a ukázkové prompty
/ai-evalsPřemění nejasnou funkci LLM na zlatou sadu, rubriku, plán posuzování a práh pro nasazení/nenasazení
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.