AI Evals

Přemění nejasnou funkci LLM na zlatou sadu, rubriku, plán posuzování a práh pro nasazení/nenasazení

od liqiongyu · liqiongyu/lenny_skills_plus

Otestováno · Funguje ★ 9.2/10

AI Evals — Přemění nejasnou funkci LLM na zlatou sadu, rubriku, plán posuzování a práh pro nasazení/nenasazení

Co umí

7krokový pracovní postup, který vytváří AI Evals Pack pro funkci LLM: eval PRD s prahovými hodnotami přijatelnosti, označenou zlatou testovací sadu, taxonomii chyb z otevřeného kódování, rubriku ukotvenou v chování, plán posuzování/harness s kalibrací a smyčku pro reportování + iteraci, kde každé nové selhání se stává novým testem. Spouští se na 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Testovací report

Požádal jsem základní linii i dovednost, aby navrhly hodnocení pro asistenta pro odpovědi na podporu (žádný únik PII, musí citovat KB, musí odmítnout nebezpečné požadavky). Základní linie vytvořila ad-hoc 'vyzkoušejte 10 tiketů a zkontrolujte je od oka'; dovednost dodala balíček založený na rozhodování s prahovou hodnotou pro nasazení/nenasazení, >=2 případy pro každé cílové chování včetně adverzních/bezpečnostních značek, taxonomii chyb váženou podle závažnosti, rubriku s konkrétními kotvami a rozhodčími kritérii a kalibraci posuzovatele plus regresní smyčku. Její reference (RUBRIC, TEMPLATES, CHECKLISTS) jsou skutečnou substancí, nikoli zástupnými symboly, a repozitář dokonce dodává vlastní ukázku s dovedností/bez dovednosti.

Testováno: 2026-07-18 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Příkazy a ukázkové prompty

  • /ai-evalsPřemění nejasnou funkci LLM na zlatou sadu, rubriku, plán posuzování a práh pro nasazení/nenasazení

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.