AI Evals
Verwandelt ein unscharfes LLM-Feature in einen Golden Set, eine Rubrik, einen Richterplan und einen Ship/No-Ship-Schwellenwert
Getestet · Funktioniert
Was es kann
Ein 7-stufiger Workflow, der ein AI Evals Pack für ein LLM-Feature erstellt: ein Eval-PRD mit Akzeptanzschwellen, ein getaggter Golden Test Set, eine Fehlertaxonomie aus offenem Coding, eine verhaltensbasierte Rubrik, ein Judge/Harness-Plan mit Kalibrierung und eine Berichts- + Iterationsschleife, bei der jeder neue Fehler zu einem neuen Test wird. Wird ausgelöst bei 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Testbericht
Sowohl die Baseline als auch der Skill wurden gebeten, Evals für einen Support-Antwort-Assistenten zu entwerfen (kein PII-Leck, muss KB zitieren, muss unsichere Anfragen ablehnen). Die Baseline produzierte ad-hoc 'try 10 tickets and eyeball it'; der Skill lieferte ein entscheidungsbasiertes Paket mit einem Ship/No-Ship-Schwellenwert, >=2 Fällen pro Zielverhalten einschließlich adversarieller/Sicherheits-Tags, einer nach Schweregrad gewichteten Fehlertaxonomie, einer Rubrik mit konkreten Ankern und Tie-Breakern sowie Richterkalibrierung plus einer Regressionsschleife. Seine Referenzen (RUBRIC, TEMPLATES, CHECKLISTS) sind echte Substanz, keine Stubs, und das Repo liefert sogar eine eigene With-Skill/Without-Skill-Demonstration.
Getestet am: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Befehle & Beispiel-Prompts
/ai-evalsVerwandelt ein unscharfes LLM-Feature in einen Golden Set, eine Rubrik, einen Richterplan und einen Ship/No-Ship-Schwellenwert
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.