AI Evals
Transformer une fonctionnalité LLM floue en un ensemble doré, une grille, un plan de jugement et un seuil de livraison/non-livraison
Testé · Fonctionne
Ce que fait
Un workflow en 7 étapes qui produit un pack d'évaluations IA pour une fonctionnalité LLM : un PRD d'évaluation avec des seuils d'acceptation, un ensemble de tests dorés étiquetés, une taxonomie d'erreurs issue du codage ouvert, une grille ancrée sur le comportement, un plan de juge/harnais avec calibration, et une boucle de rapport + itération où chaque nouvelle défaillance devient un nouveau test. Se déclenche sur 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.
Rapport de test
J'ai demandé à la base et à la compétence de concevoir des évaluations pour un assistant de réponse au support (pas de fuite de PII, doit citer la KB, doit refuser les requêtes dangereuses). La base a produit un 'essayez 10 tickets et évaluez à l'œil' ad hoc ; la compétence a livré un pack ancré sur la décision avec un seuil de livraison/non-livraison, >=2 cas par comportement cible incluant des tags adversariaux/de sécurité, une taxonomie d'erreurs pondérée par la sévérité, une grille avec des ancres concrètes et des critères de départage, et une calibration du juge plus une boucle de régression. Ses références (RUBRIC, TEMPLATES, CHECKLISTS) sont de la substance réelle, pas des stubs, et le dépôt livre même sa propre vitrine avec/sans compétence.
Testé le: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/liqiongyu/lenny_skills_plus.git mkdir -p ~/.claude/skills cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals
Commandes et exemples de prompts
/ai-evalsTransformer une fonctionnalité LLM floue en un ensemble doré, une grille, un plan de jugement et un seuil de livraison/non-livraison
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Design evals for our support-reply assistant that must never leak PII.Help me build a golden test set and rubric for this LLM feature.Our AI quality is flaky, make it into a repeatable evaluation loop.