AI Evals

Transformer une fonctionnalité LLM floue en un ensemble doré, une grille, un plan de jugement et un seuil de livraison/non-livraison

par liqiongyu · liqiongyu/lenny_skills_plus

Testé · Fonctionne ★ 9.2/10

AI Evals — Transformer une fonctionnalité LLM floue en un ensemble doré, une grille, un plan de jugement et un seuil de livraison/non-livraison

Ce que fait

Un workflow en 7 étapes qui produit un pack d'évaluations IA pour une fonctionnalité LLM : un PRD d'évaluation avec des seuils d'acceptation, un ensemble de tests dorés étiquetés, une taxonomie d'erreurs issue du codage ouvert, une grille ancrée sur le comportement, un plan de juge/harnais avec calibration, et une boucle de rapport + itération où chaque nouvelle défaillance devient un nouveau test. Se déclenche sur 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Rapport de test

J'ai demandé à la base et à la compétence de concevoir des évaluations pour un assistant de réponse au support (pas de fuite de PII, doit citer la KB, doit refuser les requêtes dangereuses). La base a produit un 'essayez 10 tickets et évaluez à l'œil' ad hoc ; la compétence a livré un pack ancré sur la décision avec un seuil de livraison/non-livraison, >=2 cas par comportement cible incluant des tags adversariaux/de sécurité, une taxonomie d'erreurs pondérée par la sévérité, une grille avec des ancres concrètes et des critères de départage, et une calibration du juge plus une boucle de régression. Ses références (RUBRIC, TEMPLATES, CHECKLISTS) sont de la substance réelle, pas des stubs, et le dépôt livre même sa propre vitrine avec/sans compétence.

Testé le: 2026-07-18 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Commandes et exemples de prompts

  • /ai-evalsTransformer une fonctionnalité LLM floue en un ensemble doré, une grille, un plan de jugement et un seuil de livraison/non-livraison

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.