AI Evals

Convierte una característica difusa de LLM en un conjunto dorado, rúbrica, plan de juez y umbral de envío/no envío

Por liqiongyu · liqiongyu/lenny_skills_plus

Probado · Funciona ★ 9.2/10

AI Evals — Convierte una característica difusa de LLM en un conjunto dorado, rúbrica, plan de juez y umbral de envío/no envío

Qué hace

Un flujo de trabajo de 7 pasos que produce un paquete de evaluaciones de IA para una característica de LLM: un PRD de evaluación con umbrales de aceptación, un conjunto de pruebas dorado etiquetado, una taxonomía de errores a partir de la codificación abierta, una rúbrica anclada en el comportamiento, un plan de juez/arnés con calibración y un bucle de informes + iteración donde cada nuevo fallo se convierte en una nueva prueba. Se activa con 'design evals for our AI feature', 'build a golden set and rubric', 'make our flaky AI quality a repeatable eval'.

Informe de la prueba

Se pidió tanto a la línea base como a la habilidad que diseñaran evaluaciones para un asistente de respuesta de soporte (sin fuga de PII, debe citar KB, debe rechazar solicitudes inseguras). La línea base produjo un 'try 10 tickets and eyeball it' ad-hoc; la habilidad entregó un paquete anclado en decisiones con un umbral de envío/no envío, >=2 casos por comportamiento objetivo incluyendo etiquetas adversarias/de seguridad, una taxonomía de errores ponderada por severidad, una rúbrica con anclajes concretos y desempates, y calibración del juez más un bucle de regresión. Sus referencias (RUBRIC, TEMPLATES, CHECKLISTS) son sustancia real, no stubs, y el repositorio incluso incluye su propia demostración con/sin habilidad.

Probado el: 2026-07-18 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/liqiongyu/lenny_skills_plus.git
mkdir -p ~/.claude/skills
cd lenny_skills_plus && cp -r skills/ai-evals ~/.claude/skills/ai-evals

Comandos y prompts de ejemplo

  • /ai-evalsConvierte una característica difusa de LLM en un conjunto dorado, rúbrica, plan de juez y umbral de envío/no envío

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Design evals for our support-reply assistant that must never leak PII.
  • Help me build a golden test set and rubric for this LLM feature.
  • Our AI quality is flaky, make it into a repeatable evaluation loop.