Inngest Agent Evals
Conecta evaluaciones de agentes Inngest en producción: puntuación directa/diferida, sesiones y experimentos A/B.
Probado · Funciona
Qué hace
Añade las primitivas de evaluación v4 de Inngest — step.score, scorers createScorer diferidos, correlación meta.sessions y comparaciones A/B group.experiment — a un agente de IA o flujo de trabajo en producción construido sobre Inngest. Se activa cuando el usuario quiere puntuar, evaluar, depurar o realizar pruebas A/B de los resultados de agentes/flujos de trabajo, o migrar una aplicación Inngest existente para añadir evaluaciones de producción.
Informe de la prueba
Se verificó el patrón de código exacto de la skill contra el paquete real, actualmente publicado inngest@4.12.1 en npm — scoreMiddleware, createScorer, group.experiment y experimentRef compilaron limpiamente — mientras que una línea base de memoria reinventó un sistema de puntuación no duradero y no atribuido que POSTea a un endpoint de métricas inventado y decide su 'experimento' con Math.random().
Probado el: 2026-07-14 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/inngest/inngest-skills cd inngest-skills mkdir -p ~/.claude/skills cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals
Comandos y prompts de ejemplo
/inngest-agent-evalsConecta evaluaciones de agentes Inngest en producción: puntuación directa/diferida, sesiones y experimentos A/B.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Add quality scoring to my Inngest support-ticket agent functionI need an A/B test comparing two prompt strategies in InngestWire up deferred eval scoring from user feedback in Inngest