Inngest Agent Evals

Conecta evaluaciones de agentes Inngest en producción: puntuación directa/diferida, sesiones y experimentos A/B.

Por inngest · inngest/inngest-skills

Probado · Funciona ★ 9.6/10

Inngest Agent Evals — Conecta evaluaciones de agentes Inngest en producción: puntuación directa/diferida, sesiones y experimentos A/B.

Qué hace

Añade las primitivas de evaluación v4 de Inngest — step.score, scorers createScorer diferidos, correlación meta.sessions y comparaciones A/B group.experiment — a un agente de IA o flujo de trabajo en producción construido sobre Inngest. Se activa cuando el usuario quiere puntuar, evaluar, depurar o realizar pruebas A/B de los resultados de agentes/flujos de trabajo, o migrar una aplicación Inngest existente para añadir evaluaciones de producción.

Informe de la prueba

Se verificó el patrón de código exacto de la skill contra el paquete real, actualmente publicado inngest@4.12.1 en npm — scoreMiddleware, createScorer, group.experiment y experimentRef compilaron limpiamente — mientras que una línea base de memoria reinventó un sistema de puntuación no duradero y no atribuido que POSTea a un endpoint de métricas inventado y decide su 'experimento' con Math.random().

Probado el: 2026-07-14 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/inngest/inngest-skills
cd inngest-skills
mkdir -p ~/.claude/skills
cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals

Comandos y prompts de ejemplo

  • /inngest-agent-evalsConecta evaluaciones de agentes Inngest en producción: puntuación directa/diferida, sesiones y experimentos A/B.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Add quality scoring to my Inngest support-ticket agent function
  • I need an A/B test comparing two prompt strategies in Inngest
  • Wire up deferred eval scoring from user feedback in Inngest