Inngest Agent Evals

Configura le valutazioni degli agenti Inngest in produzione: scoring diretto/differito, sessioni ed esperimenti A/B.

di inngest · inngest/inngest-skills

Promosso ★ 9.6/10

Inngest Agent Evals — Configura le valutazioni degli agenti Inngest in produzione: scoring diretto/differito, sessioni ed esperimenti A/B.

Cosa fa

Aggiunge le primitive di valutazione v4 di Inngest — step.score, createScorer differiti, correlazione meta.sessions e confronti A/B group.experiment — a un agente AI o workflow di produzione basato su Inngest. Si attiva quando l'utente desidera assegnare un punteggio, valutare, debuggare o testare A/B i risultati di un agente/workflow, o migrare un'app Inngest esistente per aggiungere valutazioni di produzione.

Rapporto di test

Ho verificato il pattern di codice esatto della skill rispetto al pacchetto inngest@4.12.1 reale e attualmente pubblicato su npm — scoreMiddleware, createScorer, group.experiment ed experimentRef sono stati tutti compilati senza errori — mentre una baseline da memoria ha reinventato un sistema di scoring non duraturo e non attribuito che invia POST a un endpoint di metriche inventato e 'lancia una moneta' per il suo 'esperimento' con Math.random().

Testato il: 2026-07-14 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/inngest/inngest-skills
cd inngest-skills
mkdir -p ~/.claude/skills
cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals

Comandi e prompt di esempio

  • /inngest-agent-evalsConfigura le valutazioni degli agenti Inngest in produzione: scoring diretto/differito, sessioni ed esperimenti A/B.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Add quality scoring to my Inngest support-ticket agent function
  • I need an A/B test comparing two prompt strategies in Inngest
  • Wire up deferred eval scoring from user feedback in Inngest