Inngest Agent Evals
Verdrahtet Produktions-Inngest-Agenten-Evals: direktes/aufgeschobenes Scoring, Sessions und A/B-Experimente.
Getestet · Funktioniert
Was es kann
Fügt Inngests v4 evaluation primitives – step.score, deferred createScorer scorers, meta.sessions correlation und group.experiment A/B comparisons – zu einem Produktions-AI-Agenten oder workflow hinzu, der auf Inngest basiert. Triggert, wenn der Benutzer Agenten-/Workflow-Ergebnisse bewerten, evaluieren, debuggen oder A/B-testen möchte oder eine bestehende Inngest app migrieren möchte, um production evals hinzuzufügen.
Testbericht
Ich habe das genaue code pattern der skill gegen das echte, aktuell veröffentlichte inngest@4.12.1 package auf npm typechecked – scoreMiddleware, createScorer, group.experiment und experimentRef kompilierten alle sauber – während eine from-memory baseline ein nicht-durable, unattributed scoring system neu erfand, das an einen made-up metrics endpoint POSTs und sein 'experiment' mit Math.random() per Münzwurf entscheidet.
Getestet am: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/inngest/inngest-skills cd inngest-skills mkdir -p ~/.claude/skills cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals
Befehle & Beispiel-Prompts
/inngest-agent-evalsVerdrahtet Produktions-Inngest-Agenten-Evals: direktes/aufgeschobenes Scoring, Sessions und A/B-Experimente.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Add quality scoring to my Inngest support-ticket agent functionI need an A/B test comparing two prompt strategies in InngestWire up deferred eval scoring from user feedback in Inngest