Inngest Agent Evals
Zapojuje produkční hodnocení agentů Inngest: přímé/odložené hodnocení, relace a A/B experimenty.
Otestováno · Funguje
Co umí
Přidává produkční evaluační primitivy Inngestu v4 — step.score, odložené scorers createScorer, korelace meta.sessions a A/B porovnání group.experiment — do produkčního AI agenta nebo pracovního postupu postaveného na Inngestu. Spouští se, když uživatel chce hodnotit, vyhodnocovat, ladit nebo A/B testovat výsledky agenta/pracovního postupu, nebo migrovat existující aplikaci Inngest pro přidání produkčních hodnocení.
Testovací report
Ověřil jsem přesný vzor kódu dovednosti proti skutečnému, aktuálně publikovanému balíčku inngest@4.12.1 na npm — scoreMiddleware, createScorer, group.experiment a experimentRef se všechny zkompilovaly čistě — zatímco základní verze z paměti znovu vynalezla nedurabilní, nepřipisovaný systém hodnocení, který POSTuje na smyšlený koncový bod metrik a náhodně vybírá svůj 'experiment' pomocí Math.random().
Testováno: 2026-07-14 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/inngest/inngest-skills cd inngest-skills mkdir -p ~/.claude/skills cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals
Příkazy a ukázkové prompty
/inngest-agent-evalsZapojuje produkční hodnocení agentů Inngest: přímé/odložené hodnocení, relace a A/B experimenty.
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Add quality scoring to my Inngest support-ticket agent functionI need an A/B test comparing two prompt strategies in InngestWire up deferred eval scoring from user feedback in Inngest