Inngest Agent Evals

Zapojuje produkční hodnocení agentů Inngest: přímé/odložené hodnocení, relace a A/B experimenty.

od inngest · inngest/inngest-skills

Otestováno · Funguje ★ 9.6/10

Inngest Agent Evals — Zapojuje produkční hodnocení agentů Inngest: přímé/odložené hodnocení, relace a A/B experimenty.

Co umí

Přidává produkční evaluační primitivy Inngestu v4 — step.score, odložené scorers createScorer, korelace meta.sessions a A/B porovnání group.experiment — do produkčního AI agenta nebo pracovního postupu postaveného na Inngestu. Spouští se, když uživatel chce hodnotit, vyhodnocovat, ladit nebo A/B testovat výsledky agenta/pracovního postupu, nebo migrovat existující aplikaci Inngest pro přidání produkčních hodnocení.

Testovací report

Ověřil jsem přesný vzor kódu dovednosti proti skutečnému, aktuálně publikovanému balíčku inngest@4.12.1 na npm — scoreMiddleware, createScorer, group.experiment a experimentRef se všechny zkompilovaly čistě — zatímco základní verze z paměti znovu vynalezla nedurabilní, nepřipisovaný systém hodnocení, který POSTuje na smyšlený koncový bod metrik a náhodně vybírá svůj 'experiment' pomocí Math.random().

Testováno: 2026-07-14 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/inngest/inngest-skills
cd inngest-skills
mkdir -p ~/.claude/skills
cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals

Příkazy a ukázkové prompty

  • /inngest-agent-evalsZapojuje produkční hodnocení agentů Inngest: přímé/odložené hodnocení, relace a A/B experimenty.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Add quality scoring to my Inngest support-ticket agent function
  • I need an A/B test comparing two prompt strategies in Inngest
  • Wire up deferred eval scoring from user feedback in Inngest