Inngest Agent Evals

Okablowuje produkcyjne ewaluacje agentów Inngest: bezpośrednie/odroczone punktowanie, sesje i eksperymenty A/B.

Autor: inngest · inngest/inngest-skills

Testowano · Działa ★ 9.6/10

Inngest Agent Evals — Okablowuje produkcyjne ewaluacje agentów Inngest: bezpośrednie/odroczone punktowanie, sesje i eksperymenty A/B.

Co robi ten skill

Dodaje prymitywy ewaluacji v4 Inngest — step.score, odroczone createScorer scorers, korelację meta.sessions i porównania A/B group.experiment — do produkcyjnego agenta AI lub przepływu pracy zbudowanego na Inngest. Wyzwalane, gdy użytkownik chce punktować, oceniać, debugować lub testować A/B wyniki agenta/przepływu pracy, lub migrować istniejącą aplikację Inngest w celu dodania ewaluacji produkcyjnych.

Raport z testu

Sprawdzono typ dokładnego wzorca kodu umiejętności w stosunku do rzeczywistego, aktualnie opublikowanego pakietu inngest@4.12.1 w npm — scoreMiddleware, createScorer, group.experiment i experimentRef skompilowały się czysto — podczas gdy punkt odniesienia z pamięci wymyślił nietrwały, nieprzypisany system punktowania, który POSTuje do zmyślonego punktu końcowego metryk i rzuca monetą 'eksperyment' z Math.random().

Testowano: 2026-07-14 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/inngest/inngest-skills
cd inngest-skills
mkdir -p ~/.claude/skills
cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals

Komendy i przykładowe prompty

  • /inngest-agent-evalsOkablowuje produkcyjne ewaluacje agentów Inngest: bezpośrednie/odroczone punktowanie, sesje i eksperymenty A/B.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Add quality scoring to my Inngest support-ticket agent function
  • I need an A/B test comparing two prompt strategies in Inngest
  • Wire up deferred eval scoring from user feedback in Inngest