Inngest Agent Evals
Connecte les évaluations d'agents Inngest en production : scoring direct/différé, sessions et expériences A/B.
Testé · Fonctionne
Ce que fait
Ajoute les primitives d'évaluation v4 d'Inngest — step.score, les scorers createScorer différés, la corrélation meta.sessions et les comparaisons A/B group.experiment — à un agent AI ou un workflow de production construit sur Inngest. Se déclenche lorsque l'utilisateur souhaite scorer, évaluer, déboguer ou tester A/B les résultats d'un agent/workflow, ou migrer une application Inngest existante pour ajouter des évaluations de production.
Rapport de test
J'ai vérifié le pattern de code exact de la compétence par rapport au package inngest@4.12.1 réel et actuellement publié sur npm — scoreMiddleware, createScorer, group.experiment et experimentRef ont tous compilé sans erreur — tandis qu'une base de référence de mémoire réinventait un système de scoring non durable et non attribué qui POSTe vers un endpoint de métriques inventé et simule son 'expérience' avec Math.random().
Testé le: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/inngest/inngest-skills cd inngest-skills mkdir -p ~/.claude/skills cp -r skills/inngest-agent-evals ~/.claude/skills/inngest-agent-evals
Commandes et exemples de prompts
/inngest-agent-evalsConnecte les évaluations d'agents Inngest en production : scoring direct/différé, sessions et expériences A/B.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Add quality scoring to my Inngest support-ticket agent functionI need an A/B test comparing two prompt strategies in InngestWire up deferred eval scoring from user feedback in Inngest