Eval Consistency

Évalue les réponses de jeu de rôle d'un persona sur 5 dimensions et rapporte un nombre de 0 à 100

par YIKUAIBANZI · YIKUAIBANZI/forge-skill

Fonctionne avec configuration ★ 8.0/10

Eval Consistency — Évalue les réponses de jeu de rôle d'un persona sur 5 dimensions et rapporte un nombre de 0 à 100

Ce que fait

Exécute une évaluation de cohérence de jeu de rôle répétable sur un profil forge-persona : il répond à un ensemble fixe de scénarios de chat en personnage, puis note chaque réponse sur la longueur du message, les phrases signatures, la ponctuation, le modèle d'interaction et les limites strictes. La sortie est une ventilation par scénario, des moyennes par dimension et un score comparable de 0 à 100 que vous pouvez réexécuter après avoir modifié un persona. Se déclenche sur /eval-consistency ou sur une demande de test de cohérence de persona ou de jeu de rôle.

Rapport de test

A construit un persona.json valide pour le profil ciblé par les cas de test fournis et l'a confirmé avec le persona_validator.py du dépôt, puis a exécuté trois scénarios deux fois, avec et sans la compétence. La référence sans compétence a produit un verdict en prose ('c02 feels a little flat') ; la compétence a produit 25 jugements notés, un agrégat comparable de 96,7/100, et a identifié la cause réelle : le phrasé naturel du scénario se trouve dans les preuves L0 et L4 mais n'a jamais été enregistré dans L2.signature_phrases. Ce pointeur vers un champ JSON spécifique est le véritable gain par rapport à la référence. La faiblesse est que le même modèle écrit et évalue les réponses, donc une barre de réussite de 70 points discrimine à peine. Il ne peut pas non plus fonctionner tel quel : personas/ est ignoré par git, vous devez donc d'abord générer un profil avec /forge-persona, et les chemins de l'étape 0 ne se résolvent que depuis un checkout forge-skill.

Testé le: 2026-08-05 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/YIKUAIBANZI/forge-skill.git
mkdir -p ~/.claude/skills
cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases

Commandes et exemples de prompts

  • /eval-consistencyÉvalue les réponses de jeu de rôle d'un persona sur 5 dimensions et rapporte un nombre de 0 à 100

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Run /eval-consistency to score my persona's roleplay replies
  • Test whether my forge persona stays in character across scenarios
  • 跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数