Eval Consistency
Beoordeelt de roleplay-antwoorden van een persona op 5 dimensies en rapporteert een getal van 0-100
Werkt met setup
Wat het doet
Voert een herhaalbare roleplay-consistency evaluatie uit over een forge-persona profiel: het antwoordt op een vaste set chat scenario's in karakter, en beoordeelt vervolgens elk antwoord op berichtlengte, signature phrases, interpunctie, interaction pattern en hard boundaries. De output is een per-scenario uitsplitsing, per-dimensie gemiddelden en één vergelijkbare 0-100 score die je opnieuw kunt uitvoeren na het bewerken van een persona. Activeert op /eval-consistency of op een verzoek om persona of roleplay consistency te testen.
Testrapport
Bouwde een schema-valid persona.json voor het profiel dat de gebundelde test cases targetten en bevestigde dit met de eigen persona_validator.py van de repo, voerde vervolgens drie scenario's twee keer uit, met en zonder de skill. De no-skill baseline produceerde een proza-oordeel ('c02 feels a little flat'); de skill produceerde 25 gescoorde oordelen, een vergelijkbaar 96.7/100 aggregaat, en wees de werkelijke oorzaak aan, namelijk dat de natuurlijke formulering van het scenario in L0 en L4 bewijs leeft, maar nooit was geregistreerd in L2.signature_phrases. Die verwijzing naar een specifiek JSON-veld is de echte winst ten opzichte van de baseline. De zwakte is dat hetzelfde model zowel de antwoorden schrijft als beoordeelt, dus een 70-punten pass bar discrimineert nauwelijks. Het kan ook niet out of the box draaien: personas/ is gitignored, dus je moet eerst een profiel genereren met /forge-persona, en de Step 0 paths lossen alleen op vanuit een forge-skill checkout.
Getest op: 2026-08-05 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Commando's en voorbeeldprompts
/eval-consistencyBeoordeelt de roleplay-antwoorden van een persona op 5 dimensies en rapporteert een getal van 0-100
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数