Eval Consistency
Scorer en personas rollespilsvar på 5 dimensioner og rapporterer et tal fra 0-100
Virker med opsætning
Hvad det gør
Kører en gentagelig rollespils-konsistensevaluering over en forge-persona-profil: den svarer på et fast sæt chat-scenarier i karakter og bedømmer derefter hvert svar på meddelelseslængde, signaturfraser, tegnsætning, interaktionsmønster og hårde grænser. Output er en per-scenarie-opdeling, gennemsnit per dimension og en sammenlignelig 0-100 score, du kan genkøre efter redigering af en persona. Udløses af /eval-consistency eller ved en anmodning om at teste persona- eller rollespils-konsistens.
Testrapport
Byggede en skema-gyldig persona.json for den profil, de medfølgende testcases målretter, og bekræftede den med repoets egen persona_validator.py, kørte derefter tre scenarier to gange, med og uden færdigheden. No-skill-baselinen producerede en prosa-dom ('c02 feels a little flat'); færdigheden producerede 25 scorede bedømmelser, et sammenligneligt 96.7/100 samlet resultat og udpegede den faktiske årsag, at scenariets naturlige formuleringer findes i L0- og L4-evidens, men aldrig blev registreret i L2.signature_phrases. Den pointer til et specifikt JSON-felt er den reelle gevinst i forhold til baselinen. Svagheden er, at den samme model både skriver og bedømmer svarene, så en 70-points beståelsesgrænse diskriminerer knap nok. Den kan heller ikke køre ud af boksen: personas/ er gitignored, så du skal først generere en profil med /forge-persona, og Step 0-stierne løses kun indefra en forge-skill checkout.
Testet: 2026-08-05 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Kommandoer og eksempelprompter
/eval-consistencyScorer en personas rollespilsvar på 5 dimensioner og rapporterer et tal fra 0-100
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数