Eval Consistency

Scorer en personas rollespilsvar på 5 dimensioner og rapporterer et tal fra 0-100

Af YIKUAIBANZI · YIKUAIBANZI/forge-skill

Virker med opsætning ★ 8.0/10

Eval Consistency — Scorer en personas rollespilsvar på 5 dimensioner og rapporterer et tal fra 0-100

Hvad det gør

Kører en gentagelig rollespils-konsistensevaluering over en forge-persona-profil: den svarer på et fast sæt chat-scenarier i karakter og bedømmer derefter hvert svar på meddelelseslængde, signaturfraser, tegnsætning, interaktionsmønster og hårde grænser. Output er en per-scenarie-opdeling, gennemsnit per dimension og en sammenlignelig 0-100 score, du kan genkøre efter redigering af en persona. Udløses af /eval-consistency eller ved en anmodning om at teste persona- eller rollespils-konsistens.

Testrapport

Byggede en skema-gyldig persona.json for den profil, de medfølgende testcases målretter, og bekræftede den med repoets egen persona_validator.py, kørte derefter tre scenarier to gange, med og uden færdigheden. No-skill-baselinen producerede en prosa-dom ('c02 feels a little flat'); færdigheden producerede 25 scorede bedømmelser, et sammenligneligt 96.7/100 samlet resultat og udpegede den faktiske årsag, at scenariets naturlige formuleringer findes i L0- og L4-evidens, men aldrig blev registreret i L2.signature_phrases. Den pointer til et specifikt JSON-felt er den reelle gevinst i forhold til baselinen. Svagheden er, at den samme model både skriver og bedømmer svarene, så en 70-points beståelsesgrænse diskriminerer knap nok. Den kan heller ikke køre ud af boksen: personas/ er gitignored, så du skal først generere en profil med /forge-persona, og Step 0-stierne løses kun indefra en forge-skill checkout.

Testet: 2026-08-05 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/YIKUAIBANZI/forge-skill.git
mkdir -p ~/.claude/skills
cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases

Kommandoer og eksempelprompter

  • /eval-consistencyScorer en personas rollespilsvar på 5 dimensioner og rapporterer et tal fra 0-100

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Run /eval-consistency to score my persona's roleplay replies
  • Test whether my forge persona stays in character across scenarios
  • 跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数