Eval Consistency
Scorer en personas rollespill-svar på 5 dimensjoner og rapporterer et tall fra 0-100
Krever oppsett
Hva den gjør
Kjører en repeterbar rollespill-konsistensevaluering over en forge-persona-profil: den svarer på et fast sett med chat-scenarioer i karakter, og graderer deretter hvert svar på meldingslengde, signaturfraser, tegnsetting, interaksjonsmønster og harde grenser. Utdata er en per-scenario-fordeling, gjennomsnitt per dimensjon og én sammenlignbar 0-100-score du kan kjøre på nytt etter å ha redigert en persona. Utløses av /eval-consistency eller en forespørsel om å teste persona- eller rollespill-konsistens.
Testrapport
Bygde en skjema-gyldig persona.json for profilen de medfølgende testcasene målretter og bekreftet den med repoets egen persona_validator.py, kjørte deretter tre scenarier to ganger, med og uten ferdigheten. No-skill-baselinen produserte en prosa-dom ('c02 feels a little flat'); ferdigheten produserte 25 scorede vurderinger, et sammenlignbart 96.7/100 aggregat, og pekte på den faktiske årsaken, at scenarioets naturlige formuleringer lever i L0 og L4 bevis, men aldri ble registrert i L2.signature_phrases. Den pekeren til et spesifikt JSON-felt er den virkelige gevinsten over baselinen. Svakheten er at den samme modellen både skriver og graderer svarene, så en 70-poengs bestått-grense diskriminerer knapt. Den kan heller ikke kjøre ut av boksen: personas/ er gitignored, så du må først generere en profil med /forge-persona, og Step 0-stiene løses kun fra innsiden av en forge-skill-checkout.
Testet på: 2026-08-05 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Kommandoer og eksempelprompter
/eval-consistencyScorer en personas rollespill-svar på 5 dimensjoner og rapporterer et tall fra 0-100
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数