Eval Consistency
Poängsätter en personas rollspelsvar på 5 dimensioner och rapporterar ett nummer mellan 0-100
Fungerar med konfiguration
Vad den gör
Kör en repeterbar rollspelskonsekvensutvärdering över en forge-persona-profil: den svarar på en fast uppsättning chattscenarier i karaktär, betygsätter sedan varje svar utifrån meddelandelängd, signaturfraser, interpunktion, interaktionsmönster och hårda gränser. Utdata är en uppdelning per scenario, genomsnitt per dimension och en jämförbar 0-100-poäng som du kan köra om efter att ha redigerat en persona. Utlöses av /eval-consistency eller en förfrågan om att testa persona- eller rollspelskonsekvens.
Testrapport
Byggde en schema-valid persona.json för profilen som de medföljande testfallen riktar sig mot och bekräftade den med repots egen persona_validator.py, körde sedan tre scenarier två gånger, med och utan färdigheten. Baslinjen utan färdighet producerade en prosa-dom ('c02 känns lite platt'); färdigheten producerade 25 poängsatta bedömningar, ett jämförbart 96.7/100 aggregat, och pekade ut den verkliga orsaken, att scenariots naturliga formulering finns i L0 och L4 bevis men aldrig registrerades i L2.signature_phrases. Den pekaren till ett specifikt JSON-fält är den verkliga vinsten över baslinjen. Svagheten är att samma modell både skriver och betygsätter svaren, så en 70-poängs godkänd gräns diskriminerar knappt. Den kan inte heller köras direkt: personas/ är gitignored, så du måste först generera en profil med /forge-persona, och Steg 0-sökvägarna löses endast från insidan av en forge-skill checkout.
Testad: 2026-08-05 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Kommandon och exempelprompter
/eval-consistencyPoängsätter en personas rollspelsvar på 5 dimensioner och rapporterar ett nummer mellan 0-100
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数