Eval Consistency

Poängsätter en personas rollspelsvar på 5 dimensioner och rapporterar ett nummer mellan 0-100

av YIKUAIBANZI · YIKUAIBANZI/forge-skill

Fungerar med konfiguration ★ 8.0/10

Eval Consistency — Poängsätter en personas rollspelsvar på 5 dimensioner och rapporterar ett nummer mellan 0-100

Vad den gör

Kör en repeterbar rollspelskonsekvensutvärdering över en forge-persona-profil: den svarar på en fast uppsättning chattscenarier i karaktär, betygsätter sedan varje svar utifrån meddelandelängd, signaturfraser, interpunktion, interaktionsmönster och hårda gränser. Utdata är en uppdelning per scenario, genomsnitt per dimension och en jämförbar 0-100-poäng som du kan köra om efter att ha redigerat en persona. Utlöses av /eval-consistency eller en förfrågan om att testa persona- eller rollspelskonsekvens.

Testrapport

Byggde en schema-valid persona.json för profilen som de medföljande testfallen riktar sig mot och bekräftade den med repots egen persona_validator.py, körde sedan tre scenarier två gånger, med och utan färdigheten. Baslinjen utan färdighet producerade en prosa-dom ('c02 känns lite platt'); färdigheten producerade 25 poängsatta bedömningar, ett jämförbart 96.7/100 aggregat, och pekade ut den verkliga orsaken, att scenariots naturliga formulering finns i L0 och L4 bevis men aldrig registrerades i L2.signature_phrases. Den pekaren till ett specifikt JSON-fält är den verkliga vinsten över baslinjen. Svagheten är att samma modell både skriver och betygsätter svaren, så en 70-poängs godkänd gräns diskriminerar knappt. Den kan inte heller köras direkt: personas/ är gitignored, så du måste först generera en profil med /forge-persona, och Steg 0-sökvägarna löses endast från insidan av en forge-skill checkout.

Testad: 2026-08-05 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/YIKUAIBANZI/forge-skill.git
mkdir -p ~/.claude/skills
cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases

Kommandon och exempelprompter

  • /eval-consistencyPoängsätter en personas rollspelsvar på 5 dimensioner och rapporterar ett nummer mellan 0-100

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Run /eval-consistency to score my persona's roleplay replies
  • Test whether my forge persona stays in character across scenarios
  • 跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数