Eval Consistency
Bewertet die Rollenspielantworten einer Persona in 5 Dimensionen und meldet eine Zahl von 0-100
Funktioniert mit Setup
Was es kann
Führt eine wiederholbare Rollenspiel-Konsistenzbewertung über ein forge-persona-Profil durch: Es antwortet auf eine feste Reihe von Chat-Szenarien im Charakter und bewertet dann jede Antwort nach Nachrichtenlänge, Signaturphrasen, Interpunktionsmuster und harten Grenzen. Die Ausgabe ist eine Aufschlüsselung pro Szenario, Durchschnittswerte pro Dimension und eine vergleichbare 0-100-Punktzahl, die Sie nach dem Bearbeiten einer Persona erneut ausführen können. Wird ausgelöst bei /eval-consistency oder bei einer Anfrage zum Testen der Persona- oder Rollenspielkonsistenz.
Testbericht
Ein schema-gültiges persona.json für das Profil, das die gebündelten Testfälle ansprechen, erstellt und mit dem eigenen persona_validator.py des Repos bestätigt, dann drei Szenarien zweimal ausgeführt, mit und ohne Skill. Die Baseline ohne Skill lieferte ein Prosa-Urteil ('c02 feels a little flat'); der Skill lieferte 25 bewertete Urteile, ein vergleichbares Aggregat von 96.7/100, und identifizierte die tatsächliche Ursache, dass die natürliche Formulierung des Szenarios in L0- und L4-Beweisen liegt, aber nie in L2.signature_phrases registriert wurde. Dieser Verweis auf ein spezifisches JSON-Feld ist der eigentliche Gewinn gegenüber der Baseline. Die Schwäche ist, dass dasselbe Modell sowohl die Antworten schreibt als auch bewertet, sodass eine 70-Punkte-Bestanden-Grenze kaum diskriminiert. Es kann auch nicht sofort ausgeführt werden: personas/ ist gitignored, daher müssen Sie zuerst ein Profil mit /forge-persona generieren, und die Step 0-Pfade werden nur innerhalb eines forge-skill-Checkouts aufgelöst.
Getestet am: 2026-08-05 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Befehle & Beispiel-Prompts
/eval-consistencyBewertet die Rollenspielantworten einer Persona in 5 Dimensionen und meldet eine Zahl von 0-100
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数