Eval Consistency

Bewertet die Rollenspielantworten einer Persona in 5 Dimensionen und meldet eine Zahl von 0-100

von YIKUAIBANZI · YIKUAIBANZI/forge-skill

Funktioniert mit Setup ★ 8.0/10

Eval Consistency — Bewertet die Rollenspielantworten einer Persona in 5 Dimensionen und meldet eine Zahl von 0-100

Was es kann

Führt eine wiederholbare Rollenspiel-Konsistenzbewertung über ein forge-persona-Profil durch: Es antwortet auf eine feste Reihe von Chat-Szenarien im Charakter und bewertet dann jede Antwort nach Nachrichtenlänge, Signaturphrasen, Interpunktionsmuster und harten Grenzen. Die Ausgabe ist eine Aufschlüsselung pro Szenario, Durchschnittswerte pro Dimension und eine vergleichbare 0-100-Punktzahl, die Sie nach dem Bearbeiten einer Persona erneut ausführen können. Wird ausgelöst bei /eval-consistency oder bei einer Anfrage zum Testen der Persona- oder Rollenspielkonsistenz.

Testbericht

Ein schema-gültiges persona.json für das Profil, das die gebündelten Testfälle ansprechen, erstellt und mit dem eigenen persona_validator.py des Repos bestätigt, dann drei Szenarien zweimal ausgeführt, mit und ohne Skill. Die Baseline ohne Skill lieferte ein Prosa-Urteil ('c02 feels a little flat'); der Skill lieferte 25 bewertete Urteile, ein vergleichbares Aggregat von 96.7/100, und identifizierte die tatsächliche Ursache, dass die natürliche Formulierung des Szenarios in L0- und L4-Beweisen liegt, aber nie in L2.signature_phrases registriert wurde. Dieser Verweis auf ein spezifisches JSON-Feld ist der eigentliche Gewinn gegenüber der Baseline. Die Schwäche ist, dass dasselbe Modell sowohl die Antworten schreibt als auch bewertet, sodass eine 70-Punkte-Bestanden-Grenze kaum diskriminiert. Es kann auch nicht sofort ausgeführt werden: personas/ ist gitignored, daher müssen Sie zuerst ein Profil mit /forge-persona generieren, und die Step 0-Pfade werden nur innerhalb eines forge-skill-Checkouts aufgelöst.

Getestet am: 2026-08-05 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/YIKUAIBANZI/forge-skill.git
mkdir -p ~/.claude/skills
cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases

Befehle & Beispiel-Prompts

  • /eval-consistencyBewertet die Rollenspielantworten einer Persona in 5 Dimensionen und meldet eine Zahl von 0-100

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Run /eval-consistency to score my persona's roleplay replies
  • Test whether my forge persona stays in character across scenarios
  • 跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数