Eval Consistency
Valuta le risposte di roleplay di una persona su 5 dimensioni e riporta un numero da 0 a 100
Richiede configurazione
Cosa fa
Esegue una valutazione ripetibile della coerenza del roleplay su un profilo forge-persona: risponde a un set fisso di scenari di chat "in character", quindi valuta ogni risposta in base alla lunghezza del messaggio, alle frasi distintive, alla punteggiatura, al modello di interazione e ai limiti rigidi. L'output è una ripartizione per scenario, medie per dimensione e un punteggio comparabile da 0 a 100 che puoi rieseguire dopo aver modificato una persona. Si attiva su /eval-consistency o su una richiesta di testare la coerenza della persona o del roleplay.
Rapporto di test
Costruito un persona.json valido per lo schema del profilo target dei casi di test inclusi e confermato con il persona_validator.py del repo, quindi eseguiti tre scenari due volte, con e senza la skill. La baseline senza skill ha prodotto un verdetto in prosa ('c02 feels a little flat'); la skill ha prodotto 25 giudizi con punteggio, un aggregato comparabile di 96.7/100, e ha individuato la causa reale, ovvero che la fraseologia naturale dello scenario si trova nelle evidenze L0 e L4 ma non è mai stata registrata in L2.signature_phrases. Quel puntatore a un campo JSON specifico è il vero guadagno rispetto alla baseline. La debolezza è che lo stesso modello scrive e valuta le risposte, quindi una soglia di superamento di 70 punti discrimina a malapena. Inoltre, non può essere eseguito "out of the box": personas/ è gitignored, quindi devi prima generare un profilo con /forge-persona, e i percorsi del Passaggio 0 si risolvono solo dall'interno di un checkout forge-skill.
Testato il: 2026-08-05 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Comandi e prompt di esempio
/eval-consistencyValuta le risposte di roleplay di una persona su 5 dimensioni e riporta un numero da 0 a 100
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数