Eval Consistency
Califica las respuestas de roleplay de una persona en 5 dimensiones e informa un número de 0-100
Funciona con configuración
Qué hace
Ejecuta una evaluación repetible de consistencia de roleplay sobre un perfil forge-persona: responde a un conjunto fijo de escenarios de chat de forma coherente con el personaje, luego califica cada respuesta en longitud del mensaje, frases distintivas, puntuación, patrón de interacción y límites estrictos. La salida es un desglose por escenario, promedios por dimensión y una puntuación comparable de 0-100 que puedes volver a ejecutar después de editar una persona. Se activa con /eval-consistency o con una solicitud para probar la consistencia de una persona o roleplay.
Informe de la prueba
Construyó un persona.json válido para el esquema del perfil al que apuntan los casos de prueba incluidos y lo confirmó con el propio persona_validator.py del repositorio, luego ejecutó tres escenarios dos veces, con y sin la habilidad. La línea base sin habilidad produjo un veredicto en prosa ('c02 feels a little flat'); la habilidad produjo 25 juicios puntuados, un agregado comparable de 96.7/100, y señaló la causa real, que el fraseo natural del escenario reside en la evidencia L0 y L4 pero nunca se registró en L2.signature_phrases. Ese puntero a un campo JSON específico es la verdadera ganancia sobre la línea base. La debilidad es que el mismo modelo escribe y califica las respuestas, por lo que una barra de aprobación de 70 puntos apenas discrimina. Tampoco puede ejecutarse de inmediato: personas/ está en .gitignore, por lo que primero debes generar un perfil con /forge-persona, y las rutas del Paso 0 solo se resuelven desde dentro de un checkout de forge-skill.
Probado el: 2026-08-05 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Comandos y prompts de ejemplo
/eval-consistencyCalifica las respuestas de roleplay de una persona en 5 dimensiones e informa un número de 0-100
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数