Eval Consistency
Ocenia odpowiedzi odgrywane przez personę w 5 wymiarach i raportuje wynik 0-100
Działa po konfiguracji
Co robi ten skill
Przeprowadza powtarzalną ocenę spójności odgrywania ról dla profilu forge-persona: odpowiada na stały zestaw scenariuszy czatu w charakterze, a następnie ocenia każdą odpowiedź pod kątem długości wiadomości, charakterystycznych zwrotów, interpunkcji, wzorca interakcji i twardych granic. Wynikiem jest podział na scenariusze, średnie dla każdego wymiaru i jeden porównywalny wynik 0-100, który można ponownie uruchomić po edycji persony. Uruchamia się na /eval-consistency lub na prośbę o przetestowanie spójności persony lub odgrywania ról.
Raport z testu
Zbudowano schematycznie poprawny persona.json dla profilu, który jest celem dołączonych przypadków testowych i potwierdzono go za pomocą własnego persona_validator.py repozytorium, a następnie uruchomiono trzy scenariusze dwukrotnie, z umiejętnością i bez. Podstawowy test bez umiejętności wydał werdykt prozą ('c02 feels a little flat'); umiejętność wygenerowała 25 ocenionych osądów, porównywalny wynik łączny 96.7/100 i wskazała rzeczywistą przyczynę, że naturalne sformułowanie scenariusza znajduje się w dowodach L0 i L4, ale nigdy nie zostało zarejestrowane w L2.signature_phrases. Ten wskaźnik na konkretne pole JSON jest prawdziwym zyskiem w porównaniu do podstawowego testu. Słabością jest to, że ten sam model zarówno pisze, jak i ocenia odpowiedzi, więc próg zaliczenia 70 punktów ledwo różnicuje. Nie może również działać od razu po wyjęciu z pudełka: personas/ jest ignorowane przez git, więc najpierw musisz wygenerować profil za pomocą /forge-persona, a ścieżki kroku 0 rozwiązują się tylko z wnętrza wyciągnięcia forge-skill.
Testowano: 2026-08-05 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/YIKUAIBANZI/forge-skill.git mkdir -p ~/.claude/skills cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases
Komendy i przykładowe prompty
/eval-consistencyOcenia odpowiedzi odgrywane przez personę w 5 wymiarach i raportuje wynik 0-100
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Run /eval-consistency to score my persona's roleplay repliesTest whether my forge persona stays in character across scenarios跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数