Eval Consistency

Ocenia odpowiedzi odgrywane przez personę w 5 wymiarach i raportuje wynik 0-100

Autor: YIKUAIBANZI · YIKUAIBANZI/forge-skill

Działa po konfiguracji ★ 8.0/10

Eval Consistency — Ocenia odpowiedzi odgrywane przez personę w 5 wymiarach i raportuje wynik 0-100

Co robi ten skill

Przeprowadza powtarzalną ocenę spójności odgrywania ról dla profilu forge-persona: odpowiada na stały zestaw scenariuszy czatu w charakterze, a następnie ocenia każdą odpowiedź pod kątem długości wiadomości, charakterystycznych zwrotów, interpunkcji, wzorca interakcji i twardych granic. Wynikiem jest podział na scenariusze, średnie dla każdego wymiaru i jeden porównywalny wynik 0-100, który można ponownie uruchomić po edycji persony. Uruchamia się na /eval-consistency lub na prośbę o przetestowanie spójności persony lub odgrywania ról.

Raport z testu

Zbudowano schematycznie poprawny persona.json dla profilu, który jest celem dołączonych przypadków testowych i potwierdzono go za pomocą własnego persona_validator.py repozytorium, a następnie uruchomiono trzy scenariusze dwukrotnie, z umiejętnością i bez. Podstawowy test bez umiejętności wydał werdykt prozą ('c02 feels a little flat'); umiejętność wygenerowała 25 ocenionych osądów, porównywalny wynik łączny 96.7/100 i wskazała rzeczywistą przyczynę, że naturalne sformułowanie scenariusza znajduje się w dowodach L0 i L4, ale nigdy nie zostało zarejestrowane w L2.signature_phrases. Ten wskaźnik na konkretne pole JSON jest prawdziwym zyskiem w porównaniu do podstawowego testu. Słabością jest to, że ten sam model zarówno pisze, jak i ocenia odpowiedzi, więc próg zaliczenia 70 punktów ledwo różnicuje. Nie może również działać od razu po wyjęciu z pudełka: personas/ jest ignorowane przez git, więc najpierw musisz wygenerować profil za pomocą /forge-persona, a ścieżki kroku 0 rozwiązują się tylko z wnętrza wyciągnięcia forge-skill.

Testowano: 2026-08-05 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/YIKUAIBANZI/forge-skill.git
mkdir -p ~/.claude/skills
cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases

Komendy i przykładowe prompty

  • /eval-consistencyOcenia odpowiedzi odgrywane przez personę w 5 wymiarach i raportuje wynik 0-100

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Run /eval-consistency to score my persona's roleplay replies
  • Test whether my forge persona stays in character across scenarios
  • 跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数