Eval Consistency

Hodnotí odpovědi roleplay persona na 5 dimenzích a hlásí číslo 0-100

od YIKUAIBANZI · YIKUAIBANZI/forge-skill

Funguje s nastavením ★ 8.0/10

Eval Consistency — Hodnotí odpovědi roleplay persona na 5 dimenzích a hlásí číslo 0-100

Co umí

Spouští opakovatelné hodnocení konzistence roleplay přes profil forge-persona: odpovídá na pevně danou sadu chatových scénářů v roli, poté hodnotí každou odpověď na délku zprávy, charakteristické fráze, interpunkci, interakční vzorec a pevné hranice. Výstupem je rozpis pro každý scénář, průměry pro každou dimenzi a jedno srovnatelné skóre 0-100, které můžete znovu spustit po úpravě persony. Spouští se na /eval-consistency nebo na požadavek na testování persony nebo konzistence roleplay.

Testovací report

Vytvořil jsem schéma-validní persona.json pro profil, na který cílí přibalené testovací případy, a potvrdil jsem ho vlastním persona_validator.py repozitáře, poté jsem spustil tři scénáře dvakrát, s dovedností i bez ní. Základní linie bez dovednosti vyprodukovala prozaický verdikt ('c02 feels a little flat'); dovednost vyprodukovala 25 bodovaných posudků, srovnatelný agregát 96.7/100 a přesně určila skutečnou příčinu, že přirozená formulace scénáře žije v důkazech L0 a L4, ale nikdy nebyla zaregistrována v L2.signature_phrases. Tento ukazatel na konkrétní pole JSON je skutečným ziskem oproti základní linii. Slabinou je, že stejný model píše i hodnotí odpovědi, takže 70bodová hranice pro úspěšné splnění sotva rozlišuje. Také se nemůže spustit hned po vybalení: personas/ je gitignored, takže musíte nejprve vygenerovat profil pomocí /forge-persona, a cesty kroku 0 se vyřeší pouze zevnitř checkoutu forge-skill.

Testováno: 2026-08-05 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/YIKUAIBANZI/forge-skill.git
mkdir -p ~/.claude/skills
cd forge-skill && cp -r evals/eval-consistency ~/.claude/skills/eval-consistency && cp -r evals/test_cases ~/.claude/skills/eval-consistency/test_cases

Příkazy a ukázkové prompty

  • /eval-consistencyHodnotí odpovědi roleplay persona na 5 dimenzích a hlásí číslo 0-100

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Run /eval-consistency to score my persona's roleplay replies
  • Test whether my forge persona stays in character across scenarios
  • 跑一下我这个角色扮演人设在这几个对话测试场景下的一致性评测,看看最终能打多少分数