SentencePiece Tokenizer
Referenční skill pro trénování a používání jazykově nezávislého BPE/Unigram tokenizeru od Googlu.
Otestováno · Funguje
Co umí
Referenční příručka pro Google tokenizer SentencePiece: jazykově nezávislé trénování přímo na surovém Unicode pomocí BPE nebo Unigram, používané T5, ALBERT, XLNet a mBART. Spouští se, když uživatel potřebuje vícejazyčnou nebo CJK tokenizaci, reprodukovatelné/deterministické slovníky, nebo trénování na surovém textu bez předběžné tokenizace.
Testovací report
Pro nastavení vícejazyčného tokenizeru obecné znalosti už daly téměř rovnocenný kód, protože knihovna je dobře zdokumentovaná; hlavní přínos byla přehledová tabulka, i když jím citovaná čísla výkonu neměla uvedený zdroj.
Testováno: 2026-07-10 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Příkazy a ukázkové prompty
/sentencepieceReferenční skill pro trénování a používání jazykově nezávislého BPE/Unigram tokenizeru od Googlu.
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses