SentencePiece Tokenizer
Referenceskill til træning/brug af Googles sprog-uafhængige BPE/Unigram-tokenizer.
Testet · Virker
Hvad det gør
Referenceguide til Googles SentencePiece-tokenizer: rå-Unicode, sprog-uafhængig træning med BPE eller Unigram, brugt af T5, ALBERT, XLNet og mBART. Trigges når brugeren skal bruge flersproget eller CJK-tokenisering, reproducerbare/deterministiske vokabularer, eller træning på rå tekst uden for-tokenisering.
Testrapport
Ved opsætning af en flersproget tokenizer var generel viden allerede tæt på et tilsvarende resultat, fordi biblioteket er velbeskrevet; hovedgevinsten var en dækningstabel, selvom de citerede performance-tal var udokumenterede.
Testet: 2026-07-10 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Kommandoer og eksempelprompter
/sentencepieceReferenceskill til træning/brug af Googles sprog-uafhængige BPE/Unigram-tokenizer.
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses