SentencePiece Tokenizer
Referanseskill for å trene/bruke Googles språkuavhengige BPE-/Unigram-tokenisator.
Bestått
Hva den gjør
Referanseguide for Googles SentencePiece-tokenisator: rå-Unicode, språkuavhengig trening med BPE eller Unigram, brukt av T5, ALBERT, XLNet og mBART. Utløses når brukeren trenger flerspråklig eller CJK-tokenisering, reproduserbare/deterministiske vokabularer, eller trening på rå tekst uten forhåndstokenisering.
Testrapport
For et flerspråklig tokenisator-oppsett fikk generell kunnskap allerede nesten tilsvarende kode siden biblioteket er godt dokumentert; hovedgevinsten var en dekningstabell, selv om de siterte ytelsestallene manglet kilde.
Testet på: 2026-07-10 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Kommandoer og eksempelprompter
/sentencepieceReferanseskill for å trene/bruke Googles språkuavhengige BPE-/Unigram-tokenisator.
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses