SentencePiece Tokenizer
Referensskill för att träna/använda Googles språkoberoende BPE/Unigram-tokeniserare.
Testad · Fungerar
Vad den gör
Referensguide för Googles SentencePiece-tokeniserare: rå-Unicode, språkoberoende träning med BPE eller Unigram, används av T5, ALBERT, XLNet och mBART. Aktiveras när användaren behöver flerspråkig eller CJK-tokenisering, reproducerbara/deterministiska vokabulärer, eller träning på rå text utan förtokenisering.
Testrapport
För en flerspråkig tokeniserar-uppsättning gav redan allmän kunskap nästan likvärdig kod eftersom biblioteket är väldokumenterat; den huvudsakliga vinsten var en täckningstabell, även om de citerade prestandasiffrorna saknade källa.
Testad: 2026-07-10 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Kommandon och exempelprompter
/sentencepieceReferensskill för att träna/använda Googles språkoberoende BPE/Unigram-tokeniserare.
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses