SentencePiece Tokenizer
Naslagskill voor het trainen en gebruiken van Google's taalonafhankelijke BPE/Unigram-tokenizer.
Getest · Werkt
Wat het doet
Naslaggids voor Google's SentencePiece-tokenizer: taalonafhankelijke training op ruwe Unicode met BPE of Unigram, gebruikt door T5, ALBERT, XLNet en mBART. Gaat aan wanneer iemand meertalige of CJK-tokenisatie nodig heeft, reproduceerbare/deterministische vocabulaires, of training op ruwe tekst zonder voortokenisatie.
Testrapport
Voor een meertalige tokenizer-setup kwam algemene kennis al dicht bij equivalente code, omdat de library goed gedocumenteerd is; de belangrijkste winst was een dekkingstabel, al waren de geciteerde prestatiecijfers niet onderbouwd met bronnen.
Getest op: 2026-07-10 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Commando's en voorbeeldprompts
/sentencepieceNaslagskill voor het trainen en gebruiken van Google's taalonafhankelijke BPE/Unigram-tokenizer.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses