SentencePiece Tokenizer
Referenz-Skill für Training und Nutzung von Googles sprachunabhängigem BPE-/Unigram-Tokenizer.
Getestet · Funktioniert
Was es kann
Referenzleitfaden für Googles SentencePiece-Tokenizer: sprachunabhängiges Training auf rohem Unicode mit BPE oder Unigram, eingesetzt von T5, ALBERT, XLNet und mBART. Reagiert, wenn mehrsprachige oder CJK-Tokenisierung, reproduzierbare/deterministische Vokabulare oder Training auf Rohtext ohne Vor-Tokenisierung gebraucht werden.
Testbericht
Für ein mehrsprachiges Tokenizer-Setup lieferte bereits allgemeines Wissen nahezu gleichwertigen Code, da die Bibliothek gut dokumentiert ist; der Hauptgewinn war eine Abdeckungstabelle, wobei die zitierten Performance-Zahlen ohne Quellenangabe blieben.
Getestet am: 2026-07-10 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Befehle & Beispiel-Prompts
/sentencepieceReferenz-Skill für Training und Nutzung von Googles sprachunabhängigem BPE-/Unigram-Tokenizer.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses