SentencePiece Tokenizer

Referenz-Skill für Training und Nutzung von Googles sprachunabhängigem BPE-/Unigram-Tokenizer.

von Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Getestet · Funktioniert ★ 8.0/10

SentencePiece Tokenizer — Referenz-Skill für Training und Nutzung von Googles sprachunabhängigem BPE-/Unigram-Tokenizer.

Was es kann

Referenzleitfaden für Googles SentencePiece-Tokenizer: sprachunabhängiges Training auf rohem Unicode mit BPE oder Unigram, eingesetzt von T5, ALBERT, XLNet und mBART. Reagiert, wenn mehrsprachige oder CJK-Tokenisierung, reproduzierbare/deterministische Vokabulare oder Training auf Rohtext ohne Vor-Tokenisierung gebraucht werden.

Testbericht

Für ein mehrsprachiges Tokenizer-Setup lieferte bereits allgemeines Wissen nahezu gleichwertigen Code, da die Bibliothek gut dokumentiert ist; der Hauptgewinn war eine Abdeckungstabelle, wobei die zitierten Performance-Zahlen ohne Quellenangabe blieben.

Getestet am: 2026-07-10 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Befehle & Beispiel-Prompts

  • /sentencepieceReferenz-Skill für Training und Nutzung von Googles sprachunabhängigem BPE-/Unigram-Tokenizer.

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses