SentencePiece Tokenizer

Referenceskill til træning/brug af Googles sprog-uafhængige BPE/Unigram-tokenizer.

Af Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testet · Virker ★ 8.0/10

SentencePiece Tokenizer — Referenceskill til træning/brug af Googles sprog-uafhængige BPE/Unigram-tokenizer.

Hvad det gør

Referenceguide til Googles SentencePiece-tokenizer: rå-Unicode, sprog-uafhængig træning med BPE eller Unigram, brugt af T5, ALBERT, XLNet og mBART. Trigges når brugeren skal bruge flersproget eller CJK-tokenisering, reproducerbare/deterministiske vokabularer, eller træning på rå tekst uden for-tokenisering.

Testrapport

Ved opsætning af en flersproget tokenizer var generel viden allerede tæt på et tilsvarende resultat, fordi biblioteket er velbeskrevet; hovedgevinsten var en dækningstabel, selvom de citerede performance-tal var udokumenterede.

Testet: 2026-07-10 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Kommandoer og eksempelprompter

  • /sentencepieceReferenceskill til træning/brug af Googles sprog-uafhængige BPE/Unigram-tokenizer.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses