SentencePiece Tokenizer

Referanseskill for å trene/bruke Googles språkuavhengige BPE-/Unigram-tokenisator.

av Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Bestått ★ 8.0/10

SentencePiece Tokenizer — Referanseskill for å trene/bruke Googles språkuavhengige BPE-/Unigram-tokenisator.

Hva den gjør

Referanseguide for Googles SentencePiece-tokenisator: rå-Unicode, språkuavhengig trening med BPE eller Unigram, brukt av T5, ALBERT, XLNet og mBART. Utløses når brukeren trenger flerspråklig eller CJK-tokenisering, reproduserbare/deterministiske vokabularer, eller trening på rå tekst uten forhåndstokenisering.

Testrapport

For et flerspråklig tokenisator-oppsett fikk generell kunnskap allerede nesten tilsvarende kode siden biblioteket er godt dokumentert; hovedgevinsten var en dekningstabell, selv om de siterte ytelsestallene manglet kilde.

Testet på: 2026-07-10 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Kommandoer og eksempelprompter

  • /sentencepieceReferanseskill for å trene/bruke Googles språkuavhengige BPE-/Unigram-tokenisator.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses