SentencePiece Tokenizer

Naslagskill voor het trainen en gebruiken van Google's taalonafhankelijke BPE/Unigram-tokenizer.

Door Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Getest · Werkt ★ 8.0/10

SentencePiece Tokenizer — Naslagskill voor het trainen en gebruiken van Google's taalonafhankelijke BPE/Unigram-tokenizer.

Wat het doet

Naslaggids voor Google's SentencePiece-tokenizer: taalonafhankelijke training op ruwe Unicode met BPE of Unigram, gebruikt door T5, ALBERT, XLNet en mBART. Gaat aan wanneer iemand meertalige of CJK-tokenisatie nodig heeft, reproduceerbare/deterministische vocabulaires, of training op ruwe tekst zonder voortokenisatie.

Testrapport

Voor een meertalige tokenizer-setup kwam algemene kennis al dicht bij equivalente code, omdat de library goed gedocumenteerd is; de belangrijkste winst was een dekkingstabel, al waren de geciteerde prestatiecijfers niet onderbouwd met bronnen.

Getest op: 2026-07-10 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Commando's en voorbeeldprompts

  • /sentencepieceNaslagskill voor het trainen en gebruiken van Google's taalonafhankelijke BPE/Unigram-tokenizer.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses