SentencePiece Tokenizer

Referensskill för att träna/använda Googles språkoberoende BPE/Unigram-tokeniserare.

av Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testad · Fungerar ★ 8.0/10

SentencePiece Tokenizer — Referensskill för att träna/använda Googles språkoberoende BPE/Unigram-tokeniserare.

Vad den gör

Referensguide för Googles SentencePiece-tokeniserare: rå-Unicode, språkoberoende träning med BPE eller Unigram, används av T5, ALBERT, XLNet och mBART. Aktiveras när användaren behöver flerspråkig eller CJK-tokenisering, reproducerbara/deterministiska vokabulärer, eller träning på rå text utan förtokenisering.

Testrapport

För en flerspråkig tokeniserar-uppsättning gav redan allmän kunskap nästan likvärdig kod eftersom biblioteket är väldokumenterat; den huvudsakliga vinsten var en täckningstabell, även om de citerade prestandasiffrorna saknade källa.

Testad: 2026-07-10 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Kommandon och exempelprompter

  • /sentencepieceReferensskill för att träna/använda Googles språkoberoende BPE/Unigram-tokeniserare.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses