SentencePiece Tokenizer

Referenční skill pro trénování a používání jazykově nezávislého BPE/Unigram tokenizeru od Googlu.

od Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Otestováno · Funguje ★ 8.0/10

SentencePiece Tokenizer — Referenční skill pro trénování a používání jazykově nezávislého BPE/Unigram tokenizeru od Googlu.

Co umí

Referenční příručka pro Google tokenizer SentencePiece: jazykově nezávislé trénování přímo na surovém Unicode pomocí BPE nebo Unigram, používané T5, ALBERT, XLNet a mBART. Spouští se, když uživatel potřebuje vícejazyčnou nebo CJK tokenizaci, reprodukovatelné/deterministické slovníky, nebo trénování na surovém textu bez předběžné tokenizace.

Testovací report

Pro nastavení vícejazyčného tokenizeru obecné znalosti už daly téměř rovnocenný kód, protože knihovna je dobře zdokumentovaná; hlavní přínos byla přehledová tabulka, i když jím citovaná čísla výkonu neměla uvedený zdroj.

Testováno: 2026-07-10 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Příkazy a ukázkové prompty

  • /sentencepieceReferenční skill pro trénování a používání jazykově nezávislého BPE/Unigram tokenizeru od Googlu.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses