SentencePiece Tokenizer
Skill referencyjny do trenowania/używania niezależnego językowo tokenizatora BPE/Unigram od Google.
Testowano · Działa
Co robi ten skill
Przewodnik referencyjny do tokenizatora SentencePiece od Google: trening na surowym Unicode, niezależny od języka, z BPE albo Unigram, używany przez T5, ALBERT, XLNet i mBART. Uruchamia się, gdy użytkownik potrzebuje tokenizacji wielojęzycznej albo CJK, odtwarzalnych/deterministycznych słowników, albo treningu na surowym tekście bez wstępnej tokenizacji.
Raport z testu
Przy konfiguracji tokenizatora wielojęzycznego ogólna wiedza dała już niemal równoważny kod, bo biblioteka jest dobrze udokumentowana; głównym zyskiem była tabela pokrycia, choć cytowane liczby wydajności były bez źródła.
Testowano: 2026-07-10 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Komendy i przykładowe prompty
/sentencepieceSkill referencyjny do trenowania/używania niezależnego językowo tokenizatora BPE/Unigram od Google.
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses