SentencePiece Tokenizer

Skill referencyjny do trenowania/używania niezależnego językowo tokenizatora BPE/Unigram od Google.

Autor: Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testowano · Działa ★ 8.0/10

SentencePiece Tokenizer — Skill referencyjny do trenowania/używania niezależnego językowo tokenizatora BPE/Unigram od Google.

Co robi ten skill

Przewodnik referencyjny do tokenizatora SentencePiece od Google: trening na surowym Unicode, niezależny od języka, z BPE albo Unigram, używany przez T5, ALBERT, XLNet i mBART. Uruchamia się, gdy użytkownik potrzebuje tokenizacji wielojęzycznej albo CJK, odtwarzalnych/deterministycznych słowników, albo treningu na surowym tekście bez wstępnej tokenizacji.

Raport z testu

Przy konfiguracji tokenizatora wielojęzycznego ogólna wiedza dała już niemal równoważny kod, bo biblioteka jest dobrze udokumentowana; głównym zyskiem była tabela pokrycia, choć cytowane liczby wydajności były bez źródła.

Testowano: 2026-07-10 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Komendy i przykładowe prompty

  • /sentencepieceSkill referencyjny do trenowania/używania niezależnego językowo tokenizatora BPE/Unigram od Google.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses