SentencePiece Tokenizer

Skill di riferimento per addestrare/usare il tokenizer BPE/Unigram indipendente dalla lingua di Google.

di Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Promosso ★ 8.0/10

SentencePiece Tokenizer — Skill di riferimento per addestrare/usare il tokenizer BPE/Unigram indipendente dalla lingua di Google.

Cosa fa

Guida di riferimento per il tokenizer SentencePiece di Google: addestramento su Unicode grezzo, indipendente dalla lingua, con BPE o Unigram, usato da T5, ALBERT, XLNet e mBART. Si attiva quando l'utente ha bisogno di tokenizzazione multilingue o CJK, vocabolari riproducibili/deterministici, o addestramento su testo grezzo senza pre-tokenizzazione.

Rapporto di test

Per una configurazione di tokenizer multilingue, la conoscenza generale ha già prodotto codice quasi equivalente, poiché la libreria è ben documentata; il vantaggio principale è stata una tabella di copertura, anche se i numeri di performance citati non avevano fonte.

Testato il: 2026-07-10 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Comandi e prompt di esempio

  • /sentencepieceSkill di riferimento per addestrare/usare il tokenizer BPE/Unigram indipendente dalla lingua di Google.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses