SentencePiece Tokenizer
Skill di riferimento per addestrare/usare il tokenizer BPE/Unigram indipendente dalla lingua di Google.
Promosso
Cosa fa
Guida di riferimento per il tokenizer SentencePiece di Google: addestramento su Unicode grezzo, indipendente dalla lingua, con BPE o Unigram, usato da T5, ALBERT, XLNet e mBART. Si attiva quando l'utente ha bisogno di tokenizzazione multilingue o CJK, vocabolari riproducibili/deterministici, o addestramento su testo grezzo senza pre-tokenizzazione.
Rapporto di test
Per una configurazione di tokenizer multilingue, la conoscenza generale ha già prodotto codice quasi equivalente, poiché la libreria è ben documentata; il vantaggio principale è stata una tabella di copertura, anche se i numeri di performance citati non avevano fonte.
Testato il: 2026-07-10 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Comandi e prompt di esempio
/sentencepieceSkill di riferimento per addestrare/usare il tokenizer BPE/Unigram indipendente dalla lingua di Google.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses