SentencePiece Tokenizer
Skill de referencia para entrenar y usar el tokenizador BPE/Unigram independiente del idioma de Google.
Probado · Funciona
Qué hace
Guía de referencia para el tokenizador SentencePiece de Google: entrenamiento en Unicode en bruto, independiente del idioma, con BPE o Unigram, usado por T5, ALBERT, XLNet y mBART. Se activa cuando el usuario necesita tokenización multilingüe o CJK, vocabularios reproducibles/deterministas, o entrenamiento sobre texto en bruto sin pre-tokenización.
Informe de la prueba
Para una configuración de tokenizador multilingüe, el conocimiento general ya producía código casi equivalente porque la librería está bien documentada; la ganancia principal fue una tabla de cobertura, aunque las cifras de rendimiento citadas no tenían fuente.
Probado el: 2026-07-10 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Comandos y prompts de ejemplo
/sentencepieceSkill de referencia para entrenar y usar el tokenizador BPE/Unigram independiente del idioma de Google.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses