SentencePiece Tokenizer

Skill de referencia para entrenar y usar el tokenizador BPE/Unigram independiente del idioma de Google.

Por Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Probado · Funciona ★ 8.0/10

SentencePiece Tokenizer — Skill de referencia para entrenar y usar el tokenizador BPE/Unigram independiente del idioma de Google.

Qué hace

Guía de referencia para el tokenizador SentencePiece de Google: entrenamiento en Unicode en bruto, independiente del idioma, con BPE o Unigram, usado por T5, ALBERT, XLNet y mBART. Se activa cuando el usuario necesita tokenización multilingüe o CJK, vocabularios reproducibles/deterministas, o entrenamiento sobre texto en bruto sin pre-tokenización.

Informe de la prueba

Para una configuración de tokenizador multilingüe, el conocimiento general ya producía código casi equivalente porque la librería está bien documentada; la ganancia principal fue una tabla de cobertura, aunque las cifras de rendimiento citadas no tenían fuente.

Probado el: 2026-07-10 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Comandos y prompts de ejemplo

  • /sentencepieceSkill de referencia para entrenar y usar el tokenizador BPE/Unigram independiente del idioma de Google.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses