SentencePiece Tokenizer
Skill de référence pour entraîner/utiliser le tokeniseur BPE/Unigram indépendant de la langue de Google.
Testé · Fonctionne
Ce que fait
Guide de référence pour le tokeniseur SentencePiece de Google : entraînement sur Unicode brut, indépendant de la langue, avec BPE ou Unigram, utilisé par T5, ALBERT, XLNet et mBART. Se déclenche quand l'utilisateur a besoin de tokenisation multilingue ou CJK, de vocabulaires reproductibles/déterministes, ou d'entraînement sur texte brut sans pré-tokenisation.
Rapport de test
Pour une configuration de tokeniseur multilingue, la connaissance générale a déjà produit un code quasi équivalent car la bibliothèque est bien documentée ; le gain principal a été un tableau de couverture, bien que ses chiffres de performance cités soient sans source.
Testé le: 2026-07-10 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece
Commandes et exemples de prompts
/sentencepieceSkill de référence pour entraîner/utiliser le tokeniseur BPE/Unigram indépendant de la langue de Google.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Train a SentencePiece tokenizer on raw multilingual textSet up Unigram tokenization for CJK text without pre-tokenizationBuild a deterministic BPE vocabulary like the one T5 uses