HuggingFace Tokenizers
Entraîne et exécute des tokenizers rapides en Rust avec BPE, WordPiece ou Unigram.
Testé · Fonctionne
Ce que fait
Tokenizers rapides optimisés pour la recherche et la production. L'implémentation en Rust tokenize 1 Go en moins de 20 secondes. Prend en charge les algorithmes BPE, WordPiece et Unigram. Entraînez des vocabulaires personnalisés, suivez les alignements, gérez le padding/troncature. S'intègre parfaitement à transformers. À utiliser pour de la tokenisation haute performance ou l'entraînement de tokenizers personnalisés.
Rapport de test
Testé par une installation verbatim (git clone + copie propre, frontmatter YAML valide, les 4 fichiers de référence présents), puis en entraînant un petit tokenizer BPE sur un corpus inline de 10 lignes selon le schéma du SKILL.md. La comparaison A/B avec un bras de base sans skill a produit des résultats identiques au bit près (taille de vocabulaire 60 ; « the quick fox jumps » tokenisé en ['the','quick','fox','j','u','m','ps']), le skill n'a donc modifié ni la correction ni l'usage de l'API ; il n'a apporté qu'une rigueur marginale par rapport à l'exécution de base (déterminisme vérifié sur 3 exécutions, plus une explication du comportement de fusion). La documentation est exacte, sans prérequis caché bloquant, même si les affirmations de vitesse/benchmark relèvent d'un marketing non vérifié.
Testé le: 2026-07-12 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers
Commandes et exemples de prompts
/huggingface-tokenizersEntraîne et exécute des tokenizers rapides en Rust avec BPE, WordPiece ou Unigram.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Train a custom BPE tokenizer on my corpusTokenize this dataset quickly with Hugging Face tokenizersSet up padding and truncation for my tokenizer