HuggingFace Tokenizers

Entraîne et exécute des tokenizers rapides en Rust avec BPE, WordPiece ou Unigram.

par Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testé · Fonctionne ★ 7.6/10

HuggingFace Tokenizers — Entraîne et exécute des tokenizers rapides en Rust avec BPE, WordPiece ou Unigram.

Ce que fait

Tokenizers rapides optimisés pour la recherche et la production. L'implémentation en Rust tokenize 1 Go en moins de 20 secondes. Prend en charge les algorithmes BPE, WordPiece et Unigram. Entraînez des vocabulaires personnalisés, suivez les alignements, gérez le padding/troncature. S'intègre parfaitement à transformers. À utiliser pour de la tokenisation haute performance ou l'entraînement de tokenizers personnalisés.

Rapport de test

Testé par une installation verbatim (git clone + copie propre, frontmatter YAML valide, les 4 fichiers de référence présents), puis en entraînant un petit tokenizer BPE sur un corpus inline de 10 lignes selon le schéma du SKILL.md. La comparaison A/B avec un bras de base sans skill a produit des résultats identiques au bit près (taille de vocabulaire 60 ; « the quick fox jumps » tokenisé en ['the','quick','fox','j','u','m','ps']), le skill n'a donc modifié ni la correction ni l'usage de l'API ; il n'a apporté qu'une rigueur marginale par rapport à l'exécution de base (déterminisme vérifié sur 3 exécutions, plus une explication du comportement de fusion). La documentation est exacte, sans prérequis caché bloquant, même si les affirmations de vitesse/benchmark relèvent d'un marketing non vérifié.

Testé le: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers

Commandes et exemples de prompts

  • /huggingface-tokenizersEntraîne et exécute des tokenizers rapides en Rust avec BPE, WordPiece ou Unigram.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Train a custom BPE tokenizer on my corpus
  • Tokenize this dataset quickly with Hugging Face tokenizers
  • Set up padding and truncation for my tokenizer