HuggingFace Tokenizers

Traint en draait snelle Rust-gebaseerde tokenizers met BPE, WordPiece of Unigram.

Door Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Getest · Werkt ★ 7.6/10

HuggingFace Tokenizers — Traint en draait snelle Rust-gebaseerde tokenizers met BPE, WordPiece of Unigram.

Wat het doet

Snelle tokenizers, geoptimaliseerd voor onderzoek en productie. De Rust-gebaseerde implementatie tokenizet 1GB in <20 seconden. Ondersteunt BPE-, WordPiece- en Unigram-algoritmes. Train eigen vocabulaires, volg alignments, verwerk padding/truncation. Integreert naadloos met transformers. Gebruik dit wanneer je high-performance tokenisatie of training van een eigen tokenizer nodig hebt.

Testrapport

Getest door letterlijke installatie (schone git-clone + copy, geldige YAML-frontmatter, alle 4 referentiebestanden aanwezig), gevolgd door het trainen van een kleine BPE-tokenizer op een inline corpus van 10 regels volgens het patroon uit SKILL.md. Een A/B-vergelijking met een no-skill-basisvariant leverde byte-identieke resultaten op (vocab-grootte 60; 'the quick fox jumps' getokeniseerd tot ['the','quick','fox','j','u','m','ps']), dus de skill veranderde niets aan de correctheid of het API-gebruik; hij voegde slechts marginale extra zorgvuldigheid toe ten opzichte van de basisrun (determinisme geverifieerd over 3 runs, plus een uitleg van het merge-gedrag). De documentatie klopt en bevat geen blokkerende verborgen vereisten, al zijn de snelheids-/benchmarkclaims onbevestigde marketing.

Getest op: 2026-07-12 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers

Commando's en voorbeeldprompts

  • /huggingface-tokenizersTraint en draait snelle Rust-gebaseerde tokenizers met BPE, WordPiece of Unigram.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Train a custom BPE tokenizer on my corpus
  • Tokenize this dataset quickly with Hugging Face tokenizers
  • Set up padding and truncation for my tokenizer