HuggingFace Tokenizers
Traint en draait snelle Rust-gebaseerde tokenizers met BPE, WordPiece of Unigram.
Getest · Werkt
Wat het doet
Snelle tokenizers, geoptimaliseerd voor onderzoek en productie. De Rust-gebaseerde implementatie tokenizet 1GB in <20 seconden. Ondersteunt BPE-, WordPiece- en Unigram-algoritmes. Train eigen vocabulaires, volg alignments, verwerk padding/truncation. Integreert naadloos met transformers. Gebruik dit wanneer je high-performance tokenisatie of training van een eigen tokenizer nodig hebt.
Testrapport
Getest door letterlijke installatie (schone git-clone + copy, geldige YAML-frontmatter, alle 4 referentiebestanden aanwezig), gevolgd door het trainen van een kleine BPE-tokenizer op een inline corpus van 10 regels volgens het patroon uit SKILL.md. Een A/B-vergelijking met een no-skill-basisvariant leverde byte-identieke resultaten op (vocab-grootte 60; 'the quick fox jumps' getokeniseerd tot ['the','quick','fox','j','u','m','ps']), dus de skill veranderde niets aan de correctheid of het API-gebruik; hij voegde slechts marginale extra zorgvuldigheid toe ten opzichte van de basisrun (determinisme geverifieerd over 3 runs, plus een uitleg van het merge-gedrag). De documentatie klopt en bevat geen blokkerende verborgen vereisten, al zijn de snelheids-/benchmarkclaims onbevestigde marketing.
Getest op: 2026-07-12 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers
Commando's en voorbeeldprompts
/huggingface-tokenizersTraint en draait snelle Rust-gebaseerde tokenizers met BPE, WordPiece of Unigram.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Train a custom BPE tokenizer on my corpusTokenize this dataset quickly with Hugging Face tokenizersSet up padding and truncation for my tokenizer