HuggingFace Tokenizers
Tränar och kör snabba Rust-baserade tokenizers med BPE, WordPiece eller Unigram.
Testad · Fungerar
Vad den gör
Snabba tokenizers optimerade för forskning och produktion. Den Rust-baserade implementationen tokeniserar 1 GB på under 20 sekunder. Stöder algoritmerna BPE, WordPiece och Unigram. Träna anpassade vokabulärer, spåra alignments, hantera padding/truncation. Integreras sömlöst med transformers. Använd när du behöver högpresterande tokenisering eller anpassad tokenizer-träning.
Testrapport
Testades genom att installera ord för ord (ren git clone + kopiering, giltig YAML-frontmatter, alla 4 referensfiler finns) och sedan träna en liten BPE-tokenizer på ett 10-radigt inline-korpus enligt mönstret i SKILL.md. A/B-jämförelse mot en skillfri baslinje gav byte-identiska resultat (vokabulärstorlek 60; 'the quick fox jumps' tokeniserades till ['the','quick','fox','j','u','m','ps']), så skillen ändrade varken korrekthet eller API-användning; den tillförde bara marginell noggrannhet utöver baskörningen (determinism verifierad över 3 körningar plus en förklaring av sammanslagningsbeteendet). Dokumentationen är korrekt utan blockerande dolda krav, även om påståenden om hastighet/benchmark är overifierad marknadsföring.
Testad: 2026-07-12 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers
Kommandon och exempelprompter
/huggingface-tokenizersTränar och kör snabba Rust-baserade tokenizers med BPE, WordPiece eller Unigram.
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Train a custom BPE tokenizer on my corpusTokenize this dataset quickly with Hugging Face tokenizersSet up padding and truncation for my tokenizer