HuggingFace Tokenizers
Trener og kjører raske Rust-baserte tokenizere med BPE, WordPiece eller Unigram.
Bestått
Hva den gjør
Raske tokenizere optimalisert for forskning og produksjon. Rust-basert implementasjon tokeniserer 1GB på under 20 sekunder. Støtter BPE-, WordPiece- og Unigram-algoritmer. Tren egne vokabularer, spor alignments, håndter padding/truncation. Integreres sømløst med transformers. Bruk når du trenger høyytelses-tokenisering eller egen tokenizer-trening.
Testrapport
Testet ved å installere ordrett (ren git-clone + kopiering, gyldig YAML-frontmatter, alle 4 referansefiler til stede), deretter trening av en liten BPE-tokenizer på et 10-linjers inline-korpus etter mønsteret i SKILL.md. A/B-sammenligning mot en no-skill-basearm ga byteidentiske resultater (vokabularstørrelse 60; «the quick fox jumps» tokenisert til ['the','quick','fox','j','u','m','ps']), så skillet endret verken korrekthet eller API-bruk; det tilførte kun marginal grundighet utover basekjøringen (determinisme verifisert over 3 kjøringer, pluss en forklaring av merge-oppførselen). Dokumentasjonen er korrekt uten blokkerende skjulte krav, selv om hastighets-/benchmark-påstandene er uverifisert markedsføring.
Testet på: 2026-07-12 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers
Kommandoer og eksempelprompter
/huggingface-tokenizersTrener og kjører raske Rust-baserte tokenizere med BPE, WordPiece eller Unigram.
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Train a custom BPE tokenizer on my corpusTokenize this dataset quickly with Hugging Face tokenizersSet up padding and truncation for my tokenizer