HuggingFace Tokenizers

Træner og kører hurtige Rust-baserede tokenizers med BPE, WordPiece eller Unigram.

Af Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testet · Virker ★ 7.6/10

HuggingFace Tokenizers — Træner og kører hurtige Rust-baserede tokenizers med BPE, WordPiece eller Unigram.

Hvad det gør

Hurtige tokenizers optimeret til forskning og produktion. Den Rust-baserede implementering tokeniserer 1GB på under 20 sekunder. Understøtter algoritmerne BPE, WordPiece og Unigram. Træn custom ordforråd, spor alignments, håndter padding/truncation. Integreres problemfrit med transformers. Brug det, når du har brug for højtydende tokenisering eller custom tokenizer-træning.

Testrapport

Testet ved installation ordret (ren git-clone + kopiering, gyldig YAML-frontmatter, alle 4 referencefiler til stede) og derefter træning af en lille BPE-tokenizer på et 10-linjers inline-korpus efter mønsteret i SKILL.md. A/B-sammenligning mod en no-skill-basisarm gav byte-identiske resultater (vocab size 60; 'the quick fox jumps' blev tokeniseret til ['the','quick','fox','j','u','m','ps']), så skillet ændrede ikke korrektheden eller API-brugen; det tilføjede kun marginal grundighed i forhold til basiskørslen (determinisme verificeret på tværs af 3 kørsler plus en forklaring af merge-adfærden). Dokumentationen er præcis uden blokerende skjulte krav, selvom påstande om hastighed/benchmarks er uverificeret markedsføring.

Testet: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers

Kommandoer og eksempelprompter

  • /huggingface-tokenizersTræner og kører hurtige Rust-baserede tokenizers med BPE, WordPiece eller Unigram.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Train a custom BPE tokenizer on my corpus
  • Tokenize this dataset quickly with Hugging Face tokenizers
  • Set up padding and truncation for my tokenizer