HuggingFace Tokenizers

Trenuje i uruchamia szybkie tokenizery oparte na Ruście, z BPE, WordPiece albo Unigram.

Autor: Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testowano · Działa ★ 7.6/10

HuggingFace Tokenizers — Trenuje i uruchamia szybkie tokenizery oparte na Ruście, z BPE, WordPiece albo Unigram.

Co robi ten skill

Szybkie tokenizery zoptymalizowane pod badania i produkcję. Implementacja oparta na Ruście tokenizuje 1GB w mniej niż 20 sekund. Obsługuje algorytmy BPE, WordPiece i Unigram. Trenuje własne słowniki, śledzi wyrównania (alignments), obsługuje padding/truncation. Integruje się bezproblemowo z transformers. Używaj, gdy potrzebujesz wysokowydajnej tokenizacji albo trenowania własnego tokenizera.

Raport z testu

Przetestowano przez instalację dosłowną (czysty git-clone + kopiowanie, poprawny YAML frontmatter, wszystkie 4 pliki referencyjne obecne), a następnie trening małego tokenizera BPE na 10-liniowym korpusie inline według wzorca z SKILL.md. Porównanie A/B z wariantem bez skilla dało identyczne co do bajta wyniki (rozmiar słownika 60; 'the quick fox jumps' stokenizowane do ['the','quick','fox','j','u','m','ps']), więc skill nie zmienił poprawności ani sposobu użycia API; dodał jedynie marginalną skrupulatność względem wariantu bazowego (zweryfikowany determinizm w 3 przebiegach oraz wyjaśnienie zachowania scalania). Dokumentacja jest zgodna z prawdą, bez blokujących ukrytych wymagań, choć twierdzenia o szybkości/benchmarkach są niezweryfikowanym marketingiem.

Testowano: 2026-07-12 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers

Komendy i przykładowe prompty

  • /huggingface-tokenizersTrenuje i uruchamia szybkie tokenizery oparte na Ruście, z BPE, WordPiece albo Unigram.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Train a custom BPE tokenizer on my corpus
  • Tokenize this dataset quickly with Hugging Face tokenizers
  • Set up padding and truncation for my tokenizer