HuggingFace Tokenizers

Trénuje a spouští rychlé tokenizery postavené na Rustu s BPE, WordPiece nebo Unigram.

od Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Otestováno · Funguje ★ 7.6/10

HuggingFace Tokenizers — Trénuje a spouští rychlé tokenizery postavené na Rustu s BPE, WordPiece nebo Unigram.

Co umí

Rychlé tokenizery optimalizované pro výzkum i produkci. Implementace postavená na Rustu tokenizuje 1 GB dat za méně než 20 sekund. Podporuje algoritmy BPE, WordPiece a Unigram. Trénujte vlastní slovníky, sledujte zarovnání, řešte padding/truncation. Bezešvě se integruje s transformers. Použijte, když potřebujete vysoce výkonnou tokenizaci nebo trénování vlastního tokenizeru.

Testovací report

Testováno instalací beze změn (čistý git-clone + kopie, platný YAML frontmatter, všechny 4 referenční soubory přítomné), poté natrénován malý BPE tokenizer na 10řádkovém vloženém korpusu podle vzoru ze SKILL.md. A/B srovnání proti variantě bez skillu přineslo bajtově identické výsledky (velikost slovníku 60; 'the quick fox jumps' se tokenizovalo na ['the','quick','fox','j','u','m','ps']), takže skill nezměnil správnost ani způsob použití API; přidal jen okrajovou míru důslednosti oproti základnímu běhu (ověřena determinističnost napříč 3 běhy plus vysvětlení chování mergování). Dokumentace je přesná bez blokujících skrytých požadavků, i když tvrzení o rychlosti/benchmarcích jsou neověřený marketing.

Testováno: 2026-07-12 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/huggingface-tokenizers ~/.claude/skills/huggingface-tokenizers

Příkazy a ukázkové prompty

  • /huggingface-tokenizersTrénuje a spouští rychlé tokenizery postavené na Rustu s BPE, WordPiece nebo Unigram.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Train a custom BPE tokenizer on my corpus
  • Tokenize this dataset quickly with Hugging Face tokenizers
  • Set up padding and truncation for my tokenizer