SentencePiece Tokenizer

Skill de référence pour entraîner/utiliser le tokeniseur BPE/Unigram indépendant de la langue de Google.

par Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Testé · Fonctionne ★ 8.0/10

SentencePiece Tokenizer — Skill de référence pour entraîner/utiliser le tokeniseur BPE/Unigram indépendant de la langue de Google.

Ce que fait

Guide de référence pour le tokeniseur SentencePiece de Google : entraînement sur Unicode brut, indépendant de la langue, avec BPE ou Unigram, utilisé par T5, ALBERT, XLNet et mBART. Se déclenche quand l'utilisateur a besoin de tokenisation multilingue ou CJK, de vocabulaires reproductibles/déterministes, ou d'entraînement sur texte brut sans pré-tokenisation.

Rapport de test

Pour une configuration de tokeniseur multilingue, la connaissance générale a déjà produit un code quasi équivalent car la bibliothèque est bien documentée ; le gain principal a été un tableau de couverture, bien que ses chiffres de performance cités soient sans source.

Testé le: 2026-07-10 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 02-tokenization/sentencepiece ~/.claude/skills/sentencepiece

Commandes et exemples de prompts

  • /sentencepieceSkill de référence pour entraîner/utiliser le tokeniseur BPE/Unigram indépendant de la langue de Google.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Train a SentencePiece tokenizer on raw multilingual text
  • Set up Unigram tokenization for CJK text without pre-tokenization
  • Build a deterministic BPE vocabulary like the one T5 uses