Distributed LLM Pretraining: TorchTitan

Configure le pré-entraînement distribué de LLM à grande échelle avec le parallélisme 4D de torchtitan.

par Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Fonctionne avec configuration ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Configure le pré-entraînement distribué de LLM à grande échelle avec le parallélisme 4D de torchtitan.

Ce que fait

Fournit un pré-entraînement distribué de LLM natif PyTorch avec torchtitan et son parallélisme 4D (FSDP2, TP, PP, CP). À utiliser pour pré-entraîner Llama 3.1, DeepSeek V3, ou des modèles personnalisés à grande échelle, de 8 à plus de 512 GPU, avec Float8, torch.compile et le checkpointing distribué.

Rapport de test

L'usage réel exige impérativement un cluster multi-GPU (8 à plus de 512 GPU, idéalement des H100) plus un token Hugging Face pour télécharger le tokenizer — des prérequis que le SKILL.md ne signale jamais en amont malgré sa présentation « clé en main » de lancement d'entraînement — le test s'est donc limité à l'artefact de configuration plutôt qu'à un entraînement réel. L'installation était propre (simple cp, frontmatter strict-YAML, les 4 fichiers de référence présents). A/B sur une tâche de configuration Llama3-8B : les deux bras ont produit des TOML valides FSDP2 + Float8 + compile + selective-AC, mais la configuration du bras avec skill a bien câblé le convertisseur float8 dans [model] converters (donc float8 s'active réellement), tandis que la configuration de base configurait [quantize.linear.float8] sans enregistrer le convertisseur, ce qui signifie que son float8 ne se serait jamais appliqué, silencieusement.

Testé le: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Commandes et exemples de prompts

  • /distributed-llm-pretraining-torchtitanConfigure le pré-entraînement distribué de LLM à grande échelle avec le parallélisme 4D de torchtitan.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run