Distributed LLM Pretraining: TorchTitan

Configura il pretraining distribuito di LLM su larga scala usando il parallelismo 4D di torchtitan.

di Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Richiede configurazione ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Configura il pretraining distribuito di LLM su larga scala usando il parallelismo 4D di torchtitan.

Cosa fa

Offre pretraining distribuito di LLM nativo per PyTorch usando torchtitan con parallelismo 4D (FSDP2, TP, PP, CP). Da usare per il pretraining su larga scala di Llama 3.1, DeepSeek V3 o modelli personalizzati, da 8 a oltre 512 GPU, con Float8, torch.compile e checkpointing distribuito.

Rapporto di test

L'uso reale richiede obbligatoriamente un cluster multi-GPU (da 8 a oltre 512 GPU, idealmente H100) più un token Hugging Face per scaricare il tokenizer — prerequisiti che SKILL.md non segnala mai in anticipo nonostante la sua impostazione 'avvia il training' chiavi in mano — quindi il test si è limitato all'artefatto di configurazione anziché al training vero e proprio. L'installazione è stata pulita (un solo cp, frontmatter YAML rigoroso, tutti e 4 i file di riferimento presenti). A/B su un task di configurazione per Llama3-8B: entrambi i rami hanno prodotto TOML validi con FSDP2 + Float8 + compile + selective-AC, ma la configurazione del ramo con skill ha collegato il convertitore float8 dentro [model] converters (quindi float8 si attiva davvero), mentre la configurazione di base ha impostato [quantize.linear.float8] senza registrare il convertitore, il che significa che il suo float8 non si sarebbe mai applicato, silenziosamente.

Testato il: 2026-07-12 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Comandi e prompt di esempio

  • /distributed-llm-pretraining-torchtitanConfigura il pretraining distribuito di LLM su larga scala usando il parallelismo 4D di torchtitan.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run