Distributed LLM Pretraining: TorchTitan
Configura il pretraining distribuito di LLM su larga scala usando il parallelismo 4D di torchtitan.
Richiede configurazione
Cosa fa
Offre pretraining distribuito di LLM nativo per PyTorch usando torchtitan con parallelismo 4D (FSDP2, TP, PP, CP). Da usare per il pretraining su larga scala di Llama 3.1, DeepSeek V3 o modelli personalizzati, da 8 a oltre 512 GPU, con Float8, torch.compile e checkpointing distribuito.
Rapporto di test
L'uso reale richiede obbligatoriamente un cluster multi-GPU (da 8 a oltre 512 GPU, idealmente H100) più un token Hugging Face per scaricare il tokenizer — prerequisiti che SKILL.md non segnala mai in anticipo nonostante la sua impostazione 'avvia il training' chiavi in mano — quindi il test si è limitato all'artefatto di configurazione anziché al training vero e proprio. L'installazione è stata pulita (un solo cp, frontmatter YAML rigoroso, tutti e 4 i file di riferimento presenti). A/B su un task di configurazione per Llama3-8B: entrambi i rami hanno prodotto TOML validi con FSDP2 + Float8 + compile + selective-AC, ma la configurazione del ramo con skill ha collegato il convertitore float8 dentro [model] converters (quindi float8 si attiva davvero), mentre la configurazione di base ha impostato [quantize.linear.float8] senza registrare il convertitore, il che significa che il suo float8 non si sarebbe mai applicato, silenziosamente.
Testato il: 2026-07-12 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Comandi e prompt di esempio
/distributed-llm-pretraining-torchtitanConfigura il pretraining distribuito di LLM su larga scala usando il parallelismo 4D di torchtitan.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run