Distributed LLM Pretraining: TorchTitan
Setter opp distribuert LLM-pretrening i stor skala med torchtitans 4D-parallellisme.
Krever oppsett
Hva den gjør
Gir PyTorch-native distribuert LLM-pretrening med torchtitan og 4D-parallellisme (FSDP2, TP, PP, CP). Bruk ved pretrening av Llama 3.1, DeepSeek V3, eller egne modeller i stor skala, fra 8 til 512+ GPU-er, med Float8, torch.compile og distribuert checkpointing.
Testrapport
Reell bruk krever ubetinget en multi-GPU-klynge (8–512+ GPU-er, helst H100) pluss et Hugging Face-token for nedlasting av tokenizer — forutsetninger SKILL.md aldri flagger på forhånd til tross for sin nøkkelferdige «start trening»-fremstilling — så testingen ble avgrenset til konfig-artefaktet fremfor faktisk trening. Installasjonen var ren (én cp, strict-YAML-frontmatter, alle 4 referansefiler til stede). A/B på en Llama3-8B-konfigoppgave: begge armene produserte gyldige FSDP2 + Float8 + compile + selective-AC-TOML-er, men den skill-styrte konfigen koblet float8-konverteren inn i [model] converters (så float8 faktisk aktiveres), mens basekonfigen satte opp [quantize.linear.float8] uten å registrere konverteren, noe som betyr at float8 der aldri ville tre i kraft uten varsel.
Testet på: 2026-07-12 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Kommandoer og eksempelprompter
/distributed-llm-pretraining-torchtitanSetter opp distribuert LLM-pretrening i stor skala med torchtitans 4D-parallellisme.
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run