Distributed LLM Pretraining: TorchTitan

Setter opp distribuert LLM-pretrening i stor skala med torchtitans 4D-parallellisme.

av Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Krever oppsett ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Setter opp distribuert LLM-pretrening i stor skala med torchtitans 4D-parallellisme.

Hva den gjør

Gir PyTorch-native distribuert LLM-pretrening med torchtitan og 4D-parallellisme (FSDP2, TP, PP, CP). Bruk ved pretrening av Llama 3.1, DeepSeek V3, eller egne modeller i stor skala, fra 8 til 512+ GPU-er, med Float8, torch.compile og distribuert checkpointing.

Testrapport

Reell bruk krever ubetinget en multi-GPU-klynge (8–512+ GPU-er, helst H100) pluss et Hugging Face-token for nedlasting av tokenizer — forutsetninger SKILL.md aldri flagger på forhånd til tross for sin nøkkelferdige «start trening»-fremstilling — så testingen ble avgrenset til konfig-artefaktet fremfor faktisk trening. Installasjonen var ren (én cp, strict-YAML-frontmatter, alle 4 referansefiler til stede). A/B på en Llama3-8B-konfigoppgave: begge armene produserte gyldige FSDP2 + Float8 + compile + selective-AC-TOML-er, men den skill-styrte konfigen koblet float8-konverteren inn i [model] converters (så float8 faktisk aktiveres), mens basekonfigen satte opp [quantize.linear.float8] uten å registrere konverteren, noe som betyr at float8 der aldri ville tre i kraft uten varsel.

Testet på: 2026-07-12 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Kommandoer og eksempelprompter

  • /distributed-llm-pretraining-torchtitanSetter opp distribuert LLM-pretrening i stor skala med torchtitans 4D-parallellisme.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run