Distributed LLM Pretraining: TorchTitan
Sætter storskala distribueret LLM-pretræning op med torchtitans 4D-parallelisme.
Virker med opsætning
Hvad det gør
Leverer PyTorch-native distribueret LLM-pretræning med torchtitan og 4D-parallelisme (FSDP2, TP, PP, CP). Brug det til pretræning af Llama 3.1, DeepSeek V3 eller custom modeller i stor skala fra 8 til 512+ GPU'er med Float8, torch.compile og distribueret checkpointing.
Testrapport
Reel brug kræver ubetinget en multi-GPU-klynge (8-512+ GPU'er, ideelt H100) plus et Hugging Face-token til download af tokenizer — forudsætninger som SKILL.md aldrig flager på forhånd på trods af sin nøglefærdige 'launch training'-fremstilling — så testen blev afgrænset til konfigurationsartefaktet frem for reel træning. Installationen var ren (én cp, strict-YAML-frontmatter, alle 4 referencefiler til stede). A/B på en Llama3-8B-konfigurationsopgave: begge arme producerede gyldige FSDP2 + Float8 + compile + selective-AC TOML-filer, men skill-armens konfiguration koblede float8-konverteren ind i [model] converters (så float8 rent faktisk aktiveres), mens basiskonfigurationen satte [quantize.linear.float8] op men undlod konverter-registreringen, hvilket betyder at dens float8 aldrig ville blive anvendt uden en fejlmeddelelse.
Testet: 2026-07-12 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Kommandoer og eksempelprompter
/distributed-llm-pretraining-torchtitanSætter storskala distribueret LLM-pretræning op med torchtitans 4D-parallelisme.
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run