Distributed LLM Pretraining: TorchTitan
Konfigurerar distribuerad LLM-förträning i stor skala med torchtitans 4D-parallellism.
Fungerar med konfiguration
Vad den gör
Erbjuder PyTorch-native distribuerad LLM-förträning med torchtitan och 4D-parallellism (FSDP2, TP, PP, CP). Använd vid förträning av Llama 3.1, DeepSeek V3 eller anpassade modeller i stor skala, från 8 till 512+ GPU:er, med Float8, torch.compile och distribuerad checkpointing.
Testrapport
Verklig användning kräver ovillkorligen ett multi-GPU-kluster (8–512+ GPU:er, helst H100) plus en Hugging Face-token för nedladdning av tokenizer — förutsättningar som SKILL.md aldrig flaggar för i förväg trots sin nyckelfärdiga 'launch training'-inramning — så testningen begränsades till konfigartefakten snarare än faktisk träning. Installationen var ren (en enda cp, strikt YAML-frontmatter, alla 4 referensfiler finns). A/B på en Llama3-8B-konfigurationsuppgift: båda armarna gav giltiga TOML-filer med FSDP2 + Float8 + compile + selective-AC, men skillens konfiguration kopplade in float8-omvandlaren i [model] converters (så att float8 faktiskt aktiveras), medan basens konfiguration ställde in [quantize.linear.float8] men utelämnade registreringen av omvandlaren, vilket innebär att dess float8 tyst aldrig skulle tillämpas.
Testad: 2026-07-12 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Kommandon och exempelprompter
/distributed-llm-pretraining-torchtitanKonfigurerar distribuerad LLM-förträning i stor skala med torchtitans 4D-parallellism.
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run