Distributed LLM Pretraining: TorchTitan

Konfigurerar distribuerad LLM-förträning i stor skala med torchtitans 4D-parallellism.

av Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Fungerar med konfiguration ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Konfigurerar distribuerad LLM-förträning i stor skala med torchtitans 4D-parallellism.

Vad den gör

Erbjuder PyTorch-native distribuerad LLM-förträning med torchtitan och 4D-parallellism (FSDP2, TP, PP, CP). Använd vid förträning av Llama 3.1, DeepSeek V3 eller anpassade modeller i stor skala, från 8 till 512+ GPU:er, med Float8, torch.compile och distribuerad checkpointing.

Testrapport

Verklig användning kräver ovillkorligen ett multi-GPU-kluster (8–512+ GPU:er, helst H100) plus en Hugging Face-token för nedladdning av tokenizer — förutsättningar som SKILL.md aldrig flaggar för i förväg trots sin nyckelfärdiga 'launch training'-inramning — så testningen begränsades till konfigartefakten snarare än faktisk träning. Installationen var ren (en enda cp, strikt YAML-frontmatter, alla 4 referensfiler finns). A/B på en Llama3-8B-konfigurationsuppgift: båda armarna gav giltiga TOML-filer med FSDP2 + Float8 + compile + selective-AC, men skillens konfiguration kopplade in float8-omvandlaren i [model] converters (så att float8 faktiskt aktiveras), medan basens konfiguration ställde in [quantize.linear.float8] men utelämnade registreringen av omvandlaren, vilket innebär att dess float8 tyst aldrig skulle tillämpas.

Testad: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Kommandon och exempelprompter

  • /distributed-llm-pretraining-torchtitanKonfigurerar distribuerad LLM-förträning i stor skala med torchtitans 4D-parallellism.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run