Distributed LLM Pretraining: TorchTitan

Sætter storskala distribueret LLM-pretræning op med torchtitans 4D-parallelisme.

Af Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Virker med opsætning ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Sætter storskala distribueret LLM-pretræning op med torchtitans 4D-parallelisme.

Hvad det gør

Leverer PyTorch-native distribueret LLM-pretræning med torchtitan og 4D-parallelisme (FSDP2, TP, PP, CP). Brug det til pretræning af Llama 3.1, DeepSeek V3 eller custom modeller i stor skala fra 8 til 512+ GPU'er med Float8, torch.compile og distribueret checkpointing.

Testrapport

Reel brug kræver ubetinget en multi-GPU-klynge (8-512+ GPU'er, ideelt H100) plus et Hugging Face-token til download af tokenizer — forudsætninger som SKILL.md aldrig flager på forhånd på trods af sin nøglefærdige 'launch training'-fremstilling — så testen blev afgrænset til konfigurationsartefaktet frem for reel træning. Installationen var ren (én cp, strict-YAML-frontmatter, alle 4 referencefiler til stede). A/B på en Llama3-8B-konfigurationsopgave: begge arme producerede gyldige FSDP2 + Float8 + compile + selective-AC TOML-filer, men skill-armens konfiguration koblede float8-konverteren ind i [model] converters (så float8 rent faktisk aktiveres), mens basiskonfigurationen satte [quantize.linear.float8] op men undlod konverter-registreringen, hvilket betyder at dens float8 aldrig ville blive anvendt uden en fejlmeddelelse.

Testet: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Kommandoer og eksempelprompter

  • /distributed-llm-pretraining-torchtitanSætter storskala distribueret LLM-pretræning op med torchtitans 4D-parallelisme.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run