Distributed LLM Pretraining: TorchTitan

Richtet groß angelegtes verteiltes LLM-Pretraining mit torchtitans 4D-Parallelism ein.

von Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Funktioniert mit Setup ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Richtet groß angelegtes verteiltes LLM-Pretraining mit torchtitans 4D-Parallelism ein.

Was es kann

Bietet PyTorch-natives verteiltes LLM-Pretraining mit torchtitan und 4D-Parallelism (FSDP2, TP, PP, CP). Geeignet für das Pretraining von Llama 3.1, DeepSeek V3 oder eigenen Modellen im großen Maßstab von 8 bis über 512 GPUs mit Float8, torch.compile und verteiltem Checkpointing.

Testbericht

Der reale Einsatz erfordert zwingend einen Multi-GPU-Cluster (8 bis über 512 GPUs, idealerweise H100) sowie ein Hugging-Face-Token für den Tokenizer-Download — Voraussetzungen, auf die die SKILL.md trotz ihres Turnkey-'Training starten'-Framings nie vorab hinweist —, daher beschränkte sich der Test auf das Konfigurationsartefakt statt auf echtes Training. Die Installation lief sauber (ein einzelnes cp, strict-YAML-Frontmatter, alle 4 Referenzdateien vorhanden). A/B bei einer Llama3-8B-Konfigurationsaufgabe: Beide Arme erzeugten gültige TOMLs mit FSDP2 + Float8 + Compile + Selective-AC, aber die Skill-Konfiguration band den Float8-Converter in [model] converters ein (sodass Float8 tatsächlich aktiviert wird), während die Basiskonfiguration [quantize.linear.float8] konfigurierte, aber die Converter-Registrierung ausließ, wodurch ihr Float8 stillschweigend nie angewendet würde.

Getestet am: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Befehle & Beispiel-Prompts

  • /distributed-llm-pretraining-torchtitanRichtet groß angelegtes verteiltes LLM-Pretraining mit torchtitans 4D-Parallelism ein.

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run