Distributed LLM Pretraining: TorchTitan

Zet grootschalige gedistribueerde LLM-pretraining op met de 4D-parallellisatie van torchtitan.

Door Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Werkt met setup ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Zet grootschalige gedistribueerde LLM-pretraining op met de 4D-parallellisatie van torchtitan.

Wat het doet

Biedt PyTorch-native gedistribueerde LLM-pretraining met torchtitan en 4D-parallellisatie (FSDP2, TP, PP, CP). Gebruik dit bij het pretrainen van Llama 3.1, DeepSeek V3 of eigen modellen op schaal, van 8 tot 512+ GPU's, met Float8, torch.compile en gedistribueerde checkpointing.

Testrapport

Praktisch gebruik vereist hard een multi-GPU-cluster (8-512+ GPU's, idealiter H100) plus een Hugging Face-token voor het downloaden van de tokenizer — vereisten die SKILL.md nooit vooraf vermeldt ondanks de kant-en-klare 'start training'-framing — dus testen beperkte zich tot het configartefact in plaats van daadwerkelijke training. Installatie was schoon (één cp, strict-YAML-frontmatter, alle 4 referentiebestanden aanwezig). A/B op een Llama3-8B-configtaak: beide varianten leverden geldige TOML's op met FSDP2 + Float8 + compile + selective-AC, maar de configuratie met skill koppelde de float8-converter aan [model] converters (waardoor float8 daadwerkelijk actief wordt), terwijl de basisconfiguratie [quantize.linear.float8] instelde maar de converter-registratie wegliet, waardoor float8 stilzwijgend nooit zou worden toegepast.

Getest op: 2026-07-12 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Commando's en voorbeeldprompts

  • /distributed-llm-pretraining-torchtitanZet grootschalige gedistribueerde LLM-pretraining op met de 4D-parallellisatie van torchtitan.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run