Distributed LLM Pretraining: TorchTitan
Zet grootschalige gedistribueerde LLM-pretraining op met de 4D-parallellisatie van torchtitan.
Werkt met setup
Wat het doet
Biedt PyTorch-native gedistribueerde LLM-pretraining met torchtitan en 4D-parallellisatie (FSDP2, TP, PP, CP). Gebruik dit bij het pretrainen van Llama 3.1, DeepSeek V3 of eigen modellen op schaal, van 8 tot 512+ GPU's, met Float8, torch.compile en gedistribueerde checkpointing.
Testrapport
Praktisch gebruik vereist hard een multi-GPU-cluster (8-512+ GPU's, idealiter H100) plus een Hugging Face-token voor het downloaden van de tokenizer — vereisten die SKILL.md nooit vooraf vermeldt ondanks de kant-en-klare 'start training'-framing — dus testen beperkte zich tot het configartefact in plaats van daadwerkelijke training. Installatie was schoon (één cp, strict-YAML-frontmatter, alle 4 referentiebestanden aanwezig). A/B op een Llama3-8B-configtaak: beide varianten leverden geldige TOML's op met FSDP2 + Float8 + compile + selective-AC, maar de configuratie met skill koppelde de float8-converter aan [model] converters (waardoor float8 daadwerkelijk actief wordt), terwijl de basisconfiguratie [quantize.linear.float8] instelde maar de converter-registratie wegliet, waardoor float8 stilzwijgend nooit zou worden toegepast.
Getest op: 2026-07-12 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Commando's en voorbeeldprompts
/distributed-llm-pretraining-torchtitanZet grootschalige gedistribueerde LLM-pretraining op met de 4D-parallellisatie van torchtitan.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run