Distributed LLM Pretraining: TorchTitan
Nastavuje distribuovaný pretraining LLM ve velkém měřítku pomocí 4D paralelismu torchtitan.
Funguje s nastavením
Co umí
Poskytuje nativní PyTorch distribuovaný pretraining LLM pomocí torchtitan se 4D paralelismem (FSDP2, TP, PP, CP). Použijte při pretrainingu Llama 3.1, DeepSeek V3 nebo vlastních modelů ve velkém měřítku od 8 do 512+ GPU s Float8, torch.compile a distribuovaným checkpointingem.
Testovací report
Reálné použití striktně vyžaduje multi-GPU cluster (8-512+ GPU, ideálně H100) a Hugging Face token pro stažení tokenizeru — tyto předpoklady SKILL.md nikde předem neuvádí, přestože rámuje 'spuštění tréninku' jako hotové řešení na klíč — testování se proto omezilo na konfigurační artefakt místo skutečného tréninku. Instalace proběhla čistě (jediné cp, striktně validní YAML frontmatter, všechny 4 referenční soubory přítomné). A/B na úloze konfigurace Llama3-8B: obě varianty vytvořily platné TOML soubory s FSDP2 + Float8 + compile + selective-AC, ale konfigurace se skillem zapojila float8 converter do [model] converters (takže float8 skutečně funguje), zatímco základní konfigurace nastavila [quantize.linear.float8], ale vynechala registraci converteru, takže by se její float8 potichu nikdy neaplikoval.
Testováno: 2026-07-12 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Příkazy a ukázkové prompty
/distributed-llm-pretraining-torchtitanNastavuje distribuovaný pretraining LLM ve velkém měřítku pomocí 4D paralelismu torchtitan.
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run