Distributed LLM Pretraining: TorchTitan

Nastavuje distribuovaný pretraining LLM ve velkém měřítku pomocí 4D paralelismu torchtitan.

od Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Funguje s nastavením ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Nastavuje distribuovaný pretraining LLM ve velkém měřítku pomocí 4D paralelismu torchtitan.

Co umí

Poskytuje nativní PyTorch distribuovaný pretraining LLM pomocí torchtitan se 4D paralelismem (FSDP2, TP, PP, CP). Použijte při pretrainingu Llama 3.1, DeepSeek V3 nebo vlastních modelů ve velkém měřítku od 8 do 512+ GPU s Float8, torch.compile a distribuovaným checkpointingem.

Testovací report

Reálné použití striktně vyžaduje multi-GPU cluster (8-512+ GPU, ideálně H100) a Hugging Face token pro stažení tokenizeru — tyto předpoklady SKILL.md nikde předem neuvádí, přestože rámuje 'spuštění tréninku' jako hotové řešení na klíč — testování se proto omezilo na konfigurační artefakt místo skutečného tréninku. Instalace proběhla čistě (jediné cp, striktně validní YAML frontmatter, všechny 4 referenční soubory přítomné). A/B na úloze konfigurace Llama3-8B: obě varianty vytvořily platné TOML soubory s FSDP2 + Float8 + compile + selective-AC, ale konfigurace se skillem zapojila float8 converter do [model] converters (takže float8 skutečně funguje), zatímco základní konfigurace nastavila [quantize.linear.float8], ale vynechala registraci converteru, takže by se její float8 potichu nikdy neaplikoval.

Testováno: 2026-07-12 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Příkazy a ukázkové prompty

  • /distributed-llm-pretraining-torchtitanNastavuje distribuovaný pretraining LLM ve velkém měřítku pomocí 4D paralelismu torchtitan.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run