Distributed LLM Pretraining: TorchTitan

Konfiguruje rozproszony pretrening LLM na dużą skalę przy użyciu 4D parallelism z torchtitan.

Autor: Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Działa po konfiguracji ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Konfiguruje rozproszony pretrening LLM na dużą skalę przy użyciu 4D parallelism z torchtitan.

Co robi ten skill

Zapewnia natywny dla PyTorch rozproszony pretrening LLM za pomocą torchtitan z 4D parallelism (FSDP2, TP, PP, CP). Używaj przy pretrenowaniu Llama 3.1, DeepSeek V3 albo własnych modeli na dużą skalę, od 8 do 512+ GPU, z Float8, torch.compile i rozproszonym checkpointingiem.

Raport z testu

Prawdziwe użycie bezwzględnie wymaga klastra wielo-GPU (8-512+ GPU, najlepiej H100) oraz tokena HuggingFace do pobrania tokenizera — wymagań, których SKILL.md nigdzie na wstępie nie sygnalizuje mimo formułowania 'uruchom trening' jako gotowego rozwiązania — więc test ograniczono do artefaktu konfiguracyjnego, a nie faktycznego treningu. Instalacja była czysta (pojedyncze cp, poprawny strict-YAML frontmatter, wszystkie 4 pliki referencyjne obecne). A/B na zadaniu konfiguracji Llama3-8B: oba warianty wygenerowały poprawne pliki TOML z FSDP2 + Float8 + compile + selective-AC, ale konfiguracja z użyciem skilla podpięła konwerter float8 do [model] converters (dzięki czemu float8 faktycznie się aktywuje), podczas gdy konfiguracja bazowa ustawiła [quantize.linear.float8], ale pominęła rejestrację konwertera, przez co jej float8 po cichu nigdy by się nie zastosował.

Testowano: 2026-07-12 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Komendy i przykładowe prompty

  • /distributed-llm-pretraining-torchtitanKonfiguruje rozproszony pretrening LLM na dużą skalę przy użyciu 4D parallelism z torchtitan.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run