Distributed LLM Pretraining: TorchTitan

Configura el pretraining distribuido de LLMs a gran escala usando el paralelismo 4D de torchtitan.

Por Orchestra-Research · Orchestra-Research/AI-Research-SKILLs

Funciona con configuración ★ 7.6/10

Distributed LLM Pretraining: TorchTitan — Configura el pretraining distribuido de LLMs a gran escala usando el paralelismo 4D de torchtitan.

Qué hace

Ofrece pretraining distribuido de LLMs nativo de PyTorch usando torchtitan con paralelismo 4D (FSDP2, TP, PP, CP). Úsala para hacer pretraining de Llama 3.1, DeepSeek V3 o modelos personalizados a gran escala, de 8 a más de 512 GPUs, con Float8, torch.compile y checkpointing distribuido.

Informe de la prueba

El uso real requiere obligatoriamente un clúster multi-GPU (de 8 a más de 512 GPUs, idealmente H100) además de un token de Hugging Face para descargar el tokenizer — requisitos que el SKILL.md nunca señala de antemano pese a presentarse como un 'launch training' listo para usar — así que la prueba se limitó al artefacto de configuración en lugar del entrenamiento real. La instalación fue limpia (un solo cp, frontmatter strict-YAML válido, los 4 archivos de referencia presentes). A/B en una tarea de configuración de Llama3-8B: ambos arms produjeron TOMLs válidos con FSDP2 + Float8 + compile + selective-AC, pero la configuración con la skill conectó el conversor de float8 en [model] converters (por lo que float8 realmente se activa), mientras que la configuración base configuró [quantize.linear.float8] pero omitió el registro del conversor, lo que significa que su float8 nunca se aplicaría, silenciosamente.

Probado el: 2026-07-12 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/Orchestra-Research/AI-Research-SKILLs
cd AI-Research-SKILLs
mkdir -p ~/.claude/skills
cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan

Comandos y prompts de ejemplo

  • /distributed-llm-pretraining-torchtitanConfigura el pretraining distribuido de LLMs a gran escala usando el paralelismo 4D de torchtitan.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Pretrain Llama 3.1 across 64 GPUs with torchtitan
  • Set up FSDP2 and tensor parallelism for pretraining
  • Configure distributed checkpointing for a large training run