Distributed LLM Pretraining: TorchTitan
Configura el pretraining distribuido de LLMs a gran escala usando el paralelismo 4D de torchtitan.
Funciona con configuración
Qué hace
Ofrece pretraining distribuido de LLMs nativo de PyTorch usando torchtitan con paralelismo 4D (FSDP2, TP, PP, CP). Úsala para hacer pretraining de Llama 3.1, DeepSeek V3 o modelos personalizados a gran escala, de 8 a más de 512 GPUs, con Float8, torch.compile y checkpointing distribuido.
Informe de la prueba
El uso real requiere obligatoriamente un clúster multi-GPU (de 8 a más de 512 GPUs, idealmente H100) además de un token de Hugging Face para descargar el tokenizer — requisitos que el SKILL.md nunca señala de antemano pese a presentarse como un 'launch training' listo para usar — así que la prueba se limitó al artefacto de configuración en lugar del entrenamiento real. La instalación fue limpia (un solo cp, frontmatter strict-YAML válido, los 4 archivos de referencia presentes). A/B en una tarea de configuración de Llama3-8B: ambos arms produjeron TOMLs válidos con FSDP2 + Float8 + compile + selective-AC, pero la configuración con la skill conectó el conversor de float8 en [model] converters (por lo que float8 realmente se activa), mientras que la configuración base configuró [quantize.linear.float8] pero omitió el registro del conversor, lo que significa que su float8 nunca se aplicaría, silenciosamente.
Probado el: 2026-07-12 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/Orchestra-Research/AI-Research-SKILLs cd AI-Research-SKILLs mkdir -p ~/.claude/skills cp -r 01-model-architecture/torchtitan ~/.claude/skills/distributed-llm-pretraining-torchtitan
Comandos y prompts de ejemplo
/distributed-llm-pretraining-torchtitanConfigura el pretraining distribuido de LLMs a gran escala usando el paralelismo 4D de torchtitan.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Pretrain Llama 3.1 across 64 GPUs with torchtitanSet up FSDP2 and tensor parallelism for pretrainingConfigure distributed checkpointing for a large training run