Módulo 10 · Lenguaje y LLMs
Entrenar a gran escala
Lo que hace falta para entrenar modelos grandes: datos masivos, varias GPU, paralelismo y checkpoints.
Qué vas a aprender
- Entrenamiento distribuido: FSDP y DeepSpeed · Práctica · ~120 min
- Ahorrar memoria con gradient checkpointing · Práctica · ~70 min
- Paralelismo DualPipe · Teoría · ~60 min
- Taller de preentrenamiento 1 · Descargar corpus grandes · Práctica · ~90 min
- Taller de preentrenamiento 2 · Corpus tokenizado en HDF5 · Práctica · ~90 min
- Taller de preentrenamiento 3 · Learning rate coseno con warmup · Práctica · ~90 min
- Taller de preentrenamiento 4 · Recorte de gradientes y precisión mixta · Práctica · ~90 min
- Taller de preentrenamiento 5 · Acumulación de gradientes · Práctica · ~90 min
- Taller de preentrenamiento 6 · Guardar y reanudar checkpoints · Práctica · ~90 min
- Taller de preentrenamiento 7 · DDP y FSDP desde cero · Práctica · ~90 min
- Taller de preentrenamiento 8 · Evaluar el modelo entrenado · Práctica · ~90 min
- Taller distribuido 1 · Operaciones colectivas · Práctica · ~90 min
- Taller distribuido 2 · Data Parallel · Práctica · ~90 min
- Taller distribuido 3 · ZeRO y el estado del optimizador · Práctica · ~90 min
- Taller distribuido 4 · Paralelismo de pipeline · Práctica · ~90 min
- Taller distribuido 5 · Checkpoints fragmentados · Práctica · ~90 min
- Taller distribuido 6 · Entrenamiento distribuido completo · Práctica · ~90 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.