Módulo 10 · Lenguaje y LLMs

Entrenar a gran escala

Lo que hace falta para entrenar modelos grandes: datos masivos, varias GPU, paralelismo y checkpoints.

Lecciones: 17Duración: ~25 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Entrenamiento distribuido: FSDP y DeepSpeed · Práctica · ~120 min
  2. Ahorrar memoria con gradient checkpointing · Práctica · ~70 min
  3. Paralelismo DualPipe · Teoría · ~60 min
  4. Taller de preentrenamiento 1 · Descargar corpus grandes · Práctica · ~90 min
  5. Taller de preentrenamiento 2 · Corpus tokenizado en HDF5 · Práctica · ~90 min
  6. Taller de preentrenamiento 3 · Learning rate coseno con warmup · Práctica · ~90 min
  7. Taller de preentrenamiento 4 · Recorte de gradientes y precisión mixta · Práctica · ~90 min
  8. Taller de preentrenamiento 5 · Acumulación de gradientes · Práctica · ~90 min
  9. Taller de preentrenamiento 6 · Guardar y reanudar checkpoints · Práctica · ~90 min
  10. Taller de preentrenamiento 7 · DDP y FSDP desde cero · Práctica · ~90 min
  11. Taller de preentrenamiento 8 · Evaluar el modelo entrenado · Práctica · ~90 min
  12. Taller distribuido 1 · Operaciones colectivas · Práctica · ~90 min
  13. Taller distribuido 2 · Data Parallel · Práctica · ~90 min
  14. Taller distribuido 3 · ZeRO y el estado del optimizador · Práctica · ~90 min
  15. Taller distribuido 4 · Paralelismo de pipeline · Práctica · ~90 min
  16. Taller distribuido 5 · Checkpoints fragmentados · Práctica · ~90 min
  17. Taller distribuido 6 · Entrenamiento distribuido completo · Práctica · ~90 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis