Módulo 11 · Lenguaje y LLMs

LLMs modernos: arquitecturas e inferencia eficiente

Cómo son los modelos abiertos actuales y cómo hacerlos rápidos y baratos: cuantización, decodificación especulativa y atención eficiente.

Lecciones: 14Duración: ~18 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Así están hechos los modelos abiertos · Teoría · ~45 min
  2. DeepSeek-V3 por dentro · Teoría · ~75 min
  3. Jamba: Transformers y modelos de estado · Teoría · ~60 min
  4. Atención eficiente: ventanas, dispersa y diferencial · Práctica · ~60 min
  5. Atención diferencial · Práctica · ~60 min
  6. Atención dispersa nativa (NSA) · Práctica · ~60 min
  7. Predecir varios tokens a la vez · Práctica · ~60 min
  8. Cuantización: modelos que caben · Práctica · ~120 min
  9. Acelerar la inferencia · Práctica · ~120 min
  10. Decodificación especulativa: la idea · Práctica · ~60 min
  11. Decodificación especulativa con EAGLE · Práctica · ~75 min
  12. EAGLE-3 en detalle · Práctica · ~75 min
  13. Inferencia asíncrona (Hogwild!) · Práctica · ~60 min
  14. Proyecto: un pipeline de LLM de principio a fin · Práctica · ~120 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis