Módulo 11 · Lenguaje y LLMs
LLMs modernos: arquitecturas e inferencia eficiente
Cómo son los modelos abiertos actuales y cómo hacerlos rápidos y baratos: cuantización, decodificación especulativa y atención eficiente.
Qué vas a aprender
- Así están hechos los modelos abiertos · Teoría · ~45 min
- DeepSeek-V3 por dentro · Teoría · ~75 min
- Jamba: Transformers y modelos de estado · Teoría · ~60 min
- Atención eficiente: ventanas, dispersa y diferencial · Práctica · ~60 min
- Atención diferencial · Práctica · ~60 min
- Atención dispersa nativa (NSA) · Práctica · ~60 min
- Predecir varios tokens a la vez · Práctica · ~60 min
- Cuantización: modelos que caben · Práctica · ~120 min
- Acelerar la inferencia · Práctica · ~120 min
- Decodificación especulativa: la idea · Práctica · ~60 min
- Decodificación especulativa con EAGLE · Práctica · ~75 min
- EAGLE-3 en detalle · Práctica · ~75 min
- Inferencia asíncrona (Hogwild!) · Práctica · ~60 min
- Proyecto: un pipeline de LLM de principio a fin · Práctica · ~120 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.