Módulo 28 · Producción y responsabilidad
Servir modelos en producción
Desplegar LLMs rápido y barato: plataformas, motores de inferencia, métricas, cuantización y hardware.
Qué vas a aprender
- Plataformas gestionadas: Bedrock, Vertex y Azure · Teoría · ~60 min
- Lo que cuesta servir un modelo · Teoría · ~60 min
- Métricas de inferencia que importan · Teoría · ~60 min
- Por dentro de un motor de inferencia · Teoría · ~75 min
- Reutilizar la caché de prefijos · Teoría · ~75 min
- Decodificación especulativa en producción · Teoría · ~60 min
- Separar prefill y decode · Teoría · ~75 min
- Un stack de serving completo · Teoría · ~60 min
- Compilar para un hardware concreto · Teoría · ~75 min
- Cuantizar para producción · Teoría · ~75 min
- Autoescalado de GPUs con Kubernetes · Teoría · ~75 min
- Evitar el arranque en frío · Teoría · ~60 min
- Servir en varias regiones · Teoría · ~60 min
- IA en el dispositivo (edge) · Teoría · ~60 min
- Elegir tu propio motor de serving · Teoría · ~45 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.