Módulo 28 · Producción y responsabilidad

Servir modelos en producción

Desplegar LLMs rápido y barato: plataformas, motores de inferencia, métricas, cuantización y hardware.

Lecciones: 15Duración: ~16 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Plataformas gestionadas: Bedrock, Vertex y Azure · Teoría · ~60 min
  2. Lo que cuesta servir un modelo · Teoría · ~60 min
  3. Métricas de inferencia que importan · Teoría · ~60 min
  4. Por dentro de un motor de inferencia · Teoría · ~75 min
  5. Reutilizar la caché de prefijos · Teoría · ~75 min
  6. Decodificación especulativa en producción · Teoría · ~60 min
  7. Separar prefill y decode · Teoría · ~75 min
  8. Un stack de serving completo · Teoría · ~60 min
  9. Compilar para un hardware concreto · Teoría · ~75 min
  10. Cuantizar para producción · Teoría · ~75 min
  11. Autoescalado de GPUs con Kubernetes · Teoría · ~75 min
  12. Evitar el arranque en frío · Teoría · ~60 min
  13. Servir en varias regiones · Teoría · ~60 min
  14. IA en el dispositivo (edge) · Teoría · ~60 min
  15. Elegir tu propio motor de serving · Teoría · ~45 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis