Módulo 5 · Fundamentos

Aprendizaje por refuerzo

Agentes que aprenden de la experiencia: de los MDP a PPO, la base del RLHF de los LLMs.

Lecciones: 12Duración: ~14 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Estados, acciones y recompensas (MDP) · Teoría · ~45 min
  2. Programación dinámica · Práctica · ~75 min
  3. Aprender de episodios: Monte Carlo · Práctica · ~75 min
  4. Q-Learning y SARSA · Práctica · ~75 min
  5. Redes Q profundas (DQN) · Práctica · ~75 min
  6. Gradiente de política con REINFORCE · Práctica · ~75 min
  7. Métodos actor-crítico · Práctica · ~75 min
  8. PPO, el algoritmo de cabecera · Práctica · ~75 min
  9. Modelos de recompensa y RLHF · Práctica · ~45 min
  10. Refuerzo con varios agentes · Práctica · ~45 min
  11. De la simulación al mundo real · Teoría · ~45 min
  12. RL en juegos: de AlphaZero al razonamiento de los LLMs · Práctica · ~120 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis