Módulo 5 · Fundamentos
Aprendizaje por refuerzo
Agentes que aprenden de la experiencia: de los MDP a PPO, la base del RLHF de los LLMs.
Qué vas a aprender
- Estados, acciones y recompensas (MDP) · Teoría · ~45 min
- Programación dinámica · Práctica · ~75 min
- Aprender de episodios: Monte Carlo · Práctica · ~75 min
- Q-Learning y SARSA · Práctica · ~75 min
- Redes Q profundas (DQN) · Práctica · ~75 min
- Gradiente de política con REINFORCE · Práctica · ~75 min
- Métodos actor-crítico · Práctica · ~75 min
- PPO, el algoritmo de cabecera · Práctica · ~75 min
- Modelos de recompensa y RLHF · Práctica · ~45 min
- Refuerzo con varios agentes · Práctica · ~45 min
- De la simulación al mundo real · Teoría · ~45 min
- RL en juegos: de AlphaZero al razonamiento de los LLMs · Práctica · ~120 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.