Módulo 30 · Producción y responsabilidad
Alineamiento y seguridad de los modelos
Por qué los modelos hacen cosas que no queremos y cómo se investiga y se gobierna: recompensas, engaño, supervisión y marcos de seguridad.
Qué vas a aprender
- Seguir instrucciones como señal de alineamiento · Teoría · ~45 min
- Hacer trampa con la recompensa (ley de Goodhart) · Teoría · ~60 min
- Modelos complacientes · Teoría · ~60 min
- La familia DPO · Teoría · ~75 min
- Feedback de IA (RLAIF) e IA constitucional · Teoría · ~60 min
- Reglas constitucionales y cómo se saltan · Teoría · ~60 min
- Objetivos ocultos y alineamiento engañoso · Teoría · ~75 min
- Agentes durmientes · Teoría · ~60 min
- Maquinación en modelos de frontera · Teoría · ~60 min
- Modelos que fingen estar alineados · Teoría · ~60 min
- Control de IA ante modelos que no cooperan · Teoría · ~75 min
- Supervisar modelos más capaces que nosotros · Teoría · ~60 min
- Evaluar capacidades peligrosas (WMDP) · Teoría · ~60 min
- Marcos de seguridad de los laboratorios · Teoría · ~75 min
- La política de escalado responsable de Anthropic · Teoría · ~45 min
- Los marcos de OpenAI y DeepMind · Teoría · ~45 min
- Evaluación externa y horizontes de tareas · Teoría · ~60 min
- Riesgos a escala social · Teoría · ~45 min
- Bienestar de los modelos · Teoría · ~45 min
- El ecosistema de investigación en alineamiento · Teoría · ~45 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.