Módulo 30 · Producción y responsabilidad

Alineamiento y seguridad de los modelos

Por qué los modelos hacen cosas que no queremos y cómo se investiga y se gobierna: recompensas, engaño, supervisión y marcos de seguridad.

Lecciones: 20Duración: ~20 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Seguir instrucciones como señal de alineamiento · Teoría · ~45 min
  2. Hacer trampa con la recompensa (ley de Goodhart) · Teoría · ~60 min
  3. Modelos complacientes · Teoría · ~60 min
  4. La familia DPO · Teoría · ~75 min
  5. Feedback de IA (RLAIF) e IA constitucional · Teoría · ~60 min
  6. Reglas constitucionales y cómo se saltan · Teoría · ~60 min
  7. Objetivos ocultos y alineamiento engañoso · Teoría · ~75 min
  8. Agentes durmientes · Teoría · ~60 min
  9. Maquinación en modelos de frontera · Teoría · ~60 min
  10. Modelos que fingen estar alineados · Teoría · ~60 min
  11. Control de IA ante modelos que no cooperan · Teoría · ~75 min
  12. Supervisar modelos más capaces que nosotros · Teoría · ~60 min
  13. Evaluar capacidades peligrosas (WMDP) · Teoría · ~60 min
  14. Marcos de seguridad de los laboratorios · Teoría · ~75 min
  15. La política de escalado responsable de Anthropic · Teoría · ~45 min
  16. Los marcos de OpenAI y DeepMind · Teoría · ~45 min
  17. Evaluación externa y horizontes de tareas · Teoría · ~60 min
  18. Riesgos a escala social · Teoría · ~45 min
  19. Bienestar de los modelos · Teoría · ~45 min
  20. El ecosistema de investigación en alineamiento · Teoría · ~45 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis