Módulo 9 · Lenguaje y LLMs
Ajuste fino y preferencias
Convierte un modelo base en un asistente útil: LoRA, SFT, RLHF, DPO e IA constitucional.
Qué vas a aprender
- Fine-tuning eficiente con LoRA y QLoRA · Práctica · ~75 min
- Ajuste supervisado con instrucciones (SFT) · Práctica · ~90 min
- RLHF: recompensa y PPO aplicados a un LLM · Práctica · ~90 min
- DPO: preferencias sin modelo de recompensa · Práctica · ~90 min
- IA constitucional y modelos que se corrigen solos · Práctica · ~45 min
- Taller GPT 10 · Ajuste por instrucciones · Práctica · ~90 min
- Taller GPT 11 · DPO desde cero · Práctica · ~90 min
- Taller GPT 12 · Evaluación completa · Práctica · ~90 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.