Módulo 14 · Aplicaciones con LLMs
Evaluar modelos y aplicaciones con LLMs
Benchmarks, evals propias, LLM como juez y contexto largo: saber si tu sistema funciona de verdad.
Qué vas a aprender
- Benchmarks y evaluación de modelos · Práctica · ~90 min
- Probar aplicaciones con LLMs · Práctica · ~45 min
- Frameworks de evaluación: RAGAS, DeepEval y G-Eval · Práctica · ~75 min
- Evaluar el contexto largo · Teoría · ~60 min
- Taller de evaluación 1 · Especificar las tareas · Práctica · ~90 min
- Taller de evaluación 2 · Métricas clásicas · Práctica · ~90 min
- Taller de evaluación 3 · Métrica por ejecución de código · Práctica · ~90 min
- Taller de evaluación 4 · Perplejidad y calibración · Práctica · ~90 min
- Taller de evaluación 5 · Agregar resultados en un ranking · Práctica · ~90 min
- Taller de evaluación 6 · El evaluador completo · Práctica · ~90 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.