Módulo 14 · Aplicaciones con LLMs

Evaluar modelos y aplicaciones con LLMs

Benchmarks, evals propias, LLM como juez y contexto largo: saber si tu sistema funciona de verdad.

Lecciones: 10Duración: ~14 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Benchmarks y evaluación de modelos · Práctica · ~90 min
  2. Probar aplicaciones con LLMs · Práctica · ~45 min
  3. Frameworks de evaluación: RAGAS, DeepEval y G-Eval · Práctica · ~75 min
  4. Evaluar el contexto largo · Teoría · ~60 min
  5. Taller de evaluación 1 · Especificar las tareas · Práctica · ~90 min
  6. Taller de evaluación 2 · Métricas clásicas · Práctica · ~90 min
  7. Taller de evaluación 3 · Métrica por ejecución de código · Práctica · ~90 min
  8. Taller de evaluación 4 · Perplejidad y calibración · Práctica · ~90 min
  9. Taller de evaluación 5 · Agregar resultados en un ranking · Práctica · ~90 min
  10. Taller de evaluación 6 · El evaluador completo · Práctica · ~90 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis