Módulo 24 · Más allá del texto

Visión por computador

Imágenes y vídeo: convoluciones, clasificación, detección, segmentación, 3D y modelos que ven y entienden.

Lecciones: 24Duración: ~26 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. Píxeles, canales y color · Práctica · ~45 min
  2. Convoluciones desde cero · Práctica · ~75 min
  3. Redes convolucionales: de LeNet a ResNet · Teoría y práctica · ~75 min
  4. Clasificar imágenes · Práctica · ~75 min
  5. Aprovechar modelos preentrenados (transfer learning) · Práctica · ~75 min
  6. Detectar objetos con YOLO · Práctica · ~75 min
  7. Segmentación semántica con U-Net · Práctica · ~75 min
  8. Segmentar objeto a objeto: Mask R-CNN · Teoría y práctica · ~75 min
  9. Vision Transformers: la idea · Práctica · ~45 min
  10. Vision Transformers en código · Práctica · ~45 min
  11. Aprender sin etiquetas: SimCLR, DINO y MAE · Teoría y práctica · ~75 min
  12. CLIP: imágenes y texto en el mismo espacio · Práctica · ~45 min
  13. Buscar imágenes parecidas · Práctica · ~45 min
  14. Leer documentos: OCR y más · Teoría y herramientas · ~45 min
  15. Puntos clave y postura del cuerpo · Práctica · ~45 min
  16. Estimar la profundidad con una sola cámara · Práctica · ~60 min
  17. Seguir objetos en vídeo · Práctica · ~60 min
  18. Entender vídeo · Teoría y práctica · ~45 min
  19. Visión 3D: nubes de puntos y NeRF · Teoría y práctica · ~45 min
  20. 3D Gaussian Splatting · Práctica · ~90 min
  21. Segmentar cualquier cosa (SAM 3) · Práctica · ~60 min
  22. Modelos que ven y hablan · Teoría y herramientas · ~75 min
  23. Visión en tiempo real en dispositivos · Teoría y práctica · ~75 min
  24. Proyecto: un sistema de visión completo · Práctica · ~120 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis