Módulo 24 · Más allá del texto
Visión por computador
Imágenes y vídeo: convoluciones, clasificación, detección, segmentación, 3D y modelos que ven y entienden.
Qué vas a aprender
- Píxeles, canales y color · Práctica · ~45 min
- Convoluciones desde cero · Práctica · ~75 min
- Redes convolucionales: de LeNet a ResNet · Teoría y práctica · ~75 min
- Clasificar imágenes · Práctica · ~75 min
- Aprovechar modelos preentrenados (transfer learning) · Práctica · ~75 min
- Detectar objetos con YOLO · Práctica · ~75 min
- Segmentación semántica con U-Net · Práctica · ~75 min
- Segmentar objeto a objeto: Mask R-CNN · Teoría y práctica · ~75 min
- Vision Transformers: la idea · Práctica · ~45 min
- Vision Transformers en código · Práctica · ~45 min
- Aprender sin etiquetas: SimCLR, DINO y MAE · Teoría y práctica · ~75 min
- CLIP: imágenes y texto en el mismo espacio · Práctica · ~45 min
- Buscar imágenes parecidas · Práctica · ~45 min
- Leer documentos: OCR y más · Teoría y herramientas · ~45 min
- Puntos clave y postura del cuerpo · Práctica · ~45 min
- Estimar la profundidad con una sola cámara · Práctica · ~60 min
- Seguir objetos en vídeo · Práctica · ~60 min
- Entender vídeo · Teoría y práctica · ~45 min
- Visión 3D: nubes de puntos y NeRF · Teoría y práctica · ~45 min
- 3D Gaussian Splatting · Práctica · ~90 min
- Segmentar cualquier cosa (SAM 3) · Práctica · ~60 min
- Modelos que ven y hablan · Teoría y herramientas · ~75 min
- Visión en tiempo real en dispositivos · Teoría y práctica · ~75 min
- Proyecto: un sistema de visión completo · Práctica · ~120 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.