Módulo 25 · Más allá del texto
Voz y audio
Del sonido al texto y del texto a la voz: espectrogramas, reconocimiento, síntesis y asistentes de voz.
Qué vas a aprender
- El sonido como datos · Teoría · ~45 min
- Espectrogramas y escala Mel · Práctica · ~45 min
- Clasificar sonidos · Práctica · ~75 min
- Reconocimiento de voz · Práctica · ~45 min
- Transformers para audio · Teoría · ~45 min
- Whisper: usarlo y ajustarlo · Práctica · ~75 min
- ¿Quién habla? Identificar voces · Práctica · ~45 min
- Detectar la voz y los turnos de palabra · Práctica · ~45 min
- De texto a voz · Práctica · ~75 min
- Clonar y convertir voces · Práctica · ~75 min
- Comprimir audio con redes neuronales · Teoría · ~60 min
- Generar música · Práctica · ~75 min
- Modelos que entienden audio y texto · Teoría · ~45 min
- Audio en tiempo real · Práctica · ~75 min
- Conversaciones de voz a voz en streaming · Teoría · ~75 min
- Voces falsas y marcas de agua · Práctica · ~75 min
- Medir la calidad del audio · Teoría · ~60 min
- Proyecto: tu asistente de voz · Práctica · ~120 min
Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.