Módulo 25 · Más allá del texto

Voz y audio

Del sonido al texto y del texto a la voz: espectrogramas, reconocimiento, síntesis y asistentes de voz.

Lecciones: 18Duración: ~19 hAcceso: incluido en todos los planes

Qué vas a aprender

  1. El sonido como datos · Teoría · ~45 min
  2. Espectrogramas y escala Mel · Práctica · ~45 min
  3. Clasificar sonidos · Práctica · ~75 min
  4. Reconocimiento de voz · Práctica · ~45 min
  5. Transformers para audio · Teoría · ~45 min
  6. Whisper: usarlo y ajustarlo · Práctica · ~75 min
  7. ¿Quién habla? Identificar voces · Práctica · ~45 min
  8. Detectar la voz y los turnos de palabra · Práctica · ~45 min
  9. De texto a voz · Práctica · ~75 min
  10. Clonar y convertir voces · Práctica · ~75 min
  11. Comprimir audio con redes neuronales · Teoría · ~60 min
  12. Generar música · Práctica · ~75 min
  13. Modelos que entienden audio y texto · Teoría · ~45 min
  14. Audio en tiempo real · Práctica · ~75 min
  15. Conversaciones de voz a voz en streaming · Teoría · ~75 min
  16. Voces falsas y marcas de agua · Práctica · ~75 min
  17. Medir la calidad del audio · Teoría · ~60 min
  18. Proyecto: tu asistente de voz · Práctica · ~120 min

Cómo se aprende aquí: cada lección termina con una práctica interactiva que se corrige sola, y los ejemplos de Python se ejecutan en tu navegador.

Ver planes desde 25 € → Probar las lecciones gratis