Del visual al auditivo: sonorización de escenas guiada por imagen

54º Congreso Español de Acústica — Tecniacústica 2023

Paper Language
ES · Español
Date / Time
Author
María Sánchez RuizETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Author 2
Laura Fernández GalindoETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Author 3
Julián Arias LondoñoETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Author 4
Mateo José Cámara LargoETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Author 5
Giulia CominiAmazon.com
Author 6
Adam GabrysAmazon.com
Author 7
José Luis Blanco MurilloETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Author 8
Juan Ignacio Godino LlorenteETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Author 9
Luis Alfonso Hernández GómezETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, España
Pags
821-830
Session
PSA-1 Nuevos métodos PSA y Aplicaciones de IA.
Subsession

Abstract

Los recientes avances en las técnicas generativas de imagen, vídeo, texto y audio, y su uso por el gran público, están propiciando nuevas formas de generación de contenidos. Habitualmente, se abordaba cada modalidad por separado, lo que plantea limitaciones. La sonorización automática de secuencias visuales es uno de los mayores desafíos de cara a la generación automática de contenidos multimodales. Presentamos un flujo de procesamiento que, a partir de imágenes extraídas de vídeos, es capaz de sonorizarlas. Trabajamos con modelos pre-entrenados que emplean complejos codificadores, aprendizaje contrastivo, y múltiples modalidades, permitiendo representaciones complejas de las secuencias para su sonorización. El esquema propuesto plantea distintas posibilidades para la asignación de los audios y el guiado por texto. Evaluamos el esquema sobre un dataset de marcos extraídos de un videojuego comercial y sonidos extraídos de la plataforma Freesound. Las pruebas subjetivas han evidenciado que el esquema propuesto es capaz de generar y asignar audios automática y convenientemente a las imágenes. Además, se adapta bien a las preferencias de los usuarios, y las métricas objetivas propuestas presentan una correlación elevada con las valoraciones subjetivas.

← Volver al listado de comunicaciones