Del visual al auditivo: sonorización de escenas guiada por imagen
54º Congreso Español de Acústica — Tecniacústica 2023
Abstract
Los recientes avances en las técnicas generativas de imagen, vídeo, texto y audio, y su uso por el gran público, están propiciando nuevas formas de generación de contenidos. Habitualmente, se abordaba cada modalidad por separado, lo que plantea limitaciones. La sonorización automática de secuencias visuales es uno de los mayores desafíos de cara a la generación automática de contenidos multimodales. Presentamos un flujo de procesamiento que, a partir de imágenes extraídas de vídeos, es capaz de sonorizarlas. Trabajamos con modelos pre-entrenados que emplean complejos codificadores, aprendizaje contrastivo, y múltiples modalidades, permitiendo representaciones complejas de las secuencias para su sonorización. El esquema propuesto plantea distintas posibilidades para la asignación de los audios y el guiado por texto. Evaluamos el esquema sobre un dataset de marcos extraídos de un videojuego comercial y sonidos extraídos de la plataforma Freesound. Las pruebas subjetivas han evidenciado que el esquema propuesto es capaz de generar y asignar audios automática y convenientemente a las imágenes. Además, se adapta bien a las preferencias de los usuarios, y las métricas objetivas propuestas presentan una correlación elevada con las valoraciones subjetivas.