Generación de RIRs para modelado de salas mediante ViTGAN
54º Congreso Español de Acústica — Tecniacústica 2023
Abstract
Los modelos de aprendizaje profundo (Deep Learning, DL) se han usado desde hace unos años en aplicaciones de sonido como son la detección de eventos sonoros, cancelación de eco, mejora de la voz o clasificación de géneros musicales, entre otras. Recientemente, las redes neuronales basadas en módulos de atención (Transformers) han demostrado su gran capacidad para capturar relaciones entre las distintas partes de un texto de lenguaje natural, o de una imagen. Estos modelos DL son capaces de identificar relaciones de forma global, en lugar de depender únicamente de la información local cercana. En este trabajo se presenta una investigación exploratoria de la capacidad de este tipo de redes para modelar la respuesta acústica de una sala (Room Impulse Response, RIR) entre dos posiciones cualquiera del emisor y el receptor. Para ello se han usado las RIRs medidas en seis salas distintas con un array circular de 60 altavoces y dos arrays de micrófonos, un array planar y array circular de 64 y 30 micrófonos, respectivamente. Los resultados muestran que los parámetros de la representación tiempo-frecuencia de la RIR y el tipo de función de pérdida utilizada pueden mejorar la calidad de las RIRs inferidas por el Transformer.