Reconocimiento de fuentes a partir de medidas sonométricas para el análisis de paisajes sonoros
54º Congreso Español de Acústica — Tecniacústica 2023
Abstract
La medida sonométrica estándar (IEC 61672-1) proporciona espectrogramas en bandas de tercio de octava con una ventana cada 1 s (lento) y 125 ms (rápido). Esta medida se utiliza a menudo en aplicaciones de monitoreo a largo plazo en la acústica urbana, ya que requiere poca capacidad de almacenamiento y preserva la privacidad. Sin embargo, la composición de la escena sonora se pierde y el análisis del entorno sonoro se dificulta. En los últimos años, los algoritmos de clasificación pre-entrenados como YAMnet o PANN han permitido una calidad de clasificación suficiente para tales análisis. Sin embargo, la mayoría de estos algoritmos requieren representaciones espectrales de Mel con una ventana temporal muy rápida (e.g. 10 ms). En este trabajo, proponemos una arquitectura de red neuronal convolucional para la transcodificación de espectrogramas de tercio de octava lentos o rápidos, de modo que puedan ser utilizados como entrada para modelos robustos pre-entrenados. En comparación con la creación de un nuevo modelo que tomaría como entrada espectrogramas de tercio de octava rápidos, esta aproximación es más eficiente y requiere menos entrenamiento. Los experimentos muestran que el modelo propuesto tiene una precisión de clasificación relevante para el análisis del paisaje sonoro.