Reconocimiento de emociones a través de la señal de voz

54º Congreso Español de Acústica — Tecniacústica 2023

Paper Language
ES · Español
Date / Time
Author
Lorena Álvarez PérezUniversidad Carlos III de Madrid, Leganés, España
Author 2
Álvaro Callejas RamosUniversidad Carlos III de Madrid, Leganés, España
Author 3
Fernando Blanco AlbendeaAccenture Limited
Pags
782-787
Session
PSA-1 Nuevos métodos PSA y Aplicaciones de IA.
Subsession

Abstract

El reconocimiento de emociones es una herramienta muy atractiva debido al gran número de aplicaciones y casos de uso que ofrece. La utilización de algoritmos de aprendizaje automático supervisado permite a la máquina “aprender” a partir de las características de la voz humana, para posteriormente predecir la emoción del hablante en señales de audio desconocidas. En este trabajo se presentan dos sistemas de reconocimiento de emociones: uno para voz hablada (8 emociones) y otro para voz cantada (6 emociones). Asimismo, se incluye un estudio previo de las características de la voz humana y de los clasificadores (de aprendizaje máquina) utilizados, que mejor rendimiento presentan en la tarea de reconocimiento de emociones. Se han llevado a cabo experimentos utilizando la base de datos RADVESS (del inglés “The Ryerson Audio-Visual Database of Emotional Speech and Song”) que contiene 7356 ficheros que corresponden a 24 actores (12 hombres y 12 mujeres) y se han considerado 4 clasificadores: perceptrón multicapa, Random Forest, XGBoost y el algoritmo k-NN. Se comprobará que, dependiendo del tipo de problema a resolver, será mejor un clasificador u otro, y la emoción peor clasificada también dependerá de si la señal de audio es voz hablada o voz cantada.

← Volver al listado de comunicaciones