Logo do repositório
 
A carregar...
Miniatura
Publicação

Analysis of Personal Characteristics and Emotional State From The Voice Signal

Utilize este identificador para referenciar este registo.
Nome:Descrição:Tamanho:Formato: 
Guerreiro_2022.pdf4.42 MBAdobe PDF Ver/Abrir

Resumo(s)

Voice signals are a rich source of personal information, which makes them widely used in many applications, particularly in recognition, leading to the main objective of the present work: study the possibility of predicting gender, age, and emotional state through short voice interactions with a mobile device (a smartphone or remote control) and based on the physiology of speech features, using Machine Learning (ML) and Deep Learning (DL) algorithms. As a starting point of this dissertation, a proof of concept was conducted with existing databases to verify if the main objective mentioned previously was viable, with Brazilian Portuguese, Catalan and English samples. Next, data acquisition was carried out to create a Portuguese dataset, consisting of 156 samples of 88 different people. After the audio data was collected, it was pre-processed and used in the gender recognition, age group recognition, and emotion recognition models. Regarding ML, Support Vector Machine (SVM), K-Nearest Neighbors (KNN), and Random Forest algorithms were tested. The gender recognition model achieved an accuracy of 87.8%, the age group recognition model achieved 83.4%, and 94.6% was reached for the emotion recognition model. The SVM algorithm produced the best results for all models. Concerning DL, a Time-Delay Neural Network (TDNN) algorithm was tested. The gender recognition model achieved an accuracy of 85.7%, the age group recognition model an accuracy of 51.6%, and the emotion recognition model an accuracy of 88.9%. With this work, and based on the best results, it is possible to conclude that gender, age group and emotion can be recognized with good accuracy using voice signals. In addition, a platform was developed capable of showing the results of the developed models in an easy-understanding way for people with no technical skills. Future work should be done in order to improve the performance of these models by increasing the dataset.
Sinais de voz são uma fonte rica de informações pessoais, tornando-os muito usados em várias aplicações, particularmente em reconhecimento, levando ao objetivo principal do presente trabalho: estudar a possibilidade de prever o género, idade e estado emocional através de curtas interações de voz com um dispositivo móvel (um smartphone ou um comando), baseado em parâmetros da fisiologia da voz, usando algoritmos de Machine Learning (ML) e Deep Learning (DL). Como ponto inicial desta dissertação, foi realizada uma validação do conceito com bases de dados existentes, para verificar se o objetivo principal mencionado anteriormente era viável. Para isso foram usadas amostras em Português do Brasil, em Catalão e em Inglês. De seguida, foi realizada uma aquisição de dados por forma a criar um dataset Português que, no fim, consiste em 156 amostras de 88 pessoas diferentes. Depois das amostras serem recolhidas, foram pré processadas e, com recurso a ML, usadas nos modelos de reconhecimento de género, faixa etária e emoção. No que diz respeito a ML, os algoritmos testados foram Support Vector Machine (SVM), K-Nearest Neighbors (KNN) e Random Forest. O modelo de reconhecimento de género alcançou uma eficácia de 87.8%, o de reconhecimento de faixa etária alcançou 83.4%, e 94.6% foi a eficácia alcançada para o de reconhecimento de emoção. O algoritmo SVM foi o que produziu melhores resultados para os modelos. Relativamente a DL, foi testado um algoritmo Time-Delay Neural Network (TDNN). O modelo de reconhecimento de género alcançou uma eficácia de 85.7%, o modelo de reconhecimento de faixa etária uma eficácia de 51.6%, e o modelo de reconhecimento de emoções alcançou uma eficácia de 88.9%. Com este projeto, e com base nos melhores resultados obtidos, é possível concluir que o género, a faixa etária e a emoção podem ser reconhecidos com boa exatidão através de sinais de voz. Para tornar os resultados dos modelos desenvolvidos mais acessíveis a pessoas sem capacidades técnicas, foi ainda desenvolvida uma plataforma de fácil entendimento. No sentido de melhorar o desempenho dos modelos, e como trabalho futuro, sugere-se uma nova aquisição de dados por forma a aumentar o conjunto de dados.

Descrição

Palavras-chave

Voice Signal Gender Age Emotion Machine Learning Deep Learning

Contexto Educativo

Citação

Projetos de investigação

Unidades organizacionais

Fascículo

Editora

Licença CC