| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 4.42 MB | Adobe PDF |
Autores
Orientador(es)
Resumo(s)
Voice signals are a rich source of personal information, which makes them widely
used in many applications, particularly in recognition, leading to the main objective of
the present work: study the possibility of predicting gender, age, and emotional state
through short voice interactions with a mobile device (a smartphone or remote control)
and based on the physiology of speech features, using Machine Learning (ML) and Deep
Learning (DL) algorithms.
As a starting point of this dissertation, a proof of concept was conducted with existing
databases to verify if the main objective mentioned previously was viable, with Brazilian
Portuguese, Catalan and English samples. Next, data acquisition was carried out to create
a Portuguese dataset, consisting of 156 samples of 88 different people. After the audio
data was collected, it was pre-processed and used in the gender recognition, age group
recognition, and emotion recognition models.
Regarding ML, Support Vector Machine (SVM), K-Nearest Neighbors (KNN), and Random
Forest algorithms were tested. The gender recognition model achieved an accuracy
of 87.8%, the age group recognition model achieved 83.4%, and 94.6% was reached for
the emotion recognition model. The SVM algorithm produced the best results for all
models. Concerning DL, a Time-Delay Neural Network (TDNN) algorithm was tested.
The gender recognition model achieved an accuracy of 85.7%, the age group recognition
model an accuracy of 51.6%, and the emotion recognition model an accuracy of 88.9%.
With this work, and based on the best results, it is possible to conclude that gender, age
group and emotion can be recognized with good accuracy using voice signals. In addition,
a platform was developed capable of showing the results of the developed models in an
easy-understanding way for people with no technical skills. Future work should be done
in order to improve the performance of these models by increasing the dataset.
Sinais de voz são uma fonte rica de informações pessoais, tornando-os muito usados em várias aplicações, particularmente em reconhecimento, levando ao objetivo principal do presente trabalho: estudar a possibilidade de prever o género, idade e estado emocional através de curtas interações de voz com um dispositivo móvel (um smartphone ou um comando), baseado em parâmetros da fisiologia da voz, usando algoritmos de Machine Learning (ML) e Deep Learning (DL). Como ponto inicial desta dissertação, foi realizada uma validação do conceito com bases de dados existentes, para verificar se o objetivo principal mencionado anteriormente era viável. Para isso foram usadas amostras em Português do Brasil, em Catalão e em Inglês. De seguida, foi realizada uma aquisição de dados por forma a criar um dataset Português que, no fim, consiste em 156 amostras de 88 pessoas diferentes. Depois das amostras serem recolhidas, foram pré processadas e, com recurso a ML, usadas nos modelos de reconhecimento de género, faixa etária e emoção. No que diz respeito a ML, os algoritmos testados foram Support Vector Machine (SVM), K-Nearest Neighbors (KNN) e Random Forest. O modelo de reconhecimento de género alcançou uma eficácia de 87.8%, o de reconhecimento de faixa etária alcançou 83.4%, e 94.6% foi a eficácia alcançada para o de reconhecimento de emoção. O algoritmo SVM foi o que produziu melhores resultados para os modelos. Relativamente a DL, foi testado um algoritmo Time-Delay Neural Network (TDNN). O modelo de reconhecimento de género alcançou uma eficácia de 85.7%, o modelo de reconhecimento de faixa etária uma eficácia de 51.6%, e o modelo de reconhecimento de emoções alcançou uma eficácia de 88.9%. Com este projeto, e com base nos melhores resultados obtidos, é possível concluir que o género, a faixa etária e a emoção podem ser reconhecidos com boa exatidão através de sinais de voz. Para tornar os resultados dos modelos desenvolvidos mais acessíveis a pessoas sem capacidades técnicas, foi ainda desenvolvida uma plataforma de fácil entendimento. No sentido de melhorar o desempenho dos modelos, e como trabalho futuro, sugere-se uma nova aquisição de dados por forma a aumentar o conjunto de dados.
Sinais de voz são uma fonte rica de informações pessoais, tornando-os muito usados em várias aplicações, particularmente em reconhecimento, levando ao objetivo principal do presente trabalho: estudar a possibilidade de prever o género, idade e estado emocional através de curtas interações de voz com um dispositivo móvel (um smartphone ou um comando), baseado em parâmetros da fisiologia da voz, usando algoritmos de Machine Learning (ML) e Deep Learning (DL). Como ponto inicial desta dissertação, foi realizada uma validação do conceito com bases de dados existentes, para verificar se o objetivo principal mencionado anteriormente era viável. Para isso foram usadas amostras em Português do Brasil, em Catalão e em Inglês. De seguida, foi realizada uma aquisição de dados por forma a criar um dataset Português que, no fim, consiste em 156 amostras de 88 pessoas diferentes. Depois das amostras serem recolhidas, foram pré processadas e, com recurso a ML, usadas nos modelos de reconhecimento de género, faixa etária e emoção. No que diz respeito a ML, os algoritmos testados foram Support Vector Machine (SVM), K-Nearest Neighbors (KNN) e Random Forest. O modelo de reconhecimento de género alcançou uma eficácia de 87.8%, o de reconhecimento de faixa etária alcançou 83.4%, e 94.6% foi a eficácia alcançada para o de reconhecimento de emoção. O algoritmo SVM foi o que produziu melhores resultados para os modelos. Relativamente a DL, foi testado um algoritmo Time-Delay Neural Network (TDNN). O modelo de reconhecimento de género alcançou uma eficácia de 85.7%, o modelo de reconhecimento de faixa etária uma eficácia de 51.6%, e o modelo de reconhecimento de emoções alcançou uma eficácia de 88.9%. Com este projeto, e com base nos melhores resultados obtidos, é possível concluir que o género, a faixa etária e a emoção podem ser reconhecidos com boa exatidão através de sinais de voz. Para tornar os resultados dos modelos desenvolvidos mais acessíveis a pessoas sem capacidades técnicas, foi ainda desenvolvida uma plataforma de fácil entendimento. No sentido de melhorar o desempenho dos modelos, e como trabalho futuro, sugere-se uma nova aquisição de dados por forma a aumentar o conjunto de dados.
Descrição
Palavras-chave
Voice Signal Gender Age Emotion Machine Learning Deep Learning
