Este modelo, apresentado em um artigo na revista Mobile Networks and Applications, foi treinado para reconhecer emoções em seres humanos.
"Modelo multi-informativo do algoritmo comuma tomada de decisão é criada por meio do reconhecimento de emoções”, escreveram Han Tian, Zhang Zhu e Xu Jing em seu artigo. “O modelo está sendo usado para analisar dados representativos sobre os indivíduos e para ajudar a diagnosticar a depressão nos indivíduos”.
Tian e seus colegas treinaram seu modelo para definirDados DAIC-WOZ, um conjunto de expressões faciais em áudio e 3D de pacientes com diagnóstico de transtorno depressivo e pessoas sem depressão. Essas gravações de áudio e expressões faciais foram coletadas durante entrevistas realizadas por um agente virtual que fez diversas perguntas sobre o humor e a vida do entrevistado.
“Com base no estudo das características da fala de pessoas comtranstorno depressivo, este artigo fornece um estudo aprofundado sobre o diagnóstico de depressão usando a fala com base em dados de fala do conjunto de dados DAIC-WOZ, escreveram Tian, Zhu e Jian em seu estudo. - Em primeiro lugar, as informações de fala são pré-processadas, incluindo pré-ênfase de fala, enquadramento, detecção de endpoint, eliminação de ruído, etc. Em segundo lugar, OpenSmile é usado para extrair características de sinais de fala, e características de fala que podem refletir funções são estudadas e analisadas em profundidade .
Para extrair recursos importantes da vozregistros, o modelo da equipe usa OpenSmile (interpretação de fala e música de código aberto por extração de grande espaço). É um conjunto de ferramentas frequentemente usado por cientistas da computação para extrair recursos de clipes de áudio e classificá-los.
Os pesquisadores usaram essa ferramenta paraextração de características individuais da fala e suas combinações, geralmente encontradas na fala de pacientes com diagnóstico de depressão. Posteriormente, eles usaram uma técnica conhecida como Análise de Componentes Principais para reduzir o conjunto de recursos extraídos.
Tian, Zhu e Jian avaliaram seu modelo na sérietestes nos quais avaliaram sua capacidade de detectar pessoas deprimidas e não deprimidas a partir de suas gravações de voz. Seu esquema produziu resultados notáveis, detectando depressão com uma precisão de 87% em pacientes do sexo masculino e 87,5% em pacientes do sexo feminino.
No futuro, algoritmo de aprendizagem profunda,desenvolvido por este grupo de pesquisadores pode se tornar uma ferramenta auxiliar adicional para psiquiatras e médicos, juntamente com outras ferramentas de diagnóstico bem estabelecidas. Além disso, esta pesquisa pode inspirar o desenvolvimento de ferramentas de IA semelhantes para detectar sinais de transtornos mentais com base na fala.
Consulte Mais informação:
Duas fotos da Terra com diferença de 50 anos foram comparadas na NASA: o que os cientistas descobriram
Cientistas transplantaram “cérebro” humano em ratos e contaram o que aconteceu no final
ChatGPT entrevistado no Google por um engenheiro de $ 183.000