Assistente Zuckerberg e o sistema operacional "Samantha": dois tipos de sistemas de voz
Eu trabalho em um laboratório
Há duas maneiras de ver o que éassistente de voz. Imagine que você tem um mordomo virtual. Por exemplo, cerca de cinco anos atrás, Mark Zuckerberg fez um assistente inteligente em sua casa, o chamou de "Jarvis". Ele sabia deixar as pessoas entrarem na casa, abrir e fechar portas, cortinas, acender a luz. Outros exemplos de tais dispositivos são "Alexa" e "Alice", eles vivem no dispositivo e são capazes de melhorar a vida. Eles podem controlar o forno, máquina de lavar, aspirador de pó e assim por diante.
Outra maneira de olhar para os assistentes é comointerface. No filme "Ela" havia um sistema operacional chamado "Samantha", na dublagem russa ela tinha a mesma voz que "Alice" do Yandex. Ela atuou como uma interface para o gerenciamento do sistema operacional e não foi projetada como assistente. A Apple tem essa abordagem - Siri, Microsoft - Сortana, Google - Google Assistant.
Como eles funcionam?
Todos os assistentes são construídos em uma estrutura muito semelhanteprincípio. A primeira coisa que ele precisa fazer é ouvir a voz. Isso acontece no dispositivo do usuário - um telefone celular ou um alto-falante inteligente. O usuário diz: "Alice", "Alexa", "OK Google". Após essas palavras mágicas, o aparelho está pronto para gravar a voz do usuário. Isso acontece até certo ponto - até que o cliente fique em silêncio ou o dispositivo esteja cansado de esperar até que fique em silêncio. Depois disso, os dados são enviados para o servidor da empresa, que presta os serviços.
É aqui que a magia começa.A primeira operação é a conversão de fala para texto. Todo mundo diz de forma diferente, como faço para converter isso em texto? Então começa o que usamos para assistentes de voz - a prestação de um serviço. Esta é qualquer operação disponível online - compra de ingressos, reserva de mesa em um restaurante. A única questão é como fornecer uma interface amigável. Se não estiver lá, o dispositivo se transforma em um locutor.
Após chamar o serviço, o usuário precisaretornar os resultados, para isso você precisa embalá-los corretamente. Muito provavelmente, será um texto, uma edição de uma página na Internet, uma música, dados que a calculadora calculou. Os dados são convertidos novamente em fala e transmitidos ao cliente.
Fala para texto
Nossa comunicação se dá por meio da fala, a voz émovimento do ar ao redor. Essas vibrações caem no tímpano, ele empurra três ossos - o estribo, a bigorna e o martelo. Esses, por sua vez, balançam um órgão chamado caracol. Pegamos o caracol do peixe, ele está cheio de água e as células ciliadas vivem nele, elas oscilam junto com a água do caracol. As células ciliadas superiores amplificam as flutuações no fluido e as transmitem para a parte inferior das células ciliadas, que formam um impulso elétrico. Este impulso é transmitido ao cérebro.
Além disso, em diferentes locais da cóclea, as células ciliadas são responsáveis por diferentes frequências. As frequências altas são processadas na parte larga, as frequências médias ficam no meio e as frequências baixas mais próximas do centro.
Como podemos fazer a máquina perceber um som assimda mesma forma - não na forma de um sinal bruto, mas na forma de um conjunto de frequências? A resposta a esta pergunta foi dada pelo matemático francês Jean Baptiste Fourier, que viveu na fronteira dos séculos XVIII-XIX. O cientista propôs essa transformação matemática, com a qual tudo é igual ao ouvido - um sinal bruto é obtido e decomposto em componentes de frequência.
O que fazer com os componentes de frequência?Podemos mapear uma representação espectral para um fonema, ou seja, podemos converter a fala em fonemas. Eles são mais ou menos facilmente convertidos por algoritmos em letras. Ou seja, podemos obter uma palavra a partir de uma representação fonética.
Mas tudo isso é impreciso.Existem fonemas que diferem um pouco, as transições de um som para outro podem soar diferentes. Chamam-se senones, são cerca de 10 mil, mas quando são tantos, a tarefa de definir palavras torna-se muito mais difícil.

Combatendo bugs
Como os pesquisadores lidam com os erros?A resposta a esta pergunta foi dada pelo matemático russo Andrei Markov, que viveu na virada dos séculos 19 para 20. Ele desenvolveu uma teoria descrevendo processos onde um segue do outro. E graças à sua teoria, foram desenvolvidos modelos ocultos de Markov. Esta é uma das primeiras maneiras de corrigir erros desse tipo.
Por exemplo, quando uma pessoa fala indistintamente, elasotaque ou ele pronuncia errado a palavra - existe um mecanismo matemático que permite restaurar e determinar com alta precisão o que a pessoa quis dizer. Afinal, as pessoas também erram, mas se entendem, o que significa que temos um mecanismo de correção de erros em nossas cabeças.
Mas a representação de texto não é suficiente -computador trabalha com números. Como obtê-los? Noam Chomsky tem uma hipótese de que temos uma estrutura no cérebro, além disso, disponível no nível do nascimento, o que nos ajuda a aprender línguas naturais rapidamente. Chomsky ao longo de sua vida constrói, refina e trabalha em um modelo que determina quais padrões comuns existem em um idioma, não importa o que seja - russo, inglês ou chinês.
No slide - a gramática de Chomsky.Isso é quase a mesma coisa que eles fazem nas aulas de russo quando analisam uma frase por composição. Existem substantivos, adjetivos, sujeitos, predicados, grupos de verbos - tudo isso é formalizado e pode ser mostrado à máquina. Essa estrutura é facilmente representada na forma de números.
A máquina pode entender qual é o assunto emproposta e que medidas tomar. Por exemplo, se o cliente disser: “Alice, ligue uma música”, então “ligar” será a ação, “música” será o objeto no qual a ação ocorre. "Alice" entenderá o cliente e começará a agir.
Mas as próprias palavras são uma coleção de letras, comocompreender o seu significado? Existem palavras semelhantes - "play" e "play", o dispositivo entenderá que isso é a mesma coisa? A resposta a esta pergunta foi dada pelo linguista americano Leonardo Bloomfield. No início do século XX, ele propôs uma teoria em que o significado de uma palavra é determinado pelo contexto em que essa palavra está localizada. Olhe para o slide e pense em qual palavra pode ser substituída por três pontos.

Minha resposta seria um elefante, mas quando pergunteialunos, eles dizem que pode haver um rinoceronte ou mesmo uma girafa. Mas, em geral, entendemos que este é um grande animal que vive na África e que pode ficar com raiva. Se combinarmos tudo isso, obteremos alguma descrição semântica desse objeto sem usar a palavra em si.
Mas se digitalizarmos, teremos dezenas de milhares de números.E graças ao matemático americano Gene Golub, ele conseguiu descobrir como reduzir significativamente o número de dígitos.Em vez de usar números, eles usaram uma coleção de dígitos chamada vetor.E esse vetor pode ser usado para entender proximidade ou distância no significado, coerência semântica.Dessa forma, você pode entender que "brincar" é mais ou menos o mesmo que "brincar".
Agora existem ferramentas onde você pode inserir palavras, e ficará claro como elas estão distribuídas no mapa de significados.Por exemplo, as palavras "girafa", "elefante" e "rinoceronte" são agrupadas no espaço de significados.Esses métodos evoluíram e agora parecem muito mais avançados.
Apresentamos palavras na forma de uma estrutura, frases na forma de uma estrutura, apresentamos palavras na forma de significados, tudo isso na forma de números, o que vem a seguir?
Serviços
Cada serviço tem centenas de milhares, milhões,bilhões de objetos. Se estamos falando de pesquisar na Internet, são centenas de bilhões de páginas, dezenas de bilhões de imagens. Se streaming de música, milhões de músicas.
Uma das primeiras abordagens para indexação de dados -construção de árvores de busca binária. O mesmo é usado nos dicionários: você abre no meio, e se pulou a palavra certa, volta para trás, se não entendeu, vá em frente. Mas em 1962, os matemáticos soviéticos Georgy Adelson-Velsky e Evgeniy Landis criaram uma estrutura de dados que se mantém em um estado de pesquisa rápida.
Este sistema só funciona em dados lineares -números ou palavras. E o que acontecerá com os dados multidimensionais se quisermos procurar algo em um mapa ou no espaço tridimensional? Para fazer isso, eles criaram estruturas como kd-trees, que lidam perfeitamente com as tarefas de busca no espaço tridimensional. Mas eles pararam de trabalhar para tarefas modernas, onde o texto é descrito por centenas de números.
Mas graças ao trabalho teórico do final do século XXEric Berninson propôs o desenvolvimento de árvores de busca, chamadas Anna, que podem ser usadas para garantir uma boa qualidade de busca em coleções enormes. Isso funciona para toda a vasta base do Spotify - um resultado maravilhoso que foi obtido apenas cinco anos atrás.

Existem também outras abordagens:por exemplo, o sociólogo Stanley Milgram realizou experimentos bizarros e às vezes desumanos. Ele deu origem à teoria dos seis apertos de mão, que todas as pessoas na Terra se conhecem através de não mais que seis apertos de mão. Para fazer isso, ele pediu às pessoas que enviassem uma carta a um estranho. Eles então tiveram que escolher entre seus conhecidos aqueles que poderiam estar familiarizados com essa pessoa. E aconteceu que eles levaram seis letras para fazer isso. O experimento foi criticado, mas repetido nos anos 2000 - e confirmou os resultados.
Esta é uma propriedade incrível, que em matemáticaadquiriu o nome de Conde "Small World". Cientistas russos - o grupo de Yuri Malkov - propuseram um algoritmo interessante. Eles o usavam para encontrar qualquer coisa em qualquer lugar. Os nós neste gráfico não são mais pessoas, mas documentos.
Neste gráfico - a distância mais curta entre qualquerum par de objetos. Os usuários podem encontrar o que precisamos muito rapidamente. Essa estrutura de dados agora é usada em muitas empresas na Rússia e no exterior - Facebook, Mail.ru, Yandex. Um excelente modelo matemático que mudou não apenas os serviços de busca e recomendação, mas também os assistentes de voz.
Consulte Mais informação
Veja a primeira nave orbital de estágio único do mundo do futuro
Durante três anos, os cientistas acreditaram que havia água no sul de Marte. Acontece que não era
Uma aeronave hipersônica movida a hidrogênio pode atingir velocidades de até Mach 12. São quase 15.000 km/h