Humano o bot: cómo crear a alguien que te hable por teléfono

¿Cuáles son las formas de expresar un bot?

Hay dos formas principales de expresar un bot: usando síntesis de voz o

grabar líneas en la voz del locutor.En el primer caso, obtendrá una actuación de voz agradable, correcta, pero a menudo impasible, en el segundo, un habla vivaz y natural. Ambos métodos tienen derecho a la vida. Por ejemplo, si el asistente de voz se posiciona inicialmente como un robot, los usuarios no percibirán negativamente el habla ligeramente mecánica. Si el objetivo es convertir un bot en un empleado de pleno derecho de un centro de llamadas, entonces tiene más sentido que una empresa utilice discursos pregrabados para procesar las preguntas.

Uno de los métodos de síntesis de voz más famosos es inclusoentre los no programadores - TTS. La computadora simplemente lee y pronuncia el texto. Un ejemplo sorprendente es la síntesis de los servicios de voz de Google, que se puede escuchar en el traductor de Google Translate. El habla rusa del servicio es muy fácil de distinguir del habla natural, que es el principal problema de dicha síntesis. Para poner el énfasis necesario, utilice SSML: marcado de síntesis de voz. Pero incluso con eso, es difícil lograr un sonido como el de un locutor profesional. Por ello, comenzamos a desarrollar una alternativa de alta calidad.

¿Por qué necesitas síntesis de voz con variables?

Las empresas están utilizando activamente las capacidades de la voz.bots y se esfuerza por hacer que su discurso sea más agradable y personalizado hacia los clientes. La personalización aumenta el compromiso y la lealtad: el 70 % de las empresas que utilizan la personalización avanzada obtuvieron un retorno de la inversión del 200 % o más en sus esfuerzos.

Para que la voz del robot sea realista, las empresasgrabar la voz de un locutor, actor u operador del centro de contacto. La desventaja es que todas las réplicas son estáticas. Esto es adecuado, por ejemplo, para recibir instrucciones sobre cómo cancelar un pedido o informar sobre promociones actuales. Pero las comunicaciones empresariales contienen muchos datos cambiantes: variables. 

Para que la voz de un bot sea realista, las empresas graban la voz de un narrador, actor u operador de un centro de contacto. La desventaja es que todas las réplicas son estáticas.

Por ejemplo, para confirmar una cita en una clínica:Nombre del paciente, nombre del médico, fecha y hora de la cita. En el caso de entrega: nombre completo del cliente, número de pedido y su contenido, importe y plazo de entrega. Cada entrada debe contener parámetros individuales del cliente o su solicitud. Y luego se utiliza el pegado de archivos, mezclas de audio o simplemente actuación de voz robótica.

La esencia del pegado es que crea.“aplicaciones” de numerosas grabaciones del locutor. En el caso de la entrega, es necesario anotar alrededor de 1,5 mil calles, nombres de ciudades y números de casas y apartamentos que aparecen con frecuencia. Esta es una tarea que requiere mucha mano de obra y requiere mucho esfuerzo y tiempo por parte del locutor. Después de la grabación, los archivos de audio deben fusionarse en la secuencia correcta. Un ingeniero de sonido profesional puede realizar transiciones suaves entre cortes y pausas, pero las uniones seguirán siendo audibles y grandes cantidades de datos fuente hacen que ese trabajo sea abrumador. Probamos esta opción, pero nos dimos cuenta de que no era adecuada para resolver problemas complejos.

Sabemos que algunas empresas están intentando encontrar un altavoz con una voz similar a la actuación de voz SpeechKit estándar de Yandex o Google Speech. Pero en este caso también se oyen las inserciones. 

Intentamos integrarlo en grabaciones de voz en off.TTS. Es decir, no grabamos todos los nombres de calles y ciudades de antemano, sino que generamos la frase deseada usando TTS basándose en la voz del locutor y la insertamos en la réplica del locutor pregrabada. El resultado fue una mezcla de discurso emocional y vivo de una persona y un robot.

Cualquier cosa que intentemos con varios instrumentos,No obtuvimos un buen resultado. Como resultado, llegamos a desarrollar nuestro propio algoritmo, al que llamamos síntesis híbrida. Esta tecnología le permite cambiar rápidamente frases en grabaciones de voz en off para un robot de voz; solo necesita pasar el reemplazo al algoritmo; Al mismo tiempo, el habla sintetizada copia la entonación y las emociones del hablante, suena natural y no se destaca del contexto. De esta manera, podrás expresar cualquier variable que no estuviera en la grabación de voz en off original, así como probar nuevos escenarios.

TTS

¿Cómo funciona la síntesis híbrida?

La primera etapa es trabajar con locutores.Para cubrir la diversidad de la lengua rusa, fue necesario grabar 10 horas de discurso en un estudio profesional. Son frases de libros, noticias y datos frecuentes: números, nombres, direcciones y ciudades. Esto proporciona suficientes datos de entrenamiento, después de los cuales puede comenzar a crear modelos de síntesis híbridos para cada hablante.

Para cada proyecto de llamada automática, el locutor escribe plantillas de frases, por ejemplo: "Hola,sergei petrovich! Mañana te entregaremos tu pedido en tu dirección.calle Tverskaia, 3Con14 a 18horas.¿Le convendrá aceptarlo? El modelo de síntesis híbrida puede procesar tareas como, por ejemplo, cuándo es necesario reemplazar a Sergei Petrovich por Anna Vasilyevna, y la dirección y la hora: en la calle Bolshaya Zelenina, 24, de 10 a 14 horas. El resultado es una nueva réplica con variables sintetizadas: “Hola,Anna vasilievna! Mañana te entregaremos tu pedido en tu dirección.Calle Bolshaya Zelenina, 24Con10 a 14horas. ¿Le convendrá aceptarlo? Para cada llamada a la base de clientes, se crea y ejecuta una tarea independiente.

Narración

La alta calidad del sonido se logra gracias a que la red neuronal utiliza las entonaciones y emociones del hablante del ejemplo.

Cómo configurar la síntesis híbrida

Ofrecemos varios modelos confeccionados.Síntesis híbrida con voces femeninas y masculinas. Las llamadas de plantilla funcionan en las plataformas JAICP y JAICF; las llamadas desde bots creados en otros servicios son posibles a través de la API. Configurar un script desde cero lleva varias horas. Una réplica sintetizada cuesta 12 kopeks, la voz en off de una plantilla para un proyecto cuesta 3.000 rublos por hora de trabajo del locutor.

El conjunto de voces preparadas se ampliará.También existe la opción de utilizar la síntesis híbrida Just AI con la creación de un modelo para un locutor seleccionado individualmente o que sea la voz oficial de la empresa.

síntesis híbrida

La tecnología de síntesis híbrida le permite personalizar IVR y llamadas robóticas para fines de encuestas NPS, cuestionarios, recordatorios, ventas adicionales y soporte para programas de fidelización.

Lee mas:

Un agujero negro en la galaxia le dio la razón a Einstein. Lo principal

El espacio destruye huesos y cambia su estructura: los científicos no saben cómo la gente volará a Marte

Los astrónomos han encontrado planetas que son diferentes a la Tierra, pero aptos para la vida