Humain ou bot : comment créer quelqu'un qui vous parle au téléphone

Quelles sont les façons d'exprimer un bot 

Il existe deux manières principales d'exprimer un robot : en utilisant la synthèse vocale ou

enregistrer des lignes dans la voix de l'annonceur.Dans le premier cas, vous obtiendrez un doublage agréable, correct, mais le plus souvent sans émotion, dans le second - un discours vivant et naturel. Les deux méthodes ont droit à la vie. Par exemple, si l’assistant vocal est initialement positionné comme un robot, alors une parole légèrement mécanique ne sera pas perçue négativement par les utilisateurs. Si l'objectif est de transformer un robot en un employé de centre d'appels à part entière, il est alors plus logique pour une entreprise d'utiliser des discours préenregistrés pour traiter les questions.

L'une des méthodes de synthèse vocale les plus connues est mêmeparmi les non-programmeurs - TTS. L'ordinateur lit et prononce simplement le texte. Un exemple frappant est la synthèse des services vocaux de Google, que l'on peut entendre dans le traducteur Google Translate. Le discours russe du service se distingue très facilement du discours naturel, ce qui constitue le principal problème d'une telle synthèse. Pour mettre l'accent nécessaire, utilisez SSML - balisage de synthèse vocale. Mais même avec cela, il est difficile d’obtenir le son d’un annonceur professionnel. Par conséquent, nous avons commencé à développer une alternative de haute qualité.

Pourquoi avez-vous besoin d'une synthèse vocale avec des variables 

Les entreprises utilisent activement les capacités de la voixbots et s’efforce de rendre leur discours plus agréable et personnalisé envers les clients. La personnalisation augmente l'engagement et la fidélité : 70 % des entreprises utilisant la personnalisation avancée ont enregistré un retour sur investissement de 200 % ou plus sur leurs efforts.

Pour rendre la voix du bot réaliste, les entreprisesenregistrer la voix d'un annonceur, d'un acteur ou d'un opérateur de centre de contact. L'inconvénient est que toutes les répliques sont statiques. Cela convient, par exemple, pour obtenir des instructions sur l'annulation d'une commande ou pour informer sur les promotions en cours. Mais les communications professionnelles contiennent de nombreuses données changeantes, des variables.

Pour rendre la voix d'un robot réaliste, les entreprises enregistrent la voix d'un narrateur, d'un acteur ou d'un opérateur de centre de contact. L'inconvénient est que toutes les répliques sont statiques.

Par exemple, pour confirmer un rendez-vous dans une clinique :Nom du patient, nom du médecin, date et heure du rendez-vous. Dans le cas de livraison : nom complet du client, numéro de commande et son contenu, montant et délai de livraison. Chaque entrée doit contenir des paramètres individuels du client ou de sa demande. Et puis le collage de fichiers, les mixages audio ou simplement le doublage robotique sont utilisés.

L'essence du collage est qu'il crée« candidatures » à partir de nombreux enregistrements de l’annonceur. En cas de livraison, vous devez noter environ 1,5 mille rues, noms de villes, numéros de maisons et d'appartements fréquents. Il s'agit d'une tâche très laborieuse qui nécessite des efforts et du temps considérables de la part de l'annonceur. Après l'enregistrement, les fichiers audio doivent être fusionnés dans le bon ordre. Un ingénieur du son professionnel peut effectuer des transitions fluides entre les montages et placer des pauses, mais les jonctions resteront audibles, et de grandes quantités de données sources rendent ce travail écrasant. Nous avons essayé cette option, mais nous avons réalisé qu'elle n'était pas adaptée pour résoudre des problèmes complexes.

Nous savons que certaines entreprises essaient de trouver un locuteur avec une voix similaire à la voix SpeechKit standard de Yandex ou de Google Speech. Mais dans ce cas, les inserts sont également audibles.

Nous avons essayé de l'intégrer dans les enregistrements de voix offTTS. Autrement dit, nous n’avons pas enregistré tous les noms de rues et de villes à l’avance, mais avons généré la phrase souhaitée à l’aide de TTS en fonction de la voix de l’annonceur et l’avons insérée dans la réplique préenregistrée de l’annonceur. Le résultat était un mélange de discours émotionnels et vivants d'une personne et d'un robot.

Quoi que nous essayions à partir de divers instruments,Nous n'avons pas eu un bon résultat. En conséquence, nous avons développé notre propre algorithme, que nous avons appelé synthèse hybride. Cette technologie vous permet de modifier rapidement des phrases dans des enregistrements de voix off pour un robot vocal ; il vous suffit de transmettre le remplacement à l'algorithme ; Dans le même temps, la parole synthétisée copie l'intonation et les émotions du locuteur, semble naturelle et ne se démarque pas du contexte. De cette façon, vous pouvez exprimer toutes les variables qui ne figuraient pas dans l'enregistrement de voix off d'origine, ainsi que tester de nouveaux scénarios.

STT

Comment fonctionne la synthèse hybride ?

La première étape consiste à travailler avec les annonceurs.Pour couvrir la diversité de la langue russe, il a fallu enregistrer 10 heures de discours dans un studio professionnel. Il s'agit d'expressions tirées de livres, d'actualités et de données fréquentes : chiffres, noms, adresses et villes. Cela fournit suffisamment de données de formation, après quoi vous pouvez commencer à créer des modèles de synthèse hybrides pour chaque locuteur.

Pour chaque projet d'appel automatisé, l'annonceur écrit des modèles de phrases, par exemple : « Bonjour,Sergueï Petrovitch! Demain, nous livrerons votre commande à votre adresseRue Tverskaïa, 3Avec14 à 18heures.Serait-il commode pour vous de l’accepter ? Le modèle de synthèse hybride peut traiter des tâches telles que le moment où il est nécessaire de remplacer Sergei Petrovich par Anna Vasilyevna, ainsi que l'adresse et l'heure - au 24, rue Bolshaya Zelenina, de 10h00 à 14h00. Le résultat est une nouvelle réplique avec des variables synthétisées : « Bonjour,Anna Vassilievna! Demain, nous livrerons votre commande à votre adresseRue Bolshaya Zelenina, 24Avec10 à 14heures. Serait-il commode pour vous de l’accepter ? Pour chaque appel à la clientèle, une tâche distincte est créée et exécutée.

Voix off

Une qualité sonore élevée est obtenue grâce au réseau neuronal qui utilise les intonations et les émotions du locuteur de l'exemple.

Comment configurer la synthèse hybride

Nous proposons plusieurs modèles prêts à l'emploisynthèse hybride avec des voix féminines et masculines. Les appels de modèles fonctionnent sur les plateformes JAICP et JAICF ; les appels de robots créés dans d'autres services sont possibles via l'API. La configuration d'un script à partir de zéro prend plusieurs heures. Une réplique synthétisée coûte 12 kopecks, la voix off d'un modèle de projet coûte 3 000 roubles par heure de travail de l'annonceur.

L'ensemble des voix prêtes à l'emploi s'étoffera.Il existe également une option utilisant la synthèse hybride Just AI avec la création d'un modèle pour un annonceur sélectionné individuellement ou qui est la voix officielle de l'entreprise.

synthèse hybride

La technologie de synthèse hybride permet de personnaliser les appels SVI et robotiques à des fins d'enquêtes NPS, de questionnaires, de rappels, d'upsales et d'accompagnement des programmes de fidélité.

Lire la suite:

Un trou noir dans la galaxie a donné raison à Einstein. La chose principale

L'espace détruit les os et modifie leur structure: les scientifiques ne savent pas comment les gens voleront vers Mars

Les astronomes ont découvert des planètes différentes de la Terre, mais propices à la vie