Mensch oder Bot: So erstellen Sie jemanden, der mit Ihnen telefoniert

Welche Möglichkeiten gibt es, einen Bot zu äußern?

Es gibt im Wesentlichen zwei Möglichkeiten, einem Bot eine Stimme zu geben: mithilfe der Sprachsynthese oder

Nehmen Sie Zeilen mit der Stimme des Ansagers auf.Im ersten Fall erhalten Sie eine angenehme, korrekte, aber meist emotionslose Sprachausgabe, im zweiten Fall eine lebendige, natürliche Sprache. Beide Methoden haben das Recht auf Leben. Wenn der Sprachassistent beispielsweise zunächst als Roboter positioniert ist, wird leicht mechanische Sprache von den Nutzern nicht negativ wahrgenommen. Wenn das Ziel darin besteht, einen Bot in einen vollwertigen Callcenter-Mitarbeiter zu verwandeln, ist es für ein Unternehmen sinnvoller, vorab aufgezeichnete Sprache zur Bearbeitung von Fragen zu verwenden. 

Eine der bekanntesten Sprachsynthesemethoden ist Evenunter Nicht-Programmierern - TTS. Der Computer liest und spricht einfach den Text. Ein markantes Beispiel ist die Synthese der Speech Services von Google, die im Google Translate-Übersetzer zu hören ist. Die russische Sprache des Dienstes lässt sich sehr leicht von der natürlichen Sprache unterscheiden, was das Hauptproblem einer solchen Synthese darstellt. Um den nötigen Schwerpunkt zu setzen, verwenden Sie SSML – Sprachsynthese-Markup. Aber selbst damit ist es schwierig, den Klang eines professionellen Ansagers zu erreichen. Deshalb haben wir begonnen, eine hochwertige Alternative zu entwickeln. 

Warum benötigen Sie eine Sprachsynthese mit Variablen?

Unternehmen nutzen aktiv die Möglichkeiten der SpracheBots und ist bestrebt, ihre Ansprache gegenüber den Kunden angenehmer und persönlicher zu gestalten. Personalisierung erhöht das Engagement und die Loyalität: 70 % der Unternehmen, die erweiterte Personalisierung nutzen, erzielten mit ihren Bemühungen einen ROI von 200 % oder mehr.

Um die Stimme des Bots realistisch zu gestalten, UnternehmenNehmen Sie die Stimme eines Ansagers, Schauspielers oder Contact-Center-Mitarbeiters auf. Der Nachteil ist, dass alle Replikate statisch sind. Dies eignet sich beispielsweise für Hinweise zur Stornierung einer Bestellung oder zur Information über aktuelle Aktionen. Aber Geschäftskommunikation enthält viele sich ändernde Daten – Variablen.

Um die Stimme eines Bots realistisch zu gestalten, zeichnen Unternehmen die Stimme eines Erzählers, Schauspielers oder Contact-Center-Mitarbeiters auf. Der Nachteil ist, dass alle Replikate statisch sind.

Um beispielsweise einen Termin in einer Klinik zu bestätigen:Name des Patienten, Name des Arztes, Datum und Uhrzeit des Termins. Im Falle einer Lieferung: vollständiger Name des Kunden, Bestellnummer und deren Inhalt, Menge und Lieferzeit. Jeder Eintrag muss individuelle Parameter des Auftraggebers bzw. seiner Anfrage enthalten. Und dann kommen Dateiklebungen, Audiomischungen oder einfach Roboter-Sprachausgabe zum Einsatz. 

Das Wesentliche am Kleben ist, dass es etwas schafft„Bewerbungen“ aus zahlreichen Aufnahmen des Ansagers. Im Falle einer Lieferung müssen Sie etwa 1,5 Tausend häufig vorkommende Straßen, Städtenamen, Haus- und Wohnungsnummern aufschreiben. Dies ist eine sehr arbeitsintensive Aufgabe, die vom Ansager viel Aufwand und Zeit erfordert. Nach der Aufnahme müssen die Audiodateien in der richtigen Reihenfolge zusammengefügt werden. Ein professioneller Tontechniker kann fließende Übergänge zwischen Schnitten und Pausen herstellen, die Übergänge sind jedoch weiterhin hörbar, und große Mengen an Quelldaten machen diese Arbeit überwältigend. Wir haben diese Option ausprobiert, mussten jedoch feststellen, dass sie zur Lösung komplexer Probleme nicht geeignet ist. 

Wir wissen, dass einige Unternehmen versuchen, einen Sprecher zu finden, dessen Stimme der standardmäßigen SpeechKit-Sprachausgabe von Yandex oder Google Speech ähnelt. Aber auch in diesem Fall sind die Einlagen hörbar. 

Wir haben versucht, es in Voice-Over-Aufnahmen zu integrierenTTS. Das heißt, wir haben nicht alle Namen von Straßen und Städten im Voraus aufgezeichnet, sondern mithilfe von TTS basierend auf der Stimme des Ansagers die gewünschte Phrase generiert und diese in die zuvor aufgezeichnete Nachbildung des Ansagers eingefügt. Das Ergebnis war eine Mischung aus emotionaler, lebendiger Rede eines Menschen und eines Roboters. 

Was auch immer wir aus verschiedenen Instrumenten ausprobieren,Wir hatten kein gutes Ergebnis. Infolgedessen entwickelten wir unseren eigenen Algorithmus, den wir Hybridsynthese nannten. Mit dieser Technologie können Sie Phrasen in Voice-Over-Aufnahmen für einen Voice-Bot schnell ändern. Sie müssen lediglich die Ersetzung an den Algorithmus übergeben. Gleichzeitig kopiert die synthetische Sprache die Intonation und Emotionen des Sprechers, klingt natürlich und hebt sich nicht vom Kontext ab. Auf diese Weise können Sie alle Variablen aussprechen, die nicht in der ursprünglichen Voice-Over-Aufnahme enthalten waren, und neue Szenarien testen. 

TTS

Wie funktioniert die Hybridsynthese?

Die erste Stufe ist die Zusammenarbeit mit Ansagern.Um die Vielfalt der russischen Sprache abzudecken, war es notwendig, 10 Stunden Rede in einem professionellen Studio aufzunehmen. Dabei handelt es sich um Phrasen aus Büchern, Nachrichten und häufig vorkommenden Daten: Ziffern, Namen, Adressen und Städte. Dadurch stehen genügend Trainingsdaten zur Verfügung, sodass Sie mit der Erstellung hybrider Synthesemodelle für jeden Sprecher beginnen können.

Für jedes Robocall-Projekt schreibt der Ansager Satzvorlagen auf, zum Beispiel: „Hallo,Sergej Petrowitsch! Morgen liefern wir Ihre Bestellung an Ihre AdresseTwerskaja-Straße, 3Mit14 bis 18Std.Wird es für Sie bequem sein, es anzunehmen?“ Das hybride Synthesemodell kann Aufgaben verarbeiten, z. B. wenn es notwendig ist, Sergei Petrowitsch durch Anna Wassiljewna zu ersetzen, sowie die Adresse und Uhrzeit – an die Bolschaja-Zelenina-Straße 24 von 10 bis 14 Uhr. Das Ergebnis ist eine neue Replik mit synthetisierten Variablen: „Hallo,Anna Wassiljewna! Morgen liefern wir Ihre Bestellung an Ihre AdresseBolshaya Zelenina-Straße, 24Mit10 bis 14Std. Wird es für Sie bequem sein, es anzunehmen?“ Für jeden Anruf beim Kundenstamm wird eine separate Aufgabe erstellt und ausgeführt. 

Voice-over

Eine hohe Klangqualität wird dadurch erreicht, dass das neuronale Netzwerk die Intonationen und Emotionen des Sprechers aus dem Beispiel nutzt. 

So richten Sie die Hybridsynthese ein 

Wir bieten mehrere fertige Modelle anHybridsynthese mit Frauen- und Männerstimmen. Vorlagenaufrufe funktionieren auf den Plattformen JAICP und JAICF; Aufrufe von Bots, die in anderen Diensten erstellt wurden, sind über die API möglich. Das Einrichten eines Skripts von Grund auf dauert mehrere Stunden. Eine synthetisierte Nachbildung kostet 12 Kopeken, das Voice-Over einer Vorlage für ein Projekt kostet 3.000 Rubel pro Arbeitsstunde des Ansagers.

Die Menge der vorgefertigten Stimmen wird erweitert.Es besteht auch die Möglichkeit, die Just AI-Hybridsynthese mit der Erstellung eines Modells für einen individuell ausgewählten Ansager oder die offizielle Stimme des Unternehmens zu verwenden.

Hybridsynthese

Die Hybrid-Synthese-Technologie ermöglicht es Ihnen, IVR- und Roboteranrufe für NPS-Umfragen, Fragebögen, Erinnerungen, Upsale und Unterstützung für Treueprogramme zu personalisieren.

Weiter lesen:

Ein Schwarzes Loch in der Galaxie gab Einstein Recht. Die Hauptsache

Der Weltraum zerstört Knochen und verändert ihre Struktur: Wissenschaftler wissen nicht, wie Menschen zum Mars fliegen werden

Astronomen haben Planeten gefunden, die sich von der Erde unterscheiden, aber für Leben geeignet sind