Menneske eller bot: hvordan man skaber nogen, der taler til dig i telefonen

Hvad er måderne at give udtryk for en bot 

Der er to hovedmåder at stemme en bot på: ved hjælp af talesyntese eller

optage linjer i talerens stemme.I det første tilfælde vil du få en behagelig, korrekt, men oftest følelsesløs stemmeskue, i det andet - livlig, naturlig tale. Begge metoder har ret til liv. For eksempel, hvis stemmeassistenten oprindeligt er placeret som en robot, så vil let mekanisk tale ikke blive opfattet negativt af brugerne. Hvis målet er at gøre en bot til en fuldgyldig callcentermedarbejder, så giver det mere mening for en virksomhed at bruge forudindspillet tale til at behandle spørgsmål. 

En af de mest berømte talesyntesemetoder er enddablandt ikke-programmører - TTS. Computeren læser og siger blot teksten. Et slående eksempel er syntesen af ​​taletjenester fra Google, som kan høres i Google Translate-oversætteren. Tjenestens russiske tale er meget let at skelne fra naturlig tale, hvilket er hovedproblemet ved en sådan syntese. For at lægge den nødvendige vægt, brug SSML - talesyntese-markering. Men selv med det er det svært at opnå en lyd som en professionel announcer. Derfor begyndte vi at udvikle et alternativ af høj kvalitet. 

Hvorfor har du brug for talesyntese med variable 

Virksomheder bruger aktivt stemmens mulighederbots og stræber efter at gøre deres tale mere behagelig og personlig over for kunderne. Personalisering øger engagement og loyalitet: 70 % af virksomheder, der bruger avanceret personalisering, opnåede 200 % ROI eller mere på deres indsats. 

For at gøre botens stemme realistisk, virksomhederoptage stemmen fra en taler, skuespiller eller kontaktcenteroperatør. Ulempen er, at alle replikaer er statiske. Dette er for eksempel velegnet til instruktioner om at annullere en ordre eller informere om aktuelle kampagner. Men virksomhedskommunikation indeholder en masse skiftende data – variabler.

For at gøre en bots stemme realistisk optager virksomheder stemmen fra en fortæller, skuespiller eller kontaktcenteroperatør. Ulempen er, at alle replikaer er statiske.

For eksempel for at bekræfte en aftale på en klinik:Patientens navn, lægens navn, dato og tidspunkt for aftalen. I leveringssagen: kundens fulde navn, ordrenummer og dets indhold, mængde og leveringstid. Hver post skal indeholde individuelle parametre for klienten eller dennes anmodning. Og så bruges fillimning, lydmiks eller blot robot-stemmespil. 

Essensen af ​​limning er, at det skaber"applikationer" fra talrige optagelser af taleren. I tilfælde af levering skal du nedskrive omkring 1,5 tusinde hyppigt forekommende gader, bynavne, hus- og lejlighedsnumre. Dette er en meget arbejdskrævende opgave, som kræver en betydelig indsats og tid fra taleren. Efter optagelsen skal lydfilerne flettes i den rigtige rækkefølge. En professionel lydtekniker kan lave jævne overgange mellem klip og stedspauser, men krydsene vil stadig være hørbare, og store mængder kildedata gør et sådant arbejde overvældende. Vi prøvede denne mulighed, men indså, at den ikke var egnet til at løse komplekse problemer. 

Vi ved, at nogle virksomheder forsøger at finde en højttaler med en stemme, der ligner standard SpeechKit-stemme fra Yandex eller Google Speech. Men i dette tilfælde er indsatserne også hørbare. 

Vi forsøgte at integrere det i voice-over-optagelserTTS. Det vil sige, at vi ikke optog alle navne på gader og byer på forhånd, men genererede den ønskede sætning ved hjælp af TTS baseret på talerens stemme og indsatte den i den forudindspillede talers replika. Resultatet var en blanding af følelsesmæssig, levende tale af en person og en robot. 

Uanset hvad vi prøver fra forskellige instrumenter,Vi havde ikke et godt resultat. Som et resultat kom vi til at udvikle vores egen algoritme, som vi kaldte hybridsyntese. Denne teknologi giver dig mulighed for hurtigt at ændre sætninger i voiceover-optagelser for en stemmebot; du skal bare videregive erstatningen til algoritmen. Samtidig kopierer syntetiseret tale talerens intonation og følelser, lyder naturligt og skiller sig ikke ud fra konteksten. På denne måde kan du stemme alle variabler, der ikke var i den originale voice-over-optagelse, samt teste nye scenarier. 

TTS

Hvordan fungerer hybridsyntese?

Den første fase er at arbejde med announcers.For at dække mangfoldigheden af ​​det russiske sprog var det nødvendigt at optage 10 timers tale i et professionelt studie. Disse er sætninger fra bøger, nyheder og hyppigt forekommende data: tal, navne, adresser og byer. Dette giver nok træningsdata, hvorefter du kan begynde at skabe hybride syntesemodeller for hver højttaler. 

For hvert robocall-projekt skriver taleren ned sætningsskabeloner, for eksempel: "Hej,Sergei Petrovich! I morgen leverer vi din ordre til din adresseTverskaya gade, 3Med14 til 18timer.Vil det være praktisk for dig at acceptere det?” Hybridsyntesemodellen kan behandle opgaver som når det er nødvendigt at erstatte Sergei Petrovich med Anna Vasilyevna, og adressen og tidspunktet - til Bolshaya Zelenina Street, 24 fra 10.00 til 14.00. Resultatet er en ny replika med syntetiserede variable: "Hej,Anna Vasilievna! I morgen leverer vi din ordre til din adresseBolshaya Zelenina gaden, 24Med10 til 14timer. Vil det være praktisk for dig at acceptere det?” For hvert opkald til kundebasen oprettes og udføres en separat opgave. 

Voice over

Høj lydkvalitet opnås på grund af, at det neurale netværk bruger intonationerne og følelserne fra højttaleren fra eksemplet. 

Sådan opsætter du hybridsyntese 

Vi tilbyder flere færdige modellerhybrid syntese med kvindelige og mandlige stemmer. Skabelonopkald fungerer på JAICP- og JAICF-platformene; opkald fra bots oprettet i andre tjenester er mulige via API'et. Opsætning af et script fra bunden tager flere timer. En syntetiseret replika koster 12 kopek, voice-over af en skabelon til et projekt koster 3.000 rubler i timen for talerens arbejde. 

Sættet af færdiglavede stemmer vil udvide sig.Der er også en mulighed for at bruge Just AI hybrid syntese med skabelsen af ​​en model for en individuelt udvalgt announcer eller hvem der er virksomhedens officielle stemme.

hybrid syntese

Hybrid synteseteknologi giver dig mulighed for at tilpasse IVR- og robotopkald med henblik på NPS-undersøgelser, spørgeskemaer, påmindelser, opsalg og support til loyalitetsprogrammer.

Læs mere:

Et sort hul i galaksen viste, at Einstein havde ret. Det vigtigste

Rummet ødelægger knogler og ændrer deres struktur: Forskere ved ikke, hvordan folk vil flyve til Mars

Astronomer har fundet planeter, der er forskellige fra Jorden, men egnede til liv