Koji su načini da se izrazi bot
Postoje dva glavna načina davanja glasa botu: pomoću sinteze govora ili
Jedna od najpoznatijih metoda sinteze govora je parnameđu neprogramerima – TTS. Računalo jednostavno čita i izgovara tekst. Upečatljiv primjer je sinteza Googleovih govornih usluga, koja se može čuti u prevoditelju Google Translate. Ruski govor službe vrlo je lako razlikovati od prirodnog govora, što je glavni problem takve sinteze. Za postavljanje potrebnih naglasaka upotrijebite SSML - označavanje sinteze govora. Ali čak i s njim teško je postići zvuk poput profesionalnog spikera. Stoga smo počeli razvijati visokokvalitetnu alternativu.
Zašto vam je potrebna sinteza govora s varijablama
Poduzeća aktivno koriste mogućnosti glasabotova i nastoji njihov govor učiniti ugodnijim i personaliziranijim prema korisnicima. Personalizacija povećava angažman i lojalnost: 70% tvrtki koje koriste naprednu personalizaciju zabilježilo je 200% ROI ili više od svojih napora.
Kako bi glas bota bio realističan, tvrtkesnimite glas spikera, glumca ili operatera kontakt centra. Loša strana je što su sve replike statične. Ovo je prikladno, na primjer, za upute o otkazivanju narudžbe ili obavijesti o trenutnim promocijama. Ali poslovna komunikacija sadrži mnogo promjenjivih podataka—varijabli.
Kako bi glas bota bio realističan, tvrtke snimaju glas naratora, glumca ili operatera kontakt centra. Loša strana je što su sve replike statične.
Na primjer, za potvrdu termina u klinici:Ime pacijenta, ime liječnika, datum i vrijeme pregleda. U dostavnici: puno ime naručitelja, broj narudžbe i njezin sadržaj, iznos i vrijeme isporuke. Svaki unos mora sadržavati pojedinačne parametre klijenta ili njegov zahtjev. A onda se koristi lijepljenje datoteka, audio miksevi ili jednostavno robotizirana glasovna gluma.
Bit lijepljenja je da stvara“prijave” s brojnih snimaka spikera. U slučaju dostave potrebno je zapisati oko 1,5 tisuća ulica koje se često pojavljuju, naziva gradova, brojeva kuća i stanova. Ovo je vrlo naporan zadatak koji od spikera zahtijeva značajan trud i vrijeme. Nakon snimanja potrebno je spojiti audiodatoteke u ispravnom redoslijedu. Profesionalni inženjer zvuka može napraviti glatke prijelaze između rezova i postavljanja pauza, ali spojevi će i dalje biti čujni, a velike količine izvornih podataka čine takav posao neodoljivim. Isprobali smo ovu opciju, ali smo shvatili da nije prikladna za rješavanje složenih problema.
Znamo da neke tvrtke pokušavaju pronaći zvučnika s glasom sličnim standardnom SpeechKit glasovnom ponašanju iz Yandexa ili Google Speecha. No, u ovom slučaju se čuju i umetci.
Pokušali smo to integrirati u glasovne snimkeTTS. Odnosno, nismo unaprijed snimili sva imena ulica i gradova, već smo pomoću TTS-a generirali željenu frazu na temelju glasa spikera i umetnuli je u prethodno snimljenu repliku spikera. Rezultat je bila mješavina emotivnog, živog govora osobe i robota.
Što god pokušamo od raznih instrumenata,Nismo imali dobar rezultat. Kao rezultat toga, došli smo do razvoja vlastitog algoritma, koji smo nazvali hibridna sinteza. Ova tehnologija vam omogućuje da brzo promijenite fraze u glasovnim snimkama za glasovni bot; U isto vrijeme, sintetizirani govor kopira intonaciju i emocije govornika, zvuči prirodno i ne odskače od konteksta. Na taj način možete izgovoriti sve varijable koje nisu bile u izvornoj glasovnoj snimci, kao i testirati nove scenarije.
TTS
Kako funkcionira hibridna sinteza?
Prva faza je rad s spikerima.Da bi se pokrila raznolikost ruskog jezika, bilo je potrebno snimiti 10 sati govora u profesionalnom studiju. To su fraze iz knjiga, vijesti i podaci koji se često pojavljuju: brojevi, imena, adrese i gradovi. To daje dovoljno podataka za obuku, nakon čega možete početi stvarati hibridne modele sinteze za svakog govornika.
Za svaki projekt robotskog poziva, spiker zapisuje predloške izraza, na primjer: "Zdravo,Sergej Petrovič! Sutra ćemo Vašu narudžbu dostaviti na Vašu adresuTverska ulica, 3S14 do 18sati.Hoće li ti biti zgodno da to prihvatiš?” Model hibridne sinteze može obraditi zadatke kao što je kada je potrebno zamijeniti Sergeja Petroviča s Anom Vasiljevnom, a adresa i vrijeme - do ulice Bolshaya Zelenina, 24 od 10 do 14 sati. Rezultat je nova replika sa sintetiziranim varijablama: “Pozdrav,Ana Vasiljevna! Sutra ćemo Vašu narudžbu dostaviti na Vašu adresuBolshaya Zelenina ulica, 24S10 do 14sati. Hoće li ti biti zgodno da to prihvatiš?” Za svaki poziv korisničkoj bazi kreira se i izvršava zaseban zadatak.
Sinkronizacija
Visoka kvaliteta zvuka postiže se zahvaljujući tome što neuronska mreža koristi intonacije i emocije govornika iz primjera.
Kako postaviti hibridnu sintezu
Nudimo nekoliko gotovih modelahibridna sinteza sa ženskim i muškim glasovima. Pozivi predloška rade na platformama JAICP i JAICF; pozivi od botova stvorenih u drugim uslugama mogući su putem API-ja. Postavljanje skripte od nule traje nekoliko sati. Jedna sintetizirana replika košta 12 kopejki, glasovno snimanje predloška za projekt košta 3000 rubalja po satu rada spikera.
Skup gotovih glasova će se proširiti.Postoji i opcija korištenja Just AI hibridne sinteze uz izradu modela za pojedinačno odabranog spikera ili tko je službeni glas tvrtke.
hibridna sinteza
Tehnologija hibridne sinteze omogućuje vam da personalizirate IVR i robotske pozive za potrebe NPS anketa, upitnika, podsjetnika, prodaje i podrške za programe vjernosti.
Čitaj više:
Crna rupa u galaksiji dokazala je da je Einstein bio u pravu. Glavna stvar
Svemir uništava kosti i mijenja njihovu strukturu: znanstvenici ne znaju kako će ljudi letjeti na Mars
Astronomi su pronašli planete koji se razlikuju od Zemlje, ali pogodni za život