Om sau bot: cum să creezi pe cineva care îți vorbește la telefon

Care sunt modalitățile de a exprima un bot 

Există două moduri principale de a exprima un bot: folosind sinteza vorbirii sau

înregistrează replici în vocea crainicului.În primul caz, veți obține o voce plăcută, corectă, dar cel mai adesea lipsită de emoții, în al doilea - vorbire plină de viață, naturală. Ambele metode au dreptul la viață. De exemplu, dacă asistentul vocal este poziționat inițial ca un robot, atunci vorbirea ușor mecanică nu va fi percepută negativ de către utilizatori. Dacă scopul este de a transforma un bot într-un angajat cu drepturi depline al centrului de apeluri, atunci este mai logic ca o companie să folosească vorbirea preînregistrată pentru a procesa întrebări. 

Una dintre cele mai cunoscute metode de sinteză a vorbirii este chiarprintre non-programatori - TTS. Computerul pur și simplu citește și rostește textul. Un exemplu izbitor este sinteza serviciilor de vorbire de la Google, care poate fi auzită în traducătorul Google Translate. Discursul rus al serviciului este foarte ușor de distins de vorbirea naturală, care este principala problemă a unei astfel de sinteze. Pentru a pune accentul necesar, utilizați SSML - markup pentru sinteza vorbirii. Dar chiar și cu el, este dificil să obții un sunet ca un crainic profesionist. Prin urmare, am început să dezvoltăm o alternativă de înaltă calitate. 

De ce aveți nevoie de sinteză a vorbirii cu variabile 

Companiile folosesc activ capacitățile vociiroboți și se străduiește să-și facă discursul mai plăcut și mai personalizat față de clienți. Personalizarea crește implicarea și loialitatea: 70% dintre companiile care folosesc personalizarea avansată au observat un ROI de 200% sau mai mult în eforturile lor. 

Pentru a face vocea botului realistă, companiiînregistrați vocea unui crainic, actor sau operator de centru de contact. Dezavantajul este că toate replicile sunt statice. Acest lucru este potrivit, de exemplu, pentru instrucțiuni privind anularea unei comenzi sau informarea despre promoțiile curente. Dar comunicațiile de afaceri conțin o mulțime de date în schimbare — variabile. 

Pentru a face vocea unui bot realistă, companiile înregistrează vocea unui narator, actor sau operator de centru de contact. Dezavantajul este că toate replicile sunt statice.

De exemplu, pentru a confirma o programare la o clinică:Numele pacientului, numele medicului, data și ora programării. În cazul livrării: numele complet al clientului, numărul comenzii și conținutul acesteia, cantitatea și timpul de livrare. Fiecare intrare trebuie să conțină parametrii individuali ai clientului sau a cererii acestuia. Și apoi sunt folosite lipirea fișierelor, mixurile audio sau pur și simplu actoria vocală robotizată. 

Esența lipirii este că creează„aplicații” din numeroase înregistrări ale crainicului. În cazul livrării, trebuie să notați aproximativ 1,5 mii de străzi care apar frecvent, nume de orașe, numere de case și apartamente. Aceasta este o sarcină foarte intensă, care necesită efort și timp semnificativ din partea crainicului. După înregistrare, fișierele audio trebuie îmbinate în ordinea corectă. Un inginer de sunet profesionist poate face tranziții ușoare între tăieturi și pauze, dar joncțiunile vor fi în continuare audibile, iar cantitățile mari de date sursă fac o astfel de muncă copleșitoare. Am încercat această opțiune, dar ne-am dat seama că nu este potrivită pentru rezolvarea unor probleme complexe. 

Știm că unele companii încearcă să găsească un difuzor cu o voce similară cu vocea standard SpeechKit de la Yandex sau Google Speech. Dar în acest caz, inserțiile sunt și audibile. 

Am încercat să-l integrăm în înregistrările de voce offTTS. Adică nu am înregistrat în prealabil toate numele străzilor și orașelor, ci am generat fraza dorită folosind TTS pe baza vocii crainicului și am introdus-o în replica crainicului preînregistrată. Rezultatul a fost un amestec de vorbire emoțională, în direct, a unei persoane și a unui robot. 

Orice am încerca de la diverse instrumente,Nu am avut un rezultat bun. Drept urmare, am ajuns să dezvoltăm propriul algoritm, pe care l-am numit sinteza hibridă. Această tehnologie vă permite să schimbați rapid fraze în înregistrările de voce off pentru un robot vocal, trebuie doar să treceți algoritmul de înlocuire. În același timp, vorbirea sintetizată copiază intonația și emoțiile vorbitorului, sună natural și nu iese în evidență din context. În acest fel, puteți exprima orice variabile care nu se aflau în înregistrarea vocală originală, precum și să testați scenarii noi. 

TTS

Cum funcționează sinteza hibridă?

Prima etapă este lucrul cu cranici.Pentru a acoperi diversitatea limbii ruse, a fost necesar să înregistrați 10 ore de vorbire într-un studio profesional. Acestea sunt fraze din cărți, știri și date care apar frecvent: cifre, nume, adrese și orașe. Acest lucru oferă suficiente date de antrenament, după care puteți începe să creați modele hibride de sinteză pentru fiecare difuzor. 

Pentru fiecare proiect robocall, crainicul notează șabloane de fraze, de exemplu: „Bună ziua,Serghei Petrovici! Mâine vă vom livra comanda la adresa dvsstrada Tverskaya, 3Cu14 până la 18ore.Vă va fi convenabil să o acceptați?” Modelul de sinteză hibridă poate procesa sarcini, cum ar fi atunci când este necesar să se înlocuiască Serghei Petrovici cu Anna Vasilyevna, iar adresa și ora - către strada Bolshaya Zelenina, 24, de la 10:00 la 14:00. Rezultatul este o nouă replică cu variabile sintetizate: „Bună ziua,Anna Vasilievna! Mâine vă vom livra comanda la adresa dvsstrada Bolshaya Zelenina, 24Cu10 la 14ore. Vă va fi convenabil să o acceptați?” Pentru fiecare apel către baza de clienți, este creată și executată o sarcină separată. 

Voce off

Calitatea ridicată a sunetului este obținută datorită faptului că rețeaua neuronală folosește intonațiile și emoțiile difuzorului din exemplu. 

Cum să configurați sinteza hibridă 

Oferim mai multe modele gata făcutesinteza hibrida cu voci feminine si masculine. Apelurile tip șablon funcționează pe platformele JAICP și JAICF. Apelurile de la roboți creați în alte servicii sunt posibile prin API. Configurarea unui script de la zero durează câteva ore. O replică sintetizată costă 12 copeici, vocea off a unui șablon pentru un proiect costă 3.000 de ruble pe oră de lucru a crainicului. 

Setul de voci gata făcute se va extinde.Există, de asemenea, o opțiune care utilizează sinteza hibridă Just AI cu crearea unui model pentru un crainic selectat individual sau care este vocea oficială a companiei.

sinteza hibridă

Tehnologia de sinteză hibridă vă permite să personalizați IVR și apelurile robotizate în scopul anchetelor NPS, chestionarelor, mementourilor, vânzărilor suplimentare și asistenței pentru programele de loialitate.

Citeste mai mult:

O gaură neagră în galaxie i-a dat dreptate lui Einstein. Lucrul principal

Spațiul distruge oasele și le schimbă structura: oamenii de știință nu știu cum vor zbura oamenii pe Marte

Astronomii au descoperit planete care sunt diferite de Pământ, dar potrivite pentru viață