Menneske eller bot: hvordan skape noen som snakker med deg på telefonen

Hva er måtene å gi uttrykk for en bot 

Det er to hovedmåter å stemme en bot på: ved hjelp av talesyntese eller

spille inn linjer i talerens stemme.I det første tilfellet vil du få en hyggelig, korrekt, men oftest følelsesløs stemmeskue, i det andre - livlig, naturlig tale. Begge metodene har rett til liv. For eksempel, hvis stemmeassistenten i utgangspunktet er plassert som en robot, vil lett mekanisk tale ikke bli oppfattet negativt av brukerne. Hvis målet er å gjøre en bot til en fullverdig ansatt i kundesenteret, er det mer fornuftig for et selskap å bruke forhåndsinnspilt tale for å behandle spørsmål. 

En av de mest kjente talesyntesemetodene er jevnblant ikke-programmerere - TTS. Datamaskinen leser og snakker bare teksten. Et slående eksempel er syntesen av taletjenester fra Google, som kan høres i Google Translate-oversetteren. Den russiske talen til tjenesten er veldig lett å skille fra naturlig tale, som er hovedproblemet med en slik syntese. For å legge den nødvendige vekten, bruk SSML – talesyntesemarkering. Men selv med det er det vanskelig å oppnå en lyd som en profesjonell kunngjører. Derfor begynte vi å utvikle et alternativ av høy kvalitet. 

Hvorfor trenger du talesyntese med variabler 

Bedrifter bruker aktivt stemmens evnerbots og streber etter å gjøre talen deres mer behagelig og personlig overfor kunder. Personalisering øker engasjement og lojalitet: 70 % av selskapene som bruker avansert personalisering fikk 200 % avkastning eller mer på innsatsen. 

For å gjøre botens stemme realistisk, selskaperta opp stemmen til en taler, skuespiller eller kontaktsenteroperatør. Ulempen er at alle replikaer er statiske. Dette egner seg for eksempel for instruksjoner om kansellering av en bestilling eller informere om aktuelle kampanjer. Men forretningskommunikasjon inneholder mye data i endring – variabler.

For å gjøre en bots stemme realistisk, spiller selskaper inn stemmen til en forteller, skuespiller eller kontaktsenteroperatør. Ulempen er at alle replikaer er statiske.

For eksempel, for å bekrefte en avtale på en klinikk:Pasientens navn, legens navn, dato og tidspunkt for avtale. I leveringssaken: kundens fulle navn, ordrenummer og innhold, beløp og leveringstid. Hver oppføring må inneholde individuelle parametere for klienten eller hans forespørsel. Og så brukes filliming, lydmikser eller ganske enkelt robotstemmespill. 

Essensen av liming er at det skaper"applikasjoner" fra en rekke opptak av kunngjøreren. Ved levering må du skrive ned ca. 1,5 tusen ofte forekommende gater, bynavn, hus- og leilighetsnummer. Dette er en svært arbeidskrevende oppgave som krever betydelig innsats og tid fra varsleren. Etter opptak må lydfilene slås sammen i riktig rekkefølge. En profesjonell lydtekniker kan gjøre jevne overganger mellom kutt og plasseringspauser, men kryssene vil fortsatt være hørbare, og store mengder kildedata gjør slikt arbeid overveldende. Vi prøvde dette alternativet, men innså at det ikke var egnet for å løse komplekse problemer. 

Vi vet at noen selskaper prøver å finne en høyttaler med en stemme som ligner standard SpeechKit-stemmespill fra Yandex eller Google Speech. Men i dette tilfellet er også innleggene hørbare. 

Vi prøvde å integrere det i voice-over-opptakTTS. Det vil si at vi ikke spilte inn alle navnene på gater og byer på forhånd, men genererte ønsket frase ved hjelp av TTS basert på kunngjørerens stemme og satte den inn i den forhåndsinnspilte kunngjørerens replika. Resultatet var en blanding av emosjonell, levende tale fra en person og en robot. 

Uansett hva vi prøver fra forskjellige instrumenter,Vi fikk ikke noe godt resultat. Som et resultat kom vi til å utvikle vår egen algoritme, som vi kalte hybridsyntese. Denne teknologien lar deg raskt endre fraser i voiceover-opptak for en stemmerobot; du trenger bare å sende erstatningen til algoritmen. Samtidig kopierer syntetisert tale intonasjonen og følelsene til høyttaleren, høres naturlig ut og skiller seg ikke ut fra konteksten. På denne måten kan du stemme alle variabler som ikke var i det originale voice-over-opptaket, samt teste nye scenarier. 

TTS

Hvordan fungerer hybridsyntese?

Den første fasen er å jobbe med varslere.For å dekke mangfoldet i det russiske språket, var det nødvendig å spille inn 10 timers tale i et profesjonelt studio. Dette er fraser fra bøker, nyheter og ofte forekommende data: tall, navn, adresser og byer. Dette gir nok treningsdata, og deretter kan du begynne å lage hybridsyntesemodeller for hver høyttaler. 

For hvert robocall-prosjekt skriver kunngjøreren ned setningsmaler, for eksempel: "Hei,Sergei Petrovitsj! I morgen leverer vi bestillingen din til din adresseTverskaya gate, 3Med14 til 18timer.Vil det være praktisk for deg å akseptere det?» Hybridsyntesemodellen kan behandle oppgaver som når det er nødvendig å erstatte Sergei Petrovich med Anna Vasilyevna, og adressen og tidspunktet - til Bolshaya Zelenina Street, 24 fra 10.00 til 14.00. Resultatet er en ny kopi med syntetiserte variabler: "Hei,Anna Vasilievna! I morgen leverer vi bestillingen din til din adresseBolshaya Zelenina gate, 24Med10 til 14timer. Vil det være praktisk for deg å akseptere det?» For hver samtale til kundebasen opprettes og utføres en egen oppgave. 

Voiceover

Høy lydkvalitet oppnås på grunn av at det nevrale nettverket bruker intonasjonene og følelsene til høyttaleren fra eksemplet. 

Slik setter du opp hybridsyntese 

Vi tilbyr flere ferdige modellerhybridsyntese med kvinnelige og mannsstemmer. Malanrop fungerer på JAICP- og JAICF-plattformene; anrop fra roboter opprettet i andre tjenester er mulig via API. Å sette opp et skript fra bunnen av tar flere timer. Én syntetisert kopi koster 12 kopek, voice-over av en mal for et prosjekt koster 3000 rubler per time av kunngjørerens arbeid. 

Settet med ferdige stemmer vil utvide seg.Det er også et alternativ å bruke Just AI-hybridsyntese med å lage en modell for en individuelt valgt kunngjører eller hvem som er den offisielle stemmen til selskapet.

hybrid syntese

Hybrid synteseteknologi lar deg tilpasse IVR og robotsamtaler i forbindelse med NPS-undersøkelser, spørreskjemaer, påminnelser, oppsalg og støtte for lojalitetsprogrammer.

Les mer:

Et svart hull i galaksen viste at Einstein hadde rett. Hovedtingen

Rommet ødelegger bein og endrer strukturen deres: forskere vet ikke hvordan folk vil fly til Mars

Astronomer har funnet planeter som er forskjellige fra jorden, men egnet for liv