Wat zijn de manieren om een bot een stem te geven?
Er zijn twee manieren om een bot een stem te geven: met behulp van spraaksynthese of
Een van de bekendste methoden voor spraaksynthese is zelfsonder niet-programmeurs - TTS. De computer leest en spreekt eenvoudigweg de tekst. Een sprekend voorbeeld is de synthese van Speech Services van Google, die te horen is in de Google Translate-vertaler. De Russische toespraak van de dienst is heel gemakkelijk te onderscheiden van natuurlijke spraak, wat het grootste probleem is van een dergelijke synthese. Gebruik SSML - markup voor spraaksynthese om de nodige nadruk te leggen. Maar zelfs daarmee is het moeilijk om het geluid van een professionele omroeper te bereiken. Daarom zijn we begonnen met het ontwikkelen van een kwalitatief hoogstaand alternatief.
Waarom heb je spraaksynthese met variabelen nodig?
Bedrijven maken actief gebruik van de mogelijkheden van spraakbots en streeft ernaar om hun toespraak aangenamer en persoonlijker te maken richting klanten. Personalisatie vergroot de betrokkenheid en loyaliteit: 70% van de bedrijven die geavanceerde personalisatie gebruiken, realiseerde een ROI van 200% of meer op hun inspanningen.
Om de stem van de bot realistisch te maken, bedrijvenneem de stem op van een omroeper, acteur of contactcenteroperator. Het nadeel is dat alle replica's statisch zijn. Dit is bijvoorbeeld geschikt voor instructies over het annuleren van een bestelling of het informeren over lopende acties. Maar zakelijke communicatie bevat veel veranderende gegevens: variabelen.
Om de stem van een bot realistisch te maken, nemen bedrijven de stem op van een verteller, acteur of contactcenteroperator. Het nadeel is dat alle replica's statisch zijn.
Om bijvoorbeeld een afspraak in een kliniek te bevestigen:Naam van de patiënt, naam van de arts, datum en tijdstip van afspraak. In de leveringskist: volledige naam van de klant, ordernummer en de inhoud ervan, bedrag en levertijd. Elke invoer moet individuele parameters van de klant of zijn verzoek bevatten. En dan worden het lijmen van bestanden, audiomixen of gewoon robotachtige stemacteurs gebruikt.
De essentie van lijmen is dat het creëert“applicaties” uit talrijke opnames van de omroeper. Bij bezorging dient u ongeveer 1,5 duizend veel voorkomende straten, plaatsnamen, huis- en appartementnummers op te schrijven. Dit is een zeer arbeidsintensieve taak die aanzienlijke inspanning en tijd van de omroeper vergt. Na de opname moeten de audiobestanden in de juiste volgorde worden samengevoegd. Een professionele geluidstechnicus kan vloeiende overgangen maken tussen fragmenten en pauzes, maar de overgangen zullen nog steeds hoorbaar zijn, en grote hoeveelheden brongegevens maken dergelijk werk overweldigend. We hebben deze optie geprobeerd, maar beseften dat deze niet geschikt was voor het oplossen van complexe problemen.
We weten dat sommige bedrijven een spreker proberen te vinden met een stem die lijkt op de standaard SpeechKit-stemacteurs van Yandex of Google Speech. Maar in dit geval zijn de inzetstukken ook hoorbaar.
We hebben geprobeerd het te integreren in voice-overopnamesTTS. Dat wil zeggen dat we niet alle namen van straten en steden vooraf hebben opgenomen, maar de gewenste zin hebben gegenereerd met behulp van TTS op basis van de stem van de omroeper en deze in de vooraf opgenomen replica van de omroeper hebben ingevoegd. Het resultaat was een mix van emotionele, live spraak van een persoon en een robot.
Wat we ook proberen met verschillende instrumenten,Wij hadden geen goed resultaat. Als resultaat hiervan zijn we ons eigen algoritme gaan ontwikkelen, dat we hybride synthese noemden. Met deze technologie kunt u snel zinnen in voice-overopnames voor een stembot wijzigen; u hoeft de vervanging alleen maar door te geven aan het algoritme. Tegelijkertijd kopieert gesynthetiseerde spraak de intonatie en emoties van de spreker, klinkt natuurlijk en onderscheidt zich niet van de context. Op deze manier kunt u variabelen uitspreken die niet in de originele voice-overopname zaten, en nieuwe scenario's testen.
TTS
Hoe werkt hybride synthese?
De eerste fase is het werken met omroepers.Om de diversiteit van de Russische taal te dekken, was het nodig om 10 uur spraak op te nemen in een professionele studio. Dit zijn zinnen uit boeken, nieuws en veel voorkomende gegevens: cijfers, namen, adressen en steden. Dit levert voldoende trainingsgegevens op, waarna u voor elke luidspreker hybride synthesemodellen kunt gaan maken.
Voor elk robocall-project schrijft de omroeper zinssjablonen op, bijvoorbeeld: “Hallo,Sergei Petrovich! Morgen bezorgen wij uw bestelling op uw adresTverskaja straat, 3Met14 tot 18uur.Vindt u het handig om het te accepteren?” Het hybride synthesemodel kan taken verwerken zoals wanneer het nodig is om Sergei Petrovich te vervangen door Anna Vasilyevna, en het adres en de tijd - naar Bolshaya Zelenina Street, 24 van 10.00 tot 14.00 uur. Het resultaat is een nieuwe replica met gesynthetiseerde variabelen: “Hallo,Anna Vasilievna! Morgen bezorgen wij uw bestelling op uw adresBolsjaja Zelenina-straat, 24Met10 tot 14uur. Vindt u het handig om het te accepteren?” Voor elke oproep naar het klantenbestand wordt een aparte taak aangemaakt en uitgevoerd.
Voice over
Een hoge geluidskwaliteit wordt bereikt doordat het neurale netwerk gebruik maakt van de intonaties en emoties van de spreker uit het voorbeeld.
Hoe hybride synthese in te stellen
Wij bieden verschillende kant-en-klare modellen aanhybride synthese met vrouwen- en mannenstemmen. Sjabloonoproepen werken op de JAICP- en JAICF-platforms; oproepen van bots die in andere services zijn gemaakt, zijn mogelijk via de API. Het helemaal opnieuw opzetten van een script duurt enkele uren. Eén gesynthetiseerde replica kost 12 kopeken, de voice-over van een sjabloon voor een project kost 3.000 roebel per uur van het werk van de omroeper.
De set kant-en-klare stemmen wordt uitgebreid.Er is ook een optie om Just AI hybride synthese te gebruiken met het creëren van een model voor een individueel geselecteerde omroeper of die de officiële stem van het bedrijf is.
hybride synthese
Met hybride synthesetechnologie kunt u IVR- en robotoproepen personaliseren voor NPS-enquêtes, vragenlijsten, herinneringen, upsales en ondersteuning voor loyaliteitsprogramma's.
Lees verder:
Een zwart gat in de melkweg bewees Einstein gelijk. Het belangrijkste
Ruimte vernietigt botten en verandert hun structuur: wetenschappers weten niet hoe mensen naar Mars zullen vliegen
Astronomen hebben planeten gevonden die verschillen van de aarde, maar geschikt zijn voor leven