Jaké jsou způsoby, jak vyjádřit robotovi
Existují dva hlavní způsoby, jak vyjádřit robota: pomocí syntézy řeči nebo
Jedna z nejznámějších metod syntézy řeči je sudámezi neprogramátory - TTS. Počítač jednoduše přečte a vysloví text. Pozoruhodným příkladem je syntéza Speech Services od společnosti Google, kterou lze slyšet v překladači Google Translate. Ruská řeč služby je velmi snadno odlišitelná od přirozené řeči, což je hlavní problém takové syntézy. Pro umístění potřebných akcentů použijte SSML - značkování syntézy řeči. Ale i s tím je těžké dosáhnout zvuku jako profesionální hlasatel. Proto jsme začali vyvíjet kvalitní alternativu.
Proč potřebujete syntézu řeči s proměnnými
Firmy aktivně využívají možnosti hlasuroboty a snaží se, aby jejich řeč byla příjemnější a personalizovaná směrem k zákazníkům. Personalizace zvyšuje angažovanost a loajalitu: 70 % společností, které používají pokročilou personalizaci, zaznamenalo 200 % nebo více ROI svého úsilí.
Aby byl hlas robota realistický, společnostinahrát hlas hlasatele, herce nebo operátora kontaktního centra. Nevýhodou je, že všechny repliky jsou statické. To se hodí například pro pokyny ke zrušení objednávky nebo informování o aktuálních akcích. Ale obchodní komunikace obsahuje mnoho měnících se dat – proměnných.
Aby byl hlas robota realistický, společnosti nahrávají hlas vypravěče, herce nebo operátora kontaktního centra. Nevýhodou je, že všechny repliky jsou statické.
Chcete-li například potvrdit schůzku na klinice:Jméno pacienta, jméno lékaře, datum a čas schůzky. V případě doručení: celé jméno klienta, číslo objednávky a její obsah, množství a dodací lhůta. Každý záznam musí obsahovat individuální parametry klienta nebo jeho požadavku. A pak se používá lepení souborů, zvukové mixy nebo jednoduše robotické hlasové ovládání.
Podstatou lepení je, že tvoří„aplikací“ z četných nahrávek hlasatele. V případě doručení je potřeba zapsat cca 1,5 tisíce často se vyskytujících ulic, názvy měst, čísla domů a bytů. Jedná se o velmi pracný úkol, který od hlasatele vyžaduje značné úsilí a čas. Po nahrání je třeba zvukové soubory sloučit ve správném pořadí. Profesionální zvukař dokáže plynule přecházet mezi střihy a pauzami, ale spoje budou stále slyšitelné a velké množství zdrojových dat takovou práci zdrcuje. Vyzkoušeli jsme tuto možnost, ale zjistili jsme, že není vhodná pro řešení složitých problémů.
Víme, že některé společnosti se snaží najít reproduktor s hlasem podobným standardnímu hlasovému ovládání SpeechKit od Yandex nebo Google Speech. Ale v tomto případě jsou vložky také slyšet.
Snažili jsme se to integrovat do voice-over nahrávekTTS. To znamená, že jsme předem nenahráli všechny názvy ulic a měst, ale vygenerovali jsme požadovanou frázi pomocí TTS na základě hlasu hlasatele a vložili ji do předem nahrané repliky hlasatele. Výsledkem byla směs emotivní, živé řeči člověka a robota.
Ať zkoušíme cokoli z různých nástrojů,Neměli jsme dobrý výsledek. V důsledku toho jsme přišli k vývoji našeho vlastního algoritmu, který jsme nazvali hybridní syntéza. Tato technologie vám umožňuje rychle měnit fráze v hlasových nahrávkách pro hlasového robota, stačí předat náhradu algoritmu. Syntetizovaná řeč přitom kopíruje intonaci a emoce mluvčího, zní přirozeně a nevystupuje z kontextu. Tímto způsobem můžete vyjádřit jakékoli proměnné, které nebyly v původní nahrávce komentáře, a také testovat nové scénáře.
TTS
Jak funguje hybridní syntéza?
První etapou je práce s hlasateli.Pro pokrytí rozmanitosti ruského jazyka bylo nutné nahrát 10 hodin projevu v profesionálním studiu. Jsou to fráze z knih, zprávy a často se vyskytující údaje: čísla, jména, adresy a města. To poskytuje dostatek tréninkových dat, po kterých můžete začít vytvářet modely hybridní syntézy pro každého reproduktoru.
Pro každý projekt robocall si hlasatel zapíše šablony frází, například: „Dobrý den,Sergej Petrovič! Zítra doručíme vaši objednávku na vaši adresuTverská ulice, 3S14 až 18hodin.Bude pro vás výhodné to přijmout?" Model hybridní syntézy dokáže zpracovat úkoly, jako když je nutné nahradit Sergeje Petroviče Annou Vasiljevnou, a adresu a čas - na ulici Bolshaya Zelenina, 24 od 10:00 do 14:00. Výsledkem je nová replika se syntetizovanými proměnnými: „Dobrý den,Anna Vasilievna! Zítra doručíme vaši objednávku na vaši adresuBolshaya Zelenina ulice, 24S10 až 14hodin. Bude pro vás výhodné to přijmout?" Pro každý hovor do zákaznické základny se vytvoří a provede samostatný úkol.
Voiceover
Vysoká kvalita zvuku je dosažena díky tomu, že neuronová síť využívá intonaci a emoce mluvčího z příkladu.
Jak nastavit hybridní syntézu
Nabízíme několik hotových modelůhybridní syntéza s ženskými a mužskými hlasy. Volání šablon fungují na platformách JAICP a JAICF prostřednictvím rozhraní API. Nastavení skriptu od začátku trvá několik hodin. Jedna syntetizovaná replika stojí 12 kopejek, voice-over šablony pro projekt stojí 3000 rublů za hodinu práce hlasatele.
Sada připravených hlasů se rozšíří.K dispozici je také možnost využití hybridní syntézy Just AI s vytvořením modelu pro individuálně vybraného hlasatele nebo toho, kdo je oficiálním hlasem společnosti.
hybridní syntéza
Technologie hybridní syntézy vám umožňuje personalizovat IVR a robotické hovory pro účely průzkumů NPS, dotazníků, upomínek, prodeje a podpory věrnostních programů.
Přečtěte si více:
Černá díra v galaxii dala Einsteinovi za pravdu. Hlavní věc
Vesmír ničí kosti a mění jejich strukturu: vědci nevědí, jak lidé poletí na Mars
Astronomové našli planety, které jsou odlišné od Země, ale vhodné pro život