Какви са начините за озвучаване на бот?
Има два основни начина за озвучаване на бот: използвайте синтез на реч или
Един от най-известните методи за синтез на реч е четниятсред непрограмистите - TTS. Компютърът просто чете и изговаря текста. Ярък пример е синтезът на Speech Services от Google, който може да се чуе в преводача на Google Translate. Руската реч на услугата е много лесна за разграничаване от естествената реч, което е основният проблем на такъв синтез. За да поставите необходимите акценти, използвайте SSML - маркиране за синтез на реч. Но дори и с него е трудно да се постигне звук като на професионален говорител. Затова започнахме да разработваме висококачествена алтернатива.
Защо ви е необходим синтез на реч с променливи
Бизнесът активно използва възможностите на гласаботове и се стреми да направи речта им по-приятна и персонализирана спрямо клиентите. Персонализирането повишава ангажираността и лоялността: 70% от компаниите, използващи разширено персонализиране, са видели 200% ROI или повече от своите усилия.
За да направите гласа на бота реалистичен, компаниизапишете гласа на говорител, актьор или оператор на контактен център. Недостатъкът е, че всички реплики са статични. Това е подходящо, например, за инструкции за анулиране на поръчка или информиране за текущи промоции. Но бизнес комуникациите съдържат много променящи се данни - променливи.
За да направят гласа на бота реалистичен, компаниите записват гласа на разказвач, актьор или оператор на контактен център. Недостатъкът е, че всички реплики са статични.
Например, за да потвърдите среща в клиника:Име на пациента, име на лекар, дата и час на среща. В случая на доставка: трите имена на клиента, номер на поръчката и нейното съдържание, сума и срок на доставка. Всеки запис трябва да съдържа индивидуални параметри на клиента или негова заявка. След това се използва залепване на файлове, аудио миксове или просто роботизирана гласова игра.
Същността на лепенето е, че създава„приложения“ от множество записи на диктора. В случай на доставка, трябва да запишете около 1,5 хиляди често срещани улици, имена на градове, номера на къщи и апартаменти. Това е много трудоемка задача, която изисква значителни усилия и време от диктора. След записа аудио файловете трябва да бъдат обединени в правилната последователност. Професионален звуков инженер може да прави плавни преходи между съкращения и поставяне на паузи, но кръстовищата все още ще се чуват, а големите количества изходни данни правят тази работа непосилна. Опитахме тази опция, но разбрахме, че не е подходяща за решаване на сложни проблеми.
Знаем, че някои компании се опитват да намерят високоговорител с глас, подобен на стандартния SpeechKit, действащ от Yandex или Google Speech. Но в този случай вложките също се чуват.
Опитахме се да го интегрираме в гласови записиTTS. Тоест, ние не записахме всички имена на улици и градове предварително, а генерирахме желаната фраза с помощта на TTS въз основа на гласа на диктора и я вмъкнахме в предварително записаната реплика на диктора. Резултатът беше смесица от емоционална, жива реч на човек и робот.
Каквото и да опитаме от различни инструменти,Нямахме добър резултат. В резултат на това разработихме собствен алгоритъм, който нарекохме хибриден синтез. Тази технология ви позволява бързо да променяте фрази в гласови записи за гласов бот; просто трябва да предадете замяната на алгоритъма. В същото време синтезираната реч копира интонацията и емоциите на говорещия, звучи естествено и не се откроява от контекста. По този начин можете да озвучите всякакви променливи, които не са били в оригиналния гласов запис, както и да тествате нови сценарии.
TTS
Как работи хибридният синтез?
Първият етап е работа с диктори.За да се покрие многообразието на руския език, беше необходимо да се запишат 10 часа реч в професионално студио. Това са фрази от книги, новини и често срещани данни: цифри, имена, адреси и градове. Това осигурява достатъчно данни за обучение, след което можете да започнете да създавате хибридни модели за синтез за всеки говорител.
За всеки проект за автоматично обаждане дикторът записва шаблони за фрази, например: „Здравейте,Сергей Петрович! Утре ще доставим Вашата поръчка до Вашия адресТверская улица, 3с14 до 18часа.Ще бъде ли удобно за вас да го приемете?“ Моделът на хибридния синтез може да обработва задачи като например, когато е необходимо да се замени Сергей Петрович с Анна Василевна, а адресът и часът - до улица Болшая Зеленина, 24 от 10 до 14 часа. Резултатът е нова реплика със синтезирани променливи: „Здравейте,Анна Василиевна! Утре ще доставим Вашата поръчка до Вашия адресУлица Болшая Зеленина, 24с10 до 14часа. Ще бъде ли удобно за вас да го приемете?“ За всяко обаждане до клиентската база се създава и изпълнява отделна задача.
Озвучаване
Високото качество на звука се постига благодарение на факта, че невронната мрежа използва интонациите и емоциите на говорещия от примера.
Как да настроите хибриден синтез
Предлагаме няколко готови моделахибриден синтез с женски и мъжки гласове. Обажданията на шаблони работят на платформите JAICP и JAICF; обажданията от ботове, създадени в други услуги, са възможни чрез API. Настройването на скрипт от нулата отнема няколко часа. Една синтезирана реплика струва 12 копейки, озвучаването на шаблон за проект струва 3000 рубли на час работа на диктора.
Наборът от готови гласове ще се разшири.Има и опция за използване на хибриден синтез Just AI със създаване на модел за индивидуално избран говорител или кой е официалният глас на компанията.
хибриден синтез
Технологията за хибриден синтез ви позволява да персонализирате IVR и роботизирани обаждания за целите на NPS проучвания, въпросници, напомняния, допълнителни продажби и поддръжка за програми за лоялност.
Прочетете още:
Една черна дупка в галактиката доказа, че Айнщайн е прав. Основното нещо
Космосът разрушава костите и променя структурата им: учените не знаят как хората ще летят до Марс
Астрономите са открили планети, които са различни от Земята, но подходящи за живот