Які є способи озвучити бот
Є два основних способи озвучити бота: використовувати синтез мови
Один із найвідоміших методів синтезу мови навітьсеред не-програмістів - TTS. Комп'ютер просто читає та озвучує текст. Яскравим прикладом є синтез Speech Services by Google, який можна почути в перекладачі Google Translate. Російську мову сервісу дуже легко відрізнити від природної, у чому полягає основна проблема такого синтезу. Щоб розставити потрібні акценти, використовують SSML – розмітку синтезу мови. Але навіть з нею складно досягти звучання, як у професійного диктора. Тому ми стали розробляти якісну альтернативу.
Навіщо потрібен синтез мови зі змінними?
Бізнес активно використовує можливості голосовихботів і прагне зробити їх мова більш приємною та персоналізованою по відношенню до клієнтів. Особисте звернення підвищує залученість та лояльність: 70% компаній, які використовують розширену персоналізацію, отримали 200% ROI та більше від своїх зусиль.
Щоб зробити голос бота реалістичним, компаніїзаписують голос диктора, актора чи оператора контакт-центру. Мінус у тому, що всі репліки виходять статичні. Це підійде, наприклад, для інструкції зі скасування замовлення або інформування про поточні акції. Але в бізнесових повідомленнях багато змінних даних — змінних.
Щоб зробити голос бота реалістичним, компанії записують голос диктора, актора або оператора контакт-центру. Мінус у тому, що всі репліки виходять статичні.
Наприклад, для підтвердження прийому в клініці:ПІБ пацієнта, ПІБ лікаря, дата та час прийому. У кейсі доставки: ПІБ клієнта, номер замовлення та його склад, сума та час доставки. У кожну запис потрібно підставляти індивідуальні параметри клієнта чи запиту. І тоді в хід йдуть склеювання файлів, мікси аудіо або просто роботизоване озвучення.
Суть склеювання полягає в тому, що створюються"аплікації" з численних записів диктора. У разі доставки потрібно записати близько 1,5 тис. вулиць, що часто зустрічаються, назви міст, номери будинків і квартир. Це дуже трудомістке завдання, яке вимагає від диктора значних зусиль та тимчасових витрат. Після запису аудіофайли потрібно склеїти у правильній послідовності. Професійний звукорежисер може зробити плавні переходи між склейками та розставити паузи, але місця стиків все одно будуть чутні, і великі обсяги вихідних даних роблять таку роботу непідйомною. Ми пробували такий варіант, але зрозуміли, що він не підходить для вирішення складних завдань.
Нам відомо, що деякі компанії намагаються знайти диктора з голосом, схожим на стандартне озвучення SpeechKit від Яндекса або Google Speech. Але в цьому випадку вставки так само чутні.
Ми намагалися інтегрувати в дикторські записиTTS. Тобто ми не записували заздалегідь усі назви вулиць та міст, а генерували потрібну фразу за допомогою TTS на базі голосу диктора та вставляли її у передзаписану дикторську репліку. У результаті виходила суміш емоційної, живої мови людини і робота.
Щоб ми не пробували з різних інструментів,у нас не вийшов добрий результат. У результаті ми дійшли розробки власного алгоритму, який назвали гібридним синтезом. Ця технологія дозволяє швидко змінювати фрази у дикторських записах для голосового бота, достатньо передати алгоритму заміну. При цьому синтезована мова копіює інтонацію та емоції диктора, звучить природно та не виділяється з контексту. Таким чином, можна озвучувати будь-які змінні, яких не було в початковому дикторському записі, а також тестувати нові сценарії.
TTS
Як працює гібридний синтез
Перший етап – це робота з дикторами.Щоб охопити різноманітність російської мови, потрібно було записати 10 годин промови у професійній студії. Це фрази з книг, новин і дані, що часто зустрічаються: чисельні, імена, адреси та міста. Так з'являється достатньо даних для навчання, після чого вже можна розпочинати створення моделей гібридного синтезу для кожного диктора.
Для кожного проекту роботизованого обдзвону диктор записує шаблони фраз, наприклад: «Здрастуйте,Сергій Петрович! Завтра ми доставимо вам замовлення на адресувулиця Тверська, 3з14 до 18годин.Вам буде зручно його прийняти? Модель гібридного синтезу може обробляти такі завдання, коли потрібно замінити Сергія Петровича на Ганну Василівну, а адресу та час – на вулицю Велика Зеленіна, 24 з 10 до 14 години. У результаті виходить нова репліка із синтезованими змінними: «Здрастуйте,Ганна Василівна! Завтра ми доставимо вам замовлення на адресувулиця Велика Зеленіна, 24з10 до 14годин. Вам буде зручно його прийняти? Для кожного дзвінка за базою клієнтів формується та виконується окреме завдання.
Дикторський запис
Висока якість звучання досягається за рахунок того, що нейромережа використовує інтонації та емоції диктора з прикладу.
Як налаштувати гібридний синтез
Ми пропонуємо кілька готових моделейгібридного синтезу з жіночими та чоловічими голосами. Виклики шаблону працюють на платформах JAICP та JAICF, виклики з ботів, створених в інших сервісах, можливі API. Налаштування сценарію з нуля триває кілька годин. Одна синтезована репліка коштує 12 копійок, озвучення шаблону для проекту - 3000 рублів за годину роботи диктора.
Набір готових голосів розширюватиметься.Також є варіант із використанням гібридного синтезу Just AI із створенням моделі під індивідуально підібраного диктора або того, хто є офіційним голосом компанії.
Гібридний синтез
Технологія гібридного синтезу дозволяє персоналізувати IVR та роботизовані дзвінки з цілями NPS-опитувань, анкетування, нагадувань, upsale та підтримки програм лояльності.
Читати далі:
Чорна діра у Галактиці підтвердила правоту Ейнштейна. Головне
Космос руйнує кістки та змінює їхню структуру: вчені не знають, як люди полетять на Марс
Астрономи знайшли планети, які відрізняються від Землі, але придатні для життя