봇의 목소리를 내는 방법은 무엇인가요
봇에게 음성을 전달하는 두 가지 주요 방법은 음성 합성을 사용하는 것입니다.
가장 유명한 음성 합성 방법 중 하나는프로그래머가 아닌 사람들 사이 - TTS. 컴퓨터는 단순히 텍스트를 읽고 말합니다. 눈에 띄는 예는 Google 번역 번역기에서들을 수있는 Google 음성 서비스의 합성입니다. 서비스의 러시아어 음성은 그러한 합성의 주요 문제인 자연스러운 음성과 구별하기가 매우 쉽습니다. 필요한 강조를 하려면 SSML(음성 합성 마크업)을 사용하십시오. 하지만 그렇다고 해도 전문 아나운서 같은 소리를 내기는 어렵습니다. 따라서 우리는 고품질의 대안을 개발하기 시작했습니다.
변수를 사용하여 음성 합성이 필요한 이유
기업에서는 음성 기능을 적극적으로 활용하고 있습니다.봇은 고객에게 더욱 즐겁고 개인화된 음성을 제공하기 위해 노력합니다. 개인화는 참여도와 충성도를 높입니다. 고급 개인화를 사용하는 기업의 70%가 노력에 대해 200% 이상의 ROI를 경험했습니다.
봇의 목소리를 현실감 있게 만들기 위해 기업은아나운서, 배우, 컨택센터 교환원의 음성을 녹음하세요. 단점은 모든 복제본이 정적이라는 것입니다. 예를 들어 주문 취소에 대한 지침이나 현재 프로모션에 대한 알림에 적합합니다. 그러나 비즈니스 커뮤니케이션에는 변화하는 데이터, 즉 변수가 많이 포함되어 있습니다.
봇의 음성을 사실적으로 만들기 위해 회사에서는 내레이터, 배우 또는 연락 센터 운영자의 음성을 녹음합니다. 단점은 모든 복제본이 정적이라는 것입니다.
예를 들어, 진료소 예약을 확인하려면 다음을 수행하세요.환자 이름, 의사 이름, 예약 날짜 및 시간. 배송 케이스의 경우: 고객의 이름, 주문 번호 및 내용, 수량 및 배송 시간. 각 항목에는 클라이언트 또는 해당 요청의 개별 매개변수가 포함되어야 합니다. 그런 다음 파일 접착, 오디오 믹스 또는 단순한 로봇 음성 연기가 사용됩니다.
접착의 본질은 그것이 만드는 것입니다아나운서의 수많은 녹음에서 나온 "응용 프로그램". 배송시에는 자주 발생하는 거리, 도시명, 집, 아파트 호수 등 15000개 정도를 적어주셔야 합니다. 이는 아나운서의 상당한 노력과 시간이 필요한 매우 노동 집약적인 작업입니다. 녹음 후에는 오디오 파일을 올바른 순서로 병합해야 합니다. 전문 사운드 엔지니어는 컷과 일시정지 사이를 원활하게 전환할 수 있지만 연결 부분은 여전히 들릴 수 있으며 많은 양의 소스 데이터로 인해 이러한 작업이 부담스러워집니다. 우리는 이 옵션을 시도했지만 복잡한 문제를 해결하는 데는 적합하지 않다는 것을 깨달았습니다.
우리는 일부 회사가 Yandex 또는 Google Speech에서 작동하는 표준 SpeechKit 음성과 유사한 음성을 가진 스피커를 찾으려고 노력하고 있다는 것을 알고 있습니다. 하지만 이 경우에는 삽입된 내용도 들을 수 있습니다.
우리는 그것을 음성 해설 녹음에 통합하려고 시도했습니다.TTS. 즉, 거리와 도시의 이름을 미리 모두 녹음하지 않고, 아나운서의 음성을 바탕으로 TTS를 이용하여 원하는 문구를 생성하여 미리 녹음된 아나운서의 레플리카에 삽입하였습니다. 그 결과 사람과 로봇의 감정적이고 생생한 음성이 혼합되었습니다.
다양한 악기를 사용해 무엇을 하든,우리는 좋은 결과를 얻지 못했습니다. 그 결과 우리는 하이브리드 합성이라는 자체 알고리즘을 개발하게 되었습니다. 이 기술을 사용하면 음성 봇의 음성 해설 녹음에서 문구를 신속하게 변경할 수 있습니다. 대체 문구를 알고리즘에 전달하기만 하면 됩니다. 동시에 합성된 음성은 화자의 억양과 감정을 복사하고 자연스럽게 들리며 문맥에서 눈에 띄지 않습니다. 이러한 방식으로 원래 음성 해설 녹음에 없었던 모든 변수를 음성으로 녹음할 수 있을 뿐만 아니라 새로운 시나리오를 테스트할 수도 있습니다.
TTS
하이브리드 합성은 어떻게 작동하나요?
첫 번째 단계는 아나운서와 협력하는 것입니다.러시아어의 다양성을 다루기 위해서는 전문 스튜디오에서 10시간 분량의 연설을 녹음해야 했습니다. 숫자, 이름, 주소, 도시 등 책, 뉴스 및 자주 발생하는 데이터의 문구입니다. 이렇게 하면 충분한 훈련 데이터가 제공되며 그 후에는 각 화자에 대한 하이브리드 합성 모델 생성을 시작할 수 있습니다.
각 자동녹음전화 프로젝트에 대해 아나운서는 다음과 같은 문구 템플릿을 기록합니다.세르게이 페트로비치! 내일 우리는 당신의 주문을 당신의 주소로 배달할 것입니다트베르스카야 거리, 3와14~18시간.받아들이는 것이 편할까요?” 하이브리드 합성 모델은 Sergei Petrovich를 Anna Vasilyevna로 교체해야 하는 경우, 오전 10시부터 오후 2시까지 Bolshaya Zelenina Street, 24까지의 주소와 시간 등의 작업을 처리할 수 있습니다. 결과는 합성된 변수를 가진 새로운 복제본입니다: “안녕하세요,안나 바실리에브나! 내일 우리는 당신의 주문을 당신의 주소로 배달할 것입니다볼샤야 젤레니나 거리, 24와10~14시간. 받아들이는 것이 편할까요?” 고객에게 전화할 때마다 별도의 작업이 생성되어 실행됩니다.
보이스오버
신경망이 예제에서 화자의 억양과 감정을 사용한다는 사실로 인해 높은 음질이 달성됩니다.
하이브리드 합성 설정 방법
우리는 여러 가지 기성 모델을 제공합니다여성 및 남성 목소리의 하이브리드 합성. 템플릿 호출은 JAICP 및 JAICF 플랫폼에서 작동하며, 다른 서비스에서 생성된 봇의 호출은 API를 통해 가능합니다. 스크립트를 처음부터 설정하려면 몇 시간이 걸립니다. 합성된 복제본 하나의 비용은 12코펙이고, 프로젝트 템플릿의 음성 해설 비용은 아나운서 작업 시간당 3,000루블입니다.
기성품 음성 세트가 확장됩니다.또한 개별적으로 선택된 아나운서 또는 회사의 공식 목소리인 모델 생성과 함께 Just AI 하이브리드 합성을 사용하는 옵션도 있습니다.
하이브리드 합성
하이브리드 합성 기술을 사용하면 NPS 설문조사, 설문지, 알림, 상향 판매 및 로열티 프로그램 지원을 위해 IVR 및 로봇 호출을 개인화할 수 있습니다.
더 읽어보기 :
은하계의 블랙홀은 아인슈타인이 옳았다는 것을 증명했습니다. 중요한 것은
우주는 뼈를 파괴하고 구조를 변경합니다: 과학자들은 사람들이 어떻게 화성으로 날아갈지 모릅니다.
천문학자들은 지구와 다르지만 생명체에 적합한 행성을 발견했습니다.