วิธีเปล่งเสียงบอทคืออะไร?
มีสองวิธีหลักในการเปล่งเสียงบอท: ใช้การสังเคราะห์เสียงพูดหรือ
วิธีการสังเคราะห์เสียงพูดที่มีชื่อเสียงที่สุดวิธีหนึ่งก็คือในหมู่ผู้ที่ไม่ใช่โปรแกรมเมอร์ - TTS คอมพิวเตอร์เพียงอ่านและพูดข้อความ ตัวอย่างที่เด่นชัดคือการสังเคราะห์ Speech Services โดย Google ซึ่งสามารถได้ยินได้ในโปรแกรมแปลของ Google Translate คำพูดของรัสเซียในการให้บริการนั้นแยกแยะได้ง่ายมากจากคำพูดที่เป็นธรรมชาติซึ่งเป็นปัญหาหลักของการสังเคราะห์ดังกล่าว หากต้องการเน้นที่จำเป็น ให้ใช้ SSML - มาร์กอัปการสังเคราะห์เสียงพูด แต่ถึงอย่างนั้น มันก็ยากที่จะได้เสียงเหมือนผู้ประกาศมืออาชีพ ดังนั้นเราจึงเริ่มพัฒนาทางเลือกคุณภาพสูง
เหตุใดคุณจึงต้องมีการสังเคราะห์เสียงพูดด้วยตัวแปร
ธุรกิจต่าง ๆ กำลังใช้ความสามารถด้านเสียงอย่างจริงจังบอทและมุ่งมั่นที่จะทำให้คำพูดของพวกเขาน่าพอใจและเป็นส่วนตัวต่อลูกค้ามากขึ้น การปรับเปลี่ยนในแบบของคุณช่วยเพิ่มการมีส่วนร่วมและความภักดี: 70% ของบริษัทที่ใช้การปรับเปลี่ยนในแบบของคุณขั้นสูงได้รับ ROI 200% หรือมากกว่าจากความพยายามของพวกเขา
เพื่อให้เสียงของบอทสมจริง บริษัทต่างๆบันทึกเสียงของผู้ประกาศ นักแสดง หรือเจ้าหน้าที่ศูนย์ติดต่อ ข้อเสียคือแบบจำลองทั้งหมดเป็นแบบคงที่ เหมาะสำหรับคำแนะนำในการยกเลิกคำสั่งซื้อหรือแจ้งโปรโมชั่นปัจจุบัน แต่การสื่อสารทางธุรกิจประกอบด้วยข้อมูลที่เปลี่ยนแปลงมากมาย—ตัวแปร
เพื่อให้เสียงของบอทสมจริง บริษัทต่างๆ จะบันทึกเสียงของผู้บรรยาย นักแสดง หรือเจ้าหน้าที่ศูนย์ติดต่อ ข้อเสียคือแบบจำลองทั้งหมดเป็นแบบคงที่
ตัวอย่างเช่น เพื่อยืนยันการนัดหมายที่คลินิก:ชื่อคนไข้ ชื่อแพทย์ วันและเวลาที่นัดหมาย ในกรณีการส่งมอบ: ชื่อนามสกุลของลูกค้า หมายเลขคำสั่งซื้อและเนื้อหา จำนวนและเวลาในการจัดส่ง แต่ละรายการจะต้องมีพารามิเตอร์เฉพาะของลูกค้าหรือคำขอของเขา จากนั้นจึงใช้การติดไฟล์ เสียงมิกซ์ หรือการแสดงเสียงด้วยหุ่นยนต์
สาระสำคัญของการติดกาวคือมันสร้างขึ้น“แอพพลิเคชั่น” จากการบันทึกของผู้ประกาศมากมาย ในกรณีของการจัดส่ง คุณต้องจดถนน ชื่อเมือง หมายเลขบ้านและอพาร์ตเมนต์ที่เกิดขึ้นบ่อยประมาณ 1.5 พันรายการ นี่เป็นงานที่ต้องใช้แรงงานมากซึ่งต้องใช้ความพยายามและเวลาอย่างมากจากผู้ประกาศ หลังจากบันทึก ไฟล์เสียงจะต้องถูกรวมเข้าด้วยกันในลำดับที่ถูกต้อง วิศวกรเสียงมืออาชีพสามารถดำเนินการเปลี่ยนระหว่างการตัดและการหยุดชั่วคราวได้อย่างราบรื่น แต่จุดเชื่อมต่อจะยังคงได้ยินอยู่ และแหล่งข้อมูลจำนวนมากทำให้งานดังกล่าวล้นหลาม เราลองใช้ตัวเลือกนี้แล้ว แต่พบว่ามันไม่เหมาะสำหรับการแก้ปัญหาที่ซับซ้อน
เรารู้ว่าบางบริษัทพยายามค้นหาวิทยากรที่มีเสียงคล้ายกับเสียง SpeechKit มาตรฐานที่แสดงจาก Yandex หรือ Google Speech แต่ในกรณีนี้ ส่วนแทรกจะได้ยินเช่นกัน
เราพยายามรวมมันเข้ากับการบันทึกเสียงพากย์ทีทีเอส. นั่นคือเราไม่ได้บันทึกชื่อถนนและเมืองทั้งหมดล่วงหน้า แต่สร้างวลีที่ต้องการโดยใช้ TTS ตามเสียงของผู้ประกาศและแทรกลงในแบบจำลองของผู้ประกาศที่บันทึกไว้ล่วงหน้า ผลลัพธ์ที่ได้คือการผสมผสานระหว่างอารมณ์และคำพูดสดของคนและหุ่นยนต์
อะไรก็ตามที่เราลองใช้จากเครื่องดนตรีต่างๆเราไม่ได้ผลลัพธ์ที่ดี เป็นผลให้เราพัฒนาอัลกอริธึมของเราเอง ซึ่งเราเรียกว่าการสังเคราะห์แบบไฮบริด เทคโนโลยีนี้ช่วยให้คุณเปลี่ยนวลีในการบันทึกเสียงพากย์สำหรับบอทเสียงได้อย่างรวดเร็ว คุณเพียงแค่ต้องส่งต่อการแทนที่ไปยังอัลกอริทึม ในเวลาเดียวกัน คำพูดสังเคราะห์จะคัดลอกน้ำเสียงและอารมณ์ของผู้พูด ฟังดูเป็นธรรมชาติและไม่โดดเด่นจากบริบท ด้วยวิธีนี้ คุณสามารถส่งเสียงตัวแปรใดๆ ที่ไม่ได้อยู่ในการบันทึกเสียงพากย์ต้นฉบับ รวมถึงทดสอบสถานการณ์ใหม่ๆ ได้
TTS
การสังเคราะห์แบบไฮบริดทำงานอย่างไร?
ขั้นแรกคือการทำงานร่วมกับผู้ประกาศเพื่อให้ครอบคลุมความหลากหลายของภาษารัสเซีย จำเป็นต้องบันทึกคำพูดเป็นเวลา 10 ชั่วโมงในสตูดิโอมืออาชีพ เหล่านี้เป็นวลีจากหนังสือ ข่าว และข้อมูลที่เกิดขึ้นบ่อย: ตัวเลข ชื่อ ที่อยู่ และเมือง ข้อมูลนี้จะให้ข้อมูลการฝึกอบรมที่เพียงพอ หลังจากนั้นคุณสามารถเริ่มสร้างแบบจำลองการสังเคราะห์แบบไฮบริดสำหรับลำโพงแต่ละตัวได้
สำหรับแต่ละโปรเจ็กต์ robocall ผู้ประกาศจะเขียนเทมเพลตวลี เช่น: “สวัสดีSergei Petrovich! พรุ่งนี้เราจะส่งคำสั่งซื้อของคุณไปยังที่อยู่ของคุณถนน Tverskaya 3กับ14 ถึง 18ชั่วโมง.จะสะดวกให้คุณยอมรับหรือไม่” โมเดลการสังเคราะห์แบบไฮบริดสามารถประมวลผลงานต่างๆ เช่น เมื่อจำเป็นต้องเปลี่ยน Sergei Petrovich ด้วย Anna Vasilyevna และที่อยู่และเวลา - ไปที่ถนน Bolshaya Zelenina, 24 ตั้งแต่ 10.00 น. ถึง 14.00 น. ผลลัพธ์ที่ได้คือแบบจำลองใหม่ที่มีตัวแปรสังเคราะห์: “สวัสดีAnna Vasilievna! พรุ่งนี้เราจะส่งคำสั่งซื้อของคุณไปยังที่อยู่ของคุณถนน Bolshaya Zelenina 24กับ10 ถึง 14ชั่วโมง. จะสะดวกให้คุณยอมรับหรือไม่” สำหรับการโทรไปยังฐานลูกค้าแต่ละครั้ง จะมีการสร้างและดำเนินการงานที่แยกจากกัน
สั่งการด้วยเสียง
คุณภาพเสียงที่สูงนั้นเกิดขึ้นได้จากการที่โครงข่ายประสาทเทียมใช้น้ำเสียงและอารมณ์ของผู้พูดจากตัวอย่าง
วิธีการตั้งค่าการสังเคราะห์แบบไฮบริด
เรามีโมเดลสำเร็จรูปหลายแบบการสังเคราะห์เสียงผสมระหว่างเสียงผู้หญิงและผู้ชาย การเรียกเทมเพลตใช้งานได้บนแพลตฟอร์ม JAICP และ JAICF การเรียกจากบอทที่สร้างในบริการอื่นสามารถทำได้ผ่าน API การตั้งค่าสคริปต์ตั้งแต่เริ่มต้นจะใช้เวลาหลายชั่วโมง แบบจำลองสังเคราะห์หนึ่งชุดมีราคา 12 โกเปค การพากย์เสียงของเทมเพลตสำหรับโปรเจ็กต์มีค่าใช้จ่าย 3,000 รูเบิลต่อชั่วโมงในงานของผู้ประกาศ
ชุดเสียงสำเร็จรูปจะขยายออกนอกจากนี้ยังมีตัวเลือกโดยใช้การสังเคราะห์ไฮบริดของ Just AI กับการสร้างแบบจำลองสำหรับผู้ประกาศที่เลือกเป็นรายบุคคลหรือผู้ที่เป็นเสียงอย่างเป็นทางการของบริษัท
การสังเคราะห์แบบลูกผสม
เทคโนโลยีการสังเคราะห์แบบไฮบริดช่วยให้คุณปรับแต่ง IVR และการโทรด้วยหุ่นยนต์สำหรับวัตถุประสงค์ในการสำรวจของ NPS แบบสอบถาม การแจ้งเตือน การลดราคา และการสนับสนุนโปรแกรมความภักดี
อ่านเพิ่มเติม:
หลุมดำในดาราจักรพิสูจน์แล้วว่าไอน์สไตน์คิดถูก สิ่งหลัก
อวกาศทำลายกระดูกและเปลี่ยนโครงสร้าง: นักวิทยาศาสตร์ไม่รู้ว่าผู้คนจะบินไปยังดาวอังคารอย่างไร
นักดาราศาสตร์พบดาวเคราะห์ที่แตกต่างจากโลกแต่เหมาะสมกับชีวิต