มนุษย์หรือบอท: วิธีสร้างคนที่คุยกับคุณทางโทรศัพท์

วิธีเปล่งเสียงบอทคืออะไร? 

มีสองวิธีหลักในการเปล่งเสียงบอท: ใช้การสังเคราะห์เสียงพูดหรือ

ในกรณีแรกคุณจะได้รับเสียงที่น่าพอใจถูกต้อง แต่ส่วนใหญ่มักจะไม่มีอารมณ์ในกรณีที่สองคําพูดที่มีชีวิตชีวาและเป็นธรรมชาติตัวอย่างเช่นหากผู้ช่วยเสียงอยู่ในตําแหน่งเริ่มต้นเป็นหุ่นยนต์คําพูดเชิงกลเล็กน้อยจะไม่เป็นหากเป้าหมายคือการเปลี่ยนบอทให้เป็นพนักงานคอลเซ็นเตอร์ที่เต็มเปี่ยมมันก็มีเหตุผลมากกว่าที่ บริษัท จะใช้คําพูดที่บันทึกไว้ล่วงหน้าเพื่อประมวลผลคําถาม 

วิธีการสังเคราะห์เสียงพูดที่มีชื่อเสียงที่สุดวิธีหนึ่งก็คือในหมู่ผู้ที่ไม่ใช่โปรแกรมเมอร์ - TTS คอมพิวเตอร์เพียงอ่านและพูดข้อความ ตัวอย่างที่เด่นชัดคือการสังเคราะห์ Speech Services โดย Google ซึ่งสามารถได้ยินได้ในโปรแกรมแปลของ Google Translate คำพูดของรัสเซียในการให้บริการนั้นแยกแยะได้ง่ายมากจากคำพูดที่เป็นธรรมชาติซึ่งเป็นปัญหาหลักของการสังเคราะห์ดังกล่าว หากต้องการเน้นที่จำเป็น ให้ใช้ SSML - มาร์กอัปการสังเคราะห์เสียงพูด แต่ถึงอย่างนั้น มันก็ยากที่จะได้เสียงเหมือนผู้ประกาศมืออาชีพ ดังนั้นเราจึงเริ่มพัฒนาทางเลือกคุณภาพสูง 

เหตุใดคุณจึงต้องมีการสังเคราะห์เสียงพูดด้วยตัวแปร 

ธุรกิจต่าง ๆ กำลังใช้ความสามารถด้านเสียงอย่างจริงจังบอทและมุ่งมั่นที่จะทำให้คำพูดของพวกเขาน่าพอใจและเป็นส่วนตัวต่อลูกค้ามากขึ้น การปรับเปลี่ยนในแบบของคุณช่วยเพิ่มการมีส่วนร่วมและความภักดี: 70% ของบริษัทที่ใช้การปรับเปลี่ยนในแบบของคุณขั้นสูงได้รับ ROI 200% หรือมากกว่าจากความพยายามของพวกเขา

เพื่อให้เสียงของบอทสมจริง บริษัทต่างๆบันทึกเสียงของผู้ประกาศ นักแสดง หรือเจ้าหน้าที่ศูนย์ติดต่อ ข้อเสียคือแบบจำลองทั้งหมดเป็นแบบคงที่ เหมาะสำหรับคำแนะนำในการยกเลิกคำสั่งซื้อหรือแจ้งโปรโมชั่นปัจจุบัน แต่การสื่อสารทางธุรกิจประกอบด้วยข้อมูลที่เปลี่ยนแปลงมากมาย—ตัวแปร

เพื่อให้เสียงของบอทสมจริง บริษัทต่างๆ จะบันทึกเสียงของผู้บรรยาย นักแสดง หรือเจ้าหน้าที่ศูนย์ติดต่อ ข้อเสียคือแบบจำลองทั้งหมดเป็นแบบคงที่

ตัวอย่างเช่น เพื่อยืนยันการนัดหมายที่คลินิก:ชื่อคนไข้ ชื่อแพทย์ วันและเวลาที่นัดหมาย ในกรณีการส่งมอบ: ชื่อนามสกุลของลูกค้า หมายเลขคำสั่งซื้อและเนื้อหา จำนวนและเวลาในการจัดส่ง แต่ละรายการจะต้องมีพารามิเตอร์เฉพาะของลูกค้าหรือคำขอของเขา จากนั้นจึงใช้การติดไฟล์ เสียงมิกซ์ หรือการแสดงเสียงด้วยหุ่นยนต์ 

สาระสำคัญของการติดกาวคือมันสร้างขึ้น“แอพพลิเคชั่น” จากการบันทึกของผู้ประกาศมากมาย ในกรณีของการจัดส่ง คุณต้องจดถนน ชื่อเมือง หมายเลขบ้านและอพาร์ตเมนต์ที่เกิดขึ้นบ่อยประมาณ 1.5 พันรายการ นี่เป็นงานที่ต้องใช้แรงงานมากซึ่งต้องใช้ความพยายามและเวลาอย่างมากจากผู้ประกาศ หลังจากบันทึก ไฟล์เสียงจะต้องถูกรวมเข้าด้วยกันในลำดับที่ถูกต้อง วิศวกรเสียงมืออาชีพสามารถดำเนินการเปลี่ยนระหว่างการตัดและการหยุดชั่วคราวได้อย่างราบรื่น แต่จุดเชื่อมต่อจะยังคงได้ยินอยู่ และแหล่งข้อมูลจำนวนมากทำให้งานดังกล่าวล้นหลาม เราลองใช้ตัวเลือกนี้แล้ว แต่พบว่ามันไม่เหมาะสำหรับการแก้ปัญหาที่ซับซ้อน 

เรารู้ว่าบางบริษัทพยายามค้นหาวิทยากรที่มีเสียงคล้ายกับเสียง SpeechKit มาตรฐานที่แสดงจาก Yandex หรือ Google Speech แต่ในกรณีนี้ ส่วนแทรกจะได้ยินเช่นกัน 

เราพยายามรวมมันเข้ากับการบันทึกเสียงพากย์ทีทีเอส. นั่นคือเราไม่ได้บันทึกชื่อถนนและเมืองทั้งหมดล่วงหน้า แต่สร้างวลีที่ต้องการโดยใช้ TTS ตามเสียงของผู้ประกาศและแทรกลงในแบบจำลองของผู้ประกาศที่บันทึกไว้ล่วงหน้า ผลลัพธ์ที่ได้คือการผสมผสานระหว่างอารมณ์และคำพูดสดของคนและหุ่นยนต์ 

อะไรก็ตามที่เราลองใช้จากเครื่องดนตรีต่างๆเราไม่ได้ผลลัพธ์ที่ดี เป็นผลให้เราพัฒนาอัลกอริธึมของเราเอง ซึ่งเราเรียกว่าการสังเคราะห์แบบไฮบริด เทคโนโลยีนี้ช่วยให้คุณเปลี่ยนวลีในการบันทึกเสียงพากย์สำหรับบอทเสียงได้อย่างรวดเร็ว คุณเพียงแค่ต้องส่งต่อการแทนที่ไปยังอัลกอริทึม ในเวลาเดียวกัน คำพูดสังเคราะห์จะคัดลอกน้ำเสียงและอารมณ์ของผู้พูด ฟังดูเป็นธรรมชาติและไม่โดดเด่นจากบริบท ด้วยวิธีนี้ คุณสามารถส่งเสียงตัวแปรใดๆ ที่ไม่ได้อยู่ในการบันทึกเสียงพากย์ต้นฉบับ รวมถึงทดสอบสถานการณ์ใหม่ๆ ได้

TTS

การสังเคราะห์แบบไฮบริดทำงานอย่างไร?

ขั้นแรกคือการทำงานร่วมกับผู้ประกาศเพื่อให้ครอบคลุมความหลากหลายของภาษารัสเซีย จำเป็นต้องบันทึกคำพูดเป็นเวลา 10 ชั่วโมงในสตูดิโอมืออาชีพ เหล่านี้เป็นวลีจากหนังสือ ข่าว และข้อมูลที่เกิดขึ้นบ่อย: ตัวเลข ชื่อ ที่อยู่ และเมือง ข้อมูลนี้จะให้ข้อมูลการฝึกอบรมที่เพียงพอ หลังจากนั้นคุณสามารถเริ่มสร้างแบบจำลองการสังเคราะห์แบบไฮบริดสำหรับลำโพงแต่ละตัวได้

สำหรับแต่ละโปรเจ็กต์ robocall ผู้ประกาศจะเขียนเทมเพลตวลี เช่น: “สวัสดีSergei Petrovich! พรุ่งนี้เราจะส่งคำสั่งซื้อของคุณไปยังที่อยู่ของคุณถนน Tverskaya 3กับ14 ถึง 18ชั่วโมง.จะสะดวกให้คุณยอมรับหรือไม่” โมเดลการสังเคราะห์แบบไฮบริดสามารถประมวลผลงานต่างๆ เช่น เมื่อจำเป็นต้องเปลี่ยน Sergei Petrovich ด้วย Anna Vasilyevna และที่อยู่และเวลา - ไปที่ถนน Bolshaya Zelenina, 24 ตั้งแต่ 10.00 น. ถึง 14.00 น. ผลลัพธ์ที่ได้คือแบบจำลองใหม่ที่มีตัวแปรสังเคราะห์: “สวัสดีAnna Vasilievna! พรุ่งนี้เราจะส่งคำสั่งซื้อของคุณไปยังที่อยู่ของคุณถนน Bolshaya Zelenina 24กับ10 ถึง 14ชั่วโมง. จะสะดวกให้คุณยอมรับหรือไม่” สำหรับการโทรไปยังฐานลูกค้าแต่ละครั้ง จะมีการสร้างและดำเนินการงานที่แยกจากกัน

สั่งการด้วยเสียง

คุณภาพเสียงที่สูงนั้นเกิดขึ้นได้จากการที่โครงข่ายประสาทเทียมใช้น้ำเสียงและอารมณ์ของผู้พูดจากตัวอย่าง 

วิธีการตั้งค่าการสังเคราะห์แบบไฮบริด 

เรามีโมเดลสำเร็จรูปหลายแบบการสังเคราะห์เสียงผสมระหว่างเสียงผู้หญิงและผู้ชาย การเรียกเทมเพลตใช้งานได้บนแพลตฟอร์ม JAICP และ JAICF การเรียกจากบอทที่สร้างในบริการอื่นสามารถทำได้ผ่าน API การตั้งค่าสคริปต์ตั้งแต่เริ่มต้นจะใช้เวลาหลายชั่วโมง แบบจำลองสังเคราะห์หนึ่งชุดมีราคา 12 โกเปค การพากย์เสียงของเทมเพลตสำหรับโปรเจ็กต์มีค่าใช้จ่าย 3,000 รูเบิลต่อชั่วโมงในงานของผู้ประกาศ

ชุดเสียงสำเร็จรูปจะขยายออกนอกจากนี้ยังมีตัวเลือกโดยใช้การสังเคราะห์ไฮบริดของ Just AI กับการสร้างแบบจำลองสำหรับผู้ประกาศที่เลือกเป็นรายบุคคลหรือผู้ที่เป็นเสียงอย่างเป็นทางการของบริษัท

การสังเคราะห์แบบลูกผสม

เทคโนโลยีการสังเคราะห์แบบไฮบริดช่วยให้คุณปรับแต่ง IVR และการโทรด้วยหุ่นยนต์สำหรับวัตถุประสงค์ในการสำรวจของ NPS แบบสอบถาม การแจ้งเตือน การลดราคา และการสนับสนุนโปรแกรมความภักดี

อ่านเพิ่มเติม:

หลุมดำในดาราจักรพิสูจน์แล้วว่าไอน์สไตน์คิดถูก สิ่งหลัก

อวกาศทำลายกระดูกและเปลี่ยนโครงสร้าง: นักวิทยาศาสตร์ไม่รู้ว่าผู้คนจะบินไปยังดาวอังคารอย่างไร

นักดาราศาสตร์พบดาวเคราะห์ที่แตกต่างจากโลกแต่เหมาะสมกับชีวิต