คณิตศาสตร์มากมายและไม่มีเวทมนตร์: ผู้ช่วยเสียงทำงานอย่างไร

ผู้ช่วย Zuckerberg และระบบปฏิบัติการ "Samantha": ระบบเสียงสองประเภท

Я работаю в лаборатории

машинного обучения представления данных. Веду два блока предметов в университете: один из них связан с прикладным машинным обучением и искусственным интеллектом. Второй — с поиском и его разновидностями. На пересечении этих предметов и лежит та область, про которую я сегодня буду пытаться говорить.

มีสองวิธีในการดูว่าคืออะไรผู้ช่วยเสียง ลองนึกภาพว่าคุณมีพ่อบ้านเสมือนจริง ตัวอย่างเช่น ประมาณห้าปีที่แล้ว Mark Zuckerberg สร้างผู้ช่วยอัจฉริยะในบ้านของเขา เรียกเขาว่า "Jarvis" เขารู้วิธีให้คนเข้าบ้าน เปิดปิดประตู ม่าน เปิดไฟ ตัวอย่างอื่นๆ ของอุปกรณ์ดังกล่าว ได้แก่ "Alexa" และ "Alice" ซึ่งอยู่ในอุปกรณ์และสามารถปรับปรุงชีวิตได้ สามารถควบคุมเตาอบ เครื่องซักผ้า เครื่องดูดฝุ่นและอื่นๆ

อีกวิธีในการดูผู้ช่วยคืออินเตอร์เฟซ. ในภาพยนตร์เรื่อง "She" มีระบบปฏิบัติการที่เรียกว่า "Samantha" ในการแสดงเสียงของรัสเซียเธอมีเสียงเดียวกับ "Alice" จาก Yandex เธอทำหน้าที่เป็นอินเทอร์เฟซสำหรับการจัดการระบบปฏิบัติการ และไม่ได้รับการออกแบบมาเป็นผู้ช่วย Apple มีแนวทางนี้ - Siri, Microsoft - Сortana, Google - Google Assistant

พวกเขาทำงานอย่างไร

ผู้ช่วยทั้งหมดถูกสร้างขึ้นบนคล้ายกันมากหลักการ. สิ่งแรกที่เขาต้องทำคือได้ยินเสียง สิ่งนี้เกิดขึ้นบนอุปกรณ์ของผู้ใช้ - โทรศัพท์มือถือหรือลำโพงอัจฉริยะ ผู้ใช้พูดว่า: "Alice", "Alexa", "OK Google" หลังจากคำวิเศษเหล่านี้ อุปกรณ์ก็พร้อมที่จะบันทึกเสียงของผู้ใช้ สิ่งนี้เกิดขึ้นได้จนถึงจุดหนึ่ง - จนกว่าไคลเอนต์จะเงียบหรืออุปกรณ์เบื่อที่จะรอจนกว่าจะเงียบ หลังจากนั้นข้อมูลจะถูกส่งไปยังเซิร์ฟเวอร์ของบริษัทที่ให้บริการ

นี่คือจุดเริ่มต้นของเวทมนตร์การดำเนินการแรกคือการแปลงคำพูดเป็นข้อความ ทุกคนพูดต่างกัน ฉันจะแปลงเป็นข้อความได้อย่างไร จากนั้นเริ่มต้นสิ่งที่เราใช้ผู้ช่วยเสียงสำหรับ - การให้บริการ นี่คือการดำเนินการใด ๆ ที่มีให้ทางออนไลน์ - การซื้อตั๋ว การจองโต๊ะในร้านอาหาร คำถามเดียวคือวิธีการจัดเตรียมส่วนต่อประสานที่ใช้งานง่าย หากไม่มีอยู่ อุปกรณ์จะกลายเป็นผู้พูด

หลังจากเรียกใช้บริการแล้ว ผู้ใช้ต้องส่งคืนผลลัพธ์ สำหรับสิ่งนี้ คุณต้องแพ็คให้ถูกต้อง เป็นไปได้มากว่ามันจะเป็นข้อความ ปัญหาจากหน้าบนอินเทอร์เน็ต เพลง ข้อมูลที่เครื่องคิดเลขคำนวณ ข้อมูลจะถูกแปลงกลับไปเป็นคำพูดและส่งไปยังไคลเอนต์

พูดเป็นข้อความ

การสื่อสารของเราเกิดขึ้นผ่านคำพูด เสียงคือการเคลื่อนที่ของอากาศรอบๆ การสั่นสะเทือนเหล่านี้ตกลงไปที่แก้วหู มันดันกระดูกสามชิ้น - โกลน ทั่งและค้อน ในทางกลับกัน เขย่าอวัยวะที่เรียกว่าหอยทาก เราได้หอยทากจากปลา มันเต็มไปด้วยน้ำ และเซลล์ขนอาศัยอยู่ในนั้น พวกมันสั่นคลอนไปกับน้ำในหอยทาก เซลล์ขนด้านบนจะขยายความผันผวนของของเหลวและส่งผ่านไปยังส่วนล่างของเซลล์ขน ซึ่งก่อให้เกิดแรงกระตุ้นทางไฟฟ้า แรงกระตุ้นนี้จะถูกส่งไปยังสมอง

ยิ่งไปกว่านั้น เซลล์ขนมีหน้าที่รับผิดชอบในความถี่ที่แตกต่างกันในบริเวณต่างๆ ของโคเคลีย ความถี่สูงจะถูกประมวลผลในส่วนกว้าง ความถี่กลางจะอยู่ตรงกลาง และความถี่ต่ำใกล้กับศูนย์กลางมากขึ้น

เราจะทำให้เครื่องรับรู้เสียงแบบนี้ได้อย่างไรในลักษณะเดียวกัน - ไม่ใช่ในรูปแบบของสัญญาณดิบ แต่อยู่ในรูปแบบของชุดความถี่? คำตอบสำหรับคำถามนี้ได้รับจากนักคณิตศาสตร์ชาวฝรั่งเศส Jean Baptiste Fourier เขาอาศัยอยู่ที่ชายแดนของศตวรรษที่ XVIII-XIX นักวิทยาศาสตร์เสนอการเปลี่ยนแปลงทางคณิตศาสตร์ดังกล่าวด้วยความช่วยเหลือซึ่งทุกอย่างเหมือนกับในหู - สัญญาณดิบจะถูกนำและสลายตัวเป็นส่วนประกอบความถี่

จะทำอย่างไรกับส่วนประกอบความถี่?เราสามารถจับคู่การแสดงสเปกตรัมกับฟอนิม นั่นคือ เราสามารถแปลงคำพูดเป็นหน่วยเสียงได้ พวกมันจะถูกแปลงเป็นตัวอักษรตามอัลกอริทึมอย่างง่ายดายไม่มากก็น้อย นั่นคือเราสามารถได้คำจากการออกเสียง

แต่ทั้งหมดนี้ไม่ถูกต้องมีหน่วยเสียงที่แตกต่างกันเล็กน้อย การเปลี่ยนจากเสียงหนึ่งไปอีกเสียงหนึ่งอาจฟังดูแตกต่างออกไป พวกเขาเรียกว่า senones มีประมาณ 10,000 ตัว แต่เมื่อมีหลายคำงานในการกำหนดคำจะยากขึ้นมาก

ต่อสู้กับแมลง

นักวิจัยจัดการกับข้อผิดพลาดอย่างไร?คำตอบสำหรับคำถามนี้มอบให้โดย Andrei Markov นักคณิตศาสตร์ชาวรัสเซียซึ่งอาศัยอยู่ในช่วงเปลี่ยนศตวรรษที่ 19-20 เขาได้พัฒนาทฤษฎีที่อธิบายกระบวนการที่กระบวนการหนึ่งตามมาจากอีกกระบวนการหนึ่ง และต้องขอบคุณทฤษฎีของเขา ทำให้โมเดล Markov ที่ซ่อนอยู่ได้รับการพัฒนา นี่เป็นวิธีแรกในการแก้ไขข้อผิดพลาดประเภทนี้

เช่น เมื่อบุคคลพูดไม่ชัด เขาจะสำเนียงหรือเขาออกเสียงคำผิด - มีกลไกทางคณิตศาสตร์ที่ช่วยให้คุณสามารถกู้คืนและกำหนดได้อย่างแม่นยำว่าบุคคลนั้นหมายถึงอะไร ท้ายที่สุดผู้คนก็ทำผิดพลาดเช่นกัน แต่พวกเขาเข้าใจซึ่งกันและกันซึ่งหมายความว่าเรามีกลไกในการแก้ไขข้อผิดพลาดในหัวของเรา

แต่การแสดงข้อความไม่เพียงพอ -คอมพิวเตอร์ทำงานกับตัวเลข วิธีรับพวกเขา? Noam Chomsky มีสมมติฐานว่าเรามีโครงสร้างในสมอง ยิ่งกว่านั้น ใช้ได้ในระดับแรกเกิด ซึ่งช่วยให้เราเรียนรู้ภาษาธรรมชาติได้อย่างรวดเร็ว ชอมสกีตลอดชีวิตของเขาสร้าง ปรับแต่ง และทำงานบนแบบจำลองที่กำหนดรูปแบบทั่วไปในภาษานั้นๆ ไม่ว่าจะเป็นภาษารัสเซีย ภาษาอังกฤษ หรือภาษาจีน

บนสไลด์ - ไวยากรณ์ของชอมสกี้นี่เป็นสิ่งเดียวกับที่พวกเขาทำในบทเรียนภาษารัสเซียเมื่อวิเคราะห์ประโยคตามองค์ประกอบ มีคำนาม, คำคุณศัพท์, หัวเรื่อง, ภาคแสดง, กลุ่มกริยา - ทั้งหมดนี้ทำให้เป็นทางการและสามารถแสดงต่อเครื่องได้ โครงสร้างนี้แสดงได้ง่ายในรูปของตัวเลข

เครื่องสามารถเข้าใจสิ่งที่เป็น subject ในข้อเสนอและการดำเนินการที่จะดำเนินการ ตัวอย่างเช่น หากลูกค้าพูดว่า: "Alice เปิดเพลง" จากนั้น "เปิด" จะเป็นการกระทำ "ดนตรี" จะเป็นวัตถุที่เกิดการกระทำนั้น "อลิซ" จะเข้าใจลูกค้าและเริ่มดำเนินการ

แต่คำเหล่านั้นเป็นชุดของตัวอักษรเช่นเข้าใจความหมายของพวกเขา? มีคำที่คล้ายกันคือ "เล่น" กับ "เล่น" เครื่องจะเข้าใจไหมว่านี่คือสิ่งเดียวกัน? คำตอบสำหรับคำถามนี้มอบให้โดย Leonardo Bloomfield นักภาษาศาสตร์ชาวอเมริกัน ในตอนต้นของศตวรรษที่ 20 เขาได้เสนอทฤษฎีที่ความหมายของคำถูกกำหนดโดยบริบทของคำนี้ ดูสไลด์และคิดว่าคำใดที่สามารถแทนที่จุดสามจุดได้

คำตอบของฉันจะเป็นช้าง แต่เมื่อฉันถามนักเรียนบอกว่าอาจมีแรดหรือแม้แต่ยีราฟ แต่โดยทั่วไปแล้ว เราเข้าใจว่านี่เป็นสัตว์ขนาดใหญ่ที่อาศัยอยู่ในแอฟริกาและอาจโกรธได้ หากเรารวมสิ่งเหล่านี้เข้าด้วยกัน เราก็จะได้คำอธิบายเชิงความหมายของวัตถุนี้โดยไม่ใช้คำนั้นเอง

Но если мы будем оцифровывать это, то получатся десятки тысяч цифр. И благодаря американскому математику Джину Голубу удалось придумать, как существенно снизить количество цифр. Вместо того, чтобы использовать цифры, они использовали совокупность цифр, которая называется вектором. И этот вектор можно использовать, чтобы понимать близость или удаленность по смыслу, семантическую связанность. Так можно понять, что «сыграй» — это примерно то же самое, что «играй».

Сейчас есть инструменты, где можно ввести слова, и станет ясно, как они распределяются на карте смыслов. Например, слова «жираф», «слон» и «носорог» — группируются, оказываются рядышком в пространстве смыслов. Эти методы развивались и сейчас выглядят гораздо более продвинуто.

เราได้นำเสนอคำในรูปแบบโครงสร้าง ประโยคในรูปแบบโครงสร้าง เราได้นำเสนอคำในรูปแบบของความหมาย ทั้งหมดนี้อยู่ในรูปแบบตัวเลข อะไรต่อไป?

บริการ

แต่ละบริการมีจำนวนหลายแสนล้านพันล้านของวัตถุ หากเรากำลังพูดถึงการค้นหาทางอินเทอร์เน็ต หน้าเหล่านี้คือหน้าหลายแสนล้านหน้า หลายหมื่นล้านภาพ หากสตรีมเพลงเป็นล้านเพลง

หนึ่งในแนวทางแรกในการจัดทำดัชนีข้อมูล −การสร้างต้นไม้ค้นหาไบนารี พจนานุกรมก็ใช้เช่นเดียวกัน: คุณเปิดมันตรงกลาง และถ้าคุณข้ามคำที่ถูกต้อง ให้เลื่อนกลับ ถ้าคุณไม่เข้าใจ ให้ไปต่อ แต่ในปี 1962 นักคณิตศาสตร์ชาวโซเวียต Georgy Adelson-Velsky และ Evgeniy Landis ได้คิดค้นโครงสร้างข้อมูลที่รักษาตัวเองให้อยู่ในสภาพที่สามารถดึงข้อมูลได้อย่างรวดเร็ว

ระบบนี้ใช้งานได้กับข้อมูลเชิงเส้นเท่านั้น −ตัวเลขหรือคำ และจะเกิดอะไรขึ้นกับข้อมูลหลายมิติถ้าเราต้องการค้นหาบางสิ่งบนแผนที่หรือในพื้นที่สามมิติ ในการทำเช่นนี้พวกเขาสร้างโครงสร้างเช่น kd-trees พวกเขาจัดการกับงานการค้นหาในพื้นที่สามมิติได้อย่างสมบูรณ์แบบ แต่พวกเขาหยุดทำงานสมัยใหม่ซึ่งมีการอธิบายข้อความด้วยตัวเลขนับร้อย

แต่ต้องขอบคุณงานทฤษฎีของปลายศตวรรษที่ยี่สิบEric Berninson เสนอการพัฒนาแผนผังการค้นหาที่เรียกว่า Anna ซึ่งสามารถใช้เพื่อรับประกันคุณภาพการค้นหาที่ดีในคอลเล็กชันขนาดใหญ่ วิธีนี้ใช้ได้กับฐาน Spotify ที่กว้างใหญ่ทั้งหมด ซึ่งเป็นผลลัพธ์ที่ยอดเยี่ยมเมื่อห้าปีที่แล้ว

นอกจากนี้ยังมีแนวทางอื่นๆ:ตัวอย่างเช่น นักสังคมวิทยา สแตนลีย์ มิลแกรม ทำการทดลองที่แปลกประหลาดและบางครั้งก็ไร้มนุษยธรรม เขาให้กำเนิดทฤษฎีการจับมือกันหกครั้ง ซึ่งทุกคนบนโลกรู้จักกันผ่านการจับมือกันไม่เกินหกครั้ง เมื่อต้องการทำเช่นนี้ เขาขอให้คนส่งจดหมายถึงคนแปลกหน้า จากนั้นพวกเขาก็ต้องเลือกคนที่คุ้นเคยกับบุคคลนี้จากคนรู้จัก และปรากฏว่าต้องใช้จดหมายถึงหกฉบับในการทำเช่นนี้ การทดลองถูกวิพากษ์วิจารณ์ แต่ทำซ้ำในปี 2000 - และยืนยันผลลัพธ์

นี่เป็นคุณสมบัติที่น่าทึ่งซึ่งในวิชาคณิตศาสตร์ได้รับชื่อนับ "โลกใบเล็ก" นักวิทยาศาสตร์ชาวรัสเซีย - กลุ่ม Yuri Malkov - เสนออัลกอริทึมที่น่าสนใจ พวกเขาใช้มันเพื่อค้นหาทุกสิ่งทุกที่ โหนดในกราฟนี้ไม่ใช่บุคคลอีกต่อไป แต่เป็นเอกสาร

ในกราฟนี้ - ระยะทางที่สั้นที่สุดระหว่าง anyสองสามวัตถุ ผู้ใช้สามารถค้นหาสิ่งที่เราต้องการได้อย่างรวดเร็ว โครงสร้างข้อมูลนี้ถูกใช้ในหลายบริษัทในรัสเซียและต่างประเทศ - Facebook, Mail.ru, Yandex แบบจำลองทางคณิตศาสตร์ที่ยอดเยี่ยมซึ่งไม่เพียงเปลี่ยนบริการค้นหาและแนะนำเท่านั้น แต่ยังรวมถึงผู้ช่วยด้านเสียงด้วย

อ่านเพิ่มเติม

ดูเรือโคจรรอบเดียวลำแรกของโลกแห่งอนาคต

เป็นเวลาสามปีที่นักวิทยาศาสตร์เชื่อว่ามีน้ำอยู่ทางใต้ของดาวอังคาร กลับกลายเป็นว่าไม่ใช่

เครื่องบินพลังงานไฮโดรเจนที่มีความเร็วเหนือเสียงสามารถเร่งความเร็วได้ถึง 12 มัค เกือบ 15,000 กม./ชม.