เราเรียนรู้ที่จะระบุภาษามือในแฮงเอาท์วิดีโอ

นักวิจัยได้นำเสนอระบบตรวจจับภาษามือแบบเรียลไทม์ เธอสามารถบอกได้เมื่อ

คู่สนทนากำลังพยายามพูดอะไรบางอย่างหรือเพียงแค่ขยับร่างกาย ศีรษะ แขน นักวิทยาศาสตร์ตั้งข้อสังเกตว่างานนี้อาจดูง่ายสำหรับบุคคล แต่ก่อนหน้านี้ระบบดังกล่าวไม่สามารถใช้งานได้ในบริการวิดีโอคอลใด ๆ - พวกเขาทั้งหมดตอบสนองต่อเสียงหรือท่าทางของมนุษย์

การพัฒนาใหม่โดยนักวิจัยของ Google สามารถทำได้ทำอย่างมีประสิทธิภาพสูงและมีเวลาแฝงต่ำ ในขณะที่นักวิจัยทราบว่าการตรวจจับภาษามือนำไปสู่ความล่าช้าหรือคุณภาพของวิดีโอที่ลดลง แต่ปัญหานี้สามารถแก้ไขได้และตัวแบบยังคงเบาและเชื่อถือได้

ระบบจะเรียกใช้วิดีโอผ่านแบบจำลองด้านล่างก่อนเรียกว่า PoseNet ซึ่งจะประเมินตำแหน่งของร่างกายและแขนขาในทุกเฟรม ข้อมูลภาพที่เรียบง่ายจะถูกส่งไปยังโมเดลที่ได้รับการฝึกฝนเพื่อวางตำแหน่งข้อมูลจากวิดีโอของผู้คนที่ใช้ภาษามือและเปรียบเทียบภาพกับวิธีที่ผู้คนมักแสดงคำบางคำ

แบบจำลองระบุคำและนิพจน์ได้อย่างถูกต้องด้วยความแม่นยำ 80% และด้วยการเพิ่มประสิทธิภาพเพิ่มเติมสามารถเข้าถึง 91.5% เมื่อพิจารณาว่าการตรวจจับ "ลำโพงที่ใช้งานอยู่" ในบริการส่วนใหญ่ทำงานด้วยความล่าช้านักวิจัยเชื่อว่าสิ่งเหล่านี้เป็นตัวเลขที่มาก

ดูเพิ่มเติมที่:

มีความเป็นไปได้ที่จะสร้างเครื่องปฏิกรณ์นิวเคลียร์เทอร์โมนิวเคลียร์บนโลก ผลที่ตามมาจะเป็นอย่างไร?

ธารน้ำแข็ง Doomsday กลายเป็นอันตรายมากกว่าที่นักวิทยาศาสตร์คิด เราบอกสิ่งสำคัญ

ในวันที่ 3 ของการเจ็บป่วยผู้ป่วย COVID-19 ส่วนใหญ่สูญเสียความรู้สึกในการดมและมักจะมีอาการน้ำมูกไหล