Am învățat să identificăm limbajul semnelor în apelurile video

Cercetătorii au dezvăluit un sistem de detectare a limbajului semnelor în timp real.distinge când

Interlocutorul încearcă să spună ceva sau doar să-și miște corpul, capul, brațele.Oamenii de știință observă că această sarcină poate părea ușoară pentru oameni, dar anterior nu a existat un astfel de sistem în niciunul dintre serviciile de apeluri video - toți răspundla orice sunet sau gest al unei persoane.

O nouă dezvoltare a cercetătorilor Google este capabilăfaceți-o cu o eficiență mare și cu o latență redusă. În timp ce cercetătorii observă că detectarea limbajului semnelor duce la o întârziere sau la degradarea calității videoclipurilor, această problemă poate fi rezolvată, iar modelul în sine rămâne ușor și fiabil.

Sistemul rulează mai întâi videoclipul prin modelul de mai josnumit PoseNet, care evaluează poziția corpului și a membrelor în fiecare cadru. Informațiile vizuale simplificate sunt trimise unui model instruit pentru a poziționa datele din videoclipurile persoanelor care utilizează limbajul semnelor și compară imaginea cu modul în care oamenii afișează de obicei anumite cuvinte.

Modelul identifică corect cuvintele și expresiile cuPrecizie de 80%, iar cu o optimizare suplimentară poate ajunge la 91,5%. Având în vedere că detectarea unui „difuzor activ” în majoritatea serviciilor funcționează cu întârzieri, cercetătorii consideră că acestea sunt un număr foarte mare.

Vezi și:

Este posibil să se creeze un reactor termonuclear pe Pământ. Care vor fi consecințele?

Ghețarul Doomsday s-a dovedit a fi mai periculos decât credeau oamenii de știință. Spunem principalul lucru

În ziua a 3-a de boală, majoritatea pacienților cu COVID-19 își pierd simțul mirosului și suferă adesea de un nas curgător