We leerden gebarentaal herkennen in videogesprekken

Onderzoekers hebben een realtime gebarentaaldetectiesysteem gepresenteerd. Ze kan vertellen wanneer

de gesprekspartner probeert iets te zeggen of gewoonbeweegt lichaam, hoofd, armen. Wetenschappers merken op dat deze taak voor een persoon misschien gemakkelijk lijkt, maar voorheen was een dergelijk systeem niet beschikbaar in een van de videobeldiensten - ze reageren allemaal op elk geluid of menselijk gebaar.

Nieuwe ontwikkeling door Google-onderzoekers is in staatdoe het met grote efficiëntie en lage latentie. Hoewel de onderzoekers opmerken dat de detectie van gebarentaal leidt tot een vertraging of verminderde videokwaliteit, kan dit probleem worden opgelost en blijft het model zelf licht en betrouwbaar.

Het systeem voert de video eerst door het model ondergenaamd PoseNet, dat de positie van het lichaam en ledematen in elk frame beoordeelt. Vereenvoudigde visuele informatie wordt naar een model gestuurd dat getraind is in het positioneren van gegevens uit video's van mensen die gebarentaal gebruiken, en vergelijkt de afbeelding met hoe mensen gewoonlijk bepaalde woorden weergeven.

Het model identificeert correct woorden en uitdrukkingen met80% nauwkeurigheid, en met extra optimalisatie kan het 91,5% bereiken. Aangezien de detectie van een "actieve spreker" in de meeste diensten wordt vertraagd, zijn de onderzoekers van mening dat dit zeer hoge aantallen zijn.

Zie ook:

Het is mogelijk om op aarde een thermonucleaire reactor te maken. Wat zijn de gevolgen?

De Doomsday-gletsjer bleek gevaarlijker te zijn dan wetenschappers dachten. We vertellen het belangrijkste

Op dag 3 van de ziekte verliezen de meeste COVID-19-patiënten hun reukvermogen en hebben ze vaak een loopneus