Vi lærte at identificere tegnsprog i videoopkald

Forskere har præsenteret et tegnsprogsdetektionssystem i realtid. Hun kan fortælle hvornår

samtalepartneren forsøger at sige noget eller barebevæger krop, hoved, arme. Forskere bemærker, at denne opgave kan virke let for en person, men tidligere var et sådant system ikke tilgængeligt i nogen af ​​videoopkaldstjenesterne - de reagerer alle på enhver lyd eller menneskelig gestus.

Ny udvikling fra Google-forskere er i stand tilgør det med stor effektivitet og lav latenstid. Mens forskerne bemærker, at påvisning af tegnsprog fører til en forsinkelse eller forringet videokvalitet, kan dette problem løses, og selve modellen forbliver let og pålidelig.

Systemet kører først videoen gennem modellen underkaldes PoseNet, som vurderer kroppens og lemmernes position i hver ramme. Forenklet visuel information sendes til en model, der er uddannet til at placere data fra videoer af mennesker, der bruger tegnsprog, og sammenligner billedet med, hvordan folk normalt viser bestemte ord.

Modellen identificerer korrekt ord og udtryk korrekt med80% nøjagtighed, og med yderligere optimering kan den nå 91,5%. I betragtning af at detekteringen af ​​en "aktiv højttaler" i de fleste tjenester fungerer med forsinkelser, mener forskerne, at dette er meget stort antal.

Se også:

Det er muligt at skabe en termonuklear reaktor på Jorden. Hvad vil konsekvenserne være?

Dommedagsbreen viste sig at være farligere end forskere troede. Vi fortæller det vigtigste

På sygdom 3 mister de fleste COVID-19 patienter deres lugtesans og lider ofte af en løbet næse