Vi lærte å identifisere tegnspråk i videosamtaler

Forskere har presentert et tegnspråkdeteksjonssystem i sanntid. Hun kan si når

samtalepartneren prøver å si noe eller barebeveger kropp, hode, armer. Forskere bemerker at denne oppgaven kan virke lett for en person, men tidligere var et slikt system ikke tilgjengelig i noen av videosamtaletjenestene - de reagerer alle på lyd eller menneskelig gest.

Ny utvikling fra Google-forskere er i stand tilgjør det med stor effektivitet og lav ventetid. Mens forskerne merker at påvisning av tegnspråk fører til en forsinkelse eller forringet videokvalitet, kan dette problemet løses, og selve modellen forblir lett og pålitelig.

Systemet kjører først videoen gjennom modellen underkalt PoseNet, som vurderer kroppens og lemmenes posisjon i hver ramme. Forenklet visuell informasjon sendes til en modell som er opplært til å posisjonere data fra videoer av personer som bruker tegnspråk, og sammenligner bildet med hvordan folk vanligvis viser visse ord.

Modellen identifiserer ord og uttrykk riktig med80% nøyaktighet, og med ytterligere optimalisering kan den nå 91,5%. Tatt i betraktning at oppdagelsen av en "aktiv høyttaler" i de fleste tjenester fungerer med forsinkelser, mener forskerne at dette er veldig store tall.

Se også:

Det er mulig å lage en termonukleær reaktor på jorden. Hva blir konsekvensene?

Dommedagsbreen viste seg å være farligere enn forskere trodde. Vi forteller det viktigste

På sykdomsdag 3 mister de fleste COVID-19 pasienter luktesansen og lider ofte av en rennende nese