Nauczyliśmy się rozpoznawać język migowy w rozmowach wideo

Naukowcy zaprezentowali system wykrywania języka migowego w czasie rzeczywistym. Ona wie kiedy

rozmówca próbuje coś powiedzieć lub po prostuporusza ciałem, głową, ramionami. Naukowcy zauważają, że dla człowieka to zadanie może wydawać się łatwe, jednak wcześniej taki system nie był dostępny w żadnej z usług wideorozmów – wszystkie reagują na każdy dźwięk czy gest człowieka.

Nowe rozwiązanie opracowane przez badaczy Google umożliwiarób to z dużą wydajnością i małym opóźnieniem. Chociaż naukowcy zauważają, że wykrycie języka migowego prowadzi do opóźnienia lub pogorszenia jakości wideo, problem ten można rozwiązać, a sam model pozostaje lekki i niezawodny.

System najpierw przepuszcza wideo przez model podzwany PoseNet, który ocenia pozycję ciała i kończyn w każdej klatce. Uproszczone informacje wizualne są wysyłane do modelu wyszkolonego do pozycjonowania danych z filmów wideo osób używających języka migowego i porównuje obraz z tym, jak ludzie zwykle wyświetlają określone słowa.

Model poprawnie identyfikuje słowa i wyrażenia z80% dokładności, a przy dodatkowej optymalizacji może osiągnąć 91,5%. Biorąc pod uwagę, że wykrywanie „aktywnego mówcy” w większości usług działa z opóźnieniami, naukowcy uważają, że są to bardzo duże liczby.

Zobacz także:

Możliwe jest stworzenie reaktora termojądrowego na Ziemi. Jakie będą konsekwencje?

Lodowiec Doomsday okazał się bardziej niebezpieczny, niż sądzili naukowcy. Mówimy najważniejsze

W 3. dniu choroby większość pacjentów z COVID-19 traci zmysł węchu i często cierpi na katar