Nowa sieć neuronowa może rozróżniać pojedyncze osoby i obiekty na wideo oraz przyspieszać lub spowalniać je
W tym celu zespół Google i OxfordUniwersytet podzielił każdą klatkę wideo na osobne warstwy i nauczył sztucznej inteligencji identyfikowania znajdujących się w nich ludzi lub obiektów. Ta sieć neuronowa skupia się na rzeczach na każdej warstwie, koncentrując się na ich ruchach, a następnie może oddzielić każdy obiekt i zmienić ich ruch.

Naukowcy ustalili górną granicę prędkości dźwięku
Wcześniej Google wymyślił model, który mógłczytać język migowy podczas rozmów wideo. Sztuczna inteligencja potrafi wykryć, kto aktywnie mówi, ale ignoruje drugą osobę, jeśli tylko porusza rękami lub głową. Nowe odkrycie opracowane przez badaczy Google pozwala to robić z dużą wydajnością i niskim opóźnieniem. Jak dotąd badacze zauważają, że wykrywanie języka migowego prowadzi do opóźnień lub pogorszenia jakości wideo, ale problem ten można rozwiązać, a sam model pozostaje lekki i niezawodny.
System najpierw przepuszcza wideo przez model podzwany PoseNet, który ocenia pozycję ciała i kończyn w każdej klatce. Uproszczone informacje wizualne są wysyłane do modelu wyszkolonego do pozycjonowania danych z filmów wideo osób używających języka migowego i porównuje obraz z tym, jak ludzie zwykle wyświetlają określone słowa.
Czytaj także
W 3. dniu choroby większość pacjentów z COVID-19 traci zmysł węchu i często cierpi na katar
Zobacz najbliższe ujęcia powierzchni Słońca
Lodowiec Doomsday okazał się bardziej niebezpieczny, niż sądzili naukowcy. Mówimy najważniejsze