Ein neues neuronales Netzwerk kann einzelne Personen und Objekte in Videos unterscheiden und sie beschleunigen oder verlangsamen
Dafür das Google- und Oxford-TeamDie Universität teilte jeden Videorahmen in separate Ebenen ein und brachte der KI bei, Personen oder Objekte in ihnen zu identifizieren. Dieses neuronale Netzwerk konzentriert sich auf Dinge auf jeder Ebene und konzentriert sich auf ihre Bewegungen. Dann kann es jedes Objekt trennen und seine Bewegung ändern.

Wissenschaftler haben die Obergrenze der Schallgeschwindigkeit ermittelt
Zuvor hatte Google ein Modell entwickelt, das dies könnteLesen Sie bei Videoanrufen die Gebärdensprache. KI kann erkennen, wer aktiv spricht, ignoriert die andere Person jedoch, wenn sie nur ihre Hände oder ihren Kopf bewegt. Eine neue Entwicklung von Google-Forschern kann dies mit großer Effizienz und geringer Latenz tun. Bisher stellen die Forscher fest, dass die Erkennung der Gebärdensprache zu Verzögerungen oder einer Verschlechterung der Videoqualität führt. Dieses Problem kann jedoch gelöst werden und das Modell selbst bleibt leichtgewichtig und zuverlässig.
Das System führt das Video zunächst durch das Modell untergenannt PoseNet, das die Position des Körpers und der Gliedmaßen in jedem Frame bewertet. Vereinfachte visuelle Informationen werden an ein Modell gesendet, das darauf trainiert ist, Daten aus Videos von Personen in Gebärdensprache zu positionieren, und vergleicht das Bild damit, wie Personen normalerweise bestimmte Wörter anzeigen.
Lesen Sie auch
Am dritten Krankheitstag verlieren die meisten COVID-19-Patienten ihren Geruchssinn und leiden häufig an einer laufenden Nase
Sehen Sie die nächsten Aufnahmen der Sonnenoberfläche
Der Doomsday-Gletscher erwies sich als gefährlicher als Wissenschaftler dachten. Wir erzählen die Hauptsache