Wissenschaftler des AIRI-Instituts präsentierten auf einer internationalen wissenschaftlichen Konferenz über virtuelle und
Tiefenanalyse ist eine der HauptaufgabenComputer-Vision-Anwendungen. Damit der Roboter im Raum navigieren kann und der Augmented-Reality-Filter das gewünschte Bild überlagert, muss das System die Entfernungen zu jedem Objekt im Bild korrekt einschätzen.
In der Regel werden Tiefenkarten auf der Grundlage von erstelltInformationen von speziellen Sensoren. Das beliebteste davon ist Lidar. Dieses Gerät richtet einen Lichtstrahl aus und misst die Zeit, die es dauert, bis die Reflexion zurückkehrt. Nachteile dieser Technologie: begrenzte Reichweite und hohe Kosten für Sensoren. Alternativ kommen auch RGB-Kameras zum Einsatz. Diese Methode wird bei der Entwicklung verschiedener AR-Anwendungen für Smartphones verwendet.
Die neue Technologie kombiniert verschiedene Ansätze zuLösung des Problems der Tiefenschätzung. Forscher haben Modelle entwickelt, die globale räumliche Informationen verwenden, um die genauesten Karten zu erstellen. Das vorgeschlagene Modell kombiniert die Vorteile von Transformatoren und Convolutional Neural Networks. Die Autoren merken an, dass das Modell selbstlernend ist und keine Daten von Tiefensensoren benötigt.
Die Entwickler berichteten, dass die vorgeschlagene Methodehat die Leistungsbewertung an unabhängigen Datensätzen bestanden und eines der besten Ergebnisse der Welt gezeigt. Informationen über Modelle und Methoden sollen bald öffentlich zugänglich gemacht werden.
Weiter lesen:
Die NASA enthüllte den Ursprung von Haumea – dem mysteriösesten Planeten im Sonnensystem
Die "dunkle Materie" des Genoms verbarg die Krebsbehandlung: was Wissenschaftler dort fanden
Fünf Millionen Todesjahre: Warum das „Große Sterben“ wirklich so lange gedauert hat