Förderbeginn 01.01.2020

Kamera-Lokalisierung unter Berücksichtigung von Schätzungsunsicherheit anhand von mehrdeutigen Bildern und dreidimensionalen Daten

Dr. Shadi Albarqouni
Technische Universität München
Lehrstuhl für Informatik 16 - Informatikanwendungen in der Medizin

Prof. Dr. Nassir Navab
Technische Universität München
Fakultät für Informatik

Prof. Leonidas Guibas
Stanford University
Artificial Intelligence Laboratory

Dr. Tolga Birdal
Stanford University
Artificial Intelligence Laboratory



Kamera-Lokalisierung steht für die Bestimmung der sechs Parameter einer Kamera, welche ihre Orientierung und Position im Raum definieren. Inzwischen ist es eine zentrale Technologie für eine Vielzahl an Anwendungen, einschließlich der Erweiterten Realität, dem Autonomen Fahren, der Mensch-Maschine-Interaktion und in der Steuerung von Robotern. Seit Jahrzehnten haben Forscher im Bereich Computer Vision versucht eine eindeutige Lösung für dieses Problem zu finden. Seit Kurzem, allerdings, verändert sich der Gedankengang der Wissenschaftler grundlegend, so dass eine einzige Lösung für unsere hochkomplexe und vieldeutige räumliche Umgebung als nicht ausreichend angesehen wird. Stattdessen sollen ein möglicher Bereich an Lösungen in der Form einer Wahrscheinlichkeitsverteilung oder ein Maß an Unsicherheit in die geschätzte Kameraposition bestimmt werden.

Dank dem momentanen Fortschritt im Bereich der künstlichen Intelligenz, kann dieses wichtige Problem heutzutage mit Algorithmen des maschinellen Lernens gelöst werden. Diese ermöglichen es eine aussagekräftige Darstellung der vorhandenen Daten zu berechnen. Ziel der Zusammenarbeit der TU München und der Stanford University ist es, in diesem Projekt, Algorithmen zu entwerfen und zu implementieren, welche die Unsicherheit und Vieldeutigkeit in den Schätzungen eines Modells erklären können. Im Speziellem ist das Ziel, unter Verwendung von neuronalen Netzen und Variationsrechnung, Kamera-Lokalisierung anhand von 2D Bildern oder 3D Punktdaten mit der Unsicherheitsquantifizierung auf multimodaler Ebene zu verbinden.