Förderbeginn 01.07.2016

Erkennen von Handlungen in Videos durch internetgestütztes Lernen

Prof. Dr. Nassir Navab
Technische Universität München
Lehrstuhl für Informatik 16 - Informatikanwendungen in der Medizin

Prof. Dr. Silvio Savarese
Stanford University
Department of Computer Science



Weltweit existieren etwa 3.5 Billionen Fotos. Allein auf Facebook werden monatlich 6 Milliarden Fotos hochgeladen. Jede Minute erscheinen 72 Stunden an neuen Videos auf YouTube. Nach einer Schätzung von Cisco wird der Anteil an visuellen Daten (Bilder und Videos) des Internetverkehrs auf 85% ansteigen. Trotzdem fehlen uns momentan noch effiziente Algorithmen um große Bild- oder Videodatenmengen verarbeiten und analysieren zu können. Die zentrale Idee dieser Zusammenarbeit ist es die Daten die bereits im Internet zu finden sind zu nutzen um manuelle Annotationen zu vermeiden, da diese oft sehr kostspielig sind. Dafür werden wir ein tiefes, neuronales Netz anfangs von Bildern von einer Suchmaschine (z.B. Google) trainieren, das dann inkrementell auf Videos ausgeweitet wird. Wir versprechen uns dadurch gute Ergebnisse ohne tausende Videos von Hand für das Training beschreiben zu müssen.