Förderbeginn 01.01.2019

Intrinsisch motivierte intelligente Systeme - unüberwachtes Lernen durch physikalische Interaktion und Beobachtung

Prof. Dr. Nils Thuerey
Technische Universität München
Lehrstuhl für Informatik 15 - Computer Graphik und Visualisierung

Damian Mrowca
Stanford University
Stanford Neuroscience and Artificial Intelligence Laboratory



Säuglinge erforschen ihre Umwelt auf eine scheinbar willkürliche aber strukturierte Art und Weise, welche als Neugier bezeichnet wird. Sie scheinen dadurch absichtlich Ereignisse zu kreieren, die für sie neu, informativ und aufregend sind. Ein intelligentes System, welches ähnliche Fähigkeiten aufweisen kann, wäre in Anwendungen im Bereich Computer-Vision oder Robotik von großem Nutzen. Basierend auf dieser Tatsache sollen die Möglichkeiten für ein autonomes intelligentes System untersucht werden, um in einer realistischen physischen Umgebung ohne Überwachung zu lernen. Im Rahmen dieses Projekts kombinieren wir IT-Techniken, wie z. B. Deep Learning mit den Erfahrungen aus Psychologie, um einen weiteren Schritt in Richtung einer besseren künstlichen Intelligenz zu machen. Es wird erwartet, dass die Ergebnisse erste Schritte zur Schaffung flexibler, selbstüberwachter autonomer Agenten sind und die Entwicklung effizienter Lernalgorithmen weiter voranschreiten. Dieses Projekt profitiert von Partnern aus unterschiedlichen Forschungsgebieten wie Informatik, Neurobiologie und Psychologie.

Abschlussbericht
In diesem BaCaTec-Projekt haben wir uns auf eine gemeinsame Forschung mit der Stanford University konzentriert. Kürzlich wurden auf neuronalen Netzen basierende Vorwärtsdynamikmodelle vorgeschlagen, die versuchen, die Dynamik physikalischer Systeme auf deterministische Weise zu erlernen. Während kurzfristige Bewegungen genau vorhergesagt werden können, leiden langfristige Vorhersagen unter der Akkumulation von Eingabe- und Vorhersagefehlern, die zu plausiblen, aber unterschiedlichen Trajektorien führen können, die von der Grundwahrheit abweichen. Ein System, das Verteilungen der zukünftigen physikalischen Zustände für lange Zeithorizonte basierend auf ihrer Unsicherheit vorhersagt, ist daher eine vielversprechende Lösung. In diesem Projekt stellen wir eine neuartige robuste Monte-Carlo- Sampling-Methode vor, die auf einer Graph-Faltungs-Dropout-Methode basiert, die es uns ermöglicht, mehrere plausible Trajektorien für einen Anfangszustand zu samplen, wenn ein auf einem neuronalen Netz basierender Vorwärtsdynamik-Prädiktor gegeben ist. Durch die Einführung eines neuen Formbewahrungsverlustes und das rekurrente Training unseres Dynamikmodells stabilisieren wir langfristige Vorhersagen. Wir zeigen, dass die langfristigen Vorwärtsdynamik-Vorhersagefehler unseres Modells bei komplizierten physikalischen Interaktionen von starren und deformierbaren Objekten verschiedener Formen signifikant niedriger sind als bei bestehenden starken Basislinien. Schließlich demonstrieren wir, wie die Generierung mehrerer Trajektorien mit unserer Monte-Carlo-Dropout-Methode verwendet werden kann, um modellfreie Reinforcement-Learning-Agenten schneller und zu besseren Lösungen bei einfachen Manipulationsaufgaben zu trainieren.