Bitte wählen Sie den gewünschten Projektzeitraum:
- Juli 2026
- Januar 2026
- Juli 2025
- Januar 2025
- Juli 2024
- Januar 2024
- Juli 2023
- Januar 2023
- Juli 2022
- Januar 2022
- Juli 2021
- Januar 2021
- Juli 2020
- Januar 2020
- Juli 2019
- Januar 2019
- Juli 2018
- Januar 2018
- Juli 2017
- Januar 2017
- Juli 2016
- Januar 2016
- Juli 2015
- Januar 2015
- Juli 2014
- Januar 2014
- Juli 2013
- Januar 2013
- Juli 2012
- Januar 2012
- Juli 2011
- Januar 2011
- Juli 2010
- Januar 2010
- Juli 2009
- Januar 2009
- Juli 2008
- Januar 2008
- Juli 2007
- Januar 2007
- Juli 2006
- Januar 2006
- Juli 2005
- Januar 2005
- Juli 2004
- Januar 2004
- Juli 2003
- Januar 2003
- Juli 2002
- Januar 2002
- Juli 2001
- Januar 2001
Förderbeginn 01.07.2023
BRAIN-Gen: Gehirnrepräsentationen Lernen mit Generativen Modellen
Prof. Dr. Nassir Navab
Technische Universität München
Fakultät für Informatik
Prof. Dr. Ehsan Adeli
Stanford University
Department of Psychiatry and Behavioral Science
Unser Projekt zielt darauf ab, ein hochentwickeltes generatives Modell zu entwickeln, um die komplexen Interaktionen von gegenfaktischen Faktoren — wie Alter, Geschlecht und Bildung — und deren Einfluss auf Gehirnstruktur, Funktion und Kognition zu entschlüsseln. Unter Verwendung umfangreicher Gehirndatensätze entwickeln wir ein Disentangling Autoencoder (DAE) Modell und nutzen dabei die neuesten Fortschritte in generativen und Disentangling-Techniken. Das DAE wird Gehirnbilddatensätze rekonstruieren und analysieren, latente Darstellungen komplexer Faktoren extrahieren. Diese Arbeit wird unser Verständnis für die Auswirkungen dieser Faktoren auf die Gehirngesundheit vertiefen, was potenziell die Entwicklung gezielter Interventionen und Therapien für neurologische Erkrankungen leiten könnte.
Abschlussbericht
Einleitung
Dieser Bericht beleuchtet die kollaborative Forschung zwischen dem Computer-Aided Medical Procedures (CAMP) Labor der Technischen Universität München (TUM) und dem Stanford Translational AI Research (STAI) Labor der Stanford University, mit Fokus auf neuesten Entwicklungen in der medizinischen Bildanalyse. Die Zusammenarbeit hat signifikante Beiträge in Bereichen wie der generativen Modellierung für multimodale MRT-Synthese und der Anwendung latenter Diffusionsmodelle für die kontrafaktische Bildgenerierung hervorgebracht. Dieser Bericht fasst die wichtigsten Ergebnisse und Methoden aus den Publikationen [1, 2, 3] zusammen, die aus den gemeinsamen Bemühungen dieser Forschungsgruppen resultieren.
Physik-Informierte Latente Diffusion für Multimodale MRT-Synthese
In [1] haben wir die Herausforderung der begrenzten und variablen Modalitätenverfügbarkeit über verschiedene Datensätze hinweg adressiert, welche die Entwicklung universell anwendbarer generativer Modelle behindert. Wir haben ein physik-informiertes generatives Modell entwickelt, um eine variable Anzahl von Hirn-MRT-Modalitäten zu synthetisieren, einschließlich solcher, die in den Trainingsdaten nicht vorhanden sind. Unser Modell verwendet einen zweistufigen generativen Prozess, der latente Diffusionsmodelle (LDMs) nutzt:
* Physikalische Gewebeeigenschaftskarten: Wir verwenden LDMs, um unbeobachtete physikalische Gewebeeigenschaftskarten zu generieren: Protonendichte (PD), longitudinale Relaxationszeit (T1) und transversale Relaxationszeit (T2). Um Informationen aus verschiedenen Modalitäten zu kombinieren, verwenden wir ein Product-of-Experts (PoE), um unimodale Inferenzverteilungen zu einer gemeinsamen multimodalen Verteilung zu aggregieren. Wir konditionieren den Encoder auch auf Akquisitionsparameter unter Verwendung der adaptiven Gruppennormalisierung (AdaGN).
* Physikalisches Signalmodell: Anschließend wenden wir ein physikalisches Signalmodell auf die generierten Gewebeeigenschaftskarten an, um die finalen MRT-Scans zu synthetisieren. Das Signalmodell besteht aus Gleichungen, die die Beziehung zwischen Gewebeeigenschaften (PD, T1, T2) und Signalintensität in Abhängigkeit von Akquisitionsparametern wie Echozeit (TE), Repetitionszeit (TR) und Inversionszeit (TI) approximieren.
Dieser physik-informierte Ansatz ermöglicht es uns, realistischere und physikalisch plausiblere MRT-Bilder zu generieren. Unsere Experimente zeigen, dass dieses Modell MRT-Kontraste generieren kann, die in den Trainingsdaten nicht vorhanden sind, und dass die generierten Gewebeeigenschaften realistische Verteilungen aufweisen.
Hybride Faltungs-Transformer-Architektur für die Segmentierung
Wir haben auch hybride Architekturen für die medizinische Bildsegmentierung untersucht, um die Vorteile von Convolutional Neural Networks (CNNs) und Transformer-Netzwerken zu kombinieren. Diese Forschung [2] basiert auf der Beobachtung, dass selbstüberwacht vortrainierte Vision Transformer, wie DINO, Aufmerksamkeitskarten lernen, die wertvolle räumliche Informationen erfassen. Um dies zu nutzen, haben wir DAINet (Dual Attention-Image Network) entwickelt, eine spezialisierte CNN-Architektur. DAINet integriert Visualisierungen von Aufmerksamkeitskarten eines vortrainierten DINO-Modells als zusätzlichen Eingabestrom neben dem Originalbild. Die Architektur verwendet ein Dual-Encoder-Design: (1) der erste Encoder verarbeitet das Originalbild und (2) der zweite Encoder verarbeitet die Visualisierungen der Aufmerksamkeitskarten. Die Ausgaben dieser Encoder werden konkateniert und in einen gemeinsamen Decoder eingespeist. Wir haben auch einen Schaltmechanismus eingeführt, um die Skip-Verbindungen zwischen den Encodern und dem Decoder zu steuern. DAINet übertrifft sowohl rein CNN-basierte als auch Transformer-basierte Architekturen bei medizinischen Bildsegmentierungsaufgaben und erzielt modernste Leistung bei reduzierten Rechenkosten.
Latentes Driften in Diffusionsmodellen für die Kontrafaktische Medizinische Bildsynthese
Wir haben uns auch der Herausforderung der Generierung kontrafaktischer medizinischer Bilder gestellt, die für die Untersuchung hypothetischer Szenarien im medizinischen Kontext entscheidend sind. Wir haben Latent Drifting (LD) [3] entwickelt, eine neuartige Methode zur Konditionierung von Diffusionsmodellen für diese Aufgabe. LD führt einen Hyperparameter σ in den Diffusionsprozess ein, um die gelernte Verteilung eines vortrainierten Modells an eine neue, Ziel-Verteilung medizinischer Bilder anzupassen. Dies ist wichtig, da das Fein-Tuning von Diffusionsmodellen auf begrenzten medizinischen Datensätzen aufgrund der Verteilungsverschiebung zwischen allgemeinen Bilddatensätzen (die für das Vortraining verwendet werden) und spezialisierten medizinischen Bilddatensätzen oft schwierig ist. Diffusionsmodelle werden trainiert, um Daten iterativ zu entrauschen, und LD modifiziert diesen Prozess, indem es den Hyperparameter σ zum Ziel des Forward-Prozesses und des Reverse-Diffusionsprozesses hinzufügt. Wir definieren LD als ein Min-Max-Optimierungsproblem, bei dem wir darauf abzielen, den Abstand zwischen der generierten Datenverteilung und der Zieldatenverteilung zu minimieren und gleichzeitig die kontrafaktische Wiedergabetreue zu maximieren. Die kontrafaktische Wiedergabetreue wird anhand einer Verlustfunktion gemessen, die die Ähnlichkeit zum Originalbild gewährleistet und gleichzeitig das gewünschte kontrafaktische Ergebnis erzielt. Die Wirksamkeit von LD wird anhand von Aufgaben zur kontrafaktischen Bildgenerierung demonstriert, die seine Fähigkeit zeigen, realistische und konditionsgetreue Bilder zu generieren.
Wichtigste Ergebnisse und Implikationen
Unsere wichtigsten Ergebnisse dieser Zusammenarbeit sind nachfolgend zusammengefasst:
* [1] zeigt, dass physik-informierte generative Modelle realistische und vielfältige MRT-Kontraste synthetisieren können, selbst solche, die in den Trainingsdaten nicht vorhanden sind, indem sie Gewebeeigenschaften und Akquisitionsparameter entkoppeln.
* In [2] haben wir festgestellt, dass die Einbeziehung von Visualisierungen von Aufmerksamkeitskarten vortrainierter Transformer CNN-basierte Segmentierungsmodelle verbessert und modernste Leistung bei reduzierten Rechenkosten erzielt.
* [3] zeigt, dass Latent Drifting Diffusionsmodelle effektiv für die kontrafaktische medizinische Bildgenerierung konditioniert und Realismus und Wiedergabetreue im Vergleich zu Standard-Feinabstimmungsmethoden verbessert.
Fazit
Unsere kollaborative Forschung hat substanzielle Beiträge zur medizinischen Bildanalyse geleistet und die Grenzen des mit Deep Learning Möglichen erweitert. Durch die Kombination unserer Expertise haben wir innovative Lösungen für die MRT-Synthese, die kontrafaktische Bildgenerierung und die Bildsegmentierung entwickelt. Diese Fortschritte bergen ein erhebliches Potenzial zur Verbesserung der diagnostischen Genauigkeit, der Behandlungsplanung und unseres allgemeinen Verständnisses medizinischer Bilder.
Referenzen
[1] S. Lüpke, Y. Yeganeh, E. Adeli, N. Navab, and A. Farshad. “Physics-Informed Latent Dif-
fusion for Multimodal Brain MRI Synthesis”. In: Medical Image Computing and Computer
Assisted Intervention – MICCAI 2024 Workshops. Cham: Springer Nature Switzerland, 2025,
pp. 198–207.
[2] Y. Yeganeh, I. Charisiadis, M. Hasny, M. Hartenberger, B. Ommer, N. Navab, A. Farshad,
and E. Adeli. “Latent Drifting in Diffusion Models for Counterfactual Medical Image Syn-
thesis”. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition (2025).
[3] Y. Yeganeh, A. Farshad, P. Weinberger, S.-A. Ahmadi, E. Adeli, and N. Navab. “Transformers pay attention to convolutions leveraging emerging properties of ViTs by dual attention-image network”. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. 2023, pp. 2304–2315.