
Merlin: KI liest CT-Scans und sagt Krankheiten voraus
Quellen (7)
- Nature: Merlin – a computed tomography vision–language foundation model and datasetnature.com
- EurekAlert: Automated CT scan analysis could fast-track clinical assessmentseurekalert.org
- AuntMinnie: AI model shows promise for reading CT scans like a radiologist wouldauntminnie.com
- Stanford MIMI GitHub: Merlingithub.com
- PMC: Merlin – A Computed Tomography Vision-Language Foundation Modelpmc.ncbi.nlm.nih.gov
- STAT News: FDA clears Aidoc tool that detects multiple conditions on a CT scanstatnews.com
- The Imaging Wire: FDA AI Approvals Surge Past 1k for Radiologytheimagingwire.com
Die FDA hat über 1.000 KI-Systeme für die Radiologie zugelassen. Fast alle können genau eine Aufgabe: ein Organ, ein Befundbild, eine Erkrankung. Stanfords Foundation-Model Merlin zeigt, dass ein anderer Ansatz möglich ist: Es analysiert vollständige CT-Volumina dreidimensional, bewältigt 752 diagnostische Aufgaben auf einmal und übertraf in der externen Prüfung an 44.000 Scans aus vier Krankenhäusern spezialisierte Einzelsysteme. Die Ergebnisse erschienen im März 2026 in Nature.
Was Merlin anders macht als bisherige Radiologie-KI
Merlin ist ein sogenanntes 3D-Vision-Language-Foundation-Model: ein KI-System, das gleichzeitig CT-Bilddaten, Diagnose-Codes aus elektronischen Patientenakten und Texte aus Radiologieberichten verarbeitet. Entwickelt wurde es von Louis Blankemeier und Akshay Chaudhari vom Department of Radiology der Stanford University, gefördert durch die US-amerikanischen National Institutes of Health (NIH).

Das entscheidende technische Merkmal gegenüber bisherigen Radiologie-KI-Systemen: Merlin wertet nicht einzelne 2D-Schichten eines CT-Scans aus, sondern den gesamten 3D-Volumendatensatz auf einmal. Bei einem Abdominal-CT sind das typischerweise mehr als 300 Schichten. Bisherige Systeme arbeiteten schichtweise und verloren dabei räumliche Zusammenhänge, die für Diagnosen entscheidend sein können. Merlin verarbeitet das vollständige Volumen und erkennt Strukturen und Muster, die im zweidimensionalen Schnittbild nicht sichtbar sind.
Trainiert wurde das Modell auf einem Datensatz der Stanford University School of Medicine: über 6 Millionen CT-Bilder aus 15.331 Scans, kombiniert mit mehr als 1,8 Millionen Diagnose-Codes aus Patientenakten und mehr als 6 Millionen Texttoken aus echten Radiologieberichten.
Was 752 Tests zeigten
Die Forscher evaluierten Merlin auf 752 einzelne diagnostische Aufgaben in sechs Kategorien: die Klassifizierung von 31 abdominalen Befunden ohne spezifisches Training (Zero-Shot), die Vorhersage von 692 medizinischen Phänotypen anhand von ICD-Codes, automatische Generierung von Radiologieberichten, 3D-Segmentierung von 20 Organen sowie die Vorhersage des Fünfjahresrisikos für sechs chronische Erkrankungen darunter Diabetes, Hypertonie und kardiovaskuläre Erkrankungen.
Bei der Phänotyp-Klassifizierung erzielte Merlin laut der Nature-Publikation im Schnitt 81 Prozent Genauigkeit. Bei einem Subset von 102 häufigen Diagnose-Codes stieg dieser Wert auf 90 Prozent. Für die Fünfjahresrisiko-Vorhersage erreichte das Modell einen AUROC-Wert von 0,757, verglichen mit 0,68 für ein Vergleichsmodell: Das entspricht einer Verbesserung um mehr als sieben Prozentpunkte. Bei der internen Zero-Shot-Klassifizierung erzielte Merlin einen F1-Score von 0,741 und übertraf damit spezialisierte Systeme wie OpenCLIP und BiomedCLIP. Besonders relevant: Das Modell funktionierte auch bei Thorax-CT-Scans, obwohl es ausschließlich auf Abdominalscans trainiert worden war.
Im Vergleich: KI in der Radiologie
Merlin tritt in ein Feld ein, das in den vergangenen Jahren rasant gewachsen ist. Die FDA hat bis Ende 2025 mehr als 1.000 KI-gestützte Medizinprodukte für die Radiologie zugelassen. GE HealthCare allein hält 115 dieser Zulassungen, gefolgt von Siemens Healthineers und Philips. Das Grundmuster all dieser Systeme: Jedes ist auf eine einzige Aufgabe oder einen einzelnen anatomischen Bereich spezialisiert.
Ein konkretes Beispiel liefert Aidoc: Das Unternehmen erhielt im Januar 2026 die FDA-Clearance für ein Abdominal-CT-Tool, das gleichzeitig 14 Befunde erkennt, darunter Leberläsionen, Milzverletzungen und Appendizitis. Das galt als Durchbruch, weil bisherige zugelassene Tools je nur eine einzige Befundkategorie abdeckten. Zum Vergleich: Merlin wurde auf 752 Aufgaben und 692 Phänotypen getestet, also ein Vielfaches dessen, was Aidoc abdeckt.

Ein zweites Vergleichsmaß liefert Comp2Comp, ein Open-Source-Projekt aus derselben Stanford-Gruppe, das mehrere FDA-Clearances für spezifische CT-Gewebemessungen hält. Comp2Comp konzentriert sich auf klar begrenzte Messaufgaben. Merlin hingegen ist ein generalistisches Basismodell, das ohne Nachtraining auf neue Aufgaben angewendet werden kann. Das ist eine fundamental andere Herangehensweise.
Drei Voraussetzungen für den klinischen Einsatz
Ein Foundation-Modell wie Merlin ist kein Medizinprodukt, das sofort in einem Krankenhaus eingesetzt werden kann. Drei konkrete Voraussetzungen müssen erfüllt sein.
Erstens: prospektive klinische Studien. Alle publizierten Daten zu Merlin stammen aus retrospektiven Analysen historischer Datensätze. Für eine Marktzulassung durch FDA oder EMA braucht es neue Studien, in denen das Modell unter realen klinischen Bedingungen mit aktuellen Patienten validiert wird.
Zweitens: Regulierung. Die FDA hat ein dediziertes Zulassungsverfahren für KI-Medizinprodukte entwickelt. Der Weg von einem wissenschaftlichen Modell zur klinischen Clearance dauert typischerweise zwei bis fünf Jahre. Für ein System der Komplexität Merlins, das 752 Aufgaben abdecken soll, dürfte der Zeitrahmen am oberen Ende liegen.
Drittens: Integration in bestehende Radiologieworkflows. Scanner, Bildverwaltungssysteme und Befundungssoftware stammen aus verschiedenen Generationen und sprechen unterschiedliche Protokolle. Eine standardisierte Schnittstelle für ein Foundation-Modell dieser Komplexität existiert in der klinischen Praxis noch nicht.
Die Forscher haben Code, Modell und einen Datensatz von 25.494 CT-Scan-Radiologiebericht-Paaren open-source veröffentlicht. Das beschleunigt die externe Validierung durch andere Forschungsgruppen. Ob das den klinischen Weg verkürzt, hängt davon ab, wie viele dieser Gruppen in den nächsten Jahren in prospektive Studien einsteigen.
Kommentare