Interview mit Mary-Anne Hartley, EPFL

Wie die EPFL offene KI-Modelle für die Medizin entwickelt

Uhr

Unter dem Namen Meditron veröffentlicht die ETH Lausanne grosse, offene Sprachmodelle für die Medizin. Im Interview sagt Mary-Anne Hartley, Leiterin des Laboratory for Intelligent Global Health and Humanitarian Response Technologies (LIGHT), wie die Modelle entstanden und wie Fachärzte von ihnen profitieren können. Interview: René Jaun

Mary-Anne Hartley, Leiterin des Laboratory for Intelligent Global Health and Humanitarian Response Technologies (LIGHT), EPFL. (Source: zVg)
Mary-Anne Hartley, Leiterin des Laboratory for Intelligent Global Health and Humanitarian Response Technologies (LIGHT), EPFL. (Source: zVg)

Im Herbst 2023 haben Sie mit Meditron ein Open-Source-Sprachmodell für die Medizin lanciert. Im Sommer 2026 lancierten Sie nun mit "Meditron FO" keinen direkten Nachfolger, sondern ein Framework zum Erstellen medizinischer Sprachmodelle. Warum haben Sie sich für diesen neuen Ansatz entschieden?

Mary-Anne Hartley: Der Grund war pragmatischer Natur. Fast wöchentlich erscheinen neue offene Modelle. Ist das Finetuning an ein bestimmtes Basismodell gebunden, kann es bereits veraltet sein, wenn wir es veröffentlichen. Unterschiedliche Einsatzbereiche benötigen zudem unterschiedliche Modelle. Einige müssen lokal mit begrenzten Rechenressourcen laufen; andere müssen bestimmte Sprachen unterstützen oder spezifische Anforderungen an Lizenzierung und Bereitstellung erfüllen. Mit einem Framework können wir ein geeignetes Basismodell auswählen und gleichzeitig den Prozess der medizinischen Anpassung konsistent halten. Im Konzept steckt auch ein wenig das Theseus-Paradoxon.

Was meinen Sie damit?

Wenn man jede Planke eines Schiffes ersetzt, ist es dann noch dasselbe Schiff? Wir stellten uns eine ähnliche Frage: Wenn wir jeden Parameter ersetzen, was macht das neue Modell dann weiterhin zu Meditron? Wir glauben, dass seine Kontinuität nicht in einem festen Satz von Gewichten liegt, sondern in dem, was weitergeführt wird: eine überprüfbare Methode, ein konsistenter Satz klinischer Werte und die kontinuierliche Beteiligung von Ärztinnen und Ärzten – von der Erstellung des Korpus über die Evaluation bis hin zur Bereitstellung. Die Parameter mögen sich ändern, aber diese Grundsätze bleiben bestehen.

Sie trainierten mehrere offene Sprachmodelle mithilfe des Meditron-FO-Frameworks. Wie wirkt sich die Wahl des Basismodells auf das Endresultat aus?

Das Basismodell bestimmt die Fähigkeiten, die Meditron übernimmt, darunter Schlussfolgerungsvermögen, Sprachabdeckung, Grösse und Möglichkeiten zur Bereitstellung. Jedes von uns getestete Basismodell verbesserte sich nach der medizinischen Anpassung. Apertus-70B legte dabei um 6,6 Prozentpunkte zu.

Gibt es ein bestimmtes Basismodell, das Sie medizinischen Fachpersonen empfehlen würden?

Einen universellen Gewinner gibt es nicht. Benchmarks können nicht jeden klinischen Kontext erfassen, und Blindtests ergaben in Kenia, Tansania und Malawi unterschiedliche Präferenzen. Das beste Modell ist jenes, das für die relevanten Sprachen, Arbeitsabläufe und die vorhandene Infrastruktur validiert wurde. In manchen Umgebungen kann ein kleineres, lokal einsetzbares Modell nützlicher sein als jenes mit dem höchsten Benchmark-Ergebnis.

Sie erwähnten das an der EPFL entwickelte offene KI-Modell Apertus. Ihre Arbeit baute unter anderem auf diesem Modell auf. Hat Ihre Arbeit umgekehrt auch die Entwicklung von Apertus beeinflusst?

Ja. Der Meditron-Korpus wurde beim Training von Apertus 1.5 verwendet, das in unseren Evaluationen eine vergleichbare Leistung bei medizinischen Benchmarks erreichte. Derzeit helfen wir bei der Entwicklung des medizinischen Experten für die nächste Apertus-Generation.

Bei der Entwicklung von Meditron arbeiten Sie aktiv mit medizinischen Fachpersonen zusammen. Wie sah diese Zusammenarbeit bisher aus und wie funktioniert sie heute?

Ärztinnen und Ärzte sind dauerhaft Teil unseres Kernentwicklungsteams und an den täglichen Diskussionen beteiligt. Sie gestalten die gesamte Pipeline mit – von der Erstellung des Korpus über die Evaluation bis hin zu klinischen Studien. MOOVE, kurz für Massive Open Online Validation and Evaluation, ist die Komponente unserer vollständig offenen Entwicklungspipeline für die klinische Beteiligung und das Feedback. Sie verbindet Evaluationen anhand hypothetischer Fälle und klinische Studien unter realen Bedingungen mit dem anschliessenden Training und der Evaluation der Modelle. Das daraus resultierende Feedback und die gewonnenen Daten fliessen wiederum in das Training und die Evaluation der Modelle ein. Zudem bringen wir klinische Fachpersonen für intensive Evaluationssessions ("Validatathons") zusammen. Befragungen vor und nach der Teilnahme deuten darauf hin, dass ihnen die Teilnahme auch dabei hilft, ihre Begeisterung für diese Werkzeuge und ihr Bewusstsein für deren Grenzen besser auszubalancieren.

Wie hat das Feedback aus der medizinischen Community Meditron verändert?

Grundlegend. Beim Feedback geht es um mehr als darum, was klinische Fachpersonen bevorzugen: Es zwingt uns dazu, uns mit der Realität der Implementierung dieser Werkzeuge auseinanderzusetzen – begrenzte Zeit, verfügbare Ressourcen und die Anforderungen klinischer Arbeitsabläufe. Diese Realitäten beeinflussen, was wir entwickeln und wie wir es evaluieren. Wir verwenden das Feedback aus MOOVE zudem direkt zum Training der Modelle. Bei einer Evaluation in der Schweiz bevorzugten Klinikerinnen und Kliniker das daraus entstandene Modell in 70 Prozent der Vergleiche; dasselbe Modell wurde auch in Tansania bevorzugt. Das deutet darauf hin, dass sich manche klinischen Präferenzen über verschiedene Gesundheitssysteme hinweg übertragen lassen, auch wenn der Kontext eine Rolle spielt. Wir können aus diesen gemeinsamen Präferenzen lernen und gleichzeitig die Modelle weiterhin an lokale Bedürfnisse anpassen.

Wie haben Sie den medizinischen Trainingskorpus zusammengestellt? Wo haben Sie die Grenze gezogen – gab es beispielsweise Material, das Sie bewusst nicht in die Trainingsdaten aufgenommen haben?

Vollständige Offenheit war der Ausgangspunkt: Wir wollten nicht nur die Modellgewichte veröffentlichen, sondern auch die Datenquellen, Lizenzen und den Erstellungsprozess überprüfbar machen. Wir kombinierten acht öffentliche medizinische Frage-Antwort-Datensätze, mehr als 46’000 klinische Leitlinien und von Fachpersonen verfasste Fallvignetten aus MOOVE. Anschliessend erweiterten wir sie mithilfe eines von klinischen Fachpersonen überprüften Prozesses zur Erzeugung synthetischer Daten. Wir schlossen Quellen mit schwacher Evidenz aus, verwarfen Beispiele, die sich nicht zuverlässig standardisieren liessen, und entfernten erkannte Überschneidungen mit Evaluations-Benchmarks. Der veröffentlichte Korpus basiert nicht auf privaten Patientendaten, und die Lizenzen seiner Quellen sind dokumentiert. Klinische Fachpersonen halfen uns zudem dabei, die Grenzen nicht an den falschen Stellen zu ziehen. Wir verfeinerten die Ausschlusskriterien für "veraltete" Inhalte sowie für lokale Anpassungen, die in Gebieten mit begrenzten Ressourcen akzeptabel sind.

Welche Vorteile gegenüber einem herkömmlichen medizinischen KI-Modell bieten vollständig offene KI-Modelle einer Hausärztin oder einem Hausarzt?

Stellen Sie sich vor, Ihr klinischer Arbeitsablauf wäre von einem kommerziellen Modell wie Fable 5 abhängig – und dieses würde eingestellt, plötzlich unbezahlbar oder durch ein Update in seiner Leistung verändert. Das System, das Sie validiert haben, wäre möglicherweise nicht mehr dasselbe System, das Sie verwenden. Offene Modelle ermöglichen es Institutionen, eine validierte Version beizubehalten, sie lokal anzupassen und Upgrades selbst zu kontrollieren. Vollständig offene Modelle gehen noch weiter: Dokumentierte Trainingsquellen, Lizenzen und Methoden ermöglichen eine Überprüfung im Hinblick auf die Transparenz- und Urheberrechtsanforderungen des EU AI Act. Damit wird Offenheit nicht nur zu einem Prinzip für faire und transparente Entwicklungsstandards, sondern auch zu einer praktischen Grundlage für Kontrolle und Rechenschaftspflicht.

Wenn ein KI-System eine falsche medizinische Empfehlung abgibt, möchte man im Nachhinein verstehen, was schiefgelaufen ist. Inwiefern ermöglicht es Ihre offene Pipeline in einem solchen Fall, den Entscheidungsprozess nachzuvollziehen?

Ein klinischer Fehler ist nicht zwangsläufig allein die Schuld eines Modells. Das klassische "Swiss-Cheese"-Modell der Patientensicherheit beschreibt, wie Schaden entstehen kann, wenn Lücken in aufeinanderfolgenden Sicherheitsvorkehrungen zusammenfallen. Bei KI können solche Lücken überall in den komplexen Interaktionen zwischen Modell, medizinischer Fachperson, Arbeitsablauf, Patient, Überweisungskette und Kontext entstehen. MOOVE bildet deshalb einen zentralen Bestandteil unseres offenen Entwicklungsprozesses: Unsere klinischen Studien unter realen Bedingungen untersuchen diese Interaktionen in der Praxis und lassen die daraus gewonnenen Erkenntnisse wieder in die Entwicklung einfliessen. Um Fehler zu verstehen, muss das gesamte klinische System in seinem jeweiligen Kontext untersucht werden, statt im Nachhinein lediglich das Modell zu analysieren.

Laut Ihrer Ankündigung stehen Studien der neuen Meditron-Modelle unter realen klinischen Bedingungen noch aus. Welche Anwendungsfälle möchten Sie testen?

Alle! Wir entwickeln eine Plattformstudie, die im Laufe der Zeit neue Anwendungsfälle aufnehmen kann – sowohl in Umgebungen mit vielen als auch mit begrenzteren Ressourcen. In der Schweiz untersuchen wir zunächst, ob Meditron dabei helfen kann, unnötige Interventionen zu reduzieren, darunter vermeidbare Antibiotikaverschreibungen und bildgebende Untersuchungen. In der medizinischen Grundversorgung in ressourcenärmeren Gebieten liegt der Schwerpunkt auf einer sicheren Triage, diagnostischer Sensitivität sowie der Identifikation von Patientinnen und Patienten, die eine Behandlung oder Überweisung benötigen. Das sind unterschiedliche Ausprägungen desselben Ziels: begrenzte Ressourcen einzusetzen, um eine angemessene Versorgung zu gewährleisten.

Die Schweiz arbeitet derzeit an der Einführung des elektronischen Gesundheitsdossiers (E-GD). Welche Daten müsste ein E-GD oder ein Praxisinformationssystem bereitstellen, damit Meditron einen echten klinischen Nutzen bieten kann?

In ein sicheres E-GD zu investieren, ohne zugleich über eine nutzbare, lokal kontrollierte KI-Alternative zu verfügen, wäre ein schwerwiegendes Versäumnis bei der Datensicherheit. Wir haben wiederholt erlebt, dass klinische Fachpersonen Patienteninformationen in externe kommerzielle Modelle kopieren, weil sie praktische Unterstützung bei der Patientenversorgung benötigen. Sicherheit muss berücksichtigen, wie klinische Fachpersonen tatsächlich arbeiten. Ich hoffe, dass Investitionen in das E-GD auch klinisch validierte lokale medizinische Modelle finanzieren, die über sichere Schnittstellen angebunden sind und Patientendaten innerhalb einer Infrastruktur halten, die Gesundheitseinrichtungen kontrollieren können.

Im klinischen Alltag liegen viele relevante Informationen noch nicht sauber strukturiert vor, sondern finden sich etwa in Arztberichten, Freitext­notizen oder Austrittsberichten. Wie gut eignet sich Ihr Ansatz für diese Art von Daten und welche ­neuen Fehlerquellen könnten bei deren Verarbeitung entstehen?

Sprachmodelle eignen sich gut dafür, Informationen aus Freitext zu extrahieren und zusammenzufassen, doch klinische Abkürzungen sind stark lokal geprägt. In der französischen Notfallmedizin kann ACR für einen Herz-Kreislauf-Stillstand stehen; in der amerikanischen Nephrologie kann damit das Albumin-Kreatinin-Verhältnis im Urin gemeint sein. Eine Verwechslung könnte die Krankengeschichte einer Patientin oder eines Patienten grundlegend verfälschen. Sprachliche Gewandtheit allein bedeutet noch kein klinisches Verständnis. Neben bekannten Risiken wie Bias und Halluzinationen werfen längere klinische Texte zudem grundlegende Datenschutzfragen auf, wenn sie weitergegeben werden.

Wenn Sie drei bis fünf Jahre in die Zukunft blicken: Wie sähe für Sie die ideale KI-unterstützte Arztpraxis aus? Und welche Rolle würde Meditron darin spielen?

In der Informatik gibt es einen Witz, wonach wir eine Technologie "KI" nennen, solange sie auffällig, umständlich und fehleranfällig ist; sobald sie zuverlässig funktioniert, wird sie einfach zu Software. Genau das würde ich gerne in der Medizin sehen: KI tritt in den Hintergrund, weil sie zuverlässig geworden ist. Mein Ideal ist reibungslos, konsequent zugänglich und in lokaler Hand. Modelle wären in klinische Arbeitsabläufe integriert, würden mithilfe lokaler Daten verbessert und auf expliziten Statistiken basieren, wobei Unsicherheiten auf eine für klinische Fachpersonen verständliche Weise ausgedrückt würden. Wenn wir wissen, wie sie bei unserer eigenen Patientenpopulation funktionieren, können wir unsere Wachsamkeit entsprechend kalibrieren und verstehen, wann wir ihren Ergebnissen vertrauen können. Das ist die Zukunft, an deren Aufbau Meditron mitwirken soll. Ich bin stolz darauf, Teil der vollständig offenen Bewegung zu sein, bei der die Schweiz eine Vorreiterrolle einnimmt. Technologien, die Entscheidungen mit weitreichenden Folgen für die klinische Versorgung beeinflussen, sollten überprüfbar sein, von den Gesundheitssystemen kontrolliert werden, denen sie dienen, und dort zugänglich sein, wo sie den grössten Unterschied bewirken können.

Webcode
BcnmFZ2P