← Zurück zum Blog
Newsca. 7 Min. Lesezeit

Die FDA schreibt Regeln für KI-Geräte, die noch niemand gebaut hat

Veröffentlicht 7. Okt. 2026
Die FDA schreibt Regeln für KI-Geräte, die noch niemand gebaut hat

Regulierungsbehörden reagieren normalerweise. Ein Produkt kommt auf den Markt, etwas geht schief, und die Leitlinie folgt. Das Gerätezentrum der FDA hat gerade das Gegenteil getan. Am 1. Oktober veröffentlichte es seine vorgeschlagene Leitlinienagenda für das Haushaltsjahr 2027, und weit oben auf der Liste steht ein Leitlinienentwurf für eine Gerätekategorie, von der es noch kein einziges Exemplar zugelassen hat.

Bei dieser Kategorie handelt es sich um konversationelle Geräte mit generativer KI, die für psychische Störungen vorgesehen sind. Das Center for Devices and Radiological Health der FDA hat bislang mehr als 1.200 KI-gestützte Medizinprodukte zugelassen. Keines davon nutzt generative KI für eine Indikation im Bereich psychische Gesundheit. Die Behörde formuliert evidenzbasierte Empfehlungen, bevor der erste Antrag eingeht – ein Weg, die Messlatte früh anzulegen, statt sie später Fall für Fall auszuhandeln.

Dieser Schritt baut auf einem Diskussionspapier auf, das das CDRH im August veröffentlichte, mit dem Titel Considerations for the Regulation of Generative AI-Enabled Medical Devices. Es ist ausdrücklich ein Diskussionsdokument, keine Politik, und es enthält 26 Fragen, die die Öffentlichkeit beantworten soll. Die Kommentarfrist endet am 19. Oktober. Wer ein klinisches Produkt auf Basis eines großen Sprachmodells entwickelt, hat rund zwei Wochen Zeit, sich dazu zu äußern, wie er reguliert werden möchte.

Ein Risikorahmen mit zwei Achsen

Die Kernidee des Papiers ist, dass generative KI-Geräte auf Arten versagen, die ältere Softwarevorschriften nicht vorhergesehen haben. Die Behörde schlägt vor, Risiken auf zwei Achsen zu bewerten. Die eine ist die Folge einer falschen Ausgabe – also wie sehr eine falsche Antwort dem Patienten schadet. Die andere ist der Grad der Eigenständigkeit – also wie stark das System selbst handelt, statt einem Menschen einen Vorschlag zu unterbreiten.

Diese Kombination ist dem Geist nach vertraut. Radiologie-Software, die einem Radiologen eine Fraktur markiert, hat ein anderes Risikoprofil als Software, die die Diagnose ohne Überprüfung stellt. Neu ist, dass dies auf Systeme angewendet wird, die nicht deterministisch sind – bei denen also dieselbe Eingabe unterschiedliche Ausgaben erzeugen kann – und die sich nach der Inbetriebnahme weiter anpassen können. Die traditionelle Softwarevalidierung geht von einem festen Artefakt aus. Ein Modell, das driftet, passt nicht zu dieser Annahme.

Um damit umzugehen, bringt das Papier einen Ansatz ins Spiel, der an die Zulassung von Ärzten angelehnt ist. Das Argument lautet, dass Ärzte nicht in jedem Szenario geprüft werden, mit dem sie konfrontiert werden könnten. Sie bestehen strukturierte Prüfungen ihres Grundwissens und ihrer Denkfähigkeit und praktizieren dann unter Aufsicht. Die FDA fragt, ob ein generatives Gerät auf dieselbe Weise bewertet werden könnte – mit nicht-klinischem Benchmarking gegen definierte Standards, gefolgt von klinischer Bestätigung in realen oder simulierten Umgebungen.

Die Post-Market-Überwachung bekommt die schwierigere Aufgabe. Da sich diese Systeme verändern können, schlägt das Papier vor, Leistungsdrift, Halluzinationen und unerwartete Ausgaben sowohl des geräteeigenen Modells als auch eines darunterliegenden Foundation-Modells zu verfolgen. Der zweite Teil ist wichtig. Ein Gerätehersteller, der das Modell eines anderen feinabstimmt, erbt Verhalten, das er nicht vollständig überblicken kann, und das Papier fragt direkt, wie Marktzulassungs- und Post-Market-Erwartungen gelten sollen, wenn der Hersteller das zugrunde liegende Modell nicht kontrolliert.

Was das Papier vermeidet zu sagen

Liest man das Dokument daraufhin, was es auslässt, wird die Richtung klarer. Es verwendet nie die alte Unterscheidung der FDA zwischen gesperrten und adaptiven Algorithmen. Es vermeidet die Begriffe Software in einem Medizinprodukt und Software als Medizinprodukt, die das Vokabular eines Jahrzehnts der Geräteprüfung waren. Klinische Entscheidungsunterstützung taucht nur in einer Fußnote auf.

Die Auslassungen wirken beabsichtigt. Die alten Kategorien wurden für Software geschaffen, die sich nach der Validierung vorhersehbar verhält. Generative Systeme verwischen die Grenze zwischen dem Werkzeug und der Ausgabe, und die Behörde scheint Platz für einen Rahmen zu schaffen, der diese Annahmen nicht erbt. Ob das ein echter Neuanfang oder eine Neuverpackung derselben Prinzipien ist, ist genau das, wozu die Stakeholder Stellung nehmen sollen.

Die Leitlinienagenda zeigt, wohin das Geld fließt

Die Agenda für das Haushaltsjahr 2027, zu der bis zum 30. November Kommentare eingereicht werden können, zeigt, welche Entwürfe die Behörde als nahezu abgeschlossen betrachtet. Drei stehen ganz oben. Erstens die Finalisierung der Leitlinie zum Software-Lebenszyklus KI-gestützter Geräte, die erstmals im Januar 2025 entworfen wurde und abdeckt, wie ein Modell über seinen gesamten Lebenszyklus überwacht, aktualisiert und erneut validiert wird – nicht nur bei der Zulassung. Zweitens die Finalisierung der Leitlinie zu vorab festgelegten Änderungskontrollplänen aus August 2024, die definiert, was ein Sponsor im Voraus festlegen muss, um bestimmte Algorithmusänderungen nach der Markteinführung ohne neue Einreichung vorzunehmen. Drittens die Finalisierung der Leitlinie für roboterassistierte chirurgische Geräte, einschließlich eines separaten Entwurfs von Ende September zu Instrumentensteuerung, Latenz, Cybersicherheit und Sterilisation.

Diese drei sind die Aussage der Behörde: Hier steht der Einsatz bereits. Vorab festgelegte Änderungskontrollpläne sind der Mechanismus, der es einer zugelassenen KI-Funktion erlaubt, weiterzulernen, ohne eine neue Prüfung zu durchlaufen, und sie sind der Unterschied zwischen einem Modell, das einmal ausgeliefert wird, und einem Modell, das sich verbessert. Die Lebenszyklus-Leitlinie macht aus dieser Erlaubnis eine Betriebsanforderung. Zusammen beschreiben sie ein Gerät, das als fortlaufender Prozess und nicht als versiegeltes Produkt reguliert wird.

Das Problem mit Modellen von Drittanbietern

Eine Frage im Papier verdient mehr Aufmerksamkeit als die anderen. Sie fragt, wie Marktzulassungs- und Post-Market-Erwartungen gelten sollen, wenn der Hersteller das zugrunde liegende Foundation-Modell nicht kontrolliert. Diese Situation ist inzwischen die Norm und nicht die Ausnahme. Ein Krankenhaussystem, das ein Allzweckmodell für die Triagierung nutzt, trainiert es nicht neu und hat keinen Zugang zu den Trainingsdaten, dem Fine-Tuning-Verfahren oder dem Änderungsplan.

Schon die Formulierung der Behörde räumt die Schwierigkeit ein. Die Post-Market-Überwachung müsste in ihrem Modell sowohl die Drift im Modell des Geräts als auch die im darunterliegenden Foundation-Modell verfolgen, was bedeutet, dass ein Gerätehersteller Einblick in Änderungen benötigt, die er nicht vorgenommen hat und über die er möglicherweise nicht informiert wird. Die Übertragung der Kompetenzidee auf diesen Fall wirft die Frage auf, wer die Zulassung erhält. Der Gerätehersteller kann nachweisen, dass seine eigene Schicht funktioniert, aber er kann das Verhalten einer Komponente, die er lizenziert, nicht ohne Weiteres nachweisen.

Ein Vergleich mit der früheren Generation von KI-Geräteregeln lohnt sich. Vorab festgelegte Änderungskontrollpläne funktionieren, wenn ein Sponsor das Modell kontrolliert und die beabsichtigten Änderungen im Voraus festlegen kann. Kommt das Modell von einem Dritten, muss der Plan Aktualisierungen berücksichtigen, die nach dem Zeitplan eines anderen eintreffen. Keine der Diskussionsfragen löst das, und die Antworten werden weitgehend darüber entscheiden, ob der letztlich entstehende Rahmen für kleine Entwickler machbar ist oder nur für Unternehmen, die groß genug sind, um ihre eigenen Modelle zu bauen.

Warum der Zeitpunkt ungewöhnlich ist

Leitlinien zu schreiben, bevor ein erster Antrag eingeht, ist selten, und der Grund, warum es hier geschieht, ist, dass das konversationelle Gerät für psychische Gesundheit die schwierigste Version des Problems ist. Diese Systeme sprechen mit Patienten in natürlicher Sprache, was ihre Ausgaben schwer eingrenzbar und schwer testbar macht. Ein diagnostisches Modell gibt eine Zahl zurück. Ein konversationelles gibt zurück, was auch immer es als Nächstes zu sagen beschließt.

Die Behörde muss zudem ihre eigene Vorsicht mit dem politischen Druck in Einklang bringen, medizinische Innovation zu beschleunigen, und das Diskussionspapier spiegelt beides wider. Es stützt sich auf einen risikobasierten Ansatz mit möglichst geringer Belastung und räumt zugleich ein, dass eine Marktzulassungsprüfung allein ein System, das sich verändert, nicht bewerten kann. Diese Spannung ist der Grund, warum das Dokument in Fragen statt in Antworten endet. Sie ist auch der Grund, warum es sich lohnt, die 26 Fragen genau zu lesen. Sie sind eine Vorschau auf die Argumente, die das erste zugelassene generative Gerät für psychische Gesundheit prägen werden – wann auch immer jemand einen Antrag dafür einreicht.

Andere Regulierungsbehörden bewegen sich parallel. Die britische Arzneimittelbehörde hat drei Gesetzesänderungen ans Parlament geschickt, um die Geräteaufsicht zu modernisieren, einschließlich ausdrücklichem Raum für Software- und KI-Geräte in einem nach Risikostufen gegliederten Lizenzrahmen. Japan überarbeitet seine Anforderungen an biologische Produkte, um neuere molekulare Testmethoden aufzunehmen. Das Muster ist bei allen dreien dasselbe: Die Regeln werden neu aufgebaut, bevor die Produkte eintreffen – auf die Wette, dass es billiger ist, sie im Voraus zu schreiben, als sie später auszufechten.

Verwandte Artikel