La FDA sta scrivendo regole per dispositivi IA che nessuno ha ancora costruito

I regolatori di solito reagiscono. Un prodotto viene immesso sul mercato, qualcosa va storto e arrivano le linee guida. Il centro per i dispositivi della FDA ha appena fatto l'opposto. Il 1° ottobre ha pubblicato la sua proposta di agenda delle linee guida per l'anno fiscale 2027, e vicino alla cima della lista c'è una bozza di documento di linee guida per una categoria di dispositivi di cui non ha ancora autorizzato nemmeno un singolo esempio.
La categoria è quella dei dispositivi conversazionali abilitati all'IA generativa destinati ai disturbi di salute mentale. Il Center for Devices and Radiological Health della FDA ha autorizzato finora più di 1.200 dispositivi medici abilitati all'IA. Nessuno di essi utilizza l'IA generativa per un'indicazione di salute mentale. L'agenzia sta scrivendo raccomandazioni probatorie prima che arrivi la prima domanda, il che è un modo per fissare l'asticella in anticipo invece di negoziarla caso per caso in seguito.
Questa mossa si aggiunge a un documento di discussione che il CDRH ha pubblicato in agosto, intitolato Considerazioni per la regolamentazione dei dispositivi medici abilitati all'IA generativa. È esplicitamente un documento di discussione, non una politica, e contiene 26 domande a cui il pubblico deve rispondere. I commenti si chiudono il 19 ottobre. Chiunque stia costruendo un prodotto clinico su un modello linguistico di grandi dimensioni ha circa due settimane per dire qualcosa su come vuole essere regolamentato.
Un quadro di rischio a due assi
L'idea centrale del documento è che i dispositivi di IA generativa falliscono in modi che le vecchie regole sul software non avevano previsto. L'agenzia propone di valutare il rischio su due assi. Uno è la conseguenza di un output errato, cioè quanto gravemente una risposta sbagliata danneggia il paziente. L'altro è il livello di indipendenza, cioè quanto il sistema agisce da solo rispetto a consegnare a un umano un suggerimento.
Questa combinazione è familiare nello spirito. Un software di radiologia che segnala una frattura a un radiologo ha un profilo di rischio diverso da un software che formula la diagnosi senza revisione. La novità è applicarlo a sistemi non deterministici, cioè in cui lo stesso input può produrre output diversi, e che possono continuare ad adattarsi dopo l'implementazione. La validazione tradizionale del software presuppone un artefatto fisso. Un modello che subisce drift non rientra in questo presupposto.
Per gestirlo, il documento propone un approccio modellato su come vengono accreditati i clinici. L'argomento è che i medici non vengono testati su ogni scenario che potrebbero affrontare. Superano valutazioni strutturate delle conoscenze e del ragionamento di base, poi esercitano sotto supervisione. La FDA chiede se un dispositivo generativo potrebbe essere valutato allo stesso modo, con benchmarking non clinico rispetto a standard definiti seguito da conferma clinica in ambienti reali o simulati.
La sorveglianza post-commercializzazione riceve il compito più difficile. Poiché questi sistemi possono cambiare, il documento suggerisce di monitorare il drift delle prestazioni, le allucinazioni e gli output imprevisti sia del modello proprio del dispositivo sia di qualsiasi modello di base sottostante. Questa seconda parte conta. Un produttore di dispositivi che esegue il fine-tuning sul modello di qualcun altro eredita un comportamento che non può vedere appieno, e il documento chiede direttamente come dovrebbero applicarsi le aspettative pre-commercializzazione e post-commercializzazione quando il produttore non controlla il modello sottostante.
Cosa evita di dire il documento
Leggete il documento per ciò che omette e la direzione diventa più chiara. Non usa mai la vecchia distinzione della FDA tra algoritmi bloccati e adattivi. Evita i termini software in un dispositivo medico e software come dispositivo medico, che sono stati il vocabolario di un decennio di revisione dei dispositivi. Il supporto decisionale clinico compare solo in una nota a piè di pagina.
Le omissioni sembrano deliberate. Le vecchie categorie erano costruite per software che si comporta in modo prevedibile una volta validato. I sistemi generativi sfumano il confine tra lo strumento e l'output, e l'agenzia sembra fare spazio a un quadro che non erediti tali presupposti. Se si tratti di un vero azzeramento o di un riconfezionamento degli stessi principi è ciò su cui gli stakeholder sono chiamati a commentare.
L'agenda delle linee guida dice dove stanno andando gli investimenti
L'agenda per l'anno fiscale 2027, che accoglie commenti fino al 30 novembre, vi dice quali bozze l'agenzia considera vicine alla definizione. Tre sono in cima. Primo, finalizzare le linee guida sul ciclo di vita del software dei dispositivi abilitati all'IA, redatte inizialmente nel gennaio 2025, che coprono come un modello viene monitorato, aggiornato e rivalidato lungo tutto il suo ciclo di vita e non solo al momento dell'autorizzazione. Secondo, finalizzare le linee guida sui piani di controllo delle modifiche predeterminate dell'agosto 2024, che definiscono ciò che uno sponsor deve pre-specificare per apportare determinate modifiche post-commercializzazione all'algoritmo senza presentare una nuova domanda. Terzo, finalizzare le linee guida per i dispositivi chirurgici robot-assistiti, inclusa una bozza separata emessa a fine settembre che copre controllo degli strumenti, latenza, cybersecurity e sterilizzazione.
Queste tre sono l'agenzia che dice: ecco dove si trova già l'implementazione. I piani di controllo delle modifiche predeterminate sono il meccanismo che consente a una funzione IA approvata di continuare ad apprendere senza una nuova revisione, e sono la differenza tra un modello che viene distribuito una volta e un modello che migliora. Le linee guida sul ciclo di vita trasformano quel permesso in un requisito operativo. Insieme descrivono un dispositivo regolamentato come processo continuo anziché come prodotto sigillato.
Il problema dei modelli di terze parti
Una domanda nel documento merita più attenzione delle altre. Chiede come dovrebbero applicarsi le aspettative pre-commercializzazione e post-commercializzazione quando il produttore non controlla il modello di base sottostante. Questa situazione ormai è la norma più che l'eccezione. Un sistema ospedaliero che incapsula un modello generico per il triage non lo riaddestra, e non ha accesso ai dati di addestramento, alla procedura di fine-tuning o al calendario delle modifiche.
La stessa impostazione dell'agenzia riconosce la difficoltà. La sorveglianza post-commercializzazione, nel suo modello, dovrebbe monitorare il drift nel modello del dispositivo e nel modello di base sottostante, il che significa che un produttore di dispositivi ha bisogno di visibilità sui cambiamenti che non ha apportato e di cui potrebbe non essere informato. Estendere l'idea di competenza a questo caso solleva la questione di chi venga accreditato. Il produttore del dispositivo può dimostrare che il proprio livello si comporta correttamente, ma non può facilmente dimostrare il comportamento di un componente che concede in licenza.
C'è un confronto che vale la pena fare con la generazione precedente di regole sui dispositivi IA. I piani di controllo delle modifiche predeterminate funzionano quando uno sponsor controlla il modello e può pre-specificare le modifiche che intende apportare. Quando il modello proviene da una terza parte, il piano deve accogliere aggiornamenti che arrivano secondo il calendario di qualcun altro. Nessuna delle domande di discussione risolve questo punto, e le risposte determineranno in gran parte se il quadro finale sarà praticabile per piccoli sviluppatori o solo per aziende abbastanza grandi da costruire i propri modelli.
Perché la tempistica è insolita
Scrivere linee guida prima di una prima domanda è raro, e il motivo per cui accade qui è che il dispositivo conversazionale per la salute mentale è la versione più difficile del problema. Questi sistemi parlano ai pazienti in linguaggio naturale, il che rende i loro output difficili da delimitare e da testare. Un modello diagnostico restituisce un numero. Uno conversazionale restituisce qualunque cosa decida di dire dopo.
L'agenzia deve anche conciliare la propria cautela con la pressione politica ad accelerare l'innovazione medica, e il documento di discussione riflette entrambe. Si basa su un approccio basato sul rischio e meno oneroso possibile, riconoscendo al contempo che la sola revisione pre-commercializzazione non può valutare un sistema che cambia. È questa tensione il motivo per cui il documento si chiude con domande anziché risposte. È anche il motivo per cui vale la pena leggere attentamente le 26 domande. Sono un'anticipazione degli argomenti che plasmeranno il primo dispositivo generativo approvato per la salute mentale, ogni volta che qualcuno ne presenterà domanda.
Altri regolatori si stanno muovendo in parallelo. L'autorità britannica di regolamentazione dei medicinali ha inviato tre emendamenti al parlamento per modernizzare la vigilanza sui dispositivi, incluso uno spazio esplicito per software e dispositivi IA nell'ambito di un quadro di licenze a livelli di rischio. Il Giappone sta rivedendo i requisiti per i prodotti biologici per assorbire metodi più recenti di test molecolare. Lo schema in tutti e tre è lo stesso: le regole vengono ricostruite prima che arrivino i prodotti, scommettendo che scriverle in anticipo costi meno che contesterle in tribunale dopo.
Articoli correlati
Il chip di memoria è ora il collo di bottiglia nel calcolo AI
La roadmap logica è pubblica e prevedibile. La roadmap della memoria è vincolata dai rendimenti del packaging, da una base di talenti che richiede anni e dai piani di capitale di tre aziende.
La musica AI ha ottenuto una licenza. Ecco cosa copre davvero.
Le tracce economiche esistono ancora. Ciò che sta scomparendo è l'assunto che una traccia generata da un prompt sia priva di rivendicazioni, cosa che non è mai stata vera e ora è dimostrabilmente falsa.
Gli studi di Hengdian sono vuoti mentre la pipeline del cinema AI asiatico corre
I teatri di posa vuoti di Hengdian sono la prova che l'industria ha già scommesso, che il pubblico sia d'accordo o no.
Google ha comprato 890 megawatt di nucleare per alimentare i suoi data center
La capacità di calcolo è disponibile. L'elettricità è ciò che deve essere organizzato, con anni di anticipo, come si organizza una catena di approvvigionamento.