Articolo del blog

Wizey vs ChatGPT: l'IA medica legge meglio i referti

Analisi tecnica del CEO: il divario tra LLM generalisti e IA medica – Lost in the Middle, allucinazioni, privacy e quando ChatGPT resta lo strumento giusto.

IA in sanità Analisi & diagnostica Salute & prevenzione
Wizey vs ChatGPT: l'IA medica legge meglio i referti

Sento sempre la stessa storia: una persona riceve dal laboratorio il PDF della biochimica, apre ChatGPT, allega il file e scrive «spiegami questo». Un minuto dopo il modello restituisce una risposta sicura di sé – a volte utile, a volte del tutto sbagliata. In entrambi i casi il paziente se ne va con la sensazione di aver «capito tutto».

Questo scenario mi preoccupa, e non perché costruisca IA medica per lavoro. Mi preoccupa perché la mia formazione accademica è nelle scienze cognitive e nell’architettura dei modelli linguistici, e capisco esattamente ciò che questi sistemi non sanno fare. ChatGPT è un ottimo strumento generalista. Ma tra «ottimo» e «adatto a interpretare i Suoi esami» c’è un abisso in cui, ogni giorno, cadono persone colte e attente.

In questo articolo voglio accompagnarLa – senza allarmismi, senza hype e senza marketing – attraverso il modo in cui i modelli linguistici generalisti funzionano davvero, perché proprio nei contesti medici mostrano i loro limiti e in quali scenari restano comunque davvero utili. Lungo il percorso Le spiegherò che cosa facciamo di diverso in Wizey e perché.

La versione breve e non tecnica, se non legge nient’altro: un modello generalista come ChatGPT è un generalista erudito – la sua conoscenza è ampia un miglio e profonda un centimetro, messa insieme da tutto ciò che ha letto, dagli articoli scientifici con revisione paritaria ai thread di Reddit. Sa collegare in modo brillante il «colesterolo alto» alle «malattie cardiache» perché ha visto queste parole insieme un milione di volte – ma è una correlazione statistica, non un meccanismo fisiologico. Un sistema medico specializzato si comporta più come uno specialista: lavora a partire da una mappa strutturata delle relazioni mediche – l’idea alla base di un grafo della conoscenza medica – invece che da un mare piatto di testo. Ed è costruito per coprire l’ultimo miglio: il passaggio dall’informazione grezza all’azione concreta successiva – quali uno o due risultati meritino davvero un approfondimento, a quale specialista rivolgersi e che cosa chiedere alla visita. ChatGPT, anche quando i fatti che riporta sono corretti, si ferma quasi sempre a un generico «consulti un medico».

LLM generalista vs IA medica specializzata: il divario architetturale

ChatGPT è un grande modello linguistico generalista (LLM), addestrato a prevedere il token successivo su un enorme corpus di testo tratto da internet. Sa un po’ di tutto – dalle ricette del borscht alla cromodinamica quantistica. Dal punto di vista architetturale, la medicina è semplicemente un dominio come tanti altri. Nulla nella progettazione del modello privilegia il ragionamento clinico.

Un’IA medica specializzata è costruita in modo diverso. Non è un singolo modello, ma una pipeline: riconoscimento del documento (OCR), parsing rigoroso di ogni marcatore di laboratorio in un oggetto strutturato, verifica rispetto agli intervalli di riferimento e alle convenzioni sulle unità di misura e solo allora un modulo analitico che confronta i dati con le linee guida cliniche. Nell’ultima fase usiamo la Retrieval-Augmented Generation (RAG), la tecnica descritta per la prima volta nel classico articolo di Lewis et al. (2020). RAG significa che il modello non risponde «a memoria»: recupera frammenti rilevanti da una base di conoscenza verificata e ci ragiona sopra.

La distinzione fondamentale: un modello generalista genera una risposta; un sistema medico specializzato recupera e confronta con dati strutturati. Il primo può essere creativo e sbagliato. Il secondo è tenuto a essere accurato e prevedibile. In medicina la creatività è un anti-pattern.

Lost in the Middle: il vero problema, non una «finestra di contesto troppo piccola»

Uno dei miti più duri a morire su ChatGPT è che «non riesca a gestire referti lunghi perché la sua finestra di contesto è troppo piccola». Nel 2026 semplicemente non è più vero. I modelli di frontiera della classe GPT oggi supportano finestre di contesto di circa 1 milione di token; i modelli Claude di livello Opus di Anthropic e Gemini 3.x di Google operano anch’essi nell’ordine del milione di token. Un PDF di laboratorio di cinque pagine ci sta con enorme margine.

Il vero problema ha un nome: Lost in the Middle. È stato descritto in dettaglio da Liu et al. (2023, Stanford). Quando si fornisce a un LLM un contesto lungo, il modello è eccellente nell’estrarre informazioni dall’inizio e dalla fine, ma la sua accuratezza «cede» nel mezzo. Se si traccia l’accuratezza in funzione della posizione, la curva assomiglia a una U – alta ai bordi, con una valle nel mezzo. Questo vale anche per i modelli con finestre da un milione di token.

Che cosa significa per i Suoi esami? Se un PDF di cinque pagine colloca un marcatore critico – poniamo una proteina C-reattiva elevata – nella terza pagina, proprio in mezzo al prompt, un modello generalista ha una probabilità decisamente più alta di non «vederlo» quando ragiona. Non che ne dimentichi l’esistenza, ma gli dà troppo poco peso nella conclusione finale. In un testo creativo la cosa è invisibile. Nella biochimica è un’infiammazione sistemica non rilevata.

Nel nostro sistema aggiriamo questo effetto a livello architetturale. I dati vengono prima estratti in una tabella rigorosa, e solo quella tabella viene passata al modulo analitico. Lost in the Middle si comporta in modo molto diverso su una tabella strutturata di 30 righe rispetto a cinque pagine di testo che scorre libero.

E poiché la domanda più comune degli utenti è «quanti marcatori posso caricare davvero in una volta sola», voglio essere concreto. Wizey elabora regolarmente PDF con 80, 100, persino 150+ marcatori da un’unica visita: biochimica, ormoni, emocromo, coagulazione, assetto lipidico e immunogramma tutti insieme. Ogni numero entra nell’analisi e il modulo analitico cerca correlazioni tra tutti i gruppi in parallelo: come il TSH si correli con il colesterolo, come si legga la ferritina alla luce della proteina C-reattiva, come la glicemia interagisca con trigliceridi e insulina, come una variazione della creatinina in due anni si combini con l’andamento della pressione arteriosa. Un LLM generalista non costruisce questa rete di relazioni: non può fisicamente tenere a fuoco decine di parametri indipendenti e confrontarli tra loro senza una rappresentazione strutturata.

Allucinazioni: perché la medicina è il peggior campo in cui possano manifestarsi

I grandi modelli linguistici allucinano: producono informazioni formulate con sicurezza che non esistono né nei loro dati di addestramento né nella realtà. Non è un bug, ma una conseguenza diretta di come funziona la previsione probabilistica dei token. Il modello è ottimizzato per la plausibilità, non per la verità.

Nella maggior parte dei compiti va bene così. Se ChatGPT inventa una funzione inesistente in una libreria oscura, il programmatore riceve un errore di compilazione e la corregge. Se sbaglia la data di un film, non fa male a nessuno.

In medicina il costo è diverso. Un bot può «ricordare» con sicurezza un intervallo di riferimento che non esiste. Può suggerire una relazione tra due marcatori che non è mai comparsa in letteratura. Può indicare un farmaco che allevia un sintomo tralasciando una controindicazione che il modello «non ha considerato». E tutto questo viene servito con lo stesso tono calmo e sicuro di una domanda sulla capitale della Francia.

I sistemi specializzati risolvono il problema con barriere di sicurezza rigorose: il modulo analitico ragiona solo entro le linee guida cliniche precaricate. Se non esiste una regola, il sistema risponde «dati insufficienti» invece di inventarne una.

Privacy: che cosa succede al Suo PDF dopo che lo carica su ChatGPT

Questa è la parte a cui quasi nessuno pensa. Quando carica un referto su un account ChatGPT gratuito o Plus, che cosa succede davvero a quel file?

Secondo l’attuale politica di OpenAI, le conversazioni nei prodotti per privati (ChatGPT Free, Plus, Pro) per impostazione predefinita possono essere usate per migliorare i modelli. Può disattivare l’opzione manualmente dalle impostazioni sui dati, oppure usare la Temporary Chat, ma la maggior parte degli utenti non lo fa. Nei piani aziendali (Team, Enterprise, API) i dati per impostazione predefinita non vengono usati per l’addestramento, ma l’utente finale tipico non ha questi piani.

Di solito un referto contiene: il Suo nome completo, la data di nascita, a volte un indirizzo, il numero di assicurazione o di polizza, il nome del laboratorio e del medico che ha prescritto gli esami. Secondo la normativa statunitense HIPAA e il GDPR dell’UE, si tratta di dati sanitari personali di categoria particolare (negli Stati Uniti chiamati Protected Health Information, o PHI, e «categoria particolare di dati» ai sensi dell’articolo 9 del GDPR). Ospedali, cliniche e servizi soggetti a HIPAA sono obbligati a trattare questi dati nell’ambito di appositi Business Associate Agreement; un prodotto di chat per il grande pubblico non ha alcun obbligo di questo tipo verso un privato che carica un proprio file. Formalmente il paziente non viola alcuna legge – esercita il controllo sui propri dati – ma allo stesso tempo non ha alcuna visibilità su ciò che accade dopo.

Non sto invitando alla paranoia. La maggior parte delle persone carica i propri esami e la vita va avanti. Ma se la riservatezza dei dati medici Le sta a cuore anche solo un po’, è un buon motivo per usare servizi che operano in un ambiente protetto e descrivono in un linguaggio chiaro che cosa fanno dei Suoi file.

Quando l’IA generalista è particolarmente pericolosa

La situazione più pericolosa in assoluto non è un marcatore isolato, ma il caso in cui bisogna vedere la relazione tra decine di parametri e comprendere il contesto clinico. Alcune trappole tipiche:

  • Pannelli ampi (15+ marcatori in una volta sola). Entra in gioco Lost in the Middle: il modello commenta con sicurezza la prima e l’ultima riga e si perde gli scostamenti sottili ma importanti nel mezzo.
  • Marcatori tumorali. L’intuizione «sopra l’intervallo = male, dentro l’intervallo = tutto a posto» sbaglia in pieno. Molti marcatori tumorali aumentano in processi benigni e molti pazienti con tumori accertati hanno valori nell’intervallo di normalità. I modelli generalisti tendono a produrre risposte stereotipate che La spaventano senza motivo oppure La rassicurano a torto.
  • Ferritina letta isolatamente dall’infiammazione. Una trappola classica: ChatGPT vede una ferritina elevata e dice «ha troppo ferro, mangi meno carne rossa». Ma la ferritina è una proteina della fase acuta, e il suo aumento riflette spesso un’infiammazione sistemica più che le riserve di ferro. Senza guardare contemporaneamente la proteina C-reattiva e l’emocromo, interpretarla come un «sovraccarico di ferro» è un errore.
  • Esami pediatrici. Nei bambini gli intervalli di riferimento cambiano in base al mese di età. I modelli generalisti «mescolano» regolarmente gli intervalli degli adulti e i genitori ricevono un falso allarme o una falsa rassicurazione.

Il confronto sui parametri che contano

Il quadro completo, condensato in una tabella:

ParametroChatGPT generalistaIA medica specializzata (Wizey)
ArchitetturaUn unico grande LLM, risposta generativaPipeline: OCR → parsing → RAG sulle linee guida cliniche
Accuratezza dell’estrazione numericaMedia, cala a metà documento (Lost in the Middle)Garantita – ogni marcatore convertito in un oggetto strutturato
Difesa dalle allucinazioniMinima, risposta ottimizzata per la plausibilitàBarriere di sicurezza rigorose, risposta vincolata ai protocolli
Volume di dati gestitoCala con i pannelli ampiStabile su 100+ marcatori a visita
Scoperta delle correlazioniSchemi generali, nessuna garanziaConfronto incrociato sistematico tra tutti i gruppi
Andamento pluriennaleNon tracciato tra una sessione e l’altraAndamenti e confronto tra una visita e l’altra
Indirizzo allo specialistaGenerico («vada da un medico»)Basato su algoritmi clinici specifici
Privacy per l’utenteI dati possono entrare nei set di addestramento, server in tutto il mondoAmbiente protetto, trattamento dei dati trasparente
Caso d’uso idealeSpiegare termini, tradurre, domande generaliInterpretare i referti, preparare la visita, seguire gli andamenti

Un algoritmo passo passo per chi ha appena ricevuto i referti

La versione breve: non cerchi su Google un marcatore alla volta e non incolli tutto nel primo chatbot che capita. Proceda con metodo.

  1. Niente panico. Un intervallo di riferimento è la fascia che comprende circa il 95% delle persone apparentemente sane. Per definizione, circa il 5% delle persone sane ne resta fuori. Un valore fuori intervallo è un invito ad approfondire, non una diagnosi.
  2. Raccolga i Suoi dati in un unico posto. Se ha risultati di diversi anni, vale oro. Molti dei segnali più importanti stanno negli andamenti, non nei valori assoluti.
  3. Usi uno strumento che non perde dati. Può essere un servizio specializzato o un foglio di calcolo strutturato – ciò che conta è che ogni numero sia registrato.
  4. Cerchi sindromi, non numeri isolati. Glicemia + HbA1c + trigliceridi + HDL insieme dicono molto di più sul metabolismo di qualsiasi singolo valore preso da solo.
  5. Individui lo specialista giusto. Spesso il beneficio maggiore di una buona interpretazione degli esami è capire se rivolgersi al medico di base, all’endocrinologo o all’ematologo. Questo fa risparmiare settimane di ansia e denaro.
  6. Arrivi preparato alla visita. Formuli domande precise. Per un medico è più facile rispondere a «il mio TSH insieme a questo T4 libero potrebbe indicare un ipotiroidismo subclinico?» che a «per favore, mi sistemi questi valori sbagliati».

Quando ChatGPT è davvero utile in ambito medico

Non voglio che questo articolo risulti unilaterale. Gli LLM generalisti sono davvero utili in medicina, solo non là dove vengono usati più spesso. Alcuni scenari in cui li uso io stesso:

  • Spiegare i termini. Che cos’è la VES, la differenza tra bilirubina diretta e indiretta, che cosa significa «eosinofilia»: ChatGPT spiega i concetti in modo pulito.
  • Tradurre referti medici da altre lingue, con note di contesto.
  • Abbozzare un elenco di domande per il medico, sulla base dei sintomi e del contesto generale.
  • Orientarsi in un’area della medicina che non si conosce – scoprire che esiste una certa specialità, come sono fatti gli approcci terapeutici, quali parole chiave usare per una lettura più approfondita.
  • Aiuto nella lettura di articoli scientifici, quando si sta già approfondendo un argomento.

Dove funziona male: interpretare valori di laboratorio specifici, formulare diagnosi, valutare l’andamento su più visite e consigliare farmaci. Tutto questo riguarda la precisione dei dati, non la spiegazione dei concetti. Il famoso studio di Kung et al. (2023, PLOS Digital Health) – quello in cui «ChatGPT ha superato l’USMLE» – riportava in realtà un risultato borderline (intorno al 60%), e gli autori stessi sottolineano che rispondere a domande su casi clinici non è la stessa cosa del ragionamento clinico. Un’IA può ragionare come un medico; non si assume la responsabilità di un medico. Sono due cose diverse.

Mini-FAQ

Un’IA medica specializzata può comunque sbagliare? Sì. Qualsiasi IA è uno strumento di supporto alle decisioni, non un oracolo. Ma in un sistema ben progettato la probabilità che tralasci un valore del Suo referto o inventi una diagnosi inesistente è ridotta al minimo grazie a un parsing rigoroso e a un recupero circoscritto dalle linee guida cliniche.

Perché mi serve un’IA se comunque sarà il mio medico a valutare gli esami? Per arrivare con dati strutturati e domande concrete. Il tempo della visita è limitato e, se i primi 15 minuti se ne vanno nel trascrivere i Suoi numeri, non resta quasi nulla per l’analisi.

Quanti marcatori può analizzare Wizey in una volta sola? Nella pratica reale, 100+ per visita. Biochimica, ormoni, emocromo, coagulazione e assetto lipidico tutti insieme. Il modulo analitico cerca correlazioni tra tutti i gruppi in parallelo, senza perdere un solo numero.

Posso caricare esami vecchi di diversi anni fa? È la cosa più utile in assoluto che possa fare. In medicina conta la dinamica. Nessuno riesce a tenere in testa centinaia di numeri distribuiti su cinque anni; un servizio serio ricostruisce gli andamenti all’istante.

Se sono un utente esperto, posso usare ChatGPT per gli esami? Sì, ma con prudenza. Tenga presente Lost in the Middle e le allucinazioni, verifichi le soglie numeriche confrontandole con fonti di riferimento e non carichi documenti sensibili su un piano per privati senza aver compreso l’informativa sulla privacy.

Conclusione

L’IA ha cambiato il modo in cui ci occupiamo della nostra salute e, nel complesso, è una buona cosa. Ma un modello linguistico generalista e un’IA medica specializzata sono due strumenti diversi. Sul piano dell’architettura sono ugualmente «intelligenti», ma sono costruiti per compiti diversi.

Se vuole provare uno strumento progettato appositamente per interpretare i referti – uno che prende sul serio tutto ciò che ho descritto sopra – è esattamente per questo che abbiamo creato Wizey. Nessuna promessa di «guarire» alcunché. Solo la garanzia che nessun numero del Suo referto andrà perso e che qualsiasi conclusione offerta potrà portarla con sicurezza dal Suo medico.

Fonti