Abbiamo caricato cinque casi clinici in ChatGPT e in Wizey – i due strumenti di IA che oggi un paziente apre più facilmente quando cerca di dare un senso a un referto di laboratorio – e abbiamo chiesto a ciascuno di interpretare gli stessi esami. Entrambe le IA sono arrivate alla stessa diagnosi. Ciò che è successo dopo è stato inaspettato, e cambia la domanda che vale la pena porre a questa tecnologia.
Due risposte per la stessa persona
Uomo di quarantacinque anni. Un unico set di esami. Un prompt breve: «per favore, interpreti i miei esami». Due servizi. Ecco che cosa è tornato indietro – testualmente.
ChatGPT: Faccia tre cose e la maggior parte dei valori si normalizzerà. 1) Perda 8-12 kg. 2) Alcol: in questo momento quasi tutte le sere. Per il fegato e l’insulina è un fattore critico. 3) Attività fisica: minimo 8.000-10.000 passi al giorno più allenamento di forza tre volte a settimana.
Wizey, l’IA medica specializzata: Endocrinologo – per gestire prediabete e insulino-resistenza e discutere la terapia sostitutiva con testosterone. Cardiologo o internista – per la valutazione del rischio cardiovascolare. Gastroenterologo o epatologo – per confermare la steatosi epatica. Specialista del sonno o otorinolaringoiatra – per valutare l’apnea del sonno. Urologo-andrologo – per un approfondimento della disfunzione sessuale. Dosaggio del PSA – obbligatorio prima di qualsiasi discussione sulla terapia con testosterone (screening standard per gli uomini dai 45 anni in su).
Una persona, un unico set di esami. Entrambe le IA hanno letto correttamente il quadro – sindrome metabolica, insulino-resistenza, ipogonadismo funzionale, sospetta apnea del sonno, carenza di vitamina D e di zinco. La diagnosi ha coinciso. A divergere è stato ciò che quest’uomo dovrebbe fare concretamente nelle due settimane successive.
Siamo il team dietro Wizey. Entrando in questo esperimento, la nostra ipotesi di partenza era che ChatGPT avrebbe sbagliato la diagnosi. Non ha sbagliato una sola volta su cinque casi. La vera scoperta è stata un’altra: una diagnosi principale corretta non equivale ad aiutare il paziente. Nei cinque casi mostreremo dove corre la vera linea di differenza – e indicheremo l’unico caso in cui ChatGPT ci ha superati sul piano clinico.
Come abbiamo condotto il test
- Abbiamo assemblato cinque pannelli clinici ricostruiti da casi reali pubblicati (PubMed, Blood, Annals of Family Medicine) – preservando ogni anomalia e ogni sintomo clinicamente rilevante.
- Abbiamo caricato lo stesso pannello in entrambi i servizi: ChatGPT (piano Plus, GPT-5.4) e Wizey, un’IA medica specializzata.
- Per ChatGPT abbiamo digitato un prompt breve: «per favore, interpreti i miei esami». Nessuna domanda di approfondimento, nessun prompt engineering. L’obiettivo era imitare ciò che fa un paziente qualunque con una stampa in mano.
- Tutti gli output sono stati registrati testualmente. Le citazioni dirette in questo articolo non sono state modificate; i punti in cui abbiamo tagliato per brevità sono segnalati con i puntini di sospensione.
- Quattro casi sono scenari ambulatoriali di routine; un caso bonus è urgente, incluso specificamente per testare il comportamento nel triage.
Una nota sull’ambito
Cinque casi sono l’illustrazione di uno schema, non una statistica. Abbiamo visto la stessa forma in ciascuno dei cinque, ma non lo presentiamo come uno studio randomizzato da mille esecuzioni.
Siamo il team di Wizey – il conflitto di interessi è evidente. Per compensarlo in parte: la metodologia è stata fissata prima delle esecuzioni, tutti gli output sono citati testualmente e, ogni volta che ChatGPT ci ha superati, lo diciamo apertamente. Le pubblicazioni di origine da cui è stato ricostruito ogni pannello sono indicate nel testo, così chiunque può riprodurre l’esperimento.
Tutti i test sono stati eseguiti in un solo giorno, il 17 aprile 2026.
Che cosa dice la letteratura con revisione paritaria
Per chi vuole i numeri prima dei casi clinici, ecco che cosa riporta la letteratura scientifica con revisione paritaria su ChatGPT nell’interpretazione degli esami di laboratorio:
- Cabral et al., PLOS ONE 2024: sulle domande specialistiche di medicina di laboratorio, ChatGPT interpreta correttamente in circa il 51% dei casi, e il 17% delle risposte è del tutto errato.
- Nature Communications Medicine, 2025: quando un valore clinico falso viene inserito di nascosto nel contesto del prompt, gli LLM «raddoppiano la posta» nell’83% dei casi – cioè accettano il valore falso e vi costruiscono sopra il ragionamento, senza mai segnalare l’incongruenza.
- Nature Scientific Reports, 2025: sui disturbi misti dell’equilibrio acido-base, ChatGPT restituisce un verdetto «nella norma» falsamente rassicurante nel 16,7% dei casi; i medici di terapia intensiva sugli stessi casi mostrano un tasso di false rassicurazioni dello 0%.
I numeri, per dirla con delicatezza, sono allarmanti. Ma c’è un dettaglio. Nel nostro test su cinque casi, ChatGPT ha prodotto in modo affidabile la diagnosi principale corretta – anche nei casi in cui ci aspettavamo un inciampo: ipotiroidismo subclinico, MGUS (gammapatia monoclonale di significato indeterminato), rabdomiolisi da statine, transizione perimenopausale, sindrome metabolica con ipogonadismo funzionale. Cinque su cinque.
È questo il vero punto di svolta dell’esperimento. La differenza non è «ha indovinato o ha sbagliato», come si tende a impostarla. La differenza sta in ciò che viene dopo la diagnosi corretta. È lo strato che analizzeremo ora.

Caso 1: quarantacinque anni, stanco di essere stanco
Ingegnere di quarantacinque anni. Lavoro sedentario, un grande progetto contro il tempo, stress cronico. Disturbi: stanchezza persistente che un fine settimana libero non risolve, calo della libido, aumento di peso, russamento, cefalea mattutina, reflusso due o tre volte a settimana, dolore alle ginocchia. Alcol: un bicchiere o due di vino quasi tutte le sere, più superalcolici nel fine settimana. Familiarità: il padre ha il diabete di tipo 2, la madre ha l’ipertensione. Il classico uomo di mezza età «finalmente mi sono deciso a fare gli esami».
Anomalie principali del pannello. HbA1c 5,9%. HOMA-IR (indice di insulino-resistenza) 4,9, quasi il doppio del limite superiore di <2,5. Trigliceridi 2,4 mmol/L, LDL 3,6, HDL 0,95, ApoB 1,35, indice aterogeno 5,1. ALT 58 U/L, GGT 78 – un quadro di steatosi epatica non alcolica (NAFLD). Testosterone libero 220 pmol/L, sotto il range. Vitamina D 18 ng/mL, zinco 9,4 μmol/L, B12 260 pmol/L, omocisteina 11,8. PCR ad alta sensibilità 4,8 mg/L, acido urico 468 μmol/L, cortisolo 580 nmol/L. Circonferenza addominale 104 cm (normale <94).
Parità sulla diagnosi. Entrambe le IA hanno prodotto lo stesso elenco: sindrome metabolica, insulino-resistenza, prediabete, dislipidemia aterogena, NAFLD, ipogonadismo funzionale, carenza di vitamina D e di zinco, infiammazione cronica di basso grado, iperuricemia, sospetta apnea ostruttiva del sonno, cortisolo ai limiti alti della norma. ChatGPT non ha tralasciato un solo pezzo del quadro clinico. Ha messo insieme onestamente ogni dato.
E ora – dove i due hanno preso strade diverse.
Indirizzamento agli specialisti. ChatGPT non ha nominato nessuno specialista specifico. Il blocco «dove andare» consisteva in «pronto soccorso» (riservato alla rabdomiolisi, non a questo caso) e in frasi come «di solito si prescrive» o «ne parli con il Suo medico». Wizey ha elencato cinque specialisti con le rispettive competenze:
Endocrinologo – per gestire prediabete e insulino-resistenza, valutare la necessità di una correzione farmacologica di lipidi e glicemia e discutere la terapia sostitutiva con testosterone se le modifiche allo stile di vita non bastano. Cardiologo o internista – per la valutazione del rischio cardiovascolare. Gastroenterologo o epatologo – per confermare la steatosi epatica. Specialista del sonno o otorinolaringoiatra – per valutare l’apnea del sonno. Urologo-andrologo – per un approfondimento della disfunzione sessuale.
– Wizey
Nella maggior parte dei sistemi sanitari, vedere cinque specialisti in due settimane è irrealistico – il percorso di invio con il medico di base che fa da filtro è più realistico e, anche con un’assicurazione privata, mettere in fila cinque visite richiede un mese. Ma almeno il paziente sa chi andrà a vedere e perché. «Ne parli con il Suo medico» è una non-risposta quando i tempi d’attesa tipici in endocrinologia vanno da settimane a mesi; il paziente non fa che aprire un’altra chat di IA. O peggio – inizia a curarsi da solo. O semplicemente perde tempo prezioso.
Il livello di sicurezza – l’omissione più grave. ChatGPT ha segnalato il testosterone libero basso e ne ha spiegato le cause. E lì si è fermato. Wizey ha inserito questo come voce a sé:
Dosaggio del PSA (antigene prostatico specifico) – obbligatorio prima di qualsiasi discussione sulla terapia con testosterone. Screening standard per gli uomini dai 45 anni in su.
– Wizey
Non è un cavillo. La terapia sostitutiva con testosterone (TRT) in presenza di un tumore della prostata non diagnosticato può accelerare la progressione del tumore – lo screening del PSA prima di iniziare la TRT è previsto dalla maggior parte delle linee guida pertinenti (Endocrine Society, AUA e altre). Un uomo di 45 anni che legge l’output di ChatGPT e va a cercare la TRT in una clinica privata di fascia alta senza un PSA è un vero fallimento clinico in attesa di accadere. Le linee guida sulla terapia con testosterone dell’Endocrine Society sono inequivocabili su questo punto.
Obiettivi quantitativi. ChatGPT: «Vitamina D3 4000-5000 IU, magnesio 300-400 mg, zinco 20-30 mg, omega-3 2-3 g, complesso B». Wizey sulla stessa domanda:
Vitamina D – con un livello sierico di 18 ng/mL, il dosaggio tipico è 2000-5000 IU al giorno per raggiungere un intervallo obiettivo di 40-60 ng/mL. Ricontrollo a 2-3 mesi. Zinco – 15-30 mg come picolinato o citrato. Magnesio 300-400 mg come citrato o glicinato. Omega-3 (EPA+DHA) 1000-2000 mg. Berberina o inositolo – ne parli con il Suo endocrinologo.
– Wizey
La differenza è tra «quanto prenderne oggi» e «quale livello raggiungere, quale forma scegliere, quando ricontrollare». Con la prima risposta, il paziente prende la vitamina D e non ha idea se stia funzionando. Con la seconda, c’è un punto di verifica.
La cascata dei meccanismi. ChatGPT ha dato tabelle ed elenchi puntati: ecco la glicemia, ecco l’insulina, ecco l’LDL. Wizey ha esposto otto nessi causali numerati:
1) Il grasso viscerale non è solo un deposito – è un tessuto a funzione endocrina. Rilascia segnali infiammatori, riduce la sensibilità all’insulina e converte il testosterone in estradiolo. 2) Insulino-resistenza → il pancreas produce più insulina → l’insulina stimola la sintesi epatica di trigliceridi e LDL → dislipidemia. 3) Cortisolo alto → peggiora l’insulino-resistenza e sopprime il testosterone. 4) Alcol quotidiano → aumenta i trigliceridi e la gamma-GT, disturba il sonno. 5) Carenza di vitamina D e di zinco → ridotta sintesi di testosterone. 6) Testosterone libero basso → perdita di massa muscolare → metabolismo più lento. 7) Russamento più cefalea mattutina → apnea → frammentazione del sonno → cortisolo + insulino-resistenza. 8) Familiarità – base genetica.
– Wizey

È la mappa mentale che un bravo medico tiene in testa. Con essa, il paziente smette di essere un passeggero nella propria fisiologia: perdere peso, rinunciare al vino della sera e usare la CPAP per l’apnea non sono più tre azioni scollegate – sono parti di un unico sistema.
Inquadramento emotivo e prognosi. ChatGPT si è attenuto a un’esposizione clinica neutra. Wizey ha aggiunto un inquadramento breve ma importante:
Buona notizia: la maggior parte dei Suoi problemi è reversibile… Se agisce ora, la prognosi è ottima – si può invertire tutto. La Sua situazione è tipica di un uomo di mezza età di oggi. L’importante è che se ne sia accorto in tempo. Molti arrivano solo quando sono già diabetici, o dopo un infarto.
– Wizey
Non è psicoterapia. È informazione prognostica – «agire ora conta, non è troppo tardi» – più un orientamento: «il Suo caso non è insolito». Per un uomo di 45 anni che fissa un pannello con venti valori alterati, la differenza tra una diagnosi senza emozioni e una diagnosi accompagnata dal riconoscimento che il recupero è ancora possibile è psicologicamente significativa.
Dove ChatGPT ha vinto. Lp(a) – con una familiarità per malattia coronarica, è un marcatore cardiaco importante che non abbiamo menzionato. La formula condensata delle «tre cose da fare» (peso, alcol, attività) è memorabile e motivante. L’ecografia carotidea come screening dell’aterosclerosi. Veri punti a favore di ChatGPT in questo caso.
Conclusione del caso. Parità sulla diagnosi. Divergenza su «che cosa fa concretamente quest’uomo nei prossimi 14 giorni?». ChatGPT ha dato una formula motivante in tre mosse. Wizey ha dato cinque specialisti con competenze precise, il controllo di sicurezza del PSA prima della TRT, obiettivi quantitativi con intervalli di ricontrollo, una cascata di meccanismi, una prognosi e la rassicurazione che il paziente era in tempo.
Una diagnosi principale corretta vale zero minuti di aiuto reale se non è seguita da un percorso di invio, da un controllo di sicurezza, da livelli obiettivo e da un inquadramento del tipo «è in tempo».
Sette differenze tra i servizi
Non una statistica su cento casi – uno schema osservabile su cinque, ripetuto in ciascuno. Abbiamo confrontato gli output riga per riga su sette parametri.

La tabella non afferma che «ChatGPT perde». È una mappa di dove i due servizi divergono. Sulla domanda rapida «ma questo che cosa significa», ChatGPT è veloce e valido. Sul piano d’azione prima della visita medica, cede in modo sistematico. Non è un difetto: GPT è stato addestrato su testi eterogenei di internet, non su algoritmi clinici di gestione del paziente.
Dove ChatGPT ci ha superati – onestamente
Abbiamo passato il caso MGUS (gammapatia monoclonale di significato indeterminato) attraverso entrambi i servizi – e qui ChatGPT ha vinto sul piano clinico. Nella nostra metodologia avevamo promesso di indicare apertamente i nostri errori. Questo è uno di essi.
Uomo di sessantotto anni. Disturbi – debolezza generalizzata da sei mesi e dolore alla schiena intermittente. In terapia con perindopril e atorvastatina 10 mg. Pannello quasi normale tranne tre reperti: proteine totali 92 g/L (elevate; normale 64-83), albumina 38 (normale), VES 38 mm/hr (più del doppio del limite superiore). Età 68 + sei mesi di debolezza + dolore alla schiena + proteine totali elevate + VES elevata = la classica «triade di allarme» per gammapatia monoclonale o mieloma multiplo. Va colta nello screening.
Che cosa ha fatto meglio ChatGPT. Ha calcolato esplicitamente il rapporto albumina/globuline: proteine totali 92, albumina 38 → globuline 54, rapporto 0,70 (normale >1,0). Conclusione: globuline elevate. Da lì ha indicato una diagnosi differenziale specifica:
Tre segnali d’allarme: VES 38, proteine totali 92 e il quadro dei sintomi (debolezza più dolore alla schiena). Questa combinazione impone classicamente di escludere il mieloma multiplo… Può indicare anche: infiammazione cronica, infezione, malattia reumatologica, MGUS.
– ChatGPT
E ha indicato accertamenti specifici: elettroforesi delle proteine sieriche + immunofissazione + catene leggere libere (FLC) + proteina di Bence-Jones nelle urine + radiografia/RM della colonna + TC ossea. È una vera checklist clinica – esattamente ciò che prescriverebbe un ematologo. È la differenza tra «accertamenti per MGUS» e «accertamenti per una VES inspiegabile». Secondo una recente analisi di NEJM AI su GPT-4 nei casi clinici, gli elenchi di diagnosi differenziale specifici per l’ematologia sono un ambito in cui i modelli di frontiera sono migliorati in modo evidente.

Che cosa ha mancato Wizey. Non abbiamo calcolato esplicitamente il rapporto A/G. Abbiamo menzionato le gammapatie monoclonali come possibilità, ma non abbiamo indicato gli esami di conferma specifici – FLC, immunofissazione, Bence-Jones. È una vera lacuna del prodotto, non una sottigliezza interpretativa. Il team ne è consapevole. Ci stiamo lavorando.
Che cosa Wizey ha comunque offerto. Nonostante la mancanza sugli esami, l’output non era vuoto. Conteneva qualcosa che ChatGPT non aveva:
Si prepari alla visita: annoti quando è iniziata la debolezza, con che frequenza e dove esattamente ha male alla schiena, se ha avuto febbre, sudorazioni notturne o perdita di peso involontaria.
– Wizey
Quell’elenco – febbre, sudorazioni notturne, perdita di peso – è il classico screening dei «sintomi B» per linfoma e mieloma. Un paziente che si presenta dall’ematologo con un appunto di due righe che dice «tre episodi di sudorazione notturna in sei mesi, circa 3 kg di calo di peso involontario» fa risparmiare al medico venti minuti di anamnesi e migliora la qualità della visita.
Wizey ha anche fatto un’annotazione metacognitiva («sul Suo referto non erano riportati gli intervalli di riferimento – ho usato le norme riconosciute a livello internazionale»), ha indicato una finestra di urgenza più precisa («1-2 settimane» contro il «nelle prossime settimane» di ChatGPT) e ha commentato brevemente i farmaci in corso.
Conclusione editoriale. Non è una vittoria o una sconfitta – sono due modalità operative diverse. ChatGPT si è comportato come la checklist di un medico nelle mani del paziente: un elenco di esami da portare al medico. Wizey si è comportato come una preparazione alla visita: sintomi B, formulazione più chiara dei disturbi, una finestra di urgenza precisa.
Entrambe le modalità sono legittime. Aver mancato gli esami specifici per la MGUS è un punto su cui ci critichiamo. Ma se il paziente si presenta dall’ematologo con l’appunto di Wizey e l’ematologo prescrive da sé FLC, immunofissazione e Bence-Jones (che è il suo lavoro), i venti minuti risparmiati sull’anamnesi dei sintomi B valgono molto.
Altri due casi, lo stesso schema
Ipotiroidismo subclinico – donna di cinquantadue anni
Si è presentata con stanchezza, aumento di peso e pelle secca. TSH 6,8 mIU/L (elevato; normale 0,4-4,0), T4 e T3 liberi nella norma. Colesterolo totale 6,8 mmol/L, LDL 4,3. Entrambe le IA sono arrivate correttamente a ipotiroidismo subclinico più dislipidemia. La diagnosi principale ha di nuovo coinciso.
La differenza è stata in una sola frase. ChatGPT:
Le linee guida attuali di solito raccomandano di iniziare il trattamento se: TSH >6-7, sintomi presenti, età <65. Lei soddisfa tutti i criteri. La levotiroxina si prescrive di solito a una bassa dose iniziale.
– ChatGPT
In apparenza ragionevole. Nella sostanza, è una semplificazione dalle conseguenze potenzialmente dannose. Le linee guida dell’American Thyroid Association e della European Thyroid Association per il TSH nell’intervallo 4-10 mIU/L dicono in realtà il contrario: la decisione è individualizzata. Wizey lo ha colto:
La decisione di iniziare la terapia è individualizzata: un TSH superiore a 10 mIU/L in genere richiede il trattamento; un TSH nell’intervallo 4-10 mIU/L (come nel Suo caso) dipende dai sintomi, dalla presenza di anticorpi tiroidei, dalle comorbilità e dall’andamento nel tempo.
– Wizey
E ha indicato una sequenza che ChatGPT ha saltato:
Ripetere l’assetto lipidico al controllo – dopo la correzione della funzione tiroidea, il colesterolo spesso si normalizza da solo.
– Wizey
È il dettaglio decisivo. Se una donna con TSH 6,8 e colesterolo 6,8 inizia contemporaneamente levotiroxina e una statina, tre mesi dopo potrebbe assumere una statina di cui non ha bisogno: l’ipotiroidismo di per sé alza il colesterolo. Wizey ha aggiunto un indirizzamento esplicito (endocrinologo), un ricontrollo di TSH e T4 libero a 2-3 mesi e una finestra di urgenza di «2-4 settimane».
Conclusione del caso: entrambi hanno ragione sulla diagnosi. Uno spinge verso un sovra-trattamento e una statina inutile. L’altro costruisce una sequenza.
Lo stesso schema si ripresenta nel caso successivo, su un tema diverso – e il costo dell’eccessiva semplificazione sale ancora.
Perimenopausa – donna di cinquant’anni
Paziente: vampate di calore, sudorazioni notturne, insonnia, calo della libido, «annebbiamento mentale». Familiarità – osteoporosi nella madre, malattia coronarica nel padre. Pannello: FSH 42 IU/L, estradiolo 45 pmol/L (basso), progesterone 1,2 nmol/L, anti-TPO 68 IU/mL (Hashimoto iniziale), vitamina D 22 ng/mL, ferritina 32 μg/L, PTH 68 pg/mL, LDL 3,9 mmol/L. Entrambe le IA sono arrivate a: transizione perimenopausale + tiroidite autoimmune iniziale + carenza di vitamina D + carenza di ferro latente + dislipidemia postmenopausale.
Il punto di divergenza è stato la terapia ormonale della menopausa (MHT; la terminologia più datata è HRT, terapia ormonale sostitutiva – oggi si preferisce MHT). ChatGPT:
Terapia ormonale della menopausa. Molto probabilmente indicata. Riduce le vampate di calore, migliora il sonno, protegge le ossa, migliora i lipidi. Va avviata da un ginecologo dopo valutazione.
– ChatGPT
Wizey ha aperto lo stesso tema in un quadro decisionale:
Data la Sua età (50), l’assenza di controindicazioni e i sintomi marcati – Lei si trova nella «finestra di opportunità» per iniziare la MHT. Iniziare la MHT entro i primi 10 anni dall’ultima mestruazione (Lei rientra in questa finestra) è associato al beneficio maggiore: riduzione delle vampate di calore dell’80-90%, miglioramento di sonno, umore e libido, protezione ossea e cardiovascolare, prevenzione dell’atrofia genitourinaria.
– Wizey
Ciò che conta non è solo il numero «80-90%» – è il controllo di sicurezza che ChatGPT ha saltato:
Ecografia pelvica e mammografia – per aggiornare gli screening (ultima mammografia due anni fa, citologia tre anni fa). Le controindicazioni vanno escluse prima di iniziare la MHT.
– Wizey
In gran parte della cultura sanitaria occidentale, il tema della MHT viene evitato oppure dominato da timori ormai superati sul tumore al seno risalenti all’era del WHI. Un quadro decisionale con una finestra esplicita, un effetto quantificato e gli accertamenti preliminari è raro – soprattutto per una donna il cui ginecologo le ha detto «be’, è l’età, ci conviva». Wizey ha aggiunto anche un breve inquadramento emotivo, senza esagerare:
I Suoi sintomi non sono «solo invecchiamento» e non sono qualcosa che deve accettare. È una condizione gestibile.
– Wizey
Sugli obiettivi quantitativi, lo stesso schema dell’uomo di 45 anni. ChatGPT: «vitamina D 2000-4000 IU». Wizey: vitamina D obiettivo 40-60 ng/mL, ferritina 50-100, ferro elementare 40-80 mg al mattino a stomaco vuoto con vitamina C, calcio 1200-1500 mg, proteine 1,0-1,2 g/kg di peso corporeo. La differenza non è il dosaggio – è che ora la paziente ha una checklist da monitorare, non un suggerimento generico.
Conclusione del caso: il tema della MHT è un campo minato di informazioni superate. Un quadro decisionale completo qui non è un extra – è il livello minimo di supporto al paziente.
E un caso urgente?
Nei quattro casi ambulatoriali, il contrasto principale era su indirizzamento, sicurezza e obiettivi. Ma c’è un’altra dimensione che non si vede negli scenari di routine – il triage. Un paziente in condizioni critiche dovrebbe chiamare i servizi di emergenza, non aprire un’IA. Nella pratica, apre comunque l’IA. Abbiamo eseguito un caso urgente per vedere come entrambi i servizi lo gestivano.
Uomo di cinquantadue anni. In terapia con atorvastatina 40 mg da 8 anni per ipercolesterolemia, più diabete di tipo 2 in trattamento con metformina. Disturbi: grave debolezza muscolare prossimale (non riesce a sollevare le braccia, non riesce a salire le scale), dolore a spalle e fianchi, urine scure da cinque giorni. Pannello: CK 23.171 U/L (normale 30-200 – oltre 115 volte il valore normale), AST 3.851, ALT 594, mioglobina sierica 3.200, mioglobinuria positiva, creatinina 188 μmol/L, eGFR 38 mL/min/1,73 m², potassio 5,3 mmol/L.
Entrambi hanno visto giusto. Diagnosi: rabdomiolisi da statine con danno renale acuto. Eziologia ricondotta all’atorvastatina. Raccomandazione: ricovero. Entrambi hanno menzionato anti-HMGCR (anticorpi anti-HMG-CoA reduttasi) e anti-SRP – marcatori della miopatia necrotizzante immuno-mediata associata alle statine (IMNM).
Oltre a questo, si sono differenziati su tre punti.
Triage – la prima riga della risposta. ChatGPT ha organizzato la risposta in 12 blocchi: valori, sintomi, cause, terapia. La frase «vada subito in ospedale» compariva nel nono blocco su dodici – dopo un lungo muro di testo. Wizey ha aperto lo stesso caso in modo diverso:
Situazione critica – ricovero immediato necessario. I Suoi esami indicano un grave danno acuto del tessuto muscolare (rabdomiolisi) che minaccia la funzione renale e richiede cure mediche immediate. È un’emergenza medica.
– Wizey
E più avanti, nel blocco dell’urgenza:
Urgenza CRITICA – ricovero necessario entro poche ore… Se avverte un peggioramento improvviso (debolezza intensa, battito irregolare, riduzione della diuresi, confusione) – chiami i servizi di emergenza.
– Wizey
In un’emergenza, la prima riga della risposta determina l’esito. Se il paziente vede un’analisi in 12 blocchi con «vada subito in ospedale» al blocco nove, può perdere 10-15 minuti a leggere. La collocazione del triage è la differenza tra «ha chiamato i servizi di emergenza» e «ha letto fino in fondo».
Ragionamento clinico – il calcolo AST/ALT. AST 3.851 e ALT 594 sono facili da interpretare erroneamente come grave danno epatico: transaminasi alle stelle, quindi fegato. Wizey ha fatto il calcolo esplicito:
Rapporto AST/ALT = 6,5 (normale è circa 1). Questo grado di predominanza dell’AST sull’ALT è tipico di un danno muscolare, non di un danno epatico.
– Wizey
Senza quel calcolo, il paziente potrebbe essere terrorizzato da una «catastrofe epatica» – quando qui l’origine delle transaminasi è muscolare. ChatGPT ha menzionato lo schema in termini generali, ma non ha calcolato il rapporto.
La risposta al «perché proprio ora?». Il paziente assumeva atorvastatina da 8 anni. Perché la rabdomiolisi è comparsa proprio adesso?
La rabdomiolisi può essere stata scatenata da: una lieve disidratazione, interazioni farmacologiche o l’esposizione cumulativa alla statina su un fondo di funzione renale in peggioramento (ridotta clearance renale → aumento dei livelli della statina).
– Wizey
ChatGPT ha saltato questa domanda. È importante – è il motivo per cui continuare la statina dopo la guarigione non è un’opzione.
Piano post-ricovero. Quello di ChatGPT era sostanzialmente inesistente: sospendere la statina, liquidi, monitoraggio. Quello di Wizey era un piano di dimissione completo: idratazione 2-2,5 L al giorno, restrizione proteica a 0,8-1 g/kg, restrizione del potassio, evitare i FANS, CoQ10 100-200 mg al giorno, genotipizzazione SLCO1B1, alternative alle statine (ezetimibe, fibrati, inibitori di PCSK9), monitoraggio della funzione renale e della CK almeno ogni 3 mesi per il primo anno.
Conclusione del caso. Negli scenari di routine, il triage è una questione di tatto. Nelle emergenze, è responsabilità clinica. La differenza nella prima riga, nel calcolo del rapporto e nel piano di dimissione è la differenza tra «informazione» e «navigazione». Per essere assolutamente chiari: in una situazione del genere, il paziente deve chiamare il 112 / i servizi di emergenza, non aprire un’IA.
I limiti dell’esperimento
Avevamo promesso trasparenza metodologica. Ecco che cosa c’è di debole in ciò che abbiamo fatto.
Cinque casi sono l’illustrazione di uno schema, non una statistica. Le conclusioni probatorie richiedono centinaia di esecuzioni, idealmente con valutatori in cieco e una metodologia preregistrata. Abbiamo visto lo stesso schema in ciascuno dei cinque, ma riconosciamo che il campione è troppo piccolo. Un lettore esigente ha tutto il diritto di dire «mostratemi 200 casi». È una richiesta legittima.
Sulla MGUS abbiamo mancato gli esami di conferma specifici – FLC, immunofissazione, Bence-Jones. Non si tratta di «non aver capito il contesto» – è una vera lacuna del prodotto. Il team ne è consapevole e il lavoro su un miglior recupero dei frammenti clinicamente rilevanti per specifici schemi di pannello è in corso.
«Lost in the Middle». All’inizio ci aspettavamo che nel caso di rabdomiolisi da statine – un pannello di ~70 marcatori con l’atorvastatina sepolta a metà elenco tra otto farmaci – ChatGPT non riuscisse a collegare la miopatia alla statina. Non è successo: il modello ha correttamente legato l’atorvastatina all’aumento della CK. È possibile che l’effetto compaia su pannelli più ampi (oltre 150 marcatori), che non abbiamo testato. L’ipotesi non è verificata.
Un modello, una versione. Abbiamo testato ChatGPT su GPT-5.4 – un’istantanea precisa nel tempo. Non abbiamo testato altri LLM pubblici su questi casi. I risultati potrebbero variare.
Conflitto di interessi. Siamo il team di Wizey. Per limitarlo: la metodologia è stata fissata prima delle esecuzioni (elenco dei casi, prompt, servizi) e tutti gli output sono citati testualmente.
Quando usare quale strumento
La conclusione non è «usi Wizey». La conclusione è che la scelta dipende dal compito.

ChatGPT è davvero utile per:
- tradurre il linguaggio medico in parole semplici («che cosa significa davvero HOMA-IR?»)
- risposte brevi a una domanda mirata («che cos’è la ferritina?»)
- contesto educativo sulle malattie, soprattutto quelle rare
- la formula motivante delle «tre cose da fare subito» – un primo passo concreto
Un’IA medica specializzata è utile per:
- una lettura strutturata di un pannello di laboratorio completo
- l’indirizzamento a specialisti con competenze precise
- il livello di sicurezza – condizioni preliminari prima della terapia, segnali d’allarme, finestre di urgenza con tempi
- obiettivi quantitativi – quale livello raggiungere, quale formulazione scegliere, quando ricontrollare
- la preparazione alla visita – come formulare i disturbi, quali domande porre, che cosa portare per rendere efficiente l’appuntamento
Un medico in carne e ossa resta necessario. Nessuna IA può eseguire l’esame obiettivo, la palpazione, né assumersi la responsabilità clinica del paziente. Un bravo medico può ancora porre domande che l’IA non ha imparato a generare e vede ciò che non è sul referto. Ma arrivare preparati – con una mappa degli invii, disturbi ben formulati e una lista di domande – è enormemente meglio che arrivare confusi con una pila di risultati.
La domanda non è «quale IA è più intelligente». La domanda è che cosa vuole di preciso Lei dalla tecnologia: una risposta rapida o un’analisi strutturata della Sua situazione specifica.
Mini-FAQ
Perché ChatGPT non ha mancato la diagnosi principale in nessuno dei cinque casi? La diagnosi principale è l’ipotesi più probabile a partire da un pannello e, sugli schemi clinici comuni – sindrome metabolica, ipotiroidismo subclinico, rabdomiolisi – gli LLM se la cavano davvero bene. Il problema non è la diagnosi in sé. È ciò che succede dopo: indirizzare i pazienti agli specialisti giusti, i controlli di sicurezza prima della terapia, i livelli obiettivo e gli intervalli di monitoraggio, i calcoli clinici come il rapporto AST/ALT.
Che cos’è un «livello di sicurezza» e perché conta nell’interpretazione degli esami? Un livello di sicurezza è l’insieme delle condizioni preliminari e degli accertamenti che devono precedere l’inizio di qualsiasi terapia – per esempio, il PSA prima della terapia sostitutiva con testosterone, o la mammografia e l’ecografia pelvica prima della terapia ormonale della menopausa. ChatGPT ha saltato sistematicamente questi controlli, non perché «non sa», ma perché è stato addestrato su testi eterogenei di internet, non su algoritmi clinici di gestione del paziente.
Avete testato solo ChatGPT. E Claude, Gemini o altri modelli? Solo ChatGPT in questo esperimento – GPT-5.4 nel piano Plus. Non abbiamo passato gli stessi casi attraverso altri LLM. Abbiamo pubblicato i pannelli di input completi e gli output testuali, così chiunque voglia ripetere l’esperimento su altri modelli può confrontare i risultati direttamente. Inseriremo il link alla Sua analisi se ce la invia.
Cinque casi sono pochi. Dov’è l’evidenza su larga scala? Domanda legittima. Cinque casi sono l’illustrazione di uno schema, non una statistica. Abbiamo visto la stessa forma in ciascuno dei cinque, ma non lo presentiamo come uno studio randomizzato. Le conclusioni probatorie richiedono centinaia di esecuzioni con valutatori in cieco e una metodologia preregistrata – è la fase successiva a cui il team sta lavorando.
Dove sono i dati grezzi dell’esperimento? I pannelli di input completi e gli output testuali di entrambi i servizi per tutti e cinque i casi sono pubblicati in una pagina di accompagnamento separata all’indirizzo /blog/2026/04/17/wizey-vs-chatgpt-raw-experiment-data/. Anche la metodologia di riproduzione è lì, per chi voglia far girare gli stessi pazienti su altri modelli.
In conclusione
La diagnosi corretta è la parte facile. Ciò che viene dopo – la mappa degli invii, i controlli di sicurezza, i livelli obiettivo, la prognosi, il triage – è dove avviene il lavoro vero della cura del paziente. È lo strato in cui gli LLM generalisti cedono in modo sistematico, e lo strato in cui un’IA medica specializzata è costruita per operare.
Se cerca uno strumento pensato proprio per questo tipo di interpretazione di più pannelli di laboratorio, è ciò che stiamo costruendo con Wizey. Non sostituisce una consulenza clinica – serve ad aiutarla ad arrivarci preparato. Gli output grezzi completi di entrambi i servizi per tutti e cinque i casi sono pubblicati apertamente, insieme alla metodologia di riproduzione, per chi voglia far girare gli stessi pazienti su un modello diverso.



