Articolo del blog

Wizey vs Grok (xAI): IA in tempo reale per domande mediche

Un'IA in tempo reale come Grok può interpretare il Suo referto? Guardiamo l'LLM di xAI con occhio clinico e dove un'IA medica come Wizey agisce diversamente.

IA in sanità Analisi & diagnostica Salute & prevenzione
Wizey vs Grok (xAI): IA in tempo reale per domande mediche

I medici sentono sempre più spesso una nuova versione di una vecchia domanda: «Dottoressa, l’ho chiesto a Grok.» A volte riguarda un sintomo, a volte un valore specifico del loro pannello di biochimica, a volte la dose di un farmaco di cui hanno letto su X. Grok è diventato un’IA di uso quotidiano per un tipo particolare di utente – il pubblico esperto di tecnologia e nativo di X, che ne apprezza la sensazione di tempo reale e la disponibilità a rispondere a domande che altri chatbot rifiutano educatamente.

Proprio per questo voglio ripercorrere con onestà ciò che Grok sa fare bene in una conversazione medica e dove si collocano i limiti di prodotto, tecnici e normativi. In questo articolo osservo il modello di punta di xAI con l’occhio del clinico: come si comporta con le domande di salute, che cosa Le offre davvero la sua ricerca in tempo reale e dove dovrebbe smettere di aspettarsi che un assistente generico svolga un lavoro per cui non è mai stato progettato.

Lavoro nel team di Wizey, quindi sono di parte: valuto ogni IA in base a come tratta un referto di laboratorio. Ma questa parzialità mette in luce cose che a un utente occasionale sfuggono: perché un chatbot in tempo reale e meno filtrato è per certi versi più pericoloso per la medicina di uno cortese, e perché «Grok le dice come stanno» è un testo di marketing, non un dato clinico.

Grok nel 2026: tempo reale, provocatorio, ma pur sempre un LLM generico

Un rapido inquadramento tecnico, perché a volte si parla di Grok come se fosse una nuova specie di IA. Non lo è. Grok è la famiglia di grandi modelli linguistici di xAI (attualmente nella classe Grok 3 / Grok 4 nel corso del 2026), addestrata su un misto di dati web pubblici e del corpus dei post di X, distribuita in primo luogo tramite l’abbonamento X Premium e l’API di xAI.

Ciò che rende Grok distintivo sul piano del prodotto sono tre cose. Primo, la stretta integrazione con X: può parlarci dentro l’app mentre scorre il feed, e può citare o riassumere i post quasi in tempo reale. Secondo, una politica dei contenuti «meno censurata»: xAI presenta Grok come più disposto a confrontarsi con domande spinose, politiche o speculative. Terzo, una voce deliberatamente irriverente, ispirata in parte all’estetica della Guida galattica per autostoppisti.

Nessuna di queste tre caratteristiche ne fa un modello medico. Sotto il cofano, Grok è un LLM generico con le stesse modalità di errore documentate in tutto il settore: allucinazioni, assurdità enunciate con sicurezza, sensibilità alla formulazione del prompt e l’effetto Lost in the Middle, per cui le informazioni sepolte nel mezzo di un contesto lungo vengono sottopesate nell’output. Sono proprietà dell’architettura transformer, non di un particolare fornitore. Tutto ciò che ho scritto sugli LLM generici nel confronto di riferimento tra Wizey e ChatGPT vale anche per Grok. Qui mi concentro su ciò che è specifico di Grok: l’aspetto del tempo reale, la posizione sulla politica dei contenuti e la distribuzione tramite X Premium.

Il problema della «minore censura» – perché conta in medicina

Con ChatGPT o Claude, la lamentela più comune degli utenti esperti è che il modello risulta troppo prudente: si mostra evasivo, rifiuta o rimanda a «consulti un medico» perfino per domande divulgative innocue. Grok è posizionato esplicitamente nella direzione opposta. Si confronta con più domande, dà risposte dal tono più diretto e si cautela meno.

In quasi ogni ambito non medico, questo è un pregio. In medicina, è un rischio.

Ecco il meccanismo. Un chatbot cortese che si rifiuta di interpretare il Suo valore di ferritina è fastidioso, ma così evita anche di darLe con sicurezza la risposta sbagliata. Un chatbot che risponde di buon grado alla stessa domanda con un paragrafo dal suono plausibile può essere molto più dannoso, perché l’utente se ne va convinto di aver capito il proprio referto. Il rischio clinico reale cresce con la sicurezza del modello, non con la sua disponibilità a collaborare. Meno filtri e un tono più diretto sono una cattiva combinazione per un ambito in cui le risposte sbagliate possono tradursi in diagnosi ritardate.

Grok mostra anche le tendenze compiacenti documentate nei principali LLM: il modello adatta spesso la risposta a ciò che l’utente sembra voler sentire. Gli chieda «la mia ferritina è 800, probabilmente è solo infiammazione?» e otterrà con più probabilità una risposta d’accordo rispetto a quando chiede «la mia ferritina è 800, di che cosa dovrei preoccuparmi?». Le indicazioni della Mayo Clinic sui chatbot IA sono piuttosto nette in proposito: questi strumenti sono utili per la divulgazione generale, non per l’interpretazione diagnostica personale.

Ricerca in tempo reale: utile per le notizie, irrilevante per il Suo referto

Il secondo punto di forza di Grok è l’accesso in tempo reale a X e al web pubblico. Per alcune domande è davvero utile. Se un farmaco è appena stato ritirato, se viene segnalato un focolaio, se stamattina è uscita una nuova linea guida clinica, Grok può farlo emergere più in fretta di un modello con una data di addestramento fissa.

Per interpretare il Suo referto, però, la ricerca in tempo reale non serve praticamente a nulla. Il Suo pannello di biochimica non è su internet. È un PDF privato, generato dal Suo laboratorio specifico, con gli intervalli di riferimento propri di quel laboratorio, lo specifico metodo di dosaggio utilizzato e la specifica combinazione di analiti esaminati. Nulla di tutto ciò è recuperabile con una ricerca sul web. Ciò di cui ha davvero bisogno è un parser strutturato che estragga ogni riga come una tupla (parametro, valore, unità, intervallo di riferimento), normalizzi le unità tra laboratori diversi e faccia passare il risultato attraverso percorsi clinici validati. I dati web in tempo reale non possono sostituire nessuno di questi passaggi.

In alcuni casi, la ricerca in tempo reale peggiora la situazione. Grok può trascinare nella risposta opinioni prese da post su X e da thread di forum, e spesso dall’output è difficile capire quale affermazione provenga da una fonte con revisione paritaria, quale dal tweet di un medico e quale da un account anonimo. The Lancet Digital Health e Nature hanno entrambe pubblicato su come gli LLM confondano la provenienza delle affermazioni mediche: con uno strato di recupero dati fortemente basato sui social media, questa confusione peggiora, non migliora.

Niente HIPAA BAA, e i termini di xAI escludono esplicitamente il parere medico

Sul piano normativo la storia è semplice e breve. Il Grok per il consumatore di xAI, distribuito tramite X Premium, non offre un HIPAA Business Associate Agreement. Ciò significa che Grok non è un luogo lecito in cui caricare dati identificabili dei pazienti nel contesto sanitario statunitense. Per l’UE, il GDPR tratta le informazioni sulla salute come dati di categoria particolare, che richiedono tutele esplicite che un chatbot generico per il consumatore non può fornire. Le linee guida dell’OMS sull’IA per la salute sono inequivocabili: i chatbot per il consumatore non sostituiscono gli strumenti clinicamente validati.

Gli stessi termini di servizio di xAI escludono esplicitamente il parere medico: gli output di Grok non sono destinati a diagnosi, trattamento o qualsiasi decisione clinica, e xAI declina ogni responsabilità per un simile uso. Non è un tranello nascosto nelle clausole scritte in piccolo. È la posizione legale standard di ogni fornitore di LLM per il consumatore (OpenAI, Anthropic, Google, xAI) e va presa alla lettera.

Quindi, anche se la risposta di Grok sulla Sua ferritina suona plausibile, il fornitore Le ha già detto, per iscritto, che non può farci affidamento per le decisioni mediche. Già solo questo è un motivo per trattare Grok come uno strumento didattico, non clinico.

Dove Grok si inceppa su un vero pannello di laboratorio

Vorrei scendere nel concreto su che cosa si inceppa quando prova a usare Grok per interpretare gli esami di laboratorio.

Nessun parser strutturato. Quando incolla il testo di un PDF in Grok, lo legge come un muro di parole, non come una tabella strutturata. Le unità vengono confuse (µg/L contro mg/L – nella pratica una differenza di mille volte), gli intervalli di riferimento smettono di essere associati alla riga giusta, le note a piè di pagina sul metodo vengono ignorate. Su cinque valori funziona bene. Su un pannello da 28 righe comincia a perdere numeri.

Lost in the Middle sui dati strutturati. Liu et al. 2023 (Stanford) hanno documentato che gli LLM sottopesano le informazioni al centro di un contesto lungo. In un pannello da 30 parametri, gli analiti nel mezzo del documento – proprio quelli che potrebbero contare – ricevono la minore attenzione. Per la biochimica, è così che una PCR elevata, una sottile anomalia della formula leucocitaria o un TSH in lenta deriva sparisce in silenzio dalla sintesi.

Nessun percorso clinico. Quando un sistema specializzato vede una ferritina elevata, è tenuto a guardare anche la PCR e la formula leucocitaria, perché la ferritina è una proteina della fase acuta e leggerla isolatamente è clinicamente sbagliato. Grok non conosce quell’algoritmo. Può interpretare la ferritina «alla lettera» come sovraccarico di ferro e consigliare di ridurre la carne rossa. La risposta suona plausibile. Sul piano clinico, è una svista.

Nessuna continuità tra le visite. Grok non cuce insieme i Suoi esami di marzo, giugno e novembre in un’unica linea temporale. Ogni conversazione è essenzialmente una pagina bianca. In medicina, l’andamento su tre visite è spesso più informativo di qualsiasi singolo valore.

Sicurezza senza calibrazione. Il tono meno filtrato di Grok comporta meno momenti «non sono sicuro» nel suo output, anche quando l’incertezza è alta. Un sistema che suona sicuro a un non esperto ma sbaglia spesso è peggio di uno che esprime i dovuti dubbi.

Niente di tutto questo è una critica a xAI come azienda. È semplicemente una descrizione di ciò per cui un LLM generico è costruito e di ciò per cui non lo è. Se stessi costruendo un’IA sociale in tempo reale, farei gli stessi compromessi che hanno fatto loro. Solo, non le affiderei un referto di laboratorio.

Scenario di prova: ferritina 812 con Grok contro una pipeline medica

Per restare sul concreto, ho fatto passare lo stesso caso attraverso entrambi gli strumenti. Un paziente di 38 anni, ferritina 812 ng/mL, PCR 14 mg/L, emoglobina 121 g/L, con un emocromo e un pannello metabolico peraltro nella norma.

Grok su X Premium, tre valori incollati in chat. La risposta era un paragrafo sicuro sul sovraccarico di ferro, sullo screening per l’emocromatosi, con un accenno all’infiammazione come possibile fattore confondente e la raccomandazione di «parlare con un medico in caso di dubbi». Nessuna singola frase era errata. Ma nessuna definizione delle priorità: l’accertamento di un’emocromatosi e la correzione per una proteina della fase acuta sono percorsi clinici molto diversi, e l’utente deve indovinare quale dei due si applichi. Alla domanda successiva «potrebbe essere solo infiammazione?» Grok si è detto d’accordo, ed è esattamente il problema della compiacenza.

Grok con un PDF completo da 28 parametri. Grok ha letto la maggior parte dei valori, ma ha mancato due anomalie nella parte centrale del pannello e non ha collegato l’assetto lipidico agli enzimi epatici. La sintesi generale era corretta ma piatta: nessuna indicazione di urgenza, nessun «ecco che cosa fare per primo».

Lo stesso pannello attraverso una pipeline specializzata (Wizey). Tabella strutturata di tutti i 28 parametri con unità normalizzate, scostamenti segnalati, una linea di tendenza se esistono referti precedenti e un elenco di azioni in ordine di priorità: «discutere con urgenza con un gastroenterologo», «controllo di routine tra tre mesi», «variante della norma, nessuna azione necessaria». Ogni affermazione della sintesi clinica risale a una riga precisa della tabella estratta, così un medico può verificarla riga per riga. Non è magia, è un’architettura diversa. Wizey usa OCR → estrazione strutturata → grafo della conoscenza → percorsi clinici validati, ed è esplicitamente progettato per rifiutare anziché allucinare quando non è sicuro. Grok è progettato per confrontarsi. Sono prodotti diversi per lavori diversi.

Quando Grok è lo strumento giusto per la salute

Ho promesso un confronto equo. Grok ha veri punti di forza e lo uso personalmente per alcune cose specifiche.

  • Nozioni generali. «Che cos’è la ferritina», «che cosa misura la PCR», «in che cosa l’immunità indotta dal vaccino differisce da quella naturale»: qui Grok va bene. Velocità e tono sono un vantaggio netto per l’apprendimento.
  • Notizie di salute in tempo reale. La segnalazione di focolai, i ritiri di farmaci, i risultati di studi clinici appena annunciati: la ricerca in tempo reale e il flusso continuo di X sono un vantaggio reale rispetto ai modelli con una data di addestramento fissa.
  • Formulare le domande per il Suo medico. Descriva la Sua situazione in linguaggio naturale e chieda a Grok di produrre da cinque a sette domande mirate per la visita. Questo aiuta davvero: i medici preferiscono di gran lunga un paziente preparato a uno impreparato.
  • Tradurre il gergo medico. «Mi spieghi questa lettera di dimissione in parole semplici» è un compito che qualsiasi LLM moderno, Grok compreso, svolge bene. È traduzione, non diagnosi.
  • Approfondire un tema di sanità pubblica. Se vuole capire una nuova linea guida, una controversia su una classe di farmaci o un dibattito su X riguardo a un articolo scientifico, l’accesso in tempo reale di Grok e la sua disponibilità a confrontarsi con le sfumature sono utili.

Quello che non farei è incollare in Grok un PDF dei miei esami e agire in base alla sua interpretazione. Non perché Grok sia «cattivo», ma perché è costruito per un lavoro diverso.

Mini-FAQ

Posso chiedere a Grok di interpretare i risultati delle mie analisi del sangue? Tecnicamente può incollare qualche valore nella chat di Grok su X e ricevere una risposta. Ma gli stessi termini di servizio di xAI escludono esplicitamente il parere medico, Grok non ha un HIPAA Business Associate Agreement, e la sua nota tendenza a risposte provocatorie, compiacenti o speculative è esattamente il comportamento sbagliato per un referto di laboratorio. Per un pannello completo da 20 a 30 parametri, un LLM generico come Grok non è lo strumento giusto.

Che cos’è Grok e in che cosa si differenzia da ChatGPT? Grok è il grande modello linguistico (LLM) di punta di xAI, attualmente nella generazione Grok 3/4 nel corso del 2026. È distribuito soprattutto tramite X Premium (il livello a pagamento del social network un tempo noto come Twitter) e tramite l’API di xAI. Rispetto a ChatGPT, Grok si posiziona con l’accesso in tempo reale ai post su X e al web pubblico, una politica dei contenuti meno restrittiva e un tono deliberatamente provocatorio. Sotto il cofano resta un LLM generico, con gli stessi limiti di allucinazione e ragionamento.

Grok è conforme a HIPAA o GDPR per i dati medici? No. xAI non offre un HIPAA Business Associate Agreement per il Grok destinato al consumatore su X Premium, e caricare informazioni sanitarie identificabili in una qualsiasi interfaccia di chat per il consumatore – Grok, ChatGPT, Gemini o altre – non è consigliabile. La conformità al GDPR per i dati sanitari di categoria particolare richiede un’infrastruttura esplicita e garanzie contrattuali che il Grok per il consumatore non fornisce.

La ricerca web in tempo reale rende Grok più sicuro per le domande mediche? La ricerca in tempo reale aiuta con i temi che evolvono in fretta, come i ritiri di farmaci o le notizie sui focolai, ma non risolve il problema di fondo dell’interpretazione degli esami. Il Suo esame del sangue non è su internet: è un PDF privato di uno specifico laboratorio, con intervalli di riferimento e metodi propri. La ricerca in tempo reale non può sostituire un parser strutturato, la normalizzazione delle unità o i percorsi clinici. Può anzi peggiorare le cose portando alla luce, come prove, casuali post di forum.

Quando Grok è davvero utile in ambito salute? Per le domande di carattere generale Grok va bene: che cos’è la ferritina, che cosa misura la PCR, come risponde il sistema immunitario a un virus. È utile anche per le notizie in tempo reale su eventi di sanità pubblica, carenze di farmaci o annunci delle autorità in cui conta l’attualità. Ma interpretare il Suo pannello di esami specifico con i suoi numeri e decidere che cosa fare dopo è un compito diverso: pensato per una pipeline medica specializzata, non per un chatbot generico.

Conclusione

Grok è un LLM generico capace e con una personalità propria, dotato di veri punti di forza: l’accesso in tempo reale a X, la disponibilità a confrontarsi con domande che altri modelli rifiutano e una prosa davvero veloce e scorrevole. Per l’educazione sanitaria generale, per seguire le notizie di medicina in tempo reale, per preparare le domande prima di una visita funziona bene, e non ho problemi a consigliarlo in questi casi.

Ma interpretare un vero pannello di laboratorio è un lavoro diverso. Quel lavoro richiede il parsing rigoroso di ogni valore, la normalizzazione di unità e intervalli di riferimento, il collegamento tra più visite in una vera linea temporale e l’operare all’interno di percorsi clinici validati, anziché la generazione di testo libero. Wizey l’abbiamo costruito esattamente così: non un altro chatbot generico, ma una pipeline specializzata per i documenti medici, progettata per rifiutare anziché allucinare quando non è sicura. Se ha tra le mani un referto che vuole decifrare senza perdere un solo numero, quello è lo strumento costruito per questo compito.

Fonti