Nell’ultimo anno i medici hanno osservato un chiaro cambiamento nel modo in cui i pazienti si preparano alle visite. Se un tempo portavano le stampe di ChatGPT, oggi una quota crescente arriva con gli screenshot di Microsoft Copilot – la piccola icona blu che vive in Word, Outlook, Teams e nella barra delle applicazioni di Windows. Quando il Suo datore di lavoro distribuisce Microsoft 365 Copilot ed è lì, a portata di clic, sembra il posto sensato dove caricare un PDF di laboratorio. È integrato. È di livello enterprise. È di Microsoft.
Dal punto di vista clinico, il quadro è ambivalente. Copilot è un assistente davvero capace e, per la governance dei dati aziendali, è probabilmente l’IA più rigorosamente circoscritta tra quelle vicine al mondo consumer. Ma «rigorosamente circoscritta per l’azienda» e «sicura per l’interpretazione clinica» sono due affermazioni molto diverse. In questo articolo voglio analizzare questa distinzione con onestà.
I limiti generali dei grandi modelli linguistici (LLM) nell’interpretazione dei referti li ho trattati nell’articolo pilastro Wizey vs ChatGPT. Qui mi concentro su ciò che è specifico di Microsoft Copilot – il backend Azure OpenAI, l’integrazione con Microsoft Graph, le garanzie commerciali di protezione dei dati e ciò che significano, e ciò che non significano, quando un pannello di 45 marcatori arriva nella finestra della chat.
Che cos’è davvero Microsoft Copilot nel 2026
Microsoft Copilot non è un prodotto unico. È un marchio che comprende almeno quattro livelli sensibilmente diversi tra loro.
Copilot (consumer) è l’assistente di chat gratuito su copilot.microsoft.com e all’interno di Windows 11. Gira su modelli di classe GPT-4o e GPT-5 ospitati in Azure OpenAI, con visione multimodale e ancoraggio web tramite Bing. Non ha alcun Business Associate Agreement (BAA) e si applicano i normali termini di servizio consumer.
Copilot Pro è il livello consumer a pagamento (circa 20 $ al mese) che aggiunge accesso prioritario, modelli avanzati per le immagini e una leggera integrazione nelle app personali di Microsoft 365. Restano i termini consumer. Resta l’assenza di BAA.
Microsoft 365 Copilot è la licenza enterprise venduta per postazione alle organizzazioni. È quella che compare nel Word e nell’Outlook aziendali. Si appoggia su Azure OpenAI, aggiunge il contesto di Microsoft Graph (i file, la posta, il calendario e Teams del Suo tenant) e opera secondo condizioni commerciali di protezione dei dati. Secondo la documentazione ufficiale sulla privacy di Microsoft, i prompt e le risposte sono cifrati in transito e a riposo, restano entro il perimetro del servizio Microsoft 365 e non vengono usati per addestrare i modelli di base.
Copilot per M365 nei tenant sanitari aggiunge la copertura HIPAA quando il cliente ha stipulato un Business Associate Agreement con Microsoft. È l’unica edizione contrattualmente pensata per le informazioni sanitarie protette (Protected Health Information).
Per i pazienti è fondamentale capire una cosa: il Copilot gratuito sul Suo portatile di casa e il Copilot enterprise dentro il sistema del Suo ospedale sono prodotti molto diversi dal punto di vista della conformità, anche se la finestra di chat è identica.
Dove Copilot è davvero forte
Voglio essere onesto. Per chiunque viva nell’ecosistema Microsoft, Copilot ha vantaggi reali rispetto a una sessione ingenua di ChatGPT.
Cifratura dei dati in transito e isolamento del tenant per il Copilot M365 enterprise sono reali. È una delle poche esperienze di IA rivolte al consumer in cui, al livello enterprise, si ha la certezza contrattuale che i propri prompt non finiranno nell’addestramento del modello. Per un’organizzazione che valuta l’IA per le attività cliniche, questo conta enormemente.
Analisi strutturata dei documenti. Copilot eredita la pipeline di Office per la lettura di Word, PDF ed Excel. In pratica significa che un PDF di laboratorio ben scansionato viene letto in modo più pulito rispetto a una semplice finestra di chat: il lato Office del prodotto apporta una gestione documentale concreta che i chatbot puri non hanno.
Contesto di Microsoft Graph per i flussi di lavoro. Se il Suo compito è «riassumi le tre email più recenti sulla mia risonanza al ginocchio inviate dallo studio del mio medico», Copilot brilla davvero. Sa mettere insieme eventi del calendario, thread di Outlook e allegati di OneDrive come nessun LLM autonomo saprebbe fare. È l’argomento di vendita su cui punta Microsoft, ed è legittimo per il lavoro d’ufficio.
I modelli di base più recenti, e in fretta. Poiché Copilot gira su Azure OpenAI, beneficia degli aggiornamenti di classe GPT-4o/GPT-5 con SLA enterprise. Non riceve un modello datato nascosto dietro il marchio Microsoft: riceve in sostanza la famiglia GPT di frontiera con salvaguardie commerciali.
Dove Copilot fallisce nei compiti medici
Ora l’elenco onesto, quello che i medici vedono durante le visite.
Le allucinazioni sono architettura, non un bug. Un LLM generico ottimizza la plausibilità, non la verità. La direttrice medica di Wizey, la dott.ssa Aigerim Bissenova, osserva: «Ho letto screenshot di pazienti in cui Copilot commentava con sicurezza un “magnesio leggermente basso” che semplicemente non figurava tra gli esami richiesti, oppure inventava un intervallo di riferimento per un marcatore tumorale che non corrispondeva al piè di pagina reale del laboratorio.» Questo coincide con quanto descrivono la revisione del 2023 di Nature Medicine sugli LLM in medicina e uno studio del 2024 su Lancet Digital Health sul ragionamento diagnostico degli LLM: risultati dal suono plausibile con un tasso di errore clinicamente inaccettabile su casi numerici specifici. Far girare lo stesso modello sotto il marchio Microsoft non ne cambia le modalità di errore.
Lost in the Middle nei pannelli lunghi. L’effetto documentato da Liu et al. (2023) è universale per le architetture transformer, e GPT-4o non fa eccezione. Quando un paziente incolla un pannello metabolico completo di 50 marcatori, più tiroide, più studio del ferro, più vitamina D, Copilot commenta in dettaglio i primi valori e gli ultimi, mentre i marcatori sepolti nel mezzo – spesso proprio i sottili indizi infiammatori o metabolici – ricevono una frase generica o vengono saltati in silenzio. L’involucro di Office non lo risolve.
Nessun ragionamento sistematico tra marcatori. Un’interpretazione competente dipende quasi sempre da combinazioni. La ferritina va letta alla luce della PCR, perché la ferritina è essa stessa una proteina di fase acuta. Il TSH va letto insieme al T4 libero e talvolta agli anticorpi anti-TPO. La glicemia a digiuno va affiancata a HbA1c e insulina. Copilot commenta ogni valore di un elenco, ma non possiede un grafo di conoscenza clinico che codifichi queste relazioni come regole ferree. Due utenti con gli stessi numeri possono ricevere due storie diverse a seconda di come formulano la domanda.
Il contesto di Microsoft Graph è il contesto sbagliato. Il Suo calendario e i Suoi thread di Outlook non aiutano Copilot a interpretare le Sue analisi. Per l’esperienza rivolta al consumer non c’è integrazione con le cartelle cliniche elettroniche native FHIR, non c’è accesso ai Suoi pannelli precedenti a meno di allegarli manualmente e non c’è un database integrato di intervalli di riferimento che conosca il metodo di dosaggio del Suo specifico laboratorio. L’integrazione enterprise è notevole, ma per questo compito non è l’integrazione che conta.
Microsoft stessa dichiara che l’ambito medico è fuori portata. Il Microsoft Responsible AI Standard indica esplicitamente gli scenari medici a elevata rilevanza come casi che richiedono una valutazione specializzata, superiore a quanto offre un Copilot generico. I termini di servizio consumer di Copilot ribadiscono che non è un dispositivo medico e non è destinato alla diagnosi medica.
HIPAA, BAA e il divario tra consumer ed enterprise
È qui che la maggior parte dei pazienti e non pochi ambulatori di medie dimensioni fanno confusione. Lo dico con chiarezza.
Il Copilot consumer non ha alcuna copertura HIPAA. Quando accede con un account Microsoft personale su copilot.microsoft.com e incolla il PDF del Suo emocromo, sta usando un prodotto consumer. Tra Lei e Microsoft non esiste alcun Business Associate Agreement. I Suoi dati non sono informazioni sanitarie protette (PHI) in senso normativo, perché è Lei, il paziente, a divulgarli volontariamente, ma il servizio non ha alcun obbligo HIPAA di tutelarli come PHI. La guida dell’HHS su HIPAA e cloud computing chiarisce dove ricadono gli obblighi.
Il Copilot M365 enterprise con BAA è un’altra storia. Se il Suo ambulatorio dispone di una licenza Microsoft 365 enterprise con un BAA firmato, i prompt e le risposte tramite M365 Copilot possono rientrare nelle tutele HIPAA. I dati risiedono nel tenant del cliente, sono cifrati in transito e a riposo e sono esplicitamente esclusi dall’addestramento dei modelli di base. È un impianto di governance solido, ma non dice nulla sul fatto che l’output del modello sia clinicamente corretto. Il BAA è un contratto sul trattamento dei dati. Non è una validazione dell’accuratezza medica.
GDPR e il versante europeo. Per i pazienti dell’UE, M365 Copilot offre opzioni di residenza dei dati che mantengono i prompt entro i confini europei. Anche in questo caso il punto è dove i dati vengono archiviati, non se l’interpretazione è corretta.
In breve: il Copilot enterprise dentro un tenant sanitario è governato molto meglio del ChatGPT pubblico. Questo non ne fa un dispositivo medico. Governance e validità clinica sono assi diversi.
Un test realistico: pannello executive da 45 marcatori con Copilot enterprise
Per ancorare tutto questo a un’esperienza concreta, ho svolto un test sensato. Ho preso il PDF anonimizzato di un pannello di check-up executive da 45 marcatori – emocromo con formula, CMP, assetto lipidico completo, pannello tiroideo, studio del ferro compresa la ferritina, vitamina D 25-OH, omocisteina, PCR ad alta sensibilità, HbA1c – e l’ho caricato in Microsoft 365 Copilot dentro un tenant enterprise di prova.
Cosa è andato bene. L’OCR è stato pulito. Copilot ha letto correttamente i nomi dei marcatori e le unità, non ha confuso i mg/dL con i mmol/L e ha organizzato la risposta per sistema anatomico. Il primo pannello (emocromo) ha ricevuto un commento ponderato. Anche gli ultimi marcatori (HbA1c, vitamina D) hanno ricevuto dettagli. Quella curva di attenzione a forma di U è esattamente ciò che prevede la letteratura sul Lost in the Middle.
Cosa si è rotto. Il centro del referto – nello specifico una ferritina elevata accanto a una PCR ad alta sensibilità elevata – non è stato integrato. Copilot mi ha detto che la ferritina era alta e ha consigliato di indagare un sovraccarico di ferro. Separatamente, mi ha detto che la PCR ad alta sensibilità era elevata e ha accennato all’infiammazione. Non ha mai collegato le due cose, che è la mossa da manuale che un medico competente compie per prima: un aumento della ferritina in fase acuta riflette l’infiammazione prima del ferro.
Mancata riproducibilità. Ho rieseguito lo stesso PDF in una nuova chat con una formulazione leggermente diversa. L’omocisteina è passata da «nei limiti della norma» a «al limite superiore: valutare B12 e folati». Stesso numero, stesso intervallo di riferimento, storia diversa. Per un documento medico questo è inaccettabile: non si possono costruire decisioni cliniche su output stocastici.
Nessuna visione longitudinale. Copilot non ha memoria delle analisi precedenti da una sessione di chat all’altra, a meno che non alleghi manualmente ogni PDF precedente. Non esiste il concetto di andamento. La Sua HbA1c che sale lentamente da 5,4 a 5,7 e poi a 5,9 nell’arco di tre anni – il segnale lento che conta davvero – resta invisibile finché non la fornisce a mano.
Al contrario, una pipeline sviluppata appositamente per l’interpretazione dei referti scompone ciascuno di quei 45 marcatori in un oggetto strutturato (nome, valore, unità, riferimento, data del prelievo, metodo); poi un livello di ragionamento deterministico percorre la tabella applicando regole cliniche codificate. Ferritina più PCR è una regola, non una scelta stilistica. Gli andamenti nel corso degli anni sono elementi di primo livello. L’output è riproducibile perché la logica è riproducibile.
Quando Copilot è lo strumento giusto in un flusso di lavoro medico
Non voglio che questo suoni come «Copilot è pessimo, non va mai usato». Non è questo il messaggio. Copilot è eccellente in diversi compiti adiacenti.
Riassumere un articolo medico di cui già si fida. Se il Suo endocrinologo Le ha inviato un PDF con le linee guida e ne vuole il senso in 300 parole, Copilot è perfetto.
Preparare un elenco di domande per la visita. Gli fornisca i Suoi sintomi e il contesto, chieda cinque domande da portare al Suo cardiologo. Questo sfrutta i punti di forza del modello – la generazione strutturata di contenuti non numerici – senza alcun rischio.
Tradurre un referto di laboratorio straniero. Analisi fatte in vacanza, in tedesco, ebraico o giapponese? Copilot tradurrà in modo pulito il testo descrittivo e le etichette delle unità. Da abbinare a uno strumento specializzato per l’interpretazione vera e propria.
Trasformare gli appunti di una visita in un riassunto leggibile. Se il Suo medico Le consegna una sintesi post-visita piena di sigle, Copilot può riscriverla in un linguaggio semplice per la Sua documentazione.
Attività amministrative sanitarie legate all’ufficio. Scrivere un’email per richiedere una visita specialistica, riassumere la corrispondenza con l’assicurazione, trasformare una discussione su Teams sul Suo piano di cura in punti elenco: esattamente i flussi di lavoro per cui è stato creato Microsoft Graph.
Ciò che non è adatto a Copilot: l’interpretazione diretta di un pannello con più marcatori, il monitoraggio longitudinale su anni di dati, le decisioni su dosaggi o farmaci, l’interpretazione di marcatori tumorali o profili ormonali borderline, o qualsiasi cosa richieda un ragionamento clinico deterministico.
Confronto diretto: Wizey vs Microsoft Copilot
| Aspetto | Wizey | Microsoft Copilot (M365 Enterprise) |
|---|---|---|
| Scopo | Sviluppato appositamente per l’interpretazione dei referti | Assistente di produttività generico |
| Modello di base | Grafo di conoscenza medico + pipeline LLM validata | Classe GPT-4o / GPT-5 tramite Azure OpenAI |
| Gestione dei documenti | Analisi strutturata in oggetti tipizzati per ciascun marcatore | Testo libero + visione sul PDF |
| Ragionamento clinico | Percorsi clinici codificati, regole deterministiche | Predizione statistica del token successivo |
| Collegamenti tra marcatori (ferritina/PCR, TSH/T4) | Di primo livello, sempre valutati | Non modellati |
| Monitoraggio longitudinale | Nativo, rilevamento automatico delle tendenze | Nessuno; richiede l’allegato manuale |
| Rischio di allucinazione | Circoscritto da estrazione strutturata e controlli sulle regole | Elevato nei casi limite numerici |
| Riproducibilità | Lo stesso input produce lo stesso output | Stocastico; stesso input, risposte diverse |
| HIPAA / BAA | Controlli di grado medico integrati | BAA disponibile solo nel livello enterprise |
| GDPR / residenza UE | Disponibile | Disponibile nel livello enterprise |
| Addestramento sui dati dell’utente | Mai | Non per l’enterprise; per il livello gratuito valgono le condizioni consumer |
| Integrazione con Microsoft Graph | Non applicabile | Sì (non correlata all’interpretazione dei referti) |
Un breve algoritmo per i pazienti
Se ha già Microsoft 365 al lavoro o a casa:
- Usi Copilot per ciò in cui è eccellente: riassumere, redigere, tradurre, gestire i flussi di lavoro di Office.
- Non usi il Copilot consumer per interpretare pannelli numerici di laboratorio. Già solo la lacuna del BAA è un motivo per fermarsi.
- Se usa il Copilot M365 enterprise in un ambulatorio con BAA, tratti i suoi commenti sui referti come un ausilio di lettura approssimativo, non come un output clinico. Verifichi ogni numero che cita confrontandolo con il PDF reale.
- Per l’interpretazione vera e propria – andamenti della ferritina, lettura tiroidea, rapporti lipidici, stato vitaminico nel corso degli anni – usi uno strumento sviluppato appositamente, che scompone i valori in dati strutturati e applica regole cliniche validate.
- Porti l’output strutturato al Suo medico. L’obiettivo è arrivare preparato alla visita, non sostituirla.
Mini-FAQ
Microsoft Copilot è conforme all’HIPAA per caricare le mie analisi del sangue? Dipende dall’edizione. Microsoft 365 Copilot per i clienti enterprise è coperto dal Microsoft Business Associate Agreement quando è in essere un BAA idoneo, e i dati del tenant non vengono usati per addestrare i modelli di base. Il Copilot consumer gratuito NON è coperto da un BAA, non è pensato per le informazioni sanitarie protette (PHI) e gli stessi termini di Microsoft sconsigliano l’uso clinico.
Copilot riesce a leggere correttamente un PDF con più pannelli, come un CMP o un profilo tiroideo completo? Copilot usa la visione multimodale di classe GPT-4o tramite Azure OpenAI e se la cava piuttosto bene con PDF puliti e ben strutturati. Ma sui pannelli fitti da 40 a 60 marcatori incappa nello stesso problema del Lost in the Middle che ha ogni LLM transformer: i valori agli estremi ricevono commenti precisi, mentre i marcatori a metà documento vengono riassunti in modo più generico o, di tanto in tanto, inventati. Inoltre non ha alcun meccanismo per collegare la ferritina alla PCR, o il TSH al T4 libero.
E il contesto di Microsoft Graph? Non rende Copilot più intelligente in ambito sanitario? Microsoft Graph dà a Copilot accesso alle Sue email, ai documenti, alle chat di Teams e al calendario – utile per la produttività sul lavoro, ma non porta alcun contesto clinico. Non si collega a un grafo di conoscenza medico, non conosce gli intervalli di riferimento del Suo dosaggio e non sa ragionare sulle vie fisiologiche.
Copilot è più sicuro di ChatGPT per i dati sanitari in un contesto aziendale? Per la governance dei dati sì: il Copilot M365 enterprise mantiene i dati del tenant entro il perimetro del servizio Microsoft 365, li cifra in transito e a riposo e non addestra i modelli di base con i prompt del tenant. Per l’accuratezza medica no. Il modello sottostante è un LLM generico, con lo stesso profilo di rischio di allucinazione di qualsiasi altra implementazione di GPT-4o.
Quando ha senso usare Copilot per temi di salute? Per riassumere articoli di cui già si fida, redigere domande per il Suo medico, tradurre un referto di laboratorio straniero o trasformare gli appunti di una visita in un riassunto leggibile. Per l’interpretazione numerica diretta di un pannello con oltre 40 marcatori o per il monitoraggio longitudinale, uno strumento sviluppato appositamente è più sicuro.
In sintesi
Microsoft Copilot è un serio prodotto di IA enterprise con punti di forza legittimi: garanzie di governance reali per i clienti aziendali, un’integrazione pulita con Office, modelli GPT di frontiera che operano secondo condizioni commerciali. Per redigere, riassumere, tradurre e gestire flussi di lavoro è eccellente.
Per il compito specifico di interpretare i Suoi referti, Copilot resta un LLM generico. Eredita ogni limite che abbiamo documentato nella letteratura sugli LLM: allucinazioni sui valori numerici limite, Lost in the Middle sui pannelli lunghi, nessuna logica sistematica tra marcatori, output stocastico a fronte di input identici. Il backend Azure, il contesto di Microsoft Graph e il BAA enterprise non risolvono questi limiti. Affrontano problemi diversi.
Nel team di Wizey costruiamo uno strumento che fa bene esattamente una cosa: trasforma il PDF dei Suoi referti in un’interpretazione strutturata, riproducibile e consapevole dell’andamento longitudinale, circoscritta da percorsi clinici validati. Non sostituisce il Suo medico. È il modo per entrare preparato nella stanza della visita, con le domande giuste già pronte.



