Nelle mie cerchie Claude ha la reputazione di essere quello maturo del gruppo tra i grandi modelli linguistici. Rifiuta con più cautela, allucina più di rado e dà risposte più sfumate quando lo si incalza sui compromessi. Come ingegnere che sviluppa prodotti di IA da dieci anni, lo apprezzo – e uso Claude ogni giorno per la revisione del codice, la scrittura e la lettura di documenti lunghi.
Ma un LLM ben educato non è automaticamente uno strumento medico sicuro. In questo articolo voglio esaminare che cosa fa davvero la Constitutional AI, in che cosa Claude migliora concretamente rispetto agli altri chatbot generalisti nelle domande di salute e dove l’architettura resta comunque al di sotto di ciò per cui è progettata un’IA medica specializzata come Wizey. È un articolo tecnico, ma spiegherò ogni termine specialistico in parole semplici.
Che cos’è davvero la Constitutional AI (in parole semplici)
La Constitutional AI, presentata dal team di Anthropic in Bai et al., 2022, è una tecnica di addestramento che utilizza un insieme scritto di principi – una «costituzione» – per allontanare il modello da output dannosi, ingannevoli o inutili. Invece di affidarsi soltanto ad annotatori umani che confrontano coppie di risposte (il classico ciclo RLHF), la Constitutional AI aggiunge un secondo ciclo in cui il modello critica i propri output rispetto alla costituzione e poi li rivede. Anthropic chiama la tecnica che ne risulta RLAIF: apprendimento per rinforzo dal feedback dell’IA.
La costituzione non è un regolamento su medicina o diritto; è un insieme di valori di alto livello come «essere utile, innocuo e onesto», rifiutarsi di fornire aiuto alla violenza, non fingersi umano, mantenere la prudenza in caso di incertezza e così via. Nel corso dell’addestramento il modello interiorizza questi principi. È questo il motivo per cui Claude appare più coerente nei casi limite rispetto ad alcuni concorrenti: il suo «comportamento di rifiuto» e il suo «comportamento di risposta» sono plasmati dagli stessi valori, anziché essere applicati sopra come un filtro separato.
Perché questo aiuta (un po’) nelle conversazioni mediche
Alcune proprietà della Constitutional AI si traducono in vantaggi concreti quando un paziente pone una domanda sulla salute:
- Incertezza calibrata. Claude è più propenso a dire «non ne sono sicuro» o «dovrebbe verificarlo con un medico», il che in medicina è davvero la risposta giusta più spesso di quanto lo sia nella programmazione o nel marketing.
- Meno confabulazione dilagante. Quando i modelli non sanno, tendono a ripiegare su una prosa dal suono plausibile. Claude sembra farlo più di rado rispetto ai modelli GPT di base, stando alle valutazioni interne di Anthropic e ai benchmark indipendenti citati nella recente letteratura sul ragionamento medico degli LLM.
- Migliore ritenzione del contesto lungo nei documenti complessi. Su un referto di consulenza specialistica di 30 pagine, ben leggibile, Claude riesce a rimanere fedele alla fonte meglio di alcuni concorrenti.
Sono vantaggi reali. Se ha intenzione di usare un LLM generalista per riassumere un articolo medico o tradurre un referto anatomopatologico, Claude è una scelta difendibile.
Dove la Constitutional AI smette di bastare
La medicina non è soltanto un ambito critico per la sicurezza; è un ambito in cui la risposta corretta dipende da dati strutturati interpretati alla luce di protocolli clinici validati. La Constitutional AI, per quanto potente, non risolve tre problemi di fondo:
- Nessuna estrazione strutturata. Quando Claude legge il Suo PDF, lo legge come testo. Non costruisce una tabella interna dei Suoi 60 marcatori con unità di misura, intervalli di riferimento e riferimenti temporali: elabora una sequenza di token. I valori possono essere letti male (soprattutto ai margini dell’OCR), confusi tra dosaggi diversi o silenziosamente tralasciati nel mezzo di un documento lungo.
- Nessun grafo della conoscenza medica fondato. La «conoscenza» di Claude è una traccia statistica del suo corpus di addestramento. Non dispone di alcuna mappa curata che gli indichi, per esempio, che la ferritina è una proteina della fase acuta e va interpretata insieme alla PCR: ha semplicemente letto molto testo che lo afferma e recupera quell’associazione in modo affidabile soltanto una parte delle volte.
- Nessun guardrail rigido sul ragionamento numerico. Il ragionamento in forma libera è fluido e convincente, ma non verificato. Quando Claude spiega perché il Suo TSH insieme al T4 libero suggerisce un ipotiroidismo subclinico, il ragionamento può essere corretto, parzialmente corretto o sbagliato con piena sicurezza: dalla sola prosa non può capirlo senza un confronto con una fonte di riferimento.
È lo stesso limite di fondo di cui ho scritto nel confronto di riferimento Wizey vs ChatGPT: un LLM generalista genera, mentre uno specialista estrae, valida e applica. La generazione di Claude è più disciplinata, ma resta pur sempre generazione.
Il problema Lost in the Middle non si cura della Sua costituzione
Anche con l’eccellente prestazione di Claude sui contesti lunghi, il fenomeno Lost in the Middle descritto da Liu et al. (2023) resta valido: gli LLM prestano più attenzione all’inizio e alla fine dell’input che alla parte centrale. In un pannello denso di 40–60 marcatori distribuito su cinque pagine, un valore a metà della terza pagina può essere sì riconosciuto, ma sottopesato nell’interpretazione finale.
L’addestramento con la costituzione non cambia questo: è un artefatto dell’architettura transformer e della codifica posizionale. Anthropic ha ottenuto miglioramenti concreti nelle sue ultime versioni dei modelli, ma nessun benchmark pubblico che io abbia visto mostra l’effetto del tutto eliminato per il recupero di fatti isolati dalla parte centrale del contesto.
Wizey affronta questo aspetto in modo strutturale anziché statistico. La pipeline estrae prima ogni valore in uno schema; l’analisi viene poi eseguita su una tabella di 60 righe anziché su un PDF di 5 pagine. Il Lost in the Middle su una tabella breve e strutturata si comporta in modo molto diverso dal Lost in the Middle sul testo libero.
Privacy e HIPAA: Claude per i consumatori vs Claude Enterprise
È qui che emerge una distinzione reale. L’API di Anthropic e Claude Enterprise supportano i Business Associate Agreement (BAA) previsti dall’HIPAA e possono essere configurati con la Zero Data Retention, il che significa che prompt e risposte non vengono conservati oltre la sessione. È un’opzione legittima per una clinica che sta costruendo uno strumento interno.
Il prodotto per i consumatori su claude.ai nei piani Free e Pro è tutta un’altra storia. In base alle condizioni per i consumatori, le conversazioni possono essere conservate per finalità di revisione della sicurezza e delle policy, e l’account non è coperto da un BAA. Per un paziente che vuole discutere il PDF dei propri esami, è proprio questo il piano che userebbe davvero – e il caricamento di dati sanitari protetti (PHI) in quella sede non rientra nelle tutele enterprise.
Al confronto, Wizey è progettato fin dalle fondamenta per i dati PHI: il livello di estrazione opera all’interno di un perimetro conforme alle normative e l’analisi si fonda su un corpus clinico validato che non esce dal servizio.
Quando ricorro comunque a Claude
Per essere chiari, Claude ha davvero il suo posto nel percorso di un paziente. Personalmente lo uso per:
- Spiegare che cosa significa un termine medico prima di approfondire.
- Tradurre un referto di laboratorio dallo spagnolo o dal francese all’inglese, conservando le sfumature cliniche.
- Riassumere un lungo PDF di una lettera di consulenza specialistica.
- Preparare domande di approfondimento strutturate per la mia visita dal medico di base.
- Leggere con occhio critico un articolo su uno studio clinico.
Nessuna di queste attività equivale a «interpretare i miei valori di laboratorio e dirmi che cosa non va». Sono compiti in cui la risposta viene verificata rispetto al mio giudizio o a quello del mio medico, e in cui il compito dell’LLM è un lavoro linguistico, non un’inferenza numerica. Un’analisi analoga per un modello open-weights fortemente orientato al reasoning si trova nel mio confronto Wizey vs DeepSeek R1.
Confronto diretto
| Aspetto | Claude (Anthropic) | Wizey |
|---|---|---|
| Tipo di modello | LLM generalista (Constitutional AI + RLAIF) | Pipeline medica specializzata (OCR → estrazione → grafo della conoscenza → RAG validato) |
| Estrazione numerica | Implicita, tramite lettura del testo | Deterministica, strutturata, con unità validate |
| Fondamento della conoscenza medica | Traccia statistica dei dati di addestramento | Grafo della conoscenza medica curato + protocolli clinici |
| Profilo di allucinazione | Più basso della maggior parte dei concorrenti, ma non nullo | Limitato – rifiuta fuori protocollo anziché inventare |
| Contesto lungo | Fino a ~1 milione di token, comunque soggetto al Lost in the Middle | L’analisi viene eseguita su una tabella breve e strutturata, non su un lungo PDF |
| BAA HIPAA | Disponibile su API / Enterprise, non per i consumatori | Integrato per l’uso da parte del paziente |
| Uso migliore | Lettura, scrittura, spiegazione, traduzione | Interpretazione end-to-end dei pannelli di laboratorio, monitoraggio longitudinale |
Mini-FAQ
Claude allucina meno di ChatGPT nelle domande mediche? In modo incrementale sì, su molti benchmark, grazie a Constitutional AI e RLAIF. Ma «più di rado» non è «per niente», e la modalità di errore quando si verifica – una risposta sicura, fluida e clinicamente sbagliata – è identica.
Claude è conforme all’HIPAA per il caricamento dei referti? Solo tramite l’API di Anthropic o Claude Enterprise con un BAA in essere. claude.ai per i consumatori non lo è, e la Usage Policy di Anthropic colloca esplicitamente la diagnosi e il trattamento medici in una categoria che richiede la supervisione umana (human-in-the-loop).
Il contesto da 1 milione di token di Claude basta per anni di esami? La finestra è abbastanza ampia, ma il Lost in the Middle continua a peggiorare il recupero dal centro del contesto. Un’estrazione strutturata in una serie temporale è migliore che forzare un lungo PDF dentro il prompt.
Se Claude è più sicuro, perché non usarlo per tutto? Un comportamento di rifiuto più sicuro non equivale alla validità clinica. Wizey è progettato per il compito specifico di trasformare un referto di laboratorio in un’interpretazione clinicamente coerente; Claude è progettato per il lavoro linguistico generale.
A che cosa serve Claude nel percorso di un paziente? Compiti linguistici – spiegare, tradurre, riassumere, formulare domande. Non l’interpretazione numerica di un risultato con più pannelli.
Conclusione
Claude è l’LLM generalista più assennato sul mercato, e la Constitutional AI è un risultato ingegneristico significativo. Per un paziente che vuole capire che cosa significa «anemia microcitica ipocromica» o tradurre una lettera specialistica, è uno strumento davvero valido.
Per il compito più circoscritto e più difficile di trasformare un PDF di laboratorio di più pagine in un’interpretazione strutturata e clinicamente coerente, con intervalli di riferimento verificati, andamenti longitudinali e pattern trasversali tra marcatori segnalati – è per questo che abbiamo costruito Wizey. Se è questo il problema che sta cercando di risolvere, una pipeline specializzata si adatta meglio alla forma del compito. E se desidera uno sguardo più ampio su dove gli LLM generici funzionano e dove falliscono in medicina, l’articolo di riferimento Wizey vs ChatGPT offre l’argomentazione più estesa.



