Articolo del blog

Wizey vs Claude: basta la Constitutional AI in medicina?

Con la Constitutional AI, Claude allucina meno, ma basta per interpretare i referti in sicurezza? Esaminiamo allineamento, guardrail e validità clinica.

IA in sanità Analisi & diagnostica Salute & prevenzione
Wizey vs Claude: basta la Constitutional AI in medicina?

Nelle mie cerchie Claude ha la reputazione di essere quello maturo del gruppo tra i grandi modelli linguistici. Rifiuta con più cautela, allucina più di rado e dà risposte più sfumate quando lo si incalza sui compromessi. Come ingegnere che sviluppa prodotti di IA da dieci anni, lo apprezzo – e uso Claude ogni giorno per la revisione del codice, la scrittura e la lettura di documenti lunghi.

Ma un LLM ben educato non è automaticamente uno strumento medico sicuro. In questo articolo voglio esaminare che cosa fa davvero la Constitutional AI, in che cosa Claude migliora concretamente rispetto agli altri chatbot generalisti nelle domande di salute e dove l’architettura resta comunque al di sotto di ciò per cui è progettata un’IA medica specializzata come Wizey. È un articolo tecnico, ma spiegherò ogni termine specialistico in parole semplici.

Che cos’è davvero la Constitutional AI (in parole semplici)

La Constitutional AI, presentata dal team di Anthropic in Bai et al., 2022, è una tecnica di addestramento che utilizza un insieme scritto di principi – una «costituzione» – per allontanare il modello da output dannosi, ingannevoli o inutili. Invece di affidarsi soltanto ad annotatori umani che confrontano coppie di risposte (il classico ciclo RLHF), la Constitutional AI aggiunge un secondo ciclo in cui il modello critica i propri output rispetto alla costituzione e poi li rivede. Anthropic chiama la tecnica che ne risulta RLAIF: apprendimento per rinforzo dal feedback dell’IA.

La costituzione non è un regolamento su medicina o diritto; è un insieme di valori di alto livello come «essere utile, innocuo e onesto», rifiutarsi di fornire aiuto alla violenza, non fingersi umano, mantenere la prudenza in caso di incertezza e così via. Nel corso dell’addestramento il modello interiorizza questi principi. È questo il motivo per cui Claude appare più coerente nei casi limite rispetto ad alcuni concorrenti: il suo «comportamento di rifiuto» e il suo «comportamento di risposta» sono plasmati dagli stessi valori, anziché essere applicati sopra come un filtro separato.

Perché questo aiuta (un po’) nelle conversazioni mediche

Alcune proprietà della Constitutional AI si traducono in vantaggi concreti quando un paziente pone una domanda sulla salute:

  • Incertezza calibrata. Claude è più propenso a dire «non ne sono sicuro» o «dovrebbe verificarlo con un medico», il che in medicina è davvero la risposta giusta più spesso di quanto lo sia nella programmazione o nel marketing.
  • Meno confabulazione dilagante. Quando i modelli non sanno, tendono a ripiegare su una prosa dal suono plausibile. Claude sembra farlo più di rado rispetto ai modelli GPT di base, stando alle valutazioni interne di Anthropic e ai benchmark indipendenti citati nella recente letteratura sul ragionamento medico degli LLM.
  • Migliore ritenzione del contesto lungo nei documenti complessi. Su un referto di consulenza specialistica di 30 pagine, ben leggibile, Claude riesce a rimanere fedele alla fonte meglio di alcuni concorrenti.

Sono vantaggi reali. Se ha intenzione di usare un LLM generalista per riassumere un articolo medico o tradurre un referto anatomopatologico, Claude è una scelta difendibile.

Dove la Constitutional AI smette di bastare

La medicina non è soltanto un ambito critico per la sicurezza; è un ambito in cui la risposta corretta dipende da dati strutturati interpretati alla luce di protocolli clinici validati. La Constitutional AI, per quanto potente, non risolve tre problemi di fondo:

  1. Nessuna estrazione strutturata. Quando Claude legge il Suo PDF, lo legge come testo. Non costruisce una tabella interna dei Suoi 60 marcatori con unità di misura, intervalli di riferimento e riferimenti temporali: elabora una sequenza di token. I valori possono essere letti male (soprattutto ai margini dell’OCR), confusi tra dosaggi diversi o silenziosamente tralasciati nel mezzo di un documento lungo.
  2. Nessun grafo della conoscenza medica fondato. La «conoscenza» di Claude è una traccia statistica del suo corpus di addestramento. Non dispone di alcuna mappa curata che gli indichi, per esempio, che la ferritina è una proteina della fase acuta e va interpretata insieme alla PCR: ha semplicemente letto molto testo che lo afferma e recupera quell’associazione in modo affidabile soltanto una parte delle volte.
  3. Nessun guardrail rigido sul ragionamento numerico. Il ragionamento in forma libera è fluido e convincente, ma non verificato. Quando Claude spiega perché il Suo TSH insieme al T4 libero suggerisce un ipotiroidismo subclinico, il ragionamento può essere corretto, parzialmente corretto o sbagliato con piena sicurezza: dalla sola prosa non può capirlo senza un confronto con una fonte di riferimento.

È lo stesso limite di fondo di cui ho scritto nel confronto di riferimento Wizey vs ChatGPT: un LLM generalista genera, mentre uno specialista estrae, valida e applica. La generazione di Claude è più disciplinata, ma resta pur sempre generazione.

Il problema Lost in the Middle non si cura della Sua costituzione

Anche con l’eccellente prestazione di Claude sui contesti lunghi, il fenomeno Lost in the Middle descritto da Liu et al. (2023) resta valido: gli LLM prestano più attenzione all’inizio e alla fine dell’input che alla parte centrale. In un pannello denso di 40–60 marcatori distribuito su cinque pagine, un valore a metà della terza pagina può essere sì riconosciuto, ma sottopesato nell’interpretazione finale.

L’addestramento con la costituzione non cambia questo: è un artefatto dell’architettura transformer e della codifica posizionale. Anthropic ha ottenuto miglioramenti concreti nelle sue ultime versioni dei modelli, ma nessun benchmark pubblico che io abbia visto mostra l’effetto del tutto eliminato per il recupero di fatti isolati dalla parte centrale del contesto.

Wizey affronta questo aspetto in modo strutturale anziché statistico. La pipeline estrae prima ogni valore in uno schema; l’analisi viene poi eseguita su una tabella di 60 righe anziché su un PDF di 5 pagine. Il Lost in the Middle su una tabella breve e strutturata si comporta in modo molto diverso dal Lost in the Middle sul testo libero.

Privacy e HIPAA: Claude per i consumatori vs Claude Enterprise

È qui che emerge una distinzione reale. L’API di Anthropic e Claude Enterprise supportano i Business Associate Agreement (BAA) previsti dall’HIPAA e possono essere configurati con la Zero Data Retention, il che significa che prompt e risposte non vengono conservati oltre la sessione. È un’opzione legittima per una clinica che sta costruendo uno strumento interno.

Il prodotto per i consumatori su claude.ai nei piani Free e Pro è tutta un’altra storia. In base alle condizioni per i consumatori, le conversazioni possono essere conservate per finalità di revisione della sicurezza e delle policy, e l’account non è coperto da un BAA. Per un paziente che vuole discutere il PDF dei propri esami, è proprio questo il piano che userebbe davvero – e il caricamento di dati sanitari protetti (PHI) in quella sede non rientra nelle tutele enterprise.

Al confronto, Wizey è progettato fin dalle fondamenta per i dati PHI: il livello di estrazione opera all’interno di un perimetro conforme alle normative e l’analisi si fonda su un corpus clinico validato che non esce dal servizio.

Quando ricorro comunque a Claude

Per essere chiari, Claude ha davvero il suo posto nel percorso di un paziente. Personalmente lo uso per:

  • Spiegare che cosa significa un termine medico prima di approfondire.
  • Tradurre un referto di laboratorio dallo spagnolo o dal francese all’inglese, conservando le sfumature cliniche.
  • Riassumere un lungo PDF di una lettera di consulenza specialistica.
  • Preparare domande di approfondimento strutturate per la mia visita dal medico di base.
  • Leggere con occhio critico un articolo su uno studio clinico.

Nessuna di queste attività equivale a «interpretare i miei valori di laboratorio e dirmi che cosa non va». Sono compiti in cui la risposta viene verificata rispetto al mio giudizio o a quello del mio medico, e in cui il compito dell’LLM è un lavoro linguistico, non un’inferenza numerica. Un’analisi analoga per un modello open-weights fortemente orientato al reasoning si trova nel mio confronto Wizey vs DeepSeek R1.

Confronto diretto

AspettoClaude (Anthropic)Wizey
Tipo di modelloLLM generalista (Constitutional AI + RLAIF)Pipeline medica specializzata (OCR → estrazione → grafo della conoscenza → RAG validato)
Estrazione numericaImplicita, tramite lettura del testoDeterministica, strutturata, con unità validate
Fondamento della conoscenza medicaTraccia statistica dei dati di addestramentoGrafo della conoscenza medica curato + protocolli clinici
Profilo di allucinazionePiù basso della maggior parte dei concorrenti, ma non nulloLimitato – rifiuta fuori protocollo anziché inventare
Contesto lungoFino a ~1 milione di token, comunque soggetto al Lost in the MiddleL’analisi viene eseguita su una tabella breve e strutturata, non su un lungo PDF
BAA HIPAADisponibile su API / Enterprise, non per i consumatoriIntegrato per l’uso da parte del paziente
Uso miglioreLettura, scrittura, spiegazione, traduzioneInterpretazione end-to-end dei pannelli di laboratorio, monitoraggio longitudinale

Mini-FAQ

Claude allucina meno di ChatGPT nelle domande mediche? In modo incrementale sì, su molti benchmark, grazie a Constitutional AI e RLAIF. Ma «più di rado» non è «per niente», e la modalità di errore quando si verifica – una risposta sicura, fluida e clinicamente sbagliata – è identica.

Claude è conforme all’HIPAA per il caricamento dei referti? Solo tramite l’API di Anthropic o Claude Enterprise con un BAA in essere. claude.ai per i consumatori non lo è, e la Usage Policy di Anthropic colloca esplicitamente la diagnosi e il trattamento medici in una categoria che richiede la supervisione umana (human-in-the-loop).

Il contesto da 1 milione di token di Claude basta per anni di esami? La finestra è abbastanza ampia, ma il Lost in the Middle continua a peggiorare il recupero dal centro del contesto. Un’estrazione strutturata in una serie temporale è migliore che forzare un lungo PDF dentro il prompt.

Se Claude è più sicuro, perché non usarlo per tutto? Un comportamento di rifiuto più sicuro non equivale alla validità clinica. Wizey è progettato per il compito specifico di trasformare un referto di laboratorio in un’interpretazione clinicamente coerente; Claude è progettato per il lavoro linguistico generale.

A che cosa serve Claude nel percorso di un paziente? Compiti linguistici – spiegare, tradurre, riassumere, formulare domande. Non l’interpretazione numerica di un risultato con più pannelli.

Conclusione

Claude è l’LLM generalista più assennato sul mercato, e la Constitutional AI è un risultato ingegneristico significativo. Per un paziente che vuole capire che cosa significa «anemia microcitica ipocromica» o tradurre una lettera specialistica, è uno strumento davvero valido.

Per il compito più circoscritto e più difficile di trasformare un PDF di laboratorio di più pagine in un’interpretazione strutturata e clinicamente coerente, con intervalli di riferimento verificati, andamenti longitudinali e pattern trasversali tra marcatori segnalati – è per questo che abbiamo costruito Wizey. Se è questo il problema che sta cercando di risolvere, una pipeline specializzata si adatta meglio alla forma del compito. E se desidera uno sguardo più ampio su dove gli LLM generici funzionano e dove falliscono in medicina, l’articolo di riferimento Wizey vs ChatGPT offre l’argomentazione più estesa.

Fonti