Blog-Artikel

Wizey vs. ChatGPT: fünf klinische Fälle im Vergleich

Fünf Fälle: identische Laborwerte in ChatGPT und eine spezialisierte medizinische KI. Diagnose 5/5 gleich – alles danach ging auseinander. Wörtlich.

KI im Gesundheitswesen Analysen & Diagnostik Gesundheit & Prävention
Wizey vs. ChatGPT: fünf klinische Fälle im Vergleich

Wir gaben fünf klinische Fälle in ChatGPT und in Wizey ein – die beiden KI-Tools, die ein Patient heute am ehesten öffnet, wenn er einen Laborbefund verstehen will – und baten beide, dieselben Laborwerte zu interpretieren. Beide KIs kamen zur selben Diagnose. Was danach geschah, war unerwartet – und es verändert die Frage, die man an diese Technologie stellen sollte.

Zwei Antworten für dieselbe Person

Fünfundvierzigjähriger Mann. Ein Satz Laborwerte. Ein kurzer Prompt: „bitte meine Laborwerte interpretieren“. Zwei Dienste. Das kam zurück – wörtlich.

ChatGPT: Tun Sie drei Dinge, und die meisten Werte normalisieren sich. 1) Nehmen Sie 8–12 kg ab. 2) Alkohol: derzeit fast jeden Abend. Für Leber und Insulin ist das kritisch. 3) Körperliche Aktivität: mindestens 8.000–10.000 Schritte pro Tag plus Krafttraining dreimal pro Woche.

Wizey, die spezialisierte medizinische KI: Endokrinologe – zur Behandlung von Prädiabetes und Insulinresistenz und zur Besprechung einer Testosteronersatztherapie. Kardiologe oder Internist – zur Einschätzung des Herz-Kreislauf-Risikos. Gastroenterologe oder Hepatologe – zur Bestätigung einer Fettlebererkrankung. Schlafmediziner oder HNO-Arzt – zur Abklärung einer Schlafapnoe. Urologe-Androloge – zur genaueren Abklärung der sexuellen Funktionsstörung. PSA-Test – erforderlich vor jeder Besprechung einer Testosterontherapie (Standard-Screening bei Männern ab 45).

Eine Person, ein Satz Laborwerte. Beide KIs lasen das Bild korrekt – metabolisches Syndrom, Insulinresistenz, funktioneller Hypogonadismus, vermutete Schlafapnoe, Vitamin-D- und Zinkmangel. Die Diagnose stimmte überein. Auseinander ging, was dieser Mann in den nächsten zwei Wochen tatsächlich tun sollte.

Wir sind das Team hinter Wizey. Zu Beginn dieses Experiments lautete unsere Arbeitshypothese, dass ChatGPT die Diagnose verfehlen würde. In fünf Fällen lag es kein einziges Mal daneben. Der eigentliche Befund war ein anderer: Eine korrekte primäre Diagnose ist nicht dasselbe, wie dem Patienten zu helfen. Über fünf Fälle hinweg zeigen wir, wo die eigentliche Trennlinie verläuft – und wir nennen den einen Fall, in dem ChatGPT uns fachlich geschlagen hat.

Wie wir getestet haben

  • Wir stellten fünf klinische Panels zusammen, rekonstruiert aus real publizierten Fällen (PubMed, Blood, Annals of Family Medicine) – wobei jede klinisch bedeutsame Auffälligkeit und jedes Symptom erhalten blieb.
  • Wir luden dasselbe Panel in beide Dienste: ChatGPT (Plus-Tarif, GPT-5.4) und Wizey, eine spezialisierte medizinische KI.
  • Für ChatGPT tippten wir einen kurzen Prompt: „bitte meine Laborwerte interpretieren“. Keine Rückfragen, kein Prompt-Engineering. Ziel war es, nachzuahmen, was ein normaler Patient mit einem Ausdruck in der Hand tut.
  • Alle Ausgaben wurden wörtlich erfasst. Direkte Zitate in diesem Artikel sind unbearbeitet; Stellen, die wir aus Platzgründen gekürzt haben, sind mit Auslassungspunkten markiert.
  • Vier Fälle sind routinemäßige ambulante Szenarien; ein Bonusfall ist dringlich und wurde gezielt aufgenommen, um das Triage-Verhalten zu testen.

Anmerkung zum Umfang

Fünf Fälle sind die Veranschaulichung eines Musters, keine Statistik. Wir sahen in jedem der fünf Fälle dasselbe Bild, aber wir stellen das nicht als randomisierte Studie mit tausend Durchläufen dar.

Wir sind das Wizey-Team – der Interessenkonflikt liegt auf der Hand. Um ihn teilweise auszugleichen: Die Methodik stand vor den Durchläufen fest, alle Ausgaben sind wörtlich zitiert, und wo immer ChatGPT uns geschlagen hat, sagen wir es klar. Die Quellpublikationen, aus denen jedes Panel rekonstruiert wurde, sind im Text genannt, sodass jeder das Experiment reproduzieren kann.

Alle Tests wurden an einem einzigen Tag durchgeführt, am 17. April 2026.

Was die begutachtete Fachliteratur sagt

Für alle, die vor den Fallbeispielen die Zahlen sehen möchten: Das berichtet die begutachtete Fachliteratur über ChatGPT bei der Laborinterpretation:

  • Cabral et al., PLOS ONE 2024: Bei spezialisierten labormedizinischen Fragen interpretiert ChatGPT in etwa 51 % der Fälle korrekt, und 17 % der Antworten sind schlicht falsch.
  • Nature Communications Medicine, 2025: Wird ein falscher medizinischer Wert unbemerkt in den Prompt-Kontext eingefügt, „beharren“ LLMs in 83 % der Fälle darauf – das heißt, sie übernehmen den falschen Wert und bauen ihre Argumentation darauf auf, ohne den Widerspruch je zu benennen.
  • Nature Scientific Reports, 2025: Bei gemischten Säure-Basen-Störungen liefert ChatGPT in 16,7 % der Fälle ein fälschlich beruhigendes Urteil „normal“; Intensivmediziner zeigen bei denselben Fällen eine Rate falscher Entwarnung von 0 %.

Die Zahlen sind, gelinde gesagt, alarmierend. Doch es gibt einen Haken. In unserem Test mit fünf Fällen lieferte ChatGPT zuverlässig die korrekte primäre Diagnose – selbst in den Fällen, in denen wir ein Straucheln erwartet hatten: subklinische Hypothyreose, MGUS (monoklonale Gammopathie unklarer Signifikanz), statininduzierte Rhabdomyolyse, der perimenopausale Übergang, metabolisches Syndrom mit funktionellem Hypogonadismus. Fünf von fünf.

Das ist der eigentliche Dreh- und Angelpunkt dieses Experiments. Der Unterschied ist nicht „richtig oder falsch“, wie man es gern darstellt. Der Unterschied liegt in dem, was nach der korrekten Diagnose kommt. Diese Ebene nehmen wir uns als Nächstes vor.

Fünf Fälle im Experiment: 45-jähriger Mann (metabolisches Syndrom), 52-jährige Frau (subklinische Hypothyreose), 50-jährige Frau (Perimenopause), 68-jähriger Mann (monoklonale Gammopathie), 52-jähriger Mann (Rhabdomyolyse)
Fünf Fälle im Experiment. Wir gehen jeden einzelnen durch – vom 45-jährigen Ingenieur bis zum dringlichen Rhabdomyolyse-Fall.

Fall 1: Fünfundvierzig, der Müdigkeit müde

45-jähriger Ingenieur. Sitzende Tätigkeit, ein Großprojekt unter Termindruck, chronischer Stress. Beschwerden: anhaltende Müdigkeit, die auch ein freies Wochenende nicht behebt, nachlassende Libido, Gewichtszunahme, Schnarchen, morgendliche Kopfschmerzen, Reflux zwei- bis dreimal pro Woche, Knieschmerzen. Alkohol: ein bis zwei Gläser Wein fast jeden Abend, dazu Spirituosen am Wochenende. Familienanamnese: Vater hat Typ-2-Diabetes, Mutter hat Bluthochdruck. Der klassische Mann mittleren Alters nach dem Motto „Jetzt lasse ich endlich mal Blut abnehmen“.

Wichtigste Auffälligkeiten im Panel. HbA1c 5,9 %. HOMA-IR (Insulinresistenz-Index) 4,9, fast das Doppelte des oberen Grenzwerts von <2,5. Triglyceride 2,4 mmol/L, LDL 3,6, HDL 0,95, ApoB 1,35, atherogener Index 5,1. ALT 58 U/L, GGT 78 – ein Muster der nicht-alkoholischen Fettlebererkrankung (NAFLD). Freies Testosteron 220 pmol/L, unterhalb des Normbereichs. Vitamin D 18 ng/mL, Zink 9,4 µmol/L, Vitamin B12 260 pmol/L, Homocystein 11,8. hs-CRP 4,8 mg/L, Harnsäure 468 µmol/L, Cortisol 580 nmol/L. Bauchumfang 104 cm (normal <94).

Gleichstand bei der Diagnose. Beide KIs erstellten dieselbe Liste: metabolisches Syndrom, Insulinresistenz, Prädiabetes, atherogene Dyslipidämie, NAFLD, funktioneller Hypogonadismus, Vitamin-D- und Zinkmangel, chronische niedriggradige Entzündung, Hyperurikämie, vermutete obstruktive Schlafapnoe, hochnormales Cortisol. ChatGPT übersah keinen Teil des klinischen Bildes. Es fügte jeden Datenpunkt gewissenhaft zusammen.

Nun – wo die beiden auseinandergingen.

Weiterleitung an Fachärzte. ChatGPT nannte keinen einzigen konkreten Facharzt. Der Block „Wohin gehen“ bestand aus „Notaufnahme“ (der Rhabdomyolyse vorbehalten, nicht diesem Fall) und Formulierungen wie „wird üblicherweise verordnet“ oder „besprechen Sie das mit Ihrem Arzt“. Wizey führte fünf Fachärzte mit ihren jeweiligen Zuständigkeiten auf:

Endokrinologe – zur Behandlung von Prädiabetes und Insulinresistenz, zur Prüfung, ob eine medikamentöse Korrektur von Lipiden und Glukose nötig ist, und zur Besprechung einer Testosteronersatztherapie, falls Änderungen des Lebensstils nicht ausreichen. Kardiologe oder Internist – zur Einschätzung des Herz-Kreislauf-Risikos. Gastroenterologe oder Hepatologe – zur Bestätigung einer Fettlebererkrankung. Schlafmediziner oder HNO-Arzt – zur Abklärung einer Schlafapnoe. Urologe-Androloge – zur genaueren Abklärung der sexuellen Funktionsstörung.

Wizey

In den meisten Gesundheitssystemen ist es unrealistisch, fünf Fachärzte in zwei Wochen zu sehen – der Weg über den Hausarzt als Gatekeeper ist realistischer, und selbst mit privater Versicherung dauert es einen Monat, fünf Termine zu koordinieren. Aber immerhin weiß der Patient, zu wem er geht und warum. „Besprechen Sie das mit Ihrem Arzt“ ist eine Nicht-Antwort, wenn die üblichen Wartezeiten in der Endokrinologie Wochen bis Monate betragen; der Patient öffnet einfach den nächsten KI-Chat. Oder schlimmer – er beginnt mit der Selbstbehandlung. Oder verliert schlicht wertvolle Zeit.

Die Sicherheitsebene – das größte Versäumnis. ChatGPT wies auf das niedrige freie Testosteron hin und erklärte die Ursachen. Da hörte es auf. Wizey fügte dies als eigenen Punkt ein:

PSA-Test (prostataspezifisches Antigen) – erforderlich vor jeder Besprechung einer Testosterontherapie. Standard-Screening bei Männern ab 45.

Wizey

Das ist keine Kleinigkeit. Eine Testosteronersatztherapie (TRT) bei nicht diagnostiziertem Prostatakrebs kann die Tumorprogression beschleunigen – ein PSA-Screening vor Beginn einer TRT ist in den meisten einschlägigen Leitlinien festgeschrieben (Endocrine Society, AUA und andere). Ein 45-Jähriger, der die Ausgabe von ChatGPT liest und sich ohne PSA-Wert in einer Boutique-Klinik eine TRT besorgt, ist ein klinischer Fehler mit Ansage. Die Leitlinie der Endocrine Society zur Testosterontherapie ist in diesem Punkt unmissverständlich.

Quantitative Zielwerte. ChatGPT: „Vitamin D3 4.000–5.000 IE, Magnesium 300–400 mg, Zink 20–30 mg, Omega-3 2–3 g, B-Komplex.“ Wizey zur selben Frage:

Vitamin D – bei einem Serumspiegel von 18 ng/mL sind typische Dosierungen 2.000–5.000 IE/Tag, um einen Zielbereich von 40–60 ng/mL zu erreichen. Kontrolle in 2–3 Monaten. Zink – 15–30 mg als Picolinat oder Citrat. Magnesium 300–400 mg als Citrat oder Glycinat. Omega-3 (EPA+DHA) 1.000–2.000 mg. Berberin oder Inositol – mit Ihrem Endokrinologen besprechen.

Wizey

Der Unterschied ist „wie viel nehme ich heute“ gegenüber „welchen Spiegel soll ich erreichen, welche Form wähle ich, wann kontrolliere ich nach“. Bei der ersten Variante nimmt der Patient Vitamin D und hat keine Ahnung, ob es wirkt. Bei der zweiten gibt es einen Kontrollpunkt.

Die mechanistische Kaskade. ChatGPT lieferte Tabellen und Aufzählungen: hier die Glukose, hier das Insulin, hier das LDL. Wizey legte acht nummerierte kausale Zusammenhänge dar:

1) Viszerales Fett ist nicht nur Speicher – es ist ein endokrin aktives Gewebe. Es setzt Entzündungssignale frei, senkt die Insulinsensitivität und wandelt Testosteron in Östradiol um. 2) Insulinresistenz → die Bauchspeicheldrüse produziert mehr Insulin → Insulin stimuliert die Synthese von Triglyceriden und LDL in der Leber → Dyslipidämie. 3) Hohes Cortisol → verschlechtert die Insulinresistenz und unterdrückt das Testosteron. 4) Täglicher Alkohol → erhöht Triglyceride und GGT, stört den Schlaf. 5) Vitamin-D- und Zinkmangel → verminderte Testosteronsynthese. 6) Niedriges freies Testosteron → Verlust an Muskelmasse → langsamerer Stoffwechsel. 7) Schnarchen plus morgendliche Kopfschmerzen → Apnoe → Schlaffragmentierung → Cortisol + Insulinresistenz. 8) Familienanamnese – genetischer Hintergrund.

Wizey

Acht Zusammenhänge des metabolischen Syndroms: Viszerales Fett, täglicher Alkohol, vermutete Apnoe und Familienanamnese münden über Entzündung, Insulinresistenz und hohes Cortisol in Dyslipidämie, niedriges Testosteron und Prädiabetes
Acht Zusammenhänge in einem Körper. Was eine Ärztin oder ein Arzt im Kopf behält – und ein Patient meist nicht.

Das ist die mentale Landkarte, die eine gute Ärztin oder ein guter Arzt im Kopf hat. Mit ihr ist der Patient nicht länger nur Passagier im eigenen Körper: Gewichtsabnahme, der Verzicht auf den abendlichen Wein und die CPAP-Nutzung bei Apnoe sind nicht länger drei zusammenhanglose Handlungen – sie sind Teile eines einzigen Systems.

Emotionale Einordnung und Prognose. ChatGPT blieb bei neutralen klinischen Aussagen. Wizey fügte eine kurze, aber wichtige Einordnung hinzu:

Gute Nachricht: Die meisten Ihrer Probleme sind umkehrbar… Wenn Sie jetzt handeln, ist die Prognose ausgezeichnet – alles lässt sich umkehren. Ihre Situation ist typisch für einen modernen Mann mittleren Alters. Wichtig ist, dass Sie es rechtzeitig bemerkt haben. Viele kommen erst, wenn sie bereits Diabetiker sind oder nach einem Herzinfarkt.

Wizey

Das ist keine Therapie. Es ist prognostische Information – „jetzt zu handeln zählt, es ist nicht zu spät“ – plus Orientierung: „Ihr Fall ist nicht ungewöhnlich“. Für einen 45-Jährigen, der auf ein Panel mit zwanzig auffälligen Werten starrt, ist der Unterschied zwischen einer emotionslosen Diagnose und einer Diagnose plus der Anerkennung, dass Erholung noch möglich ist, psychologisch bedeutsam.

Wo ChatGPT gewonnen hat. Lp(a) – bei einer Familienanamnese mit koronarer Herzkrankheit ist das ein wichtiger kardialer Marker, den wir nicht erwähnt haben. Die verdichtete Formel „drei Dinge zu tun“ (Gewicht, Alkohol, Bewegung) ist einprägsam und motivierend. Karotis-Ultraschall als Atherosklerose-Screening. Echte Punkte für ChatGPT in diesem Fall.

Fazit des Falls. Gleichstand bei der Diagnose. Unterschied bei „Was tut dieser Mann in den nächsten 14 Tagen tatsächlich?“ ChatGPT lieferte eine motivierende Formel aus drei Handlungen. Wizey lieferte fünf Fachärzte mit konkreten Zuständigkeiten, die Sicherheitsschranke „PSA vor TRT“, quantitative Zielwerte mit Kontrollintervallen, eine mechanistische Kaskade, eine Prognose und die Beruhigung, dass der Patient rechtzeitig dran war.

Eine korrekte primäre Diagnose ist null Minuten echte Hilfe, wenn danach kein Überweisungspfad, keine Sicherheitsprüfung, keine Zielwerte und keine „Sie sind rechtzeitig dran“-Einordnung folgen.

Sieben Unterschiede zwischen den Diensten

Keine Statistik über hundert Fälle – ein beobachtbares Muster über fünf Fälle, in jedem wiederholt. Wir verglichen die Ausgaben Zeile für Zeile anhand von sieben Parametern.

Tabelle mit sieben Parametern zum Vergleich von ChatGPT und einer spezialisierten medizinischen KI: Diagnose, Weiterleitung, Sicherheit, quantitative Zielwerte, Prognose und Einordnung, mechanistische Kaskaden und Testspezifität
Die Diagnose stimmt 5/5. Alles, was danach kommt – Weiterleitung, Sicherheit, Zielwerte, Einordnung, Mechanismus, Testspezifität – geht auseinander.

Die Tabelle ist keine Aussage, dass „ChatGPT verliert“. Sie ist eine Karte, die zeigt, wo die beiden Dienste auseinandergehen. Bei der schnellen Frage „was bedeutet das überhaupt“ ist ChatGPT schnell und gut. Beim Handlungsplan vor dem Arztbesuch schwächelt es systematisch. Das ist kein Fehler: GPT wurde mit heterogenen Internettexten trainiert, nicht mit klinischen Algorithmen zum Patientenmanagement.

Wo ChatGPT uns geschlagen hat – ehrlich gesagt

Wir ließen den MGUS-Fall (monoklonale Gammopathie unklarer Signifikanz) durch beide Dienste laufen – und hier gewann ChatGPT fachlich. Wir hatten in unserer Methodik versprochen, unsere Fehler klar zu benennen. Dies ist einer davon.

68-jähriger Mann. Beschwerden – allgemeine Schwäche seit sechs Monaten und zeitweise Rückenschmerzen. Nimmt Perindopril und Atorvastatin 10 mg. Panel nahezu normal bis auf drei Befunde: Gesamteiweiß 92 g/L (erhöht; normal 64–83), Albumin 38 (normal), BSG 38 mm/h (mehr als das Doppelte des oberen Grenzwerts). Alter 68 + sechs Monate Schwäche + Rückenschmerzen + erhöhtes Gesamteiweiß + erhöhte BSG = die klassische „Red-Flag“-Trias für eine monoklonale Gammopathie oder ein multiples Myelom. Das muss im Screening erkannt werden.

Was ChatGPT besser gemacht hat. Es berechnete ausdrücklich den Albumin/Globulin-Quotienten: Gesamteiweiß 92, Albumin 38 → Globuline 54, Quotient 0,70 (normal >1,0). Schlussfolgerung: erhöhte Globuline. Von dort nannte es eine konkrete Differentialdiagnose:

Drei Warnzeichen: BSG 38, Gesamteiweiß 92 und das Symptommuster (Schwäche plus Rückenschmerzen). Diese Kombination erfordert klassischerweise den Ausschluss eines multiplen Myeloms… Kann auch hindeuten auf: chronische Entzündung, Infektion, rheumatologische Erkrankung, MGUS.

ChatGPT

Und es lieferte eine konkrete Abklärung: Serumeiweißelektrophorese + Immunfixation + freie Leichtketten (FLC) + Bence-Jones-Protein im Urin + Röntgen/MRT der Wirbelsäule + Knochen-CT. Das ist eine echte klinische Checkliste – genau das, was ein Hämatologe anordnen würde. Es ist der Unterschied zwischen „Abklärung einer MGUS“ und „Abklärung einer unklaren BSG“. Laut aktueller NEJM-AI-Berichterstattung zu GPT-4 bei klinischen Fällen sind hämatologiespezifische Differentialdiagnose-Listen ein Bereich, in dem Spitzenmodelle merklich besser geworden sind.

Vier Stellen, an denen ChatGPT stärker war als Wizey: kardialer Marker Lp(a), spezifische Bestätigungstests für MGUS, verdichtete Drei-Handlungs-Formel und Karotis-Ultraschall als Atherosklerose-Screening
Vier Stellen, an denen ChatGPT stärker war. Ausgeschrieben, damit der Artikel nicht zur Werbung wird.

Was Wizey übersehen hat. Wir berechneten den A/G-Quotienten nicht ausdrücklich. Wir erwähnten monoklonale Gammopathien als Möglichkeit, nannten aber nicht die spezifischen Bestätigungstests – FLC, Immunfixation, Bence-Jones. Das ist eine echte Produktlücke, keine Feinheit der Interpretation. Das Team sieht das. Es wird daran gearbeitet.

Was Wizey dennoch geliefert hat. Trotz des übersehenen Testpanels war die Ausgabe nicht leer. Sie enthielt etwas, das ChatGPT nicht hatte:

Bereiten Sie sich auf Ihren Termin vor: Notieren Sie, wann die Schwäche begann, wie oft und wo genau Ihr Rücken schmerzt, ob Sie Fieber, Nachtschweiß oder ungewollten Gewichtsverlust hatten.

Wizey

Diese Liste – Fieber, Nachtschweiß, Gewichtsverlust – ist das klassische Screening auf „B-Symptome“ bei Lymphom und Myelom. Ein Patient, der in der Praxis eines Hämatologen mit einer zweizeiligen Notiz erscheint – „drei Episoden Nachtschweiß in sechs Monaten, etwa 3 kg ungewollter Gewichtsverlust“ –, erspart der Ärztin oder dem Arzt zwanzig Minuten Anamnese und verbessert die Qualität der Konsultation.

Wizey machte außerdem eine metakognitive Anmerkung („die Referenzbereiche waren auf Ihrem Befund nicht angegeben – ich habe international anerkannte Normwerte verwendet“), gab ein präziseres Dringlichkeitsfenster an („1–2 Wochen“ statt „in den kommenden Wochen“ bei ChatGPT) und kommentierte kurz die aktuelle Medikation.

Redaktionelles Fazit. Das ist kein Sieg/Niederlage – es sind zwei verschiedene Arbeitsweisen. ChatGPT verhielt sich wie eine ärztliche Checkliste in Patientenhand: eine Liste von Tests, die man zum Arzt mitbringt. Wizey verhielt sich wie eine Vorbereitung auf den Arztbesuch: B-Symptome, klarere Formulierung der Beschwerden, ein präzises Dringlichkeitsfenster.

Beide Modi sind legitim. Die spezifischen MGUS-Tests zu übersehen, ist ein Punkt, an dem wir uns selbst kritisieren. Aber wenn der Patient beim Hämatologen mit der Notiz von Wizey erscheint und der Hämatologe FLC, Immunfixation und Bence-Jones selbst anordnet (was seine Aufgabe ist), sind die bei der B-Symptom-Anamnese eingesparten zwanzig Minuten viel wert.

Zwei weitere Fälle, dasselbe Muster

Subklinische Hypothyreose – Zweiundfünfzigjährige Frau

Sie kam mit Müdigkeit, Gewichtszunahme und trockener Haut. TSH 6,8 mIU/L (erhöht; normal 0,4–4,0), freies T4 und T3 im Normbereich. Gesamtcholesterin 6,8 mmol/L, LDL 4,3. Beide KIs landeten korrekt bei subklinischer Hypothyreose plus Dyslipidämie. Die primäre Diagnose stimmte erneut überein.

Sie gingen in einem einzigen Satz auseinander. ChatGPT:

Aktuelle Leitlinien empfehlen üblicherweise einen Therapiebeginn, wenn: TSH >6–7, Symptome vorhanden, Alter <65. Sie erfüllen alle Kriterien. Levothyroxin wird in der Regel in niedriger Anfangsdosis verordnet.

ChatGPT

Oberflächlich vernünftig. Inhaltlich ist es eine Vereinfachung mit potenziell schädlichen Folgen. Die Leitlinien der American Thyroid Association und der European Thyroid Association für TSH im Bereich 4–10 mIU/L sagen tatsächlich das Gegenteil: Die Entscheidung wird individuell getroffen. Wizey hat das erfasst:

Die Entscheidung für einen Therapiebeginn wird individuell getroffen: TSH über 10 mIU/L rechtfertigt in der Regel eine Therapie; TSH im Bereich 4–10 mIU/L (wie bei Ihnen) hängt von den Symptomen, dem Vorliegen von Schilddrüsen-Antikörpern, Begleiterkrankungen und dem Verlauf über die Zeit ab.

Wizey

Und es lieferte eine Abfolge, die ChatGPT ausgelassen hatte:

Wiederholen Sie das Lipidprofil in der Kontrolle – nachdem die Schilddrüsenfunktion korrigiert ist, normalisiert sich das Cholesterin oft von selbst.

Wizey

Das ist das entscheidende Detail. Wenn eine Frau mit TSH 6,8 und Cholesterin 6,8 gleichzeitig mit Levothyroxin und einem Statin beginnt, nimmt sie drei Monate später womöglich ein Statin, das sie nicht braucht: Eine Schilddrüsenunterfunktion allein erhöht das Cholesterin. Wizey ergänzte eine ausdrückliche Weiterleitung (Endokrinologe), eine erneute Kontrolle von TSH und freiem T4 in 2–3 Monaten und ein Dringlichkeitsfenster von „2–4 Wochen“.

Fazit des Falls: Beide liegen bei der Diagnose richtig. Das eine drängt in Richtung Übertherapie und ein unnötiges Statin. Das andere baut eine Abfolge auf.

Dasselbe Muster zeigt sich im nächsten Fall, zu einem anderen Thema – und der Preis der Vereinfachung steigt weiter.

Perimenopause – Fünfzigjährige Frau

Patientin: Hitzewallungen, Nachtschweiß, Schlaflosigkeit, nachlassende Libido, geistige Benommenheit („Brain Fog“). Familienanamnese – Osteoporose bei der Mutter, koronare Herzkrankheit beim Vater. Panel: FSH 42 IU/L, Östradiol 45 pmol/L (niedrig), Progesteron 1,2 nmol/L, anti-TPO 68 IU/mL (frühe Hashimoto-Thyreoiditis), Vitamin D 22 ng/mL, Ferritin 32 µg/L, PTH 68 pg/mL, LDL 3,9 mmol/L. Beide KIs landeten bei: perimenopausaler Übergang + frühe Autoimmunthyreoiditis + Vitamin-D-Mangel + latenter Eisenmangel + postmenopausale Dyslipidämie.

Sie gingen bei der menopausalen Hormontherapie (MHT; die ältere Bezeichnung ist HRT, Hormonersatztherapie – heute wird MHT bevorzugt) auseinander. ChatGPT:

Menopausale Hormontherapie. Sehr wahrscheinlich indiziert. Sie reduziert Hitzewallungen, verbessert den Schlaf, schützt die Knochen, verbessert die Blutfette. Wird nach Abklärung von einem Gynäkologen eingeleitet.

ChatGPT

Wizey öffnete dasselbe Thema zu einem Entscheidungsrahmen:

Angesichts Ihres Alters (50), des Fehlens von Kontraindikationen und der ausgeprägten Symptome befinden Sie sich im „Zeitfenster der Gelegenheit“ für den Beginn einer MHT. Ein MHT-Beginn innerhalb der ersten 10 Jahre nach der letzten Menstruation (Sie liegen in diesem Fenster) ist mit dem größten Nutzen verbunden: 80–90 % Reduktion der Hitzewallungen, besserer Schlaf, bessere Stimmung, bessere Libido, Schutz von Knochen und Herz-Kreislauf-System, Vorbeugung einer urogenitalen Atrophie.

Wizey

Entscheidend ist nicht nur die Zahl „80–90 %“ – es ist die Sicherheitsschranke, die ChatGPT ausgelassen hat:

Ultraschall des kleinen Beckens und Mammografie – um Ihre Vorsorge auf den aktuellen Stand zu bringen (die letzte Mammografie war vor zwei Jahren, die Zytologie vor drei Jahren). Vor Beginn einer MHT müssen Kontraindikationen ausgeschlossen werden.

Wizey

In weiten Teilen der westlichen Patientenkultur werden MHT-Gespräche entweder vermieden oder von veralteten Brustkrebsängsten aus der WHI-Ära bestimmt. Ein Entscheidungsrahmen mit einem klaren Zeitfenster, einer quantifizierten Effektstärke und der vorausgesetzten Abklärung ist selten – besonders für eine Frau, deren Gynäkologe sagte: „Tja, das ist Ihr Alter, damit müssen Sie leben.“ Wizey fügte zudem eine kurze emotionale Einordnung hinzu, ohne zu übertreiben:

Ihre Symptome sind nicht „einfach nur das Alter“ und nichts, das Sie hinnehmen müssen. Das ist eine behandelbare Erkrankung.

Wizey

Bei den quantitativen Zielwerten dasselbe Muster wie beim 45-jährigen Mann. ChatGPT: „Vitamin D 2.000–4.000 IE.“ Wizey: Ziel Vitamin D 40–60 ng/mL, Ferritin 50–100, elementares Eisen 40–80 mg morgens auf nüchternen Magen mit Vitamin C, Calcium 1.200–1.500 mg, Eiweiß 1,0–1,2 g/kg Körpergewicht. Der Unterschied ist nicht die Dosierung – es ist, dass die Patientin nun eine Checkliste hat, an der sie sich orientieren kann, und nicht nur einen allgemeinen Vorschlag.

Fazit des Falls: Das MHT-Gespräch ist ein Minenfeld aus veralteten Informationen. Ein vollständiger Entscheidungsrahmen ist hier kein Bonus – er ist das Grundniveau der Patientenunterstützung.

Und ein dringlicher Fall?

In den vier ambulanten Fällen lag der Hauptunterschied bei Weiterleitung, Sicherheit und Zielwerten. Doch es gibt eine weitere Dimension, die man in Routineszenarien nicht sieht – die Triage. Ein Patient in kritischem Zustand sollte den Rettungsdienst rufen, nicht eine KI öffnen. In der Praxis öffnet er trotzdem die KI. Wir ließen einen dringlichen Fall laufen, um zu sehen, wie beide Dienste damit umgehen.

52-jähriger Mann. Seit 8 Jahren Atorvastatin 40 mg wegen Hypercholesterinämie, dazu ein mit Metformin eingestellter Typ-2-Diabetes. Beschwerden: schwere proximale Muskelschwäche (kann die Arme nicht heben, keine Treppen steigen), Schmerzen in Schultern und Hüften, seit fünf Tagen dunkler Urin. Panel: CK 23.171 U/L (normal 30–200 – mehr als 115-fach erhöht), AST 3.851, ALT 594, Serummyoglobin 3.200, Myoglobinurie positiv, Kreatinin 188 µmol/L, eGFR 38 mL/min/1,73 m², Kalium 5,3 mmol/L.

Beide lagen richtig. Diagnose: statininduzierte Rhabdomyolyse mit akuter Nierenschädigung. Ätiologie auf Atorvastatin zurückgeführt. Empfehlung: stationäre Aufnahme. Beide erwähnten anti-HMGCR (HMG-CoA-Reduktase-Antikörper) und anti-SRP – Marker einer statinassoziierten immunvermittelten nekrotisierenden Myopathie (IMNM).

Darüber hinaus unterschieden sie sich in drei Punkten.

Triage – die erste Zeile der Antwort. ChatGPT gliederte seine Antwort in 12 Blöcke: Werte, Symptome, Ursachen, Behandlung. Der Satz „gehen Sie sofort ins Krankenhaus“ tauchte im neunten von zwölf Blöcken auf – nach einer langen Textwand. Wizey eröffnete denselben Fall anders:

Kritische Situation – sofortige stationäre Aufnahme erforderlich. Ihre Laborwerte weisen auf eine schwere akute Schädigung des Muskelgewebes (Rhabdomyolyse) hin, die die Nierenfunktion bedroht und sofortige ärztliche Versorgung erfordert. Das ist ein medizinischer Notfall.

Wizey

Und später im Dringlichkeitsblock:

KRITISCHE Dringlichkeit – stationäre Aufnahme innerhalb von Stunden erforderlich… Wenn Sie eine plötzliche Verschlechterung bemerken (starke Schwäche, unregelmäßiger Herzschlag, verminderte Urinausscheidung, Verwirrtheit) – rufen Sie den Rettungsdienst.

Wizey

In einem Notfall entscheidet die erste Zeile der Antwort über den Ausgang. Wenn der Patient eine Analyse aus 12 Blöcken sieht, mit „gehen Sie sofort ins Krankenhaus“ in Block neun, verliert er womöglich 10–15 Minuten mit Lesen. Die Platzierung der Triage ist der Unterschied zwischen „hat den Rettungsdienst gerufen“ und „hat bis zum Ende gelesen“.

Klinisches Denken – die AST/ALT-Berechnung. AST 3.851 und ALT 594 lassen sich leicht als schwere Leberschädigung fehldeuten: Transaminasen durch die Decke, also die Leber. Wizey rechnete es ausdrücklich vor:

AST/ALT-Quotient = 6,5 (normal etwa 1). Dieses Ausmaß der AST-Dominanz gegenüber ALT ist typisch für eine Muskelschädigung, nicht für eine Leberschädigung.

Wizey

Ohne diese Berechnung könnte der Patient in Angst vor einer „Leberkatastrophe“ verfallen – obwohl die Transaminasen hier aus dem Muskel stammen. ChatGPT erwähnte das Muster allgemein, berechnete den Quotienten aber nicht.

Die Antwort auf „Warum jetzt?“ Der Patient nahm seit 8 Jahren Atorvastatin. Warum trat die Rhabdomyolyse gerade jetzt auf?

Die Rhabdomyolyse könnte ausgelöst worden sein durch: leichte Dehydratation, Arzneimittelwechselwirkungen oder eine kumulative Statin-Exposition vor dem Hintergrund einer sich verschlechternden Nierenfunktion (verminderte renale Clearance → steigende Statinspiegel).

Wizey

ChatGPT ließ diese Frage aus. Sie ist wichtig – sie ist der Grund, warum eine Fortführung des Statins nach der Genesung keine Option ist.

Plan für nach dem Krankenhaus. Der von ChatGPT war praktisch nicht vorhanden: Statin absetzen, Flüssigkeit, Kontrolle. Der von Wizey war ein vollständiger Entlassungsplan: Flüssigkeitszufuhr 2–2,5 L/Tag, Eiweißrestriktion auf 0,8–1 g/kg, Kaliumrestriktion, keine NSAR, CoQ10 100–200 mg/Tag, SLCO1B1-Genotypisierung, Statin-Alternativen (Ezetimib, Fibrate, PCSK9-Hemmer), Kontrolle von Nierenfunktion und CK mindestens alle 3 Monate im ersten Jahr.

Fazit des Falls. In Routineszenarien ist Triage eine Frage des Taktgefühls. In Notfällen ist sie klinische Verantwortung. Der Unterschied in der ersten Zeile, in der Quotientenberechnung und im Entlassungsplan ist der Unterschied zwischen „Information“ und „Navigation“. Um es ganz klar zu sagen: In einer solchen Situation sollte der Patient den Notruf 112 / den Rettungsdienst rufen – und keine KI öffnen.

Grenzen des Experiments

Wir haben methodische Transparenz versprochen. Hier ist, was an unserem Vorgehen schwach ist.

Fünf Fälle sind die Veranschaulichung eines Musters, keine Statistik. Belastbare Schlussfolgerungen brauchen Hunderte von Durchläufen, idealerweise mit verblindeten Bewertern und einer präregistrierten Methodik. Wir sahen in jedem der fünf Fälle dasselbe Muster, räumen aber ein, dass die Stichprobe zu klein ist. Eine kundige Leserin oder ein kundiger Leser darf sagen: „Zeigen Sie mir 200 Fälle.“ Das ist eine berechtigte Forderung.

Bei MGUS haben wir die spezifischen Bestätigungstests übersehen – FLC, Immunfixation, Bence-Jones. Das ist kein „Kontext nicht verstanden“ – es ist eine echte Produktlücke. Das Team weiß das, und an einem besseren Abruf klinisch relevanter Fragmente für bestimmte Panel-Muster wird gearbeitet.

„Lost in the Middle“. Wir hatten anfangs erwartet, dass ChatGPT im Fall der Statin-Rhabdomyolyse – ein Panel mit ~70 Werten, in dem Atorvastatin mitten in einer Liste von acht Medikamenten steckte – die Myopathie nicht mit dem Statin in Verbindung bringen würde. Das geschah nicht: Das Modell verknüpfte Atorvastatin korrekt mit der erhöhten CK. Möglicherweise zeigt sich der Effekt bei größeren Panels (150+ Werte), die wir nicht getestet haben. Die Hypothese ist unbestätigt.

Ein Modell, eine Version. Wir testeten ChatGPT auf GPT-5.4 – eine bestimmte Momentaufnahme. Wir testeten andere öffentliche LLMs nicht mit diesen Fällen. Die Ergebnisse können abweichen.

Interessenkonflikt. Wir sind das Wizey-Team. Um ihn zu begrenzen: Die Methodik stand vor den Durchläufen fest (Fallliste, Prompt, Dienste), und alle Ausgaben sind wörtlich zitiert.

Wann welches Werkzeug

Das Fazit lautet nicht „Nutzen Sie Wizey“. Das Fazit lautet, dass die Wahl von der Aufgabe abhängt.

Drei Arbeitsweisen: ChatGPT für schnelle Antworten und erklärenden Kontext, Wizey für detaillierte Analyse und Vorbereitung auf den Arztbesuch, eine echte Ärztin oder ein echter Arzt für körperliche Untersuchung und klinische Verantwortung
Drei Arbeitsweisen. ChatGPT – schnelle Antwort. Spezialisierte KI – strukturierte Analyse. Ärztin oder Arzt – klinische Verantwortung.

ChatGPT ist wirklich gut für:

  • Das Übersetzen medizinischer Fachsprache in eine verständliche Sprache („was bedeutet HOMA-IR eigentlich?“)
  • Kurze Antworten auf eine gezielte Frage („was ist Ferritin?“)
  • Erklärendes Hintergrundwissen zu Krankheiten, besonders zu seltenen
  • Die motivierende Formel „drei Dinge, die jetzt zu tun sind“ – ein konkreter erster Schritt

Eine spezialisierte medizinische KI ist gut für:

  • Eine strukturierte Lesart eines vollständigen Laborpanels
  • Die Weiterleitung an Fachärzte mit konkreten Zuständigkeiten
  • Die Sicherheitsebene – Voraussetzungen vor der Therapie, Warnzeichen, Dringlichkeitsfenster mit Zeitangaben
  • Quantitative Zielwerte – welchen Spiegel man erreichen soll, welche Form man wählt, wann man nachkontrolliert
  • Die Vorbereitung auf den Termin – wie man Beschwerden formuliert, welche Fragen man stellt, was man mitbringt, um den Termin effizient zu machen

Eine echte Ärztin oder ein echter Arzt bleibt unverzichtbar. Keine KI kann die körperliche Untersuchung, das Abtasten oder die klinische Verantwortung für den Patienten übernehmen. Eine gute Ärztin oder ein guter Arzt kann noch Fragen stellen, die die KI nicht zu formulieren gelernt hat, und sieht, was nicht auf dem Laborbefund steht. Aber vorbereitet zu erscheinen – mit einer Übersicht der nötigen Überweisungen, gut formulierten Beschwerden und einer Fragenliste – ist dramatisch besser, als verwirrt mit einem Stapel Ergebnisse aufzutauchen.

Die Frage ist nicht „welche KI ist klüger“. Die Frage ist, was genau Sie von der Technologie wollen: eine schnelle Antwort oder eine strukturierte Analyse Ihrer konkreten Situation.

Mini-FAQ

Warum hat ChatGPT in keinem der fünf Fälle die primäre Diagnose verfehlt? Die primäre Diagnose ist die wahrscheinlichste Hypothese zu einem Panel, und bei häufigen klinischen Mustern – metabolisches Syndrom, subklinische Hypothyreose, Rhabdomyolyse – schneiden LLMs wirklich gut ab. Das Problem ist nicht die Diagnose selbst. Es ist das, was danach kommt: die Weiterleitung der Patienten an die richtigen Fachärzte, Sicherheitsprüfungen vor Therapiebeginn, Zielwerte und Kontrollintervalle, klinische Berechnungen wie der AST/ALT-Quotient.

Was ist eine „Sicherheitsebene“ und warum ist sie bei der Laborinterpretation wichtig? Eine Sicherheitsebene ist die Gesamtheit der Voraussetzungen und Untersuchungen, die vor Beginn jeder Therapie erfüllt sein müssen – zum Beispiel ein PSA-Wert vor einer Testosteronersatztherapie oder Mammografie und Ultraschall des kleinen Beckens vor einer menopausalen Hormontherapie. ChatGPT übersprang diese Schranken durchgängig – nicht, weil es „nichts weiß“, sondern weil es mit heterogenen Internettexten trainiert wurde und nicht mit klinischen Algorithmen zum Patientenmanagement.

Sie haben nur ChatGPT getestet. Was ist mit Claude, Gemini oder anderen Modellen? In diesem Experiment nur ChatGPT – GPT-5.4 im Plus-Tarif. Wir haben dieselben Fälle nicht durch andere LLMs laufen lassen. Wir haben die vollständigen Eingabe-Panels und wörtlichen Ausgaben veröffentlicht, sodass jeder, der das Experiment mit anderen Modellen wiederholen möchte, die Ergebnisse direkt vergleichen kann. Wir verlinken Ihren Bericht, wenn Sie ihn uns schicken.

Fünf Fälle sind nicht viel. Wo ist der Beleg im großen Maßstab? Berechtigte Frage. Fünf Fälle sind die Veranschaulichung eines Musters, keine Statistik. Wir sahen in jedem der fünf Fälle dasselbe Bild, aber wir stellen das nicht als randomisierte Studie dar. Belastbare Schlussfolgerungen brauchen Hunderte von Durchläufen mit verblindeten Bewertern und einer präregistrierten Methodik – das ist die nächste Phase, an der das Team arbeitet.

Wo sind die Rohdaten des Experiments? Die vollständigen Eingabe-Panels und wörtlichen Ausgaben beider Dienste über alle fünf Fälle hinweg sind als separate Begleitseite unter /blog/2026/04/17/wizey-vs-chatgpt-raw-experiment-data/ veröffentlicht. Die Methodik zur Reproduktion findet sich dort ebenfalls, falls jemand dieselben Patienten durch andere Modelle laufen lassen möchte.

Das Fazit

Die korrekte Diagnose ist der leichte Teil. Was danach kommt – die Überweisungsübersicht, die Sicherheitsschranken, die Zielwerte, die Prognose, die Triage – ist der Ort, an dem die eigentliche Arbeit der Patientenversorgung geschieht. Das ist die Ebene, auf der universelle LLMs durchgängig schwächeln, und die Ebene, für die eine spezialisierte medizinische KI gebaut ist.

Wenn Sie ein Werkzeug möchten, das speziell für diese Art der Interpretation mehrerer Laborpanels gemacht ist, dann ist es genau das, was wir bei Wizey bauen. Es ist kein Ersatz für eine ärztliche Beratung – es soll Ihnen helfen, gut vorbereitet zu einer solchen zu kommen. Die vollständigen Rohausgaben beider Dienste über alle fünf Fälle hinweg sind offen veröffentlicht, zusammen mit der Methodik zur Reproduktion, falls jemand dieselben Patienten durch ein anderes Modell laufen lassen möchte.

Quellen