Blog makalesi

Wizey vs ChatGPT: beş klinik vaka yan yana test edildi

Aynı tahlil sonuçlarını beş vakada ChatGPT'ye ve özel bir tıbbi yapay zekâya yükledik. Tanılar 5/5 örtüştü; sonrası tamamen ayrıştı. Birebir alıntılarla.

Sağlıkta yapay zekâ Tahliller ve tanı Sağlık ve korunma
Wizey vs ChatGPT: beş klinik vaka yan yana test edildi

Beş klinik vakayı, bir hastanın bugün bir tahlil raporunu anlamlandırmaya çalışırken açması en olası iki yapay zekâ (YZ) aracı olan ChatGPT’ye ve Wizey’e yükledik ve her birinden aynı tahlil sonuçlarını yorumlamasını istedik. Her iki YZ de aynı tanıya ulaştı. Sonrasında olanlar beklenmedikti ve teknolojiye sorulmaya değer soruyu değiştiriyor.

Aynı kişi için iki yanıt

Kırk beş yaşında erkek. Tek tahlil seti. Tek bir kısa istem: “lütfen tahlil sonuçlarımı yorumlayın.” İki hizmet. İşte gelen yanıtlar – birebir.

ChatGPT: Üç şey yapın, belirteçlerin çoğu normale döner. 1) 8–12 kg verin. 2) Alkol: şu anda neredeyse her akşam. Karaciğer ve insülin için bu kritik. 3) Fiziksel aktivite: günde en az 8.000–10.000 adım, ayrıca haftada üç kez kuvvet antrenmanı.

Wizey, özel tıbbi yapay zekâ: Endokrinolog – prediyabeti ve insülin direncini yönetmek ve testosteron replasman tedavisini görüşmek için. Kardiyolog ya da dahiliye uzmanı – kalp-damar riskinin değerlendirilmesi için. Gastroenterolog ya da hepatolog – karaciğer yağlanmasını doğrulamak için. Uyku uzmanı ya da KBB – uyku apnesini değerlendirmek için. Ürolog-androlog – cinsel işlev bozukluğunun daha ayrıntılı incelenmesi için. PSA testi – testosteron tedavisi görüşülmeden önce gereklidir (45 yaş ve üzeri erkeklerde standart tarama).

Tek kişi, tek tahlil seti. Her iki YZ de tabloyu doğru okudu: metabolik sendrom, insülin direnci, fonksiyonel hipogonadizm, olası uyku apnesi, D vitamini ve çinko eksikliği. Tanı örtüştü. Ayrışan şey, bu adamın önümüzdeki iki hafta içinde gerçekte ne yapması gerektiğiydi.

Wizey’in arkasındaki ekibiz. Bu deneye girerken çalışma varsayımımız, ChatGPT’nin tanıyı kaçıracağıydı. Beş vakanın hiçbirinde kaçırmadı. Asıl bulgu başka bir şeydi: doğru bir birincil tanı, hastaya yardım etmekle aynı şey değildir. Beş vaka boyunca gerçek fark çizgisinin nereden geçtiğini göstereceğiz; ayrıca ChatGPT’nin klinik içerik açısından bizi geçtiği tek vakayı da adıyla anacağız.

Nasıl test ettik

  • Gerçek yayımlanmış vakalardan (PubMed, Blood, Annals of Family Medicine) yeniden oluşturulan beş klinik panel derledik; klinik açıdan anlamlı her anormalliği ve belirtiyi koruyarak.
  • Aynı paneli her iki hizmete de yükledik: ChatGPT (Plus katmanı, GPT-5.4) ve özel bir tıbbi yapay zekâ olan Wizey.
  • ChatGPT için kısa bir istem yazdık: “lütfen tahlil sonuçlarımı yorumlayın.” Ek soru yok, istem mühendisliği yok. Amaç, elinde bir çıktı tutan sıradan bir hastanın yaptığını taklit etmekti.
  • Tüm çıktılar birebir kaydedildi. Bu yazıdaki doğrudan alıntılar düzenlenmemiştir; uzunluk için kısalttığımız yerler üç nokta ile işaretlenmiştir.
  • Dört vaka rutin ayaktan hasta senaryosudur; bir bonus vaka acildir ve özellikle triyaj davranışını test etmek için dahil edilmiştir.

Kapsam üzerine bir not

Beş vaka bir istatistik değil, bir örüntü örneğidir. Beşinin her birinde aynı yapıyı gördük, ancak bunu bin çalıştırmalık randomize bir çalışma olarak sunmuyoruz.

Biz Wizey ekibiyiz; çıkar çatışması ortada. Bunu kısmen dengelemek için: yöntem çalıştırmalardan önce sabitlendi, tüm çıktılar birebir alıntılandı ve ChatGPT bizi nerede geçtiyse bunu doğrudan söylüyoruz. Her panelin yeniden oluşturulduğu kaynak yayınlar metin içinde belirtildi; böylece herkes deneyi tekrar üretebilir.

Tüm testler tek bir günde, 17 Nisan 2026’da yapıldı.

Hakemli literatür ne diyor

Vaka incelemelerinden önce sayıları görmek isteyen okurlar için, hakemli literatürün ChatGPT’nin tahlil yorumundaki performansı hakkında bildirdikleri şöyle:

  • Cabral ve ark., PLOS ONE 2024: özel laboratuvar tıbbı sorularında ChatGPT vakaların yaklaşık %51’inde doğru yorum yapıyor ve yanıtların %17’si tümüyle yanlış.
  • Nature Communications Medicine, 2025: istem bağlamına sessizce yanlış bir tıbbi değer yerleştirildiğinde, büyük dil modelleri vakaların %83’ünde bu değeri “ikiye katlıyor”; yani yanlış değeri kabul edip üzerine akıl yürütme kuruyor, tutarsızlığı hiç işaretlemiyor.
  • Nature Scientific Reports, 2025: karışık asit-baz bozukluklarında ChatGPT vakaların %16,7’sinde yanlış biçimde rahatlatan bir “normal” kararı veriyor; aynı vakalarda yoğun bakım hekimleri %0 oranında yanlış güven veriyor.

Sayılar, en hafif deyimle, ürkütücü. Ama bir ayrıntı var. Beş vakalık testimizde ChatGPT, tökezlemesini beklediğimiz vakalarda bile birincil tanıyı güvenilir biçimde doğru koydu: subklinik hipotiroidi, MGUS (önemi belirsiz monoklonal gamopati), statine bağlı rabdomiyoliz, perimenopoz geçişi, fonksiyonel hipogonadizmle birlikte metabolik sendrom. Beşte beş.

Bu deneyin asıl dönüm noktası da bu. Fark, insanların çerçevelemeye eğilimli olduğu gibi “doğru bildi mi, yanlış mı bildi” değil. Fark, doğru tanıdan sonra gelende. İşte bir sonraki bölümde açacağımız katman bu.

Deneydeki beş vaka: 45 yaşında erkek (metabolik sendrom), 52 yaşında kadın (subklinik hipotiroidi), 50 yaşında kadın (perimenopoz), 68 yaşında erkek (monoklonal gamopati), 52 yaşında erkek (rabdomiyoliz)
Deneydeki beş vaka. Her birini tek tek ele alacağız: 45 yaşındaki mühendisten acil rabdomiyoliz vakasına kadar.

Vaka 1: kırk beş yaşında, yorgunluktan bıkmış

Kırk beş yaşında mühendis. Masa başı iş, teslim tarihi yaklaşan büyük bir proje, kronik stres. Şikâyetler: hafta sonu dinlenmeyle geçmeyen sürekli yorgunluk, azalan libido, kilo alımı, horlama, sabah baş ağrıları, haftada iki ya da üç kez reflü, diz ağrısı. Alkol: neredeyse her akşam bir ya da iki kadeh şarap, ayrıca hafta sonları sert içkiler. Aile öyküsü: babada tip 2 diyabet, annede hipertansiyon. Klasik “nihayet tahlil yaptırmaya vakit buldum” diyen orta yaşlı erkek.

Paneldeki başlıca anormallikler. HbA1c %5,9. HOMA-IR (insülin direnci indeksi) 4,9; üst sınır olan <2,5 değerinin neredeyse iki katı. Trigliserid 2,4 mmol/L, LDL 3,6, HDL 0,95, ApoB 1,35, aterojenik indeks 5,1. ALT 58 U/L, GGT 78 – alkole bağlı olmayan karaciğer yağlanması (NAFLD) örüntüsü. Serbest testosteron 220 pmol/L, aralığın altında. D vitamini 18 ng/mL, çinko 9,4 μmol/L, B12 260 pmol/L, homosistein 11,8. hs-CRP 4,8 mg/L, ürik asit 468 μmol/L, kortizol 580 nmol/L. Bel çevresi 104 cm (normal <94).

Tanıda eşitlik. Her iki YZ de aynı listeyi çıkardı: metabolik sendrom, insülin direnci, prediyabet, aterojenik dislipidemi, NAFLD, fonksiyonel hipogonadizm, D vitamini ve çinko eksikliği, kronik düşük dereceli iltihap, hiperürisemi, olası obstrüktif uyku apnesi, yüksek-normal kortizol. ChatGPT klinik tablonun hiçbir parçasını kaçırmadı. Her veri noktasını dürüstçe bir araya getirdi.

Şimdi – ikisinin ayrıştığı yer.

Uzman yönlendirmesi. ChatGPT tek bir belirli uzman adı vermedi. “Nereye gitmeli” bölümü “acil servis”ten (bu vaka için değil, rabdomiyoliz için ayrılmış) ve “genellikle reçete edilir” ya da “doktorunuzla görüşün” gibi ifadelerden oluşuyordu. Wizey ise beş uzmanı, her birinin özel sorumluluklarıyla sıraladı:

Endokrinolog – prediyabeti ve insülin direncini yönetmek, farmakolojik lipid ve glukoz düzeltmesi gereksinimini değerlendirmek ve yaşam tarzı değişiklikleri yetersiz kalırsa testosteron replasman tedavisini görüşmek için. Kardiyolog ya da dahiliye uzmanı – kalp-damar riskinin değerlendirilmesi için. Gastroenterolog ya da hepatolog – karaciğer yağlanmasını doğrulamak için. Uyku uzmanı ya da KBB – uyku apnesini değerlendirmek için. Ürolog-androlog – cinsel işlev bozukluğunun daha ayrıntılı incelenmesi için.

Wizey

Çoğu sağlık sisteminde iki hafta içinde beş uzmana görünmek gerçekçi değildir; aile hekiminin yönlendirici olduğu sevk yolu daha gerçekçidir ve özel sigortayla bile beş konsültasyonu ayarlamak bir ay alır. Ama en azından hasta kime, neden gittiğini bilir. Tipik endokrinoloji bekleme süreleri haftalarca, aylarca sürerken “doktorunuzla görüşün” bir yanıt değildir; hasta yalnızca başka bir YZ sohbeti açar. Ya da daha kötüsü – kendi kendini tedavi etmeye başlar. Ya da yalnızca önemli olan zamanı kaybeder.

Güvenlik katmanı – en büyük eksik. ChatGPT düşük serbest testosteronu işaretledi ve nedenlerini açıkladı. Durduğu yer orasıydı. Wizey ise bunu ayrı bir madde olarak ekledi:

PSA (prostat spesifik antijen) testi – testosteron tedavisi görüşülmeden önce gereklidir. 45 yaş ve üzeri erkeklerde standart tarama.

Wizey

Bu, önemsiz bir ayrıntı değildir. Tanı konmamış prostat kanseri varlığında testosteron replasman tedavisi (TRT) tümör ilerlemesini hızlandırabilir; TRT başlanmadan önce PSA taraması ilgili kılavuzların çoğuna (Endocrine Society, AUA ve diğerleri) yazılmıştır. ChatGPT’nin çıktısını okuyup PSA olmadan bir butik klinikte TRT arayışına giren 45 yaşında biri, gerçekleşmeyi bekleyen gerçek bir klinik başarısızlıktır. Endocrine Society’nin testosteron tedavisi kılavuzu bu konuda nettir.

Nicel hedefler. ChatGPT: “D3 vitamini 4000–5000 IU, magnezyum 300–400 mg, çinko 20–30 mg, omega-3 2–3 g, B-kompleks.” Wizey aynı soruda:

D vitamini – 18 ng/mL serum düzeyinde, 40–60 ng/mL hedef aralığına ulaşmak için tipik doz günde 2000–5000 IU’dur. 2–3 ay sonra tekrar kontrol edin. Çinko – pikolinat ya da sitrat biçiminde 15–30 mg. Magnezyum – sitrat ya da glisinat biçiminde 300–400 mg. Omega-3 (EPA+DHA) 1000–2000 mg. Berberin ya da inositol – endokrinologunuzla görüşün.

Wizey

Fark şu: “bugün ne kadar almalı” ile “hangi düzeye ulaşmalı, hangi formu seçmeli, ne zaman tekrar kontrol etmeli” arasındaki fark. İlk yanıtta hasta D vitamini alır ama işe yarayıp yaramadığını bilmez. İkincisinde bir kontrol noktası vardır.

Mekanizma zinciri. ChatGPT tablolar ve madde işaretli listeler verdi: işte glukoz, işte insülin, işte LDL. Wizey ise sekiz numaralı nedensel bağlantıyı sıraladı:

1) Visseral yağ yalnızca bir depo değildir – endokrin açıdan etkin bir dokudur. İltihap sinyalleri salgılar, insülin duyarlılığını düşürür ve testosteronu östradiole dönüştürür. 2) İnsülin direnci → pankreas daha çok insülin üretir → insülin karaciğerde trigliserid ve LDL sentezini uyarır → dislipidemi. 3) Yüksek kortizol → insülin direncini kötüleştirir ve testosteronu baskılar. 4) Günlük alkol → trigliseridleri ve GGT’yi yükseltir, uykuyu bozar. 5) D vitamini ve çinko eksikliği → azalmış testosteron sentezi. 6) Düşük serbest testosteron → kas kütlesi kaybı → yavaşlayan metabolizma. 7) Horlama ve sabah baş ağrıları → apne → uyku bölünmesi → kortizol + insülin direnci. 8) Aile öyküsü – genetik zemin.

Wizey

Metabolik sendromun sekiz bağlantısı: visseral yağ, günlük alkol, olası apne ve aile öyküsü; iltihap, insülin direnci ve yüksek kortizol üzerinden dislipidemi, düşük testosteron ve prediyabete akıyor
Tek bir bedende sekiz bağlantı. Bir hekimin zihninde tuttuğu, hastanın ise genellikle tutmadığı şey.

Bu, iyi bir hekimin zihninde tuttuğu zihinsel haritadır. Bununla hasta, kendi fizyolojisinde bir yolcu olmaktan çıkar: kilo vermek, akşam şarabını bırakmak ve apne için CPAP kullanmak artık birbirinden bağımsız üç eylem değildir; tek bir sistemin parçalarıdır.

Duygusal çerçeveleme ve prognoz. ChatGPT nötr klinik ifadeye bağlı kaldı. Wizey ise kısa ama önemli bir çerçeve ekledi:

İyi haber: sorunlarınızın çoğu geri döndürülebilir… Şimdi harekete geçerseniz prognoz mükemmel – her şey tersine çevrilebilir. Durumunuz modern, orta yaşlı bir erkek için tipik. Önemli olan, bunu zamanında yakalamış olmanız. Birçok kişi ancak diyabet geliştikten ya da bir kalp krizi geçirdikten sonra başvuruyor.

Wizey

Bu bir terapi değildir. Prognostik bir bilgidir – “şimdi harekete geçmek önemli, çok geç değil” – ayrıca bir yönlendirme: “sizin durumunuz sıra dışı değil.” Yirmi anormal belirteçli bir panele bakan 45 yaşında biri için, duygudan yoksun bir tanı ile iyileşmenin hâlâ mümkün olduğunun kabulünü de içeren bir tanı arasındaki fark, psikolojik açıdan önemlidir.

ChatGPT’nin kazandığı yer. Lp(a) – koroner hastalık aile öyküsü olan birinde bu, bizim değinmediğimiz önemli bir kalp belirtecidir. Özet “yapılacak üç şey” formülü (kilo, alkol, aktivite) akılda kalıcı ve motive edicidir. Ateroskleroz taraması olarak karotis ultrason. Bu vakada ChatGPT için gerçek kazanımlar.

Vakadan çıkan ders. Tanıda eşitlik. “Bu adam önümüzdeki 14 günde gerçekte ne yapacak?” sorusunda ayrışma. ChatGPT motive edici, üç eylemli bir formül verdi. Wizey ise belirli sorumluluklarıyla beş uzman, TRT öncesi PSA güvenlik kapısı, tekrar kontrol aralıklarıyla nicel hedefler, bir mekanizma zinciri, bir prognoz ve hastanın zamanında yakaladığına dair güvence verdi.

Doğru bir birincil tanı; ardından bir sevk yolu, bir güvenlik kontrolü, hedef düzeyler ve “zamanında yakaladınız” çerçevesi yoksa, gerçek yardım açısından sıfır dakikadır.

İki hizmet arasındaki yedi fark

Yüz vaka üzerinden bir istatistik değil; beş vakada gözlemlenen, her birinde yinelenen bir örüntü. Çıktıları yedi parametrede satır satır karşılaştırdık.

ChatGPT ile özel bir tıbbi yapay zekâyı karşılaştıran yedi parametrelik tablo: tanı, yönlendirme, güvenlik, nicel hedefler, prognoz ve çerçeveleme, mekanizma zincirleri ve test özgüllüğü
Tanı 5/5 örtüşüyor. Sonrasında gelen her şey – yönlendirme, güvenlik, hedefler, çerçeveleme, mekanizma, test özgüllüğü – ayrışıyor.

Tablo, “ChatGPT kaybediyor” diyen bir ifade değildir. İki hizmetin nerede ayrıştığının bir haritasıdır. Hızlı “bu ne anlama geliyor” sorusunda ChatGPT hızlı ve iyidir. Doktor ziyaretinden önceki eylem planında ise sistematik olarak zayıflar. Bu bir hata değil: GPT, klinik hasta yönetimi algoritmalarıyla değil, heterojen internet metinleriyle eğitildi.

ChatGPT’nin bizi geçtiği yer – dürüstçe

MGUS vakasını (önemi belirsiz monoklonal gamopati) her iki hizmette de çalıştırdık – ve burada ChatGPT klinik içerik açısından kazandı. Yöntemimizde, eksiklerimizi doğrudan adıyla anacağımızın sözünü vermiştik. Bu da onlardan biri.

Altmış sekiz yaşında erkek. Şikâyetler – son altı aydır yaygın halsizlik ve aralıklı sırt ağrısı. Perindopril ve atorvastatin 10 mg kullanıyor. Panel, üç bulgu dışında neredeyse normal: total protein 92 g/L (yüksek; normal 64–83), albümin 38 (normal), sedimantasyon 38 mm/hr (üst sınırın iki katından fazla). Yaş 68 + altı aylık halsizlik + sırt ağrısı + yüksek total protein + yüksek sedimantasyon = monoklonal gamopati ya da multipl miyelom için klasik “kırmızı bayrak üçlüsü”. Taramada yakalanması gerekir.

ChatGPT’nin daha iyi yaptığı. Albümin/globulin oranını açıkça hesapladı: total protein 92, albümin 38 → globulinler 54, oran 0,70 (normal >1,0). Sonuç: yüksek globulinler. Oradan belirli bir ayırıcı tanı sıraladı:

Üç uyarı işareti: sedimantasyon 38, total protein 92 ve belirti örüntüsü (halsizlik ve sırt ağrısı). Bu kombinasyon klasik olarak multipl miyelomun dışlanmasını gerektirir… Ayrıca şunları düşündürebilir: kronik iltihap, enfeksiyon, romatolojik hastalık, MGUS.

ChatGPT

Ve belirli bir tetkik planı verdi: serum protein elektroforezi + immünofiksasyon + serbest hafif zincirler (FLC) + idrarda Bence-Jones proteini + spinal röntgen/MR + kemik BT. Bu gerçek bir klinik kontrol listesi – tam olarak bir hematoloğun isteyeceği şey. “MGUS için tetkik” ile “açıklanamayan sedimantasyon için tetkik” arasındaki fark budur. GPT-4’ün klinik vakalardaki performansına ilişkin yakın tarihli NEJM AI değerlendirmesine göre, hematolojiye özgü ayırıcı tanı listeleri, öncü modellerin gözle görülür biçimde geliştiği bir alan.

ChatGPT'nin Wizey'den daha güçlü olduğu dört yer: Lp(a) kalp belirteci, MGUS için belirli doğrulayıcı testler, özet üç eylemli formül ve ateroskleroz taraması olarak karotis ultrason
ChatGPT'nin daha güçlü olduğu dört yer. Yazı bir pazarlama metnine dönüşmesin diye açıkça yazıldı.

Wizey’in kaçırdığı. A/G oranını açıkça hesaplamadık. Monoklonal gamopatileri bir olasılık olarak andık ama belirli doğrulayıcı testleri – FLC, immünofiksasyon, Bence-Jones – adıyla anmadık. Bu, yorumun bir inceliği değil, gerçek bir ürün eksiğidir. Ekip bunu görüyor. Çalışma sürüyor.

Wizey’in yine de sunduğu. Test paneli eksiğine rağmen çıktı boş değildi. ChatGPT’de olmayan bir şey içeriyordu:

Randevunuza hazırlanın: halsizliğin ne zaman başladığını, sırtınızın ne sıklıkta ve tam olarak nerede ağrıdığını, ateşiniz, gece terlemeleriniz ya da istem dışı kilo kaybınız olup olmadığını not edin.

Wizey

Bu liste – ateş, gece terlemeleri, kilo kaybı – lenfoma ve miyelom için klasik “B semptomları” taramasıdır. Hematoloğun ofisine “altı ayda üç kez gece terlemesi, yaklaşık 3 kg istem dışı kilo kaybı” yazan iki satırlık bir notla gelen bir hasta, hekime yirmi dakikalık öykü almaktan tasarruf ettirir ve görüşmenin niteliğini artırır.

Wizey ayrıca üstbilişsel bir not düştü (“referans aralıkları tahlil sonuçlarınızda basılı değildi – uluslararası kabul görmüş normları kullandım”), daha kesin bir aciliyet penceresi verdi (ChatGPT’nin “önümüzdeki haftalar”ına karşı “1–2 hafta”) ve mevcut ilaçlar hakkında kısaca yorum yaptı.

Editöryel değerlendirme. Bu bir galibiyet/mağlubiyet değil – iki farklı çalışma biçimi. ChatGPT, hastanın elindeki bir hekim kontrol listesi gibi davrandı: doktora götürülecek testlerin listesi. Wizey ise doktor ziyaretine hazırlık gibi davrandı: B semptomları, daha net şikâyet ifadesi, kesin bir aciliyet penceresi.

Her iki biçim de meşrudur. Belirli MGUS testlerini kaçırmak, kendimizi eleştirdiğimiz bir nokta. Ama hasta hematoloğa Wizey’in notuyla gelir ve hematolog FLC, immünofiksasyon ve Bence-Jones testlerini kendisi isterse (ki bu onun işidir), B semptomu öyküsünde kazanılan yirmi dakika çok değerlidir.

İki vaka daha, aynı örüntü

Subklinik hipotiroidi – elli iki yaşında kadın

Yorgunluk, kilo alımı ve kuru cilt ile başvurdu. TSH 6,8 mIU/L (yüksek; normal 0,4–4,0), serbest T4 ve T3 aralık içinde. Total kolesterol 6,8 mmol/L, LDL 4,3. Her iki YZ de doğru biçimde subklinik hipotiroidi ve dislipidemiye vardı. Birincil tanı yine örtüştü.

Tek bir cümlede ayrıştılar. ChatGPT:

Güncel kılavuzlar genellikle şu durumlarda tedaviye başlanmasını önerir: TSH >6–7, belirtiler mevcut, yaş <65. Tüm ölçütleri karşılıyorsunuz. Levotiroksin genellikle düşük bir başlangıç dozunda reçete edilir.

ChatGPT

Yüzeysel olarak makul. Özünde ise, olası zararlı sonuçları olan bir basitleştirme. American Thyroid Association ve European Thyroid Association’ın 4–10 mIU/L aralığındaki TSH için kılavuzları aslında bunun tam tersini söyler: karar kişiye özeldir. Wizey bunu yakaladı:

Tedaviye başlama kararı kişiye özeldir: 10 mIU/L üzerindeki TSH genellikle tedaviyi gerektirir; 4–10 mIU/L aralığındaki TSH (sizde olduğu gibi) belirtilere, tiroid antikorlarının varlığına, eşlik eden hastalıklara ve zaman içindeki seyre bağlıdır.

Wizey

Ve ChatGPT’nin atladığı bir sıralama verdi:

Takipte lipid profilini tekrarlayın – tiroid işlevi düzeldikten sonra kolesterol çoğu zaman kendiliğinden normale döner.

Wizey

Kritik ayrıntı bu. TSH 6,8 ve kolesterol 6,8 olan bir kadın aynı anda levotiroksin ve bir statine başlarsa, üç ay sonra ihtiyacı olmayan bir statini kullanıyor olabilir: hipotiroidi tek başına kolesterolü yükseltir. Wizey açık bir yönlendirme (endokrinolog), 2–3 ay içinde TSH ve serbest T4’ün tekrar kontrolü ve “2–4 hafta” aciliyet penceresi ekledi.

Vakadan çıkan ders: ikisi de tanıda haklı. Biri aşırı tedaviye ve gereksiz bir statine doğru itiyor. Diğeri bir sıralama kuruyor.

Aynı örüntü, farklı bir konuda bir sonraki vakada da ortaya çıkıyor – ve aşırı basitleştirmenin bedeli daha da artıyor.

Perimenopoz – elli yaşında kadın

Hasta: sıcak basmaları, gece terlemeleri, uykusuzluk, azalan libido, “beyin sisi.” Aile öyküsü – annede osteoporoz, babada koroner hastalık. Panel: FSH 42 IU/L, östradiol 45 pmol/L (düşük), progesteron 1,2 nmol/L, anti-TPO 68 IU/mL (erken Hashimoto), D vitamini 22 ng/mL, ferritin 32 μg/L, PTH 68 pg/mL, LDL 3,9 mmol/L. Her iki YZ de şuraya vardı: perimenopoz geçişi + erken otoimmün tiroidit + D vitamini eksikliği + latent demir eksikliği + postmenopozal dislipidemi.

Menopozal hormon tedavisi (MHT; eski terminolojide HRT, hormon replasman tedavisi – güncel kullanım MHT’yi tercih eder) konusunda ayrıştılar. ChatGPT:

Menopozal hormon tedavisi. Büyük olasılıkla endike. Sıcak basmalarını azaltır, uykuyu iyileştirir, kemiği korur, lipidleri iyileştirir. Değerlendirmeden sonra bir jinekolog tarafından başlatılır.

ChatGPT

Wizey aynı konuyu bir karar çerçevesine açtı:

Yaşınız (50), kontrendikasyon bulunmaması ve belirgin belirtileriniz göz önüne alındığında – MHT’ye başlamak için “fırsat penceresi” içindesiniz. MHT’ye son âdet döneminden sonraki ilk 10 yıl içinde başlamak (siz bu pencere içindesiniz) en büyük yararla ilişkilidir: sıcak basmalarında %80–90 azalma, daha iyi uyku, ruh hâli, libido, kemik ve kalp-damar koruması, genitoüriner atrofinin önlenmesi.

Wizey

Önemli olan yalnızca “%80–90” sayısı değil – ChatGPT’nin atladığı güvenlik kapısı:

Pelvik ultrason ve mamografi – taramanızı güncellemek için (son mamografi iki yıl önce, sitoloji üç yıl önceydi). MHT’ye başlamadan önce kontrendikasyonlar dışlanmalıdır.

Wizey

Batı hasta kültürünün büyük bölümünde MHT tartışmaları ya geçiştirilir ya da WHI döneminden kalma güncelliğini yitirmiş meme kanseri korkularının gölgesinde kalır. Açık bir pencere, sayısallaştırılmış bir etki büyüklüğü ve ön koşul tetkiklerini içeren bir karar çerçevesi nadirdir – özellikle jinekoloğu “eh, yaşınız bu, alışın” diyen bir kadın için. Wizey ayrıca, ölçüyü kaçırmadan kısa bir duygusal çerçeve ekledi:

Belirtileriniz “yalnızca yaşlanma” değil ve kabullenmek zorunda olduğunuz bir şey de değil. Bu, yönetilebilir bir durumdur.

Wizey

Nicel hedeflerde, 45 yaşındaki erkekle aynı örüntü. ChatGPT: “D vitamini 2000–4000 IU.” Wizey: hedef D vitamini 40–60 ng/mL, ferritin 50–100, sabah aç karnına C vitamini ile 40–80 mg elementer demir, kalsiyum 1200–1500 mg, kilogram başına 1,0–1,2 g protein. Fark dozlama değil – hastanın artık genel bir öneri değil, karşılaştırarak izleyebileceği bir kontrol listesine sahip olması.

Vakadan çıkan ders: MHT konuşması, güncelliğini yitirmiş bilgilerle dolu bir mayın tarlasıdır. Buradaki tam bir karar çerçevesi bir ekstra değil – hasta desteğinin temel düzeyidir.

Peki ya acil bir vaka?

Dört ayaktan hasta vakasında temel karşıtlık yönlendirme, güvenlik ve hedeflerdeydi. Ama rutin senaryolarda görmediğiniz başka bir boyut var – triyaj. Kritik durumdaki bir hasta bir YZ açmak yerine acil servisi aramalıdır. Uygulamada yine de YZ’yi açarlar. Her iki hizmetin bunu nasıl ele aldığını görmek için bir acil vaka çalıştırdık.

Elli iki yaşında erkek. Hiperkolesterolemi için 8 yıldır atorvastatin 40 mg kullanıyor, ayrıca metforminle yönetilen tip 2 diyabet. Şikâyetler: ciddi proksimal kas güçsüzlüğü (kollarını kaldıramıyor, merdiven çıkamıyor), omuzlarda ve kalçalarda ağrı, son beş gündür koyu renkli idrar. Panel: CK 23.171 U/L (normal 30–200 – 115 kattan fazla yüksek), AST 3.851, ALT 594, serum miyoglobini 3.200, miyoglobinüri pozitif, kreatinin 188 μmol/L, eGFR 38 mL/min/1,73 m², potasyum 5,3 mmol/L.

İkisi de doğru buldu. Tanı: akut böbrek hasarıyla birlikte statine bağlı rabdomiyoliz. Etiyoloji atorvastatine bağlandı. Öneri: hastaneye yatış. İkisi de anti-HMGCR (HMG-CoA redüktaz antikorları) ve anti-SRP’den söz etti – statine bağlı immün aracılı nekrotizan miyopatinin (IMNM) belirteçleri.

Bunun ötesinde, üç noktada ayrıldılar.

Triyaj – yanıtın ilk satırı. ChatGPT yanıtını 12 bloğa ayırdı: belirteçler, belirtiler, nedenler, tedavi. “Hemen hastaneye gidin” ifadesi on iki bloktan dokuzuncusunda ortaya çıktı – uzun bir metin duvarının ardından. Wizey aynı vakayı farklı açtı:

Kritik durum – acil hastaneye yatış gerekli. Tahlil sonuçlarınız, böbrek işlevini tehdit eden ve acil tıbbi bakım gerektiren ciddi, akut kas dokusu hasarına (rabdomiyoliz) işaret ediyor. Bu bir tıbbi acil durumdur.

Wizey

Ve sonra aciliyet bloğunda:

KRİTİK aciliyet – saatler içinde hastaneye yatış gerekli… Ani bir kötüleşme hissederseniz (şiddetli güçsüzlük, düzensiz kalp atışı, idrar çıkışında azalma, bilinç bulanıklığı) – acil servisi arayın.

Wizey

Acil bir durumda yanıtın ilk satırı sonucu belirler. Hasta, dokuzuncu blokta “hemen hastaneye gidin” yazan 12 bloklu bir analiz görürse, okumaya 10–15 dakika kaybedebilir. Triyajın yerleşimi, “acil servisi aradı” ile “sonuna kadar okudu” arasındaki farktır.

Klinik akıl yürütme – AST/ALT hesabı. AST 3.851 ve ALT 594, ciddi bir karaciğer hasarı olarak yanlış okunmaya elverişlidir: transaminazlar tavan yapmış, demek ki karaciğer. Wizey açık hesabı yaptı:

AST/ALT oranı = 6,5 (normal yaklaşık 1). ALT’ye kıyasla bu derece AST baskınlığı, karaciğer hasarı için değil, kas hasarı için tipiktir.

Wizey

Bu hesap olmadan hasta bir “karaciğer felaketi”nden dehşete kapılabilir – oysa buradaki transaminazların kaynağı kastır. ChatGPT örüntüden genel hatlarıyla söz etti ama oranı hesaplamadı.

“Neden şimdi?” sorusunu yanıtlama. Hasta 8 yıldır atorvastatin kullanıyordu. Rabdomiyoliz neden tam da şimdi oldu?

Rabdomiyoliz şunlarla tetiklenmiş olabilir: hafif dehidratasyon, ilaç etkileşimleri ya da kötüleşen böbrek işlevi zemininde kümülatif statin maruziyeti (azalan böbrek klirensi → yükselen statin düzeyleri).

Wizey

ChatGPT bu soruyu atladı. Önemli bir soru – iyileşmeden sonra statine devam etmenin neden bir seçenek olmadığının nedeni bu.

Hastane sonrası plan. ChatGPT’ninki neredeyse yok gibiydi: statini kes, sıvı, izlem. Wizey’inki ise tam bir taburculuk planıydı: günde 2–2,5 L hidrasyon, 0,8–1 g/kg protein kısıtlaması, potasyum kısıtlaması, NSAİİ’lerden kaçınma, günde 100–200 mg CoQ10, SLCO1B1 genotiplemesi, statin alternatifleri (ezetimib, fibratlar, PCSK9 inhibitörleri), ilk yıl en az 3 ayda bir böbrek işlevi ve CK izlemi.

Vakadan çıkan ders. Rutin senaryolarda triyaj bir incelik meselesidir. Acil durumlarda ise klinik sorumluluktur. İlk satırdaki, oran hesabındaki ve taburculuk planındaki fark, “bilgi” ile “yönlendirme” arasındaki farktır. Açıkça söyleyelim: bu tür bir durumda hasta bir YZ açmamalı – acil servisi / 112’yi aramalıdır.

Deneyin sınırlılıkları

Yöntemsel şeffaflık sözü vermiştik. Yaptığımız işin zayıf yanları şunlar.

Beş vaka bir istatistik değil, bir örüntü örneğidir. Kanıta dayalı sonuçlar için, ideal olarak kör değerlendiricilerle ve önceden kayıtlı bir yöntemle yüzlerce çalıştırma gerekir. Beşinin her birinde aynı örüntüyü gördük, ancak örneklemin fazla küçük olduğunu kabul ediyoruz. Donanımlı bir okurun “bana 200 vaka gösterin” deme hakkı vardır. Bu haklı bir talep.

MGUS’ta belirli doğrulayıcı testleri kaçırdık – FLC, immünofiksasyon, Bence-Jones. Bu, “bağlamı anlamadık” değil – gerçek bir ürün eksiğidir. Ekip bunu biliyor ve belirli panel örüntüleri için klinik açıdan ilgili parçaların daha iyi getirilmesi üzerine çalışma sürüyor.

“Ortada kaybolma” (Lost in the Middle). Başlangıçta, statin-rabdomiyoliz vakasında – sekiz ilaç arasında atorvastatinin listenin ortasına gömülü olduğu ~70 belirteçlik bir panel – ChatGPT’nin miyopatiyi statinle ilişkilendiremeyeceğini bekliyorduk. Bu olmadı: model atorvastatini yüksek CK ile doğru biçimde bağladı. Etkinin, test etmediğimiz daha büyük panellerde (150+ belirteç) ortaya çıkması olasıdır. Bu varsayım doğrulanmamıştır.

Tek model, tek sürüm. ChatGPT’yi GPT-5.4 üzerinde test ettik – belirli bir zaman kesiti. Bu vakalarda başka herkese açık büyük dil modellerini test etmedik. Sonuçlar farklı olabilir.

Çıkar çatışması. Biz Wizey ekibiyiz. Bunu sınırlamak için: yöntem çalıştırmalardan önce sabitlendi (vaka listesi, istem, hizmetler) ve tüm çıktılar birebir alıntılandı.

Hangi aracı ne zaman kullanmalı

Sonuç “Wizey’i kullanın” değil. Sonuç şu: seçim göreve bağlıdır.

Üç çalışma biçimi: hızlı yanıtlar ve eğitici bağlam için ChatGPT, ayrıntılı analiz ve doktor ziyaretine hazırlık için Wizey, fiziksel muayene ve klinik sorumluluk için gerçek bir hekim
Üç çalışma biçimi. ChatGPT – hızlı yanıt. Özel YZ – yapılandırılmış analiz. Hekim – klinik sorumluluk.

ChatGPT şunlarda gerçekten iyi:

  • Tıbbi dili sade bir dile çevirmek (“HOMA-IR aslında ne demek?”)
  • Odaklı bir soruya kısa yanıtlar (“ferritin nedir?”)
  • Hastalıklar, özellikle nadir olanlar hakkında eğitici arka plan
  • Motive edici “şimdi yapılacak üç şey” formülü – somut bir ilk adım

Özel bir tıbbi yapay zekâ şunlarda iyi:

  • Tam bir laboratuvar panelinin yapılandırılmış okunması
  • Belirli sorumluluklara sahip uzmanlara yönlendirme
  • Güvenlik katmanı – tedaviden önceki ön koşullar, uyarı işaretleri, zamanlamalı aciliyet pencereleri
  • Nicel hedefler – hangi düzeye ulaşılacağı, hangi formülasyonun seçileceği, ne zaman tekrar kontrol edileceği
  • Ziyarete hazırlık – şikâyetlerin nasıl ifade edileceği, hangi soruların sorulacağı, randevuyu verimli kılmak için neyin getirileceği

Gerçek bir hekim hâlâ gereklidir. Hiçbir YZ fiziksel muayeneyi, palpasyonu yapamaz ya da hasta için klinik sorumluluk taşıyamaz. İyi bir hekim, YZ’nin üretmeyi öğrenmediği soruları hâlâ sorabilir ve laboratuvar raporunda olmayanı görür. Ama hazırlıklı gelmek – bir sevk haritası, iyi ifade edilmiş şikâyetler ve bir soru listesiyle – bir yığın sonuçla şaşkın gelmekten çok daha iyidir.

Soru “hangi YZ daha akıllı” değil. Soru, teknolojiden özellikle ne istediğiniz: hızlı bir yanıt mı, yoksa kendi özel durumunuzun yapılandırılmış bir analizi mi.

Mini SSS

ChatGPT beş vakanın hiçbirinde birincil tanıyı neden kaçırmadı? Birincil tanı, bir panel karşısında en olası varsayımdır; metabolik sendrom, subklinik hipotiroidi, rabdomiyoliz gibi sık görülen klinik örüntülerde büyük dil modelleri gerçekten iyi iş çıkarır. Sorun tanının kendisi değil. Sorun, sonrasında olan biten: hastaları doğru uzmanlara yönlendirmek, tedaviden önce güvenlik kapıları, hedef düzeyler ve izlem aralıkları, AST/ALT oranı gibi klinik hesaplamalar.

“Güvenlik katmanı” nedir ve tahlil yorumunda neden önemlidir? Güvenlik katmanı, herhangi bir tedaviye başlamadan önce yerine getirilmesi gereken ön koşullar ve taramalar bütünüdür; örneğin testosteron replasmanından önce PSA ya da menopozal hormon tedavisinden önce mamografi ve pelvik ultrason. ChatGPT bu kapıları sürekli olarak atladı; bunun nedeni “bilmemesi” değil, klinik hasta yönetimi algoritmalarıyla değil, heterojen internet metinleriyle eğitilmiş olmasıdır.

Yalnızca ChatGPT’yi test ettiniz. Peki Claude, Gemini ya da diğer modeller? Bu deneyde yalnızca ChatGPT – Plus katmanındaki GPT-5.4. Aynı vakaları diğer büyük dil modellerinde çalıştırmadık. Girdi panellerinin tamamını ve birebir çıktıları yayımladık; bu deneyi başka modellerde tekrarlamak isteyen herkes sonuçları doğrudan karşılaştırabilir. Yazınızı gönderirseniz bağlantısını paylaşırız.

Beş vaka çok değil. Peki ölçekli kanıt nerede? Haklı bir soru. Beş vaka bir istatistik değil, bir örüntü örneğidir. Beşinin her birinde aynı yapıyı gördük, ancak bunu randomize bir çalışma olarak sunmuyoruz. Kanıta dayalı sonuçlar için kör değerlendiricilerle ve önceden kayıtlı bir yöntemle yüzlerce çalıştırma gerekir; ekibin üzerinde çalıştığı bir sonraki aşama da bu.

Deneyin ham verileri nerede? Her iki hizmetin beş vakanın tamamındaki girdi panellerinin tamamı ve birebir çıktıları, ayrı bir tamamlayıcı sayfada yayımlanmıştır: /blog/2026/04/17/wizey-vs-chatgpt-raw-experiment-data/. Aynı hastaları başka modellerde çalıştırmak isteyenler için tekrar üretme yöntemi de orada.

Özetle

Doğru tanı kolay olan kısımdır. Sonrasında gelen – sevk haritası, güvenlik kapıları, hedef düzeyler, prognoz, triyaj – hasta bakımının asıl işinin gerçekleştiği yerdir. Genel amaçlı büyük dil modellerinin sürekli olarak zayıfladığı katman ve özel tıbbi yapay zekânın yaşamak üzere kurulduğu katman da budur.

Bu tür çok panelli tahlil yorumu için özel olarak tasarlanmış bir araç istiyorsanız, Wizey’de kurduğumuz şey tam da bu. Bir klinik değerlendirmenin yerine geçmez – ona hazırlıklı gitmenize yardımcı olmak için tasarlandı. Her iki hizmetin beş vakanın tamamındaki eksiksiz ham çıktıları, aynı hastaları farklı bir modelde çalıştırmak isteyenler için, tekrar üretme yöntemiyle birlikte açıkça yayımlanmıştır.

Sıkça sorulan sorular

ChatGPT beş vakanın hiçbirinde birincil tanıyı neden kaçırmadı?

Birincil tanı, bir panel karşısında en olası varsayımdır; metabolik sendrom, subklinik hipotiroidi, rabdomiyoliz gibi sık görülen klinik örüntülerde büyük dil modelleri gerçekten iyi iş çıkarır. Sorun tanının kendisi değil. Sorun, sonrasında olan biten: hastaları doğru uzmanlara yönlendirmek, tedaviden önce güvenlik kapıları, hedef düzeyler ve izlem aralıkları, AST/ALT oranı gibi klinik hesaplamalar.

“Güvenlik katmanı” nedir ve tahlil yorumunda neden önemlidir?

Güvenlik katmanı, herhangi bir tedaviye başlamadan önce yerine getirilmesi gereken ön koşullar ve taramalar bütünüdür; örneğin testosteron replasmanından önce PSA ya da menopozal hormon tedavisinden önce mamografi ve pelvik ultrason. ChatGPT bu kapıları sürekli olarak atladı; bunun nedeni “bilmemesi” değil, klinik hasta yönetimi algoritmalarıyla değil, heterojen internet metinleriyle eğitilmiş olmasıdır.

Yalnızca ChatGPT'yi test ettiniz. Peki Claude, Gemini ya da diğer modeller?

Bu deneyde yalnızca ChatGPT – Plus katmanındaki GPT-5.4. Aynı vakaları diğer büyük dil modellerinde çalıştırmadık. Girdi panellerinin tamamını ve birebir çıktıları yayımladık; bu deneyi başka modellerde tekrarlamak isteyen herkes sonuçları doğrudan karşılaştırabilir. Yazınızı gönderirseniz bağlantısını paylaşırız.

Beş vaka çok değil. Peki ölçekli kanıt nerede?

Haklı bir soru. Beş vaka bir istatistik değil, bir örüntü örneğidir. Beşinin her birinde aynı yapıyı gördük, ancak bunu randomize bir çalışma olarak sunmuyoruz. Kanıta dayalı sonuçlar için kör değerlendiricilerle ve önceden kayıtlı bir yöntemle yüzlerce çalıştırma gerekir; ekibin üzerinde çalıştığı bir sonraki aşama da bu.

Deneyin ham verileri nerede?

Her iki hizmetin beş vakanın tamamındaki girdi panellerinin tamamı ve birebir çıktıları, ayrı bir tamamlayıcı sayfada yayımlanmıştır: /blog/2026/04/17/wizey-vs-chatgpt-raw-experiment-data/. Aynı hastaları başka modellerde çalıştırmak isteyenler için tekrar üretme yöntemi de orada.

Kaynaklar