Blog makalesi

Wizey vs ChatGPT: tahlilde tıbbi yapay zekâ neden üstün

CEO'nun teknik analizi: genel amaçlı LLM'ler ile tıbbi yapay zekâ arasındaki mimari uçurum. Lost in the Middle, halüsinasyon, gizlilik, ChatGPT ne zaman uygun.

Sağlıkta yapay zekâ Tahliller ve tanı Sağlık ve korunma
Wizey vs ChatGPT: tahlilde tıbbi yapay zekâ neden üstün

Sürekli aynı hikâyeyi duyuyorum: birisi laboratuvardan bir biyokimya PDF’i alıyor, ChatGPT‘yi açıyor, dosyayı ekliyor ve “bunu açıklayın” yazıyor. Bir dakika sonra model kendinden emin bir yanıt veriyor – kimi zaman yararlı, kimi zaman tümüyle hatalı. Her iki durumda da hasta, “her şeyi anladığı” duygusuyla ayrılıyor.

Bu senaryo beni endişelendiriyor – hem de mesleğim gereği bir tıbbi yapay zekâ (YZ) geliştirdiğim için değil. Beni endişelendiren şey şu: akademik geçmişim bilişsel bilim ve dil modellerinin mimarisi üzerine olduğundan, bu sistemlerin tam olarak neyi yapamadığını çok iyi anlıyorum. ChatGPT mükemmel bir genel amaçlı araçtır. Ama “mükemmel” ile “tahlil sonuçlarınızı yorumlamaya uygun” arasında, iyi eğitimli ve dikkatli insanların her gün içine düştüğü bir uçurum var.

Bu yazıda size – panik yaratmadan, abartısız ve pazarlama yapmadan – genel amaçlı dil modellerinin gerçekte nasıl çalıştığını, özellikle tıbbi bağlamlarda neden zorlandıklarını ve hangi senaryolarda hâlâ gerçekten yararlı olduklarını anlatmak istiyorum. Bu arada Wizey’de neyi farklı yaptığımızı ve nedenini açıklayacağım.

Kısa, teknik olmayan özet, başka bir şey okumayacaksanız: ChatGPT gibi genel amaçlı bir model, çok okumuş bir genelcidir – bilgisi bir kilometre genişliğinde ama yalnızca bir santim derinliğinde; okuduğu her şeyden, hakemli makalelerden Reddit başlıklarına kadar birbirine dikilmiştir. “Yüksek kolesterol”ü “kalp hastalığına” parlak biçimde bağlayabilir, çünkü bu kelimeleri milyonlarca kez bir arada görmüştür – ama bu, fizyolojik bir yolak değil, istatistiksel bir korelasyondur. Uzmanlaşmış bir tıbbi sistem daha çok bir uzman gibi davranır: düz bir metin denizi yerine, tıbbi ilişkilerin yapılandırılmış bir haritasından – bir tıbbi bilgi grafiği fikrinden – yola çıkar. Ve son kilometreyi kat etmek üzere tasarlanmıştır: ham bilgiden somut bir sonraki eyleme geçiş – hangi bir iki sonucun gerçekten konuşulmayı hak ettiği, hangi uzmana görünmeniz gerektiği ve randevunuzda ne soracağınız. ChatGPT, gerçekleri doğru olsa bile, neredeyse her zaman genel geçer bir “bir doktora danışın” ile yetinir.

Genel amaçlı LLM ile uzmanlaşmış tıbbi yapay zekâ: mimari uçurum

ChatGPT, devasa bir internet metni külliyatı üzerinde bir sonraki tokeni tahmin etmek için eğitilmiş, büyük ve genel amaçlı bir dil modelidir (LLM). Her şey hakkında biraz bilgi sahibidir – borş çorbası tariflerinden kuantum kromodinamiğine kadar. Mimari açıdan tıp, birçok alandan yalnızca bir tanesidir. Modelin tasarımında klinik akıl yürütmeye ayrıcalık tanıyan hiçbir şey yoktur.

Uzmanlaşmış bir tıbbi yapay zekâ farklı kurulur. Tek bir model değildir – bir işlem hattıdır: belge tanıma (OCR), her laboratuvar belirtecinin yapılandırılmış bir nesneye titizlikle ayrıştırılması, referans aralıkları ve birim kurallarına göre doğrulama ve ancak ondan sonra verileri klinik kılavuzlarla karşılaştıran bir analiz modülü. Son aşamada, ilk kez klasik Lewis et al. (2020) makalesinde tanımlanan teknik olan Retrieval-Augmented Generation (RAG) kullanıyoruz. RAG, modelin “kafadan” yanıt vermemesi demektir – doğrulanmış bir bilgi tabanından ilgili parçaları getirir ve bunlar üzerinden akıl yürütür.

Temel ayrım şu: genel amaçlı bir model bir yanıt üretir; uzmanlaşmış bir tıbbi sistem yapılandırılmış verilere karşı getirir ve eşleştirir. Birincisi yaratıcı ve yanlış olabilir. İkincisi doğru ve öngörülebilir olmak zorundadır. Tıpta yaratıcılık bir anti-pattern’dir.

Lost in the Middle: asıl sorun, “çok küçük bağlam penceresi” değil

ChatGPT hakkındaki en inatçı efsanelerden biri, “bağlam penceresi çok küçük olduğu için uzun tahlil sonuçlarıyla baş edemediği” iddiasıdır. 2026’da bu artık geçerli değil. GPT sınıfının en ileri modelleri artık yaklaşık 1 milyon tokenlik bağlam pencerelerini destekliyor; Anthropic’in Opus sınıfı Claude modelleri ve Google’ın Gemini 3.x modelleri de milyon token ölçeğinde çalışıyor. Beş sayfalık bir laboratuvar PDF’i buraya çok büyük bir payla rahatça sığar.

Asıl sorunun bir adı var: Lost in the Middle. Liu et al. (2023, Stanford) tarafından ayrıntılı olarak tanımlandı. Bir LLM’e uzun bir bağlam verdiğinizde, model bilgiyi baştan ve sondan çıkarmakta çok başarılıdır, ama doğruluğu ortada “sarkar”. Doğruluğu konuma göre grafiğe dökerseniz, eğri bir U’ya benzer – kenarlarda yüksek, ortada bir çukur. Bu, milyon tokenlik pencereleri olan modeller için bile geçerlidir.

Bu, tahlil sonuçlarınız için ne anlama gelir? Beş sayfalık bir PDF, kritik bir belirteci – diyelim ki yüksek bir C-reaktif protein (CRP) – üçüncü sayfaya, yani istemin tam ortasına yerleştirirse, genel amaçlı bir modelin akıl yürütürken onu basitçe “görememe” olasılığı anlamlı ölçüde daha yüksektir. Var olduğunu unutmaz, ama nihai sonuçta ona gereğinden az ağırlık verir. Yaratıcı bir metin için bu görünmezdir. Biyokimya için ise gözden kaçan sistemik bir iltihaptır.

Bizim sistemimizde bu etkiyi mimari düzeyde aşıyoruz. Veriler önce katı bir tabloya çıkarılır ve yalnızca o tablo analiz modülüne verilir. Lost in the Middle, 30 satırlık yapılandırılmış bir tabloda, serbest akan beş sayfalık metne göre çok farklı davranır.

Ve en sık gelen kullanıcı sorusu “aynı anda gerçekte kaç belirteç yükleyebilirim” olduğu için, somut konuşayım. Wizey, tek bir ziyaretten 80, 100, hatta 150+ belirteç içeren PDF’leri düzenli olarak işler – biyokimya, hormonlar, tam kan sayımı, pıhtılaşma paneli, lipid profili, immünogram, hepsi bir arada. Her sayı analize girer ve analiz modülü tüm gruplarda paralel olarak ilişkiler arar: TSH‘nin kolesterolle nasıl ilişkili olduğunu, ferritinin C-reaktif protein ışığında nasıl okunduğunu, glukozun trigliserid ve insülinle nasıl etkileştiğini, kreatinindeki iki yıllık değişimin kan basıncı eğilimleriyle nasıl birleştiğini. Genel amaçlı bir LLM bu ilişkiler ağını kuramaz – onlarca bağımsız parametreyi aynı anda odakta tutup yapılandırılmış bir temsil olmadan çapraz karşılaştıramaz; bu fiziksel olarak mümkün değildir.

Halüsinasyonlar: tıp neden bunun için en kötü alan

Büyük dil modelleri halüsinasyon üretir – ne eğitim verilerinde ne de gerçeklikte var olan, kendinden emin bir dille ifade edilmiş bilgiler ortaya koyar. Bu bir hata değil; olasılıksal token tahmininin nasıl çalıştığının doğrudan bir sonucudur. Model, gerçeğe değil, inandırıcılığa göre optimize edilmiştir.

Çoğu görevde bu kabul edilebilir. ChatGPT az bilinen bir kütüphanede var olmayan bir işlev uydurursa, programcı bir derleyici hatası alır ve düzeltir. Bir filmin tarihini yanlış verirse, kimse zarar görmez.

Tıpta maliyet farklıdır. Bir bot, var olmayan bir referans aralığını kendinden emin bir şekilde “hatırlayabilir”. Literatürde hiç yer almamış iki belirteç arasında bir ilişki önerebilir. Bir belirtiyi hafifleten bir ilacın adını verirken, modelin “hesaba katmadığı” bir kontrendikasyonu atlayabilir. Ve tüm bunlar, Fransa’nın başkentine ilişkin bir soruyla aynı sakin, kendinden emin tonda sunulur.

Uzmanlaşmış sistemler bunu katı güvenlik sınırlarıyla çözer: analiz modülü yalnızca önceden yüklenmiş klinik kılavuzların içinde akıl yürütür. Bir kural yoksa, sistem bir tane uydurmak yerine “yetersiz veri” yanıtını verir.

Gizlilik: PDF’inizi ChatGPT’ye yükledikten sonra ne oluyor

Bu, neredeyse hiç kimsenin düşünmediği kısım. Ücretsiz ya da Plus bir ChatGPT hesabına bir tahlil raporu yüklediğinizde, o dosyaya gerçekte ne olur?

OpenAI’nin güncel politikasına göre, bireysel ürünlerdeki (ChatGPT Free, Plus, Pro) sohbetler varsayılan olarak modelleri geliştirmek için kullanılabilir. Veri kontrolleri üzerinden bunu manuel olarak kapatabilir ya da Temporary Chat kullanabilirsiniz – ama çoğu kullanıcı bunu yapmaz. Kurumsal paketlerde (Team, Enterprise, API) veriler varsayılan olarak eğitim için kullanılmaz, ama tipik son kullanıcı bu paketlerde değildir.

Bir tahlil raporu genellikle şunları içerir: ad soyadınız, doğum tarihiniz, bazen bir adres, sigorta ya da poliçe numarası, laboratuvarın ve tetkiki isteyen hekimin adı. ABD’deki HIPAA ve AB’deki GDPR çerçevelerine göre bu, özel nitelikli kişisel sağlık verisidir (ABD’de Korunan Sağlık Bilgisi ya da PHI; GDPR’ın 9. maddesine göre “özel nitelikli veri” olarak adlandırılır). Hastaneler, klinikler ve HIPAA kapsamındaki hizmetler bu tür verileri Business Associate Agreements kapsamında işlemekle yükümlüdür; kendi dosyasını yükleyen bir kişiye karşı bireysel kullanıcılara yönelik bir sohbet ürününün böyle bir yükümlülüğü yoktur. Resmî olarak hasta herhangi bir yasayı çiğnemiyor – kendi verileriniz üzerinde kontrol uyguluyorsunuz – ama aynı zamanda sonra ne olacağına dair hiçbir görünürlüğünüz de yok.

Paranoya savunuculuğu yapmıyorum. Çoğu insan tahlillerini yükler ve hayat devam eder. Ama tıbbi gizlilik sizin için biraz olsun önemliyse, bu, korunan bir ortamda çalışan ve dosyalarınızla ne yaptığını sade bir dille anlatan hizmetleri kullanmak için gerçek bir gerekçedir.

Genel amaçlı yapay zekâ ne zaman özellikle tehlikeli

En tehlikeli durum, izole bir belirteç değildir – onlarca parametre arasındaki ilişkiyi görmeniz ve klinik bağlamı anlamanız gereken durumdur. Birkaç tipik tuzak:

  • Büyük paneller (aynı anda 15+ belirteç). Lost in the Middle devreye girer: model, ilk ve son satırlar hakkında kendinden emin yorum yaparken ortadaki ince ama önemli kaymaları gözden kaçırır.
  • Tümör belirteçleri. “Aralığın üstünde = kötü, aralık içinde = iyi” sezgisi tamamen çöker. Birçok tümör belirteci iyi huylu süreçlerde yükselir ve doğrulanmış tümörü olan birçok hastada değerler normal aralıktadır. Genel amaçlı modeller, ya yersiz yere korkutan ya da yanlış biçimde rahatlatan şablon yanıtlar üretme eğilimindedir.
  • İltihaptan bağımsız okunan ferritin. Klasik bir tuzak: ChatGPT yüksek ferritin görür ve “Sizde çok fazla demir var, daha az kırmızı et yiyin” der. Oysa ferritin bir akut faz proteinidir ve yükselmesi çoğu zaman demir depolarını değil, sistemik iltihabı yansıtır. Aynı anda C-reaktif proteine ve tam kan sayımına bakmadan, “demir yükü” okuması bir hatadır.
  • Çocuklarda tahliller. Çocuklarda referans aralıkları aylık yaşa göre değişir. Genel amaçlı modeller düzenli olarak yetişkin aralıklarını “işin içine karıştırır” ve ebeveynler ya yersiz bir alarm ya da yanlış bir rahatlama alır.

Önemli parametrelerde karşılaştırma

Tüm tablo, tek bir çizelgeye sıkıştırılmış hâliyle:

ParametreGenel amaçlı ChatGPTUzmanlaşmış tıbbi yapay zekâ (Wizey)
MimariTek büyük LLM, üretken yanıtİşlem hattı: OCR → ayrıştırma → klinik kılavuzlar üzerinde RAG
Sayısal veri çıkarma doğruluğuOrta; belge ortasında düşer (Lost in the Middle)Garanti – her belirteç yapılandırılmış bir nesneye ayrıştırılır
Halüsinasyona karşı korumaAsgari; yanıt inandırıcılığa göre optimize edilirKatı güvenlik sınırları; yanıt protokollerle sınırlı
İşlenen veri hacmiBüyük panellerde düşerZiyaret başına 100+ belirteçte kararlı
İlişki keşfiGenel örüntüler, garanti yokTüm gruplarda sistematik çapraz karşılaştırma
Çok yıllı değişimOturumlar arası izlenmezEğilimler ve ziyaretten ziyarete karşılaştırma
Uzmana yönlendirmeGenel geçer (“bir doktora görünün”)Belirli klinik algoritmalara dayalı
Kullanıcı açısından gizlilikVeriler eğitim setlerine girebilir, sunucular küreselKorunan ortam, açık veri işleme
En uygun kullanımTerim açıklama, çeviri, genel sorularTahlil yorumu, ziyaret hazırlığı, değişimi izleme

Elinde yeni tahlil sonuçları olan hastalar için adım adım algoritma

Kısa versiyon: belirteçleri tek tek Google’da aramayın ve gördüğünüz ilk sohbet botuna her şeyi yapıştırmayın. Sistemli çalışın.

  1. Panik yapmayın. Referans aralığı, görünürde sağlıklı insanların yaklaşık %95’ini kapsayan banttır. Tanım gereği, sağlıklı insanların yaklaşık %5’i bunun dışında kalır. Aralık dışı bir değer, bir tanı değil, araştırma için bir işarettir.
  2. Verilerinizi tek bir yerde toplayın. Birkaç yıllık sonucunuz varsa, bu altın değerindedir. En önemli sinyallerin birçoğu mutlak değerlerde değil, eğilimlerde gizlidir.
  3. Veri kaybetmeyen bir araç kullanın. Bu, uzmanlaşmış bir hizmet ya da yapılandırılmış bir tablo olabilir – önemli olan, her sayının hesaba katılmasıdır.
  4. İzole sayılar değil, sendromlar arayın. Glukoz + HbA1c + trigliserid + HDL birlikte, metabolizmanız hakkında tek başına herhangi bir değerden çok daha fazlasını anlatır.
  5. Doğru uzmanı belirleyin. İyi bir tahlil yorumunun en büyük getirisi çoğu zaman, bir pratisyen hekime mi, endokrinoloğa mı yoksa hematoloğa mı görünmeniz gerektiğini bilmektir. Bu, haftalarca sürecek gerginlikten ve paradan tasarruf ettirir.
  6. Randevuya hazırlıklı gidin. Belirli sorular oluşturun. Bir doktorun “TSH değerim şu serbest T4 ile birlikte subklinik hipotiroidiye işaret edebilir mi?” sorusuna yanıt vermesi, “şu kötü değerleri düzeltin lütfen” demekten daha kolaydır.

ChatGPT tıbbi bağlamda gerçekten ne zaman işe yarar

Bu yazının tek yanlı okunmasını istemem. Genel amaçlı LLM’ler tıpta gerçekten yararlıdır – yalnızca en sık kullanıldıkları yerde değil. Kendi kullandığım birkaç senaryo:

  • Terim açıklama. Sedimantasyonun ne olduğu, direkt ve indirekt bilirubin arasındaki fark, “eozinofili”nin ne anlama geldiği – ChatGPT kavramları düzgün açıklar.
  • Tıbbi belgelerin çevirisi başka dillerden, bağlama ilişkin notlarla birlikte.
  • Bir soru listesi hazırlama – belirtilere ve genel bağlama dayanarak doktora yöneltilecek sorular.
  • Tıbbın alışılmadık bir alanında yönlenme – böyle bir uzmanlık dalının var olduğunu, tedavi yaklaşımlarının nasıl göründüğünü, daha derin okuma için hangi anahtar kelimelerin kullanılacağını öğrenme.
  • Bilimsel makaleleri okumaya yardım, bir konuda zaten derinleşmeye başladığınızda.

Kötü yaptığı şeyler: belirli tahlil değerlerini yorumlamak, tanı koymak, birden çok ziyaretteki değişimi değerlendirmek ve ilaç önermek. Bunların hepsi kavram açıklamayla değil, veri hassasiyetiyle ilgilidir. Ünlü Kung et al. (2023, PLOS Digital Health) çalışması – hani şu “ChatGPT, USMLE’yi geçti” denen çalışma – aslında sınırda bir performans (yaklaşık %60) bildirdi ve yazarların kendisi, vinyet sorularını yanıtlamanın klinik düşünmeyle aynı şey olmadığını vurguluyor. Yapay zekâ bir klinisyen gibi akıl yürütebilir; ama bir klinisyenin sorumluluğunu taşımaz. Bunlar farklı şeylerdir.

Mini SSS

Uzmanlaşmış bir tıbbi yapay zekâ yine de hata yapabilir mi? Evet. Herhangi bir yapay zekâ bir karar destek aracıdır, bir kâhin değil. Ama tahlil sonuçlarınızdan bir değeri atlaması ya da var olmayan bir tanı uydurması olasılığı, iyi tasarlanmış bir sistemde katı ayrıştırma ve klinik kılavuzlarla sınırlı bilgi getirme sayesinde en aza indirilir.

Doktorum zaten tahlillere bakacaksa neden bir yapay zekâya ihtiyacım var? Randevuya yapılandırılmış verilerle ve somut sorularla gitmeniz için. Randevu süresi sınırlıdır ve ilk 15 dakika sayılarınızı deftere geçirmeye giderse, analiz için neredeyse hiçbir şey kalmaz.

Wizey aynı anda kaç belirteç analiz edebilir? Gerçek pratikte ziyaret başına 100+. Biyokimya, hormonlar, tam kan sayımı, pıhtılaşma, lipid profili hepsi bir arada. Analiz modülü, bir sayıyı bile düşürmeden tüm gruplarda paralel olarak ilişkiler arar.

Birkaç yıl öncesine ait eski tahlilleri yükleyebilir miyim? Yapabileceğiniz en yararlı şey budur. Tıp, değişimle ilgilidir. Kimse beş yıla yayılan yüzlerce sayıyı kafasında tutamaz; iyi bir hizmet eğilimleri anında oluşturur.

İleri düzey bir kullanıcıysam – tahliller için ChatGPT’yi kullanabilir miyim? Kullanabilirsiniz, ama dikkatli olun. Lost in the Middle etkisini ve halüsinasyonları unutmayın, sayısal eşikleri referans kaynaklarına göre iki kez kontrol edin ve gizlilik politikasını anlamadan hassas belgeleri bireysel bir pakete yüklemeyin.

Sonuç

Yapay zekâ, kendi sağlığımızla nasıl ilgilendiğimizi değiştirdi ve genel olarak bu iyi bir şey. Ama genel amaçlı bir dil modeli ile uzmanlaşmış bir tıbbi yapay zekâ, iki farklı araçtır. Mimari açıdan eşit derecede “zeki”dirler, ama farklı işler için kurulmuşlardır.

Özellikle tahlil yorumu için tasarlanmış – yukarıda anlattığım her şeyi ciddiye alan – bir aracı denemek isterseniz, Wizey’i tam da bunun için geliştirdik. Hiçbir şeyi “iyileştirme” vaadi yok. Yalnızca şunun garantisi: tahlil sonuçlarınızdan hiçbir sayı kaybolmayacak ve sunduğu her sonucu doktorunuza güvenle götürebileceksiniz.

Sıkça sorulan sorular

Uzmanlaşmış bir tıbbi yapay zekâ yine de hata yapabilir mi?

Evet. Herhangi bir yapay zekâ bir karar destek aracıdır, bir kâhin değil. Ama katı veri ayrıştırması ve klinik kılavuzlarla sınırlı bilgi getirme sayesinde, sistemin tahlil sonuçlarınızdan bir değeri atlaması ya da var olmayan bir tanı uydurması olasılığı en aza iner.

Doktorum zaten tahlillere bakacaksa neden bir yapay zekâya ihtiyacım var?

Böylece randevuya yapılandırılmış verilerle, öne çıkarılmış ilişkilerle ve belirli sorularla gelirsiniz. Muayene süresi kısadır. İlk 15 dakika sayılarınızı dosyaya geçirmeye giderse, gerçek analiz ve strateji için neredeyse hiçbir şey kalmaz.

Wizey aynı anda kaç laboratuvar belirteci analiz edebilir?

Gerçek kullanıcılar tek bir ziyaretten 80, 100, hatta 150+ belirteç içeren PDF’ler yükler – biyokimya, hormonlar, tam kan sayımı, pıhtılaşma paneli, lipid profili. Her sayı analize girer ve sistem tüm gruplarda paralel olarak ilişkiler arar.

Birkaç yıl öncesine ait eski tahlilleri yükleyebilir miyim?

Yapabileceğiniz en yararlı şey budur. Tıp, dinamiğin bilimidir. Hiçbir insan beş yıla yayılan yüzlerce sayıyı kafasında tutamaz, ama iyi bir hizmet eğilimleri anında oluşturur ve önemli değişiklikleri işaretler.

Tıbbi belgeleri ChatGPT'ye yüklemek güvenli mi?

Bireysel paketlerde (Free, Plus, Pro), sohbetleriniz varsayılan olarak modelleri geliştirmek için kullanılabilir. Bunu manuel olarak kapatabilirsiniz, ama çoğu insan kapatmaz. Tahlil raporları özel nitelikli kişisel sağlık verisi içerir; bu yüzden korunan bir ortamda çalışan ve veri politikasını açıkça anlatan hizmetleri kullanmak daha iyidir.

Tıbbı anlayan ileri düzey bir kullanıcıysam – yine de ChatGPT'yi kullanabilir miyim?

Kullanabilirsiniz, ama dikkatle: Lost in the Middle etkisini ve LLM’lerin halüsinasyon eğilimini unutmayın, sayısal eşikleri referans kaynaklarına göre iki kez kontrol edin ve gizlilik politikasını önce anlamadan hassas belgeleri bireysel bir pakete yüklemeyin.

Kaynaklar