Bir tıbbi yapay zekâ (YZ) şirketinde ürün tarafında çalıştığım için, bu seride bana Gemini’yi başka her rakipten daha çok soruyorlar. Vaat gerçekten cezbedici: tahlil PDF’inizi okuyan, tansiyon aletinizin fotoğrafına bakan, yürüyüşünüzü değerlendirmek için sizi yürürken çeken 30 saniyelik videoyu izleyen ve tüm bunları 1 milyon+ tokenlik bir bağlamla sentezleyen tek bir model. Google, çok modluluğu sonradan eklenmiş değil doğal hissettirmek için ciddi bir mühendislik emeği harcadı.
Bunu görünce ilk içgüdü şu oluyor: “işte, bu OCR sorununu çözer.” Çözmez. Sorunu bir katmandan başka bir katmana taşır ve bunu yaparken uzmanlaşmış bir işlem hattının hassasiyetini, genelci bir modelin esnekliğiyle takas eder. Bu yazı, bu takasın bir hasta için ne zaman değdiğine, ne zaman kesinlikle değmediğine ürün gözüyle bakışımdır.
Gemini gerçekte neyi farklı yapıyor
Gemini teknik anlamda doğuştan çok modludur (multimodal): görme yetisi sonradan eklenmek yerine, Google DeepMind’ın Gemini teknik raporunda anlatıldığı gibi, iç içe geçmiş metin, görsel, ses ve video üzerinde önceden eğitilmiştir. Pratikte bu, tek bir ileri geçişin bir tahlil PDF’ini, bir ilaç kutusunun fotoğrafını ve bir hastanın sorusunu alıp tek bir yanıt üretebilmesi demektir – her modaliteyi ayrı bir modelden geçirip çıktıları birbirine dikmek yerine.
Temiz, yapılandırılmış girdilerde sonuç etkileyicidir. İyi taranmış, değerleri temiz bir tabloda düzgünce basılı bir Quest Diagnostics ya da LabCorp PDF’i saniyeler içinde çıkarılır ve özetlenir. Gemini hangi belirteçlerin aralık dışında olduğunu doğru biçimde işaret eder, her birini kabaca açıklar ve çoğu zaman bariz birliktelikleri fark eder (örneğin yüksek LDL ile düşük HDL). Kendi sahasında – temiz, tablo hâlindeki veride – pazarlamanın vaat ettiğini elde edersiniz.
Ürün açısından asıl soru şu: girdi ne sıklıkla temiz oluyor?
Dağınık belge sorunu
Kullanıcı araştırmalarımızda aynı örüntüyü defalarca görüyorum. Hastalar tertemiz tahlil PDF’leriyle gelmiyor. Şunlarla geliyorlar:
- Bir klinik koridorundaki tepe lambasının yansımasıyla, açılı çekilmiş telefon fotoğrafları
- Sıkıştırmada sol sütunun sağa taştığı iki sütunlu düzenler
- Bir hemşirenin karaladığı el yazısı notlar
- Dördüncü sayfası, fakslanmış bir kopyanın yeniden fakslanmış kopyası olan çok sayfalı paneller
- Kendine özgü biçimlendirmesi olan küçük bölgesel sağlayıcılara ait laboratuvar formları
Bu girdilerde, Gemini’nin çok modlu okuması, çıktıdan tespit edilmesi zor biçimlerde bozulur. Bir değer 1,4 yerine 14 olarak yanlış okunabilir, bir alanin aminotransferaz (ALT) satırı aspartat aminotransferaz (AST) satırına çekilebilir, satırı bir zımba gölgesiyle kısmen örtülmüş bir belirteç sessizce atlanabilir. Gemini’nin döndürdüğü yanıt yine de akıcı okunur – yalnızca, hafifçe yanlış bir tabloya dayanıyordur. Tıpta çok modlu temel modeller (The Lancet Digital Health, 2024) üzerine bir araştırma, bu örüntüyü görme yeteneğine sahip LLM‘ler genelinde belgeliyor.
Aynı sorun diğer genelci modelleri de etkiliyor. Yakından ilişkili bu hata biçimini Wizey vs ChatGPT ana karşılaştırmasında ele almıştım: üretken bir yorum, ancak içine giren tokenler kadar iyidir ve tokenler her zaman doğru olmayan bir okuma adımına bağlıdır.
Yapılandırılmış çıkarma ile üretken okuma
Asıl önemli olan mimari fark budur. Wizey iki aşamada çalışır:
- Yüzlerce sağlayıcıya ait laboratuvar formları üzerinde eğitilmiş, çok sütunlu düzenleri, el yazısı eklemeleri ve düşük kaliteli taramaları açıkça ele alan uzmanlaşmış bir tıbbi OCR. Çıktı, yapılandırılmış bir kayıttır: {belirteç, değer, birim, alt referans, üst referans, işaret, tarih, numune}.
- O yapılandırılmış kayıt üzerinde çalışan, bir tıbbi bilgi grafiğine ve doğrulanmış klinik yolaklara dayanan bir klinik akıl yürütme katmanı. Ham pikselleri bir daha asla okumaz.
Gemini her iki adımı tek bir üretken geçişte birleştirir. Bu zariftir ve temiz girdilerde hızlı ve doğrudur. Ama ortada yapılandırılmış bir ara ürün yoktur. Çıkarma yanlış olduysa, bunu göremezsiniz. Yorum yanlış olduysa, geriye doğru izleyip doğru değere ulaşamazsınız. Ürün açısından güvenlik hikâyesinin yarısı olan hata ayıklanabilirlik ortadan kalkar. Bir JMIR Medical Informatics çalışması (2024), uzmanlaşmış, yapay zekâ destekli laboratuvar test denetleyicilerinin acil güvenlik vakalarında %100 duyarlılıkla %74,3 tanısal doğruluğa ulaştığını buldu – genelci çok modlu modellerin ortaya koymadığı düzeyde doğrulanmış bir performans.
1 milyonluk bağlam yanılsaması
Gemini’nin milyon tokenlik bağlamı etkileyicidir ve Google’ın pazarlaması bunu boylamsal kullanım senaryoları için öne çıkarır – “son beş yıllık tahlillerinizi yükleyin, bir eğilim analizi alın.” Pratikte, Liu et al. (2023) tarafından tanımlanan Lost in the Middle etkisi hâlâ geçerlidir: dikkat, uzun bir istemin kenarlarında en güçlü, ortasında daha zayıftır. On yıllık bir geçmişin üçüncü yılına ait bir glukoz değeri, birinci ya da onuncu yıla ait değerle aynı muameleyi görmez.
Daha da önemlisi, tahlillerin boylamsal analizi özünde bir zaman serisi problemidir. HbA1c değerini 20 ziyaret boyunca grafiğe döküp eğimi görmek istersiniz; bunu paragraflarla anlatmak istemezsiniz. Wizey, çıkarılan her değeri bir zaman serisinde bir satır olarak saklar ve eğilimleri doğrudan hesaplar. Uzun bağlamlı bir LLM bunu yaklaşık olarak yapabilir, ama “işe uygun araç” argümanı güçlü biçimde yapılandırılmış depolamadan yana.
PDF’lerin ötesinde çok modluluk – Gemini’nin önde olduğu yer
Hakkını verelim: Gemini’nin çok modluluğunun, uzmanlaşmış bir işlem hattının bugün yapabileceğinin gerçekten önüne geçtiği bir alan var. Canlı, sohbet tarzı kullanım – telefonunuzu bir ilaç etiketine tutun, bir soru sorun, etikete atıfta bulunan bir yanıt alın – Gemini’nin meşru bir başarısıdır. Videoya kaydedilmiş bir doktor görüşmesini özetlemek makuldür. El yazısı bir uzman mektubunu tek seferlik okumak mümkündür.
Ürün diliyle: Gemini harika bir evrensel okuma aracıdır. Sorun şu ki, “bir tahlil PDF’ini okumak” dışarıdan evrensel bir okuma göreviymiş gibi görünür, ama içeriden uzmanlık gerektiren bir görevdir. Problemin biçimi, görünürdeki girdi modalitesinden daha önemlidir.
Gizlilik: tüketici ile kurumsal ayrımı
Google Cloud Vertex AI üzerindeki Gemini API’si, uygun müşteriler için Google’ın BAA’sı kapsamına alınabilir; bu, gerçek Korunan Sağlık Bilgisi’ni Gemini üzerinden işleyen herhangi bir klinik ya da platform için doğru yoldur.
gemini.google.com adresindeki tüketici Gemini uygulaması ve kişisel Google Workspace içindeki Gemini özellikleri bir BAA taşımaz. Hızlı bir okuma için oraya bir tahlil PDF’i yüklemek hastalar arasında yaygın bir alışkanlıktır ve aynı zamanda açık bir PHI ifşasıdır – çoğu kullanıcının, yarattığının farkında olmadığı bir ifşa. Bu ayrım arayüzde görünmezdir; bu da sağlık bağlamında gerçek bir ürün kusurudur.
Hasta kullanımı için özel olarak geliştirilen Wizey, kullanıcılardan ürünün hangi sürümünde olduklarını düşünüp çözmelerini istemez.
Yan yana karşılaştırma
| Boyut | Gemini (Google) | Wizey |
|---|---|---|
| Belge okuma | Doğuştan çok modlu, temiz girdilerde güçlü | Uzmanlaşmış tıbbi OCR, dağınık gerçek dünya taramalarında sağlam |
| Çıktı biçimi | Üretken düz metin | Yapılandırılmış kayıt + düz metin yorum |
| Hata ayıklanabilirlik | Düşük – tek geçiş, ara ürün yok | Yüksek – çıkarılan her değer görünür ve düzenlenebilir |
| Boylamsal analiz | İstem tabanlı, Lost in the Middle’dan etkilenir | Doğuştan zaman serisi şeması |
| Bilgi dayanağı | İstatistiksel iz + Med-PaLM kökeni | Özenle derlenmiş tıbbi bilgi grafiği |
| HIPAA BAA | Vertex AI için var, tüketici Gemini için yok | Hasta kullanımı için yerleşik |
| En uygun kullanım | Evrensel okuma, video/ses, modaliteler arası görevler | Uçtan uca tahlil yorumu, eğilim takibi, işaretleme |
Mini SSS
Tahlil raporumun bir fotoğrafını Gemini’ye yükleyip güvenilir bir okuma alabilir miyim? Bir okuma alabilirsiniz. Temiz PDF’lerde çoğu zaman doğrudur. Telefon fotoğraflarında, eğri taramada, parlamada, el yazısında ya da iki sütunlu düzenlerde çıkarma hataları sıktır ve akıcı bir düz metin olarak döndürülür; bu yüzden tespit edilmesi zordur.
1 milyon+ bağlam, Gemini’nin yılların tahlillerini daha iyi işlediği anlamına mı gelir? Yalnızca yüzeyde. Lost in the Middle, bağlamın ortasındaki hatırlamayı hâlâ zayıflatır ve boylamsal tahlil analizi bir uzun istem problemi değil, bir zaman serisi problemidir.
Gemini, tıbbi belgeler için HIPAA uyumlu mu? Google BAA’lı Vertex AI dağıtımında, evet. Tüketici Gemini uygulamasında, hayır.
Wizey’in OCR’ı, Gemini’nin doğal görüşünden nasıl farklı? Wizey, akıl yürütmeden önce doğrulanmış, yapılandırılmış bir şemaya çıkarır – her belirteci birimi ve referans aralığıyla birlikte. Gemini ise ara ürün olmadan tek bir üretken geçişte okur.
Gemini, sağlık konusunda gerçekten ne zaman yardımcı olur? Çeviri, açıklama, özetleme, soru hazırlama. Mükemmel bir okuma ve yazma aracıdır; dağınık taramalar üzerinde uzmanlık gerektiren sayısal çıkarım onun güçlü yanı değildir.
Sonuç
Gemini, bugün tüketicilerin erişebildiği en esnek çok modlu modeldir ve pek çok gündelik okuma görevi için gayet iyi bir seçimdir. Ama gerçek dünyadan bir tahlil PDF’ini – taranmış, fotoğraflanmış, fakslanmış, bazen el yazısı – güvenilir, yapılandırılmış bir yoruma dönüştürme özel işinde, uzmanlaşma hâlâ esnekliği geçer.
Wizey tam da bu niş için kuruldu: dağınık girdilerden sağ çıkan bir tıbbi OCR işlem hattı, boylamsal analizden sağ çıkan yapılandırılmış bir şema ve düz metin olasılığına değil, doğrulanmış klinik yolaklara dayanan bir akıl yürütme katmanı. Genelci LLM’lerin tıpta nereye oturduğuna ve nerede başarısız olduğuna dair daha derin tartışmayı isterseniz, Wizey vs ChatGPT ana karşılaştırma yazısı bu yazının tamamlayıcısıdır.



