Blog makalesi

Wizey vs Perplexity: tıpta yapay zekâ atıfları güvenilir mi?

Perplexity kaynakları satır içinde gösterir; yanıtları güvenilir görünür. Ama atıf, doğruluk demek değildir. Tıbbi RAG açık web değil, derlenmiş külliyat ister.

Sağlıkta yapay zekâ Tahliller ve tanı Sağlık ve korunma
Wizey vs Perplexity: tıpta yapay zekâ atıfları güvenilir mi?

Perplexity, ChatGPT’nin daha olgun sürümü gibi geliyor. Bir soru soruyorsunuz, akıcı bir yanıt alıyorsunuz ve tam orada, dipnotlarda kaynaklar duruyor. Arayüz temiz, atıflar yetkin görünüyor ve – tahlil sonuçlarına bakan bir hasta için kritik olan nokta – tüm deneyim şunu ima ediyor: “kaynak gösterildiği için bu güvenilirdir.”

Ürün tasarımı açısından Perplexity gerçekten zekice bir şey yaptı: RAG’ı (Retrieval-Augmented Generation) bireysel bir deneyim olarak sundu ve bilgi getirme sürecini görünür kıldı. Bu, gerçek bir başarı. Ama kullanıcıların yıllarca tıbbi yapay zekâ (YZ) ile nasıl etkileştiğini izlemiş biri olarak şunu söyleyebilirim: bu güven sinyali, altındaki sistemin tam olarak hak etmediği bir işi üstleniyor. Bu yazıda Perplexity’nin nerede parladığını, özellikle tıpta nerede başarısız olduğunu ve mimari benzese de özenle derlenmiş bir külliyat üzerinde çalışan Wizey tarzı bir RAG’ın neden farklı bir ürün olduğunu anlatmak istiyorum.

Perplexity aslında nedir

Perplexity, arama destekli bir LLM ürünüdür. Kaputun altında bir sorgu, web’de canlı bir arama tetikler; en iyi sonuçlar getirilip parçalara bölünür, parçalar vektörlere gömülür, en ilgili parçalar sorguyla birlikte bir LLM‘e – çoğu zaman GPT, Claude veya Perplexity’nin kendi Sonar modeline – verilir ve modele, her iddiaya atıf yaparak bu parçaları kullanıp yanıt vermesi söylenir. Bu, Lewis et al. (2020) tarafından tanımlanan ders kitabı düzeyinde bir RAG’dır; hızlı ve çekici bir arayüzle sarmalanmıştır.

Temel mühendislik tercihleri şunlar: açık web’den gerçek zamanlı getirme, sentez için genel amaçlı bir LLM kullanma ve atıfları satır içinde gösterme. Bu birleşim, hem güçlü yanlarının hem de tıbbi zayıflıklarının kaynağıdır.

Neler işe yarıyor: genel bilgi, güncellik, kaynak görünürlüğü

Klinik olmayan sorularda Perplexity mükemmeldir. Güncelliğin önemli olduğu her konuda – yeni ürün çıkışları, politika değişiklikleri, piyasa gelişmeleri – statik LLM’leri geride bırakır, çünkü sorgu anında web’i gerçekten okur. Atıflar tıklayıp doğrulamanıza olanak tanır; bu, sizden eğitimine güvenmenizi isteyen saf bir sohbet botuna kıyasla gerçek bir disiplindir. Bir JAMA analizi (2023), görünür kaynak göstermenin yapay zekâ yanıtlarına duyulan güveni – iyisiyle kötüsüyle – belirgin biçimde artırdığını belirtti.

Literatür taraması yapan bir klinisyen için, akademik odaklı aramasıyla Perplexity Pro gerçekten yararlı bir kütüphane aracı olabilir. Bir atıfta neye bakacağınızı biliyorsanız, zaman kazandırır.

Tahlil PDF’ini yorumlamaya çalışan bir hasta içinse aynı özellikler bir yüke dönüşür. Bunun nedenini açmakta yarar var.

Tıpta atıflar neden doğrulukla eş değildir

Hastalar tahlil yorumu için Perplexity kullandığında üç belirgin başarısızlık biçimi tekrar tekrar ortaya çıkar:

1. Kaynak gerçektir, ama desteklediği iddia, kaynağın aslında söylediği şey değildir. Getirilen metnin bir parçasını özetleyen bir LLM, konudan sapabilir. Perplexity, meşru bir NIH sayfasına atıf yaparken o NIH sayfasında yer almayan bir iddiada bulunabilir; sayfa ile iddia birbirine anlamsal olarak değil, istatistiksel olarak yakındır. The Lancet Digital Health (2024) dergisinde belgelenen araştırma, bu örüntüyü birden çok RAG sisteminde gösteriyor: atıflar, olgusal doğruluğu artırmadan da algılanan güveni yükseltir.

2. Kaynak meşru görünür ama tıbbi açıdan yetkin değildir. Perplexity’nin getirme mekanizması, açık web’i külliyatı olarak ele alır. Sıralamada üst sıralarda çıkan bir sağlık blogu, bir Healthline özeti, bir Medium yazısı, popüler bir Reddit tıp başlığı – bunlar PubMed ve Mayo ile yan yana, sık sık atıflarda görünür. Bir hastanın bunları tartmasının kolay bir yolu yoktur. Hakemli klinik kılavuzlar, bir sağlıklı yaşam influencer’ının gönderisinin hemen yanında durur; ikisi de aynı dipnot biçimiyle gösterilir.

3. Seçici alıntı (cherry-picking) sorunu. RAG, sorgunun yakınına gömülen parçaları getirir. İncelikli bir tıbbi konuda, sorguyla en ilgili parça çoğu zaman bağlamından kopuk, kılavuzun tamamını yansıtmayan bir cümledir. Örneğin “yüksek ferritin her zaman demir yükü müdür” sorusu, ferritinin demir depolarıyla birlikte yükseldiğini belirten bir parçayı getirebilir; bu, tek bir durumda doğru, ama çok daha yaygın olan iltihap durumunda son derece yanıltıcıdır. Atıf yapılan cümle doğrudur; ondan kurulan yanıt yanlıştır.

Ferritin örneği, somut olarak

Sık gördüğüm gerçek bir örüntüyü adım adım anlatayım. Bir hasta Perplexity’ye soruyor: “ferritinim 450, bu ne anlama geliyor?” Tipik bir yanıt; demir yükü, hemokromatoz ve karaciğer hastalığından söz eden parçaları çeker, MedlinePlus’a atıf yapar ve bu durumlar hakkında ölçülü görünen bir metin üretir. Yetkin görünür.

Kullanıcı soruyu tam olarak doğru biçimde kurmadıkça tipik olarak gözden kaçırdığı şey şudur: ferritin bir akut faz reaktanıdır. İltihap varlığında – enfeksiyon, otoimmün alevlenme, yakın zamanda geçirilmiş ameliyat, obeziteye bağlı düşük dereceli iltihap – ferritin, gerçek demir depolarından bağımsız olarak yükselir. Ferritin hakkındaki MedlinePlus kaynağı bu noktayı açıkça vurgular. Doğru klinik yorum, CRP (C-reaktif protein) ile tüm demir panelinin (serum demiri, transferrin satürasyonu, TDBK) birlikte okunmasına bağlıdır. Bu birlikte okuma olmadan, “yüksek ferritin” yanıtı tek başına yanlış değildir; yalnızca yanlış bir çerçevede işliyordur.

Wizey bunun üstesinden gelir, çünkü işlem hattı ferritini ve CRP‘yi ve demir panelini PDF’inizden yapılandırılmış değerler olarak çıkarır; yorum katmanının bilgi grafiğinde ise akut faz yorumuna dair açık kurallar vardır. Perplexity ile aynı getirme mimarisi örüntüsü, tamamen farklı bir külliyat ve tamamen farklı kısıtlar.

RAG kalitesi bir külliyat sorunudur, kullanıcı deneyimi sorunu değil

Bunu okuyan mühendislerin duymasını istediğim nokta bu. Perplexity’nin kullanıcı deneyimi atıfları verir. Külliyatı ise açık web’dir. Neyi güvenilir biçimde yanıtlayıp yanıtlayamayacağınızı külliyat belirler.

Wizey’in RAG’ı mimari olarak benzerdir: ilgili parçaları çıkar, bir akıl yürütme katmanına ver, temellendirilmiş bir yanıt üret. Fark, külliyattadır – hakemli kılavuzlar (USPSTF, ACP, NICE, kardiyoloji ve endokrinoloji derneklerinin önerileri), süzülmüş referans aralıkları ve doğrulanmış klinik yollar üzerine kurulu, özenle derlenmiş tıbbi bir bilgi grafiği. Külliyatta Reddit yoktur. Külliyatta sağlık blogları yoktur. Ödünleşim şudur: daha az genişlik, çok daha yüksek güvenilirlik; ve Wizey’i geçen haftanın yapay zekâ haberlerini aramak için kullanamazsınız – yalnızca laboratuvar verilerini yorumlamak için.

Tıbbi yapay zekânın neden bu tür bir uzmanlaşma gerektirdiğine daha geniş bir bakış için, üretken ve çıkarıma dayalı yaklaşım arasındaki ayrımı derinlemesine ele alan Wizey vs ChatGPT temel karşılaştırmasını öneririm.

Gizlilik: bireysel Perplexity ve PHI

Perplexity’nin bireysel ürünü, standart gizlilik politikası uyarınca sorguları ve çıktıları hizmeti iyileştirmek için saklar. HIPAA kapsamında bir hizmet değildir ve korunan sağlık bilgisi (PHI) için tasarlanmamıştır. Perplexity Enterprise daha güçlü veri işleme sunar, ama bir BAA onun varsayılan duruşu değildir ve ürün, özünde hâlâ genel amaçlı bir arama aracıdır.

Tahlil değerlerini, üstbilgideki adını ve doğum tarihini bireysel bir Perplexity sohbetine yapıştıran bir hasta, bireysel bir arama ürününe PHI ifşa etmiş olur. Ürün, onları uyarmak için hiçbir şey yapmaz, çünkü bu kullanım senaryosu için tasarlanmamıştır.

Wizey, amaca özel geliştirilmiş diğer tıbbi yapay zekâlar gibi, korunan sağlık bilgisini uyumlu bir sınır içinde tutar ve laboratuvar verilerini tasarımı gereği korumalı kabul eder.

Perplexity gerçekten ne zaman işe yarar

Hak ettiği dengeli notla bitirmek gerekirse: Perplexity, sağlıkla ilişkili belirli görevler için iyi bir araçtır.

  • Uzman ziyaretinden önce bir ilaç veya hastalıkla ilgili güncel literatürü taramak
  • Bir kılavuzun yakın zamanda güncellenip güncellenmediğini kontrol etmek
  • Sonra kendiniz okuyabileceğiniz dar bir konuda yetkin kaynaklar bulmak
  • Hangi terimleri arayacağınızı öğrenmek için yabancı olduğunuz bir tıbbi alt alanda yön bulmak
  • Yerleşik çeviri bağlamıyla yabancı dildeki tıbbi haberleri okumak

Bunlar için gerçek zamanlı web getirimi bir avantajdır. Yalnızca şunu unutmayın: kendi sayısal tahlil sonuçlarınızı yorumlama gibi daha zor bir görevde, atıflar ne kadar düzgün görünürse görünsün, açık web yanlış külliyattır.

Yan yana karşılaştırma

BoyutPerplexityWizey
KülliyatAçık web, canlı getirilirÖzenle derlenmiş tıbbi bilgi grafiği + klinik protokoller
Atıf biçimiSatır içinde görünür, karışık otoriteÖrtük, her zaman doğrulanmış kaynaklardan
Tahlil PDF’lerini işlemeSayıları okur, web parçalarını yapıştırırYapılandırılmış çıkarım + protokole dayalı yorum
Belirteçler arası akıl yürütmeZayıf – getirilen parçalar ne diyorsa oBilgi grafiğinde açıkça tanımlı (ferritin × CRP, TSH × sT4)
Boylamsal takipDesteklenmiyorYerleşik zaman serisi
HIPAA BAABireyselde yok, Enterprise’da sınırlıHasta kullanımı için yerleşik
En uygun kullanımLiteratür taraması, güncellik, hızlı yön bulmaHastalar için uçtan uca tahlil yorumu

Mini-FAQ

Perplexity kaynak gösteriyorsa, bu tıpta neden yeterli değil? Atıf, iddianın yakınında bir kaynağın var olduğunu kanıtlar. O kaynağın söz konusu iddiayı doğruladığını kanıtlamaz. Perplexity, düzenli olarak, bir araya getirilen yanıtı aslında desteklemeyen gerçek sayfalara atıf yapar – özellikle incelikli klinik konularda.

Perplexity tahlil sonuçlarımı yorumlayabilir mi? Web parçalarını birbirine dikerek her belirteç hakkında yorum yapabilir. Yorumu doğrulanmış klinik protokollere dayandıramaz, ilişkili belirteçleri çapraz bağlayamaz veya eğilimleri takip edemez.

Perplexity HIPAA uyumlu mu? Bireysel Perplexity, hayır. Perplexity Enterprise daha sıkı bir veri işlemeye sahiptir ama yine de tıbbi düzeyde bir platform değil, genel amaçlı bir arama aracıdır.

Perplexity’nin RAG’ı ile Wizey’in RAG’ı arasındaki gerçek fark nedir? Külliyat. Aynı mimari örüntü; açık web’e karşı özenle derlenmiş tıbbi bilgi grafiği.

Perplexity sağlık alanında ne zaman işe yarar? Literatür taraması, güncellik kontrolleri, konuya yönelme – atıf yapılan kaynakları eleştirel biçimde değerlendirebilen kullanıcılar için.

Sonuç

Perplexity, RAG’ı güzel bir bireysel ürüne dönüştürdü ve klinik olmayan birçok soru için mevcut en iyi genel amaçlı yapay zekâ aracıdır. Görünür atıf sunan kullanıcı deneyimi, herhangi bir yapay zekâ sistemi için gerçekten yararlı bir disiplindir.

Ama tıpta, sistemin, güvenilirliği asıl belirleyen kısmı, kullanıcı deneyimi değil külliyattır. Açık web, bir hastanın tahlil yorumunu dayandırmak için yanlış bir yerdir. Wizey gibi uzmanlaşmış bir aracın üzerine kurulduğu şey, hakemli kılavuzlara ve doğrulanmış klinik yollara dayanan, özenle derlenmiş tıbbi bir bilgi grafiğidir. Aynı getirme örüntüsü, çok farklı bir vaat – ve kan tahlilinizi güvenle okumak gibi dar bir görevde asıl önemli olan, bu vaattir. Daha derin mimari tartışmayı isterseniz, Wizey vs ChatGPT temel yazısı bunu baştan sona ele alıyor.

Kaynaklar