Blog makalesi

Wizey vs DeepSeek R1: akıl yürütme tahlillerde işe yarar mı?

DeepSeek R1, sesli düşünen açık ağırlıklı bir akıl yürütme modeli. Düşünce zinciri tıbbi yapay zekâyı daha güvenli mi kılar, yoksa yalnızca daha inandırıcı mı?

Sağlıkta yapay zekâ Tahliller ve tanı Sağlık ve korunma
Wizey vs DeepSeek R1: akıl yürütme tahlillerde işe yarar mı?

DeepSeek, R1 akıl yürütme modelini 2025’in başında yayımladığında yapay zekâ (YZ) sektörünü sarstı. MIT lisansıyla açık ağırlıklar, kapalı ABD rakiplerinin bir büyüklük mertebesi altındaki fiyatlar ve OpenAI’nin kapalı akıl yürütme sistemleriyle aynı düzeyde matematik başarısına sahip, görünür bir düşünce zinciri (chain-of-thought, CoT – modelin yanıt vermeden önce “sesli düşünmesi”). Mühendislik ekibimiz tek bir soruyu yanıtlamak için haftalarca onu zorlu testlerden geçirdi: bu mimarinin tıbbi bir yapay zekâ işlem hattında (pipeline) gerçekten yeri var mı?

DeepSeek ailesi o zamandan beri büyüdü. 2026 baharında seri, hibrit akıl yürütme modu ve 1M tokenlik bağlam penceresine sahip DeepSeek V4, V3.2-Speciale (IMO 2025 altın madalyası) ve tek bir tüketici GPU’sunda çalışan, 32B parametreli kompakt bir R2 içeriyor. Teknoloji gerçekten etkileyici. Ama “etkileyici teknoloji” ile “tıp için uygun” aynı iddia değil.

Bu yazıda DeepSeek R1 ve ardıllarının mühendislik ayrıntılarını inceliyorum: akıl yürütme nasıl eğitiliyor, açık ağırlıklar oyunu nerede değiştiriyor, düşünce zinciri klinik bağlamlarda neden iki ucu keskin bir kılıç ve Wizey’in yapılandırılmış işlem hattı karşılaştırıldığında nasıl bir yerde duruyor. Genel amaçlı LLM’lerin laboratuvar raporlarını nasıl işlediğinin temelleri için – RAG, Lost in the Middle, halüsinasyonlar, HIPAA/GDPR – tıbbi yapay zekâ için Wizey vs ChatGPT başlıklı temel yazımıza bakın.

DeepSeek R1’i mimari açıdan farklı kılan ne

En göze çarpan fark akıl yürütme. Standart bir LLM “komut → yanıt” şeklinde çalışır. R1 ise önce uzun bir iç düşünce zinciri – çoğu zaman 2.000 ila 10.000 token – üretir ve ancak ondan sonra nihai yanıtı verir. Bunu doğrudan API’de görebilirsiniz: bir <think> bloğu, modelin tıpkı bir öğretmenin tahtada problem çözmesi gibi enine boyuna düşündüğünü gösterir.

Kaputun altında R1, bir Uzmanlar Karması (Mixture of Experts, MoE) omurgasıyla DeepSeek V3 üzerine kuruludur. Model, çok sayıda uzmanlaşmış “alt model” barındırır ve her sorguyu yalnızca ihtiyaç duyduğu alt kümeye yönlendirir; toplamda yüz milyarlarca parametreye makul bir çıkarım maliyetiyle böyle ulaşılır. Akıl yürütme yeteneğinin kendisi, klasik denetimli ince ayarla değil, GRPO (Group Relative Policy Optimization) ile pekiştirmeli öğrenme yoluyla eğitildi; bu, arXiv’deki özgün DeepSeek R1 makalesinde anlatılıyor ve sonradan Nature’da yayımlandı. Basitçe: modele “doğru yanıtlar” öğretilmedi; doğru yanıtlara ulaştığı için ödüllendirildi ve kendi kendini kontrol etme, hipotezleri sıralama ve geri izleme gibi stratejileri kendi başına keşfetti.

İkinci yapısal fark açık ağırlıklar. Her DeepSeek sürümü (V3, R1, V3.2, V4, R2) MIT lisansıyla Hugging Face’te yayımlanır. Herhangi bir şirket ağırlıkları indirebilir, kendi altyapısında çalıştırabilir, belirli bir görev için ince ayar yapabilir ve çıkarım için sağlayıcıya hiçbir ücret ödemez. GPT, Claude, Gemini gibi kapalı frontier (en gelişmiş) modeller için bu, mimari olarak imkânsızdır.

Açık ağırlıkların gerçekten kazandığı yer: gizlilik ve yerinde dağıtım

Açık ağırlıklar pazarlama söylemi değil; ekonomiyi ve uyumluluk tablosunu değiştiriyor. Bence DeepSeek’in en güçlü olduğu yer burası ve ana akım haberciliğin sonuçlarını hafife alma eğiliminde olduğu yer de burası.

Bulut akışında – chat.deepseek.com veya API – gizlilik, diğer sağlayıcılardaki gibidir: verileriniz Çin veri koruma mevzuatı kapsamında DeepSeek’in sunucularına gider. ABD veya Avrupa tıbbi verileri için bu kesin bir sınırdır: ne HIPAA ne de GDPR, korunan sağlık bilgilerinin denetimsiz sınır ötesi işlenmesine izin verir.

Açık ağırlıklar tabloyu tümüyle değiştirir. Modeli kendi donanımınıza dağıtabilirsiniz – bir hastane veri merkezi, bir araştırma laboratuvarı, hatta bir hekim iş istasyonu – ve hasta kaydının tek bir baytı bile çevrenizden çıkmaz. Pratik donanım hedefleri:

  • DeepSeek-R1-Distill-Llama-8B (damıtılmış – büyük modeli taklit etmek için eğitilmiş daha küçük bir model): yaklaşık 6 GB VRAM, RTX 3060 veya üzerinde çalışır.
  • DeepSeek-R1-Distill-32B: kabaca 20 GB VRAM – RTX 3090, RTX 4090 veya sunucu sınıfı bir T4/A10.
  • DeepSeek-R1-Distill-70B: yaklaşık 40 GB VRAM – iki RTX 4090 veya bir A100.
  • Tam DeepSeek-R1 (671B MoE): 1 TB’ın üzerinde toplam belleğe sahip, çok sayıda H100/A100’lü bir sunucu. Ev laboratuvarı için gerçekçi değil, klinik veri merkezi içinse sıradan.
  • 32B’lik R2: frontier kaliteye yaklaşırken tek bir tüketici RTX 4090’a (24 GB VRAM) sığar.

Bunu kapalı frontier modelleriyle karşılaştırın: GPT-5 veya Claude Opus için “modeli indirmek” hiç mümkün değildir – her istek sağlayıcının bulutuna gitmek zorundadır. DeepSeek ile ağınızın içindeki bir sunucuya Ollama veya vLLM kurabilir, yerel bir ön yüz bağlayabilir ve tüm iş akışını dış dünyaya kapalı (air-gapped) tutabilirsiniz. HIPAA ve GDPR’ye tümüyle uyarken dünya standartlarında bir LLM çalıştırmanın tek pratik yolu budur – ve bu, tıbbi yapay zekâyı değerlendiren hastane BT ekipleri için gerçek bir avantajdır.

Wizey’de, dahili bir araştırma kapsamında damıtılmış R1 türevlerini test ettik. Kalite, amiral gemisi kapalı modellere göre daha düşük; ancak iyi tanımlanmış görevlerde – anonimleştirilmiş ön işleme, dahili özetleme – yerel model işe yarayan bir araçtır.

DeepSeek’in kapalı frontier modellerini geçtiği yerler

Tek taraflı bir yazı olmasın diye: R1 ve ardılları “ucuz bir GPT kopyası” değil. Birçok boyutta nesnel olarak güçlüler.

  • Maliyet. Güncel DeepSeek V4 fiyatlandırması, en üst OpenAI ve Anthropic kademelerinin kabaca bir büyüklük mertebesi altında. Yüksek hacimli iş yüklerinde bu, ürünün piyasaya çıkmasıyla çıkamaması arasındaki farktır.
  • Matematik ve biçimsel mantık. AIME, MATH-500, SWE-bench ve GPQA Diamond’da R1/R2, OpenAI’nin akıl yürütme modelleriyle başa baş. Tıp için bunun önemi var: eGFR hesaplamaları, ağırlığa göre dozlama, birim dönüşümleri – bunlar düşünce zincirinin (CoT) gerçekten yardımcı olduğu matematik görevleridir.
  • Akıl yürütme şeffaflığı. Düşünce zinciri (CoT) izi çağırana geri döndürülür; böylece mantığın nerede raydan çıktığını denetleyebilirsiniz. OpenAI’nin o serisi modelleri akıl yürütmeyi API’nin ardında gizler.
  • İnce ayar yapılabilirliği. Ağırlıklar açık olduğundan, tıbbi araştırma grupları doğrulanmış klinik derlemler üzerinde ön eğitime ve RLHF’ye devam edebilir. Bu, kapalı modeller için yapısal olarak imkânsızdır.

Bunlar gerçek kazanımlar. Soru, bunların klinik düzeyde bir araç oluşturup oluşturmadığı; işte hikâyenin karmaşıklaştığı yer burası.

Akıl yürütmeye karşı halüsinasyon: düşünce zinciri tıpta yardımcı olur mu

Bu, yazının temel sorusu ve bir mühendis olarak en karışık duygulara sahip olduğum yer.

İyi haber. Kapsamlı 2025 çalışması “Medical Hallucinations in Foundation Models”, düşünce zincirinin test edilen vakaların %86’sında tıbbi halüsinasyon oranını düşürdüğünü buldu. Ortalamada, açık akıl yürütme yanıtı gerçekten daha doğru kılar. R1, halüsinasyona direnç konusunda sağlam temel sonuçlar ortaya koydu – önceki nesil modellerin çoğundan daha iyi.

Kötü haber. Düşünce zinciri aynı zamanda halüsinasyon sinyalini gizler. Klasik tespit yöntemleri – token düzeyinde güven, çıktı entropisi – iyi çalışmaz olur; çünkü model, sonuç yanlış olduğunda bile akıcı, kendi içinde tutarlı bir metin yazar. The Lancet Digital Health’in klinik ortamlarda ChatGPT’nin sınırlarına ilişkin analizi anlatı güveninin tıbbi doğruluğun zayıf bir göstergesi olduğunu daha önce göstermişti. Akıl yürütme modelleri bunu güçlendirir.

Asıl kötü haber. 2025’te yapay zekâ halüsinasyonlarına ilişkin analizler belirli bir bulguda birleşiyor: dil modelleri, tam da yanıldıklarında kendinden emin ifadeler (“kesinlikle”, “kuşkusuz”, “açıkça”) kullanmaya %34 daha yatkın. Akıl yürütme modelleri bunu daha da kötüleştirir: uzun, düşünceli görünen bir iz, düşünce zinciri 3. adımda yoldan çıkıp sonraki 2.000 token boyunca tutarlı biçimde yanlış yönde ilerlese bile nihai yanıtı daha yetkili hissettirir.

Tıpta bu, kritik hata biçimidir. Şöyle düşünün: model, yükselmiş alkalen fosfatazınız üzerine 3.000 token “akıl yürütür”, olası nedenler etrafında zarif bir ayırıcı tanı kurar ve osteomalazi ile sonuçlandırır – çünkü düşünce zincirinin 3. adımında erişkin referans aralığını çocuk (pediatrik) aralığıyla karıştırmıştır. Çıktı, konsültan bir hekimin notu gibi okunur. Ama yanlıştır. Düşünce zinciri olmasaydı aynı model daha belirsiz, daha az kendinden emin bir yanıt verebilirdi – ve hasta, sonuca kilitlenmek yerine büyük olasılıkla doktoruna danışırdı.

Ödünleşim gerçek: akıl yürütme ortalama halüsinasyon oranını düşürür, ama geriye kalan halüsinasyonların inandırıcılığını artırır. Saf teknik görevlerde (matematik, kod) bu kabul edilebilir bir takas. Tıpta ise bir hatanın maliyeti asimetriktir ve bu, hesabı değiştirir.

Senaryo testi: aynı laboratuvar paneli R1 ve Wizey ile

Somut olarak – teknik değerlendirme sırasında çalıştırdığım bir senaryo.

Panel: gerçek (kimliksizleştirilmiş) kapsamlı bir metabolik panel + tam kan sayımı + ferritin + TSH + serbest T4 + CRP + homosistein + D vitamini + B12 + lipid profili, toplam 47 belirteç. Birkaç anormallik: ferritin 320 ng/mL ile yüksek, CRP 8,5 mg/L ile orta düzeyde yüksek, TSH 4,1 mIU/L ile üst sınıra yakın, homosistein 14 µmol/L.

Sohbet arayüzü üzerinden DeepSeek R1 (İngilizce, modelin en güçlü olduğu dil):

  1. Yaklaşık 4.500 tokenlik düşünce zinciri; her belirteci tek tek gözden geçirip ilişkilendirmeler kuruyor.
  2. Nihai sonuç: ferritini “olası demir yükü ya da kronik iltihap” olarak işaretledi, bunu doğru biçimde CRP ile ilişkilendirdi, ama tek bir ferritin değerine dayanarak ilk sıradaki ayırıcı tanı olarak hemokromatoz (nadir bir genetik hastalık) önerdi.
  3. TSH 4,1’i “normal aralık içinde” yorumladı; 4,1 değerinin, sınırda homosistein ve iltihapla birlikte anti-TPO antikoru incelemesini ve 6–8 hafta sonra tekrarı gerektirdiğini – standart subklinik hipotiroidi incelemesini – gözden kaçırdı.
  4. Homosistein 14, dikkat gerektiren bir değer olarak işaretlenmedi (birçok laboratuvar < 10 değerini optimal kabul eder).
  5. Model, “bir sağlık uzmanına danışın” türünden kalıp uyarıları defalarca ekledi, ama bu uyarıların arasında kendinden emin bir tonda çok spesifik hipotezler öne sürdü.

Aynı panel Wizey işlem hattı üzerinden:

  1. 47 belirtecin tümü, yaşa ve cinsiyete özgü referans aralıklarına göre yapılandırılmış bir tabloya ayrıştırıldı.
  2. Yüksek CRP ile birlikte ferritin doğru yorumlandı: önce iltihap dışlanır (akut faz reaktanı davranışı), sonra demir yükü düşünülür. Hemokromatoz ancak doğrulayıcı transferrin satürasyonu ve genetik test sonrasında gündeme gelir – tek bir ferritin değerinden değil.
  3. TSH 4,1, sınırda olarak vurgulandı ve anti-TPO antikorlarıyla yeniden test yapılması açıkça önerildi.
  4. Homosistein 14, hafif yüksek olarak işaretlendi; B12/folat/B6 yolağına dikkat çekildi ve bu kofaktörlerin kontrol edilmesi önerildi.
  5. Her ifade, tıbbi bilgi grafiğindeki belirli bir kaynağa bağlanır (klinik kılavuzlar, akut faz reaktanları için NCBI StatPearls kaynakları, Nature Medicine derlemeleri).

Fark, DeepSeek’in “daha aptal” olması değil – yetenekli bir model. Fark şu: genel amaçlı bir akıl yürütme modelinin birim dönüşümü, referans aralığı seçimi ya da tanısal hipotezlerin Bayesçi hiyerarşisi için yerleşik güvenlik bariyerleri yoktur. O akıl yürütür. Wizey ise protokolleri izler – ve akıl yürütmeyi yalnızca doğrulanmış bir protokolün uygun gördüğü yerlerde kullanır.

DeepSeek R1 ne zaman doğru araçtır

Adil olmak istiyorum. DeepSeek’in – özellikle yerel olarak dağıtıldığında – gerçekten doğru seçim olduğu birkaç senaryo:

  • Dış dünyaya kapalı (air-gapped) klinik veya Ar-Ge ortamları. Kuruluşunuzun katı gizlilik gereksinimleri varsa, kendi sunucunuzdaki yerel bir R1-Distill-32B ya da R2, üçüncü bir tarafa tek bir bayt bile göndermeden frontier kaliteye yakın bir sonuç verir. Bu, son teknoloji bir LLM ile HIPAA/GDPR uyumluluğuna giden en pratik yoldur.
  • Alana özgü ince ayar için temel. Açık ağırlıklar, tıbbi araştırma gruplarının doğrulanmış klinik derlemler üzerinde ön eğitime devam etmesine ve kendi RLHF yığınlarını kurmasına olanak tanır. Bu seçenek kapalı modeller için mevcut değildir.
  • Tıbbi bir işlem hattı içindeki teknik alt görevler. Doz hesaplamaları, birim dönüşümü, CHA2DS2-VASc veya Wells gibi risk skorları – akıl yürütmenin yardımcı olduğu, yalıtılmış matematik/mantık modülleri. Onu “doktor” olarak değil, bir bileşen olarak kullanın.
  • Çeviri ve terminoloji açıklaması – bu konuda model, frontier sistemlerle başa baştır.
  • Maliyete duyarlı iş yükleri – milyonlarca isteği çalıştırmanız gerekiyorsa, kapalı frontier modellerine kıyasla fiyat farkı ayda on binlerce dolara ulaşır.

Yapmayacağım şey: gerçek bir hastanın laboratuvar PDF’ini bulut DeepSeek sohbetine yapıştırıp çıktısını klinik bir yanıt gibi ele almak. Sınır ötesi veri akışı, inandırıcı ama yanlış düşünce zinciri hata biçimi, tıbbi cihaz sertifikasyonunun bulunmaması ve referans aralığı disiplininin yokluğu bir araya gelince, bu, tüketici kullanımı için kötü bir seçimdir. “Tahlili bir bota gönderip yanıt almak” isteyen bir hasta için, bu amaçla geliştirilmiş tıbbi bir hizmet doğru araçtır.

Wizey akıl yürütmeyi nasıl kullanıyor – protokolün yerine değil, içinde

En sık aldığım soru: Wizey de dahili olarak akıl yürütme kullanıyor mu? Evet – ama sınırlandırılmış biçimde. İşlem hattımız şöyle:

  1. OCR ve çıkarım. PDF’teki her değer, deterministik biçimde ayrıştırılır ve laboratuvara özgü referans aralığıyla birlikte yapılandırılmış bir şemaya (LOINC tarzı) eşlenir.
  2. Referans aralığı bağlama. Her değer, hastanın yaşı, cinsiyeti ve (ilgili olduğu yerde) gebelik ya da böbrek durumu için doğru aralığa göre değerlendirilir. Bu, LLM çıktısı değil, koddur.
  3. Doğrulanmış klinik bilgi grafiği üzerinde RAG. Nihai rapordaki her ifade, serbest üretim değil, belirli bir kaynağa – kılavuz, hakemli makale, StatPearls kaydı – dayandırılır.
  4. Güvenlik bariyerleri içinde, tanısal zincirler için akıl yürütme. Düşünce zinciri tarzı düşünmenin hakkını verdiği yer burası: önsel ve olabilirliğin modelin görüşünden değil, bilgi grafiğinden geldiği bir Bayesçi ayırıcı tanı kurmak.
  5. Protokole kilitli çıktılar. Nihai metin, yapılandırılmış sonuca bağlıdır. Model, protokolün onaylamadığı bir tanıyı uyduramaz.

Bu mimari aynı anda iki iş yapar. Akıl yürütmenin gerçek faydasını – adım adım tanısal mantık, birim açısından güvenli hesaplamalar, belirteçler arası birlikte değişimin farkında olma – yakalarken, saf bir akıl yürütme modelini tıpta riskli kılan o özgül hata biçimini de keser: öncüller hiçbir zaman doğrulanmadığı için yanlış olan, uzun, inandırıcı ve kendi içinde tutarlı bir düşünce zinciri.

Sonuç

DeepSeek teknik açıdan etkileyici bir çalışma ve sektörün, kapalı frontier modellerine açık kaynaklı bir alternatifi olmasından içtenlikle memnunum. Yerel dağıtım, kapalı model kullanıcılarının sahip olmadığı gizlilik ve ince ayar seçeneklerinin önünü açar; bu da hastaneler, araştırma grupları ve veri egemenliğini ciddiye alan herkes için önemlidir.

Ama akıl yürütme tek başına tıbbi sorunu çözmez. Yanlış öncüller üzerine kurulmuş uzun, düzgün biçimlendirilmiş bir düşünce zinciri yine de yanlış bir yanıttır – sadece daha iyi paketlenmiştir. Belirli bir hastanın tahlillerini okuma işinde – her sayının, her referans aralığının ve her ayırıcı tanının önem taşıdığı yerde – Wizey ekibi farklı bir yol izledi: doğrulanmış klinik kaynaklar üzerinde RAG ve katı protokol bariyerlerine sahip, uzmanlaşmış bir işlem hattı. Hasta açısından bu, tek ve somut bir söze dönüşür: rapordaki her ifade bir hekime gösterilebilir ve bir kaynağa kadar izlenebilir.

Sıkça sorulan sorular

Sıradan bir LLM ile DeepSeek R1 gibi bir akıl yürütme modeli arasındaki fark nedir?

Sıradan bir LLM yanıtını hemen yazar. Akıl yürütme modeli ise önce uzun bir iç düşünce zinciri (çoğu zaman birkaç bin token) oluşturur ve ancak ondan sonra nihai sonucu üretir. Matematik ve mantık görevlerinde bu çoğu zaman işe yarar. Tıbbi sorularda ise etki karışıktır: akıl yürütme ortalamada bazı halüsinasyonları azaltır, ama geriye kalan hataları daha da inandırıcı kılabilir.

DeepSeek R1 gizlilik için yerel olarak çalıştırılabilir mi?

Evet ve bu, sağlık alanı için en güçlü argümanıdır. Ağırlıklar, MIT lisansıyla Hugging Face’te açıktır. Damıtılmış 7B–8B sürümleri bir RTX 3060’ta (8 GB VRAM), 32B tek bir 24 GB GPU’da, tam 671B MoE ise çok sayıda H100’lü bir sunucuda çalışır. Yerel dağıtım, hiçbir hasta verisinin çevrenizden çıkmadığı anlamına gelir – HIPAA ve GDPR uyumluluğuna giden gerçek bir yol.

DeepSeek R1 tıbbi cihaz olarak onaylı mı?

Hayır. DeepSeek R1, genel amaçlı bir akıl yürütme modelidir. FDA onayı, tıbbi cihaz olarak CE işareti ve resmi bir klinik doğrulaması yoktur. Tıbbi verilerle ince ayar yapılmış topluluk çatalları (fork) mevcuttur, ancak bunlar araştırma ürünleridir, onaylı klinik araçlar değildir.

Düşünce zinciri tıbbi halüsinasyonların sıklığını azaltır mı?

Bazen, ama bir şartla. 2025 tarihli bir çalışma, düşünce zincirinin (CoT) test edilen tıbbi vakaların %86’sında halüsinasyon oranını düşürdüğünü buldu. Madalyonun diğer yüzü: modeller yanıldıklarında kendinden emin ifadeler (“kesinlikle”, “kuşkusuz”) kullanmaya %34 daha yatkındır ve akıl yürütme bu etkiyi güçlendirir. Daha az hata, ama hayatta kalanlar daha yetkili görünür.

Wizey neden saf akıl yürütme yerine yapılandırılmış bir işlem hattı (pipeline) kullanıyor?

Doğrulanmamış bilgi üzerinde serbest akıl yürütme, kendi içinde tutarlı ama tıbbi açıdan yanlış bir sonuç kurabilir. Wizey, çıktıları doğrulanmış klinik protokollere kilitler: OCR her değeri çıkarır, bir çıkarım katmanı bunları laboratuvar referans aralıklarına göre yapılandırır ve RAG her ifadeyi doğrulanmış tıbbi kaynaklara dayandırır. Akıl yürütme, tanısal zincirler için dahili olarak kullanılır, ancak nihai çıktılar serbest üretimle değil, protokolle sınırlanır.

Kaynaklar