Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Sağlık Bilimleri / Tıp Araştırmaları / Mamografi Görüntüsü Olmadan Beş Yıllık Meme Kanseri Riski Tahmin Edilebilir mi? 4,6 Milyon Raporla Geliştirilen Uzunlamasına Yapay Zekâ Modeli
Tıp Araştırmaları

Mamografi Görüntüsü Olmadan Beş Yıllık Meme Kanseri Riski Tahmin Edilebilir mi? 4,6 Milyon Raporla Geliştirilen Uzunlamasına Yapay Zekâ Modeli

Mamografi taramalarında BI-RADS 1, 2 veya 3 sonucu alan kişiler genellikle mevcut incelemede kanser açısından negatif ya da büyük ölçüde iyi huylu kabul edilir.

20/07/2026  Veri Anla 43 görüntüleme
Mamografi Görüntüsü Olmadan Beş Yıllık Meme Kanseri Riski Tahmin Edilebilir mi? 4,6 Milyon Raporla Geliştirilen Uzunlamasına Yapay Zekâ Modeli

Mamografi taramalarında BI-RADS 1, 2 veya 3 sonucu alan kişiler genellikle mevcut incelemede kanser açısından negatif ya da büyük ölçüde iyi huylu kabul edilir. Ancak aynı BI-RADS sınıfında bulunan kişilerin gelecekte meme kanseri geliştirme riskleri eşit değildir. Mevcut tarama sistemleri çoğunlukla yaş ve mevcut mamografi sınıfına dayalı benzer takip aralıkları uygular; geçmiş raporlarda biriken klinik işaretlerin gelecekteki riske katkısı ise rutin uygulamada sistematik biçimde hesaplanmaz.

Bu çalışma, ham mamografi görüntülerine erişmeden, yalnızca radyologların geçmiş ve güncel rapor metinleriyle elektronik sağlık kayıtlarındaki yapılandırılmış bilgileri kullanarak bir ile beş yıl içindeki meme kanseri riskini tahmin eden bir model geliştirmiştir.

Veriler, yazarların Brezilya’nın en büyük özel sağlık sistemi olarak tanımladığı Hapvida’nın 200’den fazla hastane ve kliniğinden elde edilmiştir. Ocak 2016 ile Aralık 2025 arasında BI-RADS 1, 2 veya 3 olarak sınıflandırılmış yaklaşık 4,61 milyon mamografi raporu ve 1,81 milyon kişi başlangıç veri havuzunu oluşturmuştur.

Beş yıllık risk analizi için yaş, önceki kanser durumu, erken dönemde kanser doğrulanması ve yeterli takip bulunması gibi ölçütler uygulanmıştır. Ana metin ve hasta akış şeması, beş yıllık kohortta 278.475 kişiye ait 706.545 uygun mamografi incelemesi bulunduğunu ve bunların 9.620’sinin beş yıl içinde pozitif sonuçla ilişkilendirildiğini bildirmektedir. Bu, inceleme düzeyinde yaklaşık %1,36’lık bir olay sıklığına karşılık gelmektedir.

Bununla birlikte çalışmanın raporlanmasında sayısal bir iç tutarsızlık vardır. Tablo 1’de beş yıllık toplam inceleme sayısı 706.910 olarak verilmektedir. Aynı tablodaki BI-RADS 1, 2 ve 3 sayılarının toplamı da 706.910’dur. Buna karşılık ana metin ve Şekil 2’de 706.545 sayısı kullanılmaktadır. Ayrıca bildirilen 566.698 eğitim ve 142.517 test incelemesinin toplamı 709.215’tir ve her iki toplamla da uyuşmamaktadır. Bu farklılıklar nihai sürümde açıklanmalıdır.

Modelin girdileri iki ana bloktan oluşmuştur. İlk blok; yaş, menarş ve menopoz yaşı, doğum yapmama, düşük sayısı, ailede meme veya yumurtalık kanseri öyküsü, emzirme, beden kitle indeksi, BI-RADS sınıfı, sigorta ödemesi ve coğrafi posta kodu gibi yapılandırılmış klinik bilgileri içermiştir.

İkinci blok, kişilerin indeks mamografiden önceki radyoloji raporlarının tarih sırasına göre düzenlenmiş metinlerini ve incelemeler arasındaki zaman aralıklarını kapsamıştır. Rapor metinleri TF-IDF yöntemiyle sayısal vektörlere dönüştürülmüş, geçmiş raporlar ortalama veya yakın tarihli incelemelere daha fazla ağırlık veren zaman ağırlıklı birleştirme yöntemleriyle özetlenmiştir.

Beş yıllık tahmin için test kümesindeki AUROC değeri 0,863 ve %95 güven aralığı 0,853-0,871 olarak bildirilmiştir. Bir ile dört yıllık modellerde AUROC değerleri 0,82 ile 0,85 arasında değişmiştir. Beş yıllık takip süresini birlikte değerlendiren konkordans indeksi 0,859’dur.

AUROC 0,86, rastgele seçilen bir kanser gelişen inceleme ile kanser gelişmeyen bir inceleme karşılaştırıldığında modelin kanser gelişen incelemeye daha yüksek risk puanı verme olasılığının yaklaşık %86 olduğunu ifade eder. Bu değer, modelin bireysel bir kişide “%86 doğrulukla kanseri bildiği” anlamına gelmez.

Model yalnızca en yüksek riskli %3,4’lük inceleme grubunu işaretlediğinde, beş yıl içinde kanser gelişecek pozitif incelemelerin %50,1’ini yakalamıştır. Bu çalışma noktasında özgüllük %97,3 ve pozitif öngörü değeri yaklaşık %25,1’dir. Başka bir ifadeyle yüksek risk olarak işaretlenen yaklaşık her dört incelemeden biri beş yıllık pozitif sonuçla ilişkilidir; ancak bu, kişilerin hemen kanser olduğu veya biyopsi gerektirdiği anlamına gelmez.

Düşük risk analizi de dikkat çekicidir. En düşük riskli incelemelerin %25’i düşük risk grubu olarak seçildiğinde bütün beş yıllık kanser olaylarının %5’i bu grupta kalmıştır. En düşük riskli %47 seçildiğinde ise bütün pozitif olayların %10’u bu grupta kalmıştır. Bu sonuçların doğru yorumu, “düşük risk grubundaki kişilerin %10’u kanser oldu” değildir.

Çalışmanın özetinde kullanılan “en düşük %47’lik grupta yalnızca %10 kanser gelişti” ifadesi yanıltıcıdır. Şekil 4 ve sonuç bölümüne göre %10 değeri, bütün kanser olaylarının ne kadarının düşük risk grubunda kaldığını gösteren yanlış negatif oranıdır. Düşük risk grubundaki incelemelerin yaklaşık %99,6’sı beş yıl boyunca negatif kalmıştır; dolayısıyla grup içi pozitiflik yaklaşık %0,4 düzeyindedir.

Model, BI-RADS sınıflarının kendi içindeki belirgin risk farklılıklarını da göstermiştir. BI-RADS 1, 2 ve 3 içinde gelecekte kanser gelişen incelemelerin risk puanları geniş bir dağılım sergilemiştir. Bu bulgu, tek bir mamografinin BI-RADS sınıfının gelecekteki riski bütünüyle temsil etmediğini; geçmiş raporların ve klinik özelliklerin ek bilgi taşıyabileceğini düşündürmektedir.

Açıklanabilirlik analizinde yüksek risk tahminlerini en güçlü biçimde etkileyen rapor ifadeleri arasında önceki meme cerrahisi, mastektomi, kalsifikasyonlar ve mimari distorsiyonlar yer almıştır. Düşük risk tahminlerinde ise iki memenin simetrik görünmesi, karşı memede veya aksiller lenf düğümlerinde şüpheli bulgu bulunmaması ve güven verici radyolojik ifadeler öne çıkmıştır.

Yapılandırılmış değişkenlerde aile öyküsü ve üreme öyküsü yüksek risk tahminlerine daha fazla katkı sağlamıştır. Sigorta ödeme düzeyi ve coğrafi bölge gibi sosyoekonomik göstergeler ise bazı doğru negatif tahminlerde daha belirgin olmuştur. Bu son bulgu dikkatle yorumlanmalıdır; ekonomik ve coğrafi değişkenler biyolojik riski değil, sağlık hizmetine erişimi, takip düzenini veya veri kayıt biçimini de yansıtabilir.

Modelin kalibrasyonu beta kalibrasyonu ve izotonik regresyonla iyileştirilmiştir. Her iki yöntemde Brier skoru yaklaşık 0,014 olarak bildirilirken kalibre edilmemiş modelde 0,093’tür. En yüksek risk tahminlerinde hafif aşırı güven görülmüştür. Düşük olay sıklığı nedeniyle Brier skorunun olay prevalansıyla birlikte yorumlanması gerekir; çalışmada yalnızca prevalansı tahmin eden basit bir karşılaştırma modelinin Brier skoru verilmemiştir.

Çalışma, modelin gerçek klinik uygulamada erken tanıyı artırdığını, ölümleri azalttığını veya tarama maliyetlerini düşürdüğünü göstermemiştir. Model sağlık çalışanlarının kararlarını değiştirecek biçimde ileriye dönük olarak uygulanmamış, yüksek risk grubuna ek MRI veya biyopsi verilmemiş ve düşük risk grubunda tarama aralığı gerçekten iki yıla çıkarılmamıştır.

Bu nedenle sonuçlar, kişiselleştirilmiş tarama için güçlü bir teknik olasılık göstermekle birlikte henüz tarama rehberi değildir. Yazarların da belirttiği gibi prospektif doğrulama, maliyet-etkililik analizi, yanlış pozitiflerin doğuracağı biyopsi ve kaygı yükü, gecikmiş tanı riski ve farklı sağlık sistemlerindeki dış doğrulama tamamlanmadan klinik politika değişikliği yapılmamalıdır.

Çalışmanın temel problemi nedir?

Geleneksel meme kanseri tarama programlarında yaş, aile öyküsü ve mevcut mamografi sonucu gibi sınırlı sayıda faktör kullanılır. Pek çok sağlık sisteminde belirli bir yaş grubundaki kişilere yıllık veya iki yılda bir mamografi önerilir.

Bu yaklaşım nüfus düzeyinde uygulanabilir olsa da aynı yaşta ve aynı BI-RADS sınıfında bulunan iki kişinin gerçek riski birbirinden çok farklı olabilir. Örneğin her ikisi de BI-RADS 2 olan iki kişiden birinin geçmiş raporlarında tekrarlayan kalsifikasyon, mimari bozulma ve cerrahi öyküsü bulunurken diğerinde yıllardır değişmeyen, simetrik ve iyi huylu bulgular bulunabilir.

Çalışmanın temel araştırma sorusu şudur:

Bir kişinin geçmiş mamografi raporlarının tamamı ve rutin elektronik sağlık kayıtları birlikte değerlendirilirse, mevcut inceleme negatif veya muhtemelen iyi huylu olsa bile önümüzdeki bir ile beş yıl içindeki meme kanseri riski daha iyi ayırt edilebilir mi?

BI-RADS 1, 2 ve 3 ne ifade eder?

BI-RADS sınıfıGenel klinik anlamıÇalışmadaki rolü
BI-RADS 1Negatif inceleme; şüpheli bulgu bulunmamasıGelecekteki kanser riskinin tahmin edildiği ana gruplardan biri
BI-RADS 2İyi huylu bulgularMevcut incelemede kanser kuşkusu düşük, ancak uzun dönemli risk heterojen olabilir
BI-RADS 3Muhtemelen iyi huylu bulgu; genellikle kısa aralıklı kontrol gerektirirModelin daha ayrıntılı risk farklılığı aradığı üçüncü ana grup

Model BI-RADS 4, 5 veya 6 ile başvuran kişilerin mevcut kanser olasılığını değerlendirmek için geliştirilmemiştir. Amaç, güncel incelemesi negatif veya muhtemelen iyi huylu görünen kişiler arasında gelecekteki riski ayırmaktır.

Bu model mevcut mamogramdaki kanseri mi, gelecekteki kanseri mi tahmin ediyor?

Çalışma gelecekteki kanser riskini tahmin etmeyi amaçlamaktadır. İndeks mamografiden sonraki ilk 90 gün içinde malignite doğrulanan incelemeler dışlanmıştır. Böylece mevcut inceleme sırasında zaten var olan veya hemen sonrasında tanı konan kanserlerin “gelecek risk” olarak sınıflandırılmasının önüne geçilmeye çalışılmıştır.

Birincil sonuç, indeks mamografiden 90 gün sonra başlayıp seçilen tahmin ufkunun sonuna kadar ortaya çıkan meme kanseri göstergesidir.

Pozitif sonuç şu yollardan biriyle tanımlanmıştır:

  • BI-RADS 6 sınıflaması,
  • Malign biyopsi sonucu,
  • BI-RADS 5 sınıflaması; ancak sonraki altı ayda negatif veya iyi huylu incelemeyle çürütülmemiş olması.

Bu sonuç tanımı yalnızca histopatolojik olarak doğrulanmış kanserlerden oluşmamaktadır. BI-RADS 5 veya 6 kodlarının da sonuç etiketine katkıda bulunması olası yanlış sınıflandırmaya yol açabilir. Araştırmacılar zaman pencerelerini değiştirerek duyarlılık analizleri yapmış ve model performansında belirgin değişim bildirmemiştir.

Takibin yeterli olduğu nasıl belirlendi?

Bir incelemenin belirli bir tahmin ufkunda negatif olarak sınıflandırılabilmesi için hastanın o süre boyunca sistem içinde gözlenmiş olması gerekiyordu. Takip yıllık aralıklara ayrılmış ve kişinin hedef sürenin sonunda veya sonrasında en az bir mamografi ya da biyopsi kaydı bulunması istenmiştir.

Örneğin beş yıllık analizde, kişinin beşinci yıl veya sonrasında sistemde bir mamografi ya da biyopsi kaydı bulunması gerekiyordu. Yeterli takibi bulunmayan incelemeler beş yıllık analizden çıkarılmış, ancak daha kısa takip ölçütünü karşılıyorsa bir veya iki yıllık analizlerde tutulmuştur.

Bu yöntem yanlış negatif etiketleri azaltmayı amaçlar. Buna karşılık düzenli takip yaptıran ve aynı özel sağlık sistemi içinde kalan kişileri seçer. Sağlık sisteminden ayrılan, başka merkezde tanı alan veya uzun süre mamografi yaptırmayan kişiler dışlanmış olabilir.

Dolayısıyla modelin performansı, düzenli ve belgelenmiş takibi bulunan özel sağlık sistemi kullanıcılarında ölçülmüştür. Parçalı kayıtlara sahip sağlık sistemlerine aynı biçimde taşınabileceği gösterilmemiştir.

Beş yıllık kohort nasıl oluşturuldu?

AşamaBildirilen sayıAçıklama
Başlangıç mamografi raporları4.609.295BI-RADS 1, 2 veya 3 raporları
Başlangıçtaki kişiler1.810.3452016-2025 dönemindeki toplam kişi sayısı
Beş yıllık uygun kişiler278.475Yaş, erken kanser dışlaması ve takip ölçütlerini karşılayanlar
Beş yıllık uygun incelemelerAna metin ve Şekil 2’de 706.545Tablo 1’de 706.910 olarak verilmiştir
Negatif sonuçlu incelemeler696.925Beş yıl içinde pozitif sonuç bulunmayan ve takip edilenler
Pozitif sonuçlu incelemeler9.620İnceleme düzeyinde %1,36 olay sıklığı
BI-RADS 5 veya 6 ile ilk işaret8.517Daha sonra biyopsiyle doğrulanmış olabilir
İlk pozitif işaret olarak malign biyopsi1.103Öncesinde BI-RADS 5 veya 6 bulunmayanlar

Analiz bir kişi düzeyinde mi, mamografi düzeyinde mi yapıldı?

Bir kişi çalışma süresinde birden fazla uygun mamografiye sahip olabilir. Her uygun mamografi, o tarihte mevcut bilgilerle oluşturulan ayrı bir indeks inceleme ve ayrı bir risk tahmini olarak değerlendirilmiştir.

Aynı kişi eğitim ve test kümelerine bölünmemiştir. Veri ayrımı kişi düzeyinde yapılmış ve bir kişinin bütün incelemeleri aynı kümede tutulmuştur. Bu yaklaşım eğitim-test veri sızıntısını azaltan önemli bir güçlü yöndür.

Bununla birlikte performans ölçülerinin birimi büyük ölçüde mamografi incelemesidir. Aynı kişi test kümesinde birden fazla indeks incelemeyle temsil edilebilir. Bu nedenle “en yüksek riskli %3,4” ifadesi doğrudan benzersiz kişilerin %3,4’ü anlamına gelmeyebilir.

Aynı kişiye ait incelemeler birbirinden bağımsız değildir. Çalışma bu bağımlılığın güven aralıklarında nasıl ele alındığını ana metinde ayrıntılı olarak açıklamamaktadır.

Modelde kullanılan yapılandırılmış veriler

Değişken grubuÖrnek değişkenler
DemografiYaş
Üreme öyküsüMenarş yaşı, menopoz yaşı, doğum yapmama, düşük sayısı, emzirme öyküsü
Aile öyküsüAilede meme veya yumurtalık kanseri
Güncel radyolojik sınıfİndeks mamografinin BI-RADS sınıfı
Vücut ölçümüBeden kitle indeksi
Sosyoekonomik göstergelerAylık sigorta ödemesi
Coğrafi bağlamBrezilya posta kodunun ilk üç hanesi

Sigorta ödemesi ve posta kodu doğrudan biyolojik meme kanseri belirteçleri değildir. Sağlık hizmetine erişim, gelir, bölgesel sağlık altyapısı, takip sıklığı ve kayıt kalitesi gibi farklı süreçlerin göstergesi olabilirler.

Uzunlamasına mamografi raporları nasıl kullanıldı?

Her kişi, indeks incelemeden önceki mamografi raporlarının zaman sırasına göre düzenlenmiş dizisiyle temsil edilmiştir. Her geçmiş kayıt şu bilgileri taşımıştır:

  • Radyoloğun serbest metin raporu,
  • İlgili BI-RADS sınıfı,
  • Bir önceki mamografiyle arasındaki zaman.

Model yalnızca son rapora bakmamış; geçmiş raporlar boyunca ortaya çıkan, kaybolan veya tekrar eden radyolojik ifadeleri özetlemeye çalışmıştır.

Bu yaklaşım şu tür bilgileri yakalayabilir:

  • Yıllar içinde tekrarlanan kalsifikasyon ifadeleri,
  • Mimari distorsiyonun yeni veya kalıcı olması,
  • Önceki cerrahi değişiklikler,
  • İki inceleme arasındaki sürenin uzaması veya kısalması,
  • BI-RADS sınıflarının zaman içindeki seyri.

TF-IDF ne işe yaradı?

Radyoloji raporları doğrudan sinir ağına ham cümleler şeklinde verilmemiştir. Metinler, kelime ve kelime çiftlerinin rapor içindeki önemini ölçen TF-IDF yöntemiyle sayısal vektörlere dönüştürülmüştür.

Çalışmanın kullandığı yöntemin temel mantığı açıklama amacıyla şöyle gösterilebilir:

\[ TF\text{-}IDF(t,d)=TF(t,d)\times\log\left(\frac{N}{DF(t)}\right) \]

Burada:

  • t, belirli bir kelime veya terimi,
  • d, incelenen radyoloji raporunu,
  • TF(t,d), terimin ilgili raporda ne sıklıkta geçtiğini,
  • DF(t), terimin kaç farklı raporda görüldüğünü,
  • N, toplam rapor sayısını ifade eder.

“Meme” veya “mamografi” gibi hemen her raporda bulunan kelimeler düşük ayırt edici ağırlık alırken “mimari distorsiyon” veya belirli cerrahi ifadeler daha ayırt edici olabilir.

TF-IDF’nin avantajı, modelin hangi kelime veya kelime çiftlerine önem verdiğinin görülebilmesidir. Buna karşılık kelimelerin bağlamını modern dil modelleri kadar ayrıntılı temsil etmeyebilir. Olumsuzluk, belirsizlik, rapor şablonları ve kurumlara özgü yazım biçimleri model performansını etkileyebilir.

Geçmiş raporların zamanı nasıl dikkate alındı?

Model mimarisinde geçmiş raporları tek bir hasta vektörüne dönüştüren değiştirilebilir bir birleştirme modülü kullanılmıştır. Basit ortalama ve daha yakın tarihli incelemelere daha fazla önem veren zaman ağırlıklı ortalama seçenekleri değerlendirilmiştir.

Çalışmanın anlattığı üstel zaman ağırlığının temel mantığı şu ilişkiyle açıklanabilir:

\[ w_i=\frac{e^{-\lambda\Delta t_i}}{\sum_j e^{-\lambda\Delta t_j}} \]

Burada:

  • Δti, geçmiş raporla indeks inceleme arasındaki zamanı,
  • λ, eski raporların ağırlığının ne kadar hızlı azalacağını belirleyen parametreyi,
  • wi, ilgili geçmiş raporun toplam özetteki ağırlığını ifade eder.

Bu formül çalışmanın zaman ağırlıklı yaklaşımını açıklamak için verilmiştir. Kullanılan kesin parametreler ve en iyi toplulaştırma seçeneği ana PDF’de ayrıntılı biçimde raporlanmamış, ek materyale yönlendirilmiştir.

Model mimarisinde önemli bir açıklama tutarsızlığı

Çalışma tasarımı bölümünde her tahmin ufku için ayrı bir model eğitildiği belirtilmektedir. Buna karşılık model mimarisi bölümünde ve Şekil 1’de tek bir yoğun sinir ağının bir, iki, üç, dört ve beş yıllık olasılıkları aynı anda ürettiği gösterilmektedir.

Bu iki anlatım birbirinden farklı model kurulumlarını tarif eder:

  • Her zaman ufku için bağımsız model,
  • Beş zamanı aynı anda tahmin eden çok çıkışlı tek model.

Nihai uygulamanın hangisi olduğu açık biçimde belirtilmelidir. Model mimarisi, kayıp fonksiyonu ve zaman ufukları arasındaki bilgi paylaşımı bakımından bu ayrım önemlidir.

Model nasıl eğitildi ve test edildi?

  • Veriler kişi düzeyinde eğitim ve test kümelerine ayrılmıştır.
  • Aynı kişi iki farklı ana kümeye girmemiştir.
  • Eğitim verisi içinde beş katlı çapraz doğrulama kullanılmıştır.
  • Hiperparametreler doğrulama performansına göre seçilmiştir.
  • Nihai metrikler saklı test kümesinde hesaplanmıştır.
  • Belirsizlikler yeniden örneklemeye dayalı güven aralıklarıyla verilmiştir.

Bu yaklaşım rastgele hasta bölünmesine dayalı bir iç doğrulamadır. Daha sonraki yıllarda gelen hastalarla ayrı zamansal doğrulama veya başka bir sağlık sisteminde bağımsız dış doğrulama yapılmamıştır.

AUROC sonuçları

Tahmin süresiGenel AUROC%95 güven aralığı
1 yıl0,840,82-0,85
2 yıl0,850,83-0,86
3 yıl0,820,80-0,83
4 yıl0,830,81-0,83
5 yıl0,860,85-0,87

Beş yıllık modelin daha yüksek performans göstermesi ilk bakışta şaşırtıcıdır; çünkü daha uzak geleceğin tahmin edilmesi genellikle daha zor olabilir. Yazarlar bunu beş yıllık kohortta daha fazla kanser olayı bulunmasına ve zaman ufukları için farklı eğitim düzenlerine bağlamaktadır.

AUROC neyi gösterir, neyi göstermez?

AUROC, modelin pozitif ve negatif incelemeleri ne kadar iyi sıraladığını ölçer. Yaygın bir yorumla:

\[ AUROC=P(Risk_{pozitif}>Risk_{negatif}) \]

Beş yıllık AUROC=0,863 değeri, rastgele seçilen bir pozitif incelemeye rastgele seçilen negatif incelemeden daha yüksek risk puanı verilme olasılığının yaklaşık %86,3 olduğunu ifade eder.

AUROC:

  • Bir kişinin kesin kanser olasılığını göstermez.
  • Belirlenen risk yüzdesinin doğru kalibre edildiğini tek başına kanıtlamaz.
  • Yanlış pozitif veya yanlış negatiflerin klinik maliyetini içermez.
  • Modelin kullanılmasıyla ölüm oranının azalacağını göstermez.

Konkordans indeksi

Beş yıla kadar bütün takip zamanları birlikte değerlendirildiğinde C-indeksi 0,859 olarak bildirilmiştir. Konkordans indeksi, daha erken kanser gelişen incelemeye daha yüksek risk verilip verilmediğini değerlendirir.

Ancak çalışmanın ana modellemesi ikili zaman ufku tahminleri olarak tarif edilmektedir. C-indeksinin hangi risk skoru ve sansürleme yaklaşımıyla hesaplandığı ana metinde sınırlı ayrıntıyla sunulmuştur.

Kalibrasyon neden gereklidir?

İki model hastaları benzer doğrulukla sıralayabilir, ancak biri riski sürekli olduğundan yüksek tahmin edebilir. Klinik kararlarda yalnızca sıralama değil, “bu kişinin beş yıllık riski yaklaşık yüzde kaçtır?” sorusu da önemlidir.

Çalışmada üç kalibrasyon yöntemi değerlendirilmiştir:

  • Platt ölçekleme,
  • Beta kalibrasyonu,
  • İzotonik regresyon.

Platt ölçekleme ciddi sınıf dengesizliği altında olasılıkları dar bir aralığa sıkıştırmıştır. Beta ve izotonik kalibrasyon daha uygun sonuç vermiştir.

Kalibrasyon yaklaşımıŞekil 3’teki Brier skoruYorum
Kalibre edilmemiş model0,093Gözlenen risklerle belirgin uyumsuzluk
Beta kalibrasyonu0,014Gözlenen oranlara daha yakın tahminler
İzotonik regresyon0,014Beta kalibrasyonuna benzer sonuç

En yüksek risk aralığında her iki kalibre model de riski hafif yüksek tahmin etmiştir. Bu bölgedeki örnek sayısının daha az olması ve olayların seyrekliği tahmin belirsizliğini artırmaktadır.

Beş yıllık kanser prevalansı düşük olduğu için Brier skoru doğal olarak küçük olabilir. Çalışmada yalnızca genel prevalansı herkese atayan basit bir referans modelle Brier karşılaştırması verilmemiştir. Bu nedenle 0,014 değeri tek başına kalibrasyonun klinik yeterliliğini kanıtlamaz.

En yüksek riskli %3,4’lük grup

ÖlçüSonuçAnlamı
Yüksek risk olarak işaretlenen incelemelerEn yüksek %3,4Test incelemelerinin küçük bir bölümü ek değerlendirmeye ayrılır
Duyarlılık%50,1Beş yıl içinde pozitif olacak incelemelerin yaklaşık yarısı yakalanır
Özgüllük%97,3Negatif incelemelerin büyük bölümü yüksek risk olarak işaretlenmez
Pozitif öngörü değeri%25,1İşaretlenen yaklaşık her dört incelemeden biri beş yıllık pozitif sonuçla ilişkilidir

Bu eşik klinik uygulamada doğrulanmış bir biyopsi veya MRI eşiği değildir. Yazarlar, yüksek riskli kişilerin yeniden değerlendirme, daha kısa takip veya ek görüntüleme için seçilebileceğini tartışmaktadır; ancak bu stratejiler çalışmada uygulanmamıştır.

Yüksek risk olarak işaretlenenlerin yaklaşık dörtte üçü beş yıl içinde pozitif sonuç geliştirmemiştir. Bu kişilere ek biyopsi veya görüntüleme uygulanması yanlış pozitiflik, kaygı, maliyet ve gereksiz işlem oluşturabilir.

Düşük riskli %25 ve %47 nasıl yorumlanmalıdır?

Düşük risk olarak seçilen bölümBütün pozitiflerin bu grupta kalan bölümüNegatif öngörü değeri
En düşük riskli %25%5,0; 2.468 pozitifin 123’üYaklaşık %99,6
En düşük riskli %47%10,0; 2.468 pozitifin 247’siYaklaşık %99,6

Yanlış negatif oranı, bütün pozitiflerin ne kadarının düşük risk grubuna atandığını gösterir. Grup içindeki gerçek kanser oranı değildir.

Model düşük riskli kişilerin tarama aralığının iki yıla çıkarılabileceğine ilişkin bir politika senaryosu sunmaktadır. Ancak bu senaryo uygulanıp test edilmemiştir. Taramanın geciktirilmesiyle ortaya çıkabilecek evre değişimi, interval kanser, mortalite, yaşam kalitesi veya maliyet sonucu ölçülmemiştir.

BI-RADS sınıfları içinde gizli risk farklılığı

Şekil 4’te, gelecekte pozitif sonuç geliştiren BI-RADS 1, 2 ve 3 incelemelerinin model risk puanları geniş ve örtüşen dağılımlar göstermektedir.

Bu sonuç iki önemli noktaya işaret eder:

  • BI-RADS 3 genel olarak daha yüksek risk taşısa da bütün BI-RADS 3 incelemeleri aynı değildir.
  • BI-RADS 1 veya 2 sonucu alan bazı incelemeler geçmiş rapor ve klinik özellikleri nedeniyle yüksek uzun dönem risk puanı alabilir.

Model BI-RADS’ın yerine geçmek üzere değil, BI-RADS sınıfına ek bir uzun dönemli risk katmanı olarak tasarlanmıştır.

Yaş gruplarına göre performans

Yaş grubu5 yıllık AUROC%95 güven aralığıMetinde bildirilen prevalans
18-390,810,79-0,83%1,1
40-490,850,84-0,87%1,8
50-74 veya 50-750,870,86-0,89%2,4

Tablo 2 üst yaş grubunu 50-74, sonuç metni ise 50-75 olarak tanımlamaktadır. Çalışmanın genel uygunluk ölçütü 18-75 yaştır. Bu küçük fakat düzeltilmesi gereken bir raporlama farklılığıdır.

18-39 yaş grubunun mamografi taramasına hangi klinik nedenlerle girdiği ayrıca önemlidir. Bu yaşlarda mamografi yaptıran kişiler genel genç nüfustan farklı risk özellikleri taşıyabilir. Dolayısıyla performans bütün 18-39 yaş grubuna genellenemez.

Bölgelere göre performans

Bölge5 yıllık AUROC%95 güven aralığı
Kuzey0,810,76-0,87
Kuzeydoğu0,850,83-0,86
Orta-Batı0,740,65-0,85
Güneydoğu0,880,86-0,90
Güney0,740,58-0,90

Model bütün bölgelerde rastlantı düzeyinin üzerinde ayrım göstermiştir. Ancak beş yıllık uygun incelemelerin %70,4’ü Kuzeydoğu bölgesinden gelmektedir. Güney ve Orta-Batı bölgelerindeki örneklem çok daha küçüktür ve güven aralıkları geniştir.

Tablo 1’de beş bölgenin sayıları toplam inceleme sayısına ulaşmamaktadır; bölgesel bilgisi eksik incelemeler alt grup analizinden çıkarılmıştır. Bu nedenle “bütün bölgelerde güçlü genelleme” ifadesi özellikle az temsil edilen bölgeler bakımından dikkatli kullanılmalıdır.

Açıklanabilirlik için bütünleşik gradyanlar

Model kararlarına hangi özelliklerin katkı sağladığını değerlendirmek için bütünleşik gradyanlar, İngilizce adıyla integrated gradients, kullanılmıştır.

Yöntemin temel matematiksel mantığı şöyledir:

\[ IG_i(x)=(x_i-x_i')\int_0^1\frac{\partial F(x'+\alpha(x-x'))}{\partial x_i}\,d\alpha \]

Burada:

  • x, gerçek inceleme girdisini,
  • x′, karşılaştırma için kullanılan başlangıç girdisini,
  • F, modelin risk çıktısını,
  • IGi, i numaralı özelliğin tahmine katkısını ifade eder.

Metin özelliklerinde başlangıç noktası bilgi içermeyen sıfır vektör, yapılandırılmış özelliklerde ise standartlaştırılmış nüfus ortalığıdır.

Yöntem bir özelliğin model kararını hangi yönde değiştirdiğini gösterir. Özelliğin gerçek dünyada kansere neden olduğunu kanıtlamaz.

Metin bloğu mu, yapılandırılmış veriler mi daha etkiliydi?

Şekil 5’te radyoloji raporu metinlerinin toplam katkısı yapılandırılmış özelliklerden genellikle daha yüksektir. Ancak metin bloğu binlerce kelime ve kelime çiftinden, yapılandırılmış blok ise çok daha az sayıdaki değişkenden oluşmaktadır.

Bu nedenle toplam katkının daha yüksek olması kısmen metin bloğunun boyutunun daha büyük olmasından kaynaklanabilir. Araştırmacılar bu sınırlılığı açıkça kabul etmektedir.

Negatif tahminler daha az sayıdaki güçlü ve güven verici ifadeye dayanırken pozitif tahminler rapor sözlüğündeki daha geniş bir terim grubunun ortak katkısıyla oluşmuştur.

Yüksek risk tahminlerinde öne çıkan ifadeler

  • Meme cerrahisi,
  • Sağ mastektomi,
  • Duktal uzanım,
  • Vasküler dilatasyon,
  • Kalsifikasyonlar,
  • Spiküle veya şüpheli bulgular,
  • Mimari distorsiyon,
  • Mikrokalsifikasyonlar,
  • Meme tümörü veya kitleye işaret eden ifadeler.

Bu terimlerin yüksek riskle ilişkili bulunması klinik olarak anlaşılabilir görünmektedir. Ancak açıklanabilirlik analizi, yapılandırılmış kayıtlarda bulunmayan bazı cerrahi veya implant öykülerinin rapor metninden modele girdiğini de göstermiştir.

Yazarlar, bazı meme implantı veya geçmiş cerrahi öyküsü bulunan kişilerin eksik yapılandırılmış kayıtlar nedeniyle yanlış biçimde kohorta dahil edilmiş olabileceğini belirtmektedir. Bu durum elektronik sağlık kayıtlarının doğruluğuna bağımlılığı göstermektedir.

Düşük risk tahminlerinde öne çıkan ifadeler

  • Simetrik memeler,
  • Karşı memede şüpheli bulgu bulunmaması,
  • Aksiller lenf düğümü büyümesi bulunmaması,
  • Normal konfigürasyon,
  • İyi huylu veya değişmeyen bulgular,
  • Şüpheli patolojik bulgu yokluğu.

Bu ifadeler modelin düşük riski yalnızca yaş veya BI-RADS sınıfından değil, rapor dilindeki güven verici bulguların ortak örüntüsünden çıkardığını düşündürmektedir.

Yapılandırılmış özelliklerin katkısı

Yüksek risk tahminlerinde aile öyküsü ve üreme öyküsü daha belirgin katkı sağlamıştır. Düşük risk tahminlerinde aylık sigorta ödemesi ve coğrafi bölge gibi sosyoekonomik göstergeler öne çıkmıştır.

Bu sonuç modelin klinik anlamlı özellikleri kullandığını destekleyebilir; ancak sosyoekonomik özelliklerin katkısı şu olasılıkları da gündeme getirir:

  • Bölgesel takip sıklığı farklılıkları,
  • Sağlık hizmetine erişim,
  • Tanı doğrulama olasılığı,
  • Rapor yazım uygulamaları,
  • Sigorta paketine bağlı görüntüleme yoğunluğu.

Bu nedenle modelin sosyoekonomik ve coğrafi gruplarda adil çalışıp çalışmadığı yalnızca AUROC ile değil, kalibrasyon, yanlış negatif oranları ve klinik sonuçlarla ayrıca değerlendirilmelidir.

Çalışmanın klasik risk modelleriyle karşılaştırması

Yazarlar Gail, Tyrer-Cuzick, BOADICEA ve görüntü tabanlı derin öğrenme modellerinin yayımlanmış AUROC değerlerini çalışmanın 0,86 değerinden daha düşük olarak sunmaktadır.

Ancak bunlar aynı hastalar, aynı sonuç tanımı ve aynı test kümesi üzerinde yapılan doğrudan karşılaştırmalar değildir. Farklı çalışmalar:

  • Farklı ülkeleri,
  • Farklı yaş ve risk dağılımlarını,
  • Farklı kanser tanımlarını,
  • Farklı takip sürelerini,
  • Farklı görüntüleme ve klinik veri türlerini kullanmıştır.

Bu nedenle çalışma güçlü bir performans göstermiş olsa da diğer modellerden kesin olarak üstün olduğu bağımsız başa baş değerlendirmeyle kanıtlanmamıştır.

Ham mamografi görüntülerinin kullanılmaması neden önemli?

Görüntü tabanlı modellerin uygulanması için ham mamografi dosyalarının standart biçimde saklanması, aktarılması ve yüksek hesaplama gücüyle işlenmesi gerekir. Birçok sağlık sisteminde geçmiş görüntüler eksik, farklı cihaz formatlarında veya birden fazla merkezde parçalı olabilir.

Radyoloji raporları ve elektronik sağlık kayıtları ise çoğu klinik sistemde daha küçük veri boyutunda ve daha kolay erişilebilir durumdadır.

Bu yaklaşımın olası avantajları:

  • Daha düşük hesaplama yükü,
  • Mevcut kayıt sistemlerine daha kolay entegrasyon,
  • Rapor terimlerinin açıklanabilir olması,
  • Geçmiş incelemelerin zaman içindeki birikimini kullanabilme,
  • Görüntü arşivi eksik sağlık sistemlerinde uygulanabilirlik.

Temel dezavantaj ise görüntüde bulunan ancak rapora yazılmamış ayrıntıların kaybedilmesidir. Model radyoloğun ne gördüğünden çok, rapora ne yazdığını öğrenmektedir. Raporlama alışkanlıkları değiştiğinde performans da değişebilir.

Model klinikte nasıl kullanılabilir?

Yazarların önerdiği olası kullanım alanları şunlardır:

  • BI-RADS 1-3 içindeki yüksek riskli kişileri daha erken yeniden değerlendirmek,
  • Ek mamografi, ultrason veya MRI için önceliklendirme yapmak,
  • BI-RADS 3 içindeki daha yüksek riskli kişileri daha yakından izlemek,
  • Çok düşük riskli kişileri yıllık yerine iki yıllık taramaya yönlendirmek,
  • Sınırlı görüntüleme kaynaklarını risk düzeyine göre dağıtmak.

Bunların hiçbiri bu araştırmada klinik müdahale olarak sınanmamıştır. Model çıktılarının hekim kararına eklenmesinin kanser evresini, ölüm oranını, biyopsi sayısını, maliyeti veya hasta kaygısını nasıl değiştireceği bilinmemektedir.

Çalışmanın geçmiş, bugün ve gelecek açısından önemi

Geçmişte meme kanseri risk modelleri büyük ölçüde yaş, aile öyküsü, üreme geçmişi ve genetik belirteçler gibi sabit değişkenlere dayanmıştır. Mamografi tabanlı yapay zekâ çalışmaları ise çoğunlukla tek bir incelemenin görüntüsünü kullanmıştır.

Bugün bu çalışma, geçmiş radyoloji raporlarının bütününün ve incelemeler arasındaki zamanın gelecekteki risk için önemli bilgi taşıyabileceğini göstermektedir. Bu yaklaşım, tek bir mamografi karesinden çok kişinin zaman içindeki tarama hikâyesini değerlendirmektedir.

Gelecekte rapor metni, görüntüler, reçeteler, genetik bilgiler ve yaşam tarzı verileri birlikte kullanılarak daha kapsamlı risk modelleri geliştirilebilir. Ancak daha fazla veri eklenmesi her zaman daha iyi klinik sonuç anlamına gelmez. Veri kalitesi, mahremiyet, ayrımcılık riski, model kalibrasyonu ve sağlık sistemi üzerindeki etkiler ayrıca değerlendirilmelidir.

Çalışmanın güçlü yönleri

  • Yaklaşık 4,61 milyon mamografi raporu ve 1,81 milyon kişilik çok büyük bir başlangıç veri tabanı kullanılmıştır.
  • Veriler on yıllık gerçek yaşam sağlık sistemi kayıtlarından elde edilmiştir.
  • BI-RADS 1, 2 ve 3 içindeki gelecekteki risk farklılığına odaklanılmıştır.
  • Geçmiş mamografi raporları tarih sırasıyla modele dahil edilmiştir.
  • Ham görüntü gerektirmeyen daha ölçeklenebilir bir yaklaşım geliştirilmiştir.
  • TF-IDF kullanımı klinik terim düzeyinde açıklanabilirlik sağlamıştır.
  • Yapılandırılmış klinik, üreme, aile öyküsü ve sosyoekonomik bilgiler birleştirilmiştir.
  • Eğitim-test ayrımı kişi düzeyinde yapılmıştır.
  • Bir ile beş yıl için ayrı performans sonuçları sunulmuştur.
  • Yaş ve coğrafi bölge alt grupları incelenmiştir.
  • Beta ve izotonik kalibrasyon yöntemleri karşılaştırılmıştır.
  • Operasyonel duyarlılık, özgüllük, PPV, NPV ve yanlış negatif senaryoları sunulmuştur.
  • BI-RADS sınıfları içindeki risk dağılımları görselleştirilmiştir.
  • Bütünleşik gradyanlarla doğru ve hatalı tahminler ayrı incelenmiştir.
  • Metin ve yapılandırılmış özelliklerin katkıları ayrı değerlendirilmiştir.
  • Erken kanser dışlama ve sonuç doğrulama pencereleri için duyarlılık analizleri yapılmıştır.

Çalışmanın sınırlılıkları

  • Hakem değerlendirmesi yoktur: Çalışma henüz hakemlikten geçmemiş bir preprinttir.
  • Retrospektif tasarım: Kayıt hataları, seçilim ve ölçülmeyen karıştırıcılar bulunabilir.
  • Tek sağlık sistemi: Veriler aynı özel sağlık ağına aittir; başka ülkeler veya kamu sistemlerinde dış doğrulama yoktur.
  • Rastgele iç doğrulama: Test verisi bağımsız kişilerden oluşsa da aynı kurum, dönem ve kayıt süreçlerinden gelmektedir.
  • Takip seçilimi: Yeterli takip kaydı bulunmayan kişiler çıkarılmıştır.
  • Özel sağlık sistemi nüfusu: Sonuçlar Brezilya’daki bütün nüfusa veya kamu sağlık sistemine doğrudan genellenemez.
  • İnceleme düzeyinde analiz: Aynı kişi birden fazla indeks mamografiyle temsil edilebilir.
  • İncelemeler arası bağımlılık: Aynı kişinin tekrarlanan incelemelerinin istatistiksel bağımlılığı ana metinde ayrıntılı ele alınmamıştır.
  • Sonuç etiketi histolojiyle sınırlı değildir: BI-RADS 5 ve 6 kayıtları da pozitif sonuca katkıda bulunmuştur.
  • Ham görüntüler kullanılmamıştır: Raporlara aktarılmayan görüntü bilgileri kaybedilmiştir.
  • Rapor yazımına bağımlılık: Hastane, cihaz, radyolog ve dil değişiklikleri performansı etkileyebilir.
  • Eksik klinik kayıtlar: Cerrahi veya implant öyküsü bazı kişilerde yalnızca metinden anlaşılmıştır.
  • Sosyoekonomik vekil değişkenler: Sigorta ödemesi ve posta kodu sağlık hizmeti erişimini öğrenmiş olabilir.
  • Adalet analizi sınırlıdır: Irk, etnik köken, gelir düzeyi ve diğer sosyal gruplara göre ayrıntılı hata analizi sunulmamıştır.
  • Bölgesel dengesizlik: Beş yıllık kohortun büyük bölümü Kuzeydoğu bölgesindendir.
  • Az temsil edilen bölgeler: Güney ve Orta-Batı tahminlerinde güven aralıkları geniştir.
  • Kalibrasyonda yüksek risk sapması: En yüksek tahminlerde hafif aşırı güven görülmüştür.
  • Brier karşılaştırması eksiktir: Basit prevalans modeline karşı Brier karşılaştırması verilmemiştir.
  • Doğrudan model karşılaştırması yoktur: Gail, Tyrer-Cuzick veya görüntü tabanlı modeller aynı test kümesinde değerlendirilmemiştir.
  • Prospektif klinik yarar gösterilmemiştir: Modelin erken tanıyı veya sağkalımı iyileştirdiği bilinmemektedir.
  • Tarama aralığı denenmemiştir: Düşük risk grubunda iki yıllık taramanın güvenliği deneysel olarak sınanmamıştır.
  • Ek görüntülemenin etkisi bilinmiyor: Yüksek riskli gruba MRI veya biyopsi verilmesinin yarar-zarar dengesi ölçülmemiştir.
  • Maliyet-etkililik yoktur: Sağlık sistemi kaynaklarına gerçek etkisi hesaplanmamıştır.
  • Model kurulumunda tutarsızlık: Ayrı zaman modelleri ile çok çıkışlı tek model anlatımları uyuşmamaktadır.
  • Kohort toplamlarında tutarsızlık: 706.545, 706.910 ve eğitim-test toplamı birbiriyle eşleşmemektedir.
  • Düşük risk ifadesi yanıltıcıdır: Özetteki %10 ifadesi grup içi kanser oranı değil, bütün pozitiflerin düşük risk grubunda kalan kısmıdır.
  • Yaş grubu raporlaması farklıdır: Tablo 50-74, metin 50-75 kullanmaktadır.
  • Ek materyal eksikliği: Bazı önemli hiperparametreler ve uygulama ayrıntıları ana PDF’de değil ek materyalde bırakılmıştır.
  • Yeniden üretilebilirlik sınırlıdır: Ham rapor metinleri gizlilik nedeniyle paylaşılmayacak, veriler ve ağırlıklar ancak yayım sonrasında koşullu biçimde sağlanacaktır.

Çalışma ne söylüyor?

  • Uzunlamasına mamografi raporları gelecekteki meme kanseri riski hakkında önemli tahmin sinyali taşımaktadır.
  • Ham mamografi görüntüleri olmadan güçlü risk ayrımı elde edilebilmiştir.
  • Beş yıllık modelin test AUROC değeri yaklaşık 0,86’dır.
  • Model bir ile beş yıllık zaman ufuklarında benzer ayrım performansı göstermiştir.
  • BI-RADS 1, 2 ve 3 sınıflarının kendi içinde önemli risk heterojenliği bulunmaktadır.
  • En yüksek riskli %3,4’lük inceleme grubu, beş yıllık pozitiflerin yaklaşık yarısını içermektedir.
  • Düşük riskli büyük bir inceleme grubu çok yüksek negatif öngörü değerine sahiptir.
  • Geçmiş cerrahi ifadeleri, kalsifikasyonlar ve mimari distorsiyonlar yüksek risk tahminlerine katkıda bulunmaktadır.
  • Güven verici ve simetrik radyolojik ifadeler düşük risk tahminlerinde öne çıkmaktadır.
  • Metin raporları, yapılandırılmış klinik özelliklerden daha büyük toplam tahmin katkısı göstermiştir.
  • Beta ve izotonik kalibrasyon ham model olasılıklarını iyileştirmiştir.
  • Rutin rapor metinleri kişiselleştirilmiş tarama araştırmaları için ölçeklenebilir bir veri kaynağı olabilir.

Çalışma ne söylemiyor?

  • Modelin mamografi veya radyolog değerlendirmesinin yerine geçebileceğini göstermemektedir.
  • Modelin mevcut kanseri kesin olarak teşhis ettiğini göstermemektedir.
  • AUROC 0,86’nın bireysel tahminlerde %86 doğruluk anlamına geldiğini göstermemektedir.
  • Yüksek riskli işaretlenen herkesin kanser geliştireceğini göstermemektedir.
  • En düşük riskli %47’nin %10’unda kanser geliştiğini göstermemektedir.
  • Düşük riskli kişilerin taramasının güvenle iki yılda bire çıkarılabileceğini kanıtlamamaktadır.
  • Yüksek riskli kişilere otomatik olarak biyopsi veya MRI yapılması gerektiğini kanıtlamamaktadır.
  • Model kullanımının kanseri daha erken evrede yakaladığını göstermemektedir.
  • Meme kanserine bağlı ölümü azalttığını göstermemektedir.
  • Diğer risk modellerinden başa baş karşılaştırmayla üstün olduğunu göstermemektedir.
  • Brezilya kamu sistemi veya başka ülkelerde aynı performansı göstereceğini kanıtlamamaktadır.
  • Sosyoekonomik özelliklerin biyolojik olarak koruyucu veya risk artırıcı olduğunu göstermemektedir.
  • Modelin eşitlik, maliyet ve hasta yaşam kalitesi açısından güvenli olduğunu göstermemektedir.

Çalışmanın Yöntemi ve Bulguları

Teknik yöntem özeti

Yöntem alanıÇalışmada uygulanan yaklaşım
Çalışma türüRetrospektif gerçek yaşam kohortu ve prognostik modelleme
Sağlık sistemiHapvida, Brezilya özel sağlık ağı
Veri dönemi1 Ocak 2016-31 Aralık 2025
Başlangıç veri hacmi4.609.295 mamografi raporu ve 1.810.345 kişi
İndeks mamografi sınıflarıBI-RADS 1, 2 ve 3
Yaş aralığı18-75 yıl
Geçmiş meme kanseriDışlandı
Erken kanser dışlama penceresiİndeks incelemeden sonraki ilk 90 gün
Tahmin ufukları1, 2, 3, 4 ve 5 yıl
Birincil sonuçBI-RADS 5/6 veya malign biyopsiyle belirlenen gelecekteki pozitif sonuç
Yapılandırılmış girdilerDemografi, üreme öyküsü, aile öyküsü, BMI, BI-RADS, sigorta ödemesi ve posta kodu
Metin girdileriGeçmiş mamografi raporlarının tarih sıralı serisi
Metin kodlamaTF-IDF
Zaman bilgisiİncelemeler arasındaki süre ve zaman ağırlıklı birleştirme
Tahmin modeliBirleştirilmiş vektörleri kullanan yoğun sinir ağı
Veri ayrımıKişi düzeyinde eğitim ve test ayrımı
DoğrulamaEğitim kümesinde beş katlı çapraz doğrulama ve saklı test kümesi
Ayrım ölçüleriAUROC ve konkordans indeksi
Operasyonel ölçülerDuyarlılık, özgüllük, PPV, NPV ve yanlış negatif oranı
KalibrasyonPlatt, beta ve izotonik kalibrasyon
AçıklanabilirlikBütünleşik gradyanlar ve terim çifti katkı haritaları

Beş yıllık kohortun ana özellikleri

ÖzellikSonuç
Kişi sayısı278.475
Uygun inceleme sayısıAna metinde 706.545; Tablo 1’de 706.910
Medyan yaş43 yıl; çeyrekler arası aralık 36-52
BI-RADS 1404.042; %57,2
BI-RADS 2218.295; %30,9
BI-RADS 384.573; %11,9
Pozitif sonuç9.620; %1,36
Eğitim incelemeleri566.698
Test incelemeleri142.517

Model performansının özeti

Performans alanıSonuçDoğru yorum
5 yıllık AUROC0,863Güçlü risk sıralaması; bireysel doğruluk yüzdesi değildir
5 yıllık C-indeksi0,859Olay zamanına göre güçlü sıralama
1-4 yıllık AUROC0,82-0,85Farklı zaman ufuklarında benzer ayrım
Kalibre Brier skoru0,014Nadir olay sıklığı ve referans modelle birlikte yorumlanmalıdır
En yüksek riskli %3,4’te duyarlılık%50,1Bütün pozitif incelemelerin yaklaşık yarısı yakalanır
En yüksek riskli %3,4’te özgüllük%97,3Negatiflerin büyük bölümü işaretlenmez
En yüksek riskli %3,4’te PPV%25,1İşaretlenenlerin yaklaşık dörtte biri pozitif sonuç geliştirir
En düşük riskli %47’de FNR%10,0Bütün pozitiflerin %10’u bu gruptadır; grup içi kanser oranı değildir
Düşük risk grubunda NPVYaklaşık %99,6İncelemelerin yaklaşık %0,4’ü pozitif olabilir

Modelin formüllerle açıklanan temel bileşenleri

Metin ağırlıklandırması:

\[ TF\text{-}IDF(t,d)=TF(t,d)\times\log\left(\frac{N}{DF(t)}\right) \]

Bu ilişki, raporda sık fakat bütün raporlarda nadir bulunan terimlere daha fazla ağırlık verir.

Zaman ağırlıklı rapor birleştirme:

\[ w_i=\frac{e^{-\lambda\Delta t_i}}{\sum_j e^{-\lambda\Delta t_j}} \]

Yakın tarihli raporlar, seçilen parametreye bağlı olarak daha yüksek ağırlık alabilir.

İkili gelecek risk tahmini:

\[ \hat{p}_k=P(Y=1\mid X,\ T\leq k) \]

Burada p̂k, mevcut inceleme anındaki bilgilerle k yıl içinde pozitif sonuç gelişme olasılığını; X, rapor ve yapılandırılmış özellikleri ifade eder.

Bütünleşik gradyan katkısı:

\[ IG_i(x)=(x_i-x_i')\int_0^1\frac{\partial F(x'+\alpha(x-x'))}{\partial x_i}\,d\alpha \]

Bu ölçü, belirli bir kelime veya klinik özelliğin model risk tahminini ne kadar ve hangi yönde etkilediğini gösterir.

Metin, tablo ve şekiller arasındaki raporlama sorunları

KonuBir yerde bildirilenBaşka yerde bildirilenNeden önemli?
Beş yıllık toplam inceleme706.545Tablo 1’de 706.910Kohort büyüklüğü ve prevalans hesabı açıklığa kavuşmalıdır
Eğitim-test toplamı566.698 + 142.517 = 709.215Her iki kohort toplamından daha yüksekVeri ayrımının doğru sayıları belirsizdir
Model yapısıHer tahmin ufku için ayrı modelŞekil 1’de aynı anda 1-5 yıl çıktısı veren modelModel mimarisi ve eğitim yöntemi farklılaşır
Düşük riskli %47Özette “yalnızca %10 kanser gelişti”Sonuç ve Şekil 4’te pozitiflerin %10’unun grupta kalmasıGrup içi riskle yanlış negatif oranı birbirine karıştırılmamalıdır
Üst yaş grubuMetinde 50-75Tablo 2’de 50-74Alt grup sınırı net olmalıdır

Etik onay, finansman ve çıkar çatışması

Çalışma Brezilya Ulusal Sağlık Konseyine bağlı Ulusal Araştırma Etik Komisyonu tarafından CAAE 83210524.4.0000.0229 numarasıyla onaylanmıştır.

Araştırma Helsinki Bildirgesi ve Brezilya Ulusal Sağlık Konseyi’nin 466/2012 sayılı kararı doğrultusunda yürütülmüştür. Kimliksizleştirilmiş ikincil verilerin geriye dönük kullanılması nedeniyle bireysel bilgilendirilmiş onam zorunluluğu kaldırılmıştır.

Çalışma FAPESP, Hapvida Assistência Médica S.A., CNPq, CAPES ve FUNCAP tarafından desteklenmiştir. Fon sağlayıcıların çalışma tasarımı, veri toplama, analiz, yorum veya makale yazımında rol almadığı bildirilmiştir.

Yazarlar çıkar çatışması beyan etmemiştir.

Kaynak ve Yöntem Notu

Bu içerik, Higor S. Monteiro, José A. Shiomi da Cruz, César L. C. Mattos, Iago C. Chaves, Javam C. Machado, Hernán A. Makse, Lucas C. Parra ve José S. Andrade Jr. tarafından hazırlanan “Breast cancer risk prediction from longitudinal mammography reports in a real-world health system: a prognostic modelling study” başlıklı araştırmaya dayanmaktadır.

Çalışma SSRN’de sunulan bir preprinttir. Özgün metinde açıkça “This preprint research paper has not been peer reviewed” ifadesi yer almaktadır. Dolayısıyla model, analizler ve klinik yorumlar bağımsız hakem değerlendirmesinden geçmemiştir ve sonraki sürümlerde değişebilir.

Araştırma randomize tarama deneyi veya prospektif klinik uygulama çalışması değildir. Brezilya’daki tek bir özel sağlık sisteminin 2016-2025 dönemindeki geriye dönük elektronik sağlık kayıtlarına dayanan prognostik modelleme çalışmasıdır.

Model ham mamografi görüntülerini kullanmamıştır. Tahminler radyoloji rapor metinleri, önceki BI-RADS kayıtları, incelemeler arasındaki zaman ve yapılandırılmış klinik bilgilerden elde edilmiştir.

Model mevcut mamografide kanser tanısı koymak için değil, BI-RADS 1-3 olarak değerlendirilen incelemelerden sonra bir ile beş yıl içindeki pozitif sonuç riskini tahmin etmek amacıyla geliştirilmiştir.

Çalışmadaki pozitif sonuç yalnızca histopatolojik kanser doğrulamasından oluşmamaktadır; BI-RADS 5 ve 6 kayıtları da sonuç tanımına katkıda bulunmaktadır. Sonuç etiketindeki olası yanlış sınıflandırma dikkate alınmalıdır.

En yüksek riskli %3,4 ve en düşük riskli %47 gibi eşikler geriye dönük test verisi üzerinde oluşturulmuş operasyonel senaryolardır. Klinik uygulama için doğrulanmış biyopsi, MRI veya tarama aralığı eşikleri değildir.

Çalışma düşük risk grubunda iki yıllık taramanın güvenli olduğunu, yüksek risk grubunda ek görüntülemenin yarar sağladığını veya model kullanımının meme kanserine bağlı ölümleri azalttığını göstermemektedir.

Kohort sayıları, eğitim-test bölünmesi, zaman ufku model yapısı ve düşük risk oranının anlatımı konusunda metin, tablo ve şekiller arasında açıklama gerektiren tutarsızlıklar vardır.

Model yalnızca aynı sağlık sisteminden rastgele ayrılmış kişiler üzerinde test edilmiştir. Bağımsız sağlık sistemi, kamu sistemi veya başka bir ülkede dış doğrulama yapılmamıştır.

Ham radyoloji raporlarının gizlilik nedeniyle paylaşılmayacağı, kimliksizleştirilmiş verilerin ve model ağırlıklarının ise yayım sonrasında veri sorumlusunun onayına bağlı olarak sağlanabileceği belirtilmiştir. Bu durum mevcut preprintin bağımsız yeniden üretilebilirliğini sınırlar.

Bu makale yalnızca yüklenen PDF’deki yöntem, kohort akışı, tablolar, model şeması, ROC ve kalibrasyon grafikleri, risk yüzdelikleri, BI-RADS dağılımları, açıklanabilirlik analizleri, yazar yorumları ve sınırlılıklar temel alınarak hazırlanmıştır. PDF’de bulunmayan klinik yarar, tarama güvenliği, tedavi başarısı veya kesin kişisel risk iddiası eklenmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy