
Mamografi taramalarında BI-RADS 1, 2 veya 3 sonucu alan kişiler genellikle mevcut incelemede kanser açısından negatif ya da büyük ölçüde iyi huylu kabul edilir. Ancak aynı BI-RADS sınıfında bulunan kişilerin gelecekte meme kanseri geliştirme riskleri eşit değildir. Mevcut tarama sistemleri çoğunlukla yaş ve mevcut mamografi sınıfına dayalı benzer takip aralıkları uygular; geçmiş raporlarda biriken klinik işaretlerin gelecekteki riske katkısı ise rutin uygulamada sistematik biçimde hesaplanmaz.
Bu çalışma, ham mamografi görüntülerine erişmeden, yalnızca radyologların geçmiş ve güncel rapor metinleriyle elektronik sağlık kayıtlarındaki yapılandırılmış bilgileri kullanarak bir ile beş yıl içindeki meme kanseri riskini tahmin eden bir model geliştirmiştir.
Veriler, yazarların Brezilya’nın en büyük özel sağlık sistemi olarak tanımladığı Hapvida’nın 200’den fazla hastane ve kliniğinden elde edilmiştir. Ocak 2016 ile Aralık 2025 arasında BI-RADS 1, 2 veya 3 olarak sınıflandırılmış yaklaşık 4,61 milyon mamografi raporu ve 1,81 milyon kişi başlangıç veri havuzunu oluşturmuştur.
Beş yıllık risk analizi için yaş, önceki kanser durumu, erken dönemde kanser doğrulanması ve yeterli takip bulunması gibi ölçütler uygulanmıştır. Ana metin ve hasta akış şeması, beş yıllık kohortta 278.475 kişiye ait 706.545 uygun mamografi incelemesi bulunduğunu ve bunların 9.620’sinin beş yıl içinde pozitif sonuçla ilişkilendirildiğini bildirmektedir. Bu, inceleme düzeyinde yaklaşık %1,36’lık bir olay sıklığına karşılık gelmektedir.
Bununla birlikte çalışmanın raporlanmasında sayısal bir iç tutarsızlık vardır. Tablo 1’de beş yıllık toplam inceleme sayısı 706.910 olarak verilmektedir. Aynı tablodaki BI-RADS 1, 2 ve 3 sayılarının toplamı da 706.910’dur. Buna karşılık ana metin ve Şekil 2’de 706.545 sayısı kullanılmaktadır. Ayrıca bildirilen 566.698 eğitim ve 142.517 test incelemesinin toplamı 709.215’tir ve her iki toplamla da uyuşmamaktadır. Bu farklılıklar nihai sürümde açıklanmalıdır.
Modelin girdileri iki ana bloktan oluşmuştur. İlk blok; yaş, menarş ve menopoz yaşı, doğum yapmama, düşük sayısı, ailede meme veya yumurtalık kanseri öyküsü, emzirme, beden kitle indeksi, BI-RADS sınıfı, sigorta ödemesi ve coğrafi posta kodu gibi yapılandırılmış klinik bilgileri içermiştir.
İkinci blok, kişilerin indeks mamografiden önceki radyoloji raporlarının tarih sırasına göre düzenlenmiş metinlerini ve incelemeler arasındaki zaman aralıklarını kapsamıştır. Rapor metinleri TF-IDF yöntemiyle sayısal vektörlere dönüştürülmüş, geçmiş raporlar ortalama veya yakın tarihli incelemelere daha fazla ağırlık veren zaman ağırlıklı birleştirme yöntemleriyle özetlenmiştir.
Beş yıllık tahmin için test kümesindeki AUROC değeri 0,863 ve %95 güven aralığı 0,853-0,871 olarak bildirilmiştir. Bir ile dört yıllık modellerde AUROC değerleri 0,82 ile 0,85 arasında değişmiştir. Beş yıllık takip süresini birlikte değerlendiren konkordans indeksi 0,859’dur.
AUROC 0,86, rastgele seçilen bir kanser gelişen inceleme ile kanser gelişmeyen bir inceleme karşılaştırıldığında modelin kanser gelişen incelemeye daha yüksek risk puanı verme olasılığının yaklaşık %86 olduğunu ifade eder. Bu değer, modelin bireysel bir kişide “%86 doğrulukla kanseri bildiği” anlamına gelmez.
Model yalnızca en yüksek riskli %3,4’lük inceleme grubunu işaretlediğinde, beş yıl içinde kanser gelişecek pozitif incelemelerin %50,1’ini yakalamıştır. Bu çalışma noktasında özgüllük %97,3 ve pozitif öngörü değeri yaklaşık %25,1’dir. Başka bir ifadeyle yüksek risk olarak işaretlenen yaklaşık her dört incelemeden biri beş yıllık pozitif sonuçla ilişkilidir; ancak bu, kişilerin hemen kanser olduğu veya biyopsi gerektirdiği anlamına gelmez.
Düşük risk analizi de dikkat çekicidir. En düşük riskli incelemelerin %25’i düşük risk grubu olarak seçildiğinde bütün beş yıllık kanser olaylarının %5’i bu grupta kalmıştır. En düşük riskli %47 seçildiğinde ise bütün pozitif olayların %10’u bu grupta kalmıştır. Bu sonuçların doğru yorumu, “düşük risk grubundaki kişilerin %10’u kanser oldu” değildir.
Çalışmanın özetinde kullanılan “en düşük %47’lik grupta yalnızca %10 kanser gelişti” ifadesi yanıltıcıdır. Şekil 4 ve sonuç bölümüne göre %10 değeri, bütün kanser olaylarının ne kadarının düşük risk grubunda kaldığını gösteren yanlış negatif oranıdır. Düşük risk grubundaki incelemelerin yaklaşık %99,6’sı beş yıl boyunca negatif kalmıştır; dolayısıyla grup içi pozitiflik yaklaşık %0,4 düzeyindedir.
Model, BI-RADS sınıflarının kendi içindeki belirgin risk farklılıklarını da göstermiştir. BI-RADS 1, 2 ve 3 içinde gelecekte kanser gelişen incelemelerin risk puanları geniş bir dağılım sergilemiştir. Bu bulgu, tek bir mamografinin BI-RADS sınıfının gelecekteki riski bütünüyle temsil etmediğini; geçmiş raporların ve klinik özelliklerin ek bilgi taşıyabileceğini düşündürmektedir.
Açıklanabilirlik analizinde yüksek risk tahminlerini en güçlü biçimde etkileyen rapor ifadeleri arasında önceki meme cerrahisi, mastektomi, kalsifikasyonlar ve mimari distorsiyonlar yer almıştır. Düşük risk tahminlerinde ise iki memenin simetrik görünmesi, karşı memede veya aksiller lenf düğümlerinde şüpheli bulgu bulunmaması ve güven verici radyolojik ifadeler öne çıkmıştır.
Yapılandırılmış değişkenlerde aile öyküsü ve üreme öyküsü yüksek risk tahminlerine daha fazla katkı sağlamıştır. Sigorta ödeme düzeyi ve coğrafi bölge gibi sosyoekonomik göstergeler ise bazı doğru negatif tahminlerde daha belirgin olmuştur. Bu son bulgu dikkatle yorumlanmalıdır; ekonomik ve coğrafi değişkenler biyolojik riski değil, sağlık hizmetine erişimi, takip düzenini veya veri kayıt biçimini de yansıtabilir.
Modelin kalibrasyonu beta kalibrasyonu ve izotonik regresyonla iyileştirilmiştir. Her iki yöntemde Brier skoru yaklaşık 0,014 olarak bildirilirken kalibre edilmemiş modelde 0,093’tür. En yüksek risk tahminlerinde hafif aşırı güven görülmüştür. Düşük olay sıklığı nedeniyle Brier skorunun olay prevalansıyla birlikte yorumlanması gerekir; çalışmada yalnızca prevalansı tahmin eden basit bir karşılaştırma modelinin Brier skoru verilmemiştir.
Çalışma, modelin gerçek klinik uygulamada erken tanıyı artırdığını, ölümleri azalttığını veya tarama maliyetlerini düşürdüğünü göstermemiştir. Model sağlık çalışanlarının kararlarını değiştirecek biçimde ileriye dönük olarak uygulanmamış, yüksek risk grubuna ek MRI veya biyopsi verilmemiş ve düşük risk grubunda tarama aralığı gerçekten iki yıla çıkarılmamıştır.
Bu nedenle sonuçlar, kişiselleştirilmiş tarama için güçlü bir teknik olasılık göstermekle birlikte henüz tarama rehberi değildir. Yazarların da belirttiği gibi prospektif doğrulama, maliyet-etkililik analizi, yanlış pozitiflerin doğuracağı biyopsi ve kaygı yükü, gecikmiş tanı riski ve farklı sağlık sistemlerindeki dış doğrulama tamamlanmadan klinik politika değişikliği yapılmamalıdır.
Çalışmanın temel problemi nedir?
Geleneksel meme kanseri tarama programlarında yaş, aile öyküsü ve mevcut mamografi sonucu gibi sınırlı sayıda faktör kullanılır. Pek çok sağlık sisteminde belirli bir yaş grubundaki kişilere yıllık veya iki yılda bir mamografi önerilir.
Bu yaklaşım nüfus düzeyinde uygulanabilir olsa da aynı yaşta ve aynı BI-RADS sınıfında bulunan iki kişinin gerçek riski birbirinden çok farklı olabilir. Örneğin her ikisi de BI-RADS 2 olan iki kişiden birinin geçmiş raporlarında tekrarlayan kalsifikasyon, mimari bozulma ve cerrahi öyküsü bulunurken diğerinde yıllardır değişmeyen, simetrik ve iyi huylu bulgular bulunabilir.
Çalışmanın temel araştırma sorusu şudur:
Bir kişinin geçmiş mamografi raporlarının tamamı ve rutin elektronik sağlık kayıtları birlikte değerlendirilirse, mevcut inceleme negatif veya muhtemelen iyi huylu olsa bile önümüzdeki bir ile beş yıl içindeki meme kanseri riski daha iyi ayırt edilebilir mi?
BI-RADS 1, 2 ve 3 ne ifade eder?
| BI-RADS sınıfı | Genel klinik anlamı | Çalışmadaki rolü |
|---|---|---|
| BI-RADS 1 | Negatif inceleme; şüpheli bulgu bulunmaması | Gelecekteki kanser riskinin tahmin edildiği ana gruplardan biri |
| BI-RADS 2 | İyi huylu bulgular | Mevcut incelemede kanser kuşkusu düşük, ancak uzun dönemli risk heterojen olabilir |
| BI-RADS 3 | Muhtemelen iyi huylu bulgu; genellikle kısa aralıklı kontrol gerektirir | Modelin daha ayrıntılı risk farklılığı aradığı üçüncü ana grup |
Model BI-RADS 4, 5 veya 6 ile başvuran kişilerin mevcut kanser olasılığını değerlendirmek için geliştirilmemiştir. Amaç, güncel incelemesi negatif veya muhtemelen iyi huylu görünen kişiler arasında gelecekteki riski ayırmaktır.
Bu model mevcut mamogramdaki kanseri mi, gelecekteki kanseri mi tahmin ediyor?
Çalışma gelecekteki kanser riskini tahmin etmeyi amaçlamaktadır. İndeks mamografiden sonraki ilk 90 gün içinde malignite doğrulanan incelemeler dışlanmıştır. Böylece mevcut inceleme sırasında zaten var olan veya hemen sonrasında tanı konan kanserlerin “gelecek risk” olarak sınıflandırılmasının önüne geçilmeye çalışılmıştır.
Birincil sonuç, indeks mamografiden 90 gün sonra başlayıp seçilen tahmin ufkunun sonuna kadar ortaya çıkan meme kanseri göstergesidir.
Pozitif sonuç şu yollardan biriyle tanımlanmıştır:
- BI-RADS 6 sınıflaması,
- Malign biyopsi sonucu,
- BI-RADS 5 sınıflaması; ancak sonraki altı ayda negatif veya iyi huylu incelemeyle çürütülmemiş olması.
Bu sonuç tanımı yalnızca histopatolojik olarak doğrulanmış kanserlerden oluşmamaktadır. BI-RADS 5 veya 6 kodlarının da sonuç etiketine katkıda bulunması olası yanlış sınıflandırmaya yol açabilir. Araştırmacılar zaman pencerelerini değiştirerek duyarlılık analizleri yapmış ve model performansında belirgin değişim bildirmemiştir.
Takibin yeterli olduğu nasıl belirlendi?
Bir incelemenin belirli bir tahmin ufkunda negatif olarak sınıflandırılabilmesi için hastanın o süre boyunca sistem içinde gözlenmiş olması gerekiyordu. Takip yıllık aralıklara ayrılmış ve kişinin hedef sürenin sonunda veya sonrasında en az bir mamografi ya da biyopsi kaydı bulunması istenmiştir.
Örneğin beş yıllık analizde, kişinin beşinci yıl veya sonrasında sistemde bir mamografi ya da biyopsi kaydı bulunması gerekiyordu. Yeterli takibi bulunmayan incelemeler beş yıllık analizden çıkarılmış, ancak daha kısa takip ölçütünü karşılıyorsa bir veya iki yıllık analizlerde tutulmuştur.
Bu yöntem yanlış negatif etiketleri azaltmayı amaçlar. Buna karşılık düzenli takip yaptıran ve aynı özel sağlık sistemi içinde kalan kişileri seçer. Sağlık sisteminden ayrılan, başka merkezde tanı alan veya uzun süre mamografi yaptırmayan kişiler dışlanmış olabilir.
Dolayısıyla modelin performansı, düzenli ve belgelenmiş takibi bulunan özel sağlık sistemi kullanıcılarında ölçülmüştür. Parçalı kayıtlara sahip sağlık sistemlerine aynı biçimde taşınabileceği gösterilmemiştir.
Beş yıllık kohort nasıl oluşturuldu?
| Aşama | Bildirilen sayı | Açıklama |
|---|---|---|
| Başlangıç mamografi raporları | 4.609.295 | BI-RADS 1, 2 veya 3 raporları |
| Başlangıçtaki kişiler | 1.810.345 | 2016-2025 dönemindeki toplam kişi sayısı |
| Beş yıllık uygun kişiler | 278.475 | Yaş, erken kanser dışlaması ve takip ölçütlerini karşılayanlar |
| Beş yıllık uygun incelemeler | Ana metin ve Şekil 2’de 706.545 | Tablo 1’de 706.910 olarak verilmiştir |
| Negatif sonuçlu incelemeler | 696.925 | Beş yıl içinde pozitif sonuç bulunmayan ve takip edilenler |
| Pozitif sonuçlu incelemeler | 9.620 | İnceleme düzeyinde %1,36 olay sıklığı |
| BI-RADS 5 veya 6 ile ilk işaret | 8.517 | Daha sonra biyopsiyle doğrulanmış olabilir |
| İlk pozitif işaret olarak malign biyopsi | 1.103 | Öncesinde BI-RADS 5 veya 6 bulunmayanlar |
Analiz bir kişi düzeyinde mi, mamografi düzeyinde mi yapıldı?
Bir kişi çalışma süresinde birden fazla uygun mamografiye sahip olabilir. Her uygun mamografi, o tarihte mevcut bilgilerle oluşturulan ayrı bir indeks inceleme ve ayrı bir risk tahmini olarak değerlendirilmiştir.
Aynı kişi eğitim ve test kümelerine bölünmemiştir. Veri ayrımı kişi düzeyinde yapılmış ve bir kişinin bütün incelemeleri aynı kümede tutulmuştur. Bu yaklaşım eğitim-test veri sızıntısını azaltan önemli bir güçlü yöndür.
Bununla birlikte performans ölçülerinin birimi büyük ölçüde mamografi incelemesidir. Aynı kişi test kümesinde birden fazla indeks incelemeyle temsil edilebilir. Bu nedenle “en yüksek riskli %3,4” ifadesi doğrudan benzersiz kişilerin %3,4’ü anlamına gelmeyebilir.
Aynı kişiye ait incelemeler birbirinden bağımsız değildir. Çalışma bu bağımlılığın güven aralıklarında nasıl ele alındığını ana metinde ayrıntılı olarak açıklamamaktadır.
Modelde kullanılan yapılandırılmış veriler
| Değişken grubu | Örnek değişkenler |
|---|---|
| Demografi | Yaş |
| Üreme öyküsü | Menarş yaşı, menopoz yaşı, doğum yapmama, düşük sayısı, emzirme öyküsü |
| Aile öyküsü | Ailede meme veya yumurtalık kanseri |
| Güncel radyolojik sınıf | İndeks mamografinin BI-RADS sınıfı |
| Vücut ölçümü | Beden kitle indeksi |
| Sosyoekonomik göstergeler | Aylık sigorta ödemesi |
| Coğrafi bağlam | Brezilya posta kodunun ilk üç hanesi |
Sigorta ödemesi ve posta kodu doğrudan biyolojik meme kanseri belirteçleri değildir. Sağlık hizmetine erişim, gelir, bölgesel sağlık altyapısı, takip sıklığı ve kayıt kalitesi gibi farklı süreçlerin göstergesi olabilirler.
Uzunlamasına mamografi raporları nasıl kullanıldı?
Her kişi, indeks incelemeden önceki mamografi raporlarının zaman sırasına göre düzenlenmiş dizisiyle temsil edilmiştir. Her geçmiş kayıt şu bilgileri taşımıştır:
- Radyoloğun serbest metin raporu,
- İlgili BI-RADS sınıfı,
- Bir önceki mamografiyle arasındaki zaman.
Model yalnızca son rapora bakmamış; geçmiş raporlar boyunca ortaya çıkan, kaybolan veya tekrar eden radyolojik ifadeleri özetlemeye çalışmıştır.
Bu yaklaşım şu tür bilgileri yakalayabilir:
- Yıllar içinde tekrarlanan kalsifikasyon ifadeleri,
- Mimari distorsiyonun yeni veya kalıcı olması,
- Önceki cerrahi değişiklikler,
- İki inceleme arasındaki sürenin uzaması veya kısalması,
- BI-RADS sınıflarının zaman içindeki seyri.
TF-IDF ne işe yaradı?
Radyoloji raporları doğrudan sinir ağına ham cümleler şeklinde verilmemiştir. Metinler, kelime ve kelime çiftlerinin rapor içindeki önemini ölçen TF-IDF yöntemiyle sayısal vektörlere dönüştürülmüştür.
Çalışmanın kullandığı yöntemin temel mantığı açıklama amacıyla şöyle gösterilebilir:
\[ TF\text{-}IDF(t,d)=TF(t,d)\times\log\left(\frac{N}{DF(t)}\right) \]
Burada:
- t, belirli bir kelime veya terimi,
- d, incelenen radyoloji raporunu,
- TF(t,d), terimin ilgili raporda ne sıklıkta geçtiğini,
- DF(t), terimin kaç farklı raporda görüldüğünü,
- N, toplam rapor sayısını ifade eder.
“Meme” veya “mamografi” gibi hemen her raporda bulunan kelimeler düşük ayırt edici ağırlık alırken “mimari distorsiyon” veya belirli cerrahi ifadeler daha ayırt edici olabilir.
TF-IDF’nin avantajı, modelin hangi kelime veya kelime çiftlerine önem verdiğinin görülebilmesidir. Buna karşılık kelimelerin bağlamını modern dil modelleri kadar ayrıntılı temsil etmeyebilir. Olumsuzluk, belirsizlik, rapor şablonları ve kurumlara özgü yazım biçimleri model performansını etkileyebilir.
Geçmiş raporların zamanı nasıl dikkate alındı?
Model mimarisinde geçmiş raporları tek bir hasta vektörüne dönüştüren değiştirilebilir bir birleştirme modülü kullanılmıştır. Basit ortalama ve daha yakın tarihli incelemelere daha fazla önem veren zaman ağırlıklı ortalama seçenekleri değerlendirilmiştir.
Çalışmanın anlattığı üstel zaman ağırlığının temel mantığı şu ilişkiyle açıklanabilir:
\[ w_i=\frac{e^{-\lambda\Delta t_i}}{\sum_j e^{-\lambda\Delta t_j}} \]
Burada:
- Δti, geçmiş raporla indeks inceleme arasındaki zamanı,
- λ, eski raporların ağırlığının ne kadar hızlı azalacağını belirleyen parametreyi,
- wi, ilgili geçmiş raporun toplam özetteki ağırlığını ifade eder.
Bu formül çalışmanın zaman ağırlıklı yaklaşımını açıklamak için verilmiştir. Kullanılan kesin parametreler ve en iyi toplulaştırma seçeneği ana PDF’de ayrıntılı biçimde raporlanmamış, ek materyale yönlendirilmiştir.
Model mimarisinde önemli bir açıklama tutarsızlığı
Çalışma tasarımı bölümünde her tahmin ufku için ayrı bir model eğitildiği belirtilmektedir. Buna karşılık model mimarisi bölümünde ve Şekil 1’de tek bir yoğun sinir ağının bir, iki, üç, dört ve beş yıllık olasılıkları aynı anda ürettiği gösterilmektedir.
Bu iki anlatım birbirinden farklı model kurulumlarını tarif eder:
- Her zaman ufku için bağımsız model,
- Beş zamanı aynı anda tahmin eden çok çıkışlı tek model.
Nihai uygulamanın hangisi olduğu açık biçimde belirtilmelidir. Model mimarisi, kayıp fonksiyonu ve zaman ufukları arasındaki bilgi paylaşımı bakımından bu ayrım önemlidir.
Model nasıl eğitildi ve test edildi?
- Veriler kişi düzeyinde eğitim ve test kümelerine ayrılmıştır.
- Aynı kişi iki farklı ana kümeye girmemiştir.
- Eğitim verisi içinde beş katlı çapraz doğrulama kullanılmıştır.
- Hiperparametreler doğrulama performansına göre seçilmiştir.
- Nihai metrikler saklı test kümesinde hesaplanmıştır.
- Belirsizlikler yeniden örneklemeye dayalı güven aralıklarıyla verilmiştir.
Bu yaklaşım rastgele hasta bölünmesine dayalı bir iç doğrulamadır. Daha sonraki yıllarda gelen hastalarla ayrı zamansal doğrulama veya başka bir sağlık sisteminde bağımsız dış doğrulama yapılmamıştır.
AUROC sonuçları
| Tahmin süresi | Genel AUROC | %95 güven aralığı |
|---|---|---|
| 1 yıl | 0,84 | 0,82-0,85 |
| 2 yıl | 0,85 | 0,83-0,86 |
| 3 yıl | 0,82 | 0,80-0,83 |
| 4 yıl | 0,83 | 0,81-0,83 |
| 5 yıl | 0,86 | 0,85-0,87 |
Beş yıllık modelin daha yüksek performans göstermesi ilk bakışta şaşırtıcıdır; çünkü daha uzak geleceğin tahmin edilmesi genellikle daha zor olabilir. Yazarlar bunu beş yıllık kohortta daha fazla kanser olayı bulunmasına ve zaman ufukları için farklı eğitim düzenlerine bağlamaktadır.
AUROC neyi gösterir, neyi göstermez?
AUROC, modelin pozitif ve negatif incelemeleri ne kadar iyi sıraladığını ölçer. Yaygın bir yorumla:
\[ AUROC=P(Risk_{pozitif}>Risk_{negatif}) \]
Beş yıllık AUROC=0,863 değeri, rastgele seçilen bir pozitif incelemeye rastgele seçilen negatif incelemeden daha yüksek risk puanı verilme olasılığının yaklaşık %86,3 olduğunu ifade eder.
AUROC:
- Bir kişinin kesin kanser olasılığını göstermez.
- Belirlenen risk yüzdesinin doğru kalibre edildiğini tek başına kanıtlamaz.
- Yanlış pozitif veya yanlış negatiflerin klinik maliyetini içermez.
- Modelin kullanılmasıyla ölüm oranının azalacağını göstermez.
Konkordans indeksi
Beş yıla kadar bütün takip zamanları birlikte değerlendirildiğinde C-indeksi 0,859 olarak bildirilmiştir. Konkordans indeksi, daha erken kanser gelişen incelemeye daha yüksek risk verilip verilmediğini değerlendirir.
Ancak çalışmanın ana modellemesi ikili zaman ufku tahminleri olarak tarif edilmektedir. C-indeksinin hangi risk skoru ve sansürleme yaklaşımıyla hesaplandığı ana metinde sınırlı ayrıntıyla sunulmuştur.
Kalibrasyon neden gereklidir?
İki model hastaları benzer doğrulukla sıralayabilir, ancak biri riski sürekli olduğundan yüksek tahmin edebilir. Klinik kararlarda yalnızca sıralama değil, “bu kişinin beş yıllık riski yaklaşık yüzde kaçtır?” sorusu da önemlidir.
Çalışmada üç kalibrasyon yöntemi değerlendirilmiştir:
- Platt ölçekleme,
- Beta kalibrasyonu,
- İzotonik regresyon.
Platt ölçekleme ciddi sınıf dengesizliği altında olasılıkları dar bir aralığa sıkıştırmıştır. Beta ve izotonik kalibrasyon daha uygun sonuç vermiştir.
| Kalibrasyon yaklaşımı | Şekil 3’teki Brier skoru | Yorum |
|---|---|---|
| Kalibre edilmemiş model | 0,093 | Gözlenen risklerle belirgin uyumsuzluk |
| Beta kalibrasyonu | 0,014 | Gözlenen oranlara daha yakın tahminler |
| İzotonik regresyon | 0,014 | Beta kalibrasyonuna benzer sonuç |
En yüksek risk aralığında her iki kalibre model de riski hafif yüksek tahmin etmiştir. Bu bölgedeki örnek sayısının daha az olması ve olayların seyrekliği tahmin belirsizliğini artırmaktadır.
Beş yıllık kanser prevalansı düşük olduğu için Brier skoru doğal olarak küçük olabilir. Çalışmada yalnızca genel prevalansı herkese atayan basit bir referans modelle Brier karşılaştırması verilmemiştir. Bu nedenle 0,014 değeri tek başına kalibrasyonun klinik yeterliliğini kanıtlamaz.
En yüksek riskli %3,4’lük grup
| Ölçü | Sonuç | Anlamı |
|---|---|---|
| Yüksek risk olarak işaretlenen incelemeler | En yüksek %3,4 | Test incelemelerinin küçük bir bölümü ek değerlendirmeye ayrılır |
| Duyarlılık | %50,1 | Beş yıl içinde pozitif olacak incelemelerin yaklaşık yarısı yakalanır |
| Özgüllük | %97,3 | Negatif incelemelerin büyük bölümü yüksek risk olarak işaretlenmez |
| Pozitif öngörü değeri | %25,1 | İşaretlenen yaklaşık her dört incelemeden biri beş yıllık pozitif sonuçla ilişkilidir |
Bu eşik klinik uygulamada doğrulanmış bir biyopsi veya MRI eşiği değildir. Yazarlar, yüksek riskli kişilerin yeniden değerlendirme, daha kısa takip veya ek görüntüleme için seçilebileceğini tartışmaktadır; ancak bu stratejiler çalışmada uygulanmamıştır.
Yüksek risk olarak işaretlenenlerin yaklaşık dörtte üçü beş yıl içinde pozitif sonuç geliştirmemiştir. Bu kişilere ek biyopsi veya görüntüleme uygulanması yanlış pozitiflik, kaygı, maliyet ve gereksiz işlem oluşturabilir.
Düşük riskli %25 ve %47 nasıl yorumlanmalıdır?
| Düşük risk olarak seçilen bölüm | Bütün pozitiflerin bu grupta kalan bölümü | Negatif öngörü değeri |
|---|---|---|
| En düşük riskli %25 | %5,0; 2.468 pozitifin 123’ü | Yaklaşık %99,6 |
| En düşük riskli %47 | %10,0; 2.468 pozitifin 247’si | Yaklaşık %99,6 |
Yanlış negatif oranı, bütün pozitiflerin ne kadarının düşük risk grubuna atandığını gösterir. Grup içindeki gerçek kanser oranı değildir.
Model düşük riskli kişilerin tarama aralığının iki yıla çıkarılabileceğine ilişkin bir politika senaryosu sunmaktadır. Ancak bu senaryo uygulanıp test edilmemiştir. Taramanın geciktirilmesiyle ortaya çıkabilecek evre değişimi, interval kanser, mortalite, yaşam kalitesi veya maliyet sonucu ölçülmemiştir.
BI-RADS sınıfları içinde gizli risk farklılığı
Şekil 4’te, gelecekte pozitif sonuç geliştiren BI-RADS 1, 2 ve 3 incelemelerinin model risk puanları geniş ve örtüşen dağılımlar göstermektedir.
Bu sonuç iki önemli noktaya işaret eder:
- BI-RADS 3 genel olarak daha yüksek risk taşısa da bütün BI-RADS 3 incelemeleri aynı değildir.
- BI-RADS 1 veya 2 sonucu alan bazı incelemeler geçmiş rapor ve klinik özellikleri nedeniyle yüksek uzun dönem risk puanı alabilir.
Model BI-RADS’ın yerine geçmek üzere değil, BI-RADS sınıfına ek bir uzun dönemli risk katmanı olarak tasarlanmıştır.
Yaş gruplarına göre performans
| Yaş grubu | 5 yıllık AUROC | %95 güven aralığı | Metinde bildirilen prevalans |
|---|---|---|---|
| 18-39 | 0,81 | 0,79-0,83 | %1,1 |
| 40-49 | 0,85 | 0,84-0,87 | %1,8 |
| 50-74 veya 50-75 | 0,87 | 0,86-0,89 | %2,4 |
Tablo 2 üst yaş grubunu 50-74, sonuç metni ise 50-75 olarak tanımlamaktadır. Çalışmanın genel uygunluk ölçütü 18-75 yaştır. Bu küçük fakat düzeltilmesi gereken bir raporlama farklılığıdır.
18-39 yaş grubunun mamografi taramasına hangi klinik nedenlerle girdiği ayrıca önemlidir. Bu yaşlarda mamografi yaptıran kişiler genel genç nüfustan farklı risk özellikleri taşıyabilir. Dolayısıyla performans bütün 18-39 yaş grubuna genellenemez.
Bölgelere göre performans
| Bölge | 5 yıllık AUROC | %95 güven aralığı |
|---|---|---|
| Kuzey | 0,81 | 0,76-0,87 |
| Kuzeydoğu | 0,85 | 0,83-0,86 |
| Orta-Batı | 0,74 | 0,65-0,85 |
| Güneydoğu | 0,88 | 0,86-0,90 |
| Güney | 0,74 | 0,58-0,90 |
Model bütün bölgelerde rastlantı düzeyinin üzerinde ayrım göstermiştir. Ancak beş yıllık uygun incelemelerin %70,4’ü Kuzeydoğu bölgesinden gelmektedir. Güney ve Orta-Batı bölgelerindeki örneklem çok daha küçüktür ve güven aralıkları geniştir.
Tablo 1’de beş bölgenin sayıları toplam inceleme sayısına ulaşmamaktadır; bölgesel bilgisi eksik incelemeler alt grup analizinden çıkarılmıştır. Bu nedenle “bütün bölgelerde güçlü genelleme” ifadesi özellikle az temsil edilen bölgeler bakımından dikkatli kullanılmalıdır.
Açıklanabilirlik için bütünleşik gradyanlar
Model kararlarına hangi özelliklerin katkı sağladığını değerlendirmek için bütünleşik gradyanlar, İngilizce adıyla integrated gradients, kullanılmıştır.
Yöntemin temel matematiksel mantığı şöyledir:
\[ IG_i(x)=(x_i-x_i')\int_0^1\frac{\partial F(x'+\alpha(x-x'))}{\partial x_i}\,d\alpha \]
Burada:
- x, gerçek inceleme girdisini,
- x′, karşılaştırma için kullanılan başlangıç girdisini,
- F, modelin risk çıktısını,
- IGi, i numaralı özelliğin tahmine katkısını ifade eder.
Metin özelliklerinde başlangıç noktası bilgi içermeyen sıfır vektör, yapılandırılmış özelliklerde ise standartlaştırılmış nüfus ortalığıdır.
Yöntem bir özelliğin model kararını hangi yönde değiştirdiğini gösterir. Özelliğin gerçek dünyada kansere neden olduğunu kanıtlamaz.
Metin bloğu mu, yapılandırılmış veriler mi daha etkiliydi?
Şekil 5’te radyoloji raporu metinlerinin toplam katkısı yapılandırılmış özelliklerden genellikle daha yüksektir. Ancak metin bloğu binlerce kelime ve kelime çiftinden, yapılandırılmış blok ise çok daha az sayıdaki değişkenden oluşmaktadır.
Bu nedenle toplam katkının daha yüksek olması kısmen metin bloğunun boyutunun daha büyük olmasından kaynaklanabilir. Araştırmacılar bu sınırlılığı açıkça kabul etmektedir.
Negatif tahminler daha az sayıdaki güçlü ve güven verici ifadeye dayanırken pozitif tahminler rapor sözlüğündeki daha geniş bir terim grubunun ortak katkısıyla oluşmuştur.
Yüksek risk tahminlerinde öne çıkan ifadeler
- Meme cerrahisi,
- Sağ mastektomi,
- Duktal uzanım,
- Vasküler dilatasyon,
- Kalsifikasyonlar,
- Spiküle veya şüpheli bulgular,
- Mimari distorsiyon,
- Mikrokalsifikasyonlar,
- Meme tümörü veya kitleye işaret eden ifadeler.
Bu terimlerin yüksek riskle ilişkili bulunması klinik olarak anlaşılabilir görünmektedir. Ancak açıklanabilirlik analizi, yapılandırılmış kayıtlarda bulunmayan bazı cerrahi veya implant öykülerinin rapor metninden modele girdiğini de göstermiştir.
Yazarlar, bazı meme implantı veya geçmiş cerrahi öyküsü bulunan kişilerin eksik yapılandırılmış kayıtlar nedeniyle yanlış biçimde kohorta dahil edilmiş olabileceğini belirtmektedir. Bu durum elektronik sağlık kayıtlarının doğruluğuna bağımlılığı göstermektedir.
Düşük risk tahminlerinde öne çıkan ifadeler
- Simetrik memeler,
- Karşı memede şüpheli bulgu bulunmaması,
- Aksiller lenf düğümü büyümesi bulunmaması,
- Normal konfigürasyon,
- İyi huylu veya değişmeyen bulgular,
- Şüpheli patolojik bulgu yokluğu.
Bu ifadeler modelin düşük riski yalnızca yaş veya BI-RADS sınıfından değil, rapor dilindeki güven verici bulguların ortak örüntüsünden çıkardığını düşündürmektedir.
Yapılandırılmış özelliklerin katkısı
Yüksek risk tahminlerinde aile öyküsü ve üreme öyküsü daha belirgin katkı sağlamıştır. Düşük risk tahminlerinde aylık sigorta ödemesi ve coğrafi bölge gibi sosyoekonomik göstergeler öne çıkmıştır.
Bu sonuç modelin klinik anlamlı özellikleri kullandığını destekleyebilir; ancak sosyoekonomik özelliklerin katkısı şu olasılıkları da gündeme getirir:
- Bölgesel takip sıklığı farklılıkları,
- Sağlık hizmetine erişim,
- Tanı doğrulama olasılığı,
- Rapor yazım uygulamaları,
- Sigorta paketine bağlı görüntüleme yoğunluğu.
Bu nedenle modelin sosyoekonomik ve coğrafi gruplarda adil çalışıp çalışmadığı yalnızca AUROC ile değil, kalibrasyon, yanlış negatif oranları ve klinik sonuçlarla ayrıca değerlendirilmelidir.
Çalışmanın klasik risk modelleriyle karşılaştırması
Yazarlar Gail, Tyrer-Cuzick, BOADICEA ve görüntü tabanlı derin öğrenme modellerinin yayımlanmış AUROC değerlerini çalışmanın 0,86 değerinden daha düşük olarak sunmaktadır.
Ancak bunlar aynı hastalar, aynı sonuç tanımı ve aynı test kümesi üzerinde yapılan doğrudan karşılaştırmalar değildir. Farklı çalışmalar:
- Farklı ülkeleri,
- Farklı yaş ve risk dağılımlarını,
- Farklı kanser tanımlarını,
- Farklı takip sürelerini,
- Farklı görüntüleme ve klinik veri türlerini kullanmıştır.
Bu nedenle çalışma güçlü bir performans göstermiş olsa da diğer modellerden kesin olarak üstün olduğu bağımsız başa baş değerlendirmeyle kanıtlanmamıştır.
Ham mamografi görüntülerinin kullanılmaması neden önemli?
Görüntü tabanlı modellerin uygulanması için ham mamografi dosyalarının standart biçimde saklanması, aktarılması ve yüksek hesaplama gücüyle işlenmesi gerekir. Birçok sağlık sisteminde geçmiş görüntüler eksik, farklı cihaz formatlarında veya birden fazla merkezde parçalı olabilir.
Radyoloji raporları ve elektronik sağlık kayıtları ise çoğu klinik sistemde daha küçük veri boyutunda ve daha kolay erişilebilir durumdadır.
Bu yaklaşımın olası avantajları:
- Daha düşük hesaplama yükü,
- Mevcut kayıt sistemlerine daha kolay entegrasyon,
- Rapor terimlerinin açıklanabilir olması,
- Geçmiş incelemelerin zaman içindeki birikimini kullanabilme,
- Görüntü arşivi eksik sağlık sistemlerinde uygulanabilirlik.
Temel dezavantaj ise görüntüde bulunan ancak rapora yazılmamış ayrıntıların kaybedilmesidir. Model radyoloğun ne gördüğünden çok, rapora ne yazdığını öğrenmektedir. Raporlama alışkanlıkları değiştiğinde performans da değişebilir.
Model klinikte nasıl kullanılabilir?
Yazarların önerdiği olası kullanım alanları şunlardır:
- BI-RADS 1-3 içindeki yüksek riskli kişileri daha erken yeniden değerlendirmek,
- Ek mamografi, ultrason veya MRI için önceliklendirme yapmak,
- BI-RADS 3 içindeki daha yüksek riskli kişileri daha yakından izlemek,
- Çok düşük riskli kişileri yıllık yerine iki yıllık taramaya yönlendirmek,
- Sınırlı görüntüleme kaynaklarını risk düzeyine göre dağıtmak.
Bunların hiçbiri bu araştırmada klinik müdahale olarak sınanmamıştır. Model çıktılarının hekim kararına eklenmesinin kanser evresini, ölüm oranını, biyopsi sayısını, maliyeti veya hasta kaygısını nasıl değiştireceği bilinmemektedir.
Çalışmanın geçmiş, bugün ve gelecek açısından önemi
Geçmişte meme kanseri risk modelleri büyük ölçüde yaş, aile öyküsü, üreme geçmişi ve genetik belirteçler gibi sabit değişkenlere dayanmıştır. Mamografi tabanlı yapay zekâ çalışmaları ise çoğunlukla tek bir incelemenin görüntüsünü kullanmıştır.
Bugün bu çalışma, geçmiş radyoloji raporlarının bütününün ve incelemeler arasındaki zamanın gelecekteki risk için önemli bilgi taşıyabileceğini göstermektedir. Bu yaklaşım, tek bir mamografi karesinden çok kişinin zaman içindeki tarama hikâyesini değerlendirmektedir.
Gelecekte rapor metni, görüntüler, reçeteler, genetik bilgiler ve yaşam tarzı verileri birlikte kullanılarak daha kapsamlı risk modelleri geliştirilebilir. Ancak daha fazla veri eklenmesi her zaman daha iyi klinik sonuç anlamına gelmez. Veri kalitesi, mahremiyet, ayrımcılık riski, model kalibrasyonu ve sağlık sistemi üzerindeki etkiler ayrıca değerlendirilmelidir.
Çalışmanın güçlü yönleri
- Yaklaşık 4,61 milyon mamografi raporu ve 1,81 milyon kişilik çok büyük bir başlangıç veri tabanı kullanılmıştır.
- Veriler on yıllık gerçek yaşam sağlık sistemi kayıtlarından elde edilmiştir.
- BI-RADS 1, 2 ve 3 içindeki gelecekteki risk farklılığına odaklanılmıştır.
- Geçmiş mamografi raporları tarih sırasıyla modele dahil edilmiştir.
- Ham görüntü gerektirmeyen daha ölçeklenebilir bir yaklaşım geliştirilmiştir.
- TF-IDF kullanımı klinik terim düzeyinde açıklanabilirlik sağlamıştır.
- Yapılandırılmış klinik, üreme, aile öyküsü ve sosyoekonomik bilgiler birleştirilmiştir.
- Eğitim-test ayrımı kişi düzeyinde yapılmıştır.
- Bir ile beş yıl için ayrı performans sonuçları sunulmuştur.
- Yaş ve coğrafi bölge alt grupları incelenmiştir.
- Beta ve izotonik kalibrasyon yöntemleri karşılaştırılmıştır.
- Operasyonel duyarlılık, özgüllük, PPV, NPV ve yanlış negatif senaryoları sunulmuştur.
- BI-RADS sınıfları içindeki risk dağılımları görselleştirilmiştir.
- Bütünleşik gradyanlarla doğru ve hatalı tahminler ayrı incelenmiştir.
- Metin ve yapılandırılmış özelliklerin katkıları ayrı değerlendirilmiştir.
- Erken kanser dışlama ve sonuç doğrulama pencereleri için duyarlılık analizleri yapılmıştır.
Çalışmanın sınırlılıkları
- Hakem değerlendirmesi yoktur: Çalışma henüz hakemlikten geçmemiş bir preprinttir.
- Retrospektif tasarım: Kayıt hataları, seçilim ve ölçülmeyen karıştırıcılar bulunabilir.
- Tek sağlık sistemi: Veriler aynı özel sağlık ağına aittir; başka ülkeler veya kamu sistemlerinde dış doğrulama yoktur.
- Rastgele iç doğrulama: Test verisi bağımsız kişilerden oluşsa da aynı kurum, dönem ve kayıt süreçlerinden gelmektedir.
- Takip seçilimi: Yeterli takip kaydı bulunmayan kişiler çıkarılmıştır.
- Özel sağlık sistemi nüfusu: Sonuçlar Brezilya’daki bütün nüfusa veya kamu sağlık sistemine doğrudan genellenemez.
- İnceleme düzeyinde analiz: Aynı kişi birden fazla indeks mamografiyle temsil edilebilir.
- İncelemeler arası bağımlılık: Aynı kişinin tekrarlanan incelemelerinin istatistiksel bağımlılığı ana metinde ayrıntılı ele alınmamıştır.
- Sonuç etiketi histolojiyle sınırlı değildir: BI-RADS 5 ve 6 kayıtları da pozitif sonuca katkıda bulunmuştur.
- Ham görüntüler kullanılmamıştır: Raporlara aktarılmayan görüntü bilgileri kaybedilmiştir.
- Rapor yazımına bağımlılık: Hastane, cihaz, radyolog ve dil değişiklikleri performansı etkileyebilir.
- Eksik klinik kayıtlar: Cerrahi veya implant öyküsü bazı kişilerde yalnızca metinden anlaşılmıştır.
- Sosyoekonomik vekil değişkenler: Sigorta ödemesi ve posta kodu sağlık hizmeti erişimini öğrenmiş olabilir.
- Adalet analizi sınırlıdır: Irk, etnik köken, gelir düzeyi ve diğer sosyal gruplara göre ayrıntılı hata analizi sunulmamıştır.
- Bölgesel dengesizlik: Beş yıllık kohortun büyük bölümü Kuzeydoğu bölgesindendir.
- Az temsil edilen bölgeler: Güney ve Orta-Batı tahminlerinde güven aralıkları geniştir.
- Kalibrasyonda yüksek risk sapması: En yüksek tahminlerde hafif aşırı güven görülmüştür.
- Brier karşılaştırması eksiktir: Basit prevalans modeline karşı Brier karşılaştırması verilmemiştir.
- Doğrudan model karşılaştırması yoktur: Gail, Tyrer-Cuzick veya görüntü tabanlı modeller aynı test kümesinde değerlendirilmemiştir.
- Prospektif klinik yarar gösterilmemiştir: Modelin erken tanıyı veya sağkalımı iyileştirdiği bilinmemektedir.
- Tarama aralığı denenmemiştir: Düşük risk grubunda iki yıllık taramanın güvenliği deneysel olarak sınanmamıştır.
- Ek görüntülemenin etkisi bilinmiyor: Yüksek riskli gruba MRI veya biyopsi verilmesinin yarar-zarar dengesi ölçülmemiştir.
- Maliyet-etkililik yoktur: Sağlık sistemi kaynaklarına gerçek etkisi hesaplanmamıştır.
- Model kurulumunda tutarsızlık: Ayrı zaman modelleri ile çok çıkışlı tek model anlatımları uyuşmamaktadır.
- Kohort toplamlarında tutarsızlık: 706.545, 706.910 ve eğitim-test toplamı birbiriyle eşleşmemektedir.
- Düşük risk ifadesi yanıltıcıdır: Özetteki %10 ifadesi grup içi kanser oranı değil, bütün pozitiflerin düşük risk grubunda kalan kısmıdır.
- Yaş grubu raporlaması farklıdır: Tablo 50-74, metin 50-75 kullanmaktadır.
- Ek materyal eksikliği: Bazı önemli hiperparametreler ve uygulama ayrıntıları ana PDF’de değil ek materyalde bırakılmıştır.
- Yeniden üretilebilirlik sınırlıdır: Ham rapor metinleri gizlilik nedeniyle paylaşılmayacak, veriler ve ağırlıklar ancak yayım sonrasında koşullu biçimde sağlanacaktır.
Çalışma ne söylüyor?
- Uzunlamasına mamografi raporları gelecekteki meme kanseri riski hakkında önemli tahmin sinyali taşımaktadır.
- Ham mamografi görüntüleri olmadan güçlü risk ayrımı elde edilebilmiştir.
- Beş yıllık modelin test AUROC değeri yaklaşık 0,86’dır.
- Model bir ile beş yıllık zaman ufuklarında benzer ayrım performansı göstermiştir.
- BI-RADS 1, 2 ve 3 sınıflarının kendi içinde önemli risk heterojenliği bulunmaktadır.
- En yüksek riskli %3,4’lük inceleme grubu, beş yıllık pozitiflerin yaklaşık yarısını içermektedir.
- Düşük riskli büyük bir inceleme grubu çok yüksek negatif öngörü değerine sahiptir.
- Geçmiş cerrahi ifadeleri, kalsifikasyonlar ve mimari distorsiyonlar yüksek risk tahminlerine katkıda bulunmaktadır.
- Güven verici ve simetrik radyolojik ifadeler düşük risk tahminlerinde öne çıkmaktadır.
- Metin raporları, yapılandırılmış klinik özelliklerden daha büyük toplam tahmin katkısı göstermiştir.
- Beta ve izotonik kalibrasyon ham model olasılıklarını iyileştirmiştir.
- Rutin rapor metinleri kişiselleştirilmiş tarama araştırmaları için ölçeklenebilir bir veri kaynağı olabilir.
Çalışma ne söylemiyor?
- Modelin mamografi veya radyolog değerlendirmesinin yerine geçebileceğini göstermemektedir.
- Modelin mevcut kanseri kesin olarak teşhis ettiğini göstermemektedir.
- AUROC 0,86’nın bireysel tahminlerde %86 doğruluk anlamına geldiğini göstermemektedir.
- Yüksek riskli işaretlenen herkesin kanser geliştireceğini göstermemektedir.
- En düşük riskli %47’nin %10’unda kanser geliştiğini göstermemektedir.
- Düşük riskli kişilerin taramasının güvenle iki yılda bire çıkarılabileceğini kanıtlamamaktadır.
- Yüksek riskli kişilere otomatik olarak biyopsi veya MRI yapılması gerektiğini kanıtlamamaktadır.
- Model kullanımının kanseri daha erken evrede yakaladığını göstermemektedir.
- Meme kanserine bağlı ölümü azalttığını göstermemektedir.
- Diğer risk modellerinden başa baş karşılaştırmayla üstün olduğunu göstermemektedir.
- Brezilya kamu sistemi veya başka ülkelerde aynı performansı göstereceğini kanıtlamamaktadır.
- Sosyoekonomik özelliklerin biyolojik olarak koruyucu veya risk artırıcı olduğunu göstermemektedir.
- Modelin eşitlik, maliyet ve hasta yaşam kalitesi açısından güvenli olduğunu göstermemektedir.
Çalışmanın Yöntemi ve Bulguları
Teknik yöntem özeti
| Yöntem alanı | Çalışmada uygulanan yaklaşım |
|---|---|
| Çalışma türü | Retrospektif gerçek yaşam kohortu ve prognostik modelleme |
| Sağlık sistemi | Hapvida, Brezilya özel sağlık ağı |
| Veri dönemi | 1 Ocak 2016-31 Aralık 2025 |
| Başlangıç veri hacmi | 4.609.295 mamografi raporu ve 1.810.345 kişi |
| İndeks mamografi sınıfları | BI-RADS 1, 2 ve 3 |
| Yaş aralığı | 18-75 yıl |
| Geçmiş meme kanseri | Dışlandı |
| Erken kanser dışlama penceresi | İndeks incelemeden sonraki ilk 90 gün |
| Tahmin ufukları | 1, 2, 3, 4 ve 5 yıl |
| Birincil sonuç | BI-RADS 5/6 veya malign biyopsiyle belirlenen gelecekteki pozitif sonuç |
| Yapılandırılmış girdiler | Demografi, üreme öyküsü, aile öyküsü, BMI, BI-RADS, sigorta ödemesi ve posta kodu |
| Metin girdileri | Geçmiş mamografi raporlarının tarih sıralı serisi |
| Metin kodlama | TF-IDF |
| Zaman bilgisi | İncelemeler arasındaki süre ve zaman ağırlıklı birleştirme |
| Tahmin modeli | Birleştirilmiş vektörleri kullanan yoğun sinir ağı |
| Veri ayrımı | Kişi düzeyinde eğitim ve test ayrımı |
| Doğrulama | Eğitim kümesinde beş katlı çapraz doğrulama ve saklı test kümesi |
| Ayrım ölçüleri | AUROC ve konkordans indeksi |
| Operasyonel ölçüler | Duyarlılık, özgüllük, PPV, NPV ve yanlış negatif oranı |
| Kalibrasyon | Platt, beta ve izotonik kalibrasyon |
| Açıklanabilirlik | Bütünleşik gradyanlar ve terim çifti katkı haritaları |
Beş yıllık kohortun ana özellikleri
| Özellik | Sonuç |
|---|---|
| Kişi sayısı | 278.475 |
| Uygun inceleme sayısı | Ana metinde 706.545; Tablo 1’de 706.910 |
| Medyan yaş | 43 yıl; çeyrekler arası aralık 36-52 |
| BI-RADS 1 | 404.042; %57,2 |
| BI-RADS 2 | 218.295; %30,9 |
| BI-RADS 3 | 84.573; %11,9 |
| Pozitif sonuç | 9.620; %1,36 |
| Eğitim incelemeleri | 566.698 |
| Test incelemeleri | 142.517 |
Model performansının özeti
| Performans alanı | Sonuç | Doğru yorum |
|---|---|---|
| 5 yıllık AUROC | 0,863 | Güçlü risk sıralaması; bireysel doğruluk yüzdesi değildir |
| 5 yıllık C-indeksi | 0,859 | Olay zamanına göre güçlü sıralama |
| 1-4 yıllık AUROC | 0,82-0,85 | Farklı zaman ufuklarında benzer ayrım |
| Kalibre Brier skoru | 0,014 | Nadir olay sıklığı ve referans modelle birlikte yorumlanmalıdır |
| En yüksek riskli %3,4’te duyarlılık | %50,1 | Bütün pozitif incelemelerin yaklaşık yarısı yakalanır |
| En yüksek riskli %3,4’te özgüllük | %97,3 | Negatiflerin büyük bölümü işaretlenmez |
| En yüksek riskli %3,4’te PPV | %25,1 | İşaretlenenlerin yaklaşık dörtte biri pozitif sonuç geliştirir |
| En düşük riskli %47’de FNR | %10,0 | Bütün pozitiflerin %10’u bu gruptadır; grup içi kanser oranı değildir |
| Düşük risk grubunda NPV | Yaklaşık %99,6 | İncelemelerin yaklaşık %0,4’ü pozitif olabilir |
Modelin formüllerle açıklanan temel bileşenleri
Metin ağırlıklandırması:
\[ TF\text{-}IDF(t,d)=TF(t,d)\times\log\left(\frac{N}{DF(t)}\right) \]
Bu ilişki, raporda sık fakat bütün raporlarda nadir bulunan terimlere daha fazla ağırlık verir.
Zaman ağırlıklı rapor birleştirme:
\[ w_i=\frac{e^{-\lambda\Delta t_i}}{\sum_j e^{-\lambda\Delta t_j}} \]
Yakın tarihli raporlar, seçilen parametreye bağlı olarak daha yüksek ağırlık alabilir.
İkili gelecek risk tahmini:
\[ \hat{p}_k=P(Y=1\mid X,\ T\leq k) \]
Burada p̂k, mevcut inceleme anındaki bilgilerle k yıl içinde pozitif sonuç gelişme olasılığını; X, rapor ve yapılandırılmış özellikleri ifade eder.
Bütünleşik gradyan katkısı:
\[ IG_i(x)=(x_i-x_i')\int_0^1\frac{\partial F(x'+\alpha(x-x'))}{\partial x_i}\,d\alpha \]
Bu ölçü, belirli bir kelime veya klinik özelliğin model risk tahminini ne kadar ve hangi yönde etkilediğini gösterir.
Metin, tablo ve şekiller arasındaki raporlama sorunları
| Konu | Bir yerde bildirilen | Başka yerde bildirilen | Neden önemli? |
|---|---|---|---|
| Beş yıllık toplam inceleme | 706.545 | Tablo 1’de 706.910 | Kohort büyüklüğü ve prevalans hesabı açıklığa kavuşmalıdır |
| Eğitim-test toplamı | 566.698 + 142.517 = 709.215 | Her iki kohort toplamından daha yüksek | Veri ayrımının doğru sayıları belirsizdir |
| Model yapısı | Her tahmin ufku için ayrı model | Şekil 1’de aynı anda 1-5 yıl çıktısı veren model | Model mimarisi ve eğitim yöntemi farklılaşır |
| Düşük riskli %47 | Özette “yalnızca %10 kanser gelişti” | Sonuç ve Şekil 4’te pozitiflerin %10’unun grupta kalması | Grup içi riskle yanlış negatif oranı birbirine karıştırılmamalıdır |
| Üst yaş grubu | Metinde 50-75 | Tablo 2’de 50-74 | Alt grup sınırı net olmalıdır |
Etik onay, finansman ve çıkar çatışması
Çalışma Brezilya Ulusal Sağlık Konseyine bağlı Ulusal Araştırma Etik Komisyonu tarafından CAAE 83210524.4.0000.0229 numarasıyla onaylanmıştır.
Araştırma Helsinki Bildirgesi ve Brezilya Ulusal Sağlık Konseyi’nin 466/2012 sayılı kararı doğrultusunda yürütülmüştür. Kimliksizleştirilmiş ikincil verilerin geriye dönük kullanılması nedeniyle bireysel bilgilendirilmiş onam zorunluluğu kaldırılmıştır.
Çalışma FAPESP, Hapvida Assistência Médica S.A., CNPq, CAPES ve FUNCAP tarafından desteklenmiştir. Fon sağlayıcıların çalışma tasarımı, veri toplama, analiz, yorum veya makale yazımında rol almadığı bildirilmiştir.
Yazarlar çıkar çatışması beyan etmemiştir.
Kaynak ve Yöntem Notu
Bu içerik, Higor S. Monteiro, José A. Shiomi da Cruz, César L. C. Mattos, Iago C. Chaves, Javam C. Machado, Hernán A. Makse, Lucas C. Parra ve José S. Andrade Jr. tarafından hazırlanan “Breast cancer risk prediction from longitudinal mammography reports in a real-world health system: a prognostic modelling study” başlıklı araştırmaya dayanmaktadır.
Çalışma SSRN’de sunulan bir preprinttir. Özgün metinde açıkça “This preprint research paper has not been peer reviewed” ifadesi yer almaktadır. Dolayısıyla model, analizler ve klinik yorumlar bağımsız hakem değerlendirmesinden geçmemiştir ve sonraki sürümlerde değişebilir.
Araştırma randomize tarama deneyi veya prospektif klinik uygulama çalışması değildir. Brezilya’daki tek bir özel sağlık sisteminin 2016-2025 dönemindeki geriye dönük elektronik sağlık kayıtlarına dayanan prognostik modelleme çalışmasıdır.
Model ham mamografi görüntülerini kullanmamıştır. Tahminler radyoloji rapor metinleri, önceki BI-RADS kayıtları, incelemeler arasındaki zaman ve yapılandırılmış klinik bilgilerden elde edilmiştir.
Model mevcut mamografide kanser tanısı koymak için değil, BI-RADS 1-3 olarak değerlendirilen incelemelerden sonra bir ile beş yıl içindeki pozitif sonuç riskini tahmin etmek amacıyla geliştirilmiştir.
Çalışmadaki pozitif sonuç yalnızca histopatolojik kanser doğrulamasından oluşmamaktadır; BI-RADS 5 ve 6 kayıtları da sonuç tanımına katkıda bulunmaktadır. Sonuç etiketindeki olası yanlış sınıflandırma dikkate alınmalıdır.
En yüksek riskli %3,4 ve en düşük riskli %47 gibi eşikler geriye dönük test verisi üzerinde oluşturulmuş operasyonel senaryolardır. Klinik uygulama için doğrulanmış biyopsi, MRI veya tarama aralığı eşikleri değildir.
Çalışma düşük risk grubunda iki yıllık taramanın güvenli olduğunu, yüksek risk grubunda ek görüntülemenin yarar sağladığını veya model kullanımının meme kanserine bağlı ölümleri azalttığını göstermemektedir.
Kohort sayıları, eğitim-test bölünmesi, zaman ufku model yapısı ve düşük risk oranının anlatımı konusunda metin, tablo ve şekiller arasında açıklama gerektiren tutarsızlıklar vardır.
Model yalnızca aynı sağlık sisteminden rastgele ayrılmış kişiler üzerinde test edilmiştir. Bağımsız sağlık sistemi, kamu sistemi veya başka bir ülkede dış doğrulama yapılmamıştır.
Ham radyoloji raporlarının gizlilik nedeniyle paylaşılmayacağı, kimliksizleştirilmiş verilerin ve model ağırlıklarının ise yayım sonrasında veri sorumlusunun onayına bağlı olarak sağlanabileceği belirtilmiştir. Bu durum mevcut preprintin bağımsız yeniden üretilebilirliğini sınırlar.
Bu makale yalnızca yüklenen PDF’deki yöntem, kohort akışı, tablolar, model şeması, ROC ve kalibrasyon grafikleri, risk yüzdelikleri, BI-RADS dağılımları, açıklanabilirlik analizleri, yazar yorumları ve sınırlılıklar temel alınarak hazırlanmıştır. PDF’de bulunmayan klinik yarar, tarama güvenliği, tedavi başarısı veya kesin kişisel risk iddiası eklenmemiştir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir