Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Sağlık Bilimleri / Tıp Araştırmaları / Hetero-MedSAM: Tıbbi Görüntü Segmentasyonunu Heterojen Uzmanlar ve Evrimsel Budamayla Hafifleştiren Yapay Zekâ Çerçevesi
Tıp Araştırmaları

Hetero-MedSAM: Tıbbi Görüntü Segmentasyonunu Heterojen Uzmanlar ve Evrimsel Budamayla Hafifleştiren Yapay Zekâ Çerçevesi

Tıbbi görüntü segmentasyonu; bilgisayarlı tomografi, manyetik rezonans, röntgen, ultrason, endoskopi, dermoskopi ve göz dibi görüntülerinde organların, tümörlerin, damarların veya başka anatomik yapıların sınırlarının piksel düzeyinde belirlenmesidir.

20/07/2026  Veri Anla 31 görüntüleme
Hetero-MedSAM: Tıbbi Görüntü Segmentasyonunu Heterojen Uzmanlar ve Evrimsel Budamayla Hafifleştiren Yapay Zekâ Çerçevesi

Tıbbi görüntü segmentasyonu; bilgisayarlı tomografi, manyetik rezonans, röntgen, ultrason, endoskopi, dermoskopi ve göz dibi görüntülerinde organların, tümörlerin, damarların veya başka anatomik yapıların sınırlarının piksel düzeyinde belirlenmesidir. Bu işlem radyoterapi planlaması, hastalık ilerlemesinin izlenmesi, cerrahi hazırlık ve nicel görüntü analizi gibi alanlarda önemli bilgiler sağlayabilir.

MedSAM gibi tıbbi görüntü temel modelleri, çok çeşitli segmentasyon görevlerinde kullanılabilecek genel görsel temsil yeteneklerine sahiptir. Ancak bu modellerin büyük görüntü kodlayıcıları yüksek hesaplama, bellek ve enerji gereksinimi oluşturur. Bu durum modellerin taşınabilir cihazlarda, düşük güçlü klinik terminallerde veya sınırlı donanıma sahip sağlık kuruluşlarında kullanılmasını güçleştirir.

Bu preprint çalışmada araştırmacılar, MedSAM’in önceden eğitilmiş omurgasını koruyarak yalnızca göreve uyum sağlayan küçük yan modüllerin eğitildiği Hetero-MedSAM adlı bir çerçeve önermektedir. Modelin merkezinde birbirinin aynı olmayan, farklı işlevlere uzmanlaşmış dört modül bulunmaktadır:

  • Farklı büyüklükteki anatomik hedefleri yakalamaya çalışan Ölçek Farkındalıklı Uzman,
  • Uzun, ince ve düzensiz sınırları izlemeye çalışan Anizotropik Kenar Uzmanı,
  • Yerel ayrıntıları görüntünün genel bağlamıyla birleştiren Bağlam Modülasyonu Uzmanı,
  • BT, MRG, röntgen ve başka görüntüleme yöntemleri arasındaki fiziksel sinyal farklarını telafi etmeye çalışan Uyarlanabilir Modalite Uzmanı.

Model, görüntünün modalitesini, anatomik hedefi, klinik görevi ve görüntü içeriğini birlikte değerlendirerek ilk üç uzman için dinamik ağırlıklar üretmektedir. Eğitim sırasında uzmanların katkıları hareketli ortalamayla izlenmekte; uzun süre düşük katkı veren dallar fiziksel olarak devre dışı bırakılmaktadır. Araştırmacılar bu süreci “evrimsel budama” olarak adlandırmaktadır.

Yaklaşık 20.000 tıbbi görüntü kesitinden ve sekiz görüntüleme modalitesinden oluşturulan HeteroMedSeg veri kümesinde modelin bildirilen genel Dice Benzerlik Katsayısı 0,8644, HD95 değeri 5,37 ve çıkarım hızı 4,42 kare/saniyedir. Bildirilen eğitilebilir parametre ölçeği 4,40 milyondur.

Karşılaştırmada temel MedSAM modeli 0,8037 Dice skoru, 7,50 HD95 ve 0,23 kare/saniye hız elde etmiştir. Hetero-MedSAM, bu deney düzeninde daha yüksek bölgesel örtüşme, daha düşük sınır hatası ve daha yüksek işlem hızı göstermiştir. Bununla birlikte yerel olarak dört katmana yerleştirilen MedSegX modeli 4,69 kare/saniye ile Hetero-MedSAM’den biraz daha hızlıdır; Hetero-MedSAM’in avantajı esas olarak segmentasyon doğruluğu ve sınır uyumunda görülmektedir.

Çalışmanın önemli sonucu, uzman modüllerinin ağın her katmanına yerleştirilmesinin faydalı olmadığıdır. Bütün katmanlara heterojen uzman eklenen ilk model yalnızca 0,8428 Dice skoru elde etmiştir. En iyi sonuç, uzmanların MedSAM görüntü kodlayıcısının derin katmanlarından 6, 7, 9 ve 11 numaralı bloklara yerleştirilmesiyle alınmıştır.

Sonuçlar, farklı görüntüleme problemleri için farklı uzmanların öne çıktığını göstermektedir. Dermoskopide düzensiz sınırlar nedeniyle kenar uzmanı, MRG’de birbirinden kopuk hedef bölgeler nedeniyle bağlam uzmanı, BT’de ise farklı büyüklükteki hedefler nedeniyle ölçek uzmanı daha sık korunmuştur.

Bununla birlikte çalışma gerçek klinik kullanım kanıtı sunmamaktadır. Deneyler kamuya açık veri kaynaklarından derlenen görüntüler üzerinde yapılmıştır. Prospektif hasta çalışması, gerçek hastane iş akışı, taşınabilir tıbbi cihaz testi veya klinisyen performans karşılaştırması bulunmamaktadır. Ayrıca 4,40 milyon değeri modelin eğitilebilir uyarlama parametrelerini ifade etmektedir; dondurulmuş MedSAM omurgasının bellekte tutulması ve çıkarım sırasında çalıştırılması gereksinimi ortadan kalkmamaktadır.

Tıbbi görüntü segmentasyonu nedir?

Bir tıbbi görüntü sınıflandırma sistemi, görüntünün tamamı için “tümör var” veya “tümör yok” gibi tek bir karar üretebilir. Segmentasyon sistemi ise bunun ötesine geçerek hedef yapının hangi piksellerde bulunduğunu belirlemeye çalışır.

Örneğin bir karaciğer BT görüntüsünde segmentasyon modeli:

  • Karaciğerin dış sınırını,
  • Karaciğer içindeki lezyonu,
  • Lezyonun çevresindeki dokuyu,
  • Gerekirse damar veya safra yolu yapılarını

ayrı maskeler hâlinde gösterebilir.

Bu nedenle segmentasyon yalnızca “nesnenin varlığını” değil, nesnenin konumunu, alanını, hacmini, şeklini ve sınırlarını da tanımlamaya çalışır.

Tıbbi görüntülerde bu görev zordur çünkü:

  • Aynı organ farklı hastalarda farklı büyüklük ve biçime sahip olabilir.
  • Tümör sınırı çevre dokudan keskin biçimde ayrılmayabilir.
  • İnce damarlar ve sinirler uzun, kıvrımlı ve birkaç piksel genişliğinde olabilir.
  • BT, MRG, ultrason ve röntgen görüntüleri birbirinden farklı fiziksel sinyal mekanizmalarıyla oluşur.
  • Aynı modalitede farklı cihazlar ve çekim protokolleri farklı görüntü dağılımları üretebilir.
  • Bazı hedefler görüntünün büyük bölümünü kaplarken bazıları çok küçük olabilir.

MedSAM neden doğrudan hafif bir model değildir?

MedSAM, genel amaçlı Segment Anything Model mimarisinin tıbbi görüntülere uyarlanmış biçimidir. Model büyük bir görüntü kodlayıcısı kullanarak görüntüyü yüksek boyutlu özellik temsillerine dönüştürür. İstem kodlayıcısı, kullanıcı tarafından verilen kutu gibi yönlendirmeleri işler; maske kod çözücüsü ise hedef yapının segmentasyon maskesini üretir.

Büyük temel modellerin güçlü yönü, çok çeşitli görüntüler üzerinde öğrenilmiş genel özellikleri yeniden kullanabilmeleridir. Ancak büyük görüntü kodlayıcısının:

  • Yüksek parametre sayısı,
  • Yüksek FLOP gereksinimi,
  • Bellek tüketimi,
  • Düşük güçlü işlemcilerde gecikme oluşturması

klinik uç cihazlara dağıtımı sınırlandırabilir.

Çalışmanın karşılaştırma tablosunda temel MedSAM için 93,74 milyon parametre, 371,99 GFLOP ve Intel Xeon E5-2680 v4 işlemci üzerinde 0,23 kare/saniye bildirilmektedir.

Hetero-MedSAM tamamen yeni ve küçük bir temel model oluşturmamaktadır. MedSAM görüntü kodlayıcısını ve istem kodlayıcısını dondurarak bunların içine veya yanına az sayıda eğitilebilir uzman yolu eklemektedir.

Bu ayrım önemlidir:

  • Az eğitilebilir parametre, modelin uyarlanması sırasında güncellenen ağırlıkların az olduğu anlamına gelir.
  • Küçük toplam model, bütün omurganın fiziksel olarak küçük olduğu anlamına gelir.

Hetero-MedSAM birinci hedefe güçlü biçimde odaklanmaktadır. Ancak dondurulan MedSAM omurgası çıkarım sırasında yine çalıştırıldığı için 4,40 milyonluk sayı, bütün modelin toplam bellek ayak izinin yalnızca 4,40 milyon parametreye düştüğü biçiminde yorumlanmamalıdır.

Parametre-verimli ince ayar nedir?

Parametre-verimli ince ayar, önceden eğitilmiş büyük modelin bütün ağırlıklarını yeniden eğitmek yerine ana omurgayı sabit tutarak az sayıda ek parametreyi günceller.

Gündelik bir benzetmeyle, büyük bir hastaneyi baştan inşa etmek yerine mevcut hastanenin belirli bölümlerine küçük uzman ekipler eklemek gibidir. Ana altyapı korunur; yeni göreve uyum uzman ekipler üzerinden sağlanır.

Bu yaklaşım:

  • Eğitim belleğini azaltabilir.
  • Göreve özgü ağırlık dosyasını küçültebilir.
  • Aynı omurganın farklı görevlerde yeniden kullanılmasını kolaylaştırabilir.
  • Tam model ince ayarına göre eğitim maliyetini düşürebilir.

Ancak bütün görevler için aynı yapıda tek bir adaptör kullanılırsa, farklı tıbbi görüntülerin ihtiyaçları yeterince temsil edilmeyebilir. Hetero-MedSAM’in çıkış noktası bu sınırlamadır.

Neden “heterojen” uzmanlar kullanılıyor?

Klasik uzmanlar karışımı mimarilerinde birden fazla benzer ağ dalı bulunabilir. Bu dallar aynı temel yapıyı taşır ancak farklı örneklerde farklı oranlarda etkinleştirilir.

Hetero-MedSAM’de ise uzmanların yalnızca ağırlıkları değil, iç mimarileri ve görevleri de farklıdır. Her uzman belirli bir tıbbi görüntü sorununa yöneliktir:

UzmanHedeflediği problemTemel işlem
Ölçek Farkındalıklı UzmanKüçük lezyonlarla büyük organların aynı modelde işlenmesiFarklı genişleme oranlarına sahip paralel derinliksel evrişimler
Anizotropik Kenar UzmanıUzun, ince, kıvrımlı veya asimetrik sınırlarYatay ve dikey şerit evrişimleri ile tek taraflı dolgulama
Bağlam Modülasyonu UzmanıYerel ayrıntılarla geniş anatomik bağlamın birleştirilmesiGlobal ortalama ve maksimum havuzlama ile kanal modülasyonu
Uyarlanabilir Modalite UzmanıBT, MRG, röntgen ve başka modaliteler arasındaki sinyal farklarıModaliteye özgü uzman yönlendirmesi ve parametre telafisi

Bu tasarımın mantığı, bir radyoloğun kemik röntgeni, beyin MRG’si ve dermoskopi görüntüsünü aynı görsel kurallarla değerlendirmemesine benzetilebilir. Görüntülerin fiziksel üretim biçimleri ve klinik hedefleri farklı olduğu için modelin kullandığı yardımcı temsil yolları da farklılaştırılmaktadır.

Modelin genel mimarisi

Şekil 1’de modelin bütün işlem zinciri gösterilmektedir. Temel akış şöyledir:

  1. Tıbbi görüntü dondurulmuş MedSAM görüntü kodlayıcısına girer.
  2. Görüntü özellikleri Transformer bloklarında işlenir.
  3. Seçilmiş derin bloklara HeCon-MoAE uzman modülü paralel yol olarak eklenir.
  4. Modalite, organ, görev ve görüntü bağlamı bir yönlendirme ağına girer.
  5. Uzmanların katkı ağırlıkları hesaplanır.
  6. Uzman çıktıları MedSAM’in özgün ileri beslemeli ağ çıktısıyla birleştirilir.
  7. Kutu istemi dondurulmuş istem kodlayıcısıyla işlenir.
  8. Görüntü ve istem temsilleri maske kod çözücüsünde birleştirilir.
  9. Hedef yapının segmentasyon maskesi oluşturulur.

Bu mimari, MedSAM’in önceden öğrendiği genel tıbbi görüntü bilgisini korurken belirli görevlerin gerektirdiği ek özelliklerin küçük uzman yollarıyla tamamlanmasını amaçlamaktadır.

MedSegDB’nin anatomik bilgi hiyerarşisi

Çalışma, daha önce geliştirilen MedSegDB adlı anatomik bilgi ve segmentasyon veri yapısını deneysel referans olarak kullanmaktadır. MedSegDB, 129 kamuya açık veri kaynağından gelen tıbbi görüntüleri hiyerarşik bir anatomik ağaç altında birleştirmektedir.

Şekil 2’de gösterilen yapı bir kök katman ve dört anatomik düzeyden oluşur:

DüzeyİçerikBildirilen kapsam
Kök katmanGenel insan vücudu temsiliOrtak başlangıç vektörü
Katman 1Vücut sistemiBaş-boyun, gövde, iskelet, damar ve deri olmak üzere 5 alt ağaç
Katman 2Anatomik bölgeGöğüs, karın ve pelvis gibi 12 bölge
Katman 3Organ veya doku39 organ ve doku varlığı
Katman 4Klinik segmentasyon görevi111 ayrıntılı görev

Örneğin model için şu anlamsal yol oluşturulabilir:

\[ \mathrm{İnsan\ vücudu} \rightarrow \mathrm{Gövde} \rightarrow \mathrm{Karın} \rightarrow \mathrm{Karaciğer} \rightarrow \mathrm{Karaciğer\ tümörü} \]

Bu hiyerarşi modelin yalnızca görüntü piksellerine değil, görüntünün hangi modaliteye, organa ve klinik göreve ait olduğuna ilişkin yapılandırılmış bilgiye de erişmesini sağlar.

Ortak bağlam tanımlayıcısı nasıl oluşturuluyor?

Model dört bilgi kaynağını birleştirir:

  • Görüntüleme modalitesi gömmesi: Em
  • Anatomik yapı gömmesi: Ea
  • Klinik görev gömmesi: Et
  • Global olarak havuzlanmış görüntü özelliği: X̄

Çalışmada verilen ortak bağlam denklemi şöyledir:

\[ C_{\mathrm{all}} = \mathrm{Concat}(E_m,E_a,E_t,\bar{X}) \]

Burada:

  • Call, uzman yönlendirmesinde kullanılacak birleşik bağlam tanımlayıcısıdır.
  • Concat, özellik vektörlerinin kanal boyutunda yan yana eklenmesidir.
  • Em, görüntünün BT, MRG, röntgen veya başka bir modaliteye ait olduğunu kodlar.
  • Ea, anatomik konumu ve organ bilgisini temsil eder.
  • Et, hangi yapının segmentasyonunun istendiğini temsil eder.
  • X̄, görüntünün genel içerik özetidir.

Gündelik anlamıyla sistem yalnızca “görüntüde ne görüyorum?” sorusunu değil, “bu görüntü hangi cihazdan geldi, hangi organı gösteriyor ve benden hangi yapıyı bulmam isteniyor?” sorularını birlikte değerlendirmektedir.

Uzman ağırlıkları nasıl hesaplanıyor?

İlk üç morfolojik uzmanın ağırlıkları yönlendirme ağı tarafından hesaplanır:

\[ [w_1,w_2,w_3]^T = \mathrm{Softmax}(W_g \cdot \sigma(W_{in}\cdot C_{\mathrm{all}})) \]

Bu formülde:

  • w1, Ölçek Farkındalıklı Uzmanın ağırlığıdır.
  • w2, Anizotropik Kenar Uzmanının ağırlığıdır.
  • w3, Bağlam Modülasyonu Uzmanının ağırlığıdır.
  • Win ve Wg, eğitim sırasında öğrenilen matrislerdir.
  • σ, sigmoid aktivasyonudur.
  • Softmax, üç ağırlığı pozitif değerlere dönüştürerek toplamlarını bire eşitler.

Ağırlıkların temel koşulu şöyledir:

\[ \sum_{i=1}^{3} w_i = 1 \]

Böylece model, üç morfolojik uzman arasında sınırlı bir dikkat bütçesi dağıtır. Bir görüntüde düzensiz sınırlar öne çıkıyorsa kenar uzmanının payı artabilir; hedeflerin boyutları çok değişiyorsa ölçek uzmanı daha fazla ağırlık alabilir.

Dördüncü uzman olan Uyarlanabilir Modalite Uzmanı bu rekabetin dışında tutulmaktadır. Çalışmada kontrol ağırlığı:

\[ w_4 = 1 \]

olarak sabitlenmiştir. Bunun amacı modaliteye özgü sinyal telafisinin ilk üç uzman arasındaki ağırlık rekabetinden etkilenmeden sürekli çalışmasıdır.

Uzman çıktıları MedSAM’e nasıl ekleniyor?

Uzmanların ürettiği özellikler MedSAM’in özgün ileri beslemeli ağ yoluyla birleştirilir:

\[ Y = \mathrm{MLP}(X) + s \cdot \left(\sum_{i=1}^{3} w_iE_i(X)+w_4E_4(X)\right) \]

Burada:

  • X, Transformer bloğuna giren özelliktir.
  • MLP(X), MedSAM’in özgün ileri beslemeli ağ çıktısıdır.
  • E1-E3, üç morfolojik uzmanın dönüşümleridir.
  • E4, modalite uzmanıdır.
  • wi, uzman katkı ağırlıklarıdır.
  • s, uzman katkısının genel büyüklüğünü kontrol eden ayarlanabilir ölçek katsayısıdır.
  • Y, özgün ve uzman yollarının birleşmiş çıktısıdır.

Bu yapı özgün MedSAM temsilini silmek yerine ona artık bir düzeltme veya tamamlayıcı bilgi eklemektedir. Böylece uzman yolları yanlış veya yetersiz öğrenirse önceden eğitilmiş omurganın temel temsili korunmaya çalışılır.

Ölçek Farkındalıklı Uzman nasıl çalışıyor?

Tıbbi görüntülerde hedef boyutları büyük ölçüde değişebilir. Bir görüntüde bütün karaciğer segmentasyonu yapılırken başka bir görüntüde birkaç milimetrelik lezyon aranabilir.

Ölçek Farkındalıklı Uzman önce özellik kanallarını 1×1 evrişimle düşük boyutlu bir darboğaza indirir. Ardından farklı genişleme oranlarına sahip üç paralel derinliksel evrişim uygular:

\[ x_r = \mathrm{DConv}_r(\mathrm{Conv}^{down}_{1\times1}(X)), \quad r\in\{1,2,3\} \]

Burada:

  • r, genişletilmiş evrişimin genişleme oranıdır.
  • r=1, daha yerel ayrıntıları görür.
  • r=2 ve r=3, daha geniş çevresel bağlamı örnekler.
  • DConv, her kanal üzerinde daha düşük maliyetle uygulanan derinliksel evrişimdir.

Üç ölçek daha sonra birleştirilir:

\[ X_{\mathrm{scale}} = \mathrm{Conv}^{up}_{1\times1}\left(\mathrm{GELU}(\mathrm{Concat}(x_1,x_2,x_3))\right) \]

Bu işlem küçük ayrıntılarla geniş anatomik konturların aynı temsil içinde bir araya getirilmesini amaçlar.

Şekil 3’ün uzman diyagramında üç dalın üzerinde de “R=1” etiketi görünürken yöntem metni ve denklem genişleme oranlarını 1, 2 ve 3 olarak tanımlamaktadır. Bu, preprint içindeki görsel ile matematiksel açıklama arasında bir belge tutarsızlığıdır. Kesin uygulamanın kod üzerinden doğrulanması gerekir.

Anizotropik Kenar Uzmanı nasıl çalışıyor?

“Anizotropik” ifadesi, yapının her yönde aynı görünmediğini anlatır. Bir karaciğer kitlesi görece yuvarlak olabilirken damar, sinir, bağırsak duvarı veya deri lezyonunun sınırı uzun, ince ve belirli bir yöne uzanan biçimde olabilir.

Klasik kare evrişim çekirdeği uzun ve ince bir yapıyı incelerken çevredeki gereksiz arka planı da işleme katabilir. Model bu nedenle yatay ve dikey şerit çekirdekler kullanmaktadır:

\[ y_h^{(i)} = \mathrm{Conv}_{1\times k}(\mathrm{Pad}^{(i)}_h(X)), \quad i\in\{0,1\} \]

\[ y_v^{(i)} = \mathrm{Conv}_{k\times1}(\mathrm{Pad}^{(i)}_v(X)), \quad i\in\{0,1\} \]

Bu formüllerde:

  • yh, yatay yöndeki özellikleri temsil eder.
  • yv, dikey yöndeki özellikleri temsil eder.
  • Pad, çekirdeğin sola, sağa, yukarıya veya aşağıya daha fazla ağırlık verebilmesini sağlayan tek taraflı asimetrik doldurmadır.
  • Şekilde çekirdekler 1×3 ve 3×1 olarak gösterilmiştir.

Dört yönlü çıktı birleştirilir:

\[ X_{\mathrm{edge}} = \mathrm{Conv}_{1\times1}\left(\mathrm{SiLU}(\mathrm{Concat}(y_h^{(0)},y_h^{(1)},y_v^{(0)},y_v^{(1)}))\right) \]

Bu uzman, özellikle düzensiz deri lezyonu sınırları, ince damar yapıları ve yönlü anatomik konturlar için tasarlanmıştır.

Bağlam Modülasyonu Uzmanı nasıl çalışıyor?

Bazı segmentasyon hataları, modelin küçük bir ayrıntıya fazla odaklanıp görüntünün genel anatomik düzenini gözden kaçırmasından kaynaklanır.

Bağlam uzmanı iki global özet kullanmaktadır:

  • Global ortalama havuzlama: Görüntüdeki genel özellik dağılımını özetler.
  • Global maksimum havuzlama: En belirgin sinyalleri öne çıkarır.

Kanal ağırlıkları şu ilişkiyle üretilir:

\[ W = \sigma(\mathrm{FC}(\mathrm{Concat}(\mathrm{GAP}(Z),\mathrm{GMP}(Z)))) \]

Burada:

  • Z, düşük boyutlu darboğaz özelliğidir.
  • GAP, global ortalama havuzlamadır.
  • GMP, global maksimum havuzlamadır.
  • FC, tam bağlantılı dönüşümdür.
  • W, hangi özellik kanallarının güçlendirilip hangilerinin azaltılacağını belirleyen ağırlıktır.

Modüle edilmiş özellik:

\[ U = \mathrm{BN}(\mathrm{DWConv}_{3\times3}(Z\odot W)) \]

\[ X_{\mathrm{context}} = \mathrm{Conv}_{1\times1}(U) \]

⊙ işareti kanal düzeyinde eleman bazlı çarpmayı, BN ise toplu normalizasyonu ifade eder.

Bu uzman özellikle MRG görüntülerinde birbirinden kopuk küçük hedef bölgelerin genel anatomik bağlam içinde fark edilmesine yardımcı olmayı amaçlamaktadır.

Uyarlanabilir Modalite Uzmanı ne yapıyor?

BT’de ölçülen Hounsfield birimleriyle MRG’nin sinyal yoğunluğu, röntgenin projeksiyon yapısı veya endoskopinin renk ve aydınlatma özellikleri aynı değildir.

Uyarlanabilir Modalite Uzmanı, görüntü modalitesine göre ayrılan küçük uzman yollarından uygun olanı yönlendirmeyle seçer. Çalışmanın mimari şemasında CT, MRI, X-ray ve diğer modalite uzmanları ayrı dallar olarak gösterilmektedir.

Bu dalın hedefi, aynı anatomik yapının farklı görüntüleme sistemlerinde oluşturduğu dağılım kaymasını telafi etmektir.

Ancak yöntem metninde modalite uzmanının ağırlığı 1 olarak sabitlenirken daha sonraki budama bölümünde toplam uzman sayısı dört olarak verilmekte ve budama maskesi bütün uzmanları kapsayabilecek biçimde tanımlanmaktadır. Uzman evrimi tablosunda ise yalnızca ilk üç uzman raporlanmaktadır. Bu nedenle dördüncü uzmanın budama sırasında tam olarak nasıl ele alındığı preprint metninde bütünüyle açık değildir.

Uzman bankasının hesaplama yükü

Çalışmada bütün uzmanlar 768×16×16 giriş/çıkış özelliği ve 64 kanallı ortak darboğaz altında karşılaştırılmıştır.

ModülParametreHesaplama yükü
Standart evrişim karşılaştırması135,17 bin34,60 milyon FLOP
Derinliksel evrişim karşılaştırması98,88 bin25,31 milyon FLOP
Dörtlü grup evrişimi107,52 bin27,53 milyon FLOP
Ölçek Farkındalıklı Uzman198,34 bin50,77 milyon FLOP
Anizotropik Kenar Uzmanı124,48 bin51,18 milyon FLOP
Bağlam Modülasyonu Uzmanı100,54 bin25,38 milyon FLOP
Uyarlanabilir Modalite Uzmanı98,30 bin25,17 milyon FLOP
Toplam uzman bankası521,66 bin152,50 milyon FLOP

Bu tablo tek bir uzman bankasının maliyetini göstermektedir. Son modelde uzman bankaları seçilmiş birden fazla Transformer bloğuna yerleştirildiği için model düzeyindeki toplam değerler ayrı olarak raporlanmıştır.

Evrimsel budama mekanizması

Dört uzman dalının her seçili katmanda sürekli çalıştırılması modelin hafiflik hedefini zayıflatabilir. Araştırmacılar bu nedenle eğitim sırasında uzman katkılarını izleyen bir mekanizma geliştirmiştir.

Her uzmanın hareketli ortalama katkı skoru şu formülle güncellenir:

\[ S_{\mathrm{avg}}^{(t)}=(1-\lambda)S_{\mathrm{avg}}^{(t-1)}+\lambda\cdot\mathrm{Mean}(w^{(t)}) \]

Burada:

  • Savg(t), t anındaki yumuşatılmış katkı skorudur.
  • w(t), güncel mini partideki uzman ağırlıklarıdır.
  • Mean, örnekler üzerindeki ortalamadır.
  • λ, hareketli ortalamanın yeni bilgiye ne hızla uyum sağlayacağını belirler.

Çalışmada:

\[ \lambda = 0{,}1 \]

olarak kullanılmıştır.

Tek bir görüntüde uzman ağırlığı rastlantısal biçimde artıp azalabilir. Hareketli ortalama, geçici dalgalanmalardan çok uzun dönemli katkıya odaklanmayı amaçlar.

Uzmanın katkısı önceden belirlenen eşik değerin altında kalırsa budama maskesi uygulanır. Çalışmada eşik:

\[ \tau = 0{,}01 \]

olarak belirlenmiştir.

Değerlendirmeler eğitimin 8., 16. ve 24. dönemlerinde yapılmıştır.

Budama sonrası ağırlık hesaplaması şöyledir:

\[ \hat{w}=\mathrm{Softmax}\left((W_g\cdot\sigma(W_{in}\cdot C_{\mathrm{all}}))\odot(1-m)-M\cdot m\right) \]

Burada:

  • m, her uzman için 0 veya 1 değerini alan budama maskesidir.
  • m=1, ilgili uzman yolunun kapatıldığını gösterir.
  • M, budanan uzmanın Softmax öncesi skorunu çok büyük negatif değere iten büyük bir sayıdır.
  • ŵ, budama sonrasındaki yeni uzman ağırlıklarıdır.

Amaç yalnızca uzman çıktısını sıfıra çarpmak değil, çıkarım sırasında ilgili fiziksel dalın çalıştırılmasını durdurarak gerçek hesaplama tasarrufu sağlamaktır.

Kayıp fonksiyonu

Modelin segmentasyon eğitimi ikili çapraz entropi ve Dice kaybının toplamıyla yapılmaktadır:

\[ \mathcal{L}_{\mathrm{mask}}=\lambda_1\mathcal{L}_{\mathrm{BCE}}+\lambda_2\mathcal{L}_{\mathrm{Dice}} \]

Çalışmada iki katsayı da 1 olarak ayarlanmıştır:

\[ \lambda_1=\lambda_2=1 \]

İkili çapraz entropi kaybı:

\[ \mathcal{L}_{\mathrm{BCE}}=-\frac{1}{N}\sum_{i=1}^{N}\left(y_i\log p(y_i)+(1-y_i)\log(1-p(y_i))\right) \]

Burada:

  • yi, i pikselinin gerçek etiketidir ve 0 veya 1 değerini alır.
  • p(yi), modelin piksel için ürettiği olasılıktır.
  • N, görüntüdeki toplam piksel sayısıdır.

Dice kaybı:

\[ \mathcal{L}_{\mathrm{Dice}}=1-\frac{2\sum_{i=1}^{N}p(y_i)y_i+\epsilon}{\sum_{i=1}^{N}p(y_i)+\sum_{i=1}^{N}y_i+\epsilon} \]

Bu formülde ε, paydanın sıfır olmasını önleyen küçük sayısal sabittir.

Çapraz entropi her pikselin sınıfını doğru tahmin etmeye, Dice kaybı ise tahmin edilen bölgenin gerçek bölgeyle toplu örtüşmesine odaklanır.

Model bir görüntü için birden fazla maske adayı üretir. Eğitimde gerçek maskeye en iyi uyan aday seçilir:

\[ \mathcal{L}_{\mathrm{total}}=\min_{j\in\{1,\ldots,M\}}\{\mathcal{L}_{\mathrm{mask}}(P_j,Y)\} \]

Burada:

  • M, maske adayı sayısıdır.
  • Pj, j numaralı tahmindir.
  • Y, gerçek segmentasyon maskesidir.

HeteroMedSeg veri kümesi

Araştırmacılar kamuya açık tıbbi görüntü kaynaklarından yaklaşık 20.000 iki boyutlu görüntü kesiti derleyerek HeteroMedSeg adlı deneysel veri kümesini oluşturmuştur.

Veri kümesinde sekiz modalite bulunmaktadır:

  • Röntgen,
  • Dermoskopi,
  • Bilgisayarlı tomografi,
  • Göz dibi görüntüleme,
  • Manyetik rezonans görüntüleme,
  • Ultrason,
  • Endoskopi,
  • Kolonoskopi.

Şekil 4’te modaliteler arasında örnek sayılarının eşit olmadığı görülmektedir. Bu dağılım modelin daha kalabalık modalitelerden daha fazla öğrenme sinyali almasına yol açabilir.

Görüntü adları “Modalite-Görev Varlığı” biçiminde düzenlenmiş ve modelin modalite ile anatomik bağlam kodlarını dosya adından ayrıştırmasına olanak sağlanmıştır.

Veriler:

  • Yüzde 70 eğitim,
  • Yüzde 15 doğrulama,
  • Yüzde 15 test

olarak ayrılmıştır.

Metin, bölmenin hasta düzeyinde mi, görüntü kesiti düzeyinde mi veya kaynak veri kümesi düzeyinde mi yapıldığını ayrıntılı biçimde açıklamamaktadır. Aynı hastaya ait komşu kesitlerin farklı bölümlere düşmesi durumunda veri sızıntısı oluşabileceği için bu ayrıntı model performansının güvenilirliği açısından önemlidir.

Ön işleme

Bütün görüntüler 256×256 piksele yeniden boyutlandırılmıştır.

BT görüntülerinde Hounsfield birimleri:

\[ -150 \leq \mathrm{HU} \leq 250 \]

aralığında kırpılmış ve daha sonra doğrusal olarak normalize edilmiştir.

Bu pencere yumuşak doku ağırlıklı bir aralığı temsil eder. Ancak kemik, akciğer veya çok düşük yoğunluklu dokuların bazı sinyalleri bu kırpma sırasında kaybolabilir.

MRG ve diğer modalitelerde piksel değerleri:

\[ 0 \leq x \leq 1 \]

aralığına ölçeklenmiştir.

Eğitim sırasında:

  • 0,9-1,1 arasında rastgele ölçekleme,
  • Rastgele çevirme

uygulanmıştır.

Eğitim ayarları

YazılımPyTorch
DonanımNVIDIA GPU ortamı; GPU modeli belirtilmemiştir
OptimizasyonAdamW
Başlangıç öğrenme oranı1 × 10-4
Ağırlık azalması0,01
Öğrenme oranı programıKosinüs tavlama
Mini parti büyüklüğü24
Eğitim süresi50 dönem
Budama kontrolleri8., 16. ve 24. dönemler

GPU modelinin, rastgele tohumların ve deney tekrar sayısının belirtilmemesi eğitim süresi ve sonuç değişkenliğinin bağımsız olarak değerlendirilmesini zorlaştırmaktadır.

Değerlendirme ölçütleri

Dice Benzerlik Katsayısı: Tahmin edilen maske ile gerçek maskenin ne ölçüde örtüştüğünü gösterir. Değer bire yaklaştıkça bölgesel uyum artar.

HD95: Tahmin edilen sınır ile gerçek sınır arasındaki çift yönlü mesafelerin yüzde 95’lik değerini ölçer. Düşük değer daha iyi sınır uyumunu gösterir. En uç yüzde 5’lik hatayı dışarıda bıraktığı için tek bir gürültülü piksele karşı klasik Hausdorff mesafesinden daha dayanıklıdır.

Parametre sayısı: Modelin depolama ve öğrenilebilir kapasite ölçeğini gösterir. Hetero-MedSAM için bildirilen değer eğitilebilir uyarlama parametrelerine odaklanmaktadır.

FLOP: Bir ileri geçişteki yaklaşık kayan nokta işlem sayısını gösterir.

FPS: Saniyede işlenen görüntü sayısıdır. Çalışmada Intel Xeon E5-2680 v4 CPU üzerinde ölçülmüştür.

Neden bütün katmanlara uzman eklenmedi?

MedSAM görüntü kodlayıcısı 12 Transformer bloğundan oluşmaktadır. Araştırmacılar önce bütün katmanlara uzman yerleştirmeyi denemiştir.

Tam katmanlı heterojen uzman modeli:

\[ \mathrm{DSC}=0{,}8428 \]

elde etmiştir.

Bu sonuç, MedSegX’in tam katmanlı homojen uzman modelinin 0,8567 skorundan ve Hetero-MedSAM’in son seçilen yapısından daha düşüktür.

Araştırmacılar bu durumu şöyle yorumlamaktadır:

  • Sığ katmanlar temel kenar ve doku özelliklerini çıkarır.
  • Farklı yapıda çok sayıda uzman erken katmanlara eklendiğinde önceden öğrenilmiş temel temsiller bozulabilir.
  • Heterojen yollar farklı büyüklükte ve yönde gradyanlar üreterek görevler arası çatışmayı artırabilir.
  • Derin katmanlarda anatomik ve semantik özellikler daha kararlı hâle gelir.
  • Uzmanların bu katmanlarda göreve özgü düzeltme yapması daha az bozucu olabilir.

Bu sonuç, daha fazla modülün otomatik olarak daha iyi performans anlamına gelmediğini göstermektedir.

Katman sayısı ve konumu deneyleri

Çalışmada bir, iki, üç, dört ve beş katmana uzman yerleştirilen çok sayıda düzen test edilmiştir.

Sığ katman veya karma katman düzenlerinin büyük bölümü 0,83 Dice sınırını aşamamıştır. Derin katman düzenleri daha iyi sonuç vermiştir.

Öne çıkan sonuçlar:

YerleşimKatmanlarDSCBaşlangıç → son parametre
Üç derin katman6, 9, 110,85344,20M → 4,05M
Dört derin katman6, 7, 9, 110,86444,63M → 4,40M
Beş derin katman6, 7, 8, 9, 110,86005,05M → 4,69M

Dört katmanlı düzen, beş katmanlı modelden daha az parametreyle daha yüksek sonuç vermiştir. Bu nedenle son modelde dört uzman yerleşim noktası seçilmiştir.

Neden 6, 7, 9 ve 11. katmanlar seçildi?

Araştırmacılar derin bölgede mümkün olan 15 farklı dört katman kombinasyonunu karşılaştırmıştır.

En iyi sonuç:

\[ [6,7,9,11] \rightarrow \mathrm{DSC}=0{,}8644 \]

olarak raporlanmıştır.

Bu yapı üç pencere dikkat bloğu ve bir global dikkat bloğu içermektedir. Yazarlar bu düzeni “önce yerel, sonra global” iş birliği olarak yorumlamaktadır:

  • 6., 7. ve 9. katmanlardaki pencere dikkati yerel yapıları işler.
  • Uzmanlar yerel ölçek ve sınır özelliklerini tamamlar.
  • 11. katmandaki global dikkat geniş anatomik bağlamı birleştirir.
  • Son uzman modülü yerel özelliklerin global düzeyde bütünleşmesine katkı sağlar.

Karşılaştırmalı performans

ModelDSC ↑HD95 ↓Parametre (M) ↓FLOP (G) ↓FPS ↑
MedSAM0,80377,5093,74371,990,23
SwinLite-MedSAM0,81127,8514,29101,052,25
LiteMedSAM0,81507,479,7974,951,68
Med-FastSAM0,82346,8526,4194,152,17
Rep-MedSAM0,82956,199,2850,852,92
MedSegX, 6-7-9-110,84555,724,5069,544,69
MedSegX, bütün bloklar0,85675,435,4169,953,87
Hetero-MedSAM0,86445,374,4069,614,42

Hetero-MedSAM, çalışmadaki en yüksek genel Dice skorunu ve en düşük HD95 değerini elde etmiştir. FPS bakımından ise yerel MedSegX modeli biraz daha hızlıdır.

Bu tablo, modelin her ölçütte tek başına en iyi olmadığını; doğruluk, sınır kalitesi, parametre ölçeği ve hız arasında bir denge sunduğunu göstermektedir.

FLOP değeri Rep-MedSAM’den daha yüksektir. Dolayısıyla “hafif” ifadesi her hesaplama ölçütünde en düşük değere sahip olmak anlamına gelmemektedir.

Modalitelere göre performans

Şekil 5, MedSAM, tam katmanlı MedSegX ve Hetero-MedSAM’i modalite düzeyinde karşılaştırmaktadır.

Çalışmanın yorumuna göre Hetero-MedSAM:

  • MRG,
  • Göz dibi,
  • Röntgen,
  • Dermoskopi,
  • Diğer modaliteler

üzerinde olumlu sonuçlar göstermiştir.

BT modalitesinde ise MedSegX’in sonucu Hetero-MedSAM’den marjinal biçimde daha yüksektir. Bu durum tek bir genel ortalamanın bütün modalitelerde üstünlük anlamına gelmediğini gösterir.

Uzmanların modaliteye göre evrimi

Tablo 5, eğitim ilerledikçe uzman ağırlıklarının nasıl değiştiğini göstermektedir. Son dönemde her seçili katmanda ilk üç morfolojik uzmandan yalnızca biri korunmuştur.

ModaliteKatman 6Katman 7Katman 9Katman 11
BTÖlçekBağlamÖlçekKenar
EndoskopiBağlamKenarKenarBağlam
DermoskopiKenarKenarKenarÖlçek
MRGBağlamÖlçekBağlamBağlam

Bu örüntüler mimarinin tasarım amacıyla uyumludur:

  • BT’de hedef boyutları değiştiği için ölçek uzmanı sık korunmuştur.
  • Endoskopide bulanık sınırlar ve geniş sahne bağlamı nedeniyle kenar ve bağlam uzmanları birlikte öne çıkmıştır.
  • Dermoskopide düzensiz lezyon konturları nedeniyle kenar uzmanı baskın hâle gelmiştir.
  • MRG’de birbirinden kopuk bölgelerin birlikte tanınması gerektiği için bağlam uzmanı çoğu katmanda korunmuştur.

Nitel segmentasyon örnekleri

Şekil 6’da dört zorlu klinik görünüm karşılaştırılmıştır:

  • BT’de küçük lezyon,
  • Endoskopide bulanık sınır,
  • Dermoskopide düzensiz topoloji,
  • MRG’de birbirinden ayrılmış hedef bölgeler.

Araştırmacılara göre Hetero-MedSAM, dermoskopide sınırların aşırı yumuşatılmasını azaltmış; MRG’de ana hedef bölgenin dışında bulunan küçük kopuk bölgeleri daha iyi fark etmiştir.

Bununla birlikte MRG örneğinde global bağlama ayrılan kapasitenin ana büyük bölgedeki yerel uyumu bir miktar azaltabileceği de belirtilmektedir. Bu, modelin global bütünlük ile yerel piksel uyumu arasında bir denge kurduğunu gösterir.

Ablasyon çalışması ne gösterdi?

Model bileşenleri sırayla eklenerek her uzmanın katkısı incelenmiştir.

YapıDSC ↑HD95 ↓
Yalnızca Ölçek Farkındalıklı Uzman0,83126,72
Ölçek + Kenar0,83386,01
Ölçek + Kenar + Bağlam0,84525,86
Dört uzmanın tamamı0,85515,49
Dört uzman + evrimsel budama0,86445,37

Her bileşenin eklenmesi Dice skorunu artırmış ve sınır hatasını düşürmüştür. Budama yalnızca modeli küçültmekle kalmamış, performansı da iyileştirmiştir.

Araştırmacılar bunu düşük katkılı dalların kaldırılmasıyla uzmanlar arasındaki özellik çatışmasının ve aşırı uyumun azalabileceği biçiminde yorumlamaktadır.

Bununla birlikte ablasyon tek bir ekleme sırası üzerinden yapılmıştır. Örneğin yalnızca kenar uzmanı veya yalnızca bağlam uzmanı gibi bütün olası kombinasyonlar raporlanmamıştır. Dolayısıyla her uzman için bağımsız katkı miktarı tam olarak ayrıştırılamamaktadır.

Çalışmanın güçlü yönleri

  • MedSAM tamamen yeniden eğitilmek yerine dondurulmuş omurga üzerinde parametre-verimli uyarlama yapılmıştır.
  • Uzmanların aynı yapıyı tekrarlaması yerine birbirini tamamlayan dört farklı işlev tasarlanmıştır.
  • Görüntü içeriği modalite, organ ve klinik görev bilgisiyle birlikte yönlendirmede kullanılmıştır.
  • Katman yerleşimi çok sayıda ablasyon deneyiyle araştırılmıştır.
  • Uzman katkıları eğitim boyunca izlenmiş ve düşük katkılı yollar fiziksel olarak budanmıştır.
  • Bölge örtüşmesi yanında sınır kalitesi HD95 ile değerlendirilmiştir.
  • Parametre, FLOP ve CPU hızı birlikte raporlanmıştır.
  • Sekiz farklı görüntü modalitesi kullanılmıştır.
  • Bileşenlerin aşamalı katkısını gösteren ablasyon çalışması sunulmuştur.
  • Kodun kamuya açık olduğu belirtilmiştir.

Çalışmanın sınırlılıkları

Hakem değerlendirmesi bulunmamaktadır: Çalışma preprinttir ve bağımsız bilimsel hakemler tarafından henüz değerlendirilmemiştir.

Gerçek klinik doğrulama yoktur: Model prospektif hastane verisinde, rutin klinik iş akışında veya hekim gözetiminde test edilmemiştir.

“Hafif” parametre sayısının yorumu: Bildirilen 4,40 milyon değer eğitilebilir uyarlama parametrelerine odaklanmaktadır. Dondurulmuş MedSAM omurgası modelden çıkarılmamıştır.

Gerçek uç cihaz testi yoktur: FPS ölçümü Intel Xeon E5-2680 v4 sunucu sınıfı CPU üzerinde yapılmıştır. Telefon, taşınabilir ultrason, gömülü GPU veya düşük güçlü klinik terminal üzerinde ölçüm bulunmamaktadır.

Toplam bellek tüketimi raporlanmamıştır: RAM, GPU belleği, model dosyası boyutu, enerji tüketimi ve gecikme dağılımı verilmemiştir.

Veri bölme ayrıntısı sınırlıdır: Eğitim, doğrulama ve test ayrımının hasta veya kaynak veri kümesi düzeyinde yapılıp yapılmadığı açıklanmamaktadır.

Veri dengesizliği: Sekiz modalitenin örnek sayıları eşit değildir. Genel ortalama daha kalabalık modalitelerden daha fazla etkilenebilir.

Bağımsız dış test sınırlıdır: Çalışma farklı hastanelerden elde edilen tamamen bağımsız, model geliştirmede kullanılmamış çok merkezli klinik test seti sunmamaktadır.

İstatistiksel belirsizlik raporlanmamıştır: DSC ve HD95 sonuçları için standart sapma, güven aralığı veya farklı rastgele tohumlarla tekrarlanan deney dağılımları verilmemiştir.

GPU ayrıntısı yoktur: Kullanılan NVIDIA GPU modeli ve eğitim donanımı açıklanmadığından eğitim süreleri tam olarak yeniden karşılaştırılamaz.

Budama hiperparametreleri elle seçilmiştir: 0,01 eşik değeri ile 8., 16. ve 24. dönem kontrolleri için kapsamlı duyarlılık analizi raporlanmamıştır.

Katman yerleşimi otomatik değildir: En iyi 6, 7, 9 ve 11 düzeni manuel ablasyon taramasıyla bulunmuştur.

Budama sonrasında örnek düzeyinde esneklik azalır: Uzmanlar fiziksel olarak kapatıldığında farklı bir görüntünün ihtiyaç duyabileceği dal tekrar etkinleşemez.

Dördüncü uzmanla ilgili açıklık sorunu: Modalite uzmanının ağırlığı sabit 1 olarak verilirken budama formülü dört uzmanı kapsamakta, evrim tablosu ise yalnızca üç uzmanı göstermektedir.

Mimari şekil tutarsızlığı: Ölçek uzmanı diyagramında üç dal R=1 görünürken denklemlerde 1, 2 ve 3 genişleme oranları tanımlanmıştır.

Kutu istemi protokolü ayrıntılı değildir: Kutu istemlerinin gerçek maskelerden nasıl üretildiği, ne kadar rastgelelik içerdiği ve test sırasında ne kadar doğru olması gerektiği açık biçimde raporlanmamaktadır.

İki boyutlu kesit yaklaşımı: Veri kümesi görüntü kesitlerinden oluşmaktadır. Üç boyutlu hacim sürekliliği ve komşu kesit bilgisi doğrudan kullanılmamaktadır.

Klinik sonuç ölçülmemiştir: Daha yüksek Dice skoru otomatik olarak daha doğru tanı, daha güvenli cerrahi veya daha iyi hasta sonucu anlamına gelmez.

Çalışma ne söylüyor, ne söylemiyor?

Çalışmanın desteklediği ifadeÇalışmanın desteklemediği ifade
Heterojen uzmanlar bu deney veri kümesinde segmentasyon sonuçlarını iyileştirmiştir.Hetero-MedSAM bütün hastanelerde ve bütün tıbbi görüntülerde en iyi modeldir.
Derin katman yerleşimi sığ katman yerleşiminden daha başarılı olmuştur.Uzmanların her olası mimaride yalnızca derin katmanlarda bulunması gerekir.
Evrimsel budama parametre sayısını azaltırken performansı artırmıştır.Budama her veri kümesinde doğruluğu mutlaka artırır.
Model 4,40 milyon eğitilebilir parametreyle uyarlanmıştır.Dağıtılan bütün model yalnızca 4,40 milyon parametreden oluşmaktadır.
CPU testinde 4,42 FPS elde edilmiştir.Her taşınabilir veya düşük güçlü cihazda gerçek zamanlı çalışacağı kanıtlanmıştır.
DSC 0,8644 ve HD95 5,37 elde edilmiştir.Model klinik tanı ve tedavi kararlarında güvenli biçimde kullanılabilir.
Uzman yönlendirmesi modalitelere göre farklı örüntüler göstermiştir.Uzman ağırlıkları doğrudan biyolojik veya klinik açıklama sağlamaktadır.
Kamuya açık çok modaliteli verilerde olumlu sonuç alınmıştır.Çapraz hastane ve çapraz cihaz genellemesi kesin olarak kanıtlanmıştır.

Geçmiş, bugün ve gelecek açısından önemi

Geçmiş açısından: Tıbbi görüntü segmentasyonunda hafifletme çalışmaları çoğunlukla büyük görüntü kodlayıcısını küçük bir omurgayla değiştirmeye veya bütün görevlere aynı adaptör yapısını uygulamaya odaklanmıştır. Hetero-MedSAM, hafif adaptörlerin de kendi içinde farklı işlevlere uzmanlaşabileceğini göstermeye çalışmaktadır.

Bugün açısından: Çalışma, büyük bir temel modelin bütün ağırlıklarını yeniden eğitmeden farklı modalitelere uyarlanabileceğini ve doğru uzman yerleşimiyle doğruluk-hız dengesinin iyileştirilebileceğini göstermektedir.

Gelecek açısından: Bu yaklaşım şu araştırma yönlerini destekleyebilir:

  • Uzmanların yerleşimini otomatik belirleyen sinir mimarisi araması,
  • Görüntü başına değişebilen daha hafif dinamik yönlendirme,
  • Üç boyutlu tıbbi hacimlere uyarlama,
  • Hasta ve hastane düzeyinde bağımsız dış doğrulama,
  • Farklı üreticilere ait cihazlar arasında genelleme testi,
  • Gerçek gömülü donanım ve taşınabilir cihazlarda enerji ölçümü,
  • Segmentasyon belirsizliğinin raporlanması,
  • Hekim düzeltmesiyle etkileşimli segmentasyon,
  • Düşük kontrastlı ve çok küçük lezyonlarda özel uzman tasarımları,
  • Uzman kararlarının açıklanabilirliğinin geliştirilmesi.

Gündelik yaşam ve sağlık hizmetleri açısından anlamı

Bir tıbbi görüntü modelinin taşınabilir cihazlarda çalışabilmesi, teorik olarak görüntülerin yalnızca büyük veri merkezlerinde değil; ameliyathane terminallerinde, taşınabilir ultrason cihazlarında, düşük donanımlı hastane bilgisayarlarında veya uzak sağlık merkezlerinde de işlenebilmesine yardımcı olabilir.

Daha hızlı segmentasyon:

  • Radyoloğun ölçüm işini hızlandırabilir.
  • Lezyon hacminin otomatik hesaplanmasına yardımcı olabilir.
  • Radyoterapi konturlarının ilk taslağını üretebilir.
  • Cerrahi planlamada anatomik yapıların görselleştirilmesini kolaylaştırabilir.

Ancak bu olasılıklar çalışmada klinik olarak gösterilmemiştir. Modelin gerçek hasta bakımında kullanılması için veri güvenliği, hata analizi, farklı cihazlarda doğrulama, klinisyen denetimi, düzenleyici değerlendirme ve prospektif klinik çalışmalar gereklidir.

Çalışmanın Yöntemi ve Bulguları

Teknik araştırma tasarımı

Çalışma türüHesaplamalı model geliştirme ve çok modaliteli segmentasyon karşılaştırması
Temel modelMedSAM
Uyarlama yaklaşımıParametre-verimli ince ayar ve heterojen uzmanlar karışımı
Ana modülHeterogeneous Contextual Mixture of Experts, HeCon-MoAE
Uzman sayısıDört işlevsel uzman türü
Son yerleşimTransformer katmanları 6, 7, 9 ve 11
Veri kümesiHeteroMedSeg
Görüntü sayısıYaklaşık 20.000 iki boyutlu kesit
Modalite sayısıSekiz
Görüntü boyutu256 × 256 piksel
DeğerlendirmeDSC, HD95, parametre, FLOP ve FPS

Modelin temel matematiksel akışı

Bağlam birleştirme:

\[ C_{\mathrm{all}}=\mathrm{Concat}(E_m,E_a,E_t,\bar{X}) \]

İlk üç uzman için yönlendirme:

\[ [w_1,w_2,w_3]^T=\mathrm{Softmax}(W_g\sigma(W_{in}C_{\mathrm{all}})) \]

Ağırlık koşulu:

\[ \sum_{i=1}^{3}w_i=1,\qquad w_4=1 \]

Uzman ve omurga birleşimi:

\[ Y=\mathrm{MLP}(X)+s\left(\sum_{i=1}^{3}w_iE_i(X)+w_4E_4(X)\right) \]

Hareketli katkı skoru:

\[ S_{\mathrm{avg}}^{(t)}=(1-\lambda)S_{\mathrm{avg}}^{(t-1)}+\lambda\mathrm{Mean}(w^{(t)}),\quad\lambda=0{,}1 \]

Budama eşiği:

\[ \tau=0{,}01 \]

Birleşik kayıp:

\[ \mathcal{L}_{\mathrm{mask}}=\mathcal{L}_{\mathrm{BCE}}+\mathcal{L}_{\mathrm{Dice}} \]

Son modelin bildirilen sonuçları

ÖlçütHetero-MedSAM sonucuAnlamı
DSC0,8644Tahmin ve gerçek maske arasında yüksek bölgesel örtüşme
HD955,37Karşılaştırılan modeller içindeki en düşük sınır sapması
Parametre4,40 milyonBildirilen eğitilebilir uyarlama parametre ölçeği
FLOP69,61 milyarBir ileri geçişin yaklaşık hesaplama yükü
CPU hızı4,42 FPSIntel Xeon E5-2680 v4 üzerindeki bildirilmiş hız

Temel MedSAM’e göre fark

ÖlçütMedSAMHetero-MedSAMMutlak değişim
DSC0,80370,8644+0,0607
HD957,505,37-2,13
FLOP371,99 G69,61 G-302,38 G
FPS0,234,42+4,19 FPS

Uzman katkılarının aşamalı sonucu

AşamaDSCHD95
Ölçek uzmanı0,83126,72
+ Kenar uzmanı0,83386,01
+ Bağlam uzmanı0,84525,86
+ Modalite uzmanı0,85515,49
+ Evrimsel budama0,86445,37

Şekillerin birlikte anlattığı süreç

  • Şekil 1: MedSAM omurgasına HeCon-MoAE modüllerinin nasıl bağlandığını gösterir.
  • Şekil 2: İnsan vücudundan klinik segmentasyon görevine uzanan anatomik bilgi ağacını gösterir.
  • Şekil 3: Yönlendirme ağı ile dört uzman dalının iç mimarisini ayrıntılandırır.
  • Şekil 4: Sekiz modalite arasındaki örnek dağılımının eşit olmadığını gösterir.
  • Şekil 5: Modellerin BT, MRG, göz dibi, röntgen, dermoskopi ve diğer gruplardaki sonuçlarını karşılaştırır.
  • Şekil 6: Küçük lezyon, bulanık sınır, düzensiz topoloji ve kopuk hedef bölgelerdeki nitel segmentasyon farklarını gösterir.

Teknik sonuç

Çalışmanın deneyleri, MedSAM’in bütün omurgasını yeniden eğitmeden işlevsel olarak farklı uzman yollarıyla uyarlanabileceğini göstermektedir. En yüksek sonuç, uzmanların ağın bütün katmanlarına değil, yüksek düzeyli semantik özelliklerin oluştuğu seçili derin bloklara yerleştirilmesiyle elde edilmiştir.

Evrimsel budama, yalnızca düşük katkılı dalları kaldırarak parametre sayısını azaltmamış; aynı zamanda uzmanlar arasındaki olası özellik çatışmasını azaltarak DSC ve HD95 sonuçlarını iyileştirmiştir.

Bununla birlikte sonuçlar, Hetero-MedSAM’in klinik kullanıma hazır olduğunu veya bütün tıbbi görüntü segmentasyon görevlerinde üstün olduğunu göstermemektedir. Bulgular, belirli bir derlenmiş veri kümesi ve araştırmacıların bildirdiği deney düzeni için geçerlidir.

Kaynak ve Yöntem Notu

Bu içerik, Lieqiang Liu ve Chengping Zhao tarafından hazırlanan “Hetero-MedSAM: A Lightweight Medical Image Segmentation Framework Based on Heterogeneous Mixture of Experts and Evolutionary Pruning” başlıklı çalışmaya dayanmaktadır.

Kaynak, SSRN üzerinde bulunan ve Elsevier’e gönderilmek üzere hazırlanmış bir preprint araştırma makalesidir. Metinde açıkça “This preprint research paper has not been peer reviewed” ifadesi yer almaktadır. Dolayısıyla çalışma bağımsız bilimsel hakem değerlendirmesinden geçmemiştir. Metinde dergi kabulü veya makaleye ait DOI bilgisi bulunmamaktadır.

Araştırma bir klinik çalışma, hasta müdahale deneyi veya tıbbi cihaz güvenlik çalışması değildir. Kamuya açık tıbbi görüntü veri kaynaklarında gerçekleştirilen hesaplamalı model geliştirme ve karşılaştırmalı segmentasyon çalışmasıdır.

Çalışmada kullanılan tıbbi görüntülerin kamuya açık ve yerleşik veri kaynaklarından alındığı, bu nedenle ayrıca etik kurul onayı gerekmediği belirtilmektedir. Yazarlar çıkar çatışması bildirmemiştir.

Verilerin bir Google Drive klasöründe, kodun ise çalışmada belirtilen GitHub deposunda kamuya açık olduğu ifade edilmektedir. Bununla birlikte sonuçların tam olarak yeniden üretilebilmesi; veri bölme yöntemi, istem üretimi, rastgele tohumlar, GPU modeli ve bazı mimari ayrıntıların daha açık raporlanmasını gerektirebilir.

Bildirilen 4,40 milyon parametre modelin eğitilebilir uyarlama ölçeğini ifade etmektedir. Dondurulmuş MedSAM omurgası çıkarım sırasında hâlâ kullanılmaktadır. Bu nedenle çalışma, bütün modelin yalnızca 4,40 milyon parametreyle depolandığını veya her düşük güçlü cihazda çalışacağını göstermemektedir.

CPU hız testi Intel Xeon E5-2680 v4 üzerinde yapılmıştır. Taşınabilir ultrason, gömülü işlemci, telefon, düşük güçlü klinik terminal veya gerçek tıbbi uç cihaz üzerinde performans ölçümü raporlanmamıştır.

Modelin yüksek Dice ve düşük HD95 sonuçları segmentasyon performansını göstermektedir; tanı doğruluğu, tedavi başarısı, cerrahi güvenlik veya hasta sonuçlarında iyileşme kanıtı değildir.

Bu makale yalnızca yüklenen preprintteki mimari tanımlar, formüller, veri hazırlama süreci, tablolar, grafikler, ablasyonlar, karşılaştırmalı sonuçlar, sınırlılıklar ve yazar yorumları temel alınarak hazırlanmıştır. PDF’de bulunmayan klinik başarı, düzenleyici onay, gerçek zamanlı cihaz performansı veya hasta yararı iddiaları eklenmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy