Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Səhiyyə Elmləri / Tibbi Tədqiqatlar / Hetero-MedSAM: Tibbi Görüntü Segmentasyonunu Heterogen Uzmanlar və Təkamül xarakterli Budamayla Yüngülləşdirən Yapay Zekâ Çərçivəsi
Tibbi Tədqiqatlar

Hetero-MedSAM: Tibbi Görüntü Segmentasyonunu Heterogen Uzmanlar və Təkamül xarakterli Budamayla Yüngülləşdirən Yapay Zekâ Çərçivəsi

Tibbi görüntü seqmentasiyau; kompüter tomoqrafiyası, maqnit-rezonans, rentgen, ultrasəs, endoskopiya, dermoskopiya və göz dibi görüntülerinde organların, tümörlerin, damarların və ya başka anatomik yapıların sınırlarının piksel düzeyinde belirlenmesidir.

20/07/2026  Veri Anla 25 baxış
Hetero-MedSAM: Tibbi Görüntü Segmentasyonunu Heterogen Uzmanlar və Təkamül xarakterli Budamayla Yüngülləşdirən Yapay Zekâ Çərçivəsi

Tibbi görüntü seqmentasiyau; kompüter tomoqrafiyası, maqnit-rezonans, rentgen, ultrasəs, endoskopiya, dermoskopiya və göz dibi görüntülerinde organların, tümörlerin, damarların və ya başka anatomik yapıların sınırlarının piksel düzeyinde belirlenmesidir. Bu işlem radyoterapi planlaması, xəstəlik ilerlemesinin izlenmesi, cerrahi hazırlık və nicel görüntü analizi gibi alanlarda mühüm bilgiler sağlayabilir.

MedSAM gibi tibbi görüntü əsas modelleri, çox çeşitli seqmentasiya görevlerinde kullanılabilecek genel görsel temsil yeteneklerine sahiptir. Ancak bu modellerin böyük görüntü kodlayıcıları yüksək hesablama, yaddaş və enerji gereksinimi oluşturur. Bu durum modellerin taşınabilir cihazlarda, aşağı güçlü klinik terminallerde və ya sınırlı donanıma sahip sağlık kuruluşlarında kullanılmasını güçleştirir.

Bu preprint tədqiqatda tədqiqatçılar, MedSAM’in önceden eğitilmiş omurğasını koruyarak yalnız göreve uyum sağlayan kiçik yan modüllerin eğitildiği Hetero-MedSAM adlı bir çerçeve önermektedir. Modelin merkezinde birbirinin eyni olmayan, fərqli işlevlere ekspertlaşmış dört modül bulunmaktadır:

  • Farklı büyüklükteki anatomik hedefleri yakalamaya çalışan Ölçek Farkındalıklı Uzman,
  • Uzun, ince və düzensiz sınırları izlemeye çalışan Anizotropik Kenar Uzmanı,
  • Yerel ayrıntıları görüntünün genel bağlamıyla birleştiren Bağlam Modülasyonu Uzmanı,
  • BT, MRG, rentgen və başka görüntüləmə yöntemleri arasındaki fiziksel sinyal farklarını telafi etmeye çalışan Uyarlanabilir Modalite Uzmanı.

Model, görüntünün modalitesini, anatomik hedefi, klinik görevi və görüntü içeriğini birlikte değerlendirerek ilk üç ekspert üçün dinamik ağırlıklar üretmektedir. Eğitim sırasında ekspertlərın katkıları hareketli ortalamayla izlenmekte; uzun süre aşağı katkı veren dallar fiziksel olaraq devre dışı bırakılmaktadır. Araşdırmacılar bu süreci “təkamül xarakterli budama” olaraq adlandırmaktadır.

Yaklaşık 20.000 tibbi görüntü kesitinden və sekiz görüntüləmə modalitesinden yaradılan HeteroMedSeg məlumat dəstinde modelin bildirilen genel Dice Benzerlik Katsayısı 0,8644, HD95 değeri 5,37 və inferensiya hızı 4,42 kare/saniyedir. Bildirilen eğitilebilir parametr ölçeği 4,40 milyondur.

Karşılaştırmada əsas MedSAM modeli 0,8037 Dice skoru, 7,50 HD95 və 0,23 kare/saniye hız elde etmiştir. Hetero-MedSAM, bu deney düzeninde daha yüksək bölgesel örtüşme, daha aşağı sınır hatası və daha yüksək işlem hızı göstermiştir. Bununla birlikte yerel olaraq dört qata yerleştirilen MedSegX modeli 4,69 kare/saniye ilə Hetero-MedSAM’den biraz daha hızlıdır; Hetero-MedSAM’in avantajı esas olaraq seqmentasiya doğruluğu və sınır uyumunda görülmektedir.

Tədqiqatnın mühüm sonucu, ekspert modüllerinin ağın her qatına yerleştirilmesinin faydalı olmadığıdır. Bütün qatlara heterogen ekspert eklenen ilk model yalnız 0,8428 Dice skoru elde etmiştir. En iyi sonuç, ekspertlərın MedSAM görüntü kodlayıcısının derin qatlarından 6, 7, 9 və 11 numaralı bloklara yerleştirilmesiyle alınmıştır.

Nəticələr, fərqli görüntüləmə problemleri üçün fərqli ekspertlərın öne çıktığını göstərir. Dermoskopide düzensiz sınırlar nedeniyle kenar ekspertı, MRG’de birbirinden kopuk hedef bölgeler nedeniyle bağlam ekspertı, BT’de ise fərqli büyüklükteki hedefler nedeniyle ölçek ekspertı daha sık korunmuştur.

Bununla birlikte tədqiqat gerçek klinik kullanım kanıtı sunmamaktadır. Deneyler kamuya açık veri kaynaklarından derlenen görüntüler üzərində yapılmıştır. Prospektif xəstə tədqiqatsı, gerçek xəstəne iş akışı, taşınabilir tibbi cihaz testi və ya klinisyen performans karşılaştırması bulunmamaktadır. Ayrıca 4,40 milyon değeri modelin eğitilebilir uyarlama parametrlerini ifade etmektedir; dondurulmuş MedSAM omurğasının yaddaşte tutulması və inferensiya sırasında çalıştırılması gereksinimi ortadan kalkmamaktadır.

Tibbi görüntü seqmentasiyau nedir?

Bir tibbi görüntü sınıflandırma sistemi, görüntünün tamamı üçün “tümör var” və ya “tümör yok” gibi tek bir karar üretebilir. Segmentasyon sistemi ise bunun ötesine geçerek hedef yapının hangi piksellerde bulunduğunu belirlemeye çalışır.

Örneğin bir karaciğer BT görüntüsünde seqmentasiya modeli:

  • Karaciğerin dış sərhədinı,
  • Karaciğer içindeki lezyonu,
  • Lezyonun çevresindeki dokuyu,
  • Gerekirse damar və ya safra yolu yapılarını

ayrı maskeler hâlinde gösterebilir.

Bu nedenle seqmentasiya yalnız “nesnenin varlığını” değil, nesnenin konumunu, alanını, hacmini, şeklini və sınırlarını da tanımlamaya çalışır.

Tibbi görüntülerde bu görev zordur çünkü:

  • Aynı organ fərqli xəstəlarda fərqli büyüklük və biçime sahip olabilir.
  • Tümör sərhədi çevre dokudan keskin biçimde ayrılmayabilir.
  • İnce damarlar və sinirler uzun, kıvrımlı və birkaç piksel genişliğinde olabilir.
  • BT, MRG, ultrasəs və rentgen görüntüleri birbirinden fərqli fiziksel sinyal mekanizmalarıyla oluşur.
  • Aynı modalitede fərqli cihazlar və çekim protokolleri fərqli görüntü dağılımları üretebilir.
  • Bazı hedefler görüntünün böyük bölümünü kaplarken bazıları çox kiçik olabilir.

MedSAM neden doğrudan hafif bir model deyil?

MedSAM, genel amaçlı Segment Anything Model mimarisinin tibbi görüntülere uyarlanmış biçimidir. Model böyük bir görüntü kodlayıcısı kullanarak görüntüyü yüksək boyutlu özellik temsillerine dönüştürür. İstem kodlayıcısı, kullanıcı tarafından verilen kutu gibi yönlendirmeleri işler; maske kod çözücüsü ise hedef yapının seqmentasiya maskesini üretir.

Büyük əsas modellerin güçlü yönü, çox çeşitli görüntüler üzərində öğrenilmiş genel özellikleri yeniden kullanabilmeleridir. Ancak böyük görüntü kodlayıcısının:

  • Yüksek parametr sayısı,
  • Yüksek FLOP gereksinimi,
  • Bellek tüketimi,
  • Düşük güçlü işlemcilerde gecikme oluşturması

klinik uç cihazlara dağıtımı sınırlandırabilir.

Tədqiqatnın karşılaştırma tablosunda əsas MedSAM üçün 93,74 milyon parametr, 371,99 GFLOP və Intel Xeon E5-2680 v4 işlemci üzərində 0,23 kare/saniye bildirilmektedir.

Hetero-MedSAM tamamen yeni və kiçik bir əsas model oluşturmamaktadır. MedSAM görüntü kodlayıcısını və istem kodlayıcısını dondurarak bunların içine və ya yanına az sayıda eğitilebilir ekspert yolu eklemektedir.

Bu ayrım önemlidir:

  • Az eğitilebilir parametr, modelin uyarlanması sırasında güncellenen ağırlıkların az olduğu anlamına gelir.
  • Küçük toplam model, bütün omurğanın fiziksel olaraq kiçik olduğu anlamına gelir.

Hetero-MedSAM birinci hedefe güçlü biçimde odaklanmaktadır. Ancak dondurulan MedSAM omurğası inferensiya sırasında yine çalıştırıldığı üçün 4,40 milyonluk sayı, bütün modelin toplam yaddaş ayak izinin yalnız 4,40 milyon parametrye düştüğü biçiminde yorumlanmamalıdır.

Parametre-verimli ince ayar nedir?

Parametre-verimli ince ayar, önceden eğitilmiş böyük modelin bütün ağırlıklarını yeniden eğitmek yerine ana omurğayı sabit tutarak az sayıda ek parametryi günceller.

Gündelik bir benzetmeyle, böyük bir xəstəneyi baştan inşa etmek yerine mevcut xəstənenin belirli bölümlerine kiçik ekspert ekipler eklemek gibidir. Ana altyapı korunur; yeni göreve uyum ekspert ekipler üzerinden sağlanır.

Bu yaklaşım:

  • Eğitim belleğini azaltabilir.
  • Göreve özgü ağırlık dosyasını küçültebilir.
  • Aynı omurğanın fərqli görevlerde yeniden kullanılmasını kolaylaştırabilir.
  • Tam model ince ayarına görə təlim maliyetini düşürebilir.

Ancak bütün görevler üçün eyni yapıda tek bir adaptör kullanılırsa, fərqli tibbi görüntülerin ihtiyaçları yeterince temsil edilmeyebilir. Hetero-MedSAM’in çıkış noktası bu sınırlamadır.

Neden “heterogen” ekspertlər kullanılıyor?

Klasik ekspertlər karışımı mimarilerinde birden fazla benzer ağ dalı bulunabilir. Bu dallar eyni əsas yapıyı taşır lakin fərqli örneklerde fərqli oranlarda etkinleştirilir.

Hetero-MedSAM’de ise ekspertlərın yalnız ağırlıkları değil, iç mimarileri və görevleri de farklıdır. Her ekspert belirli bir tibbi görüntü sorununa yöneliktir:

UzmanHedeflediği problemTemel işlem
Ölçek Farkındalıklı UzmanKüçük lezyonlarla böyük organların eyni modelde işlenmesiFarklı genişleme oranlarına sahip paralel derinliksel evrişimler
Anizotropik Kenar UzmanıUzun, ince, kıvrımlı və ya asimetrik sınırlarYatay və dikey şerit evrişimleri ilə tek taraflı dolgulama
Bağlam Modülasyonu UzmanıYerel ayrıntılarla geniş anatomik bağlamın birleştirilmesiGlobal ortalama və maksimum havuzlama ilə kanal modülasyonu
Uyarlanabilir Modalite UzmanıBT, MRG, rentgen və başka modaliteler arasındaki sinyal farklarıModaliteye özgü ekspert yönlendirmesi və parametr telafisi

Bu tasarımın mantığı, bir radyoloğun kemik rentgeni, beyin MRG’si və dermoskopiya görüntüsünü eyni görsel kurallarla değerlendirmemesine benzetilebilir. Görüntülerin fiziksel üretim biçimleri və klinik hedefleri fərqli olduğu üçün modelin kullandığı yardımcı temsil yolları da farklılaştırılmaktadır.

Modelin genel mimarisi

Şəkil 1’de modelin bütün işlem zinciri gösterilmektedir. Temel akış şöyledir:

  1. Tibbi görüntü dondurulmuş MedSAM görüntü kodlayıcısına girer.
  2. Görüntü özellikleri Transformer bloklarında işlenir.
  3. Seçilmiş derin bloklara HeCon-MoAE ekspert modülü paralel yol olaraq eklenir.
  4. Modalite, organ, görev və görüntü bağlamı bir yönlendirme ağına girer.
  5. Uzmanların katkı ağırlıkları hesaplanır.
  6. Uzman çıktıları MedSAM’in özgün ileri beslemeli ağ çıktısıyla birleştirilir.
  7. Kutu istemi dondurulmuş istem kodlayıcısıyla işlenir.
  8. Görüntü və istem temsilleri maske kod çözücüsünde birleştirilir.
  9. Hedef yapının seqmentasiya maskesi oluşturulur.

Bu mimari, MedSAM’in önceden öğrendiği genel tibbi görüntü bilgisini korurken belirli görevlerin gerektirdiği ek özelliklerin kiçik ekspert yollarıyla tamamlanmasını məqsəd daşıyır.

MedSegDB’nin anatomik bilgi hiyerarşisi

Tədqiqat, daha önce geliştirilen MedSegDB adlı anatomik bilgi və seqmentasiya veri quruluşunı deneysel referans olaraq kullanmaktadır. MedSegDB, 129 kamuya açık veri kaynağından gelen tibbi görüntüleri hiyerarşik bir anatomik ağaç altında birleştirmektedir.

Şəkil 2’de gösterilen yapı bir kök qat və dört anatomik düzeyden oluşur:

DüzeyİçerikBildirilen kapsam
Kök qatGenel insan vücudu temsiliOrtak başlangıç vektörü
Katman 1Vücut sistemiBaş-boyun, gövde, iskelet, damar və deri olmak üzere 5 alt ağaç
Katman 2Anatomik bölgeGöğüs, karın və pelvis gibi 12 bölge
Katman 3Organ və ya doku39 organ və doku varlığı
Katman 4Klinik seqmentasiya görevi111 ayrıntılı görev

Örneğin model üçün bu anlamsal yol oluşturulabilir:

\[ \mathrm{İnsan\ vücudu} \rightarrow \mathrm{Gövde} \rightarrow \mathrm{Karın} \rightarrow \mathrm{Karaciğer} \rightarrow \mathrm{Karaciğer\ tümörü} \]

Bu hiyerarşi modelin yalnız görüntü piksellerine değil, görüntünün hangi modaliteye, organa və klinik göreve ait olduğuna ilişkin yapılandırılmış bilgiye de erişmesini sağlar.

Ortak bağlam tanımlayıcısı necə oluşturuluyor?

Model dört bilgi kaynağını birleştirir:

  • Görüntüleme modalitesi gömmesi: Em
  • Anatomik yapı gömmesi: Ea
  • Klinik görev gömmesi: Et
  • Global olaraq havuzlanmış görüntü özelliği: X̄

Tədqiqatda verilen ortak bağlam denklemi şöyledir:

\[ C_{\mathrm{all}} = \mathrm{Concat}(E_m,E_a,E_t,\bar{X}) \]

Burada:

  • Call, ekspert yönlendirmesinde kullanılacak birleşik bağlam tanımlayıcısıdır.
  • Concat, özellik vektörlerinin kanal boyutunda yan yana eklenmesidir.
  • Em, görüntünün BT, MRG, rentgen və ya başka bir modaliteye ait olduğunu kodlar.
  • Ea, anatomik konumu və organ bilgisini temsil eder.
  • Et, hangi yapının seqmentasiyaunun istendiğini temsil eder.
  • X̄, görüntünün genel içerik özetidir.

Gündelik anlamıyla sistem yalnız “görüntüde ne görüyorum?” sorusunu değil, “bu görüntü hangi cihazdan geldi, hangi organı gösteriyor və benden hangi yapıyı bulmam isteniyor?” sorularını birlikte değerlendirmektedir.

Uzman ağırlıkları necə hesaplanıyor?

İlk üç morfolojik ekspertın ağırlıkları yönlendirme ağı tarafından hesaplanır:

\[ [w_1,w_2,w_3]^T = \mathrm{Softmax}(W_g \cdot \sigma(W_{in}\cdot C_{\mathrm{all}})) \]

Bu formülde:

  • w1, Ölçek Farkındalıklı Uzmanın ağırlığıdır.
  • w2, Anizotropik Kenar Uzmanının ağırlığıdır.
  • w3, Bağlam Modülasyonu Uzmanının ağırlığıdır.
  • Win və Wg, təlim sırasında öğrenilen matrislerdir.
  • σ, sigmoid aktivasyonudur.
  • Softmax, üç ağırlığı pozitif değerlere dönüştürerek toplamlarını bire eşitler.

Ağırlıkların əsas koşulu şöyledir:

\[ \sum_{i=1}^{3} w_i = 1 \]

Böylece model, üç morfolojik ekspert arasında sınırlı bir dikkat bütçesi dağıtır. Bir görüntüde düzensiz sınırlar öne çıkıyorsa kenar ekspertının payı artabilir; hedeflerin boyutları çox değişiyorsa ölçek ekspertı daha fazla ağırlık alabilir.

Dördüncü ekspert olan Uyarlanabilir Modalite Uzmanı bu rekabetin dışında tutulmaktadır. Tədqiqatda kontrol ağırlığı:

\[ w_4 = 1 \]

olarak sabitlenmiştir. Bunun amacı modaliteye özgü sinyal telafisinin ilk üç ekspert arasındaki ağırlık rekabetinden etkilenmeden sürekli tədqiqatsıdır.

Uzman çıktıları MedSAM’e necə ekleniyor?

Uzmanların ürettiği özellikler MedSAM’in özgün ileri beslemeli ağ yoluyla birleştirilir:

\[ Y = \mathrm{MLP}(X) + s \cdot \left(\sum_{i=1}^{3} w_iE_i(X)+w_4E_4(X)\right) \]

Burada:

  • X, Transformer bloğuna giren özelliktir.
  • MLP(X), MedSAM’in özgün ileri beslemeli ağ çıktısıdır.
  • E1-E3, üç morfolojik ekspertın dönüşümleridir.
  • E4, modalite ekspertıdır.
  • wi, ekspert katkı ağırlıklarıdır.
  • s, ekspert katkısının genel büyüklüğünü kontrol eden ayarlanabilir ölçek katsayısıdır.
  • Y, özgün və ekspert yollarının birleşmiş çıktısıdır.

Bu yapı özgün MedSAM temsilini silmek yerine ona artık bir düzeltme və ya tamamlayıcı bilgi eklemektedir. Böylece ekspert yolları yanlış və ya yetersiz öğrenirse önceden eğitilmiş omurğanın əsas temsili korunmaya çalışılır.

Ölçek Farkındalıklı Uzman necə çalışıyor?

Tibbi görüntülerde hedef boyutları böyük ölçüde değişebilir. Bir görüntüde bütün karaciğer seqmentasiyau yapılırken başka bir görüntüde birkaç milimetrelik lezyon aranabilir.

Ölçek Farkındalıklı Uzman önce özellik kanallarını 1×1 evrişimle aşağı boyutlu bir darboğaza indirir. Ardından fərqli genişleme oranlarına sahip üç paralel derinliksel evrişim uygular:

\[ x_r = \mathrm{DConv}_r(\mathrm{Conv}^{down}_{1\times1}(X)), \quad r\in\{1,2,3\} \]

Burada:

  • r, genişletilmiş evrişimin genişleme oranıdır.
  • r=1, daha yerel ayrıntıları görür.
  • r=2 və r=3, daha geniş çevresel bağlamı örnekler.
  • DConv, her kanal üzərində daha aşağı maliyetle uygulanan derinliksel evrişimdir.

Üç ölçek daha sonra birleştirilir:

\[ X_{\mathrm{scale}} = \mathrm{Conv}^{up}_{1\times1}\left(\mathrm{GELU}(\mathrm{Concat}(x_1,x_2,x_3))\right) \]

Bu işlem kiçik ayrıntılarla geniş anatomik konturların eyni temsil içinde bir araya getirilmesini amaçlar.

Şəkil 3’ün ekspert diyagramında üç dalın üzərində de “R=1” etiketi görünürken yöntem metni və denklem genişleme oranlarını 1, 2 və 3 olaraq tanımlamaktadır. Bu, preprint içindeki görsel ilə matematiksel açıklama arasında bir belge tutarsızlığıdır. Kesin uygulamanın kod üzerinden doğrulanması gerekir.

Anizotropik Kenar Uzmanı necə çalışıyor?

“Anizotropik” ifadesi, yapının her yönde eyni görünmediğini anlatır. Bir karaciğer kitlesi görece yuvarlak olabilirken damar, sinir, bağırsak duvarı və ya deri lezyonunun sərhədi uzun, ince və belirli bir yöne uzanan biçimde olabilir.

Klasik kare evrişim çekirdeği uzun və ince bir yapıyı incelerken çevredeki gereksiz arka planı da işleme katabilir. Model bu nedenle yatay və dikey şerit çekirdekler kullanmaktadır:

\[ y_h^{(i)} = \mathrm{Conv}_{1\times k}(\mathrm{Pad}^{(i)}_h(X)), \quad i\in\{0,1\} \]

\[ y_v^{(i)} = \mathrm{Conv}_{k\times1}(\mathrm{Pad}^{(i)}_v(X)), \quad i\in\{0,1\} \]

Bu formüllerde:

  • yh, yatay yöndeki özellikleri temsil eder.
  • yv, dikey yöndeki özellikleri temsil eder.
  • Pad, çekirdeğin sola, sağa, yukarıya və ya aşağıya daha fazla ağırlık verebilmesini sağlayan tek taraflı asimetrik doldurmadır.
  • Şəkilde çekirdekler 1×3 və 3×1 olaraq gösterilmiştir.

Dört yönlü çıktı birleştirilir:

\[ X_{\mathrm{edge}} = \mathrm{Conv}_{1\times1}\left(\mathrm{SiLU}(\mathrm{Concat}(y_h^{(0)},y_h^{(1)},y_v^{(0)},y_v^{(1)}))\right) \]

Bu ekspert, özellikle düzensiz deri lezyonu sınırları, ince damar yapıları və yönlü anatomik konturlar üçün tasarlanmıştır.

Bağlam Modülasyonu Uzmanı necə çalışıyor?

Bazı seqmentasiya hataları, modelin kiçik bir ayrıntıya fazla odaklanıp görüntünün genel anatomik düzenini gözden kaçırmasından kaynaklanır.

Bağlam ekspertı iki global özet kullanmaktadır:

  • Global ortalama havuzlama: Görüntüdeki genel özellik dağılımını özetler.
  • Global maksimum havuzlama: En belirgin sinyalleri öne çıkarır.

Kanal ağırlıkları bu ilişkiyle üretilir:

\[ W = \sigma(\mathrm{FC}(\mathrm{Concat}(\mathrm{GAP}(Z),\mathrm{GMP}(Z)))) \]

Burada:

  • Z, aşağı boyutlu darboğaz özelliğidir.
  • GAP, global ortalama havuzlamadır.
  • GMP, global maksimum havuzlamadır.
  • FC, tam bağlantılı dönüşümdür.
  • W, hangi özellik kanallarının güçlendirilip hangilerinin azaltılacağını belirleyen ağırlıktır.

Modüle edilmiş özellik:

\[ U = \mathrm{BN}(\mathrm{DWConv}_{3\times3}(Z\odot W)) \]

\[ X_{\mathrm{context}} = \mathrm{Conv}_{1\times1}(U) \]

⊙ işareti kanal düzeyinde eleman bazlı çarpmayı, BN ise toplu normalizasyonu ifade eder.

Bu ekspert özellikle MRG görüntülerinde birbirinden kopuk kiçik hedef bölgelerin genel anatomik bağlam içinde fark edilmesine yardımcı olmayı məqsəd daşıyır.

Uyarlanabilir Modalite Uzmanı ne yapıyor?

BT’de ölçülen Hounsfield birimleriyle MRG’nin sinyal yoğunluğu, rentgenin projeksiyon quruluşu və ya endoskopiyanin renk və aydınlatma özellikleri eyni deyil.

Uyarlanabilir Modalite Uzmanı, görüntü modalitesine görə ayrılan kiçik ekspert yollarından uygun olanı yönlendirmeyle seçer. Tədqiqatnın mimari şemasında CT, MRI, X-ray və diğer modalite ekspertlərı ayrı dallar olaraq gösterilmektedir.

Bu dalın hedefi, eyni anatomik yapının fərqli görüntüləmə sistemlerinde yaratdığu dağılım kaymasını telafi etmektir.

Ancak yöntem metninde modalite ekspertının ağırlığı 1 olaraq sabitlenirken daha sonraki budama bölümünde toplam ekspert sayısı dört olaraq verilmekte və budama maskesi bütün ekspertlərı kapsayabilecek biçimde tanımlanmaktadır. Uzman evrimi tablosunda ise yalnız ilk üç ekspert raporlanmaktadır. Bu nedenle dördüncü ekspertın budama sırasında tam olaraq necə ele alındığı preprint metninde bütünüyle açık deyil.

Uzman bankasının hesablama yükü

Tədqiqatda bütün ekspertlər 768×16×16 giriş/çıkış özelliği və 64 kanallı ortak darboğaz altında müqayisə edilmişdir.

ModülParametreHesaplama yükü
Standart evrişim karşılaştırması135,17 bin34,60 milyon FLOP
Derinliksel evrişim karşılaştırması98,88 bin25,31 milyon FLOP
Dörtlü grup evrişimi107,52 bin27,53 milyon FLOP
Ölçek Farkındalıklı Uzman198,34 bin50,77 milyon FLOP
Anizotropik Kenar Uzmanı124,48 bin51,18 milyon FLOP
Bağlam Modülasyonu Uzmanı100,54 bin25,38 milyon FLOP
Uyarlanabilir Modalite Uzmanı98,30 bin25,17 milyon FLOP
Toplam ekspert bankası521,66 bin152,50 milyon FLOP

Bu tablo tek bir ekspert bankasının maliyetini göstərir. Son modelde ekspert bankaları seçilmiş birden fazla Transformer bloğuna yerleştirildiği üçün model düzeyindeki toplam değerler ayrı olaraq raporlanmıştır.

Təkamül xarakterli budama mekanizması

Dört ekspert dalının her seçili qatda sürekli çalıştırılması modelin hafiflik hedefini zayıflatabilir. Araşdırmacılar bu nedenle təlim sırasında ekspert katkılarını izleyen bir mekanizma geliştirmiştir.

Her ekspertın hareketli ortalama katkı skoru bu formülle güncellenir:

\[ S_{\mathrm{avg}}^{(t)}=(1-\lambda)S_{\mathrm{avg}}^{(t-1)}+\lambda\cdot\mathrm{Mean}(w^{(t)}) \]

Burada:

  • Savg(t), t anındaki yumuşatılmış katkı skorudur.
  • w(t), güncel mini partideki ekspert ağırlıklarıdır.
  • Mean, örnekler üzerindeki ortalamadır.
  • λ, hareketli ortalamanın yeni bilgiye ne hızla uyum sağlayacağını belirler.

Tədqiqatda:

\[ \lambda = 0{,}1 \]

olarak kullanılmıştır.

Tek bir görüntüde ekspert ağırlığı rastlantısal biçimde artıp azalabilir. Hareketli ortalama, geçici dalgalanmalardan çox uzun dönemli katkıya odaklanmayı amaçlar.

Uzmanın katkısı önceden belirlenen eşik değerin altında kalırsa budama maskesi uygulanır. Tədqiqatda eşik:

\[ \tau = 0{,}01 \]

olarak belirlenmiştir.

Değerlendirmeler təlimin 8., 16. və 24. dönemlerinde yapılmıştır.

Budama sonrası ağırlık hesablaması şöyledir:

\[ \hat{w}=\mathrm{Softmax}\left((W_g\cdot\sigma(W_{in}\cdot C_{\mathrm{all}}))\odot(1-m)-M\cdot m\right) \]

Burada:

  • m, her ekspert üçün 0 və ya 1 değerini alan budama maskesidir.
  • m=1, əlaqəli ekspert yolunun kapatıldığını gösterir.
  • M, budanan ekspertın Softmax öncesi skorunu çox böyük negatif değere iten böyük bir sayıdır.
  • ŵ, budama sonrasındaki yeni ekspert ağırlıklarıdır.

Məqsəd yalnız ekspert çıktısını sıfıra çarpmak değil, inferensiya sırasında əlaqəli fiziksel dalın çalıştırılmasını durdurarak gerçek hesablama tasarrufu sağlamaktır.

Kayıp fonksiyonu

Modelin seqmentasiya təlimi ikili çapraz entropi və Dice kaybının toplamıyla yapılmaktadır:

\[ \mathcal{L}_{\mathrm{mask}}=\lambda_1\mathcal{L}_{\mathrm{BCE}}+\lambda_2\mathcal{L}_{\mathrm{Dice}} \]

Tədqiqatda iki katsayı da 1 olaraq ayarlanmıştır:

\[ \lambda_1=\lambda_2=1 \]

İkili çapraz entropi kaybı:

\[ \mathcal{L}_{\mathrm{BCE}}=-\frac{1}{N}\sum_{i=1}^{N}\left(y_i\log p(y_i)+(1-y_i)\log(1-p(y_i))\right) \]

Burada:

  • yi, i pikselinin gerçek etiketidir və 0 və ya 1 değerini alır.
  • p(yi), modelin piksel üçün ürettiği olasılıktır.
  • N, görüntüdeki toplam piksel sayısıdır.

Dice kaybı:

\[ \mathcal{L}_{\mathrm{Dice}}=1-\frac{2\sum_{i=1}^{N}p(y_i)y_i+\epsilon}{\sum_{i=1}^{N}p(y_i)+\sum_{i=1}^{N}y_i+\epsilon} \]

Bu formülde ε, paydanın sıfır olmasını önleyen kiçik sayısal sabittir.

Çapraz entropi her pikselin sınıfını doğru tahmin etmeye, Dice kaybı ise tahmin edilen bölgenin gerçek bölgeyle toplu örtüşmesine odaklanır.

Model bir görüntü üçün birden fazla maske adayı üretir. Eğitimde gerçek maskeye en iyi uyan aday seçilir:

\[ \mathcal{L}_{\mathrm{total}}=\min_{j\in\{1,\ldots,M\}}\{\mathcal{L}_{\mathrm{mask}}(P_j,Y)\} \]

Burada:

  • M, maske adayı sayısıdır.
  • Pj, j numaralı tahmindir.
  • Y, gerçek seqmentasiya maskesidir.

HeteroMedSeg məlumat dəsti

Araşdırmacılar kamuya açık tibbi görüntü kaynaklarından yaklaşık 20.000 iki boyutlu görüntü kesiti derleyerek HeteroMedSeg adlı deneysel məlumat dəstini yaratmışdır.

Veri kümesinde sekiz modalite bulunmaktadır:

  • Röntgen,
  • Dermoskopi,
  • Bilgisayarlı tomografi,
  • Göz dibi görüntüləmə,
  • Manyetik rezonans görüntüləmə,
  • Ultrason,
  • Endoskopi,
  • Kolonoskopi.

Şəkil 4’te modaliteler arasında örnek sayılarının eşit olmadığı görülmektedir. Bu dağılım modelin daha kalabalık modalitelerden daha fazla öğrenme sinyali almasına yol açabilir.

Görüntü adları “Modalite-Görev Varlığı” biçiminde düzenlenmiş və modelin modalite ilə anatomik bağlam kodlarını dosya adından ayrıştırmasına olanak sağlanmıştır.

Veriler:

  • Yüzde 70 təlim,
  • Yüzde 15 doğrulama,
  • Yüzde 15 test

olarak ayrılmıştır.

Metin, bölmenin xəstə düzeyinde mi, görüntü kesiti düzeyinde mi və ya kaynak məlumat dəsti düzeyinde mi yapıldığını ayrıntılı biçimde açıklamamaktadır. Aynı xəstəya ait komşu kesitlerin fərqli bölümlere düşmesi durumunda veri sızıntısı oluşabileceği üçün bu ayrıntı model performansının güvenilirliği açısından önemlidir.

Ön işleme

Bütün görüntüler 256×256 piksele yeniden boyutlandırılmıştır.

BT görüntülerinde Hounsfield birimleri:

\[ -150 \leq \mathrm{HU} \leq 250 \]

aralığında kırpılmış və daha sonra doğrusal olaraq normalize edilmiştir.

Bu pencere yumuşak doku ağırlıklı bir aralığı temsil eder. Ancak kemik, ağciyər və ya çox aşağı yoğunluklu dokuların bazı sinyalleri bu kırpma sırasında kaybolabilir.

MRG və diğer modalitelerde piksel değerleri:

\[ 0 \leq x \leq 1 \]

aralığına ölçeklenmiştir.

Eğitim sırasında:

  • 0,9-1,1 arasında rastgele ölçekleme,
  • Rastgele çevirme

tətbiq edilmişdir.

Eğitim ayarları

YazılımPyTorch
DonanımNVIDIA GPU ortamı; GPU modeli belirtilmemiştir
OptimizasyonAdamW
Başlangıç öğrenme oranı1 × 10-4
Ağırlık azalması0,01
Öğrenme oranı programıKosinüs tavlama
Mini parti büyüklüğü24
Eğitim süresi50 dönem
Budama kontrolleri8., 16. və 24. dönemler

GPU modelinin, rastgele tohumların və deney tekrar sayısının belirtilmemesi təlim süresi və sonuç değişkenliğinin bağımsız olaraq değerlendirilmesini zorlaştırmaktadır.

Değerlendirme ölçütleri

Dice Benzerlik Katsayısı: Tahmin edilen maske ilə gerçek maskenin ne ölçüde örtüştüğünü gösterir. Değer bire yaklaştıkça bölgesel uyum artar.

HD95: Tahmin edilen sınır ilə gerçek sınır arasındaki çift yönlü mesafelerin yüzde 95’lik değerini ölçer. Düşük değer daha iyi sınır uyumunu gösterir. En uç yüzde 5’lik hatayı dışarıda bıraktığı üçün tek bir gürültülü piksele qarşı klasik Hausdorff mesafesinden daha dayanıklıdır.

Parametre sayısı: Modelin depolama və öğrenilebilir kapasite ölçeğini gösterir. Hetero-MedSAM üçün bildirilen değer eğitilebilir uyarlama parametrlerine odaklanmaktadır.

FLOP: Bir ileri geçişteki yaklaşık kayan nokta işlem sayısını gösterir.

FPS: Saniyede işlenen görüntü sayısıdır. Tədqiqatda Intel Xeon E5-2680 v4 CPU üzərində ölçülmüştür.

Neden bütün qatlara ekspert eklenmedi?

MedSAM görüntü kodlayıcısı 12 Transformer bloğundan oluşmaktadır. Araşdırmacılar önce bütün qatlara ekspert yerleştirmeyi denemiştir.

Tam qatlı heterogen ekspert modeli:

\[ \mathrm{DSC}=0{,}8428 \]

elde etmiştir.

Bu sonuç, MedSegX’in tam qatlı homojen ekspert modelinin 0,8567 skorundan və Hetero-MedSAM’in son seçilen quruluşundan daha aşağıtür.

Araşdırmacılar bu durumu şöyle yorumlamaktadır:

  • Sığ qatlar əsas kenar və doku özelliklerini çıkarır.
  • Farklı yapıda çox sayıda ekspert erken qatlara eklendiğinde önceden öğrenilmiş əsas temsiller bozulabilir.
  • Heterogen yollar fərqli büyüklükte və yönde gradyanlar üreterek görevler arası çatışmayı artırabilir.
  • Derin qatlarda anatomik və semantik özellikler daha kararlı hâle gelir.
  • Uzmanların bu qatlarda göreve özgü düzeltme yapması daha az bozucu olabilir.

Bu sonuç, daha fazla modülün otomatik olaraq daha iyi performans anlamına gelmediğini göstərir.

Katman sayısı və konumu deneyleri

Tədqiqatda bir, iki, üç, dört və beş qata ekspert yerleştirilen çox sayıda düzen test edilmiştir.

Sığ qat və ya karma qat düzenlerinin böyük bölümü 0,83 Dice sərhədinı aşamamıştır. Derin qat düzenleri daha iyi sonuç vermiştir.

Öne çıkan sonuçlar:

YerleşimKatmanlarDSCBaşlangıç → son parametr
Üç derin qat6, 9, 110,85344,20M → 4,05M
Dört derin qat6, 7, 9, 110,86444,63M → 4,40M
Beş derin qat6, 7, 8, 9, 110,86005,05M → 4,69M

Dört qatlı düzen, beş qatlı modelden daha az parametryle daha yüksək sonuç vermiştir. Bu nedenle son modelde dört ekspert yerleşim noktası seçilmiştir.

Neden 6, 7, 9 və 11. qatlar seçildi?

Araşdırmacılar derin bölgede mümkün olan 15 fərqli dört qat kombinasyonunu karşılaştırmıştır.

En iyi sonuç:

\[ [6,7,9,11] \rightarrow \mathrm{DSC}=0{,}8644 \]

olarak raporlanmıştır.

Bu yapı üç pencere dikkat bloğu və bir global dikkat bloğu içermektedir. Yazarlar bu düzeni “önce yerel, sonra global” iş birliği olaraq yorumlamaktadır:

  • 6., 7. və 9. qatlardaki pencere dikkati yerel yapıları işler.
  • Uzmanlar yerel ölçek və sınır özelliklerini tamamlar.
  • 11. qatdaki global dikkat geniş anatomik bağlamı birleştirir.
  • Son ekspert modülü yerel özelliklerin global düzeyde bütünleşmesine katkı sağlar.

Karşılaştırmalı performans

ModelDSC ↑HD95 ↓Parametre (M) ↓FLOP (G) ↓FPS ↑
MedSAM0,80377,5093,74371,990,23
SwinLite-MedSAM0,81127,8514,29101,052,25
LiteMedSAM0,81507,479,7974,951,68
Med-FastSAM0,82346,8526,4194,152,17
Rep-MedSAM0,82956,199,2850,852,92
MedSegX, 6-7-9-110,84555,724,5069,544,69
MedSegX, bütün bloklar0,85675,435,4169,953,87
Hetero-MedSAM0,86445,374,4069,614,42

Hetero-MedSAM, tədqiqatdaki en yüksək genel Dice skorunu və en aşağı HD95 değerini elde etmiştir. FPS bakımından ise yerel MedSegX modeli biraz daha hızlıdır.

Bu tablo, modelin her ölçütte tek başına en iyi olmadığını; doğruluk, sınır kalitesi, parametr ölçeği və hız arasında bir denge sunduğunu göstərir.

FLOP değeri Rep-MedSAM’den daha yüksəktir. Dolayısıyla “hafif” ifadesi her hesablama ölçütünde en aşağı değere sahip olmak anlamına gelmemektedir.

Modalitelere görə performans

Şəkil 5, MedSAM, tam qatlı MedSegX və Hetero-MedSAM’i modalite düzeyinde karşılaştırmaktadır.

Tədqiqatnın yorumuna görə Hetero-MedSAM:

  • MRG,
  • Göz dibi,
  • Röntgen,
  • Dermoskopi,
  • Diğer modaliteler

üzerinde olumlu sonuçlar göstermiştir.

BT modalitesinde ise MedSegX’in sonucu Hetero-MedSAM’den marjinal biçimde daha yüksəktir. Bu durum tek bir genel ortalamanın bütün modalitelerde üstünlük anlamına gelmediğini gösterir.

Uzmanların modaliteye görə evrimi

Cədvəl 5, təlim ilerledikçe ekspert ağırlıklarının necə değiştiğini göstərir. Son dönemde her seçili qatda ilk üç morfolojik ekspertdan yalnız biri korunmuştur.

ModaliteKatman 6Katman 7Katman 9Katman 11
BTÖlçekBağlamÖlçekKenar
EndoskopiBağlamKenarKenarBağlam
DermoskopiKenarKenarKenarÖlçek
MRGBağlamÖlçekBağlamBağlam

Bu örüntüler mimarinin tasarım amacıyla uyumludur:

  • BT’de hedef boyutları değiştiği üçün ölçek ekspertı sık korunmuştur.
  • Endoskopide bulanık sınırlar və geniş sahne bağlamı nedeniyle kenar və bağlam ekspertlərı birlikte öne çıkmıştır.
  • Dermoskopide düzensiz lezyon konturları nedeniyle kenar ekspertı baskın hâle gelmiştir.
  • MRG’de birbirinden kopuk bölgelerin birlikte tanınması gerektiği üçün bağlam ekspertı çoğu qatda korunmuştur.

Nitel seqmentasiya örnekleri

Şəkil 6’da dört zorlu klinik görünüm müqayisə edilmişdir:

  • BT’de kiçik lezyon,
  • Endoskopide bulanık sınır,
  • Dermoskopide düzensiz topoloji,
  • MRG’de birbirinden ayrılmış hedef bölgeler.

Araşdırmacılara görə Hetero-MedSAM, dermoskopiyade sınırların aşırı yumuşatılmasını azaltmış; MRG’de ana hedef bölgenin dışında bulunan kiçik kopuk bölgeleri daha iyi fark etmiştir.

Bununla birlikte MRG örneğinde global bağlama ayrılan kapasitenin ana böyük bölgedeki yerel uyumu bir miktar azaltabileceği de belirtilmektedir. Bu, modelin global bütünlük ilə yerel piksel uyumu arasında bir denge kurduğunu gösterir.

Ablasyon tədqiqatsı ne gösterdi?

Model bileşenleri sırayla eklenerek her ekspertın katkısı incelenmiştir.

YapıDSC ↑HD95 ↓
Yalnızca Ölçek Farkındalıklı Uzman0,83126,72
Ölçek + Kenar0,83386,01
Ölçek + Kenar + Bağlam0,84525,86
Dört ekspertın tamamı0,85515,49
Dört ekspert + təkamül xarakterli budama0,86445,37

Her bileşenin eklenmesi Dice skorunu artırmış və sınır hatasını düşürmüştür. Budama yalnız modeli küçültmekle kalmamış, performansı da iyileştirmiştir.

Araşdırmacılar bunu aşağı katkılı dalların kaldırılmasıyla ekspertlər arasındaki özellik çatışmasının və aşırı uyumun azalabileceği biçiminde yorumlamaktadır.

Bununla birlikte ablasyon tek bir ekleme sırası üzerinden yapılmıştır. Örneğin yalnız kenar ekspertı və ya yalnız bağlam ekspertı gibi bütün olası kombinasyonlar raporlanmamıştır. Dolayısıyla her ekspert üçün bağımsız katkı miktarı tam olaraq ayrıştırılamamaktadır.

Tədqiqatın güclü tərəfləri

  • MedSAM tamamen yeniden eğitilmek yerine dondurulmuş omurğa üzərində parametr-verimli uyarlama yapılmıştır.
  • Uzmanların eyni yapıyı tekrarlaması yerine birbirini tamamlayan dört fərqli işlev tasarlanmıştır.
  • Görüntü içeriği modalite, organ və klinik görev bilgisiyle birlikte yönlendirmede kullanılmıştır.
  • Katman yerleşimi çox sayıda ablasyon deneyiyle araştırılmıştır.
  • Uzman katkıları təlim boyunca izlenmiş və aşağı katkılı yollar fiziksel olaraq budanmıştır.
  • Bölge örtüşmesi yanında sınır kalitesi HD95 ilə qiymətləndirilmişdir.
  • Parametre, FLOP və CPU hızı birlikte raporlanmıştır.
  • Sekiz fərqli görüntü modalitesi kullanılmıştır.
  • Bileşenlerin aşamalı katkısını gösteren ablasyon tədqiqatsı sunulmuştur.
  • Kodun kamuya açık olduğu belirtilmiştir.

Tədqiqatın məhdudiyyətləri

Hakem değerlendirmesi bulunmamaktadır: Tədqiqat preprinttir və bağımsız bilimsel hakemler tarafından henüz değerlendirilmemiştir.

Gerçek klinik doğrulama yoktur: Model prospektif xəstəne verisinde, rutin klinik iş akışında və ya hekim gözetiminde test edilmemiştir.

“Hafif” parametr sayısının yorumu: Bildirilen 4,40 milyon değer eğitilebilir uyarlama parametrlerine odaklanmaktadır. Dondurulmuş MedSAM omurğası modelden çıkarılmamıştır.

Gerçek uç cihaz testi yoktur: FPS ölçümü Intel Xeon E5-2680 v4 sunucu sınıfı CPU üzərində yapılmıştır. Telefon, taşınabilir ultrasəs, gömülü GPU və ya aşağı güçlü klinik terminal üzərində ölçüm bulunmamaktadır.

Toplam yaddaş tüketimi raporlanmamıştır: RAM, GPU belleği, model dosyası boyutu, enerji tüketimi və gecikme dağılımı verilmemiştir.

Veri bölme ayrıntısı sınırlıdır: Eğitim, doğrulama və test ayrımının xəstə və ya kaynak məlumat dəsti düzeyinde yapılıp yapılmadığı açıklanmamaktadır.

Veri dengesizliği: Sekiz modalitenin örnek sayıları eşit deyil. Genel ortalama daha kalabalık modalitelerden daha fazla etkilenebilir.

Bağımsız dış test sınırlıdır: Tədqiqat fərqli xəstənelerden elde edilen tamamen bağımsız, model geliştirmede kullanılmamış çox merkezli klinik test seti sunmamaktadır.

İstatistiksel belirsizlik raporlanmamıştır: DSC və HD95 sonuçları üçün standart sapma, güven aralığı və ya fərqli rastgele tohumlarla tekrarlanan deney dağılımları verilmemiştir.

GPU ayrıntısı yoktur: Kullanılan NVIDIA GPU modeli və təlim donanımı açıklanmadığından təlim süreleri tam olaraq yeniden karşılaştırılamaz.

Budama hiperparametrleri elle seçilmiştir: 0,01 eşik değeri ilə 8., 16. və 24. dönem kontrolleri üçün kapsamlı duyarlılık analizi raporlanmamıştır.

Katman yerleşimi otomatik deyil: En iyi 6, 7, 9 və 11 düzeni manuel ablasyon taramasıyla bulunmuştur.

Budama sonrasında örnek düzeyinde esneklik azalır: Uzmanlar fiziksel olaraq kapatıldığında fərqli bir görüntünün ihtiyaç duyabileceği dal tekrar etkinleşemez.

Dördüncü ekspertla əlaqəli açıklık sorunu: Modalite ekspertının ağırlığı sabit 1 olaraq verilirken budama formülü dört ekspertı kapsamakta, evrim tablosu ise yalnız üç ekspertı göstərir.

Mimari şekil tutarsızlığı: Ölçek ekspertı diyagramında üç dal R=1 görünürken denklemlerde 1, 2 və 3 genişleme oranları tanımlanmıştır.

Kutu istemi protokolü ayrıntılı deyil: Kutu istemlerinin gerçek maskelerden necə üretildiği, ne kadar rastgelelik içerdiği və test sırasında ne kadar doğru olması gerektiği açık biçimde raporlanmamaktadır.

İki boyutlu kesit yaklaşımı: Veri kümesi görüntü kesitlerinden oluşmaktadır. Üç boyutlu hacim sürekliliği və komşu kesit bilgisi doğrudan kullanılmamaktadır.

Klinik sonuç ölçülmemiştir: Daha yüksək Dice skoru otomatik olaraq daha doğru tanı, daha güvenli cerrahi və ya daha iyi xəstə sonucu anlamına gelmez.

Tədqiqat nə deyir, nə demir?

Tədqiqatnın desteklediği ifadeTədqiqatnın desteklemediği ifade
Heterogen ekspertlər bu deney məlumat dəstinde seqmentasiya sonuçlarını iyileştirmiştir.Hetero-MedSAM bütün xəstənelerde və bütün tibbi görüntülerde en iyi modeldir.
Derin qat yerleşimi sığ qat yerleşiminden daha başarılı olmuştur.Uzmanların her olası mimaride yalnız derin qatlarda bulunması gerekir.
Təkamül xarakterli budama parametr sayısını azaltırken performansı artırmıştır.Budama her məlumat dəstinde doğruluğu mutlaka artırır.
Model 4,40 milyon eğitilebilir parametryle uyarlanmıştır.Dağıtılan bütün model yalnız 4,40 milyon parametrden oluşmaktadır.
CPU testinde 4,42 FPS elde edilmiştir.Her taşınabilir və ya aşağı güçlü cihazda gerçek zamanlı çalışacağı kanıtlanmıştır.
DSC 0,8644 və HD95 5,37 elde edilmiştir.Model klinik tanı və müalicə kararlarında güvenli biçimde kullanılabilir.
Uzman yönlendirmesi modalitelere görə fərqli örüntüler göstermiştir.Uzman ağırlıkları doğrudan biyolojik və ya klinik açıklama sağlamaktadır.
Kamuya açık çox modaliteli verilerde olumlu sonuç alınmıştır.Çapraz xəstəne və çapraz cihaz genellemesi kesin olaraq kanıtlanmıştır.

Keçmiş, bu gün və gələcək baxımından əhəmiyyəti

Geçmiş açısından: Tibbi görüntü seqmentasiyaunda hafifletme tədqiqatları çoğunlukla böyük görüntü kodlayıcısını kiçik bir omurğayla değiştirmeye və ya bütün görevlere eyni adaptör quruluşunı uygulamaya odaklanmıştır. Hetero-MedSAM, hafif adaptörlerin de kendi içinde fərqli işlevlere ekspertlaşabileceğini göstermeye tədqiqatktadır.

Bugün açısından: Tədqiqat, böyük bir əsas modelin bütün ağırlıklarını yeniden eğitmeden fərqli modalitelere uyarlanabileceğini və doğru ekspert yerleşimiyle doğruluk-hız dengesinin iyileştirilebileceğini göstərir.

Gelecek açısından: Bu yaklaşım bu araşdırma yönlerini destekleyebilir:

  • Uzmanların yerleşimini otomatik belirleyen sinir mimarisi araması,
  • Görüntü başına değişebilen daha hafif dinamik yönlendirme,
  • Üç boyutlu tibbi hacimlere uyarlama,
  • Hasta və xəstəne düzeyinde bağımsız dış doğrulama,
  • Farklı üreticilere ait cihazlar arasında genelleme testi,
  • Gerçek gömülü donanım və taşınabilir cihazlarda enerji ölçümü,
  • Segmentasyon belirsizliğinin raporlanması,
  • Hekim düzeltmesiyle etkileşimli seqmentasiya,
  • Düşük kontrastlı və çox kiçik lezyonlarda özel ekspert tasarımları,
  • Uzman kararlarının açıklanabilirliğinin geliştirilmesi.

Gündəlik həyat və səhiyyə xidmətləri baxımından mənası

Bir tibbi görüntü modelinin taşınabilir cihazlarda çalışabilmesi, teorik olaraq görüntülerin yalnız böyük veri merkezlerinde değil; ameliyathane terminallerinde, taşınabilir ultrasəs cihazlarında, aşağı donanımlı xəstəne bilgisayarlarında və ya uzak sağlık merkezlerinde de işlenebilmesine yardımcı olabilir.

Daha hızlı seqmentasiya:

  • Radyoloğun ölçüm işini hızlandırabilir.
  • Lezyon hacminin otomatik hesaplanmasına yardımcı olabilir.
  • Radyoterapi konturlarının ilk taslağını üretebilir.
  • Cerrahi planlamada anatomik yapıların görselleştirilmesini kolaylaştırabilir.

Ancak bu olasılıklar tədqiqatda klinik olaraq gösterilmemiştir. Modelin gerçek xəstə bakımında kullanılması üçün veri güvenliği, hata analizi, fərqli cihazlarda doğrulama, klinisyen denetimi, düzenleyici değerlendirme və prospektif klinik tədqiqatlar gereklidir.

Tədqiqatın Metodu və Nəticələri

Texniki tədqiqat dizaynı

Tədqiqat türüHesaplamalı model geliştirme və çox modaliteli seqmentasiya karşılaştırması
Temel modelMedSAM
Uyarlama yaklaşımıParametre-verimli ince ayar və heterogen ekspertlər karışımı
Ana modülHeterogeneous Contextual Mixture of Experts, HeCon-MoAE
Uzman sayısıDört işlevsel ekspert türü
Son yerleşimTransformer qatları 6, 7, 9 və 11
Veri kümesiHeteroMedSeg
Görüntü sayısıYaklaşık 20.000 iki boyutlu kesit
Modalite sayısıSekiz
Görüntü boyutu256 × 256 piksel
DeğerlendirmeDSC, HD95, parametr, FLOP və FPS

Modelin əsas matematiksel akışı

Bağlam birleştirme:

\[ C_{\mathrm{all}}=\mathrm{Concat}(E_m,E_a,E_t,\bar{X}) \]

İlk üç ekspert üçün yönlendirme:

\[ [w_1,w_2,w_3]^T=\mathrm{Softmax}(W_g\sigma(W_{in}C_{\mathrm{all}})) \]

Ağırlık koşulu:

\[ \sum_{i=1}^{3}w_i=1,\qquad w_4=1 \]

Uzman və omurğa birleşimi:

\[ Y=\mathrm{MLP}(X)+s\left(\sum_{i=1}^{3}w_iE_i(X)+w_4E_4(X)\right) \]

Hareketli katkı skoru:

\[ S_{\mathrm{avg}}^{(t)}=(1-\lambda)S_{\mathrm{avg}}^{(t-1)}+\lambda\mathrm{Mean}(w^{(t)}),\quad\lambda=0{,}1 \]

Budama eşiği:

\[ \tau=0{,}01 \]

Birleşik kayıp:

\[ \mathcal{L}_{\mathrm{mask}}=\mathcal{L}_{\mathrm{BCE}}+\mathcal{L}_{\mathrm{Dice}} \]

Son modelin bildirilen sonuçları

ÖlçütHetero-MedSAM sonucuAnlamı
DSC0,8644Tahmin və gerçek maske arasında yüksək bölgesel örtüşme
HD955,37Karşılaştırılan modeller içindeki en aşağı sınır sapması
Parametre4,40 milyonBildirilen eğitilebilir uyarlama parametr ölçeği
FLOP69,61 milyarBir ileri geçişin yaklaşık hesablama yükü
CPU hızı4,42 FPSIntel Xeon E5-2680 v4 üzerindeki bildirilmiş hız

Temel MedSAM’e görə fark

ÖlçütMedSAMHetero-MedSAMMutlak değişim
DSC0,80370,8644+0,0607
HD957,505,37-2,13
FLOP371,99 G69,61 G-302,38 G
FPS0,234,42+4,19 FPS

Uzman katkılarının aşamalı sonucu

AşamaDSCHD95
Ölçek ekspertı0,83126,72
+ Kenar ekspertı0,83386,01
+ Bağlam ekspertı0,84525,86
+ Modalite ekspertı0,85515,49
+ Təkamül xarakterli budama0,86445,37

Şəkillerin birlikte anlattığı süreç

  • Şəkil 1: MedSAM omurğasına HeCon-MoAE modüllerinin necə bağlandığını gösterir.
  • Şəkil 2: İnsan vücudundan klinik seqmentasiya görevine uzanan anatomik bilgi ağacını gösterir.
  • Şəkil 3: Yönlendirme ağı ilə dört ekspert dalının iç mimarisini ayrıntılandırır.
  • Şəkil 4: Sekiz modalite arasındaki örnek dağılımının eşit olmadığını gösterir.
  • Şəkil 5: Modellerin BT, MRG, göz dibi, rentgen, dermoskopiya və diğer gruplardaki sonuçlarını karşılaştırır.
  • Şəkil 6: Küçük lezyon, bulanık sınır, düzensiz topoloji və kopuk hedef bölgelerdeki nitel seqmentasiya farklarını gösterir.

Texniki nəticə

Tədqiqatnın deneyleri, MedSAM’in bütün omurğasını yeniden eğitmeden işlevsel olaraq fərqli ekspert yollarıyla uyarlanabileceğini göstərir. En yüksək sonuç, ekspertlərın ağın bütün qatlarına değil, yüksək düzeyli semantik özelliklerin oluştuğu seçili derin bloklara yerleştirilmesiyle elde edilmiştir.

Təkamül xarakterli budama, yalnız aşağı katkılı dalları kaldırarak parametr sayısını azaltmamış; eyni zamanda ekspertlər arasındaki olası özellik çatışmasını azaltarak DSC və HD95 sonuçlarını iyileştirmiştir.

Bununla birlikte sonuçlar, Hetero-MedSAM’in klinik kullanıma hazır olduğunu və ya bütün tibbi görüntü seqmentasiya görevlerinde üstün olduğunu göstərmir. Nəticələr, belirli bir derlenmiş məlumat dəsti və tədqiqatçıların bildirdiği deney düzeni üçün geçerlidir.

Mənbə və Metod Qeydi

Bu məzmun, Lieqiang Liu və Chengping Zhao tarafından hazırlanan “Hetero-MedSAM: A Lightweight Medical Image Segmentation Framework Based on Heterogeneous Mixture of Experts and Evolutionary Pruning” başlıqlı tədqiqata əsaslanır.

Mənbə, SSRN üzərində bulunan və Elsevier’e gönderilmek üzere hazırlanmış bir preprint araşdırma makalesidir. Metinde açıkça “This preprint research paper has not been peer reviewed” ifadesi yer almaktadır. Dolayısıyla tədqiqat bağımsız bilimsel elmi rəy prosesindən keçməmişdir. Metinde dergi kabulü və ya makaleye ait DOI bilgisi bulunmamaktadır.

Araşdırma bir klinik tədqiqat, xəstə müdahale deneyi və ya tibbi cihaz təhlükəsizlik tədqiqatsı deyil. Kamuya açık tibbi görüntü veri kaynaklarında gerçekleştirilen hesablamalı model geliştirme və karşılaştırmalı seqmentasiya tədqiqatsıdır.

Tədqiqatda kullanılan tibbi görüntülerin kamuya açık və yerleşik veri kaynaklarından alındığı, bu nedenle ayrıca etik kurul onayı gerekmediği belirtilmektedir. Yazarlar çıkar çatışması bildirmemiştir.

Verilerin bir Google Drive klasöründe, kodun ise tədqiqatda belirtilen GitHub deposunda kamuya açık olduğu ifade edilmektedir. Bununla birlikte sonuçların tam olaraq yeniden üretilebilmesi; veri bölme yöntemi, istem üretimi, rastgele tohumlar, GPU modeli və bazı mimari ayrıntıların daha açık raporlanmasını gerektirebilir.

Bildirilen 4,40 milyon parametr modelin eğitilebilir uyarlama ölçeğini ifade etmektedir. Dondurulmuş MedSAM omurğası inferensiya sırasında hâlâ kullanılmaktadır. Bu nedenle tədqiqat, bütün modelin yalnız 4,40 milyon parametryle depolandığını və ya her aşağı güçlü cihazda çalışacağını göstərmir.

CPU hız testi Intel Xeon E5-2680 v4 üzərində yapılmıştır. Taşınabilir ultrasəs, gömülü işlemci, telefon, aşağı güçlü klinik terminal və ya gerçek tibbi uç cihaz üzərində performans ölçümü raporlanmamıştır.

Modelin yüksək Dice və aşağı HD95 sonuçları seqmentasiya performansını göstərir; tanı doğruluğu, müalicə başarısı, cerrahi təhlükəsizlik və ya xəstə sonuçlarında iyileşme kanıtı deyil.

Bu makale yalnız yüklenen preprintteki mimari tanımlar, formüller, veri hazırlama süreci, tablolar, grafikler, ablasyonlar, karşılaştırmalı sonuçlar, sınırlılıklar və yazar yorumları əsas alınarak hazırlanmıştır. PDF’de bulunmayan klinik başarı, düzenleyici onay, gerçek zamanlı cihaz performansı və ya xəstə yararı iddiaları eklenmemiştir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy