Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Sog‘liqni saqlash fanlari / Tibbiy tadqiqotlar / Hetero-MedSAM: Tibbiy tasvir segmentatsiyasini geterogen ekspertlar va evolyutsion kesish bilan yengillashtiruvchi sun’iy intellekt tizimi
Tibbiy tadqiqotlar

Hetero-MedSAM: Tibbiy tasvir segmentatsiyasini geterogen ekspertlar va evolyutsion kesish bilan yengillashtiruvchi sun’iy intellekt tizimi

Tibbiy tasvir segmentatsiyasi kompyuter tomografiyasi, magnit-rezonans, rentgen, ultratovush, endoskopiya, dermoskopiya va koʻz tubi tasvirlarida organlar, oʻsmalar, qon tomirlari yoki boshqa anatomik tuzilmalarning chegaralarini piksel darajasida aniqlashdir.

20/07/2026  Veri Anla 21 marta ko‘rildi
Hetero-MedSAM: Tibbiy tasvir segmentatsiyasini geterogen ekspertlar va evolyutsion kesish bilan yengillashtiruvchi sun’iy intellekt tizimi

Tibbiy tasvir segmentatsiyasi; kompyuter tomografiyasi, magnit-rezonans, rentgen, ultratovush, endoskopiya, dermoskopiya va koʻz tubi tasvirlarida organlar, oʻsmalar, qon tomirlari yoki boshqa anatomik tuzilmalarning chegaralarini piksel darajasida aniqlashdir. Bu jarayon radioterapiyani rejalashtirish, kasallik rivojlanishini kuzatish, jarrohlik tayyorgarligi va miqdoriy tasvir tahlili kabi sohalarda muhim ma’lumotlar berishi mumkin.

MedSAM kabi tibbiy tasvirlarning asosiy modellari juda turli segmentatsiya vazifalarida foydalanish mumkin boʻlgan umumiy vizual tasvirlash qobiliyatiga ega. Biroq bu modellarning katta tasvir kodlagichlari yuqori hisoblash, xotira va energiya talabini yuzaga keltiradi. Bu holat modellarni koʻchma qurilmalarda, kam quvvatli klinik terminallarda yoki cheklangan apparat vositalariga ega sogʻliqni saqlash muassasalarida qoʻllashni qiyinlashtiradi.

Ushbu preprint tadqiqotida tadqiqotchilar MedSAMning oldindan oʻqitilgan tayanch qismini saqlagan holda, faqat vazifaga moslashuvchi kichik yon modullar oʻqitiladigan Hetero-MedSAM nomli tizimni taklif qiladilar. Model markazida bir-biriga aynan oʻxshamaydigan va turli funksiyalarga ixtisoslashgan toʻrtta modul mavjud:

  • Turli kattalikdagi anatomik nishonlarni ushlashga qaratilgan Masshtabdan Xabardor Ekspert,
  • Uzun, ingichka va notekis chegaralarni kuzatishga qaratilgan Anizotrop Chegara Eksperti,
  • Mahalliy tafsilotlarni tasvirning umumiy konteksti bilan birlashtiradigan Kontekst Modulyatsiyasi Eksperti,
  • KT, MRT, rentgen va boshqa tasvirlash usullari oʻrtasidagi fizik signal farqlarini qoplashga qaratilgan Moslashuvchan Modalitet Eksperti.

Model tasvir modaliteti, anatomik nishon, klinik vazifa va tasvir mazmunini birgalikda baholab, dastlabki uch ekspert uchun dinamik ogʻirliklar hosil qiladi. Oʻqitish davomida ekspertlarning hissasi harakatlanuvchi oʻrtacha yordamida kuzatiladi; uzoq vaqt davomida past hissa qoʻshgan tarmoqlar jismonan oʻchirib qoʻyiladi. Tadqiqotchilar bu jarayonni “evolyutsion kesish” deb ataydilar.

Taxminan 20.000 ta tibbiy tasvir kesimi va sakkizta tasvirlash modalitetidan tuzilgan HeteroMedSeg ma’lumotlar toʻplamida modelning bildirilgan umumiy Dice Oʻxshashlik Koeffitsiyenti 0,8644, HD95 qiymati 5,37 va inferensiya tezligi 4,42 kadr/soniyani tashkil etadi. Bildirilgan oʻqitiladigan parametrlar koʻlami 4,40 milliondir.

Taqqoslashda asosiy MedSAM modeli 0,8037 Dice balli, 7,50 HD95 va 0,23 kadr/soniya tezlikka erishgan. Hetero-MedSAM ushbu tajriba sharoitida yuqoriroq hududiy ustma-ust tushish, pastroq chegara xatosi va yuqoriroq ishlov tezligini koʻrsatgan. Biroq mahalliy ravishda toʻrtta qatlamga joylashtirilgan MedSegX modeli 4,69 kadr/soniya bilan Hetero-MedSAMdan biroz tezroq; Hetero-MedSAMning ustunligi asosan segmentatsiya aniqligi va chegara mosligida kuzatiladi.

Tadqiqotning muhim natijalaridan biri — ekspert modullarini tarmoqning har bir qatlamiga joylashtirish foydali emasligidir. Barcha qatlamlarga geterogen ekspert qoʻshilgan dastlabki model atigi 0,8428 Dice balliga erishgan. Eng yaxshi natija ekspertlar MedSAM tasvir kodlagichining chuqur qatlamlaridagi 6, 7, 9 va 11-raqamli bloklarga joylashtirilganda olingan.

Natijalar turli tasvirlash muammolarida turli ekspertlar ustun kelishini koʻrsatadi. Dermoskopiyada notekis chegaralar sababli chegara eksperti, MRTda bir-biridan uzilgan nishon hududlari sababli kontekst eksperti, KTda esa turli kattalikdagi nishonlar sababli masshtab eksperti koʻproq saqlanib qolgan.

Shu bilan birga, tadqiqot real klinik qoʻllash dalilini taqdim etmaydi. Tajribalar ochiq ma’lumot manbalaridan jamlangan tasvirlar ustida oʻtkazilgan. Prospektiv bemor tadqiqoti, haqiqiy shifoxona ish jarayoni, koʻchma tibbiy qurilma testi yoki klinitsistlar faoliyati bilan taqqoslash mavjud emas. Bundan tashqari, 4,40 million qiymati modelning oʻqitiladigan moslashtirish parametrlarini anglatadi; muzlatilgan MedSAM tayanch qismini xotirada saqlash va inferensiya vaqtida ishlatish zarurati yoʻqolmaydi.

Tibbiy tasvir segmentatsiyasi nima?

Tibbiy tasvirni tasniflash tizimi butun tasvir uchun “oʻsma bor” yoki “oʻsma yoʻq” kabi bitta qaror chiqarishi mumkin. Segmentatsiya tizimi esa bundan tashqariga chiqib, nishon tuzilma qaysi piksellarda joylashganini aniqlashga harakat qiladi.

Masalan, jigar KT tasvirida segmentatsiya modeli:

  • Jigarning tashqi chegarasini,
  • Jigar ichidagi lezyonni,
  • Lezyon atrofidagi toʻqimani,
  • Zarur boʻlsa, qon tomiri yoki oʻt yoʻli tuzilmalarini

alohida niqoblar koʻrinishida koʻrsatishi mumkin.

Shu sababli segmentatsiya faqat “obyektning mavjudligini” emas, balki obyektning joylashuvi, maydoni, hajmi, shakli va chegaralarini ham aniqlashga intiladi.

Tibbiy tasvirlarda bu vazifa qiyin, chunki:

  • Bir xil organ turli bemorlarda turli kattalik va shaklga ega boʻlishi mumkin.
  • Oʻsma chegarasi atrofdagi toʻqimadan keskin ajralmasligi mumkin.
  • Ingichka qon tomirlari va nervlar uzun, egri-bugri va atigi bir necha piksel kengligida boʻlishi mumkin.
  • KT, MRT, ultratovush va rentgen tasvirlari bir-biridan farqli fizik signal mexanizmlari orqali hosil boʻladi.
  • Bir xil modalitetda turli qurilmalar va tasvirga olish protokollari turli tasvir taqsimotlarini yuzaga keltirishi mumkin.
  • Ba’zi nishonlar tasvirning katta qismini egallasa, boshqalari juda kichik boʻlishi mumkin.

Nega MedSAM bevosita yengil model emas?

MedSAM umumiy maqsadli Segment Anything Model arxitekturasining tibbiy tasvirlarga moslashtirilgan shaklidir. Model katta tasvir kodlagichidan foydalanib tasvirni yuqori oʻlchamli xususiyat ifodalariga aylantiradi. Prompt kodlagichi foydalanuvchi bergan quti kabi yoʻnaltirishlarni qayta ishlaydi; niqob dekoderi esa nishon tuzilmaning segmentatsiya niqobini hosil qiladi.

Katta asosiy modellarning kuchli jihati juda turli tasvirlarda oʻrganilgan umumiy xususiyatlarni qayta ishlata olishidir. Biroq katta tasvir kodlagichining:

  • Yuqori parametrlar soni,
  • Yuqori FLOP talabi,
  • Xotira sarfi,
  • Kam quvvatli protsessorlarda kechikish keltirib chiqarishi

klinik chekka qurilmalarga joylashtirishni cheklashi mumkin.

Tadqiqotning taqqoslash jadvalida asosiy MedSAM uchun 93,74 million parametr, 371,99 GFLOP va Intel Xeon E5-2680 v4 protsessorida 0,23 kadr/soniya koʻrsatilgan.

Hetero-MedSAM mutlaqo yangi va kichik asosiy model yaratmaydi. U MedSAM tasvir kodlagichi va prompt kodlagichini muzlatib, ularning ichiga yoki yoniga oz sonli oʻqitiladigan ekspert yoʻllarini qoʻshadi.

Bu farq muhim:

  • Kam oʻqitiladigan parametr modelni moslashtirish paytida yangilanadigan ogʻirliklar soni kamligini anglatadi.
  • Kichik umumiy model esa butun tayanch arxitektura jismonan kichikligini anglatadi.

Hetero-MedSAM birinchi maqsadga kuchli e’tibor qaratadi. Biroq muzlatilgan MedSAM tayanch qismi inferensiya vaqtida baribir ishlagani sababli 4,40 millionlik koʻrsatkich butun modelning umumiy xotira izi atigi 4,40 million parametrgacha kamaydi, deb talqin qilinmasligi kerak.

Parametr-samarali nozik sozlash nima?

Parametr-samarali nozik sozlash oldindan oʻqitilgan katta modelning barcha ogʻirliklarini qayta oʻqitish oʻrniga asosiy tayanch qismini oʻzgarmas qoldirib, oz sonli qoʻshimcha parametrlarni yangilaydi.

Kundalik oʻxshatishda bu katta bir shifoxonani boshidan qayta qurish oʻrniga mavjud shifoxonaning ayrim boʻlimlariga kichik mutaxassis jamoalarini qoʻshishga oʻxshaydi. Asosiy infratuzilma saqlanadi; yangi vazifaga moslashuv mutaxassis jamoalari orqali ta’minlanadi.

Bu yondashuv:

  • Oʻqitish xotirasini kamaytirishi mumkin.
  • Vazifaga xos ogʻirlik faylini kichraytirishi mumkin.
  • Bir xil tayanch modelni turli vazifalarda qayta ishlatishni osonlashtirishi mumkin.
  • Toʻliq modelni nozik sozlashga nisbatan oʻqitish xarajatini kamaytirishi mumkin.

Biroq barcha vazifalarda bir xil tuzilishga ega bitta adapter ishlatilsa, turli tibbiy tasvirlarning ehtiyojlari yetarli darajada ifodalanmasligi mumkin. Hetero-MedSAMning boshlangʻich nuqtasi shu cheklovdir.

Nega “geterogen” ekspertlardan foydalaniladi?

Klassik ekspertlar aralashmasi arxitekturalarida bir-biriga oʻxshash bir nechta tarmoq shoxlari boʻlishi mumkin. Bu shoxlar bir xil asosiy tuzilmani saqlaydi, ammo turli namunalarda turli nisbatlarda faollashadi.

Hetero-MedSAMda esa ekspertlarning nafaqat ogʻirliklari, balki ichki arxitekturasi va vazifalari ham farq qiladi. Har bir ekspert muayyan tibbiy tasvir muammosiga yoʻnaltirilgan:

EkspertNishonga olingan muammoAsosiy amal
Masshtabdan Xabardor EkspertKichik lezyonlar bilan katta organlarni bir modelda qayta ishlashTurli kengayish koeffitsiyentlariga ega parallel chuqurlik boʻyicha konvolyutsiyalar
Anizotrop Chegara EkspertiUzun, ingichka, egri yoki assimetrik chegaralarGorizontal va vertikal tasma konvolyutsiyalari hamda bir tomonlama toʻldirish
Kontekst Modulyatsiyasi EkspertiMahalliy tafsilotlarni keng anatomik kontekst bilan birlashtirishGlobal oʻrtacha va maksimal pooling bilan kanal modulyatsiyasi
Moslashuvchan Modalitet EkspertiKT, MRT, rentgen va boshqa modalitetlar oʻrtasidagi signal farqlariModalitetga xos ekspert yoʻnaltirish va parametr kompensatsiyasi

Bu dizayn mantigʻini radiologning suyak rentgeni, miya MRTsi va dermoskopiya tasvirini bir xil vizual qoidalar bilan baholamasligiga qiyoslash mumkin. Tasvirlarning fizik hosil boʻlish usullari va klinik nishonlari farqli boʻlgani uchun model foydalanadigan yordamchi ifoda yoʻllari ham farqlashtiriladi.

Modelning umumiy arxitekturasi

1-rasmda modelning butun ishlov zanjiri koʻrsatiladi. Asosiy oqim quyidagicha:

  1. Tibbiy tasvir muzlatilgan MedSAM tasvir kodlagichiga kiradi.
  2. Tasvir xususiyatlari Transformer bloklarida qayta ishlanadi.
  3. Tanlangan chuqur bloklarga HeCon-MoAE ekspert moduli parallel yoʻl sifatida qoʻshiladi.
  4. Modalitet, organ, vazifa va tasvir konteksti yoʻnaltirish tarmogʻiga kiradi.
  5. Ekspertlarning hissa ogʻirliklari hisoblanadi.
  6. Ekspert chiqishlari MedSAMning asl oldinga yoʻnaltirilgan tarmoq chiqishi bilan birlashtiriladi.
  7. Quti prompti muzlatilgan prompt kodlagichi bilan qayta ishlanadi.
  8. Tasvir va prompt ifodalari niqob dekoderida birlashtiriladi.
  9. Nishon tuzilmaning segmentatsiya niqobi hosil qilinadi.

Bu arxitektura MedSAM oldindan oʻrgangan umumiy tibbiy tasvir bilimini saqlagan holda, muayyan vazifalar talab qiladigan qoʻshimcha xususiyatlarni kichik ekspert yoʻllari orqali toʻldirishni maqsad qiladi.

MedSegDBning anatomik bilim iyerarxiyasi

Tadqiqot ilgari ishlab chiqilgan MedSegDB nomli anatomik bilim va segmentatsiya ma’lumot tuzilmasidan tajribaviy ma’lumotnoma sifatida foydalanadi. MedSegDB 129 ta ochiq ma’lumot manbasidan kelgan tibbiy tasvirlarni iyerarxik anatomik daraxt ostida birlashtiradi.

2-rasmda koʻrsatilgan tuzilma bitta ildiz qatlam va toʻrtta anatomik darajadan iborat:

DarajaMazmunBildirilgan qamrov
Ildiz qatlamUmumiy inson tanasi ifodasiUmumiy boshlangʻich vektor
1-qatlamTana tizimiBosh-boʻyin, gavda, skelet, tomir va teridan iborat 5 kichik daraxt
2-qatlamAnatomik hududKoʻkrak, qorin va chanoq kabi 12 hudud
3-qatlamOrgan yoki toʻqima39 organ va toʻqima birligi
4-qatlamKlinik segmentatsiya vazifasi111 batafsil vazifa

Masalan, model uchun quyidagi semantik yoʻl tuzilishi mumkin:

\[ \mathrm{İnsan\ vücudu} \rightarrow \mathrm{Gövde} \rightarrow \mathrm{Karın} \rightarrow \mathrm{Karaciğer} \rightarrow \mathrm{Karaciğer\ tümörü} \]

Bu iyerarxiya modelga faqat tasvir piksellariga emas, balki tasvir qaysi modalitet, organ va klinik vazifaga tegishli ekaniga oid tuzilmaviy ma’lumotga ham kirish imkonini beradi.

Umumiy kontekst tavsiflagichi qanday yaratiladi?

Model toʻrtta ma’lumot manbasini birlashtiradi:

  • Tasvirlash modaliteti embeddingi: Em
  • Anatomik tuzilma embeddingi: Ea
  • Klinik vazifa embeddingi: Et
  • Global pooling qilingan tasvir xususiyati: X̄

Tadqiqotda berilgan umumiy kontekst tenglamasi quyidagicha:

\[ C_{\mathrm{all}} = \mathrm{Concat}(E_m,E_a,E_t,\bar{X}) \]

Bu yerda:

  • Call, ekspertlarni yoʻnaltirishda ishlatiladigan birlashtirilgan kontekst tavsiflagichidir.
  • Concat, xususiyat vektorlarini kanal oʻlchami boʻylab yonma-yon qoʻshishdir.
  • Em, tasvirning KT, MRT, rentgen yoki boshqa modalitetga tegishliligini kodlaydi.
  • Ea, anatomik joylashuv va organ ma’lumotini ifodalaydi.
  • Et, qaysi tuzilmaning segmentatsiyasi soʻralayotganini ifodalaydi.
  • X̄, tasvirning umumiy mazmun xulosasidir.

Kundalik ma’noda tizim faqat “tasvirda nimani koʻryapman?” degan savolni emas, balki “bu tasvir qaysi qurilmadan keldi, qaysi organni koʻrsatadi va mendan qaysi tuzilmani topish soʻralmoqda?” degan savollarni ham birgalikda baholaydi.

Ekspert ogʻirliklari qanday hisoblanadi?

Dastlabki uch morfologik ekspertning ogʻirliklari yoʻnaltirish tarmogʻi tomonidan hisoblanadi:

\[ [w_1,w_2,w_3]^T = \\mathrm{Softmax}(W_g \\cdot \\sigma(W_{in}\\cdot C_{\\mathrm{all}})) \]

Ushbu formulada:

  • w1, Masshtabdan Xabardor Ekspertning ogʻirligidir.
  • w2, Anizotrop Chegara Ekspertining ogʻirligidir.
  • w3, Kontekst Modulyatsiyasi Ekspertining ogʻirligidir.
  • Win va Wg, oʻqitish davomida oʻrganiladigan matritsalardir.
  • σ, sigmoid aktivatsiyasidir.
  • Softmax, uchta ogʻirlikni musbat qiymatlarga aylantirib, ularning yigʻindisini birga tenglashtiradi.

Ogʻirliklarning asosiy sharti quyidagicha:

\[ \sum_{i=1}^{3} w_i = 1 \]

Shu tariqa model uch morfologik ekspert oʻrtasida cheklangan e’tibor budjetini taqsimlaydi. Bir tasvirda notekis chegaralar ustun boʻlsa, chegara ekspertining ulushi oshishi mumkin; nishonlar oʻlchami juda oʻzgaruvchan boʻlsa, masshtab eksperti koʻproq ogʻirlik olishi mumkin.

Toʻrtinchi ekspert boʻlgan Moslashuvchan Modalitet Eksperti bu raqobatdan tashqarida saqlanadi. Tadqiqotda boshqaruv ogʻirligi:

\[ w_4 = 1 \]

sifatida belgilangan. Bundan maqsad modalitetga xos signal kompensatsiyasi dastlabki uch ekspert orasidagi ogʻirlik raqobatidan ta’sirlanmasdan doimiy ishlashidir.

Ekspert chiqishlari MedSAMga qanday qoʻshiladi?

Ekspertlar hosil qilgan xususiyatlar MedSAMning asl oldinga yoʻnaltirilgan tarmoq yoʻli bilan birlashtiriladi:

\[ Y = \mathrm{MLP}(X) + s \cdot \left(\sum_{i=1}^{3} w_iE_i(X)+w_4E_4(X)\right) \]

Bu yerda:

  • X, Transformer blokiga kiruvchi xususiyatdir.
  • MLP(X), MedSAMning asl oldinga yoʻnaltirilgan tarmoq chiqishidir.
  • E1-E3, uch morfologik ekspertning transformatsiyalaridir.
  • E4, modalitet ekspertidir.
  • wi, ekspert hissasi ogʻirliklaridir.
  • s, ekspert hissasining umumiy kattaligini boshqaruvchi sozlanadigan masshtab koeffitsiyentidir.
  • Y, asl va ekspert yoʻllarining birlashtirilgan chiqishidir.

Bu tuzilma asl MedSAM ifodasini oʻchirib yubormaydi, balki unga qoldiq tuzatish yoki qoʻshimcha ma’lumot qoʻshadi. Shu tariqa ekspert yoʻllari notoʻgʻri yoki yetarli darajada oʻrganmasa, oldindan oʻqitilgan tayanch modelning asosiy ifodasi saqlanishiga harakat qilinadi.

Masshtabdan Xabardor Ekspert qanday ishlaydi?

Tibbiy tasvirlarda nishon oʻlchamlari juda katta diapazonda oʻzgarishi mumkin. Bir tasvirda butun jigar segmentatsiya qilinsa, boshqa tasvirda bir necha millimetrlik lezyon qidirilishi mumkin.

Masshtabdan Xabardor Ekspert avval xususiyat kanallarini 1×1 konvolyutsiya bilan past oʻlchamli tor boʻgʻinga tushiradi. Soʻng turli kengayish koeffitsiyentlariga ega uchta parallel chuqurlik boʻyicha konvolyutsiyani qoʻllaydi:

\[ x_r = \mathrm{DConv}_r(\mathrm{Conv}^{down}_{1\times1}(X)), \quad r\in\{1,2,3\} \]

Bu yerda:

  • r, dilatatsiyalangan konvolyutsiyaning kengayish koeffitsiyentidir.
  • r=1, koʻproq mahalliy tafsilotlarni koʻradi.
  • r=2 va r=3, kengroq atrof kontekstini namunalaydi.
  • DConv, har bir kanal boʻylab pastroq xarajat bilan qoʻllanadigan chuqurlik boʻyicha konvolyutsiyadir.

Keyin uch masshtab birlashtiriladi:

\[ X_{\mathrm{scale}} = \mathrm{Conv}^{up}_{1\times1}\left(\mathrm{GELU}(\mathrm{Concat}(x_1,x_2,x_3))\right) \]

Bu amal mayda tafsilotlar bilan keng anatomik konturlarni bir ifoda ichida birlashtirishni maqsad qiladi.

3-rasmdagi ekspert diagrammasida uchala tarmoq ustida ham “R=1” yorligʻi koʻrinsa-da, usul matni va tenglama kengayish koeffitsiyentlarini 1, 2 va 3 deb belgilaydi. Bu preprintdagi vizual material bilan matematik izoh oʻrtasidagi hujjat nomuvofiqligidir. Aniq amalga oshirishni kod orqali tasdiqlash kerak.

Anizotrop Chegara Eksperti qanday ishlaydi?

“Anizotrop” atamasi tuzilmaning barcha yoʻnalishda bir xil koʻrinmasligini anglatadi. Jigar oʻsmasi nisbatan yumaloq boʻlishi mumkin, qon tomiri, nerv, ichak devori yoki teri lezyoni chegarasi esa uzun, ingichka va muayyan yoʻnalishda choʻzilgan shaklda boʻlishi mumkin.

Klassik kvadrat konvolyutsiya yadrosi uzun va ingichka tuzilmani koʻrayotganda atrofdagi keraksiz fonni ham hisobga olishi mumkin. Shuning uchun model gorizontal va vertikal tasma yadrolardan foydalanadi:

\[ y_h^{(i)} = \mathrm{Conv}_{1\times k}(\mathrm{Pad}^{(i)}_h(X)), \quad i\in\{0,1\} \]

\[ y_v^{(i)} = \mathrm{Conv}_{k\times1}(\mathrm{Pad}^{(i)}_v(X)), \quad i\in\{0,1\} \]

Ushbu formulalarda:

  • yh, gorizontal yoʻnalishdagi xususiyatlarni ifodalaydi.
  • yv, vertikal yoʻnalishdagi xususiyatlarni ifodalaydi.
  • Pad, yadroga chapga, oʻngga, yuqoriga yoki pastga koʻproq ogʻirlik berish imkonini yaratadigan bir tomonlama assimetrik toʻldirishdir.
  • Rasmda yadrolar 1×3 va 3×1 koʻrinishida berilgan.

Toʻrt yoʻnalishdagi chiqish birlashtiriladi:

\[ X_{\mathrm{edge}} = \mathrm{Conv}_{1\times1}\left(\mathrm{SiLU}(\mathrm{Concat}(y_h^{(0)},y_h^{(1)},y_v^{(0)},y_v^{(1)}))\right) \]

Bu ekspert ayniqsa notekis teri lezyoni chegaralari, ingichka qon tomir tuzilmalari va yoʻnalgan anatomik konturlar uchun moʻljallangan.

Kontekst Modulyatsiyasi Eksperti qanday ishlaydi?

Ba’zi segmentatsiya xatolari modelning kichik tafsilotga haddan tashqari e’tibor berib, tasvirning umumiy anatomik tartibini e’tibordan chetda qoldirishidan kelib chiqadi.

Kontekst eksperti ikkita global xulosadan foydalanadi:

  • Global oʻrtacha pooling: Tasvirdagi umumiy xususiyat taqsimotini jamlaydi.
  • Global maksimal pooling: Eng yaqqol signallarni ajratib koʻrsatadi.

Kanal ogʻirliklari quyidagi munosabat bilan hosil qilinadi:

\[ W = \sigma(\mathrm{FC}(\mathrm{Concat}(\mathrm{GAP}(Z),\mathrm{GMP}(Z)))) \]

Bu yerda:

  • Z, past oʻlchamli tor boʻgʻin xususiyatidir.
  • GAP, global oʻrtacha poolingdir.
  • GMP, global maksimal poolingdir.
  • FC, toʻliq bogʻlangan transformatsiyadir.
  • W, qaysi xususiyat kanallari kuchaytirilishi yoki kamaytirilishini belgilovchi ogʻirlikdir.

Modulyatsiya qilingan xususiyat:

\[ U = \mathrm{BN}(\mathrm{DWConv}_{3\times3}(Z\odot W)) \]

\[ X_{\mathrm{context}} = \mathrm{Conv}_{1\times1}(U) \]

⊙ belgisi kanal darajasida elementma-element koʻpaytirishni, BN esa batch normalizatsiyani bildiradi.

Bu ekspert ayniqsa MRT tasvirlarida bir-biridan uzilgan kichik nishon hududlarini umumiy anatomik kontekst ichida aniqlashga yordam berishni maqsad qiladi.

Moslashuvchan Modalitet Eksperti nima qiladi?

KTda oʻlchanadigan Hounsfield birliklari bilan MRT signal intensivligi, rentgenning proyeksiya tuzilishi yoki endoskopiyaning rang va yoritish xususiyatlari bir xil emas.

Moslashuvchan Modalitet Eksperti tasvir modalitetiga qarab ajratilgan kichik ekspert yoʻllaridan mos keluvchisini yoʻnaltirish orqali tanlaydi. Tadqiqot arxitektura sxemasida CT, MRI, X-ray va boshqa modalitet ekspertlari alohida tarmoqlar sifatida koʻrsatilgan.

Bu tarmoqning maqsadi bir xil anatomik tuzilmaning turli tasvirlash tizimlarida yuzaga keltiradigan taqsimot siljishini kompensatsiya qilishdir.

Biroq usul matnida modalitet ekspertining ogʻirligi 1 deb belgilangan boʻlsa, keyingi kesish boʻlimida ekspertlarning umumiy soni toʻrt deb koʻrsatiladi va kesish niqobi barcha ekspertlarni qamrab olishi mumkin boʻlgan tarzda ta’riflanadi. Ekspert evolyutsiyasi jadvalida esa faqat dastlabki uch ekspert beriladi. Shu sababli toʻrtinchi ekspert kesish vaqtida aynan qanday boshqarilgani preprint matnida toʻliq ravshan emas.

Ekspert bankining hisoblash yuklamasi

Tadqiqotda barcha ekspertlar 768×16×16 kirish/chiqish xususiyati va 64 kanalli umumiy tor boʻgʻin ostida taqqoslangan.

ModulParametrHisoblash yuklamasi
Standart konvolyutsiya taqqoslanishi135,17 ming34,60 million FLOP
Chuqurlik boʻyicha konvolyutsiya taqqoslanishi98,88 ming25,31 million FLOP
Toʻrt guruhli konvolyutsiya107,52 ming27,53 million FLOP
Masshtabdan Xabardor Ekspert198,34 ming50,77 million FLOP
Anizotrop Chegara Eksperti124,48 ming51,18 million FLOP
Kontekst Modulyatsiyasi Eksperti100,54 ming25,38 million FLOP
Moslashuvchan Modalitet Eksperti98,30 ming25,17 million FLOP
Jami ekspert banki521,66 ming152,50 million FLOP

Bu jadval bitta ekspert bankining xarajatini koʻrsatadi. Yakuniy modelda ekspert banklari tanlangan bir nechta Transformer blokiga joylashtirilgani sababli model darajasidagi umumiy qiymatlar alohida hisobot qilingan.

Evolyutsion kesish mexanizmi

Toʻrtta ekspert tarmogʻini har bir tanlangan qatlamda doimiy ishlatish modelning yengillik maqsadini zaiflashtirishi mumkin. Shu sababli tadqiqotchilar oʻqitish davomida ekspert hissalarini kuzatadigan mexanizm ishlab chiqqan.

Har bir ekspertning harakatlanuvchi oʻrtacha hissa balli quyidagi formula bilan yangilanadi:

\[ S_{\mathrm{avg}}^{(t)}=(1-\lambda)S_{\mathrm{avg}}^{(t-1)}+\lambda\cdot\mathrm{Mean}(w^{(t)}) \]

Bu yerda:

  • Savg(t), t vaqtidagi silliqlangan hissa ballidir.
  • w(t), joriy mini-batchdagi ekspert ogʻirliklaridir.
  • Mean, namunalar boʻyicha oʻrtacha qiymatdir.
  • λ, harakatlanuvchi oʻrtachaning yangi ma’lumotga qanchalik tez moslashishini belgilaydi.

Tadqiqotda:

\[ \lambda = 0{,}1 \]

qiymati ishlatilgan.

Bitta tasvirda ekspert ogʻirligi tasodifiy ravishda ortib yoki kamayishi mumkin. Harakatlanuvchi oʻrtacha vaqtinchalik tebranishlardan koʻra uzoq muddatli hissaga e’tibor qaratishni maqsad qiladi.

Ekspert hissasi oldindan belgilangan chegaradan past qolsa, kesish niqobi qoʻllanadi. Tadqiqotda chegara:

\[ \tau = 0{,}01 \]

sifatida belgilangan.

Baholashlar oʻqitishning 8., 16. va 24. davrlarida amalga oshirilgan.

Kesishdan keyingi ogʻirlik hisobi quyidagicha:

\[ \hat{w}=\mathrm{Softmax}\left((W_g\cdot\sigma(W_{in}\cdot C_{\mathrm{all}}))\odot(1-m)-M\cdot m\right) \]

Bu yerda:

  • m, har bir ekspert uchun 0 yoki 1 qiymatini oladigan kesish niqobidir.
  • m=1, tegishli ekspert yoʻli yopilganini koʻrsatadi.
  • M, kesilgan ekspertning Softmaxdan oldingi ballini juda katta manfiy qiymatga suradigan katta sondir.
  • ŵ, kesishdan keyingi yangi ekspert ogʻirliklaridir.

Maqsad faqat ekspert chiqishini nolga koʻpaytirish emas, balki inferensiya paytida tegishli fizik tarmoqning ishlashini toʻxtatib, haqiqiy hisoblash tejamkorligini ta’minlashdir.

Yoʻqotish funksiyasi

Modelning segmentatsiya boʻyicha oʻqitilishi ikkilik kross-entropiya va Dice yoʻqotishining yigʻindisi bilan amalga oshiriladi:

\[ \mathcal{L}_{\mathrm{mask}}=\lambda_1\mathcal{L}_{\mathrm{BCE}}+\lambda_2\mathcal{L}_{\mathrm{Dice}} \]

Tadqiqotda ikkala koeffitsiyent ham 1 qilib belgilangan:

\[ \lambda_1=\lambda_2=1 \]

Ikkilik kross-entropiya yoʻqotishi:

\[ \mathcal{L}_{\mathrm{BCE}}=-\frac{1}{N}\sum_{i=1}^{N}\left(y_i\log p(y_i)+(1-y_i)\log(1-p(y_i))\right) \]

Bu yerda:

  • yi, i-pikselning haqiqiy yorligʻi boʻlib, 0 yoki 1 qiymatini oladi.
  • p(yi), modelning piksel uchun hosil qilgan ehtimolligidir.
  • N, tasvirdagi jami piksel sonidir.

Dice yoʻqotishi:

\[ \mathcal{L}_{\mathrm{Dice}}=1-\frac{2\sum_{i=1}^{N}p(y_i)y_i+\epsilon}{\sum_{i=1}^{N}p(y_i)+\sum_{i=1}^{N}y_i+\epsilon} \]

Ushbu formulada ε, maxrajning nol boʻlishini oldini oladigan kichik sonli doimiydir.

Kross-entropiya har bir piksel sinfini toʻgʻri taxmin qilishga, Dice yoʻqotishi esa taxmin qilingan hududning haqiqiy hudud bilan umumiy ustma-ust tushishiga e’tibor qaratadi.

Model bitta tasvir uchun bir nechta niqob nomzodini hosil qiladi. Oʻqitishda haqiqiy niqobga eng yaxshi mos keladigan nomzod tanlanadi:

\[ \mathcal{L}_{\mathrm{total}}=\min_{j\in\{1,\ldots,M\}}\{\mathcal{L}_{\mathrm{mask}}(P_j,Y)\} \]

Bu yerda:

  • M, niqob nomzodlari sonidir.
  • Pj, j-raqamli taxmindir.
  • Y, haqiqiy segmentatsiya niqobidir.

HeteroMedSeg ma’lumotlar toʻplami

Tadqiqotchilar ochiq tibbiy tasvir manbalaridan taxminan 20.000 ta ikki oʻlchovli tasvir kesimini jamlab, HeteroMedSeg nomli tajribaviy ma’lumotlar toʻplamini yaratgan.

Ma’lumotlar toʻplamida sakkizta modalitet mavjud:

  • Rentgen,
  • Dermoskopiya,
  • Kompyuter tomografiyasi,
  • Koʻz tubi tasvirlash,
  • Magnit-rezonans tasvirlash,
  • Ultratovush,
  • Endoskopiya,
  • Kolonoskopiya.

4-rasmda modalitetlar boʻyicha namunalar soni teng emasligi koʻrinadi. Bu taqsimot modelning koʻproq namunaga ega modalitetlardan koʻproq oʻrganish signali olishiga olib kelishi mumkin.

Tasvir nomlari “Modalitet-Vazifa Birligi” shaklida tuzilgan va modelga modalitet hamda anatomik kontekst kodlarini fayl nomidan ajratib olish imkonini bergan.

Ma’lumotlar:

  • 70 foiz oʻqitish,
  • 15 foiz validatsiya,
  • 15 foiz test

qilib ajratilgan.

Matnda boʻlinish bemor darajasida, tasvir kesimi darajasida yoki manba ma’lumotlar toʻplami darajasida amalga oshirilgani batafsil tushuntirilmagan. Bir bemorga tegishli qoʻshni kesimlar turli boʻlimlarga tushib qolsa, ma’lumot sizib chiqishi yuz berishi mumkin; shu sababli bu tafsilot model ishlash koʻrsatkichlarining ishonchliligi uchun muhimdir.

Oldindan ishlov berish

Barcha tasvirlar 256×256 pikselga qayta oʻlchamlangan.

KT tasvirlarida Hounsfield birliklari:

\[ -150 \leq \mathrm{HU} \leq 250 \]

oraligʻida kesilgan va keyin chiziqli ravishda normallashtirilgan.

Bu oyna yumshoq toʻqimaga yoʻnaltirilgan diapazonni ifodalaydi. Biroq suyak, oʻpka yoki juda past zichlikdagi toʻqimalarning ayrim signallari bu kesish jarayonida yoʻqolishi mumkin.

MRT va boshqa modalitetlarda piksel qiymatlari:

\[ 0 \leq x \leq 1 \]

oraligʻiga masshtablangan.

Oʻqitish davomida:

  • 0,9-1,1 oraligʻida tasodifiy masshtablash,
  • Tasodifiy aylantirish

qoʻllangan.

Oʻqitish sozlamalari

Dasturiy ta’minotPyTorch
Apparat vositasiNVIDIA GPU muhiti; GPU modeli koʻrsatilmagan
OptimallashtirishAdamW
Boshlangʻich oʻrganish tezligi1 × 10-4
Ogʻirlik kamayishi0,01
Oʻrganish tezligi dasturiKosinus annealing
Mini-batch hajmi24
Oʻqitish davomiyligi50 davr
Kesish nazoratlari8., 16. va 24. davrlar

GPU modeli, tasodifiy urugʻlar va tajriba takrorlari soni koʻrsatilmagani oʻqitish davomiyligi hamda natija oʻzgaruvchanligini mustaqil baholashni qiyinlashtiradi.

Baholash mezonlari

Dice Oʻxshashlik Koeffitsiyenti: Taxmin qilingan niqob bilan haqiqiy niqob qanchalik ustma-ust tushishini koʻrsatadi. Qiymat birga yaqinlashgan sari hududiy moslik ortadi.

HD95: Taxmin qilingan chegara bilan haqiqiy chegara orasidagi ikki yoʻnalishli masofalarning 95-foizlik qiymatini oʻlchaydi. Past qiymat yaxshiroq chegara mosligini bildiradi. Eng chekka 5 foizlik xatoni chiqarib tashlagani sababli u bitta shovqinli pikselga nisbatan klassik Hausdorff masofasidan barqarorroqdir.

Parametrlar soni: Modelning saqlash va oʻrganiladigan sigʻimi koʻlamini koʻrsatadi. Hetero-MedSAM uchun bildirilgan qiymat oʻqitiladigan moslashtirish parametrlariga qaratilgan.

FLOP: Bitta oldinga oʻtishdagi taxminiy suzuvchi nuqtali amallar sonini koʻrsatadi.

FPS: Bir soniyada qayta ishlanadigan tasvirlar sonidir. Tadqiqotda Intel Xeon E5-2680 v4 CPUda oʻlchangan.

Nega barcha qatlamlarga ekspert qoʻshilmadi?

MedSAM tasvir kodlagichi 12 ta Transformer blokidan iborat. Tadqiqotchilar avval barcha qatlamlarga ekspert joylashtirishni sinab koʻrgan.

Toʻliq qatlamli geterogen ekspert modeli:

\[ \mathrm{DSC}=0{,}8428 \]

natijani olgan.

Bu natija MedSegXning toʻliq qatlamli gomogen ekspert modelidagi 0,8567 balldan ham, Hetero-MedSAMning yakuniy tanlangan tuzilmasidan ham pastdir.

Tadqiqotchilar bu holatni quyidagicha izohlaydilar:

  • Sayoz qatlamlar asosiy chegara va tekstura xususiyatlarini ajratib oladi.
  • Turli tuzilishga ega koʻplab ekspertlar erta qatlamlarga qoʻshilsa, oldindan oʻrganilgan asosiy ifodalar buzilishi mumkin.
  • Geterogen yoʻllar turli kattalik va yoʻnalishdagi gradientlarni hosil qilib, vazifalararo ziddiyatni kuchaytirishi mumkin.
  • Chuqur qatlamlarda anatomik va semantik xususiyatlar barqarorroq boʻladi.
  • Ekspertlarning bu qatlamlarda vazifaga xos tuzatish kiritishi kamroq buzuvchi boʻlishi mumkin.

Bu natija koʻproq modul avtomatik ravishda yaxshiroq ishlashni anglatmasligini koʻrsatadi.

Qatlam soni va joylashuvi tajribalari

Tadqiqotda ekspertlar bir, ikki, uch, toʻrt va besh qatlamga joylashtirilgan koʻplab konfiguratsiyalar sinovdan oʻtkazilgan.

Sayoz qatlam yoki aralash qatlam konfiguratsiyalarining katta qismi 0,83 Dice chegarasidan oshmagan. Chuqur qatlam konfiguratsiyalari yaxshiroq natija bergan.

Ajralib turgan natijalar:

JoylashuvQatlamlarDSCBoshlangʻich → yakuniy parametr
Uch chuqur qatlam6, 9, 110,85344,20M → 4,05M
Toʻrt chuqur qatlam6, 7, 9, 110,86444,63M → 4,40M
Besh chuqur qatlam6, 7, 8, 9, 110,86005,05M → 4,69M

Toʻrt qatlamli konfiguratsiya besh qatlamli modeldan kamroq parametr bilan yuqoriroq natija bergan. Shu sababli yakuniy modelda ekspertlar uchun toʻrtta joylashtirish nuqtasi tanlangan.

Nega 6, 7, 9 va 11-qavatlar tanlandi?

Tadqiqotchilar chuqur qismda mumkin boʻlgan 15 xil toʻrt qatlamli kombinatsiyani taqqoslagan.

Eng yaxshi natija:

\[ [6,7,9,11] \rightarrow \mathrm{DSC}=0{,}8644 \]

sifatida hisobot qilingan.

Bu tuzilma uchta oynali attention bloki va bitta global attention blokini oʻz ichiga oladi. Mualliflar bu konfiguratsiyani “avval mahalliy, keyin global” hamkorlik sifatida talqin qiladilar:

  • 6., 7. va 9-qavatlardagi oynali attention mahalliy tuzilmalarni qayta ishlaydi.
  • Ekspertlar mahalliy masshtab va chegara xususiyatlarini toʻldiradi.
  • 11-qavatdagi global attention keng anatomik kontekstni birlashtiradi.
  • Yakuniy ekspert moduli mahalliy xususiyatlarning global darajada integratsiyalanishiga hissa qoʻshadi.

Taqqoslama ishlash koʻrsatkichlari

ModelDSC ↑HD95 ↓Parametr (M) ↓FLOP (G) ↓FPS ↑
MedSAM0,80377,5093,74371,990,23
SwinLite-MedSAM0,81127,8514,29101,052,25
LiteMedSAM0,81507,479,7974,951,68
Med-FastSAM0,82346,8526,4194,152,17
Rep-MedSAM0,82956,199,2850,852,92
MedSegX, 6-7-9-110,84555,724,5069,544,69
MedSegX, barcha bloklar0,85675,435,4169,953,87
Hetero-MedSAM0,86445,374,4069,614,42

Hetero-MedSAM tadqiqotdagi eng yuqori umumiy Dice ballini va eng past HD95 qiymatini olgan. FPS boʻyicha esa mahalliy MedSegX modeli biroz tezroq.

Bu jadval model har bir oʻlchov boʻyicha yakka holda eng yaxshi emasligini, balki aniqlik, chegara sifati, parametr koʻlami va tezlik oʻrtasida muvozanat taqdim etishini koʻrsatadi.

FLOP qiymati Rep-MedSAMdan yuqoriroq. Shuning uchun “yengil” atamasi har bir hisoblash mezonida eng past qiymatga ega boʻlishni anglatmaydi.

Modalitetlar boʻyicha ishlash

5-rasm MedSAM, toʻliq qatlamli MedSegX va Hetero-MedSAMni modalitet darajasida taqqoslaydi.

Tadqiqot talqiniga koʻra Hetero-MedSAM:

  • MRT,
  • Koʻz tubi,
  • Rentgen,
  • Dermoskopiya,
  • Boshqa modalitetlar

boʻyicha ijobiy natijalar koʻrsatgan.

KT modalitetida esa MedSegX natijasi Hetero-MedSAMdan juda oz miqdorda yuqoriroq. Bu holat bitta umumiy oʻrtacha koʻrsatkich barcha modalitetlarda ustunlikni anglatmasligini koʻrsatadi.

Ekspertlarning modalitetga koʻra evolyutsiyasi

5-jadval oʻqitish davom etgani sari ekspert ogʻirliklari qanday oʻzgarganini koʻrsatadi. Yakuniy davrda har bir tanlangan qatlamda dastlabki uch morfologik ekspertdan faqat bittasi saqlanib qolgan.

Modalitet6-qatlam7-qatlam9-qatlam11-qatlam
KTMasshtabKontekstMasshtabChegara
EndoskopiyaKontekstChegaraChegaraKontekst
DermoskopiyaChegaraChegaraChegaraMasshtab
MRTKontekstMasshtabKontekstKontekst

Bu naqshlar arxitekturaning dizayn maqsadiga mos keladi:

  • KTda nishon oʻlchamlari oʻzgaruvchan boʻlgani uchun masshtab eksperti koʻp saqlangan.
  • Endoskopiyada xira chegaralar va keng sahna konteksti sababli chegara hamda kontekst ekspertlari birgalikda ustun chiqqan.
  • Dermoskopiyada notekis lezyon konturlari tufayli chegara eksperti ustun holatga kelgan.
  • MRTda bir-biridan ajralgan hududlarni birgalikda tanish talab qilingani uchun kontekst eksperti koʻpchilik qatlamlarda saqlangan.

Sifatli segmentatsiya misollari

6-rasmda toʻrtta murakkab klinik koʻrinish taqqoslangan:

  • KTda kichik lezyon,
  • Endoskopiyada xira chegara,
  • Dermoskopiyada notekis topologiya,
  • MRTda bir-biridan ajralgan nishon hududlari.

Tadqiqotchilarga koʻra Hetero-MedSAM dermoskopiyada chegaralarning haddan tashqari silliqlanishini kamaytirgan; MRTda esa asosiy nishon hududidan tashqarida joylashgan kichik uzilgan hududlarni yaxshiroq aniqlagan.

Shu bilan birga, MRT misolida global kontekstga ajratilgan sigʻim asosiy katta hududdagi mahalliy moslikni biroz kamaytirishi mumkinligi ham qayd etiladi. Bu model global yaxlitlik bilan mahalliy piksel mosligi oʻrtasida muvozanat oʻrnatishini koʻrsatadi.

Ablatsiya tadqiqoti nimani koʻrsatdi?

Model komponentlari navbat bilan qoʻshilib, har bir ekspertning hissasi tekshirilgan.

TuzilmaDSC ↑HD95 ↓
Faqat Masshtabdan Xabardor Ekspert0,83126,72
Masshtab + Chegara0,83386,01
Masshtab + Chegara + Kontekst0,84525,86
Toʻrtta ekspertning barchasi0,85515,49
Toʻrtta ekspert + evolyutsion kesish0,86445,37

Har bir komponentning qoʻshilishi Dice ballini oshirgan va chegara xatosini kamaytirgan. Kesish faqat modelni kichraytirib qolmagan, balki ishlash koʻrsatkichini ham yaxshilagan.

Tadqiqotchilar buni past hissa qoʻshadigan tarmoqlar olib tashlanganda ekspertlar oʻrtasidagi xususiyatlar ziddiyati va ortiqcha moslashuv kamayishi mumkinligi bilan izohlaydilar.

Biroq ablatsiya faqat bitta qoʻshish ketma-ketligi boʻyicha bajarilgan. Masalan, faqat chegara eksperti yoki faqat kontekst eksperti kabi barcha mumkin boʻlgan kombinatsiyalar hisobot qilinmagan. Shu sababli har bir ekspertning mustaqil hissa miqdorini toʻliq ajratib boʻlmaydi.

Tadqiqotning kuchli jihatlari

  • MedSAM toʻliq qayta oʻqitilmay, muzlatilgan tayanch model ustida parametr-samarali moslashtirish amalga oshirilgan.
  • Ekspertlar bir xil tuzilmani takrorlash oʻrniga bir-birini toʻldiruvchi toʻrtta farqli funksiya sifatida loyihalangan.
  • Tasvir mazmuni modalitet, organ va klinik vazifa ma’lumoti bilan birgalikda yoʻnaltirishda ishlatilgan.
  • Qatlam joylashuvi koʻplab ablatsiya tajribalari bilan tekshirilgan.
  • Ekspert hissalari oʻqitish davomida kuzatilgan va past hissa qoʻshadigan yoʻllar jismonan kesilgan.
  • Hududiy ustma-ust tushishdan tashqari chegara sifati HD95 bilan baholangan.
  • Parametr, FLOP va CPU tezligi birgalikda hisobot qilingan.
  • Sakkiz xil tasvir modalitetidan foydalanilgan.
  • Komponentlarning bosqichma-bosqich hissasini koʻrsatadigan ablatsiya tadqiqoti taqdim etilgan.
  • Kod ochiq ekani bildirilgan.

Tadqiqotning cheklovlari

Hakamlik baholashi mavjud emas: Tadqiqot preprint boʻlib, hali mustaqil ilmiy hakamlar tomonidan baholanmagan.

Haqiqiy klinik validatsiya yoʻq: Model prospektiv shifoxona ma’lumotlarida, odatiy klinik ish jarayonida yoki shifokor nazoratida sinovdan oʻtkazilmagan.

“Yengil” parametrlar sonining talqini: Bildirilgan 4,40 million qiymat oʻqitiladigan moslashtirish parametrlariga qaratilgan. Muzlatilgan MedSAM tayanch qismi modeldan olib tashlanmagan.

Haqiqiy chekka qurilma testi yoʻq: FPS oʻlchovi Intel Xeon E5-2680 v4 server sinfidagi CPUda amalga oshirilgan. Telefon, koʻchma ultratovush, oʻrnatilgan GPU yoki kam quvvatli klinik terminalda oʻlchov yoʻq.

Umumiy xotira sarfi hisobot qilinmagan: RAM, GPU xotirasi, model fayli hajmi, energiya sarfi va kechikish taqsimoti berilmagan.

Ma’lumotlarni boʻlish tafsiloti cheklangan: Oʻqitish, validatsiya va test boʻlinishi bemor yoki manba ma’lumotlar toʻplami darajasida qilingan-qilinmagani tushuntirilmagan.

Ma’lumotlar nomutanosibligi: Sakkiz modalitetdagi namunalar soni teng emas. Umumiy oʻrtacha koʻrsatkich koʻproq namunali modalitetlardan koʻproq ta’sirlanishi mumkin.

Mustaqil tashqi test cheklangan: Tadqiqot turli shifoxonalardan olingan, model ishlab chiqilishida ishlatilmagan mutlaqo mustaqil koʻp markazli klinik test toʻplamini taqdim etmaydi.

Statistik noaniqlik hisobot qilinmagan: DSC va HD95 natijalari uchun standart ogʻish, ishonch oraligʻi yoki turli tasodifiy urugʻlar bilan takrorlangan tajriba taqsimotlari berilmagan.

GPU tafsiloti yoʻq: Ishlatilgan NVIDIA GPU modeli va oʻqitish apparati ochiqlanmagani sababli oʻqitish vaqtlarini toʻliq qayta taqqoslab boʻlmaydi.

Kesish giperparametrlari qoʻlda tanlangan: 0,01 chegara qiymati hamda 8., 16. va 24. davrlardagi nazoratlar uchun keng qamrovli sezgirlik tahlili hisobot qilinmagan.

Qatlam joylashuvi avtomatik emas: Eng yaxshi 6, 7, 9 va 11 konfiguratsiyasi qoʻlda ablatsiya skaneri orqali topilgan.

Kesishdan keyin namuna darajasidagi moslashuvchanlik kamayadi: Ekspertlar jismonan oʻchirilgach, boshqa tasvir talab qilishi mumkin boʻlgan tarmoq qayta faollasha olmaydi.

Toʻrtinchi ekspertga oid aniqlik muammosi: Modalitet ekspertining ogʻirligi doimiy 1 deb berilgan, kesish formulasi esa toʻrtta ekspertni qamrab oladi, evolyutsiya jadvali esa faqat uch ekspertni koʻrsatadi.

Arxitektura rasmi nomuvofiqligi: Masshtab eksperti diagrammasida uchala tarmoq R=1 deb koʻrsatilgan, tenglamalarda esa 1, 2 va 3 kengayish koeffitsiyentlari ta’riflangan.

Quti prompti protokoli batafsil emas: Quti promptlari haqiqiy niqoblardan qanday yaratilgani, qancha tasodifiylikni oʻz ichiga olgani va test paytida qanchalik aniq boʻlishi kerakligi ochiq tarzda hisobot qilinmagan.

Ikki oʻlchovli kesim yondashuvi: Ma’lumotlar toʻplami tasvir kesimlaridan iborat. Uch oʻlchovli hajm uzluksizligi va qoʻshni kesim ma’lumoti bevosita ishlatilmaydi.

Klinik natija oʻlchanmagan: Yuqoriroq Dice balli avtomatik ravishda aniqroq tashxis, xavfsizroq jarrohlik yoki yaxshiroq bemor natijasini anglatmaydi.

Tadqiqot nimani aytadi, nimani aytmaydi?

Tadqiqot qoʻllab-quvvatlaydigan bayonotTadqiqot qoʻllab-quvvatlamaydigan bayonot
Geterogen ekspertlar ushbu tajriba ma’lumotlar toʻplamida segmentatsiya natijalarini yaxshilagan.Hetero-MedSAM barcha shifoxonalarda va barcha tibbiy tasvirlarda eng yaxshi modeldir.
Chuqur qatlamlarga joylashtirish sayoz qatlamlarga joylashtirishdan muvaffaqiyatliroq boʻlgan.Har qanday mumkin boʻlgan arxitekturada ekspertlar faqat chuqur qatlamlarda boʻlishi kerak.
Evolyutsion kesish parametrlar sonini kamaytirgan holda ishlash koʻrsatkichini oshirgan.Kesish har bir ma’lumotlar toʻplamida aniqlikni albatta oshiradi.
Model 4,40 million oʻqitiladigan parametr bilan moslashtirilgan.Joylashtirilgan butun model faqat 4,40 million parametrdan iborat.
CPU testida 4,42 FPS olingan.Har qanday koʻchma yoki kam quvvatli qurilmada real vaqt rejimida ishlashi isbotlangan.
DSC 0,8644 va HD95 5,37 natijalari olingan.Model klinik tashxis va davolash qarorlarida xavfsiz ishlatilishi mumkin.
Ekspertlarni yoʻnaltirish modalitetlarga koʻra turli naqshlarni koʻrsatgan.Ekspert ogʻirliklari bevosita biologik yoki klinik izoh beradi.
Ochiq koʻp modalitetli ma’lumotlarda ijobiy natija olingan.Shifoxonalararo va qurilmalararo umumlashtirish aniq isbotlangan.

Oʻtmish, bugun va kelajak nuqtai nazaridan ahamiyati

Oʻtmish nuqtai nazaridan: Tibbiy tasvir segmentatsiyasini yengillashtirish boʻyicha ishlar asosan katta tasvir kodlagichini kichik tayanch model bilan almashtirishga yoki barcha vazifalarga bir xil adapter tuzilmasini qoʻllashga qaratilgan. Hetero-MedSAM yengil adapterlarning oʻzi ham turli funksiyalarga ixtisoslashishi mumkinligini koʻrsatishga urinadi.

Bugun nuqtai nazaridan: Tadqiqot katta asosiy modelning barcha ogʻirliklarini qayta oʻqitmasdan turib turli modalitetlarga moslashtirish mumkinligini va ekspertlarni toʻgʻri joylashtirish bilan aniqlik-tezlik muvozanatini yaxshilash mumkinligini koʻrsatadi.

Kelajak nuqtai nazaridan: Bu yondashuv quyidagi tadqiqot yoʻnalishlarini qoʻllab-quvvatlashi mumkin:

  • Ekspertlar joylashuvini avtomatik belgilovchi neyron arxitektura qidiruvi,
  • Har bir tasvirga qarab oʻzgaradigan yengilroq dinamik yoʻnaltirish,
  • Uch oʻlchovli tibbiy hajmlarga moslashtirish,
  • Bemor va shifoxona darajasida mustaqil tashqi validatsiya,
  • Turli ishlab chiqaruvchilarning qurilmalari orasida umumlashtirish testi,
  • Haqiqiy oʻrnatilgan apparat va koʻchma qurilmalarda energiya oʻlchovi,
  • Segmentatsiya noaniqligini hisobot qilish,
  • Shifokor tuzatishi bilan interaktiv segmentatsiya,
  • Past kontrastli va juda kichik lezyonlar uchun maxsus ekspert dizaynlari,
  • Ekspert qarorlarining tushuntiriluvchanligini yaxshilash.

Kundalik hayot va sogʻliqni saqlash nuqtai nazaridan ma’nosi

Tibbiy tasvir modelining koʻchma qurilmalarda ishlashi nazariy jihatdan tasvirlarni faqat yirik ma’lumot markazlarida emas, balki operatsion terminalida, koʻchma ultratovush qurilmalarida, past imkoniyatli shifoxona kompyuterlarida yoki uzoq sogʻliqni saqlash markazlarida ham qayta ishlashga yordam berishi mumkin.

Tezroq segmentatsiya:

  • Radiologning oʻlchash ishini tezlashtirishi mumkin.
  • Lezyon hajmini avtomatik hisoblashga yordam berishi mumkin.
  • Radioterapiya konturlarining dastlabki loyihasini yaratishi mumkin.
  • Jarrohlik rejalashtirishda anatomik tuzilmalarni vizuallashtirishni osonlashtirishi mumkin.

Biroq bu imkoniyatlar tadqiqotda klinik jihatdan koʻrsatilmagan. Modelni haqiqiy bemor parvarishida ishlatish uchun ma’lumot xavfsizligi, xato tahlili, turli qurilmalarda validatsiya, klinitsist nazorati, tartibga soluvchi baholash va prospektiv klinik tadqiqotlar talab etiladi.

Tadqiqot usuli va natijalari

Texnik tadqiqot dizayni

Tadqiqot turiHisoblash modeli ishlab chiqish va koʻp modalitetli segmentatsiya taqqoslanishi
Asosiy modelMedSAM
Moslashtirish yondashuviParametr-samarali nozik sozlash va geterogen ekspertlar aralashmasi
Asosiy modulHeterogeneous Contextual Mixture of Experts, HeCon-MoAE
Ekspertlar soniToʻrtta funksional ekspert turi
Yakuniy joylashuvTransformer qatlamlari 6, 7, 9 va 11
Ma’lumotlar toʻplamiHeteroMedSeg
Tasvirlar soniTaxminan 20.000 ikki oʻlchovli kesim
Modalitetlar soniSakkiz
Tasvir oʻlchami256 × 256 piksel
BaholashDSC, HD95, parametr, FLOP va FPS

Modelning asosiy matematik oqimi

Kontekstni birlashtirish:

\[ C_{\mathrm{all}}=\mathrm{Concat}(E_m,E_a,E_t,\bar{X}) \]

Dastlabki uch ekspert uchun yoʻnaltirish:

\[ [w_1,w_2,w_3]^T=\mathrm{Softmax}(W_g\sigma(W_{in}C_{\mathrm{all}})) \]

Ogʻirlik sharti:

\[ \sum_{i=1}^{3}w_i=1,\qquad w_4=1 \]

Ekspert va tayanch model birlashuvi:

\[ Y=\mathrm{MLP}(X)+s\left(\sum_{i=1}^{3}w_iE_i(X)+w_4E_4(X)\right) \]

Harakatlanuvchi hissa balli:

\[ S_{\mathrm{avg}}^{(t)}=(1-\lambda)S_{\mathrm{avg}}^{(t-1)}+\lambda\mathrm{Mean}(w^{(t)}),\quad\lambda=0{,}1 \]

Kesish chegarasi:

\[ \tau=0{,}01 \]

Birlashtirilgan yoʻqotish:

\[ \mathcal{L}_{\mathrm{mask}}=\mathcal{L}_{\mathrm{BCE}}+\mathcal{L}_{\mathrm{Dice}} \]

Yakuniy modelning bildirilgan natijalari

MezonHetero-MedSAM natijasiMa’nosi
DSC0,8644Taxmin va haqiqiy niqob oʻrtasida yuqori hududiy ustma-ust tushish
HD955,37Taqqoslangan modellar ichidagi eng past chegara ogʻishi
Parametr4,40 millionBildirilgan oʻqitiladigan moslashtirish parametrlar koʻlami
FLOP69,61 milliardBitta oldinga oʻtishning taxminiy hisoblash yuklamasi
CPU tezligi4,42 FPSIntel Xeon E5-2680 v4 dagi bildirilgan tezlik

Asosiy MedSAMga nisbatan farq

MezonMedSAMHetero-MedSAMMutlaq oʻzgarish
DSC0,80370,8644+0,0607
HD957,505,37-2,13
FLOP371,99 G69,61 G-302,38 G
FPS0,234,42+4,19 FPS

Ekspert hissalarining bosqichma-bosqich natijasi

BosqichDSCHD95
Masshtab eksperti0,83126,72
+ Chegara eksperti0,83386,01
+ Kontekst eksperti0,84525,86
+ Modalitet eksperti0,85515,49
+ Evolyutsion kesish0,86445,37

Rasmlar birgalikda koʻrsatadigan jarayon

  • 1-rasm: HeCon-MoAE modullari MedSAM tayanch qismiga qanday ulanayotganini koʻrsatadi.
  • 2-rasm: Inson tanasidan klinik segmentatsiya vazifasigacha choʻzilgan anatomik bilim daraxtini koʻrsatadi.
  • 3-rasm: Yoʻnaltirish tarmogʻi va toʻrtta ekspert tarmogʻining ichki arxitekturasini batafsil koʻrsatadi.
  • 4-rasm: Sakkiz modalitet orasidagi namunalar taqsimoti teng emasligini koʻrsatadi.
  • 5-rasm: Modellarning KT, MRT, koʻz tubi, rentgen, dermoskopiya va boshqa guruhlardagi natijalarini taqqoslaydi.
  • 6-rasm: Kichik lezyon, xira chegara, notekis topologiya va uzilgan nishon hududlaridagi sifatli segmentatsiya farqlarini koʻrsatadi.

Texnik xulosa

Tadqiqot tajribalari MedSAMning butun tayanch qismini qayta oʻqitmasdan, funksional jihatdan turlicha ekspert yoʻllari orqali moslashtirish mumkinligini koʻrsatadi. Eng yuqori natija ekspertlar tarmoqning barcha qatlamlariga emas, yuqori darajali semantik xususiyatlar shakllanadigan tanlangan chuqur bloklarga joylashtirilganda olingan.

Evolyutsion kesish faqat past hissa qoʻshadigan tarmoqlarni olib tashlab parametrlar sonini kamaytirmagan; shu bilan birga ekspertlar oʻrtasidagi ehtimoliy xususiyat ziddiyatini kamaytirib, DSC va HD95 natijalarini yaxshilagan.

Shu bilan birga natijalar Hetero-MedSAM klinik foydalanishga tayyorligini yoki barcha tibbiy tasvir segmentatsiyasi vazifalarida ustun ekanini koʻrsatmaydi. Topilmalar muayyan jamlangan ma’lumotlar toʻplami va tadqiqotchilar bildirgan tajriba sharoiti uchun amal qiladi.

Manba va usul haqida izoh

Ushbu mazmun Lieqiang Liu va Chengping Zhao tomonidan tayyorlangan “Hetero-MedSAM: A Lightweight Medical Image Segmentation Framework Based on Heterogeneous Mixture of Experts and Evolutionary Pruning” nomli tadqiqotga asoslangan.

Manba SSRNda joylashtirilgan va Elsevierga yuborish uchun tayyorlangan preprint tadqiqot maqolasidir. Matnda aniq “This preprint research paper has not been peer reviewed” iborasi mavjud. Demak, tadqiqot mustaqil ilmiy hakamlik baholashidan oʻtmagan. Matnda jurnalga qabul qilingani yoki maqolaga tegishli DOI ma’lumoti mavjud emas.

Tadqiqot klinik sinov, bemorga aralashuv tajribasi yoki tibbiy qurilma xavfsizligi tadqiqoti emas. Bu ochiq tibbiy tasvir ma’lumot manbalarida amalga oshirilgan hisoblash modeli ishlab chiqish va taqqoslama segmentatsiya tadqiqotidir.

Tadqiqotda ishlatilgan tibbiy tasvirlar ochiq va tan olingan ma’lumot manbalaridan olingani, shu sababli qoʻshimcha etika qoʻmitasi tasdigʻi talab etilmagani bildiriladi. Mualliflar manfaatlar toʻqnashuvini ma’lum qilmagan.

Ma’lumotlar Google Drive papkasida, kod esa tadqiqotda koʻrsatilgan GitHub repozitoriyasida ochiq ekani aytiladi. Shunga qaramay, natijalarni toʻliq qayta ishlab chiqish uchun ma’lumotlarni boʻlish usuli, prompt yaratish, tasodifiy urugʻlar, GPU modeli va ayrim arxitektura tafsilotlari yanada aniqroq hisobot qilinishi talab etilishi mumkin.

Bildirilgan 4,40 million parametr modelning oʻqitiladigan moslashtirish koʻlamini anglatadi. Muzlatilgan MedSAM tayanch qismi inferensiya paytida hamon ishlatiladi. Shu sababli tadqiqot butun model atigi 4,40 million parametr bilan saqlanishini yoki har qanday kam quvvatli qurilmada ishlashini koʻrsatmaydi.

CPU tezlik testi Intel Xeon E5-2680 v4da bajarilgan. Koʻchma ultratovush, oʻrnatilgan protsessor, telefon, kam quvvatli klinik terminal yoki haqiqiy tibbiy chekka qurilmada ishlash koʻrsatkichi oʻlchovi hisobot qilinmagan.

Modelning yuqori Dice va past HD95 natijalari segmentatsiya ishlash koʻrsatkichini koʻrsatadi; bu tashxis aniqligi, davolash muvaffaqiyati, jarrohlik xavfsizligi yoki bemor natijalarining yaxshilanishi dalili emas.

Ushbu maqola faqat yuklangan preprintdagi arxitektura ta’riflari, formulalar, ma’lumot tayyorlash jarayoni, jadvallar, grafiklar, ablatsiyalar, taqqoslama natijalar, cheklovlar va mualliflar talqinlariga asoslanib tayyorlangan. PDFda mavjud boʻlmagan klinik muvaffaqiyat, tartibga soluvchi tasdiq, real vaqt qurilma ishlashi yoki bemorga foyda haqidagi da’volar qoʻshilmagan.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati