Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Kompyuter fanlari / D2SNet: Kam Yorug‘likdagi Tasvirni Yaxshilashda Fazoviy va Chastota Sohalarini Birlashtiruvchi Ikki Sohali Sinergiya Tarmog‘i
Kompyuter fanlari

D2SNet: Kam Yorug‘likdagi Tasvirni Yaxshilashda Fazoviy va Chastota Sohalarini Birlashtiruvchi Ikki Sohali Sinergiya Tarmog‘i

Dual-Domain Synergy Network (D2SNet) kam yorug‘likdagi tasvirni yaxshilash muammosida tasvirning fazoviy tuzilishi va chastota komponentlarini ko‘p masshtabli U-Net ichida birgalikda qayta ishlaydigan chuqur o‘rganish arxitekturasidir.

17/09/2026  Veri Anla 112 marta ko‘rildi
D2SNet: Kam Yorug‘likdagi Tasvirni Yaxshilashda Fazoviy va Chastota Sohalarini Birlashtiruvchi Ikki Sohali Sinergiya Tarmog‘i

Dual-Domain Synergy Network (D2SNet) — kam yorug‘likdagi tasvirni yaxshilash muammosida tasvirning fazoviy tuzilishi va chastota komponentlarini ko‘p masshtabli U-Net ichida birgalikda qayta ishlaydigan chuqur o‘rganish arxitekturasidir. Modelning asosiy maqsadi faqat tasvirni yoritish emas; yoritish tuzatilayotgan paytda shovqinning keraksiz ravishda kuchayishini cheklash, ranglarni saqlash va nozik teksturalarni qayta tiklashdir. D2SNet buni Dinamik Chastota Tanlash Moduli (Dynamic Frequency Selection Module, DFSM), Ko‘p Masshtabli Xususiyat Ajratib Olish Moduli (Multi-Scale Feature Extraction Module, MSFEM) va Fazoviy-Chastotaviy To‘ldiruvchanlik Moduli (Spatial-Frequency Complementarity Module, SFCM) orqali amalga oshiradi.

DFSM qat’iy Fourier, kosinus yoki to‘lqincha bazalari bilan bevosita ajratish o‘rniga kirish xususiyatlaridan o‘rganiladigan past chastotani o‘tkazuvchi filtrlar guruhlarini hosil qiladi. Bu filtrlar past chastotali va yuqori chastotali xususiyatlarni ajratadi; kanal va fazoviy diqqat mexanizmlari keyin qaysi chastota komponentlari yaxshilash uchun foydaliroq ekaniga vazn beradi. MSFEM esa 3 × 3, 5 × 5 va 7 × 7 kengaytirilgan depth-wise separable konvolyutsiyalarni 1 × 1 lokal tarmoq bilan birlashtirib, ham keng kontekstni, ham lokal tafsilotni ushlashga harakat qiladi. SFCM ushbu ikki yondashuvni kichik SU-Net tuzilmasi orqali asosiy U-Netning yuqori aniqlikdagi darajasiga bog‘laydi.

Manba tadqiqotida D2SNet; LOLv1, LOLv2-Real, LOLv2-Synthetic, LOL-Blur, Sony-Total-Dark, beshta juftlashtirilmagan kam yorug‘lik ma’lumotlar to‘plami va ExDark obyekt aniqlash tajribalarini o‘z ichiga olgan keng benchmark to‘plamida baholangan. Masalan, LOLv1da 25.09 dB PSNR va 0.874 SSIM, LOLv2-Syntheticda 26.60 dB PSNR va 0.947 SSIM, LOL-Blurda 27.78 dB PSNR va 0.906 SSIM qayd etilgan. Model 5.62 million parametr va 256 × 256 kirish patchi uchun 36.82 G FLOPs bilan ishlaydi.

Bu natijalar D2SNet tadqiqotda qo‘llangan ma’lumotlar to‘plamlari va o‘qitish protokoli doirasida kuchli kam yorug‘likni tiklash modeli ekanini ko‘rsatadi. Biroq natijalar ekspert taqrizidan o‘tmagan preprintdan olingan va muayyan benchmark natijalari real dunyodagi barcha kamera, sensor, yoritish darajasi yoki buzilish turlari uchun universal ustunlikni anglatmaydi.

Tadqiqot muammosi: nega faqat yorqinlikni oshirish yetarli emas?

Kam yorug‘likda olingan tasvirda muammo faqat o‘rtacha piksel intensivligining pastligi emas. Sensor shovqini yaqqolroq bo‘lishi, ranglar buzilishi, lokal kontrast kamayishi, nozik teksturalar yo‘qolishi va uzoq ekspozitsiya ishlatilgan bo‘lsa harakat yoki kamera sababli xiralashish yuzaga kelishi mumkin. Shu sababli yaxshi kam yorug‘lik tasvirini yaxshilash tizimi bir tomondan global yoritishni tuzatarkan, boshqa tomondan tafsilotlarni saqlashi, shovqinni kuchaytirmasligi va tabiiy bo‘lmagan ortiqcha ekspozitsiyalangan hududlarni hosil qilmasligi kerak.

Manba tadqiqoti mavjud yondashuvlarni ikki asosiy jihatdan muhokama qiladi. CNN va Transformer asosidagi usullarning katta qismi asosan fazoviy sohada ishlaydi. Chastota sohasidan foydalanuvchi usullar esa ko‘pincha FFT, DCT yoki DWT kabi oldindan belgilangan transformatsiyalardan foydalanadi. Ushbu qat’iy transformatsiyalarning kam yorug‘lik buzilishining tasvirdan tasvirga o‘zgaruvchi tuzilishiga bevosita moslasha olmasligi D2SNetning boshlang‘ich nuqtasidir.

D2SNet Nima va Nega Ikki Xil Sohani Birgalikda Ishlatadi?

D2SNet kam yorug‘likdagi tasvirning fazoviy tuzilishi hamda past-yuqori chastota xususiyatlarini bir xil ko‘p masshtabli tiklash tarmog‘ida o‘zaro qo‘llaydigan U-Net asosidagi tasvirni yaxshilash modelidir. Fazoviy soha obyektlar, hududlar va lokal kontekst qayerda joylashganini ifodalasa, chastota ajratilishi sekinroq o‘zgaradigan yoritish komponentlari bilan chet, tekstura va shovqin kabi tezroq o‘zgaradigan komponentlarni turlicha qayta ishlash imkonini beradi.

Tarmoqning umumiy ma’lumot oqimi

Kirish \(3 \times H \times W\) o‘lchamdagi kam yorug‘lik RGB tasviridir. Dastlabki 3 × 3 konvolyutsiya tasvirni \(C \times H \times W\) o‘lchamdagi sayoz xususiyat tasviriga aylantiradi. So‘ng uch masshtabli asosiy U-Net kodlovchisi aniqlikni bosqichma-bosqich kamaytirar ekan, kanal sonini oshiradi. Dekoder teskari yo‘nalishda ishlaydi va kodlovchidan kelgan xususiyatlar bilan skip bog‘lanishlari orqali birlashadi.

Har bir aniqlik darajasining oxirgi ResBlock amaliyotidan keyin DFSM qo‘llanadi. MSFEM esa uzluksiz ravishda har bir darajaga joylashtirilmaydi; SU-Net va asosiy U-Net bottlenecklarida ishlatiladi. Manbaga ko‘ra, bu tanlov ko‘p sonli kengaytirilgan konvolyutsiyalar ketma-ket qo‘llanganda yuzaga kelishi mumkin bo‘lgan muntazam sampling bo‘shliqlari va fazoviy axborot yo‘qolishini kamaytirishga qaratilgan.

Yakuniy bosqichda 3 × 3 konvolyutsiya qo‘llanadi va tarmoq chiqishi original kam yorug‘likdagi tasvir bilan residual bog‘lanish orqali birlashtirilib, yakuniy yaxshilangan tasvir olinadi.

Uch asosiy modul

ModulTo‘liq nomiAsosiy vazifaIlmiy roli
DFSMDynamic Frequency Selection ModuleO‘rganiladigan filtrlar bilan chastotani ajratish va vaznlashTasvir mazmuniga ko‘ra foydali past/yuqori chastota komponentlarini tanlash
MSFEMMulti-Scale Feature Extraction ModuleBir nechta receptive field o‘lchamlaridan fazoviy xususiyatlarni ajratib olishChastota tanlashga globaldan lokalgacha cho‘zilgan semantik kontekst taqdim etish
SFCMSpatial-Frequency Complementarity ModuleSU-Net, MSFEM va DFSMni umumiy qayta ishlash oqimida birlashtirishYuqori aniqlik darajasida fazoviy-chastotaviy to‘ldiruvchanlikni yaratish

DFSM O‘rganiladigan Chastota Tanlovini Qanday Amalga Oshirar?

DFSM kirish xususiyatlarini kanal guruhlariga ajratadi, kirishning o‘zidan o‘rganiladigan past chastotani o‘tkazuvchi filtr yadrolarini hosil qiladi, past chastota komponentini filtrlash orqali chiqaradi va yuqori chastota komponentini kirish bilan past chastota komponenti orasidagi qoldiq sifatida hosil qiladi; so‘ng kanal va fazoviy diqqat vaznlari past va yuqori chastotalarning chiqishdagi hissasini dinamik tarzda belgilaydi.

FFE: chastota komponentlarini dinamik ajratish

Kirish xususiyat xaritasi \(X \in \mathbb{R}^{C \times H \times W}\), kanal o‘qida \(g\) guruhga bo‘linadi:

Tenglama (1)

\[ X=[X^{1},X^{2},\ldots,X^{g}] \]

Har bir guruhning kanal soni \(C_i=C/g\) sifatida belgilanadi. Filtr yaratish yo‘li global average pooling, 1 × 1 konvolyutsiya, batch normalization va Softmaxdan foydalanadi:

Tenglama (2)

\[ LPF=\operatorname{Softmax}\left(BN\left(Conv_{1\times1}(GAP(X))\right)\right) \]

Hosil qilingan past chastotani o‘tkazuvchi filtrlarning o‘lchami \(k^{2}\times g\). \(k\) filtr yadrosi o‘lchamini, \(g\) kanal guruhlari sonini bildiradi. Softmax amaliyoti \(k^{2}\) yadro elementi bo‘yicha normallashtirilgan vaznlar hosil qiladi.

Tenglama (3), manbada chop etilgan shaklda

\[ X^{i}_{low}= \sum_{p,q\in\mathcal{N}_{k}} \left( X^{i}(h+p,w+q)\cdot LPS^{i} \right) \]

Bu yerda \(h,w\) joriy fazoviy joylashuvni; \(\mathcal{N}_{k}\) esa \(k\times k\) lokal qo‘shnichilikni bildiradi. Manba matnining izohida tegishli filtr LPF deb atalgan bo‘lsa-da, Tenglama (3) tasvirida LPS belgisi chop etilgan. Manba bu yozuv xatosi ekanini ochiq aytmagani uchun ikki belgilash o‘rtasidagi nomuvofiqlik bu yerda o‘zgartirilmay qayd etiladi.

Yuqori chastota komponenti original xususiyatdan barcha past chastota guruhlarining birlashtirilgan tasvirini ayirish orqali olinadi:

Tenglama (4)

\[ X_{high}=X-[X^{1}_{low},X^{2}_{low},\ldots,X^{g}_{low}] \]

Bu matematik tuzilma muhim: yuqori chastota komponenti alohida qat’iy high-pass filtr bilan hisoblanmaydi, balki o‘rganiladigan past chastota taxminining qoldig‘i sifatida aniqlanadi.

DAGG va ikki tomonlama diqqat mexanizmi

Past va yuqori chastota xususiyatlari avval alohida 3 × 3 depth-wise konvolyutsiyalardan o‘tkaziladi. So‘ng ikki xil fusion yo‘li hosil qilinadi: elementlar bo‘yicha qo‘shish bilan \(X_{add}\), kanal yo‘nalishida birlashtirish bilan \(X_{con}\). \(X_{add}\) parallel kanal va fazoviy diqqat yo‘llaridan tashkil topgan Dual Attention Modulega uzatiladi.

Tenglama (5)

\[ W_{ca}=Conv_{1\times1}\left( ReLU\left( Conv_{1\times1}(GAP(X_{add})) \right) \right) \]

\(W_{ca}\in\mathbb{R}^{C\times1\times1}\) qaysi xususiyat kanallari yaxshilash nuqtayi nazaridan muhimroq ekanini vaznlaydigan kanal diqqat hadidir.

Tenglama (6)

\[ W_{sa}=Conv_{7\times7}\left( [GAP(X_{add}),GMP(X_{add})] \right) \]

\(W_{sa}\in\mathbb{R}^{1\times H\times W}\) fazoviy hududlar orasida vazn taqsimotini hosil qiladi. Manba izohiga ko‘ra maqsad ko‘proq buzilgan hududlarga ko‘proq e’tibor berishdir.

Kanal va fazoviy vaznlar birlashtirilib Sigmoid orqali \(W_{casa}\) hosil qilinadi. Ikki fusion yo‘lining birikishi quyidagicha:

Tenglama (7)

\[ X_{fuse}= W_{casa}\cdot X_{add} + (1-W_{casa})\cdot Conv_{1\times1}(X_{con}) \]

So‘ng past va yuqori chastota komponentlariga xos normallashtirilgan vaznlar olinadi:

Tenglama (8)

\[ W_{low},W_{high} = Split\left( Softmax(GAP(X_{fuse})) \right) \]

DFSM chiqishi:

Tenglama (9)

\[ X_{out} = W_{low}\cdot X_{low} + W_{high}\cdot X_{high} \]

Bu so‘nggi ifoda DFSMning asosiy vazifasini umumlashtiradi. Model past va yuqori chastota xususiyatlarini qat’iy nisbatlarda qo‘shmaydi; har bir kirish uchun o‘rganilgan vaznlar bilan qayta birlashtiradi.

MSFEM: global kontekst va lokal tafsilotni bir modulda saqlash

MSFEM kirish xususiyatlarini avval batch normalization, 1 × 1 point-wise konvolyutsiya va GELU aktivatsiyasidan o‘tkazadi:

Tenglama (10)

\[ \hat{X} = GELU\left( Conv_{1\times1}(BN(X)) \right) \]

Katta tarmoqda uchta parallel depth-wise dilated convolution qo‘llanadi:

Tenglama (11)

\[ X_{k} = DWDConv_{k\times k,d=3}(\hat{X}), \qquad k\in\{3,5,7\} \]

Dilation nisbati \(d=3\). Manba bergan samarali receptive field munosabati:

\[ k_{eff}=k+(k-1)(d-1) \]

Shunga ko‘ra 3 × 3, 5 × 5 va 7 × 7 yadrolar mos ravishda 7 × 7, 13 × 13 va 19 × 19 samarali receptive fieldlarga yetadi. Shu tariqa yagona yadro masshtabiga bog‘lanib qolmasdan qisqa, o‘rta va uzoqroq masofali fazoviy kontekstni ushlashga harakat qilinadi.

Katta tarmoq chiqishi:

Tenglama (12)

\[ X_{large} = Conv_{1\times1} \left( GELU \left( Conv_{1\times1} ([X_{3},X_{5},X_{7}]) \right) \right) \]

Kichik tarmoq faqat 1 × 1 depth-wise konvolyutsiyadan foydalanib lokal axborotni to‘ldiradi:

Tenglama (13)

\[ X_{small} = Conv_{1\times1} \left( GELU \left( DWConv_{1\times1}(\hat{X}) \right) \right) \]

MSFEMning e’tiborga molik dizayn tanlovi modul barcha darajalarda ketma-ket qo‘llanmasligidir. Manba kengaytirilgan konvolyutsiyalarni ko‘plab ketma-ket masshtablarda qo‘llash muntazam namuna olinmaydigan piksellar va fazoviy axborot yo‘qotilishiga olib kelishi mumkinligini aytib, MSFEMni faqat SU-Net va asosiy U-Net bottlenecklariga joylashtiradi.

SFCM va kichik U-Netning joylashuvi

SFCM \(C\times H\times W\) kirishni avval ikkita 3 × 3 konvolyutsiya va ReLUni o‘z ichiga olgan ResBlock bilan qayta ishlaydi. So‘ng xususiyatlar kernel=2 va stride=2 depth-wise konvolyutsiya bilan \(C\times H/2\times W/2\) o‘lchamga tushiriladi va MSFEMga uzatiladi. Bilinear interpolation bilan yana original aniqlikka ko‘tarilgach DFSM qo‘llanadi va sayoz xususiyatlar bilan skip bog‘lanishi quriladi.

Bu tuzilma asosiy U-Netning faqat eng yuqori aniqlikdagi birinchi masshtabida qo‘llangan. Ablation natijalari SU-Netni ikkinchi va uchinchi masshtablarga ham qo‘shish FLOPsni kamaytirsa-da, PSNRni pasaytirishini ko‘rsatadi. Bu topilma past aniqlik darajalarida yangi downsampling amaliyoti foydali fazoviy tafsilotlarni yo‘qotishi mumkinligi bilan izohlangan.

Yo‘qotish funksiyasi

D2SNetni o‘qitishda ham fazoviy soha, ham chastota sohasi uchun \(L_{1}\) yo‘qotish qo‘llanadi.

Tenglama (14)

\[ L_{spatial} = \|Pred-GT\|_{1} \]

Bu yerda \(Pred\) tarmoq hosil qilgan tasvirni, \(GT\) esa referens normal-yorug‘lik tasvirini bildiradi.

Tenglama (15)

\[ L_{frequency} = \|F(Pred)-F(GT)\|_{1} \]

\(F\) tez Fourier transformini (FFT) anglatadi. Bu chastota yo‘qotishi bashorat qilingan tasvir bilan referens tasvirning chastota tasvirlarini bir-biriga yaqinlashtirishga qaratilgan.

Tenglama (16)

\[ L = L_{spatial} + \lambda L_{frequency} \]

Tadqiqotda \(\lambda=0.2\) tanlangan. Demak, umumiy optimallashtirish fazoviy qayta qurish xatosini asosiy komponent sifatida saqlagan holda chastota sohasi mosligiga ham qo‘shimcha vazn beradi.

Baholash metrikalari nimani o‘lchaydi?

PSNR piksel darajasidagi qayta qurish xatosi bilan bog‘liq sifat o‘lchovidir va bu tadqiqotda yuqori qiymat afzal. SSIM strukturaviy o‘xshashlikni o‘lchaydi va bunda ham yuqori qiymat yaxshiroq. LPIPS chuqur xususiyat fazosidagi perseptual farqni baholaydi; past qiymat yaxshiroq. Referens tasviri bo‘lmagan ma’lumotlar to‘plamlarida BRISQUE va NIQE qo‘llangan va har ikkisida ham past qiymat afzal.

Tadqiqot Usuli va Natijalari

Ma’lumotlar to‘plamlari

Asosiy juftlashtirilgan baholashlarda LOLv1, LOLv2-Real va LOLv2-Synthetic qo‘llangan. LOLv1da 485 kam/normal yorug‘lik tasvir jufti o‘qitish, 15 juft test uchun ajratilgan. LOLv2-Real o‘qitish:test nisbati 689:100, LOLv2-Synthetic nisbati 900:100.

LOL-Blur ma’lumotlar to‘plami 200 sahnadan yaratilgan 12.000 kam-yorug‘lik/xira va yuqori-aniqlik tasvir juftidan iborat; 10.200 juft o‘qitish, 1.800 juft test uchun ishlatilgan. Sony-Total-Dark bo‘limida 2.697 qisqa va uzoq ekspozitsiyali RAW tasvir jufti mavjud; 2.099 juft o‘qitish, 598 juft test uchun ishlatilgan.

Referens tasviri bo‘lmagan umumlashtirish tajribalari DICM, LIME, MEF, NPE va VVda o‘tkazilgan. Shuningdek, kam yorug‘likni yaxshilashning yuqori darajadagi kompyuter ko‘rish vazifasiga ta’sirini baholash uchun ExDark obyekt aniqlash ma’lumotlar to‘plami ishlatilgan.

O‘qitish va amalga oshirish tafsilotlari

ParametrManbada ishlatilgan qiymat
FreymvorkPyTorch
UskunaBitta NVIDIA A100 GPU
OptimizerAdam
\(\beta_1\)0.9
\(\beta_2\)0.999
\(\epsilon\)\(1\times10^{-8}\)
Boshlang‘ich learning rate\(1\times10^{-3}\) yoki \(1.2\times10^{-3}\)
Yakuniy learning rate\(5\times10^{-7}\)
Learning rate jadvaliCosine annealing
Batch size32
Patch size256 × 256
DFSM filtr yadrolari3 × 3 va 5 × 5
FFE guruh soni8
LOLv1 / LOLv2 o‘qitish muddati2.500 epoch
LOL-Blur o‘qitish muddati1.500 epoch
Sony-Total-DarkLOL-Blur bilan bir xil asosiy parametr sozlamalari

Asosiy juftlashtirilgan benchmark natijalari

Ma’lumotlar to‘plamiPSNRSSIMLPIPS
LOLv125.09 dB0.8740.082
LOLv2-Real23.80 dB0.8770.076
LOLv2-Synthetic26.60 dB0.9470.027
LOL-Blur27.78 dB0.9060.075
Sony-Total-Dark21.70 dB0.6760.387

D2SNetning hisoblash hajmi manba jadvallarida 5.62 million parametr va 36.82 G FLOPs deb berilgan. LOLv1da model 25.09 dB PSNR bilan Diff-Retinex++ning 24.67 dB qiymatidan 0.42 dB yuqori bo‘lgan. LOLv2-Syntheticda D2SNet 26.60 dB PSNR, 0.947 SSIM va 0.027 LPIPSga erishgan.

LOLv2-Real uchun D2SNetning 23.80 dB PSNR va 0.877 SSIM qiymatlari manba Jadval 1-da eng yuqori qiymatlardir. Biroq LPIPS qiymati 0.076 bo‘lib, shu jadvalda CWNet uchun 0.063 qayd etilgan. Shu sabab manba matnidagi “PSNR, SSIM va LPIPSning barchasida eng yaxshi” iborasi jadvalning LPIPS ustuniga mos kelmaydi.

LOL-Blur: yaxshilash va xiralikni bartaraf etish birgalikda

LOL-Blur tajribasida D2SNet 27.78 dB PSNR, 0.906 SSIM va 0.075 LPIPS ko‘rsatgan. Manba Jadval 2-da bu uch qiymat ham ro‘yxatdagi boshqa end-to-end va ketma-ket usullardan yaxshiroq ko‘rinadi. Modelning 36.82 G FLOPs hisoblash xarajati ayrim og‘irroq usullardan ancha past bo‘lsa-da, taqqoslangan eng yengil model emas.

Manbaning sifatli taqqoslashlarida D2SNet chiqishlarida rangni qayta tiklash, tafsilotni saqlash va xiralikni kamaytirish ta’kidlanadi. Bular vizual misollar bilan qo‘llab-quvvatlangan; biroq sifat misollarining tanlovi barcha mumkin bo‘lgan sahnalarni ifodalovchi mustaqil foydalanuvchi tadqiqoti emas.

Sony-Total-Dark: juda qorong‘i RAW tasvirlar

Sony-Total-Darkda D2SNet 21.70 dB PSNR, 0.676 SSIM va 0.387 LPIPSga erishgan. Manba taqqoslashida LEDNet mos ravishda 20.83 dB, 0.648 va 0.471 qiymatlarda. Bu tajriba arxitektura nafaqat standart LOL tasvirlarida, balki juda past ekspozitsiyali RAW ma’lumotlarida ham baholanganini ko‘rsatadi.

Referens tasviri bo‘lmagan ma’lumotlar to‘plamlari

Ma’lumotlar to‘plamiBRISQUENIQE
DICM18.163.77
LIME14.633.66
MEF13.223.38
NPE13.214.01
VV18.542.80

LIME, MEF va VVda D2SNet kuchli qiymatlar beradi. DICMda BRISQUE 18.16 bilan manba jadvalidagi eng past qiymat; NIQE 3.77 esa DarkIRning 3.76 qiymatidan juda oz yuqori. NPEda D2SNetning 13.21 BRISQUE qiymati DarkIRning 12.88 qiymatidan, 4.01 NIQE qiymati esa CIDNetning 3.74 qiymatidan yuqori. Shu bois natijalar “barcha juftlashtirilmagan ma’lumotlar to‘plamlarida va barcha metrikalarda eng yaxshi” deb talqin qilinmasligi kerak.

Ablation Tajribalari D2SNetning Qaysi Komponentlari Hissa Qo‘shishini Ko‘rsatadi?

Manba ablationlari eng katta yagona modul hissasi DFSMdan kelganini, MSFEM qo‘shimcha yutuq berganini va SU-Netni faqat eng yuqori aniqlikdagi masshtabda ishlatish samaradorlik-hisoblash muvozanati nuqtayi nazaridan ma’qulroq ekanini ko‘rsatadi; to‘liq tuzilma LOLv1da 25.09 dB PSNR va 0.874 SSIMga erishgan.

Asosiy modullarning hissasi

Asosiy tarmoq 20.19 dB PSNR va 0.815 SSIM bergan. Asosiy U-Net bottleneckiga MSFEM qo‘shilishi PSNRni 21.06 dBga olib chiqqan, DFSMni tegishli masshtablarda ishlatish esa 23.68 dBga yetkazgan. Manba mualliflari buni DFSM uchun baselinega nisbatan 3.49 dB PSNR o‘sishi sifatida qayd etadi.

SU-Netni birinchi masshtabga qo‘shish bilan PSNR 23.74 dB bo‘lgan, FLOPs esa 38.13 Gdan 35.01 Gga tushgan. Keyingi MSFEM joylashtirishlari bilan to‘liq tarmoq 25.09 dB PSNR, 0.874 SSIM, 5.62 M parametr va 36.82 G FLOPsga erishgan.

Nega faqat bitta SU-Net?

SU-Net soniPSNRSSIMFLOPs
023.680.85838.13 G
123.740.85835.01 G
223.420.85031.89 G
323.270.85028.77 G

SU-Net soni oshgani sari hisoblash kamayganiga qaramay, tasvir sifati pasayadi. Manbaning talqiniga ko‘ra, pastroq aniqlik qatlamlarida qo‘shimcha downsampling qaytarib bo‘lmaydigan fazoviy tafsilot yo‘qotilishiga olib kelishi mumkin.

FFE guruh soni

FFE uchun \(g=2\) va \(g=4\) holatlarida PSNR 23.57 dB, \(g=8\) holatida 23.68 dB, \(g=16\) holatida 23.48 dB. Shu sabab yakuniy modelda 8 guruh tanlangan. Manba 16 guruhdagi pasayishni ehtimoliy overfitting bilan bog‘laydi; bu izoh bevosita isbotlangan mexanizm emas, muallif talqinidir.

O‘rganiladigan filtr va diqqat dizayni

FFE taqqoslashida Gaussian filtr 23.22 dB, Wavelet filtr 23.21 dB va o‘rganiladigan low-pass filtr 23.68 dB PSNR bergan. DAGG tomonida CBAM bilan 23.19 dB, tadqiqotning DAM tuzilmasi bilan 23.68 dB olingan. Shunday qilib, manba tajribalari ham mazmunga moslanuvchi chastota ajratish, ham parallel ikki tomonlama diqqat mexanizmi tanlangan benchmarkda hissa qo‘shganini ko‘rsatadi.

MSFEM masshtablarining hissasi

Uch parallel 3 × 3 DWDConv 20.34 dB, uch parallel 5 × 5 tuzilma 20.56 dB, uch parallel 7 × 7 tuzilma 20.64 dB PSNR bergan. Ko‘p masshtabli Large Branch 20.81 dBga, Large Branch va Small Branchni birga ishlatish esa 21.06 dBga chiqqan. Kichik tarmoqning qo‘shilishi 0.19 dB PSNR foyda bergan, manba jadvaliga ko‘ra atigi 0.07 G qo‘shimcha FLOPs keltirgan.

ExDark obyekt aniqlash qo‘llanmasi

Tadqiqot tasvirni yaxshilashning faqat vizual sifat metrikasiga emas, keyingi kompyuter ko‘rish vazifasiga ta’sirini ham sinagan. ExDark ma’lumotlar to‘plamidagi 7.363 tasvir 5.890 o‘qitish, 737 validatsiya va 736 test tasviriga ajratilgan. Tasvirlar LOLv2-Syntheticda o‘qitilgan D2SNet modeli bilan yaxshilangach, YOLO-V5 obyekt detektori qo‘llangan.

D2SNet oldindan qayta ishlashi bilan manba Jadval 10-da umumiy mAP 73.6 deb qayd etilgan. Ikkinchi eng yuqori o‘rtacha qiymat SRENet uchun 67.9; farq 5.7 ball. “Dog” kategoriyasida D2SNet 80.0, Diff-Retinex++ 72.8 ga erishgan va farq 7.2 ball bo‘lgan. Manba Rasm 9-dagi misollardan birida kam yorug‘lik tasvirida aniqlanmagan qayiq D2SNet yaxshilashidan keyin YOLO-V5 tomonidan 0.82 ishonch balli bilan aniqlangan.

D2SNet Natijalari Qanday Talqin Qilinishi Kerak?

D2SNet natijalari tadqiqotda ishlatilgan benchmark ma’lumotlar to‘plamlari va o‘qitish sozlamalari ostida fazoviy-chastotaviy sinergiya kuchli tiklash yondashuvi bo‘lishi mumkinligini qo‘llab-quvvatlaydi; biroq preprint maqomi, ma’lumotlar to‘plamlarining cheklangan qamrovi va ayrim matn-jadval nomuvofiqliklari sababli natijalar barcha real kamera tizimlari yoki barcha kam yorug‘lik sharoitlari uchun qat’iy va universal ustunlik da’vosiga aylantirilmasligi kerak.

Tadqiqot qo‘llab-quvvatlaydigan xulosalar

Manba tajribalari DFSM kuchli ablation hissasini berganini, MSFEMning turli receptive field masshtablarini birlashtirishi bir masshtabli versiyalardan yuqori PSNR berganini va eng yuqori aniqlik darajasiga joylashtirilgan yagona SU-Net hisoblash xarajati bilan sifat orasida ma’qulroq muvozanat yaratganini ko‘rsatadi. D2SNet, shuningdek, juftlashtirilgan, juftlashtirilmagan, xira va o‘ta qorong‘i ma’lumotlar to‘plamlarida sinovdan o‘tkazilgan; ExDark tajribasi orqali obyekt aniqlash uchun oldindan qayta ishlash ta’siri ham baholangan.

Tadqiqot qo‘llab-quvvatlamaydigan umumlashtirishlar

Tadqiqot D2SNet barcha kamera sensorlarida, barcha shovqin modellarida, barcha yoritish darajalarida yoki real vaqt embedded qurilmalarda bir xil samaradorlikni berishini isbotlamaydi. Manba muayyan mobil qurilma, edge accelerator yoki real vaqt sanoat tizimida latency o‘lchovini taqdim etmaydi. Shuningdek, benchmark tasvir metrikalaridagi yaxshilanish har bir vizual idrok yoki xavfsizlik-kritik kompyuter ko‘rish vazifasida ayni miqdordagi foyda bo‘lishini anglatmaydi.

Manba va Usul Izohi

Asl sarlavha: D2SNet: Dual-domain Synergy Network for Low-Light Image Enhancement

Mualliflar: Feng Huang; Jing Guo; Jing Wu; Jiong Huang.

Mualliflar tartibi: Feng Huang → Jing Guo → Jing Wu → Jiong Huang.

Muassasa: SSRN rasmiy yozuviga ko‘ra to‘rtala muallif ham Fuzhou University bilan bog‘langan.

Aloqa muallifi: SSRN yozuvida Jing Guo “Contact Author” sifatida ko‘rsatilgan. PDFning ko‘rinadigan versiyasi alohida corresponding-author belgisini bermaydi.

DOI: 10.2139/ssrn.7003581

Platforma: SSRN.

Rasmiy yozuv:SSRN Abstract 7003581

Topshirish/yozuv sanasi: 26 iyun 2026.

Manba turi: Preprint tadqiqot maqolasi.

Taqriz holati: Manba PDF ish ekspert taqrizidan o‘tmaganini ochiq aytadi.

Jurnal/jild/son: Manbada taqrizli jurnal nashri, jild yoki son ma’lumoti berilmagan.

Litsenziya/mualliflik huquqi: SSRN yozuv sahifasida huquqlar saqlanishi va ruxsatsiz qayta foydalanishga yo‘l qo‘yilmasligi ko‘rsatilgan. Shu sabab Verianla matni manbadagi rasm va jadval dizaynini ko‘chirmaydi; faqat tekshiriladigan ilmiy ma’lumot, usul, tenglama va natijalarni mustaqil o‘quv tuzilmasida tushuntiradi.

Manfaatlar to‘qnashuvi: Mualliflar ishga ta’sir qilishi mumkin bo‘lgan ma’lum moliyaviy manfaat yoki shaxsiy munosabat yo‘qligini bildiradi.

Ma’lumotlardan foydalanish: Manba tadqiqotda ishlatilgan ma’lumotlar so‘rov asosida mavjudligini bildiradi.

Moliyalashtirish: Ko‘rib chiqilgan PDFda alohida moliyalashtirish bayonoti keltirilmagan.

CRediT/muallif hissalari: Ko‘rib chiqilgan PDFda mualliflar kesimida CRediT hissa bayonoti berilmagan.

Manba ichidagi belgilash nomuvofiqligi: Tenglama (3) tasvirida \(LPS^{i}\), tegishli izoh matnida esa past chastotani o‘tkazuvchi filtr uchun \(LPF^{i}\) yozuvi ishlatilgan. Manba bu farq sababini tushuntirmaydi.

Manba ichidagi natija nomuvofiqligi: Matnda LOLv2-Realda D2SNet PSNR, SSIM va LPIPSning uchalasida ham eng yaxshi deyilgan, ammo Jadval 1-da CWNetning LPIPS qiymati 0.063, D2SNetniki 0.076. LPIPSda past qiymat afzal bo‘lgani uchun Verianla bahosida jadval qiymatlari asos qilib olingan.

Metodologik chegara: Natijalar o‘rganilgan tasvir tiklash modelining tanlangan benchmark ma’lumotlar to‘plamlaridagi samaradorligiga asoslanadi. Taqriz, mustaqil qayta ishlab ko‘rish, turli uskuna latency o‘lchovlari va keng dala validatsiyasi bu manbada ko‘rsatilmagan.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati