
Utafiti huu unapendekeza mtandao wa neva wa msukumo unaoitwa BiSNet, uliotiwa msukumo na mfumo wa kuona wa kibayolojia, kwa ajili ya kusafisha picha moja iliyoharibiwa na mistari ya mvua kwa matumizi ya chini ya nishati. Mitandao ya neva ya msukumo huchakata taarifa hasa kupitia matukio machache ya spike yenye thamani 0 au 1 badala ya uamilishaji endelevu wa namba za nukta elekezi. Sifa hii inaweza kupunguza ukokotoaji usiohitajika katika neuroni zisizoamilishwa, lakini pia inaweza kusababisha kupotea kwa taarifa za rangi, muundo na kingo nyembamba katika urejeshaji wa picha. Lengo kuu la BiSNet ni kupunguza upotevu huu wa taarifa huku ikihifadhi faida ya matumizi madogo ya nishati ya ukokotoaji wa msukumo.
Muundo huu hutumia usanifu wa matawi mawili uliotiwa msukumo na mgawanyo wa kazi kati ya njia ya ventral, ambayo katika mfumo wa kuona wa kibayolojia ni nyeti kwa maelezo na taarifa za mwelekeo, na njia ya dorsal, ambayo hutathmini muktadha mpana zaidi wa kuona. Tawi la ndani hutumia ukweli kwamba mistari ya mvua mara nyingi huwa wima au ya mshazari na hutoa vipengele vya mwelekeo kupitia konvolusheni za msukumo zinazotegemea Gabor. Tawi la kimataifa hutathmini muundo wa jumla wa picha, maeneo yaliyoathiriwa na mvua na uharibifu wa masafa ya juu katika kikoa cha masafa. Matawi haya mawili huingiliana katika encoder na hutuma miunganisho ya kuruka yenye taarifa za mwelekeo kwenda hatua ya decoder.
BiSNet ina vipengele vitatu maalumu vya msingi. Gabor Spiking Residual Block hunasa mistari ya mvua kwa kutumia viini vya Gabor vinavyohisi mwelekeo kama 0°, 45°, 90° na 135°. Moduli ya FMECA hurekebisha amplitudo ya spektra katika kikoa cha Fourier huku ikihifadhi taarifa ya awamu; katika tawi la anga, huzalisha maski inayobainisha maeneo yaliyoathiriwa na mvua. Moduli ya DiSA hujaribu kutenganisha kingo halisi za vitu na mistari ya mvua kwa kuunganisha majibu ya mvua ya mwelekeo wa 45°, 90° na 135° na taarifa za kisemantiki katika vipengele vinavyohamishwa kutoka encoder kwenda decoder.
Katika seti za data sintetiki Rain200H, Rain200L na Rain1200, BiSNet ilitoa thamani za juu zaidi za PSNR na SSIM kati ya mbinu zote zilizolinganishwa. Muundo ulifikia 29,88 dB na 0,9180 katika Rain200H; 40,31 dB na 0,9877 katika Rain200L; na 34,61 dB na 0,9398 katika Rain1200. Katika Rain1200, faida ya PSNR dhidi ya mshindani wa karibu ilikuwa 0,02 dB pekee, ilhali katika Rain200L tofauti ilifikia 0,78 dB. Kwa hiyo, ukubwa wa ubora hutofautiana kulingana na seti ya data.
BiSNet ina vigezo milioni 1,108, FLOP bilioni 12,494 na gharama ya nishati iliyoripotiwa kuwa \(1{,}562\times10^5\) µJ. Nishati yake ni takriban asilimia 22,2 chini kuliko NAFNet, muundo wa CNN wenye nishati ya chini zaidi katika jedwali. Hata hivyo, miundo midogo ya msukumo ESDNet na VLIF hutumia nishati kidogo kuliko BiSNet. Mchango wa BiSNet si kutoa thamani ya chini kabisa ya nishati, bali kuboresha uwiano wa usahihi–nishati wa mitandao ya msukumo kuelekea ubora wa juu zaidi wa picha.
Kwa mtazamo wa Türkiye: Mbinu ya BiSNet inaweza kuchunguzwa katika maeneo kama kamera za trafiki zinazofanya kazi wakati wa mvua, mifumo ya usaidizi wa dereva, ndege zisizo na rubani, kamera za usalama, upigaji picha wa kilimo, na mifumo ya ufuatiliaji wa reli na barabara kuu. Kabla ya matumizi nchini Türkiye, seti za data za ndani zinapaswa kuundwa zikijumuisha mchana-usiku, mwanga wa taa za mbele, ukungu, mvua iliyochanganyika na theluji, matone juu ya lenzi na mvua inayolazwa kwa upepo katika maeneo ya Bahari Nyeusi, Marmara na miji yenye mvua nyingi. Muundo unapaswa kupimwa kwenye kifaa halisi cha ukingoni au kichakataji cha neuromorphic kwa kuchelewa, nguvu kwa watt, matumizi ya kumbukumbu na athari zake kwa kazi za baadaye za utambuzi wa vitu. Utafiti huu hauwezi kutumiwa kuhitimisha kuwa kuna bidhaa iliyo tayari kwa matumizi moja kwa moja katika mifumo ya trafiki au usalama nchini Türkiye, matokeo ya kuaminika katika aina zote za mvua au akiba ya nishati ya kimwili iliyothibitishwa.
Tatizo la kuondoa mvua kutoka picha moja ni nini?
Picha zilizopigwa wakati wa mvua zinaweza kuwa na mistari myembamba, mikanda minene meupe, kontrasti ndogo, mtawanyiko wa mwanga na ukungu wa ndani. Uharibifu huu haupunguzi tu ubora wa kimwonekano wa picha; pia hubadilisha ingizo la kazi za baadaye za kuona kwa kompyuta kama utambuzi wa vitu, ufuatiliaji, uainishaji na uelewa wa mandhari.
Kuondoa mvua kutoka picha moja kunalenga kukadiria picha safi kwa kutumia fremu moja tu yenye mvua. Tofauti na mbinu za video, taarifa za mwendo kutoka fremu za kabla na baada hazipatikani. Muundo unapaswa kusawazisha malengo mawili yanayokinzana kwa wakati mmoja:
- Kuondoa mistari ya mvua na uharibifu wa masafa ya juu unaosababishwa na mvua
- Kuhifadhi kingo nyembamba za vitu, nywele, mimea, waya, mistari ya barabarani na miundo mingine halisi inayofanana
Kwa kuwa mistari ya mvua na kingo halisi za picha zinaweza kuwa na mwelekeo na sifa za masafa ya juu zinazofanana, uondoaji wenye nguvu kupita kiasi unaweza kufuta miundo halisi. Uondoaji usiotosha unaweza kuacha mabaki ya mvua kwenye picha.
Kwa nini mtandao wa neva wa msukumo umetumika?
Mitandao ya kawaida ya neva ya konvolusheni na miundo ya Transformer hufanya idadi kubwa ya operesheni endelevu za kuzidisha-na-kujumlisha. Mitandao ya neva ya msukumo hutegemea neuroni kutoa spike pale tu thamani ya kizingiti inapovukwa. Uwezo wa kufanya ukokotoaji mchache na unaoendeshwa na tukio katika maeneo yasiyotoa spike unaweza kuleta akiba ya nishati, hasa kwenye maunzi yanayofaa ya neuromorphic.
Kulingana na tafsiri ya watafiti, pikseli zilizoathiriwa na mvua huonyesha mabadiliko ya ghafla ya ukali ikilinganishwa na mazingira yake, jambo linaloweza kuendana kiasili na majibu ya binary ya spike. Hata hivyo, urejeshaji wa picha unahitaji pato lenye msongamano na thamani endelevu. Asili ya binary ya uamilishaji wa spike inaweza kusababisha kupotea kwa taarifa zifuatazo:
- Mabadiliko laini ya rangi
- Kingo zenye kontrasti ndogo
- Miundo midogo ya uso
- Kiwango cha uwazi cha mstari wa mvua
- Tofauti ndogo za ukali kati ya mandharinyuma na uharibifu
BiSNet inalenga kupunguza upotevu huu wa taarifa kwa kutumia uchimbaji wa vipengele wa njia mbili, priors za Gabor zenye mwelekeo, uchakataji wa kikoa cha masafa na mifumo ya umakini.
Usanifu wa jumla wa BiSNet ukoje?
Kielelezo 1 katika ukurasa wa 3 na mchoro wa usanifu wa ukubwa kamili katika ukurasa wa 14 vinaonyesha mtiririko wa mtandao kutoka picha yenye mvua hadi picha safi.
- Picha moja yenye mvua hurudiwa kwenye mhimili wa muda na kugeuzwa kuwa mfululizo wa spike.
- Picha hugawanywa katika matawi mawili: tawi la ndani la GaborConv na tawi la kimataifa la uchimbaji wa vipengele.
- Katika tawi la ndani, vitalu vya GaborSRB huchimba vipengele vya mwelekeo vya mvua na kingo.
- Katika tawi la kimataifa, Spiking Residual Block za kawaida na moduli za FMECA huchakata muktadha, masafa na taarifa ya maski ya mvua.
- Vipengele vya matawi mawili huunganishwa katika viwango mbalimbali vya encoder.
- Moduli za DiSA huchuja vipengele vya encoder kwa mwelekeo na semantiki na kuvihamisha kwenda decoder.
- Vitalu vya SRB katika decoder hujenga upya mwonekano wa kina na maelezo ya picha.
- Mchoro unaonyesha uwepo wa muunganisho wa residual kati ya ingizo lenye mvua na pato la mtandao.
Usanifu unalenga kutumia taarifa ya mwelekeo wa ndani kuongoza tawi la kimataifa. Kwa njia hii, mtandao hautumii tu muktadha mpana wa picha bali pia mwelekeo wa mistari ya mvua na uhusiano wake na mipaka halisi ya vitu.
Mfano wa njia mbili za kibayolojia unatumikaje?
Watafiti wanahusisha tawi la ndani la Gabor na uteuzi wa maelezo na mwelekeo wa njia ya ventral katika mfumo wa kuona wa kibayolojia, na tawi la kimataifa na uchakataji wa muktadha mpana wa kuona wa njia ya dorsal. Mfano huu ndio hoja ya msingi ya muundo wa usanifu.
Katika utafiti huu hakuna jaribio lililofanywa kwenye mfumo wa kuona wa binadamu au wanyama, wala shughuli za muundo hazijalinganishwa na rekodi za neuroni za kibayolojia. Kwa hiyo, usemi “uliotiwa msukumo na biolojia” unaeleza mfano wa usanifu na priors za receptive field za Gabor; hauonyeshi kuwa mtandao unaiga mfumo wa kuona wa kibayolojia kikamilifu.
Spiking Residual Block ina vipengele gani?
Kielelezo 2 katika kurasa za 5 na 15 kinalinganisha Spiking Residual Block ya kawaida na muundo wa GaborSRB. Katika kizuizi cha kawaida kuna:
- Neuroni ya LIF
- Konvolusheni ya msukumo
- Batch normalization inayotegemea muda au tdBN
- Muunganisho wa residual
- Mixed Attention Unit
Mixed Attention Unit katika mchoro ina vipengele vya umakini wa muda, umakini wa chaneli na umakini wa anga. Maandishi makuu hayatoi milinganyo ya kina ya vipengele hivi vitatu.
Gabor Spiking Residual Block inafanyaje kazi?
Vichujio vya Gabor ni vichujio vinavyojibu kwa nguvu kwa mistari ya mwelekeo na masafa fulani ya anga. Katika utafiti huu, ukweli kwamba mistari ya mvua mara nyingi ni wima au ya mshazari ndio sababu kuu ya kuchagua viini vya kuanzia vinavyotegemea Gabor.
Katika GaborSRB, uzito wa konvolusheni hauwekwi bila kubadilika. Kwanza huanzishwa kwa kazi za Gabor zenye hisia kwa mwelekeo wa mvua, kisha hubadilishwa pamoja na data wakati wa mafunzo. Hivyo, inalengwa kupata uwiano kati ya kuhifadhi uteuzi wa mwelekeo wa awali na kujifunza mahususi kwa kazi.
Viini vinavyotumika katika tabaka za juu juu vinategemea tofauti kati ya receptive fields kuu na za pembeni. Muundo msingi katika utafiti unaweza kufupishwa kama ifuatavyo:
\[ K_1 = \operatorname{Gabor}(x,y;\theta_1,\sigma_3) -\beta\,\operatorname{Gabor}(x,y;0^\circ,\sigma_4) \]
na kiini chake pacha chenye mwelekeo wa ishara uliogeuzwa. Muundo wa pili unalinganisha mielekeo miwili tofauti:
\[ K_2 = \operatorname{Gabor}(x,y;\theta_1,\sigma_1) -\operatorname{Gabor}(x,y;\theta_2,\sigma_2) \]
Muundo wa tatu unaotumika katika tabaka za kina hutenganisha mwelekeo mkuu na mchanganyiko wa vipengele saidizi vya mlalo na mshazari:
\[ K_3 = \operatorname{Gabor}(x,y;\theta_1,\sigma_1) -\left[ \alpha\,\operatorname{Gabor}(x,y;0^\circ,\sigma_2) +\operatorname{Gabor}(x,y;\theta_2,\sigma_2) \right] \]
Pembe zilizotumika katika utafiti ni:
- \(\theta_1\in\{0^\circ,45^\circ,90^\circ,135^\circ\}\)
- \(\theta_2\in\{45^\circ,135^\circ\}\)
- \(\alpha=18\%\)
- \(\beta=26\%\)
\(\sigma_1\) na \(\sigma_2\) zinawakilisha maeneo ya katikati na pembeni katika tabaka za juu juu, huku \(\sigma_3\) na \(\sigma_4\) zikiwakilisha ukubwa wa maeneo katika tabaka za kina.
Muundo huu hutoa mwitikio wa awali wenye nguvu kwa mistari ya mvua ya wima na ya diagonal. Hata hivyo, hakuna matokeo tofauti ya mwelekeo yaliyoripotiwa kwa mvua karibu na mlalo, athari zilizopinda za matone, matone makubwa juu ya lenzi au mtawanyiko wa mwanga.
Uonyeshaji wa GaborSRB unaonyesha nini?
Katika Kielelezo 8 kwenye kurasa za 10 na 21, majibu ya Gabor ya kiwango cha chini mwanzoni mwa mafunzo na ramani za vipengele vya kina zaidi baada ya mafunzo zinaonyeshwa.
- Mwanzoni, vichujio hujibu kwa nguvu kwa mistari mingi ya mvua ya mshazari na kingo za vitu.
- Katika tabaka za kati, majibu huwa ya kuchagua zaidi na baadhi ya mistari ya mandharinyuma hukandamizwa.
- Inadaiwa kuwa tabaka za kina huangazia mipaka ya vitu na miundo ya kufikirika zaidi.
Picha hizi zinaonyesha kwa namna ya kimaelezo maeneo ambayo muundo unajibu. Hata hivyo, ramani ya vipengele pekee si ushahidi kwamba moduli fulani ndiyo husababisha utenganishaji sahihi wa mvua. Aidha, lebo mbili katika mistari miwili ya mwisho ya kielelezo zote zimeandikwa “Gabor Converge-Mid”; maelezo yanataja mstari wa tatu kama kipengele cha kiwango cha juu.
Moduli ya FMECA inatumiaje kikoa cha masafa?
FMECA imefafanuliwa katika sehemu mbalimbali za maandishi kwa majina Spiking Frequency Mask Attention Block na Frequency-Mask-guided Efficient Channel Attention. Moduli ina sehemu kuu tatu:
- FrequencyMixerBlock
- RainMaskHead na RainMaskGate
- Efficient Channel Attention
Katika tawi la masafa, transform ya Fourier ya kweli ya pande mbili hutumika kwa ramani ya vipengele katika kila hatua ya muda. Amplitudo ya spektra hurekebishwa kwa konvolusheni ya 1 × 1 huku sehemu ya awamu ikihifadhiwa. Spektra iliyorekebishwa hurudishwa kwenye kikoa cha anga kwa inverse Fourier transform.
Kipengele kilichoimarishwa na masafa \(F\) huunganishwa katika residual connection na ingizo asili \(x_{tb}\):
\[ Y=x_{tb}+F \]
Lengo la mbinu hii ni kufanya vipengele vya spektra vya masafa ya juu na vyenye mwelekeo vya mistari ya mvua viwe dhahiri zaidi ndani ya muktadha wa kimataifa.
Maski ya mvua inaundwaje?
RainMaskHead kwanza hutengeneza mwitikio wa kingo wa ndani kutoka tensor ya vipengele vya spike \(p\):
\[ E_t=\operatorname{tdBN} \left( \operatorname{Conv}_{3\times3}(\operatorname{LIF}(p)) \right) \]
Wastani wa majibu chanya katika kila hatua ya muda huchukuliwa:
\[ M=\frac{1}{T}\sum_{t=1}^{T}\operatorname{ReLU}(E_t) \]
Kisha maski ya mwonekano wa mvua ya 0–1 huundwa kwa konvolusheni ya 1 × 1 na Sigmoid:
\[ M_{\mathrm{rain}}= \operatorname{Sigmoid} \left( \operatorname{Conv}_{1\times1}(M) \right) \]
RainMaskGate hutumia konvolusheni tofauti kwa maeneo ya mvua na mandharinyuma:
\[ Y_{\mathrm{gate}} = \operatorname{Conv}_{\mathrm{rain}}(f)\odot M_{\mathrm{rain}} + \operatorname{Conv}_{\mathrm{bg}}(f)\odot (1-M_{\mathrm{rain}}) \]
Mgawanyo huu unalenga mtandao kujifunza kuchakata kwa nguvu zaidi maeneo yaliyoathiriwa na mvua huku ukihifadhi maelezo katika maeneo safi au yenye muundo.
Picha za maski ya mvua zinaonyesha nini?
Kielelezo 7 katika kurasa za 9 na 20 kina safu tano:
- Ingizo lenye mvua
- Maski ya marejeo bandia iliyoundwa kutokana na tofauti kati ya picha yenye mvua na picha safi
- Maski iliyokadiriwa na BiSNet
- Matokeo yaliyosafishwa
- Lengo safi
Maski zilizokadiriwa hutoa majibu yenye nguvu kwa mistari mizito na ya mshazari ya mvua. Maski hizo si nakala kamili ya marejeo bandia; zinaunda maeneo mapana na endelevu zaidi. Watafiti wanafasiri hili kama dalili kwamba mtandao hujifunza maeneo ya uharibifu badala ya kuiga tofauti ya pikseli pekee.
Hakuna kipimo tofauti cha kiasi kama IoU, F1, precision au sensitivity kilichotolewa kwa usahihi wa maski. Ufanano wa kuona unaunga mkono kwamba tawi la maski hutenganisha maeneo ya mvua kwa usahihi, lakini hauamui usahihi wake kamili.
Kwa nini moduli ya DiSA inahitajika?
Katika mitandao ya encoder–decoder, skip connections huhamisha vipengele vya mwonekano wa juu kwenda decoder. Hata hivyo, vipengele vya encoder vinaweza kubeba mistari ya mvua pamoja na kingo halisi za vitu. Ikiwa vinahamishwa moja kwa moja, decoder inaweza kurudisha mvua iliyokuwa imeondolewa ndani ya picha.
Direction-Integrated Skip Attention au DiSA huanzisha ulinganifu wa kisemantiki na utenganishaji wa mwelekeo kati ya kipengele cha encoder \(x\) na kipengele cha decoder \(g\).
Kwanza vipengele viwili huhamishwa kwenye nafasi ya pamoja kwa projekseni za 1 × 1:
\[ q=w_g(g)+w_x(x) \]
Vichujio vya Gabor vya 45°, 90° na 135° hutumiwa kwenye uwakilishi uliounganishwa wa vipengele vya encoder na decoder:
\[ O_k=\left|G_{\theta_k}*s\right|, \qquad \theta_k\in\{45^\circ,90^\circ,135^\circ\} \]
Lango la kisemantiki huzalisha uzito unaobainisha ni mwelekeo gani muhimu zaidi katika kila pikseli:
\[ W= \operatorname{Softmax} \left( \operatorname{Conv}_{1\times1} (\operatorname{Sigmoid}(q)) \right) \]
Majibu ya mwelekeo huunganishwa kwa uzito:
\[ A_{\mathrm{dir}} = \sum_{k=1}^{K}W_k\odot O_k \]
Ramani ya mwisho ya umakini huhesabiwa kutoka taarifa za mwelekeo na semantiki:
\[ A= \operatorname{Sigmoid} \left( \operatorname{Conv}_{1\times1} \left[ A_{\mathrm{dir}}, \operatorname{Conv}_{1\times1}(q) \right] \right) \]
Kipengele cha skip huchujwa kwa ramani hii:
\[ x_{\mathrm{out}}=A\odot x \]
Ndani ya DiSA, vichujio vya Gabor vya mwelekeo hutumika kama priors zisizobadilika na mzigo wa ziada wa vigezo vinavyoweza kujifunzwa huwekwa katika kiwango kidogo.
Ni seti gani za data zilizotumika?
| Seti ya data | Picha za mafunzo | Picha za majaribio | Tabia ya mvua | Njia ya tathmini |
|---|---|---|---|---|
| Rain200L | 1.800 | 200 | Mistari michache au nyepesi ya mvua | PSNR na SSIM |
| Rain200H | 1.800 | 200 | Mistari mizito ya mvua | PSNR na SSIM |
| Rain1200 | 12.000 | 1.200 | Mielekeo na viwango mbalimbali | PSNR na SSIM |
| RW-Data | Haijabainishwa | Picha 185 halisi zenye mvua | Mvua halisi, isiyo ya kawaida na uharibifu wa mandharinyuma | Ulinganisho wa kuona wa kimaelezo |
Katika seti za data sintetiki, picha yenye mvua ina lengo safi linalolingana, hivyo ufanano wa pikseli na muundo unaweza kupimwa. Katika RW-Data hakuna lengo safi linalolingana, kwa hiyo PSNR au SSIM haikuhesabiwa.
PSNR na SSIM hupima nini?
PSNR ni nyeti kwa hitilafu ya kiwango cha pikseli kati ya picha iliyorejeshwa na lengo safi. Thamani ya juu kwa ujumla humaanisha hitilafu ndogo ya wastani ya pikseli.
SSIM hutathmini picha kulingana na mwangaza, kontrasti na ufanano wa muundo. Thamani ya juu ya SSIM inaonyesha kuwa mipaka ya vitu na miundo ya ndani imehifadhiwa karibu zaidi na lengo.
Ingawa vipimo hivi viwili hutumika sana katika urejeshaji wa picha, haviwakilishi kikamilifu uhalisia wa kiutambuzi, usahihi wa rangi au utendaji wa baadaye wa utambuzi wa vitu.
Mipangilio ya mafunzo na utekelezaji ni ipi?
| Mpangilio | Thamani iliyotolewa katika utafiti |
|---|---|
| Muundo wa deep learning | PyTorch 2.1.0 |
| Maktaba ya SNN | SpikingJelly 0.0.0.0.15 |
| GPU | NVIDIA GeForce RTX 4090, imeandikwa kama 48 GB katika maandishi |
| Uboreshaji | Adam |
| Ukubwa wa batch | 12 |
| Kiwango cha awali cha kujifunza | \(1\times10^{-3}\) |
| Kiwango cha mwisho cha kujifunza | \(1\times10^{-7}\) |
| Ratiba ya kiwango cha kujifunza | Cosine annealing |
| Epoch | 1.000 |
| Kipande cha mafunzo | Pikseli 90 × 96 |
| Idadi za SRB/GaborSRB za encoder | [4, 4, 8, 8] |
| Idadi za SRB za decoder | [2, 2, 2, 2] |
| Hatua ya muda iliyochaguliwa | 4 |
Utafiti haujaeleza kwa kina mchakato wa kuongeza data za picha, normalisation ya rangi, loss function, viwango vya kizingiti vya LIF, time constants za neuroni, surrogate gradient function, uanzishaji wote wa uzito na kigezo cha early stopping.
Matokeo makuu ya ulinganisho ni yapi?
| Usanifu | Mbinu | Rain200H PSNR / SSIM | Rain200L PSNR / SSIM | Rain1200 PSNR / SSIM | Kigezo (M) | FLOPs (G) | Nishati (µJ) |
|---|---|---|---|---|---|---|---|
| CNN | MSPFN | 28,35 / 0,9034 | 38,58 / 0,9827 | 32,39 / 0,9165 | 13,350 | 595,512 | \(7{,}444\times10^6\) |
| CNN | RCDNet | 28,65 / 0,8935 | 37,65 / 0,9787 | 32,62 / 0,9181 | 2,958 | 194,501 | \(2{,}431\times10^6\) |
| CNN | MPRNet | 29,36 / 0,9059 | 39,47 / 0,9869 | 32,91 / 0,9160 | 3,637 | 548,651 | \(6{,}858\times10^6\) |
| CNN | EffDerain | 26,87 / 0,8438 | 36,89 / 0,9804 | 32,87 / 0,9151 | 27,654 | 52,915 | \(6{,}614\times10^5\) |
| CNN | NAFNet | 29,17 / 0,9088 | 38,66 / 0,9829 | 34,58 / 0,9365 | 29,102 | 16,064 | \(2{,}008\times10^5\) |
| CNN | SFNet | 29,28 / 0,9105 | 39,42 / 0,9861 | 34,55 / 0,9362 | 13,234 | 124,439 | \(1{,}555\times10^6\) |
| CNN | CPRA | 29,62 / 0,9126 | 39,53 / 0,9863 | 34,59 / 0,9360 | 0,261 | 35,882 | \(4{,}485\times10^5\) |
| Transformer | DRT | 28,69 / 0,8894 | 38,85 / 0,9803 | 33,91 / 0,9288 | 1,176 | 166,045 | \(2{,}075\times10^6\) |
| Transformer | ELFFormer | 28,73 / 0,8941 | 38,50 / 0,9843 | 33,75 / 0,9359 | 1,532 | 66,392 | \(2{,}958\times10^5\) |
| Transformer | HPCNet | 29,28 / 0,8968 | 39,44 / 0,9849 | 34,48 / 0,9371 | 1,416 | 72,180 | \(3{,}692\times10^5\) |
| Transformer | SmartAssign | 28,18 / 0,8736 | 38,72 / 0,9814 | 33,17 / 0,9154 | 1,359 | 90,386 | \(1{,}129\times10^6\) |
| SNN | ESDNet | 28,26 / 0,9021 | 38,91 / 0,9862 | 33,92 / 0,9325 | 0,166 | 7,320 | \(9{,}150\times10^4\) |
| SNN | VLIF | 28,63 / 0,8935 | 38,46 / 0,9847 | 32,74 / 0,9184 | 0,088 | 2,794 | \(1{,}166\times10^4\) |
| SNN | BiSNet | 29,88 / 0,9180 | 40,31 / 0,9877 | 34,61 / 0,9398 | 1,108 | 12,494 | \(1{,}562\times10^5\) |
Matokeo ya Rain200H yanapaswa kutafsiriwaje?
Katika Rain200H yenye mistari mizito ya mvua, BiSNet ilipata 29,88 dB PSNR na 0,9180 SSIM. PSNR ya pili kwa juu ilikuwa 29,62 dB na SSIM ya pili kwa juu ilikuwa 0,9126, zote za CPRA.
- Tofauti ya PSNR: 0,26 dB
- Tofauti ya SSIM: 0,0054
Katika ulinganisho wa kuona kwenye kurasa za 7 na 18, BiSNet imeonyeshwa kuondoa mistari mizito ya mvua inayokatana na kuhifadhi maelezo ya matumbawe na uso wa maji karibu na picha lengo. Kwa baadhi ya washindani, mabaki madogo ya mvua, mabadiliko ya rangi au ishara za kulainishwa zimeainishwa.
Matokeo ya Rain200L yanapaswa kutafsiriwaje?
Katika seti ya data ya mvua chache Rain200L, BiSNet ilitoa 40,31 dB PSNR na 0,9877 SSIM.
- PSNR ya pili kwa juu: CPRA, 39,53 dB
- Tofauti ya PSNR: 0,78 dB
- SSIM ya pili kwa juu: MPRNet, 0,9869
- Tofauti ya SSIM: 0,0008
Tofauti ya PSNR ni dhahiri katika seti hii ya data, huku tofauti ya SSIM ikiwa ndogo. Hii inaonyesha kuwa kulikuwa na uboreshaji mkubwa zaidi katika hitilafu ya pikseli, ilhali miundo pinzani pia ilikuwa karibu sana na lengo kwa ufanano wa muundo.
Matokeo ya Rain1200 yanapaswa kutafsiriwaje?
Katika seti kubwa na tofauti zaidi ya Rain1200, BiSNet ilifikia 34,61 dB PSNR na 0,9398 SSIM.
- PSNR ya pili kwa juu: CPRA, 34,59 dB
- Tofauti ya PSNR: 0,02 dB
- SSIM ya pili kwa juu: HPCNet, 0,9371
- Tofauti ya SSIM: 0,0027
Ingawa BiSNet ina thamani ya juu zaidi katika jedwali, faida ya PSNR ni 0,02 dB pekee. Kwa kuwa hakuna marudio mengi ya mafunzo wala utofauti wa kitakwimu uliotolewa, haiwezekani kubainisha kama tofauti hii ndogo ni kubwa kuliko utofauti wa nasibu wa mafunzo.
Faida dhidi ya mbinu za SNN ni ipi?
| Ulinganisho | Tofauti ya PSNR Rain200H | Tofauti ya PSNR Rain200L | Tofauti ya PSNR Rain1200 |
|---|---|---|---|
| BiSNet – ESDNet | +1,62 dB | +1,40 dB | +0,69 dB |
| BiSNet – VLIF | +1,25 dB | +1,85 dB | +1,87 dB |
BiSNet hutoa usahihi wa juu zaidi wa urejeshaji kuliko washindani wa msukumo, lakini hutumia vigezo zaidi, FLOP zaidi na nishati zaidi iliyoripotiwa.
Uwiano wa nishati na ukokotoaji wa muundo ukoje?
- BiSNet ina vigezo milioni 1,108.
- VLIF, ESDNet na CPRA hutumia vigezo vichache zaidi.
- Thamani ya BiSNet ya FLOP bilioni 12,494 ni kubwa tu kuliko VLIF na ESDNet; ni thamani ya tatu kwa udogo katika jedwali.
- Nishati iliyoripotiwa ya BiSNet ni 156.200 µJ.
- Ni takriban asilimia 22,2 chini ya thamani ya NAFNet ya 200.800 µJ.
- BiSNet hutumia takriban asilimia 70,7 zaidi ya nishati kuliko ESDNet.
- Nishati iliyoripotiwa ya BiSNet ni takriban mara 13,4 ya VLIF.
Matokeo haya yanaonyesha kuwa BiSNet si mtandao wenye ufanisi wa juu kabisa kwa maana kamili. Muundo unalenga kutoa ubora wa picha unaokaribia au kuzidi kiwango cha CNN na Transformer kwa gharama ya ukokotoaji mkubwa zaidi wa SNN.
Kwa kuwa njia ya kuhesabu jedwali la nishati haijaelezwa, thamani za µJ hazipaswi kutafsiriwa moja kwa moja kama matumizi ya nguvu ya kifaa halisi, muda wa betri au utendaji wa mazingira halisi.
Ni nini kilichoonyeshwa kwenye picha halisi zenye mvua?
Katika ulinganisho wa RW-Data kwenye kurasa za 8 na 19, picha ya barabara yenye mvua na mimea imetumika. Watafiti wanasema kuwa baadhi ya mbinu zina:
- Mabaki ya mvua
- Kulainishwa kupita kiasi kwa miundo ya mimea
- Kupotea kwa muundo wa ndani
- Mabadiliko ya rangi yasiyo ya kawaida
ilhali BiSNet huzalisha picha safi na ya asili zaidi.
Kwa kuwa RW-Data haina lengo safi, matokeo “bora zaidi” yanategemea tu tafsiri ya kimaelezo ya picha zilizochaguliwa. Hakuna tathmini ya kipofu ya binadamu, alama za watumiaji, NIQE, BRISQUE au usahihi wa kazi zinazofuata ulioripotiwa.
Majaribio ya kuondoa moduli yanaonyesha nini?
| Muundo | Njia mbili | GaborSRB | FMECA | DiSA | Kigezo (M) | FLOPs (G) | PSNR | SSIM |
|---|---|---|---|---|---|---|---|---|
| (a) | Hapana | Hapana | Hapana | Hapana | 0,029 | 2,127 | 38,89 | 0,9826 |
| (b) | Ndiyo | Hapana | Hapana | Hapana | 0,063 | 2,633 | 39,53 | 0,9848 |
| (c) | Ndiyo | Hapana | Ndiyo | Hapana | 0,983 | 10,286 | 39,71 | 0,9853 |
| (d) | Hapana | Hapana | Ndiyo | Hapana | 0,949 | 9,782 | 39,25 | 0,9833 |
| (e) | Ndiyo | Ndiyo | Ndiyo | Hapana | 1,010 | 11,990 | 39,95 | 0,9866 |
| (f) | Ndiyo | Ndiyo | Hapana | Ndiyo | 0,159 | 2,712 | 39,82 | 0,9858 |
| (g) | Ndiyo | Ndiyo | Ndiyo | Ndiyo | 1,108 | 12,494 | 40,31 | 0,9877 |
Mchango wa njia mbili ni upi?
Wakati muundo msingi (a) unalinganishwa na muundo wenye njia mbili pekee (b):
- PSNR imeongezeka kutoka 38,89 hadi 39,53 dB.
- Faida ni 0,64 dB.
- SSIM imeongezeka kutoka 0,9826 hadi 0,9848.
- Idadi ya vigezo imeongezeka kutoka milioni 0,029 hadi milioni 0,063.
Tofauti ya 0,46 dB kati ya miundo (c) na (d) yenye FMECA pia inaunga mkono mchango wa njia mbili.
Mchango wa FMECA ni upi?
Wakati muundo wa njia mbili (b) unalinganishwa na muundo ulioongezewa FMECA (c), PSNR imeongezeka kwa 0,18 dB na SSIM kwa 0,0005. Hata hivyo, idadi ya vigezo imeongezeka kutoka milioni 0,063 hadi milioni 0,983, na thamani ya FLOP kutoka bilioni 2,633 hadi bilioni 10,286.
Wakati muundo (f) wenye GaborSRB na DiSA unalinganishwa na muundo kamili (g), kuongeza FMECA:
- Kumeongeza PSNR kwa 0,49 dB.
- Kumeongeza SSIM kwa 0,0019.
- Kumeongeza FLOP kwa takriban bilioni 9,782.
FMECA hutoa mchango mkubwa kwa usahihi katika jedwali la ablation, lakini pia inachangia sehemu kubwa ya ongezeko la ukokotoaji.
Mchango wa GaborSRB ni upi?
Wakati muundo (c) wenye njia mbili na FMECA unalinganishwa na muundo ulioongezewa GaborSRB (e):
- PSNR imeongezeka kutoka 39,71 hadi 39,95 dB.
- Faida ni 0,24 dB.
- SSIM imeongezeka kutoka 0,9853 hadi 0,9866.
- Mzigo wa ziada wa vigezo na FLOP umebaki mdogo.
Ulinganisho huu unaunga mkono kuwa priors za mwelekeo za Gabor hutoa mchango wa ziada wa urejeshaji ndani ya usanifu huo huo wa kimataifa.
Je, mchango wa kujitegemea wa DiSA umebainishwa?
Hapana. Makala inasema kuwa DiSA haikufanyiwa ablation tofauti kwa sababu inategemea vipengele vya Gabor na miunganisho ya tabaka mbalimbali.
Wakati muundo (b) unalinganishwa na muundo (f), PSNR huongezeka kutoka 39,53 hadi 39,82 dB. Hata hivyo, katika ulinganisho huu GaborSRB na DiSA zimeongezwa kwa pamoja. Kwa hiyo, haiwezekani kubainisha ni kiasi gani cha tofauti ya 0,29 dB kinatokana na GaborSRB na kiasi gani kinatokana na DiSA.
Muundo kamili unaleta faida gani dhidi ya muundo msingi?
| Kipimo | Muundo msingi | BiSNet kamili | Mabadiliko |
|---|---|---|---|
| PSNR | 38,89 dB | 40,31 dB | +1,42 dB |
| SSIM | 0,9826 | 0,9877 | +0,0051 |
| Kigezo | 0,029 M | 1,108 M | Takriban mara 38 |
| FLOPs | 2,127 G | 12,494 G | Takriban mara 5,9 |
Matokeo ya ablation yanaonyesha kuwa faida ya usahihi si ya bure. Muundo kamili una mafanikio zaidi kuliko mtandao msingi, lakini ni mkubwa zaidi na unahitaji ukokotoaji zaidi kwa kiwango kikubwa.
Idadi ya hatua za muda inaathirije utendaji?
| Hatua ya muda | FLOPs (G) | PSNR | SSIM |
|---|---|---|---|
| 1 | 11,179 | 39,42 | 0,9847 |
| 2 | 11,618 | 39,88 | 0,9862 |
| 4 | 12,494 | 40,31 | 0,9877 |
| 6 | 13,371 | 40,39 | 0,9881 |
Hatua sita za muda zilitoa vipimo vya juu zaidi. Hata hivyo, kutoka hatua nne hadi sita:
- PSNR imeongezeka kwa 0,08 dB pekee.
- SSIM imeongezeka kwa 0,0004 pekee.
- Thamani ya FLOP imeongezeka kwa bilioni 0,877.
Watafiti walichagua hatua nne za muda katika muundo mkuu kwa sababu ya uwiano wa usahihi–ukokotoaji.
Ni nguvu gani kuu za utafiti?
- Unatumia mitandao ya neva ya msukumo si kwa uainishaji pekee bali pia kwa tatizo la urejeshaji wa picha lenye pato zito.
- Unachakata taarifa ya mwelekeo wa ndani na muktadha wa kimataifa katika matawi tofauti.
- Priors za Gabor zimeachwa zibadilike wakati wa mafunzo.
- Maski ya mvua ya anga na uchakataji wa kikoa cha masafa zimeunganishwa katika moduli moja.
- Unajaribu kupunguza kurudishwa kwa taarifa ya mvua kutoka skip connections kwenda kwenye picha.
- Unatoa ulinganisho mpana wa miundo kwa vipimo sawa katika seti tatu za data sintetiki.
- Unatathmini familia za CNN, Transformer na SNN katika jedwali moja.
- Unaripoti vigezo, FLOP na makadirio ya nishati pamoja na usahihi.
- Majaribio ya ablation yamefanywa kwa moduli msingi.
- Uhusiano kati ya hatua za muda na usahihi–ukokotoaji umechunguzwa.
- Maski za mvua na majibu ya Gabor yameonyeshwa.
- Jaribio la kimaelezo limefanywa kwenye picha halisi zenye mvua.
Ni mapungufu gani makuu ya utafiti?
- Utafiti ni preprint ambao haujapitia tathmini ya rika.
- Mbinu na makisio ya hesabu ya nishati hayajaelezwa.
- Hakuna kipimo halisi cha nishati na kuchelewa kwenye kichakataji cha neuromorphic.
- Tofauti kati ya mafunzo ya GPU na inference ya neuromorphic haijatathminiwa.
- Hakuna tathmini ya kiasi yenye rejea katika seti ya data ya ulimwengu halisi.
- Hakuna tathmini ya kipofu ya binadamu au utafiti wa watumiaji.
- Hakuna random seed, standard deviation au confidence interval zilizotolewa kwa matokeo.
- Uthabiti wa kitakwimu wa faida ya 0,02 dB katika Rain1200 haujaonyeshwa.
- Moduli ya DiSA haijatengwa kwa kujitegemea.
- Loss function haijaelezwa.
- Mbinu ya surrogate gradient na vigezo vya neuroni za LIF havijatolewa.
- Spike rate na msongamano wa matukio kwa kila tabaka haujaripotiwa.
- Uhusiano kati ya thamani ya nishati na shughuli ya spike haujaonyeshwa.
- Muda wa mafunzo na inference latency kwa kila picha haujatolewa.
- Matumizi ya kumbukumbu na picha kwa sekunde hayajaripotiwa.
- Hakuna jaribio la kifaa cha simu, kilichopachikwa au cha ukingoni lililofanywa.
- Hakuna uchanganuzi tofauti wa utendaji kwa mielekeo mbalimbali ya mvua.
- Mvua ya mlalo, matone kwenye lenzi, ukungu na theluji havijachunguzwa.
- Mvua ya usiku, mwanga mkali wa taa na hali za mwanga mdogo hazijajaribiwa tofauti.
- Utendaji wa utambuzi au ufuatiliaji wa vitu baada ya kuondoa mvua haujapimwa.
- Utabiri wa maski haujatathminiwa kwa vipimo tofauti vya segmentation.
- Maelezo ya kufundisha upya miundo ya kulinganisha hayajaelezwa.
- Mipangilio ya kuongeza data na normalisation haijatolewa.
- Hakuna kiungo kilichotolewa kwa source code, uzito uliofunzwa na faili za kuzalisha upya.
- Kuna kutofautiana kwa lebo katika Kielelezo 8.
- Kifupi FRB katika usanifu wa jumla hakijafafanuliwa wazi.
Utafiti unaunga mkono nini?
- Unaunga mkono kuwa priors za Gabor zenye taarifa ya mwelekeo zinaweza kuwa muhimu katika urejeshaji wa picha wa msukumo.
- Unaonyesha kuwa uchakataji wa vipengele vya ndani na kimataifa kwa njia mbili unaweza kutoa usahihi wa juu kuliko SNN msingi.
- Unaonyesha kuwa kikoa cha masafa na uchakataji wa maski ya mvua vinaweza kuongeza utendaji vinapotumika pamoja.
- Unaonyesha kuwa BiSNet ilitoa PSNR na SSIM za juu kuliko mbinu zilizolinganishwa katika seti tatu za data sintetiki zilizochaguliwa.
- Unaonyesha kuwa BiSNet ina usahihi wa juu kuliko mbinu mbili zilizopo za SNN za kuondoa mvua.
- Unaunga mkono kuwa hatua nne za muda zinaweza kutoa matokeo karibu na hatua sita kwa FLOP ndogo.
- Unaonyesha kuwa uwiano unaoweza kurekebishwa unaweza kuundwa kati ya usahihi na ufanisi wa nishati katika mitandao ya msukumo.
Utafiti haujathibitisha nini?
- Haujathibitisha kuwa BiSNet ndiyo mbinu bora katika seti zote za data za mvua.
- Hauonyeshi kuwa tofauti ndogo kama 0,02 dB zitadumu katika marudio tofauti ya mafunzo.
- Haujathibitisha kuwa thamani ya nishati iliyoripotiwa itapatikana vivyo hivyo kwenye kifaa halisi.
- Hauonyeshi kuwa BiSNet ndiyo SNN yenye nishati ya chini zaidi.
- Haujathibitisha kuwa muundo unafanya kazi kwa wakati halisi.
- Hauonyeshi kuwa hutoa ubora bora zaidi wa kuona kwa kipimo cha objektivu katika picha halisi zenye mvua.
- Haujathibitisha kuwa kuondoa mvua huongeza utambuzi wa vitu au usalama wa kuendesha.
- Hauonyeshi kuwa inazalisha kwa usahihi utendaji wa mfumo wa kuona wa kibayolojia.
- Hauainishi kwa uhakika mchango huru wa DiSA.
- Haudhamini mafanikio sawa katika mvua ya mlalo, matone ya lenzi, ukungu, theluji au mwanga wa usiku.
Mbinu na Matokeo ya Utafiti
Muundo wa utafiti
Utafiti huu ni kazi ya majaribio ya kuona kwa kompyuta inayojumuisha kutengeneza usanifu mpya wa mtandao wa neva wa msukumo, mafunzo yanayosimamiwa kwa picha sintetiki zenye jozi, ulinganisho wa CNN–Transformer–SNN, ukaguzi wa kimaelezo katika picha halisi, majaribio ya kuondoa vipengele na uchanganuzi wa hatua za muda.
Ingizo na pato la muundo
| Kipengele | Maelezo |
|---|---|
| Ingizo | Picha moja ya RGB yenye mvua |
| Uwakilishi wa muda | Kurudia picha kwa hatua T za muda |
| Njia ya ndani | Uchimbaji wa vipengele vya mwelekeo kwa GaborConv na GaborSRB |
| Njia ya kimataifa | Uchakataji wa muktadha, masafa na maski kwa SRB na FMECA |
| Skip connection | Uchujaji wa mwelekeo na semantiki kwa DiSA |
| Pato | Picha iliyorejeshwa yenye mistari ya mvua iliyopunguzwa |
Moduli msingi
- Spiking Convolution Unit inayotegemea neuroni ya LIF
- Batch normalization inayotegemea muda
- Spiking Residual Block
- Gabor Spiking Residual Block
- Mixed Attention Unit
- FrequencyMixerBlock
- RainMaskHead
- RainMaskGate
- Efficient Channel Attention
- Direction-Integrated Skip Attention
Seti za data za majaribio
| Seti ya data | Jumla ya sampuli zilizotumika | Lengo kuu |
|---|---|---|
| Rain200H | 2.000 | Usahihi chini ya mvua nzito ya sintetiki |
| Rain200L | 2.000 | Usahihi chini ya mvua nyepesi na chache |
| Rain1200 | 13.200 | Ujumlishaji katika utofauti wa mwelekeo na kiwango |
| RW-Data | 185 | Tathmini ya kimaelezo katika picha halisi zenye mvua |
Matokeo makuu
- BiSNet ilitoa thamani za juu zaidi za PSNR na SSIM katika seti tatu za data sintetiki.
- Faida kubwa zaidi ya SNN katika PSNR dhidi ya VLIF ni 1,87 dB katika Rain1200.
- Katika Rain1200, tofauti ya PSNR dhidi ya mshindani wa jumla wa karibu ni 0,02 dB pekee.
- Njia mbili ziliongeza 0,64 dB PSNR kwa muundo msingi.
- GaborSRB iliongeza 0,24 dB kwa muundo huo huo wa njia mbili na FMECA.
- FMECA ilitoa 0,49 dB PSNR ya ziada katika muundo kamili.
- Muundo kamili ulitoa PSNR ya juu kwa 1,42 dB kuliko muundo msingi.
- Hatua nne za muda zilitoa matokeo ya chini kwa 0,08 dB pekee kuliko hatua sita.
- BiSNet ina nishati iliyoripotiwa takriban asilimia 22,2 chini kuliko muundo wa CNN wenye nishati ya chini zaidi kati ya waliolinganishwa.
- VLIF na ESDNet hutumia nishati kidogo kuliko BiSNet.
Mipaka ya kutafsiri vipimo vya mafanikio
Katika seti za data sintetiki, PSNR na SSIM zilihesabiwa dhidi ya picha lengo safi. Vipimo hivi vilitolewa kama thamani moja kwa picha zilezile za majaribio. Migawanyo kwa picha, confidence intervals au mabadiliko kati ya marudio hayakushirikiwa.
Katika picha halisi hakuna lengo safi, kwa hiyo matokeo yanategemea mifano ya kuona. Hakuna tathmini huru ya kiasi inayounga mkono mafanikio ya ulimwengu halisi katika utafiti.
Taarifa zinazokosekana kwa ajili ya kurudiwa kwa matokeo
- Loss functions za mafunzo na validation
- Surrogate gradient function
- Threshold, reset na time constants za LIF
- Maelezo ya spike coding
- Spike rates kwa kila tabaka
- Mlinganyo wa hesabu ya nishati na makisio ya maunzi
- Random seeds na marudio ya majaribio
- Mipangilio ya kuongeza picha
- Inference time na matumizi ya kumbukumbu
- Taratibu za kufundisha upya miundo pinzani
- Source code na uzito wa muundo
Hatua zinazohitajika kwa matumizi halisi
- Kipimo halisi cha watt na joule kwenye kichakataji cha neuromorphic
- Jaribio la latency kwenye mobile GPU, FPGA na edge processors
- Seti za data za usiku, ukungu, mwanga mkali wa taa na mvua ya upepo
- Uundaji tofauti wa matone juu ya lenzi na mkusanyiko wa mvua
- Uthibitishaji wa nje kwa picha halisi za mvua kutoka Türkiye
- Ulinganisho wa utambuzi wa vitu kabla na baada ya kuondoa mvua
- Jedwali la utendaji kwa pembe tofauti za mvua
- Confidence intervals kwa random seeds nyingi
- Jaribio huru la ablation la DiSA
- Tathmini ya usahihi wa maski kwa vipimo kama IoU na F1
- Tathmini ya kipofu ya binadamu katika picha halisi
- Kushiriki code, uzito na usanidi wa mafunzo
Maelezo ya Chanzo na Mbinu
Jina halisi la utafiti: Bio-inspired Spiking Neural Network for Single Image Deraining
Waandishi: Yuwei Chen; Yuwei Deng; Zhefei Cai; Tong Zhu; Bin Zhao; Yingle Fan.
Mpangilio wa waandishi: Mpangilio hapo juu unahifadhi mpangilio asili wa waandishi katika utafiti.
Taarifa ya mchango sawa: Utafiti hauna taarifa ya mwandishi mwenza wa kwanza au mchango sawa.
Mwandishi wa mawasiliano: Yingle Fan.
Barua pepe za waandishi:
- Yuwei Chen: yuweichen@hdu.edu.cn
- Yuwei Deng: yuweideng@hdu.edu.cn
- Zhefei Cai: zfcai@cjlu.edu.cn
- Yingle Fan: fan@hdu.edu.cn
Barua pepe za waandishi wengine: Hakuna anwani ya barua pepe iliyotolewa kwa Tong Zhu na Bin Zhao katika ukurasa mkuu wa kichwa.
Taarifa za ORCID:
- Yuwei Chen: 0009-0007-2123-2651
- Yingle Fan: 0000-0002-7478-9687
Taasisi:
- School of Automation, Hangzhou Dianzi University, Hangzhou 310018, China.
- College of Information Engineering, China Jiliang University, Hangzhou 310018, China.
Jukwaa rasmi la uchapishaji: SSRN.
Kiungo rasmi cha utafiti:Ukurasa wa utafiti wa SSRN
Tarehe ya kupakiwa SSRN: 31 Julai 2026.
Mwaka wa kuchapishwa: 2026.
Urefu wa faili: Kurasa 21 katika rekodi ya SSRN. Uwekaji namba wa kurasa wa makala kuu ni kurasa 13; faili iliyopakiwa ina picha za ziada za vielelezo vya ukurasa mzima.
Jarida: Hakuna jina mahususi la jarida lililopitiwa na rika au uamuzi wa kukubaliwa kwa toleo hili.
Hali ya uchapishaji: Hati ina kauli “Preprint submitted to Elsevier”. Kauli hii haimaanishi kuwa utafiti umekubaliwa na jarida la Elsevier au umepitia tathmini ya rika.
Aina ya chanzo: Utafiti wa preprint wa kuona kwa kompyuta unaojumuisha usanifu wa mtandao wa neva wa msukumo, ulinganisho wa benchmark sintetiki, tathmini ya kimaelezo katika picha halisi na majaribio ya ablation.
Hali ya tathmini ya rika: Utafiti haujapitia tathmini ya rika. Kila ukurasa wa faili una onyo “Preprint not peer reviewed”.
Ufadhili: Utafiti ulifadhiliwa na Xinmiao Project chini ya Zhejiang Provincial Applied Basic Research Program kwa ruzuku namba 2026XMHD023.
Michango ya waandishi:
- Yuwei Chen: Uundaji wa dhana, mbinu, programu, uthibitishaji, uchambuzi rasmi, utafiti na uandishi.
- Yuwei Deng: Mbinu na usimamizi wa data.
- Zhefei Cai: Uchambuzi rasmi, rasilimali na mapitio.
- Tong Zhu: Programu na uonyeshaji.
- Bin Zhao: Rasilimali na ushauri.
- Yingle Fan: Uundaji wa dhana, ushauri na mapitio.
Mgongano wa maslahi: Hakuna tamko wazi la mgongano wa maslahi katika maandishi makuu.
Upatikanaji wa data: Seti zilizopo za data Rain200L, Rain200H, Rain1200 na RW-Data zimetumika. Maandishi makuu hayatoi viungo vya moja kwa moja vya kupakua seti hizi za data.
Upatikanaji wa code na muundo: Hakuna kiungo cha ufikiaji wazi kilichotolewa kwa source code, uzito uliofunzwa, faili kamili za usanidi au kumbukumbu za majaribio.
Maelezo ya kipimo cha nishati: Jedwali la ulinganisho linatoa thamani za nishati kwa µJ; hata hivyo, kifaa cha kupimia kimwili, fomula ya hesabu ya nishati, coefficients za MAC na AC, spike rate au maunzi lengwa ya neuromorphic hayajaelezwa. Kwa hiyo, thamani hizi haziwezi kuthibitishwa kama matumizi halisi ya nguvu katika mazingira ya kazi.
Tofauti za picha na mbinu: Maelezo ya Kielelezo 8 yanataja vipengele vya kiwango cha chini, kati na juu, lakini picha mbili za chini zimewasilishwa zote kwa lebo ileile “Gabor Converge-Mid”. Pia hakuna ufafanuzi wazi wa kifupi FRB kinachoonekana katika usanifu wa jumla katika maandishi makuu ya mbinu.
Maelezo haya ya Kiswahili yameandaliwa baada ya kukagua michoro ya usanifu, ufafanuzi wa viini vya Gabor, milinganyo ya FMECA na DiSA, maelezo ya seti za data, mipangilio ya mafunzo, jedwali la PSNR–SSIM, ulinganisho wa parameter–FLOP–energy, mifano ya picha halisi, maski za mvua, uonyeshaji wa vipengele vya Gabor, jedwali la ablation na matokeo ya hatua za muda katika utafiti uliopakiwa. Hakuna jaribio jipya au thamani mpya ya utendaji kutoka nje ya utafiti iliyoongezwa kwenye matokeo ya kisayansi.
Utafiti unaunga mkono kuwa priors za Gabor zilizotiwa msukumo na uteuzi wa mwelekeo wa kibayolojia, pamoja na mifumo ya umakini inayotegemea masafa na maski, zinaweza kuongeza usahihi katika urejeshaji wa picha wa msukumo. Kizuizi kikuu ni kwamba mafanikio haya yanategemea vipimo vya mara moja katika seti za data sintetiki na makadirio ya nishati ambayo mbinu yake haijaelezwa. Muundo haupaswi kuchukuliwa kuwa tayari kwa matumizi kabla haujathibitishwa kwenye maunzi halisi ya neuromorphic, mfumo wa upigaji picha wa wakati halisi au mnyororo wa kuona kwa kompyuta wenye umuhimu wa usalama.

Acha maoni
Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *