Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Uhandisi / SMD-Net: Mtandao wa Utambuzi wa Viwango Vingi vya Ukubwa Unaozingatia Umbo kwa Utambuzi wa Vitu Chini ya Maji
Uhandisi

SMD-Net: Mtandao wa Utambuzi wa Viwango Vingi vya Ukubwa Unaozingatia Umbo kwa Utambuzi wa Vitu Chini ya Maji

SMD-Net (Shape-Aware Multi-Scale Detection Network) ni mtandao wa utambuzi wa vitu wa viwango vingi vya ukubwa unaozingatia umbo, uliotengenezwa kwa msingi wa YOLOv11s ili kuimarisha utambuzi wa vitu katika picha za chini ya maji zenye utofauti mdogo wa mwangaza, mipaka iliyofifia, maumbo ya shabaha yasiyo ya kawaida, makundi ya vitu yaliyosongamana, kufunikwa kwa sehemu na shabaha ndogo.

09/09/2026  Veri Anla Imetazamwa mara 45
SMD-Net: Mtandao wa Utambuzi wa Viwango Vingi vya Ukubwa Unaozingatia Umbo kwa Utambuzi wa Vitu Chini ya Maji

SMD-Net (Shape-Aware Multi-Scale Detection Network) ni mtandao wa utambuzi wa vitu wa viwango vingi vya ukubwa unaozingatia umbo, uliotengenezwa kwa msingi wa YOLOv11s ili kuimarisha utambuzi wa vitu katika picha za chini ya maji zenye utofauti mdogo wa mwangaza, mipaka iliyofifia, maumbo ya shabaha yasiyo ya kawaida, makundi ya vitu yaliyosongamana, kufunikwa kwa sehemu na shabaha ndogo. Modeli inaunganisha katika usanifu mmoja Shape-aware Feature Extraction Module (SFEM), inayoimarisha taarifa za umbo na maana; Progressive Multi-scale Fusion Module (PMFM), inayounganisha hatua kwa hatua vipengele vya ngazi ya juu na ya chini; tawi la ziada la High-Resolution Detection Branch (HRDB) lenye mwonekano wa 160×160; vichwa vya utambuzi vinavyotumia SEAM kusisitiza maeneo yanayoonekana ya shabaha; na kipimo cha hitilafu cha PIoU kinachoadhibu moja kwa moja kutolingana kwa mipaka ya visanduku. SMD-Net ilipata %67.2 AP, %85.4 AP50 na %75.0 AP75 kwenye mkusanyiko wa data wa DUO; %42.4 AP kwenye URPC2020; na %78.3 AP katika jaribio la uwezo wa kufanya kazi kwenye data nyingine la Trash-ICRA19. Ikiwa na vigezo milioni 10.68, 30.8 GFLOPs na 156 FPS kwenye jukwaa la majaribio la chanzo, modeli ilionyesha matokeo mazuri katika uwiano wa usahihi na gharama ya ukokotoaji.

Matokeo makuu ya utafiti si ongezeko la AP ya jumla pekee. Katika majaribio ya kuondoa na kuongeza vipengele kwenye DUO, SMD-Net kamili iliinua AP ya modeli ya msingi ya YOLOv11s kutoka %65.6 hadi %67.2, AP75 kutoka %73.0 hadi %75.0 na AP ya shabaha ndogo kutoka %43.9 hadi %48.9. Hata hivyo, utendaji hauongezeki mfululizo katika michanganyiko yote ya kati ya moduli; baadhi ya michanganyiko ina upungufu mdogo. Pia, ingawa SMD-Net ina matokeo bora zaidi ya AP ya jumla na AP ya shabaha ndogo kwenye URPC2020, haizidi matokeo yote ya kulinganisha katika AP50, AP75, na AP ya shabaha za ukubwa wa kati na kubwa. Kwa hiyo, chanzo kinaunga mkono kuwa modeli inatoa uwiano mzuri hasa katika usahihi wa jumla, utambuzi wa shabaha ndogo na baadhi ya masharti makali ya kubainisha mahali, wala si ubora wa moja kwa moja katika kila mkusanyiko wa data na kila kipimo.

Matokeo haya yanatokana na majaribio ya maono ya kompyuta yaliyofanywa bila muunganisho wa moja kwa moja kwa kutumia mikusanyiko mitatu ya data iliyo wazi kwa umma. Utafiti hauripoti matumizi ya muda mrefu katika mazingira halisi kwenye chombo halisi cha chini ya maji kinachojiendesha, uchanganuzi wa ucheleweshaji katika mifumo tofauti ya kamera/vifaa, au upimaji wa matumizi ya nishati wakati wa uchakataji wa papo hapo chini ya maji. Kwa hiyo, matokeo ya 156 FPS ni kipimo cha modeli kutoa utabiri kwenye jukwaa la majaribio lililotumia RTX 4090; hayathibitishi kuwa kasi hiyo hiyo itapatikana kwenye kompyuta halisi ya AUV yenye rasilimali chache.

Kwa nini ni vigumu kutambua vitu chini ya maji?

Tofauti na upigaji picha hewani, upigaji picha chini ya maji hupata upotoshaji mkubwa wa kifizikia kutokana na ufyonzwaji wa mwanga unaotegemea urefu wa mawimbi na mtawanyiko unaojirudia. Athari hizi hubadilisha nishati ya wigo, hupunguza utofauti wa mwangaza na kufifisha mipaka ya vitu. Aidha, viumbe vya baharini kufunikwa kwa sehemu na mawe, mchanga na mimea, shabaha nyingi ndogo kuwa karibu na nyingine, na jiometri isiyo ya kawaida ya shabaha hufanya uainishaji na ukadiriaji wa visanduku vya mipaka katika utambuzi wa vitu kuwa vigumu.

Kielelezo 1 cha chanzo kinaonyesha mifano ya shabaha za chini ya maji zilizofifia, zinazofunikana na zilizo katika makundi. Kielelezo hicho hicho kinaeleza kuwa shabaha ndogo na za ukubwa wa kati ni takribani %92 ya shabaha zote katika mkusanyiko wa data wa DUO. Katika mgawanyo kama huo, hatua zinazofuatana za kupunguza mwonekano katika kitambuzi cha kawaida zinaweza kupunguza zaidi taarifa za kingo na umbile za shabaha ndogo ambazo tayari zinawakilishwa na pikseli chache.

SMD-Net ni nini na imetengenezwa kutatua tatizo gani?

SMD-Net ni mtandao wa utambuzi wa vitu wa viwango vingi vya ukubwa, unaotumia msingi wa YOLOv11s na unaolenga kuboresha utambuzi wa vitu vya chini ya maji vyenye maumbo yasiyo ya kawaida, vidogo, vyenye utofauti mdogo wa mwangaza au vilivyofunikwa kwa sehemu. Modeli haitegemei uboreshaji mmoja tu; inatumia pamoja utoaji wa vipengele unaozingatia umbo kwa SFEM, uunganishaji wa pande mbili wa vipengele vya mwonekano wa juu na wa chini kwa PMFM, utabiri wa mwonekano wa juu wa 160×160 kwa HRDB, usisitizaji wa maeneo yanayoonekana ya shabaha kwa SEAM, na ukadiriaji wa visanduku unaozingatia mipaka kwa PIoU.

Usanifu wa jumla

Katika Kielelezo 2 cha chanzo, SMD-Net inaonyeshwa katika hatua kuu tatu: utoaji wa vipengele kwa ngazi katika mtandao wa msingi, uunganishaji wa vipengele vya viwango vingi vya ukubwa kupitia PMFM, na utambuzi katika viwango vinne tofauti vya ukubwa. SFEM ipo katika sehemu ya ngazi ya juu ya mtandao wa msingi. Moduli hii hutumia vipengele vya DySnake, SPPF na Tanhformer. Kisha vipengele vya ngazi mbalimbali hupelekwa kwenye PMFM. PMFM hujenga upya na kuunganisha vipengele kupitia njia za kutoka juu kwenda chini na kutoka chini kwenda juu. Katika hatua ya mwisho, ramani za vipengele za viwango vinne vya ukubwa hupelekwa kwenye vichwa vya utambuzi vyenye SEAM.

SFEM: utoaji wa vipengele unaozingatia umbo

Shape-aware Feature Extraction Module (SFEM) inalenga kuwakilisha hasa vitu virefu na vilivyopinda kama matango ya bahari, na mipaka yenye matawi kama ya nyota za baharini, bila kuvibana katika mpangilio wa kudumu wa uchukuaji sampuli wa mraba. Kielelezo 3 cha chanzo kinalinganisha mipangilio ya uchukuaji sampuli ya konvolusheni ya kawaida, konvolusheni iliyopanuliwa, konvolusheni inayoweza kubadilika umbo na DySnake.

Kwa nini DySnake inatofautiana na konvolusheni ya kawaida?

Badala ya kuhamisha nukta za uchukuaji sampuli kwa mikengeuko inayojifunzwa kila mmoja kivyake tu, konvolusheni ya DySnake hutumia mkakati wa uchukuaji sampuli unaokusanya mikengeuko hatua kwa hatua kutoka katikati ya kiini kuelekea nje; lengo ni kuhifadhi mwendelezo wa karibu kati ya nukta wakati zinafuata jiometri ya shabaha zilizopinda au ndefu. Katika konvolusheni ya kawaida gridi yenye mpangilio wa kawaida haibadiliki; katika konvolusheni iliyopanuliwa, nafasi za gridi huongezeka lakini jiometri hubaki yenye mpangilio wa kawaida; katika konvolusheni inayoweza kubadilika umbo, nukta husogea kwa uhuru zaidi. DySnake inalenga kudumisha pamoja urekebishaji kulingana na umbo na mwendelezo wa kijiometri.

Chanzo kinataja jiometri isiyo ya kawaida ya shabaha za DUO na URPC2020 kuwa sababu kuu ya uchaguzi huu. Katika jaribio la kuondoa na kuongeza vipengele vya SFEM, modeli kamili iliyotumia DySnakeConv ilipata %67.2 AP, %85.4 AP50 na %75.0 AP75 kwenye DUO. Hata hivyo, Star Conv ilitoa matokeo yaliyo juu kidogo katika AP ya shabaha ndogo: %49.0 ikilinganishwa na %48.9. Kwa hiyo, ubora wa DySnakeConv upo hasa katika uwiano wa vipimo vya jumla na vipimo vyenye masharti makali ya kubainisha mahali.

DynamicTanh na Tanhformer

Kwa kuwa miitikio ya chaneli ya vipengele vya ngazi ya juu inaweza kubaki bila uwiano baada ya DySnake na SPPF, DynamicTanh (DYT) hutumiwa ndani ya Tanhformer. Mlinganyo wa kwanza wa chanzo ni:

\[ \hat{x}_{c,h,w}=\omega_c \cdot \tanh(\alpha x_{c,h,w})+\beta_c \tag{1} \]

Hapa, \(x_{c,h,w}\) huwakilisha kipengele cha ingizo katika chaneli \(c\) na nafasi \((h,w)\); \(\alpha\) ni kigezo cha jumla cha kuongeza au kupunguza kiwango kinachojifunzwa; \(\omega_c\) ni kizidishi cha kiwango kinachojifunzwa kwa kila chaneli, na \(\beta_c\) ni kipengele cha upendeleo cha kila chaneli. Mwitikio wa kipengele unapokuwa mdogo, ubadilishaji wa tanh hufanya kazi takribani kwa uhusiano wa mstari na kuhifadhi kwa kiasi kikubwa taarifa za maana. Kwa miitikio mikubwa sana, hukaribia kiwango cha kujaa na kubana uamilishaji uliopitiliza pamoja na kelele za mandharinyuma.

DynamicTanh huwekwa ndani ya DynAttn-Block (DAB) kabla ya umakini wa ndani na kabla ya tawi la upitishaji wa mbele:

\[ X_d=X+\operatorname{Attn}(\operatorname{DYT}_1(X)) \tag{2} \]

\[ Y=X_d+\operatorname{FFN}(\operatorname{DYT}_2(X_d)) \tag{3} \]

Muundo huu wenye miunganisho ya mabaki hulenga kupunguza kutawala kwa miitikio mikali kupita kiasi ya chaneli kwa kurekebisha kiwango cha vipengele kabla ya ubadilishaji wa umakini na FFN.

PMFM: uunganishaji wa pande mbili na wa hatua kwa hatua wa viwango vingi vya ukubwa

Progressive Multi-scale Fusion Module (PMFM) hutumia njia ya pande mbili ili vipengele vya maana vya ngazi ya juu na maelezo ya kingo na umbile ya ngazi ya chini vikamilishane. Njia ya kutoka juu kwenda chini ina Reconstruction and Communication Module (RCM), uambatanishaji na vitalu vya C3K2; njia ya kutoka chini kwenda juu ina operesheni za Conv, Modulation Fusion Module (MFM) na DySnake. Matokeo yake ni ramani za vipengele vilivyounganishwa katika viwango vinne vya ukubwa.

PMFM huhifadhije maelezo ya shabaha ndogo za chini ya maji?

Badala ya kuongeza tu mwonekano wa vipengele vya ngazi ya juu vyenye mwonekano mdogo, PMFM hujenga upya muundo wa nafasi kwa RCM, huongeza taarifa za majirani katika mielekeo maalumu kupitia uhamishaji wa chaneli, na hurekebisha uzito wa mchango wa maana ya ngazi ya juu na maelezo ya ngazi ya chini kwa MFM kulingana na data. Hivyo, hupunguza upotevu wa taarifa za mipaka na umbile za shabaha ndogo wakati wa kupunguza mwonekano mara kwa mara, huku ikiwezesha taarifa za darasa za ngazi ya juu kupelekwa kwenye tabaka zenye mwonekano mkubwa zaidi.

RCM: ujenzi upya na mawasiliano ya kimwelekeo

Katika RCM, mwonekano wa kipengele cha ingizo kwanza huongezwa mara mbili, kisha konvolusheni ya kila chaneli hutumiwa:

\[ X_{in}=\operatorname{DWConv}(\operatorname{Up}(X_r)) \tag{4} \]

Kisha ramani ya vipengele hugawanywa katika makundi manne kwenye mhimili wa chaneli:

\[ [X_1,X_2,X_3,X_4]=\operatorname{Split}(X_{in}) \tag{5} \]

Uhamishaji wa mzunguko chanya na hasi katika mielekeo ya kimo na upana hutumiwa kwa makundi haya:

\[ \tilde{X}_1=\mathcal{R}^{+s}_{h}(X_1), \qquad \tilde{X}_2=\mathcal{R}^{-s}_{h}(X_2) \tag{6} \]

\[ \tilde{X}_3=\mathcal{R}^{+s}_{w}(X_3), \qquad \tilde{X}_4=\mathcal{R}^{-s}_{w}(X_4) \tag{7} \]

Hapa, \(h\) na \(w\) huwakilisha vipimo vya nafasi, na \(s\) kiasi cha uhamishaji. Mwishowe, makundi manne ya mielekeo huambatanishwa na kuunganishwa kwa konvolusheni ya 1×1:

\[ Y_r=\operatorname{Conv}_{1\times1} \left( \operatorname{Cat} (\tilde X_1,\tilde X_2,\tilde X_3,\tilde X_4) \right) \tag{8} \]

Jukumu la kisayansi la RCM ni kuunda mwingiliano wa ziada kuhusu mipaka ya shabaha na muundo wa karibu wa kimwelekeo, badala ya kuongeza tu msongamano wa pikseli baada ya kuongeza mwonekano.

MFM: kusawazisha maana ya ngazi ya juu na maelezo ya ngazi ya chini kulingana na data

Kwanza MFM hujumlisha matawi mawili ya vipengele:

\[ U=\tilde F_{high}+\tilde F_{low} \tag{9} \]

Kisha uzito wa kila tawi kwa kulinganisha na jingine hutengenezwa kwa ukusanyaji wa wastani wa jumla, MLP na Softmax:

\[ [\alpha_{high},\alpha_{low}] = \operatorname{Softmax} \left( \operatorname{MLP}(\operatorname{GAP}(U)) \right) \tag{10} \]

Kiwango cha matawi mawili hurekebishwa kwa uzito huu:

\[ \hat F_{high}=\alpha_{high}\odot\tilde F_{high} \tag{11} \]

\[ \hat F_{low}=\alpha_{low}\odot\tilde F_{low} \tag{12} \]

na huunganishwa tena:

\[ V=\hat F_{high}+\hat F_{low} \tag{13} \]

Tokeo la mwisho:

\[ Y_m= \operatorname{Conv} \left( \operatorname{Cat}(V,\tilde F_{low}) \right) \tag{14} \]

hufafanuliwa hivyo. Katika sentensi ya utangulizi wa kifungu hiki kidogo katika maandishi ya chanzo, vipengele viwili vya ingizo vimeandikwa kimakosa mara mbili kama \(\tilde F_{high}\); lakini Eq. (9)-(14), Kielelezo 6 na maelezo yaliyobaki yanaonyesha wazi kuwa matawi mawili ni \(\tilde F_{high}\) na \(\tilde F_{low}\). Kutolingana huku kwa uhariri hakujafichwa hapa.

HRDB: tawi la utambuzi lenye mwonekano wa juu wa 160×160

Katika muundo wa kawaida wa utabiri wa viwango vitatu vya ukubwa, kwa ingizo la 640×640, ramani ya vipengele yenye mwonekano mkubwa zaidi ni 80×80 na hatua ya kusogea ni 8. SMD-Net huongeza High-Resolution Detection Branch inayofanya kazi kwenye ramani ya vipengele ya 160×160. Hivyo, hatua ndogo zaidi ya kusogea hushuka kutoka 8 hadi 4. Lengo ni kupeleka mipaka, umbile na miundo ya karibu inayoonekana ya shabaha ndogo na zilizofunikwa kwa sehemu hadi hatua ya utabiri kwa mwonekano wa nafasi ulio juu zaidi.

SEAM: kuimarisha taarifa zinazoonekana za shabaha

Shabaha inapofunikwa kwa sehemu, mara nyingi mtandao huona kingo chache, umbile au sehemu za jiometri ya karibu pekee, wala si shabaha nzima. Kwa sababu hiyo, SMD-Net hutumia SEAM katika matawi ya ukadiriaji na uainishaji. Kwanza, muundo wa karibu:

\[ Z=\operatorname{DCovN}(X_s) \tag{15} \]

hutolewa kwa njia hiyo. Kisha uzito wa chaneli:

\[ a= \sigma \left( W_2\, \delta \left( W_1\operatorname{GAP}(Z) \right) \right) \tag{16} \]

huhesabiwa hivyo, na uzito wa vipengele vya ingizo hurekebishwa kwa:

\[ Y_s=X_s\odot\exp(a) \tag{17} \]

Hapa, \(\delta\) huwakilisha ReLU, \(\sigma\) Sigmoid, na \(\odot\) uzidishaji wa kila chaneli.

Mbinu na Matokeo ya Utafiti

Mikusanyiko ya data

Mkusanyiko wa dataIdadi ya pichaMadarasaJukumu katika utafiti
DUO7.782; 6.671 za mafunzo, 1.111 za majaribioHolothurian, echinus, scallop, starfishTathmini kuu ya usahihi, shabaha ndogo/za ukubwa wa kati, kufunikwa na kuondoa au kuongeza vipengele
URPC20205.543; 4.434 za mafunzo, 1.109 za majaribioMadarasa manne sawa na ya DUOUthibitishaji mkuu wa pili; kutokuwa na uwiano kwa madarasa kunakoonekana wazi
Trash-ICRA19Takribani 5.700Plastic, biological objects, ROVsTathmini ya uwezo wa kufanya kazi kwenye mikusanyiko tofauti ya data

Jukwaa la mafunzo na vigezo vya juu vya mafunzo

KigezoThamani
Mfumo wa uendeshajiWindows 11
Mfumo wa programuPyTorch 2.2.2
Python3.10.14
CUDA12.1
GPUNVIDIA RTX 4090, 24 GB
CPUIntel Core i7-13700K
Ukubwa wa ingizo640×640
Ukubwa wa kundi8
Mzunguko wa mafunzo300
KiboreshaSGD
Kasi ya awali ya kujifunza0.01
Msukumo0.937
Upunguzaji wa uzito0.0005

Vipimo vya tathmini

Utafiti hutumia vipimo vya COCO. AP ni wastani wa Average Precision unaohesabiwa kwenye vizingiti vya IoU=0.50 hadi 0.95 kwa hatua za 0.05. AP50 na AP75 huonyesha AP kwenye IoU ya 0.50 na 0.75 mtawalia; AP75 huhitaji uwekaji sahihi zaidi wa visanduku. APS, APM na APL hupima utendaji kwa vitu vidogo, vya ukubwa wa kati na vikubwa mtawalia. Idadi ya vigezo, FLOPs na FPS pia zimeripotiwa kando kwa ajili ya gharama ya ukokotoaji.

Matokeo ya DUO

 
KipimoSMD-NetMaelezo
AP%67.2Thamani ya juu zaidi katika jedwali la ulinganisho la chanzo
AP50%85.4Ya juu zaidi
AP75%75.0Ya juu zaidi; ubora katika ubainishaji wa mahali wenye masharti makali
APS%48.9AMSP-UOD iko juu kidogo kwa %49.0
APM%68.8Ya juu zaidi
APL%66.0DCM-YOLO iko juu zaidi kwa %66.4
Vigezo10.68 MUsanifu wenye mahitaji madogo kwa kulinganisha
FLOPs30.8 GSharti la jaribio la 640×640
FPS156Jukwaa la majaribio la RTX 4090

Ubora wa SMD-Net kwenye DUO unaonekana wazi katika AP ya jumla, AP50, AP75 na vipimo vya shabaha za ukubwa wa kati. Hata hivyo, jedwali la chanzo linaonyesha wazi kuwa modeli si ya kwanza katika kila kiwango cha ukubwa. Katika AP ya shabaha ndogo, AMSP-UOD yenye %49.0 inazidi kidogo thamani ya %48.9 ya SMD-Net; kwa shabaha kubwa, DCM-YOLO yenye %66.4 iko juu ya %66.0 ya SMD-Net.

Matokeo ya URPC2020

 
KipimoSMD-NetHali ya ulinganisho
AP%42.4Ya juu zaidi
AP50%75.4RT-DETR iko juu zaidi kwa %76.2
AP75%42.8Mamba-YOLO iko juu zaidi kwa %44.9
APS%41.9Ya juu zaidi
APM%31.9Iko juu ya baadhi ya matokeo ya kulinganisha; haipaswi kuwasilishwa kama bora zaidi kwa hali zote
APL%46.2RT-DETR iko juu zaidi kwa %46.9

Kuna jambo muhimu la kutofautisha katika matokeo ya URPC2020: SMD-Net inapata matokeo bora zaidi katika AP ya jumla na AP ya shabaha ndogo, lakini haizidi washindani wote katika AP50, AP75 na vipimo vya shabaha kubwa. Kwa hiyo, ubora wa modeli katika mkusanyiko huu wa data upo hasa katika uwiano wa jumla na utambuzi wa shabaha ndogo.

Matokeo ya uwezo wa kufanya kazi kwenye data nyingine ya Trash-ICRA19

KipimoSMD-NetHali
AP%78.3Ya juu zaidi kati ya mbinu zilizolinganishwa
AP50%97.3Ya juu zaidi
AP75%89.3Ya juu zaidi
APS%29.9YOLOv8s iko juu zaidi kwa %30.6
APM%66.8Ya juu zaidi
APL%83.4Ya juu zaidi

Jaribio hili hutoa ushahidi wa uwezo wa kufanya kazi kwenye mikusanyiko tofauti ya data kwa kutathmini modeli hiyo hiyo kwenye mkusanyiko mwingine wa data ya chini ya maji wenye muundo tofauti wa madarasa. Hata hivyo, matokeo haya hayamaanishi uwezo wa kufanya kazi kwa hali zote kwenye vihisi ambavyo haijawahi kuviona kabisa, bahari tofauti, mifumo tofauti ya mwangaza au shughuli za AUV za wakati halisi.

Matokeo ya utambuzi kwa tathmini ya kuona na Grad-CAM++

Vielelezo 10-13 vya chanzo vinalinganisha matokeo ya vitambuzi mbalimbali katika mifano migumu iliyochaguliwa, kama makundi ya shabaha yaliyosongamana, mipaka iliyofifia, vitu vidogo na kufunikwa sana kwa sehemu. Kulingana na uchanganuzi wa waandishi, SMD-Net hupunguza shabaha zinazokosekana na utambuzi chanya usio sahihi katika mifano hii, hasa ikitambua kwa uthabiti zaidi shabaha ambazo sehemu yake tu inaonekana.

Taswira za Grad-CAM++ katika Kielelezo 14 zinaonyesha kuwa, ikilinganishwa na YOLOv11s, SMD-Net hukusanya zaidi maeneo yenye mwitikio mkubwa karibu na shabaha halisi na hupunguza uamilishaji katika baadhi ya maeneo changamani ya mandharinyuma. Picha hizi ni ushahidi wa kuona unaounga mkono utaratibu wa modeli; kwa kuwa ni mifano iliyochaguliwa, zenyewe hazithibitishi kitakwimu utendaji wa jumla. Ushahidi mkuu wa matokeo ya kiasi ni majedwali ya AP.

Majaribio ya kuondoa na kuongeza moduli kuu

MuundoAPAP50AP75APS
Modeli ya msingi ya YOLOv11s65.684.073.043.9
SFEM pekee66.384.874.148.1
PMFM pekee66.384.774.346.8
HRDB pekee66.484.274.044.2
SEAM pekee66.284.774.343.8
PIoU pekee66.484.873.944.7
SFEM + PMFM66.284.873.545.9
SFEM + PMFM + HRDB66.985.174.946.7
+ SEAM67.185.274.846.6
SMD-Net kamili + PIoU67.285.475.048.9

Modeli kamili ilipata ongezeko la pointi za asilimia 1.6 katika AP, 1.4 katika AP50, 2.0 katika AP75 na 5.0 katika APS ikilinganishwa na modeli ya msingi. Hata hivyo, michango ya vipengele haijumlishiki kikamilifu. Kwa mfano, ingawa SFEM pekee na PMFM pekee kila moja hutoa 66.3 AP, zikiunganishwa hushuka hadi 66.2 AP. SEAM inapoongezwa, AP huongezeka lakini AP75 hushuka kidogo kutoka 74.9 hadi 74.8 na APS kutoka 46.7 hadi 46.6. Waandishi wa chanzo wanaeleza hali hii kwa mwingiliano na urekebishaji wa vipengele wakati wa uboreshaji wa pamoja.

Kwa nini PIoU ilitumika katika utafiti huu?

PIoU ni kipimo cha ukadiriaji wa visanduku kinachozingatia moja kwa moja hitilafu ya kulinganisha mipaka ya kushoto, kulia, juu na chini ya kisanduku kilichotabiriwa na kisanduku halisi, badala ya kuzingatia kitovu au IoU ya jumla pekee. Chini ya maji, mipaka ya shabaha inapofifia, shabaha zinapofunikana au kuwa karibu sana, hata kama kisanduku kilichotabiriwa kinanasa kitovu cha shabaha kwa usahihi, mipaka yake inaweza kujumuisha mandharinyuma mengi kupita kiasi; PIoU inalenga kuhimiza ubainishaji sahihi zaidi wa mahali kwa kurekebisha mikengeuko hii ya mipaka kulingana na kiwango.

Katika chanzo, kipengele cha mkengeuko wa mipaka:

\[ P= \frac{1}{4} \left( \frac{d_{w1}+d_{w2}}{w_{gt}} + \frac{d_{h1}+d_{h2}}{h_{gt}} \right) \tag{18} \]

kinafafanuliwa hivyo. \(d_{w1}\) na \(d_{w2}\) huwakilisha mikengeuko ya mipaka ya kushoto na kulia, \(d_{h1}\) na \(d_{h2}\) mikengeuko ya mipaka ya juu na chini; \(w_{gt}\) na \(h_{gt}\) huwakilisha upana na kimo cha kisanduku halisi. Hivyo, hitilafu ya mipaka hurekebishwa kulingana na kiwango cha ukubwa cha kitu chenyewe.

PIoU:

\[ PIoU=IoU+\exp(-P^2)-1 \tag{19} \]

imefafanuliwa hivyo. Kisanduku kilichotabiriwa kinapokaribia mipaka halisi, \(P\) hupungua na \(\exp(-P^2)\) hukaribia 1; hivyo thamani ya PIoU huongezeka. Kutolingana kwa mipaka kunapoongezeka, kipengele cha ziada hupungua.

Kipimo cha hitilafuAPAP50AP75APSAPMAPL
CIoU67.185.274.846.669.165.7
WIoU66.585.373.944.468.864.7
GIoU66.685.374.646.468.865.0
SIoU66.985.374.449.369.264.8
PIoU67.285.475.048.968.866.0

Jedwali linaonyesha kuwa PIoU inatoa matokeo bora zaidi katika AP, AP50, AP75 na APL. Hata hivyo, ingawa maandishi ya chanzo yanasema PIoU ina ubora kwa shabaha ndogo, thamani ya APS ya SIoU ya 49.3 iko juu kuliko 48.9 ya PIoU; SIoU pia katika APM ina 69.2, inayozidi 68.8 ya PIoU. Kwa hiyo, tafsiri sahihi inayotokana na jedwali ni kuwa PIoU ina nguvu zaidi hasa katika AP ya jumla na AP75 yenye masharti makali ya kubainisha mahali.

Utata wa ukokotoaji

Chanzo kimeripoti SMD-Net ikiwa na vigezo milioni 10.68, 30.8 GFLOPs na 156 FPS. Katika ulinganisho wa DUO, YOLOv8m ina vigezo 25.90 M, 78.9 G FLOPs na 143 FPS; YOLOv11m ina vigezo 20.03 M, 67.7 G FLOPs na 144 FPS; DCM-YOLO ina vigezo 12.51 M, 45.9 G FLOPs na 161 FPS. Dynamic-YOLO yenye vigezo 8.23 M, 12.5 G FLOPs na 184 FPS ina mahitaji madogo na kasi kubwa kuliko SMD-Net, lakini AP yake kwenye DUO ni %64.3. Matokeo haya yanaonyesha kuwa SMD-Net si modeli ndogo zaidi au ya kasi zaidi kwa hali zote, bali inatoa uwiano mzuri kati ya usahihi na gharama ya ukokotoaji.

Hitimisho linaloungwa mkono na lisiloungwa mkono na utafiti

Yanayoungwa mkono na utafitiYasiyoungwa mkono na utafiti
SMD-Net kupata thamani za juu zaidi za AP ya jumla, AP50 na AP75 kati ya mbinu zilizolinganishwa kwenye DUOSMD-Net kuwa bora kuliko washindani wote katika kila mkusanyiko wa data na kila kiwango cha ukubwa wa vitu
Vipengele vya SFEM, PMFM, HRDB, SEAM na PIoU kwa pamoja katika modeli kamili kuongeza utendaji ikilinganishwa na modeli ya msingiMchango wa kila moduli kuwa huru, wa mstari na unaoweza kujumlishwa na mingine
AP ya shabaha ndogo kwenye DUO kuongezeka kwa pointi za asilimia 5.0 ikilinganishwa na modeli ya msingiKuwa bora daima kuliko modeli zote mbadala au vipimo vyote vya hitilafu kwa shabaha ndogo zaidi
Kupatikana kwa matokeo mazuri ya uwezo wa kufanya kazi kwenye mikusanyiko tofauti ya data kwenye Trash-ICRA19Uwezo wa kufanya kazi kwa hali zote za bahari, kamera, mifumo ya mwangaza au maeneo ya kijiografia
Kupatikana kwa 156 FPS kwenye mfumo wa majaribio wa RTX 4090Kupatikana kwa FPS, matumizi ya nishati au ucheleweshaji uleule kwenye vifaa vya AUV vyenye rasilimali chache
Kuimarika kwa kulenga shabaha katika mifano iliyochaguliwa ya tathmini ya kuona na picha za Grad-CAM++Picha hizi pekee kuwa uthibitisho wa kitakwimu wa uwezo wa kufanya kazi katika hali nyingine

Vikwazo vikuu na kazi za baadaye

Utafiti unategemea mikusanyiko mitatu ya data iliyo wazi kwa umma na hauripoti jaribio la mfumo mzima katika mazingira halisi kwenye AUV halisi. Tathmini ya vifaa ilifanywa kwenye GPU yenye nguvu ya kompyuta ya mezani. Hakuna jaribio la muda mrefu katika mazingira halisi linalotathmini kwa pamoja tofauti za ubora wa maji, kina, mwangaza, optiki za kamera, ubanaji, kelele za vihisi na mwendo wa chombo halisi. Chanzo pia kina baadhi ya mabaki ya violezo vya uhariri na kutolingana kidogo kati ya maandishi na majedwali.

Katika kazi za baadaye, waandishi wanalenga kuongeza ustahimilivu katika mazingira halisi ya chini ya maji yaliyo tofauti zaidi, kuchunguza utekelezaji wenye mahitaji madogo kwa majukwaa yenye rasilimali chache, kupanua hadi utambuzi wa mazingira ya chini ya maji katika nyanja tofauti, na utambuzi wa vitu unaotumia video.

Dokezo kuhusu Chanzo na Mbinu

Kichwa asili: SMD-Net: A Shape-Aware Multi-Scale Detection Network for Underwater Object Detection

Waandishi: Qian Fan, Pengfei Zou, Ziyang Qi, Tian Hua, Runhao Chen, Ye Niu.

Mwandishi wa mawasiliano: Qian Fan; anwani fanqian@yzu.edu.cn imetolewa kwenye PDF.

Taasisi wanazohusiana nazo: College of Information Engineering, Yangzhou University, Yangzhou 225009, China; Graduate School of Engineering, Kyushu Institute of Technology, Fukuoka 804-8550, Japan; College of Animal Science and Technology, Yangzhou University, Yangzhou 225009, China.

Aina ya chanzo: Makala ya awali kabla ya uchapishaji rasmi. Kurasa za PDF zinaeleza wazi “This preprint research paper has not been peer reviewed”.

Jukwaa: SSRN; kiungo https://ssrn.com/abstract=7022170 kimetolewa kwenye PDF ya chanzo.

DOI: DOI haijaandikwa katika PDF iliyopakiwa na haikuweza kuthibitishwa kwa kujitegemea katika utafutaji wa taarifa za bibliografia kwenye wavuti uliopatikana; kwa hiyo DOI haikukisiwa.

Jarida / juzuu / toleo: PDF ya chanzo haina taarifa ya jarida maalumu, juzuu au toleo. Kauli ya kiolezo “Preprint submitted to Elsevier” inaonekana chini ya kurasa; kauli hii haimaanishi makala iliyochapishwa au kukubaliwa katika jarida maalumu la Elsevier.

Tarehe ya uchapishaji: Hakuna tarehe katika sehemu zinazoonekana za bibliografia za PDF iliyopakiwa; kwa kuwa hakuna tarehe iliyothibitishwa, haikuongezwa.

Leseni: PDF haijaeleza leseni ya wazi ya kutumia tena maudhui. Kabla ya kunakili vielelezo vya chanzo kama vilivyo, masharti ya leseni ya SSRN na mwenye haki yanapaswa kuthibitishwa kando.

Upatikanaji wa data: “Data zitatolewa baada ya kuombwa.”

Mgongano wa maslahi: Waandishi hawajaripoti mgongano wa maslahi ya kifedha unaojulikana au mahusiano binafsi yanayoweza kuathiri utafiti.

Dokezo la CRediT: Katika sehemu ya CRediT ya chanzo, viwakilishi vya kiolezo kama “First Author”, “Second Author” na “Third Author” vimebaki badala ya majina halisi ya waandishi. Kwa hiyo, si salama kuhusisha kwa uhakika majukumu ya mchango na waandishi maalumu. Chanzo kinataja kwa mwandishi wa kwanza uundaji wa dhana, mbinu, programu, uchunguzi, uchanganuzi rasmi, usimamizi wa data, uwasilishaji wa taswira na rasimu ya awali; kwa waandishi wa pili hadi wa nne, uthibitishaji, rasilimali na mapitio/uhariri; kwa waandishi wa tano hadi wa sita, programu, uthibitishaji na uwasilishaji wa taswira.

Madokezo ya uhariri/ulinganifu ndani ya chanzo:

MahaliHali iliyoonekana katika chanzoMbinu ya Verianla
Vichwa vya kurasaKiwakilishi “Short Title of the Article” kimeachwa katika kurasa nyingi.Hakikutafsiriwa kama matokeo ya kisayansi ya utafiti; kiliwekwa kama dokezo la baki la maandalizi ya makala ya awali.
CRediTFirst Author, Second Author na kadhalika vimetumika badala ya majina halisi.Michango haikuhusishwa kimyakimya na majina.
Maandishi ya MFMVipengele viwili vya ingizo vimeandikwa mara mbili kama \(\tilde F_{high}\) katika sentensi moja.Hitilafu ya maandishi iliachwa ionekane kwa kueleza kuwa Eq. (9)-(14) na Kielelezo 6 vina muundo wa \(\tilde F_{high}\) + \(\tilde F_{low}\).
Maelezo ya PIoU / Jedwali 6Maandishi yanasisitiza ubora wa PIoU kwa vitu vidogo; hata hivyo, SIoU APS=49.3, PIoU=48.9.Thamani ya namba katika jedwali ilipewa kipaumbele; ubora wa PIoU katika AP ya jumla na AP75 ulielezwa kando.
Jaribio la kuondoa na kuongeza konvolusheni za SFEMIngawa DySnake ni bora zaidi katika vipimo vya jumla, Star Conv katika APS ina 49.0, inayozidi thamani ya 48.9 ya DySnake.Haikufanywa kauli ya jumla kuwa “bora zaidi katika kila kipimo”.

Kikwazo kikuu cha kisayansi: Matokeo yanategemea mikusanyiko ya data iliyo wazi kwa umma na tathmini ya maabara/kituo cha kazi inayotumia RTX 4090. Matumizi katika mazingira halisi kwenye chombo halisi cha chini ya maji kinachojiendesha, matumizi ya nishati, ucheleweshaji wa vifaa vilivyopachikwa au shughuli za muda mrefu baharini havijathibitishwa.

Uchoraji upya wa vielelezo: Usanifu wa SMD-Net wa Kielelezo 2, jiometri za uchukuaji sampuli za Kielelezo 3, mtiririko wa RCM/MFM wa Vielelezo 5-6, jiometri ya mipaka ya PIoU ya Kielelezo 9 na uhusiano wa AP-FPS wa Kielelezo 15 vinaweza kuchorwa upya kama michoro/grafu asili za Verianla zinazofuata kwa uaminifu data za chanzo.

Verianla Live: Inafaa kwa ulinganisho wa DUO na URPC, majaribio ya kuondoa na kuongeza vipengele, ulinganisho wa vipimo vya hitilafu na uwiano wa AP-FPS. Uwasilishaji wa taswira wakati wa utekelezaji unapaswa kutumia thamani halisi za majedwali kama chanzo cha msingi cha ukweli; haupaswi kuzalisha thamani mpya za kati za AP/FPS.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy