Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Mühəndislik / SMD-Net: Sualtı Obyektlərin Aşkarlanması üçün Formaya Həssas Çoxmiqyaslı Aşkarlama Şəbəkəsi
Mühəndislik

SMD-Net: Sualtı Obyektlərin Aşkarlanması üçün Formaya Həssas Çoxmiqyaslı Aşkarlama Şəbəkəsi

SMD-Net (Shape-Aware Multi-Scale Detection Network), aşağı kontrast, bulanıq sərhədlər, nizamsız hədəf formaları, sıx obyekt qrupları, qismən örtülmələr və kiçik hədəflər olan sualtı təsvirlərdə obyekt aşkarlanmasını gücləndirmək üçün YOLOv11s əsasında hazırlanmış formaya həssas, çoxmiqyaslı obyekt aşkarlama şəbəkəsidir.

09/09/2026  Veri Anla 43 baxış
SMD-Net: Sualtı Obyektlərin Aşkarlanması üçün Formaya Həssas Çoxmiqyaslı Aşkarlama Şəbəkəsi

SMD-Net (Shape-Aware Multi-Scale Detection Network), aşağı kontrast, bulanıq sərhədlər, nizamsız hədəf formaları, sıx obyekt qrupları, qismən örtülmələr və kiçik hədəflər olan sualtı təsvirlərdə obyekt aşkarlanmasını gücləndirmək üçün YOLOv11s əsasında hazırlanmış formaya həssas, çoxmiqyaslı obyekt aşkarlama şəbəkəsidir. Model forma və semantik məlumatı gücləndirən Shape-aware Feature Extraction Module (SFEM), yüksək və aşağı səviyyəli əlamətləri mərhələli birləşdirən Progressive Multi-scale Fusion Module (PMFM), 160×160 ayırdetməli əlavə High-Resolution Detection Branch (HRDB), hədəfin görünən sahələrini vurğulayan SEAM əsaslı aşkarlama başlıqları və çərçivə sərhədlərinin hizalanmasını birbaşa cərimələyən PIoU itkisini eyni arxitekturada birləşdirir. SMD-Net DUO verilənlər dəstində %67.2 AP, %85.4 AP50 və %75.0 AP75; URPC2020-də %42.4 AP; Trash-ICRA19 ümumiləşdirmə təcrübəsində isə %78.3 AP əldə etmişdir. Model 10.68 milyon parametr, 30.8 GFLOPs və mənbənin təcrübə platformasında 156 FPS ilə dəqiqlik–hesablama tarazlığı baxımından güclü nəticə göstərmişdir.

Tədqiqatın ən güclü nəticəsi yalnız ümumi AP artımı deyil. DUO ablasiya sınaqlarında tam SMD-Net YOLOv11s baza modelinin AP qiymətini %65.6-dan %67.2-yə, AP75 qiymətini %73.0-dan %75.0-a və kiçik hədəf AP-sini %43.9-dan %48.9-a yüksəltmişdir. Bununla belə, bütün aralıq modul kombinasiyalarında göstəricilər monoton artmır; bəzi kombinasiyalarda kiçik azalmalar var. Həmçinin URPC2020-də SMD-Net ümumi AP və kiçik hədəf AP-si üzrə ən yaxşı nəticəni versə də, AP50, AP75, orta və böyük hədəf AP-si üzrə bütün müqayisələri üstələmir. Buna görə mənbə modelin hər verilənlər dəstində və hər meyarda mütləq üstünlüyünü deyil, xüsusən ümumi dəqiqlik, kiçik hədəflərin aşkarlanması və bəzi sərt lokallaşdırma şərtlərində güclü tarazlıq təmin etdiyini dəstəkləyir.

Bu nəticələr üç açıq verilənlər dəstində aparılmış oflayn kompüter görməsi təcrübələrinə əsaslanır. Tədqiqat real avtonom sualtı aparatda uzunmüddətli sahə tətbiqi, müxtəlif kamera/aparat zəncirlərində gecikmə analizi və ya sualtında real vaxtda enerji istehlakı ölçməsi bildirmir. Buna görə 156 FPS nəticəsi istifadə olunan RTX 4090 əsaslı təcrübə platformasında modelin çıxarış ölçməsidir; resursları məhdud real AUV kompüterində eyni sürətin alınacağını sübut etmir.

Sualtı obyekt aşkarlanması niyə çətindir?

Sualtı təsviralma havadakı təsviralmadan fərqli olaraq işığın dalğa uzunluğundan asılı udulması və çoxsaylı səpilməsi səbəbindən güclü fiziki təhriflərə məruz qalır. Bu təsirlər spektral enerjini dəyişdirir, kontrastı azaldır və obyekt sərhədlərini bulanıqlaşdırır. Bundan əlavə, dəniz canlılarının daş, qum və bitki örtüyü arasında qismən örtülməsi, çoxlu kiçik hədəfin bir-birinə yaxın olması və hədəflərin nizamsız həndəsəsi obyekt aşkarlanmasının həm təsnifat, həm də çərçivə reqressiyası tərəfini çətinləşdirir.

Mənbənin Şəkil 1-ində bulanıq, örtüşmüş və qruplaşmış sualtı hədəflərin nümunələri göstərilir. Eyni şəkildə DUO verilənlər dəstində kiçik və orta miqyaslı hədəflərin bütün hədəflərin təxminən %92-sini təşkil etdiyi bildirilir. Belə paylanmada standart detektorun ardıcıl aşağı nümunələmə əməliyyatları onsuz da az piksellə təmsil olunan kiçik hədəflərin kənar və tekstura məlumatını daha da azalda bilər.

SMD-Net nədir və hansı problemi həll etmək üçün hazırlanmışdır?

SMD-Net YOLOv11s əsaslı, nizamsız formalı, kiçik, aşağı kontrastlı və ya qismən örtülmüş sualtı obyektlərin aşkarlanmasını yaxşılaşdırmağa yönəlmiş çoxmiqyaslı obyekt aşkarlama şəbəkəsidir. Model tək təkmilləşdirməyə əsaslanmır; SFEM ilə formaya həssas əlamət çıxarılmasını, PMFM ilə yüksək və aşağı ayırdetməli əlamətlərin ikiistiqamətli birləşdirilməsini, HRDB ilə 160×160 yüksək ayırdetməli proqnozu, SEAM ilə görünən hədəf sahələrinin vurğulanmasını və PIoU ilə sərhədə həssas çərçivə reqressiyasını birlikdə istifadə edir.

Ümumi arxitektura

Mənbənin Şəkil 2-sində SMD-Net üç əsas mərhələdə göstərilir: əsas şəbəkədə iyerarxik əlamət çıxarılması, PMFM vasitəsilə çoxmiqyaslı əlamət birləşdirilməsi və dörd fərqli miqyasda aşkarlama. SFEM əsas şəbəkənin yüksək səviyyəli hissəsində yerləşir. Bu modul DySnake, SPPF və Tanhformer komponentlərindən istifadə edir. Sonra çoxsəviyyəli əlamətlər PMFM-ə ötürülür. PMFM yuxarıdan aşağıya və aşağıdan yuxarıya yollarla əlamətləri yenidən qurur və birləşdirir. Son mərhələdə dörd miqyaslı əlamət xəritələri SEAM ehtiva edən aşkarlama başlıqlarına göndərilir.

SFEM: formaya həssas əlamət çıxarılması

Shape-aware Feature Extraction Module (SFEM), xüsusən dəniz xiyarı kimi uzunsov və əyri obyektləri və dəniz ulduzu kimi şaxələnən konturları sabit kvadrat nümunələmə düzülüşünə məcbur etmədən təmsil etməyi hədəfləyir. Mənbənin Şəkil 3-ü standart konvolyusiya, genişləndirilmiş konvolyusiya, deformasiya olunan konvolyusiya və DySnake nümunələmə düzülüşlərini müqayisə edir.

DySnake standart konvolyusiyadan niyə fərqlənir?

DySnake konvolyusiyası nümunələmə nöqtələrini yalnız müstəqil öyrənilən ofsetlərlə hərəkət etdirmək əvəzinə nüvənin mərkəzindən kənara doğru mərhələli yığılan nümunələmə strategiyasından istifadə edir; bununla nöqtələrin əyri və ya uzunsov hədəf həndəsəsini izləyərkən yerli fasiləsizliyi saxlaması nəzərdə tutulur. Standart konvolyusiyada nizamlı tor sabitdir, genişləndirilmiş konvolyusiyada tor aralıqları artsa da həndəsə nizamlı qalır, deformasiya olunan konvolyusiyada isə nöqtələr daha sərbəst hərəkət edir; DySnake formaya uyğunlaşmanı və həndəsi fasiləsizliyi birlikdə saxlamağı hədəfləyir.

Mənbə DUO və URPC2020 hədəflərinin həndəsi nizamsızlığını bu seçimin əsas motivasiyası kimi göstərir. SFEM ablasiyasında DySnakeConv istifadə edən tam model DUO-da %67.2 AP, %85.4 AP50 və %75.0 AP75 əldə etmişdir. Bununla belə, Star Conv kiçik hədəf AP-si üzrə cüzi yüksək nəticə vermişdir: %48.9-a qarşı %49.0. Buna görə DySnakeConv-un üstünlüyü xüsusən ümumi göstəricilərin tarazlığında və sərt lokallaşdırma meyarlarındadır.

DynamicTanh və Tanhformer

DySnake və SPPF-dən sonra yüksək səviyyəli əlamətlərin kanal cavabları qeyri-taraz qala bildiyindən Tanhformer daxilində DynamicTanh (DYT) istifadə olunur. Mənbənin birinci tənliyi:

\[ \hat{x}_{c,h,w}=\omega_c \cdot \tanh(\alpha x_{c,h,w})+\beta_c \tag{1} \]

şəklindədir. Burada \(x_{c,h,w}\), \(c\) kanalında və \((h,w)\) mövqeyindəki giriş əlamətini; \(\alpha\) qlobal öyrənilən miqyas parametrini; \(\omega_c\) kanal üzrə öyrənilən miqyas əmsalını və \(\beta_c\) kanal üzrə sürüşmə terminini ifadə edir. Əlamət cavabı kiçik olduqda tanh çevrilməsi təxminən xətti davranaraq semantik məlumatı böyük ölçüdə saxlayır. Çox böyük cavablarda isə doyma həddinə yaxınlaşaraq həddindən artıq aktivləşmələri və fon küyünü sıxışdırır.

DynamicTanh, DynAttn-Block (DAB) daxilində həm özünədiqqətdən, həm də irəliötürmə qolundan əvvəl yerləşdirilir:

\[ X_d=X+\operatorname{Attn}(\operatorname{DYT}_1(X)) \tag{2} \]

\[ Y=X_d+\operatorname{FFN}(\operatorname{DYT}_2(X_d)) \tag{3} \]

Qalıq əlaqəli bu quruluş əlamətləri diqqət və FFN çevrilmələrindən əvvəl yenidən miqyaslandıraraq həddindən artıq güclü kanal cavablarının üstünlük təşkil etməsini azaltmağa yönəlir.

PMFM: ikiistiqamətli və mərhələli çoxmiqyaslı birləşdirmə

Progressive Multi-scale Fusion Module (PMFM) yüksək səviyyəli semantik əlamətlərlə aşağı səviyyəli kənar və tekstura detallarının bir-birini tamamlaması üçün ikiistiqamətli yoldan istifadə edir. Yuxarıdan aşağıya yol Reconstruction and Communication Module (RCM), konkatenasiya və C3K2 bloklarından; aşağıdan yuxarıya yol isə Conv, Modulation Fusion Module (MFM) və DySnake əməliyyatlarından ibarətdir. Çıxışda dörd miqyasda birləşdirilmiş əlamət xəritələri yaradılır.

PMFM kiçik sualtı hədəflərin detallarını necə qoruyur?

PMFM yalnız yüksək səviyyəli, aşağı ayırdetməli əlamətləri yuxarı nümunələmək əvəzinə RCM ilə məkan quruluşunu yenidən yaradır, kanal sürüşmələri ilə istiqamətli qonşuluq məlumatını əlavə edir və MFM ilə yüksək səviyyəli semantikanın və aşağı səviyyəli detalların töhfəsini adaptiv çəkiləndirir. Beləliklə, təkrarlanan aşağı nümunələmə zamanı kiçik hədəflərin sərhəd və tekstura məlumatının itirilməsini azaldarkən yüksək səviyyəli sinif məlumatının daha yüksək ayırdetməli qatlara daşınmasını təmin edir.

RCM: yenidənqurma və istiqamətli kommunikasiya

RCM-də giriş əlaməti əvvəlcə ikiqat yuxarı nümunələnir və kanal üzrə konvolyusiya tətbiq edilir:

\[ X_{in}=\operatorname{DWConv}(\operatorname{Up}(X_r)) \tag{4} \]

Sonra əlamət xəritəsi kanal oxu boyunca dörd qrupa bölünür:

\[ [X_1,X_2,X_3,X_4]=\operatorname{Split}(X_{in}) \tag{5} \]

Bu qruplara hündürlük və en istiqamətlərində müsbət və mənfi dövri sürüşmələr tətbiq olunur:

\[ \tilde{X}_1=\mathcal{R}^{+s}_{h}(X_1), \qquad \tilde{X}_2=\mathcal{R}^{-s}_{h}(X_2) \tag{6} \]

\[ \tilde{X}_3=\mathcal{R}^{+s}_{w}(X_3), \qquad \tilde{X}_4=\mathcal{R}^{-s}_{w}(X_4) \tag{7} \]

Burada \(h\) və \(w\) məkan ölçülərini, \(s\) sürüşmə miqdarını təmsil edir. Sonda dörd istiqamətli qrup birləşdirilərək 1×1 konvolyusiya ilə birləşdirmədən keçir:

\[ Y_r=\operatorname{Conv}_{1\times1} \left( \operatorname{Cat} (\tilde X_1,\tilde X_2,\tilde X_3,\tilde X_4) \right) \tag{8} \]

RCM-in elmi rolu yuxarı nümunələmədən sonra yalnız piksel sıxlığını artırmaq əvəzinə hədəf sərhədi və yerli istiqamətli quruluş haqqında əlavə qarşılıqlı təsir yaratmaqdır.

MFM: yüksək səviyyəli semantika ilə aşağı səviyyəli detalların adaptiv tarazlaşdırılması

MFM əvvəlcə iki əlamət qolunu toplayır:

\[ U=\tilde F_{high}+\tilde F_{low} \tag{9} \]

Sonra qlobal orta hovuzlama, MLP və Softmax ilə iki qol üçün nisbi çəkilər yaradılır:

\[ [\alpha_{high},\alpha_{low}] = \operatorname{Softmax} \left( \operatorname{MLP}(\operatorname{GAP}(U)) \right) \tag{10} \]

İki qol bu çəkilərlə yenidən miqyaslandırılır:

\[ \hat F_{high}=\alpha_{high}\odot\tilde F_{high} \tag{11} \]

\[ \hat F_{low}=\alpha_{low}\odot\tilde F_{low} \tag{12} \]

və yenidən birləşdirilir:

\[ V=\hat F_{high}+\hat F_{low} \tag{13} \]

Son çıxış:

\[ Y_m= \operatorname{Conv} \left( \operatorname{Cat}(V,\tilde F_{low}) \right) \tag{14} \]

kimi müəyyən edilir. Mənbə mətnində bu alt bölmənin giriş cümləsində iki giriş əlaməti səhvən iki dəfə \(\tilde F_{high}\) kimi yazılmışdır; lakin Eq. (9)-(14), Şəkil 6 və izahın qalan hissəsi iki qolun \(\tilde F_{high}\) və \(\tilde F_{low}\) olduğunu açıq göstərir. Bu redaktə uyğunsuzluğu burada gizlədilməmişdir.

HRDB: 160×160 yüksək ayırdetməli aşkarlama qolu

Standart üçmiqyaslı proqnoz quruluşunda 640×640 giriş üçün ən yüksək ayırdetməli əlamət xəritəsi 80×80 və addım 8-dir. SMD-Net buna 160×160 əlamət xəritəsində işləyən əlavə High-Resolution Detection Branch əlavə edir. Beləliklə, ən kiçik addım 8-dən 4-ə enir. Məqsəd kiçik və qismən örtülmüş hədəflərin sərhəd, tekstura və görünən yerli quruluşlarını proqnoz mərhələsinə qədər daha yüksək məkan ayırdetməsində daşımaqdır.

SEAM: görünən hədəf məlumatının gücləndirilməsi

Qismən örtülmədə şəbəkə çox vaxt hədəfin hamısını deyil, yalnız bir neçə kənar, tekstura və ya yerli həndəsi hissəni görə bilir. Buna görə SMD-Net reqressiya və təsnifat qollarında SEAM istifadə edir. Əvvəlcə yerli quruluş:

\[ Z=\operatorname{DCovN}(X_s) \tag{15} \]

ilə çıxarılır. Sonra kanal çəkisi:

\[ a= \sigma \left( W_2\, \delta \left( W_1\operatorname{GAP}(Z) \right) \right) \tag{16} \]

kimi hesablanır və giriş əlamətləri:

\[ Y_s=X_s\odot\exp(a) \tag{17} \]

ilə yenidən çəkiləndirilir. \(\delta\) ReLU-nu, \(\sigma\) Sigmoid-i, \(\odot\) isə kanal üzrə vurmanı ifadə edir.

Tədqiqatın Metodu və Nəticələri

Verilənlər dəstləri

Verilənlər dəstiTəsvir sayıSiniflərTədqiqatdakı rolu
DUO7.782; 6.671 təlim, 1.111 sınaqHolothurian, echinus, scallop, starfishƏsas dəqiqlik, kiçik/orta hədəf, örtülmə və ablasiya qiymətləndirilməsi
URPC20205.543; 4.434 təlim, 1.109 sınaqDUO ilə eyni dörd sinifİkinci əsas yoxlama; nəzərəçarpan sinif qeyri-tarazlığı
Trash-ICRA19Təxminən 5.700Plastic, biological objects, ROVsVerilənlər dəstləri arasında ümumiləşdirmənin qiymətləndirilməsi

Təlim platforması və hiperparametrlər

ParametrQiymət
Əməliyyat sistemiWindows 11
Proqram çərçivəsiPyTorch 2.2.2
Python3.10.14
CUDA12.1
GPUNVIDIA RTX 4090, 24 GB
CPUIntel Core i7-13700K
Giriş ölçüsü640×640
Paket ölçüsü8
Epoxa300
OptimallaşdırıcıSGD
İlkin öyrənmə sürəti0.01
İmpuls0.937
Çəki azalması0.0005

Qiymətləndirmə metrikləri

Tədqiqat COCO meyarlarından istifadə edir. AP, IoU=0.50 ilə 0.95 arasındakı hədlərdə 0.05 addımlarla hesablanan Average Precision qiymətlərinin ortasıdır. AP50 və AP75 müvafiq olaraq IoU 0.50 və 0.75-dəki AP-ni göstərir; AP75 daha dəqiq çərçivə yerləşdirilməsi tələb edir. APS, APM və APL müvafiq olaraq kiçik, orta və böyük obyektlərdəki göstəriciləri ölçür. Hesablama xərci üçün parametr sayı, FLOPs və FPS də ayrıca bildirilmişdir.

DUO nəticələri

 
MetrikSMD-NetŞərh
AP%67.2Mənbənin müqayisə cədvəlində ən yüksək qiymət
AP50%85.4Ən yüksək
AP75%75.0Ən yüksək; sərt lokallaşdırma üstünlüyü
APS%48.9AMSP-UOD %49.0 ilə cüzi yüksəkdir
APM%68.8Ən yüksək
APL%66.0DCM-YOLO %66.4 ilə daha yüksəkdir
Parametr10.68 MNisbətən yüngül arxitektura
FLOPs30.8 G640×640 təcrübə şərti
FPS156RTX 4090 təcrübə platforması

SMD-Net-in DUO-dakı üstünlüyü ümumi AP, AP50, AP75 və orta hədəf göstəricilərində aydındır. Lakin mənbə cədvəli modelin hər miqyasda birinci olmadığını açıq göstərir. Kiçik hədəf AP-sində AMSP-UOD %49.0 ilə SMD-Net-in %48.9 qiymətini cüzi üstələyir, böyük hədəflərdə isə DCM-YOLO %66.4 ilə SMD-Net-in %66.0 qiymətindən yüksəkdir.

URPC2020 nəticələri

 
MetrikSMD-NetMüqayisədəki vəziyyət
AP%42.4Ən yüksək
AP50%75.4RT-DETR %76.2 ilə daha yüksəkdir
AP75%42.8Mamba-YOLO %44.9 ilə daha yüksəkdir
APS%41.9Ən yüksək
APM%31.9Bəzi müqayisələrdən yüksəkdir; mütləq ən yaxşı kimi təqdim edilməməlidir
APL%46.2RT-DETR %46.9 ilə daha yüksəkdir

URPC2020 nəticəsində mühüm incəlik var: SMD-Net ümumi AP və kiçik hədəf AP-si üzrə ən yaxşı nəticəni alır; lakin AP50, AP75 və böyük hədəf meyarlarında bütün rəqibləri üstələmir. Buna görə bu verilənlər dəstində modelin üstünlüyü xüsusən ümumi tarazlıq və kiçik hədəflərin aşkarlanmasıdır.

Trash-ICRA19 ümumiləşdirmə nəticələri

MetrikSMD-NetVəziyyət
AP%78.3Müqayisə edilən üsullar arasında ən yüksək
AP50%97.3Ən yüksək
AP75%89.3Ən yüksək
APS%29.9YOLOv8s %30.6 ilə daha yüksəkdir
APM%66.8Ən yüksək
APL%83.4Ən yüksək

Bu təcrübə eyni modeli sinif tərkibi fərqli olan başqa sualtı verilənlər dəstində qiymətləndirərək dəstlərarası ümumiləşdirmə üçün sübut verir. Lakin bu nəticə tamamilə görülməmiş sensorlar, müxtəlif dənizlər, müxtəlif işıqlandırma sistemləri və ya real vaxtlı AUV əməliyyatlarında universal ümumiləşdirmə demək deyil.

Keyfiyyət baxımından aşkarlama və Grad-CAM++ nəticələri

Mənbənin Şəkil 10-13-ündə sıx hədəf qrupları, bulanıq sərhədlər, kiçik obyektlər və güclü qismən örtülmə kimi seçilmiş çətin nümunələrdə müxtəlif detektorların nəticələri müqayisə edilir. Müəlliflərin analizinə görə SMD-Net bu nümunələrdə gözdən qaçan hədəflərin və yanlış müsbətlərin sayını azaldır, xüsusən yalnız bir hissəsi görünən hədəfləri daha sabit aşkarlayır.

Şəkil 14-dəki Grad-CAM++ vizuallaşdırmaları YOLOv11s ilə müqayisədə SMD-Net-in yüksək cavab sahələrini real hədəf ətrafında daha sıx saxladığını və bəzi mürəkkəb fon sahələrində aktivləşməni azaltdığını göstərir. Bu təsvirlər mexanizmi dəstəkləyən keyfiyyət sübutudur; seçilmiş nümunələr olduğundan ümumi göstəricilərin təkbaşına statistik sübutu deyil. Kəmiyyət nəticələrinin əsas sübutu AP cədvəlləridir.

Əsas modulların ablasiyası

QuruluşAPAP50AP75APS
YOLOv11s baza modeli65.684.073.043.9
Yalnız SFEM66.384.874.148.1
Yalnız PMFM66.384.774.346.8
Yalnız HRDB66.484.274.044.2
Yalnız SEAM66.284.774.343.8
Yalnız PIoU66.484.873.944.7
SFEM + PMFM66.284.873.545.9
SFEM + PMFM + HRDB66.985.174.946.7
+ SEAM67.185.274.846.6
Tam SMD-Net + PIoU67.285.475.048.9

Tam model baza modelinə nisbətən AP-də 1.6, AP50-də 1.4, AP75-də 2.0 və APS-də 5.0 faiz bəndi artım təmin etmişdir. Lakin komponent töhfələri tam toplanan deyil. Məsələn, yalnız SFEM və yalnız PMFM hər biri 66.3 AP versə də, birlikdə 66.2 AP-yə enirlər. SEAM əlavə edildikdə AP artsa da AP75 74.9-dan 74.8-ə və APS 46.7-dən 46.6-ya cüzi enir. Mənbənin müəllifləri bunu birgə optimallaşdırmada əlamətlərin qarşılıqlı təsiri və uyğunlaşması ilə izah edirlər.

PIoU bu tədqiqatda niyə istifadə edilmişdir?

PIoU proqnoz çərçivəsinin yalnız mərkəzini və ya ümumi IoU qiymətini deyil, sol, sağ, üst və alt sərhədlərinin real çərçivə ilə hizalanma xətasını birbaşa nəzərə alan çərçivə reqressiyası meyarıdır. Sualtında hədəf sərhədləri bulanıq, hədəflər örtüşmüş və ya bir-birinə çox yaxın olduqda proqnoz çərçivəsi hədəfin mərkəzini düzgün tutsa belə, sərhədləri fonu həddindən artıq əhatə edə bilər; PIoU bu sərhəd yayınmalarını normallaşdıraraq daha dəqiq lokallaşdırmanı təşviq etməyi hədəfləyir.

Mənbədə sərhəd yayınması termini:

\[ P= \frac{1}{4} \left( \frac{d_{w1}+d_{w2}}{w_{gt}} + \frac{d_{h1}+d_{h2}}{h_{gt}} \right) \tag{18} \]

kimi müəyyən edilir. \(d_{w1}\) və \(d_{w2}\) sol-sağ sərhəd yayınmalarını, \(d_{h1}\) və \(d_{h2}\) üst-alt sərhəd yayınmalarını; \(w_{gt}\) və \(h_{gt}\) real çərçivənin enini və hündürlüyünü təmsil edir. Beləliklə, sərhəd xətası obyektin öz miqyasına görə normallaşdırılır.

PIoU:

\[ PIoU=IoU+\exp(-P^2)-1 \tag{19} \]

şəklində müəyyən edilmişdir. Proqnoz çərçivəsi real sərhədlərə yaxınlaşdıqda \(P\) kiçilir və \(\exp(-P^2)\) 1-ə yaxınlaşır; buna görə PIoU qiyməti yüksəlir. Sərhəd uyğunsuzluğu böyüdükcə əlavə termin kiçilir.

İtkiAPAP50AP75APSAPMAPL
CIoU67.185.274.846.669.165.7
WIoU66.585.373.944.468.864.7
GIoU66.685.374.646.468.865.0
SIoU66.985.374.449.369.264.8
PIoU67.285.475.048.968.866.0

Cədvəl PIoU-nun AP, AP50, AP75 və APL-də ən yaxşı nəticəni verdiyini göstərir. Lakin mənbə mətnində PIoU-nun kiçik hədəflərdə üstün olduğu deyilsə də SIoU-nun APS qiyməti 49.3 ilə PIoU-nun 48.9 qiymətindən yüksəkdir; SIoU həmçinin APM-də 69.2 ilə PIoU-nun 68.8 qiymətini üstələyir. Buna görə cədvələ əsaslanan düzgün şərh PIoU-nun xüsusən ümumi AP və sərt lokallaşdırma AP75 baxımından daha güclü olmasıdır.

Hesablama mürəkkəbliyi

Mənbədə SMD-Net 10.68 milyon parametr, 30.8 GFLOPs və 156 FPS ilə bildirilmişdir. DUO müqayisəsində YOLOv8m 25.90 M parametr, 78.9 G FLOPs və 143 FPS; YOLOv11m 20.03 M parametr, 67.7 G FLOPs və 144 FPS; DCM-YOLO 12.51 M parametr, 45.9 G FLOPs və 161 FPS-dir. Dynamic-YOLO 8.23 M parametr, 12.5 G FLOPs və 184 FPS ilə SMD-Net-dən yüngül və sürətlidir, lakin DUO AP-si %64.3-dür. Bu nəticələr SMD-Net-in mütləq ən kiçik və ya ən sürətli model olmadığını, dəqiqliklə hesablama xərci arasında güclü tarazlıq verdiyini göstərir.

Tədqiqatın dəstəklədiyi və dəstəkləmədiyi nəticə çıxarışları

Tədqiqatın dəstəklədiyiTədqiqatın dəstəkləmədiyi
SMD-Net-in DUO-da müqayisə edilən üsullar arasında ən yüksək ümumi AP, AP50 və AP75 qiymətlərini əldə etməsiSMD-Net-in hər verilənlər dəstində və hər obyekt miqyasında bütün rəqiblərdən üstün olması
SFEM, PMFM, HRDB, SEAM və PIoU komponentlərinin tam modeldə birlikdə baza modelinə nisbətən göstəriciləri artırmasıHər modulun töhfəsinin müstəqil, xətti və bir-birinə əlavə edilə bilən olması
DUO-da kiçik hədəf AP-sinin baza modelinə nisbətən 5.0 faiz bəndi yüksəlməsiƏn kiçik hədəflərdə bütün alternativ modellərdən və ya bütün itki funksiyalarından həmişə üstün olması
Trash-ICRA19-da yaxşı dəstlərarası ümumiləşdirmə nəticəsinin əldə edilməsiBütün dəniz şəraitlərində, kameralarda, işıqlandırma sistemlərində və ya coğrafiyalarda universal ümumiləşdirmə
RTX 4090 təcrübə sistemində 156 FPS əldə edilməsiResursları məhdud AUV aparatında eyni FPS, enerji istehlakı və ya gecikmənin əldə ediləcəyi
Seçilmiş keyfiyyət nümunələrində və Grad-CAM++ təsvirlərində hədəfə fokuslanmanın yaxşılaşmasıBu təsvirlərin təkbaşına statistik ümumiləşdirmə sübutu olması

Əsas məhdudiyyətlər və gələcək işlər

Tədqiqat üç açıq verilənlər dəstinə əsaslanır və real AUV-də başdan sona sahə sınağı bildirmir. Aparat qiymətləndirilməsi güclü masaüstü GPU-da aparılmışdır. Müxtəlif su keyfiyyəti, dərinlik, işıqlandırma, kamera optikası, sıxışdırma, sensor küyü və real aparat hərəkətinin birlikdə qiymətləndirildiyi uzunmüddətli sahə təcrübəsi yoxdur. Mənbədə həmçinin bəzi redaktə şablonu qalıqları və kiçik mətn–cədvəl uyğunsuzluqları var.

Müəlliflər gələcək işlərdə daha müxtəlif real sualtı mühitlərdə dayanıqlığın artırılmasını, resursları məhdud platformalar üçün yüngül tətbiqin araşdırılmasını, domenlərarası sualtı qavramaya genişlənməni və video əsaslı obyekt aşkarlanmasını hədəfləyirlər.

Mənbə və Metod Qeydi

Orijinal başlıq: SMD-Net: A Shape-Aware Multi-Scale Detection Network for Underwater Object Detection

Müəlliflər: Qian Fan, Pengfei Zou, Ziyang Qi, Tian Hua, Runhao Chen, Ye Niu.

Məsul müəllif: Qian Fan; PDF-də fanqian@yzu.edu.cn ünvanı verilmişdir.

Qurum mənsubiyyətləri: College of Information Engineering, Yangzhou University, Yangzhou 225009, China; Graduate School of Engineering, Kyushu Institute of Technology, Fukuoka 804-8550, Japan; College of Animal Science and Technology, Yangzhou University, Yangzhou 225009, China.

Mənbə növü: Ön nəşr. PDF səhifələrində “This preprint research paper has not been peer reviewed” ifadəsi açıq yer alır.

Platforma: SSRN; mənbə PDF-də https://ssrn.com/abstract=7022170 bağlantısı verilmişdir.

DOI: Yüklənmiş PDF-də DOI yazılmamışdır və əlçatan biblioqrafik veb axtarışında müstəqil təsdiqlənə bilmədiyindən DOI təxmin edilməmişdir.

Jurnal / cild / nömrə: Mənbə PDF-də konkret jurnal, cild və ya nömrə məlumatı yoxdur. Səhifələrin altında “Preprint submitted to Elsevier” şablon ifadəsi görünür; bu ifadə konkret Elsevier jurnalında dərc edilmiş və ya qəbul olunmuş məqalə demək deyil.

Nəşr tarixi: Yüklənmiş PDF-nin görünən biblioqrafik sahələrində tarix yoxdur; təsdiqlənmiş tarix olmadığı üçün əlavə edilməmişdir.

Lisenziya: PDF-də açıq təkrar istifadə lisenziyası göstərilməmişdir. Mənbə şəkillərini eynilə köçürməzdən əvvəl SSRN və hüquq sahibinin lisenziya şərtləri ayrıca təsdiqlənməlidir.

Verilənlərin əlçatanlığı: “Verilənlər sorğu əsasında təqdim ediləcək.”

Maraqlar toqquşması: Müəlliflər məlum maliyyə maraqları toqquşması və ya tədqiqata təsir edə biləcək şəxsi münasibət bildirməmişlər.

CRediT qeydi: Mənbənin CRediT bölməsində real müəllif adları əvəzinə “First Author”, “Second Author”, “Third Author” kimi şablon yer tutucuları qalmışdır. Buna görə töhfə rollarını konkret müəlliflərlə qəti əlaqələndirmək etibarlı deyil. Mənbə ilk müəllif üçün konseptuallaşdırma, metodologiya, proqram təminatı, araşdırma, formal analiz, verilənlərin təşkili, vizuallaşdırma və ilkin mətn; ikinci–dördüncü müəlliflər üçün yoxlama, resurslar və nəzərdən keçirmə/redaktə; beşinci–altıncı müəlliflər üçün proqram təminatı, yoxlama və vizuallaşdırma rollarını göstərir.

Mənbədaxili redaktə/uyğunluq qeydləri:

YerMənbədə müşahidə olunan vəziyyətVerianla yanaşması
Səhifə başlıqları“Short Title of the Article” yer tutucusu çoxsaylı səhifələrdə saxlanmışdır.Tədqiqatın elmi nəticəsi kimi şərh edilmədi; ön nəşr hazırlığının qalığı kimi qeyd edildi.
CRediTReal adlar əvəzinə First Author, Second Author və s. istifadə edilmişdir.Töhfələr adlara səssizcə təyin edilmədi.
MFM mətniİki giriş əlaməti bir cümlədə iki dəfə \(\tilde F_{high}\) kimi yazılmışdır.Eq. (9)-(14) və Şəkil 6-nın \(\tilde F_{high}\) + \(\tilde F_{low}\) quruluşunda olduğu izah edilərək mətn səhvi görünən saxlanıldı.
PIoU şərhi / Cədvəl 6Mətn PIoU-nun kiçik obyektlərdə üstünlüyünü vurğulayır; lakin SIoU APS=49.3, PIoU=48.9-dur.Cədvəldəki ədəd əsas götürüldü; PIoU-nun ümumi AP və AP75 üstünlüyü ayrıca göstərildi.
SFEM konvolyusiya ablasiyasıDySnake ümumi meyarlarda ən yaxşı olsa da Star Conv APS-də 49.0 ilə DySnake-ın 48.9 qiymətini üstələyir.“Hər meyarda ən yaxşı” şəklində ümumiləşdirmə edilmədi.

Əsas elmi məhdudiyyət: Nəticələr açıq verilənlər dəstlərinə və RTX 4090 əsaslı laboratoriya/iş stansiyası qiymətləndirilməsinə əsaslanır. Real avtonom sualtı aparatda sahə tətbiqi, enerji istehlakı, quraşdırılmış aparat gecikməsi və ya uzunmüddətli dəniz əməliyyatı təsdiqlənməmişdir.

Təsvirlərin yenidən çəkilməsi: Şəkil 2 SMD-Net arxitekturası, Şəkil 3 nümunələmə həndəsələri, Şəkil 5-6 RCM/MFM axını, Şəkil 9 PIoU sərhəd həndəsəsi və Şəkil 15 AP-FPS əlaqəsi mənbə verilənlərinə sadiq orijinal Verianla sxemləri/qrafikləri kimi yenidən çəkilə bilər.

Verianla Live: DUO və URPC müqayisələri, komponent ablasiyası, itki müqayisəsi və AP-FPS tarazlığı üçün uyğundur. İcra vaxtı vizuallaşdırması real cədvəl qiymətlərini əsas həqiqət mənbəyi kimi istifadə etməli; yeni aralıq AP/FPS qiymətləri yaratmamalıdır.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy