Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Mühendislik / SMD-Net: Sualtı Nesne Tespiti için Şekil-Duyarlı Çok Ölçekli Algılama Ağı
Mühendislik

SMD-Net: Sualtı Nesne Tespiti için Şekil-Duyarlı Çok Ölçekli Algılama Ağı

SMD-Net (Shape-Aware Multi-Scale Detection Network), düşük kontrast, bulanık sınırlar, düzensiz hedef şekilleri, yoğun nesne kümeleri, kısmi örtüşmeler ve küçük hedefler bulunan sualtı görüntülerinde nesne tespitini güçlendirmek amacıyla YOLOv11s tabanı üzerinde geliştirilen şekil-duyarlı ve çok ölçekli bir nesne algılama ağıdır.

09/09/2026  Veri Anla 49 görüntüleme
SMD-Net: Sualtı Nesne Tespiti için Şekil-Duyarlı Çok Ölçekli Algılama Ağı

SMD-Net (Shape-Aware Multi-Scale Detection Network), düşük kontrast, bulanık sınırlar, düzensiz hedef şekilleri, yoğun nesne kümeleri, kısmi örtüşmeler ve küçük hedefler bulunan sualtı görüntülerinde nesne tespitini güçlendirmek amacıyla YOLOv11s tabanı üzerinde geliştirilen şekil-duyarlı ve çok ölçekli bir nesne algılama ağıdır. Model; şekil ve semantik bilgiyi güçlendiren Shape-aware Feature Extraction Module (SFEM), yüksek ve düşük seviyeli özellikleri aşamalı olarak birleştiren Progressive Multi-scale Fusion Module (PMFM), 160×160 çözünürlüklü ek High-Resolution Detection Branch (HRDB), görünür hedef bölgelerini vurgulayan SEAM tabanlı algılama kafaları ve kutu sınır hizalamasını doğrudan cezalandıran PIoU kaybını tek mimaride birleştirir. DUO veri kümesinde SMD-Net %67.2 AP, %85.4 AP50 ve %75.0 AP75; URPC2020'de %42.4 AP; Trash-ICRA19 genelleme deneyinde ise %78.3 AP elde etmiştir. Model 10.68 milyon parametre, 30.8 GFLOPs ve kaynak deney platformunda 156 FPS ile doğruluk-hesaplama dengesi açısından güçlü sonuç vermiştir.

Çalışmanın en güçlü sonucu yalnız genel AP artışı değildir. DUO ablasyonlarında tam SMD-Net, YOLOv11s taban çizgisinin AP değerini %65.6'dan %67.2'ye, AP75 değerini %73.0'dan %75.0'a ve küçük hedef AP'sini %43.9'dan %48.9'a yükseltmiştir. Bununla birlikte tüm ara modül kombinasyonlarında performans monoton biçimde artmamaktadır; bazı kombinasyonlarda küçük düşüşler bulunmaktadır. Ayrıca URPC2020'de SMD-Net genel AP ve küçük hedef AP'sinde en iyi sonucu verirken AP50, AP75, orta ve büyük hedef AP'sinde tüm karşılaştırmaları geçmemektedir. Dolayısıyla kaynak, modelin her veri kümesinde ve her ölçütte mutlak üstün olduğunu değil, özellikle genel doğruluk, küçük hedef algısı ve bazı katı yerelleştirme koşullarında güçlü bir denge sağladığını desteklemektedir.

Bu sonuçlar üç kamuya açık veri kümesi üzerinde elde edilmiş çevrimdışı bilgisayarlı görü deneylerine dayanır. Çalışma gerçek bir otonom sualtı aracı üzerinde uzun süreli saha konuşlandırması, farklı kamera/donanım zincirlerinde gecikme analizi veya sualtında gerçek zamanlı enerji tüketimi ölçümü raporlamamaktadır. Bu nedenle 156 FPS sonucu, kullanılan RTX 4090 tabanlı deney platformuna ait bir model çıkarım ölçümüdür; kaynak kısıtlı gerçek bir AUV bilgisayarında aynı hızın elde edileceğini kanıtlamaz.

Sualtı nesne tespiti neden zordur?

Sualtı görüntüleme, havadaki görüntülemeden farklı olarak ışığın dalga boyuna bağlı soğurulması ve çoklu saçılması nedeniyle güçlü fiziksel bozulmalara maruz kalır. Bu etkiler spektral enerjiyi değiştirir, kontrastı azaltır ve nesne sınırlarını bulanıklaştırır. Bunun üzerine deniz canlılarının taş, kum ve bitki örtüsü arasında kısmen örtülmesi, çok sayıda küçük hedefin birbirine yakın bulunması ve hedeflerin düzensiz geometrilere sahip olması nesne tespitinin hem sınıflandırma hem de kutu regresyonu tarafını zorlaştırır.

Kaynağın Figür 1'inde bulanık, örtüşmüş ve kümelenmiş sualtı hedeflerinin örnekleri gösterilmektedir. Aynı figürde DUO veri kümesindeki küçük ve orta ölçekli hedeflerin toplam hedeflerin yaklaşık %92'sini oluşturduğu belirtilmektedir. Böyle bir dağılımda standart bir algılayıcının art arda yaptığı downsampling işlemleri, zaten az sayıda piksel tarafından temsil edilen küçük hedeflerin kenar ve doku bilgisini daha da azaltabilir.

SMD-Net nedir ve hangi problemi çözmek için tasarlanmıştır?

SMD-Net, YOLOv11s tabanlı ve düzensiz şekilli, küçük, düşük kontrastlı veya kısmen örtülü sualtı nesnelerinin tespitini geliştirmeyi amaçlayan çok ölçekli bir nesne algılama ağıdır. Model tek bir iyileştirmeye dayanmaz; SFEM ile şekil-duyarlı özellik çıkarımı, PMFM ile yüksek ve düşük çözünürlüklü özelliklerin çift yönlü füzyonu, HRDB ile 160×160 yüksek çözünürlüklü tahmin, SEAM ile görünür hedef bölgelerinin vurgulanması ve PIoU ile sınır-duyarlı kutu regresyonunu birlikte kullanır.

Genel mimari

Kaynak Figür 2'de SMD-Net üç ana aşama halinde gösterilmektedir: omurga üzerinde hiyerarşik özellik çıkarımı, PMFM üzerinden çok ölçekli özellik füzyonu ve dört farklı ölçekte algılama. SFEM omurganın yüksek seviyeli bölümünde yer alır. Bu modül DySnake, SPPF ve Tanhformer bileşenlerini kullanır. Daha sonra çok seviyeli özellikler PMFM'ye aktarılır. PMFM yukarıdan aşağıya ve aşağıdan yukarıya yollarla özellikleri yeniden yapılandırır ve birleştirir. Son aşamada dört ölçekli özellik haritaları SEAM içeren algılama kafalarına gönderilir.

SFEM: şekil-duyarlı özellik çıkarımı

Shape-aware Feature Extraction Module (SFEM), özellikle deniz hıyarı gibi uzamış ve kıvrımlı nesneler ile denizyıldızı gibi dallanan konturları sabit kare örnekleme düzenine zorlamadan temsil etmeyi amaçlar. Kaynak Figür 3, standart konvolüsyon, dilated konvolüsyon, deformable konvolüsyon ve DySnake örnekleme düzenlerini karşılaştırmaktadır.

DySnake neden standart konvolüsyondan farklıdır?

DySnake convolution, örnekleme noktalarını yalnız bağımsız öğrenilebilir ofsetlerle hareket ettirmek yerine kernel merkezinden dışarı doğru kademeli olarak biriken bir örnekleme stratejisi kullanır; böylece örnekleme noktalarının kıvrımlı veya uzamış hedef geometrisini takip ederken yerel sürekliliği koruması amaçlanır. Standart konvolüsyonda düzenli grid sabittir, dilated konvolüsyonda grid aralıkları büyüse de geometri düzenli kalır ve deformable convolution'da noktalar daha serbest hareket eder; DySnake ise şekle uyum ile geometrik sürekliliği birlikte korumayı hedefler.

Kaynak, DUO ve URPC2020'deki hedeflerin geometrik düzensizliğini bu tercih için temel motivasyon olarak göstermektedir. SFEM ablasyonunda DySnakeConv kullanılan tam model DUO'da %67.2 AP, %85.4 AP50 ve %75.0 AP75 elde etmiştir. Buna karşın Star Conv küçük hedef AP'sinde çok az daha yüksek sonuç vermiştir: %49.0'a karşı %48.9. Bu nedenle DySnakeConv'un avantajı özellikle genel performans dengesi ve sıkı yerelleştirme ölçütlerindedir.

DynamicTanh ve Tanhformer

DySnake ve SPPF sonrasında yüksek seviyeli özelliklerin kanal cevapları dengesiz kalabileceğinden, Tanhformer içinde DynamicTanh (DYT) kullanılır. Kaynağın birinci denklemi:

\[ \hat{x}_{c,h,w}=\omega_c \cdot \tanh(\alpha x_{c,h,w})+\beta_c \tag{1} \]

şeklindedir. Burada \(x_{c,h,w}\), \(c\) kanalındaki ve \((h,w)\) konumundaki giriş özelliğini; \(\alpha\) global öğrenilebilir ölçek parametresini; \(\omega_c\) kanal bazlı öğrenilebilir ölçek katsayısını ve \(\beta_c\) kanal bazlı bias terimini ifade eder. Özellik cevabı küçük olduğunda tanh dönüşümü yaklaşık doğrusal davranarak semantik bilgiyi büyük ölçüde korur. Çok büyük cevaplarda ise doygunluğa yaklaşarak aşırı aktivasyonları ve arka plan gürültüsünü sıkıştırır.

DynamicTanh, DynAttn-Block (DAB) içinde hem self-attention hem feed-forward branch öncesine yerleştirilir:

\[ X_d=X+\operatorname{Attn}(\operatorname{DYT}_1(X)) \tag{2} \]

\[ Y=X_d+\operatorname{FFN}(\operatorname{DYT}_2(X_d)) \tag{3} \]

Bu artık bağlantılı yapı, özellikleri attention ve FFN dönüşümlerinden önce yeniden ölçekleyerek aşırı güçlü kanal cevaplarının baskın hale gelmesini azaltmayı amaçlar.

PMFM: çift yönlü ve aşamalı çok ölçekli füzyon

Progressive Multi-scale Fusion Module (PMFM), yüksek seviyeli semantik özelliklerle düşük seviyeli kenar ve doku ayrıntılarının birbirini tamamlamasını sağlamak için iki yönlü bir yol kullanır. Yukarıdan aşağıya yol Reconstruction and Communication Module (RCM), concatenation ve C3K2 bloklarından; aşağıdan yukarıya yol ise Conv, Modulation Fusion Module (MFM) ve DySnake işlemlerinden oluşur. Çıkışta dört ölçekte birleştirilmiş özellik haritaları oluşturulur.

PMFM küçük sualtı hedeflerinin ayrıntılarını nasıl korur?

PMFM, yalnız yüksek seviyeli düşük çözünürlüklü özellikleri yukarı örneklemek yerine RCM ile mekânsal yapıyı yeniden oluşturur, yönsel komşuluk bilgisini kanal kaydırmalarıyla ekler ve MFM ile yüksek seviye semantik ile düşük seviye ayrıntının katkısını adaptif olarak ağırlıklandırır. Böylece küçük hedeflerin sınır ve doku bilgisinin tekrarlı downsampling sırasında kaybolmasını azaltırken, yüksek seviyeli sınıfsal bilginin daha yüksek çözünürlüklü katmanlara taşınmasını sağlar.

RCM: yeniden yapılandırma ve yönsel iletişim

RCM'de giriş özelliği önce iki kat yukarı örneklenir ve depthwise convolution uygulanır:

\[ X_{in}=\operatorname{DWConv}(\operatorname{Up}(X_r)) \tag{4} \]

Daha sonra özellik haritası kanal ekseninde dört gruba ayrılır:

\[ [X_1,X_2,X_3,X_4]=\operatorname{Split}(X_{in}) \tag{5} \]

Bu gruplar yükseklik ve genişlik yönlerinde pozitif ve negatif çevrimsel kaydırmalara tabi tutulur:

\[ \tilde{X}_1=\mathcal{R}^{+s}_{h}(X_1), \qquad \tilde{X}_2=\mathcal{R}^{-s}_{h}(X_2) \tag{6} \]

\[ \tilde{X}_3=\mathcal{R}^{+s}_{w}(X_3), \qquad \tilde{X}_4=\mathcal{R}^{-s}_{w}(X_4) \tag{7} \]

Burada \(h\) ve \(w\) mekânsal boyutları, \(s\) kaydırma miktarını temsil eder. Son olarak dört yönsel grup birleştirilerek 1×1 konvolüsyonla füzyona uğrar:

\[ Y_r=\operatorname{Conv}_{1\times1} \left( \operatorname{Cat} (\tilde X_1,\tilde X_2,\tilde X_3,\tilde X_4) \right) \tag{8} \]

RCM'nin bilimsel rolü, yukarı örnekleme sonrasında yalnız piksel yoğunluğunu artırmak yerine hedef sınırı ve yerel yönsel yapı hakkında ek etkileşim oluşturmaktır.

MFM: yüksek seviye semantik ile düşük seviye ayrıntının adaptif dengelenmesi

MFM iki özellik kolunu önce toplar:

\[ U=\tilde F_{high}+\tilde F_{low} \tag{9} \]

Ardından global average pooling, MLP ve Softmax kullanılarak iki dal için göreli ağırlıklar üretilir:

\[ [\alpha_{high},\alpha_{low}] = \operatorname{Softmax} \left( \operatorname{MLP}(\operatorname{GAP}(U)) \right) \tag{10} \]

İki dal bu ağırlıklarla yeniden ölçeklenir:

\[ \hat F_{high}=\alpha_{high}\odot\tilde F_{high} \tag{11} \]

\[ \hat F_{low}=\alpha_{low}\odot\tilde F_{low} \tag{12} \]

ve yeniden birleştirilir:

\[ V=\hat F_{high}+\hat F_{low} \tag{13} \]

Son çıktı:

\[ Y_m= \operatorname{Conv} \left( \operatorname{Cat}(V,\tilde F_{low}) \right) \tag{14} \]

olarak tanımlanır. Kaynak metninde bu alt bölümün giriş cümlesinde iki giriş özelliği yanlışlıkla iki kez \(\tilde F_{high}\) olarak yazılmıştır; fakat Eq. (9)-(14), Şekil 6 ve açıklamanın geri kalanı iki dalın \(\tilde F_{high}\) ve \(\tilde F_{low}\) olduğunu açık biçimde göstermektedir. Bu editoryal tutarsızlık burada gizlenmemiştir.

HRDB: 160×160 yüksek çözünürlüklü algılama kolu

Standart üç ölçekli tahmin yapısında 640×640 giriş için en yüksek çözünürlüklü özellik haritası 80×80 ve stride 8'dir. SMD-Net buna 160×160 özellik haritasında çalışan ek bir High-Resolution Detection Branch ekler. Böylece en küçük stride 8'den 4'e düşer. Amaç, küçük ve kısmen örtülü hedeflerin sınır, doku ve görünür lokal yapılarını tahmin aşamasına kadar daha yüksek mekânsal çözünürlükte taşımaktır.

SEAM: görünür hedef bilgisinin güçlendirilmesi

Kısmi örtülme durumunda ağ çoğu zaman hedefin tamamını değil, yalnız birkaç kenar, doku veya yerel geometrik parçayı görebilir. SMD-Net bu nedenle regresyon ve sınıflandırma kollarında SEAM kullanır. Önce lokal yapı:

\[ Z=\operatorname{DCovN}(X_s) \tag{15} \]

ile çıkarılır. Ardından kanal ağırlığı:

\[ a= \sigma \left( W_2\, \delta \left( W_1\operatorname{GAP}(Z) \right) \right) \tag{16} \]

olarak hesaplanır ve giriş özellikleri:

\[ Y_s=X_s\odot\exp(a) \tag{17} \]

ile yeniden ağırlıklandırılır. \(\delta\) ReLU, \(\sigma\) Sigmoid, \(\odot\) ise kanal bazlı çarpımı ifade eder.

Çalışmanın Yöntemi ve Bulguları

Veri kümeleri

Veri kümesiGörüntü sayısıSınıflarÇalışmadaki rolü
DUO7.782; 6.671 eğitim, 1.111 testHolothurian, echinus, scallop, starfishAna doğruluk, küçük/orta hedef, örtülme ve ablasyon değerlendirmesi
URPC20205.543; 4.434 eğitim, 1.109 testDUO ile aynı dört sınıfİkinci temel doğrulama; belirgin sınıf dengesizliği
Trash-ICRA19Yaklaşık 5.700Plastic, biological objects, ROVsVeri kümeleri arası genelleme değerlendirmesi

Eğitim platformu ve hiperparametreler

ParametreDeğer
İşletim sistemiWindows 11
FrameworkPyTorch 2.2.2
Python3.10.14
CUDA12.1
GPUNVIDIA RTX 4090, 24 GB
CPUIntel Core i7-13700K
Giriş boyutu640×640
Batch size8
Epoch300
OptimizerSGD
Başlangıç öğrenme oranı0.01
Momentum0.937
Weight decay0.0005

Değerlendirme metrikleri

Çalışma COCO ölçütlerini kullanmaktadır. AP, IoU=0.50 ile 0.95 arasındaki eşiklerde 0.05 adımlarla hesaplanan ortalama Average Precision'dır. AP50 ve AP75 sırasıyla IoU 0.50 ve 0.75'teki AP'yi gösterir; AP75 daha hassas kutu yerleşimi gerektirir. APS, APM ve APL sırasıyla küçük, orta ve büyük nesnelerdeki performansı ölçer. Hesaplama maliyeti için parametre sayısı, FLOPs ve FPS ayrıca raporlanmıştır.

DUO sonuçları

 
MetrikSMD-NetYorum
AP%67.2Kaynak karşılaştırma tablosundaki en yüksek değer
AP50%85.4En yüksek
AP75%75.0En yüksek; sıkı yerelleştirme avantajı
APS%48.9AMSP-UOD %49.0 ile çok az daha yüksek
APM%68.8En yüksek
APL%66.0DCM-YOLO %66.4 ile daha yüksek
Parametre10.68 MGörece hafif mimari
FLOPs30.8 G640×640 deney koşulu
FPS156RTX 4090 deney platformu

SMD-Net'in DUO'daki avantajı genel AP, AP50, AP75 ve orta hedef performansında belirgindir. Ancak kaynak tablo, modelin her ölçekte birinci olmadığını açıkça göstermektedir. Küçük hedef AP'sinde AMSP-UOD %49.0 ile SMD-Net'in %48.9 değerini çok az aşarken, büyük hedeflerde DCM-YOLO %66.4 ile SMD-Net'in %66.0 değerinden yüksektir.

URPC2020 sonuçları

 
MetrikSMD-NetKarşılaştırmadaki durum
AP%42.4En yüksek
AP50%75.4RT-DETR %76.2 ile daha yüksek
AP75%42.8Mamba-YOLO %44.9 ile daha yüksek
APS%41.9En yüksek
APM%31.9Bazı karşılaştırmaların üzerinde; mutlak en iyi olarak sunulmamalı
APL%46.2RT-DETR %46.9 ile daha yüksek

URPC2020 sonucu önemli bir nüans taşır: SMD-Net genel AP ve küçük hedef AP'sinde en iyi sonucu elde etmektedir; ancak AP50, AP75 ve büyük hedef ölçütlerinde bütün rakipleri geçmez. Bu nedenle modelin avantajı, bu veri kümesinde özellikle genel denge ve küçük hedef algısıdır.

Trash-ICRA19 genelleme sonuçları

MetrikSMD-NetDurum
AP%78.3Karşılaştırılan yöntemler arasında en yüksek
AP50%97.3En yüksek
AP75%89.3En yüksek
APS%29.9YOLOv8s %30.6 ile daha yüksek
APM%66.8En yüksek
APL%83.4En yüksek

Bu deney, aynı modeli farklı sınıf içeriğine sahip başka bir sualtı veri kümesinde değerlendirerek veri kümeleri arası genelleme için kanıt sağlamaktadır. Ancak bu sonuç, tamamen görülmemiş sensörler, farklı denizler, farklı ışık sistemleri veya gerçek zamanlı AUV operasyonlarında evrensel genelleme anlamına gelmez.

Nitel tespit ve Grad-CAM++ bulguları

Kaynağın Figür 10-13'ünde yoğun hedef kümeleri, bulanık sınırlar, küçük nesneler ve ağır kısmi örtülme gibi seçilmiş zor örneklerde farklı algılayıcıların sonuçları karşılaştırılmaktadır. Yazarların analizine göre SMD-Net bu örneklerde kaçırılan hedef ve yanlış pozitif sayısını azaltmakta, özellikle yalnız bir kısmı görünür olan hedefleri daha kararlı biçimde tespit etmektedir.

Figür 14'teki Grad-CAM++ görselleştirmeleri, YOLOv11s'e kıyasla SMD-Net'in yüksek cevap bölgelerini gerçek hedef çevresinde daha yoğun tuttuğunu ve bazı karmaşık arka plan bölgelerindeki aktivasyonu azalttığını göstermektedir. Bu görseller mekanizmayı destekleyici nitel kanıttır; seçilmiş örnekler olduklarından tek başlarına genel performansın istatistiksel kanıtı değildir. Nicel sonuçların temel kanıtı AP tablolarıdır.

Çekirdek modül ablasyonu

YapıAPAP50AP75APS
YOLOv11s taban çizgisi65.684.073.043.9
Yalnız SFEM66.384.874.148.1
Yalnız PMFM66.384.774.346.8
Yalnız HRDB66.484.274.044.2
Yalnız SEAM66.284.774.343.8
Yalnız PIoU66.484.873.944.7
SFEM + PMFM66.284.873.545.9
SFEM + PMFM + HRDB66.985.174.946.7
+ SEAM67.185.274.846.6
Tam SMD-Net + PIoU67.285.475.048.9

Tam model taban çizgisine göre AP'de 1.6, AP50'de 1.4, AP75'te 2.0 ve APS'de 5.0 yüzde puan artış sağlamıştır. Ancak bileşen katkıları tamamen toplamsal değildir. Örneğin yalnız SFEM ve yalnız PMFM'nin her biri 66.3 AP verirken ikisi birlikte 66.2 AP'ye düşmektedir. SEAM eklendiğinde AP artarken AP75 74.9'dan 74.8'e ve APS 46.7'den 46.6'ya hafifçe geriler. Kaynak yazarları bunu ortak optimizasyondaki özellik etkileşimi ve adaptasyonuyla açıklamaktadır.

PIoU neden bu çalışmada kullanılmıştır?

PIoU, tahmin kutusunun yalnız merkezi veya genel IoU değeri yerine sol, sağ, üst ve alt sınırlarının gerçek kutuyla hizalanma hatasını doğrudan hesaba katan bir kutu regresyon ölçütüdür. Sualtında hedef sınırlarının bulanık, hedeflerin örtüşmüş veya birbirine çok yakın olduğu sahnelerde bir tahmin kutusu hedef merkezini doğru yakalasa bile sınırları arka planı fazla kapsayabilir; PIoU bu sınır sapmalarını normalize ederek daha hassas yerelleştirmeyi teşvik etmeyi amaçlar.

Kaynakta sınır sapma terimi:

\[ P= \frac{1}{4} \left( \frac{d_{w1}+d_{w2}}{w_{gt}} + \frac{d_{h1}+d_{h2}}{h_{gt}} \right) \tag{18} \]

olarak tanımlanır. \(d_{w1}\) ve \(d_{w2}\) sol-sağ sınır sapmalarını, \(d_{h1}\) ve \(d_{h2}\) üst-alt sınır sapmalarını; \(w_{gt}\) ve \(h_{gt}\) gerçek kutunun genişlik ve yüksekliğini temsil eder. Böylece sınır hatası nesnenin kendi ölçeğine göre normalize edilir.

PIoU:

\[ PIoU=IoU+\exp(-P^2)-1 \tag{19} \]

şeklinde tanımlanmıştır. Tahmin kutusu gerçek sınırlara yaklaştığında \(P\) küçülür ve \(\exp(-P^2)\) 1'e yaklaşır; dolayısıyla PIoU değeri yükselir. Sınır uyumsuzluğu büyüdükçe ilave terim küçülür.

LossAPAP50AP75APSAPMAPL
CIoU67.185.274.846.669.165.7
WIoU66.585.373.944.468.864.7
GIoU66.685.374.646.468.865.0
SIoU66.985.374.449.369.264.8
PIoU67.285.475.048.968.866.0

Tablo, PIoU'nun AP, AP50, AP75 ve APL'de en iyi sonucu verdiğini göstermektedir. Ancak kaynak metninde PIoU'nun küçük hedeflerde üstün olduğu söylenmesine karşın SIoU'nun APS değeri 49.3 ile PIoU'nun 48.9 değerinden yüksektir; SIoU ayrıca APM'de 69.2 ile PIoU'nun 68.8 değerini aşmaktadır. Dolayısıyla tabloya dayalı doğru yorum, PIoU'nun özellikle genel AP ve katı yerelleştirme AP75 açısından daha güçlü olduğudur.

Hesaplama karmaşıklığı

Kaynakta SMD-Net 10.68 milyon parametre, 30.8 GFLOPs ve 156 FPS ile raporlanmıştır. DUO karşılaştırmasında YOLOv8m 25.90 M parametre, 78.9 G FLOPs ve 143 FPS; YOLOv11m 20.03 M parametre, 67.7 G FLOPs ve 144 FPS; DCM-YOLO 12.51 M parametre, 45.9 G FLOPs ve 161 FPS'tir. Dynamic-YOLO 8.23 M parametre, 12.5 G FLOPs ve 184 FPS ile SMD-Net'ten daha hafif ve hızlıdır fakat DUO AP'si %64.3'tür. Bu sonuçlar SMD-Net'in mutlak olarak en küçük veya en hızlı model olmadığını, doğruluk ile hesaplama maliyeti arasında güçlü bir denge sunduğunu göstermektedir.

Çalışmanın desteklediği ve desteklemediği çıkarımlar

Çalışmanın desteklediğiÇalışmanın desteklemediği
SMD-Net'in DUO'da karşılaştırılan yöntemlere karşı en yüksek genel AP, AP50 ve AP75 değerlerini elde ettiğiSMD-Net'in her veri kümesinde ve her nesne ölçeğinde bütün rakiplerden üstün olduğu
SFEM, PMFM, HRDB, SEAM ve PIoU bileşenlerinin tam modelde birlikte taban çizgisine göre performans artışı sağladığıHer modülün katkısının bağımsız, lineer ve birbirine eklenebilir olduğu
DUO'da küçük hedef AP'sinin taban çizgisine göre 5.0 yüzde puan yükseldiğiEn küçük hedeflerde bütün alternatif modellerden veya bütün loss fonksiyonlarından her zaman üstün olduğu
Trash-ICRA19 üzerinde iyi veri kümeleri arası genelleme sonucu elde edildiğiBütün deniz koşulları, kameralar, ışık sistemleri veya coğrafyalarda evrensel genelleme
RTX 4090 deney sisteminde 156 FPS elde edildiğiKaynak kısıtlı AUV donanımında aynı FPS, enerji tüketimi veya gecikmenin elde edileceği
Seçilmiş nitel örneklerde ve Grad-CAM++ görsellerinde hedef odaklanmasının iyileştiğiBu görsellerin tek başına istatistiksel genelleme kanıtı olduğu

Temel sınırlılıklar ve gelecek çalışma

Çalışma üç kamuya açık veri kümesine dayanmaktadır ve gerçek AUV üzerinde uçtan uca saha testi raporlamaz. Donanım değerlendirmesi güçlü bir masaüstü GPU üzerinde yapılmıştır. Farklı su kalitesi, derinlik, aydınlatma, kamera optiği, sıkıştırma, sensör gürültüsü ve gerçek araç hareketinin birlikte değerlendirildiği uzun süreli saha deneyi bulunmamaktadır. Ayrıca kaynak bazı editoryal şablon kalıntıları ve küçük metin-tablo tutarsızlıkları içermektedir.

Yazarlar gelecek çalışmada daha çeşitli gerçek sualtı ortamlarında dayanıklılığın artırılmasını, kaynak kısıtlı platformlar için hafif dağıtımın araştırılmasını, cross-domain sualtı algısına genişlemeyi ve video tabanlı nesne tespitini hedeflemektedir.

Kaynak ve Yöntem Notu

Özgün başlık: SMD-Net: A Shape-Aware Multi-Scale Detection Network for Underwater Object Detection

Yazarlar: Qian Fan, Pengfei Zou, Ziyang Qi, Tian Hua, Runhao Chen, Ye Niu.

Sorumlu yazar: Qian Fan; PDF'de fanqian@yzu.edu.cn adresi verilmiştir.

Afiliyas­yonlar: College of Information Engineering, Yangzhou University, Yangzhou 225009, China; Graduate School of Engineering, Kyushu Institute of Technology, Fukuoka 804-8550, Japan; College of Animal Science and Technology, Yangzhou University, Yangzhou 225009, China.

Kaynak türü: Preprint. PDF'nin sayfalarında “This preprint research paper has not been peer reviewed” ifadesi açıkça yer almaktadır.

Platform: SSRN; kaynak PDF'de https://ssrn.com/abstract=7022170 bağlantısı verilmiştir.

DOI: Yüklenen PDF'de DOI yazılmamıştır ve erişilebilir bibliyografik web taramasında bağımsız olarak doğrulanamadığı için DOI tahmin edilmemiştir.

Dergi / cilt / sayı: Kaynak PDF'de belirli bir dergi, cilt veya sayı bilgisi bulunmamaktadır. Sayfa altlarında “Preprint submitted to Elsevier” şablon ifadesi görülmektedir; bu ifade belirli bir Elsevier dergisinde yayımlanmış veya kabul edilmiş makale anlamına gelmez.

Yayın tarihi: Yüklenen PDF'nin görünür bibliyografik alanlarında tarih bulunmamaktadır; doğrulanmış tarih olmadığı için eklenmemiştir.

Lisans: PDF'de açık bir yeniden kullanım lisansı belirtilmemiştir. Kaynak şekillerini birebir kopyalamadan önce SSRN ve hak sahibi lisans koşulları ayrıca doğrulanmalıdır.

Veri erişilebilirliği: “Data will be made available upon request.”

Çıkar çatışması: Yazarlar bilinen mali çıkar çatışması veya çalışmayı etkileyebilecek kişisel ilişki bildirmemiştir.

CRediT notu: Kaynağın CRediT bölümünde gerçek yazar adları yerine “First Author”, “Second Author”, “Third Author” gibi şablon yer tutucuları kalmıştır. Bu nedenle katkı rollerini belirli yazarlara kesin biçimde eşlemek güvenli değildir. Kaynak, ilk yazar için conceptualization, methodology, software, investigation, formal analysis, data curation, visualization ve original draft; ikinci-dördüncü yazarlar için validation, resources ve review/editing; beşinci-altıncı yazarlar için software, validation ve visualization rolleri yazmaktadır.

Kaynak içi editoryal/tutarlılık notları:

KonumKaynakta görülen durumVerianla yaklaşımı
Sayfa üst bilgileri“Short Title of the Article” yer tutucusu çok sayıda sayfada korunmuştur.Çalışmanın bilimsel sonucu olarak yorumlanmadı; preprint hazırlık kalıntısı olarak not edildi.
CRediTGerçek isimler yerine First Author, Second Author vb. kullanılmıştır.Katkılar isimlere sessizce atanmadı.
MFM metniİki giriş özelliği bir cümlede iki kez \(\tilde F_{high}\) olarak yazılmıştır.Eq. (9)-(14) ve Figür 6'nın \(\tilde F_{high}\) + \(\tilde F_{low}\) yapısı olduğu açıklanarak metin hatası görünür tutuldu.
PIoU yorumu / Tablo 6Metin PIoU'nun küçük nesnelerde avantajını vurgular; ancak SIoU APS=49.3, PIoU=48.9'dur.Tablodaki sayı esas alındı; PIoU'nun genel AP ve AP75 üstünlüğü ayrı belirtildi.
SFEM konvolüsyon ablasyonuDySnake genel ölçütlerde en iyi iken Star Conv APS'de 49.0 ile DySnake'ın 48.9 değerini aşmaktadır.“Her ölçütte en iyi” şeklinde genelleme yapılmadı.

Temel bilimsel sınırlılık: Sonuçlar kamuya açık veri kümeleri ve RTX 4090 tabanlı laboratuvar/iş istasyonu değerlendirmesine dayanır. Gerçek otonom sualtı aracı üzerinde saha konuşlandırması, enerji tüketimi, gömülü donanım gecikmesi veya uzun süreli deniz operasyonu doğrulanmamıştır.

Görsel yeniden çizim: Figür 2 SMD-Net mimarisi, Figür 3 örnekleme geometrileri, Figür 5-6 RCM/MFM akışı, Figür 9 PIoU sınır geometrisi ve Figür 15 AP-FPS ilişkisi kaynak verilerine sadık özgün Verianla şemaları/grafikleri olarak yeniden çizilebilir.

Verianla Live: DUO ve URPC karşılaştırmaları, bileşen ablasyonu, loss karşılaştırması ve AP-FPS dengesi için uygundur. Runtime görselleştirme gerçek tablo değerlerini kaynak-of-truth olarak kullanmalı; yeni ara AP/FPS değerleri üretmemelidir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy