
SMD-Net (Shape-Aware Multi-Scale Detection Network), düşük kontrast, bulanık sınırlar, düzensiz hedef şekilleri, yoğun nesne kümeleri, kısmi örtüşmeler ve küçük hedefler bulunan sualtı görüntülerinde nesne tespitini güçlendirmek amacıyla YOLOv11s tabanı üzerinde geliştirilen şekil-duyarlı ve çok ölçekli bir nesne algılama ağıdır. Model; şekil ve semantik bilgiyi güçlendiren Shape-aware Feature Extraction Module (SFEM), yüksek ve düşük seviyeli özellikleri aşamalı olarak birleştiren Progressive Multi-scale Fusion Module (PMFM), 160×160 çözünürlüklü ek High-Resolution Detection Branch (HRDB), görünür hedef bölgelerini vurgulayan SEAM tabanlı algılama kafaları ve kutu sınır hizalamasını doğrudan cezalandıran PIoU kaybını tek mimaride birleştirir. DUO veri kümesinde SMD-Net %67.2 AP, %85.4 AP50 ve %75.0 AP75; URPC2020'de %42.4 AP; Trash-ICRA19 genelleme deneyinde ise %78.3 AP elde etmiştir. Model 10.68 milyon parametre, 30.8 GFLOPs ve kaynak deney platformunda 156 FPS ile doğruluk-hesaplama dengesi açısından güçlü sonuç vermiştir.
Çalışmanın en güçlü sonucu yalnız genel AP artışı değildir. DUO ablasyonlarında tam SMD-Net, YOLOv11s taban çizgisinin AP değerini %65.6'dan %67.2'ye, AP75 değerini %73.0'dan %75.0'a ve küçük hedef AP'sini %43.9'dan %48.9'a yükseltmiştir. Bununla birlikte tüm ara modül kombinasyonlarında performans monoton biçimde artmamaktadır; bazı kombinasyonlarda küçük düşüşler bulunmaktadır. Ayrıca URPC2020'de SMD-Net genel AP ve küçük hedef AP'sinde en iyi sonucu verirken AP50, AP75, orta ve büyük hedef AP'sinde tüm karşılaştırmaları geçmemektedir. Dolayısıyla kaynak, modelin her veri kümesinde ve her ölçütte mutlak üstün olduğunu değil, özellikle genel doğruluk, küçük hedef algısı ve bazı katı yerelleştirme koşullarında güçlü bir denge sağladığını desteklemektedir.
Bu sonuçlar üç kamuya açık veri kümesi üzerinde elde edilmiş çevrimdışı bilgisayarlı görü deneylerine dayanır. Çalışma gerçek bir otonom sualtı aracı üzerinde uzun süreli saha konuşlandırması, farklı kamera/donanım zincirlerinde gecikme analizi veya sualtında gerçek zamanlı enerji tüketimi ölçümü raporlamamaktadır. Bu nedenle 156 FPS sonucu, kullanılan RTX 4090 tabanlı deney platformuna ait bir model çıkarım ölçümüdür; kaynak kısıtlı gerçek bir AUV bilgisayarında aynı hızın elde edileceğini kanıtlamaz.
Sualtı nesne tespiti neden zordur?
Sualtı görüntüleme, havadaki görüntülemeden farklı olarak ışığın dalga boyuna bağlı soğurulması ve çoklu saçılması nedeniyle güçlü fiziksel bozulmalara maruz kalır. Bu etkiler spektral enerjiyi değiştirir, kontrastı azaltır ve nesne sınırlarını bulanıklaştırır. Bunun üzerine deniz canlılarının taş, kum ve bitki örtüsü arasında kısmen örtülmesi, çok sayıda küçük hedefin birbirine yakın bulunması ve hedeflerin düzensiz geometrilere sahip olması nesne tespitinin hem sınıflandırma hem de kutu regresyonu tarafını zorlaştırır.
Kaynağın Figür 1'inde bulanık, örtüşmüş ve kümelenmiş sualtı hedeflerinin örnekleri gösterilmektedir. Aynı figürde DUO veri kümesindeki küçük ve orta ölçekli hedeflerin toplam hedeflerin yaklaşık %92'sini oluşturduğu belirtilmektedir. Böyle bir dağılımda standart bir algılayıcının art arda yaptığı downsampling işlemleri, zaten az sayıda piksel tarafından temsil edilen küçük hedeflerin kenar ve doku bilgisini daha da azaltabilir.
SMD-Net nedir ve hangi problemi çözmek için tasarlanmıştır?
SMD-Net, YOLOv11s tabanlı ve düzensiz şekilli, küçük, düşük kontrastlı veya kısmen örtülü sualtı nesnelerinin tespitini geliştirmeyi amaçlayan çok ölçekli bir nesne algılama ağıdır. Model tek bir iyileştirmeye dayanmaz; SFEM ile şekil-duyarlı özellik çıkarımı, PMFM ile yüksek ve düşük çözünürlüklü özelliklerin çift yönlü füzyonu, HRDB ile 160×160 yüksek çözünürlüklü tahmin, SEAM ile görünür hedef bölgelerinin vurgulanması ve PIoU ile sınır-duyarlı kutu regresyonunu birlikte kullanır.
Genel mimari
Kaynak Figür 2'de SMD-Net üç ana aşama halinde gösterilmektedir: omurga üzerinde hiyerarşik özellik çıkarımı, PMFM üzerinden çok ölçekli özellik füzyonu ve dört farklı ölçekte algılama. SFEM omurganın yüksek seviyeli bölümünde yer alır. Bu modül DySnake, SPPF ve Tanhformer bileşenlerini kullanır. Daha sonra çok seviyeli özellikler PMFM'ye aktarılır. PMFM yukarıdan aşağıya ve aşağıdan yukarıya yollarla özellikleri yeniden yapılandırır ve birleştirir. Son aşamada dört ölçekli özellik haritaları SEAM içeren algılama kafalarına gönderilir.
SFEM: şekil-duyarlı özellik çıkarımı
Shape-aware Feature Extraction Module (SFEM), özellikle deniz hıyarı gibi uzamış ve kıvrımlı nesneler ile denizyıldızı gibi dallanan konturları sabit kare örnekleme düzenine zorlamadan temsil etmeyi amaçlar. Kaynak Figür 3, standart konvolüsyon, dilated konvolüsyon, deformable konvolüsyon ve DySnake örnekleme düzenlerini karşılaştırmaktadır.
DySnake neden standart konvolüsyondan farklıdır?
DySnake convolution, örnekleme noktalarını yalnız bağımsız öğrenilebilir ofsetlerle hareket ettirmek yerine kernel merkezinden dışarı doğru kademeli olarak biriken bir örnekleme stratejisi kullanır; böylece örnekleme noktalarının kıvrımlı veya uzamış hedef geometrisini takip ederken yerel sürekliliği koruması amaçlanır. Standart konvolüsyonda düzenli grid sabittir, dilated konvolüsyonda grid aralıkları büyüse de geometri düzenli kalır ve deformable convolution'da noktalar daha serbest hareket eder; DySnake ise şekle uyum ile geometrik sürekliliği birlikte korumayı hedefler.
Kaynak, DUO ve URPC2020'deki hedeflerin geometrik düzensizliğini bu tercih için temel motivasyon olarak göstermektedir. SFEM ablasyonunda DySnakeConv kullanılan tam model DUO'da %67.2 AP, %85.4 AP50 ve %75.0 AP75 elde etmiştir. Buna karşın Star Conv küçük hedef AP'sinde çok az daha yüksek sonuç vermiştir: %49.0'a karşı %48.9. Bu nedenle DySnakeConv'un avantajı özellikle genel performans dengesi ve sıkı yerelleştirme ölçütlerindedir.
DynamicTanh ve Tanhformer
DySnake ve SPPF sonrasında yüksek seviyeli özelliklerin kanal cevapları dengesiz kalabileceğinden, Tanhformer içinde DynamicTanh (DYT) kullanılır. Kaynağın birinci denklemi:
\[ \hat{x}_{c,h,w}=\omega_c \cdot \tanh(\alpha x_{c,h,w})+\beta_c \tag{1} \]
şeklindedir. Burada \(x_{c,h,w}\), \(c\) kanalındaki ve \((h,w)\) konumundaki giriş özelliğini; \(\alpha\) global öğrenilebilir ölçek parametresini; \(\omega_c\) kanal bazlı öğrenilebilir ölçek katsayısını ve \(\beta_c\) kanal bazlı bias terimini ifade eder. Özellik cevabı küçük olduğunda tanh dönüşümü yaklaşık doğrusal davranarak semantik bilgiyi büyük ölçüde korur. Çok büyük cevaplarda ise doygunluğa yaklaşarak aşırı aktivasyonları ve arka plan gürültüsünü sıkıştırır.
DynamicTanh, DynAttn-Block (DAB) içinde hem self-attention hem feed-forward branch öncesine yerleştirilir:
\[ X_d=X+\operatorname{Attn}(\operatorname{DYT}_1(X)) \tag{2} \]
\[ Y=X_d+\operatorname{FFN}(\operatorname{DYT}_2(X_d)) \tag{3} \]
Bu artık bağlantılı yapı, özellikleri attention ve FFN dönüşümlerinden önce yeniden ölçekleyerek aşırı güçlü kanal cevaplarının baskın hale gelmesini azaltmayı amaçlar.
PMFM: çift yönlü ve aşamalı çok ölçekli füzyon
Progressive Multi-scale Fusion Module (PMFM), yüksek seviyeli semantik özelliklerle düşük seviyeli kenar ve doku ayrıntılarının birbirini tamamlamasını sağlamak için iki yönlü bir yol kullanır. Yukarıdan aşağıya yol Reconstruction and Communication Module (RCM), concatenation ve C3K2 bloklarından; aşağıdan yukarıya yol ise Conv, Modulation Fusion Module (MFM) ve DySnake işlemlerinden oluşur. Çıkışta dört ölçekte birleştirilmiş özellik haritaları oluşturulur.
PMFM küçük sualtı hedeflerinin ayrıntılarını nasıl korur?
PMFM, yalnız yüksek seviyeli düşük çözünürlüklü özellikleri yukarı örneklemek yerine RCM ile mekânsal yapıyı yeniden oluşturur, yönsel komşuluk bilgisini kanal kaydırmalarıyla ekler ve MFM ile yüksek seviye semantik ile düşük seviye ayrıntının katkısını adaptif olarak ağırlıklandırır. Böylece küçük hedeflerin sınır ve doku bilgisinin tekrarlı downsampling sırasında kaybolmasını azaltırken, yüksek seviyeli sınıfsal bilginin daha yüksek çözünürlüklü katmanlara taşınmasını sağlar.
RCM: yeniden yapılandırma ve yönsel iletişim
RCM'de giriş özelliği önce iki kat yukarı örneklenir ve depthwise convolution uygulanır:
\[ X_{in}=\operatorname{DWConv}(\operatorname{Up}(X_r)) \tag{4} \]
Daha sonra özellik haritası kanal ekseninde dört gruba ayrılır:
\[ [X_1,X_2,X_3,X_4]=\operatorname{Split}(X_{in}) \tag{5} \]
Bu gruplar yükseklik ve genişlik yönlerinde pozitif ve negatif çevrimsel kaydırmalara tabi tutulur:
\[ \tilde{X}_1=\mathcal{R}^{+s}_{h}(X_1), \qquad \tilde{X}_2=\mathcal{R}^{-s}_{h}(X_2) \tag{6} \]
\[ \tilde{X}_3=\mathcal{R}^{+s}_{w}(X_3), \qquad \tilde{X}_4=\mathcal{R}^{-s}_{w}(X_4) \tag{7} \]
Burada \(h\) ve \(w\) mekânsal boyutları, \(s\) kaydırma miktarını temsil eder. Son olarak dört yönsel grup birleştirilerek 1×1 konvolüsyonla füzyona uğrar:
\[ Y_r=\operatorname{Conv}_{1\times1} \left( \operatorname{Cat} (\tilde X_1,\tilde X_2,\tilde X_3,\tilde X_4) \right) \tag{8} \]
RCM'nin bilimsel rolü, yukarı örnekleme sonrasında yalnız piksel yoğunluğunu artırmak yerine hedef sınırı ve yerel yönsel yapı hakkında ek etkileşim oluşturmaktır.
MFM: yüksek seviye semantik ile düşük seviye ayrıntının adaptif dengelenmesi
MFM iki özellik kolunu önce toplar:
\[ U=\tilde F_{high}+\tilde F_{low} \tag{9} \]
Ardından global average pooling, MLP ve Softmax kullanılarak iki dal için göreli ağırlıklar üretilir:
\[ [\alpha_{high},\alpha_{low}] = \operatorname{Softmax} \left( \operatorname{MLP}(\operatorname{GAP}(U)) \right) \tag{10} \]
İki dal bu ağırlıklarla yeniden ölçeklenir:
\[ \hat F_{high}=\alpha_{high}\odot\tilde F_{high} \tag{11} \]
\[ \hat F_{low}=\alpha_{low}\odot\tilde F_{low} \tag{12} \]
ve yeniden birleştirilir:
\[ V=\hat F_{high}+\hat F_{low} \tag{13} \]
Son çıktı:
\[ Y_m= \operatorname{Conv} \left( \operatorname{Cat}(V,\tilde F_{low}) \right) \tag{14} \]
olarak tanımlanır. Kaynak metninde bu alt bölümün giriş cümlesinde iki giriş özelliği yanlışlıkla iki kez \(\tilde F_{high}\) olarak yazılmıştır; fakat Eq. (9)-(14), Şekil 6 ve açıklamanın geri kalanı iki dalın \(\tilde F_{high}\) ve \(\tilde F_{low}\) olduğunu açık biçimde göstermektedir. Bu editoryal tutarsızlık burada gizlenmemiştir.
HRDB: 160×160 yüksek çözünürlüklü algılama kolu
Standart üç ölçekli tahmin yapısında 640×640 giriş için en yüksek çözünürlüklü özellik haritası 80×80 ve stride 8'dir. SMD-Net buna 160×160 özellik haritasında çalışan ek bir High-Resolution Detection Branch ekler. Böylece en küçük stride 8'den 4'e düşer. Amaç, küçük ve kısmen örtülü hedeflerin sınır, doku ve görünür lokal yapılarını tahmin aşamasına kadar daha yüksek mekânsal çözünürlükte taşımaktır.
SEAM: görünür hedef bilgisinin güçlendirilmesi
Kısmi örtülme durumunda ağ çoğu zaman hedefin tamamını değil, yalnız birkaç kenar, doku veya yerel geometrik parçayı görebilir. SMD-Net bu nedenle regresyon ve sınıflandırma kollarında SEAM kullanır. Önce lokal yapı:
\[ Z=\operatorname{DCovN}(X_s) \tag{15} \]
ile çıkarılır. Ardından kanal ağırlığı:
\[ a= \sigma \left( W_2\, \delta \left( W_1\operatorname{GAP}(Z) \right) \right) \tag{16} \]
olarak hesaplanır ve giriş özellikleri:
\[ Y_s=X_s\odot\exp(a) \tag{17} \]
ile yeniden ağırlıklandırılır. \(\delta\) ReLU, \(\sigma\) Sigmoid, \(\odot\) ise kanal bazlı çarpımı ifade eder.
Çalışmanın Yöntemi ve Bulguları
Veri kümeleri
| Veri kümesi | Görüntü sayısı | Sınıflar | Çalışmadaki rolü |
|---|---|---|---|
| DUO | 7.782; 6.671 eğitim, 1.111 test | Holothurian, echinus, scallop, starfish | Ana doğruluk, küçük/orta hedef, örtülme ve ablasyon değerlendirmesi |
| URPC2020 | 5.543; 4.434 eğitim, 1.109 test | DUO ile aynı dört sınıf | İkinci temel doğrulama; belirgin sınıf dengesizliği |
| Trash-ICRA19 | Yaklaşık 5.700 | Plastic, biological objects, ROVs | Veri kümeleri arası genelleme değerlendirmesi |
Eğitim platformu ve hiperparametreler
| Parametre | Değer |
|---|---|
| İşletim sistemi | Windows 11 |
| Framework | PyTorch 2.2.2 |
| Python | 3.10.14 |
| CUDA | 12.1 |
| GPU | NVIDIA RTX 4090, 24 GB |
| CPU | Intel Core i7-13700K |
| Giriş boyutu | 640×640 |
| Batch size | 8 |
| Epoch | 300 |
| Optimizer | SGD |
| Başlangıç öğrenme oranı | 0.01 |
| Momentum | 0.937 |
| Weight decay | 0.0005 |
Değerlendirme metrikleri
Çalışma COCO ölçütlerini kullanmaktadır. AP, IoU=0.50 ile 0.95 arasındaki eşiklerde 0.05 adımlarla hesaplanan ortalama Average Precision'dır. AP50 ve AP75 sırasıyla IoU 0.50 ve 0.75'teki AP'yi gösterir; AP75 daha hassas kutu yerleşimi gerektirir. APS, APM ve APL sırasıyla küçük, orta ve büyük nesnelerdeki performansı ölçer. Hesaplama maliyeti için parametre sayısı, FLOPs ve FPS ayrıca raporlanmıştır.
DUO sonuçları
| Metrik | SMD-Net | Yorum |
|---|---|---|
| AP | %67.2 | Kaynak karşılaştırma tablosundaki en yüksek değer |
| AP50 | %85.4 | En yüksek |
| AP75 | %75.0 | En yüksek; sıkı yerelleştirme avantajı |
| APS | %48.9 | AMSP-UOD %49.0 ile çok az daha yüksek |
| APM | %68.8 | En yüksek |
| APL | %66.0 | DCM-YOLO %66.4 ile daha yüksek |
| Parametre | 10.68 M | Görece hafif mimari |
| FLOPs | 30.8 G | 640×640 deney koşulu |
| FPS | 156 | RTX 4090 deney platformu |
SMD-Net'in DUO'daki avantajı genel AP, AP50, AP75 ve orta hedef performansında belirgindir. Ancak kaynak tablo, modelin her ölçekte birinci olmadığını açıkça göstermektedir. Küçük hedef AP'sinde AMSP-UOD %49.0 ile SMD-Net'in %48.9 değerini çok az aşarken, büyük hedeflerde DCM-YOLO %66.4 ile SMD-Net'in %66.0 değerinden yüksektir.
URPC2020 sonuçları
| Metrik | SMD-Net | Karşılaştırmadaki durum |
|---|---|---|
| AP | %42.4 | En yüksek |
| AP50 | %75.4 | RT-DETR %76.2 ile daha yüksek |
| AP75 | %42.8 | Mamba-YOLO %44.9 ile daha yüksek |
| APS | %41.9 | En yüksek |
| APM | %31.9 | Bazı karşılaştırmaların üzerinde; mutlak en iyi olarak sunulmamalı |
| APL | %46.2 | RT-DETR %46.9 ile daha yüksek |
URPC2020 sonucu önemli bir nüans taşır: SMD-Net genel AP ve küçük hedef AP'sinde en iyi sonucu elde etmektedir; ancak AP50, AP75 ve büyük hedef ölçütlerinde bütün rakipleri geçmez. Bu nedenle modelin avantajı, bu veri kümesinde özellikle genel denge ve küçük hedef algısıdır.
Trash-ICRA19 genelleme sonuçları
| Metrik | SMD-Net | Durum |
|---|---|---|
| AP | %78.3 | Karşılaştırılan yöntemler arasında en yüksek |
| AP50 | %97.3 | En yüksek |
| AP75 | %89.3 | En yüksek |
| APS | %29.9 | YOLOv8s %30.6 ile daha yüksek |
| APM | %66.8 | En yüksek |
| APL | %83.4 | En yüksek |
Bu deney, aynı modeli farklı sınıf içeriğine sahip başka bir sualtı veri kümesinde değerlendirerek veri kümeleri arası genelleme için kanıt sağlamaktadır. Ancak bu sonuç, tamamen görülmemiş sensörler, farklı denizler, farklı ışık sistemleri veya gerçek zamanlı AUV operasyonlarında evrensel genelleme anlamına gelmez.
Nitel tespit ve Grad-CAM++ bulguları
Kaynağın Figür 10-13'ünde yoğun hedef kümeleri, bulanık sınırlar, küçük nesneler ve ağır kısmi örtülme gibi seçilmiş zor örneklerde farklı algılayıcıların sonuçları karşılaştırılmaktadır. Yazarların analizine göre SMD-Net bu örneklerde kaçırılan hedef ve yanlış pozitif sayısını azaltmakta, özellikle yalnız bir kısmı görünür olan hedefleri daha kararlı biçimde tespit etmektedir.
Figür 14'teki Grad-CAM++ görselleştirmeleri, YOLOv11s'e kıyasla SMD-Net'in yüksek cevap bölgelerini gerçek hedef çevresinde daha yoğun tuttuğunu ve bazı karmaşık arka plan bölgelerindeki aktivasyonu azalttığını göstermektedir. Bu görseller mekanizmayı destekleyici nitel kanıttır; seçilmiş örnekler olduklarından tek başlarına genel performansın istatistiksel kanıtı değildir. Nicel sonuçların temel kanıtı AP tablolarıdır.
Çekirdek modül ablasyonu
| Yapı | AP | AP50 | AP75 | APS |
|---|---|---|---|---|
| YOLOv11s taban çizgisi | 65.6 | 84.0 | 73.0 | 43.9 |
| Yalnız SFEM | 66.3 | 84.8 | 74.1 | 48.1 |
| Yalnız PMFM | 66.3 | 84.7 | 74.3 | 46.8 |
| Yalnız HRDB | 66.4 | 84.2 | 74.0 | 44.2 |
| Yalnız SEAM | 66.2 | 84.7 | 74.3 | 43.8 |
| Yalnız PIoU | 66.4 | 84.8 | 73.9 | 44.7 |
| SFEM + PMFM | 66.2 | 84.8 | 73.5 | 45.9 |
| SFEM + PMFM + HRDB | 66.9 | 85.1 | 74.9 | 46.7 |
| + SEAM | 67.1 | 85.2 | 74.8 | 46.6 |
| Tam SMD-Net + PIoU | 67.2 | 85.4 | 75.0 | 48.9 |
Tam model taban çizgisine göre AP'de 1.6, AP50'de 1.4, AP75'te 2.0 ve APS'de 5.0 yüzde puan artış sağlamıştır. Ancak bileşen katkıları tamamen toplamsal değildir. Örneğin yalnız SFEM ve yalnız PMFM'nin her biri 66.3 AP verirken ikisi birlikte 66.2 AP'ye düşmektedir. SEAM eklendiğinde AP artarken AP75 74.9'dan 74.8'e ve APS 46.7'den 46.6'ya hafifçe geriler. Kaynak yazarları bunu ortak optimizasyondaki özellik etkileşimi ve adaptasyonuyla açıklamaktadır.
PIoU neden bu çalışmada kullanılmıştır?
PIoU, tahmin kutusunun yalnız merkezi veya genel IoU değeri yerine sol, sağ, üst ve alt sınırlarının gerçek kutuyla hizalanma hatasını doğrudan hesaba katan bir kutu regresyon ölçütüdür. Sualtında hedef sınırlarının bulanık, hedeflerin örtüşmüş veya birbirine çok yakın olduğu sahnelerde bir tahmin kutusu hedef merkezini doğru yakalasa bile sınırları arka planı fazla kapsayabilir; PIoU bu sınır sapmalarını normalize ederek daha hassas yerelleştirmeyi teşvik etmeyi amaçlar.
Kaynakta sınır sapma terimi:
\[ P= \frac{1}{4} \left( \frac{d_{w1}+d_{w2}}{w_{gt}} + \frac{d_{h1}+d_{h2}}{h_{gt}} \right) \tag{18} \]
olarak tanımlanır. \(d_{w1}\) ve \(d_{w2}\) sol-sağ sınır sapmalarını, \(d_{h1}\) ve \(d_{h2}\) üst-alt sınır sapmalarını; \(w_{gt}\) ve \(h_{gt}\) gerçek kutunun genişlik ve yüksekliğini temsil eder. Böylece sınır hatası nesnenin kendi ölçeğine göre normalize edilir.
PIoU:
\[ PIoU=IoU+\exp(-P^2)-1 \tag{19} \]
şeklinde tanımlanmıştır. Tahmin kutusu gerçek sınırlara yaklaştığında \(P\) küçülür ve \(\exp(-P^2)\) 1'e yaklaşır; dolayısıyla PIoU değeri yükselir. Sınır uyumsuzluğu büyüdükçe ilave terim küçülür.
| Loss | AP | AP50 | AP75 | APS | APM | APL |
|---|---|---|---|---|---|---|
| CIoU | 67.1 | 85.2 | 74.8 | 46.6 | 69.1 | 65.7 |
| WIoU | 66.5 | 85.3 | 73.9 | 44.4 | 68.8 | 64.7 |
| GIoU | 66.6 | 85.3 | 74.6 | 46.4 | 68.8 | 65.0 |
| SIoU | 66.9 | 85.3 | 74.4 | 49.3 | 69.2 | 64.8 |
| PIoU | 67.2 | 85.4 | 75.0 | 48.9 | 68.8 | 66.0 |
Tablo, PIoU'nun AP, AP50, AP75 ve APL'de en iyi sonucu verdiğini göstermektedir. Ancak kaynak metninde PIoU'nun küçük hedeflerde üstün olduğu söylenmesine karşın SIoU'nun APS değeri 49.3 ile PIoU'nun 48.9 değerinden yüksektir; SIoU ayrıca APM'de 69.2 ile PIoU'nun 68.8 değerini aşmaktadır. Dolayısıyla tabloya dayalı doğru yorum, PIoU'nun özellikle genel AP ve katı yerelleştirme AP75 açısından daha güçlü olduğudur.
Hesaplama karmaşıklığı
Kaynakta SMD-Net 10.68 milyon parametre, 30.8 GFLOPs ve 156 FPS ile raporlanmıştır. DUO karşılaştırmasında YOLOv8m 25.90 M parametre, 78.9 G FLOPs ve 143 FPS; YOLOv11m 20.03 M parametre, 67.7 G FLOPs ve 144 FPS; DCM-YOLO 12.51 M parametre, 45.9 G FLOPs ve 161 FPS'tir. Dynamic-YOLO 8.23 M parametre, 12.5 G FLOPs ve 184 FPS ile SMD-Net'ten daha hafif ve hızlıdır fakat DUO AP'si %64.3'tür. Bu sonuçlar SMD-Net'in mutlak olarak en küçük veya en hızlı model olmadığını, doğruluk ile hesaplama maliyeti arasında güçlü bir denge sunduğunu göstermektedir.
Çalışmanın desteklediği ve desteklemediği çıkarımlar
| Çalışmanın desteklediği | Çalışmanın desteklemediği |
|---|---|
| SMD-Net'in DUO'da karşılaştırılan yöntemlere karşı en yüksek genel AP, AP50 ve AP75 değerlerini elde ettiği | SMD-Net'in her veri kümesinde ve her nesne ölçeğinde bütün rakiplerden üstün olduğu |
| SFEM, PMFM, HRDB, SEAM ve PIoU bileşenlerinin tam modelde birlikte taban çizgisine göre performans artışı sağladığı | Her modülün katkısının bağımsız, lineer ve birbirine eklenebilir olduğu |
| DUO'da küçük hedef AP'sinin taban çizgisine göre 5.0 yüzde puan yükseldiği | En küçük hedeflerde bütün alternatif modellerden veya bütün loss fonksiyonlarından her zaman üstün olduğu |
| Trash-ICRA19 üzerinde iyi veri kümeleri arası genelleme sonucu elde edildiği | Bütün deniz koşulları, kameralar, ışık sistemleri veya coğrafyalarda evrensel genelleme |
| RTX 4090 deney sisteminde 156 FPS elde edildiği | Kaynak kısıtlı AUV donanımında aynı FPS, enerji tüketimi veya gecikmenin elde edileceği |
| Seçilmiş nitel örneklerde ve Grad-CAM++ görsellerinde hedef odaklanmasının iyileştiği | Bu görsellerin tek başına istatistiksel genelleme kanıtı olduğu |
Temel sınırlılıklar ve gelecek çalışma
Çalışma üç kamuya açık veri kümesine dayanmaktadır ve gerçek AUV üzerinde uçtan uca saha testi raporlamaz. Donanım değerlendirmesi güçlü bir masaüstü GPU üzerinde yapılmıştır. Farklı su kalitesi, derinlik, aydınlatma, kamera optiği, sıkıştırma, sensör gürültüsü ve gerçek araç hareketinin birlikte değerlendirildiği uzun süreli saha deneyi bulunmamaktadır. Ayrıca kaynak bazı editoryal şablon kalıntıları ve küçük metin-tablo tutarsızlıkları içermektedir.
Yazarlar gelecek çalışmada daha çeşitli gerçek sualtı ortamlarında dayanıklılığın artırılmasını, kaynak kısıtlı platformlar için hafif dağıtımın araştırılmasını, cross-domain sualtı algısına genişlemeyi ve video tabanlı nesne tespitini hedeflemektedir.
Kaynak ve Yöntem Notu
Özgün başlık: SMD-Net: A Shape-Aware Multi-Scale Detection Network for Underwater Object Detection
Yazarlar: Qian Fan, Pengfei Zou, Ziyang Qi, Tian Hua, Runhao Chen, Ye Niu.
Sorumlu yazar: Qian Fan; PDF'de fanqian@yzu.edu.cn adresi verilmiştir.
Afiliyasyonlar: College of Information Engineering, Yangzhou University, Yangzhou 225009, China; Graduate School of Engineering, Kyushu Institute of Technology, Fukuoka 804-8550, Japan; College of Animal Science and Technology, Yangzhou University, Yangzhou 225009, China.
Kaynak türü: Preprint. PDF'nin sayfalarında “This preprint research paper has not been peer reviewed” ifadesi açıkça yer almaktadır.
Platform: SSRN; kaynak PDF'de https://ssrn.com/abstract=7022170 bağlantısı verilmiştir.
DOI: Yüklenen PDF'de DOI yazılmamıştır ve erişilebilir bibliyografik web taramasında bağımsız olarak doğrulanamadığı için DOI tahmin edilmemiştir.
Dergi / cilt / sayı: Kaynak PDF'de belirli bir dergi, cilt veya sayı bilgisi bulunmamaktadır. Sayfa altlarında “Preprint submitted to Elsevier” şablon ifadesi görülmektedir; bu ifade belirli bir Elsevier dergisinde yayımlanmış veya kabul edilmiş makale anlamına gelmez.
Yayın tarihi: Yüklenen PDF'nin görünür bibliyografik alanlarında tarih bulunmamaktadır; doğrulanmış tarih olmadığı için eklenmemiştir.
Lisans: PDF'de açık bir yeniden kullanım lisansı belirtilmemiştir. Kaynak şekillerini birebir kopyalamadan önce SSRN ve hak sahibi lisans koşulları ayrıca doğrulanmalıdır.
Veri erişilebilirliği: “Data will be made available upon request.”
Çıkar çatışması: Yazarlar bilinen mali çıkar çatışması veya çalışmayı etkileyebilecek kişisel ilişki bildirmemiştir.
CRediT notu: Kaynağın CRediT bölümünde gerçek yazar adları yerine “First Author”, “Second Author”, “Third Author” gibi şablon yer tutucuları kalmıştır. Bu nedenle katkı rollerini belirli yazarlara kesin biçimde eşlemek güvenli değildir. Kaynak, ilk yazar için conceptualization, methodology, software, investigation, formal analysis, data curation, visualization ve original draft; ikinci-dördüncü yazarlar için validation, resources ve review/editing; beşinci-altıncı yazarlar için software, validation ve visualization rolleri yazmaktadır.
Kaynak içi editoryal/tutarlılık notları:
| Konum | Kaynakta görülen durum | Verianla yaklaşımı |
|---|---|---|
| Sayfa üst bilgileri | “Short Title of the Article” yer tutucusu çok sayıda sayfada korunmuştur. | Çalışmanın bilimsel sonucu olarak yorumlanmadı; preprint hazırlık kalıntısı olarak not edildi. |
| CRediT | Gerçek isimler yerine First Author, Second Author vb. kullanılmıştır. | Katkılar isimlere sessizce atanmadı. |
| MFM metni | İki giriş özelliği bir cümlede iki kez \(\tilde F_{high}\) olarak yazılmıştır. | Eq. (9)-(14) ve Figür 6'nın \(\tilde F_{high}\) + \(\tilde F_{low}\) yapısı olduğu açıklanarak metin hatası görünür tutuldu. |
| PIoU yorumu / Tablo 6 | Metin PIoU'nun küçük nesnelerde avantajını vurgular; ancak SIoU APS=49.3, PIoU=48.9'dur. | Tablodaki sayı esas alındı; PIoU'nun genel AP ve AP75 üstünlüğü ayrı belirtildi. |
| SFEM konvolüsyon ablasyonu | DySnake genel ölçütlerde en iyi iken Star Conv APS'de 49.0 ile DySnake'ın 48.9 değerini aşmaktadır. | “Her ölçütte en iyi” şeklinde genelleme yapılmadı. |
Temel bilimsel sınırlılık: Sonuçlar kamuya açık veri kümeleri ve RTX 4090 tabanlı laboratuvar/iş istasyonu değerlendirmesine dayanır. Gerçek otonom sualtı aracı üzerinde saha konuşlandırması, enerji tüketimi, gömülü donanım gecikmesi veya uzun süreli deniz operasyonu doğrulanmamıştır.
Görsel yeniden çizim: Figür 2 SMD-Net mimarisi, Figür 3 örnekleme geometrileri, Figür 5-6 RCM/MFM akışı, Figür 9 PIoU sınır geometrisi ve Figür 15 AP-FPS ilişkisi kaynak verilerine sadık özgün Verianla şemaları/grafikleri olarak yeniden çizilebilir.
Verianla Live: DUO ve URPC karşılaştırmaları, bileşen ablasyonu, loss karşılaştırması ve AP-FPS dengesi için uygundur. Runtime görselleştirme gerçek tablo değerlerini kaynak-of-truth olarak kullanmalı; yeni ara AP/FPS değerleri üretmemelidir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir