
Bu çalışma, gemilerden yayılan akustik sinyalleri düşük hesaplama kapasitesine sahip sualtı platformlarında sınıflandırmak için FADD-Net adlı fizik bilgili ve hafif bir sinir ağı önermektedir. Model; ham sesleri 128 Mel bandından oluşan log-Mel spektrogramlarına dönüştürmekte, uzun süreli mekanik periyotları Fourier alanındaki Küresel Frekans Evrişim Bloğu ile süzmekte ve geçici pervane kavitasyon darbeleri ile kararlı makine çizgi spektrumlarını Çok Uzmanlı Zaman-Frekans Ayrıştırma modülü üzerinden farklı yönlerde işlemektedir. DeepShip veri kümesinde model, yalnızca 0,66 milyon parametre ve 110,05 milyon FLOP ile 3, 5 ve 10 saniyelik kesitlerde sırasıyla %75,04, %77,17 ve %77,96 doğruluk elde etmiştir. Bununla birlikte sonuçlar kamuya açık veri kümeleri ve masaüstü GPU deneyleriyle sınırlıdır; gerçek zamanlı gömülü cihaz, otonom sualtı aracı veya deniz denemesi yapılmamıştır.
FADD-Net’in temel yeniliği, akustik spektrogramı sıradan bir görüntü gibi aynı yönde işlemek yerine zaman ve frekans eksenlerinin farklı fiziksel anlamlarını mimariye yansıtmasıdır. Zaman ekseni kısa süreli kavitasyon darbelerini ve enerji değişimlerini, frekans ekseni ise makine titreşimlerinden doğan dar bantlı çizgi spektrumlarını taşımaktadır. Model, bu iki yapıyı yönsel ve anizotropik evrişimlerle ayrı uzman dallarına yönlendirmekte; ardından koordinat dikkatiyle hangi zaman aralığı ve frekans bandının sınıflandırma açısından daha önemli olduğunu yeniden ağırlıklandırmaktadır.
DeepShip üzerindeki ana deneylerde FADD-Net, incelenen bütün kesit sürelerinde en yüksek doğruluğu vermiştir. ResNet-18’in 11,17 milyon parametresine karşılık 0,66 milyon parametre kullanarak yaklaşık 16,9 kat daha küçük bir model oluşturmuş; 3 saniyelik kesitlerde ResNet-101’in %74,69’luk doğruluğunu %75,04 ile aşmıştır. ShipsEar veri kümesine aktarım öğrenmesinde ise %81,07 test doğruluğu elde ederek en yakın karşılaştırma modellerinin %74,27’lik sonucunu 6,80 yüzde puan aşmıştır. Ancak gerçek okyanus gürültüsünün 5 dB olduğu koşulda ConvNeXt-Tiny’nin %56,20’lik doğruluğu, FADD-Net’in %53,93’lük sonucundan daha yüksektir; bu nedenle model her gürültü koşulunda mutlak olarak üstün değildir.
Türkiye açısından: FADD-Net yaklaşımı; Türkiye’nin Karadeniz, Marmara, Ege ve Akdeniz’deki liman izleme sistemleri, otonom sualtı araçları, deniz trafiği araştırmaları, çevresel akustik gözlem ve açık deniz enerji tesislerinin çevresel güvenliği gibi alanlarda değerlendirilebilir. Türkiye’de uygulanmadan önce yerel gemi tipleri, liman gürültüsü, sığ su çok yollu yayılımı, değişken deniz durumu, biyolojik sesler ve farklı hidrofon sistemleriyle ayrı veri kümeleri oluşturulmalı; model gerçek gömülü işlemcilerde gecikme, enerji tüketimi ve bellek kullanımı açısından sınanmalıdır. Çalışmadan Türkiye denizlerinde doğrudan kullanılabilecek hazır bir sonar sistemi, gerçek zamanlı operasyon garantisi veya bütün gemi tipleri için güvenilir sınıflandırma sonucu çıkarılamaz.
Araştırmanın temel problemi nedir?
Pasif sonar sistemleri, çevreye aktif akustik sinyal göndermeden sualtındaki kaynakların yaydığı sesleri dinler. Gemi sınıflandırmasında temel bilgi kaynağı, gemi makineleri, pervaneler ve hidrodinamik akış tarafından üretilen gemi kaynaklı gürültüdür. Bu sesler hedefin sınıfına ilişkin bilgi taşımakla birlikte okyanus ortamında gürültü, çok yollu yayılım ve değişken çalışma koşulları nedeniyle kolayca bozulmaktadır.
Çalışma iki sorunu aynı anda ele almaktadır:
- Akustik hedefe ait zayıf ve ayırt edici işaretlerin yoğun çevresel gürültüden ayrılması.
- Bu ayrımın enerji ve işlem kapasitesi sınırlı otonom sualtı platformlarında çalışabilecek kadar küçük bir modelle gerçekleştirilmesi.
Ağır Transformer veya derin evrişimli modeller geniş küresel bağlamı öğrenebilse de milyonlarca parametre ve yüksek işlem maliyeti gerektirmektedir. Çok küçük modeller ise işlem maliyetini azaltırken gemiye özgü karmaşık zaman-frekans yapılarını yeterince ayıramayabilmektedir. FADD-Net, bu doğruluk-verimlilik çatışmasını fiziksel ses üretim mekanizmalarını doğrudan ağ mimarisine yansıtarak çözmeyi amaçlamaktadır.
Gemi kaynaklı ses hangi fiziksel bileşenlerden oluşmaktadır?
Çalışma, gemi kaynaklı akustik gürültüyü üç temel bileşen üzerinden açıklamaktadır:
- Makine titreşimleri: Dizel motor, şaft, dişli ve yardımcı makineler özellikle düşük frekanslarda kararlı ve dar bantlı çizgi spektrumları oluşturur.
- Pervane kavitasyonu: Pervane çevresindeki basınç düşüşlerinin kabarcık üretmesi ve bu kabarcıkların çökmesi, geniş bantlı ve zaman içinde darbeli bir enerji yapısı meydana getirir.
- Hidrodinamik gürültü: Gövde çevresindeki akış ve türbülans daha çok yüksek frekanslı, sürekli ve düzensiz bileşenler üretir.
Bu bileşenlerin spektrogram üzerindeki geometrileri farklıdır. Kararlı makine harmonikleri zaman boyunca devam eden yatay çizgilere, kısa süreli kavitasyon olayları ise belirli zaman noktalarında geniş frekans bantlarına yayılan dikey veya yerel enerji kümelerine benzeyebilir. Standart 3 × 3 evrişimler bu iki ekseni aynı fiziksel yapıya sahipmiş gibi işler ve bileşenlerin birbirine karışmasına yol açabilir.
Neden ham ses yerine log-Mel spektrogramı kullanılmıştır?
Ham zaman dalgası bütün sinyal bilgisini korusa da hedefe ait düzenlerin deniz gürültüsü altında doğrudan ayırt edilmesi güçtür. FADD-Net, sinyalin zaman içinde hangi frekanslarda enerji taşıdığını gösteren iki boyutlu log-Mel spektrogramlarını kullanmaktadır.
İlk olarak kısa zamanlı Fourier dönüşümüyle her zaman çerçevesinin güç spektrumu P(t,k) hesaplanmıştır. Ardından fiziksel frekans Mel ölçeğine dönüştürülmüştür:
\[ \operatorname{Mel}(f) = 2595\log_{10}\left(1+\frac{f}{700}\right) \]
- f, hertz cinsinden fiziksel frekanstır.
- Mel(f), insan işitme sisteminin düşük frekanslarda daha yüksek çözünürlük göstermesini yaklaşık olarak temsil eden Mel değeridir.
Çalışmada 128 adet örtüşen üçgensel Mel filtresi kullanılmıştır. Her filtrenin güç spektrumuna uyguladığı ağırlıklı toplam şu şekilde verilmiştir:
\[ M(t,m)=\sum_k P(t,k)H_m(k), \quad m\in[1,128] \]
- t, zaman çerçevesidir.
- k, kısa zamanlı Fourier dönüşümündeki frekans kutusudur.
- Hm(k), m numaralı Mel filtresinin k frekans kutusundaki ağırlığıdır.
- M(t,m), ilgili zaman ve Mel bandındaki süzülmüş enerjidir.
Enerjinin dinamik aralığını sıkıştırmak ve güçlü arka planın altında kalan zayıf çizgi spektrumlarını görünür hâle getirmek için logaritmik dönüşüm uygulanmıştır:
\[ L(t,m)=10\log_{10}\left(M(t,m)+\delta\right) \]
Burada δ = 10−6, sıfır değerinin logaritmasının alınmasını önleyen küçük pozitif sabittir. Ağın girdisi 1 × 128 × T boyutlu log-Mel tensörüdür; 128 frekans bantlarını, T ise segment uzunluğuna bağlı zaman çerçevelerini temsil etmektedir.
Ses verileri nasıl ön işlenmiştir?
- Bütün kayıtlar 16 kHz örnekleme hızına dönüştürülmüştür.
- Nyquist-Shannon ilişkisine göre 8 kHz altındaki frekanslar korunmuştur.
- Kısa zamanlı Fourier dönüşümünde 50 ms Hann penceresi kullanılmıştır.
- Ardışık pencereler arasındaki ilerleme 25 ms olarak belirlenmiştir.
- 128 Mel filtresi uygulanmıştır.
- Son temsil logaritmik dB ölçeğine çevrilmiştir.
Çalışmanın yorumuna göre 16 kHz’e yeniden örnekleme, gemi seslerinin bilgi taşıyan 0-8 kHz bandını korurken daha yüksek frekanslı hidrodinamik gürültünün bir bölümünü dışarıda bırakmaktadır. Ancak bu tercih, 8 kHz üzerindeki olası hedef bilgisinin kullanılmadığı anlamına gelir.
FADD-Net’in genel mimarisi nasıldır?
Şekil 2’de gösterilen mimari, log-Mel spektrogramından gemi sınıfına kadar aşağıdaki akışı izlemektedir:
- İki katmanlı başlangıç bloğu, kanal sayısını artırır ve ilk uzamsal küçültmeyi gerçekleştirir.
- Küresel Frekans Evrişim Bloğu, özellikleri Fourier alanında süzer.
- Dört aşamalı omurga, kanal sayısını yaklaşık 32’den 80’e doğru kademeli olarak artırır.
- Her aşamada Çok Uzmanlı Zaman-Frekans Ayrıştırma birimleri temel özellik çıkarıcı olarak çalışır.
- Koordinat Dikkati, zaman ve frekans yönlerindeki önemli bölgeleri yeniden ağırlıklandırır.
- Birinci ve üçüncü aşama arasında kısa yol bağlantısı, ince akustik ayrıntıların kaybolmasını azaltır.
- Küresel Bağlam Bloğu, uzak zaman-frekans noktaları arasındaki ilişkileri birleştirir.
- Sınıflandırma başlığı, özellikleri gemi kategorisi olasılıklarına dönüştürür.
Omurga aşamalarından önce kullanılan ARN modülü, gürültü baskılama ile zayıf hedef enerjisini koruma arasında uyarlanabilir denge kurmayı amaçlamaktadır. ARN’nin ayrıntılı mimarisi bu çalışmada baştan tanımlanmamış, önceki araştırmaya atıf yapılmıştır.
Küresel Frekans Evrişim Bloğu ne yapmaktadır?
Küresel Frekans Evrişim Bloğu (Frequency Convolutional Block, FCB), standart evrişimin yalnızca küçük komşulukları görebilmesi sorununu Fourier alanına geçerek aşmayı amaçlamaktadır. Gemi motoru ve pervane ritimleri uzun zaman aralıklarına yayılan periyodik modülasyonlar oluşturabilir. FCB, tüm spektrogram boyunca bu düzenleri tek işlemde değerlendirebilen küresel bir algı alanı sağlar.
Giriş özellik haritası:
\[ \mathbf{X}\in\mathbb{R}^{C\times H\times W} \]
Burada C kanal sayısını, H frekans boyutunu ve W zaman boyutunu temsil eder. İlk aşamada iki boyutlu gerçek hızlı Fourier dönüşümü uygulanır:
\[ \widetilde{\mathbf{X}}=\mathcal{F}_{2D}(\mathbf{X}) \]
Gerçek değerli girdilerin Hermitsel simetrisi kullanılarak zaman yönündeki Fourier çıktısının yaklaşık yarısı saklanır. Elde edilen karmaşık spektrum, gerçek ve sanal bölümleri öğrenilebilen karmaşık ağırlık tensörüyle eleman bazında çarpılır:
\[ \mathbf{Y}=\widetilde{\mathbf{X}}\odot\mathbf{W} \]
Ağırlıkların düşük modülasyon frekanslarına yoğunlaşması, yavaş değişen ve periyodik gemi ritimlerinin güçlendirilmesi; düzensiz, hızlı değişen gürültünün ise azaltılması biçiminde yorumlanmaktadır.
Süzülmüş özellikler ters Fourier dönüşümüyle zaman-frekans düzlemine geri taşınır:
\[ \mathbf{X}_{filtered}=\mathcal{F}_{2D}^{-1}(\mathbf{Y}) \]
Yerel ayrıntıların kaybolmasını ve eğitim kararsızlığını önlemek için özgün özellik haritası artık bağlantıyla eklenir:
\[ \mathbf{X}_{out}=\mathbf{X}+\mathbf{X}_{filtered} \]
FCB’nin teorik karmaşıklığı yaklaşık olarak:
\[ \mathcal{O}\left(CHW\log(HW)\right) \]
şeklindedir. Bu değer, bütün zaman-frekans noktaları arasında doğrudan ilişki kuran standart öz-dikkatin kuadratik maliyetinden daha düşüktür.
Çok Uzmanlı Zaman-Frekans Ayrıştırma modülü nasıl çalışmaktadır?
Multi-Expert Time-Frequency Decoupling (METFD) modülü, girdiyi üç özel uzman dalına ayırmaktadır:
| Uzman dalı | Temel işlem yönü | Hedeflenen akustik yapı |
|---|---|---|
| Zaman uzmanı | 1 × 3 ve 1 × 5 derinlik ayrılabilir evrişimler | Kısa süreli pervane kavitasyon darbeleri ve zaman içindeki enerji değişimleri |
| Frekans uzmanı | 3 × 1 ve 5 × 1 derinlik ayrılabilir evrişimler | Kararlı makine harmonikleri ve dar bantlı çizgi spektrumları |
| Ortak uzman | 3 × 3 genişletilmiş evrişim | Geniş bantlı sürekli spektrum ve iki boyutlu arka plan dokusu |
Giriş önce 1 × 1 evrişimle C kanaldan 2C kanala genişletilmektedir. Zaman uzmanı frekans ekseninde havuzlama yaparak 2C × 1 × W boyutlu zaman izleri, frekans uzmanı zaman ekseninde havuzlama yaparak 2C × H × 1 boyutlu spektral izler, ortak uzman ise küresel ortalama havuzlamayla 2C × 1 × 1 bağlam vektörü üretmektedir.
Üç uzman çıktısı eleman bazında toplanmakta, 1 × 1 izdüşümle tekrar C kanala indirilmekte ve koordinat dikkatinden geçirilmektedir:
\[ \mathbf{Y}=\mathbf{X}+\operatorname{CoordAtt}\left(F_{proj}\left(E_t(\mathbf{X}')\oplus E_f(\mathbf{X}')\oplus E_j(\mathbf{X}')\right)\right) \]
Burada Et, Ef ve Ej sırasıyla zaman, frekans ve ortak uzmanları; ⊕ ise eleman bazında toplamayı göstermektedir. Artık bağlantı, ayrıştırma sırasında özgün yerel bilgilerin tamamen kaybolmasını önlemektedir.
Koordinat dikkati neden gereklidir?
Birçok dikkat mekanizması iki boyutlu özellik haritasını tek bir kanal değerine indirger. Bu yaklaşım “hangi kanal önemlidir?” sorusunu yanıtlasa da önemli işaretin hangi zamanda ve hangi frekansta bulunduğunu silebilir.
Koordinat Dikkati, zaman ve frekans eksenlerini ayrı ayrı havuzlar:
- Bir vektör her frekans bandının zaman boyunca ortalama önemini taşır.
- Diğer vektör her zaman çerçevesinin frekanslar boyunca ortalama önemini taşır.
Bu iki yönsel temsil birleştirilir, 1 × 1 evrişim ve doğrusal olmayan dönüşümlerden geçirilir, ardından tekrar zaman ve frekans ağırlıklarına ayrılır. Son özellik:
\[ \widehat{\mathbf{U}}=\mathbf{U}\odot A_h\odot A_w \]
biçiminde oluşturulur. Ah frekans yönündeki, Aw zaman yönündeki dikkat ağırlıklarını temsil eder. Böylece model hem belirli bir çizgi spektrumunun frekans konumunu hem de kısa süreli kavitasyon olayının zaman konumunu koruyabilir.
Küresel Bağlam Bloğu ne sağlamaktadır?
METFD ve koordinat dikkati yerel ve yönsel özellikleri işlerken, Küresel Bağlam Bloğu farklı zaman-frekans bölgelerinden gelen bilgileri tek bağlamda toplar. Giriş özellik haritasından 1 × 1 evrişim ve Softmax ile uzamsal dikkat maskesi oluşturulur. Düzleştirilmiş özelliklerle maske çarpılarak kanal başına küresel bağlam vektörü hesaplanır:
\[ \mathbf{V}_{gc}=\mathbf{V}+\mathbf{W}_v\left(\mathbf{V}_{flat}\mathbf{M}^{T}\right) \]
Bu temsil daha sonra kanal genişletme, küresel ortalama havuzlama, dropout ve doğrusal sınıflandırma katmanına gönderilir.
METFD neden standart 3 × 3 evrişimden daha hafiftir?
Standart 3 × 3 evrişimin yaklaşık işlem maliyeti:
\[ \mathcal{O}(9C^2HW) \]
olarak verilmiştir. METFD’nin toplam maliyeti ise:
\[ \mathcal{O}_{METFD}=\mathcal{O}\left(4C^2HW+42CHW+4C^2(H+W+1)\right) \]
şeklinde hesaplanmıştır. H + W değerinin genellikle HW çarpımından çok küçük olması nedeniyle ana maliyet 4C²HW teriminden gelmektedir. Araştırmacılar bu yapının standart 3 × 3 evrişime göre FLOP sayısını %50’den fazla azalttığını belirtmektedir.
Bu teorik hesap, gerçek cihazdaki gecikmeyi veya enerji tüketimini doğrudan ölçmez. Fourier dönüşümünün, bellek erişiminin ve belirli donanım hızlandırıcılarının uygulama maliyeti FLOP sayısından farklı olabilir.
DeepShip veri kümesi nasıl kullanılmıştır?
DeepShip, Ocean Networks Canada tarafından sağlanan toplam 47 saat 4 dakikalık gerçek sualtı kaydını içermektedir. Veri kümesindeki 265 farklı gemi dört geniş sınıfa ayrılmıştır:
- Yük gemisi
- Yolcu gemisi
- Tanker
- Römorkör
Kayıtlar 3, 5 ve 10 saniyelik kesitlere ayrılmıştır. Üç ve beş saniyelik kesitlerde örtüşmesiz bölme, 10 saniyelik kesitlerde ise yeterli örnek sayısını korumak amacıyla 5 saniyelik örtüşme kullanılmıştır.
| Kesit süresi | Eğitim örneği | Doğrulama örneği | Test örneği | Toplam |
|---|---|---|---|---|
| 3 saniye | 44.518 | 5.912 | 6.038 | 56.468 |
| 5 saniye | 26.748 | 3.536 | 3.486 | 33.770 |
| 10 saniye | 26.153 | 3.475 | 3.553 | 33.181 |
Önemli yöntemsel tercih, bölmenin kesitler üzerinden rastgele değil özgün ses dosyası kimlikleri üzerinden yapılmasıdır. Aynı uzun kayda ait benzer çevresel gürültünün hem eğitim hem test kümesine düşmesi böylece önlenmeye çalışılmıştır. Eğitim, doğrulama ve test oranı yaklaşık 8:1:1’dir ve her sınıf için kullanılan özgün dosya kimlikleri çalışmanın Tablo 2’sinde açıkça listelenmiştir.
ShipsEar veri kümesi nasıl düzenlenmiştir?
ShipsEar, İspanya’nın kuzeybatı Atlantik kıyısında kaydedilen 90 ses kaydı ve yaklaşık üç saatlik veri içermektedir. Veri kümesindeki 11 gemi türü ve çevresel gürültü, literatürde kullanılan beş üst sınıfa ayrılmıştır:
| Sınıf | İçerdiği kaynaklar |
|---|---|
| A | Balıkçı tekneleri, trol tekneleri, midye tekneleri, römorkörler ve tarama gemileri |
| B | Motorlu tekneler, kılavuz tekneleri ve yelkenliler |
| C | Yolcu gemileri |
| D | Okyanus yolcu gemileri ve ro-ro gemileri |
| E | Doğal arka plan gürültüsü |
Kayıtlar örtüşmesiz 5 saniyelik kesitlere ayrılmış ve toplam 2.094 örnek oluşturulmuştur:
- Eğitim: 1.709 örnek
- Doğrulama: 228 örnek
- Test: 157 örnek
ShipsEar’ın küçük olması nedeniyle bu veri kümesi, DeepShip üzerinde önceden eğitilen modellerin farklı akustik ortama aktarımını değerlendirmek için kullanılmıştır.
Model hangi ölçütlerle değerlendirilmiştir?
Genel doğruluk:
\[ \operatorname{Accuracy}=\frac{\sum_{k=1}^{K}TP_k}{N} \]
olarak hesaplanmıştır. TPk, k sınıfındaki doğru pozitif örnekleri; N toplam örnek sayısını ifade eder.
Sınıf başına kesinlik ve duyarlılık:
\[ P_k=\frac{TP_k}{TP_k+FP_k} \]
\[ R_k=\frac{TP_k}{TP_k+FN_k} \]
biçimindedir. Sınıfların örnek sayısı farklı olduğu için Macro-F1 ayrıca kullanılmıştır:
\[ \operatorname{Macro-F1}=\frac{1}{K}\sum_{k=1}^{K}\frac{2P_kR_k}{P_k+R_k} \]
Macro-F1 her sınıfa eşit ağırlık verir. Ayrıca öğrenilebilir parametre sayısı ve FLOP değeri hesaplama ve bellek gereksinimlerinin yaklaşık göstergeleri olarak raporlanmıştır.
DeepShip eğitim ayarları nelerdir?
| Ayar | Değer |
|---|---|
| Donanım | Intel Core i5-14600KF, NVIDIA GeForce RTX 4060 Ti, 64 GB bellek |
| Yazılım | Python 3.8.20, PyTorch 2.4.1, CUDA 12.1 |
| Epoch | 200 |
| Yığın boyutu | 16 |
| Optimizasyon | SGD |
| Başlangıç öğrenme oranı | 6 × 10−3 |
| Ağırlık azalması | 7 × 10−5 |
| Öğrenme oranı planlayıcısı | ReduceLROnPlateau |
| Dropout | 0,2 |
| Etiket yumuşatma | 0,1 |
Beş saniyelik kesitler, sonraki ablation, gürültü dayanıklılığı ve görselleştirme deneylerinin ana ayarı olarak seçilmiştir. Araştırmacılar bu sürenin mekanik modülasyon çevrimlerini yakalamak için yeterli, 10 saniyelik girdilere göre ise daha az hesaplama yüklü olduğunu belirtmektedir.
Ana model karşılaştırması ne göstermektedir?
Tablo 3’te bütün modeller aynı log-Mel girdileri ve aynı eğitim hattıyla sıfırdan eğitilmiştir. FLOP değerleri 3 saniyelik giriş ayarı için verilmiştir.
| Model | Parametre | FLOPs | 3 sn doğruluk / Macro-F1 (%) | 5 sn doğruluk / Macro-F1 (%) | 10 sn doğruluk / Macro-F1 (%) |
|---|---|---|---|---|---|
| ResNet-18 | 11,17 M | 427,10 M | 72,89 / 72,26 | 72,37 / 72,35 | 73,01 / 72,26 |
| ResNet-34 | 21,28 M | 881,31 M | 72,89 / 72,26 | 72,03 / 71,63 | 70,14 / 69,61 |
| ResNet-50 | 23,51 M | 992,37 M | 72,69 / 71,98 | 73,55 / 73,28 | 68,28 / 67,53 |
| ResNet-101 | 42,50 M | 1,91 G | 74,69 / 74,10 | 70,65 / 69,97 | 68,90 / 67,70 |
| MobileNet-V2 | 2,23 M | 77,91 M | 72,95 / 71,63 | 70,71 / 70,76 | 74,89 / 74,11 |
| ShuffleNet-V2 | 1,26 M | 35,80 M | 70,09 / 68,96 | 66,27 / 65,44 | 72,84 / 72,06 |
| EfficientNet-B0 | 4,01 M | 99,86 M | 73,43 / 72,83 | 74,04 / 73,41 | 77,17 / 76,78 |
| ConvNeXt-Tiny | 27,81 M | 916,69 M | 73,88 / 72,61 | 72,40 / 72,38 | 74,87 / 74,00 |
| CFTANet | 0,47 M | 118,61 M | 70,85 / 69,50 | 71,43 / 70,65 | 73,02 / 73,05 |
| UATFSNet | 0,03 M | 2,78 M | 66,03 / 65,07 | 67,47 / 66,60 | 69,97 / 68,72 |
| FADD-Net | 0,66 M | 110,05 M | 75,04 / 74,66 | 77,17 / 77,02 | 77,96 / 77,76 |
FADD-Net, bütün kesit sürelerinde en yüksek doğruluğu elde etmiştir. En güçlü hafif karşılaştırmalardan EfficientNet-B0’a göre doğruluk farkları 3 saniyede 1,61, 5 saniyede 3,13 ve 10 saniyede 0,79 yüzde puandır. FADD-Net, EfficientNet-B0’ın parametre bütçesinin yaklaşık %16,5’ini kullanmaktadır; ancak FLOP değeri 3 saniyelik girişte EfficientNet-B0’dan yaklaşık %10 daha yüksektir. Bu nedenle model her hesaplama ölçütünde en küçük değildir.
ResNet-101’in doğruluğu 3 saniyede %74,69 iken 10 saniyede %68,90’a düşmüştür. FADD-Net ise giriş süresi uzadıkça %75,04’ten %77,96’ya yükselmiştir. Araştırmacılar bu farkı büyük izotropik modellerin uzun kayıtlardaki arka plan gürültüsüne aşırı uyum göstermesiyle ilişkilendirmektedir. Bununla birlikte çalışma, bu mekanizmayı farklı eğitim tekrarları veya bağımsız aşırı uyum ölçümleriyle doğrudan sınamamıştır.
FADD-Net’in hafifliği nasıl yorumlanmalıdır?
- ResNet-18’e göre parametre sayısı yaklaşık 16,9 kat daha düşüktür.
- ResNet-18’e göre 3 saniyelik girdide FLOP sayısı yaklaşık %74,2 daha azdır.
- ResNet-101’e göre parametre sayısı yaklaşık 64 kat daha düşüktür.
- ResNet-101’e göre FLOP sayısı yaklaşık %94,2 daha azdır.
- UATFSNet, 0,03 milyon parametreyle FADD-Net’ten çok daha küçüktür; ancak doğruluğu belirgin biçimde düşüktür.
- EfficientNet-B0, FADD-Net’ten daha düşük FLOP değerine sahiptir; ancak daha fazla parametre kullanmaktadır.
Bu nedenle FADD-Net “en küçük model” değil, çalışmada ölçülen doğruluk ile model boyutu arasında güçlü bir denge kuran modeldir.
Ablation deneyleri hangi modüllerin önemli olduğunu göstermektedir?
Beş saniyelik ana ayarda her seferinde bir bileşen kaldırılmış veya geleneksel eşdeğeriyle değiştirilmiştir:
| Yapılandırma | FLOPs (M) | Doğruluk (%) | Tam modele göre değişim |
|---|---|---|---|
| Tam FADD-Net | 228,70 | 76,94 | – |
| FCB olmadan | 227,88 | 74,61 | −2,33 yüzde puan |
| METFD yerine 3 × 3 evrişim | 566,59 | 75,33 | −1,61 yüzde puan |
| Koordinat dikkati olmadan | 226,85 | 73,72 | −3,22 yüzde puan |
| ARN yerine örnek normalizasyonu | 228,70 | 76,46 | −0,48 yüzde puan |
| Aşamalar arası kısa yol olmadan | 227,88 | 76,25 | −0,69 yüzde puan |
En büyük doğruluk kaybı koordinat dikkatinin kaldırılmasında oluşmuştur. Bu sonuç, önemli zaman ve frekans konumlarının korunmasının yalnızca kanal ağırlıklandırmasından daha değerli olduğunu desteklemektedir. FCB’nin kaldırılması 2,33 yüzde puanlık kayba yol açmış ve uzun süreli periyodik bilgilerin katkısını göstermiştir.
METFD’nin standart 3 × 3 evrişimle değiştirilmesi doğruluğu düşürürken işlem maliyetini 228,70 milyondan 566,59 milyon FLOP’a yükseltmiştir. Bu bulgu, yönsel ayrıştırmanın aynı anda hem daha doğru hem daha hesaplama verimli olabileceğini göstermektedir.
Ablation tablosundaki tam model doğruluğu %76,94’tür; ana karşılaştırma tablosundaki 5 saniye doğruluğu ise %77,17’dir. Çalışmada bu 0,23 yüzde puanlık farkın farklı eğitim çalıştırmalarından kaynaklanıp kaynaklanmadığı açıklanmamış ve tekrarlar arası standart sapma verilmemiştir.
Hangi evrişim çekirdeği birleşimi en iyi sonucu vermiştir?
METFD’nin zaman ve frekans yönlerindeki çekirdek boyutları ayrı ayrı denenmiştir. En yüksek doğruluk, zaman yönünde 1 × 3 ve frekans yönünde 3 × 1 çekirdeğin birleşiminde %76,53 olarak ölçülmüştür.
| Zaman çekirdeği | Frekans 1 × 1 | Frekans 3 × 1 | Frekans 5 × 1 |
|---|---|---|---|
| 1 × 1 | %69,63 | %73,03 | %73,38 |
| 1 × 3 | %73,81 | %76,53 | %73,50 |
| 1 × 5 | %72,28 | %74,02 | %73,41 |
1 × 1 çekirdekler yerel bağlamı yakalamakta yetersiz kalmıştır. Çekirdeklerin 5 uzunluğuna çıkarılması ise kısa kavitasyon darbelerini fazla yumuşatmış veya ayrı harmonikleri geniş bantlı gürültüyle birleştirmiş olabilir. Bu yorum, performans eğilimleri ve gemi seslerinin fiziksel geometrisi üzerinden yapılmıştır; darbelerin gerçek zaman ve bant genişlikleri ayrı ölçülmemiştir.
Üç uzman dalının birlikte kullanılması ne kazandırmıştır?
| Yapılandırma | Doğruluk (%) |
|---|---|
| Yalnız zaman uzmanı | 72,60 |
| Yalnız frekans uzmanı | 71,85 |
| Yalnız ortak uzman | 71,55 |
| Üç uzman temel birleşimi | 75,04 |
| Genişletilmiş evrişimli tam METFD | 75,85 |
Tek bir fiziksel bileşene odaklanmak bütün gemi sınıfları için yeterli değildir. Zaman, frekans ve ortak bağlamın birleştirilmesi doğruluğu yaklaşık 2,4-3,5 yüzde puan artırmıştır. Genişletilmiş evrişimler, parametre sayısını önemli ölçüde büyütmeden daha geniş iki boyutlu bağlam yakalayarak ek 0,81 yüzde puan kazandırmıştır.
Model sentetik gürültü altında nasıl davranmıştır?
İlk gürültü deneyinde temiz test sinyallerine −5 dB ile 20 dB arasında katkılı beyaz Gauss gürültüsü eklenmiştir. FADD-Net, incelenen bütün sentetik gürültü düzeylerinde karşılaştırma modellerinden daha yüksek doğruluk eğrisi göstermiştir.
ConvNeXt-Tiny −5 dB’de yaklaşık %30,4 doğruluk korurken FADD-Net’in eğrisi bunun üzerinde kalmıştır. Ancak şekil üzerindeki bütün noktaların kesin sayısal değerleri tablo olarak verilmediğinden grafikten okunan ara değerlerin kesin sonuç gibi kullanılması uygun değildir.
Gerçek okyanus gürültüsü altında sonuçlar nasıldır?
İkinci gürültü deneyinde ShipsEar Sınıf E’den alınan gerçek okyanus arka planı DeepShip test örneklerine eklenmiştir. Bu ortam, beyaz gürültüden daha düzensiz ve zamanla değişen bir yapıya sahiptir.
- −5 dB’de ResNet-50 doğruluğu %22,29’a düşmüştür.
- −5 dB’de EfficientNet-B0 doğruluğu %23,35’e düşmüştür.
- 5 dB’de ConvNeXt-Tiny %56,20 ile FADD-Net’in %53,93 değerini geçmiştir.
- FADD-Net 10 dB’den itibaren bütün karşılaştırma modellerini aşmıştır.
- 20 dB’de FADD-Net %76,31, ConvNeXt-Tiny ise %71,63 doğruluk vermiştir.
Bu sonuç, FADD-Net’in orta ve yüksek sinyal-gürültü oranlarında fiziksel harmonikleri ayırmada avantajlı olduğunu; ancak aşırı karmaşık gerçek gürültü koşullarında büyük bir modelin sınırlı bir bölgede daha yüksek sonuç verebildiğini göstermektedir. Çalışmanın “üstün gürültü dayanıklılığı” iddiası bu istisna dikkate alınarak yorumlanmalıdır.
Karışıklık matrisleri hangi sınıfların zor olduğunu göstermektedir?
| Sınıf | EfficientNet-B0 doğru sınıflandırma | FADD-Net doğru sınıflandırma |
|---|---|---|
| Yük gemisi | %66 | %74 |
| Yolcu gemisi | %85 | %90 |
| Tanker | %78 | %74 |
| Römorkör | %70 | %77 |
FADD-Net yük gemisi, yolcu gemisi ve römorkör sınıflarında iyileşmiş; tankerlerde dört yüzde puan gerilemiştir. Tanker örneklerinin %15’i yük gemisi, %8’i yolcu gemisi olarak sınıflandırılmıştır. Yük gemilerinin tanker olarak karıştırılma oranı EfficientNet-B0’da %24 iken FADD-Net’te %19’a düşmüştür.
Römorkörlerin %17’si yolcu gemisi olarak sınıflandırılmıştır. Çalışmanın fiziksel yorumuna göre yüksek devirli ve yük altında çalışan römorkör pervaneleri, küçük yolcu gemilerindekine benzeyen güçlü yüksek frekanslı kavitasyon ritimleri üretebilir. Yük gemileri ile tankerler ise düşük hızda çalışan büyük ticari gemiler oldukları için benzer düşük frekanslı makine harmoniklerine sahiptir.
t-SNE görselleştirmesi ne göstermektedir?
Şekil 12, özelliklerin ağ içinde ilerledikçe nasıl ayrıştığını göstermektedir:
- Ham girdide dört gemi sınıfının noktaları büyük ölçüde iç içedir.
- Başlangıç evrişimlerinden sonra bir miktar açılma oluşsa da sınıf sınırları belirsizdir.
- METFD çıkışında sınıflar arası mesafe artmakta ve sınıf içi yayılım daralmaktadır.
- Son özellik uzayında dört daha belirgin küme oluşmaktadır.
Römorkör kümesi yüksek frekanslı kavitasyon özellikleri nedeniyle daha belirgin ayrılırken yük gemisi ve tanker kümeleri birbirine yakın kalmıştır. t-SNE, yüksek boyutlu özelliklerin iki boyutlu görsel izdüşümüdür; kümelerin görünümü tek başına genelleme veya nedensellik kanıtı değildir.
Grad-CAM haritaları modelin neye baktığını göstermektedir?
Grad-CAM görsellerinde frekans alanı üç bölgeye ayrılmıştır:
- Düşük frekans: 0-100 Hz
- Orta frekans: 100-1000 Hz
- Yüksek frekans: 1-8 kHz
Yük ve tanker sınıflarında dikkat, düşük ve orta frekanslardaki sürekli yatay çizgilere yoğunlaşmıştır. Bunlar ağır makinelerin kararlı mekanik harmonikleriyle ilişkilendirilmiştir. Yolcu gemisi ve römorkörlerde ise yüksek frekanstaki yerel ve kesikli enerji blokları daha belirgindir; bunlar hızlı pervane dönüşleri ve kavitasyon darbeleriyle açıklanmıştır.
Görseller, ağın yalnızca veri kümesine özgü arka plan desenlerini değil, fiziksel olarak anlamlı ses bölgelerini kullandığı yorumunu desteklemektedir. Bununla birlikte Grad-CAM düşük çözünürlüklü bir önem haritasıdır ve belirli bir fiziksel kaynağın nedensel olarak tanımlandığını kanıtlamaz.
ShipsEar aktarım öğrenmesi nasıl yapılmıştır?
DeepShip’in 5 saniyelik verileriyle önceden eğitilen model ShipsEar’a aktarılmıştır. Beş sınıflı yeni sınıflandırma başlığı oluşturulmuş ve farklı sığ su ortamına uyum sağlaması için FCB yeniden başlatılmıştır.
| Ayar | ShipsEar değeri |
|---|---|
| Epoch | 60 |
| Yığın boyutu | 16 |
| Optimizasyon | AdamW |
| Önceden eğitilmiş omurga öğrenme oranı | 5 × 10−5 |
| Yeni katmanların öğrenme oranı | 2 × 10−3 |
| Ağırlık azalması | 1 × 10−4 |
| Öğrenme oranı planlayıcısı | Kosinüs tavlama |
| Dropout | 0,3 |
| Etiket yumuşatma | 0,1 |
| Kayıp | Sınıf ağırlıklı çapraz entropi |
Önceden eğitilmiş omurgaya düşük, yeni katmanlara daha yüksek öğrenme oranı verilmesi önceki akustik bilgiyi korurken yeni ortama uyum sağlamayı amaçlamaktadır.
Veri kümeleri arası aktarım sonuçları nelerdir?
| Model | ShipsEar test doğruluğu (%) |
|---|---|
| ResNet-18 | 73,30 |
| ResNet-34 | 74,27 |
| ResNet-50 | 72,33 |
| ResNet-101 | 69,90 |
| MobileNet-V2 | 63,11 |
| ShuffleNet-V2 | 65,05 |
| EfficientNet-B0 | 73,30 |
| ConvNeXt-Tiny | 71,84 |
| CFTANet | 74,27 |
| UATFSNet | 73,79 |
| FADD-Net | 81,07 |
FADD-Net, en yakın sonuçlar olan ResNet-34 ve CFTANet’i 6,80 yüzde puan geçmiştir. Araştırmacılar bu farkı Fourier filtresinin ortama özgü düzensiz gürültüyü azaltmasına ve METFD’nin çevreden bağımsız mekanik harmoniklerle kavitasyon ritimlerini ayırmasına bağlamaktadır.
ShipsEar test kümesinde yalnızca 157 segment bulunduğu için tek bir örneğin sonucu yaklaşık 0,64 yüzde puan değiştirebilir. Çalışmada güven aralığı veya farklı veri bölmeleriyle tekrar raporlanmadığından %81,07 sonucu sınırlı test örneklemi bağlamında değerlendirilmelidir.
Çalışmanın güçlü yönleri nelerdir?
- Ağ mimarisi gemi seslerinin fiziksel üretim mekanizmalarıyla ilişkilendirilmiştir.
- Zaman ve frekans eksenleri aynı özellikmiş gibi işlenmek yerine ayrı uzman dallarında değerlendirilmiştir.
- DeepShip bölmesi özgün dosya kimlikleri üzerinden yapılarak kesit sızıntısı azaltılmıştır.
- Üç farklı ses süresi, iki veri kümesi ve farklı model aileleri karşılaştırılmıştır.
- Doğruluk yanında Macro-F1, parametre ve FLOP değerleri raporlanmıştır.
- Her temel modül ablation deneyleriyle ayrı ayrı değerlendirilmiştir.
- Sentetik ve gerçek okyanus gürültüsü ayrı test edilmiştir.
- Karışıklık matrisleri, t-SNE ve Grad-CAM ile model davranışı görselleştirilmiştir.
- FADD-Net, küçük model boyutuyla ağır modelleri geçmiştir.
- DeepShip’ten ShipsEar’a veri kümeleri arası aktarım sınanmıştır.
Çalışmanın sınırlılıkları nelerdir?
- Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
- Model gerçek bir otonom sualtı aracı, pasif sonar cihazı veya gömülü işlemcide çalıştırılmamıştır.
- Çıkarım gecikmesi, gerçek zamanlı kare hızı, RAM kullanımı ve watt cinsinden enerji tüketimi raporlanmamıştır.
- FLOP ve parametre sayıları gerçek donanım performansının yalnızca yaklaşık göstergeleridir.
- Deneylerin tek çalıştırma mı yoksa birden fazla rastgele tohum ortalaması mı olduğu açıklanmamıştır.
- Standart sapma, güven aralığı veya istatistiksel anlamlılık testi verilmemiştir.
- DeepShip ve ShipsEar belirli coğrafi, hidrofon ve gemi dağılımlarını temsil etmektedir; bütün deniz ortamlarına genellenemez.
- ShipsEar test kümesi yalnızca 157 beş saniyelik örnekten oluşmaktadır.
- Gerçek okyanus gürültüsünde 5 dB koşulunda FADD-Net en iyi model değildir.
- Tanker doğruluğu EfficientNet-B0’a göre %78’den %74’e düşmüştür.
- Yük gemisi-tanker ve römorkör-yolcu gemisi karışıklığı devam etmektedir.
- 10 saniyelik örneklerde aynı dosya içinde 5 saniyelik örtüşme kullanılmıştır; bölmeler arasında sızıntı engellense de aynı bölme içinde örnek bağımlılığı artabilir.
- ARN modülünün bütün mimari ayrıntıları bu metinde yeniden verilmemiştir.
- Kaynak kodu, model ağırlıkları ve tam deney yapılandırması için erişim bağlantısı sunulmamıştır.
- Veri artırma yöntemleri ayrıntılı biçimde açıklanmamıştır.
- Model deniz memelileri, çevresel olaylar veya bilinmeyen hedef sınıfları üzerinde sınanmamıştır.
- Yanlış alarm, açık küme tanıma ve dağılım dışı örnek reddetme performansı değerlendirilmemiştir.
Çalışma neyi desteklemektedir?
- Fizik bilgili zaman-frekans ayrıştırmasının küçük model boyutuyla rekabetçi sınıflandırma sağlayabileceğini desteklemektedir.
- FCB, METFD ve koordinat dikkatinin her birinin doğruluğa ölçülebilir katkı sunduğunu göstermektedir.
- FADD-Net’in DeepShip üzerinde incelenen karşılaştırma modellerinden daha yüksek doğruluk verdiğini göstermektedir.
- FADD-Net’in DeepShip’ten ShipsEar’a aktarımda yüksek test doğruluğu sağlayabildiğini göstermektedir.
- Yönsel ve anizotropik işlemlerin standart 3 × 3 evrişime göre daha düşük FLOP ile daha yüksek doğruluk sağlayabileceğini göstermektedir.
- Model kararlarının bazı gemi sınıflarında fiziksel olarak anlamlı frekans ve zaman bölgeleriyle örtüştüğünü desteklemektedir.
Çalışma neyi kanıtlamamaktadır?
- Modelin gerçek deniz görevlerinde aynı doğrulukla çalışacağını kanıtlamamaktadır.
- 0,66 milyon parametrenin otomatik olarak düşük enerji tüketimi veya gerçek zamanlı çalışma sağlayacağını kanıtlamamaktadır.
- FADD-Net’in bütün gürültü seviyelerinde bütün modellerden üstün olduğunu göstermemektedir.
- Modelin bilinmeyen gemi türlerini güvenli biçimde reddedebildiğini kanıtlamamaktadır.
- Hidrofon yerleşimi, derinlik, hava koşulları ve deniz tabanı farklılıklarından bağımsız olduğunu göstermemektedir.
- Askerî veya sivil bir sonar sisteminde operasyonel güvenilirlik, sertifikasyon veya saha başarısı sunmamaktadır.
- Grad-CAM bölgelerinin doğrudan belirli makine veya pervane bileşenlerine ait olduğunu kesin olarak kanıtlamamaktadır.
Çalışmanın Yöntemi ve Bulguları
Araştırma tasarımı
Araştırma, kamuya açık iki sualtı akustik veri kümesi üzerinde denetimli sınıflandırma, model karşılaştırması, ablation analizi, gürültü dayanıklılığı testi, aktarım öğrenmesi ve özellik görselleştirmesi içeren deneysel makine öğrenmesi çalışmasıdır.
Girdi ve çıktı
| Bileşen | Teknik özellik |
|---|---|
| Ham girdi | Gemi kaynaklı sualtı ses kaydı |
| Örnekleme hızı | 16 kHz |
| STFT penceresi | 50 ms Hann |
| STFT ilerlemesi | 25 ms |
| Mel filtresi | 128 |
| Ağ girdisi | 1 × 128 × T log-Mel spektrogramı |
| DeepShip çıktısı | Yük, yolcu, tanker veya römorkör |
| ShipsEar çıktısı | Beş üst akustik sınıf |
FADD-Net temel modülleri
- İki katmanlı evrişimli başlangıç bloğu
- Küresel Frekans Evrişim Bloğu
- Dört aşamalı hafif omurga
- ARN dengeleme modülü
- Çok Uzmanlı Zaman-Frekans Ayrıştırma
- Koordinat Dikkati
- Aşamalar arası kısa yol
- Küresel Bağlam Bloğu
- Dropout düzenlemeli sınıflandırma başlığı
Ana sonuçların teknik özeti
| Ölçüt | FADD-Net sonucu | Yorum |
|---|---|---|
| Parametre sayısı | 0,66 milyon | Ağır ResNet ve ConvNeXt modellerinden belirgin ölçüde küçük |
| 3 saniyelik FLOPs | 110,05 milyon | EfficientNet-B0’dan biraz yüksek, çoğu derin modelden çok düşük |
| 3 saniye doğruluk | %75,04 | Karşılaştırılan modeller içinde en yüksek |
| 5 saniye doğruluk | %77,17 | Karşılaştırılan modeller içinde en yüksek |
| 10 saniye doğruluk | %77,96 | Karşılaştırılan modeller içinde en yüksek |
| 10 saniye Macro-F1 | %77,76 | Sınıf dengesizliğini dikkate alan en yüksek sonuç |
| ShipsEar aktarım doğruluğu | %81,07 | En yakın karşılaştırmadan 6,80 yüzde puan yüksek |
| Gerçek gürültü, 20 dB | %76,31 | Karşılaştırılan modeller içinde en yüksek |
| Gerçek gürültü, 5 dB | %53,93 | ConvNeXt-Tiny’nin %56,20 sonucunun altında |
Modül katkılarının özeti
- Koordinat Dikkati kaldırıldığında doğruluk 3,22 yüzde puan düşmüştür.
- FCB kaldırıldığında doğruluk 2,33 yüzde puan düşmüştür.
- METFD standart 3 × 3 evrişimle değiştirildiğinde doğruluk 1,61 yüzde puan düşmüş ve FLOP değeri yaklaşık 2,48 kat artmıştır.
- ARN kaldırıldığında doğruluk 0,48 yüzde puan düşmüştür.
- Aşamalar arası kısa yol kaldırıldığında doğruluk 0,69 yüzde puan düşmüştür.
Tekrarlanabilirlik açısından eksik bilgiler
- Rastgele tohumlar
- Tekrarlı deneylerin sayısı
- Sonuçların standart sapması
- Kaynak kodu ve model ağırlıkları
- Tam veri artırma yapılandırması
- ARN’nin eksiksiz uygulama ayrıntısı
- Gömülü donanım çıkarım süresi
- Gerçek güç ve bellek ölçümleri
Gerçek saha uygulamasına geçiş için gerekli adımlar
- Farklı hidrofon ve kayıt sistemleriyle yeni deniz veri kümeleri oluşturulması
- Farklı derinlik, deniz tabanı ve çok yollu yayılım koşullarında test
- Yağmur, dalga, biyolojik ses, liman ve endüstri gürültüsünün değerlendirilmesi
- Bilinmeyen hedef ve açık küme tanıma testleri
- Otonom sualtı aracındaki gömülü işlemcide gerçek zamanlı çıkarım
- Watt cinsinden güç ve megabayt cinsinden bellek ölçümü
- Uzun süreli deniz denemesi
- Yanlış alarm, gecikme ve güvenilirlik analizi
- Farklı ülke ve deniz bölgelerinden bağımsız veriyle dış doğrulama
Kaynak ve Yöntem Notu
Çalışmanın özgün adı: FADD-Net: Integrating Global Frequency Filtering and Directional Spectro-Temporal Decoupling for Lightweight Underwater Acoustic Target Recognition
Yazarlar: Chen Liang; Zailei Luo; Dongchen Tian; Ziyu Yan; Jing Xu; Xionghui Li.
Yazar sıralaması: Yukarıdaki liste çalışmadaki özgün yazar sırasını korumaktadır.
Eş birinci yazar: Çalışmada eş birinci yazar veya eş katkı beyanı bulunmamaktadır.
Sorumlu yazarlar: Jing Xu ve Xionghui Li.
Sorumlu yazar e-postaları: jxu-optics@zju.edu.cn; wananmotianlun@foxmail.com.
Kurumlar:
- Ocean College, Zhejiang University, Zhoushan 316021, Çin.
- Advanced Interdisciplinary Technology Research Center, National Innovation Institute of Defense Technology, Pekin 100071, Çin.
- School of Information and Communication Engineering, University of Electronic Science and Technology of China, Chengdu, Çin.
Resmî yayın platformu: SSRN.
Resmî çalışma bağlantısı:SSRN çalışma sayfası
Yayın tarihi: 29 Temmuz 2026.
Yayın yılı: 2026.
Dergi: Bu sürüm için belirli bir hakemli dergi adı veya kabul bilgisi yer almamaktadır.
Yayınevi: Hakemli dergi yayınevi doğrulanmamıştır. Metinde “Preprint submitted to Elsevier” ifadesi bulunmakta, ancak belirli bir Elsevier dergisi belirtilmemektedir.
Kaynak türü: Kamuya açık veri kümeleri üzerinde deneysel makine öğrenmesi ve karşılaştırmalı model değerlendirmesi içeren preprint araştırma makalesi.
Hakemlik durumu: Bu çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; bulgular bu sınırlılık dikkate alınarak okunmalıdır.
Finansman: Finansman bilgisi bu sürümde yer almamaktadır.
Çıkar çatışması: Çıkar çatışması beyanı bu sürümde yer almamaktadır.
Veri erişimi: DeepShip ve ShipsEar açık veri kümeleri kullanılmıştır; ancak çalışmanın eğitilmiş model ağırlıkları, kaynak kodu ve deney çıktı dosyaları için bağlantı verilmemiştir.
Bu Türkçe açıklama; yüklenen 25 sayfalık çalışmanın metni, denklemleri, model şemaları, veri tabloları, performans grafikleri, ablation sonuçları, gürültü deneyleri, karışıklık matrisleri, t-SNE dağılımları ve Grad-CAM haritaları incelenerek hazırlanmıştır. Çalışmada bulunmayan bilimsel sonuçlar eklenmemiştir. Dış kaynak kontrolü yalnızca DOI, SSRN kayıt tarihi ve yayın durumu gibi bibliyografik bilgilerin doğrulanması amacıyla yapılmıştır.
Çalışmanın temel sınırı, “gerçek zamanlı ve enerji kısıtlı platformlara uygunluk” iddiasının parametre ve FLOP hesaplarına dayanmasıdır. Gerçek bir gömülü sistemde gecikme, bellek, enerji tüketimi veya deniz görevi performansı ölçülmemiştir. Ayrıca bağımsız deney tekrarları ve istatistiksel güven aralıkları verilmediğinden küçük doğruluk farklarının kararlılığı doğrulanamamaktadır.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir