
Ushbu tadqiqot kemalardan tarqaladigan akustik signallarni hisoblash quvvati cheklangan suvosti platformalarida tasniflash uchun FADD-Net deb nomlangan fizik bilimlarga asoslangan va yengil neyron tarmoqni taklif etadi. Model xom audio yozuvlarni 128 ta Mel diapazonidan tashkil topgan log-Mel spektrogramlariga aylantiradi, uzoq muddatli mexanik davriyliklarni Fourier sohasidagi Global Frequency Convolution Block orqali filtrlab, vaqtinchalik parrak kavitatsiyasi impulslari bilan barqaror mashina chiziqli spektrlarini Multi-Expert Time-Frequency Decoupling moduli orqali turli yoʻnalishlarda qayta ishlaydi. DeepShip maʼlumotlar toʻplamida model atigi 0,66 million parametr va 110,05 million FLOP bilan 3, 5 va 10 soniyalik segmentlarda mos ravishda %75,04, %77,17 va %77,96 aniqlikka erishgan. Biroq natijalar ochiq maʼlumotlar toʻplamlari va ish stoli GPU tajribalari bilan cheklangan; haqiqiy vaqtli oʻrnatilgan qurilma, avtonom suvosti apparati yoki dengiz sinovi oʻtkazilmagan.
FADD-Net’ning asosiy yangiligi akustik spektrogramni oddiy tasvir kabi bir xil yoʻnalishda qayta ishlash oʻrniga, vaqt va chastota oʻqlarining turli fizik maʼnolarini arxitekturaga singdirishidir. Vaqt oʻqi qisqa muddatli kavitatsiya impulslari va energiya oʻzgarishlarini, chastota oʻqi esa mashina tebranishlaridan kelib chiqadigan tor polosali chiziqli spektrlarni tashiydi. Model bu ikki tuzilmani yoʻnalishli va anizotrop konvolyutsiyalar bilan alohida ekspert tarmoqlariga yoʻnaltiradi; soʻngra koordinata diqqat mexanizmi bilan qaysi vaqt oraligʻi va chastota diapazoni tasniflash uchun muhimroq ekanini qayta vaznlantiradi.
DeepShip’dagi asosiy tajribalarda FADD-Net tekshirilgan barcha segment davomiyliklarida eng yuqori aniqlikni koʻrsatgan. ResNet-18’ning 11,17 million parametriga qarshi 0,66 million parametr ishlatib, taxminan 16,9 marta kichikroq model yaratgan; 3 soniyalik segmentlarda ResNet-101’ning %74,69 aniqligini %75,04 bilan ortda qoldirgan. ShipsEar maʼlumotlar toʻplamiga transfer oʻrganishda esa %81,07 test aniqligiga erishib, eng yaqin taqqoslash modellarining %74,27 natijasidan 6,80 foiz punkt yuqori natija bergan. Biroq haqiqiy okean shovqini 5 dB boʻlgan sharoitda ConvNeXt-Tiny’ning %56,20 aniqligi FADD-Net’ning %53,93 natijasidan yuqori; shu sababli model har bir shovqin sharoitida mutlaq ustun emas.
Turkiya nuqtai nazaridan: FADD-Net yondashuvi Turkiyaning Qora dengiz, Marmara, Egey va Oʻrta yer dengizidagi port kuzatuv tizimlari, avtonom suvosti apparatlari, dengiz transporti tadqiqotlari, ekologik akustik monitoring va ochiq dengiz energetika obyektlarining ekologik xavfsizligi kabi sohalarda baholanishi mumkin. Turkiyada qoʻllashdan oldin mahalliy kema turlari, port shovqini, sayoz suvdagi koʻp yoʻlli tarqalish, oʻzgaruvchan dengiz holati, biologik tovushlar va turli gidrofon tizimlari bilan alohida maʼlumotlar toʻplamlari tuzilishi; model esa haqiqiy oʻrnatilgan protsessorlarda kechikish, energiya sarfi va xotira ishlatilishi boʻyicha sinalishi kerak. Ushbu tadqiqotdan Turkiya dengizlarida bevosita ishlatilishi mumkin boʻlgan tayyor sonar tizimi, haqiqiy vaqtli ishlash kafolati yoki barcha kema turlari uchun ishonchli tasniflash natijasi kelib chiqmaydi.
Tadqiqotning asosiy muammosi nima?
Passiv sonar tizimlari atrofga faol akustik signal yubormasdan suv ostidagi manbalar tarqatadigan tovushlarni tinglaydi. Kema tasnifida asosiy axborot manbai kema mashinalari, parraklar va gidrodinamik oqim tomonidan hosil qilinadigan kema shovqinidir. Bu tovushlar nishon sinfi haqida axborot tashisa-da, okean muhitidagi shovqin, koʻp yoʻlli tarqalish va oʻzgaruvchan ish sharoitlari sababli oson buziladi.
Tadqiqot bir vaqtning oʻzida ikki muammoni koʻrib chiqadi:
- Akustik nishonga tegishli zaif va farqlovchi belgilarni kuchli ekologik shovqindan ajratish.
- Bu ajratishni energiya va hisoblash quvvati cheklangan avtonom suvosti platformalarida ishlay oladigan darajada kichik model bilan bajarish.
Ogʻir Transformer yoki chuqur konvolyutsion modellar keng global kontekstni oʻrganishi mumkin, ammo millionlab parametr va yuqori hisoblash xarajatini talab qiladi. Juda kichik modellar esa hisoblash xarajatini kamaytirar ekan, kemaga xos murakkab vaqt-chastota tuzilmalarini yetarlicha ajrata olmasligi mumkin. FADD-Net ushbu aniqlik-samaradorlik ziddiyatini fizik tovush hosil boʻlish mexanizmlarini bevosita tarmoq arxitekturasiga kiritish orqali hal qilishni maqsad qiladi.
Kema manbali tovush qaysi fizik tarkibiy qismlardan iborat?
Tadqiqot kema manbali akustik shovqinni uchta asosiy tarkibiy qism orqali tushuntiradi:
- Mashina tebranishlari: Dizel dvigatel, val, tishli uzatma va yordamchi mashinalar ayniqsa past chastotalarda barqaror va tor polosali chiziqli spektrlar hosil qiladi.
- Parrak kavitatsiyasi: Parrak atrofidagi bosim pasayishlari pufakchalar hosil qilishi va bu pufakchalarning qulashi keng polosali hamda vaqt boʻyicha impulsli energiya tuzilmasini yuzaga keltiradi.
- Gidrodinamik shovqin: Korpus atrofidagi oqim va turbulentlik koʻproq yuqori chastotali, uzluksiz va tartibsiz komponentlarni hosil qiladi.
Bu komponentlarning spektrogramdagi geometriyalari turlicha. Barqaror mashina garmoniklari vaqt davomida davom etuvchi gorizontal chiziqlarga, qisqa muddatli kavitatsiya hodisalari esa maʼlum vaqt nuqtalarida keng chastota diapazonlariga yoyiladigan vertikal yoki mahalliy energiya klasterlariga oʻxshashi mumkin. Standart 3 × 3 konvolyutsiyalar bu ikki oʻqni bir xil fizik tuzilishga ega kabi qayta ishlaydi va komponentlarning bir-biriga aralashishiga olib kelishi mumkin.
Nega xom tovush oʻrniga log-Mel spektrogramidan foydalanilgan?
Xom vaqt toʻlqini signalning barcha maʼlumotini saqlasa-da, nishonga tegishli naqshlarni dengiz shovqini ostida bevosita farqlash qiyin. FADD-Net signal vaqt davomida qaysi chastotalarda energiya tashishini koʻrsatadigan ikki oʻlchamli log-Mel spektrogramlaridan foydalanadi.
Avval qisqa vaqtli Fourier oʻzgartirish bilan har bir vaqt ramkasining quvvat spektri P(t,k) hisoblangan. Soʻng fizik chastota Mel shkalasiga oʻtkazilgan:
\[ \operatorname{Mel}(f) = 2595\log_{10}\left(1+\frac{f}{700}\right) \]
- f, gertsdagi fizik chastotadir.
- Mel(f), inson eshitish tizimining past chastotalarda yuqoriroq aniqlik koʻrsatishini taxminan ifodalovchi Mel qiymatidir.
Tadqiqotda 128 ta ustma-ust tushuvchi uchburchak Mel filtri ishlatilgan. Har bir filtrning quvvat spektriga qoʻllagan vaznli yigʻindisi quyidagicha berilgan:
\[ M(t,m)=\sum_k P(t,k)H_m(k), \quad m\in[1,128] \]
- t, vaqt ramkasidir.
- k, qisqa vaqtli Fourier oʻzgartirishidagi chastota qutisidir.
- Hm(k), m-raqamli Mel filtrining k chastota qutisidagi vaznidir.
- M(t,m), tegishli vaqt va Mel diapazonidagi filtrlangan energiyadir.
Energiyaning dinamik diapazonini siqish va kuchli fon ostida qolgan zaif chiziqli spektrlarni koʻrinadigan qilish uchun logarifmik oʻzgartirish qoʻllangan:
\[ L(t,m)=10\log_{10}\left(M(t,m)+\delta\right) \]
Bu yerda δ = 10−6, nol qiymat logarifmini olishning oldini oluvchi kichik musbat doimiydir. Tarmoq kirishi 1 × 128 × T oʻlchamli log-Mel tenzoridir; 128 chastota diapazonlarini, T esa segment uzunligiga bogʻliq vaqt ramkalarini ifodalaydi.
Audio maʼlumotlar qanday dastlabki qayta ishlangan?
- Barcha yozuvlar 16 kHz namunalash tezligiga oʻtkazilgan.
- Nyquist-Shannon munosabatiga koʻra 8 kHz dan past chastotalar saqlangan.
- Qisqa vaqtli Fourier oʻzgartirishida 50 ms Hann oynasi ishlatilgan.
- Ketma-ket oynalar orasidagi qadam 25 ms etib belgilangan.
- 128 ta Mel filtri qoʻllangan.
- Yakuniy tasvir logarifmik dB shkalasiga oʻtkazilgan.
Tadqiqot talqiniga koʻra 16 kHz ga qayta namunalash kemalar tovushining axborot tashuvchi 0-8 kHz diapazonini saqlab, yuqori chastotali gidrodinamik shovqinning bir qismini chiqarib tashlaydi. Biroq bu tanlov 8 kHz dan yuqoridagi ehtimoliy nishon axboroti ishlatilmasligini anglatadi.
FADD-Net’ning umumiy arxitekturasi qanday?
2-rasmda koʻrsatilgan arxitektura log-Mel spektrogramidan kema sinfigacha quyidagi oqimni kuzatadi:
- Ikki qatlamli boshlangʻich blok kanal sonini oshiradi va birinchi fazoviy kichraytirishni bajaradi.
- Global Frequency Convolution Block xususiyatlarni Fourier sohasida filtrlaydi.
- Toʻrt bosqichli asos kanal sonini taxminan 32 dan 80 gacha bosqichma-bosqich oshiradi.
- Har bir bosqichda Multi-Expert Time-Frequency Decoupling birliklari asosiy xususiyat ajratuvchi sifatida ishlaydi.
- Koordinata diqqati vaqt va chastota yoʻnalishlaridagi muhim hududlarni qayta vaznlantiradi.
- Birinchi va uchinchi bosqich orasidagi qisqa yoʻl ulanishi nozik akustik tafsilotlarning yoʻqolishini kamaytiradi.
- Global Context Block uzoq vaqt-chastota nuqtalari orasidagi aloqalarni birlashtiradi.
- Tasniflash bosh qismi xususiyatlarni kema toifasi ehtimollariga aylantiradi.
Asos bosqichlaridan oldin ishlatiladigan ARN moduli shovqinni bostirish bilan zaif nishon energiyasini saqlash oʻrtasida moslashuvchan muvozanat oʻrnatishni maqsad qiladi. ARN’ning batafsil arxitekturasi ushbu tadqiqotda boshidan qayta taʼriflanmagan, avvalgi tadqiqotga havola qilingan.
Global Frequency Convolution Block nima qiladi?
Global Frequency Convolution Block (Frequency Convolutional Block, FCB) standart konvolyutsiyaning faqat kichik mahalliy qoʻshnichiliklarni koʻrishi muammosini Fourier sohasiga oʻtish orqali yengishni maqsad qiladi. Kema dvigateli va parrak ritmlari uzoq vaqt oraligʻiga yoyiladigan davriy modulyatsiyalar hosil qilishi mumkin. FCB butun spektrogram boʻylab bu naqshlarni bitta amalda baholash imkonini beradigan global qabul maydonini yaratadi.
Kirish xususiyat xaritasi:
\[ \mathbf{X}\in\mathbb{R}^{C\times H\times W} \]
Bu yerda C kanal sonini, H chastota oʻlchamini va W vaqt oʻlchamini ifodalaydi. Birinchi bosqichda ikki oʻlchamli real tez Fourier oʻzgartirishi qoʻllanadi:
\[ \widetilde{\mathbf{X}}=\mathcal{F}_{2D}(\mathbf{X}) \]
Real qiymatli kirishlarning Ermit simmetriyasidan foydalanib, vaqt yoʻnalishidagi Fourier chiqishining taxminan yarmi saqlanadi. Hosil boʻlgan kompleks spektr real va mavhum qismlari oʻrganiladigan kompleks vazn tenzori bilan elementma-element koʻpaytiriladi:
\[ \mathbf{Y}=\widetilde{\mathbf{X}}\odot\mathbf{W} \]
Vaznlarning past modulyatsiya chastotalarida toʻplanishi sekin oʻzgaruvchi va davriy kema ritmlarini kuchaytirish, tartibsiz va tez oʻzgaruvchi shovqinni esa kamaytirish sifatida talqin qilinadi.
Filtrlangan xususiyatlar teskari Fourier oʻzgartirish orqali vaqt-chastota tekisligiga qaytariladi:
\[ \mathbf{X}_{filtered}=\mathcal{F}_{2D}^{-1}(\mathbf{Y}) \]
Mahalliy tafsilotlarning yoʻqolishi va oʻqitish beqarorligini oldini olish uchun asl xususiyat xaritasi qoldiq ulanish bilan qoʻshiladi:
\[ \mathbf{X}_{out}=\mathbf{X}+\mathbf{X}_{filtered} \]
FCB’ning nazariy murakkabligi taxminan:
\[ \mathcal{O}\left(CHW\log(HW)\right) \]
koʻrinishidadir. Bu qiymat barcha vaqt-chastota nuqtalari orasida bevosita aloqa oʻrnatuvchi standart self-attention’ning kvadratik xarajatidan pastdir.
Multi-Expert Time-Frequency Decoupling moduli qanday ishlaydi?
Multi-Expert Time-Frequency Decoupling (METFD) moduli kirishni uchta maxsus ekspert tarmogʻiga ajratadi:
| Ekspert tarmogʻi | Asosiy qayta ishlash yoʻnalishi | Nishonlanadigan akustik tuzilma |
|---|---|---|
| Vaqt eksperti | 1 × 3 va 1 × 5 depthwise separable konvolyutsiyalar | Qisqa muddatli parrak kavitatsiyasi impulslari va vaqt boʻyicha energiya oʻzgarishlari |
| Chastota eksperti | 3 × 1 va 5 × 1 depthwise separable konvolyutsiyalar | Barqaror mashina garmoniklari va tor polosali chiziqli spektrlar |
| Umumiy ekspert | 3 × 3 dilated konvolyutsiya | Keng polosali uzluksiz spektr va ikki oʻlchamli fon teksturasi |
Kirish avval 1 × 1 konvolyutsiya bilan C kanaldan 2C kanalga kengaytiriladi. Vaqt eksperti chastota oʻqida pooling qilib 2C × 1 × W oʻlchamli vaqt izlarini, chastota eksperti vaqt oʻqida pooling qilib 2C × H × 1 oʻlchamli spektral izlarni, umumiy ekspert esa global average pooling bilan 2C × 1 × 1 kontekst vektorini hosil qiladi.
Uch ekspert chiqishi elementma-element qoʻshiladi, 1 × 1 proyeksiya bilan yana C kanalga tushiriladi va koordinata diqqatidan oʻtkaziladi:
\[ \mathbf{Y}=\mathbf{X}+\operatorname{CoordAtt}\left(F_{proj}\left(E_t(\mathbf{X}')\oplus E_f(\mathbf{X}')\oplus E_j(\mathbf{X}')\right)\right) \]
Bu yerda Et, Ef va Ej mos ravishda vaqt, chastota va umumiy ekspertlarni; ⊕ esa elementma-element yigʻishni bildiradi. Qoldiq ulanish ajratish jarayonida asl mahalliy maʼlumotning toʻliq yoʻqolishiga yoʻl qoʻymaydi.
Koordinata diqqati nima uchun kerak?
Koʻplab diqqat mexanizmlari ikki oʻlchamli xususiyat xaritasini bitta kanal qiymatiga siqadi. Bu yondashuv “qaysi kanal muhim?” degan savolga javob bersa-da, muhim belgi qaysi vaqtda va qaysi chastotada joylashganini oʻchirib yuborishi mumkin.
Koordinata diqqati vaqt va chastota oʻqlarini alohida pooling qiladi:
- Bir vektor har bir chastota diapazonining vaqt davomida oʻrtacha ahamiyatini tashiydi.
- Boshqa vektor har bir vaqt ramkasining chastotalar boʻyicha oʻrtacha ahamiyatini tashiydi.
Bu ikki yoʻnalishli tasvir birlashtiriladi, 1 × 1 konvolyutsiya va nochiziqli oʻzgartirishlardan oʻtkaziladi, soʻng yana vaqt va chastota vaznlariga ajratiladi. Yakuniy xususiyat:
\[ \widehat{\mathbf{U}}=\mathbf{U}\odot A_h\odot A_w \]
koʻrinishida hosil qilinadi. Ah chastota yoʻnalishidagi, Aw vaqt yoʻnalishidagi diqqat vaznlarini ifodalaydi. Shu tariqa model muayyan chiziqli spektrning chastota joylashuvini ham, qisqa muddatli kavitatsiya hodisasining vaqt joylashuvini ham saqlashi mumkin.
Global Context Block nima beradi?
METFD va koordinata diqqati mahalliy hamda yoʻnalishli xususiyatlarni qayta ishlayotgan paytda, Global Context Block turli vaqt-chastota hududlaridan kelgan maʼlumotni bitta kontekstga jamlaydi. Kirish xususiyat xaritasidan 1 × 1 konvolyutsiya va Softmax bilan fazoviy diqqat niqobi yaratiladi. Yassilangan xususiyatlar niqob bilan koʻpaytirilib, har bir kanal uchun global kontekst vektori hisoblanadi:
\[ \mathbf{V}_{gc}=\mathbf{V}+\mathbf{W}_v\left(\mathbf{V}_{flat}\mathbf{M}^{T}\right) \]
Bu tasvir keyin kanalni kengaytirish, global average pooling, dropout va chiziqli tasniflash qatlamiga yuboriladi.
Nega METFD standart 3 × 3 konvolyutsiyadan yengilroq?
Standart 3 × 3 konvolyutsiyaning taxminiy hisoblash xarajati:
\[ \mathcal{O}(9C^2HW) \]
deb berilgan. METFD’ning umumiy xarajati esa:
\[ \mathcal{O}_{METFD}=\mathcal{O}\left(4C^2HW+42CHW+4C^2(H+W+1)\right) \]
koʻrinishida hisoblangan. H + W qiymati odatda HW koʻpaytmasidan ancha kichik boʻlgani sababli asosiy xarajat 4C²HW hadidan keladi. Tadqiqotchilar bu tuzilma standart 3 × 3 konvolyutsiyaga nisbatan FLOP sonini %50 dan ortiq kamaytirishini taʼkidlaydi.
Ushbu nazariy hisob haqiqiy qurilmadagi kechikish yoki energiya sarfini bevosita oʻlchamaydi. Fourier oʻzgartirishining, xotiraga murojaatning va muayyan apparat tezlatkichlarining amaliy xarajati FLOP sonidan farq qilishi mumkin.
DeepShip maʼlumotlar toʻplamidan qanday foydalanilgan?
DeepShip Ocean Networks Canada tomonidan taqdim etilgan jami 47 soat 4 daqiqalik haqiqiy suvosti yozuvlarini oʻz ichiga oladi. Maʼlumotlar toʻplamidagi 265 ta turli kema toʻrtta keng sinfga ajratilgan:
- Yuk kemasi
- Yoʻlovchi kemasi
- Tanker
- Buksir
Yozuvlar 3, 5 va 10 soniyalik segmentlarga boʻlingan. Uch va besh soniyalik segmentlarda ustma-ust tushmaydigan boʻlish, 10 soniyalik segmentlarda esa yetarli namunalar sonini saqlash uchun 5 soniyalik ustma-ust tushish ishlatilgan.
| Segment davomiyligi | Oʻqitish namunasi | Validatsiya namunasi | Test namunasi | Jami |
|---|---|---|---|---|
| 3 soniya | 44.518 | 5.912 | 6.038 | 56.468 |
| 5 soniya | 26.748 | 3.536 | 3.486 | 33.770 |
| 10 soniya | 26.153 | 3.475 | 3.553 | 33.181 |
Muhim metodologik tanlov shundan iboratki, boʻlish segmentlar boʻyicha tasodifiy emas, balki asl audio fayl identifikatorlari boʻyicha amalga oshirilgan. Shu tariqa bir xil uzun yozuvga tegishli oʻxshash ekologik shovqinning ham oʻqitish, ham test toʻplamiga tushishi oldini olishga harakat qilingan. Oʻqitish, validatsiya va test nisbati taxminan 8:1:1 boʻlib, har bir sinf uchun ishlatilgan asl fayl identifikatorlari tadqiqotning 2-jadvalida ochiq keltirilgan.
ShipsEar maʼlumotlar toʻplami qanday tashkil etilgan?
ShipsEar Ispaniyaning shimoli-gʻarbiy Atlantika sohilida yozib olingan 90 ta audio yozuv va taxminan uch soatlik maʼlumotni oʻz ichiga oladi. Maʼlumotlar toʻplamidagi 11 kema turi va ekologik shovqin adabiyotda qoʻllanadigan beshta yuqori sinfga ajratilgan:
| Sinf | Oʻz ichiga olgan manbalar |
|---|---|
| A | Baliqchi qayiqlari, trol qayiqlari, midiya qayiqlari, buksirlar va dragaj kemalari |
| B | Motorli qayiqlar, lotsman qayiqlari va yelkanli qayiqlar |
| C | Yoʻlovchi kemalari |
| D | Okean yoʻlovchi kemalari va ro-ro kemalari |
| E | Tabiiy fon shovqini |
Yozuvlar ustma-ust tushmaydigan 5 soniyalik segmentlarga ajratilgan va jami 2.094 namuna hosil qilingan:
- Oʻqitish: 1.709 namuna
- Validatsiya: 228 namuna
- Test: 157 namuna
ShipsEar kichik boʻlgani sababli ushbu maʼlumotlar toʻplami DeepShip’da oldindan oʻqitilgan modellarning boshqa akustik muhitga koʻchirilishini baholash uchun ishlatilgan.
Model qaysi mezonlar bilan baholangan?
Umumiy aniqlik:
\[ \operatorname{Accuracy}=\frac{\sum_{k=1}^{K}TP_k}{N} \]
koʻrinishida hisoblangan. TPk, k sinfidagi toʻgʻri musbat namunalarni; N esa jami namunalar sonini bildiradi.
Har bir sinf uchun precision va recall:
\[ P_k=\frac{TP_k}{TP_k+FP_k} \]
\[ R_k=\frac{TP_k}{TP_k+FN_k} \]
koʻrinishidadir. Sinflardagi namuna soni turlicha boʻlgani sababli Macro-F1 ham ishlatilgan:
\[ \operatorname{Macro-F1}=\frac{1}{K}\sum_{k=1}^{K}\frac{2P_kR_k}{P_k+R_k} \]
Macro-F1 har bir sinfga teng vazn beradi. Shuningdek, oʻrganiladigan parametrlar soni va FLOP qiymati hisoblash hamda xotira talablari uchun taxminiy koʻrsatkich sifatida hisobot qilingan.
DeepShip oʻqitish sozlamalari qanday?
| Sozlama | Qiymat |
|---|---|
| Apparat | Intel Core i5-14600KF, NVIDIA GeForce RTX 4060 Ti, 64 GB xotira |
| Dasturiy taʼminot | Python 3.8.20, PyTorch 2.4.1, CUDA 12.1 |
| Epoch | 200 |
| Batch hajmi | 16 |
| Optimallashtirish | SGD |
| Boshlangʻich oʻrganish tezligi | 6 × 10−3 |
| Weight decay | 7 × 10−5 |
| Oʻrganish tezligi rejalashtirgichi | ReduceLROnPlateau |
| Dropout | 0,2 |
| Label smoothing | 0,1 |
Besh soniyalik segmentlar keyingi ablation, shovqinga chidamlilik va vizualizatsiya tajribalarining asosiy sozlamasi sifatida tanlangan. Tadqiqotchilar bu davomiylik mexanik modulyatsiya sikllarini ushlash uchun yetarli, 10 soniyalik kirishlarga nisbatan esa hisoblash yuki kamroq ekanini bildiradi.
Asosiy model taqqoslanishi nimani koʻrsatadi?
3-jadvalda barcha modellar bir xil log-Mel kirishlari va bir xil oʻqitish quvuri bilan noldan oʻqitilgan. FLOP qiymatlari 3 soniyalik kirish sozlamasi uchun berilgan.
| Model | Parametr | FLOPs | 3 soniya aniqlik / Macro-F1 (%) | 5 soniya aniqlik / Macro-F1 (%) | 10 soniya aniqlik / Macro-F1 (%) |
|---|---|---|---|---|---|
| ResNet-18 | 11,17 M | 427,10 M | 72,89 / 72,26 | 72,37 / 72,35 | 73,01 / 72,26 |
| ResNet-34 | 21,28 M | 881,31 M | 72,89 / 72,26 | 72,03 / 71,63 | 70,14 / 69,61 |
| ResNet-50 | 23,51 M | 992,37 M | 72,69 / 71,98 | 73,55 / 73,28 | 68,28 / 67,53 |
| ResNet-101 | 42,50 M | 1,91 G | 74,69 / 74,10 | 70,65 / 69,97 | 68,90 / 67,70 |
| MobileNet-V2 | 2,23 M | 77,91 M | 72,95 / 71,63 | 70,71 / 70,76 | 74,89 / 74,11 |
| ShuffleNet-V2 | 1,26 M | 35,80 M | 70,09 / 68,96 | 66,27 / 65,44 | 72,84 / 72,06 |
| EfficientNet-B0 | 4,01 M | 99,86 M | 73,43 / 72,83 | 74,04 / 73,41 | 77,17 / 76,78 |
| ConvNeXt-Tiny | 27,81 M | 916,69 M | 73,88 / 72,61 | 72,40 / 72,38 | 74,87 / 74,00 |
| CFTANet | 0,47 M | 118,61 M | 70,85 / 69,50 | 71,43 / 70,65 | 73,02 / 73,05 |
| UATFSNet | 0,03 M | 2,78 M | 66,03 / 65,07 | 67,47 / 66,60 | 69,97 / 68,72 |
| FADD-Net | 0,66 M | 110,05 M | 75,04 / 74,66 | 77,17 / 77,02 | 77,96 / 77,76 |
FADD-Net barcha segment davomiyliklarida eng yuqori aniqlikka erishgan. Eng kuchli yengil taqqoslashlardan EfficientNet-B0’ga nisbatan aniqlik farqi 3 soniyada 1,61, 5 soniyada 3,13 va 10 soniyada 0,79 foiz punktni tashkil etadi. FADD-Net EfficientNet-B0 parametr byudjetining taxminan %16,5 ini ishlatadi; biroq 3 soniyalik kirishda FLOP qiymati EfficientNet-B0’dan taxminan %10 yuqori. Shu sababli model har bir hisoblash mezonida eng kichik emas.
ResNet-101’ning aniqligi 3 soniyada %74,69 boʻlsa, 10 soniyada %68,90 gacha tushgan. FADD-Net esa kirish davomiyligi oshgani sayin %75,04 dan %77,96 gacha koʻtarilgan. Tadqiqotchilar bu farqni yirik izotrop modellarning uzun yozuvlardagi fon shovqiniga ortiqcha moslashishi bilan bogʻlaydi. Biroq tadqiqot bu mexanizmni turli oʻqitish takrorlari yoki mustaqil overfitting oʻlchovlari bilan bevosita sinamagan.
FADD-Net’ning yengilligi qanday talqin qilinishi kerak?
- ResNet-18 bilan solishtirganda parametrlar soni taxminan 16,9 marta kam.
- ResNet-18 bilan solishtirganda 3 soniyalik kirishda FLOP soni taxminan %74,2 kam.
- ResNet-101 bilan solishtirganda parametrlar soni taxminan 64 marta kam.
- ResNet-101 bilan solishtirganda FLOP soni taxminan %94,2 kam.
- UATFSNet 0,03 million parametr bilan FADD-Net’dan ancha kichik, biroq aniqligi sezilarli darajada past.
- EfficientNet-B0 FADD-Net’dan pastroq FLOP qiymatiga ega, ammo koʻproq parametr ishlatadi.
Shu sababli FADD-Net “eng kichik model” emas, balki tadqiqotda oʻlchangan aniqlik bilan model hajmi oʻrtasida kuchli muvozanat yaratadigan modeldir.
Ablation tajribalari qaysi modullar muhimligini koʻrsatadi?
Besh soniyalik asosiy sozlamada har safar bitta komponent olib tashlangan yoki anʼanaviy ekvivalenti bilan almashtirilgan:
| Konfiguratsiya | FLOPs (M) | Aniqlik (%) | Toʻliq modelga nisbatan oʻzgarish |
|---|---|---|---|
| Toʻliq FADD-Net | 228,70 | 76,94 | – |
| FCB siz | 227,88 | 74,61 | −2,33 foiz punkt |
| METFD oʻrniga 3 × 3 konvolyutsiya | 566,59 | 75,33 | −1,61 foiz punkt |
| Koordinata diqqatisiz | 226,85 | 73,72 | −3,22 foiz punkt |
| ARN oʻrniga instance normalization | 228,70 | 76,46 | −0,48 foiz punkt |
| Bosqichlararo qisqa yoʻlsiz | 227,88 | 76,25 | −0,69 foiz punkt |
Eng katta aniqlik yoʻqotilishi koordinata diqqati olib tashlanganda kuzatilgan. Bu natija muhim vaqt va chastota joylashuvlarini saqlash faqat kanal vaznlashidan koʻra qimmatroq ekanini qoʻllab-quvvatlaydi. FCB olib tashlanishi 2,33 foiz punkt yoʻqotishga olib kelgan va uzoq muddatli davriy maʼlumotning hissasini koʻrsatgan.
METFD standart 3 × 3 konvolyutsiya bilan almashtirilganda aniqlik pasaygan, hisoblash xarajati esa 228,70 milliondan 566,59 million FLOP gacha oshgan. Bu topilma yoʻnalishli ajratish bir vaqtning oʻzida ham aniqroq, ham hisoblash jihatdan samaraliroq boʻlishi mumkinligini koʻrsatadi.
Ablation jadvalidagi toʻliq model aniqligi %76,94, asosiy taqqoslash jadvalidagi 5 soniyalik aniqlik esa %77,17. Tadqiqotda bu 0,23 foiz punkt farq turli oʻqitish ishga tushirishlaridan kelib chiqqanmi, tushuntirilmagan va takrorlar orasidagi standart ogʻish berilmagan.
Qaysi konvolyutsiya yadrosi birikmasi eng yaxshi natija bergan?
METFD’ning vaqt va chastota yoʻnalishlaridagi yadro oʻlchamlari alohida sinovdan oʻtkazilgan. Eng yuqori aniqlik vaqt yoʻnalishida 1 × 3 va chastota yoʻnalishida 3 × 1 yadro birikmasida %76,53 sifatida oʻlchangan.
| Vaqt yadrosi | Chastota 1 × 1 | Chastota 3 × 1 | Chastota 5 × 1 |
|---|---|---|---|
| 1 × 1 | %69,63 | %73,03 | %73,38 |
| 1 × 3 | %73,81 | %76,53 | %73,50 |
| 1 × 5 | %72,28 | %74,02 | %73,41 |
1 × 1 yadrolar mahalliy kontekstni ushlashda yetarli boʻlmagan. Yadro uzunligini 5 gacha oshirish esa qisqa kavitatsiya impulslarini ortiqcha silliqlagan yoki alohida garmonikalarni keng polosali shovqin bilan birlashtirgan boʻlishi mumkin. Bu talqin ishlash tendensiyalari va kema tovushlarining fizik geometriyasiga asoslangan; impulslarning haqiqiy vaqt va diapazon kengliklari alohida oʻlchanmagan.
Uch ekspert tarmogʻini birgalikda ishlatish nima berdi?
| Konfiguratsiya | Aniqlik (%) |
|---|---|
| Faqat vaqt eksperti | 72,60 |
| Faqat chastota eksperti | 71,85 |
| Faqat umumiy ekspert | 71,55 |
| Uch ekspertning asosiy birikmasi | 75,04 |
| Dilated konvolyutsiyali toʻliq METFD | 75,85 |
Bitta fizik komponentga eʼtibor qaratish barcha kema sinflari uchun yetarli emas. Vaqt, chastota va umumiy kontekstning birlashtirilishi aniqlikni taxminan 2,4-3,5 foiz punkt oshirgan. Dilated konvolyutsiyalar parametrlar sonini sezilarli oshirmasdan kengroq ikki oʻlchamli kontekstni ushlab, qoʻshimcha 0,81 foiz punkt yutuq bergan.
Model sintetik shovqin ostida qanday ishlagan?
Birinchi shovqin tajribasida toza test signallariga −5 dB dan 20 dB gacha qoʻshimcha oq Gauss shovqini qoʻshilgan. FADD-Net tekshirilgan barcha sintetik shovqin darajalarida taqqoslash modellaridan yuqoriroq aniqlik egri chizigʻini koʻrsatgan.
ConvNeXt-Tiny −5 dB da taxminan %30,4 aniqlikni saqlagan, FADD-Net egri chizigʻi esa bundan yuqorida qolgan. Biroq rasmdagi barcha nuqtalarning aniq raqamli qiymatlari jadval sifatida berilmagani sababli grafikdan oʻqilgan oraliq qiymatlarni aniq natija sifatida ishlatish toʻgʻri emas.
Haqiqiy okean shovqini ostida natijalar qanday?
Ikkinchi shovqin tajribasida ShipsEar E sinfidan olingan haqiqiy okean foni DeepShip test namunalariga qoʻshilgan. Bu muhit oq shovqinga nisbatan tartibsizroq va vaqt boʻyicha oʻzgaruvchan tuzilishga ega.
- −5 dB da ResNet-50 aniqligi %22,29 gacha tushgan.
- −5 dB da EfficientNet-B0 aniqligi %23,35 gacha tushgan.
- 5 dB da ConvNeXt-Tiny %56,20 bilan FADD-Net’ning %53,93 natijasidan yuqori boʻlgan.
- FADD-Net 10 dB dan boshlab barcha taqqoslash modellarini ortda qoldirgan.
- 20 dB da FADD-Net %76,31, ConvNeXt-Tiny esa %71,63 aniqlik bergan.
Bu natija FADD-Net oʻrta va yuqori signal-shovqin nisbatlarida fizik garmonikalarni ajratishda afzallikka ega ekanini, biroq oʻta murakkab haqiqiy shovqin sharoitida yirik model cheklangan bir hududda yuqoriroq natija bera olishini koʻrsatadi. Tadqiqotning “ustun shovqinga chidamlilik” daʼvosi ushbu istisno hisobga olingan holda talqin qilinishi kerak.
Chalkashlik matritsalari qaysi sinflar qiyin ekanini koʻrsatadi?
| Sinf | EfficientNet-B0 toʻgʻri tasnifi | FADD-Net toʻgʻri tasnifi |
|---|---|---|
| Yuk kemasi | %66 | %74 |
| Yoʻlovchi kemasi | %85 | %90 |
| Tanker | %78 | %74 |
| Buksir | %70 | %77 |
FADD-Net yuk kemasi, yoʻlovchi kemasi va buksir sinflarida yaxshilangan, tankerlar uchun esa toʻrt foiz punkt pasaygan. Tanker namunalarining %15 i yuk kemasi, %8 i yoʻlovchi kemasi sifatida tasniflangan. Yuk kemalarining tanker sifatida adashtirilish darajasi EfficientNet-B0’da %24 boʻlsa, FADD-Net’da %19 gacha tushgan.
Buksirlarning %17 i yoʻlovchi kemasi sifatida tasniflangan. Tadqiqotning fizik talqiniga koʻra yuqori aylanish tezligida va yuk ostida ishlaydigan buksir parraklari kichik yoʻlovchi kemalaridagiga oʻxshash kuchli yuqori chastotali kavitatsiya ritmlarini hosil qilishi mumkin. Yuk kemalari va tankerlar esa past tezlikda ishlaydigan yirik savdo kemalari boʻlgani uchun oʻxshash past chastotali mashina garmonikalariga ega.
t-SNE vizualizatsiyasi nimani koʻrsatadi?
12-rasm xususiyatlarning tarmoq ichida oldinga siljigan sayin qanday ajralishini koʻrsatadi:
- Xom kirishda toʻrtta kema sinfi nuqtalari katta darajada bir-biriga aralashgan.
- Boshlangʻich konvolyutsiyalardan keyin biroz ajralish paydo boʻlsa-da, sinf chegaralari noaniq.
- METFD chiqishida sinflararo masofa ortadi va sinf ichidagi tarqalish torayadi.
- Yakuniy xususiyat fazosida toʻrtta aniqroq klaster hosil boʻladi.
Buksir klasteri yuqori chastotali kavitatsiya xususiyatlari sababli aniqroq ajraladi, yuk kemasi va tanker klasterlari esa bir-biriga yaqin qoladi. t-SNE yuqori oʻlchamli xususiyatlarning ikki oʻlchamli vizual proyeksiyasidir; klasterlarning koʻrinishi oʻz-oʻzidan umumlashtirish yoki sababiylik dalili emas.
Grad-CAM xaritalari model nimaga qarayotganini koʻrsatadimi?
Grad-CAM tasvirlarida chastota sohasi uch hududga ajratilgan:
- Past chastota: 0-100 Hz
- Oʻrta chastota: 100-1000 Hz
- Yuqori chastota: 1-8 kHz
Yuk va tanker sinflarida diqqat past va oʻrta chastotalardagi uzluksiz gorizontal chiziqlarga qaratilgan. Bular ogʻir mashinalarning barqaror mexanik garmonikalariga bogʻlangan. Yoʻlovchi kemasi va buksirlarda esa yuqori chastotadagi mahalliy va uzlukli energiya bloklari aniqroq boʻlib, ular tez parrak aylanishlari va kavitatsiya impulslari bilan izohlangan.
Tasvirlar tarmoq faqat maʼlumotlar toʻplamiga xos fon naqshlarini emas, balki fizik maʼnoli tovush hududlarini ham ishlatayotgani haqidagi talqinni qoʻllab-quvvatlaydi. Biroq Grad-CAM past aniqlikdagi ahamiyat xaritasi boʻlib, muayyan fizik manba sababiy ravishda aniqlanganini isbotlamaydi.
ShipsEar transfer oʻrganishi qanday bajarilgan?
DeepShip’ning 5 soniyalik maʼlumotlari bilan oldindan oʻqitilgan model ShipsEar’ga koʻchirilgan. Besh sinfli yangi tasniflash bosh qismi yaratilgan va boshqa sayoz suv muhitiga moslashish uchun FCB qayta boshlangʻich holatga keltirilgan.
| Sozlama | ShipsEar qiymati |
|---|---|
| Epoch | 60 |
| Batch hajmi | 16 |
| Optimallashtirish | AdamW |
| Oldindan oʻqitilgan asosning oʻrganish tezligi | 5 × 10−5 |
| Yangi qatlamlarning oʻrganish tezligi | 2 × 10−3 |
| Weight decay | 1 × 10−4 |
| Oʻrganish tezligi rejalashtirgichi | Kosinus annealing |
| Dropout | 0,3 |
| Label smoothing | 0,1 |
| Yoʻqotish | Sinf vaznli cross-entropy |
Oldindan oʻqitilgan asosga pastroq, yangi qatlamlarga esa yuqoriroq oʻrganish tezligi berilishi oldingi akustik bilimni saqlagan holda yangi muhitga moslashishni maqsad qiladi.
Maʼlumotlar toʻplamlari orasidagi transfer natijalari qanday?
| Model | ShipsEar test aniqligi (%) |
|---|---|
| ResNet-18 | 73,30 |
| ResNet-34 | 74,27 |
| ResNet-50 | 72,33 |
| ResNet-101 | 69,90 |
| MobileNet-V2 | 63,11 |
| ShuffleNet-V2 | 65,05 |
| EfficientNet-B0 | 73,30 |
| ConvNeXt-Tiny | 71,84 |
| CFTANet | 74,27 |
| UATFSNet | 73,79 |
| FADD-Net | 81,07 |
FADD-Net eng yaqin natijalar boʻlgan ResNet-34 va CFTANet’dan 6,80 foiz punkt yuqori natija bergan. Tadqiqotchilar bu farqni Fourier filtrining muhitga xos tartibsiz shovqinni kamaytirishi va METFD’ning muhitdan mustaqil mexanik garmonikalar bilan kavitatsiya ritmlarini ajratishi bilan bogʻlaydi.
ShipsEar test toʻplamida atigi 157 segment borligi sababli bitta namunaning natijasi taxminan 0,64 foiz punktni oʻzgartirishi mumkin. Tadqiqotda ishonch oraligʻi yoki turli maʼlumot boʻlinishlari bilan takrorlar berilmagani uchun %81,07 natija cheklangan test namunasi kontekstida baholanishi kerak.
Tadqiqotning kuchli tomonlari nimalar?
- Tarmoq arxitekturasi kema tovushlarining fizik hosil boʻlish mexanizmlari bilan bogʻlangan.
- Vaqt va chastota oʻqlari bir xil xususiyatdek qayta ishlanmay, alohida ekspert tarmoqlarida baholangan.
- DeepShip boʻlinishi asl fayl identifikatorlari asosida amalga oshirilib, segmentlar orasidagi maʼlumot sizib chiqishi kamaytirilgan.
- Uch xil audio davomiyligi, ikki maʼlumotlar toʻplami va turli model oilalari taqqoslangan.
- Aniqlik bilan birga Macro-F1, parametr va FLOP qiymatlari hisobot qilingan.
- Har bir asosiy modul ablation tajribalari bilan alohida baholangan.
- Sintetik va haqiqiy okean shovqini alohida sinovdan oʻtkazilgan.
- Chalkashlik matritsalari, t-SNE va Grad-CAM yordamida model xatti-harakati vizualizatsiya qilingan.
- FADD-Net kichik model hajmi bilan ogʻir modellardan yuqori natija bergan.
- DeepShip’dan ShipsEar’ga maʼlumotlar toʻplamlari orasidagi transfer sinalgan.
Tadqiqotning cheklovlari nimalar?
- Tadqiqot hakamlik baholashidan oʻtmagan preprintdir.
- Model haqiqiy avtonom suvosti apparati, passiv sonar qurilmasi yoki oʻrnatilgan protsessorda ishlatilmagan.
- Inference kechikishi, haqiqiy vaqtli kadr tezligi, RAM ishlatilishi va vattdagi energiya sarfi hisobot qilinmagan.
- FLOP va parametr sonlari haqiqiy apparat ishlashining faqat taxminiy koʻrsatkichlaridir.
- Tajribalar bitta ishga tushirishmi yoki bir nechta tasodifiy urugʻlarning oʻrtachasi ekanligi tushuntirilmagan.
- Standart ogʻish, ishonch oraligʻi yoki statistik ahamiyatlilik testi berilmagan.
- DeepShip va ShipsEar muayyan geografik hududlar, gidrofonlar va kema taqsimotlarini ifodalaydi; ularni barcha dengiz muhitlariga umumlashtirib boʻlmaydi.
- ShipsEar test toʻplami atigi 157 ta besh soniyalik namunadan iborat.
- Haqiqiy okean shovqinida 5 dB sharoitida FADD-Net eng yaxshi model emas.
- Tanker aniqligi EfficientNet-B0 bilan taqqoslaganda %78 dan %74 gacha pasaygan.
- Yuk kemasi-tanker va buksir-yoʻlovchi kemasi chalkashliklari davom etmoqda.
- 10 soniyalik namunalarda bir fayl ichida 5 soniyalik ustma-ust tushish ishlatilgan; boʻlinmalar orasidagi sizib chiqish oldi olingan boʻlsa ham, bir boʻlinma ichidagi namuna bogʻliqligi oshishi mumkin.
- ARN modulining barcha arxitektura tafsilotlari ushbu matnda qayta berilmagan.
- Manba kodi, model vaznlari va toʻliq tajriba konfiguratsiyasi uchun kirish havolasi taqdim etilmagan.
- Maʼlumotlarni kengaytirish usullari batafsil tushuntirilmagan.
- Model dengiz sutemizuvchilari, ekologik hodisalar yoki nomaʼlum nishon sinflarida sinalmagan.
- False alarm, open-set recognition va taqsimotdan tashqari namunalarni rad etish ishlashi baholanmagan.
Tadqiqot nimani qoʻllab-quvvatlaydi?
- Fizik bilimli vaqt-chastota ajratishi kichik model hajmi bilan raqobatbardosh tasniflashni taʼminlashi mumkinligini qoʻllab-quvvatlaydi.
- FCB, METFD va koordinata diqqatining har biri aniqlikka oʻlchanadigan hissa qoʻshishini koʻrsatadi.
- FADD-Net DeepShip’da tekshirilgan taqqoslash modellaridan yuqori aniqlik berganini koʻrsatadi.
- FADD-Net DeepShip’dan ShipsEar’ga transferda yuqori test aniqligini taʼminlay olishini koʻrsatadi.
- Yoʻnalishli va anizotrop amallar standart 3 × 3 konvolyutsiyaga nisbatan pastroq FLOP bilan yuqoriroq aniqlik berishi mumkinligini koʻrsatadi.
- Model qarorlari ayrim kema sinflarida fizik maʼnoli chastota va vaqt hududlari bilan mos kelishini qoʻllab-quvvatlaydi.
Tadqiqot nimani isbotlamaydi?
- Model haqiqiy dengiz vazifalarida xuddi shu aniqlik bilan ishlashini isbotlamaydi.
- 0,66 million parametr avtomatik ravishda kam energiya sarfi yoki haqiqiy vaqtli ishlashni taʼminlashini isbotlamaydi.
- FADD-Net barcha shovqin darajalarida barcha modellardan ustun ekanini koʻrsatmaydi.
- Model nomaʼlum kema turlarini xavfsiz rad eta olishini isbotlamaydi.
- Gidrofon joylashuvi, chuqurlik, ob-havo sharoiti va dengiz tubi farqlaridan mustaqil ekanini koʻrsatmaydi.
- Harbiy yoki fuqarolik sonar tizimida operatsion ishonchlilik, sertifikatsiya yoki dala muvaffaqiyatini taqdim etmaydi.
- Grad-CAM hududlari bevosita muayyan mashina yoki parrak komponentlariga tegishli ekanini qatʼiy isbotlamaydi.
Tadqiqotning usuli va natijalari
Tadqiqot dizayni
Tadqiqot ommaga ochiq ikkita suvosti akustik maʼlumotlar toʻplamida nazoratli tasniflash, model taqqoslash, ablation tahlili, shovqinga chidamlilik testi, transfer oʻrganish va xususiyatlarni vizualizatsiya qilishni oʻz ichiga olgan tajribaviy mashinaviy oʻrganish tadqiqotidir.
Kirish va chiqish
| Tarkibiy qism | Texnik xususiyat |
|---|---|
| Xom kirish | Kema manbali suvosti audio yozuvi |
| Namunalash tezligi | 16 kHz |
| STFT oynasi | 50 ms Hann |
| STFT qadami | 25 ms |
| Mel filtri | 128 |
| Tarmoq kirishi | 1 × 128 × T log-Mel spektrogrami |
| DeepShip chiqishi | Yuk, yoʻlovchi, tanker yoki buksir |
| ShipsEar chiqishi | Beshta yuqori akustik sinf |
FADD-Net asosiy modullari
- Ikki qatlamli konvolyutsion boshlangʻich blok
- Global Frequency Convolution Block
- Toʻrt bosqichli yengil asos
- ARN muvozanatlash moduli
- Multi-Expert Time-Frequency Decoupling
- Koordinata diqqati
- Bosqichlararo qisqa yoʻl
- Global Context Block
- Dropout bilan tartibga solingan tasniflash bosh qismi
Asosiy natijalarning texnik xulosasi
| Mezon | FADD-Net natijasi | Talqin |
|---|---|---|
| Parametrlar soni | 0,66 million | Ogʻir ResNet va ConvNeXt modellaridan sezilarli kichik |
| 3 soniyalik FLOPs | 110,05 million | EfficientNet-B0’dan biroz yuqori, aksariyat chuqur modellardan ancha past |
| 3 soniya aniqlik | %75,04 | Taqqoslangan modellar ichida eng yuqori |
| 5 soniya aniqlik | %77,17 | Taqqoslangan modellar ichida eng yuqori |
| 10 soniya aniqlik | %77,96 | Taqqoslangan modellar ichida eng yuqori |
| 10 soniya Macro-F1 | %77,76 | Sinf nomutanosibligini hisobga oluvchi eng yuqori natija |
| ShipsEar transfer aniqligi | %81,07 | Eng yaqin taqqoslashdan 6,80 foiz punkt yuqori |
| Haqiqiy shovqin, 20 dB | %76,31 | Taqqoslangan modellar ichida eng yuqori |
| Haqiqiy shovqin, 5 dB | %53,93 | ConvNeXt-Tiny’ning %56,20 natijasidan past |
Modullar hissasining xulosasi
- Koordinata diqqati olib tashlanganda aniqlik 3,22 foiz punkt pasaygan.
- FCB olib tashlanganda aniqlik 2,33 foiz punkt pasaygan.
- METFD standart 3 × 3 konvolyutsiya bilan almashtirilganda aniqlik 1,61 foiz punkt pasaygan va FLOP qiymati taxminan 2,48 marta oshgan.
- ARN olib tashlanganda aniqlik 0,48 foiz punkt pasaygan.
- Bosqichlararo qisqa yoʻl olib tashlanganda aniqlik 0,69 foiz punkt pasaygan.
Takrorlanuvchanlik nuqtai nazaridan yetishmaydigan maʼlumotlar
- Tasodifiy urugʻlar
- Takroriy tajribalar soni
- Natijalarning standart ogʻishi
- Manba kodi va model vaznlari
- Toʻliq maʼlumotlarni kengaytirish konfiguratsiyasi
- ARN’ning toʻliq amalga oshirish tafsilotlari
- Oʻrnatilgan apparatda inference vaqti
- Haqiqiy quvvat va xotira oʻlchovlari
Haqiqiy dala qoʻllanilishiga oʻtish uchun zarur qadamlar
- Turli gidrofon va yozuv tizimlari bilan yangi dengiz maʼlumotlar toʻplamlarini yaratish
- Turli chuqurlik, dengiz tubi va koʻp yoʻlli tarqalish sharoitlarida sinash
- Yomgʻir, toʻlqin, biologik tovush, port va sanoat shovqinini baholash
- Nomaʼlum nishon va ochiq sinf tanish sinovlari
- Avtonom suvosti apparatidagi oʻrnatilgan protsessorda haqiqiy vaqtli inference
- Vattdagi quvvat va megabaytdagi xotira oʻlchovi
- Uzoq muddatli dengiz sinovi
- False alarm, kechikish va ishonchlilik tahlili
- Turli mamlakat va dengiz hududlaridan mustaqil maʼlumot bilan tashqi validatsiya
Manba va usul eslatmasi
Tadqiqotning asl nomi: FADD-Net: Integrating Global Frequency Filtering and Directional Spectro-Temporal Decoupling for Lightweight Underwater Acoustic Target Recognition
Mualliflar: Chen Liang; Zailei Luo; Dongchen Tian; Ziyu Yan; Jing Xu; Xionghui Li.
Mualliflar tartibi: Yuqoridagi roʻyxat tadqiqotdagi asl mualliflar tartibini saqlaydi.
Teng birinchi muallif: Tadqiqotda teng birinchi muallif yoki teng hissa bayonoti yoʻq.
Masʼul mualliflar: Jing Xu va Xionghui Li.
Masʼul mualliflarning e-pochta manzillari: jxu-optics@zju.edu.cn; wananmotianlun@foxmail.com.
Muassasalar:
- Ocean College, Zhejiang University, Zhoushan 316021, Xitoy.
- Advanced Interdisciplinary Technology Research Center, National Innovation Institute of Defense Technology, Pekin 100071, Xitoy.
- School of Information and Communication Engineering, University of Electronic Science and Technology of China, Chengdu, Xitoy.
Rasmiy nashr platformasi: SSRN.
Rasmiy tadqiqot havolasi:SSRN tadqiqot sahifasi
Nashr sanasi: 29 iyul 2026.
Nashr yili: 2026.
Jurnal: Ushbu versiya uchun muayyan hakamlik jurnali nomi yoki qabul maʼlumoti yoʻq.
Nashriyot: Hakamlik jurnali nashriyoti tasdiqlanmagan. Matnda “Preprint submitted to Elsevier” iborasi bor, ammo muayyan Elsevier jurnali koʻrsatilmagan.
Manba turi: Ommaga ochiq maʼlumotlar toʻplamlarida tajribaviy mashinaviy oʻrganish va qiyosiy model baholashini oʻz ichiga olgan preprint tadqiqot maqolasi.
Hakamlik holati: Ushbu tadqiqot hakamlik baholashidan oʻtmagan preprintdir; natijalar shu cheklov hisobga olinib oʻqilishi kerak.
Moliyalashtirish: Moliyalashtirish maʼlumoti ushbu versiyada keltirilmagan.
Manfaatlar toʻqnashuvi: Manfaatlar toʻqnashuvi bayonoti ushbu versiyada keltirilmagan.
Maʼlumotlarga kirish: DeepShip va ShipsEar ochiq maʼlumotlar toʻplamlaridan foydalanilgan; biroq tadqiqotning oʻqitilgan model vaznlari, manba kodi va tajriba chiqish fayllari uchun havola berilmagan.
Ushbu oʻzbekcha izoh yuklangan 25 sahifalik tadqiqotning matni, tenglamalari, model sxemalari, maʼlumotlar jadvallari, ishlash grafiklari, ablation natijalari, shovqin tajribalari, chalkashlik matritsalari, t-SNE taqsimotlari va Grad-CAM xaritalari koʻrib chiqilib tayyorlangan. Tadqiqotda boʻlmagan ilmiy natijalar qoʻshilmagan. Tashqi manba tekshiruvi faqat DOI, SSRN roʻyxat sanasi va nashr holati kabi bibliografik maʼlumotlarni tasdiqlash maqsadida ishlatilgan.
Tadqiqotning asosiy cheklovi “haqiqiy vaqtli va energiya cheklangan platformalarga moslik” daʼvosi parametr va FLOP hisoblariga tayanishidir. Haqiqiy oʻrnatilgan tizimda kechikish, xotira, energiya sarfi yoki dengiz vazifasi ishlashi oʻlchanmagan. Shuningdek, mustaqil tajriba takrorlari va statistik ishonch oraliqlari berilmagani sababli kichik aniqlik farqlarining barqarorligi tasdiqlanmagan.

Izoh qoldiring
E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan