Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Uhandisi / FADD-Net: Utambuzi Mwepesi wa Malengo ya Akustiki ya Chini ya Maji kwa Uchujaji wa Masafa wa Kimataifa na Utenganishaji Elekezi wa Muda-Masafa
Uhandisi

FADD-Net: Utambuzi Mwepesi wa Malengo ya Akustiki ya Chini ya Maji kwa Uchujaji wa Masafa wa Kimataifa na Utenganishaji Elekezi wa Muda-Masafa

Utafiti huu unapendekeza mtandao wa neva mwepesi unaotumia maarifa ya kifizikia unaoitwa FADD-Net kwa ajili ya kuainisha ishara za akustiki zinazotolewa na meli kwenye majukwaa ya chini ya maji yenye uwezo mdogo wa kukokotoa.

03/08/2026  Veri Anla Imetazamwa mara 17
FADD-Net: Utambuzi Mwepesi wa Malengo ya Akustiki ya Chini ya Maji kwa Uchujaji wa Masafa wa Kimataifa na Utenganishaji Elekezi wa Muda-Masafa

Utafiti huu unapendekeza mtandao wa neva mwepesi unaotumia maarifa ya kifizikia unaoitwa FADD-Net kwa ajili ya kuainisha ishara za akustiki zinazotolewa na meli kwenye majukwaa ya chini ya maji yenye uwezo mdogo wa kukokotoa. Modeli hubadilisha sauti ghafi kuwa spectrogramu za log-Mel zenye bendi 128 za Mel, huchuja mizunguko ya muda mrefu ya kimitambo kupitia Global Frequency Convolution Block katika kikoa cha Fourier, na kuchakata kwa mwelekeo tofauti mapigo ya muda mfupi ya kavitesheni ya propela pamoja na spektra za mistari thabiti za mashine kupitia moduli ya Multi-Expert Time-Frequency Decoupling. Kwenye seti ya data ya DeepShip, modeli, ikiwa na vigezo milioni 0,66 pekee na FLOP milioni 110,05, katika vipande vya sekunde 3, 5 na 10 ilipata usahihi wa %75,04, %77,17 na %77,96 mtawalia. Hata hivyo, matokeo yamewekewa mipaka na seti za data za umma na majaribio ya GPU ya kompyuta mezani; hakuna jaribio lililofanywa kwenye kifaa kilichopachikwa cha muda halisi, chombo huru cha chini ya maji au jaribio la baharini.

Ubunifu mkuu wa FADD-Net ni kuakisi maana tofauti za kifizikia za mhimili wa muda na mhimili wa masafa ndani ya usanifu badala ya kuchakata spectrogramu ya akustiki kwa mwelekeo mmoja kama picha ya kawaida. Mhimili wa muda hubeba mapigo ya muda mfupi ya kavitesheni na mabadiliko ya nishati, huku mhimili wa masafa ukibeba spektra nyembamba za mistari zinazotokana na mitetemo ya mashine. Modeli hupeleka miundo hii miwili kwenye matawi tofauti ya wataalamu kwa kutumia konvolusheni za kimwelekeo na zisizo isotropiki; kisha hutumia coordinate attention kupima upya ni kipindi gani cha muda na bendi ipi ya masafa iliyo muhimu zaidi kwa uainishaji.

Katika majaribio makuu ya DeepShip, FADD-Net ilitoa usahihi wa juu zaidi katika muda wote wa vipande uliotathminiwa. Ikilinganishwa na ResNet-18 yenye vigezo milioni 11,17, ilitumia vigezo milioni 0,66 na hivyo kuunda modeli ndogo takribani mara 16,9; katika vipande vya sekunde 3 ilizidi ResNet-101 yenye usahihi wa %74,69 kwa kufikia %75,04. Katika ujifunzaji wa uhamishaji kwenda seti ya data ya ShipsEar, ilipata usahihi wa majaribio wa %81,07, ikiwa juu kuliko matokeo ya %74,27 ya modeli za karibu zaidi za kulinganisha kwa pointi za asilimia 6,80. Hata hivyo, katika hali ya kelele halisi ya bahari ya 5 dB, usahihi wa %56,20 wa ConvNeXt-Tiny ulikuwa juu kuliko %53,93 wa FADD-Net; kwa hiyo modeli si bora kabisa katika kila hali ya kelele.

Kwa mtazamo wa Türkiye: Mbinu ya FADD-Net inaweza kutathminiwa katika mifumo ya ufuatiliaji wa bandari katika Bahari Nyeusi, Marmara, Aegean na Mediterania ya Türkiye, vyombo huru vya chini ya maji, tafiti za trafiki baharini, ufuatiliaji wa akustiki wa mazingira na usalama wa kimazingira wa mitambo ya nishati ya baharini. Kabla ya kutumika Türkiye, inapaswa kuundwa seti maalumu za data zinazojumuisha aina za meli za eneo hilo, kelele za bandari, uenezaji wa njia nyingi katika maji mafupi, hali za bahari zinazobadilika, sauti za kibayolojia na mifumo tofauti ya hydrophone; modeli pia inapaswa kupimwa kwenye vichakataji halisi vilivyopachikwa kwa ucheleweshaji, matumizi ya nishati na matumizi ya kumbukumbu. Utafiti huu hauonyeshi kwamba kuna mfumo wa sonar ulio tayari kutumika moja kwa moja katika bahari za Türkiye, dhamana ya utendaji wa muda halisi au matokeo ya kuaminika ya uainishaji kwa aina zote za meli.

Tatizo la msingi la utafiti ni nini?

Mifumo ya sonar tulivu husikiliza sauti zinazotolewa na vyanzo vya chini ya maji bila kutuma ishara ya akustiki hai kwenye mazingira. Katika uainishaji wa meli, chanzo kikuu cha taarifa ni kelele inayotokana na meli, inayozalishwa na mashine za meli, propela na mtiririko wa hidrodinamiki. Ingawa sauti hizi hubeba taarifa kuhusu darasa la lengo, huharibiwa kwa urahisi na kelele, uenezaji wa njia nyingi na hali za uendeshaji zinazobadilika katika mazingira ya bahari.

Utafiti unashughulikia matatizo mawili kwa wakati mmoja:

  • Kutenganisha viashiria dhaifu na vinavyotofautisha vya lengo la akustiki na kelele kubwa ya mazingira.
  • Kufanya utenganishaji huu kwa modeli ndogo kiasi cha kufanya kazi kwenye majukwaa huru ya chini ya maji yenye mipaka ya nishati na uwezo wa kuchakata.

Modeli nzito za Transformer au konvolusheni za kina zinaweza kujifunza muktadha mpana wa kimataifa, lakini zinahitaji mamilioni ya vigezo na gharama kubwa ya kukokotoa. Modeli ndogo sana zinaweza kupunguza gharama ya kukokotoa lakini zikashindwa kutenganisha vya kutosha miundo changamano ya muda-masafa inayohusiana na meli. FADD-Net inalenga kutatua mgongano huu wa usahihi na ufanisi kwa kuakisi moja kwa moja taratibu za kifizikia za uzalishaji wa sauti ndani ya usanifu wa mtandao.

Sauti inayotokana na meli ina vipengele gani vya kifizikia?

Utafiti unaelezea kelele ya akustiki inayotokana na meli kupitia vipengele vitatu vikuu:

  • Mitetemo ya mashine: Injini za dizeli, shafts, gia na mashine saidizi huzalisha spektra za mistari thabiti na nyembamba hasa katika masafa ya chini.
  • Kavitesheni ya propela: Kushuka kwa shinikizo karibu na propela huzalisha viputo na kuporomoka kwa viputo hivyo hutengeneza muundo wa nishati wa bendi pana na wa mapigo kwa muda.
  • Kelele ya hidrodinamiki: Mtiririko na mtikisiko karibu na ganda la meli huzalisha zaidi vipengele vya masafa ya juu, vinavyoendelea na visivyo na mpangilio.

Jiometri ya vipengele hivi kwenye spectrogramu ni tofauti. Harmonics thabiti za mashine zinaweza kuonekana kama mistari ya mlalo inayoendelea kwa muda, huku matukio ya muda mfupi ya kavitesheni yakionekana kama mikusanyiko ya nishati ya wima au ya eneo fulani inayotawanyika katika bendi pana za masafa kwenye nyakati maalumu. Konvolusheni za kawaida za 3 × 3 hushughulikia mihimili hii miwili kana kwamba ina muundo mmoja wa kifizikia na hivyo zinaweza kusababisha vipengele kuchanganyika.

Kwa nini spectrogramu ya log-Mel imetumiwa badala ya sauti ghafi?

Ingawa wimbi ghafi la muda huhifadhi taarifa zote za ishara, ni vigumu kutofautisha moja kwa moja mifumo ya lengo chini ya kelele za bahari. FADD-Net hutumia spectrogramu za log-Mel za pande mbili zinazoonyesha ni masafa gani hubeba nishati ya ishara kadiri muda unavyopita.

Kwanza, spektra ya nguvu P(t,k) ya kila fremu ya muda ilihesabiwa kwa kutumia short-time Fourier transform. Kisha masafa ya kifizikia yalibadilishwa kwenda kwenye skeli ya Mel:

\[ \operatorname{Mel}(f) = 2595\log_{10}\left(1+\frac{f}{700}\right) \]

  • f, ni masafa ya kifizikia kwa hertz.
  • Mel(f), ni thamani ya Mel inayokadiria tabia ya mfumo wa kusikia wa binadamu kuwa na azimio kubwa zaidi katika masafa ya chini.

Utafiti ulitumia vichujio 128 vya Mel vya pembetatu vinavyopishana. Jumla yenye uzani inayotumika na kila kichujio kwenye spektra ya nguvu ilitolewa kama ifuatavyo:

\[ M(t,m)=\sum_k P(t,k)H_m(k), \quad m\in[1,128] \]

  • t, ni fremu ya muda.
  • k, ni kisanduku cha masafa katika short-time Fourier transform.
  • Hm(k), ni uzani wa kichujio cha Mel namba m katika kisanduku cha masafa k.
  • M(t,m), ni nishati iliyochujwa katika muda na bendi ya Mel husika.

Ili kubana masafa ya mabadiliko ya nishati na kufanya spektra dhaifu za mistari zinazoelemea chini ya mandharinyuma yenye nguvu zionekane, mabadiliko ya logarithmic yalitumika:

\[ L(t,m)=10\log_{10}\left(M(t,m)+\delta\right) \]

Hapa δ = 10−6, ni konstanti ndogo chanya inayozuia kuchukua logarithm ya thamani sifuri. Ingizo la mtandao ni tensor ya log-Mel yenye ukubwa wa 1 × 128 × T; 128 inawakilisha bendi za masafa, na T inawakilisha fremu za muda kulingana na urefu wa segmenti.

Data za sauti zilichakatwa awali kwa njia gani?

  • Rekodi zote zilibadilishwa kwenda kiwango cha sampuli cha 16 kHz.
  • Kulingana na uhusiano wa Nyquist-Shannon, masafa yaliyo chini ya 8 kHz yalihifadhiwa.
  • Dirisha la Hann la 50 ms lilitumika katika short-time Fourier transform.
  • Hatua kati ya madirisha mfululizo iliwekwa kuwa 25 ms.
  • Vichujio 128 vya Mel vilitumika.
  • Uwakilishi wa mwisho ulibadilishwa kwenda skeli ya logarithmic dB.

Kulingana na tafsiri ya utafiti, kuchukua sampuli upya kwa 16 kHz huhifadhi bendi ya 0-8 kHz yenye taarifa ya sauti za meli huku ikiondoa sehemu ya kelele ya hidrodinamiki ya masafa ya juu zaidi. Hata hivyo, uchaguzi huu pia unamaanisha kwamba taarifa yoyote ya lengo iliyo juu ya 8 kHz haitumiki.

Usanifu wa jumla wa FADD-Net ukoje?

Usanifu ulioonyeshwa katika Kielelezo 2 unafuata mtiririko ufuatao kutoka spectrogramu ya log-Mel hadi darasa la meli:

  1. Bloku ya awali yenye tabaka mbili huongeza idadi ya chaneli na kufanya upunguzaji wa kwanza wa nafasi.
  2. Global Frequency Convolution Block huchuja sifa katika kikoa cha Fourier.
  3. Backbone yenye hatua nne huongeza idadi ya chaneli hatua kwa hatua kutoka takribani 32 hadi 80.
  4. Katika kila hatua, vitengo vya Multi-Expert Time-Frequency Decoupling hufanya kazi kama vichimbaji vikuu vya sifa.
  5. Coordinate Attention hupima upya maeneo muhimu katika mwelekeo wa muda na masafa.
  6. Muunganisho wa njia fupi kati ya hatua ya kwanza na ya tatu hupunguza upotevu wa maelezo madogo ya akustiki.
  7. Global Context Block huunganisha mahusiano kati ya nukta za muda-masafa zilizo mbali.
  8. Kichwa cha uainishaji hubadilisha sifa kuwa uwezekano wa kategoria za meli.

Moduli ya ARN inayotumiwa kabla ya hatua za backbone inalenga kuweka uwiano unaobadilika kati ya kukandamiza kelele na kuhifadhi nishati dhaifu ya lengo. Usanifu wa kina wa ARN haujafafanuliwa upya katika utafiti huu; badala yake, marejeo yametolewa kwa utafiti wa awali.

Global Frequency Convolution Block hufanya nini?

Global Frequency Convolution Block (Frequency Convolutional Block, FCB) inalenga kushinda tatizo la konvolusheni za kawaida kuona tu ujirani mdogo kwa kuhamia katika kikoa cha Fourier. Mizunguko ya injini na propela ya meli inaweza kutengeneza modulations za kipindi zinazotanda katika muda mrefu. FCB hutoa receptive field ya kimataifa inayoweza kutathmini mifumo hii katika spectrogramu nzima kwa operesheni moja.

Ramani ya sifa ya ingizo:

\[ \mathbf{X}\in\mathbb{R}^{C\times H\times W} \]

Hapa C inawakilisha idadi ya chaneli, H ukubwa wa masafa na W ukubwa wa muda. Katika hatua ya kwanza, real fast Fourier transform ya pande mbili hutumika:

\[ \widetilde{\mathbf{X}}=\mathcal{F}_{2D}(\mathbf{X}) \]

Kwa kutumia ulinganifu wa Hermitian wa ingizo zenye thamani halisi, takribani nusu ya matokeo ya Fourier katika mwelekeo wa muda huhifadhiwa. Spektra changamano inayopatikana huzidishwa kipengele kwa kipengele na tensor ya uzani changamano ambayo sehemu zake halisi na za kufikirika zinaweza kujifunzwa:

\[ \mathbf{Y}=\widetilde{\mathbf{X}}\odot\mathbf{W} \]

Kujikita kwa uzani katika masafa ya chini ya modulation hufasiriwa kama kuimarisha mizunguko ya meli inayobadilika polepole na yenye kipindi huku kelele zisizo na mpangilio na zinazobadilika haraka zikipunguzwa.

Sifa zilizochujwa hurudishwa kwenye ndege ya muda-masafa kwa inverse Fourier transform:

\[ \mathbf{X}_{filtered}=\mathcal{F}_{2D}^{-1}(\mathbf{Y}) \]

Ili kuzuia upotevu wa maelezo ya eneo na kutokuwa thabiti kwa mafunzo, ramani ya awali ya sifa huongezwa kupitia residual connection:

\[ \mathbf{X}_{out}=\mathbf{X}+\mathbf{X}_{filtered} \]

Ugumu wa kinadharia wa FCB ni takribani:

\[ \mathcal{O}\left(CHW\log(HW)\right) \]

Thamani hii ni ndogo kuliko gharama ya quadratic ya self-attention ya kawaida inayounda uhusiano wa moja kwa moja kati ya nukta zote za muda-masafa.

Moduli ya Multi-Expert Time-Frequency Decoupling hufanya kazi vipi?

Moduli ya Multi-Expert Time-Frequency Decoupling (METFD) hugawa ingizo katika matawi matatu maalumu ya wataalamu:

Tawi la mtaalamuMwelekeo mkuu wa uchakatajiMuundo wa akustiki unaolengwa
Mtaalamu wa mudaKonvolusheni za 1 × 3 na 1 × 5 za depthwise separableMapigo ya muda mfupi ya kavitesheni ya propela na mabadiliko ya nishati kwa muda
Mtaalamu wa masafaKonvolusheni za 3 × 1 na 5 × 1 za depthwise separableHarmonics thabiti za mashine na spektra za mistari nyembamba
Mtaalamu wa pamojaKonvolusheni iliyopanuliwa ya 3 × 3Spektra pana endelevu na muundo wa mandharinyuma wa pande mbili

Ingizo kwanza kwa konvolusheni ya 1 × 1 hupanuliwa kutoka chaneli C hadi 2C. Mtaalamu wa muda hufanya pooling kwenye mhimili wa masafa na kutengeneza alama za muda zenye ukubwa 2C × 1 × W, mtaalamu wa masafa hufanya pooling kwenye mhimili wa muda na kutengeneza alama za kispektra zenye ukubwa 2C × H × 1, na mtaalamu wa pamoja hutengeneza vekta ya muktadha ya 2C × 1 × 1 kwa global average pooling.

Matokeo ya wataalamu watatu hujumlishwa kipengele kwa kipengele, hupunguzwa tena hadi chaneli C kwa projection ya 1 × 1 na kupitishwa kwenye coordinate attention:

\[ \mathbf{Y}=\mathbf{X}+\operatorname{CoordAtt}\left(F_{proj}\left(E_t(\mathbf{X}')\oplus E_f(\mathbf{X}')\oplus E_j(\mathbf{X}')\right)\right) \]

Hapa Et, Ef na Ej zinawakilisha wataalamu wa muda, masafa na pamoja mtawalia; ⊕ inaonyesha ujumlishaji wa kipengele kwa kipengele. Residual connection huzuia taarifa za awali za eneo kupotea kabisa wakati wa utenganishaji.

Kwa nini coordinate attention inahitajika?

Mifumo mingi ya attention hubana ramani ya sifa ya pande mbili kuwa thamani moja ya chaneli. Mbinu hii inaweza kujibu swali “ni chaneli gani muhimu?” lakini inaweza kufuta taarifa ya ishara muhimu iko wakati gani na katika masafa gani.

Coordinate Attention hufanya pooling kwa mihimili ya muda na masafa kando:

  • Vekta moja hubeba umuhimu wa wastani wa kila bendi ya masafa katika muda.
  • Vekta nyingine hubeba umuhimu wa wastani wa kila fremu ya muda katika masafa yote.

Uwakilishi huu miwili ya kimwelekeo huunganishwa, hupitishwa kwenye konvolusheni ya 1 × 1 na mabadiliko yasiyo ya mstari, kisha hugawanywa tena kuwa uzani wa muda na masafa. Sifa ya mwisho huundwa kama:

\[ \widehat{\mathbf{U}}=\mathbf{U}\odot A_h\odot A_w \]

Ah inawakilisha uzani wa attention katika mwelekeo wa masafa, na Aw uzani katika mwelekeo wa muda. Hivyo modeli inaweza kuhifadhi mahali pa masafa pa spektra fulani ya mstari na mahali pa muda pa tukio la kavitesheni la muda mfupi.

Global Context Block hutoa nini?

Wakati METFD na coordinate attention zinachakata sifa za eneo na kimwelekeo, Global Context Block hukusanya taarifa kutoka maeneo tofauti ya muda-masafa kuwa muktadha mmoja. Kutoka ramani ya sifa ya ingizo, spatial attention mask huundwa kwa konvolusheni ya 1 × 1 na Softmax. Sifa zilizonyooshwa huzidishwa na mask ili kukokotoa vekta ya muktadha wa kimataifa kwa kila chaneli:

\[ \mathbf{V}_{gc}=\mathbf{V}+\mathbf{W}_v\left(\mathbf{V}_{flat}\mathbf{M}^{T}\right) \]

Uwakilishi huu kisha hutumwa kwenye upanuzi wa chaneli, global average pooling, dropout na tabaka la uainishaji la mstari.

Kwa nini METFD ni nyepesi kuliko konvolusheni ya kawaida ya 3 × 3?

Gharama ya kukokotoa ya konvolusheni ya kawaida ya 3 × 3 imetolewa takribani kama:

\[ \mathcal{O}(9C^2HW) \]

Wakati gharama ya jumla ya METFD imehesabiwa kuwa:

\[ \mathcal{O}_{METFD}=\mathcal{O}\left(4C^2HW+42CHW+4C^2(H+W+1)\right) \]

Kwa kuwa thamani ya H + W kwa kawaida ni ndogo sana kuliko zao la HW, gharama kuu hutokana na neno 4C²HW. Watafiti wanaeleza kwamba muundo huu, ikilinganishwa na konvolusheni ya kawaida ya 3 × 3, hupunguza idadi ya FLOP kwa zaidi ya %50.

Hesabu hii ya kinadharia haipimi moja kwa moja ucheleweshaji au matumizi ya nishati kwenye kifaa halisi. Gharama ya utekelezaji wa Fourier transform, ufikiaji wa kumbukumbu na viongeza kasi vya vifaa mahususi inaweza kutofautiana na idadi ya FLOP.

Seti ya data ya DeepShip ilitumika vipi?

DeepShip ina jumla ya saa 47 na dakika 4 za rekodi halisi za chini ya maji zinazotolewa na Ocean Networks Canada. Meli 265 tofauti katika seti ya data zimegawanywa katika madarasa manne mapana:

  • Meli ya mizigo
  • Meli ya abiria
  • Tanker
  • Tugboat

Rekodi ziligawanywa katika vipande vya sekunde 3, 5 na 10. Kwa vipande vya sekunde tatu na tano, mgawanyo usioingiliana ulitumika; kwa vipande vya sekunde 10, mwingiliano wa sekunde 5 ulitumika ili kuhifadhi idadi ya kutosha ya sampuli.

Muda wa kipandeSampuli za mafunzoSampuli za uthibitishajiSampuli za majaribioJumla
Sekunde 344.5185.9126.03856.468
Sekunde 526.7483.5363.48633.770
Sekunde 1026.1533.4753.55333.181

Chaguo muhimu la kimethodolojia lilikuwa kwamba mgawanyo haukufanywa kwa nasibu kwa vipande, bali kwa vitambulisho vya faili za sauti asilia. Hivyo, ilijaribiwa kuzuia kelele zinazofanana za mazingira kutoka rekodi moja ndefu kuingia kwa pamoja katika seti za mafunzo na majaribio. Uwiano wa mafunzo, uthibitishaji na majaribio ulikuwa takribani 8:1:1, na vitambulisho vya faili asilia vilivyotumiwa kwa kila darasa vimeorodheshwa wazi katika Jedwali 2 la utafiti.

Seti ya data ya ShipsEar ilipangwaje?

ShipsEar ina rekodi 90 za sauti na takribani saa tatu za data zilizorekodiwa katika pwani ya Atlantiki ya kaskazini-magharibi mwa Hispania. Aina 11 za meli pamoja na kelele za mazingira katika seti hiyo zimegawanywa katika madarasa matano ya juu yanayotumiwa katika fasihi:

DarasaVyanzo vinavyojumuishwa
ABoti za uvuvi, trawlers, boti za mussel, tugboats na dredgers
BBoti za injini, boti za marubani na mashua za matanga
CMeli za abiria
DMeli za abiria za bahari na meli za ro-ro
EKelele ya kawaida ya mandharinyuma

Rekodi ziligawanywa kuwa vipande vya sekunde 5 visivyoingiliana na sampuli 2.094 zikatengenezwa kwa jumla:

  • Mafunzo: sampuli 1.709
  • Uthibitishaji: sampuli 228
  • Majaribio: sampuli 157

Kwa sababu ShipsEar ni ndogo, seti hii ya data ilitumika kutathmini uhamishaji wa modeli zilizofunzwa awali kwenye DeepShip kwenda mazingira tofauti ya akustiki.

Modeli ilitathminiwa kwa vipimo gani?

Usahihi wa jumla ulihesabiwa kama:

\[ \operatorname{Accuracy}=\frac{\sum_{k=1}^{K}TP_k}{N} \]

TPk inaonyesha sampuli chanya zilizotambuliwa kwa usahihi katika darasa k; N ni jumla ya sampuli.

Precision na recall kwa kila darasa:

\[ P_k=\frac{TP_k}{TP_k+FP_k} \]

\[ R_k=\frac{TP_k}{TP_k+FN_k} \]

zimetolewa kwa namna hii. Kwa sababu idadi ya sampuli katika madarasa tofauti si sawa, Macro-F1 pia ilitumika:

\[ \operatorname{Macro-F1}=\frac{1}{K}\sum_{k=1}^{K}\frac{2P_kR_k}{P_k+R_k} \]

Macro-F1 hutoa uzito sawa kwa kila darasa. Zaidi ya hayo, idadi ya vigezo vinavyoweza kujifunzwa na thamani ya FLOP ziliripotiwa kama viashiria vya takriban vya mahitaji ya kukokotoa na kumbukumbu.

Mipangilio ya mafunzo ya DeepShip ilikuwa ipi?

MpangilioThamani
VifaaIntel Core i5-14600KF, NVIDIA GeForce RTX 4060 Ti, kumbukumbu 64 GB
ProgramuPython 3.8.20, PyTorch 2.4.1, CUDA 12.1
Epoch200
Ukubwa wa batch16
UboreshajiSGD
Kiwango cha awali cha kujifunza6 × 10−3
Weight decay7 × 10−5
Mpangaji wa kiwango cha kujifunzaReduceLROnPlateau
Dropout0,2
Label smoothing0,1

Vipande vya sekunde tano vilichaguliwa kuwa mpangilio mkuu wa majaribio ya baadaye ya ablation, uthabiti dhidi ya kelele na uoneshaji. Watafiti wanaeleza kuwa muda huu unatosha kukamata mizunguko ya modulation ya kimitambo huku ukiwa na mzigo mdogo wa kukokotoa kuliko ingizo la sekunde 10.

Ulinganisho mkuu wa modeli unaonyesha nini?

Katika Jedwali 3, modeli zote zilifunzwa kutoka mwanzo kwa ingizo sawa za log-Mel na mkondo sawa wa mafunzo. Thamani za FLOP zimetolewa kwa mpangilio wa ingizo wa sekunde 3.

ModeliVigezoFLOPsUsahihi wa s 3 / Macro-F1 (%)Usahihi wa s 5 / Macro-F1 (%)Usahihi wa s 10 / Macro-F1 (%)
ResNet-1811,17 M427,10 M72,89 / 72,2672,37 / 72,3573,01 / 72,26
ResNet-3421,28 M881,31 M72,89 / 72,2672,03 / 71,6370,14 / 69,61
ResNet-5023,51 M992,37 M72,69 / 71,9873,55 / 73,2868,28 / 67,53
ResNet-10142,50 M1,91 G74,69 / 74,1070,65 / 69,9768,90 / 67,70
MobileNet-V22,23 M77,91 M72,95 / 71,6370,71 / 70,7674,89 / 74,11
ShuffleNet-V21,26 M35,80 M70,09 / 68,9666,27 / 65,4472,84 / 72,06
EfficientNet-B04,01 M99,86 M73,43 / 72,8374,04 / 73,4177,17 / 76,78
ConvNeXt-Tiny27,81 M916,69 M73,88 / 72,6172,40 / 72,3874,87 / 74,00
CFTANet0,47 M118,61 M70,85 / 69,5071,43 / 70,6573,02 / 73,05
UATFSNet0,03 M2,78 M66,03 / 65,0767,47 / 66,6069,97 / 68,72
FADD-Net0,66 M110,05 M75,04 / 74,6677,17 / 77,0277,96 / 77,76

FADD-Net ilipata usahihi wa juu zaidi katika muda wote wa vipande. Ikilinganishwa na EfficientNet-B0, mojawapo ya modeli nyepesi zenye nguvu zaidi, tofauti za usahihi zilikuwa kwa sekunde 3 pointi za asilimia 1,61, kwa sekunde 5 pointi 3,13 na kwa sekunde 10 pointi 0,79. FADD-Net hutumia takribani %16,5 ya bajeti ya vigezo vya EfficientNet-B0; hata hivyo, thamani yake ya FLOP kwa ingizo la sekunde 3 ni takribani %10 juu kuliko EfficientNet-B0. Kwa hiyo modeli si ndogo zaidi kwa kila kipimo cha kukokotoa.

Usahihi wa ResNet-101 kwa sekunde 3 ulikuwa %74,69, lakini kwa sekunde 10 ulipungua hadi %68,90. FADD-Net, kwa upande mwingine, iliongezeka kutoka %75,04 hadi %77,96 kadiri muda wa ingizo ulivyoongezeka. Watafiti wanahusisha tofauti hii na modeli kubwa za isotropiki kujifunza kupita kiasi kelele za mandharinyuma katika rekodi ndefu. Hata hivyo, utafiti haukuthibitisha moja kwa moja utaratibu huu kwa mafunzo yaliyorudiwa au vipimo huru vya overfitting.

Uwepesi wa FADD-Net unapaswa kutafsiriwaje?

  • Ikilinganishwa na ResNet-18, idadi ya vigezo ni takribani mara 16,9 ndogo.
  • Ikilinganishwa na ResNet-18, idadi ya FLOP kwa ingizo la sekunde 3 ni takribani %74,2 ndogo.
  • Ikilinganishwa na ResNet-101, idadi ya vigezo ni takribani mara 64 ndogo.
  • Ikilinganishwa na ResNet-101, idadi ya FLOP ni takribani %94,2 ndogo.
  • UATFSNet, ikiwa na vigezo milioni 0,03, ni ndogo zaidi kuliko FADD-Net lakini usahihi wake ni wa chini sana.
  • EfficientNet-B0 ina FLOP ya chini kuliko FADD-Net lakini hutumia vigezo zaidi.

Kwa hiyo FADD-Net si “modeli ndogo zaidi”, bali ni modeli inayoweka uwiano mzuri kati ya usahihi uliopimwa na ukubwa wa modeli.

Majaribio ya ablation yanaonyesha moduli zipi ni muhimu?

Katika mpangilio mkuu wa sekunde tano, kila mara kipengele kimoja kiliondolewa au kubadilishwa na mbadala wake wa kawaida:

UsanidiFLOPs (M)Usahihi (%)Mabadiliko dhidi ya modeli kamili
FADD-Net kamili228,7076,94–
Bila FCB227,8874,61−2,33 pointi za asilimia
Konvolusheni 3 × 3 badala ya METFD566,5975,33−1,61 pointi za asilimia
Bila Coordinate Attention226,8573,72−3,22 pointi za asilimia
Instance normalization badala ya ARN228,7076,46−0,48 pointi za asilimia
Bila njia fupi kati ya hatua227,8876,25−0,69 pointi za asilimia

Upungufu mkubwa zaidi wa usahihi ulitokea Coordinate Attention ilipoondolewa. Matokeo haya yanaunga mkono kwamba kuhifadhi mahali muhimu pa muda na masafa ni muhimu zaidi kuliko kupima chaneli pekee. Kuondolewa kwa FCB kulisababisha upungufu wa pointi 2,33 za asilimia na kuonyesha mchango wa taarifa za kipindi cha muda mrefu.

Kubadilisha METFD na konvolusheni ya kawaida ya 3 × 3 kulipunguza usahihi huku gharama ya kukokotoa ikiongezeka kutoka FLOP milioni 228,70 hadi milioni 566,59. Hili linaonyesha kwamba utenganishaji wa kimwelekeo unaweza kuwa sahihi zaidi na pia wenye ufanisi zaidi wa kukokotoa.

Usahihi wa modeli kamili katika jedwali la ablation ni %76,94, huku usahihi wa sekunde 5 katika jedwali kuu la kulinganisha ukiwa %77,17. Utafiti haujaeleza kama tofauti hii ya pointi 0,23 za asilimia imetokana na utekelezaji tofauti wa mafunzo, na hakuna mkengeuko wa kawaida kati ya marudio ulioripotiwa.

Ni mchanganyiko gani wa kernel za konvolusheni uliotoa matokeo bora?

Ukubwa wa kernel za METFD katika mwelekeo wa muda na masafa ulijaribiwa kando. Usahihi wa juu zaidi ulipatikana kwa mchanganyiko wa kernel 1 × 3 katika muda na 3 × 1 katika masafa, na ulipimwa kuwa %76,53.

Kernel ya mudaMasafa 1 × 1Masafa 3 × 1Masafa 5 × 1
1 × 1%69,63%73,03%73,38
1 × 3%73,81%76,53%73,50
1 × 5%72,28%74,02%73,41

Kernel za 1 × 1 hazikutosha kukamata muktadha wa eneo. Kuongeza urefu wa kernel hadi 5 huenda kulilainisha kupita kiasi mapigo mafupi ya kavitesheni au kuchanganya harmonics tofauti na kelele ya bendi pana. Tafsiri hii inatokana na mwelekeo wa utendaji na jiometri ya kifizikia ya sauti za meli; muda halisi na upana wa bendi za mapigo haukupimwa kando.

Kutumia matawi yote matatu ya wataalamu pamoja kuliongeza nini?

UsanidiUsahihi (%)
Mtaalamu wa muda pekee72,60
Mtaalamu wa masafa pekee71,85
Mtaalamu wa pamoja pekee71,55
Mchanganyiko wa msingi wa wataalamu watatu75,04
METFD kamili yenye konvolusheni iliyopanuliwa75,85

Kuzingatia kipengele kimoja cha kifizikia hakutoshi kwa madarasa yote ya meli. Kuunganisha muda, masafa na muktadha wa pamoja kuliongeza usahihi kwa takribani pointi 2,4-3,5 za asilimia. Konvolusheni zilizopanuliwa zilinasa muktadha mpana wa pande mbili bila kuongeza sana idadi ya vigezo na kutoa nyongeza ya pointi 0,81 za asilimia.

Modeli ilitendaje chini ya kelele sintetiki?

Katika jaribio la kwanza la kelele, kelele nyeupe ya Gaussian ya nyongeza kutoka −5 dB hadi 20 dB iliongezwa kwenye ishara safi za majaribio. FADD-Net ilionyesha mkondo wa usahihi wa juu kuliko modeli za kulinganisha katika viwango vyote vya kelele sintetiki vilivyochunguzwa.

Katika −5 dB, ConvNeXt-Tiny ilihifadhi takribani %30,4 ya usahihi, huku mkondo wa FADD-Net ukiendelea kuwa juu yake. Hata hivyo, kwa kuwa thamani sahihi za nukta zote kwenye kielelezo hazikutolewa katika jedwali, si sahihi kutumia thamani za kati zilizosomwa kwenye grafu kama matokeo kamili.

Matokeo yakoje chini ya kelele halisi ya bahari?

Katika jaribio la pili la kelele, mandharinyuma halisi ya bahari kutoka ShipsEar Darasa E iliongezwa kwenye sampuli za majaribio za DeepShip. Mazingira haya yana muundo usio na mpangilio zaidi na unaobadilika kwa muda kuliko kelele nyeupe.

  • Katika −5 dB, usahihi wa ResNet-50 ulipungua hadi %22,29.
  • Katika −5 dB, usahihi wa EfficientNet-B0 ulipungua hadi %23,35.
  • Katika 5 dB, ConvNeXt-Tiny yenye %56,20 ilizidi FADD-Net yenye %53,93.
  • FADD-Net ilizidi modeli zote za kulinganisha kuanzia 10 dB.
  • Katika 20 dB, FADD-Net ilitoa %76,31 na ConvNeXt-Tiny %71,63.

Matokeo haya yanaonyesha kwamba FADD-Net ina faida katika kutenganisha harmonics za kifizikia kwenye uwiano wa kati na wa juu wa signal-to-noise, lakini katika hali ngumu sana za kelele halisi modeli kubwa inaweza kutoa matokeo bora katika eneo fulani. Dai la “uthabiti bora dhidi ya kelele” la utafiti linapaswa kutafsiriwa kwa kuzingatia hali hii ya kipekee.

Matriki za mkanganyiko zinaonyesha madarasa gani ni magumu?

DarasaUainishaji sahihi wa EfficientNet-B0Uainishaji sahihi wa FADD-Net
Meli ya mizigo%66%74
Meli ya abiria%85%90
Tanker%78%74
Tugboat%70%77

FADD-Net iliboreka katika madarasa ya meli za mizigo, meli za abiria na tugboats, lakini ilipungua kwa pointi nne za asilimia kwa tankers. %15 ya sampuli za tanker ziliainishwa kama meli za mizigo na %8 kama meli za abiria. Kiwango cha meli za mizigo kuchanganywa na tanker kilipungua kutoka %24 kwenye EfficientNet-B0 hadi %19 kwenye FADD-Net.

%17 ya tugboats ziliainishwa kama meli za abiria. Kulingana na tafsiri ya kifizikia ya utafiti, propela za tugboats zinazofanya kazi kwa mizunguko mikubwa na chini ya mzigo zinaweza kutoa midundo mikali ya kavitesheni ya masafa ya juu inayofanana na ile ya meli ndogo za abiria. Meli za mizigo na tankers, kwa upande mwingine, ni meli kubwa za kibiashara zinazofanya kazi kwa kasi ndogo na hivyo zina harmonics zinazofanana za mashine za masafa ya chini.

Uoneshaji wa t-SNE unaonyesha nini?

Kielelezo 12 kinaonyesha jinsi sifa zinavyojitenga kadiri zinavyopita ndani ya mtandao:

  • Katika ingizo ghafi, nukta za madarasa manne ya meli zimechanganyika kwa kiasi kikubwa.
  • Baada ya konvolusheni za mwanzo, kuna utengano kidogo lakini mipaka ya madarasa bado haiko wazi.
  • Katika matokeo ya METFD, umbali kati ya madarasa huongezeka na mtawanyiko ndani ya darasa hupungua.
  • Katika nafasi ya mwisho ya sifa, makundi manne yaliyo wazi zaidi hujitokeza.

Kundi la tugboat linajitenga zaidi kutokana na sifa za kavitesheni za masafa ya juu, huku makundi ya meli za mizigo na tanker yakiendelea kuwa karibu. t-SNE ni uwakilishi wa kuona wa pande mbili wa sifa zenye vipimo vingi; mwonekano wa makundi pekee si ushahidi wa ujumlishaji au sababu.

Ramani za Grad-CAM zinaonyesha modeli inaangalia nini?

Katika picha za Grad-CAM, eneo la masafa limegawanywa katika sehemu tatu:

  • Masafa ya chini: 0-100 Hz
  • Masafa ya kati: 100-1000 Hz
  • Masafa ya juu: 1-8 kHz

Katika madarasa ya meli za mizigo na tanker, attention ilijikita kwenye mistari ya mlalo inayoendelea katika masafa ya chini na kati. Hii ilihusishwa na harmonics thabiti za kimitambo za mashine nzito. Katika meli za abiria na tugboats, vitalu vya nishati vya eneo na vilivyokatika katika masafa ya juu vilikuwa wazi zaidi; vilielezwa kwa mizunguko ya haraka ya propela na mapigo ya kavitesheni.

Picha hizi zinaunga mkono tafsiri kwamba mtandao hautumii tu mifumo ya mandharinyuma maalumu kwa seti ya data, bali pia maeneo ya sauti yenye maana ya kifizikia. Hata hivyo, Grad-CAM ni ramani ya umuhimu yenye azimio la chini na haiwezi kuthibitisha kwamba chanzo fulani cha kifizikia kimetambuliwa kwa sababu.

Ujifunzaji wa uhamishaji wa ShipsEar ulifanywaje?

Modeli iliyofunzwa awali kwa data za sekunde 5 za DeepShip ilihamishwa kwenda ShipsEar. Kichwa kipya cha uainishaji cha madarasa matano kiliundwa na FCB ikawekwa upya ili kuzoea mazingira tofauti ya maji mafupi.

MpangilioThamani ya ShipsEar
Epoch60
Ukubwa wa batch16
UboreshajiAdamW
Kiwango cha kujifunza cha backbone iliyofunzwa awali5 × 10−5
Kiwango cha kujifunza cha tabaka mpya2 × 10−3
Weight decay1 × 10−4
Mpangaji wa kiwango cha kujifunzaCosine annealing
Dropout0,3
Label smoothing0,1
LossCross-entropy yenye uzito wa darasa

Kutoa kiwango cha chini cha kujifunza kwa backbone iliyofunzwa awali na kiwango cha juu kwa tabaka mpya kunalenga kuhifadhi maarifa ya akustiki yaliyopatikana kabla huku kukiruhusu kuzoea mazingira mapya.

Matokeo ya uhamishaji kati ya seti za data ni yapi?

ModeliUsahihi wa majaribio ya ShipsEar (%)
ResNet-1873,30
ResNet-3474,27
ResNet-5072,33
ResNet-10169,90
MobileNet-V263,11
ShuffleNet-V265,05
EfficientNet-B073,30
ConvNeXt-Tiny71,84
CFTANet74,27
UATFSNet73,79
FADD-Net81,07

FADD-Net ilizidi matokeo ya karibu zaidi, ResNet-34 na CFTANet, kwa pointi za asilimia 6,80. Watafiti wanahusisha tofauti hii na kichujio cha Fourier kupunguza kelele zisizo na mpangilio zilizo maalumu kwa mazingira na METFD kutenganisha harmonics za kimitambo zisizotegemea sana mazingira na midundo ya kavitesheni.

Kwa kuwa seti ya majaribio ya ShipsEar ina segmenti 157 pekee, matokeo ya sampuli moja yanaweza kubadilisha matokeo kwa takribani pointi 0,64 za asilimia. Kwa sababu utafiti haukuripoti confidence interval au marudio kwa mgawanyo tofauti wa data, matokeo ya %81,07 yanapaswa kutathminiwa katika muktadha wa seti ndogo ya majaribio.

Nguvu za utafiti ni zipi?

  • Usanifu wa mtandao umehusishwa na taratibu za kifizikia zinazozalisha sauti za meli.
  • Mihimili ya muda na masafa haijachakatwa kama sifa moja, bali imetathminiwa katika matawi tofauti ya wataalamu.
  • Mgawanyo wa DeepShip ulifanywa kwa vitambulisho vya faili asilia ili kupunguza kuvuja kwa taarifa kati ya vipande.
  • Muda mitatu tofauti ya sauti, seti mbili za data na familia mbalimbali za modeli zililinganishwa.
  • Mbali na usahihi, Macro-F1, idadi ya vigezo na thamani za FLOP ziliripotiwa.
  • Kila moduli kuu ilitathminiwa kando kwa majaribio ya ablation.
  • Kelele sintetiki na kelele halisi ya bahari zilijaribiwa kando.
  • Tabia ya modeli ilionyeshwa kwa matriki za mkanganyiko, t-SNE na Grad-CAM.
  • FADD-Net ilizidi modeli nzito ikiwa na ukubwa mdogo wa modeli.
  • Uhamishaji kutoka DeepShip kwenda ShipsEar ulijaribiwa kati ya seti za data.

Mapungufu ya utafiti ni yapi?

  • Utafiti ni preprint ambayo haijapitia tathmini ya wenzao.
  • Modeli haijatekelezwa kwenye chombo halisi huru cha chini ya maji, kifaa cha sonar tulivu au kichakataji kilichopachikwa.
  • Ucheleweshaji wa inference, kiwango cha fremu cha muda halisi, matumizi ya RAM na matumizi ya nishati kwa watt hayajaripotiwa.
  • FLOP na idadi ya vigezo ni viashiria vya takriban tu vya utendaji wa vifaa halisi.
  • Haijaelezwa kama majaribio yalikuwa utekelezaji mmoja au wastani wa seed kadhaa za nasibu.
  • Hakuna mkengeuko wa kawaida, confidence interval au jaribio la umuhimu wa kitakwimu lililotolewa.
  • DeepShip na ShipsEar zinawakilisha maeneo maalumu ya kijiografia, hydrophone na mgawanyo wa meli; haziwezi kujumlishwa kwa mazingira yote ya bahari.
  • Seti ya majaribio ya ShipsEar ina sampuli 157 tu za sekunde tano.
  • Katika kelele halisi ya bahari ya 5 dB, FADD-Net si modeli bora zaidi.
  • Usahihi wa tanker umeshuka kutoka %78 hadi %74 ikilinganishwa na EfficientNet-B0.
  • Mchanganyiko kati ya meli za mizigo na tanker, pamoja na tugboat na meli za abiria, bado unaendelea.
  • Katika sampuli za sekunde 10, mwingiliano wa sekunde 5 ulitumika ndani ya faili moja; ingawa kuvuja kati ya migawanyo kulizuiwa, utegemezi wa sampuli ndani ya mgawanyo mmoja unaweza kuongezeka.
  • Maelezo yote ya usanifu wa moduli ya ARN hayajaelezwa tena katika maandishi haya.
  • Hakuna kiungo cha ufikiaji kilichotolewa kwa msimbo chanzo, uzani wa modeli na usanidi kamili wa majaribio.
  • Mbinu za kuongeza data hazijaelezwa kwa kina.
  • Modeli haijajaribiwa kwa mamalia wa baharini, matukio ya mazingira au madarasa ya malengo yasiyojulikana.
  • Utendaji wa false alarm, open-set recognition na kukataa sampuli zilizo nje ya usambazaji haujatathminiwa.

Utafiti unaunga mkono nini?

  • Unaunga mkono kwamba utenganishaji wa muda-masafa unaotumia maarifa ya kifizikia unaweza kutoa uainishaji wenye ushindani kwa modeli ndogo.
  • Unaonyesha kwamba FCB, METFD na coordinate attention kila moja hutoa mchango unaopimika katika usahihi.
  • Unaonyesha kwamba FADD-Net ilitoa usahihi wa juu kuliko modeli za kulinganisha zilizochunguzwa kwenye DeepShip.
  • Unaonyesha kwamba FADD-Net inaweza kutoa usahihi wa juu wa majaribio katika uhamishaji kutoka DeepShip kwenda ShipsEar.
  • Unaonyesha kwamba shughuli za kimwelekeo na zisizo isotropiki zinaweza kutoa usahihi wa juu kwa FLOP chache kuliko konvolusheni ya kawaida ya 3 × 3.
  • Unaunga mkono kwamba maamuzi ya modeli katika baadhi ya madarasa ya meli yanaendana na maeneo ya muda na masafa yenye maana ya kifizikia.

Utafiti hauthibitishi nini?

  • Hauthibitishi kwamba modeli itafanya kazi kwa usahihi sawa katika misheni halisi za baharini.
  • Hauthibitishi kwamba vigezo milioni 0,66 moja kwa moja vinamaanisha matumizi madogo ya nishati au utendaji wa muda halisi.
  • Hauonyeshi kwamba FADD-Net ni bora kuliko modeli zote katika viwango vyote vya kelele.
  • Hauthibitishi kwamba modeli inaweza kukataa kwa usalama aina za meli zisizojulikana.
  • Hauonyeshi kwamba modeli haiathiriwi na mpangilio wa hydrophone, kina, hali ya hewa na tofauti za sakafu ya bahari.
  • Hauwasilishi uaminifu wa kiutendaji, uthibitishaji wa usalama au mafanikio ya uwanjani katika mfumo wa sonar wa kijeshi au kiraia.
  • Hauthibitishi kwa uhakika kwamba maeneo ya Grad-CAM yanahusiana moja kwa moja na sehemu maalumu za mashine au propela.

Mbinu na Matokeo ya Utafiti

Muundo wa utafiti

Utafiti ni kazi ya majaribio ya ujifunzaji wa mashine inayojumuisha uainishaji unaosimamiwa, ulinganisho wa modeli, uchambuzi wa ablation, jaribio la uthabiti dhidi ya kelele, ujifunzaji wa uhamishaji na uoneshaji wa sifa katika seti mbili za data za umma za akustiki za chini ya maji.

Ingizo na matokeo

KipengeleSifa ya kiufundi
Ingizo ghafiRekodi ya sauti ya chini ya maji inayotokana na meli
Kiwango cha sampuli16 kHz
Dirisha la STFT50 ms Hann
Hatua ya STFT25 ms
Kichujio cha Mel128
Ingizo la mtandaoSpectrogramu ya log-Mel ya 1 × 128 × T
Matokeo ya DeepShipMizigo, abiria, tanker au tugboat
Matokeo ya ShipsEarMadarasa matano ya juu ya akustiki

Moduli kuu za FADD-Net

  • Bloku ya mwanzo ya konvolusheni yenye tabaka mbili
  • Global Frequency Convolution Block
  • Backbone nyepesi yenye hatua nne
  • Moduli ya kusawazisha ARN
  • Multi-Expert Time-Frequency Decoupling
  • Coordinate Attention
  • Njia fupi kati ya hatua
  • Global Context Block
  • Kichwa cha uainishaji kilichodhibitiwa kwa dropout

Muhtasari wa kiufundi wa matokeo makuu

KipimoMatokeo ya FADD-NetTafsiri
Idadi ya vigezoMilioni 0,66Ndogo kwa kiasi kikubwa kuliko modeli nzito za ResNet na ConvNeXt
FLOPs za sekunde 3Milioni 110,05Juu kidogo kuliko EfficientNet-B0, lakini chini sana kuliko modeli nyingi za kina
Usahihi wa sekunde 3%75,04Wa juu zaidi kati ya modeli zilizolinganishwa
Usahihi wa sekunde 5%77,17Wa juu zaidi kati ya modeli zilizolinganishwa
Usahihi wa sekunde 10%77,96Wa juu zaidi kati ya modeli zilizolinganishwa
Macro-F1 ya sekunde 10%77,76Matokeo ya juu zaidi yanayozingatia kutokuwiana kwa madarasa
Usahihi wa uhamishaji wa ShipsEar%81,07Pointi za asilimia 6,80 juu ya ulinganisho wa karibu zaidi
Kelele halisi, 20 dB%76,31Wa juu zaidi kati ya modeli zilizolinganishwa
Kelele halisi, 5 dB%53,93Chini ya matokeo ya %56,20 ya ConvNeXt-Tiny

Muhtasari wa mchango wa moduli

  • Coordinate Attention ilipoondolewa, usahihi ulipungua kwa pointi 3,22 za asilimia.
  • FCB ilipoondolewa, usahihi ulipungua kwa pointi 2,33 za asilimia.
  • METFD ilipobadilishwa na konvolusheni ya kawaida ya 3 × 3, usahihi ulipungua kwa pointi 1,61 za asilimia na thamani ya FLOP ikaongezeka takribani mara 2,48.
  • ARN ilipoondolewa, usahihi ulipungua kwa pointi 0,48 za asilimia.
  • Njia fupi kati ya hatua ilipoondolewa, usahihi ulipungua kwa pointi 0,69 za asilimia.

Taarifa zinazokosekana kwa upande wa urudufu wa matokeo

  • Seed za nasibu
  • Idadi ya majaribio yaliyorudiwa
  • Mkengeuko wa kawaida wa matokeo
  • Msimbo chanzo na uzani wa modeli
  • Usanidi kamili wa kuongeza data
  • Maelezo kamili ya utekelezaji wa ARN
  • Muda wa inference kwenye vifaa vilivyopachikwa
  • Vipimo halisi vya nguvu na kumbukumbu

Hatua zinazohitajika kabla ya matumizi halisi ya uwanjani

  • Kuunda seti mpya za data za baharini kwa hydrophone na mifumo tofauti ya kurekodi
  • Majario katika kina tofauti, sakafu tofauti za bahari na hali za uenezaji wa njia nyingi
  • Kutathmini mvua, mawimbi, sauti za kibayolojia, kelele za bandari na viwanda
  • Majario ya malengo yasiyojulikana na open-set recognition
  • Inference ya muda halisi kwenye kichakataji kilichopachikwa katika chombo huru cha chini ya maji
  • Kupima nguvu kwa watt na kumbukumbu kwa megabyte
  • Jaribio la muda mrefu baharini
  • Uchambuzi wa false alarm, ucheleweshaji na uaminifu
  • Uthibitishaji wa nje kwa data huru kutoka nchi na maeneo tofauti ya bahari

Dokezo la Chanzo na Mbinu

Jina kamili la asili la utafiti: FADD-Net: Integrating Global Frequency Filtering and Directional Spectro-Temporal Decoupling for Lightweight Underwater Acoustic Target Recognition

Waandishi: Chen Liang; Zailei Luo; Dongchen Tian; Ziyu Yan; Jing Xu; Xionghui Li.

Mpangilio wa waandishi: Orodha iliyo hapo juu inahifadhi mpangilio wa asili wa waandishi katika utafiti.

Mwandishi mwenza wa kwanza: Hakuna taarifa ya waandishi wenza wa kwanza au mchango sawa katika utafiti.

Waandishi wa mawasiliano: Jing Xu na Xionghui Li.

Barua pepe za waandishi wa mawasiliano: jxu-optics@zju.edu.cn; wananmotianlun@foxmail.com.

Taasisi:

  • Ocean College, Zhejiang University, Zhoushan 316021, China.
  • Advanced Interdisciplinary Technology Research Center, National Innovation Institute of Defense Technology, Beijing 100071, China.
  • School of Information and Communication Engineering, University of Electronic Science and Technology of China, Chengdu, China.

DOI:10.2139/ssrn.7202166

Jukwaa rasmi la uchapishaji: SSRN.

Kiungo rasmi cha utafiti:Ukurasa wa utafiti wa SSRN

Tarehe ya uchapishaji: 29 Julai 2026.

Mwaka wa uchapishaji: 2026.

Jarida: Hakuna jina maalumu la jarida lililopitiwa na wenzao au taarifa ya kukubaliwa kwa toleo hili.

Mchapishaji: Mchapishaji wa jarida lililopitiwa na wenzao hajathibitishwa. Maandishi yana kauli “Preprint submitted to Elsevier”, lakini hakuna jarida maalumu la Elsevier lililotajwa.

Aina ya chanzo: Makala ya utafiti ya preprint inayojumuisha ujifunzaji wa mashine wa majaribio na tathmini linganishi ya modeli kwenye seti za data za umma.

Hali ya mapitio ya wenzao: Utafiti huu ni preprint ambayo haijapitia tathmini ya wenzao; matokeo yanapaswa kusomwa kwa kuzingatia kikomo hiki.

Ufadhili: Taarifa ya ufadhili haipo katika toleo hili.

Mgongano wa maslahi: Tamko la mgongano wa maslahi halipo katika toleo hili.

Ufikiaji wa data: Seti za data za wazi za DeepShip na ShipsEar zimetumika; hata hivyo, hakuna kiungo kilichotolewa kwa uzani za modeli zilizofunzwa, msimbo chanzo na faili za matokeo ya majaribio.

Maelezo haya ya Kiswahili yameandaliwa kwa kupitia maandishi, milinganyo, michoro ya modeli, majedwali ya data, grafu za utendaji, matokeo ya ablation, majaribio ya kelele, matriki za mkanganyiko, mgawanyo wa t-SNE na ramani za Grad-CAM za utafiti wa kurasa 25 uliopakiwa. Hakuna matokeo ya kisayansi yasiyokuwapo katika utafiti yaliyoongezwa. Ukaguzi wa vyanzo vya nje ulitumika tu kuthibitisha taarifa za kibiblia kama DOI, tarehe ya usajili wa SSRN na hali ya uchapishaji.

Kikomo kikuu cha utafiti ni kwamba dai la “kufaa kwa majukwaa ya muda halisi na yenye vikwazo vya nishati” linategemea hesabu za vigezo na FLOP. Ucheleweshaji, kumbukumbu, matumizi ya nishati au utendaji wa misheni ya baharini haujapimwa katika mfumo halisi uliopachikwa. Aidha, kwa kuwa hakuna marudio huru ya majaribio na confidence interval za kitakwimu zilizotolewa, uthabiti wa tofauti ndogo za usahihi haujathibitishwa.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy