Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Muhandislik / YOLO-EFD: dron tasvirlaridagi kichik obyektlarni chekka va chastota ma’lumoti bilan yaxshiroq aniqlash
Muhandislik

YOLO-EFD: dron tasvirlaridagi kichik obyektlarni chekka va chastota ma’lumoti bilan yaxshiroq aniqlash

Dron va masofadan zondlash tasvirlarida avtomobil, piyoda, velosiped yoki mototsikl kabi obyektlar ba’zan atigi bir necha piksel kattalikda ko‘rinadi.

30/07/2026  Veri Anla 20 marta ko‘rildi
YOLO-EFD: dron tasvirlaridagi kichik obyektlarni chekka va chastota ma’lumoti bilan yaxshiroq aniqlash

Dron va masofadan zondlash tasvirlarida avtomobil, piyoda, velosiped yoki mototsikl kabi obyektlar ba’zan atigi bir necha piksel kattalikda ko‘rinadi. Tasvir xiraligi, zich transport, bir-birini to‘sadigan obyektlar va murakkab fonlar standart obyekt aniqlash tizimlarining bu kichik nishonlarni o‘tkazib yuborishiga yoki noto‘g‘ri joylashtirishiga sabab bo‘lishi mumkin. Ushbu tadqiqot YOLOv11n asosidagi yangi kichik obyekt aniqlash modeli — YOLO-EFD ni taklif qiladi.

YOLO-EFD ikkita maxsus moduldan iborat. Chekka Yo‘naltirilgan Ikki Yo‘lli Moslashtirish Moduli turli aniqlikdagi xususiyat xaritalarini Scharr chekka ma’lumoti va deformatsiyalanuvchi konvolyutsiya yordamida bir xil geometrik joyga moslashtirishga harakat qiladi. Chastota Sohasidagi Ikki Diqqat Moduli esa Diskret Kosinus O‘zgartirish orqali obyekt chekkalari va teksturalari bilan bog‘liq yuqori chastotali ma’lumotni kuchaytirib, past chastotali fon komponentlarini bostiradi.

Model VisDrone2019 va UAVDT ma’lumotlar to‘plamlarida sinovdan o‘tkazilgan. Asosiy taqqoslash jadvaliga ko‘ra VisDrone2019 da %38,2 mAP@0.5, %22,5 mAP@0.5:0.95, %46,6 precision va %39,3 recall olingan. UAVDT da esa %32,1 mAP@0.5, %18,9 mAP@0.5:0.95 va %30,5 recall bildirilgan. Model 3,4 million parametr va 12,5 GFLOP hisoblash yukiga ega.

Natijalar chekka asosidagi moslashtirish bilan chastota sohasidagi tafsilotlarni kuchaytirish kichik obyektlarni aniqlashda birgalikda foyda berishi mumkinligini ko‘rsatadi. Biroq tadqiqot peer-reviewdan o‘tmagan; haqiqiy dronda kechikish, soniyadagi kadrlar soni va energiya sarfi o‘lchanmagan. Bundan tashqari, asosiy natija jadvallaridagi ayrim sonli qiymatlar bir-biriga to‘liq mos kelmaydi.

Kichik obyektlarni aniqlash nega qiyin muammo?

Havodan olingan tasvirlarda obyekt kamera balandligi va ko‘rish burchagi sabab tasvirning juda kichik qismini egallashi mumkin. Avtomobil yoki piyoda atigi bir necha pikseldan iborat bo‘lsa, rang, tekstura, shakl va chegara ma’lumoti ancha zaiflashadi. Konvolyutsion neyron tarmoqlardagi ketma-ket downsampling amallari ham bu cheklangan ma’lumotni yanada yo‘qotishi mumkin.

Tadqiqotning birinchi shaklida ikki asosiy muammo tasvirlangan. Xira sahnada uzoq obyektlarning chekka va teksturalari atmosferik ta’sir, fokus yo‘qolishi yoki platforma harakati sabab xiralashadi. Zich sahnada esa ko‘plab transport vositalari bir-biriga yaqin joylashgan, ayrim obyektlar qisman to‘silgan va obyektlar orasidagi chegaralar noaniqlashgan.

Bunday sharoitlarda obyekt aniqlash modeli ikki alohida savolga to‘g‘ri javob berishi kerak:

  • Obyekt qayerda? Turli masshtabdagi xususiyat xaritalari geometrik jihatdan to‘g‘ri moslashtirilishi kerak.
  • Ko‘rilgan tafsilot haqiqatan obyektga tegishlimi? Obyekt chekkalarini fon teksturasi va tasvir shovqinidan ajratish kerak.

YOLO-EFD ning ikki moduli bu savollarni alohida, ammo bir-birini to‘ldiruvchi amallar bilan hal qiladi.

Standart YOLO xususiyat birlashtirishidagi muammo

YOLO oilasidagi obyekt aniqlash tarmoqlari sayoz qatlamlardan keladigan yuqori aniqlikdagi joylashuv ma’lumoti bilan chuqur qatlamlardan keladigan semantik ma’lumotni birlashtiradi. An’anaviy yondashuvda chuqur xususiyat xaritasi kattalashtiriladi va sayoz xususiyat xaritasi bilan bevosita birlashtiriladi.

Biroq downsampling va qayta kattalashtirish amallaridan o‘tgan chuqur xususiyatlar sayoz qatlamdagi piksellar bilan aynan bir geometrik joyni ifodalamasligi mumkin. Katta obyektlarda bir necha piksellik siljishga chidash mumkin bo‘lsa-da, atigi 10–20 piksel kattalikdagi nishonda shu siljish obyekt qutisining muhim qismini ta’sirlantirishi mumkin.

Shu sabab tadqiqot kichik obyekt aniqlash boshiga olib boradigan xususiyat yo‘lidagi standart kattalashtirish va birlashtirish amalini chekka ma’lumoti bilan boshqariladigan dinamik moslashtirish moduli bilan almashtirgan.

YOLO-EFD ning umumiy arxitekturasi

Model YOLOv11n ning backbone–neck–detection head tuzilishini saqlab qoladi. Maxsus modullar asosan tarmoqning ko‘p masshtabli xususiyatlar birlashtiriladigan neck qismiga joylashtirilgan.

  • Backbone: Kirish tasviridan turli aniqliklarda xususiyat xaritalarini hosil qiladi.
  • EGA moduli: Sayoz va chuqur xususiyatlarni chekka ma’lumoti yordamida geometrik jihatdan moslashtiradi.
  • FDAM moduli: Moslashtirilgan xususiyatlardagi yuqori chastotali chekka va tekstura ma’lumotini kuchaytiradi.
  • Aniqlash boshlari: Obyekt sinflari va chegaralovchi qutilarni bashorat qiladi.

Maxsus modullarni faqat kichik obyekt boshiga olib boradigan xususiyat yo‘liga joylashtirish butun tarmoqni og‘irlashtirmasdan kichik nishonlarga oid ifodalash kuchini oshirishni maqsad qiladi.

Chekka Yo‘naltirilgan Ikki Yo‘lli Moslashtirish Moduli

Scharr operatori bilan chekka ajratish

EGA deb ataladigan modul avval sayoz va yuqori aniqlikdagi xususiyat xaritasidagi gorizontal va vertikal intensivlik o‘zgarishlarini Scharr filtrlari bilan hisoblaydi:

\[ E_x=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},x}) \]

\[ E_y=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},y}) \]

  • Pi: Sayoz qatlamdan keladigan yuqori aniqlikdagi xususiyat xaritasi.
  • KScharr,x: Gorizontal yo‘nalishdagi intensivlik o‘zgarishini hisoblaydigan Scharr yadrosi.
  • KScharr,y: Vertikal yo‘nalishdagi intensivlik o‘zgarishini hisoblaydigan Scharr yadrosi.
  • Ex va Ey: Gorizontal va vertikal gradient javoblari.

Ikki yo‘nalishdagi gradientlar keyin bitta chekka kattaligi xaritasida birlashtiriladi:

\[ E=\sqrt{E_x^2+E_y^2+\varepsilon} \]

Bu yerdagi ε kvadrat ildiz hisobining sonli barqarorligini ta’minlaydigan kichik doimiydir. Hosil bo‘lgan E xaritasi kichik obyektlarning tashqi chegaralari joylashishi mumkin bo‘lgan hududlarni ifodalovchi geometrik oldindan ma’lumotdir.

Semantik va geometrik ma’lumotdan birgalikda foydalanish

Faqat chekka xaritasidan foydalanish yetarli emas. Yo‘l chiziqlari, bino chegaralari va soyalar ham kuchli chekkalar hosil qilishi mumkin. Shu sabab tadqiqot chuqur qatlamdagi semantik xususiyatlar bilan chekka xaritasini birgalikda ishlatadi.

Chuqur xususiyat xaritasi sayoz xarita aniqligiga kattalashtirilgach, chekka xaritasi bilan kanal yo‘nalishida birlashtiriladi. Deformatsiyalanuvchi konvolyutsiyada ishlatiladigan joylashuv siljishlari quyidagi amal bilan baholanadi:

\[ \Delta=\operatorname{Conv}_{\mathrm{offset}}\left(\operatorname{Concat}(P'_{i+1},E)\right) \]

  • P′i+1: Chuqur qatlamdan keladigan va sayoz xarita o‘lchamiga kattalashtirilgan semantik xususiyat.
  • E: Sayoz qatlamdan ajratilgan chekka xaritasi.
  • Δ: Deformatsiyalanuvchi konvolyutsiya qaysi nuqtalardan namuna olishini belgilovchi joylashuv siljish maydoni.

Chuqur xususiyatlar modelga qaysi tuzilma avtomobil, piyoda yoki boshqa obyekt bo‘lishi mumkinligini tushunishga; chekka xaritasi esa obyekt chegarasi qayerda joylashganini baholashga yordam beradi.

Deformatsiyalanuvchi ikki yo‘lli moslashtirish

Baholangan bir xil siljish maydoni ham sayoz, ham chuqur xususiyatlarga qo‘llanadi:

\[ P_i^{\mathrm{aligned}}=\mathcal{D}(P_i,\Delta) \]

\[ {P'}_{i+1}^{\mathrm{aligned}}=\mathcal{D}(P'_{i+1},\Delta) \]

𝒟 deformatsiyalanuvchi konvolyutsiya amalini ifodalaydi. Standart konvolyutsiya sobit namunalash panjarasidan foydalansa, deformatsiyalanuvchi konvolyutsiya baholangan siljishlarga qarab turli joylardan ma’lumot to‘plashi mumkin.

Moslashtirilgan ikki xususiyat xaritasi birlashtirilib 1 × 1 konvolyutsiyadan o‘tkaziladi:

\[ F_{\mathrm{out}}=\operatorname{Conv}_{1\times1}\left(\operatorname{Concat}(P_i^{\mathrm{aligned}},{P'}_{i+1}^{\mathrm{aligned}})\right) \]

Shu tariqa kichik obyekt boshiga yuborilgan xususiyatlar ham batafsil joylashuv ma’lumotini, ham chuqur semantik ma’lumotni tashishi maqsad qilingan.

Chastota Sohasidagi Ikki Diqqat Moduli

Nega chastota sohasi ishlatilgan?

Tasvirning katta va sekin o‘zgaradigan hududlari past chastotali komponentlarda; keskin chekkalar, nozik teksturalar va to‘satdan yorqinlik o‘zgarishlari esa yuqori chastotali komponentlarda ifodalanadi. Kichik obyektlarni farqlash uchun zarur bo‘lgan chegara va tekstura ma’lumotlari asosan yuqori chastota tomonida joylashadi.

Konvolyutsion tarmoqlardagi downsampling amallari yuqori chastotali tafsilotlarni yumshatishi mumkin. FDAM moduli bu tafsilotlarni to‘g‘ridan-to‘g‘ri chastota sohasida ajratish va kuchaytirishni maqsad qiladi.

Diskret Kosinus O‘zgartirish

Fazoviy xususiyat xaritasi ikki o‘lchamli Diskret Kosinus O‘zgartirish bilan chastota sohasiga o‘tkaziladi:

\[ F(u,v)=\mathcal{T}_{\mathrm{DCT}}\left(f(x,y)\right) \]

  • f(x,y): Fazoviy sohadagi kirish xususiyat xaritasi.
  • F(u,v): DCT dan keyin olingan chastota komponentlari.
  • u va v: Chastota tekisligidagi gorizontal va vertikal koordinatalar.

DCT spektrining yuqori chap sohasi past chastotali, past o‘ng hududlarga qarab boruvchi komponentlar esa yuqoriroq chastotali ma’lumotni ifodalaydi.

Yuqori o‘tkazuvchi chastota niqobi

Tadqiqotda α parametri bilan boshqariladigan niqob yordamida past chastotali sohaning bir qismi bostiriladi:

\[ F_{\mathrm{filtered}}(u,v)=F(u,v)\odot M(u,v;\alpha) \]

M(u,v;α) chastota niqobini, ⊙ esa elementma-element ko‘paytirishni ifodalaydi. Filtrlangan spektr teskari DCT bilan yana fazoviy sohaga qaytarilib, chekka va nozik tafsilotlarni ajratib ko‘rsatuvchi diqqat xaritasi hosil qilinadi.

α qiymati juda kichik bo‘lsa, fon yetarlicha bostirilmasligi mumkin. Juda katta bo‘lsa, obyektga tegishli foydali past va o‘rta chastotali ma’lumot ham yo‘qolishi mumkin. Tajribalarda eng yaxshi qiymat α = 0,25 deb topilgan.

Ikkinchi tartibli kanal diqqati

FDAM ning ikkinchi yo‘li har bir xususiyat kanalining faqat o‘rtachasini emas, dispersiyasini ham hisoblaydi:

\[ \mu_c=\mathbb{E}[x_c] \]

\[ \sigma_c^2=\mathbb{E}\left[(x_c-\mu_c)^2\right] \]

  • μc: c kanalidagi o‘rtacha aktivatsiya.
  • σc2: Aktivatsiyalarning fazoviy dispersiyasi.
  • xc: Tegishli kanaldagi xususiyat qiymatlari.

Kichik obyekt chegarasi atrofida aktivatsiyalar tez o‘zgarishi mumkinligi sabab obyekt tafsilotini tashuvchi kanallarda dispersiya yuqori bo‘lishi kutiladi. Tekis va bir xil fon hududlari ustun bo‘lgan kanallarda esa dispersiya pastroq bo‘lishi mumkin.

O‘rtacha va dispersiya qiymatlari birlashtirilib, 1 × 1 konvolyutsiya va sigmoid aktivatsiyasi orqali kanal og‘irliklari hosil qilinadi. Chastota yo‘lidan keladigan fazoviy diqqat bilan kanal yo‘lidan keladigan og‘irliklar birlashtirilib, tafsilot tashuvchi hududlar va kanallar kuchaytiriladi.

Ikki modul qanday birgalikda ishlaydi?

EGA moduli avval sayoz va chuqur xususiyatlarning geometrik joylashuvlarini tuzatadi. FDAM keyin shu moslashtirilgan xususiyatlardagi chekka va yuqori chastotali tafsilotlarni kuchaytiradi.

  1. Sayoz qatlamdan chekka ma’lumoti ajratiladi.
  2. Chekka va chuqur semantik xususiyatlardan joylashuv siljishlari baholanadi.
  3. Sayoz va chuqur xususiyatlar deformatsiyalanuvchi konvolyutsiya bilan moslashtiriladi.
  4. Moslashtirilgan xususiyatlar DCT bilan chastota komponentlariga ajratiladi.
  5. Past chastotali fonning bir qismi bostiriladi.
  6. O‘rtacha va dispersiyaga asoslangan kanal diqqati qo‘llanadi.
  7. Kuchaytirilgan xususiyatlar kichik obyekt aniqlash boshiga uzatiladi.

Ishlatilgan ma’lumotlar to‘plamlari

VisDrone2019

VisDrone2019 turli shaharlar, balandliklar, kamera burchaklari, yorug‘lik va ob-havo sharoitlarida olingan dron tasvirlaridan iborat. Tadqiqotda obyekt aniqlash quyi to‘plami ishlatilgan. Bu bo‘lim taxminan 10.209 ta tasvir va 540.000 dan ortiq chegaralovchi qutini o‘z ichiga oladi.

Baholangan o‘n sinf quyidagilar:

  • Piyoda
  • Inson
  • Velosiped
  • Avtomobil
  • Van
  • Yuk mashinasi
  • Uch g‘ildirakli transport vositasi
  • Tentli uch g‘ildirakli transport vositasi
  • Avtobus
  • Mototsikl

UAVDT

UAVDT ma’lumotlar to‘plami taxminan o‘n soatlik havo videosidan tanlangan 100 ta video ketma-ketligi va taxminan 80.000 ta kadrni o‘z ichiga oladi. Tasvirlar avtomagistral, chorraha, avtoturargoh va pullik o‘tish stansiyasi kabi transport muhitlarini qamrab oladi. Asosiy aniqlash sinflari avtomobil, yuk mashinasi va avtobusdir.

VisDrone turli obyekt sinflari va masshtablari jihatidan keng sinov muhiti taqdim etsa, UAVDT harakat xiraligi, zich transport va transport vositalarining bir-birini to‘sishi kabi dinamik shahar sharoitlariga e’tibor qaratadi.

O‘qitish muhiti va giperparametrlar

O‘zgaruvchiIshlatilgan qiymat
Grafik protsessorNVIDIA GeForce RTX 4090
Chuqur o‘rganish ramkasiPyTorch 2.4.1
Muhit boshqaruviAnaconda3
Kirish aniqligi640 × 640 piksel
O‘qitish davomiyligi300 epoch
Batch o‘lchami16
Boshlang‘ich o‘rganish tezligi0,01
Momentum0,937
Og‘irlik kamayishi0,0005
Optimallashtirish algoritmiStoxastik Gradient Tushishi

Matnda barcha modellar bir xil ma’lumotlarni ko‘paytirish amallari, tasodifiylik urug‘i va o‘qitish takrorlari bilan taqqoslanganmi-yo‘qmi, bu batafsil tushuntirilmagan. Model kodi, o‘qitilgan og‘irliklar va to‘liq konfiguratsiya fayllari uchun ham ochiq repozitoriy havolasi berilmagan.

Baholash mezonlari

Precision model tomonidan obyekt deb belgilangan namunalar orasida qanchasi to‘g‘ri ekanini o‘lchaydi:

\[ \operatorname{Precision}=\frac{TP}{TP+FP}\times100 \]

Recall tasvirlarda haqiqatan mavjud obyektlarning qanchasi topilganini ko‘rsatadi:

\[ \operatorname{Recall}=\frac{TP}{TP+FN}\times100 \]

  • TP: To‘g‘ri aniqlangan obyektlar.
  • FP: Aslida mavjud bo‘lmasa-da aniqlangan obyektlar.
  • FN: Model o‘tkazib yuborgan haqiqiy obyektlar.

Bir sinf uchun o‘rtacha aniqlik precision–recall egri chizig‘i ostidagi maydon sifatida ta’riflangan:

\[ AP=\int_0^1 P(R)\,dR \]

Bir nechta sinfdagi AP qiymatlarining o‘rtachasi:

\[ mAP=\frac{1}{K}\sum_{i=1}^{K}AP_i\times100 \]

mAP@0.5 bashorat qutisi bilan haqiqiy quti o‘rtasidagi kesishma-birlashma nisbati kamida 0,5 bo‘lganda hisoblanadi. mAP@0.5:0.95 esa 0,5 bilan 0,95 orasidagi o‘n xil chegarada o‘rtacha olgani uchun joylashtirish aniqligini qat’iyroq o‘lchaydi.

VisDrone2019 natijalari

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametrGFLOP
YOLOv5n%32,9%40,5%33,1%18,62,5 million7,2
YOLOv8n%33,9%41,3%34,7%19,23,2 million8,7
YOLOv10n%34,0%42,8%33,7%19,92,3 million6,5
YOLOv11n%33,9%42,1%34,9%19,82,6 million6,6
YOLOv7-Tiny%36,8%42,8%40,1%20,86,1 million13,3
EdgeYolo-t%38,5%48,9%37,8%22,45,5 million27,2
YOLO-EFD%38,2%46,6%39,3%22,53,4 million12,5

Asosiy taqqoslash jadvaliga ko‘ra YOLO-EFD YOLOv11n bilan taqqoslaganda mAP@0.5 qiymatini %33,9 dan %38,2 gacha, recall qiymatini %34,9 dan %39,3 gacha va qat’iyroq mAP qiymatini %19,8 dan %22,5 gacha oshirgan.

Model barcha taqqoslash mezonlarida yakka holda eng yuqori natijani bermaydi. EdgeYolo-t modeli mAP@0.5 va precision bo‘yicha biroz yuqoriroq natija bergan. YOLO-EFD ning asosiy ustunligi EdgeYolo-t ning 27,2 GFLOP hisoblash yukiga qarshi 12,5 GFLOP bilan o‘xshash aniqlik darajasiga yaqinlashishidir.

YOLO-EFD ning hisoblash yuki baribir asosiy YOLOv11n ga qaraganda sezilarli oshgan: parametrlar soni 2,6 milliondan 3,4 millionga, GFLOP qiymati 6,6 dan 12,5 gacha ko‘tarilgan. Demak, aniqlik oshishi evaziga asosiy modelga nisbatan qariyb ikki baravar hisoblash yuki yuzaga kelgan.

UAVDT natijalari

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametrGFLOP
YOLOv11n%31,3%37,8%27,5%18,32,6 million6,6
YOLOv7-Tiny%31,7%38,3%28,4%18,36,1 million13,3
EdgeYolo-t%32,3%40,1%29,6%18,75,5 million27,2
YOLO-EFD%32,1%39,3%30,5%18,93,4 million12,5

UAVDT da YOLO-EFD taqqoslangan modellar orasida eng yuqori recall qiymatini bergan. YOLOv11n ga nisbatan recall %27,5 dan %30,5 gacha oshgan. Bu o‘sish model zich va xira transport tasvirlarida kamroq obyektni o‘tkazib yuborishini ko‘rsatuvchi dalil beradi.

EdgeYolo-t mAP@0.5 va precision bo‘yicha kichik ustunlikka ega bo‘lsa, YOLO-EFD yuqoriroq recall va mAP@0.5:0.95 bergan. Shu sabab natijalar bitta modelning barcha mezonlarda ustunligidan ko‘ra, aniqlik va hisoblash xarajati o‘rtasida turli muvozanatlar borligini ko‘rsatadi.

Modul ablyatsiya tajribalari

KonfiguratsiyamAP@0.5:0.95mAP@0.5PrecisionRecall
YOLOv11n asosiy modeli%19,8%33,9%44,1%34,9
Faqat EGA%21,5%36,7%45,8%37,2
Faqat FDAM%20,8%35,2%45,2%35,8
EGA va FDAM%22,2%38,2%46,6%39,3

EGA moduli yolg‘iz o‘zi mAP@0.5 qiymatida 2,8 punkt, recall qiymatida 2,3 punkt oshish bergan. FDAM yolg‘iz o‘zi kichikroq, ammo barcha mezonlarda ijobiy o‘zgarish hosil qilgan. Ikki modul birgalikda ishlatilganda eng yuqori natijalarga erishilgan.

Bu topilma geometrik moslashtirish va chastota tafsilotini kuchaytirish ayni muammoning ikki alohida tarkibiga aralashishini qo‘llab-quvvatlaydi. Biroq ablyatsiya tajribalari bitta tasodifiylik urug‘imi yoki bir nechta o‘qitish takrorlarining o‘rtachasimi, bu ko‘rsatilmagan.

Chastota filtri parametri

αmAP@0.5:0.95mAP@0.5
0,00%21,5%37,8
0,25%22,2%38,2
0,50%21,8%37,5
0,75%21,6%37,4
1,00%21,3%37,2

Eng yaxshi natija α = 0,25 qiymatida olingan. Kuchliroq filtrlash qo‘llanganda unumdorlikning bosqichma-bosqich pasayishi barcha past chastotali ma’lumot keraksiz emasligini ko‘rsatadi. Obyektning umumiy shakli va konteksti ham pastroq chastota komponentlarida bo‘lishi mumkin.

Chalkashlik matritsalari nimani ko‘rsatgan?

VisDrone2019 chalkashlik matritsalarida kichik obyekt sinflarining fon bilan chalkashish nisbatlari kamaygani bildirilgan:

  • Piyoda sinfi uchun fon chalkashishi 0,72 dan 0,59 gacha tushgan.
  • Mototsikl sinfida 0,52 dan 0,49 gacha tushgan.
  • Velosiped sinfida 0,85 dan 0,78 gacha tushgan.
  • Avtomobil sinfining matritsa diagonal qiymati 0,70 dan 0,76 gacha oshgan.

Sinf bo‘yicha vizual taqqoslashda piyoda qiymati %25 dan %38 gacha, mototsikl %26 dan %37 gacha, velosiped %16 dan %29 gacha, avtobus %37 dan %45 gacha va yuk mashinasi %28 dan %36 gacha oshgan. Bu qiymatlar sinf bo‘yicha AP natijalaridan ko‘ra tadqiqotning chalkashlik matritsasi va kategoriya taqqoslashida ishlatgan klassifikatsiya nisbatlaridir.

Grad-CAM va namunaviy tasvirlar

Grad-CAM tasvirlarida YOLOv11n asosiy modeli ayrim sahnalarda diqqatini yo‘l, bino yoki fonning turli hududlariga tarqatgani; YOLO-EFD esa aktivatsiyalarini transport vositalari va piyodalar atrofida zichroq jamlagani ko‘rsatilgan.

Xira namunaviy sahnada asosiy model uchta transport vositasini, YOLO-EFD esa sakkizta transport vositasini aniqlagani bildirilgan. Zich transport namunasida YOLO-EFD qutilari bir-biriga yaqin transport vositalari chegaralariga mahkamroq mos tushgani ko‘rinadi.

Bu tasvirlar model xatti-harakatini tushuntirishga yordam bersa-da, tanlangan bir necha namunadan iborat. Alohida tasvirlar butun ma’lumotlar to‘plamidagi unumdorlik yoki real parvoz sharoitlaridagi ishonchlilikning o‘z-o‘zicha dalili emas.

Tadqiqotning kuchli tomonlari

  • Faqat konseptual taklif emas, ishlatilgan obyekt aniqlash modeli taqdim etilgan.
  • Model ikki xil va keng ishlatiladigan UAV ma’lumotlar to‘plamida baholangan.
  • EGA va FDAM modullarining alohida ta’siri ablyatsiya tajribasi bilan o‘rganilgan.
  • Chastota filtrining α parametri uchun nazoratli taqqoslash o‘tkazilgan.
  • Parametrlar soni va GFLOP ma’lumotlari aniqlik mezonlari bilan birga hisobot qilingan.
  • Chalkashlik matritsasi, Grad-CAM va aniqlash tasvirlari orqali miqdoriy natijalarga vizual izohlar qo‘shilgan.
  • Model muvaffaqiyatsiz bo‘lishi mumkin bo‘lgan sodda fon va haddan tashqari kichik nishon sharoitlari natijalar bo‘limida ochiq ko‘rsatilgan.

Ichki nomuvofiqliklar va texnik cheklovlar

  • Annotatsiya, asosiy topilmalar va ablyatsiya jadvali VisDrone2019 uchun %22,2 mAP@0.5:0.95 bildirsa, asosiy taqqoslash jadvali %22,5 beradi.
  • YOLOv11n precision qiymati asosiy taqqoslash jadvalida %42,1, ablyatsiya jadvalida %44,1 deb yozilgan.
  • Bu farqlar alohida o‘qitish takrorlaridan, turli validatsiya quyi to‘plamlaridan yoki yozuv xatosidan kelib chiqqanmi, tushuntirilmagan.
  • FDAM arxitekturasini ko‘rsatuvchi 4-shakl sarlavhasi noto‘g‘ri tarzda EGA arxitekturasi deb yozilgan. Matndagi ayrim shakl raqami yo‘naltirishlari ham haqiqiy tasvirlarga mos kelmaydi.
  • Natijalar uchun standart og‘ish, ishonch oralig‘i, statistik ahamiyat yoki bir nechta tasodifiylik urug‘i hisobot qilinmagan.
  • Taqqoslangan barcha modellar bir xil kod bazasi, ma’lumotlarni ko‘paytirish sozlamalari va o‘qitish sharoitlari ostida qayta o‘qitilganmi, bu yetarlicha tushuntirilmagan.
  • Real vaqtda foydalanish da’vosiga qaramay, FPS, har bir tasvir uchun kechikish, xotira ishlatilishi va quvvat sarfi o‘lchanmagan.
  • Tajribalar RTX 4090 da bajarilgan; dronda ishlatilishi mumkin bo‘lgan o‘rnatilgan protsessor, Jetson platformasi yoki boshqa edge qurilmada sinov o‘tkazilmagan.
  • Asosiy YOLOv11n ga nisbatan GFLOP qiymati 6,6 dan 12,5 gacha ko‘tarilgani sabab hisoblash xarajati sezilarli oshgan.
  • Model kodi, o‘qitilgan og‘irliklar, ma’lumotlarni bo‘lish fayllari va to‘liq giperparametr konfiguratsiyasi uchun ochiq havola berilmagan.
  • UAVDT da ob-havo, balandlik, kamera burchagi va zichlik kabi atributlar bo‘lsa-da, natijalar bu sharoitlar bo‘yicha alohida hisobot qilinmagan.
  • Tadqiqot sodda fonlarda va haddan tashqari kichik siyrak nishonlarda yuqori chastotali shovqinga ortiqcha e’tibor berib, noto‘g‘ri aniqlashlar hosil qilishi mumkinligini tan oladi.

Tadqiqot nimani qo‘llab-quvvatlaydi?

Natijalar turli aniqlikdagi xususiyatlarni chekka boshqaruvli deformatsiyalanuvchi konvolyutsiya bilan moslashtirish YOLOv11n ning kichik obyekt unumdorligini oshirishi mumkinligini qo‘llab-quvvatlaydi. DCT asosidagi yuqori chastota kuchaytirilishi ham ayniqsa chekkalari zaif yoki xira kichik nishonlarda qo‘shimcha hissa berishi mumkinligi bo‘yicha tajribaviy dalil taqdim etilgan.

Ikki modulni birgalikda ishlatish o‘rganilgan ma’lumotlar to‘plamlarida ularni alohida ishlatishga qaraganda yuqoriroq natija bergan. Model, shuningdek, EdgeYolo-t kabi og‘irroq usul bilan o‘xshash aniqlik oralig‘iga pastroq parametr va GFLOP qiymati bilan yaqinlashgan.

Tadqiqot nimani isbotlamaydi?

Tadqiqot YOLO-EFD barcha UAV vazifalarida yoki barcha kichik obyekt ma’lumotlar to‘plamlarida eng yaxshi model ekanini isbotlamaydi. Ayrim taqqoslash modellari ma’lum mezonlarda yuqoriroq natija bergan. Tajribalar faqat ikki ommaviy ma’lumotlar to‘plami va hisobot qilingan bitta o‘qitish tartibi bilan cheklangan.

Model haqiqiy dronda real vaqtda ishlashi, kam energiya iste’mol qilishi yoki yomon ob-havo, tun, tuman, vibratsiya va turli kamera tizimlarida ayni unumdorlikni saqlashi ko‘rsatilmagan. GFLOP va parametrlar soni real qurilma kechikishining to‘g‘ridan-to‘g‘ri ekvivalenti emas.

Natijalar, shuningdek, model qidiruv-qutqaruv, xavfsizlik yoki transport boshqaruvi kabi kritik sohalarda yakka holda ishonchli qaror bera olishini ko‘rsatmaydi. Bunday qo‘llanmalar uchun noto‘g‘ri negativlar, noto‘g‘ri pozitivlar va turli atrof-muhit sharoitlari alohida tasdiqlanishi kerak.

Turkiya nuqtai nazaridan mumkin bo‘lgan ahamiyati

Tadqiqotda taklif etilgan yondashuv Turkiyada dron asosidagi transport monitoringi, falokatdan keyingi hududni ko‘zdan kechirish, o‘rmon yong‘inlarini kuzatish, qishloq xo‘jaligi tasvirlash, qirg‘oq nazorati va infratuzilma tekshiruvi kabi sohalarga metodologik jihatdan ko‘chirilishi mumkin. Ayniqsa balanddan olingan tasvirlarda kichik transport vositalari yoki odamlarni farqlash bu qo‘llanmalarning umumiy texnik muammolaridan biridir.

Turkiyada qo‘llanadigan tizim uchun modelni mahalliy shahar tuzilishi, turli yo‘l belgilari, transport vositalari turlari, o‘simlik qoplami, topografiya, ob-havo sharoitlari va ishlatiladigan dron kameralari bilan qayta o‘qitish kerak. VisDrone va UAVDT natijalari Turkiyadagi operatsion aniqlikni bevosita ifodalamaydi.

Amaliy foydalanishdan oldin Turkiyaga oid tasvirlarda domendan tashqari sinovlar, tun va yomon ob-havo sinovlari, o‘rnatilgan apparat kechikish o‘lchovlari, energiya sarfi, ishonch oraliqlari va xato tasnifi bajarilishi kerak.

Tadqiqot usuli va natijalari

Usul komponentiQo‘llashAsosiy topilmaTalqin chegarasi
Asosiy modelYOLOv11nKichik obyekt yo‘li EGA va FDAM bilan almashtirilganBoshqa YOLO masshtablari sinovdan o‘tkazilmagan
EGA chekka ajratish3 × 3 Scharr filtrlariGorizontal va vertikal gradientlardan chekka xaritasi hosil qilinganKuchli fon chekkalari ham javob hosil qilishi mumkin
EGA moslashtirishChekka va semantik xususiyatlar bilan joylashuv siljishi; deformatsiyalanuvchi konvolyutsiyaSayoz va chuqur xususiyatlarning geometrik mosligi oshirilganJoylashuv siljishlarining alohida aniqlik tahlili berilmagan
FDAM chastota yo‘liDCT, yuqori o‘tkazuvchi niqob va teskari DCTYuqori chastotali chekka va tekstura tafsilotlari kuchaytirilganHaddan tashqari filtrlash foydali ma’lumotni kamaytirishi mumkin
FDAM kanal yo‘liKanal o‘rtachasi va dispersiyasiTafsilotga boy kanallarga yuqoriroq og‘irlik berilganMuqobil diqqat usullari bilan batafsil taqqoslash yo‘q
VisDrone2019Taxminan 10.209 ta tasvir, 540.000 dan ortiq quti va 10 sinf%38,2 mAP@0.5 va %39,3 recallmAP@0.5:0.95 natijasi matnda %22,2 va %22,5 sifatida ikki xil qiymatda berilgan
UAVDT100 ta video ketma-ketligi va taxminan 80.000 ta kadr%32,1 mAP@0.5 va %30,5 recallVideo kuzatuvi yoki vaqtli modellashtirish bajarilmagan
AblyatsiyaEGA, FDAM va birlashtirilgan model alohida sinovdan o‘tkazilganBirlashtirilgan tuzilma eng yuqori natijalarni berganKo‘p martalik o‘qitish takrorlari va standart og‘ish yo‘q
α parametri0,00–1,00 oralig‘ida besh qiymatEng yaxshi qiymat 0,25 bo‘lganFaqat VisDrone validatsiya to‘plamida hisobot qilingan
Hisoblash xarajati3,4 million parametr va 12,5 GFLOPEdgeYolo-t ga qaraganda pastroq hisoblash xarajatiReal qurilmada FPS va energiya o‘lchovi yo‘q

Eng muhim sonli natijalar

  • VisDrone2019 asosiy jadvalida YOLO-EFD uchun mAP@0.5 %38,2 deb berilgan.
  • VisDrone2019 recall qiymati %39,3, precision qiymati %46,6.
  • VisDrone2019 mAP@0.5:0.95 qiymati asosiy jadvalda %22,5; annotatsiya va ablyatsiya jadvalida %22,2.
  • UAVDT da mAP@0.5 %32,1, mAP@0.5:0.95 %18,9, precision %39,3 va recall %30,5.
  • EGA moduli yolg‘iz o‘zi asosiy modelga nisbatan mAP@0.5 qiymatini 2,8 punkt oshirgan.
  • FDAM moduli yolg‘iz o‘zi mAP@0.5 qiymatini 1,3 punkt oshirgan.
  • Ikki modul birgalikda mAP@0.5 qiymatini %33,9 dan %38,2 gacha oshirgan.
  • Eng maqbul chastota niqobi parametri α = 0,25 deb topilgan.
  • Model 3,4 million parametr va 12,5 GFLOP hisoblash yukiga ega.
  • EdgeYolo-t 27,2 GFLOP bilan %38,5 mAP@0.5 hosil qilgan bo‘lsa, YOLO-EFD 12,5 GFLOP bilan %38,2 hosil qilgan.

Operatsion foydalanishdan oldin bajarilishi kerak bo‘lgan ishlar

  1. Model kodi, og‘irliklari va ma’lumotlarni bo‘lish fayllarini e’lon qilib natijalarni qayta ishlab chiqarish.
  2. Kamida uchdan beshgacha turli tasodifiylik urug‘i bilan o‘rtacha va standart og‘ishlarni hisobot qilish.
  3. Turkiyada olingan dron tasvirlarida tashqi validatsiya o‘tkazish.
  4. Tun, tuman, yomg‘ir, vibratsiya, turli balandlik va turli kamera aniqliklarini alohida sinash.
  5. Jetson yoki shunga o‘xshash edge qurilmalarda FPS, kechikish, xotira va quvvat sarfini o‘lchash.
  6. Noto‘g‘ri pozitiv va noto‘g‘ri negativlarning qo‘llanma turiga ko‘ra xarajat tahlilini bajarish.
  7. Sodda fonlarda yuqori chastotali shovqinga ortiqcha e’tiborni kamaytiradigan adaptiv filtrlarni ishlab chiqish.
  8. Video obyekt aniqlash va ko‘p obyekt kuzatuvi uchun vaqtli izchillikni modelga qo‘shish.

Manba va usul bo‘yicha izoh

Tadqiqotning asl nomi: YOLO-EFD: Edge-guided and Frequency-domain Dual Enhancement for Small Object Detection in UAV Aerial Imagery

Mualliflar va to‘g‘ri tartib: Xin Song, Peng Li, Xuecong Liu, Xin Zhao.

Teng birinchi muallif: Tadqiqotda teng birinchi mualliflik yoki teng hissa bayonoti mavjud emas.

Mas’ul/aloqa muallifi: Xin Song.

Institutsional aloqalar:

  • School of Computer Science and Engineering, Northeastern University, Shenyang, Liaoning, Xitoy.
  • Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern University at Qinhuangdao, Qinhuangdao, Hebei, Xitoy.
  • Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment, Chaoyue Technology Co., Ltd., Jinan, Shandong, Xitoy.

DOI:10.2139/ssrn.7031768

Rasmiy tadqiqot sahifasi:SSRN rasmiy yozuvi

Nashr platformasi: SSRN.

Yuklangan sana: 1 iyul 2026.

Jurnal: Peer-reviewli jurnal nashri yoki muayyan jurnal nomi tasdiqlanmagan. Sahifa pastki qismida “Preprint submitted to Elsevier” iborasi bor, biroq maqsad jurnal ko‘rsatilmagan.

Peer-review holati: Tadqiqot peer-reviewdan o‘tmagan preprintdir.

Manba turi: Yangi chuqur o‘rganish arxitekturasi, ikki ommaviy ma’lumotlar to‘plamida qiyosiy tajribalar, modul ablyatsiya sinovlari va parametr tahlilini o‘z ichiga olgan hisoblash kompyuter ko‘rishi tadqiqoti.

Moliyalashtirish: Tadqiqot Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment Ochiq Tadqiqot Loyiha Fondi tomonidan KT25500300-lab raqami bilan qo‘llab-quvvatlangan.

Generativ sun’iy intellektdan foydalanish: Mualliflar DeepSeek dan tilni tuzatish va paragrafni tartibga solish maqsadida foydalanganini; yakuniy mazmunni ko‘rib chiqib mas’uliyatni o‘z zimmasiga olganini bildirgan.

Manfaatlar to‘qnashuvi: Yuklangan versiyada ochiq manfaatlar to‘qnashuvi bayonoti mavjud emas.

Ma’lumot va kodga kirish: VisDrone2019 va UAVDT ommaviy ma’lumotlar to‘plamlaridir. Biroq YOLO-EFD kodi, o‘qitilgan og‘irliklari, tasodifiylik urug‘lari va to‘liq tajriba konfiguratsiyasi uchun havola berilmagan.

Bibliografik ogohlantirish: Ayni sarlavha va ayni mualliflar bilan SSRN da 10.2139/ssrn.6878454 DOI li eskiroq yozuv ham mavjud. Yuklangan versiyaning barcha sahifalarida 7031768 yozuv raqami bo‘lgani sabab ushbu maqolada 10.2139/ssrn.7031768 DOI asos qilib olingan.

Ushbu turkcha izoh yuklangan tadqiqotning matni, tenglamalari, jadvallari, tarmoq sxemalari, issiqlik xaritalari, chalkashlik matritsalari va tajriba tasvirlariga asoslanib tayyorlangan. Ilmiy natijalar uchun tashqi manba qo‘shilmagan; tashqi tekshiruv faqat sarlavha, mualliflar, DOI, SSRN yozuv sanasi va mas’ul muallif kabi bibliografik identifikatsiya ma’lumotlarini tasdiqlash bilan cheklangan.

Tadqiqotning eng muhim hisobot muammosi VisDrone2019 mAP@0.5:0.95 va asosiy model precision qiymatlarining turli bo‘limlarda mos kelmasligidir. Shu sabab natijalar uzatilganda asosiy taqqoslash jadvalidagi %22,5 bilan annotatsiya va ablyatsiya jadvalidagi %22,2 qiymatlari birgalikda ko‘rsatilishi kerak.

Tadqiqot haqiqiy dron apparatida dala validatsiyasi, kechikish o‘lchovi yoki energiya sarfi tajribasini taqdim etmaydi. Shu sabab “real vaqtli va edge qurilmalarga mos” bahosi parametr va GFLOP natijalariga asoslangan salohiyat sifatida o‘qilishi, tasdiqlangan operatsion unumdorlik sifatida taqdim etilmasligi kerak.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati