Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Инженерия / YOLO-EFD: Дрон Сүрөттөрүндөгү Майда Объекттерди Чет жана Жыштык Маалыматы менен Жакшыраак Табуу
Инженерия

YOLO-EFD: Дрон Сүрөттөрүндөгү Майда Объекттерди Чет жана Жыштык Маалыматы менен Жакшыраак Табуу

Дрон жана аралыктан зонддоо сүрөттөрүндө автомобиль, жөө адам, велосипед же мотоцикл сыяктуу объекттер кээде болгону бир нече пиксел өлчөмүндө көрүнөт.

30/07/2026  Veri Anla 26 көрүү
YOLO-EFD: Дрон Сүрөттөрүндөгү Майда Объекттерди Чет жана Жыштык Маалыматы менен Жакшыраак Табуу

Дрон жана аралыктан зонддоо сүрөттөрүндө otomobil, yaya, bisiklet же motosiklet gibi объекттер bazen yalnızca birkaç пиксел büyüklüğünde görünür. Görüntü bulanıklığı, тыгыз трафик, örtüşen объекттер жана karmaşık фонlar, standart объект табуу sistemlerinin bu küçük hedefleri kaçırmasına же yanlış konumlandırmasına neden болушу мүмкүн. Бул изилдөө, YOLOv11n tabanlı yeni bir майда объект табуу modeli olan YOLO-EFD’yi önermektedir.

YOLO-EFD iki özel модульden oluşmaktadır. Kenar Güdümlü Çift Yollu Hizalama Modülü, ар башка çözünürlüklerdeki өзгөчөлүк карталарыnı Scharr чет bilgisi жана деформациялануучу конволюция kullanarak ошол эле геометриялык konuma hizalamaya изилдөөktadır. Frekans Alanlı Çift Dikkat Modülü ise Дискреттик Косинус Өзгөртүүсү aracılığıyla объект четları жана dokularıyla ilişkili жогорку жыштыктагы bilgiyi güçlendirmekte, төмөн жыштыктагы фон bмененşenlerini bastırmaktadır.

Model, VisДрон2019 жана UAVDT маалымат топтомдору үстүндө test кылынган. Ana karşılaştırma tablosuna боюнча VisДрон2019’da %38,2 mAP@0.5, %22,5 mAP@0.5:0.95, %46,6 precision жана %39,3 recall elde кылынган. UAVDT’de ise %32,1 mAP@0.5, %18,9 mAP@0.5:0.95 жана %30,5 recall билдирилген. Model 3,4 milyon parametre жана 12,5 GFLOP эсептөө yüküne sahiptir.

Sonuçlar, чет tabanlı hizalama менен жыштык alanındaki ayrıntı güçlendirmesinin майда объект табууinde birlikte yarar sторlayabмененceğini көрсөтөт. Bununla birlikte изилдөө рецензиядан өтө элекtir; gerçek bir дрон үстүндөгү gecikme, saniyedeki kare sayısı жана enerji tüketimi ölçülmemiştir. Ayrıca негизги жыйынтык tablolarındaki bazı сандык değerler birbiriyle tam катары uyuşmamaktadır.

Küçük объект табууi neden zor bir problemdir?

Havadan çekмененn сүрөттөрde bir объект, kameranın жогоркуliği жана görüş açısı nedeniyle сүрөтnün çok küçük bir bölümünü kaplayabilir. Bir otomobil же yaya yalnızca birkaç пикселden oluştuğunda renk, doku, biçim жана sınır bilgмененri oldukça zayıflar. Evrişimli sinir торlarındaki ardışık örnek azaltma işlemleri de bu sınırlı bilgiyi daha fazla kaybкыла алат.

Изилдөөnın ilk şeklinde iki негизги sorun görselleştirilmiştir. Bulanık sahnede uzak объекттерin четları жана dokuları atmosferik etki, odak kaybı же platform hareketi nedeniyle silikleşmektedir. Yoğun sahnede ise çok sayıda araç birbirine yakın konumlanmış, bazı объекттер kısmen örtülmüş жана объекттер ортосундаki sınırlar belirsizleşmiştir.

Bu koşullarda объект табуу modeli iki ayrı soruya doğru yanıt жанаrmelidir:

  • Nesne nerede? Farklı ölçeklerdeki өзгөчөлүк карталарыnın геометриялык катары doğru hizalanması керек.
  • Görülen ayrıntı gerçekten bir объектye mi ait? Nesne четlarının фон dokusundan жана сүрөт gürültüsünden ayrılması керек.

YOLO-EFD’nin iki модулу bu soruları ayrı fakat birbirini tamamlayan işlemlerle ele almaktadır.

Standart YOLO özellik birleştirmesindeki sorun

YOLO aмененsindeki объект табуу торları, sığ katmanlardan gelэң жогорку çözünürlüklü konum bilgisiyle derin katmanlardan gelen anlamsal bilgiyi birleştirir. Geleneksel yaklaşımda derin өзгөчөлүк картасы büyütülür жана sığ өзгөчөлүк картасыyla doğrudan birleştirilir.

Ancak örnek azaltma жана tekrar büyütme işlemlerinden geçmiş derin özellikler, sığ katmandaki пикселдерle tam катары ошол эле геометриялык konumu temsil etmeyebilir. Büyük объекттерde birkaç пикселlik четтөө tolere edмененbilirken yalnızca 10–20 пиксел büyüklüğündeki bir hedefte ошол эле четтөө, объект kutusunun маанилүү bir bölümünü etkмененyebilir.

Bu nedenle изилдөө, майда объект табуу başlığına giden özellik yolundaki standart büyütme жана birleştirme işlemini чет bilgisiyle yönlendirмененn dinamik bir hizalama модулуyle değiştirmiştir.

YOLO-EFD’nin genel mimarisi

Model, YOLOv11n’in omurga–boyun–табуу başlığı yapısını korumaktadır. Özel модульler esas катары торın çok ölçekli özelliklerin birleştirildiği boyun bölümüne yerleştirilmiştir.

  • Omurga: Girdi сүрөтsünden ар башка çözünürlüklerde өзгөчөлүк карталары üretir.
  • EGA модулу: Sığ жана derin özellikleri чет bilgisi yardımıyla геометриялык катары hizalar.
  • FDAM модулу: Hizalanmış özelliklerdeki жогорку жыштыктагы чет жана doku bilgisini güçlendirir.
  • Tespit başlıkları: Nesne sınıflarını жана чектөөчү кутуları tahmin eder.

Özel модульlerin yalnızca майда объект başlığına giden özellik yoluna yerleştirilmesi, bütün торı торırlaştırmadan küçük hedeflere yönelik temsil gücünün artırılmasını amaçlamaktadır.

Kenar Güdümlü Çift Yollu Hizalama Modülü

Scharr operatörüyle чет çıkarımı

EGA катары adlandırılan модуль, мурда sığ жана жогорку çözünürlüklü өзгөчөлүк картасыndaki yatay жана düşey yoğunluk değişimlerini Scharr filtreleriyle эсептөөktadır:

\[ E_x=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},x}) \]

\[ E_y=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},y}) \]

  • Pi: Sığ katmandan gelэң жогорку çözünürlüklü өзгөчөлүк картасыdır.
  • KScharr,x: Yatay yöndeki yoğunluk değişimini hesaplayan Scharr çekirdeğidir.
  • KScharr,y: Düşey yöndeki yoğunluk değişimini hesaplayan Scharr çekirdeğidir.
  • Ex жана Ey: Yatay жана düşey gradyan yanıtlarıdır.

İki yöndeki gradyanlar daha кийин tek bir чет büyüklüğü haritasında birleştirilmektedir:

\[ E=\sqrt{E_x^2+E_y^2+\varepsilon} \]

Buradaki ε, karekök hesabının сандык kararlılığını sторlayan küçük bir sabittir. Ortaya çıkan E haritası, майда объекттердиn dış sınırlarının bulunabмененceği bölgeleri temsil eden геометриялык ön bilgidir.

Anlamsal жана геометриялык bilginin birlikte kullanılması

Yalnızca чет haritasının kullanılması yeterli эмес. Yol çizgмененri, bina sınırları жана gölgeler de güçlü чет üretebilir. Bu nedenle изилдөө, derin katmandaki anlamsal özelliklerle чет haritasını birlikte kullanmaktadır.

Derin өзгөчөлүк картасы sığ haritanın çözünürlüğüne büyütüldükten кийин чет haritasıyla kanal yönünde birleştirilir. Deforme edмененbilir конволюцияde kullanılacak konum kaymaları şu işlemle tahmin edilir:

\[ \Delta=\operatorname{Conv}_{\mathrm{offset}}\left(\operatorname{Concat}(P'_{i+1},E)\right) \]

  • P′i+1: Derin katmandan gelen жана sığ haritanın boyutuna büyütülen anlamsal özelliktir.
  • E: Sığ katmandan çıkarılan чет haritasıdır.
  • Δ: Deforme edмененbilir конволюцияin hangi noktalardan örnek alacторını belirleyen konum kayma alanıdır.

Derin özellikler modelin hangi yapının bir araç, yaya же başka bir объект olabмененceğini anlamasına; чет haritası ise объектnin sınırının nerede bulunduğunu tahmin etmesine yardımcı olur.

Deforme edмененbilir çift yol hizalaması

Tahmin edмененn ошол эле kayma alanı hem sığ hem derin özelliklere uygulanmaktadır:

\[ P_i^{\mathrm{aligned}}=\mathcal{D}(P_i,\Delta) \]

\[ {P'}_{i+1}^{\mathrm{aligned}}=\mathcal{D}(P'_{i+1},\Delta) \]

𝒟, деформациялануучу конволюция işlemini temsil eder. Standart конволюция sabit bir örnekleme ızgarası kullanırken деформациялануучу конволюция, tahmin edмененn kaymalara боюнча ар башка konumlardan bilgi toplayabilir.

Hizalanan iki өзгөчөлүк картасы birleştirilip 1 × 1 конволюцияden geçirilir:

\[ F_{\mathrm{out}}=\operatorname{Conv}_{1\times1}\left(\operatorname{Concat}(P_i^{\mathrm{aligned}},{P'}_{i+1}^{\mathrm{aligned}})\right) \]

Böylece майда объект başlığına gönderмененn özelliklerin hem ayrıntılı konum bilgisini hem de derin anlamsal bilgiyi taşıması amaçlanmıştır.

Frekans Alanlı Çift Dikkat Modülü

Neden жыштык alanı колдонулган?

Bir сүрөтnün geniş жана yavaş değişen bölgeleri төмөн жыштыктагы bмененşenlerde; keskin четlar, ince dokular жана ani parlaklık değişimleri ise жогорку жыштыктагы bмененşenlerde temsil edilir. Küçük объекттерin ayırt edмененbilmesi үчүн gerekli olan sınır жана doku bilgмененri çoğunlukla жогорку жыштык tarafında yer alır.

Evrişimli торlardaki örnek azaltma işlemleri жогорку жыштыктагы ayrıntıları yumuşatabilir. FDAM модулу, bu ayrıntıları doğrudan жыштык alanında ayırmayı жана güçlendirmeyi hedeflemektedir.

Дискреттик Косинус Өзгөртүүсү

Uzamsal өзгөчөлүк картасы iki boyutlu Дискреттик Косинус Өзгөртүүсүyle жыштык alanına aktarılmaktadır:

\[ F(u,v)=\mathcal{T}_{\mathrm{DCT}}\left(f(x,y)\right) \]

  • f(x,y): Uzamsal alandaki girdi өзгөчөлүк картасыdır.
  • F(u,v): DCT кийинsında elde edмененn жыштык bмененşenleridir.
  • u жана v: Frekans düzlemindeki yatay жана düşey koordinatlardır.

DCT spektrumunun sol üst bölgesi төмөн жыштыктагы, sтор alt bölgelere doğru мененrleyen bмененşenler ise daha жогорку жыштыктагы bilgiyi temsil etmektedir.

Yüksek geçiren жыштык maskesi

Изилдөөda α parametresiyle kontrol edмененn bir maske kullanılarak төмөн жыштыктагы bölgenin bir kısmı bastırılmaktadır:

\[ F_{\mathrm{filtered}}(u,v)=F(u,v)\odot M(u,v;\alpha) \]

M(u,v;α) жыштык maskesini, ⊙ ise eleman bazlı çarpımı temsil eder. Filtrelenen spektrum ters DCT менен tekrar uzamsal alana çevrмененrek чет жана ince ayrıntıları öne çıkaran bir dikkat haritası üretilmektedir.

α değeri çok küçük olduğunda yeterli фон bastırması yapılamayabilir. Çok büyük olduğunda ise объектye ait yararlı төмөн жана orta жыштыкlı bilgмененr de kaybболушу мүмкүн. Deneylerde en iyi değer α = 0,25 катары bulunmuştur.

İkinci dereceden kanal dikkati

FDAM’ın ikinci yolu, her özellik kanalının yalnızca ortalamasını değil, varyansını da эсептөөktadır:

\[ \mu_c=\mathbb{E}[x_c] \]

\[ \sigma_c^2=\mathbb{E}\left[(x_c-\mu_c)^2\right] \]

  • μc: c kanalındaki ortalama aktivasyondur.
  • σc2: Aktivasyonların uzamsal varyansıdır.
  • xc: İlgili kanaldaki özellik değerleridir.

Bir майда объектnin sınırı çevresinde aktivasyonlar hızlı biçimde değişebмененceği үчүн объект ayrıntısı taşıyan kanallarda varyansın жогорку olması beklenmektedir. Düz жана tekdüze фон bölgelerinin baskın olduğu kanallarda ise varyans төмөнүрөөк болушу мүмкүн.

Ortalama жана varyans değerleri birleştirмененrek 1 × 1 конволюция жана sigmoid aktivasyonu үстүндөn kanal торırlıkları oluşturulur. Frekans yolundan gelen uzamsal dikkat менен kanal yolundan gelen торırlıklar birleştirмененrek ayrıntı taşıyan bölgeler жана kanallar güçlendirilir.

İki модуль nasıl birlikte изилдөөktadır?

EGA модулу мурда sığ жана derin özelliklerin геометриялык konumlarını düzeltmektedir. FDAM daha кийин bu hizalanmış özelliklerdeki четları жана жогорку жыштыктагы ayrıntıları güçlendirmektedir.

  1. Sığ katmandan чет bilgisi çıkarılır.
  2. Kenar жана derin anlamsal özelliklerden konum kaymaları tahmin edilir.
  3. Sığ жана derin özellikler деформациялануучу конволюцияle hizalanır.
  4. Hizalanmış özellikler DCT менен жыштык bмененşenlerine ayrılır.
  5. Düşük жыштыкlı фонın bir bölümü bastırılır.
  6. Ortalama жана varyans tabanlı kanal dikkati uygulanır.
  7. Güçlendirilmiş özellikler майда объект табуу başlığına aktarılır.

Kullanılan маалымат топтомдору

VisДрон2019

VisДрон2019, ар башка şehir, жогоркуlik, kamera açısı, ışık жана hava koşullarında çekilmiş дрон сүрөттөрүндөn oluşmaktadır. Изилдөөda объект табууi alt kümesi колдонулган. Bu bölüm болжол менен 10.209 сүрөт жана 540.000’den fazla чектөөчү куту içermektedir.

Değerlendirмененn on sınıf şunlardır:

  • Yaya
  • İnsan
  • Bisiklet
  • Otomobil
  • Van
  • Kamyon
  • Üç tekerlekli araç
  • Brandalı üç tekerlekli araç
  • Otobüs
  • Motosiklet

UAVDT

UAVDT маалымат топтому болжол менен on saatlik hava videosundan seçilmiş 100 video dizisi жана болжол менен 80.000 kare içermektedir. Görüntüler otoyol, kavşak, otopark жана ücretli geçiş istasyonu gibi trafik ortamlarını kapsamaktadır. Temel табуу sınıfları otomobil, kamyon жана otobüstür.

VisДрон ар башка объект sınıfları жана ölçekleri bakımından geniş bir sınama ortamı sunarken UAVDT, hareket bulanıklığı, тыгыз трафик жана araç örtüşmesi gibi dinamik şehir koşullarına odaklanmaktadır.

Eğitim ortamı жана hiperparametreler

DeğişkenKullanılan değer
Grafik işlemciNVIDIA GeForce RTX 4090
Derin öğrenme çerçeжанаsiPyTorch 2.4.1
Ortam yönetimiAnaconda3
Girdi çözünürlüğü640 × 640 пиксел
Eğitim süresi300 epoch
Batch boyutu16
Başlangıç үйрөнүү ылдамдыгы0,01
Momentum0,937
Ağırlık azalması0,0005
Optimizasyon algoritmasıStokastik Gradyan İnişi

Metin, bütün modellerin ошол эле жанаri artırma işlemleri, кокустук уругу жана окутуу tekrarlarıyla karşılaştırılıp karşılaştırılmadığını ayrıntılı biçimde açıklamamaktadır. Model kodu, eğitilmiş торırlıklar жана tam yapılandırma dosyaları үчүн de açık bir depo bторlantısı жанаrilmemiştir.

Değerlendirme ölçütleri

Precision, model tarafından объект катары işaretlenen örneklerin ne kadarının doğru olduğunu ölçmektedir:

\[ \operatorname{Precision}=\frac{TP}{TP+FP}\times100 \]

Recall, сүрөттөрde gerçekten bulunan объекттерin ne kadarının yakalandığını көрсөтөт:

\[ \operatorname{Recall}=\frac{TP}{TP+FN}\times100 \]

  • TP: Doğru табуу edмененn объекттер.
  • FP: Gerçekte bulunmadığı hâlde табуу edмененn объекттер.
  • FN: Model tarafından kaçırılan gerçek объекттер.

Bir sınıf үчүн ortalama kesinlik, precision–recall eğrisinin астында kalan alan катары tanımlanmıştır:

\[ AP=\int_0^1 P(R)\,dR \]

Birden fazla sınıftaki AP değerlerinin ortalaması:

\[ mAP=\frac{1}{K}\sum_{i=1}^{K}AP_i\times100 \]

mAP@0.5, tahmin kutusuyla gerçek kutu ортосундаki kesişim-birleşim oranının en az 0,5 olduğu durumda hesaplanmaktadır. mAP@0.5:0.95 ise 0,5 менен 0,95 ортосундаki on ар башка eşikte ortalama aldığı үчүн konumlandırma hassasiyetini daha katı biçimde ölçmektedir.

VisДрон2019 жыйынтыктарı

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametreGFLOP
YOLOv5n%32,9%40,5%33,1%18,62,5 milyon7,2
YOLOv8n%33,9%41,3%34,7%19,23,2 milyon8,7
YOLOv10n%34,0%42,8%33,7%19,92,3 milyon6,5
YOLOv11n%33,9%42,1%34,9%19,82,6 milyon6,6
YOLOv7-Tiny%36,8%42,8%40,1%20,86,1 milyon13,3
EdgeYolo-t%38,5%48,9%37,8%22,45,5 milyon27,2
YOLO-EFD%38,2%46,6%39,3%22,53,4 milyon12,5

Ana karşılaştırma tablosuna боюнча YOLO-EFD, YOLOv11n’e kıyasla mAP@0.5 değerini %33,9’dan %38,2’ye, recall değerini %34,9’dan %39,3’e жана daha katı mAP değerini %19,8’den %22,5’e çıkarmıştır.

Model bütün karşılaştırma ölçütlerinde tek başına эң жогорку sonucu жанаrmemektedir. EdgeYolo-t modeli mAP@0.5 жана precision bakımından biraz жогорураак жыйынтык üretmiştir. YOLO-EFD’nin негизги avantajı, EdgeYolo-t’nin 27,2 GFLOP эсептөө yüküne karşılık 12,5 GFLOP менен benzer doğruluk düzeyine yaklaşmasıdır.

YOLO-EFD’nin эсептөө yükü yine de негизги YOLOv11n’e боюнча belirgin biçimde artmıştır: parametre sayısı 2,6 milyondan 3,4 milyona, GFLOP değeri 6,6’dan 12,5’e yükselmiştir. Dolayısıyla doğruluk artışı karşılığında негизги modele боюнча болжол менен iki kata yaklaşan bir эсептөө yükü oluşmaktadır.

UAVDT жыйынтыктарı

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametreGFLOP
YOLOv11n%31,3%37,8%27,5%18,32,6 milyon6,6
YOLOv7-Tiny%31,7%38,3%28,4%18,36,1 milyon13,3
EdgeYolo-t%32,3%40,1%29,6%18,75,5 milyon27,2
YOLO-EFD%32,1%39,3%30,5%18,93,4 milyon12,5

UAVDT’de YOLO-EFD, karşılaştırılan modeller ортосундаki эң жогорку recall değerini üretmiştir. YOLOv11n’e боюнча recall %27,5’ten %30,5’e yükselmiştir. Bu artış, modelin yoğun жана bulanık trafik сүрөттөрүндө daha az объект kaçırdığı yönünde kanıt sunmaktadır.

EdgeYolo-t, mAP@0.5 жана precision bakımından küçük bir üstünlüğe sahipken YOLO-EFD жогорураак recall жана mAP@0.5:0.95 üretmiştir. Bu nedenle жыйынтыктар tek bir modelin her ölçütte üstünlüğünden çok, doğruluk жана эсептөө maliyeti ортосунда ар башка dengeler bulunduğunu көрсөтөт.

Modül çıkarım deneyleri

YapılandırmamAP@0.5:0.95mAP@0.5PrecisionRecall
YOLOv11n негизги modeli%19,8%33,9%44,1%34,9
Yalnızca EGA%21,5%36,7%45,8%37,2
Yalnızca FDAM%20,8%35,2%45,2%35,8
EGA жана FDAM%22,2%38,2%46,6%39,3

EGA модулу tek başına mAP@0.5 değerinde 2,8 puan, recall değerinde 2,3 puan artış sторlamıştır. FDAM tek başına daha küçük fakat bütün ölçütlerde pozitif değişim üretmiştir. İki модуль birlikte kullanıldığında эң жогорку жыйынтыктарa ulaşılmıştır.

Bu bulgu, геометриялык hizalama жана жыштык ayrıntısı güçlendirmesinin ошол эле sorunun iki ayrı bмененşenine müdahale ettiğini колдойт. Bununla birlikte абляция deneylerinin tek кокустук уругу mu yoksa birden fazla окутуу tekrarının ortalaması mı olduğu belirtilmemiştir.

Frekans filtresi parametresi

αmAP@0.5:0.95mAP@0.5
0,00%21,5%37,8
0,25%22,2%38,2
0,50%21,8%37,5
0,75%21,6%37,4
1,00%21,3%37,2

En iyi жыйынтык α = 0,25 değerinde elde кылынган. Daha güçlü filtreleme uygulandığında performansın kademeli катары düşmesi, bütün төмөн жыштык bilgisinin gereksiz olmadığını көрсөтөт. Nesnenin genel biçimi жана bторlamı da төмөнүрөөк жыштык bмененşenlerinde bulunabilir.

Karışıklık matrisleri ne көрсөткөн?

VisДрон2019 karışıklık matrislerinde майда объект sınıflarının фонla karıştırılma oranlarında azalma билдирилген:

  • Yaya sınıfı үчүн фон karışması 0,72’den 0,59’a düşmüştür.
  • Motosiklet sınıfında 0,52’den 0,49’a düşmüştür.
  • Bisiklet sınıfında 0,85’ten 0,78’e düşmüştür.
  • Otomobil sınıfının matris köşegen değeri 0,70’ten 0,76’ya yükselmiştir.

Sınıf bazlı görsel karşılaştırmada yaya değeri %25’ten %38’e, motosiklet %26’dan %37’ye, bisiklet %16’dan %29’a, otobüs %37’den %45’e жана kamyon %28’den %36’ya yükselmiştir. Bu değerler sınıf bazlı AP жыйынтыктарından ziyade изилдөөnın чаташуу матрицасы жана kategori karşılaştırmasında kullandığı sınıflandırma oranlarıdır.

Grad-CAM жана örnek сүрөттөр

Grad-CAM görsellerinde YOLOv11n негизги modelinin bazı sahnelerde ilgisini yol, bina же фонın ар башка bölgelerine dторıttığı; YOLO-EFD’nin ise aktivasyonlarını araç жана yayaların çevresinde daha yoğun topladığı gösterilmiştir.

Bulanık örnek sahnede негизги modelin üç araç, YOLO-EFD’nin ise sekiz araç табуу ettiği билдирилген. Yoğun trafik örneğinde YOLO-EFD kutularının birbirine yakın araçların sınırlarına daha sıkı oturduğu görülmektedir.

Bu сүрөттөр model davranışını açıklamaya yardımcı olsa da seçilmiş birkaç örnekten oluşmaktadır. Tekil сүрөттөр, bütün маалымат топтомуndeki performansın же gerçek учуу koşullarındaki güжанаnilirliğin tek başına kanıtı эмес.

Изилдөөnın күчтүү жактары

  • Yalnızca kavramsal bir öneri değil, çalıştırılmış bir объект табуу modeli sunulmuştur.
  • Model iki ар башка жана yaygın UAV маалымат топтому үстүндө бааланган.
  • EGA жана FDAM модульlerinin ayrı etkмененri абляция deneyiyle incelenmiştir.
  • Frekans filtresinin α parametresi үчүн kontrollü karşılaştırma yapılmıştır.
  • Parametre sayısı жана GFLOP bilgмененri doğruluk ölçütleriyle birlikte raporlanmıştır.
  • Karışıklık matrisi, Grad-CAM жана табуу сүрөттөрiyle nicel жыйынтыктарa görsel açıklamalar eklenmiştir.
  • Modelin başarısız olabildiği basit фон жана aşırı küçük hedef koşulları жыйынтык bölümünde açıkça belirtilmiştir.

İç tutarsızlıklar жана teknik чектөөлөр

  • Özet, öne çıkan табылгалар жана абляция tablosu VisДрон2019 үчүн %22,2 mAP@0.5:0.95 bildirirken ana karşılaştırma tablosu %22,5 жанаrmektedir.
  • YOLOv11n precision değeri ana karşılaştırma tablosunda %42,1, абляция tablosunda %44,1 катары yazılmıştır.
  • Bu ар башкаlıkların ayrı окутуу tekrarlarından, ар башка тастыктоо alt kümelerinden же yazım катаsından булакlanıp булакlanmadığı açıklanmamıştır.
  • FDAM mimarisini gösteren Şekil 4’ün başlığı yanlış biçimde EGA mimarisi катары yazılmıştır. Metindeki bazı şekil numarası yönlendirmeleri de gerçek görsellerle uyuşmamaktadır.
  • Sonuçlar үчүн standart четтөө, güжанаn aralığı, istatistiksel anlamlılık же birden fazla кокустук уругу raporlanmamıştır.
  • Karşılaştırılan bütün modellerin ошол эле kod tabanı, жанаri artırma ayarları жана окутуу koşulları астында yeniden eğitilip eğitilmediği yeterince açıklanmamıştır.
  • Gerçek zamanlı kullanım iddiasına rторmen FPS, сүрөт başına gecikme, bellek колдонулушу жана güç tüketimi ölçülmemiştir.
  • Deneyler RTX 4090 үстүндө yapılmış; дрон үстүндө kullanılabмененcek gömülü bir işlemci, Jetson platformu же başka bir uç cihaz үстүндө sınama yapılmamıştır.
  • Temel YOLOv11n’e боюнча GFLOP değeri 6,6’dan 12,5’e yükseldiği үчүн эсептөө maliyeti belirgin biçimde artmıştır.
  • Model kodu, eğitilmiş торırlıklar, жанаri bölümleme dosyaları жана eksiksiz hiperparametre yapılandırması үчүн açık bторlantı жанаrilmemiştir.
  • UAVDT’nin hava, бийиктик, kamera açısı жана yoğunluk gibi öznitelikleri bulunmasına rторmen жыйынтыктар bu koşullara боюнча ayrı ayrı raporlanmamıştır.
  • Изилдөө, basit фонlarda жана aşırı küçük seyrek hedeflerde жогорку жыштыктагы gürültüye aşırı odaklanarak yanlış табуу üretebildiğini kabul etmektedir.

Изилдөө neyi колдойт?

Sonuçlar, ар башка çözünürlüklerdeki özelliklerin чет güdümlü деформациялануучу конволюцияle hizalanmasının YOLOv11n’in майда объект performansını artırabildiğini колдойт. DCT tabanlı жогорку жыштык güçlendirmesinin de özellikle четları zayıf же bulanık küçük hedeflerde ek katkı sторlayabмененceğine ilişkin эксперименталдык bulgu sunulmuştur.

İki модулуn birlikte kullanılması, incelenen маалымат топтомдоруnde tek başlarına kullanılmalarına боюнча жогорураак жыйынтык üretmiştir. Model ayrıca EdgeYolo-t gibi daha торır bir ыкмаle benzer doğruluk аралыктынa төмөнүрөөк parametre жана GFLOP değeriyle yaklaşmıştır.

Изилдөө neyi далилдебейт?

Изилдөө YOLO-EFD’nin bütün UAV боюнчаvlerinde же bütün майда объект маалымат топтомдоруnde en iyi model olduğunu далилдебейт. Bazı karşılaştırma modelleri belirli ölçütlerde жогорураак жыйынтык üretmiştir. Deneyler yalnızca iki kamu маалымат топтому жана raporlanan tek окутуу düzeniyle sınırlıdır.

Modelin gerçek bir дрон үстүндө gerçek zamanlı çalıştığı, төмөн enerji tükettiği же kötü hava, gece, sis, titreşim жана ар башка kamera sistemlerinde ошол эле performansı koruduğu gösterilmemiştir. GFLOP жана parametre sayısı, gerçek cihaz gecikmesinin doğrudan karşılığı эмес.

Sonuçlar ayrıca modelin arama-kurtarma, güжанаnlik же trafik yönetimi gibi kritik alanlarda tek başına güжанаnilir karar жанаrebмененceğini göstermez. Bu tür uygulamalar үчүн yanlış negatiflerin, yanlış pozitiflerin жана ар башка çevresel koşulların ayrı ayrı doğrulanması керек.

Түркия açısından мүмкүн мааниси

Изилдөөda önerмененn yaklaşım; Түркия’de дрон tabanlı trafik izleme, afet кийинsı alan taraması, orman yangını gözetimi, tarımsal сүрөтleme, kıyı kontrolü жана altyapı denetimi gibi alanlara ыкмаsel катары aktarılabilir. Özellikle жогоркуten çekмененn сүрөттөрde küçük araçların же insanların ayırt edilmesi, bu uygulamaların ortak teknik sorunlarından biridir.

Түркия’de uygulanacak bir sistem үчүн modelin yerel şehir dokusu, ар башка yol işaretleri, araç түрлөрi, bitki örtüsü, topoğrafya, hava koşulları жана колдонулган дрон kameralarıyla yeniden eğitilmesi керек. VisДрон жана UAVDT жыйынтыктарı doğrudan Түркия’deki operasyonel doğruluğu temsil etmez.

Pratik kullanım мурдаsinde Түркия’ye ait сүрөттөр үстүндө alan dışı testler, gece жана kötü hava sınamaları, gömülü donanım gecikme ölçümleri, enerji tüketimi, güжанаn аралыкları жана ката sınıflandırması yapılmalıdır.

Изилдөөнүн Ыкмасы жана Жыйынтыктары

Yöntem bмененşeniUygulamaTemel bulguYorum sınırı
Temel modelYOLOv11nKüçük объект yolu EGA жана FDAM менен değiştirilmiştirBaşka YOLO ölçekleri sınanmamıştır
EGA чет çıkarımı3 × 3 Scharr filtreleriYatay жана düşey gradyanlardan чет haritası üretilmiştirGüçlü фон четları da yanıt oluşturabilir
EGA hizalamaKenar жана anlamsal özelliklerle konum kayması; деформациялануучу конволюцияSığ жана derin özelliklerin геометриялык uyumu artırılmıştırKonum kaymalarının ayrı doğruluk analizi жанаrilmemiştir
FDAM жыштык yoluDCT, жогорку geçiren maske жана ters DCTYüksek жыштыкlı чет жана doku ayrıntıları güçlendirilmiştirAşırı filtreleme yararlı bilgiyi azaltabilir
FDAM kanal yoluKanal ortalaması жана varyansıAyrıntı içeren kanallara жогорураак торırlık жанаrilmiştirAlternatif dikkat ыкмаleriyle ayrıntılı karşılaştırma yoktur
VisДрон2019Yaklaşık 10.209 сүрөт, 540.000’den fazla kutu жана 10 sınıf%38,2 mAP@0.5 жана %39,3 recallmAP@0.5:0.95 sonucu metinde %22,2 жана %22,5 катары iki ар башка değerde жанаrilmiştir
UAVDT100 video dizisi жана болжол менен 80.000 kare%32,1 mAP@0.5 жана %30,5 recallVideo takibi же zamansal modelleme yapılmamıştır
AblasyonEGA, FDAM жана birleşik model ayrı ayrı sınanmıştırBirleşik yapı эң жогорку жыйынтыктарı жанаrmiştirÇoklu окутуу tekrarları жана standart четтөө yoktur
α parametresi0,00–1,00 аралыктынda beş değerEn iyi değer 0,25 olmuşturYalnızca VisДрон тастыктоо kümesinde raporlanmıştır
Hesaplama maliyeti3,4 milyon parametre жана 12,5 GFLOPEdgeYolo-t’den төмөнүрөөк эсептөө maliyetiGerçek cihaz FPS жана enerji ölçümü yoktur

En маанилүү сандык жыйынтыктар

  • VisДрон2019 ana tablosunda YOLO-EFD үчүн mAP@0.5 %38,2 катары жанаrilmiştir.
  • VisДрон2019 recall değeri %39,3, precision değeri %46,6’dır.
  • VisДрон2019 mAP@0.5:0.95 değeri ana tabloda %22,5; özet жана абляция tablosunda %22,2’dir.
  • UAVDT’de mAP@0.5 %32,1, mAP@0.5:0.95 %18,9, precision %39,3 жана recall %30,5’tir.
  • EGA модулу tek başına негизги modele боюнча mAP@0.5 değerini 2,8 puan artırmıştır.
  • FDAM модулу tek başına mAP@0.5 değerini 1,3 puan artırmıştır.
  • İki модуль birlikte mAP@0.5 değerini %33,9’dan %38,2’ye yükseltmiştir.
  • En uygun жыштык maskesi parametresi α = 0,25 катары bulunmuştur.
  • Model 3,4 milyon parametre жана 12,5 GFLOP эсептөө yüküne sahiptir.
  • EdgeYolo-t 27,2 GFLOP менен %38,5 mAP@0.5 üretirken YOLO-EFD 12,5 GFLOP менен %38,2 üretmiştir.

Operasyonel kullanımdan мурда yapılması gerekenler

  1. Model kodu, торırlıkları жана жанаri bölümleme dosyaları yayımlanarak жыйынтыктарın yeniden üretilmesi.
  2. En az üç ila beş ар башка кокустук уругу менен ortalama жана standart четтөөлөрүn raporlanması.
  3. Түркия’de çekilmiş дрон сүрөттөрi үстүндө dış тастыктоо yapılması.
  4. Gece, sis, yторmur, titreşim, ар башка жогоркуlik жана ар башка kamera çözünürlüklerinin ayrı ayrı sınanması.
  5. Jetson же benzeri uç donanımlarda FPS, gecikme, bellek жана güç tüketiminin ölçülmesi.
  6. Yanlış pozitif жана yanlış negatiflerin uygulama türüne боюнча maliyet analizinin yapılması.
  7. Basit фонlarda жогорку жыштыктагы gürültüye aşırı odaklanmayı azaltacak uyarlanabilir filtrelerin geliştirilmesi.
  8. Video объект табууi жана çoklu объект takibi үчүн zamansal tutarlılığın modele eklenmesi.

Булак жана Ыкма Жөнүндө Эскертүү

Изилдөөnın özgün adı: YOLO-EFD: Edge-guided and Frequency-domain Dual Enhancement for Small Object Detection in UAV Aerial Imagery

Yazarlar жана doğru sıralama: Xin Song, Peng Li, Xuecong Liu, Xin Zhao.

Eş birinci yazar: Изилдөөda eş birinci yazarlık же eş katkı beyanı жок.

Sorumlu/мененtişim yazarı: Xin Song.

Kurumsal bторlantılar:

  • School of Computer Science and Engineering, Northeastern Uniжанаrsity, Shenyang, Liaoning, Кытай.
  • Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern Uniжанаrsity at Qinhuangdao, Qinhuangdao, Hebei, Кытай.
  • Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment, Chaoyue Technology Co., Ltd., Jinan, Shandong, Кытай.

DOI:10.2139/ssrn.7031768

Resmî изилдөө sayfası:SSRN resmî kaydı

Yayın platformu: SSRN.

Yüklenme tarihi: 1 Temmuz 2026.

Dergi: Hakemli bir dergi yayını же belirli bir dergi adı doğrulanamamıştır. Sayfa alt bilgisinde “Preprint submitted to Elsevier” ifadesi yer almakta, ancak hedef dergi belirtilmemektedir.

Hakemlik durumu: Изилдөө рецензиядан өтө элек bir preprinttir.

Kaynak türü: Yeni bir derin öğrenme mimarisi, iki kamu маалымат топтому үстүндө karşılaştırmalı deneyler, модуль çıkarım testleri жана parametre analizi içeren эсептөөlı bilgisayarlı görü изилдөөsı.

Finansman: Изилдөө, Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment Açık Изилдөө Proje Fonu tarafından KT25500300-lab numarasıyla desteklenmiştir.

Üretken yapay zekâ колдонулушу: Yazarlar, DeepSeek’i dil düzeltmesi жана paragraf düzenlemesi amacıyla kullandıklarını; nihai içeriği gözden geçirerek sorumluluğu üstlendiklerini bildirmiştir.

Çıkar çatışması: Yüklenen sürümde açık bir çıkar çatışması beyanı жок.

Veri жана kod erişimi: VisДрон2019 жана UAVDT kamu маалымат топтомдоруdir. Bununla birlikte YOLO-EFD kodu, eğitilmiş торırlıkları, rastgelelik tohumları жана tam deney yapılandırması үчүн bторlantı жанаrilmemiştir.

Bibliyografik uyarı: Aynı başlık жана ошол эле yazarlarla SSRN’de 10.2139/ssrn.6878454 DOI’li daha eski bir kayıt da бар. Yüklenen sürümün bütün sayfalarında 7031768 kayıt numarası bulunduğundan bu makalede 10.2139/ssrn.7031768 DOI’si esas alınmıştır.

Bu Türkçe açıklama, yüklenen изилдөөnın metni, теңдемелер, tabloları, тор şemaları, ısı haritaları, karışıklık matrisleri жана deney görselleri негизги alınarak hazırlanmıştır. Bilimsel жыйынтыктар үчүн dış булак eklenmemiş; dış kontrol yalnızca başlık, yazarlar, DOI, SSRN kayıt tarihi жана sorumlu yazar gibi bibliyografik kimlik bilgмененrinin doğrulanmasıyla sınırlandırılmıştır.

Изилдөөnın en маанилүү raporlama sorunu, VisДрон2019 mAP@0.5:0.95 жана негизги model precision değerlerinin ар башка bölümlerde uyuşmamasıdır. Bu nedenle жыйынтыктар aktarılırken ana karşılaştırma tablosundaki %22,5 менен özet жана абляция tablosundaki %22,2 değerleri birlikte belirtilmelidir.

Изилдөө gerçek bir дрон donanımında saha тастыктооsı, gecikme ölçümü же enerji tüketimi deneyi sunmamaktadır. Bu nedenle “gerçek zamanlı жана uç cihazlara uygun” баалооsi parametre жана GFLOP жыйынтыктарına dayanan bir potansiyel катары okunmalı, doğrulanmış operasyonel performans катары sunulmamalıdır.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты