Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Mühəndislik / YOLO-EFD: Dron Görüntülərindəki Kiçik Obyektləri Kənar və Tezlik Məlumatı ilə Daha Yaxşı Aşkar Etmək
Mühəndislik

YOLO-EFD: Dron Görüntülərindəki Kiçik Obyektləri Kənar və Tezlik Məlumatı ilə Daha Yaxşı Aşkar Etmək

Dron və uzaqdan zondlama görüntülərində avtomobil, piyada, velosiped və ya motosiklet kimi obyektlər bəzən yalnız bir neçə piksel böyüklüyündə görünür.

30/07/2026  Veri Anla 36 baxış
YOLO-EFD: Dron Görüntülərindəki Kiçik Obyektləri Kənar və Tezlik Məlumatı ilə Daha Yaxşı Aşkar Etmək

Dron və uzaqdan zondlama görüntülərində otomobil, yaya, bisiklet və ya motosiklet gibi obyektlər bazen yalnızca birkaç piksel büyüklüğünde görünür. Görüntü bulanıklığı, sıx trafik, örtüşen obyektlər və karmaşık fonlar, standart obyekt aşkarlama sistemlerinin bu küçük hedefleri kaçırmasına və ya yanlış konumlandırmasına neden ola bilər. Bu tədqiqat, YOLOv11n tabanlı yeni bir kiçik obyekt aşkarlama modeli olan YOLO-EFD’yi önermektedir.

YOLO-EFD iki özel modulden oluşmaktadır. Kenar Güdümlü Çift Yollu Hizalama Modülü, fərqli çözünürlüklerdeki xüsusiyyət xəritələrinı Scharr kənar bilgisi və deformasiya oluna bilən konvolyusiya kullanarak eyni geometrik konuma hizalamaya tədqiqatktadır. Frekans Alanlı Çift Dikkat Modülü ise Diskret Kosinus Çevirməsi aracılığıyla obyekt kənarları və dokularıyla ilişkili yüksək tezlikli bilgiyi güçlendirmekte, aşşəbəkəı tezlikli fon biləşenlerini bastırmaktadır.

Model, VisDron2019 və UAVDT vərilənlər topluları üzərində test edilmişdir. Ana karşılaştırma tablosuna görə VisDron2019’da %38,2 mAP@0.5, %22,5 mAP@0.5:0.95, %46,6 precision və %39,3 recall elde edilmişdir. UAVDT’de ise %32,1 mAP@0.5, %18,9 mAP@0.5:0.95 və %30,5 recall bildirilmişdir. Model 3,4 milyon parametre və 12,5 GFLOP hesablama yüküne sahiptir.

Sonuçlar, kənar tabanlı hizalama ilə tezlik alanındaki ayrıntı güçlendirmesinin kiçik obyekt aşkarlamainde birlikte yarar sşəbəkəlayabiləceğini göstərir. Bununla birlikte tədqiqat hakem qiymətləndirməsindən keçməmiştir; gerçek bir dron üzərindəki gecikme, saniyedeki kare sayısı və enerji tüketimi ölçülmemiştir. Ayrıca əsas nəticə tablolarındaki bazı rəqəmsal değerler birbiriyle tam kimi uyuşmamaktadır.

Küçük obyekt aşkarlamai neden zor bir problemdir?

Havadan çekilən görüntülərde bir obyekt, kameranın yüksəkliği və görüş açısı nedeniyle görüntünün çok küçük bir bölümünü kaplayabilir. Bir otomobil və ya yaya yalnızca birkaç pikselden oluştuğunda renk, doku, biçim və sınır bilgiləri oldukça zayıflar. Evrişimli sinir şəbəkəlarındaki ardışık örnek azaltma işlemleri de bu sınırlı bilgiyi daha fazla kaybedə bilər.

Tədqiqatnın ilk şeklinde iki əsas sorun görselleştirilmiştir. Bulanık sahnede uzak obyektlərin kənarları və dokuları atmosferik etki, odak kaybı və ya platform hareketi nedeniyle silikleşmektedir. Yoğun sahnede ise çok sayıda araç birbirine yakın konumlanmış, bazı obyektlər kısmen örtülmüş və obyektlər arasındaki sınırlar belirsizleşmiştir.

Bu koşullarda obyekt aşkarlama modeli iki ayrı soruya doğru yanıt vərmelidir:

  • Nesne nerede? Farklı ölçeklerdeki xüsusiyyət xəritələrinın geometrik kimi doğru hizalanması lazımdır.
  • Görülen ayrıntı gerçekten bir obyektye mi ait? Nesne kənarlarının fon dokusundan və görüntü gürültüsünden ayrılması lazımdır.

YOLO-EFD’nin iki modulu bu soruları ayrı fakat birbirini tamamlayan işlemlerle ele almaktadır.

Standart YOLO özellik birleştirmesindeki sorun

YOLO ailəsindeki obyekt aşkarlama şəbəkəları, sığ katmanlardan gelən yüksək çözünürlüklü konum bilgisiyle derin katmanlardan gelen anlamsal bilgiyi birleştirir. Geleneksel yaklaşımda derin xüsusiyyət xəritəsi büyütülür və sığ xüsusiyyət xəritəsiyla doğrudan birleştirilir.

Ancak örnek azaltma və tekrar büyütme işlemlerinden geçmiş derin özellikler, sığ katmandaki piksellərle tam kimi eyni geometrik konumu temsil etmeyebilir. Büyük obyektlərde birkaç piksellik kənaraçıxma tolere ediləbilirken yalnızca 10–20 piksel büyüklüğündeki bir hedefte eyni kənaraçıxma, obyekt kutusunun mühüm bir bölümünü etkiləyebilir.

Bu nedenle tədqiqat, kiçik obyekt aşkarlama başlığına giden özellik yolundaki standart büyütme və birleştirme işlemini kənar bilgisiyle yönlendirilən dinamik bir hizalama moduluyle değiştirmiştir.

YOLO-EFD’nin genel mimarisi

Model, YOLOv11n’in omurga–boyun–aşkarlama başlığı yapısını korumaktadır. Özel moduller esas kimi şəbəkəın çok ölçekli özelliklerin birleştirildiği boyun bölümüne yerleştirilmiştir.

  • Omurga: Girdi görüntüsünden fərqli çözünürlüklerde xüsusiyyət xəritələri üretir.
  • EGA modulu: Sığ və derin özellikleri kənar bilgisi yardımıyla geometrik kimi hizalar.
  • FDAM modulu: Hizalanmış özelliklerdeki yüksək tezlikli kənar və doku bilgisini güçlendirir.
  • Tespit başlıkları: Nesne sınıflarını və məhdudlaşdırıcı qutuları tahmin eder.

Özel modullerin yalnızca kiçik obyekt başlığına giden özellik yoluna yerleştirilmesi, bütün şəbəkəı şəbəkəırlaştırmadan küçük hedeflere yönelik temsil gücünün artırılmasını amaçlamaktadır.

Kenar Güdümlü Çift Yollu Hizalama Modülü

Scharr operatörüyle kənar çıkarımı

EGA kimi adlandırılan modul, əvvəl sığ və yüksək çözünürlüklü xüsusiyyət xəritəsindaki yatay və düşey yoğunluk değişimlerini Scharr filtreleriyle hesablamaktadır:

\[ E_x=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},x}) \]

\[ E_y=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},y}) \]

  • Pi: Sığ katmandan gelən yüksək çözünürlüklü xüsusiyyət xəritəsidır.
  • KScharr,x: Yatay yöndeki yoğunluk değişimini hesaplayan Scharr çekirdeğidir.
  • KScharr,y: Düşey yöndeki yoğunluk değişimini hesaplayan Scharr çekirdeğidir.
  • Ex və Ey: Yatay və düşey gradyan yanıtlarıdır.

İki yöndeki gradyanlar daha sonra tek bir kənar büyüklüğü haritasında birleştirilmektedir:

\[ E=\sqrt{E_x^2+E_y^2+\varepsilon} \]

Buradaki ε, karekök hesabının rəqəmsal kararlılığını sşəbəkəlayan küçük bir sabittir. Ortaya çıkan E haritası, kiçik obyektlərin dış sınırlarının bulunabiləceği bölgeleri temsil eden geometrik ön bilgidir.

Anlamsal və geometrik bilginin birlikte kullanılması

Yalnızca kənar haritasının kullanılması yeterli deyil. Yol çizgiləri, bina sınırları və gölgeler de güçlü kənar üretebilir. Bu nedenle tədqiqat, derin katmandaki anlamsal özelliklerle kənar haritasını birlikte kullanmaktadır.

Derin xüsusiyyət xəritəsi sığ haritanın çözünürlüğüne büyütüldükten sonra kənar haritasıyla kanal yönünde birleştirilir. Deforme ediləbilir konvolyusiyade kullanılacak konum kaymaları şu işlemle tahmin edilir:

\[ \Delta=\operatorname{Conv}_{\mathrm{offset}}\left(\operatorname{Concat}(P'_{i+1},E)\right) \]

  • P′i+1: Derin katmandan gelen və sığ haritanın boyutuna büyütülen anlamsal özelliktir.
  • E: Sığ katmandan çıkarılan kənar haritasıdır.
  • Δ: Deforme ediləbilir konvolyusiyain hangi noktalardan örnek alacşəbəkəını belirleyen konum kayma alanıdır.

Derin özellikler modelin hangi yapının bir araç, yaya və ya başka bir obyekt olabiləceğini anlamasına; kənar haritası ise obyektnin sınırının nerede bulunduğunu tahmin etmesine yardımcı olur.

Deforme ediləbilir çift yol hizalaması

Tahmin edilən eyni kayma alanı hem sığ hem derin özelliklere uygulanmaktadır:

\[ P_i^{\mathrm{aligned}}=\mathcal{D}(P_i,\Delta) \]

\[ {P'}_{i+1}^{\mathrm{aligned}}=\mathcal{D}(P'_{i+1},\Delta) \]

𝒟, deformasiya oluna bilən konvolyusiya işlemini temsil eder. Standart konvolyusiya sabit bir örnekleme ızgarası kullanırken deformasiya oluna bilən konvolyusiya, tahmin edilən kaymalara görə fərqli konumlardan bilgi toplayabilir.

Hizalanan iki xüsusiyyət xəritəsi birleştirilip 1 × 1 konvolyusiyaden geçirilir:

\[ F_{\mathrm{out}}=\operatorname{Conv}_{1\times1}\left(\operatorname{Concat}(P_i^{\mathrm{aligned}},{P'}_{i+1}^{\mathrm{aligned}})\right) \]

Böylece kiçik obyekt başlığına gönderilən özelliklerin hem ayrıntılı konum bilgisini hem de derin anlamsal bilgiyi taşıması amaçlanmıştır.

Frekans Alanlı Çift Dikkat Modülü

Neden tezlik alanı istifadə edilmişdir?

Bir görüntünün geniş və yavaş değişen bölgeleri aşşəbəkəı tezlikli biləşenlerde; keskin kənarlar, ince dokular və ani parlaklık değişimleri ise yüksək tezlikli biləşenlerde temsil edilir. Küçük obyektlərin ayırt ediləbilmesi üçün gerekli olan sınır və doku bilgiləri çoğunlukla yüksək tezlik tarafında yer alır.

Evrişimli şəbəkəlardaki örnek azaltma işlemleri yüksək tezlikli ayrıntıları yumuşatabilir. FDAM modulu, bu ayrıntıları doğrudan tezlik alanında ayırmayı və güçlendirmeyi hedeflemektedir.

Diskret Kosinus Çevirməsi

Uzamsal xüsusiyyət xəritəsi iki boyutlu Diskret Kosinus Çevirməsiyle tezlik alanına aktarılmaktadır:

\[ F(u,v)=\mathcal{T}_{\mathrm{DCT}}\left(f(x,y)\right) \]

  • f(x,y): Uzamsal alandaki girdi xüsusiyyət xəritəsidır.
  • F(u,v): DCT sonrasında elde edilən tezlik biləşenleridir.
  • u və v: Frekans düzlemindeki yatay və düşey koordinatlardır.

DCT spektrumunun sol üst bölgesi aşşəbəkəı tezlikli, sşəbəkə alt bölgelere doğru ilərleyen biləşenler ise daha yüksək tezlikli bilgiyi temsil etmektedir.

Yüksek geçiren tezlik maskesi

Tədqiqatda α parametresiyle kontrol edilən bir maske kullanılarak aşşəbəkəı tezlikli bölgenin bir kısmı bastırılmaktadır:

\[ F_{\mathrm{filtered}}(u,v)=F(u,v)\odot M(u,v;\alpha) \]

M(u,v;α) tezlik maskesini, ⊙ ise eleman bazlı çarpımı temsil eder. Filtrelenen spektrum ters DCT ilə tekrar uzamsal alana çevrilərek kənar və ince ayrıntıları öne çıkaran bir dikkat haritası üretilmektedir.

α değeri çok küçük olduğunda yeterli fon bastırması yapılamayabilir. Çok büyük olduğunda ise obyektye ait yararlı aşşəbəkəı və orta tezliklı bilgilər de kaybola bilər. Deneylerde en iyi değer α = 0,25 kimi bulunmuştur.

İkinci dereceden kanal dikkati

FDAM’ın ikinci yolu, her özellik kanalının yalnızca ortalamasını değil, varyansını da hesablamaktadır:

\[ \mu_c=\mathbb{E}[x_c] \]

\[ \sigma_c^2=\mathbb{E}\left[(x_c-\mu_c)^2\right] \]

  • μc: c kanalındaki ortalama aktivasyondur.
  • σc2: Aktivasyonların uzamsal varyansıdır.
  • xc: İlgili kanaldaki özellik değerleridir.

Bir kiçik obyektnin sınırı çevresinde aktivasyonlar hızlı biçimde değişebiləceği üçün obyekt ayrıntısı taşıyan kanallarda varyansın yüksək olması beklenmektedir. Düz və tekdüze fon bölgelerinin baskın olduğu kanallarda ise varyans daha aşşəbəkəı ola bilər.

Ortalama və varyans değerleri birleştirilərek 1 × 1 konvolyusiya və sigmoid aktivasyonu üzərindən kanal şəbəkəırlıkları oluşturulur. Frekans yolundan gelen uzamsal dikkat ilə kanal yolundan gelen şəbəkəırlıklar birleştirilərek ayrıntı taşıyan bölgeler və kanallar güçlendirilir.

İki modul nasıl birlikte tədqiqatktadır?

EGA modulu əvvəl sığ və derin özelliklerin geometrik konumlarını düzeltmektedir. FDAM daha sonra bu hizalanmış özelliklerdeki kənarları və yüksək tezlikli ayrıntıları güçlendirmektedir.

  1. Sığ katmandan kənar bilgisi çıkarılır.
  2. Kenar və derin anlamsal özelliklerden konum kaymaları tahmin edilir.
  3. Sığ və derin özellikler deformasiya oluna bilən konvolyusiyale hizalanır.
  4. Hizalanmış özellikler DCT ilə tezlik biləşenlerine ayrılır.
  5. Düşük tezliklı fonın bir bölümü bastırılır.
  6. Ortalama və varyans tabanlı kanal dikkati uygulanır.
  7. Güçlendirilmiş özellikler kiçik obyekt aşkarlama başlığına aktarılır.

Kullanılan vərilənlər topluları

VisDron2019

VisDron2019, fərqli şehir, yüksəklik, kamera açısı, ışık və hava koşullarında çekilmiş dron görüntülərindən oluşmaktadır. Tədqiqatda obyekt aşkarlamai alt kümesi istifadə edilmişdir. Bu bölüm təxminən 10.209 görüntü və 540.000’den fazla məhdudlaşdırıcı qutu içermektedir.

Değerlendirilən on sınıf şunlardır:

  • Yaya
  • İnsan
  • Bisiklet
  • Otomobil
  • Van
  • Kamyon
  • Üç tekerlekli araç
  • Brandalı üç tekerlekli araç
  • Otobüs
  • Motosiklet

UAVDT

UAVDT vərilənlər toplusu təxminən on saatlik hava videosundan seçilmiş 100 video dizisi və təxminən 80.000 kare içermektedir. Görüntüler otoyol, kavşak, otopark və ücretli geçiş istasyonu gibi trafik ortamlarını kapsamaktadır. Temel aşkarlama sınıfları otomobil, kamyon və otobüstür.

VisDron fərqli obyekt sınıfları və ölçekleri bakımından geniş bir sınama ortamı sunarken UAVDT, hareket bulanıklığı, sıx trafik və araç örtüşmesi gibi dinamik şehir koşullarına odaklanmaktadır.

Eğitim ortamı və hiperparametreler

DeğişkenKullanılan değer
Grafik işlemciNVIDIA GeForce RTX 4090
Derin öğrenme çerçevəsiPyTorch 2.4.1
Ortam yönetimiAnaconda3
Girdi çözünürlüğü640 × 640 piksel
Eğitim süresi300 epoch
Batch boyutu16
Başlangıç öyrənmə dərəcəsi0,01
Momentum0,937
Ağırlık azalması0,0005
Optimizasyon algoritmasıStokastik Gradyan İnişi

Metin, bütün modellerin eyni vəri artırma işlemleri, təsadüfilik toxumu və təlim tekrarlarıyla karşılaştırılıp karşılaştırılmadığını ayrıntılı biçimde açıklamamaktadır. Model kodu, eğitilmiş şəbəkəırlıklar və tam yapılandırma dosyaları üçün de açık bir depo bşəbəkəlantısı vərilmemiştir.

Değerlendirme ölçütleri

Precision, model tarafından obyekt kimi işaretlenen örneklerin ne kadarının doğru olduğunu ölçmektedir:

\[ \operatorname{Precision}=\frac{TP}{TP+FP}\times100 \]

Recall, görüntülərde gerçekten bulunan obyektlərin ne kadarının yakalandığını göstərir:

\[ \operatorname{Recall}=\frac{TP}{TP+FN}\times100 \]

  • TP: Doğru aşkarlama edilən obyektlər.
  • FP: Gerçekte bulunmadığı hâlde aşkarlama edilən obyektlər.
  • FN: Model tarafından kaçırılan gerçek obyektlər.

Bir sınıf üçün ortalama kesinlik, precision–recall eğrisinin altında kalan alan kimi tanımlanmıştır:

\[ AP=\int_0^1 P(R)\,dR \]

Birden fazla sınıftaki AP değerlerinin ortalaması:

\[ mAP=\frac{1}{K}\sum_{i=1}^{K}AP_i\times100 \]

mAP@0.5, tahmin kutusuyla gerçek kutu arasındaki kesişim-birleşim oranının en az 0,5 olduğu durumda hesaplanmaktadır. mAP@0.5:0.95 ise 0,5 ilə 0,95 arasındaki on fərqli eşikte ortalama aldığı üçün konumlandırma hassasiyetini daha katı biçimde ölçmektedir.

VisDron2019 nəticələrı

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametreGFLOP
YOLOv5n%32,9%40,5%33,1%18,62,5 milyon7,2
YOLOv8n%33,9%41,3%34,7%19,23,2 milyon8,7
YOLOv10n%34,0%42,8%33,7%19,92,3 milyon6,5
YOLOv11n%33,9%42,1%34,9%19,82,6 milyon6,6
YOLOv7-Tiny%36,8%42,8%40,1%20,86,1 milyon13,3
EdgeYolo-t%38,5%48,9%37,8%22,45,5 milyon27,2
YOLO-EFD%38,2%46,6%39,3%22,53,4 milyon12,5

Ana karşılaştırma tablosuna görə YOLO-EFD, YOLOv11n’e kıyasla mAP@0.5 değerini %33,9’dan %38,2’ye, recall değerini %34,9’dan %39,3’e və daha katı mAP değerini %19,8’den %22,5’e çıkarmıştır.

Model bütün karşılaştırma ölçütlerinde tek başına ən yüksək sonucu vərmemektedir. EdgeYolo-t modeli mAP@0.5 və precision bakımından biraz daha yüksək nəticə üretmiştir. YOLO-EFD’nin əsas avantajı, EdgeYolo-t’nin 27,2 GFLOP hesablama yüküne karşılık 12,5 GFLOP ilə benzer doğruluk düzeyine yaklaşmasıdır.

YOLO-EFD’nin hesablama yükü yine de əsas YOLOv11n’e görə belirgin biçimde artmıştır: parametre sayısı 2,6 milyondan 3,4 milyona, GFLOP değeri 6,6’dan 12,5’e yükselmiştir. Dolayısıyla doğruluk artışı karşılığında əsas modele görə təxminən iki kata yaklaşan bir hesablama yükü oluşmaktadır.

UAVDT nəticələrı

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametreGFLOP
YOLOv11n%31,3%37,8%27,5%18,32,6 milyon6,6
YOLOv7-Tiny%31,7%38,3%28,4%18,36,1 milyon13,3
EdgeYolo-t%32,3%40,1%29,6%18,75,5 milyon27,2
YOLO-EFD%32,1%39,3%30,5%18,93,4 milyon12,5

UAVDT’de YOLO-EFD, karşılaştırılan modeller arasındaki ən yüksək recall değerini üretmiştir. YOLOv11n’e görə recall %27,5’ten %30,5’e yükselmiştir. Bu artış, modelin yoğun və bulanık trafik görüntülərində daha az obyekt kaçırdığı yönünde kanıt sunmaktadır.

EdgeYolo-t, mAP@0.5 və precision bakımından küçük bir üstünlüğe sahipken YOLO-EFD daha yüksək recall və mAP@0.5:0.95 üretmiştir. Bu nedenle nəticələr tek bir modelin her ölçütte üstünlüğünden çok, doğruluk və hesablama maliyeti arasında fərqli dengeler bulunduğunu göstərir.

Modül çıkarım deneyleri

YapılandırmamAP@0.5:0.95mAP@0.5PrecisionRecall
YOLOv11n əsas modeli%19,8%33,9%44,1%34,9
Yalnızca EGA%21,5%36,7%45,8%37,2
Yalnızca FDAM%20,8%35,2%45,2%35,8
EGA və FDAM%22,2%38,2%46,6%39,3

EGA modulu tek başına mAP@0.5 değerinde 2,8 puan, recall değerinde 2,3 puan artış sşəbəkəlamıştır. FDAM tek başına daha küçük fakat bütün ölçütlerde pozitif değişim üretmiştir. İki modul birlikte kullanıldığında ən yüksək nəticələra ulaşılmıştır.

Bu bulgu, geometrik hizalama və tezlik ayrıntısı güçlendirmesinin eyni sorunun iki ayrı biləşenine müdahale ettiğini dəstəkləyir. Bununla birlikte ablasiya deneylerinin tek təsadüfilik toxumu mu yoksa birden fazla təlim tekrarının ortalaması mı olduğu belirtilmemiştir.

Frekans filtresi parametresi

αmAP@0.5:0.95mAP@0.5
0,00%21,5%37,8
0,25%22,2%38,2
0,50%21,8%37,5
0,75%21,6%37,4
1,00%21,3%37,2

En iyi nəticə α = 0,25 değerinde elde edilmişdir. Daha güçlü filtreleme uygulandığında performansın kademeli kimi düşmesi, bütün aşşəbəkəı tezlik bilgisinin gereksiz olmadığını göstərir. Nesnenin genel biçimi və bşəbəkəlamı da daha aşşəbəkəı tezlik biləşenlerinde bulunabilir.

Karışıklık matrisleri ne göstərmişdir?

VisDron2019 karışıklık matrislerinde kiçik obyekt sınıflarının fonla karıştırılma oranlarında azalma bildirilmişdir:

  • Yaya sınıfı üçün fon karışması 0,72’den 0,59’a düşmüştür.
  • Motosiklet sınıfında 0,52’den 0,49’a düşmüştür.
  • Bisiklet sınıfında 0,85’ten 0,78’e düşmüştür.
  • Otomobil sınıfının matris köşegen değeri 0,70’ten 0,76’ya yükselmiştir.

Sınıf bazlı görsel karşılaştırmada yaya değeri %25’ten %38’e, motosiklet %26’dan %37’ye, bisiklet %16’dan %29’a, otobüs %37’den %45’e və kamyon %28’den %36’ya yükselmiştir. Bu değerler sınıf bazlı AP nəticələrından ziyade tədqiqatnın qarışıqlıq matrisi və kategori karşılaştırmasında kullandığı sınıflandırma oranlarıdır.

Grad-CAM və örnek görüntülər

Grad-CAM görsellerinde YOLOv11n əsas modelinin bazı sahnelerde ilgisini yol, bina və ya fonın fərqli bölgelerine dşəbəkəıttığı; YOLO-EFD’nin ise aktivasyonlarını araç və yayaların çevresinde daha yoğun topladığı gösterilmiştir.

Bulanık örnek sahnede əsas modelin üç araç, YOLO-EFD’nin ise sekiz araç aşkarlama ettiği bildirilmişdir. Yoğun trafik örneğinde YOLO-EFD kutularının birbirine yakın araçların sınırlarına daha sıkı oturduğu görülmektedir.

Bu görüntülər model davranışını açıklamaya yardımcı olsa da seçilmiş birkaç örnekten oluşmaktadır. Tekil görüntülər, bütün vərilənlər toplusundeki performansın və ya gerçek uçuş koşullarındaki güvənilirliğin tek başına kanıtı deyil.

Tədqiqatnın güclü tərəfləri

  • Yalnızca kavramsal bir öneri değil, çalıştırılmış bir obyekt aşkarlama modeli sunulmuştur.
  • Model iki fərqli və yaygın UAV vərilənlər toplusu üzərində qiymətləndirilmişdir.
  • EGA və FDAM modullerinin ayrı etkiləri ablasiya deneyiyle incelenmiştir.
  • Frekans filtresinin α parametresi üçün kontrollü karşılaştırma yapılmıştır.
  • Parametre sayısı və GFLOP bilgiləri doğruluk ölçütleriyle birlikte raporlanmıştır.
  • Karışıklık matrisi, Grad-CAM və aşkarlama görüntüləriyle nicel nəticələra görsel açıklamalar eklenmiştir.
  • Modelin başarısız olabildiği basit fon və aşırı küçük hedef koşulları nəticə bölümünde açıkça belirtilmiştir.

İç tutarsızlıklar və teknik məhdudiyyətlər

  • Özet, öne çıkan nəticələr və ablasiya tablosu VisDron2019 üçün %22,2 mAP@0.5:0.95 bildirirken ana karşılaştırma tablosu %22,5 vərmektedir.
  • YOLOv11n precision değeri ana karşılaştırma tablosunda %42,1, ablasiya tablosunda %44,1 kimi yazılmıştır.
  • Bu fərqlilıkların ayrı təlim tekrarlarından, fərqli doğrulama alt kümelerinden və ya yazım xətasından mənbəlanıp mənbəlanmadığı açıklanmamıştır.
  • FDAM mimarisini gösteren Şekil 4’ün başlığı yanlış biçimde EGA mimarisi kimi yazılmıştır. Metindeki bazı şekil numarası yönlendirmeleri de gerçek görsellerle uyuşmamaktadır.
  • Sonuçlar üçün standart kənaraçıxma, güvən aralığı, istatistiksel anlamlılık və ya birden fazla təsadüfilik toxumu raporlanmamıştır.
  • Karşılaştırılan bütün modellerin eyni kod tabanı, vəri artırma ayarları və təlim koşulları altında yeniden eğitilip eğitilmediği yeterince açıklanmamıştır.
  • Gerçek zamanlı kullanım iddiasına rşəbəkəmen FPS, görüntü başına gecikme, bellek istifadəsi və güç tüketimi ölçülmemiştir.
  • Deneyler RTX 4090 üzərində yapılmış; dron üzərində kullanılabiləcek gömülü bir işlemci, Jetson platformu və ya başka bir uç cihaz üzərində sınama yapılmamıştır.
  • Temel YOLOv11n’e görə GFLOP değeri 6,6’dan 12,5’e yükseldiği üçün hesablama maliyeti belirgin biçimde artmıştır.
  • Model kodu, eğitilmiş şəbəkəırlıklar, vəri bölümleme dosyaları və eksiksiz hiperparametre yapılandırması üçün açık bşəbəkəlantı vərilmemiştir.
  • UAVDT’nin hava, hündürlük, kamera açısı və yoğunluk gibi öznitelikleri bulunmasına rşəbəkəmen nəticələr bu koşullara görə ayrı ayrı raporlanmamıştır.
  • Tədqiqat, basit fonlarda və aşırı küçük seyrek hedeflerde yüksək tezlikli gürültüye aşırı odaklanarak yanlış aşkarlama üretebildiğini kabul etmektedir.

Tədqiqat neyi dəstəkləyir?

Sonuçlar, fərqli çözünürlüklerdeki özelliklerin kənar güdümlü deformasiya oluna bilən konvolyusiyale hizalanmasının YOLOv11n’in kiçik obyekt performansını artırabildiğini dəstəkləyir. DCT tabanlı yüksək tezlik güçlendirmesinin de özellikle kənarları zayıf və ya bulanık küçük hedeflerde ek katkı sşəbəkəlayabiləceğine ilişkin eksperimental bulgu sunulmuştur.

İki modulun birlikte kullanılması, incelenen vərilənlər toplularınde tek başlarına kullanılmalarına görə daha yüksək nəticə üretmiştir. Model ayrıca EdgeYolo-t gibi daha şəbəkəır bir metodle benzer doğruluk aralığına daha aşşəbəkəı parametre və GFLOP değeriyle yaklaşmıştır.

Tədqiqat neyi sübut etmir?

Tədqiqat YOLO-EFD’nin bütün UAV görəvlerinde və ya bütün kiçik obyekt vərilənlər toplularınde en iyi model olduğunu sübut etmir. Bazı karşılaştırma modelleri belirli ölçütlerde daha yüksək nəticə üretmiştir. Deneyler yalnızca iki kamu vərilənlər toplusu və raporlanan tek təlim düzeniyle sınırlıdır.

Modelin gerçek bir dron üzərində gerçek zamanlı çalıştığı, aşşəbəkəı enerji tükettiği və ya kötü hava, gece, sis, titreşim və fərqli kamera sistemlerinde eyni performansı koruduğu gösterilmemiştir. GFLOP və parametre sayısı, gerçek cihaz gecikmesinin doğrudan karşılığı deyil.

Sonuçlar ayrıca modelin arama-kurtarma, güvənlik və ya trafik yönetimi gibi kritik alanlarda tek başına güvənilir karar vərebiləceğini göstermez. Bu tür uygulamalar üçün yanlış negatiflerin, yanlış pozitiflerin və fərqli çevresel koşulların ayrı ayrı doğrulanması lazımdır.

Türkiyə açısından mümkün əhəmiyyəti

Tədqiqatda önerilən yaklaşım; Türkiyə’de dron tabanlı trafik izleme, afet sonrası alan taraması, orman yangını gözetimi, tarımsal görüntüleme, kıyı kontrolü və altyapı denetimi gibi alanlara metodsel kimi aktarılabilir. Özellikle yüksəkten çekilən görüntülərde küçük araçların və ya insanların ayırt edilmesi, bu uygulamaların ortak teknik sorunlarından biridir.

Türkiyə’de uygulanacak bir sistem üçün modelin yerel şehir dokusu, fərqli yol işaretleri, araç növləri, bitki örtüsü, topoğrafya, hava koşulları və istifadə olunan dron kameralarıyla yeniden eğitilmesi lazımdır. VisDron və UAVDT nəticələrı doğrudan Türkiyə’deki operasyonel doğruluğu temsil etmez.

Pratik kullanım əvvəlsinde Türkiyə’ye ait görüntülər üzərində alan dışı testler, gece və kötü hava sınamaları, gömülü donanım gecikme ölçümleri, enerji tüketimi, güvən aralıqları və xəta sınıflandırması yapılmalıdır.

Tədqiqatın Metodu və Nəticələri

Yöntem biləşeniUygulamaTemel bulguYorum sınırı
Temel modelYOLOv11nKüçük obyekt yolu EGA və FDAM ilə değiştirilmiştirBaşka YOLO ölçekleri sınanmamıştır
EGA kənar çıkarımı3 × 3 Scharr filtreleriYatay və düşey gradyanlardan kənar haritası üretilmiştirGüçlü fon kənarları da yanıt oluşturabilir
EGA hizalamaKenar və anlamsal özelliklerle konum kayması; deformasiya oluna bilən konvolyusiyaSığ və derin özelliklerin geometrik uyumu artırılmıştırKonum kaymalarının ayrı doğruluk analizi vərilmemiştir
FDAM tezlik yoluDCT, yüksək geçiren maske və ters DCTYüksek tezliklı kənar və doku ayrıntıları güçlendirilmiştirAşırı filtreleme yararlı bilgiyi azaltabilir
FDAM kanal yoluKanal ortalaması və varyansıAyrıntı içeren kanallara daha yüksək şəbəkəırlık vərilmiştirAlternatif dikkat metodleriyle ayrıntılı karşılaştırma yoktur
VisDron2019Yaklaşık 10.209 görüntü, 540.000’den fazla kutu və 10 sınıf%38,2 mAP@0.5 və %39,3 recallmAP@0.5:0.95 sonucu metinde %22,2 və %22,5 kimi iki fərqli değerde vərilmiştir
UAVDT100 video dizisi və təxminən 80.000 kare%32,1 mAP@0.5 və %30,5 recallVideo takibi və ya zamansal modelleme yapılmamıştır
AblasyonEGA, FDAM və birleşik model ayrı ayrı sınanmıştırBirleşik yapı ən yüksək nəticələrı vərmiştirÇoklu təlim tekrarları və standart kənaraçıxma yoktur
α parametresi0,00–1,00 aralığında beş değerEn iyi değer 0,25 olmuşturYalnızca VisDron doğrulama kümesinde raporlanmıştır
Hesaplama maliyeti3,4 milyon parametre və 12,5 GFLOPEdgeYolo-t’den daha aşşəbəkəı hesablama maliyetiGerçek cihaz FPS və enerji ölçümü yoktur

En mühüm rəqəmsal nəticələr

  • VisDron2019 ana tablosunda YOLO-EFD üçün mAP@0.5 %38,2 kimi vərilmiştir.
  • VisDron2019 recall değeri %39,3, precision değeri %46,6’dır.
  • VisDron2019 mAP@0.5:0.95 değeri ana tabloda %22,5; özet və ablasiya tablosunda %22,2’dir.
  • UAVDT’de mAP@0.5 %32,1, mAP@0.5:0.95 %18,9, precision %39,3 və recall %30,5’tir.
  • EGA modulu tek başına əsas modele görə mAP@0.5 değerini 2,8 puan artırmıştır.
  • FDAM modulu tek başına mAP@0.5 değerini 1,3 puan artırmıştır.
  • İki modul birlikte mAP@0.5 değerini %33,9’dan %38,2’ye yükseltmiştir.
  • En uygun tezlik maskesi parametresi α = 0,25 kimi bulunmuştur.
  • Model 3,4 milyon parametre və 12,5 GFLOP hesablama yüküne sahiptir.
  • EdgeYolo-t 27,2 GFLOP ilə %38,5 mAP@0.5 üretirken YOLO-EFD 12,5 GFLOP ilə %38,2 üretmiştir.

Operasyonel kullanımdan əvvəl yapılması gerekenler

  1. Model kodu, şəbəkəırlıkları və vəri bölümleme dosyaları yayımlanarak nəticələrın yeniden üretilmesi.
  2. En az üç ila beş fərqli təsadüfilik toxumu ilə ortalama və standart kənaraçıxmaların raporlanması.
  3. Türkiyə’de çekilmiş dron görüntüləri üzərində dış doğrulama yapılması.
  4. Gece, sis, yşəbəkəmur, titreşim, fərqli yüksəklik və fərqli kamera çözünürlüklerinin ayrı ayrı sınanması.
  5. Jetson və ya benzeri uç donanımlarda FPS, gecikme, bellek və güç tüketiminin ölçülmesi.
  6. Yanlış pozitif və yanlış negatiflerin uygulama türüne görə maliyet analizinin yapılması.
  7. Basit fonlarda yüksək tezlikli gürültüye aşırı odaklanmayı azaltacak uyarlanabilir filtrelerin geliştirilmesi.
  8. Video obyekt aşkarlamai və çoklu obyekt takibi üçün zamansal tutarlılığın modele eklenmesi.

Mənbə və Metod Qeydi

Tədqiqatnın özgün adı: YOLO-EFD: Edge-guided and Frequency-domain Dual Enhancement for Small Object Detection in UAV Aerial Imagery

Yazarlar və doğru sıralama: Xin Song, Peng Li, Xuecong Liu, Xin Zhao.

Eş birinci yazar: Tədqiqatda eş birinci yazarlık və ya eş katkı beyanı yoxdur.

Sorumlu/ilətişim yazarı: Xin Song.

Kurumsal bşəbəkəlantılar:

  • School of Computer Science and Engineering, Northeastern Univərsity, Shenyang, Liaoning, Çin.
  • Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern Univərsity at Qinhuangdao, Qinhuangdao, Hebei, Çin.
  • Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment, Chaoyue Technology Co., Ltd., Jinan, Shandong, Çin.

DOI:10.2139/ssrn.7031768

Resmî tədqiqat sayfası:SSRN resmî kaydı

Yayın platformu: SSRN.

Yüklenme tarihi: 1 Temmuz 2026.

Dergi: Hakemli bir dergi yayını və ya belirli bir dergi adı doğrulanamamıştır. Sayfa alt bilgisinde “Preprint submitted to Elsevier” ifadesi yer almakta, ancak hedef dergi belirtilmemektedir.

Hakemlik durumu: Tədqiqat hakem qiymətləndirməsindən keçməmiş bir preprinttir.

Kaynak türü: Yeni bir derin öğrenme mimarisi, iki kamu vərilənlər toplusu üzərində karşılaştırmalı deneyler, modul çıkarım testleri və parametre analizi içeren hesablamalı bilgisayarlı görü tədqiqatsı.

Finansman: Tədqiqat, Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment Açık Tədqiqat Proje Fonu tarafından KT25500300-lab numarasıyla desteklenmiştir.

Üretken yapay zekâ istifadəsi: Yazarlar, DeepSeek’i dil düzeltmesi və paragraf düzenlemesi amacıyla kullandıklarını; nihai içeriği gözden geçirerek sorumluluğu üstlendiklerini bildirmiştir.

Çıkar çatışması: Yüklenen sürümde açık bir çıkar çatışması beyanı yoxdur.

Veri və kod erişimi: VisDron2019 və UAVDT kamu vərilənlər toplularıdir. Bununla birlikte YOLO-EFD kodu, eğitilmiş şəbəkəırlıkları, rastgelelik tohumları və tam deney yapılandırması üçün bşəbəkəlantı vərilmemiştir.

Bibliyografik uyarı: Aynı başlık və eyni yazarlarla SSRN’de 10.2139/ssrn.6878454 DOI’li daha eski bir kayıt da vardır. Yüklenen sürümün bütün sayfalarında 7031768 kayıt numarası bulunduğundan bu makalede 10.2139/ssrn.7031768 DOI’si esas alınmıştır.

Bu Türkçe açıklama, yüklenen tədqiqatnın metni, tənlikləri, tabloları, şəbəkə şemaları, ısı haritaları, karışıklık matrisleri və deney görselleri əsas alınarak hazırlanmıştır. Bilimsel nəticələr üçün dış mənbə eklenmemiş; dış kontrol yalnızca başlık, yazarlar, DOI, SSRN kayıt tarihi və sorumlu yazar gibi bibliyografik kimlik bilgilərinin doğrulanmasıyla sınırlandırılmıştır.

Tədqiqatnın en mühüm raporlama sorunu, VisDron2019 mAP@0.5:0.95 və əsas model precision değerlerinin fərqli bölümlerde uyuşmamasıdır. Bu nedenle nəticələr aktarılırken ana karşılaştırma tablosundaki %22,5 ilə özet və ablasiya tablosundaki %22,2 değerleri birlikte belirtilmelidir.

Tədqiqat gerçek bir dron donanımında saha doğrulaması, gecikme ölçümü və ya enerji tüketimi deneyi sunmamaktadır. Bu nedenle “gerçek zamanlı və uç cihazlara uygun” qiymətləndirməsi parametre və GFLOP nəticələrına dayanan bir potansiyel kimi okunmalı, doğrulanmış operasyonel performans kimi sunulmamalıdır.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy