Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Mühendislik / YOLO-EFD: Drone Görüntülerindeki Küçük Nesneleri Kenar ve Frekans Bilgisiyle Daha İyi Tespit Etmek
Mühendislik

YOLO-EFD: Drone Görüntülerindeki Küçük Nesneleri Kenar ve Frekans Bilgisiyle Daha İyi Tespit Etmek

Drone ve uzaktan algılama görüntülerinde otomobil, yaya, bisiklet veya motosiklet gibi nesneler bazen yalnızca birkaç piksel büyüklüğünde görünür.

30/07/2026  Veri Anla 31 görüntüleme
YOLO-EFD: Drone Görüntülerindeki Küçük Nesneleri Kenar ve Frekans Bilgisiyle Daha İyi Tespit Etmek

Drone ve uzaktan algılama görüntülerinde otomobil, yaya, bisiklet veya motosiklet gibi nesneler bazen yalnızca birkaç piksel büyüklüğünde görünür. Görüntü bulanıklığı, yoğun trafik, örtüşen nesneler ve karmaşık arka planlar, standart nesne tespit sistemlerinin bu küçük hedefleri kaçırmasına veya yanlış konumlandırmasına neden olabilir. Bu çalışma, YOLOv11n tabanlı yeni bir küçük nesne tespit modeli olan YOLO-EFD’yi önermektedir.

YOLO-EFD iki özel modülden oluşmaktadır. Kenar Güdümlü Çift Yollu Hizalama Modülü, farklı çözünürlüklerdeki özellik haritalarını Scharr kenar bilgisi ve deforme edilebilir evrişim kullanarak aynı geometrik konuma hizalamaya çalışmaktadır. Frekans Alanlı Çift Dikkat Modülü ise Ayrık Kosinüs Dönüşümü aracılığıyla nesne kenarları ve dokularıyla ilişkili yüksek frekanslı bilgiyi güçlendirmekte, düşük frekanslı arka plan bileşenlerini bastırmaktadır.

Model, VisDrone2019 ve UAVDT veri kümeleri üzerinde test edilmiştir. Ana karşılaştırma tablosuna göre VisDrone2019’da %38,2 mAP@0.5, %22,5 mAP@0.5:0.95, %46,6 precision ve %39,3 recall elde edilmiştir. UAVDT’de ise %32,1 mAP@0.5, %18,9 mAP@0.5:0.95 ve %30,5 recall bildirilmiştir. Model 3,4 milyon parametre ve 12,5 GFLOP hesaplama yüküne sahiptir.

Sonuçlar, kenar tabanlı hizalama ile frekans alanındaki ayrıntı güçlendirmesinin küçük nesne tespitinde birlikte yarar sağlayabileceğini göstermektedir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiştir; gerçek bir drone üzerindeki gecikme, saniyedeki kare sayısı ve enerji tüketimi ölçülmemiştir. Ayrıca temel sonuç tablolarındaki bazı sayısal değerler birbiriyle tam olarak uyuşmamaktadır.

Küçük nesne tespiti neden zor bir problemdir?

Havadan çekilen görüntülerde bir nesne, kameranın yüksekliği ve görüş açısı nedeniyle görüntünün çok küçük bir bölümünü kaplayabilir. Bir otomobil veya yaya yalnızca birkaç pikselden oluştuğunda renk, doku, biçim ve sınır bilgileri oldukça zayıflar. Evrişimli sinir ağlarındaki ardışık örnek azaltma işlemleri de bu sınırlı bilgiyi daha fazla kaybedebilir.

Çalışmanın ilk şeklinde iki temel sorun görselleştirilmiştir. Bulanık sahnede uzak nesnelerin kenarları ve dokuları atmosferik etki, odak kaybı veya platform hareketi nedeniyle silikleşmektedir. Yoğun sahnede ise çok sayıda araç birbirine yakın konumlanmış, bazı nesneler kısmen örtülmüş ve nesneler arasındaki sınırlar belirsizleşmiştir.

Bu koşullarda nesne tespit modeli iki ayrı soruya doğru yanıt vermelidir:

  • Nesne nerede? Farklı ölçeklerdeki özellik haritalarının geometrik olarak doğru hizalanması gerekir.
  • Görülen ayrıntı gerçekten bir nesneye mi ait? Nesne kenarlarının arka plan dokusundan ve görüntü gürültüsünden ayrılması gerekir.

YOLO-EFD’nin iki modülü bu soruları ayrı fakat birbirini tamamlayan işlemlerle ele almaktadır.

Standart YOLO özellik birleştirmesindeki sorun

YOLO ailesindeki nesne tespit ağları, sığ katmanlardan gelen yüksek çözünürlüklü konum bilgisiyle derin katmanlardan gelen anlamsal bilgiyi birleştirir. Geleneksel yaklaşımda derin özellik haritası büyütülür ve sığ özellik haritasıyla doğrudan birleştirilir.

Ancak örnek azaltma ve tekrar büyütme işlemlerinden geçmiş derin özellikler, sığ katmandaki piksellerle tam olarak aynı geometrik konumu temsil etmeyebilir. Büyük nesnelerde birkaç piksellik sapma tolere edilebilirken yalnızca 10–20 piksel büyüklüğündeki bir hedefte aynı sapma, nesne kutusunun önemli bir bölümünü etkileyebilir.

Bu nedenle çalışma, küçük nesne tespit başlığına giden özellik yolundaki standart büyütme ve birleştirme işlemini kenar bilgisiyle yönlendirilen dinamik bir hizalama modülüyle değiştirmiştir.

YOLO-EFD’nin genel mimarisi

Model, YOLOv11n’in omurga–boyun–tespit başlığı yapısını korumaktadır. Özel modüller esas olarak ağın çok ölçekli özelliklerin birleştirildiği boyun bölümüne yerleştirilmiştir.

  • Omurga: Girdi görüntüsünden farklı çözünürlüklerde özellik haritaları üretir.
  • EGA modülü: Sığ ve derin özellikleri kenar bilgisi yardımıyla geometrik olarak hizalar.
  • FDAM modülü: Hizalanmış özelliklerdeki yüksek frekanslı kenar ve doku bilgisini güçlendirir.
  • Tespit başlıkları: Nesne sınıflarını ve sınırlayıcı kutuları tahmin eder.

Özel modüllerin yalnızca küçük nesne başlığına giden özellik yoluna yerleştirilmesi, bütün ağı ağırlaştırmadan küçük hedeflere yönelik temsil gücünün artırılmasını amaçlamaktadır.

Kenar Güdümlü Çift Yollu Hizalama Modülü

Scharr operatörüyle kenar çıkarımı

EGA olarak adlandırılan modül, önce sığ ve yüksek çözünürlüklü özellik haritasındaki yatay ve düşey yoğunluk değişimlerini Scharr filtreleriyle hesaplamaktadır:

\[ E_x=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},x}) \]

\[ E_y=\operatorname{Conv}(P_i,K_{\mathrm{Scharr},y}) \]

  • Pi: Sığ katmandan gelen yüksek çözünürlüklü özellik haritasıdır.
  • KScharr,x: Yatay yöndeki yoğunluk değişimini hesaplayan Scharr çekirdeğidir.
  • KScharr,y: Düşey yöndeki yoğunluk değişimini hesaplayan Scharr çekirdeğidir.
  • Ex ve Ey: Yatay ve düşey gradyan yanıtlarıdır.

İki yöndeki gradyanlar daha sonra tek bir kenar büyüklüğü haritasında birleştirilmektedir:

\[ E=\sqrt{E_x^2+E_y^2+\varepsilon} \]

Buradaki ε, karekök hesabının sayısal kararlılığını sağlayan küçük bir sabittir. Ortaya çıkan E haritası, küçük nesnelerin dış sınırlarının bulunabileceği bölgeleri temsil eden geometrik ön bilgidir.

Anlamsal ve geometrik bilginin birlikte kullanılması

Yalnızca kenar haritasının kullanılması yeterli değildir. Yol çizgileri, bina sınırları ve gölgeler de güçlü kenar üretebilir. Bu nedenle çalışma, derin katmandaki anlamsal özelliklerle kenar haritasını birlikte kullanmaktadır.

Derin özellik haritası sığ haritanın çözünürlüğüne büyütüldükten sonra kenar haritasıyla kanal yönünde birleştirilir. Deforme edilebilir evrişimde kullanılacak konum kaymaları şu işlemle tahmin edilir:

\[ \Delta=\operatorname{Conv}_{\mathrm{offset}}\left(\operatorname{Concat}(P'_{i+1},E)\right) \]

  • P′i+1: Derin katmandan gelen ve sığ haritanın boyutuna büyütülen anlamsal özelliktir.
  • E: Sığ katmandan çıkarılan kenar haritasıdır.
  • Δ: Deforme edilebilir evrişimin hangi noktalardan örnek alacağını belirleyen konum kayma alanıdır.

Derin özellikler modelin hangi yapının bir araç, yaya veya başka bir nesne olabileceğini anlamasına; kenar haritası ise nesnenin sınırının nerede bulunduğunu tahmin etmesine yardımcı olur.

Deforme edilebilir çift yol hizalaması

Tahmin edilen aynı kayma alanı hem sığ hem derin özelliklere uygulanmaktadır:

\[ P_i^{\mathrm{aligned}}=\mathcal{D}(P_i,\Delta) \]

\[ {P'}_{i+1}^{\mathrm{aligned}}=\mathcal{D}(P'_{i+1},\Delta) \]

𝒟, deforme edilebilir evrişim işlemini temsil eder. Standart evrişim sabit bir örnekleme ızgarası kullanırken deforme edilebilir evrişim, tahmin edilen kaymalara göre farklı konumlardan bilgi toplayabilir.

Hizalanan iki özellik haritası birleştirilip 1 × 1 evrişimden geçirilir:

\[ F_{\mathrm{out}}=\operatorname{Conv}_{1\times1}\left(\operatorname{Concat}(P_i^{\mathrm{aligned}},{P'}_{i+1}^{\mathrm{aligned}})\right) \]

Böylece küçük nesne başlığına gönderilen özelliklerin hem ayrıntılı konum bilgisini hem de derin anlamsal bilgiyi taşıması amaçlanmıştır.

Frekans Alanlı Çift Dikkat Modülü

Neden frekans alanı kullanılmıştır?

Bir görüntünün geniş ve yavaş değişen bölgeleri düşük frekanslı bileşenlerde; keskin kenarlar, ince dokular ve ani parlaklık değişimleri ise yüksek frekanslı bileşenlerde temsil edilir. Küçük nesnelerin ayırt edilebilmesi için gerekli olan sınır ve doku bilgileri çoğunlukla yüksek frekans tarafında yer alır.

Evrişimli ağlardaki örnek azaltma işlemleri yüksek frekanslı ayrıntıları yumuşatabilir. FDAM modülü, bu ayrıntıları doğrudan frekans alanında ayırmayı ve güçlendirmeyi hedeflemektedir.

Ayrık Kosinüs Dönüşümü

Uzamsal özellik haritası iki boyutlu Ayrık Kosinüs Dönüşümüyle frekans alanına aktarılmaktadır:

\[ F(u,v)=\mathcal{T}_{\mathrm{DCT}}\left(f(x,y)\right) \]

  • f(x,y): Uzamsal alandaki girdi özellik haritasıdır.
  • F(u,v): DCT sonrasında elde edilen frekans bileşenleridir.
  • u ve v: Frekans düzlemindeki yatay ve düşey koordinatlardır.

DCT spektrumunun sol üst bölgesi düşük frekanslı, sağ alt bölgelere doğru ilerleyen bileşenler ise daha yüksek frekanslı bilgiyi temsil etmektedir.

Yüksek geçiren frekans maskesi

Çalışmada α parametresiyle kontrol edilen bir maske kullanılarak düşük frekanslı bölgenin bir kısmı bastırılmaktadır:

\[ F_{\mathrm{filtered}}(u,v)=F(u,v)\odot M(u,v;\alpha) \]

M(u,v;α) frekans maskesini, ⊙ ise eleman bazlı çarpımı temsil eder. Filtrelenen spektrum ters DCT ile tekrar uzamsal alana çevrilerek kenar ve ince ayrıntıları öne çıkaran bir dikkat haritası üretilmektedir.

α değeri çok küçük olduğunda yeterli arka plan bastırması yapılamayabilir. Çok büyük olduğunda ise nesneye ait yararlı düşük ve orta frekanslı bilgiler de kaybolabilir. Deneylerde en iyi değer α = 0,25 olarak bulunmuştur.

İkinci dereceden kanal dikkati

FDAM’ın ikinci yolu, her özellik kanalının yalnızca ortalamasını değil, varyansını da hesaplamaktadır:

\[ \mu_c=\mathbb{E}[x_c] \]

\[ \sigma_c^2=\mathbb{E}\left[(x_c-\mu_c)^2\right] \]

  • μc: c kanalındaki ortalama aktivasyondur.
  • σc2: Aktivasyonların uzamsal varyansıdır.
  • xc: İlgili kanaldaki özellik değerleridir.

Bir küçük nesnenin sınırı çevresinde aktivasyonlar hızlı biçimde değişebileceği için nesne ayrıntısı taşıyan kanallarda varyansın yüksek olması beklenmektedir. Düz ve tekdüze arka plan bölgelerinin baskın olduğu kanallarda ise varyans daha düşük olabilir.

Ortalama ve varyans değerleri birleştirilerek 1 × 1 evrişim ve sigmoid aktivasyonu üzerinden kanal ağırlıkları oluşturulur. Frekans yolundan gelen uzamsal dikkat ile kanal yolundan gelen ağırlıklar birleştirilerek ayrıntı taşıyan bölgeler ve kanallar güçlendirilir.

İki modül nasıl birlikte çalışmaktadır?

EGA modülü önce sığ ve derin özelliklerin geometrik konumlarını düzeltmektedir. FDAM daha sonra bu hizalanmış özelliklerdeki kenarları ve yüksek frekanslı ayrıntıları güçlendirmektedir.

  1. Sığ katmandan kenar bilgisi çıkarılır.
  2. Kenar ve derin anlamsal özelliklerden konum kaymaları tahmin edilir.
  3. Sığ ve derin özellikler deforme edilebilir evrişimle hizalanır.
  4. Hizalanmış özellikler DCT ile frekans bileşenlerine ayrılır.
  5. Düşük frekanslı arka planın bir bölümü bastırılır.
  6. Ortalama ve varyans tabanlı kanal dikkati uygulanır.
  7. Güçlendirilmiş özellikler küçük nesne tespit başlığına aktarılır.

Kullanılan veri kümeleri

VisDrone2019

VisDrone2019, farklı şehir, yükseklik, kamera açısı, ışık ve hava koşullarında çekilmiş drone görüntülerinden oluşmaktadır. Çalışmada nesne tespiti alt kümesi kullanılmıştır. Bu bölüm yaklaşık 10.209 görüntü ve 540.000’den fazla sınırlayıcı kutu içermektedir.

Değerlendirilen on sınıf şunlardır:

  • Yaya
  • İnsan
  • Bisiklet
  • Otomobil
  • Van
  • Kamyon
  • Üç tekerlekli araç
  • Brandalı üç tekerlekli araç
  • Otobüs
  • Motosiklet

UAVDT

UAVDT veri kümesi yaklaşık on saatlik hava videosundan seçilmiş 100 video dizisi ve yaklaşık 80.000 kare içermektedir. Görüntüler otoyol, kavşak, otopark ve ücretli geçiş istasyonu gibi trafik ortamlarını kapsamaktadır. Temel tespit sınıfları otomobil, kamyon ve otobüstür.

VisDrone farklı nesne sınıfları ve ölçekleri bakımından geniş bir sınama ortamı sunarken UAVDT, hareket bulanıklığı, yoğun trafik ve araç örtüşmesi gibi dinamik şehir koşullarına odaklanmaktadır.

Eğitim ortamı ve hiperparametreler

DeğişkenKullanılan değer
Grafik işlemciNVIDIA GeForce RTX 4090
Derin öğrenme çerçevesiPyTorch 2.4.1
Ortam yönetimiAnaconda3
Girdi çözünürlüğü640 × 640 piksel
Eğitim süresi300 epoch
Batch boyutu16
Başlangıç öğrenme oranı0,01
Momentum0,937
Ağırlık azalması0,0005
Optimizasyon algoritmasıStokastik Gradyan İnişi

Metin, bütün modellerin aynı veri artırma işlemleri, rastgelelik tohumu ve eğitim tekrarlarıyla karşılaştırılıp karşılaştırılmadığını ayrıntılı biçimde açıklamamaktadır. Model kodu, eğitilmiş ağırlıklar ve tam yapılandırma dosyaları için de açık bir depo bağlantısı verilmemiştir.

Değerlendirme ölçütleri

Precision, model tarafından nesne olarak işaretlenen örneklerin ne kadarının doğru olduğunu ölçmektedir:

\[ \operatorname{Precision}=\frac{TP}{TP+FP}\times100 \]

Recall, görüntülerde gerçekten bulunan nesnelerin ne kadarının yakalandığını göstermektedir:

\[ \operatorname{Recall}=\frac{TP}{TP+FN}\times100 \]

  • TP: Doğru tespit edilen nesneler.
  • FP: Gerçekte bulunmadığı hâlde tespit edilen nesneler.
  • FN: Model tarafından kaçırılan gerçek nesneler.

Bir sınıf için ortalama kesinlik, precision–recall eğrisinin altında kalan alan olarak tanımlanmıştır:

\[ AP=\int_0^1 P(R)\,dR \]

Birden fazla sınıftaki AP değerlerinin ortalaması:

\[ mAP=\frac{1}{K}\sum_{i=1}^{K}AP_i\times100 \]

mAP@0.5, tahmin kutusuyla gerçek kutu arasındaki kesişim-birleşim oranının en az 0,5 olduğu durumda hesaplanmaktadır. mAP@0.5:0.95 ise 0,5 ile 0,95 arasındaki on farklı eşikte ortalama aldığı için konumlandırma hassasiyetini daha katı biçimde ölçmektedir.

VisDrone2019 sonuçları

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametreGFLOP
YOLOv5n%32,9%40,5%33,1%18,62,5 milyon7,2
YOLOv8n%33,9%41,3%34,7%19,23,2 milyon8,7
YOLOv10n%34,0%42,8%33,7%19,92,3 milyon6,5
YOLOv11n%33,9%42,1%34,9%19,82,6 milyon6,6
YOLOv7-Tiny%36,8%42,8%40,1%20,86,1 milyon13,3
EdgeYolo-t%38,5%48,9%37,8%22,45,5 milyon27,2
YOLO-EFD%38,2%46,6%39,3%22,53,4 milyon12,5

Ana karşılaştırma tablosuna göre YOLO-EFD, YOLOv11n’e kıyasla mAP@0.5 değerini %33,9’dan %38,2’ye, recall değerini %34,9’dan %39,3’e ve daha katı mAP değerini %19,8’den %22,5’e çıkarmıştır.

Model bütün karşılaştırma ölçütlerinde tek başına en yüksek sonucu vermemektedir. EdgeYolo-t modeli mAP@0.5 ve precision bakımından biraz daha yüksek sonuç üretmiştir. YOLO-EFD’nin temel avantajı, EdgeYolo-t’nin 27,2 GFLOP hesaplama yüküne karşılık 12,5 GFLOP ile benzer doğruluk düzeyine yaklaşmasıdır.

YOLO-EFD’nin hesaplama yükü yine de temel YOLOv11n’e göre belirgin biçimde artmıştır: parametre sayısı 2,6 milyondan 3,4 milyona, GFLOP değeri 6,6’dan 12,5’e yükselmiştir. Dolayısıyla doğruluk artışı karşılığında temel modele göre yaklaşık iki kata yaklaşan bir hesaplama yükü oluşmaktadır.

UAVDT sonuçları

ModelmAP@0.5PrecisionRecallmAP@0.5:0.95ParametreGFLOP
YOLOv11n%31,3%37,8%27,5%18,32,6 milyon6,6
YOLOv7-Tiny%31,7%38,3%28,4%18,36,1 milyon13,3
EdgeYolo-t%32,3%40,1%29,6%18,75,5 milyon27,2
YOLO-EFD%32,1%39,3%30,5%18,93,4 milyon12,5

UAVDT’de YOLO-EFD, karşılaştırılan modeller arasındaki en yüksek recall değerini üretmiştir. YOLOv11n’e göre recall %27,5’ten %30,5’e yükselmiştir. Bu artış, modelin yoğun ve bulanık trafik görüntülerinde daha az nesne kaçırdığı yönünde kanıt sunmaktadır.

EdgeYolo-t, mAP@0.5 ve precision bakımından küçük bir üstünlüğe sahipken YOLO-EFD daha yüksek recall ve mAP@0.5:0.95 üretmiştir. Bu nedenle sonuçlar tek bir modelin her ölçütte üstünlüğünden çok, doğruluk ve hesaplama maliyeti arasında farklı dengeler bulunduğunu göstermektedir.

Modül çıkarım deneyleri

YapılandırmamAP@0.5:0.95mAP@0.5PrecisionRecall
YOLOv11n temel modeli%19,8%33,9%44,1%34,9
Yalnızca EGA%21,5%36,7%45,8%37,2
Yalnızca FDAM%20,8%35,2%45,2%35,8
EGA ve FDAM%22,2%38,2%46,6%39,3

EGA modülü tek başına mAP@0.5 değerinde 2,8 puan, recall değerinde 2,3 puan artış sağlamıştır. FDAM tek başına daha küçük fakat bütün ölçütlerde pozitif değişim üretmiştir. İki modül birlikte kullanıldığında en yüksek sonuçlara ulaşılmıştır.

Bu bulgu, geometrik hizalama ve frekans ayrıntısı güçlendirmesinin aynı sorunun iki ayrı bileşenine müdahale ettiğini desteklemektedir. Bununla birlikte ablasyon deneylerinin tek rastgelelik tohumu mu yoksa birden fazla eğitim tekrarının ortalaması mı olduğu belirtilmemiştir.

Frekans filtresi parametresi

αmAP@0.5:0.95mAP@0.5
0,00%21,5%37,8
0,25%22,2%38,2
0,50%21,8%37,5
0,75%21,6%37,4
1,00%21,3%37,2

En iyi sonuç α = 0,25 değerinde elde edilmiştir. Daha güçlü filtreleme uygulandığında performansın kademeli olarak düşmesi, bütün düşük frekans bilgisinin gereksiz olmadığını göstermektedir. Nesnenin genel biçimi ve bağlamı da daha düşük frekans bileşenlerinde bulunabilir.

Karışıklık matrisleri ne göstermiştir?

VisDrone2019 karışıklık matrislerinde küçük nesne sınıflarının arka planla karıştırılma oranlarında azalma bildirilmiştir:

  • Yaya sınıfı için arka plan karışması 0,72’den 0,59’a düşmüştür.
  • Motosiklet sınıfında 0,52’den 0,49’a düşmüştür.
  • Bisiklet sınıfında 0,85’ten 0,78’e düşmüştür.
  • Otomobil sınıfının matris köşegen değeri 0,70’ten 0,76’ya yükselmiştir.

Sınıf bazlı görsel karşılaştırmada yaya değeri %25’ten %38’e, motosiklet %26’dan %37’ye, bisiklet %16’dan %29’a, otobüs %37’den %45’e ve kamyon %28’den %36’ya yükselmiştir. Bu değerler sınıf bazlı AP sonuçlarından ziyade çalışmanın karışıklık matrisi ve kategori karşılaştırmasında kullandığı sınıflandırma oranlarıdır.

Grad-CAM ve örnek görüntüler

Grad-CAM görsellerinde YOLOv11n temel modelinin bazı sahnelerde ilgisini yol, bina veya arka planın farklı bölgelerine dağıttığı; YOLO-EFD’nin ise aktivasyonlarını araç ve yayaların çevresinde daha yoğun topladığı gösterilmiştir.

Bulanık örnek sahnede temel modelin üç araç, YOLO-EFD’nin ise sekiz araç tespit ettiği bildirilmiştir. Yoğun trafik örneğinde YOLO-EFD kutularının birbirine yakın araçların sınırlarına daha sıkı oturduğu görülmektedir.

Bu görüntüler model davranışını açıklamaya yardımcı olsa da seçilmiş birkaç örnekten oluşmaktadır. Tekil görüntüler, bütün veri kümesindeki performansın veya gerçek uçuş koşullarındaki güvenilirliğin tek başına kanıtı değildir.

Çalışmanın güçlü yönleri

  • Yalnızca kavramsal bir öneri değil, çalıştırılmış bir nesne tespit modeli sunulmuştur.
  • Model iki farklı ve yaygın UAV veri kümesi üzerinde değerlendirilmiştir.
  • EGA ve FDAM modüllerinin ayrı etkileri ablasyon deneyiyle incelenmiştir.
  • Frekans filtresinin α parametresi için kontrollü karşılaştırma yapılmıştır.
  • Parametre sayısı ve GFLOP bilgileri doğruluk ölçütleriyle birlikte raporlanmıştır.
  • Karışıklık matrisi, Grad-CAM ve tespit görüntüleriyle nicel sonuçlara görsel açıklamalar eklenmiştir.
  • Modelin başarısız olabildiği basit arka plan ve aşırı küçük hedef koşulları sonuç bölümünde açıkça belirtilmiştir.

İç tutarsızlıklar ve teknik sınırlılıklar

  • Özet, öne çıkan bulgular ve ablasyon tablosu VisDrone2019 için %22,2 mAP@0.5:0.95 bildirirken ana karşılaştırma tablosu %22,5 vermektedir.
  • YOLOv11n precision değeri ana karşılaştırma tablosunda %42,1, ablasyon tablosunda %44,1 olarak yazılmıştır.
  • Bu farklılıkların ayrı eğitim tekrarlarından, farklı doğrulama alt kümelerinden veya yazım hatasından kaynaklanıp kaynaklanmadığı açıklanmamıştır.
  • FDAM mimarisini gösteren Şekil 4’ün başlığı yanlış biçimde EGA mimarisi olarak yazılmıştır. Metindeki bazı şekil numarası yönlendirmeleri de gerçek görsellerle uyuşmamaktadır.
  • Sonuçlar için standart sapma, güven aralığı, istatistiksel anlamlılık veya birden fazla rastgelelik tohumu raporlanmamıştır.
  • Karşılaştırılan bütün modellerin aynı kod tabanı, veri artırma ayarları ve eğitim koşulları altında yeniden eğitilip eğitilmediği yeterince açıklanmamıştır.
  • Gerçek zamanlı kullanım iddiasına rağmen FPS, görüntü başına gecikme, bellek kullanımı ve güç tüketimi ölçülmemiştir.
  • Deneyler RTX 4090 üzerinde yapılmış; drone üzerinde kullanılabilecek gömülü bir işlemci, Jetson platformu veya başka bir uç cihaz üzerinde sınama yapılmamıştır.
  • Temel YOLOv11n’e göre GFLOP değeri 6,6’dan 12,5’e yükseldiği için hesaplama maliyeti belirgin biçimde artmıştır.
  • Model kodu, eğitilmiş ağırlıklar, veri bölümleme dosyaları ve eksiksiz hiperparametre yapılandırması için açık bağlantı verilmemiştir.
  • UAVDT’nin hava, irtifa, kamera açısı ve yoğunluk gibi öznitelikleri bulunmasına rağmen sonuçlar bu koşullara göre ayrı ayrı raporlanmamıştır.
  • Çalışma, basit arka planlarda ve aşırı küçük seyrek hedeflerde yüksek frekanslı gürültüye aşırı odaklanarak yanlış tespit üretebildiğini kabul etmektedir.

Çalışma neyi desteklemektedir?

Sonuçlar, farklı çözünürlüklerdeki özelliklerin kenar güdümlü deforme edilebilir evrişimle hizalanmasının YOLOv11n’in küçük nesne performansını artırabildiğini desteklemektedir. DCT tabanlı yüksek frekans güçlendirmesinin de özellikle kenarları zayıf veya bulanık küçük hedeflerde ek katkı sağlayabileceğine ilişkin deneysel bulgu sunulmuştur.

İki modülün birlikte kullanılması, incelenen veri kümelerinde tek başlarına kullanılmalarına göre daha yüksek sonuç üretmiştir. Model ayrıca EdgeYolo-t gibi daha ağır bir yöntemle benzer doğruluk aralığına daha düşük parametre ve GFLOP değeriyle yaklaşmıştır.

Çalışma neyi kanıtlamamaktadır?

Çalışma YOLO-EFD’nin bütün UAV görevlerinde veya bütün küçük nesne veri kümelerinde en iyi model olduğunu kanıtlamamaktadır. Bazı karşılaştırma modelleri belirli ölçütlerde daha yüksek sonuç üretmiştir. Deneyler yalnızca iki kamu veri kümesi ve raporlanan tek eğitim düzeniyle sınırlıdır.

Modelin gerçek bir drone üzerinde gerçek zamanlı çalıştığı, düşük enerji tükettiği veya kötü hava, gece, sis, titreşim ve farklı kamera sistemlerinde aynı performansı koruduğu gösterilmemiştir. GFLOP ve parametre sayısı, gerçek cihaz gecikmesinin doğrudan karşılığı değildir.

Sonuçlar ayrıca modelin arama-kurtarma, güvenlik veya trafik yönetimi gibi kritik alanlarda tek başına güvenilir karar verebileceğini göstermez. Bu tür uygulamalar için yanlış negatiflerin, yanlış pozitiflerin ve farklı çevresel koşulların ayrı ayrı doğrulanması gerekir.

Türkiye açısından olası önemi

Çalışmada önerilen yaklaşım; Türkiye’de drone tabanlı trafik izleme, afet sonrası alan taraması, orman yangını gözetimi, tarımsal görüntüleme, kıyı kontrolü ve altyapı denetimi gibi alanlara yöntemsel olarak aktarılabilir. Özellikle yüksekten çekilen görüntülerde küçük araçların veya insanların ayırt edilmesi, bu uygulamaların ortak teknik sorunlarından biridir.

Türkiye’de uygulanacak bir sistem için modelin yerel şehir dokusu, farklı yol işaretleri, araç türleri, bitki örtüsü, topoğrafya, hava koşulları ve kullanılan drone kameralarıyla yeniden eğitilmesi gerekir. VisDrone ve UAVDT sonuçları doğrudan Türkiye’deki operasyonel doğruluğu temsil etmez.

Pratik kullanım öncesinde Türkiye’ye ait görüntüler üzerinde alan dışı testler, gece ve kötü hava sınamaları, gömülü donanım gecikme ölçümleri, enerji tüketimi, güven aralıkları ve hata sınıflandırması yapılmalıdır.

Çalışmanın Yöntemi ve Bulguları

Yöntem bileşeniUygulamaTemel bulguYorum sınırı
Temel modelYOLOv11nKüçük nesne yolu EGA ve FDAM ile değiştirilmiştirBaşka YOLO ölçekleri sınanmamıştır
EGA kenar çıkarımı3 × 3 Scharr filtreleriYatay ve düşey gradyanlardan kenar haritası üretilmiştirGüçlü arka plan kenarları da yanıt oluşturabilir
EGA hizalamaKenar ve anlamsal özelliklerle konum kayması; deforme edilebilir evrişimSığ ve derin özelliklerin geometrik uyumu artırılmıştırKonum kaymalarının ayrı doğruluk analizi verilmemiştir
FDAM frekans yoluDCT, yüksek geçiren maske ve ters DCTYüksek frekanslı kenar ve doku ayrıntıları güçlendirilmiştirAşırı filtreleme yararlı bilgiyi azaltabilir
FDAM kanal yoluKanal ortalaması ve varyansıAyrıntı içeren kanallara daha yüksek ağırlık verilmiştirAlternatif dikkat yöntemleriyle ayrıntılı karşılaştırma yoktur
VisDrone2019Yaklaşık 10.209 görüntü, 540.000’den fazla kutu ve 10 sınıf%38,2 mAP@0.5 ve %39,3 recallmAP@0.5:0.95 sonucu metinde %22,2 ve %22,5 olarak iki farklı değerde verilmiştir
UAVDT100 video dizisi ve yaklaşık 80.000 kare%32,1 mAP@0.5 ve %30,5 recallVideo takibi veya zamansal modelleme yapılmamıştır
AblasyonEGA, FDAM ve birleşik model ayrı ayrı sınanmıştırBirleşik yapı en yüksek sonuçları vermiştirÇoklu eğitim tekrarları ve standart sapma yoktur
α parametresi0,00–1,00 aralığında beş değerEn iyi değer 0,25 olmuşturYalnızca VisDrone doğrulama kümesinde raporlanmıştır
Hesaplama maliyeti3,4 milyon parametre ve 12,5 GFLOPEdgeYolo-t’den daha düşük hesaplama maliyetiGerçek cihaz FPS ve enerji ölçümü yoktur

En önemli sayısal sonuçlar

  • VisDrone2019 ana tablosunda YOLO-EFD için mAP@0.5 %38,2 olarak verilmiştir.
  • VisDrone2019 recall değeri %39,3, precision değeri %46,6’dır.
  • VisDrone2019 mAP@0.5:0.95 değeri ana tabloda %22,5; özet ve ablasyon tablosunda %22,2’dir.
  • UAVDT’de mAP@0.5 %32,1, mAP@0.5:0.95 %18,9, precision %39,3 ve recall %30,5’tir.
  • EGA modülü tek başına temel modele göre mAP@0.5 değerini 2,8 puan artırmıştır.
  • FDAM modülü tek başına mAP@0.5 değerini 1,3 puan artırmıştır.
  • İki modül birlikte mAP@0.5 değerini %33,9’dan %38,2’ye yükseltmiştir.
  • En uygun frekans maskesi parametresi α = 0,25 olarak bulunmuştur.
  • Model 3,4 milyon parametre ve 12,5 GFLOP hesaplama yüküne sahiptir.
  • EdgeYolo-t 27,2 GFLOP ile %38,5 mAP@0.5 üretirken YOLO-EFD 12,5 GFLOP ile %38,2 üretmiştir.

Operasyonel kullanımdan önce yapılması gerekenler

  1. Model kodu, ağırlıkları ve veri bölümleme dosyaları yayımlanarak sonuçların yeniden üretilmesi.
  2. En az üç ila beş farklı rastgelelik tohumu ile ortalama ve standart sapmaların raporlanması.
  3. Türkiye’de çekilmiş drone görüntüleri üzerinde dış doğrulama yapılması.
  4. Gece, sis, yağmur, titreşim, farklı yükseklik ve farklı kamera çözünürlüklerinin ayrı ayrı sınanması.
  5. Jetson veya benzeri uç donanımlarda FPS, gecikme, bellek ve güç tüketiminin ölçülmesi.
  6. Yanlış pozitif ve yanlış negatiflerin uygulama türüne göre maliyet analizinin yapılması.
  7. Basit arka planlarda yüksek frekanslı gürültüye aşırı odaklanmayı azaltacak uyarlanabilir filtrelerin geliştirilmesi.
  8. Video nesne tespiti ve çoklu nesne takibi için zamansal tutarlılığın modele eklenmesi.

Kaynak ve Yöntem Notu

Çalışmanın özgün adı: YOLO-EFD: Edge-guided and Frequency-domain Dual Enhancement for Small Object Detection in UAV Aerial Imagery

Yazarlar ve doğru sıralama: Xin Song, Peng Li, Xuecong Liu, Xin Zhao.

Eş birinci yazar: Çalışmada eş birinci yazarlık veya eş katkı beyanı bulunmamaktadır.

Sorumlu/iletişim yazarı: Xin Song.

Kurumsal bağlantılar:

  • School of Computer Science and Engineering, Northeastern University, Shenyang, Liaoning, Çin.
  • Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern University at Qinhuangdao, Qinhuangdao, Hebei, Çin.
  • Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment, Chaoyue Technology Co., Ltd., Jinan, Shandong, Çin.

DOI:10.2139/ssrn.7031768

Resmî çalışma sayfası:SSRN resmî kaydı

Yayın platformu: SSRN.

Yüklenme tarihi: 1 Temmuz 2026.

Dergi: Hakemli bir dergi yayını veya belirli bir dergi adı doğrulanamamıştır. Sayfa alt bilgisinde “Preprint submitted to Elsevier” ifadesi yer almakta, ancak hedef dergi belirtilmemektedir.

Hakemlik durumu: Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.

Kaynak türü: Yeni bir derin öğrenme mimarisi, iki kamu veri kümesi üzerinde karşılaştırmalı deneyler, modül çıkarım testleri ve parametre analizi içeren hesaplamalı bilgisayarlı görü çalışması.

Finansman: Araştırma, Shandong Province Key Laboratory of Independent and Reliable Computing Technology and Equipment Açık Araştırma Proje Fonu tarafından KT25500300-lab numarasıyla desteklenmiştir.

Üretken yapay zekâ kullanımı: Yazarlar, DeepSeek’i dil düzeltmesi ve paragraf düzenlemesi amacıyla kullandıklarını; nihai içeriği gözden geçirerek sorumluluğu üstlendiklerini bildirmiştir.

Çıkar çatışması: Yüklenen sürümde açık bir çıkar çatışması beyanı bulunmamaktadır.

Veri ve kod erişimi: VisDrone2019 ve UAVDT kamu veri kümeleridir. Bununla birlikte YOLO-EFD kodu, eğitilmiş ağırlıkları, rastgelelik tohumları ve tam deney yapılandırması için bağlantı verilmemiştir.

Bibliyografik uyarı: Aynı başlık ve aynı yazarlarla SSRN’de 10.2139/ssrn.6878454 DOI’li daha eski bir kayıt da bulunmaktadır. Yüklenen sürümün bütün sayfalarında 7031768 kayıt numarası bulunduğundan bu makalede 10.2139/ssrn.7031768 DOI’si esas alınmıştır.

Bu Türkçe açıklama, yüklenen çalışmanın metni, denklemleri, tabloları, ağ şemaları, ısı haritaları, karışıklık matrisleri ve deney görselleri temel alınarak hazırlanmıştır. Bilimsel sonuçlar için dış kaynak eklenmemiş; dış kontrol yalnızca başlık, yazarlar, DOI, SSRN kayıt tarihi ve sorumlu yazar gibi bibliyografik kimlik bilgilerinin doğrulanmasıyla sınırlandırılmıştır.

Çalışmanın en önemli raporlama sorunu, VisDrone2019 mAP@0.5:0.95 ve temel model precision değerlerinin farklı bölümlerde uyuşmamasıdır. Bu nedenle sonuçlar aktarılırken ana karşılaştırma tablosundaki %22,5 ile özet ve ablasyon tablosundaki %22,2 değerleri birlikte belirtilmelidir.

Çalışma gerçek bir drone donanımında saha doğrulaması, gecikme ölçümü veya enerji tüketimi deneyi sunmamaktadır. Bu nedenle “gerçek zamanlı ve uç cihazlara uygun” değerlendirmesi parametre ve GFLOP sonuçlarına dayanan bir potansiyel olarak okunmalı, doğrulanmış operasyonel performans olarak sunulmamalıdır.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy