Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Mühendislik / İnsan Benzeri Görsel Dikkatle Uzaktan Algılama Nesne Tespiti: GVA ile Daha Yüksek Performans ve Beyin–Model Hizalanması
Mühendislik

İnsan Benzeri Görsel Dikkatle Uzaktan Algılama Nesne Tespiti: GVA ile Daha Yüksek Performans ve Beyin–Model Hizalanması

Guided-Search Visual Attention (GVA), insan görsel aramasındaki uyaran kaynaklı görsel belirginlik ile görev hedefli dikkat yönlendirmesini birlikte modelleyerek uzaktan algılama nesne tespit ağlarının özellik işleme sürecini düzenleyen beyin-esinli bir dikkat çerçevesidir.

15/09/2026  Veri Anla 102 görüntüleme
İnsan Benzeri Görsel Dikkatle Uzaktan Algılama Nesne Tespiti: GVA ile Daha Yüksek Performans ve Beyin–Model Hizalanması

Guided-Search Visual Attention (GVA), insan görsel aramasındaki uyaran kaynaklı görsel belirginlik ile görev hedefli dikkat yönlendirmesini birlikte modelleyerek uzaktan algılama nesne tespit ağlarının özellik işleme sürecini düzenleyen beyin-esinli bir dikkat çerçevesidir. Çalışma, GVA'yı Faster R-CNN, RetinaNet, YOLOv5s, YOLOv8n ve CenterNet olmak üzere beş farklı nesne tespit mimarisine yerleştirmiş; performansı DIOR veri setinde, insanla davranışsal uyumu eşzamanlı göz izleme verisiyle ve beyin–model temsil uyumunu EEG tabanlı representational similarity analysis ile değerlendirmiştir. Uçak kategorisinde bütün mimariler AP50 artışı göstermiş ve en büyük mutlak artış YOLOv5 için +0,260 olmuştur. GVA dikkat haritasının insan fiksasyon dağılımlarıyla Pearson korelasyonu 0,740'a ulaşmış; EEG–model RSA analizinde en belirgin hizalama artışları erken görsel kodlamayla ilişkili oksipital bölge ve top-down dikkat kontrolüyle ilişkili frontal bölgede raporlanmıştır. Bununla birlikte çalışma henüz hakem değerlendirmesinden geçmemiş bir preprinttir ve beyin hizalaması yalnız kullanılan EEG/RSA ölçüm çerçevesi içinde yorumlanmalıdır.

Günümüz uzaktan algılama modellerinde attention mekanizmaları yaygın biçimde kullanılmaktadır; ancak bu mekanizmaların büyük bölümü insan görsel dikkatini taklit etmek amacıyla değil, doğrudan görev performansını optimize etmek amacıyla öğrenilir. Dolayısıyla modelin dikkat ettiği bölgeler ile profesyonel insan gözlemcilerin görüntüde aradığı bölgeler birbirinden ayrılabilir.

Makalenin çıkış noktası bu ayrımdır. Araştırmacılar, model dikkatini doğrudan insan fiksasyon haritalarına uydurmak yerine insan görsel aramasının altında yatan guided search mekanizmasını hesaplamalı bir modüle dönüştürmeyi önermektedir. Böylece insan davranışının yalnız sonucunu kopyalamak yerine, dikkat dağılımına yol açan iki ana süreç modellenmeye çalışılmaktadır.

Birinci süreç stimulus-driven saliency, yani görüntünün kenar, renk farklılığı ve yerel sıra dışılığı gibi düşük seviyeli özelliklerin dikkati kendiliğinden çekmesidir. İkinci süreç target-directed guidance, yani gözlemcinin “uçak arıyorum” gibi görev hedefinin dikkati hedefe benzeyen bölgelere yönlendirmesidir. GVA bu iki haritayı birleştirerek hem görsel olarak dikkat çekici hem de görev açısından anlamlı bölgeleri öne çıkarır.

İnsan Benzeri Görsel Dikkat Neden Uzaktan Algılama Nesne Tespitinde Önemlidir?

İnsan benzeri görsel dikkat, modelin görüntüde yalnız istatistiksel olarak güçlü özelliklere değil, insanların hedef ararken öncelik verdiği görsel ve görev ilişkili bölgelere odaklanmasını amaçlar. Uzaktan algılama görüntülerinde hedeflerin küçük, seyrek ve yoğun arka plan içinde bulunabilmesi nedeniyle böyle bir dikkat mekanizması yanlış pozitifleri azaltabilir, kaçırılan hedefleri düşürebilir ve model kararlarının insan görsel arama stratejileriyle daha kolay karşılaştırılabilmesini sağlayabilir.

Uzaktan algılama görüntülerinde havaalanı pistleri, kara yüzeyleri, su alanları, binalar veya diğer yoğun dokular hedef olmayan fakat güçlü görsel özellikler oluşturabilir. Geleneksel bir detector bu bölgelerde yüksek aktivasyon üreterek gereksiz bounding box'lar oluşturabilir.

İnsan gözlemci ise görüntüdeki bütün yüksek kontrastlı bölgelere eşit davranmaz. Görüntünün kendisinden gelen görsel belirginliği, aradığı nesneye ilişkin önbilgiyle birleştirir. Guided search theory, insan görsel aramasını tam olarak bu iki bilgi akışının birleşimi olarak kavramsallaştırmaktadır.

Guided Search Theory GVA Modeline Nasıl Dönüştürülüyor?

GVA, guided search theory'deki iki temel dikkat kaynağını ayrı hesaplama yolları olarak uygular: bottom-up yol görüntünün kenar ve renk sıra dışılığı gibi görevden bağımsız görsel özelliklerini çıkarırken, top-down yol hedef sınıfına ilişkin öğrenilmiş görsel önbilgiden bir hedef olasılık haritası üretir. İki harita piksel düzeyinde çarpılarak ortak bir öncelik haritası oluşturulur ve yalnız hem belirgin hem de görevle ilişkili bölgeler güçlü dikkat kazanır.

Bottom-up: Uyaran kaynaklı belirginlik yolu

Stimulus-driven saliency yolu hedefin ne olduğunu bilmeden görüntünün kendi görsel özelliklerine göre dikkat haritası üretir. Kaynak bu işlem hattını tamamen açıklanabilir klasik görüntü işleme adımlarıyla kurmaktadır.

Önce görüntü mean-shift filtering ile işlenir ve CIE-Lab renk uzayına dönüştürülür. Ardından üç ölçekli Gaussian pyramid kullanılır:

  • 1× özgün çözünürlük,
  • 0,5× ölçek,
  • 0,25× ölçek.

Her ölçekte 3×3 Sobel operatörüyle kenar özellikleri çıkarılır. Buna ek olarak her pikselin çevresine göre ne kadar nadir veya sıra dışı bir renk taşıdığını ölçen color-rarity haritası hesaplanır.

Bottom-up attention map kaynakta şu biçimde tanımlanır:

\[ M_{bu}(x,y)= \mathcal{N} \left[ \sum_{s=1}^{3} w_s \left( E_s(x,y)+C_s(x,y) \right) \right] \]

Burada \(E_s\), s ölçeğindeki kenar özellik haritasını; \(C_s\), renk nadirliği haritasını; \(w_s\), ölçek ağırlığını ve \(\mathcal{N}\) min-max normalizasyonunu temsil eder.

Top-down: Hedef yönelimli rehberlik yolu

İkinci yol, göreve özgü hedef bilgisini attention map'e taşır. Çalışmada uçak hedeflerinin Lab renk imzalarını öğrenmek için 500 elle etiketlenmiş uçak örneği üzerinde Random Forest sınıflandırıcısı eğitilmiştir.

Random Forest:

  • 10 ağaç,
  • maksimum derinlik 5

kullanır ve her piksel için hedef olasılığı üretir. Bu harita 5×5 Gaussian kernel ve \(\sigma=2\) ile yumuşatılır.

Top-down guidance map:

\[ M_{td}(x,y)= \mathcal{N} \left[ G_{\sigma=2} * RF(Lab(x,y)) \right] \]

biçiminde ifade edilmektedir.

Buradaki Random Forest, detector'ın eğitim/test bölümlerinden bağımsız yardımcı görüntü yamalarıyla eğitilerek veri sızıntısını önleyecek biçimde yapılandırılmıştır.

İki dikkat yolu nasıl birleşiyor?

Bottom-up ve top-down attention haritaları element-wise multiplication ile birleştirilir. Böylece yalnız fiziksel olarak dikkat çekici olan fakat hedefle ilgisiz alanların ve yalnız hedefe benzeyen fakat görsel kanıtı zayıf alanların baskılanması amaçlanır.

Birleşik harita marker-controlled watershed algoritmasıyla aday bölgelere ayrılır. Kaynakta adayların şu koşullarla filtrelendiği belirtilmektedir:

  • alan: 50–8000 piksel,
  • en-boy oranı: 0,2–5.

Geçerli bölge merkezlerine \(\sigma=10\) piksel olan iki-boyutlu Gaussian çekirdekler yerleştirilerek son insan-benzeri attention map oluşturulur:

\[ A_{GVA}(x,y)= \mathcal{N} \left[ \sum_{k=1}^{K} \mathcal{G} \left( (x,y);c_k,\sigma=10 \right) \right] \]

Burada \(K\) geçerli aday bölge sayısını, \(c_k\) ise bu bölgelerin merkezlerini ifade eder.

GVA Gerçekten Parametresiz Bir Dikkat Modülü müdür?

GVA'nın detector ağına gömülmesi yeni öğrenilebilir derin ağ parametreleri eklememektedir ve bottom-up saliency yolu deterministik görüntü işleme işlemlerinden oluşmaktadır; ancak top-down rehberlik yolu 500 etiketli örnek üzerinde eğitilmiş bir Random Forest kullanır. Bu nedenle kaynakta geçen “parameter-free” ifadesi, GVA'nın bütün hesaplama zincirinde hiçbir öğrenilmiş bileşen bulunmadığı anlamında değil, detector mimarisine yeni optimize edilen sinir ağı parametreleri eklenmemesi anlamında dikkatli biçimde yorumlanmalıdır.

Bu ayrım metodolojik olarak önemlidir. Kaynak, detector'ın sınıflandırma ve regression kollarının değiştirilmediğini, GVA'nın native loss fonksiyonlarını koruduğunu ve detector eğitimine yeni learnable layer eklemediğini belirtmektedir.

Ancak hedef yönelimli attention map'in oluşturulması için kullanılan Random Forest önceden eğitilmektedir. Dolayısıyla GVA'nın top-down bileşeni hedef sınıfına ilişkin öğrenilmiş bilgi taşımaktadır.

GVA beş farklı detector'a nasıl gömülüyor?

MimariDetector türüGVA gömme yaklaşımı
Faster R-CNNİki aşamalıWatershed ile elde edilen GVA candidate box'ları klasik yoğun anchor'ların yerine kullanılır; bölgedeki ortalama attention skoru proposal confidence olarak değerlendirilir.
RetinaNetTek aşamalı, anchor-basedGVA adayları önceden tanımlı multi-scale anchor grid'lerin yerine kullanılır.
YOLOv5sTek aşamalı, anchor-basedGVA binary mask özellik haritalarının boyutuna ölçeklenir; gradient backpropagation ve çıktı bölgeleri insan-benzeri attention alanlarıyla sınırlandırılır.
YOLOv8nTek aşamalıGVA maskesi feature-map ölçeğine uyarlanarak feature allocation ve prediction alanlarını modüle eder.
CenterNetAnchor-freeYeniden ölçeklenmiş GVA maskesi center-point heatmap tahminlerini modüle eder.

Çalışmanın önemli tasarım kararı, GVA'yı detector backbone ile Feature Pyramid Network (FPN) arasına yerleştirerek temel detector mimarisini mümkün olduğunca bozmamaktır.

Çalışmanın Yöntemi ve Bulguları

EEGET-RSOD göz izleme ve EEG veri seti

İnsan davranışı ve beyin temsili için benchmark olarak EEGET-RSOD veri seti kullanılmıştır. Veri setinde DIOR'dan alınmış 1.000 adet 800×800 piksel optik uzaktan algılama görüntüsü bulunmaktadır.

Çalışmaya 38 katılımcı dahil edilmiştir ve kaynak bütün katılımcıların yazılı informed consent verdiğini belirtmektedir. Etik onay Beijing Normal University Ethics Committee tarafından 20221024111 numarasıyla verilmiştir.

ÖlçümDonanım / parametre
Göz izlemeSMI RED250, 250 Hz
EEGNE Enobio, 32 kanal, 500 Hz, 10–20 yerleşimi
Senkronizasyon<2 ms trigger hatası
Uyaran süresi3000 ms
Boş ekran500 ms

Fiksasyonlar I-DT algoritmasıyla çıkarılmış ve grup fixation heatmap'leri \(\sigma=8\) Gaussian kernel ile oluşturulmuştur.

EEG ön işleme

EEG sinyallerine:

  • 0,5–45 Hz filtreleme,
  • mastoid re-referencing,
  • ICA ile artefakt temizleme,
  • −200–0 ms baseline correction

uygulanmıştır.

Dört fonksiyonel bölge farklı zaman pencereleriyle tanımlanmıştır:

Beyin bölgesiZaman penceresi
Oksipital0–300 ms
Temporal100–400 ms
Frontal200–500 ms
Parietal300–600 ms

Whole-brain Representational Similarity Matrices ise 0–600 ms penceresinde oluşturulmuştur.

Detector eğitim düzeni

Detector deneylerinin ana bölümü DIOR uçak alt kümesinde gerçekleştirilmiştir.

ParametreDeğer
Train / validation / test7 : 2 : 1
FrameworkPyTorch
GPURTX 4090
Batch size16
Girdi çözünürlüğü800×800
Epoch300
Backbone başlangıcıImageNet pre-trained
Checkpoint seçimiEn yüksek AP50

GVA Nesne Tespit Performansını Ne Kadar Artırdı?

DIOR uçak testinde GVA'nın eklenmesi beş detector'ın tamamında AP50'yi artırmıştır; en büyük mimariler arası mutlak artış YOLOv5'te 0,680'den 0,940'a çıkarak +0,260 olmuştur. Daha zayıf başlangıç modelleri daha büyük kazançlar elde ederken, başlangıç performansı zaten yüksek RetinaNet ve YOLOv8'de artışlar daha küçüktür.

ModelBaseline PrecisionBaseline RecallBaseline AP50GVA PrecisionGVA RecallGVA AP50AP50 farkı
Faster R-CNN0,9150,4420,6000,7860,7390,760+0,160
YOLOv50,7170,6470,6800,9790,9070,940+0,260
CenterNet0,8410,7750,8100,9010,8520,880+0,070
RetinaNet0,9820,8740,9200,9910,9180,950+0,030
YOLOv80,9820,9320,9200,9740,9380,960+0,040

Faster R-CNN özelinde baseline model çok yüksek precision'a rağmen yalnız 0,442 recall göstermektedir. GVA sonrasında recall 0,739'a çıkarken precision 0,786'ya gerilemiş, fakat AP50 toplamda 0,600'den 0,760'a yükselmiştir.

YOLOv5'te hem precision hem recall aynı anda yükselmiş ve bu model en büyük genel detector kazancını elde etmiştir.

Güçlü modeller neden daha az kazanıyor?

Kaynağın yorumu, düşük başlangıç performansına sahip modellerde arka plan baskılama ve precision–recall dengesi açısından daha fazla iyileştirme alanı bulunmasıdır. RetinaNet ve YOLOv8 gibi güçlü baseline'lar zaten gelişmiş feature fusion ve attention davranışına sahip olduğundan GVA bu modellerde daha çok ince ayar etkisi göstermektedir.

GVA Farklı Uzaktan Algılama Hedeflerine Genellenebildi mi?

YOLOv5 üzerinde yapılan dört-sınıflı deneyde GVA uçak, gemi, depolama tankı ve köprü kategorilerinin tamamında AP50 artışı sağlamıştır; ortalama AP50 0,666'dan 0,855'e yükselmiştir. Ancak kazanç büyüklüğü hedef geometrisine göre büyük ölçüde değişmiş, en büyük artış depolama tanklarında ve en küçük artış köprülerde görülmüştür.

KategoriBaseline AP50GVA AP50Mutlak fark
Uçak0,6800,942+0,262
Gemi0,9140,958+0,044
Depolama tankı0,4930,918+0,425
Köprü0,5760,603+0,027
Ortalama0,6660,855+0,189

Kaynak, kompakt ve düzenli geometrili hedeflerde kenar ve renk-rarity mekanizmasının daha etkili olduğunu, uzun doğrusal yapılar olan köprülerin mevcut saliency tasarımıyla daha az uyumlu olduğunu ileri sürmektedir.

Uçak için ana beş-model deneyinde AP50 0,940 olarak, kategoriler arası deneyde ise 0,942 olarak raporlanmıştır. Bunlar farklı deney tablolarında verilen değerlerdir ve tek bir değere zorla eşitlenmemelidir.

GVA İnsan Göz Hareketleriyle Ne Kadar Uyumlu?

İnsan fixation heatmap'leriyle yapılan karşılaştırmada GVA için CC=0,740, NSS=2,600 ve KL=0,898 bildirilmiştir; bu değerler model attention'ının insan bakış dağılımına baseline detector'lardan daha yakın olduğunu göstermektedir. Bununla birlikte kullanılan metrikler farklı dikkat özelliklerini ölçer ve tek bir “insana benzerlik yüzdesi” olarak birleştirilmemelidir.

Dikkat hizalama metrikleri

MetrikNe ölçer?Daha iyi yön
CCAttention haritaları arasındaki genel uzamsal korelasyonYüksek
SSIMUzamsal/yapısal benzerlikYüksek
NSSModel saliency'sinin insan fiksasyon noktalarında yoğunlaşmasıYüksek
KL divergenceİki dikkat olasılık dağılımı arasındaki farkDüşük

GVA ablasyonu ne gösterdi?

Kaynak dört sistemi karşılaştırmaktadır:

  1. Itti saliency baseline,
  2. yalnız stimulus-driven saliency,
  3. yalnız target-directed guidance,
  4. tam Guided-Search Visual Attention.
YöntemCCSSIMNSSKL
Itti0,3880,3570,9201,562
Stimulus-driven0,5050,6132,5982,090
Target-directed0,5110,5652,0171,826
Full GVA0,7400,5812,6000,898

Bu tablo çift-yol tasarımının özellikle CC ve KL açısından güçlü tamamlayıcılık sağladığını göstermektedir. GVA en yüksek CC ve NSS ile en düşük KL değerini verir.

Kaynak içi tutarsızlık: aynı bölümün metni tam GVA'nın “tüm metriklerde” tek-yollu yöntemleri geçtiğini söylese de Şekil 4'te stimulus-driven yolun SSIM değeri 0,613, tam GVA'nınki 0,581'dir. Dolayısıyla SSIM açısından Şekil 4 bu cümleyi desteklememektedir.

Beyin–Model Hizalanması Nasıl Ölçüldü?

Beyin–model hizalaması, detector'ın FPN katmanlarındaki P3, P4 ve P5 özelliklerinden oluşturulan Representational Similarity Matrices ile fixation-locked EEG sinyallerinden oluşturulan RSM'lerin Spearman korelasyonu üzerinden ölçülmüştür. Bu yöntem modelin “beyin gibi düşündüğünü” doğrudan göstermez; farklı uyaranlar arasındaki temsil ilişkilerinin insan EEG'sindeki temsil geometrisine ne ölçüde benzediğini test eder.

Model RSM'lerinin oluşturulması

Target ve background bölgeleri ROI-Align ile P3, P4 ve P5 feature map'lerinden kırpılmış, pooled ve normalize edilmiştir. Her uyaran çifti arasındaki cosine dissimilarity kullanılarak model RSM'leri oluşturulmuştur.

EEG RSM'lerinin oluşturulması

EEG epoch'ları göz fiksasyon etiketlerine göre target ve background olarak ayrılmıştır. Dört kortikal bölgedeki ERP sinyalleri model feature sırasıyla eşleştirilen feature vektörlerine dönüştürülmüş, Fisher-Z transform uygulanmış ve katılımcılar arasında ortalanmıştır.

Model ile EEG RSM arasındaki ilişki Spearman rank correlation ile ölçülmüş; istatistiksel anlamlılık 5.000 permutation testi ve FDR correction ile değerlendirilmiştir.

P3, P4 ve P5 katmanları arasında ne oldu?

Baseline detector'larda beyin–model korelasyonları düşük ve düzensizdir; Spearman's r yaklaşık 0,006–0,024 aralığındadır.

GVA sonrasında hizalama tüm mimarilerde artmış ve genel olarak P3'ten P5'e doğru güçlenen bir katman gradyanı ortaya çıkmıştır.

Kaynağın P3–P5 üzerinden raporladığı maksimum RSA artışları:

ModelMaksimum RSA artışıOrtalama RSA artışı
Faster R-CNN133%108%
YOLOv550%73%
RetinaNet14%13%
CenterNet40%78%
YOLOv84%31%

Bu yüzde artışların düşük başlangıç korelasyonlarına göre göreli artışlar olduğu unutulmamalıdır; mutlak RSA değerleri küçük kalmaktadır.

GVA Hangi Beyin Bölgeleriyle Daha Fazla Hizalandı?

Bölgesel RSA analizinde en büyük ortalama artış oksipital kortekste Δρ=0,012, ikinci büyük artış frontal kortekste Δρ=0,008 olarak bildirilmiştir. Parietal Δρ=0,001 ve temporal Δρ=0,003 artışları daha küçüktür ve kaynakta çoğunlukla istatistiksel olarak anlamlı olmadığı belirtilmektedir.

Kaynak bu dağılımı GVA mimarisinin iki yoluyla ilişkilendirmektedir:

  • Oksipital artış: kenar ve renk kontrastı gibi erken görsel özelliklerin bottom-up saliency yoluyla işlenmesi,
  • Frontal artış: hedefe yönelik top-down dikkat kontrolünün task-guidance yoluyla modellenmesi.

Bu yorum mekanistik bir hipotezdir. EEG'nin mekânsal çözünürlüğü, kaynağın kendisinin de sınırlılık olarak belirttiği üzere, ince ölçekli kortikal mekanizma çıkarımlarına izin vermemektedir.

Katman hiyerarşisi ile insan görsel hiyerarşisi aynı şey midir?

Kaynak, GVA sonrasında P3'ten P5'e artan RSA'yı insan görsel sisteminin hiyerarşik işleme düzeniyle tutarlı bir örüntü olarak yorumlamaktadır. Bununla birlikte P3/P4/P5 detector özellikleri ile belirli kortikal işleme aşamalarının birebir anatomik eşdeğer olduğu gösterilmemiştir.

Doğru ifade, model feature hiyerarşisindeki temsil uyumunun derin katmanlara doğru artmasının kullanılan EEG/RSA çerçevesinde insan görsel işleme hiyerarşisiyle daha uyumlu bir örüntü oluşturduğudur.

İstatistiksel değerlendirme

Göz izleme attention metrikleri için one-way ANOVA, FDR-adjusted Tukey HSD ve 1.000 bootstrap örneği kullanılmıştır.

Neural RSA için 5.000 permutation testi uygulanmış ve \(\alpha=0,05\) düzeyinde FDR correction yapılmıştır.

Kaynak, ana visual alignment karşılaştırmalarında FDR-corrected \(p<0,001\) bildirmektedir.

Çalışmanın desteklediği sonuçlar

  • GVA, guided search theory'deki bottom-up ve top-down dikkat mekanizmalarını birleştiren çift-yollu bir attention çerçevesidir.
  • DIOR uçak testinde GVA test edilen beş detector'ın tamamında AP50'yi artırmıştır.
  • En büyük mimariler arası uçak AP50 artışı YOLOv5 için +0,260'tır.
  • YOLOv5'in dört kategorili genelleme deneyinde ortalama AP50 0,666'dan 0,855'e yükselmiştir.
  • GVA attention map'i insan fixation dağılımıyla CC=0,740 değerine ulaşmıştır.
  • Full GVA, Şekil 4'te CC, NSS ve KL bakımından tek yolların önündedir.
  • EEG–model RSA değerleri GVA sonrasında test edilen mimarilerde artmıştır.
  • En belirgin bölgesel RSA artışları oksipital ve frontal bölgelerde raporlanmıştır.
  • GVA'nın detector'a gömülmesi native classification/regression branch'lerini ve loss fonksiyonlarını değiştirmemektedir.

Çalışmanın desteklemediği sonuçlar

  • GVA kullanan detector'ların insan beyniyle aynı hesaplamayı yaptığı gösterilmemiştir.
  • CC=0,740 değeri genel anlamda “model %74 insan beynine benziyor” biçiminde yorumlanamaz.
  • EEG RSA korelasyonu klinik veya biyolojik eşdeğerlik kanıtı değildir.
  • Kognitif alignment verisi uçak dışındaki hedef kategorilerinde henüz doğrulanmamıştır.
  • GVA'nın SAR veya hyperspectral görüntülerde aynı performansı vereceği gösterilmemiştir.
  • GVA'nın bütün uzaktan algılama detector'larında aynı AP50 artışını sağlayacağı kanıtlanmamıştır.
  • “Parameter-free” ifadesi, top-down Random Forest'ın hiçbir eğitim görmediği anlamına gelmez.
  • Şekil 4, full GVA'nın SSIM'de stimulus-driven yolu geçtiğini göstermemektedir.
  • Preprint sonuçları hakemli nihai kanıt olarak değerlendirilmemelidir.

Çalışmanın sınırlılıkları

Kaynak üç ana sınırlılığı açık biçimde belirtmektedir.

  1. Kognitif veri sınırlılığı: göz izleme ve EEG alignment değerlendirmesi yalnız uçak hedefleri için mevcuttur. Diğer kategorilerde detector performansı test edilmiş olsa da karşılık gelen insan cognitive benchmark henüz yoktur.
  2. Modalite sınırlılığı: çalışma yalnız optik remote sensing görüntülerinde yapılmıştır; SAR ve hyperspectral görüntüler test edilmemiştir.
  3. EEG mekânsal çözünürlüğü: EEG, neural mechanism analizini makroskopik fonksiyonel beyin bölgeleriyle sınırlar.

Gelecek araştırma alanları

Yazarlar bottom-up saliency mekanizmasının farklı sensör modalitelerine uyarlanabileceğini önermektedir. SAR için polarimetric signatures, hyperspectral görüntüler için spectral band özellikleri renk bilgisinin yerine kullanılabilecek aday temsillerdir.

Etiketli örneğin az olduğu büyük alanlı gözlem uygulamalarında top-down prior'ın unsupervised veya self-supervised yöntemlerle öğrenilmesi de gelecekteki çalışma yönü olarak belirtilmektedir.

Çalışma ayrıca GVA gömülmesinin detector'a yeni trainable neural-network parametreleri eklememesi nedeniyle lightweight ve edge-processing mimarileri için potansiyel taşıdığını ileri sürmektedir; ancak gerçek edge cihazında ayrıntılı latency veya enerji tüketimi deneyi raporlanmamaktadır.

Kaynak ve Yöntem Notu

Özgün başlık: Embedding human-like visual attention for brain-aligned and high-performance remote sensing object detection

Yazarlar: Bing He, Tong Qin, Dajun Xing, Ying Qu, Qiaosong Hei, Chunfeng Gao, Zheng Gong, Qiao Wang, Weihua Dong

Kaynak türü: Preprint araştırma makalesi.

SSRN kayıt numarası: 7346288.

SSRN'ye yüklenme: 24 Ağustos 2026.

Hakemlik durumu: Kaynak açıkça “This preprint research paper has not been peer reviewed” ifadesini taşımaktadır.

Ana yöntem: Guided-Search Visual Attention (GVA).

Kuramsal temel: Guided search theory; stimulus-driven saliency ve target-directed guidance yollarının priority map üretmek üzere birleştirilmesi.

Detector'lar: Faster R-CNN, RetinaNet, YOLOv5s, YOLOv8n ve CenterNet.

Temel nesne tespit veri seti: DIOR.

Kognitif benchmark: EEGET-RSOD; 1.000 adet 800×800 remote sensing görüntüsü ve 38 katılımcının eşzamanlı göz izleme–EEG verileri.

Etik onay: Beijing Normal University Ethics Committee, No. 20221024111.

Eye tracker: SMI RED250, 250 Hz.

EEG: NE Enobio, 32 kanal, 500 Hz, 10–20 yerleşimi.

Visual alignment metrikleri: Pearson correlation coefficient (CC), structural similarity index (SSIM), normalized scanpath saliency (NSS), Kullback–Leibler divergence (KL).

Neural alignment yöntemi: Representational Similarity Analysis (RSA), model P3/P4/P5 FPN özellikleri ve fixation-locked EEG RSM'leri.

Data availability: EEGET-RSOD veri seti Figshare üzerinde 10.6084/m9.figshare.26943565 DOI'siyle kaynakta belirtilmektedir.

Code availability: Kaynak, analiz kodunun GitHub'da “Bing-1997/Human-like_visual_attention_embedding_framework” deposunda bulunduğunu belirtmektedir.

Kaynak içi önemli nüans: GVA detector'a yeni öğrenilebilir neural-network parametreleri eklememektedir; buna karşılık target-directed yol 500 etiketli örnek üzerinde eğitilen bir Random Forest kullanmaktadır.

Kaynak içi önemli tutarsızlık: Şekil 4'te full GVA SSIM=0,581, stimulus-driven saliency SSIM=0,613'tür; bu nedenle aynı bölümdeki “full GVA all metrics'te üstündür” cümlesi SSIM açısından şekille uyuşmamaktadır.

Temel yorum sınırı: “Brain-aligned” sonucu EEG/RSA ve eye-tracking metriklerinde ölçülen temsil/dikkat benzerliği anlamındadır; doğrudan biyolojik mekanizma eşdeğerliği veya beynin hesaplama sürecinin kopyalanması anlamına gelmez.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy