Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Bilgisayar Bilimi / GamMa ile Görüntü Eşleştirme: Bilgilendirici Özellikleri Seçerek Daha Dayanıklı ve Verimli Eşleşmeler
Bilgisayar Bilimi

GamMa ile Görüntü Eşleştirme: Bilgilendirici Özellikleri Seçerek Daha Dayanıklı ve Verimli Eşleşmeler

Bu çalışma, farklı açılardan, ışık koşullarından veya ortamlardan alınmış iki görüntü arasında güvenilir karşılıklar bulmak için GamMa adlı hafif bir yarı yoğun özellik eşleştirme modeli geliştirmiştir.

02/08/2026  Veri Anla 18 görüntüleme
GamMa ile Görüntü Eşleştirme: Bilgilendirici Özellikleri Seçerek Daha Dayanıklı ve Verimli Eşleşmeler

Bu çalışma, farklı açılardan, ışık koşullarından veya ortamlardan alınmış iki görüntü arasında güvenilir karşılıklar bulmak için GamMa adlı hafif bir yarı yoğun özellik eşleştirme modeli geliştirmiştir. Model, bütün görüntü özelliklerini eşit biçimde işlemek yerine, eşleştirme açısından daha güvenilir görünen bölgeleri Mamba tabanlı dizi modellemesinden önce seçmektedir. Bu amaçla Gated Deformable Scanning, Joint Mamba ve Gated Deformable Merge bileşenlerinden oluşan bir Gated Deformable Mamba mimarisi kullanılmıştır. GamMa, MegaDepth testinde 5°, 10° ve 20° eşiklerinde sırasıyla 65,2, 78,1 ve 87,0 AUC değerlerine ulaşmış; 5,7 milyon parametre, 202,5 GFLOP ve 37,9 ms ölçülen çalışma süresiyle yarı yoğun yöntemler arasında en yüksek sonucu vermiştir. Model ayrıca yalnızca MegaDepth üzerinde eğitildiği hâlde HPatches ve ScanNet’e ince ayar yapılmadan aktarıldığında temel JamMa modelinden daha yüksek sonuçlar üretmiştir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiştir; kaynakçası eksiktir, bazı sayısal farklar metinle tablolar arasında uyuşmamaktadır ve deneylerde çoklu eğitim tekrarlarına ait standart sapma veya güven aralığı sunulmamıştır.

GamMa’nın temel düşüncesi, görüntüdeki bütün hücrelerin eşleştirme açısından aynı değere sahip olmadığıdır. Bina köşeleri, nesne sınırları ve ayırt edici dokular güvenilir geometrik ipuçları sunarken gökyüzü, boş duvarlar, tekrarlanan desenler veya bulanık bölgeler yanlış etkileşimler oluşturabilir. Gated Index Network, eşleştirme öncesinde özellik konumlarını öğrenilebilir biçimde sıralamakta ve varsayılan ayarda bunların yarısını seçmektedir. Seçilen özellikler Mamba bloklarıyla modellenmekte, daha sonra özgün iki boyutlu özellik haritalarına geri yerleştirilmektedir. Canny kenar kaybı ise özellikle dokusu zayıf iç mekânlarda eşleşmelerin duvar kesişimleri, nesne sınırları ve köşeler gibi daha kararlı geometrik yapılara yönelmesini amaçlamaktadır.

Türkiye açısından değerlendirme: GamMa yaklaşımı; insansız hava araçlarıyla haritalama, otonom robot konumlama, artırılmış gerçeklik, kültürel mirasın üç boyutlu belgelenmesi, uydu ve hava görüntülerinin eşleştirilmesi, afet sonrası yapı karşılaştırması ve endüstriyel görsel denetim sistemlerinde Türkiye’de araştırılabilir. Uygulamaya geçmeden önce modelin Türkiye’ye özgü kent dokuları, kırsal alanlar, düşük ışıklı iç mekânlar, deprem sonrası hasarlı yapılar, tekrarlayan cepheler ve farklı kamera türleri üzerinde yeniden sınanması gerekir. Gerçek zamanlı kullanım için gömülü GPU, mobil işlemci ve düşük güçlü uç cihazlarda çalışma süresi ile bellek tüketimi ayrıca ölçülmelidir. Çalışma Türkiye’de toplanmış bir veri kümesi, yerli bir otonom sistem, operasyonel saha deneyi veya güvenlik sertifikasyonu sunmadığından Türkiye’ye özgü başarı oranı ya da saha güvenilirliği doğrudan çıkarılamaz.

Yerel özellik eşleştirme nedir?

Yerel özellik eşleştirme, aynı fiziksel noktanın veya yapının iki farklı görüntüdeki karşılığını bulma problemidir. Bir binanın köşesi, pencere kenarı, yol çizgisi veya nesne sınırı iki görüntüde farklı ölçek, açı ve aydınlatmayla görünse bile doğru eşleştirme sistemi bu noktalar arasında bağlantı kurabilmelidir.

Bu karşılıklar aşağıdaki uygulamalarda temel girdidir:

  • Görsel konumlama ve kamera pozunun hesaplanması,
  • Eşzamanlı konumlama ve haritalama (SLAM),
  • Structure-from-Motion ile üç boyutlu model üretimi,
  • Çok görüntülü yeniden yapılandırma,
  • Görüntü hizalama ve homografi tahmini,
  • Robotik ve otonom sistemlerde hareket takibi.

İki görüntü arasında çok sayıda eşleşme üretmek tek başına yeterli değildir. Yanlış eşleşmeler kamera dönüşü, öteleme ve üç boyutlu geometri tahminini bozabilir. Bu nedenle eşleşme miktarı, geometrik doğruluk, dayanıklılık ve hesaplama maliyeti birlikte değerlendirilmelidir.

Seyrek, yarı yoğun ve yoğun eşleştirme arasındaki fark

Seyrek yöntemler önce köşe veya ilgi noktası tespit eder, daha sonra bu noktalara ait tanımlayıcıları karşılaştırır. Hesaplama maliyetleri görece düşüktür; ancak dokusuz duvarlar veya tekrarlanan desenler gibi bölgelerde yeterli ve kararlı anahtar nokta üretmeyebilirler.

Yoğun yöntemler hemen hemen her piksel veya küçük görüntü bölgesi için karşılık tahmin eder. Bu yöntemler büyük görünüm değişimlerinde güçlü olabilir, fakat daha fazla parametre, bellek ve hesaplama gerektirir.

Yarı yoğun yöntemler, yoğun eşleştirmenin dayanıklılığı ile seyrek eşleştirmenin hesaplama verimliliği arasında denge kurmayı amaçlar. GamMa bu sınıfa girmektedir.

Transformer yerine Mamba neden kullanılmıştır?

Transformer tabanlı eşleştiriciler, görüntünün farklı bölgeleri arasındaki uzun menzilli ilişkileri öz dikkat mekanizmasıyla modelleyebilir. Ancak klasik öz dikkatin hesaplama maliyeti işlenen belirteç sayısının karesiyle büyür. Yarı yoğun özellik haritalarında belirteç sayısı yüksek olduğundan bu maliyet önemli olabilir.

Mamba mimarileri, uzun dizileri yaklaşık doğrusal ölçeklenen durum-uzayı modellemesiyle işleyerek daha düşük maliyetli bir alternatif sunar. JamMa adlı önceki yöntem, Mamba’yı yarı yoğun özellik eşleştirmeye uyarlamıştır. Çalışmanın çıkış noktası, JamMa’nın bütün özellik konumlarını sabit bir tarama düzeninde eşit biçimde işlemesidir.

Sabit tarama yaklaşımındaki sorun nedir?

Görüntüdeki her bölge güvenilir bir eşleştirme işareti taşımaz. Aşağıdaki bölgeler özellikle sorun oluşturabilir:

  • Düz ve dokusuz yüzeyler,
  • Birbirine benzeyen pencere veya tuğla dizileri,
  • Gökyüzü ve tek renkli arka planlar,
  • Hareket bulanıklığı bulunan bölgeler,
  • İki görüntü arasında örtüşmeyen alanlar,
  • Bakış açısına göre görünümü güçlü biçimde değişen yüzeyler.

Sabit taramada bu bölgeler de güvenilir köşeler ve sınırlar kadar dizi modellemesine katılır. Böylece belirsiz özellikler uzak bölgelerle etkileşime girerek eşleştirme sinyaline gürültü ekleyebilir. Şekil 1’de JamMa’nın ScanNet iç mekânlarında çok sayıda yanlış eşleşme ürettiği örnekler gösterilmiştir. Yeşil çizgiler olumlu, kırmızı çizgiler olumsuz eşleşmeleri temsil etmektedir.

GamMa’nın genel mimarisi

Şekil 2’deki mimari dört ana aşamadan oluşmaktadır:

  1. Yerel özelliklerin çıkarılması,
  2. Gated Deformable Mamba ile kaba ölçekli özelliklerin seçilmesi ve modellenmesi,
  3. Yerel pencerelerde ince eşleştirme,
  4. Canny kenar denetimiyle özellik konumlarının eğitilmesi.

Girdi olarak iki görüntü \(I_A\) ve \(I_B\) alınmaktadır. ConvNeXtV2-N omurgası iki çözünürlükte özellik üretmektedir:

  • Girdi çözünürlüğünün \(1/8\)’inde 256 kanallı kaba özellikler,
  • Girdi çözünürlüğünün \(1/2\)’sinde 64 kanallı ince özellikler.

ConvNeXtV2 omurgasının yaklaşık 0,65 milyon parametresi bulunmaktadır. GamMa modelinin tamamı ise tabloda 5,7 milyon parametre olarak verilmiştir.

Bilgilendirici özellik nasıl tanımlanmıştır?

Çalışma, bir özellik konumunun bilgilendiriciliğini üç kavramsal bileşenle ifade etmektedir:

\[ S_i = \alpha S_i^{struct} + \beta S_i^{distinct} + \gamma S_i^{consistency}. \]

Burada:

  • \(S_i^{struct}\), kenar, köşe veya doku gibi yapısal belirginliği;
  • \(S_i^{distinct}\), özelliğin çevresindeki bölgelerden ayırt edilebilirliğini;
  • \(S_i^{consistency}\), iki görüntü arasında eşleşme cevabının kararlılığını

temsil eder.

Bu üç değer uygulamada ayrı ayrı hesaplanmamaktadır. Gated Index Network, eşleşme kaybından gelen denetim altında hangi bölgelerin yararlı olduğunu uçtan uca öğrenmektedir. Denklem, modelin hedeflediği bilgilendiricilik kavramını açıklayan teorik bir çerçevedir.

Gated Deformable Scanning nasıl çalışmaktadır?

Kaba özellik haritaları:

\[ \mathbf{x}\in\mathbb{R}^{2\times H\times W\times C} \]

biçimindedir. İlk boyut görüntü çiftini, \(H\) ve \(W\) uzaysal boyutları, \(C\) ise kanal sayısını gösterir.

Standart taramada görüntü hücreleri sol üstten sağ alta sabit raster sırasıyla dizilir. GamMa ise her konum için öğrenilebilir bir ofset üretmektedir:

\[ \Delta t\in\mathbb{R}^{2\times H\times W\times1}. \]

Başlangıç tarama indeksi \(t_i\), \([-1,1]\) aralığına normalize edilir. Ağın tahmin ettiği ofset de `tanh` fonksiyonuyla aynı aralığa sınırlandırılır:

\[ t_D=t_i+\Delta t. \]

Konumlar \(t_D\) değerlerine göre sıralanır ve yalnızca en yüksek sıradaki \(K\) özellik korunur. Varsayılan ayarda:

\[ K=\frac{H\times W}{2}. \]

Başka bir ifadeyle kaba özellik konumlarının yarısı Mamba dizi modellemesine alınmaktadır. Amaç yalnızca en yüksek aktivasyonlu bölgeleri seçmek değil, iki görüntü arasında tutarlı olmayan, tekrarlayan veya geometrik olarak belirsiz bölgeleri bastırmaktır.

Gated Index Network yapısı

Gated Index Network, özellikleri iki paralel derinlik-ayrılabilir evrişim kolundan geçirmektedir. Bir kol doğrudan yerel yapısal cevap üretirken diğer kol GroupNorm ve GELU kullanarak uyarlamalı modülasyon oluşturmaktadır.

İki kolun çıktısı eleman bazında çarpılmaktadır:

\[ F_g=F_1\odot GELU(GN(F_2)). \]

Bu kapılama işleminde her iki koldan da destek alan cevaplar güçlenirken zayıf veya tutarsız cevapların bastırılması amaçlanmaktadır. Son ofset bir \(1\times1\) evrişimle üretilir:

\[ \Delta t=Conv_{1\times1}(F_g). \]

Şekil 9’daki seçili konumlar bina cepheleri, kubbe sınırları ve ayrıntılı mimari yapılarda yoğunlaşırken gökyüzü gibi homojen bölgelerde seyrekleşmektedir. Ancak Şekil 9’un başlığı yanlışlıkla Canny kaybı karşılaştırmasından söz etmektedir.

Sıralama işleminin türev sorunu

Özelliklerin sıralanması klasik biçimiyle türevlenebilir değildir. Bu nedenle sıralamadan geçen gradyanın doğrudan deformasyon indeksine aktarılması mümkün değildir.

Araştırmacılar, son görüntü dizisi boyutundaki gradyanları ortalayıp deformasyon indeksine geri yayarak yaklaşık bir gradyan kullanmıştır. Bu yaklaşım eğitimi mümkün kılmaktadır; ancak sıralama işleminin gerçek türevi değildir. Yaklaşımın başka gradyan kestirim yöntemleriyle karşılaştırması veya hata analizi verilmemiştir.

Joint Mamba ve özelliklerin geri birleştirilmesi

Seçilen özellikler kompakt tek boyutlu dizilere dönüştürülür. Joint Mamba, iki görüntüden gelen özellikler arasında uzun menzilli ilişkileri modellemektedir. Uygulamada dört yönlü dizi ve üst üste yerleştirilmiş dört Mamba bloğu kullanılmaktadır.

Gated Deformable Merge, işlenen özellikleri ters indeksler yardımıyla özgün \(1/8\) çözünürlüklü konumlarına geri yerleştirir. Yalnızca seçilen özelliklerin Mamba işleminden geçmesi, seçili olmayan bölgeler veya farklı diziler arasındaki doğrudan etkileşimi sınırlayabilir. Bu eksikliği azaltmak için standart evrişimlerden oluşan ek bir kapılı birleştirme birimi kullanılmıştır:

\[ \sigma=GELU(Conv_3(F_{in})), \]

\[ F_{out}=Conv_3\left(\sigma\cdot Conv_3(F_{in})\right). \]

İnce düzey eşleştirme

Kaba eşleştirmelerin ardından, tahmin edilen konumların çevresinden daha yüksek çözünürlüklü özellik pencereleri kesilmektedir. Bu pencerelerde alt piksel düzeyinde ince eşleştirme gerçekleştirilir.

Kaba aşama görüntünün genelinde olası karşılıkları bulurken ince aşama konumu küçük bir yerel pencere içinde daha kesin hâle getirir. Böylece bütün görüntü üzerinde yüksek çözünürlüklü yoğun işlem yapılmadan konum hassasiyeti artırılmaya çalışılır.

Canny kenar kaybı neden eklenmiştir?

Zayıf dokulu sahnelerde duvar veya masa yüzeyi gibi geniş alanlar ayırt edici görsel bilgi taşımaz. Buna karşılık nesne sınırları, duvar birleşimleri ve köşeler bakış açısı değişse bile daha kararlı geometrik yapılar sağlayabilir.

Canny kenar kaybının eğitim akışı şöyledir:

  1. Girdi görüntüsü ince eşleştirme çözünürlüğüne bilineer interpolasyonla küçültülür.
  2. Küçültülen görüntüye Canny kenar algılama uygulanır.
  3. Kaba eşleştirme konumu çevresinden bir kenar penceresi kesilir.
  4. Penceredeki kenar konumu iki boyutlu `argmax` işlemiyle seçilir.
  5. Tahmin edilen ince konum ile kenar tabanlı hedef konum arasındaki L1 farkı hesaplanır.

\[ L_{canny}= \frac{1}{N} \sum_{i=1}^{N} \left\| p_{idx}^{(i)}-p_{idx}^{gt,(i)} \right\|_1. \]

Bu kayıp, gerçek eşleşme noktasının mutlaka bir kenar üzerinde olduğunu kanıtlamaz. Eğitim sırasında eşleşmeleri geometrik açıdan kararlı kabul edilen yapılara yönlendiren yardımcı bir düzenleyicidir.

Toplam eğitim kaybı

Model dört kayıp bileşeniyle eğitilmiştir:

  • Kaba eşleştirme odak kaybı \(L_c\),
  • İnce eşleştirme odak kaybı \(L_f\),
  • Canny kenar kaybı \(L_{canny}\),
  • Alt piksel epipolar geometri kaybı \(L_s\).

Alt piksel kaybı, temel matris yerine iki normalize görüntü noktası ve öz matris \(E\) üzerinden simetrik epipolar uzaklığı kullanmaktadır:

\[ L_s= \frac{1}{|M_f|} \sum_{(x,y)\in M_f} \frac{(x^{\top}Ey)^2} {(Ey)_1^2+(Ey)_2^2+(E^{\top}x)_1^2+(E^{\top}x)_2^2}. \]

Toplam kayıp:

\[ L_{total} = \lambda_cL_c+ \lambda_fL_f+ \lambda_{canny}L_{canny}+ \lambda_sL_s \]

olarak tanımlanmıştır. Katsayılar:

  • \(\lambda_c=1\),
  • \(\lambda_f=1\),
  • \(\lambda_{canny}=0{,}5\),
  • \(\lambda_s=10^4\)

şeklindedir. Alt piksel kaybının ham değeri yaklaşık \(10^{-4}\) veya daha küçük olduğu için büyük bir ağırlık kullanıldığı açıklanmıştır.

Eğitim kurulumu

AyarDeğer
Eğitim veri kümesiMegaDepth
Eğitim süresi60 dönem
OptimizasyonAdamW
Başlangıç öğrenme oranı2 × 10−4
Öğrenme oranı planıKosinüs azalma ve bir dönem doğrusal ısınma
Toplu iş boyutu8
Eğitim görüntüsü832 × 832, yeniden boyutlandırma ve doldurma
Focal loss parametreleriα = 0,25; γ = 2
Canny eşikleri0,1 ve 0,2
Mamba blokları4
Seçilen özellik oranıK = 1/2
Donanımİki NVIDIA A100 GPU
Alanlar arası testlerde ince ayarYapılmamıştır

MegaDepth sonuçları

MegaDepth, geniş bakış açısı, ışık değişimi ve tekrarlayan mimari desenler içeren dış mekân görüntülerinden oluşmaktadır. Çalışma, Sacré-Cœur ve St. Peter’s Square sahnelerinden 1.500 görüntü çiftini test etmiş ve kamera pozunu LO-RANSAC ile hesaplamıştır.

YöntemParametreGFLOPSüreAUC@5°AUC@10°AUC@20°
JamMa5,7 M202,937,2 ms64,177,486,5
GamMa5,7 M202,537,9 ms65,278,187,0
DKM, yoğun72,3 M1424,5369,2 ms67,379,788,1
RoMa, yoğun111,3 M2014,3549,9 ms68,580,688,8

GamMa, JamMa’ya göre aynı parametre sayısı ve benzer hesaplama maliyetiyle 1,1, 0,7 ve 0,5 AUC puanı kazanmıştır. Çalışma süresi JamMa’dan 0,7 ms daha uzundur; bu nedenle GamMa’nın JamMa’dan daha hızlı olduğu söylenemez. Avantajı, benzer hız ve boyutta daha yüksek doğruluk sağlamasıdır.

Yoğun eşleştiriciler daha yüksek AUC üretmiştir. Bununla birlikte DKM yaklaşık 7,7 kat, RoMa yaklaşık 10,5 kat daha uzun ölçülen çalışma süresine ve çok daha fazla parametreye sahiptir.

Aachen çoklu görünüm yeniden yapılandırması

Aachen v1.1, gündüz-gece ve bakış açısı değişimleri içeren dış mekân görsel konumlama veri kümesidir. Çalışmada üç ölçüt kullanılmıştır:

  • mtl: Ortalama özellik izi uzunluğu; yüksek olması istenir.
  • mre: Ortalama yeniden izdüşüm hatası; düşük olması istenir.
  • mopi: Görüntü başına ortalama gözlem sayısı; eşleşme miktarını gösterir.
Yöntemmtlmremopi
LoFTR5,111,244432
JamMa4,481,193050
GamMa, Canny kaybı olmadan4,431,142796
GamMa5,161,132765

GamMa en uzun ortalama izi ve en düşük yeniden izdüşüm hatasını üretmiştir. Görüntü başına eşleşme sayısı LoFTR ve ASpanFormer’dan daha düşüktür. Çalışmanın yorumu, modelin çok sayıda eşleşme yerine daha az fakat geometrik açıdan daha kararlı eşleşme koruduğudur.

Canny kaybının kaldırılması mtl değerini 5,16’dan 4,43’e düşürmüştür. Bu sonuç, kenar denetiminin çoklu görüntüler boyunca iz sürekliliğine katkı sağladığını düşündürmektedir.

Sabit ve deforme edilebilir tarama karşılaştırması

KurulumAUC@5°AUC@10°AUC@20°
Sabit tarama62,676,286,1
Gated Index Network olmadan63,276,586,0
Gated Deformable Scanning65,278,187,0

Kapılı deforme edilebilir tarama sabit taramaya göre 5°, 10° ve 20° eşiklerinde sırasıyla 2,6, 1,9 ve 0,9 puan kazandırmıştır. Makale paragrafında son fark 1,9 olarak verilmiş olsa da tablo 0,9 göstermektedir.

Şekil 7’de deforme edilebilir tarama, bina sınırlarında daha belirgin ve arka planda daha düşük benzerlik cevabı üretmiştir. Sabit taramanın cevapları daha dağınık görünmektedir. Bu görsel bulgu, seçici mekanizmanın ön plan ve yapısal sınırları vurguladığı yorumunu desteklemektedir; ancak benzerlik haritaları tek başına nedensel bir kanıt değildir.

Kaç özellik seçilmelidir?

Korunan özellik oranıAUC@5°Süre
Tümü, K = 164,640,5 ms
Yarısı, K = 1/265,237,9 ms
Dörtte biri, K = 1/463,936,7 ms
Sekizde biri, K = 1/861,135,9 ms

Bütün özelliklerin işlenmesi en yüksek doğruluğu sağlamamıştır. Özelliklerin yarısının seçilmesi hem AUC’yi 0,6 puan artırmış hem de süreyi 2,6 ms azaltmıştır. Buna karşılık daha agresif filtreleme önemli eşleşme kanıtlarını kaybettirmiştir. K = 1/8, yalnızca 2 ms ek hız kazancı karşılığında K = 1/2’ye göre 4,1 AUC puanı kaybetmiştir.

Canny kenar kaybının etkisi

MegaDepth sonuçlarında Canny kaybının etkisi sınırlıdır:

KurulumAUC@5°AUC@10°AUC@20°
Canny kaybı olmadan65,178,187,1
Canny kaybıyla65,278,187,0

5° eşiğinde 0,1 puan artış, 10°’de değişim yok ve 20°’de 0,1 puan düşüş bulunmaktadır. Dolayısıyla MegaDepth tablosu Canny kaybının genel doğruluğu belirgin biçimde artırdığını göstermemektedir.

ScanNet’in zayıf dokulu iç mekânlarında sonuç daha belirgindir:

KurulumAUC@5°AUC@10°AUC@20°
Canny kaybı olmadan20,137,954,0
Canny kaybıyla21,038,454,4

Kazançlar sırasıyla 0,9, 0,5 ve 0,4 puandır. Şekil 8’de Canny denetimli eşleşmelerin iç mekân duvar kesişimleri ve nesne sınırlarında daha düzenli toplandığı görülmektedir.

HPatches alanlar arası genelleme sonucu

HPatches deneyinde bütün modeller MegaDepth üzerinde eğitilmiş ve HPatches’e ince ayar yapılmamıştır. Her yöntem için en yüksek puanlı 1.000 eşleşme kullanılmıştır.

YöntemAUC@3 pikselAUC@5 pikselAUC@10 piksel
JamMa61,871,581,2
GamMa65,575,484,3
LoFTR65,975,684,6
ASpanFormer66,376,385,3
ELoFTR66,576,485,5

GamMa, JamMa’yı 3,7, 3,9 ve 3,1 puan geçmiştir. Kaynak metin orta eşikte 4,9 puan yazmaktadır; tabloya göre doğru aritmetik fark 3,9’dur.

GamMa, Transformer tabanlı LoFTR, ASpanFormer ve ELoFTR’ın biraz gerisinde kalmıştır. Bu nedenle HPatches sonucu genel bir en iyi yöntem iddiasını değil, JamMa’ya göre alanlar arası aktarımın iyileştiğini desteklemektedir.

ScanNet alanlar arası genelleme sonucu

ScanNet’te modeller yalnızca MegaDepth üzerinde eğitilmiş ve 1.500 iç mekân görüntü çiftinde doğrudan test edilmiştir.

YöntemAUC@5°AUC@10°AUC@20°
JamMa18,535,651,3
GamMa21,038,454,4
ASpanFormer22,339,355,3

GamMa, JamMa’ya göre 2,5, 2,8 ve 3,1 puan kazanmıştır. Şekil 10’da GamMa daha fazla olumlu eşleşme üretirken yanlış eşleşme sayısının da arttığı görülmektedir. Yani modelin alanlar arası dayanıklılığı yükselmiş, fakat hata tamamen ortadan kalkmamıştır.

Omurga ağı seçimi

OmurgaAUC@5°AUC@10°AUC@20°
DINOv3, ağırlıklar dondurulmuş63,977,286,1
DINOv3, ince ayarlı65,177,987,0
GELAN65,378,087,1
ConvNeXtV265,278,187,0

Sonuçlar üç eğitilebilir omurganın birbirine çok yakın olduğunu göstermektedir. GELAN 5° ve 20° eşiklerinde çok küçük bir üstünlük sağlarken ConvNeXtV2 10°’de en yüksek sonucu vermiştir. Araştırmacılar, 0,65 milyon parametreli hafif ConvNeXtV2’yi verimlilik nedeniyle seçmiştir.

Çalışmanın güçlü yönleri

  • Özellik seçimi, dizi modellemesinden önce açık bir mimari bileşen olarak ele alınmıştır.
  • Model, aynı parametre sayısıyla JamMa’dan daha yüksek MegaDepth sonucu üretmiştir.
  • Seçilen özellik oranı doğruluk ve çalışma süresi açısından ayrıca incelenmiştir.
  • Sabit ve deforme edilebilir tarama nicel ve görsel olarak karşılaştırılmıştır.
  • Canny kaybının zengin dokulu ve zayıf dokulu veri kümelerindeki etkisi ayrıştırılmıştır.
  • MegaDepth dışında HPatches, ScanNet ve Aachen üzerinde alanlar arası test yapılmıştır.
  • Parametre, GFLOP ve çalışma süresi doğruluk ölçütleriyle birlikte verilmiştir.
  • Veri miktarı ile eşleşme kalitesi arasındaki mopi–mtl–mre dengesi tartışılmıştır.
  • Modelin yoğun eşleştiricilerden daha az hesaplama kullandığı açık biçimde gösterilmiştir.

Çalışmanın sınırlılıkları

  • Çalışma hakem değerlendirmesinden geçmemiştir.
  • Metin içi atıflar `[?]` biçimindedir ve kaynakça bulunmamaktadır.
  • HPatches ve tarama ablasyonundaki bazı farklar yanlış hesaplanmıştır.
  • Sonuçlar tek veya belirsiz sayıda eğitim çalışmasına dayanmaktadır; standart sapma ve güven aralığı verilmemiştir.
  • Çalışma süresinin ölçüm protokolü, ısınma turu, parti boyutu ve bellek kullanımı açıklanmamıştır.
  • Sıralama işlemi için kullanılan yaklaşık gradyanın alternatif yöntemlerle karşılaştırması yoktur.
  • Gated Index Network’ün seçtiği bölgelerin gerçek geometrik doğrulukla ilişkisi doğrudan etiketlenmiş bir güvenilirlik deneyiyle ölçülmemiştir.
  • Canny kaybı MegaDepth’te tutarlı iyileşme sağlamamıştır.
  • ScanNet’te olumlu eşleşme sayısıyla birlikte yanlış eşleşme sayısı da artmıştır.
  • HPatches’te bazı Transformer tabanlı yarı yoğun yöntemlerin gerisinde kalmıştır.
  • Yoğun DKM ve RoMa yöntemleri MegaDepth’te daha yüksek doğruluk sağlamıştır.
  • Hareket bulanıklığı, ağır örtülme ve çok büyük bakış açısı değişimleri için ayrı kontrollü deney verilmemiştir.
  • Mobil, gömülü veya düşük güçlü donanım testi yapılmamıştır.
  • Kodun yayımlanacağı belirtilmiş, ancak bu sürümde yeniden üretim paketi sunulmamıştır.
  • Yazarlar kullanılan verileri paylaşma izinlerinin bulunmadığını bildirmiştir.

Çalışma neyi desteklemektedir?

  • Bütün kaba özelliklerin eşit biçimde işlenmesi en iyi doğruluk–hız dengesini sağlamayabilir.
  • Özelliklerin yarısının öğrenilebilir biçimde seçilmesi, bütün özelliklerin işlenmesinden daha iyi sonuç verebilir.
  • Gated Deformable Scanning, sabit taramaya göre MegaDepth performansını artırabilir.
  • Seçilen özellikler mimari sınırlar ve doku açısından zengin ön plan bölgelerinde yoğunlaşmaktadır.
  • Canny tabanlı ek denetim zayıf dokulu iç mekânlarda eşleşme kararlılığını artırabilir.
  • GamMa, JamMa’ya göre HPatches ve ScanNet’te daha güçlü sıfır ince ayarlı aktarım göstermektedir.
  • GamMa yoğun eşleştiricilerden daha düşük hesaplama maliyetiyle rekabetçi doğruluk sağlayabilir.

Çalışma neyi kanıtlamamaktadır?

  • GamMa’nın bütün yerel özellik eşleştirme yöntemlerinden daha doğru olduğunu kanıtlamamaktadır.
  • JamMa’dan daha hızlı olduğunu göstermemektedir.
  • Canny kenarlarının her sahnede eşleşme için en doğru konumlar olduğunu kanıtlamamaktadır.
  • Seçilen yüzde 50 oranının bütün veri kümeleri ve çözünürlükler için evrensel olarak en iyi olduğunu göstermemektedir.
  • Gerçek zamanlı mobil veya gömülü sistem performansını doğrulamamaktadır.
  • Robot, araç veya insansız hava aracı üzerinde uçtan uca saha başarısı sunmamaktadır.
  • Şiddetli örtülme ve çok büyük bakış açısı değişimlerinde güvenilirliği kesinleştirmemektedir.
  • Üretilen eşleşmelerin güvenlik açısından kritik otonom sistemlerde tek başına yeterli olduğunu göstermemektedir.
  • Türkiye’deki görüntüler veya yerli sistemler için doğrulanmış başarı oranı vermemektedir.

Gelecekte hangi çalışmalar gereklidir?

  • Birden fazla rastgele tohumla eğitim yapılıp ortalama ve standart sapma raporlanmalıdır.
  • Çalışma süresi, bellek ve enerji tüketimi farklı GPU, CPU ve uç cihazlarda ölçülmelidir.
  • Özellik seçiminin kalibrasyonu ve seçilen noktaların gerçek eşleşme güvenilirliği incelenmelidir.
  • Türevlenebilir sıralama veya farklı top-K kestirim yöntemleri karşılaştırılmalıdır.
  • Büyük bakış açısı, örtülme, hareket bulanıklığı ve mevsim değişimi için ayrı testler yapılmalıdır.
  • Mobil robot, araç ve insansız hava aracı üzerinde gerçek zamanlı SLAM deneyleri gerçekleştirilmelidir.
  • Türk kentleri, tarihi yapılar ve afet sonrası görüntüler gibi yerel alan kaymaları sınanmalıdır.
  • Kaynak kodu, eğitim yapılandırması, model ağırlıkları ve yeniden üretim betikleri yayımlanmalıdır.
  • Eksik kaynakça ve metin–tablo sayısal tutarsızlıkları hakemli sürümde düzeltilmelidir.

Çalışmanın Yöntemi ve Bulguları

Teknik yöntem özeti

BileşenUygulanan yöntem
Temel görevİki görüntü arasında yarı yoğun yerel özellik eşleştirme
Özellik omurgasıConvNeXtV2-N
Kaba özellik çözünürlüğüGirdi çözünürlüğünün 1/8’i, 256 kanal
İnce özellik çözünürlüğüGirdi çözünürlüğünün 1/2’si, 64 kanal
Temel yenilikGated Deformable Mamba
Özellik seçimiÖğrenilebilir indeks ofseti, sıralama ve top-K seçimi
Varsayılan KKaba özellik konumlarının yarısı
Dizi modellemeDört üst üste Mamba bloğu ve yönlü diziler
Geri birleştirmeTers indeksleme ve kapılı evrişim birimi
İnce eşleştirmeKaba tahmin çevresinde yerel özellik penceresi
Ek geometrik denetimCanny kenar tabanlı L1 konum kaybı
Alt piksel denetimiSimetrik epipolar uzaklık
EğitimMegaDepth, 60 dönem, AdamW
Alanlar arası testHPatches ve ScanNet; ince ayar yapılmadan
Çoklu görünüm testiAachen v1.1 ve HLoc
Model boyutu5,7 milyon parametre
Hesaplama202,5 GFLOP
Ölçülen süre37,9 ms

Temel karşılaştırmalı bulgular

TestGamMa sonucuTemel karşılaştırmaYorum
MegaDepth65,2 / 78,1 / 87,0JamMa: 64,1 / 77,4 / 86,5Benzer maliyetle daha yüksek doğruluk
HPatches65,5 / 75,4 / 84,3JamMa: 61,8 / 71,5 / 81,2Alanlar arası kazanç; bazı Transformer modellerinin gerisinde
ScanNet21,0 / 38,4 / 54,4JamMa: 18,5 / 35,6 / 51,3İç mekân alan kaymasında daha dayanıklı
Aachenmtl 5,16; mre 1,13JamMa: 4,48; 1,19Daha uzun iz ve daha düşük yeniden izdüşüm hatası

Ablasyonların gösterdiği ana mekanizmalar

  • Sabit taramanın kapılı deforme edilebilir taramayla değiştirilmesi en güçlü tek bileşen kazançlarından birini sağlamıştır.
  • Gated Index Network kaldırıldığında AUC@5° 65,2’den 63,2’ye düşmüştür.
  • Bütün özellikler yerine yarısının seçilmesi hem doğruluk hem çalışma süresini iyileştirmiştir.
  • Özelliklerin yalnız dörtte veya sekizde birini korumak hesaplama süresinde küçük, doğrulukta daha büyük kayıp oluşturmuştur.
  • Canny kaybı zengin dokulu MegaDepth’te sınırlı, zayıf dokulu ScanNet ve çoklu görünüm Aachen testinde daha belirgin katkı sağlamıştır.
  • Omurga seçiminin etkisi öğrenilebilir özellik seçimi kadar büyük olmamıştır.

Görsellerin bilimsel anlamı

GörselGösterilen içerikBilimsel işlevi
Grafik özetÖzellik çıkarma, seçici tarama, Mamba, ince eşleştirme ve Canny kaybıGamMa işlem hattını tek şemada göstermek
Şekil 1JamMa’nın ScanNet eşleşmeleriAlan kaymasında yanlış eşleşme sorununu göstermek
Şekil 2GamMa’nın genel mimarisiKaba ve ince aşamalarla seçici Mamba akışını açıklamak
Şekil 3Gated Deformable ScanningKonum seçme ve dizi oluşturma sürecini göstermek
Şekil 4Gated Index Networkİki evrişim kolu ve kapılı etkileşimi açıklamak
Şekil 5Canny Edge LossKenar hedefinin nasıl üretildiğini göstermek
Şekil 6LoFTR, JamMa ve GamMa eşleşmeleriMegaDepth üzerinde nitel karşılaştırma sunmak
Şekil 7Sabit ve deforme edilebilir tarama ısı haritalarıÖn plan ve sınır cevaplarının yoğunlaşmasını göstermek
Şekil 8Canny kaybıyla ve kayıpsız eşleşme konumlarıKenar denetiminin zayıf dokulu sahnelerdeki etkisini göstermek
Şekil 9Seçilen K özellik konumlarıSeçimin mimari ve doku açısından zengin bölgelerde yoğunlaştığını göstermek
Şekil 10JamMa ve GamMa ScanNet sonuçlarıİnce ayarsız alanlar arası genelleme farkını göstermek

Tekrar üretim açısından kritik ayrıntılar

  • Görüntüler eğitimde 832 × 832 boyutuna getirilmelidir.
  • Kaba ve ince özellik kanalları sırasıyla 256 ve 64’tür.
  • Dört Mamba bloğu ve K = 1/2 yapılandırması kullanılmaktadır.
  • Canny düşük ve yüksek eşikleri 0,1 ve 0,2’dir.
  • Focal loss için α = 0,25 ve γ = 2’dir.
  • Alt piksel kaybı 104 katsayısıyla ağırlıklandırılmıştır.
  • Eğitim 60 dönem, AdamW, 2 × 10−4 başlangıç öğrenme oranı ve toplu iş boyutu 8 ile yapılmıştır.
  • HPatches karşılaştırmasında yöntem başına yalnız en yüksek 1.000 eşleşme kullanılmıştır.
  • MegaDepth ve ScanNet testlerinde 1.500 görüntü çifti değerlendirilmiştir.
  • Sonuçları yeniden üretmek için eksik kaynakça, kod, model ağırlıkları ve rastgele tohumlar gereklidir.

Sonuçların teknik yorumu

GamMa’nın sonuçları, yarı yoğun görüntü eşleştirmede bilgi miktarından çok bilgi kalitesinin belirleyici olabileceğini göstermektedir. Bütün kaba özellikleri diziye aktarmak hem süreyi uzatmış hem de doğruluğu azaltmıştır. Özelliklerin yarısını seçmek gürültülü etkileşimleri azaltırken gerekli geometrik kanıtın büyük bölümünü korumuştur.

Modelin esas kazancı parametre sayısını veya hesaplama yükünü önemli ölçüde artırmadan JamMa’nın alanlar arası dayanıklılığını geliştirmesidir. MegaDepth kazancı görece küçükken HPatches ve ScanNet farklarının daha büyük olması, seçici taramanın eğitim ve test alanı farklılaştığında daha değerli olabileceğine işaret etmektedir.

Canny kenar kaybının yararı sahneye bağımlıdır. Zengin dokulu dış mekânda katkı çok sınırlı kalırken iç mekânlarda geometrik sınırlar ek bilgi sağlamıştır. Bu durum, kenar tabanlı düzenleyicilerin evrensel değil koşula bağlı araçlar olduğunu göstermektedir.

Kaynak ve Yöntem Notu

Çalışmanın tam özgün adı: GamMa: Selecting Informative Features for Fast and Robust Local Feature Matching

Yazarlar: Jianhao Xu, Xiangtao Fan, Hongdeng Jian, Chen Xu, Weijia Bei, Qifeng Ge ve Ruijie Han.

Yazar sıralaması: Kaynakta verildiği biçimde korunmuştur.

Eş birinci yazar: Eşit katkı veya eş birinci yazarlık beyanı yer almamaktadır.

Sorumlu yazar: Hongdeng Jian.

Sorumlu yazar e-posta adresi: jianhd@radi.ac.cn

Diğer iletişim adresleri: xujianhao22@mails.ucas.ac.cn; fanxt@radi.ac.cn; xuchen@aircas.ac.cn; beiweijia21@mails.ucas.ac.cn; geqifeng21@mails.ucas.ac.cn; hanruijie23@mails.ucas.ac.cn.

Kurum 1: Key Laboratory of Digital Earth Science, Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing 100094, Çin.

Kurum 2: International Research Center of Big Data for Sustainable Development Goals, Beijing 100094, Çin.

Kurum 3: University of Chinese Academy of Sciences, Beijing 100094, Çin.

DOI:10.2139/ssrn.6996789

Resmî kaynak bağlantısı:SSRN resmî kayıt sayfası

Yayın platformu: SSRN.

Yayın yılı: 2026.

Metinde verilen tarih: 25 Haziran 2026.

Hedef dergi: Yüklenen sürüm “Preprint submitted to Pattern Recognition” ibaresini taşımaktadır.

Dergi ve yayınevi durumu: Çalışmanın Pattern Recognition tarafından kabul edildiğini veya hakemli dergi sürümünün yayımlandığını gösteren bilgi bu kaynakta bulunmamaktadır. Bu nedenle hakemli dergi yayını olarak sunulamaz.

Kaynak türü: Bilgisayarlı görüde yarı yoğun yerel özellik eşleştirme için yeni bir sinir ağı mimarisi geliştiren ve dört veri kümesinde sınayan preprint araştırma makalesi.

Hakemlik durumu: Çalışma hakem değerlendirmesinden geçmemiştir.

Jianhao Xu’nun katkıları: Kavramsallaştırma, yöntem, biçimsel analiz, veri düzenleme, özgün taslak yazımı ve araştırma.

Xiangtao Fan’ın katkıları: Kavramsallaştırma, danışmanlık, inceleme ve düzenleme, doğrulama ve finansman temini.

Hongdeng Jian’ın katkıları: Doğrulama, inceleme ve düzenleme ile yöntem.

Chen Xu’nun katkıları: Kaynak sağlama, inceleme ve düzenleme ile finansman temini.

Weijia Bei’nin katkıları: Yöntem.

Qifeng Ge’nin katkıları: Yazılım ve görselleştirme.

Ruijie Han’ın katkıları: Veri düzenleme.

Finansman: Provincial Special Funding for the Construction of Chenzhou National Sustainable Development Agenda Innovation Demonstration Zone, No. 2023sfq69.

Çıkar çatışması: Yazarlar çalışmayı etkileyebilecek bilinen bir mali çıkar veya kişisel ilişki bulunmadığını beyan etmiştir.

Veri erişimi: Yazarlar verileri paylaşma izinlerinin bulunmadığını belirtmiştir.

Kod erişimi: Metin, kodun GitHub deposunda yayımlanacağını bildirmektedir. Yüklenen sürümde sabitlenmiş bir yazılım sürümü, model ağırlığı veya yeniden üretim paketi sunulmamıştır.

Kaynakça sorunu: Metindeki atıflar `[?]` biçiminde görünmekte ve kaynakça bölümü bulunmamaktadır. Bu durum önceki yöntemlerin, veri kümelerinin ve kullanılan yazılımların özgün kaynaklarının doğrulanmasını engellemektedir.

Sayısal tutarlılık uyarısı: HPatches’te orta eşik kazancı tabloda 3,9 iken metinde 4,9 yazılmıştır. Gated Deformable Scanning’in AUC@20° kazancı tabloda 0,9 iken metinde 1,9 olarak verilmiştir.

Görsel tutarlılık uyarısı: Şekil 9’un açıklaması Canny kaybıyla ve kayıpsız özellik dağılımını karşılaştırdığını söylemektedir; ancak görsel yalnızca Gated Index Network tarafından seçilen K konumlarını göstermektedir.

Yorum sınırı: GamMa MegaDepth’te yarı yoğun yöntemler içinde en yüksek sonucu vermiş, ancak yoğun DKM ve RoMa’dan düşük AUC üretmiştir. HPatches’te LoFTR, ASpanFormer ve ELoFTR’ın biraz gerisinde kalmıştır. Bu nedenle çalışma, genel ve koşulsuz bir en iyi eşleştirici üstünlüğü kanıtlamamaktadır.

Bu Türkçe içerik yalnızca yüklenen çalışmanın metni, denklemleri, tabloları, mimari şemaları, eşleşme görselleri ve deney sonuçları temel alınarak hazırlanmıştır. Çalışmada bulunmayan bir saha başarısı, ticari ürün performansı, otonom sistem güvenliği veya Türkiye’ye özgü doğruluk iddiası eklenmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy