
Bu çalışma, farklı açılardan, ışık koşullarından veya ortamlardan alınmış iki görüntü arasında güvenilir karşılıklar bulmak için GamMa adlı hafif bir yarı yoğun özellik eşleştirme modeli geliştirmiştir. Model, bütün görüntü özelliklerini eşit biçimde işlemek yerine, eşleştirme açısından daha güvenilir görünen bölgeleri Mamba tabanlı dizi modellemesinden önce seçmektedir. Bu amaçla Gated Deformable Scanning, Joint Mamba ve Gated Deformable Merge bileşenlerinden oluşan bir Gated Deformable Mamba mimarisi kullanılmıştır. GamMa, MegaDepth testinde 5°, 10° ve 20° eşiklerinde sırasıyla 65,2, 78,1 ve 87,0 AUC değerlerine ulaşmış; 5,7 milyon parametre, 202,5 GFLOP ve 37,9 ms ölçülen çalışma süresiyle yarı yoğun yöntemler arasında en yüksek sonucu vermiştir. Model ayrıca yalnızca MegaDepth üzerinde eğitildiği hâlde HPatches ve ScanNet’e ince ayar yapılmadan aktarıldığında temel JamMa modelinden daha yüksek sonuçlar üretmiştir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiştir; kaynakçası eksiktir, bazı sayısal farklar metinle tablolar arasında uyuşmamaktadır ve deneylerde çoklu eğitim tekrarlarına ait standart sapma veya güven aralığı sunulmamıştır.
GamMa’nın temel düşüncesi, görüntüdeki bütün hücrelerin eşleştirme açısından aynı değere sahip olmadığıdır. Bina köşeleri, nesne sınırları ve ayırt edici dokular güvenilir geometrik ipuçları sunarken gökyüzü, boş duvarlar, tekrarlanan desenler veya bulanık bölgeler yanlış etkileşimler oluşturabilir. Gated Index Network, eşleştirme öncesinde özellik konumlarını öğrenilebilir biçimde sıralamakta ve varsayılan ayarda bunların yarısını seçmektedir. Seçilen özellikler Mamba bloklarıyla modellenmekte, daha sonra özgün iki boyutlu özellik haritalarına geri yerleştirilmektedir. Canny kenar kaybı ise özellikle dokusu zayıf iç mekânlarda eşleşmelerin duvar kesişimleri, nesne sınırları ve köşeler gibi daha kararlı geometrik yapılara yönelmesini amaçlamaktadır.
Türkiye açısından değerlendirme: GamMa yaklaşımı; insansız hava araçlarıyla haritalama, otonom robot konumlama, artırılmış gerçeklik, kültürel mirasın üç boyutlu belgelenmesi, uydu ve hava görüntülerinin eşleştirilmesi, afet sonrası yapı karşılaştırması ve endüstriyel görsel denetim sistemlerinde Türkiye’de araştırılabilir. Uygulamaya geçmeden önce modelin Türkiye’ye özgü kent dokuları, kırsal alanlar, düşük ışıklı iç mekânlar, deprem sonrası hasarlı yapılar, tekrarlayan cepheler ve farklı kamera türleri üzerinde yeniden sınanması gerekir. Gerçek zamanlı kullanım için gömülü GPU, mobil işlemci ve düşük güçlü uç cihazlarda çalışma süresi ile bellek tüketimi ayrıca ölçülmelidir. Çalışma Türkiye’de toplanmış bir veri kümesi, yerli bir otonom sistem, operasyonel saha deneyi veya güvenlik sertifikasyonu sunmadığından Türkiye’ye özgü başarı oranı ya da saha güvenilirliği doğrudan çıkarılamaz.
Yerel özellik eşleştirme nedir?
Yerel özellik eşleştirme, aynı fiziksel noktanın veya yapının iki farklı görüntüdeki karşılığını bulma problemidir. Bir binanın köşesi, pencere kenarı, yol çizgisi veya nesne sınırı iki görüntüde farklı ölçek, açı ve aydınlatmayla görünse bile doğru eşleştirme sistemi bu noktalar arasında bağlantı kurabilmelidir.
Bu karşılıklar aşağıdaki uygulamalarda temel girdidir:
- Görsel konumlama ve kamera pozunun hesaplanması,
- Eşzamanlı konumlama ve haritalama (SLAM),
- Structure-from-Motion ile üç boyutlu model üretimi,
- Çok görüntülü yeniden yapılandırma,
- Görüntü hizalama ve homografi tahmini,
- Robotik ve otonom sistemlerde hareket takibi.
İki görüntü arasında çok sayıda eşleşme üretmek tek başına yeterli değildir. Yanlış eşleşmeler kamera dönüşü, öteleme ve üç boyutlu geometri tahminini bozabilir. Bu nedenle eşleşme miktarı, geometrik doğruluk, dayanıklılık ve hesaplama maliyeti birlikte değerlendirilmelidir.
Seyrek, yarı yoğun ve yoğun eşleştirme arasındaki fark
Seyrek yöntemler önce köşe veya ilgi noktası tespit eder, daha sonra bu noktalara ait tanımlayıcıları karşılaştırır. Hesaplama maliyetleri görece düşüktür; ancak dokusuz duvarlar veya tekrarlanan desenler gibi bölgelerde yeterli ve kararlı anahtar nokta üretmeyebilirler.
Yoğun yöntemler hemen hemen her piksel veya küçük görüntü bölgesi için karşılık tahmin eder. Bu yöntemler büyük görünüm değişimlerinde güçlü olabilir, fakat daha fazla parametre, bellek ve hesaplama gerektirir.
Yarı yoğun yöntemler, yoğun eşleştirmenin dayanıklılığı ile seyrek eşleştirmenin hesaplama verimliliği arasında denge kurmayı amaçlar. GamMa bu sınıfa girmektedir.
Transformer yerine Mamba neden kullanılmıştır?
Transformer tabanlı eşleştiriciler, görüntünün farklı bölgeleri arasındaki uzun menzilli ilişkileri öz dikkat mekanizmasıyla modelleyebilir. Ancak klasik öz dikkatin hesaplama maliyeti işlenen belirteç sayısının karesiyle büyür. Yarı yoğun özellik haritalarında belirteç sayısı yüksek olduğundan bu maliyet önemli olabilir.
Mamba mimarileri, uzun dizileri yaklaşık doğrusal ölçeklenen durum-uzayı modellemesiyle işleyerek daha düşük maliyetli bir alternatif sunar. JamMa adlı önceki yöntem, Mamba’yı yarı yoğun özellik eşleştirmeye uyarlamıştır. Çalışmanın çıkış noktası, JamMa’nın bütün özellik konumlarını sabit bir tarama düzeninde eşit biçimde işlemesidir.
Sabit tarama yaklaşımındaki sorun nedir?
Görüntüdeki her bölge güvenilir bir eşleştirme işareti taşımaz. Aşağıdaki bölgeler özellikle sorun oluşturabilir:
- Düz ve dokusuz yüzeyler,
- Birbirine benzeyen pencere veya tuğla dizileri,
- Gökyüzü ve tek renkli arka planlar,
- Hareket bulanıklığı bulunan bölgeler,
- İki görüntü arasında örtüşmeyen alanlar,
- Bakış açısına göre görünümü güçlü biçimde değişen yüzeyler.
Sabit taramada bu bölgeler de güvenilir köşeler ve sınırlar kadar dizi modellemesine katılır. Böylece belirsiz özellikler uzak bölgelerle etkileşime girerek eşleştirme sinyaline gürültü ekleyebilir. Şekil 1’de JamMa’nın ScanNet iç mekânlarında çok sayıda yanlış eşleşme ürettiği örnekler gösterilmiştir. Yeşil çizgiler olumlu, kırmızı çizgiler olumsuz eşleşmeleri temsil etmektedir.
GamMa’nın genel mimarisi
Şekil 2’deki mimari dört ana aşamadan oluşmaktadır:
- Yerel özelliklerin çıkarılması,
- Gated Deformable Mamba ile kaba ölçekli özelliklerin seçilmesi ve modellenmesi,
- Yerel pencerelerde ince eşleştirme,
- Canny kenar denetimiyle özellik konumlarının eğitilmesi.
Girdi olarak iki görüntü \(I_A\) ve \(I_B\) alınmaktadır. ConvNeXtV2-N omurgası iki çözünürlükte özellik üretmektedir:
- Girdi çözünürlüğünün \(1/8\)’inde 256 kanallı kaba özellikler,
- Girdi çözünürlüğünün \(1/2\)’sinde 64 kanallı ince özellikler.
ConvNeXtV2 omurgasının yaklaşık 0,65 milyon parametresi bulunmaktadır. GamMa modelinin tamamı ise tabloda 5,7 milyon parametre olarak verilmiştir.
Bilgilendirici özellik nasıl tanımlanmıştır?
Çalışma, bir özellik konumunun bilgilendiriciliğini üç kavramsal bileşenle ifade etmektedir:
\[ S_i = \alpha S_i^{struct} + \beta S_i^{distinct} + \gamma S_i^{consistency}. \]
Burada:
- \(S_i^{struct}\), kenar, köşe veya doku gibi yapısal belirginliği;
- \(S_i^{distinct}\), özelliğin çevresindeki bölgelerden ayırt edilebilirliğini;
- \(S_i^{consistency}\), iki görüntü arasında eşleşme cevabının kararlılığını
temsil eder.
Bu üç değer uygulamada ayrı ayrı hesaplanmamaktadır. Gated Index Network, eşleşme kaybından gelen denetim altında hangi bölgelerin yararlı olduğunu uçtan uca öğrenmektedir. Denklem, modelin hedeflediği bilgilendiricilik kavramını açıklayan teorik bir çerçevedir.
Gated Deformable Scanning nasıl çalışmaktadır?
Kaba özellik haritaları:
\[ \mathbf{x}\in\mathbb{R}^{2\times H\times W\times C} \]
biçimindedir. İlk boyut görüntü çiftini, \(H\) ve \(W\) uzaysal boyutları, \(C\) ise kanal sayısını gösterir.
Standart taramada görüntü hücreleri sol üstten sağ alta sabit raster sırasıyla dizilir. GamMa ise her konum için öğrenilebilir bir ofset üretmektedir:
\[ \Delta t\in\mathbb{R}^{2\times H\times W\times1}. \]
Başlangıç tarama indeksi \(t_i\), \([-1,1]\) aralığına normalize edilir. Ağın tahmin ettiği ofset de `tanh` fonksiyonuyla aynı aralığa sınırlandırılır:
\[ t_D=t_i+\Delta t. \]
Konumlar \(t_D\) değerlerine göre sıralanır ve yalnızca en yüksek sıradaki \(K\) özellik korunur. Varsayılan ayarda:
\[ K=\frac{H\times W}{2}. \]
Başka bir ifadeyle kaba özellik konumlarının yarısı Mamba dizi modellemesine alınmaktadır. Amaç yalnızca en yüksek aktivasyonlu bölgeleri seçmek değil, iki görüntü arasında tutarlı olmayan, tekrarlayan veya geometrik olarak belirsiz bölgeleri bastırmaktır.
Gated Index Network yapısı
Gated Index Network, özellikleri iki paralel derinlik-ayrılabilir evrişim kolundan geçirmektedir. Bir kol doğrudan yerel yapısal cevap üretirken diğer kol GroupNorm ve GELU kullanarak uyarlamalı modülasyon oluşturmaktadır.
İki kolun çıktısı eleman bazında çarpılmaktadır:
\[ F_g=F_1\odot GELU(GN(F_2)). \]
Bu kapılama işleminde her iki koldan da destek alan cevaplar güçlenirken zayıf veya tutarsız cevapların bastırılması amaçlanmaktadır. Son ofset bir \(1\times1\) evrişimle üretilir:
\[ \Delta t=Conv_{1\times1}(F_g). \]
Şekil 9’daki seçili konumlar bina cepheleri, kubbe sınırları ve ayrıntılı mimari yapılarda yoğunlaşırken gökyüzü gibi homojen bölgelerde seyrekleşmektedir. Ancak Şekil 9’un başlığı yanlışlıkla Canny kaybı karşılaştırmasından söz etmektedir.
Sıralama işleminin türev sorunu
Özelliklerin sıralanması klasik biçimiyle türevlenebilir değildir. Bu nedenle sıralamadan geçen gradyanın doğrudan deformasyon indeksine aktarılması mümkün değildir.
Araştırmacılar, son görüntü dizisi boyutundaki gradyanları ortalayıp deformasyon indeksine geri yayarak yaklaşık bir gradyan kullanmıştır. Bu yaklaşım eğitimi mümkün kılmaktadır; ancak sıralama işleminin gerçek türevi değildir. Yaklaşımın başka gradyan kestirim yöntemleriyle karşılaştırması veya hata analizi verilmemiştir.
Joint Mamba ve özelliklerin geri birleştirilmesi
Seçilen özellikler kompakt tek boyutlu dizilere dönüştürülür. Joint Mamba, iki görüntüden gelen özellikler arasında uzun menzilli ilişkileri modellemektedir. Uygulamada dört yönlü dizi ve üst üste yerleştirilmiş dört Mamba bloğu kullanılmaktadır.
Gated Deformable Merge, işlenen özellikleri ters indeksler yardımıyla özgün \(1/8\) çözünürlüklü konumlarına geri yerleştirir. Yalnızca seçilen özelliklerin Mamba işleminden geçmesi, seçili olmayan bölgeler veya farklı diziler arasındaki doğrudan etkileşimi sınırlayabilir. Bu eksikliği azaltmak için standart evrişimlerden oluşan ek bir kapılı birleştirme birimi kullanılmıştır:
\[ \sigma=GELU(Conv_3(F_{in})), \]
\[ F_{out}=Conv_3\left(\sigma\cdot Conv_3(F_{in})\right). \]
İnce düzey eşleştirme
Kaba eşleştirmelerin ardından, tahmin edilen konumların çevresinden daha yüksek çözünürlüklü özellik pencereleri kesilmektedir. Bu pencerelerde alt piksel düzeyinde ince eşleştirme gerçekleştirilir.
Kaba aşama görüntünün genelinde olası karşılıkları bulurken ince aşama konumu küçük bir yerel pencere içinde daha kesin hâle getirir. Böylece bütün görüntü üzerinde yüksek çözünürlüklü yoğun işlem yapılmadan konum hassasiyeti artırılmaya çalışılır.
Canny kenar kaybı neden eklenmiştir?
Zayıf dokulu sahnelerde duvar veya masa yüzeyi gibi geniş alanlar ayırt edici görsel bilgi taşımaz. Buna karşılık nesne sınırları, duvar birleşimleri ve köşeler bakış açısı değişse bile daha kararlı geometrik yapılar sağlayabilir.
Canny kenar kaybının eğitim akışı şöyledir:
- Girdi görüntüsü ince eşleştirme çözünürlüğüne bilineer interpolasyonla küçültülür.
- Küçültülen görüntüye Canny kenar algılama uygulanır.
- Kaba eşleştirme konumu çevresinden bir kenar penceresi kesilir.
- Penceredeki kenar konumu iki boyutlu `argmax` işlemiyle seçilir.
- Tahmin edilen ince konum ile kenar tabanlı hedef konum arasındaki L1 farkı hesaplanır.
\[ L_{canny}= \frac{1}{N} \sum_{i=1}^{N} \left\| p_{idx}^{(i)}-p_{idx}^{gt,(i)} \right\|_1. \]
Bu kayıp, gerçek eşleşme noktasının mutlaka bir kenar üzerinde olduğunu kanıtlamaz. Eğitim sırasında eşleşmeleri geometrik açıdan kararlı kabul edilen yapılara yönlendiren yardımcı bir düzenleyicidir.
Toplam eğitim kaybı
Model dört kayıp bileşeniyle eğitilmiştir:
- Kaba eşleştirme odak kaybı \(L_c\),
- İnce eşleştirme odak kaybı \(L_f\),
- Canny kenar kaybı \(L_{canny}\),
- Alt piksel epipolar geometri kaybı \(L_s\).
Alt piksel kaybı, temel matris yerine iki normalize görüntü noktası ve öz matris \(E\) üzerinden simetrik epipolar uzaklığı kullanmaktadır:
\[ L_s= \frac{1}{|M_f|} \sum_{(x,y)\in M_f} \frac{(x^{\top}Ey)^2} {(Ey)_1^2+(Ey)_2^2+(E^{\top}x)_1^2+(E^{\top}x)_2^2}. \]
Toplam kayıp:
\[ L_{total} = \lambda_cL_c+ \lambda_fL_f+ \lambda_{canny}L_{canny}+ \lambda_sL_s \]
olarak tanımlanmıştır. Katsayılar:
- \(\lambda_c=1\),
- \(\lambda_f=1\),
- \(\lambda_{canny}=0{,}5\),
- \(\lambda_s=10^4\)
şeklindedir. Alt piksel kaybının ham değeri yaklaşık \(10^{-4}\) veya daha küçük olduğu için büyük bir ağırlık kullanıldığı açıklanmıştır.
Eğitim kurulumu
| Ayar | Değer |
|---|---|
| Eğitim veri kümesi | MegaDepth |
| Eğitim süresi | 60 dönem |
| Optimizasyon | AdamW |
| Başlangıç öğrenme oranı | 2 × 10−4 |
| Öğrenme oranı planı | Kosinüs azalma ve bir dönem doğrusal ısınma |
| Toplu iş boyutu | 8 |
| Eğitim görüntüsü | 832 × 832, yeniden boyutlandırma ve doldurma |
| Focal loss parametreleri | α = 0,25; γ = 2 |
| Canny eşikleri | 0,1 ve 0,2 |
| Mamba blokları | 4 |
| Seçilen özellik oranı | K = 1/2 |
| Donanım | İki NVIDIA A100 GPU |
| Alanlar arası testlerde ince ayar | Yapılmamıştır |
MegaDepth sonuçları
MegaDepth, geniş bakış açısı, ışık değişimi ve tekrarlayan mimari desenler içeren dış mekân görüntülerinden oluşmaktadır. Çalışma, Sacré-Cœur ve St. Peter’s Square sahnelerinden 1.500 görüntü çiftini test etmiş ve kamera pozunu LO-RANSAC ile hesaplamıştır.
| Yöntem | Parametre | GFLOP | Süre | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|---|---|---|
| JamMa | 5,7 M | 202,9 | 37,2 ms | 64,1 | 77,4 | 86,5 |
| GamMa | 5,7 M | 202,5 | 37,9 ms | 65,2 | 78,1 | 87,0 |
| DKM, yoğun | 72,3 M | 1424,5 | 369,2 ms | 67,3 | 79,7 | 88,1 |
| RoMa, yoğun | 111,3 M | 2014,3 | 549,9 ms | 68,5 | 80,6 | 88,8 |
GamMa, JamMa’ya göre aynı parametre sayısı ve benzer hesaplama maliyetiyle 1,1, 0,7 ve 0,5 AUC puanı kazanmıştır. Çalışma süresi JamMa’dan 0,7 ms daha uzundur; bu nedenle GamMa’nın JamMa’dan daha hızlı olduğu söylenemez. Avantajı, benzer hız ve boyutta daha yüksek doğruluk sağlamasıdır.
Yoğun eşleştiriciler daha yüksek AUC üretmiştir. Bununla birlikte DKM yaklaşık 7,7 kat, RoMa yaklaşık 10,5 kat daha uzun ölçülen çalışma süresine ve çok daha fazla parametreye sahiptir.
Aachen çoklu görünüm yeniden yapılandırması
Aachen v1.1, gündüz-gece ve bakış açısı değişimleri içeren dış mekân görsel konumlama veri kümesidir. Çalışmada üç ölçüt kullanılmıştır:
- mtl: Ortalama özellik izi uzunluğu; yüksek olması istenir.
- mre: Ortalama yeniden izdüşüm hatası; düşük olması istenir.
- mopi: Görüntü başına ortalama gözlem sayısı; eşleşme miktarını gösterir.
| Yöntem | mtl | mre | mopi |
|---|---|---|---|
| LoFTR | 5,11 | 1,24 | 4432 |
| JamMa | 4,48 | 1,19 | 3050 |
| GamMa, Canny kaybı olmadan | 4,43 | 1,14 | 2796 |
| GamMa | 5,16 | 1,13 | 2765 |
GamMa en uzun ortalama izi ve en düşük yeniden izdüşüm hatasını üretmiştir. Görüntü başına eşleşme sayısı LoFTR ve ASpanFormer’dan daha düşüktür. Çalışmanın yorumu, modelin çok sayıda eşleşme yerine daha az fakat geometrik açıdan daha kararlı eşleşme koruduğudur.
Canny kaybının kaldırılması mtl değerini 5,16’dan 4,43’e düşürmüştür. Bu sonuç, kenar denetiminin çoklu görüntüler boyunca iz sürekliliğine katkı sağladığını düşündürmektedir.
Sabit ve deforme edilebilir tarama karşılaştırması
| Kurulum | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| Sabit tarama | 62,6 | 76,2 | 86,1 |
| Gated Index Network olmadan | 63,2 | 76,5 | 86,0 |
| Gated Deformable Scanning | 65,2 | 78,1 | 87,0 |
Kapılı deforme edilebilir tarama sabit taramaya göre 5°, 10° ve 20° eşiklerinde sırasıyla 2,6, 1,9 ve 0,9 puan kazandırmıştır. Makale paragrafında son fark 1,9 olarak verilmiş olsa da tablo 0,9 göstermektedir.
Şekil 7’de deforme edilebilir tarama, bina sınırlarında daha belirgin ve arka planda daha düşük benzerlik cevabı üretmiştir. Sabit taramanın cevapları daha dağınık görünmektedir. Bu görsel bulgu, seçici mekanizmanın ön plan ve yapısal sınırları vurguladığı yorumunu desteklemektedir; ancak benzerlik haritaları tek başına nedensel bir kanıt değildir.
Kaç özellik seçilmelidir?
| Korunan özellik oranı | AUC@5° | Süre |
|---|---|---|
| Tümü, K = 1 | 64,6 | 40,5 ms |
| Yarısı, K = 1/2 | 65,2 | 37,9 ms |
| Dörtte biri, K = 1/4 | 63,9 | 36,7 ms |
| Sekizde biri, K = 1/8 | 61,1 | 35,9 ms |
Bütün özelliklerin işlenmesi en yüksek doğruluğu sağlamamıştır. Özelliklerin yarısının seçilmesi hem AUC’yi 0,6 puan artırmış hem de süreyi 2,6 ms azaltmıştır. Buna karşılık daha agresif filtreleme önemli eşleşme kanıtlarını kaybettirmiştir. K = 1/8, yalnızca 2 ms ek hız kazancı karşılığında K = 1/2’ye göre 4,1 AUC puanı kaybetmiştir.
Canny kenar kaybının etkisi
MegaDepth sonuçlarında Canny kaybının etkisi sınırlıdır:
| Kurulum | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| Canny kaybı olmadan | 65,1 | 78,1 | 87,1 |
| Canny kaybıyla | 65,2 | 78,1 | 87,0 |
5° eşiğinde 0,1 puan artış, 10°’de değişim yok ve 20°’de 0,1 puan düşüş bulunmaktadır. Dolayısıyla MegaDepth tablosu Canny kaybının genel doğruluğu belirgin biçimde artırdığını göstermemektedir.
ScanNet’in zayıf dokulu iç mekânlarında sonuç daha belirgindir:
| Kurulum | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| Canny kaybı olmadan | 20,1 | 37,9 | 54,0 |
| Canny kaybıyla | 21,0 | 38,4 | 54,4 |
Kazançlar sırasıyla 0,9, 0,5 ve 0,4 puandır. Şekil 8’de Canny denetimli eşleşmelerin iç mekân duvar kesişimleri ve nesne sınırlarında daha düzenli toplandığı görülmektedir.
HPatches alanlar arası genelleme sonucu
HPatches deneyinde bütün modeller MegaDepth üzerinde eğitilmiş ve HPatches’e ince ayar yapılmamıştır. Her yöntem için en yüksek puanlı 1.000 eşleşme kullanılmıştır.
| Yöntem | AUC@3 piksel | AUC@5 piksel | AUC@10 piksel |
|---|---|---|---|
| JamMa | 61,8 | 71,5 | 81,2 |
| GamMa | 65,5 | 75,4 | 84,3 |
| LoFTR | 65,9 | 75,6 | 84,6 |
| ASpanFormer | 66,3 | 76,3 | 85,3 |
| ELoFTR | 66,5 | 76,4 | 85,5 |
GamMa, JamMa’yı 3,7, 3,9 ve 3,1 puan geçmiştir. Kaynak metin orta eşikte 4,9 puan yazmaktadır; tabloya göre doğru aritmetik fark 3,9’dur.
GamMa, Transformer tabanlı LoFTR, ASpanFormer ve ELoFTR’ın biraz gerisinde kalmıştır. Bu nedenle HPatches sonucu genel bir en iyi yöntem iddiasını değil, JamMa’ya göre alanlar arası aktarımın iyileştiğini desteklemektedir.
ScanNet alanlar arası genelleme sonucu
ScanNet’te modeller yalnızca MegaDepth üzerinde eğitilmiş ve 1.500 iç mekân görüntü çiftinde doğrudan test edilmiştir.
| Yöntem | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| JamMa | 18,5 | 35,6 | 51,3 |
| GamMa | 21,0 | 38,4 | 54,4 |
| ASpanFormer | 22,3 | 39,3 | 55,3 |
GamMa, JamMa’ya göre 2,5, 2,8 ve 3,1 puan kazanmıştır. Şekil 10’da GamMa daha fazla olumlu eşleşme üretirken yanlış eşleşme sayısının da arttığı görülmektedir. Yani modelin alanlar arası dayanıklılığı yükselmiş, fakat hata tamamen ortadan kalkmamıştır.
Omurga ağı seçimi
| Omurga | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| DINOv3, ağırlıklar dondurulmuş | 63,9 | 77,2 | 86,1 |
| DINOv3, ince ayarlı | 65,1 | 77,9 | 87,0 |
| GELAN | 65,3 | 78,0 | 87,1 |
| ConvNeXtV2 | 65,2 | 78,1 | 87,0 |
Sonuçlar üç eğitilebilir omurganın birbirine çok yakın olduğunu göstermektedir. GELAN 5° ve 20° eşiklerinde çok küçük bir üstünlük sağlarken ConvNeXtV2 10°’de en yüksek sonucu vermiştir. Araştırmacılar, 0,65 milyon parametreli hafif ConvNeXtV2’yi verimlilik nedeniyle seçmiştir.
Çalışmanın güçlü yönleri
- Özellik seçimi, dizi modellemesinden önce açık bir mimari bileşen olarak ele alınmıştır.
- Model, aynı parametre sayısıyla JamMa’dan daha yüksek MegaDepth sonucu üretmiştir.
- Seçilen özellik oranı doğruluk ve çalışma süresi açısından ayrıca incelenmiştir.
- Sabit ve deforme edilebilir tarama nicel ve görsel olarak karşılaştırılmıştır.
- Canny kaybının zengin dokulu ve zayıf dokulu veri kümelerindeki etkisi ayrıştırılmıştır.
- MegaDepth dışında HPatches, ScanNet ve Aachen üzerinde alanlar arası test yapılmıştır.
- Parametre, GFLOP ve çalışma süresi doğruluk ölçütleriyle birlikte verilmiştir.
- Veri miktarı ile eşleşme kalitesi arasındaki mopi–mtl–mre dengesi tartışılmıştır.
- Modelin yoğun eşleştiricilerden daha az hesaplama kullandığı açık biçimde gösterilmiştir.
Çalışmanın sınırlılıkları
- Çalışma hakem değerlendirmesinden geçmemiştir.
- Metin içi atıflar `[?]` biçimindedir ve kaynakça bulunmamaktadır.
- HPatches ve tarama ablasyonundaki bazı farklar yanlış hesaplanmıştır.
- Sonuçlar tek veya belirsiz sayıda eğitim çalışmasına dayanmaktadır; standart sapma ve güven aralığı verilmemiştir.
- Çalışma süresinin ölçüm protokolü, ısınma turu, parti boyutu ve bellek kullanımı açıklanmamıştır.
- Sıralama işlemi için kullanılan yaklaşık gradyanın alternatif yöntemlerle karşılaştırması yoktur.
- Gated Index Network’ün seçtiği bölgelerin gerçek geometrik doğrulukla ilişkisi doğrudan etiketlenmiş bir güvenilirlik deneyiyle ölçülmemiştir.
- Canny kaybı MegaDepth’te tutarlı iyileşme sağlamamıştır.
- ScanNet’te olumlu eşleşme sayısıyla birlikte yanlış eşleşme sayısı da artmıştır.
- HPatches’te bazı Transformer tabanlı yarı yoğun yöntemlerin gerisinde kalmıştır.
- Yoğun DKM ve RoMa yöntemleri MegaDepth’te daha yüksek doğruluk sağlamıştır.
- Hareket bulanıklığı, ağır örtülme ve çok büyük bakış açısı değişimleri için ayrı kontrollü deney verilmemiştir.
- Mobil, gömülü veya düşük güçlü donanım testi yapılmamıştır.
- Kodun yayımlanacağı belirtilmiş, ancak bu sürümde yeniden üretim paketi sunulmamıştır.
- Yazarlar kullanılan verileri paylaşma izinlerinin bulunmadığını bildirmiştir.
Çalışma neyi desteklemektedir?
- Bütün kaba özelliklerin eşit biçimde işlenmesi en iyi doğruluk–hız dengesini sağlamayabilir.
- Özelliklerin yarısının öğrenilebilir biçimde seçilmesi, bütün özelliklerin işlenmesinden daha iyi sonuç verebilir.
- Gated Deformable Scanning, sabit taramaya göre MegaDepth performansını artırabilir.
- Seçilen özellikler mimari sınırlar ve doku açısından zengin ön plan bölgelerinde yoğunlaşmaktadır.
- Canny tabanlı ek denetim zayıf dokulu iç mekânlarda eşleşme kararlılığını artırabilir.
- GamMa, JamMa’ya göre HPatches ve ScanNet’te daha güçlü sıfır ince ayarlı aktarım göstermektedir.
- GamMa yoğun eşleştiricilerden daha düşük hesaplama maliyetiyle rekabetçi doğruluk sağlayabilir.
Çalışma neyi kanıtlamamaktadır?
- GamMa’nın bütün yerel özellik eşleştirme yöntemlerinden daha doğru olduğunu kanıtlamamaktadır.
- JamMa’dan daha hızlı olduğunu göstermemektedir.
- Canny kenarlarının her sahnede eşleşme için en doğru konumlar olduğunu kanıtlamamaktadır.
- Seçilen yüzde 50 oranının bütün veri kümeleri ve çözünürlükler için evrensel olarak en iyi olduğunu göstermemektedir.
- Gerçek zamanlı mobil veya gömülü sistem performansını doğrulamamaktadır.
- Robot, araç veya insansız hava aracı üzerinde uçtan uca saha başarısı sunmamaktadır.
- Şiddetli örtülme ve çok büyük bakış açısı değişimlerinde güvenilirliği kesinleştirmemektedir.
- Üretilen eşleşmelerin güvenlik açısından kritik otonom sistemlerde tek başına yeterli olduğunu göstermemektedir.
- Türkiye’deki görüntüler veya yerli sistemler için doğrulanmış başarı oranı vermemektedir.
Gelecekte hangi çalışmalar gereklidir?
- Birden fazla rastgele tohumla eğitim yapılıp ortalama ve standart sapma raporlanmalıdır.
- Çalışma süresi, bellek ve enerji tüketimi farklı GPU, CPU ve uç cihazlarda ölçülmelidir.
- Özellik seçiminin kalibrasyonu ve seçilen noktaların gerçek eşleşme güvenilirliği incelenmelidir.
- Türevlenebilir sıralama veya farklı top-K kestirim yöntemleri karşılaştırılmalıdır.
- Büyük bakış açısı, örtülme, hareket bulanıklığı ve mevsim değişimi için ayrı testler yapılmalıdır.
- Mobil robot, araç ve insansız hava aracı üzerinde gerçek zamanlı SLAM deneyleri gerçekleştirilmelidir.
- Türk kentleri, tarihi yapılar ve afet sonrası görüntüler gibi yerel alan kaymaları sınanmalıdır.
- Kaynak kodu, eğitim yapılandırması, model ağırlıkları ve yeniden üretim betikleri yayımlanmalıdır.
- Eksik kaynakça ve metin–tablo sayısal tutarsızlıkları hakemli sürümde düzeltilmelidir.
Çalışmanın Yöntemi ve Bulguları
Teknik yöntem özeti
| Bileşen | Uygulanan yöntem |
|---|---|
| Temel görev | İki görüntü arasında yarı yoğun yerel özellik eşleştirme |
| Özellik omurgası | ConvNeXtV2-N |
| Kaba özellik çözünürlüğü | Girdi çözünürlüğünün 1/8’i, 256 kanal |
| İnce özellik çözünürlüğü | Girdi çözünürlüğünün 1/2’si, 64 kanal |
| Temel yenilik | Gated Deformable Mamba |
| Özellik seçimi | Öğrenilebilir indeks ofseti, sıralama ve top-K seçimi |
| Varsayılan K | Kaba özellik konumlarının yarısı |
| Dizi modelleme | Dört üst üste Mamba bloğu ve yönlü diziler |
| Geri birleştirme | Ters indeksleme ve kapılı evrişim birimi |
| İnce eşleştirme | Kaba tahmin çevresinde yerel özellik penceresi |
| Ek geometrik denetim | Canny kenar tabanlı L1 konum kaybı |
| Alt piksel denetimi | Simetrik epipolar uzaklık |
| Eğitim | MegaDepth, 60 dönem, AdamW |
| Alanlar arası test | HPatches ve ScanNet; ince ayar yapılmadan |
| Çoklu görünüm testi | Aachen v1.1 ve HLoc |
| Model boyutu | 5,7 milyon parametre |
| Hesaplama | 202,5 GFLOP |
| Ölçülen süre | 37,9 ms |
Temel karşılaştırmalı bulgular
| Test | GamMa sonucu | Temel karşılaştırma | Yorum |
|---|---|---|---|
| MegaDepth | 65,2 / 78,1 / 87,0 | JamMa: 64,1 / 77,4 / 86,5 | Benzer maliyetle daha yüksek doğruluk |
| HPatches | 65,5 / 75,4 / 84,3 | JamMa: 61,8 / 71,5 / 81,2 | Alanlar arası kazanç; bazı Transformer modellerinin gerisinde |
| ScanNet | 21,0 / 38,4 / 54,4 | JamMa: 18,5 / 35,6 / 51,3 | İç mekân alan kaymasında daha dayanıklı |
| Aachen | mtl 5,16; mre 1,13 | JamMa: 4,48; 1,19 | Daha uzun iz ve daha düşük yeniden izdüşüm hatası |
Ablasyonların gösterdiği ana mekanizmalar
- Sabit taramanın kapılı deforme edilebilir taramayla değiştirilmesi en güçlü tek bileşen kazançlarından birini sağlamıştır.
- Gated Index Network kaldırıldığında AUC@5° 65,2’den 63,2’ye düşmüştür.
- Bütün özellikler yerine yarısının seçilmesi hem doğruluk hem çalışma süresini iyileştirmiştir.
- Özelliklerin yalnız dörtte veya sekizde birini korumak hesaplama süresinde küçük, doğrulukta daha büyük kayıp oluşturmuştur.
- Canny kaybı zengin dokulu MegaDepth’te sınırlı, zayıf dokulu ScanNet ve çoklu görünüm Aachen testinde daha belirgin katkı sağlamıştır.
- Omurga seçiminin etkisi öğrenilebilir özellik seçimi kadar büyük olmamıştır.
Görsellerin bilimsel anlamı
| Görsel | Gösterilen içerik | Bilimsel işlevi |
|---|---|---|
| Grafik özet | Özellik çıkarma, seçici tarama, Mamba, ince eşleştirme ve Canny kaybı | GamMa işlem hattını tek şemada göstermek |
| Şekil 1 | JamMa’nın ScanNet eşleşmeleri | Alan kaymasında yanlış eşleşme sorununu göstermek |
| Şekil 2 | GamMa’nın genel mimarisi | Kaba ve ince aşamalarla seçici Mamba akışını açıklamak |
| Şekil 3 | Gated Deformable Scanning | Konum seçme ve dizi oluşturma sürecini göstermek |
| Şekil 4 | Gated Index Network | İki evrişim kolu ve kapılı etkileşimi açıklamak |
| Şekil 5 | Canny Edge Loss | Kenar hedefinin nasıl üretildiğini göstermek |
| Şekil 6 | LoFTR, JamMa ve GamMa eşleşmeleri | MegaDepth üzerinde nitel karşılaştırma sunmak |
| Şekil 7 | Sabit ve deforme edilebilir tarama ısı haritaları | Ön plan ve sınır cevaplarının yoğunlaşmasını göstermek |
| Şekil 8 | Canny kaybıyla ve kayıpsız eşleşme konumları | Kenar denetiminin zayıf dokulu sahnelerdeki etkisini göstermek |
| Şekil 9 | Seçilen K özellik konumları | Seçimin mimari ve doku açısından zengin bölgelerde yoğunlaştığını göstermek |
| Şekil 10 | JamMa ve GamMa ScanNet sonuçları | İnce ayarsız alanlar arası genelleme farkını göstermek |
Tekrar üretim açısından kritik ayrıntılar
- Görüntüler eğitimde 832 × 832 boyutuna getirilmelidir.
- Kaba ve ince özellik kanalları sırasıyla 256 ve 64’tür.
- Dört Mamba bloğu ve K = 1/2 yapılandırması kullanılmaktadır.
- Canny düşük ve yüksek eşikleri 0,1 ve 0,2’dir.
- Focal loss için α = 0,25 ve γ = 2’dir.
- Alt piksel kaybı 104 katsayısıyla ağırlıklandırılmıştır.
- Eğitim 60 dönem, AdamW, 2 × 10−4 başlangıç öğrenme oranı ve toplu iş boyutu 8 ile yapılmıştır.
- HPatches karşılaştırmasında yöntem başına yalnız en yüksek 1.000 eşleşme kullanılmıştır.
- MegaDepth ve ScanNet testlerinde 1.500 görüntü çifti değerlendirilmiştir.
- Sonuçları yeniden üretmek için eksik kaynakça, kod, model ağırlıkları ve rastgele tohumlar gereklidir.
Sonuçların teknik yorumu
GamMa’nın sonuçları, yarı yoğun görüntü eşleştirmede bilgi miktarından çok bilgi kalitesinin belirleyici olabileceğini göstermektedir. Bütün kaba özellikleri diziye aktarmak hem süreyi uzatmış hem de doğruluğu azaltmıştır. Özelliklerin yarısını seçmek gürültülü etkileşimleri azaltırken gerekli geometrik kanıtın büyük bölümünü korumuştur.
Modelin esas kazancı parametre sayısını veya hesaplama yükünü önemli ölçüde artırmadan JamMa’nın alanlar arası dayanıklılığını geliştirmesidir. MegaDepth kazancı görece küçükken HPatches ve ScanNet farklarının daha büyük olması, seçici taramanın eğitim ve test alanı farklılaştığında daha değerli olabileceğine işaret etmektedir.
Canny kenar kaybının yararı sahneye bağımlıdır. Zengin dokulu dış mekânda katkı çok sınırlı kalırken iç mekânlarda geometrik sınırlar ek bilgi sağlamıştır. Bu durum, kenar tabanlı düzenleyicilerin evrensel değil koşula bağlı araçlar olduğunu göstermektedir.
Kaynak ve Yöntem Notu
Çalışmanın tam özgün adı: GamMa: Selecting Informative Features for Fast and Robust Local Feature Matching
Yazarlar: Jianhao Xu, Xiangtao Fan, Hongdeng Jian, Chen Xu, Weijia Bei, Qifeng Ge ve Ruijie Han.
Yazar sıralaması: Kaynakta verildiği biçimde korunmuştur.
Eş birinci yazar: Eşit katkı veya eş birinci yazarlık beyanı yer almamaktadır.
Sorumlu yazar: Hongdeng Jian.
Sorumlu yazar e-posta adresi: jianhd@radi.ac.cn
Diğer iletişim adresleri: xujianhao22@mails.ucas.ac.cn; fanxt@radi.ac.cn; xuchen@aircas.ac.cn; beiweijia21@mails.ucas.ac.cn; geqifeng21@mails.ucas.ac.cn; hanruijie23@mails.ucas.ac.cn.
Kurum 1: Key Laboratory of Digital Earth Science, Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing 100094, Çin.
Kurum 2: International Research Center of Big Data for Sustainable Development Goals, Beijing 100094, Çin.
Kurum 3: University of Chinese Academy of Sciences, Beijing 100094, Çin.
Resmî kaynak bağlantısı:SSRN resmî kayıt sayfası
Yayın platformu: SSRN.
Yayın yılı: 2026.
Metinde verilen tarih: 25 Haziran 2026.
Hedef dergi: Yüklenen sürüm “Preprint submitted to Pattern Recognition” ibaresini taşımaktadır.
Dergi ve yayınevi durumu: Çalışmanın Pattern Recognition tarafından kabul edildiğini veya hakemli dergi sürümünün yayımlandığını gösteren bilgi bu kaynakta bulunmamaktadır. Bu nedenle hakemli dergi yayını olarak sunulamaz.
Kaynak türü: Bilgisayarlı görüde yarı yoğun yerel özellik eşleştirme için yeni bir sinir ağı mimarisi geliştiren ve dört veri kümesinde sınayan preprint araştırma makalesi.
Hakemlik durumu: Çalışma hakem değerlendirmesinden geçmemiştir.
Jianhao Xu’nun katkıları: Kavramsallaştırma, yöntem, biçimsel analiz, veri düzenleme, özgün taslak yazımı ve araştırma.
Xiangtao Fan’ın katkıları: Kavramsallaştırma, danışmanlık, inceleme ve düzenleme, doğrulama ve finansman temini.
Hongdeng Jian’ın katkıları: Doğrulama, inceleme ve düzenleme ile yöntem.
Chen Xu’nun katkıları: Kaynak sağlama, inceleme ve düzenleme ile finansman temini.
Weijia Bei’nin katkıları: Yöntem.
Qifeng Ge’nin katkıları: Yazılım ve görselleştirme.
Ruijie Han’ın katkıları: Veri düzenleme.
Finansman: Provincial Special Funding for the Construction of Chenzhou National Sustainable Development Agenda Innovation Demonstration Zone, No. 2023sfq69.
Çıkar çatışması: Yazarlar çalışmayı etkileyebilecek bilinen bir mali çıkar veya kişisel ilişki bulunmadığını beyan etmiştir.
Veri erişimi: Yazarlar verileri paylaşma izinlerinin bulunmadığını belirtmiştir.
Kod erişimi: Metin, kodun GitHub deposunda yayımlanacağını bildirmektedir. Yüklenen sürümde sabitlenmiş bir yazılım sürümü, model ağırlığı veya yeniden üretim paketi sunulmamıştır.
Kaynakça sorunu: Metindeki atıflar `[?]` biçiminde görünmekte ve kaynakça bölümü bulunmamaktadır. Bu durum önceki yöntemlerin, veri kümelerinin ve kullanılan yazılımların özgün kaynaklarının doğrulanmasını engellemektedir.
Sayısal tutarlılık uyarısı: HPatches’te orta eşik kazancı tabloda 3,9 iken metinde 4,9 yazılmıştır. Gated Deformable Scanning’in AUC@20° kazancı tabloda 0,9 iken metinde 1,9 olarak verilmiştir.
Görsel tutarlılık uyarısı: Şekil 9’un açıklaması Canny kaybıyla ve kayıpsız özellik dağılımını karşılaştırdığını söylemektedir; ancak görsel yalnızca Gated Index Network tarafından seçilen K konumlarını göstermektedir.
Yorum sınırı: GamMa MegaDepth’te yarı yoğun yöntemler içinde en yüksek sonucu vermiş, ancak yoğun DKM ve RoMa’dan düşük AUC üretmiştir. HPatches’te LoFTR, ASpanFormer ve ELoFTR’ın biraz gerisinde kalmıştır. Bu nedenle çalışma, genel ve koşulsuz bir en iyi eşleştirici üstünlüğü kanıtlamamaktadır.
Bu Türkçe içerik yalnızca yüklenen çalışmanın metni, denklemleri, tabloları, mimari şemaları, eşleşme görselleri ve deney sonuçları temel alınarak hazırlanmıştır. Çalışmada bulunmayan bir saha başarısı, ticari ürün performansı, otonom sistem güvenliği veya Türkiye’ye özgü doğruluk iddiası eklenmemiştir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir