
Bu tədqiqat, farklı açılardan, ışık koşullarından veya ortamlardan alınmış iki görüntü arasında güvenilir qarşılıqlar bulmak için GamMa adlı hafif bir yarı-sıx xüsusiyyət uyğunlaşdırma modeli hazırlamışdır. Model, bütün görüntü xüsusiyyətlərini eşit biçimde işlemek yerine, uyğunlaşdırma açistilikndan daha güvenilir görünen bölgeleri Mamba tabanlı dizi modellemesinden önce seçmektedir. Bu amaçla Gated Deformable Scanning, Joint Mamba ve Gated Deformable Merge bileşenlerinden oluşan bir Gated Deformable Mamba mimarisi istifadə edilmişdir. GamMa, MegaDepth testinde 5°, 10° ve 20° eşiklerinde sırasıyla 65,2, 78,1 ve 87,0 AUC dəyərlerine ulaşmış; 5,7 milyon parametr, 202,5 GFLOP ve 37,9 ms ölçülen işləmə müddətiyle yarı-sıx metodler arasında en yüksek sonucu vermiştir. Model ayrıca yalnızca MegaDepth üzerinde eğitildiği hâlde HPatches ve ScanNet’e incə tənzimləmə yapılmadan aktarıldığında temel JamMa modelinden daha yüksek nəticələr üretmiştir. Bununla birlikte tədqiqat rəyçi qiymətləndirməsindən keçməmişdir; mənbəçası eksiktir, bazı sayısal farklar metinle cədvəllar arasında uyuşmamaktadır ve təcrübələrde çoklu təlim tekrarlarına ait standart sapma veya güven aralığı sunulmamıştır.
GamMa’nın temel düşüncesi, görüntüdeki bütün hücrelerin uyğunlaşdırma açistilikndan aynı dəyəre sahip olmadığıdır. Bina küncleri, nesne sınırları ve ayırt edici teksturalar güvenilir geometrik ipuçları sunarken səma, boş duvarlar, tekrarlanan desenler veya bulanıq bölgeler yanlış etkileşimler oluşturabilir. Gated Index Network, uyğunlaşdırma öncesinde xüsusiyyət konumlarını öğrenilebilir biçimde sıralamakta ve varsayılan ayarda bunların yaristiliknı seçmektedir. Seçilen xüsusiyyətlər Mamba bloklarıyla modellenmekte, daha sonra özgün iki boyutlu xüsusiyyət haritalarına geri yerleştirilmektedir. Canny kənar kaybı ise xüsusiyyətle teksturasu zayıf iç mekânlarda uyğunluqlarin duvar kesişimleri, nesne sınırları ve küncler gibi daha kararlı geometrik yapılara yönelmesini hədəfləyir.
Türkiyə baxımından qiymətləndirmə: GamMa yaklaşımı; insansız hava araçlarıyla haritalama, otonom robot konumlama, artırılmış gerçeklik, kültürel mirasın üç boyutlu belgelenmesi, uydu ve hava görüntülerinin eşleştirilmesi, afet sonrası yapı karşılaştırması ve endüstriyel görsel denetim sistemlerinde Türkiye’de araştırılabilir. Uygulamaya geçmeden önce modelin Türkiye’ye özgü kent teksturaları, kırsal sahəlar, düşük ışıklı iç mekânlar, deprem sonrası zədəlı yapılar, tekrarlayan cepheler ve farklı kamera türleri üzerinde yeniden sınanması gerekir. Gerçek zamanlı kullanım için gömülü GPU, mobil işlemci ve düşük güçlü uç cihazlarda işləmə müddəti ile bellek tüketimi ayrıca ölçülmelidir. Tədqiqat Türkiye’de toplanmış bir veri dəsti, yerli bir otonom sistem, operasyonel saha təcrübəi veya güvenlik sertifikasyonu sunmadığından Türkiye’ye özgü başarı nisbəti ya da saha güvenilirliği doğrudan çıkarılamaz.
Yerel xüsusiyyət uyğunlaşdırması nədir?
Yerel xüsusiyyət uyğunlaşdırma, aynı fiziksel noktanın veya yapının iki farklı görüntüdeki karşılığını bulma problemidir. Bir binanın küncsi, pencere kənarı, yol çizgisi veya nesne sınırı iki görüntüde farklı ölçek, açı ve aydınlatmayla görünse bile doğru uyğunlaşdırma sistemi bu noktalar arasında keçid kurabilmelidir.
Bu qarşılıqlar aşağıdaki uygulamalarda temel girdidir:
- Görsel konumlama ve kamera pozasınun hesaplanması,
- Eşzamanlı konumlama ve haritalama (SLAM),
- Structure-from-Motion ile üç boyutlu model üretimi,
- Çok görüntülü yenidənqurma,
- Görüntü hizalama ve homoqrafiya tahmini,
- Robotik ve otonom sistemlerde hərəkət takibi.
İki görüntü arasında çok sayıda uyğunluq üretmek tek başına yeterli değildir. Yanlış uyğunluqlar kamera dönüşü, öteleme ve üç boyutlu geometri tahminini bozabilir. Bu nedenle uyğunluq miktarı, geometrik doğruluq, dayanıqlılık ve hesaplama maliyeti birlikte dəyərlendirilmelidir.
Seyrək, yarı-sıx və sıx uyğunlaşdırma arasındaxın fərq
Seyrek metodler önce künc veya ilgi noktası tespit eder, daha sonra bu noktalara ait tanımlayıcıları karşılaştırır. Hesaplama maliyetleri görece düşüktür; ancak teksturasuz duvarlar veya tekrarlanan desenler gibi bölgelerde yeterli ve kararlı açar nöqtə üretmeyebilirler.
Yoğun metodler hemen hemen her piksel veya küçük görüntü bölgesi için qarşılıq tahmin eder. Bu metodler büyük görünüm değişimlerinde güçlü olabilir, fakat daha fazla parametr, bellek ve hesaplama gerektirir.
Yarı sıx metodler, sıx uyğunlaşdırmanin dayanıqlılığı ile seyrək uyğunlaşdırmanin hesaplama səmərəliliği arasında denge kurmayı amaçlar. GamMa bu sınıfa girmektedir.
Transformer əvəzinə Mamba niyə istifadə edilmişdir?
Transformer tabanlı eşleştiriciler, görüntünün farklı bölgeleri arasındaki uzun menzilli ilişkileri öz dikkat mekanizmasıyla modelleyebilir. Ancak klassik öz dikkatin hesaplama maliyeti işlenen belirteç sayistiliknın karesiyle büyür. Yarı sıx xüsusiyyət haritalarında belirteç sayistilik yüksek olduğundan bu maliyet önemli olabilir.
Mamba mimarileri, uzun dizileri yaklaşık doğrusal ölçeklenen durum-uzayı modellemesiyle işleyerek daha düşük maliyetli bir alternatif sunar. JamMa adlı önceki metod, Mamba’yı yarı-sıx xüsusiyyət uyğunlaşdırmaye uyarlamıştır. Tədqiqatnın çıkış noktası, JamMa’nın bütün xüsusiyyət konumlarını sabit bir skanlama düzeninde eşit biçimde işlemesidir.
Sabit skanlama yanaşmasındaxın problem nədir?
Görüntüdeki her bölge güvenilir bir uyğunlaşdırma işareti taşımaz. Aşağıdaki bölgeler xüsusiyyətle sorun oluşturabilir:
- Düz ve teksturasuz yüzeyler,
- Birbirine benzeyen pencere veya tuğla dizileri,
- Gökyüzü ve tek renkli arka planlar,
- Hareket bulanıqlığı bulunan bölgeler,
- İki görüntü arasında üst-üstə düşməyən sahəlar,
- Baxın açistilikna göre görünümü güçlü biçimde değişen yüzeyler.
Sabit skanlamada bu bölgeler de güvenilir küncler ve sınırlar kadar dizi modellemesine katılır. Böylece belirsiz xüsusiyyətlər uzak bölgelerle etkileşime girerek uyğunlaşdırma sinyaline gürültü ekleyebilir. Şekil 1’de JamMa’nın ScanNet iç mekânlarında çok sayıda yanlış uyğunluq ürettiği örnekler gösterilmiştir. Yeşil çizgiler olumlu, kırmızı çizgiler olumsuz uyğunluqlari temsil etmektedir.
GamMa-nın ümumi arxitekturası
Şekil 2’deki mimari dört ana aşamadan oluşmaktadır:
- Yerel xüsusiyyətlərin çıkarılması,
- Gated Deformable Mamba ile kaba ölçekli xüsusiyyətlərin seçilmesi ve modellenmesi,
- Yerel pencerelerde ince uyğunlaşdırma,
- Canny kənar denetimiyle xüsusiyyət konumlarının eğitilmesi.
Girdi olarak iki görüntü \(I_A\) ve \(I_B\) alınmaktadır. ConvNeXtV2-N omurğası iki çözünürlükte xüsusiyyət üretmektedir:
- Girdi çözünürlüğünün \(1/8\)’inde 256 kanallı kaba xüsusiyyətler,
- Girdi çözünürlüğünün \(1/2\)’sinde 64 kanallı incə xüsusiyyətler.
ConvNeXtV2 omurğasının yaklaşık 0,65 milyon parametrsi bulunmaktadır. GamMa modelinin tamamı ise cədvəlda 5,7 milyon parametr olarak verilmiştir.
İnformativ xüsusiyyət necə tərif edilmişdir?
Tədqiqat, bir xüsusiyyət konumunun informativliğini üç kavramsal bileşenle ifade etmektedir:
\[ S_i = \alpha S_i^{struct} + \beta S_i^{distinct} + \gamma S_i^{consistency}. \]
Burada:
- \(S_i^{struct}\), kənar, künc veya tekstura gibi yapısal belirginliği;
- \(S_i^{distinct}\), özelliğin çevresindeki bölgelerden ayırt edilebilirliğini;
- \(S_i^{consistency}\), iki görüntü arasında uyğunluq cevabının kararlılığını
temsil eder.
Bu üç dəyər uygulamada ayrı ayrı hesaplanmamaktadır. Gated Index Network, uyğunluq kaybından gelen denetim altında hangi bölgelerin yararlı olduğunu uçtan uca öğrenmektedir. Denklem, modelin hedeflediği informativlik kavramını açıklayan teorik bir çerçevedir.
Gated Deformable Scanning necə işləyir?
Kaba xüsusiyyət haritaları:
\[ \mathbf{x}\in\mathbb{R}^{2\times H\times W\times C} \]
biçimindedir. İlk boyut görüntü çiftini, \(H\) ve \(W\) uzaysal boyutları, \(C\) ise kanal sayistiliknı gösterir.
Standart skanlamada görüntü hücreleri sol üstten sağ alta sabit raster sırasıyla dizilir. GamMa ise her konum için öğrenilebilir bir ofset üretmektedir:
\[ \Delta t\in\mathbb{R}^{2\times H\times W\times1}. \]
Başlangıç skanlama indeksi \(t_i\), \([-1,1]\) aralığına normalize edilir. Ağın tahmin ettiği ofset de `tanh` fonksiyonuyla aynı aralığa sınırlandırılır:
\[ t_D=t_i+\Delta t. \]
Konumlar \(t_D\) dəyərlerine göre sırsahəır ve yalnızca en yüksek sıradaki \(K\) xüsusiyyət korunur. Varsayılan ayarda:
\[ K=\frac{H\times W}{2}. \]
Başka bir ifadeyle kaba xüsusiyyət konumlarının yaristilik Mamba dizi modellemesine alınmaktadır. Amaç yalnızca en yüksek aktivasyonlu bölgeleri seçmek değil, iki görüntü arasında tutarlı olmayan, tekrarlayan veya geometrik olarak belirsiz bölgeleri bastırmaktır.
Gated Index Network quruluşu
Gated Index Network, xüsusiyyətləri iki paralel derinlik-ayrılabilir evrişim kolundan geçirmektedir. Bir kol doğrudan lokal yapısal cevap üretirken diğer kol GroupNorm ve GELU kullanarak uyarlamalı modülasyon oluşturmaktadır.
İki kolun çıktistilik eleman bazında çarpılmaktadır:
\[ F_g=F_1\odot GELU(GN(F_2)). \]
Bu kapılama işleminde her iki koldan da destek sahə cevaplar güçlenirken zayıf veya tutarsız cevapların bastırılması amaçlanmaktadır. Son ofset bir \(1\times1\) evrişimle üretilir:
\[ \Delta t=Conv_{1\times1}(F_g). \]
Şekil 9’daki seçili konumlar bina cepheleri, kubbe sınırları ve ayrıntılı mimari yapılarda sıxlaşırken səma gibi homojen bölgelerde seyrəkleşmektedir. Ancak Şekil 9’un başlığı yanlışlıkla Canny kaybı karşılaştırmasından söz etmektedir.
Sıralama əməliyyatının törəmə problemi
Özelliklerin sırsahəması klassik biçimiyle türevlenebilir değildir. Bu nedenle sıralamadan geçen gradyanın doğrudan deformasiya indeksine aktarılması mümkün değildir.
Tədqiqatçılar, son görüntü dizisi boyutundaki gradyanları ortalayıp deformasiya indeksine geri yayarak yaklaşık bir gradyan kullanmıştır. Bu yaklaşım təlimi mümkün kılmaktadır; ancak sıralama işleminin gerçek türevi değildir. Yaklaşımın başka gradyan kestirim metodleriyle karşılaştırması veya hata analizi verilmemiştir.
Joint Mamba və xüsusiyyətlərin geri birləşdirilməsi
Seçilen xüsusiyyətlər kompakt tek boyutlu dizilere dönüştürülür. Joint Mamba, iki görüntüden gelen xüsusiyyətlər arasında uzun menzilli ilişkileri modellemektedir. Uygulamada dört yönlü dizi ve üst üste yerleştirilmiş dört Mamba bloğu kullanılmaktadır.
Gated Deformable Merge, işlenen xüsusiyyətləri ters indeksler yardımıyla özgün \(1/8\) çözünürlüklü konumlarına geri yerleştirir. Yalnızca seçilen xüsusiyyətlərin Mamba işleminden geçmesi, seçili olmayan bölgeler veya farklı diziler arasındaki doğrudan etkileşimi sınırlayabilir. Bu eksikliği azaltmak için standart evrişimlerden oluşan ek bir kapılı birleştirme birimi istifadə edilmişdir:
\[ \sigma=GELU(Conv_3(F_{in})), \]
\[ F_{out}=Conv_3\left(\sigma\cdot Conv_3(F_{in})\right). \]
İncə səviyyəli uyğunlaşdırma
Kaba uyğunlaşdırmalerin ardından, tahmin edilen konumların çevresinden daha yüksek çözünürlüklü xüsusiyyət pencereleri kesilmektedir. Bu pencerelerde alt piksel düzeyinde ince uyğunlaşdırma gerçekleştirilir.
Kaba aşama görüntünün genelinde olası qarşılıqları bulurken ince aşama konumu küçük bir lokal pencere içinde daha kesin hâle getirir. Böylece bütün görüntü üzerinde yüksek çözünürlüklü sıx işlem yapılmadan konum hassasiyeti artırılmaya çalışılır.
Canny kənar itkisi niyə əlavə edilmişdir?
Zayıf teksturalu sahnelerde duvar veya masa yüzeyi gibi geniş sahəlar ayırt edici görsel bilgi taşımaz. Buna qarşılıq nesne sınırları, duvar birleşimleri ve küncler baxın açistilik değişse bile daha kararlı geometrik yapılar sağlayabilir.
Canny kənar kaybının təlim axını şöyledir:
- Girdi görüntüsü ince uyğunlaşdırma çözünürlüğüne bilineer interpolasyonla küçültülür.
- Küçültülen görüntüye Canny kənar algılama uygulanır.
- Kaba uyğunlaşdırma konumu çevresinden bir kənar penceresi kesilir.
- Penceredeki kənar konumu iki boyutlu `argmax` işlemiyle seçilir.
- Tahmin edilen ince konum ile kənar tabanlı hedef konum arasındaki L1 farkı hesaplanır.
\[ L_{canny}= \frac{1}{N} \sum_{i=1}^{N} \left\| p_{idx}^{(i)}-p_{idx}^{gt,(i)} \right\|_1. \]
Bu itki, gerçek uyğunluq noktasının mutlaka bir kənar üzerinde olduğunu kanıtlamaz. Eğitim sırasında uyğunluqlari geometrik açıdan kararlı kabul edilen yapılara yönlendiren yardımcı bir düzenleyicidir.
Ümumi təlim itkisi
Model dört itki bileşeniyle eğitilmiştir:
- Kaba uyğunlaşdırma odak kaybı \(L_c\),
- İnce uyğunlaşdırma odak kaybı \(L_f\),
- Canny kənar kaybı \(L_{canny}\),
- Alt piksel epipolar geometri kaybı \(L_s\).
Alt piksel kaybı, temel matris yerine iki normalize görüntü noktası ve öz matris \(E\) üzerinden simetrik epipolar uzaklığı kullanmaktadır:
\[ L_s= \frac{1}{|M_f|} \sum_{(x,y)\in M_f} \frac{(x^{\top}Ey)^2} {(Ey)_1^2+(Ey)_2^2+(E^{\top}x)_1^2+(E^{\top}x)_2^2}. \]
Toplam itki:
\[ L_{total} = \lambda_cL_c+ \lambda_fL_f+ \lambda_{canny}L_{canny}+ \lambda_sL_s \]
olarak tanımlanmıştır. Katsayılar:
- \(\lambda_c=1\),
- \(\lambda_f=1\),
- \(\lambda_{canny}=0{,}5\),
- \(\lambda_s=10^4\)
şeklindedir. Alt piksel kaybının ham dəyəri yaklaşık \(10^{-4}\) veya daha küçük olduğu için büyük bir ağırlık kullanıldığı açıklanmıştır.
Təlim qurulumu
| Ayar | Değer |
|---|---|
| Eğitim veri dəsti | MegaDepth |
| Eğitim müddətsi | 60 dönem |
| Optimizasyon | AdamW |
| Başlangıç öğrenme nisbəti | 2 × 10−4 |
| Öğrenme nisbəti planı | Kosinüs azalma ve bir dönem doğrusal istiliknma |
| Toplu iş boyutu | 8 |
| Eğitim görüntüsü | 832 × 832, yeniden boyutlandırma ve doldurma |
| Focal loss parametrleri | α = 0,25; γ = 2 |
| Canny eşikleri | 0,1 ve 0,2 |
| Mamba blokları | 4 |
| Seçilen xüsusiyyət nisbəti | K = 1/2 |
| Donanım | İki NVIDIA A100 GPU |
| Alanlar arası testlerde incə tənzimləmə | Yapılmamıştır |
MegaDepth nəticələri
MegaDepth, geniş baxın açistilik, ışık değişimi ve tekrarlayan mimari desenler içeren dış mekân görüntülerinden oluşmaktadır. Tədqiqat, Sacré-Cœur ve St. Peter’s Square sahnelerinden 1.500 görüntü çiftini test etmiş ve kamera pozasınu LO-RANSAC ile hesaplamıştır.
| Yöntem | Parametre | GFLOP | Süre | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|---|---|---|
| JamMa | 5,7 M | 202,9 | 37,2 ms | 64,1 | 77,4 | 86,5 |
| GamMa | 5,7 M | 202,5 | 37,9 ms | 65,2 | 78,1 | 87,0 |
| DKM, sıx | 72,3 M | 1424,5 | 369,2 ms | 67,3 | 79,7 | 88,1 |
| RoMa, sıx | 111,3 M | 2014,3 | 549,9 ms | 68,5 | 80,6 | 88,8 |
GamMa, JamMa’ya göre aynı parametr sayistilik ve benzer hesaplama maliyetiyle 1,1, 0,7 ve 0,5 AUC puanı kazanmıştır. Tədqiqat müddətsi JamMa’dan 0,7 ms daha uzundur; bu nedenle GamMa’nın JamMa’dan daha sürətlı olduğu söylenemez. Avantajı, benzer sürət ve boyutta daha yüksek doğruluq sağlamasıdır.
Yoğun eşleştiriciler daha yüksek AUC üretmiştir. Bununla birlikte DKM yaklaşık 7,7 kat, RoMa yaklaşık 10,5 kat daha uzun ölçülen işləmə müddətine ve çok daha fazla parametrye sahiptir.
Aachen çoxgörünüşlü yenidənqurması
Aachen v1.1, gündüz-gece ve baxın açistilik değişimleri içeren dış mekân vizual lokallaşdırma veri dəstidir. Tədqiqatda üç ölçüt istifadə edilmişdir:
- mtl: Ortalama xüsusiyyət izi uzunluğu; yüksek olması istenir.
- mre: Ortalama yenidən proyeksiya hatası; düşük olması istenir.
- mopi: Görüntü başına orta gözlem sayistilik; uyğunluq miktarını gösterir.
| Yöntem | mtl | mre | mopi |
|---|---|---|---|
| LoFTR | 5,11 | 1,24 | 4432 |
| JamMa | 4,48 | 1,19 | 3050 |
| GamMa, Canny kaybı olmadan | 4,43 | 1,14 | 2796 |
| GamMa | 5,16 | 1,13 | 2765 |
GamMa en uzun orta izi ve en düşük yenidən proyeksiya hatasını üretmiştir. Görüntü başına uyğunluq sayistilik LoFTR ve ASpanFormer’dan daha düşüktür. Tədqiqatnın yorumu, modelin çok sayıda uyğunluq yerine daha az fakat geometrik açıdan daha kararlı uyğunluq koruduğudur.
Canny kaybının kaldırılması mtl dəyərini 5,16’dan 4,43’e düşürmüştür. Bu nəticə, kənar denetiminin çoklu görüntüler boyunca iz davamlıliğine katkı sağladığını düşündürmektedir.
Sabit və deformasiya edilə bilən skanlamanın müqayisəsi
| Kurulum | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| Sabit skanlama | 62,6 | 76,2 | 86,1 |
| Gated Index Network olmadan | 63,2 | 76,5 | 86,0 |
| Gated Deformable Scanning | 65,2 | 78,1 | 87,0 |
Kapılı deformasiya edilə bilən skanlama sabit skanlamaya göre 5°, 10° ve 20° eşiklerinde sırasıyla 2,6, 1,9 ve 0,9 puan kazandırmıştır. Makale paragrafında son fark 1,9 olarak verilmiş olsa da cədvəl 0,9 göstərir.
Şekil 7’de deformasiya edilə bilən skanlama, bina sınırlarında daha belirgin ve arka planda daha düşük benzerlik cevabı üretmiştir. Sabit skanlamanın cevapları daha dağınık görünmektedir. Bu görsel bulgu, seçici mekanizmanın ön plan ve yapısal sınırları vurguladığı yorumunu dəstəkləyir; ancak benzerlik haritaları tek başına nedensel bir kanıt değildir.
Neçə xüsusiyyət seçilməlidir?
| Korunan xüsusiyyət nisbəti | AUC@5° | Süre |
|---|---|---|
| Tümü, K = 1 | 64,6 | 40,5 ms |
| Yaristilik, K = 1/2 | 65,2 | 37,9 ms |
| Dörtte biri, K = 1/4 | 63,9 | 36,7 ms |
| Sekizde biri, K = 1/8 | 61,1 | 35,9 ms |
Bütün xüsusiyyətlərin işlenmesi en yüksek doğruluğu sağlamamıştır. Özelliklerin yaristiliknın seçilmesi hem AUC’yi 0,6 puan artırmış hem de müddətyi 2,6 ms azaltmışdır. Buna qarşılıq daha agresif filtreleme önemli uyğunluq kanıtlarını kaybettirmiştir. K = 1/8, yalnızca 2 ms ek sürət kazancı karşılığında K = 1/2’ye göre 4,1 AUC puanı kaybetmiştir.
Canny kənar itkisinin təsiri
MegaDepth nəticələrinda Canny kaybının etkisi sınırlıdır:
| Kurulum | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| Canny kaybı olmadan | 65,1 | 78,1 | 87,1 |
| Canny kaybıyla | 65,2 | 78,1 | 87,0 |
5° eşiğinde 0,1 puan artış, 10°’de değişim yok ve 20°’de 0,1 puan düşüş bulunmaktadır. Dolayistilikyla MegaDepth cədvəlsu Canny kaybının genel doğruluğu belirgin biçimde artırdığını göstermemektedir.
ScanNet’in zayıf teksturalu iç mekânlarında nəticə daha belirgindir:
| Kurulum | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| Canny kaybı olmadan | 20,1 | 37,9 | 54,0 |
| Canny kaybıyla | 21,0 | 38,4 | 54,4 |
Kazançlar sırasıyla 0,9, 0,5 ve 0,4 puandır. Şekil 8’de Canny denetimli uyğunluqlarin iç mekân duvar kesişimleri ve nesne sınırlarında daha düzenli toplandığı görülmektedir.
HPatches sahələrarası ümumiləşdirmə nəticəsi
HPatches təcrübəinde bütün modeller MegaDepth üzerinde eğitilmiş ve HPatches’e incə tənzimləmə yapılmamıştır. Her metod için en yüksek puanlı 1.000 uyğunluq istifadə edilmişdir.
| Yöntem | AUC@3 piksel | AUC@5 piksel | AUC@10 piksel |
|---|---|---|---|
| JamMa | 61,8 | 71,5 | 81,2 |
| GamMa | 65,5 | 75,4 | 84,3 |
| LoFTR | 65,9 | 75,6 | 84,6 |
| ASpanFormer | 66,3 | 76,3 | 85,3 |
| ELoFTR | 66,5 | 76,4 | 85,5 |
GamMa, JamMa’yı 3,7, 3,9 ve 3,1 puan geçmiştir. Kaynak metin orta eşikte 4,9 puan yazmaktadır; cədvəlya göre doğru aritmetik fark 3,9’dur.
GamMa, Transformer tabanlı LoFTR, ASpanFormer ve ELoFTR’ın biraz gerisinde kalmıştır. Bu nedenle HPatches sonucu genel bir en iyi metod iddiasını değil, JamMa’ya göre sahələrarası aktarımın iyileştiğini dəstəkləyir.
ScanNet sahələrarası ümumiləşdirmə nəticəsi
ScanNet’te modeller yalnızca MegaDepth üzerinde eğitilmiş ve 1.500 iç mekân görüntü çiftinde doğrudan test edilmiştir.
| Yöntem | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| JamMa | 18,5 | 35,6 | 51,3 |
| GamMa | 21,0 | 38,4 | 54,4 |
| ASpanFormer | 22,3 | 39,3 | 55,3 |
GamMa, JamMa’ya göre 2,5, 2,8 ve 3,1 puan kazanmıştır. Şekil 10’da GamMa daha fazla müsbət uyğunluq üretirken yanlış uyğunluq sayistiliknın da arttığı görülmektedir. Yani modelin sahələrarası dayanıqlılığı yükselmiş, fakat hata tamamen ortadan kalkmamıştır.
Omurğa şəbəkəsinin seçimi
| Omurga | AUC@5° | AUC@10° | AUC@20° |
|---|---|---|---|
| DINOv3, ağırlıklar dondurulmuş | 63,9 | 77,2 | 86,1 |
| DINOv3, incə tənzimləməlı | 65,1 | 77,9 | 87,0 |
| GELAN | 65,3 | 78,0 | 87,1 |
| ConvNeXtV2 | 65,2 | 78,1 | 87,0 |
Sonuçlar üç eğitilebilir omurğanın birbirine çok yaxınn olduğunu göstərir. GELAN 5° ve 20° eşiklerinde çok küçük bir üstünlük sağlarken ConvNeXtV2 10°’de en yüksek sonucu vermiştir. Tədqiqatçılar, 0,65 milyon parametrli hafif ConvNeXtV2’yi səmərəlilik nedeniyle seçmiştir.
Tədqiqatın güclü tərəfləri
- Özellik seçimi, dizi modellemesinden önce açık bir mimari bileşen olarak ele alınmıştır.
- Model, aynı parametr sayistilikyla JamMa’dan daha yüksek MegaDepth sonucu üretmiştir.
- Seçilen xüsusiyyət nisbəti doğruluq ve işləmə müddəti açistilikndan ayrıca araşdırılmışdır.
- Sabit ve deformasiya edilə bilən skanlama nicel ve görsel olarak karşılaştırılmıştır.
- Canny kaybının zengin teksturalu ve zayıf teksturalu verilənlər dəstlərindeki etkisi ayrıştırılmıştır.
- MegaDepth dışında HPatches, ScanNet ve Aachen üzerinde sahələrarası test yapılmıştır.
- Parametre, GFLOP ve işləmə müddəti doğruluq ölçütleriyle birlikte verilmiştir.
- Veri miktarı ile uyğunluq kalitesi arasındaki mopi–mtl–mre dengesi tartışılmıştır.
- Modelin sıx eşleştiricilerden daha az hesaplama kullandığı açık biçimde gösterilmiştir.
Tədqiqatnın məhdudiyyətlərı
- Tədqiqat rəyçi qiymətləndirməsindən keçməmişdir.
- Metin içi atıflar `[?]` biçimindedir ve mənbəça bulunmamaktadır.
- HPatches ve skanlama ablasiyaundaki bazı farklar yanlış hesaplanmıştır.
- Sonuçlar tek veya belirsiz sayıda təlim tədqiqatsına dayanmaktadır; standart sapma ve güven aralığı verilmemiştir.
- Tədqiqat müddətsinin ölçüm protokolü, istiliknma turu, parti boyutu ve bellek kullanımı açıqlanmamışdır.
- Sıralama işlemi için kullanılan yaklaşık gradyanın alternatif metodlerle karşılaştırması yoktur.
- Gated Index Network’ün seçtiği bölgelerin gerçek geometrik doğruluqla ilişkisi doğrudan etiketlenmiş bir güvenilirlik təcrübəiyle ölçülmemiştir.
- Canny kaybı MegaDepth’te tutarlı iyileşme sağlamamıştır.
- ScanNet’te müsbət uyğunluq sayistilikyla birlikte yanlış uyğunluq sayistilik da artmışdır.
- HPatches’te bazı Transformer tabanlı yarı-sıx metodlerin gerisinde kalmıştır.
- Yoğun DKM ve RoMa metodleri MegaDepth’te daha yüksek doğruluq sağlamıştır.
- Hareket bulanıqlığı, ağır örtülme ve çok büyük baxın açistilik değişimleri için ayrı kontrollü təcrübə verilmemiştir.
- Mobil, gömülü veya düşük güçlü donanım testi yapılmamıştır.
- Kodun yayımlanacağı belirtilmiş, ancak bu sürümde yeniden üretim paketi sunulmamıştır.
- Yazarlar kullanılan verileri paylaşma izinlerinin bulunmadığını bildirmiştir.
Tədqiqat neyi dəstəkləyir?
- Bütün kaba xüsusiyyətlerin eşit biçimde işlenmesi en iyi doğruluq–sürət dengesini sağlamayabilir.
- Özelliklerin yaristiliknın öğrenilebilir biçimde seçilmesi, bütün xüsusiyyətlərin işlenmesinden daha iyi nəticə verebilir.
- Gated Deformable Scanning, sabit skanlamaya göre MegaDepth performansını artırabilir.
- Seçilen xüsusiyyətlər mimari sınırlar ve tekstura açistilikndan zengin ön plan bölgelerinde sıxlaşmaktadır.
- Canny tabanlı ek denetim zayıf teksturalu iç mekânlarda uyğunluq kararlılığını artırabilir.
- GamMa, JamMa’ya göre HPatches ve ScanNet’te daha güçlü sıfır incə tənzimləməlı aktarım göstərir.
- GamMa sıx eşleştiricilerden daha düşük hesaplama maliyetiyle rekabetçi doğruluq sağlayabilir.
Tədqiqat neyi sübut etmir?
- GamMa’nın bütün lokal xüsusiyyət uyğunlaşdırma metodlerinden daha doğru olduğunu sübut etmir.
- JamMa’dan daha sürətlı olduğunu göstermemektedir.
- Canny kənarlarının her sahnede uyğunluq için en doğru konumlar olduğunu sübut etmir.
- Seçilen yüzde 50 nisbətinın bütün verilənlər dəstləri ve çözünürlükler için evrensel olarak en iyi olduğunu göstermemektedir.
- Gerçek zamanlı mobil veya gömülü sistem performansını doğrulamamaktadır.
- Robot, araç veya insansız hava aracı üzerinde uçtan uca saha başaristilik sunmamaktadır.
- Şiddetli örtülme ve çok büyük baxın açistilik değişimlerinde güvenilirliği kesinleştirmemektedir.
- Üretilen uyğunluqlarin güvenlik açistilikndan kritik otonom sistemlerde tek başına yeterli olduğunu göstermemektedir.
- Türkiye’deki görüntüler veya yerli sistemler için doğrulanmış başarı nisbəti vermemektedir.
Gelecekte hangi tədqiqatlar gereklidir?
- Birden fazla təsadüfi tohumla təlim yapılıp orta ve standart sapma raporlanmalıdır.
- Tədqiqat müddətsi, bellek ve enerji tüketimi farklı GPU, CPU ve uç cihazlarda ölçülmelidir.
- Özellik seçiminin kalibrasyonu ve seçilen noktaların gerçek uyğunluq güvenilirliği incelenmelidir.
- Türevlenebilir sıralama veya farklı top-K kestirim metodleri karşılaştırılmalıdır.
- Büyük baxın açistilik, örtülme, hərəkət bulanıqlığı ve mevsim değişimi için ayrı testler yapılmalıdır.
- Mobil robot, araç ve insansız hava aracı üzerinde real vaxtlı SLAM təcrübələri gerçekleştirilmelidir.
- Türk kentleri, tarihi yapılar ve afet sonrası görüntüler gibi lokal sahə kaymaları sınanmalıdır.
- Kaynak kodu, təlim yapılandırması, model ağırlıkları ve yeniden üretim betikleri yayımlanmalıdır.
- Eksik mənbəça ve metin–cədvəl sayısal tutarsızlıkları rəyçili sürümde düzeltilmelidir.
Tədqiqatın metodu və nəticələri
Texniki metod xülasəsi
| Bileşen | Uygulanan metod |
|---|---|
| Temel görev | İki görüntü arasında yarı-sıx lokal xüsusiyyət uyğunlaşdırma |
| Özellik omurğası | ConvNeXtV2-N |
| Kaba xüsusiyyət çözünürlüğü | Girdi çözünürlüğünün 1/8’i, 256 kanal |
| İnce xüsusiyyət çözünürlüğü | Girdi çözünürlüğünün 1/2’si, 64 kanal |
| Temel yenilik | Gated Deformable Mamba |
| Özellik seçimi | Öğrenilebilir indeks ofseti, sıralama ve top-K seçimi |
| Varsayılan K | Kaba xüsusiyyət konumlarının yaristilik |
| Dizi modelleme | Dört üst üste Mamba bloğu ve yönlü diziler |
| Geri birleştirme | Ters indeksleme ve kapılı evrişim birimi |
| İnce uyğunlaşdırma | Kaba tahmin çevresinde lokal xüsusiyyət penceresi |
| Ek geometrik denetim | Canny kənar tabanlı L1 konum kaybı |
| Alt piksel denetimi | Simetrik epipolar məsafə |
| Eğitim | MegaDepth, 60 dönem, AdamW |
| Alanlar arası test | HPatches ve ScanNet; incə tənzimləmə yapılmadan |
| Çoklu görünüm testi | Aachen v1.1 ve HLoc |
| Model boyutu | 5,7 milyon parametr |
| Hesaplama | 202,5 GFLOP |
| Ölçülen müddət | 37,9 ms |
Əsas müqayisəli tapıntılar
| Test | GamMa sonucu | Temel karşılaştırma | Yorum |
|---|---|---|---|
| MegaDepth | 65,2 / 78,1 / 87,0 | JamMa: 64,1 / 77,4 / 86,5 | Benzer maliyetle daha yüksek doğruluq |
| HPatches | 65,5 / 75,4 / 84,3 | JamMa: 61,8 / 71,5 / 81,2 | Alanlar arası kazanç; bazı Transformer modellerinin gerisinde |
| ScanNet | 21,0 / 38,4 / 54,4 | JamMa: 18,5 / 35,6 / 51,3 | İç mekân sahə kaymasında daha dayanıqlı |
| Aachen | mtl 5,16; mre 1,13 | JamMa: 4,48; 1,19 | Daha uzun iz ve daha düşük yenidən proyeksiya hatası |
Ablasiyaların göstərdiyi əsas mexanizmlər
- Sabit skanlamanın kapılı deformasiya edilə bilən skanlamayla değiştirilmesi en güçlü tek bileşen kazançlarından birini sağlamıştır.
- Gated Index Network kaldırıldığında AUC@5° 65,2’den 63,2’ye azalmışdır.
- Bütün xüsusiyyətlər yerine yaristiliknın seçilmesi hem doğruluq hem işləmə müddətini iyileştirmiştir.
- Özelliklerin yalnız dörtte veya sekizde birini korumak hesablama müddətinde küçük, doğruluqta daha büyük itki oluşturmuştur.
- Canny kaybı zengin teksturalu MegaDepth’te sınırlı, zayıf teksturalu ScanNet ve çoklu görünüm Aachen testinde daha belirgin katkı sağlamıştır.
- Omurga seçiminin etkisi öğrenilebilir xüsusiyyət seçimi kadar büyük olmamıştır.
Vizual materialların elmi mənası
| Görsel | Gösterilen içerik | Bilimsel işlevi |
|---|---|---|
| Grafik özet | Özellik çıkarma, seçici skanlama, Mamba, ince uyğunlaşdırma ve Canny kaybı | GamMa işlem hattını tek şemada göstermek |
| Şekil 1 | JamMa’nın ScanNet uyğunluqlari | Alan kaymasında yanlış uyğunluq sorununu göstermek |
| Şekil 2 | GamMa-nın ümumi arxitekturası | Kaba ve ince aşamalarla seçici Mamba axınını açıklamak |
| Şekil 3 | Gated Deformable Scanning | Konum seçme ve dizi oluşturma müddətcini göstermek |
| Şekil 4 | Gated Index Network | İki evrişim kolu ve kapılı etkileşimi açıklamak |
| Şekil 5 | Canny Edge Loss | Kenar hedefinin nasıl üretildiğini göstermek |
| Şekil 6 | LoFTR, JamMa ve GamMa uyğunluqlari | MegaDepth üzerinde nitel karşılaştırma sunmak |
| Şekil 7 | Sabit ve deformasiya edilə bilən skanlama istilik haritaları | Ön plan ve sınır cevaplarının sıxlaşmasını göstermek |
| Şekil 8 | Canny kaybıyla ve itkisız uyğunluq konumları | Kenar denetiminin zayıf teksturalu sahnelerdeki etkisini göstermek |
| Şekil 9 | Seçilen K xüsusiyyət konumları | Seçimin mimari ve tekstura açistilikndan zengin bölgelerde sıxlaştığını göstermek |
| Şekil 10 | JamMa ve GamMa ScanNet nəticələrı | İnce ayarsız sahələrarası ümumiləşdirmə farkını göstermek |
Təkrar istehsal baxımından kritik detallar
- Görüntüler təlimde 832 × 832 boyutuna getirilmelidir.
- Kaba ve incə xüsusiyyət kanalları sırasıyla 256 ve 64’tür.
- Dört Mamba bloğu ve K = 1/2 yapılandırması kullanılmaktadır.
- Canny düşük ve yüksek eşikleri 0,1 ve 0,2’dir.
- Focal loss için α = 0,25 ve γ = 2’dir.
- Alt piksel kaybı 104 katsayistilikyla ağırlıklandırılmıştır.
- Eğitim 60 dönem, AdamW, 2 × 10−4 başlanğıc öğrenme nisbəti ve toplu iş boyutu 8 ile yapılmıştır.
- HPatches karşılaştırmasında metod başına yalnız en yüksek 1.000 uyğunluq istifadə edilmişdir.
- MegaDepth ve ScanNet testlerinde 1.500 görüntü çifti dəyərlendirilmiştir.
- Sonuçları yeniden üretmek için eksik mənbəça, kod, model ağırlıkları ve təsadüfi tohumlar gereklidir.
Nəticələrin texniki şərhi
GamMa’nın nəticələrı, yarı-sıx görüntü uyğunlaşdırmade bilgi miktarından çok bilgi kalitesinin belirleyici olabileceğini göstərir. Bütün kaba xüsusiyyətleri diziye aktarmak hem müddətyi uzatmış hem de doğruluğu azaltmışdır. Özelliklerin yaristiliknı seçmek gürültülü etkileşimleri azaltırken gerekli geometrik kanıtın büyük bölümünü korumuştur.
Modelin esas kazancı parametr sayistiliknı veya hesaplama yükünü önemli ölçüde artırmadan JamMa’nın sahələrarası dayanıqlılığını geliştirmesidir. MegaDepth kazancı görece küçükken HPatches ve ScanNet farklarının daha büyük olması, seçici skanlamanın təlim ve test sahəı farklılaştığında daha dəyərli olabileceğine işaret etmektedir.
Canny kənar kaybının yararı sahneye bağımlıdır. Zengin teksturalu dış mekânda katkı çok sınırlı kalırken iç mekânlarda geometrik sınırlar ek bilgi sağlamıştır. Bu durum, kənar tabanlı düzenleyicilerin evrensel değil koşula bağlı araçlar olduğunu göstərir.
Mənbə və metod qeydi
Tədqiqatnın tam özgün adı: GamMa: Selecting Informative Features for Fast and Robust Local Feature Matching
Yazarlar: Jianhao Xu, Xiangtao Fan, Hongdeng Jian, Chen Xu, Weijia Bei, Qifeng Ge ve Ruijie Han.
Yazar sıralaması: Kaynakta verildiği biçimde korunmuştur.
Eş birinci yazar: Eşit katkı veya eş birinci yazarlık beyanı yer almamaktadır.
Sorumlu yazar: Hongdeng Jian.
Sorumlu yazar e-posta adresi: jianhd@radi.ac.cn
Diğer iletişim adresleri: xujianhao22@mails.ucas.ac.cn; fanxt@radi.ac.cn; xuchen@aircas.ac.cn; beiweijia21@mails.ucas.ac.cn; geqifeng21@mails.ucas.ac.cn; hanruijie23@mails.ucas.ac.cn.
Kurum 1: Key Laboratory of Digital Earth Science, Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing 100094, Çin.
Kurum 2: International Research Center of Big Data for Sustainable Development Goals, Beijing 100094, Çin.
Kurum 3: University of Chinese Academy of Sciences, Beijing 100094, Çin.
Resmî mənbə keçidsı:SSRN rəsmi kayıt sayfası
Yayın platformu: SSRN.
Yayın yılı: 2026.
Metinde verilen tarih: 25 Haziran 2026.
Hedef dergi: Yüklenen sürüm “Preprint submitted to Pattern Recognition” ibaresini taşımaktadır.
Dergi ve yayınevi durumu: Tədqiqatnın Pattern Recognition tarafından kabul edildiğini veya rəyçili dergi sürümünün yayımlandığını gösteren bilgi bu mənbəta bulunmamaktadır. Bu nedenle rəyçili dergi yayını olarak sunulamaz.
Kaynak türü: Bilgisayarlı görüde yarı-sıx lokal xüsusiyyət uyğunlaşdırma için yeni bir sinir ağı mimarisi geliştiren ve dört veri dəstinde sınayan preprint araştırma makalesi.
Hakemlik durumu: Tədqiqat rəyçi qiymətləndirməsindən keçməmişdir.
Jianhao Xu’nun katkıları: Kavramsallaştırma, metod, biçimsel analiz, veri düzenleme, özgün taslak yazımı ve araştırma.
Xiangtao Fan’ın katkıları: Kavramsallaştırma, danışmanlık, inceleme ve düzenleme, doğrulama ve finansman temini.
Hongdeng Jian’ın katkıları: Doğrulama, inceleme ve düzenleme ile metod.
Chen Xu’nun katkıları: Kaynak sağlama, inceleme ve düzenleme ile finansman temini.
Weijia Bei’nin katkıları: Yöntem.
Qifeng Ge’nin katkıları: Yazılım ve görselleştirme.
Ruijie Han’ın katkıları: Veri düzenleme.
Finansman: Provincial Special Funding for the Construction of Chenzhou National Sustainable Development Agenda Innovation Demonstration Zone, No. 2023sfq69.
Çıkar çatışması: Yazarlar tədqiqatyı etkileyebilecek bilinen bir mali çıkar veya kişisel ilişki bulunmadığını beyan etmiştir.
Veri çıxışi: Yazarlar verileri paylaşma izinlerinin bulunmadığını belirtmiştir.
Kod çıxışi: Metin, kodun GitHub deposunda yayımlanacağını bildirmektedir. Yüklenen sürümde sabitlenmiş bir yazılım sürümü, model ağırlığı veya yeniden üretim paketi sunulmamıştır.
Kaynakça sorunu: Metindeki atıflar `[?]` biçiminde görünmekte ve mənbəça bölümü bulunmamaktadır. Bu durum önceki metodlerin, verilənlər dəstlərinin ve kullanılan yazılımların özgün mənbəlarının doğrulanmasını engellemektedir.
Sayısal tutarlılık uyaristilik: HPatches’te orta eşik kazancı cədvəlda 3,9 iken metinde 4,9 yazılmıştır. Gated Deformable Scanning’in AUC@20° kazancı cədvəlda 0,9 iken metinde 1,9 olarak verilmiştir.
Görsel tutarlılık uyaristilik: Şekil 9’un açıklaması Canny kaybıyla ve itkisız xüsusiyyət dağılımını karşılaştırdığını söylemektedir; ancak görsel yalnızca Gated Index Network tarafından seçilen K konumlarını göstərir.
Yorum sınırı: GamMa MegaDepth’te yarı-sıx metodler içinde en yüksek sonucu vermiş, ancak sıx DKM ve RoMa’dan düşük AUC üretmiştir. HPatches’te LoFTR, ASpanFormer ve ELoFTR’ın biraz gerisinde kalmıştır. Bu nedenle tədqiqat, genel ve koşulsuz bir en iyi eşleştirici üstünlüğü sübut etmir.
Bu Türkçe içerik yalnızca yüklenen tədqiqatnın metni, denklemleri, cədvəlları, mimari şemaları, uyğunluq görselleri ve təcrübə nəticələrı temel alınarak hazırlanmıştır. Tədqiqatda bulunmayan bir saha başaristilik, ticari ürün performansı, otonom sistem güvenliği veya Türkiye’ye özgü doğruluq iddiası eklenmemiştir.

Şərh yazın
E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib