Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

05 Oktabr 2026, Dushanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Muhandislik / Monokulyar 3D Obyektlarni Aniqlashda Ko‘p Modalli Fuzion orqali Nazoratsiz Domen Moslashtirish
Muhandislik

Monokulyar 3D Obyektlarni Aniqlashda Ko‘p Modalli Fuzion orqali Nazoratsiz Domen Moslashtirish

Nazoratsiz monokulyar 3D aniqlash modeli UM3D (Unsupervised Monocular 3D Detection), belgilangan manba domenda o‘rganilgan uch o‘lchamli aniqlash bilimini maqsad domenda 3D quti belgilariga ehtiyoj sezmasdan ko‘chirish uchun o‘z-o‘zini nazorat qiluvchi chuqurlikni baholash, Pseudo-LiDAR yaratish, sifatga sezgir psevdobelgilash va tasvir–nuqta buluti fuzionini yagona uchdan-uchgacha o‘rganish zanjirida birlashtiradigan bir nazorat

05/10/2026  Veri Anla 21 marta ko‘rildi
Monokulyar 3D Obyektlarni Aniqlashda Ko‘p Modalli Fuzion orqali Nazoratsiz Domen Moslashtirish

Nazoratsiz monokulyar 3D aniqlash modeli UM3D (Unsupervised Monocular 3D Detection) belgilangan manba domenda o‘rganilgan uch o‘lchamli aniqlash bilimini maqsad domenga 3D quti belgilari talab qilmasdan ko‘chirish uchun o‘z-o‘zini nazorat qiluvchi chuqurlikni baholash, Pseudo-LiDAR yaratish, sifatga sezgir psevdobelgilash hamda tasvir–nuqta buluti fuzionini yagona uchdan-uchgacha o‘rganish zanjirida birlashtiradigan nazoratsiz domen moslashtirish doirasidir. Tadqiqot KITTI, Waymo Open Dataset (WOD), nuScenes va Lyft ma’lumotlar to‘plamlarida baholangan. UM3D, ayniqsa domen siljishi tufayli turli muhitlar o‘rtasida pasayadigan monokulyar 3D aniqlash samaradorligini yaxshilashni maqsad qiladi. Inferensiya bosqichida haqiqiy LiDAR talab qilinmaydi; Pseudo-LiDAR tasviri shu monokulyar tasvirdan baholangan chuqurlik asosida tizim ichida yaratiladi. Biroq samaradorlik, ayniqsa uzoq obyektlarda, chuqurlikni baholash aniqligi bilan cheklanadi va tajribalarning asosiy e’tibori avtomobil sinfiga qaratilgan.

Usulning ikkita asosiy aralashuvi bor. Birinchidan, obyekt darajasidagi tasodifiy masshtablash manba va maqsad domenlar o‘rtasidagi transport vositasi o‘lchami farqlarining dastlabki psevdobelgilarni buzishini kamaytirishga harakat qiladi. Ikkinchidan, IoU asosidagi sifat baholashidan foydalanadigan uch oralig‘li xotira banki psevdobelgilarni faqat bitta ishonch balliga ko‘ra qabul qilish o‘rniga tarixiy bashoratlar bilan moslashtiradi va yangilaydi. Ushbu tuzilma LoGoNet asosidagi tasvir–nuqta buluti fuzioni va differensiallanuvchi Change of Representation (CoR) qatlami bilan birlashtirilib, aniqlash xatosining chuqurlik tarmog‘igacha orqaga tarqalishiga imkon beradi.

WOD → KITTI nuqta buluti domen moslashtirishida LoGoNet asosidagi UM3D APBEV/AP3D qiymatlarida 85,71/67,44 ga erishgan. Manba maqolaning qisqacha mazmun va xulosa bo‘limlari WOD → KITTI uchun APBEV domen farqining %76,81 qismi yopilganini ta’kidlaydi; biroq shu tadqiqotning 2-jadvalida SECOND asosidagi UM3D uchun %97,89 APBEV Closed Gap qayd etilgan. Shu sababli %76,81 qiymati maqoladagi barcha konfiguratsiyalarning mutlaq maksimumi sifatida emas, LoGoNet konfiguratsiyasida qayd etilgan natija sifatida baholanishi kerak.

UM3D nima va u qaysi muammoni hal qiladi?

UM3D turli ma’lumotlar to‘plamlari va haydash muhitlari o‘rtasidagi taqsimot siljishi monokulyar 3D obyekt aniqlashda yuzaga keltiradigan samaradorlik yo‘qotilishini maqsad domenda haqiqiy 3D quti belgilariga tayanmasdan kamaytirishga qaratilgan uchdan-uchgacha nazoratsiz domen moslashtirish doirasidir. Tizim bitta tasvirdan chuqurlikni chiqaradi, bu chuqurlikni Pseudo-LiDAR nuqta bulutiga aylantiradi, sifat nazoratidan o‘tgan psevdobelgilar bilan maqsad domenga moslashadi va tasvir xususiyatlari bilan uch o‘lchamli geometrik xususiyatlarni birgalikda qayta ishlaydi.

Asosiy muammo: bitta kameradan chuqurlikni chiqarish nega qiyin?

Monokulyar kamerada bir xil ikki o‘lchamli tasvir proyeksiyasi turli uch o‘lchamli sahna geometriyalari bilan mos kelishi mumkin. Boshqacha aytganda, tasvir chuqurlikni bevosita o‘lchamaydi. LiDAR fizik masofani o‘lchashni ta’minlasa, monokulyar tizim chuqurlikni tasvirdagi belgilar asosida baholashi kerak. Shu sababli chuqurlikdagi xato Pseudo-LiDAR nuqtasining fazodagi holatini, undan keyin esa 3D qutining joylashuvi, o‘lchami yoki yo‘nalishini buzishi mumkin.

Ikkinchi qiyinchilik domen siljishidir. Detektor bir ma’lumotlar to‘plamida o‘rgatilganda, boshqa ma’lumotlar to‘plamidagi kamera geometriyasi, geografik muhit, sensor zichligi, transport vositalari o‘lchamlarining taqsimoti va annotatsiya protokollari farq qilishi mumkin. Shu bois manba domenda kuchli bo‘lgan model maqsad domenda xuddi shunday samaradorlikni ko‘rsatmasligi mumkin.

UM3D ning ilmiy arxitekturasi

  1. O‘z-o‘zini nazorat qiluvchi mutlaq chuqurlikni baholash: RSANet yordamida monokulyar tasvirdan mutlaq masshtabdagi chuqurlik xaritasi hosil qilinadi.
  2. Pseudo-LiDAR o‘zgartirishi: Piksel koordinatalari va chuqurlik pinhole kamera geometriyasi orqali uch o‘lchamli nuqtalarga aylantiriladi.
  3. Zichlikka asoslangan oraliq namunalash: Zich Pseudo-LiDAR bulutining siyrak va zich hududlarini muvozanatlashga harakat qilinadi.
  4. Sifatga sezgir psevdobelgilash: Obyekt darajasidagi tasodifiy masshtablash va IoU asosidagi uch oralig‘li xotira bankidan foydalaniladi.
  5. Ko‘p modalli fuzion: Tasvir xususiyatlari bilan Pseudo-LiDAR geometriyasi LoGoNet asosidagi ikki bosqichli fuzion va self-attention og‘irliklash orqali birlashtiriladi.
  6. Uchdan-uchgacha qo‘shma optimallashtirish: Differensiallanuvchi CoR qatlami tufayli 3D aniqlash yo‘qotishining gradienti chuqurlikni baholash tarmog‘iga qaytib boradi.

Pseudo-LiDAR ushbu tadqiqotda qanday yaratiladi?

Pseudo-LiDAR monokulyar tasvir uchun baholangan mutlaq chuqurlik xaritasidagi har bir pikselni kameraning ichki parametrlari yordamida uch o‘lchamli koordinataga teskari proyeksiya qilish orqali yaratiladi; UM3D keyin koordinata tizimini transport vositasi–LiDAR o‘qlariga o‘zgartiradi, 64 chiziqli LiDAR ma’lumot olish jarayonini taqlid qiluvchi burchakli namunalashni qo‘llaydi va yuqori zichlikdagi nuqta bulutini zichlikka asoslangan oraliq namunalash orqali siyraklashtiradi.

Tasvir tekisligidan uch o‘lchamli nuqtaga o‘zgartirish

Manba tadqiqotning (1)-tenglamasida tasvirdagi (i, j) holati, mutlaq chuqurlik qiymati D(i,j) va kameraning ichki parametrlaridan foydalaniladi:

\[ x=\frac{(i-c_i)D(i,j)}{f_x},\qquad y=\frac{(j-c_j)D(i,j)}{f_y},\qquad z=D(i,j) \tag{1} \]

Bu yerda \(f_x\) va \(f_y\) gorizontal va vertikal fokus masofalarini; \(c_i\) va \(c_j\) asosiy nuqta koordinatalarini bildiradi. \(i\), \(j\), \(f_x\), \(f_y\), \(c_i\) va \(c_j\) tasvir/piksel koordinata tizimidadir. \(D\) qaysi uzunlik masshtabida ifodalangan bo‘lsa, hosil qilingan \(x\), \(y\) va \(z\) koordinatalari ham o‘sha fizik masshtabni saqlaydi.

Kamera koordinatalarini transport vositasidagi LiDAR koordinata tizimiga o‘tkazish manbada quyidagi o‘qlar mosligi bilan beriladi:

\[ x=-z,\qquad y=-x,\qquad z=y \tag{2} \]

64 chiziqli LiDAR ma’lumot olishni taqlid qilish uchun har bir nuqtaning vertikal burchagi va sensorgacha bo‘lgan masofa hisoblanadi:

\[ \vartheta(n)= \arctan\left( \frac{z(n)} {\sqrt{x^2(n)+y^2(n)}} \right), \qquad l(n)=\sqrt{x^2(n)+y^2(n)+z^2(n)} \tag{3} \]

Nuqtalar vertikal burchakka ko‘ra skan chiziqlariga biriktiriladi, chiziq ichida masofaga ko‘ra tartiblanadi va azimut kataklariga ajratiladi. Har bir chiziq–azimut katagida sensorga eng yaqin nuqtaning saqlanishi bir qaytishli LiDAR o‘lchovini sxematik ravishda taqlid qiladi. Tadqiqotda sensor boshlang‘ich nuqtasidan 1 m yuqorida joylashgan nuqtalar olib tashlangani va qaytish intensivliklari 1 ga o‘rnatilgani ko‘rsatiladi.

Zichlikka asoslangan oraliq namunalash

Yuqori aniqlikdagi chuqurlik xaritasidan yaratilgan Pseudo-LiDAR juda zich bo‘lishi mumkin. UM3D fazoni \(n\) kubik hududga ajratadi:

\[ \Omega=\{\omega_1,\omega_2,\ldots,\omega_n\} \tag{4} \]

Har bir \(\omega_i\) hududidagi nuqtalar soni \(m_i\) uchun teskari zichlik og‘irligi:

\[ k_i=\frac{1}{m_i+\sigma} \tag{5} \]

deb belgilanadi. \(\sigma\) nolga bo‘lishning oldini oluvchi kichik musbat qiymatdir. Siyrak hududlarda \(k_i\) yuqoriroq bo‘lgani uchun ularning namunalashdagi nisbiy hissasi ortadi. Har bir hududdan olingan namunalar to‘plami:

\[ P_i=\{p_{i1},p_{i2},\ldots,p_{ij}\} \tag{6} \]

va yakuniy namunalanadigan bulut:

\[ \Gamma=\bigcup_{i=1}^{n}P_i \tag{7} \]

ko‘rinishida yaratiladi. Manba \(\sigma\) ning sonli qiymatini, kubik oraliqlarning aniq geometrik o‘lchamlarini yoki \(j\) ning \(k_i\) dan qaysi aniq namunalar soni qoidasi bilan hosil qilinishini batafsil qayd etmaydi; bu qiymatlar Verianla tomonidan to‘ldirilmagan.

Obyekt darajasidagi tasodifiy masshtablash nega qo‘llanadi?

Manba domendagi transport vositalarining fizik o‘lcham taqsimoti maqsad domendagidan farq qilsa, manbada o‘rgatilgan 3D detektor maqsad domendagi qutilarni tizimli ravishda noto‘g‘ri o‘lchamlashi mumkin. UM3D ning Object-Level Random Scaling Strategy (ORSS) komponenti bu og‘ishni kamaytirish uchun belgilangan manba-domen obyektlarini lokal quti koordinata tizimida masshtablaydi.

O‘lchami \((l,w,h)\), markazi \((u,v,d)\) va yo‘nalishi \(\omega\) bo‘lgan qutidagi nuqta avval lokal koordinataga o‘tkaziladi:

\[ (p_{il},p_{iw},p_{ih})= (p_{ix}-u,p_{iy}-v,p_{iz}-d) \begin{bmatrix} \cos\omega & -\sin\omega & 0\\ \sin\omega & \cos\omega & 0\\ 0 & 0 & 1 \end{bmatrix} \tag{8} \]

Keyin o‘lchamsiz \(f_l\), \(f_w\), \(f_h\) masshtab koeffitsiyentlari qo‘llanadi va nuqta yana global koordinataga o‘tkaziladi:

\[ (p_{ix},p_{iy},p_{iz})= (p_{il}f_l,p_{iw}f_w,p_{ih}f_h) \begin{bmatrix} \cos\omega & \sin\omega & 0\\ -\sin\omega & \cos\omega & 0\\ 0 & 0 & 1 \end{bmatrix} +(u,v,d) \tag{9} \]

Manba maqola \(f_l\), \(f_w\) va \(f_h\) uchun ishlatilgan tasodifiy namunalash oraliqlarini sonli ko‘rinishda bermaydi. Shu sababli bu parametrlarning taqsimoti yoki chegaralari bu yerda faraz qilinmagan.

Psevdobelgi sifati qanday nazorat qilinadi?

UM3D detektorga qo‘shilgan IoU regressiya boshi orqali bashorat qilingan 3D qutining sifat ballini o‘rganadi. Manbada sifat yo‘qotishi ikkilik kross-entropiya ko‘rinishida beriladi:

\[ L_{\mathrm{quality}} =-(1-\hat{s})\log(1-s)-\hat{s}\log(s) \tag{10} \]

\(s\) model quti uchun bashorat qilgan IoU sifat qiymatini; \(\hat{s}\) esa bashorat qutisining haqiqiy quti yoki psevdobelgi bilan hisoblangan IoU qiymatini anglatadi.

Amalda musbat chegara \(Thr_p=0.5\), manfiy chegara \(Thr_n=0.2\) qilib berilgan. \(s_i>Thr_p\) bo‘lgan qutilar musbat namuna sifatida xotiraga olinadi; \(Thr_n<s_i<Thr_p\) oralig‘idagi qutilar o‘qitish vaqtida e’tiborga olinmaydigan hududlarni ko‘rsatish uchun xotirada saqlanadi; \(s_i<Thr_n\) bo‘lganlar tashlab yuboriladi.

Tarixiy psevdobelgilar to‘plami \(H\) va joriy to‘plam \(C\) uchun 3D IoU:

\[ \mathrm{IoU}(H,C)= \frac{\cap_{H,C}}{\cup_{H,C}} \tag{11} \]

orqali hisoblanadi va har bir tarixiy quti uchun eng kuchli joriy moslik tanlanadi:

\[ \mathrm{optimum}(H,C) = \underset{C}{\arg\max}\, |\mathrm{IoU}(H,C)| \tag{12} \]

Mos kelmagan tarixiy qutilar uchun hisoblagich mexanizmi qo‘llanadi:

\[ \mathrm{state}= \begin{cases} 1, & \mathrm{counter}(H)\lt Thr_i\\ 0, & Thr_i\leq \mathrm{counter}(H)\lt Thr_r\\ -1, & \mathrm{counter}(H)\geq Thr_r \end{cases} \tag{13} \]

\(\mathrm{state}=1\) xotirada saqlash, \(\mathrm{state}=0\) e’tiborga olmaslik, \(\mathrm{state}=-1\) esa o‘chirishni anglatadi. Manba \(Thr_i\) va \(Thr_r\) chegaralarini konseptual jihatdan belgilaydi, ammo amalga oshirish tafsilotlarida ularning sonli qiymatlarini qayd etmaydi. Buning o‘rniga joriy–tarixiy psevdobelgilarni moslashtirishda ishlatilgan IoU chegarasi 0,1 deb ko‘rsatilgan.

Tasvir va Pseudo-LiDAR xususiyatlari qanday birlashtiriladi?

UM3D ning ko‘p modalli detektori LoGoNet arxitekturasiga asoslanadi. Nuqta buluti voxel tuzilmasiga aylantirilib, 3D backbone va Region Proposal Network (RPN) tomonidan qayta ishlanadi. Shu bilan bir vaqtda oldindan o‘rgatilgan 2D detektor monokulyar tasvirdan tasvir xususiyatlarini chiqaradi.

LoGoNet ning ikki fuzion bosqichi saqlanadi. Taklif hududidan tashqaridagi fuzion voxel markazlarini tasvir tekisligiga proyeksiya qilib global geometrik tartibni bog‘laydi. Taklif hududi ichidagi fuzion esa har bir taklif ichidagi lokal tafsilotlarni cross-attention orqali qayta ishlaydi. Tadqiqot o‘zgartirgan qism — bu ikki chiqishni shunchaki birlashtirish o‘rniga self-attention asosidagi og‘irlangan xususiyat yig‘ishdir.

\[ F=[F_{\mathrm{out}};F_{\mathrm{in}}], \qquad Q=W_QF,\quad K=W_KF,\quad V=W_VF \tag{14} \]

Bu yerda \(F_{\mathrm{out}}\) hudud tashqarisidagi, \(F_{\mathrm{in}}\) esa hudud ichidagi fuzion xususiyatidir. \(W_Q\), \(W_K\) va \(W_V\) o‘rganiladigan proyeksiya matritsalaridir. Masshtablangan nuqtaviy ko‘paytma attention:

\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax} \left( \frac{QK^\top}{\sqrt{d_k}} \right)V \tag{15} \]

ko‘rinishidadir. \(d_k\) kalit vektorlar o‘lchamidir. Matematik jihatdan mexanizm har bir xususiyat pozitsiyasining boshqa xususiyat pozitsiyalari bilan aloqasini og‘irliklab, tasniflash va quti regressiyasi uchun tanlovchanroq birlashtirilgan tasvir yaratadi.

Differensiallanuvchi CoR nega muhim?

Klassik voxellash nuqtaning katak ichida bor yoki yo‘qligini 0 yoki 1 bilan ifodalaydi. Bu keskin qaror koordinata o‘zgarishidagi kichik o‘zgarishlarga nisbatan uzlukli bo‘lgani uchun chuqurlik tarmog‘iga orqaga tarqaladigan gradientni to‘sishi mumkin. UM3D E2E-PL dan olingan Change of Representation (CoR) yondashuvini zichlikka asoslangan namunalash bilan birga ishlatadi va voxel bandligini yumshoq RBF og‘irliklari bilan ifodalaydi.

Bir \(u\) katak ichidagi \(P_u\) nuqtalar uchun:

\[ W(u) = \frac{1}{|P_u|} \sum_{p\in P_u} e^{-\|p-p_c\|_2^2/\delta^2} \tag{16} \]

va qo‘shni kataklar \(\Upsilon_u\) hisobga olinganda:

\[ T_{\mathrm{softquantization}}(u) = W(u)+ \frac{1}{|\Upsilon_u|} \sum_{\bar{u}\in\Upsilon_u} W(\bar{u}) \tag{17} \]

hosil bo‘ladi. \(p_c\) voxel markazidir; \(\delta\) RBF tarmoqli kengligi bilan bog‘liq. Tajriba sozlamalarida \(\delta^2=0.01\) va 26 qo‘shnili 3×3×3 yumshatish yadrosi ishlatilgan. Ushbu yumshoq tasvirning asosiy algoritmik vazifasi aniqlash xatosining nuqta tasviri orqali chuqurlik tarmog‘iga orqaga tarqalishiga imkon berishdir.

Umumiy o‘rganish maqsadi

Uchdan-uchgacha umumiy yo‘qotish:

\[ L=\alpha L_{\mathrm{depth}}+\beta L_{\mathrm{detection}} \tag{18} \]

ko‘rinishidadir. Tajribalarda \(\alpha=1\) va \(\beta=0.01\) ishlatilgan.

Manbada chuqurlik yo‘qotishi (19)-tenglama bilan quyidagicha qayd etiladi:

\[ L_{\mathrm{depth}} = \min_{t'} p_e(I_t,I_{t'\rightarrow t})L_p +\mu L_{\mathrm{smooth}} \tag{19} \]

Fotometrik komponent va silliqlik komponenti:

\[ L_p=\sum_{t'}\ell(I_t,I_{t'\rightarrow t}) \tag{20} \]

\[ L_{\mathrm{smooth}} = |\nabla_x d_t^*|e^{-|\nabla_x I_t|} + |\nabla_y d_t^*|e^{-|\nabla_y I_t|} \tag{21} \]

ko‘rinishidadir. \(d_t^*\) normallashtirilgan teskari chuqurlikni, \(\nabla_x\) va \(\nabla_y\) gorizontal va vertikal gradientlarni bildiradi. Silliqlik og‘irligi tajribalarda \(\mu=0.001\).

Aniqlash yo‘qotishi:

\[ L_{\mathrm{detection}} = L_{\mathrm{RPN}} + L_{\mathrm{conf}} + \lambda L_{\mathrm{reg}} \tag{22} \]

deb beriladi. \(L_{\mathrm{RPN}}\) region proposal network yo‘qotishi, \(L_{\mathrm{conf}}\) ishonch/bashorat yo‘qotishi va \(L_{\mathrm{reg}}\) quti regressiya yo‘qotishidir. Tajribalarda \(\lambda=2.0\) ishlatilgan.

Uch bosqichli o‘qitish mantiqi

  1. Manba domen pretraining: Haqiqiy belgilangan manba-domen nuqta buluti ma’lumotlari bilan IoU boshli detektor ORSS yordamida oldindan o‘rgatiladi.
  2. Maqsad domen self-training: Maqsad domenda bashorat qutilari va IoU sifat ballari yaratiladi; uch oralig‘li xotira banki yangilanadi va psevdobelgilar bilan o‘qitish davom ettiriladi.
  3. Uchdan-uchgacha monokulyar qo‘shma optimallashtirish: Tasvirdan chuqurlik yaratiladi, differensiallanuvchi CoR bilan Pseudo-LiDAR hosil qilinadi, psevdobelgilar yangilanadi va chuqurlik → CoR → ko‘p modalli aniqlash zanjiri yagona umumiy yo‘qotish ostida birgalikda optimallashtiriladi.

Tadqiqot usuli va natijalari

Amalga oshirish tafsilotlari

BandManbada qayd etilgan qiymat
Maqsad-domen self-training optimizerAdam
Self-training o‘rganish tezligi0.0015
Self-training davomiyligi40 epoch
Psevdobelgi yangilashHar epoch
Uchdan-uchgacha kirish/chiqish aniqligi1024 × 320
FrameworkPyTorch 1.10.0
Uchdan-uchgacha optimizerAdam
Boshlang‘ich o‘rganish tezligi0.001
O‘rganish tezligini kamaytirishHar 10 epoch da ×0.1
Uchdan-uchgacha o‘qitish30 epoch
\(\alpha\)1
\(\beta\)0.01
\(\mu\)0.001
\(\lambda\)2.0
RBF\(\delta^2=0.01\)
Yumshatish qo‘shniligi26 qo‘shni, 3×3×3
\(Thr_p\)0.5
\(Thr_n\)0.2
Xotira banki IoU moslashtirish chegarasi0.1

Ma’lumotlar to‘plamlari va baholash sohasi

Ma’lumotlar to‘plamiManbada berilgan qamrovTadqiqotdagi roli
KITTI7481 training, 7518 test namunasi; Easy/Moderate/Hard baholashMuhim maqsad domenlardan biri
Waymo Open Dataset (WOD)798 training, 202 validation, 150 test ketma-ketligiManba domen / ma’lumotlar to‘plamlariaro ko‘chirish
nuScenes1000 sahna; Boston va SingapurManba yoki maqsad domen
Lyft55.000 dan ortiq annotatsiyalangan kadrManba yoki maqsad domen

Barcha ma’lumotlar to‘plamlari uchun aniqlash sohasi \(X/Y\in[-75.2,75.2]\) m va \(Z\in[-2,4]\) m qilib belgilangan. SECOND va LoGoNet uchun voxel o‘lchami \((0.1,0.1,0.15)\) m. Ma’lumotlarni augmentatsiya qilish global tasodifiy masshtablash, aylantirish, siljitish va har bir obyekt uchun masshtablash/aylantirishni o‘z ichiga oladi.

Closed Gap metrikasi nimani anglatadi?

Closed Gap manba domenda o‘rgatilib maqsad domenga bevosita qo‘llangan model bilan maqsad domenda to‘liq nazorat ostida o‘rgatilgan Oracle o‘rtasidagi samaradorlik farqining domen moslashtirish usuli tomonidan qanchasi yopilganini foizda ifodalaydi; qiymat oshgani sari moslashtirilgan model Oracle samaradorligiga yaqinlashadi, biroq nisbat foydalanilgan Source Only va Oracle etalonlariga bog‘liq va turli tajriba sozlamalari o‘rtasida kontekstdan uzib taqqoslanmasligi kerak.

Manbada ishlatilgan tenglama:

\[ \mathrm{Closed\ Gap} = \frac{AP_{\mathrm{model}}-AP_{\mathrm{sourceonly}}} {AP_{\mathrm{oracle}}-AP_{\mathrm{sourceonly}}} \times100\% \tag{23} \]

Nuqta buluti UDA natijalari

Quyidagi jadval manba Tables 2–4 dagi faktik qiymatlarni Verianla uchun yangi jadval tuzilishida birlashtiradi. AP ustunlarida tartib APBEV/AP3D.

Ko‘chirishDetektorSource OnlySNST3DUM3DOracleUM3D Closed Gap BEV/3D
nuScenes → KITTILoGoNet54.56/23.1547.69/32.3878.26/57.4180.17/58.2090.72/84.8770.84%/56.79%
nuScenes → KITTISECOND51.84/17.9240.03/21.2375.94/54.1376.25/54.3883.29/73.4577.62%/65.66%
WOD → KITTILoGoNet69.12/31.5979.95/62.2584.67/65.3985.71/67.4490.72/84.8776.81%/67.27%
WOD → KITTISECOND67.64/27.4878.96/59.2082.19/61.8382.96/62.7583.29/73.4597.89%/76.73%
WOD → nuScenesLoGoNet39.28/24.6540.15/26.3642.58/28.1444.10/29.5755.62/39.1829.49%/33.86%
WOD → nuScenesSECOND32.91/17.2433.23/18.5735.92/20.1936.84/23.6251.88/34.8720.72%/36.18%
WOD → LyftLoGoNet74.87/57.6174.93/57.8978.14/59.9379.06/61.2885.33/71.5240.05%/26.38%
WOD → LyftSECOND72.92/54.3472.33/54.3476.32/59.2476.14/59.1984.47/68.7827.88%/33.59%

Natijalarni bitta model/ko‘chirish juftligida mutlaq ustunlik da’vosiga kamaytirib bo‘lmaydi. Masalan, WOD → Lyft SECOND konfiguratsiyasida ST3D ning APBEV qiymati 76,32 bo‘lsa, UM3D 76,14; shu bilan birga UM3D ning AP3D qiymati 59,19, ST3D ning qiymati 59,24. Demak, ushbu konfiguratsiyada farqlar juda kichik va UM3D har bir katakda eng yuqori natijani bermaydi.

Monokulyar WOD/nuScenes/Lyft → KITTI natijalari

KITTI maqsad domenda Source Only qiymatlari tadqiqotda barcha Easy/Moderate/Hard APBEV va AP3D kataklari uchun 0 deb qayd etilgan. Quyidagi jadval STMono3D, UM3D va Oracle natijalarini ko‘rsatadi.

Ko‘chirishUsulAPBEV EasyAPBEV Mod.APBEV HardAP3D EasyAP3D Mod.AP3D Hard
nuScenes → KITTISTMono3D35.6327.3723.9528.6521.8919.55
nuScenes → KITTIUM3D36.8127.6022.9429.3722.1618.93
nuScenes → KITTIOracle33.4623.6222.1829.0119.8817.17
Lyft → KITTISTMono3D26.4620.7117.6618.1413.3211.83
Lyft → KITTIUM3D28.2321.5917.9819.3213.3511.16
Lyft → KITTIOracle33.4623.6222.1829.0119.8817.17
WOD → KITTISTMono3D35.6926.9423.1928.3420.2118.03
WOD → KITTIUM3D36.1027.6723.4829.0820.9218.84
WOD → KITTIOracle33.4623.6222.1829.0119.8817.17

Ba’zi monokulyar kataklarda UM3D ning Oracle qiymatidan oshishi ehtiyotkorlik bilan talqin qilinishi kerak. Maqoladagi Oracle maqsad domenda to‘liq nazorat ostida o‘rgatilgan tasvirga asoslangan FCOS3D dir. UM3D esa bitta kamera bilan inferensiya qilsa ham, ayni tasvirdan hosil qilgan Pseudo-LiDAR geometriyasini tasvir xususiyatlari bilan birlashtiradi va kengroq manba-domen pretraining dan foydalanadi. Shu sababli bu yerda taqqoslanayotgan ikki tizimning tasvirlash tuzilmalari bir xil emas. Bu natija “nazoratsiz o‘rganish umuman to‘liq nazorat ostidagi o‘rganishdan ustun” degani emas.

nuScenes maqsad domenidagi monokulyar natijalar

Ko‘chirishUsulmAPmATEmASEmAOE
WOD → nuScenesSource Only2.41.3020.1900.802
WOD → nuScenesSTMono3D23.50.8430.1710.349
WOD → nuScenesUM3D25.70.8200.1680.311
WOD → nuScenesOracle28.20.7980.1600.209
Lyft → nuScenesSource Only2.41.3020.1900.802
Lyft → nuScenesSTMono3D21.30.9110.1700.355
Lyft → nuScenesUM3D22.10.8980.1730.304
Lyft → nuScenesOracle28.20.7980.1600.209

mAP uchun yuqori qiymat yaxshiroq aniqlash aniqligini ifodalaydi, mATE, mASE va mAOE esa xato metrikalaridir; shuning uchun ularda pastroq qiymat afzal. WOD → nuScenes ko‘chirishida UM3D STMono3D ga nisbatan mAP ni 23,5 dan 25,7 gacha oshirgan, mATE ni 0,843 dan 0,820 gacha, mASE ni 0,171 dan 0,168 gacha va mAOE ni 0,349 dan 0,311 gacha kamaytirgan.

ORSS va PLGM ablatsiyasi

ModulDetektorAPBEVAP3D
Source OnlySECOND67.6427.48
Source OnlyLoGoNet69.1231.59
Baseline + ORSSSECOND78.2955.13
Baseline + ORSSLoGoNet79.4656.08
Baseline + PLGMSECOND81.3059.42
Baseline + PLGMLoGoNet83.2561.91
Baseline + PLGM + ORSSSECOND82.9662.75
Baseline + PLGM + ORSSLoGoNet85.7167.44

LoGoNet bazasida faqat ORSS qo‘shilishi Source Only ga nisbatan APBEV/AP3D ni 69,12/31,59 dan 79,46/56,08 gacha oshiradi. Faqat PLGM 83,25/61,91 ga erishadi. Ikki komponent birga ishlatilganda 85,71/67,44 bilan eng yuqori natija olinadi. Ushbu jadval tadqiqotdagi psevdobelgi xotirasi va obyekt masshtablash aralashuvlari bir xil vazifani takrorlamasligini, balki bir-birini to‘ldiruvchi ta’sir berishini ko‘rsatadigan asosiy ablatsiya dalilidir.

Uchdan-uchgacha qo‘shma o‘qitish ablatsiyasi

Birgalikda optimallashtirilgan tarmoqAPBEV EasyAPBEV Mod.APBEV HardAP3D EasyAP3D Mod.AP3D Hard
Depth30.2620.7117.3525.5116.0614.48
RCNN32.0122.5618.5526.7517.6915.41
RPN32.6422.8718.9426.1417.5214.34
RCNN + RPN33.8923.4219.8026.9917.1015.85
Depth + RPN35.6226.3621.1628.7419.2316.19
Depth + RCNN35.9826.7323.2029.3219.1517.41
Depth + RCNN + RPN36.1027.6723.4829.0820.9218.84

Moderate APBEV RCNN + RPN qo‘shma o‘qitishida 23,42 bo‘lsa, chuqurlik tarmog‘i ham qo‘shma optimallashtirishga qo‘shilganda 27,67 gacha oshadi. Manba mualliflari bu 4,25 ballik farqni aniqlash gradientining chuqurlikni baholashga orqaga oqishining ahamiyati bilan bog‘laydi. To‘liq uch tarmoqli tuzilma oltita AP katagining beshtasida eng yuqori qiymatga erishadi; yagona istisno Easy AP3D. Bu yerda Depth + RCNN 29,32, to‘liq tuzilma esa 29,08 natija bergan.

Tadqiqot xulosasida ko‘rsatilgan %19,30 nisbiy APBEV o‘sishi ham Easy sharoitida faqat Depth qatoridagi 30,26 bilan to‘liq Depth + RCNN + RPN qatoridagi 36,10 ni taqqoslashga mos keladi.

Sifat natijalari nimani ko‘rsatadi?

Manba 5-rasmda WOD → KITTI nuqta buluti moslashtirishi vizuallashtirilgan. Source Only model domenlararo geometrik nomuvofiqlik sababli ayrim avtomobil qutilarini sezilarli darajada kichik hosil qilishi; ST3D buni yaxshilashi; UM3D esa quti joylashuvi va o‘lchamlarini Oracle ga ko‘proq yaqinlashtirishi ko‘rinadi.

Manba 6-rasmda xuddi shu ko‘chirish monokulyar 3D ko‘rinish va BEV orqali taqqoslanadi. Source Only model 2D obyektlarni topishiga qaramay, chuqurlikni baholashdagi katta xato tufayli 3D AP deyarli nolga tushishi; STMono3D chuqurlik xatosini kamaytirishi; UM3D bashoratlari esa ko‘plab namunalarda Oracle ga ko‘proq yaqinlashishi qayd etiladi. Bu rasmlar miqdoriy jadvallar o‘rnini bosmaydi; ular faqat quti geometriyasidagi domen moslashtirish ta’sirini vizual jihatdan qo‘llab-quvvatlaydi.

Hisoblash xarajati

Bitta NVIDIA RTX 3080 da bir kadr inferensiyasi taxminan 127 ms, ya’ni 7,9 FPS deb o‘lchangan. Shundan taxminan 15,5 ms 14,5 million parametrli RSANet chuqurlik tarmog‘iga, 8,1 ms CoR va zichlikka asoslangan Pseudo-LiDAR yaratishga, 103,7 ms esa ko‘p modalli detektorga to‘g‘ri keladi. Umumiy model taxminan 60,5 million parametrni o‘z ichiga oladi. Demak, joriy amalga oshirishda bottleneck chuqurlikni baholash emas, balki 3D voxel backbone, RPN, 2D xususiyat chiqaruvchi va ikki bosqichli cross-modal fuzionni o‘z ichiga oladigan aniqlash qatlamidir.

Tadqiqot qo‘llab-quvvatlaydigan xulosalar

  • UM3D ko‘rib chiqilgan ko‘plab manba→maqsad ko‘chirishlarida Source Only va taqqoslangan UDA usullariga nisbatan samaradorlik oshishini ta’minlaydi.
  • ORSS va PLGM birga ishlatilganda WOD → KITTI ablatsiyasida ikkala detektor uchun ham eng yuqori birlashtirilgan natija olinadi.
  • Chuqurlikni baholashni aniqlash maqsadi bilan birga optimallashtirish faqat aniqlash quyi tarmoqlarini birgalikda o‘qitishga qaraganda sezilarli APBEV yutug‘ini beradi.
  • Tasvir va Pseudo-LiDAR fuzioni faqat bitta modalitetga tayanuvchi domen moslashtirishga nisbatan manba tadqiqotning markaziy dizayn ustunligidir.
  • Inferensiya bosqichida Pseudo-LiDAR ayni monokulyar tasvirdan yaratilgani uchun qo‘shimcha LiDAR sensori talab qilinmaydi.

Tadqiqot qo‘llab-quvvatlamaydigan umumlashtirishlar va cheklovlar

  • Natijalar barcha obyekt sinflari uchun teng muvaffaqiyatni isbotlamaydi; tadqiqot asosan avtomobil sinfiga qaratilgan.
  • Uzoq masofadagi aniqlash o‘z-o‘zini nazorat qiluvchi chuqurlikni baholash aniqligi bilan cheklanadi.
  • Qayd etilgan 7,9 FPS lik RTX 3080 amalga oshirishi to‘liq real vaqtli avtomobil ichidagi ishlab chiqarish tizimi tasdiqlanganini anglatmaydi; mualliflar modelni siqish va inferensiyani tezlashtirishni kelajakdagi ish sifatida ko‘rsatadi.
  • KITTI yoki nuScenes benchmark muvaffaqiyati boshqa kamera geometriyalari, ob-havo sharoitlari, mamlakatlar yoki ishlab chiqarish transport vositalari uchun xuddi shunday samaradorlikni kafolatlamaydi.
  • Ba’zi monokulyar tajribalarda Oracle dan oshish umuman nazoratsiz o‘rganish to‘liq nazorat ostidagi o‘rganishdan ustunligini ko‘rsatmaydi; taqqoslanayotgan Oracle tasvirga asoslangan FCOS3D ekani va UM3D Pseudo-LiDAR geometriyasi bilan boshqa xususiyat tasviridan foydalanishi hisobga olinishi kerak.
  • Manba \(f_l,f_w,f_h\) masshtab oraliqlarini, \(\sigma\) ning sonli qiymatini va xotira bankidagi \(Thr_i\), \(Thr_r\) chegaralarining sonli qiymatlarini qayd etmagani uchun faqat maqola matni asosida har bir tafsilot bilan qayta ishlab chiqish mumkin emas.

Manba va usul haqida izoh

Original tadqiqot: Unsupervised Domain Adaptation with Multimodal Fusion for Monocular 3D Object Detection

Mualliflar: Jin Jiang; Jidong Dai; Wei Li; Yuquan Zhou; Maozhang Ye; Jianhuan Zhang; Chentao Zhang.

Mas’ul muallif: Chentao Zhang.

Muassasalar: Xiamen King Long United Automotive Industry Co., Ltd., Xiamen, Xitoy; Pen-Tung Sah Institute of Micro-Nano Science and Technology, Xiamen University, Xiamen, Xitoy; School of Artificial Intelligence, Quanzhou Vocational College of Economics and Business, Quanzhou, Xitoy.

Jurnal: Vehicles.

Nashriyot: MDPI, Basel, Switzerland.

Bibliografik yozuv: Vehicles 2026, 8(5), 98.

DOI: 10.3390/vehicles8050098

Rasmiy DOI havolasi: https://doi.org/10.3390/vehicles8050098

Tarix: Yuborilgan 7 Mart 2026; tahrir 22 Aprel 2026; qabul 25 Aprel 2026; nashr 1 May 2026.

Manba turi: Nashr qilingan akademik tadqiqot maqolasi.

Litsenziya: Creative Commons Attribution (CC BY). Ushbu Verianla matni litsenziya mavjud bo‘lishiga qaramay, original maqolaning jumla, paragraf yoki rasm tuzilishini qayta nashr etish o‘rniga ilmiy faktlar, usullar, matematik munosabatlar va qayd etilgan ma’lumotlar asosida mustaqil o‘quv tuzilmasi sifatida tayyorlangan.

Moliyalashtirish: Major Science and Technology Special Project of Fujian Province, Grant No. 2024HZ022013; Applied Technology Engineering Center of Fujian Provincial Higher Education for Visual Perception and Intelligent Analysis, Grant No. SJGZ202501.

Ma’lumotlar mavjudligi: Mualliflar original hissalar maqola ichida mavjudligini, qo‘shimcha savollar mas’ul muallifga yo‘naltirilishi mumkinligini bildiradi.

Etik bayonotlar: Institutional Review Board va informed consent maydonlari tadqiqot uchun tatbiq etilmaydi.

Manfaatlar to‘qnashuvi: Jin Jiang va Wei Li Xiamen King Long United Automotive Industry Co., Ltd. xodimlaridir. Boshqa mualliflar tadqiqot potensial manfaatlar to‘qnashuvi sifatida talqin qilinishi mumkin bo‘lgan tijoriy yoki moliyaviy munosabatlarsiz olib borilganini bildirgan.

Muallif hissalari: Konseptuallashtirish Jin Jiang va Chentao Zhang; usul Jin Jiang va Wei Li; dasturiy ta’minot Jidong Dai; validatsiya Jidong Dai va Yuquan Zhou; formal tahlil Jidong Dai va Jianhuan Zhang; tadqiqot Jin Jiang, Wei Li va Maozhang Ye; resurslar Wei Li va Maozhang Ye; ma’lumotlar kuratsiyasi Jidong Dai va Yuquan Zhou; dastlabki qoralama Jin Jiang; ko‘rib chiqish/tahrirlash Jianhuan Zhang va Chentao Zhang; vizuallashtirish Jidong Dai va Yuquan Zhou; nazorat Jin Jiang, Jianhuan Zhang va Chentao Zhang; loyiha boshqaruvi Chentao Zhang; moliyalashtirishni olish Jin Jiang va Chentao Zhang tomonidan amalga oshirilgan.

Manba ichidagi hisobot izohi: Qisqacha mazmun va xulosa bo‘limi WOD → KITTI uchun APBEV domen farqi %76,81 gacha yopilganini bildirsa, 2-jadvalning SECOND qatori %97,89 APBEV Closed Gap qayd etadi. Manba bu farqni alohida tushuntirmagani uchun ikkala qiymat ham o‘z tajriba kontekstlari bilan saqlanishi kerak.

Metodologik chegara: Tadqiqot turli benchmark ma’lumotlar to‘plamlarida algoritmik kross-domen validatsiyasini taqdim etadi. Ushbu dalil real ishlab chiqarish transport vositasida uzoq muddatli dala xavfsizligi, barcha obyekt sinflarida umumlashtirish yoki har bir yangi sensor/geografiya kombinatsiyasida bir xil muvaffaqiyat darajasini anglatmaydi.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati