
Көзөмөлсүз монокулярдык 3D аныктоо модели UM3D (Unsupervised Monocular 3D Detection) белгиленген булак доменде үйрөнүлгөн үч өлчөмдүү аныктоо билимин максат доменге 3D куту белгилерин талап кылбастан өткөрүү үчүн өзүн-өзү көзөмөлдөгөн тереңдикти баалоону, Pseudo-LiDAR түзүүнү, сапатка сезимтал псевдобелгилөөнү жана сүрөт–чекит булуту фузиясын бирдиктүү учтан-учка үйрөнүү чынжырында бириктирген көзөмөлсүз домендик ыңгайлаштыруу алкагы болуп саналат. Изилдөө KITTI, Waymo Open Dataset (WOD), nuScenes жана Lyft маалымат топтомдорунда бааланган. UM3D өзгөчө домендик өзгөрүүдөн улам ар башка чөйрөлөр ортосунда начарлаган монокулярдык 3D аныктоо көрсөткүчүн жакшыртууну көздөйт. Чыгаруу баскычында чыныгы LiDAR талап кылынбайт; Pseudo-LiDAR көрүнүшү ошол эле монокулярдык сүрөттөн бааланган тереңдиктин негизинде системанын ичинде түзүлөт. Бирок көрсөткүч, айрыкча алыскы объекттерде, тереңдикти баалоонун тактыгы менен чектелет жана эксперименттердин негизги көңүлү автоунаа классына бурулган.
Ыкманын эки негизги кийлигишүүсү бар. Биринчиден, объект деңгээлиндеги кокустук масштабдоо булак жана максат домендердин ортосундагы унаа өлчөмдөрүнүн айырмасы алгачкы псевдобелгилерди бузушун азайтууга аракет кылат. Экинчиден, IoU негизиндеги сапат баалоосун колдонгон үч аралыктагы эс тутум банкы псевдобелгилерди бир гана ишеним упайына жараша кабыл албастан, тарыхый болжолдор менен дал келтирип, жаңыртат. Бул түзүм LoGoNet негизиндеги сүрөт–чекит булуту фузиясы жана дифференциалдануучу Change of Representation (CoR) катмары менен бириктирилип, аныктоо катасынын тереңдик тармагына чейин артка тарашына мүмкүндүк берет.
WOD → KITTI чекит булутунун домендик ыңгайлашуусунда LoGoNet негизиндеги UM3D APBEV/AP3D көрсөткүчтөрүндө 85,71/67,44 көрсөткүчүнө жеткен. Булак макаланын кыскача мазмуну жана жыйынтык бөлүмдөрү WOD → KITTI үчүн APBEV домендик айырмасынын %76,81 бөлүгү жабылганын баса белгилейт; бирок ошол эле изилдөөнүн 2-таблицасында SECOND негизиндеги UM3D үчүн %97,89 APBEV Closed Gap билдирилген. Ошондуктан %76,81 мааниси макаладагы бардык конфигурациялардын абсолюттук максимуму катары эмес, LoGoNet конфигурациясында билдирилген натыйжа катары бааланышы керек.
UM3D деген эмне жана кайсы көйгөйдү чечет?
UM3D ар башка маалымат топтомдору жана айдоо чөйрөлөрүнүн ортосундагы бөлүштүрүү өзгөрүүсү монокулярдык 3D объект аныктоодо жараткан көрсөткүч жоготуусун максат доменде чыныгы 3D куту белгилерине таянбастан азайтууга багытталган учтан-учка көзөмөлсүз домендик ыңгайлаштыруу алкагы. Система бир сүрөттөн тереңдикти чыгарат, аны Pseudo-LiDAR чекит булутуна айлантат, сапаты көзөмөлдөнгөн псевдобелгилер менен максат доменге ыңгайлашат жана сүрөт белгилери менен үч өлчөмдүү геометриялык белгилерди чогуу иштетет.
Негизги көйгөй: бир камерадан тереңдикти чыгаруу эмне үчүн кыйын?
Монокулярдык камерада бир эле эки өлчөмдүү сүрөт проекциясы ар башка үч өлчөмдүү сахна геометриялары менен шайкеш келиши мүмкүн. Башкача айтканда, сүрөт тереңдикти түздөн-түз өлчөбөйт. LiDAR физикалык аралыкты өлчөөнү камсыз кылса, монокулярдык система тереңдикти сүрөттөгү белгилерден баалоого аргасыз. Ошондуктан тереңдиктеги ката Pseudo-LiDAR чекитинин мейкиндиктеги ордун, андан соң 3D кутунун жайгашуусун, өлчөмүн же багытын бузушу мүмкүн.
Экинчи кыйынчылык — домендик өзгөрүү. Детектор бир маалымат топтомунда үйрөтүлгөндө, башка маалымат топтомундагы камера геометриясы, географиялык чөйрө, сенсор тыгыздыгы, унаалардын өлчөмдөрүнүн бөлүштүрүлүшү жана аннотация протоколдору айырмаланышы мүмкүн. Ошондуктан булак доменде күчтүү болгон модель максат доменде ошол эле көрсөткүчтү көрсөтпөшү мүмкүн.
UM3Dнин илимий архитектурасы
- Өзүн-өзү көзөмөлдөгөн абсолюттук тереңдикти баалоо: RSANet колдонулуп, монокулярдык сүрөттөн абсолюттук масштабдагы тереңдик картасы түзүлөт.
- Pseudo-LiDAR өзгөртүүсү: Пиксел координаттары жана тереңдик pinhole камера геометриясы аркылуу үч өлчөмдүү чекиттерге айландырылат.
- Тыгыздыкка негизделген аралыктык үлгүлөө: Тыгыз Pseudo-LiDAR булутунун сейрек жана тыгыз аймактарын тең салмактоого аракет жасалат.
- Сапатка сезимтал псевдобелгилөө: Объект деңгээлиндеги кокустук масштабдоо жана IoU негизиндеги үч аралыктагы эс тутум банкы колдонулат.
- Көп модалдуу фузия: Сүрөт белгилери менен Pseudo-LiDAR геометриясы LoGoNet негизиндеги эки баскычтуу фузия жана өздүк көңүл буруу салмактоосу аркылуу бириктирилет.
- Учтан-учка биргелешкен оптималдаштыруу: Дифференциалдануучу CoR катмарынын аркасында 3D аныктоо жоготуусунун градиенти тереңдикти баалоо тармагына кайра жетет.
Pseudo-LiDAR бул изилдөөдө кантип түзүлөт?
Pseudo-LiDAR монокулярдык сүрөт үчүн бааланган абсолюттук тереңдик картасындагы ар бир пикселди камеранын ички параметрлери аркылуу үч өлчөмдүү координатага кайра проекциялоо менен түзүлөт; андан соң UM3D координата системасын унаа–LiDAR окторуна айландырат, 64 сызыктуу LiDAR алуу процессин туураган бурчтук үлгүлөөнү колдонот жана жогорку тыгыздыктагы чекит булутун тыгыздыкка негизделген аралыктык үлгүлөө аркылуу суюлтат.
Сүрөт тегиздигинен үч өлчөмдүү чекитке өзгөртүү
Булак изилдөөнүн (1)-теңдемесинде сүрөттөгү (i, j) орду, абсолюттук тереңдик мааниси D(i,j) жана камеранын ички параметрлери колдонулат:
\[ x=\frac{(i-c_i)D(i,j)}{f_x},\qquad y=\frac{(j-c_j)D(i,j)}{f_y},\qquad z=D(i,j) \tag{1} \]
Бул жерде \(f_x\) жана \(f_y\) горизонталдык жана вертикалдык фокус аралыктарын; \(c_i\) жана \(c_j\) негизги чекит координаттарын көрсөтөт. \(i\), \(j\), \(f_x\), \(f_y\), \(c_i\) жана \(c_j\) сүрөт/пиксел координата системасында. \(D\) кайсы узундук масштабында берилсе, түзүлгөн \(x\), \(y\) жана \(z\) координаттары ошол эле физикалык масштабды алып жүрөт.
Камера координаттарын унаадагы LiDAR координата системасына өзгөртүү булакта төмөнкү ок дал келүүсү менен берилет:
\[ x=-z,\qquad y=-x,\qquad z=y \tag{2} \]
64 сызыктуу LiDAR алуу процессин туураш үчүн ар бир чекиттин вертикалдык бурчу жана сенсорго чейинки аралыгы эсептелет:
\[ \vartheta(n)= \arctan\left( \frac{z(n)} {\sqrt{x^2(n)+y^2(n)}} \right), \qquad l(n)=\sqrt{x^2(n)+y^2(n)+z^2(n)} \tag{3} \]
Чекиттер вертикалдык бурчу боюнча скан сызыктарына бөлүштүрүлөт, сызыктын ичинде аралык боюнча иргелет жана азимут уячаларына ажыратылат. Ар бир сызык–азимут уячасында сенсорго эң жакын чекитти сактоо бир кайтуучу LiDAR өлчөөсүн схемалык түрдө туурайт. Изилдөөдө сенсордун баштапкы чекитинен 1 m жогору жайгашкан чекиттер алынып салынганы жана чагылуу интенсивдүүлүктөрү 1 деп коюлганы айтылат.
Тыгыздыкка негизделген аралыктык үлгүлөө
Жогорку чечилиштагы тереңдик картасынан түзүлгөн Pseudo-LiDAR өтө тыгыз болушу мүмкүн. UM3D мейкиндикти \(n\) кубдук аймакка бөлөт:
\[ \Omega=\{\omega_1,\omega_2,\ldots,\omega_n\} \tag{4} \]
Ар бир \(\omega_i\) аймагындагы чекиттердин саны \(m_i\) үчүн тескери тыгыздык салмагы:
\[ k_i=\frac{1}{m_i+\sigma} \tag{5} \]
деп аныкталат. \(\sigma\) нөлгө бөлүнүүнү алдын алган кичине оң маани. Сейрек аймактардын \(k_i\) мааниси жогору болгондуктан, үлгүлөөдөгү салыштырмалуу салымы көбөйөт. Ар бир аймактан алынган үлгүлөр топтому:
\[ P_i=\{p_{i1},p_{i2},\ldots,p_{ij}\} \tag{6} \]
жана акыркы үлгүлөнгөн булут:
\[ \Gamma=\bigcup_{i=1}^{n}P_i \tag{7} \]
түрүндө түзүлөт. Булак \(\sigma\)нын сандык маанисин, кубдук аралыктардын так геометриялык өлчөмдөрүн же \(j\)нин \(k_i\)ден кайсы так үлгү саны эрежеси менен алынарын кеңири билдирбейт; бул маанилер Verianla тарабынан толукталган эмес.
Объект деңгээлиндеги кокустук масштабдоо эмне үчүн колдонулат?
Булак домендеги унаалардын физикалык өлчөмдөрүнүн бөлүштүрүлүшү максат домендеги унаалардан айырмаланса, булакта үйрөтүлгөн 3D детектор максат домендеги кутуларды системалуу түрдө туура эмес өлчөмдөшү мүмкүн. UM3Dнин Object-Level Random Scaling Strategy (ORSS) компоненти бул ыктоону азайтуу үчүн белгиленген булак-домен объекттерин жергиликтүү куту координата системасында масштабдайт.
Өлчөмү \((l,w,h)\), борбору \((u,v,d)\) жана багыты \(\omega\) болгон кутудагы чекит адегенде жергиликтүү координатага өзгөртүлөт:
\[ (p_{il},p_{iw},p_{ih})= (p_{ix}-u,p_{iy}-v,p_{iz}-d) \begin{bmatrix} \cos\omega & -\sin\omega & 0\\ \sin\omega & \cos\omega & 0\\ 0 & 0 & 1 \end{bmatrix} \tag{8} \]
Андан кийин өлчөмсүз \(f_l\), \(f_w\), \(f_h\) масштаб коэффициенттери колдонулуп, чекит кайра глобалдык координатага өткөрүлөт:
\[ (p_{ix},p_{iy},p_{iz})= (p_{il}f_l,p_{iw}f_w,p_{ih}f_h) \begin{bmatrix} \cos\omega & \sin\omega & 0\\ -\sin\omega & \cos\omega & 0\\ 0 & 0 & 1 \end{bmatrix} +(u,v,d) \tag{9} \]
Булак макала \(f_l\), \(f_w\) жана \(f_h\) үчүн колдонулган кокустук үлгүлөө аралыктарын сандык түрдө бербейт. Ошондуктан бул параметрлердин бөлүштүрүлүшү же чектери бул жерде божомолдонгон эмес.
Псевдобелгинин сапаты кантип көзөмөлдөнөт?
UM3D детекторго кошулган IoU регрессия башы аркылуу болжолдонгон 3D кутунун сапат упайын үйрөнөт. Булакта сапат жоготуусу бинардык кайчылаш энтропия түрүндө берилет:
\[ L_{\mathrm{quality}} =-(1-\hat{s})\log(1-s)-\hat{s}\log(s) \tag{10} \]
\(s\) моделдин куту үчүн болжолдогон IoU сапат маанисин; \(\hat{s}\) болсо болжол кутусунун чыныгы куту же псевдобелги менен эсептелген IoU маанисин билдирет.
Ишке ашырууда оң босого \(Thr_p=0.5\), терс босого \(Thr_n=0.2\) деп берилген. \(s_i>Thr_p\) болгон кутулар оң үлгү катары эс тутумга алынат; \(Thr_n<s_i<Thr_p\) аралыгындагы кутулар окутууда эске алынбай турган аймактарды көрсөтүү үчүн эс тутумда сакталат; \(s_i<Thr_n\) болгондору алынып салынат.
Тарыхый псевдобелгилер топтому \(H\) жана учурдагы топтом \(C\) үчүн 3D IoU:
\[ \mathrm{IoU}(H,C)= \frac{\cap_{H,C}}{\cup_{H,C}} \tag{11} \]
аркылуу эсептелип, ар бир тарыхый куту үчүн эң күчтүү учурдагы дал келүү тандалат:
\[ \mathrm{optimum}(H,C) = \underset{C}{\arg\max}\, |\mathrm{IoU}(H,C)| \tag{12} \]
Дал келбеген тарыхый кутулар үчүн эсептегич механизми колдонулат:
\[ \mathrm{state}= \begin{cases} 1, & \mathrm{counter}(H)\lt Thr_i\\ 0, & Thr_i\leq \mathrm{counter}(H)\lt Thr_r\\ -1, & \mathrm{counter}(H)\geq Thr_r \end{cases} \tag{13} \]
\(\mathrm{state}=1\) эс тутумда сактоону, \(\mathrm{state}=0\) эске албоону, \(\mathrm{state}=-1\) болсо өчүрүүнү билдирет. Булак \(Thr_i\) жана \(Thr_r\) босоголорун концептуалдык түрдө аныктайт, бирок ишке ашыруу деталдарында алардын сандык маанилерин билдирбейт. Ал эми учурдагы–тарыхый псевдобелгилерди дал келтирүүдө колдонулган IoU босогосу 0,1 деп көрсөтүлгөн.
Сүрөт жана Pseudo-LiDAR белгилери кантип бириктирилет?
UM3Dнин көп модалдуу детектору LoGoNet архитектурасына негизделет. Чекит булуту voxel түзүмүнө айландырылып, 3D backbone жана Region Proposal Network (RPN) тарабынан иштетилет. Ошол эле учурда алдын ала үйрөтүлгөн 2D детектор монокулярдык сүрөттөн сүрөт белгилерин чыгарат.
LoGoNetтин эки фузия баскычы сакталат. Сунуш аймагынан тышкаркы фузия voxel борборлорун сүрөт тегиздигине проекциялап, глобалдык геометриялык түзүлүштү байланыштырат. Сунуш аймагынын ичиндеги фузия болсо ар бир сунуштун жергиликтүү деталдарын кайчылаш көңүл буруу менен иштетет. Изилдөө өзгөрткөн бөлүк — бул эки чыгууну жөн гана бириктирүүнүн ордуна өздүк көңүл бурууга негизделген салмакталган белгилерди топтоо.
\[ F=[F_{\mathrm{out}};F_{\mathrm{in}}], \qquad Q=W_QF,\quad K=W_KF,\quad V=W_VF \tag{14} \]
Бул жерде \(F_{\mathrm{out}}\) аймактан тышкаркы, \(F_{\mathrm{in}}\) аймак ичиндеги фузия белгиси. \(W_Q\), \(W_K\) жана \(W_V\) үйрөнүлүүчү проекция матрицалары. Масштабдалган чекиттик көбөйтүү көңүл буруусу:
\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax} \left( \frac{QK^\top}{\sqrt{d_k}} \right)V \tag{15} \]
түрүндө. \(d_k\) ачкыч векторлорунун өлчөмү. Математикалык жактан механизм ар бир белги позициясынын башка белги позициялары менен байланышын салмактап, классификация жана куту регрессиясы үчүн тандалма бириккен көрүнүш түзөт.
Дифференциалдануучу CoR эмне үчүн маанилүү?
Классикалык voxelizация чекиттин уячанын ичинде бар же жок экенин 0 же 1 менен билдирет. Бул кескин чечим координата өзгөрүүсүндөгү майда өзгөрүүлөргө карата үзгүлтүктүү болгондуктан, тереңдик тармагына артка тарай турган градиентти токтотушу мүмкүн. UM3D E2E-PLден алынган Change of Representation (CoR) ыкмасын тыгыздыкка негизделген үлгүлөө менен бирге колдонот жана voxel толуктугун жумшак RBF салмактары менен билдирет.
Бир \(u\) уячасындагы \(P_u\) чекиттери үчүн:
\[ W(u) = \frac{1}{|P_u|} \sum_{p\in P_u} e^{-\|p-p_c\|_2^2/\delta^2} \tag{16} \]
жана кошуна уячалар \(\Upsilon_u\) эске алынганда:
\[ T_{\mathrm{softquantization}}(u) = W(u)+ \frac{1}{|\Upsilon_u|} \sum_{\bar{u}\in\Upsilon_u} W(\bar{u}) \tag{17} \]
алынат. \(p_c\) voxel борбору; \(\delta\) RBF тилке кеңдиги менен байланыштуу. Эксперименттик жөндөөлөрдө \(\delta^2=0.01\) жана 26 кошуналуу 3×3×3 жумшартуу өзөгү колдонулган. Бул жумшак көрүнүштүн негизги алгоритмдик функциясы — аныктоо катасынын чекит көрүнүшү аркылуу тереңдик тармагына артка тарашын камсыз кылуу.
Жалпы үйрөнүү максаты
Учтан-учка жалпы жоготуу:
\[ L=\alpha L_{\mathrm{depth}}+\beta L_{\mathrm{detection}} \tag{18} \]
түрүндө. Эксперименттерде \(\alpha=1\) жана \(\beta=0.01\) колдонулган.
Булакта тереңдик жоготуусу (19)-теңдеме менен төмөнкүдөй берилет:
\[ L_{\mathrm{depth}} = \min_{t'} p_e(I_t,I_{t'\rightarrow t})L_p +\mu L_{\mathrm{smooth}} \tag{19} \]
Фотометрикалык компонент жана жылмакайлык компоненти:
\[ L_p=\sum_{t'}\ell(I_t,I_{t'\rightarrow t}) \tag{20} \]
\[ L_{\mathrm{smooth}} = |\nabla_x d_t^*|e^{-|\nabla_x I_t|} + |\nabla_y d_t^*|e^{-|\nabla_y I_t|} \tag{21} \]
түрүндө. \(d_t^*\) нормалдаштырылган тескери тереңдикти, \(\nabla_x\) жана \(\nabla_y\) горизонталдык жана вертикалдык градиенттерди көрсөтөт. Жылмакайлык салмагы эксперименттерде \(\mu=0.001\).
Аныктоо жоготуусу:
\[ L_{\mathrm{detection}} = L_{\mathrm{RPN}} + L_{\mathrm{conf}} + \lambda L_{\mathrm{reg}} \tag{22} \]
деп берилет. \(L_{\mathrm{RPN}}\) аймак сунуштоо тармагынын жоготуусу, \(L_{\mathrm{conf}}\) ишеним/болжол жоготуусу жана \(L_{\mathrm{reg}}\) куту регрессия жоготуусу. Эксперименттерде \(\lambda=2.0\) колдонулган.
Үч баскычтуу окутуу логикасы
- Булак доменди алдын ала окутуу: Чыныгы белгиленген булак-домен чекит булуту маалыматтары менен IoU баштуу детектор ORSS колдонулуп алдын ала үйрөтүлөт.
- Максат доменде өзүн-өзү окутуу: Максат доменде болжол кутулары жана IoU сапат упайлары түзүлөт; үч аралыктагы эс тутум банкы жаңыртылып, псевдобелгилер менен окутуу улантылат.
- Учтан-учка монокулярдык биргелешкен оптималдаштыруу: Сүрөттөн тереңдик түзүлөт, дифференциалдануучу CoR менен Pseudo-LiDAR алынат, псевдобелгилер жаңыртылат жана тереңдик → CoR → көп модалдуу аныктоо чынжыры бир жалпы жоготуу астында чогуу оптималдаштырылат.
Изилдөөнүн Ыкмасы жана Жыйынтыктары
Ишке ашыруу деталдары
| Элемент | Булакта билдирилген маани |
|---|---|
| Максат-домен self-training optimizer | Adam |
| Self-training үйрөнүү ылдамдыгы | 0.0015 |
| Self-training узактыгы | 40 epoch |
| Псевдобелги жаңыртуу | Ар epoch |
| Учтан-учка кирүү/чыгуу чечилиши | 1024 × 320 |
| Framework | PyTorch 1.10.0 |
| Учтан-учка optimizer | Adam |
| Баштапкы үйрөнүү ылдамдыгы | 0.001 |
| Үйрөнүү ылдамдыгын азайтуу | Ар 10 epoch сайын ×0.1 |
| Учтан-учка окутуу | 30 epoch |
| \(\alpha\) | 1 |
| \(\beta\) | 0.01 |
| \(\mu\) | 0.001 |
| \(\lambda\) | 2.0 |
| RBF | \(\delta^2=0.01\) |
| Жумшартуу коңшулугу | 26 коңшу, 3×3×3 |
| \(Thr_p\) | 0.5 |
| \(Thr_n\) | 0.2 |
| Эс тутум банкынын IoU дал келтирүү босогосу | 0.1 |
Маалымат топтомдору жана баалоо аймагы
| Маалымат топтому | Булакта берилген камтуу | Изилдөөдөгү ролу |
|---|---|---|
| KITTI | 7481 окутуу, 7518 тест үлгүсү; Easy/Moderate/Hard баалоосу | Маанилүү максат домендердин бири |
| Waymo Open Dataset (WOD) | 798 окутуу, 202 текшерүү, 150 тест ырааттуулугу | Булак домен / маалымат топтомдор аралык өткөрүү |
| nuScenes | 1000 сахна; Boston жана Сингапур | Булак же максат домен |
| Lyft | 55.000 дан ашык аннотацияланган кадр | Булак же максат домен |
Бардык маалымат топтомдору үчүн аныктоо аймагы \(X/Y\in[-75.2,75.2]\) m жана \(Z\in[-2,4]\) m деп белгиленген. SECOND жана LoGoNet үчүн voxel өлчөмү \((0.1,0.1,0.15)\) m. Маалыматты көбөйтүү глобалдык кокустук масштабдоону, айлантууну, жылдырууну жана ар бир объект боюнча масштабдоо/айлантууну камтыйт.
Closed Gap метрикасы эмнени билдирет?
Closed Gap булак доменде үйрөтүлүп максат доменге түз колдонулган модель менен максат доменде толук көзөмөлдө үйрөтүлгөн Oracle ортосундагы көрсөткүч айырмасынын домендик ыңгайлаштыруу ыкмасы тарабынан канчасы жабылганын пайыз менен билдирет; маани жогорулаган сайын ыңгайлаштырылган модель Oracle көрсөткүчүнө жакындайт, бирок катыш колдонулган Source Only жана Oracle эталондоруна көз каранды жана ар башка эксперименттик түзүлүштөрдүн ортосунда контексттен ажыратылып салыштырылбашы керек.
Булакта колдонулган теңдеме:
\[ \mathrm{Closed\ Gap} = \frac{AP_{\mathrm{model}}-AP_{\mathrm{sourceonly}}} {AP_{\mathrm{oracle}}-AP_{\mathrm{sourceonly}}} \times100\% \tag{23} \]
Чекит булуту UDA натыйжалары
Төмөнкү таблица булак Tables 2–4төгү фактылык маанилерди Verianla үчүн жаңы таблица түзүмүндө бириктирет. AP мамычаларындагы тартип APBEV/AP3D.
| Өткөрүү | Детектор | Source Only | SN | ST3D | UM3D | Oracle | UM3D Closed Gap BEV/3D |
|---|---|---|---|---|---|---|---|
| nuScenes → KITTI | LoGoNet | 54.56/23.15 | 47.69/32.38 | 78.26/57.41 | 80.17/58.20 | 90.72/84.87 | 70.84%/56.79% |
| nuScenes → KITTI | SECOND | 51.84/17.92 | 40.03/21.23 | 75.94/54.13 | 76.25/54.38 | 83.29/73.45 | 77.62%/65.66% |
| WOD → KITTI | LoGoNet | 69.12/31.59 | 79.95/62.25 | 84.67/65.39 | 85.71/67.44 | 90.72/84.87 | 76.81%/67.27% |
| WOD → KITTI | SECOND | 67.64/27.48 | 78.96/59.20 | 82.19/61.83 | 82.96/62.75 | 83.29/73.45 | 97.89%/76.73% |
| WOD → nuScenes | LoGoNet | 39.28/24.65 | 40.15/26.36 | 42.58/28.14 | 44.10/29.57 | 55.62/39.18 | 29.49%/33.86% |
| WOD → nuScenes | SECOND | 32.91/17.24 | 33.23/18.57 | 35.92/20.19 | 36.84/23.62 | 51.88/34.87 | 20.72%/36.18% |
| WOD → Lyft | LoGoNet | 74.87/57.61 | 74.93/57.89 | 78.14/59.93 | 79.06/61.28 | 85.33/71.52 | 40.05%/26.38% |
| WOD → Lyft | SECOND | 72.92/54.34 | 72.33/54.34 | 76.32/59.24 | 76.14/59.19 | 84.47/68.78 | 27.88%/33.59% |
Натыйжалар бир эле модель/өткөрүү жупунда абсолюттук артыкчылык дооматына түшүрүлбөшү керек. Мисалы, WOD → Lyft SECOND конфигурациясында ST3Dнин APBEV мааниси 76,32 болсо, UM3D 76,14; ошол эле учурда UM3Dнин AP3D мааниси 59,19, ST3Dнин мааниси 59,24. Демек бул конфигурацияда айырмачылыктар өтө аз жана UM3D ар бир уячада эң жогорку натыйжаны бербейт.
Монокулярдык WOD/nuScenes/Lyft → KITTI натыйжалары
KITTI максат доменинде Source Only маанилери изилдөөдө бардык Easy/Moderate/Hard APBEV жана AP3D уячалары үчүн 0 деп билдирилген. Төмөнкү таблица STMono3D, UM3D жана Oracle натыйжаларын көрсөтөт.
| Өткөрүү | Ыкма | APBEV Easy | APBEV Mod. | APBEV Hard | AP3D Easy | AP3D Mod. | AP3D Hard |
|---|---|---|---|---|---|---|---|
| nuScenes → KITTI | STMono3D | 35.63 | 27.37 | 23.95 | 28.65 | 21.89 | 19.55 |
| nuScenes → KITTI | UM3D | 36.81 | 27.60 | 22.94 | 29.37 | 22.16 | 18.93 |
| nuScenes → KITTI | Oracle | 33.46 | 23.62 | 22.18 | 29.01 | 19.88 | 17.17 |
| Lyft → KITTI | STMono3D | 26.46 | 20.71 | 17.66 | 18.14 | 13.32 | 11.83 |
| Lyft → KITTI | UM3D | 28.23 | 21.59 | 17.98 | 19.32 | 13.35 | 11.16 |
| Lyft → KITTI | Oracle | 33.46 | 23.62 | 22.18 | 29.01 | 19.88 | 17.17 |
| WOD → KITTI | STMono3D | 35.69 | 26.94 | 23.19 | 28.34 | 20.21 | 18.03 |
| WOD → KITTI | UM3D | 36.10 | 27.67 | 23.48 | 29.08 | 20.92 | 18.84 |
| WOD → KITTI | Oracle | 33.46 | 23.62 | 22.18 | 29.01 | 19.88 | 17.17 |
Айрым монокулярдык уячаларда UM3Dнин Oracle маанисинен ашышы этият чечмелениши керек. Макаладагы Oracle максат доменде толук көзөмөлдө үйрөтүлгөн сүрөткө негизделген FCOS3D. UM3D болсо бир камера менен чыгаруу жасаганына карабай, ошол эле сүрөттөн алынган Pseudo-LiDAR геометриясын сүрөт белгилери менен бириктирет жана кеңири булак-домен алдын ала окутуусунан пайдаланат. Ошондуктан бул жерде салыштырылган эки системанын көрүнүш түзүмдөрү бирдей эмес. Бул натыйжа «көзөмөлсүз үйрөнүү жалпысынан толук көзөмөлдөгү үйрөнүүдөн жогору» дегенди билдирбейт.
nuScenes максат домениндеги монокулярдык натыйжалар
| Өткөрүү | Ыкма | mAP | mATE | mASE | mAOE |
|---|---|---|---|---|---|
| WOD → nuScenes | Source Only | 2.4 | 1.302 | 0.190 | 0.802 |
| WOD → nuScenes | STMono3D | 23.5 | 0.843 | 0.171 | 0.349 |
| WOD → nuScenes | UM3D | 25.7 | 0.820 | 0.168 | 0.311 |
| WOD → nuScenes | Oracle | 28.2 | 0.798 | 0.160 | 0.209 |
| Lyft → nuScenes | Source Only | 2.4 | 1.302 | 0.190 | 0.802 |
| Lyft → nuScenes | STMono3D | 21.3 | 0.911 | 0.170 | 0.355 |
| Lyft → nuScenes | UM3D | 22.1 | 0.898 | 0.173 | 0.304 |
| Lyft → nuScenes | Oracle | 28.2 | 0.798 | 0.160 | 0.209 |
mAP үчүн жогору маани жакшыраак аныктоо тактыгын билдирсе, mATE, mASE жана mAOE ката метрикалары; ошондуктан аларда төмөн маани артык. WOD → nuScenes өткөрүүсүндө UM3D STMono3Dге салыштырмалуу mAPти 23,5 маанисинен 25,7 маанисине жогорулатып, mATEни 0,843 маанисинен 0,820 маанисине, mASEни 0,171 маанисинен 0,168 маанисине жана mAOEни 0,349 маанисинен 0,311 маанисине төмөндөткөн.
ORSS жана PLGM абляциясы
| Модуль | Детектор | APBEV | AP3D |
|---|---|---|---|
| Source Only | SECOND | 67.64 | 27.48 |
| Source Only | LoGoNet | 69.12 | 31.59 |
| Baseline + ORSS | SECOND | 78.29 | 55.13 |
| Baseline + ORSS | LoGoNet | 79.46 | 56.08 |
| Baseline + PLGM | SECOND | 81.30 | 59.42 |
| Baseline + PLGM | LoGoNet | 83.25 | 61.91 |
| Baseline + PLGM + ORSS | SECOND | 82.96 | 62.75 |
| Baseline + PLGM + ORSS | LoGoNet | 85.71 | 67.44 |
LoGoNet негизинде ORSS гана кошулганда Source Onlyге салыштырмалуу APBEV/AP3D 69,12/31,59 көрсөткүчүнөн 79,46/56,08 көрсөткүчүнө көтөрүлөт. PLGM гана 83,25/61,91 көрсөткүчүнө жетет. Эки компонентти чогуу колдонуу 85,71/67,44 менен эң жогорку натыйжаны берет. Бул таблица изилдөөдөгү псевдобелги эс тутуму менен объект масштабдоо кийлигишүүлөрү бир эле функцияны кайталабай, бири-бирин толуктаган таасир бергенин көрсөткөн негизги абляциялык далил.
Учтан-учка биргелешкен окутуунун абляциясы
| Биргелешип оптималдаштырылган тармак | APBEV Easy | APBEV Mod. | APBEV Hard | AP3D Easy | AP3D Mod. | AP3D Hard |
|---|---|---|---|---|---|---|
| Depth | 30.26 | 20.71 | 17.35 | 25.51 | 16.06 | 14.48 |
| RCNN | 32.01 | 22.56 | 18.55 | 26.75 | 17.69 | 15.41 |
| RPN | 32.64 | 22.87 | 18.94 | 26.14 | 17.52 | 14.34 |
| RCNN + RPN | 33.89 | 23.42 | 19.80 | 26.99 | 17.10 | 15.85 |
| Depth + RPN | 35.62 | 26.36 | 21.16 | 28.74 | 19.23 | 16.19 |
| Depth + RCNN | 35.98 | 26.73 | 23.20 | 29.32 | 19.15 | 17.41 |
| Depth + RCNN + RPN | 36.10 | 27.67 | 23.48 | 29.08 | 20.92 | 18.84 |
Moderate APBEV RCNN + RPN биргелешкен окутуусунда 23,42 болсо, тереңдик тармагы да биргелешкен оптималдаштырууга кошулганда 27,67 маанисине көтөрүлөт. Булак авторлору бул 4,25 упайлык айырманы аныктоо градиентинин тереңдикти баалоого артка агышынын мааниси менен байланыштырат. Толук үч тармактуу түзүм алты AP уячасынын бешөөсүндө эң жогорку мааниге жетет; жалгыз өзгөчө учур — Easy AP3D. Бул жерде Depth + RCNN 29,32, толук түзүм 29,08 берет.
Изилдөөнүн кыскача мазмунунда көрсөтүлгөн %19,30 салыштырмалуу APBEV өсүшү да Easy шартында Depth сабындагы 30,26 менен толук Depth + RCNN + RPN сабындагы 36,10 маанисин салыштырууга туура келет.
Сапаттык натыйжалар эмнени көрсөтөт?
Булак 5-сүрөттө WOD → KITTI чекит булутунун ыңгайлашуусу көрсөтүлөт. Source Only модели домендер аралык геометриялык шайкешсиздиктен улам айрым унаа кутуларын байкаларлык кичине түзгөнү; ST3D муну жакшыртканы; UM3D болсо кутунун ордун жана өлчөмдөрүн Oracleга көбүрөөк жакындатканы көрүнөт.
Булак 6-сүрөттө ошол эле өткөрүү монокулярдык 3D көрүнүш жана BEV аркылуу салыштырылат. Source Only модели 2D объекттерди тапканына карабай, тереңдикти баалоодогу чоң катадан улам 3D AP дээрлик нөлгө түшкөнү; STMono3D тереңдик катасын азайтканы; UM3D болжолдору болсо көп мисалдарда Oracleга көбүрөөк жакындаганы билдирилет. Бул сүрөттөр сандык таблицаларды алмаштырбайт; алар куту геометриясындагы домендик ыңгайлашуу таасирин гана визуалдык түрдө колдойт.
Эсептөө наркы
Бир NVIDIA RTX 3080 түзмөгүндө бир кадрдын чыгарылышы болжол менен 127 ms, башкача айтканда 7,9 FPS деп өлчөнгөн. Мунун болжол менен 15,5 msи 14,5 миллион параметрлүү RSANet тереңдик тармагына, 8,1 msи CoR жана тыгыздыкка негизделген Pseudo-LiDAR түзүүгө, 103,7 msи көп модалдуу детекторго туура келет. Жалпы модель болжол менен 60,5 миллион параметрди камтыйт. Демек учурдагы ишке ашырууда тар жер тереңдикти баалоо эмес, 3D voxel backbone, RPN, 2D белги чыгаруучу жана эки баскычтуу кайчылаш-модалдуу фузияны камтыган аныктоо катмары.
Изилдөө колдогон жыйынтыктар
- UM3D каралган көптөгөн булак→максат өткөрүүлөрүндө Source Only жана салыштырылган UDA ыкмаларына караганда көрсөткүч өсүшүн камсыз кылат.
- ORSS жана PLGM чогуу колдонулганда WOD → KITTI абляциясында эки детектор үчүн тең эң жогорку бириккен натыйжа алынат.
- Тереңдикти баалоону аныктоо максаты менен бирге оптималдаштыруу аныктоо подтармактарын гана чогуу окутууга караганда олуттуу APBEV өсүшүн берет.
- Сүрөт жана Pseudo-LiDAR фузиясы бир эле модалдуулукка таянган домендик ыңгайлаштырууга каршы булак изилдөөнүн борбордук дизайн артыкчылыгы.
- Чыгаруу баскычында Pseudo-LiDAR ошол эле монокулярдык сүрөттөн түзүлгөндүктөн кошумча LiDAR сенсору талап кылынбайт.
Изилдөө колдобогон жалпылоолор жана чектөөлөр
- Натыйжалар бардык объект класстары үчүн бирдей ийгиликти далилдебейт; изилдөө негизинен автоунаа классына багытталган.
- Алыскы аралыкта аныктоо өзүн-өзү көзөмөлдөгөн тереңдикти баалоонун тактыгы менен чектелет.
- Билдирилген 7,9 FPS RTX 3080 ишке ашыруусу толук реалдуу убакыттагы унаа ичиндеги өндүрүш системасы текшерилгенин билдирбейт; авторлор моделди кысууну жана чыгарууну тездетүүнү келечектеги иш катары белгилешет.
- KITTI же nuScenes benchmark ийгилиги башка камера геометриялары, аба ырайы, өлкөлөр же өндүрүш унаалары үчүн ошол эле көрсөткүчкө кепилдик бербейт.
- Айрым монокулярдык эксперименттерде Oracleдан ашуу көзөмөлсүз үйрөнүү жалпысынан толук көзөмөлдөгү үйрөнүүдөн жогору экенин көрсөтпөйт; салыштырылган Oracle сүрөткө негизделген FCOS3D экени жана UM3D Pseudo-LiDAR геометриясы менен башка белги көрүнүшүн колдонору эске алынышы керек.
- Булак \(f_l,f_w,f_h\) масштаб аралыктарын, \(\sigma\)нын сандык маанисин жана эс тутум банкындагы \(Thr_i\), \(Thr_r\) босоголорунун сандык маанилерин билдирбегендиктен, макаланын тексти гана аркылуу ар бир деталын кайра өндүрүү мүмкүн эмес.
Булак жана Ыкма Жөнүндө Эскертүү
Түпнуска изилдөө: Unsupervised Domain Adaptation with Multimodal Fusion for Monocular 3D Object Detection
Авторлор: Jin Jiang; Jidong Dai; Wei Li; Yuquan Zhou; Maozhang Ye; Jianhuan Zhang; Chentao Zhang.
Жооптуу автор: Chentao Zhang.
Мекемелер: Xiamen King Long United Automotive Industry Co., Ltd., Xiamen, Кытай; Pen-Tung Sah Institute of Micro-Nano Science and Technology, Xiamen University, Xiamen, Кытай; School of Artificial Intelligence, Quanzhou Vocational College of Economics and Business, Quanzhou, Кытай.
Журнал: Vehicles.
Басма: MDPI, Basel, Switzerland.
Библиографиялык жазуу: Vehicles 2026, 8(5), 98.
DOI: 10.3390/vehicles8050098
Расмий DOI шилтемеси: https://doi.org/10.3390/vehicles8050098
Тарых: Жөнөтүлгөн 7 март 2026; ревизия 22 апрель 2026; кабыл алынган 25 апрель 2026; жарыяланган 1 май 2026.
Булак түрү: Жарыяланган академиялык изилдөө макаласы.
Лицензия: Creative Commons Attribution (CC BY). Бул Verianla тексти лицензия бар болгонуна карабастан, түпнуска макаланын сүйлөм, абзац же сүрөт түзүлүшүн кайра жарыялоонун ордуна илимий фактылар, ыкмалар, математикалык байланыштар жана билдирилген маалыматтар негизинде өз алдынча окутуучу түзүм катары даярдалган.
Каржылоо: Major Science and Technology Special Project of Fujian Province, Grant No. 2024HZ022013; Applied Technology Engineering Center of Fujian Provincial Higher Education for Visual Perception and Intelligent Analysis, Grant No. SJGZ202501.
Маалыматтардын жеткиликтүүлүгү: Авторлор түпнуска салымдар макаланын ичинде бар экенин, кошумча суроолор жооптуу авторго жөнөтүлүшү мүмкүн экенин билдиришет.
Этикалык билдирүүлөр: Institutional Review Board жана informed consent талаалары изилдөө үчүн колдонулбайт.
Кызыкчылыктардын кагылышы: Jin Jiang жана Wei Li Xiamen King Long United Automotive Industry Co., Ltd. кызматкерлери. Башка авторлор изилдөө мүмкүн болгон кызыкчылыктардын кагылышы катары чечмелене турган коммерциялык же каржылык мамилелерсиз жүргүзүлгөнүн билдиришкен.
Автордук салымдар: Концептуалдаштыруу Jin Jiang жана Chentao Zhang; ыкма Jin Jiang жана Wei Li; программалык камсыздоо Jidong Dai; текшерүү Jidong Dai жана Yuquan Zhou; формалдык талдоо Jidong Dai жана Jianhuan Zhang; изилдөө Jin Jiang, Wei Li жана Maozhang Ye; ресурстар Wei Li жана Maozhang Ye; маалыматтарды курациялоо Jidong Dai жана Yuquan Zhou; алгачкы долбоор Jin Jiang; карап чыгуу/редакциялоо Jianhuan Zhang жана Chentao Zhang; визуалдаштыруу Jidong Dai жана Yuquan Zhou; көзөмөл Jin Jiang, Jianhuan Zhang жана Chentao Zhang; долбоорду башкаруу Chentao Zhang; каржылоону алуу Jin Jiang жана Chentao Zhang тарабынан жүргүзүлгөн.
Булак ичиндеги отчеттук эскертүү: Кыскача мазмун жана жыйынтык бөлүмү WOD → KITTI үчүн APBEV домендик айырмасы %76,81ге чейин жабылганын билдирсе, 2-таблицанын SECOND сабы %97,89 APBEV Closed Gap билдирет. Булак бул айырманы өзүнчө түшүндүрбөгөндүктөн, эки маани тең өз эксперименттик контексттери менен сакталышы керек.
Методологиялык чек: Изилдөө ар башка benchmark маалымат топтомдорунда алгоритмдик кросс-домен текшерүүсүн сунуштайт. Бул далил реалдуу өндүрүш унаасында узак мөөнөттүү талаа коопсуздугун, бардык объект класстарында жалпыланууну же ар бир жаңы сенсор/география айкалышында бирдей ийгилик деңгээлин билдирбейт.

Пикир калтырыңыз
E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген