Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Muhandislik / Sanoat Nuqta Bulutlarida Vizual Asoslash Orqali Zero-Shot 3B Aktivlarni Aniqlash va Joylashtirish
Muhandislik

Sanoat Nuqta Bulutlarida Vizual Asoslash Orqali Zero-Shot 3B Aktivlarni Aniqlash va Joylashtirish

Ushbu tadqiqot amaldagi CAD modeli yoki sanoat aktivlariga oid katta belgilangan o‘quv ma’lumotlar to‘plami mavjud bo‘lmagan obyektlarda faqat bitta 3B nuqta bulutidan uskunalarni aniqlash va ularning taxminiy fazoviy joylashuvini belgilashga qaratilgan zero-shot doirani taklif qiladi.

19/08/2026  Veri Anla 34 marta ko‘rildi
Sanoat Nuqta Bulutlarida Vizual Asoslash Orqali Zero-Shot 3B Aktivlarni Aniqlash va Joylashtirish

Ushbu tadqiqot amaldagi CAD modeli yoki sanoat aktivlariga oid katta belgilangan o‘quv ma’lumotlar to‘plami mavjud bo‘lmagan obyektlarda faqat bitta 3B nuqta bulutidan uskunalarni aniqlash va ularning taxminiy fazoviy joylashuvini belgilashga qaratilgan zero-shot doirani taklif qiladi. Tizim nuqta bulutini to‘g‘ridan-to‘g‘ri 3B obyekt detektoriga berish o‘rniga avval virtual kameralar yordamida turli balandlik va yaqinlashtirish darajalarida sahna tasvirlarini hosil qiladi. Tasvirlar GPT-4o yordamida semantik jihatdan talqin qilinadi, hosil qilingan obyekt tavsiflari Grounding DINO-ga uzatiladi, 2B bounding box-lar aniqlanadi va depth hamda kamera parametrlaridan foydalanib natijalar yana 3B mahalliy koordinata tizimiga ko‘chiriladi. Ruxsat etilgan nuqtalar yetarli bo‘lmagan holatlarda tizim obyektning tasvirdagi kattaligi, kadrdan chiqib ketishi va boshqa obyektlar bilan ustma-ust tushishi kabi mezonlardan foydalanib kamerani qayta joylashtiradi va tasvirni yana hosil qiladi.

Melburndagi murakkab bir plant room-dan Leica BLK360 lazer skaneri bilan olingan 271.348.287 nuqtali ma’lumotlar ustida taklif etilgan usul, xuddi shu vizual asoslash infratuzilmasi bilan baholangan OpenIns3D boshlang‘ichidagi AP25 qiymatini 35,84-dan 48,13-ga, AP50 qiymatini 26,89-dan 34,98-ga oshirdi. Ayniqsa, boshlang‘ich tizim AP25-da umuman aniqlay olmagan gas/oil burner sinfi taklif etilgan tizimda 41,3 AP25-ga yetdi; electrical kit, control panel, fire extinguisher va boshqa ayrim sinflarda ham sezilarli o‘sishlar qayd etildi. 3B lokalizatsiya jadvalida 11 aktiv uchun alohida Yevklid joylashuv xatolari 0,105 bilan 0,312 metr oralig‘ida o‘zgaradi. Biroq natijalar faqat bitta sanoat muhitida olingan va usul yuqori aniqlikdagi geometrik qayta tiklash tizimi sifatida emas, balki aktivlar inventarizatsiyasi, raqamli egizakning boshlang‘ich qatlami, masofaviy monitoring va inspeksiya rejalashtirish kabi taxminiy fazoviy ma’lumot yetarli bo‘lgan foydalanish ssenariylari uchun baholangan.

Sanoat obyektlarida 3B aktivlarni aniqlash nega qiyin?

Asosiy muammo faqat “nuqta bulutida obyekt topish” emas. Sanoat obyektlarida nasoslar, klapanlar, baklar, elektr panellari, duct tizimlari, zinapoyalar, burner-lar va zich quvur tarmoqlari turli o‘lchamlarda, turli balandliklarda va ko‘pincha bir-birini to‘sadigan tarzda joylashadi. Uskunaning old tomoni ko‘rinib turganda boshqa tomoni quvurlar yoki devor bilan to‘silishi mumkin; kichik klapan keng burchakli sahna tasvirida bir necha pikselgacha kichrayib ketishi mumkin.

Klassik nazoratli 3B obyekt aniqlash usullari bu muammoni katta va belgilangan ma’lumotlar to‘plamlari bilan hal qilishga urinadi. Biroq muayyan sanoat obyektiga xos uskunalar xilma-xilligi sababli bunday ma’lumotlar to‘plamlarini yaratish qimmat va ko‘p vaqt talab qiladi. Standart avtonom haydash yoki ichki makon ma’lumotlar to‘plamlarida avtomobil, piyoda, stul va stol kabi sinflar mavjud bo‘lsa, plant room-dagi gas/oil burner yoki maxsus electrical kit kabi uskunalar odatda ifodalanmaydi.

Shu sabab tadqiqotning asosiy savoli quyidagicha: faqat mavjud nuqta bulutidan, obyektga xos belgilangan modelni o‘qitmasdan, sanoat aktivlarini aniqlab, ularni 3B joylashuvga qayta joylashtirish mumkinmi?

Bu yerda “zero-shot” aynan nimani anglatadi?

Tadqiqotda zero-shot atamasi taklif etilgan tizim uchun yangi sanoat obyektiga xos belgilangan o‘quv ma’lumotlar to‘plami tayyorlanmaganini anglatadi. GPT-4o va Grounding DINO kabi oldindan o‘qitilgan foundation modellari qo‘llanadi.

Demak, tizim “hech narsani o‘rganmagan” emas. U avvaldan katta ma’lumotlarda o‘qitilgan modellardan foydalanadi; nol bo‘lgan narsa ushbu plant room-dagi uskunalarni aniqlash uchun bajarilgan domain-specific supervised training jarayonidir.

Bundan tashqari, GPT-4o tasvirlardagi obyektlarni tadqiqotda belgilangan oldindan belgilangan sanoat aktivlari lug‘atidan qidiradi. Shu sabab amaliy darajadagi zero-shot qobiliyati oldindan belgilangan sanoat sinflari va foundation model bilimining birikmasi sifatida tushunilishi kerak.

Usul nega nuqta bulutini to‘g‘ridan-to‘g‘ri tasniflamaydi?

Tadqiqotchilarning yondashuvi kuchli 2B vision–language modellarining vizual tushunish qobiliyatidan foydalanish uchun 3B nuqta bulutini turli virtual kameralardan 2B sahna tasvirlariga aylantirishdan iborat.

Bu dizaynning mantiqi quyidagicha:

  1. Nuqta bulutiga virtual kameralar joylashtiriladi.
  2. Ushbu kameralardan 2B sahna tasvirlari va depth map-lar render qilinadi.
  3. Foundation modellar tasvirlarda qaysi sanoat aktivlari borligini aniqlaydi.
  4. 2B aniqlashlar tasvirning depth ma’lumoti va kamera parametrlaridan foydalanib yana 3B sahnaga proyeksiya qilinadi.

Shu sabab tadqiqot “2B yoki 3B” o‘rtasida tanlov qilmaydi; 3B geometrik ma’lumotni 2B foundation-model vizual tushunishi bilan bitta pipeline-da birlashtiradi.

Besh bosqichli tizim qanday ishlaydi?

Maqolaning asosiy usuli besh asosiy bosqichdan iborat:

  1. Virtual Camera Positioning: Virtual kameralarni sanoat sahnasining mos hududlari va turli balandliklariga joylashtirish.
  2. Image Generation: Nuqta bulutidan turli ko‘rish va zoom darajalarida sahna tasvirlarini hosil qilish.
  3. Visual Grounding: GPT-4o bilan semantik aniqlash va Grounding DINO bilan 2B bounding box hosil qilish.
  4. Recognition-Aware Refinement: Yetarli ko‘rinmagan obyektlar uchun kamera parametrlarini avtomatik qayta sozlash va tasvirni qayta render qilish.
  5. Asset Localisation: 2B aniqlashlarni depth, intrinsics va extrinsics yordamida mahalliy 3B koordinatalarga qaytarish.

Tadqiqot metod sxemasining muhim xususiyati shundaki, to‘rtinchi bosqich bir yo‘nalishli jarayon emas. Tanib olish sifati past bo‘lsa, kamera qayta sozlanadi va yangi tasvirlar yaratiladi. Shunday qilib, obyekt detektori faqat unga berilgan tasvir bilan cheklanib qolmaydi, tizim obyekt yaxshiroq ko‘rinadigan yangi ko‘rish nuqtasini yaratishga harakat qiladi.

Virtual kameralar nega turli balandliklarda joylashtiriladi?

OpenIns3D-ning keng burchakli qat’iy sahna ko‘rinishlari oddiyroq ichki makonlarda yetarli bo‘lishi mumkin; biroq sanoat plant room-da shiftga yaqin ko‘plab quvur tarmoqlari pastdagi uskunalarni to‘sib qo‘yishi mumkin. Xuddi shuningdek, baland uskuna faqat past kameradan qaralganda to‘liq ko‘rinmasligi mumkin.

Shu sabab taklif etilgan yondashuv kameralarni bitta balandlikda ushlab turmaydi. Yuqori balandlik chegarasi ko‘tarilib baland uskunalarning, pastki chegara o‘zgartirilib pol darajasidagi uskunalarning turli burchaklardan ko‘rinishi oshiriladi.

Biroq tadqiqot bu o‘zgaruvchan balandlik strategiyasining hissasini alohida ablation tajribasi bilan o‘lchamaydi. Shuning uchun manbada “multi-height kamera joylashuvi o‘zi X AP berdi” shaklidagi raqam yo‘q.

Normal, medium va close-up zoom nega birga ishlatiladi?

Sanoat sahnasida bak bilan kichik klapan bir xil fizik masshtabga ega emas. Bitta qat’iy zoom darajasi ishlatilganda yoki umumiy sahna yo‘qoladi, yoki kichik uskunalarning vizual tafsilotlari yetarli bo‘lmay qoladi.

Tadqiqot bu muammoni:

  • normal,
  • medium,
  • close-up

bo‘lgan uch masshtabli zoom mexanizmi bilan hal qiladi. Shu orqali bir sahnaning ham umumiy konteksti, ham kichik uskuna tafsilotlari foundation modelga ko‘rsatilishi mumkin.

Devorni olib tashlash nimani anglatadi?

Bu yerda fizik obyektning devorini yo‘q qilish nazarda tutilmaydi. Nuqta buluti render qilinayotganda tashqi chegara devorlari ma’lum bir threshold yordamida tasvir yaratishdan chiqarib tashlanadi. Maqsad tashqi devor ortida yoki unga yaqin joylashgan aktivlarni virtual kameralar ko‘ra olishini ta’minlashdir.

Maqoladagi devorni olib tashlashdan oldingi/keyingi taqqoslashlar devor bilan to‘silgan pump va tank kabi uskunalar virtual tasvirlarda ko‘proq ko‘rinadigan bo‘lishi mumkinligini ko‘rsatadi.

Qaysi sahna tasviri “yaxshi” ekaniga qanday qaror qilinadi?

Dastlab render qilingan nomzod tasvirlar teng deb qabul qilinmaydi. Har bir tasvir uchun ikki mezon hisoblanadi:

  • Edge density: Canny edge detection-dan keyin tasvirdagi chekka piksellar ulushi.
  • Texture variance: kulrang darajadagi piksel intensivliklarining dispersiyasi.

Manbada tasvir skori:

\[ score_i= 0.6\times\text{edge density} + 0.4\times\text{texture variance} \]

deb ta’riflanadi.

Eng yuqori skor olgan nomzod tasvirning intrinsic kamera parametrlari keyingi ko‘rishlarni yaratishda qayta ishlatiladi. Bu yerda maqsad geometrik va tekstura ma’lumotlariga boyroq tasvir parametrini tanlashdir.

Depth-based filtering nima qiladi?

Tasvir vizual tarzda yaratilgan bo‘lsa ham, uning katta qismi bo‘sh, occluded yoki haqiqiy 3B sirt ma’lumotiga ega bo‘lmasligi mumkin. Shu sabab har bir render-ning depth map-i baholanadi.

Ko‘rinish darajasi:

\[ V= \frac{|D_{\mathrm{valid}}|}{|D|} \]

deb ta’riflanadi. \(D_{\mathrm{valid}}\) haqiqiy depth qiymatiga ega piksellarni, \(D\) esa barcha tasvir piksellarini ifodalaydi.

Faqat:

\[ V\geq\sigma \]

shartini qanoatlantiruvchi tasvirlar saqlanadi.

Tadqiqotning past va yuqori ko‘rinishli misollarida past sifatli ko‘rinishlarning depth map-larida faqat kichik va uzilib qolgan rangli hududlar ko‘rinsa, yuqori ko‘rinishda depth xaritasi zichroq va uzluksizroq bo‘ladi. Ushbu filtrlash keyingi 3B qayta proyeksiyaning to‘liq bo‘lmagan geometriyadan ta’sirlanishini kamaytirishga qaratilgan.

GPT-4o va Grounding DINO nega birga ishlatiladi?

Pipeline-dagi ikki modelning vazifalari turlicha.

GPT-4o render qilingan sahna tasvirini semantik jihatdan tahlil qiladi va tadqiqotda oldindan belgilangan sanoat aktivlari lug‘atidan ko‘rinadigan obyektlarni aniqlaydi. Har bir namuna uchun:

  • aktiv kategoriyasi,
  • namuna soni,
  • tasvirdagi taxminiy joy,
  • nisbiy kattalik,
  • ko‘rinish va kontekst tavsifi

hosil qiladi.

Bu bosqichda hali aniq bounding box yo‘q.

Grounding DINO esa GPT-4o yaratgan tabiiy til tavsifini visual grounding prompt-ga aylantirib, tegishli obyekt uchun axis-aligned 2B bounding box hosil qiladi.

Bir sinfga mansub bir nechta obyekt mavjud bo‘lganda prompt-ga joylashuv va kattalik ma’lumoti qo‘shilib, namunalarni bir-biridan ajratish ko‘zda tutiladi.

Nega Grounding DINO yolg‘iz o‘zi yetarli deb topilmadi?

Tadqiqotning sifat jihatidan taqqoslashida ODISE va YOLO-World murakkab sanoat aktivlarining katta qismini o‘tkazib yuborgan. Grounding DINO yaxshiroq lokalizatsiya bergan bo‘lsa-da, ayrim maxsus uskuna sinflarida yolg‘iz o‘zi cheklangan.

2-rasmda, ayniqsa uchinchi misoldagi gas oil burner va control panel GPT-4o + Grounding DINO kombinatsiyasi tomonidan aniqlangan, boshqa taqqoslangan modellar esa ularni o‘tkazib yuborgan. Pump sinfining turli ko‘rishlarda qayta aniqlanishi ham taklif etilgan kombinatsiya sahna kontekstidan foydalana olgan misollardan biridir.

Recognition-aware viewpoint refinement nega kerak?

Ko‘p sonli kamera va zoom darajasini yaratish ham har bir obyekt yaxshi ko‘rinishini kafolatlamaydi. Obyekt:

  • tasvirda juda kichik bo‘lib qolishi mumkin,
  • chekkada kesilib qolishi mumkin,
  • boshqa obyektlar bilan to‘silishi mumkin,
  • nomos burchakdan ko‘rinishi mumkin.

Tadqiqotning farqi shundaki, u ushbu muvaffaqiyatsizliklarni o‘lchab, kameraga qayta aloqa sifatida uzatadi.

Obyektning tasvirdagi kattaligi qanday o‘lchanadi?

Manbada projected area ratio uchun quyidagi ifoda bosilgan:

\[ A_i= \frac{ (x_2-x_1)-(y_2-y_1) }{ W\cdot H }. \]

\((x_1,y_1,x_2,y_2)\) bounding box koordinatalarini, \(W,H\) esa tasvir kengligi va balandligini ifodalaydi.

Manbaga sodiqlik izohi: Maqola buni “projected area ratio” deb ta’riflasa-da, kenglik va balandlikni ko‘paytirish o‘rniga ular orasida ayirish belgisi bosilgan. Verianla matni formulani standart to‘g‘ri to‘rtburchak yuzi formulasiga yashirincha o‘zgartirmaydi; manbadagi ko‘rinish aynan saqlanadi.

Obyektning kadrdan chiqishi qanday tekshiriladi?

Truncation indicator:

\[ T_i= \begin{cases} 1, & x_1\leq\delta \ \text{veya}\ y_1\leq\delta \ \text{veya}\ x_2\geq W-\delta \ \text{veya}\ y_2\geq H-\delta,\\ 0, & \text{aksi durumda} \end{cases} \]

deb ta’riflanadi.

Obyektning bounding box-i tasvir chetlariga belgilangan \(\delta\) marjasidan ham yaqin kelsa, ko‘rish “truncated” deb belgilanadi.

View suitability skori qanday hisoblanadi?

Obyekt masshtabi va truncation birgalikda:

\[ J_{\mathrm{view},i} = \beta\ln(1+A_i)-\gamma T_i \]

ifodasiga aylantiriladi.

Kattaroq va tasvir ichiga to‘liq sig‘gan obyekt yuqoriroq moslik skori beradi, kadrdan chiqib ketgan obyekt esa jazolanadi.

Zich sahnalarda ustma-ust tushgan qutilar qanday hisobga olinadi?

Bir ko‘rishdagi bounding box juftlarining IoU qiymatlari hisoblanib, ma’lum:

\[ \tau_{\mathrm{IoU}} \]

chegaradan yuqori bo‘lgan juftlar ulushidan clutter score \(C_v\) olinadi.

Yuqori \(C_v\) ko‘p sonli obyektlar tasvirda ustma-ust tushganini va ko‘rish grounding uchun mos bo‘lmasligi mumkinligini bildiradi.

Kamerani qayta sozlash qachon ishga tushadi?

Manbaga ko‘ra:

  • \(A_i<\tau_A\): obyekt juda kichik → zoom-in yoki kamera masofasini kamaytir.
  • \(T_i=1\): obyekt kadrdan chiqmoqda → field of view-ni kengaytir yoki kamerani siljit.
  • \(J_{\mathrm{view},i}<\tau_J\): ko‘rish burchagi yetarli emas → yaw/pitch-ni o‘zgartir.
  • \(C_v>\tau_C\): sahna juda zich → balandlik yoki kamera yo‘nalishini o‘zgartir.

Ustuvorlik shuningdek:

\[ S_i= w_1\max(0,\tau_A-A_i) + w_2\max(0,\tau_J-J_{\mathrm{view},i}) + w_3T_i \]

severity score bilan belgilanadi.

Field of view va kamera pozasi qanday o‘zgartiriladi?

Manbada fokus masofasi yangilanishi:

\[ f'_x= f_z \left( 1-\frac{\Delta FOV}{100} \right), \qquad f'_y= f_y \left( 1-\frac{\Delta FOV}{100} \right) \]

deb bosilgan.

Biroq undan keyingi matnda boshlang‘ich focal length-lar:

\[ f_x,\;f_y \]

deb ta’riflanadi va \(f_z\) izohlanmaydi. Shu sabab \(f'_x\) tenglamasidagi \(f_z\) manba ichidagi notatsiya nomuvofiqligi yoki tipografik xato bo‘lishi mumkin. Manbada bo‘lmagan tuzatish kiritilmagan.

Kamera yo‘nalishi:

\[ P'= P\cdot R_{\mathrm{yaw}}(\theta) \cdot R_{\mathrm{pitch}}(\phi) \]

bilan o‘zgartiriladi, radial kamera harakati esa:

\[ p'_{\mathrm{cam}} = p_{\mathrm{scene}} + (1+\Delta r) \frac{ p_{\mathrm{cam}}-p_{\mathrm{scene}} }{ \|p_{\mathrm{cam}}-p_{\mathrm{scene}}\| } \]

shaklida beriladi.

2B bounding box qanday qilib yana 3B joylashuvga aylanadi?

Visual grounding obyektni tasvirda topadi; biroq raqamli egizak uchun obyekt zavod koordinatasida qayerda turganini bilish kerak.

Tasvir pikseli:

\[ (u,v) \]

va unga mos depth:

\[ d \]

ma’lum bo‘lsa, kamera koordinatasi:

\[ P_C= K^{-1} [u,v,1]^T d \]

bilan hisoblanadi.

Keyin kamera extrinsic parametrlaridan foydalanib:

\[ P_L= R P_C+t \]

transformatsiyasi qo‘llanadi.

Bu yerda \(P_L\) obyektning mahalliy plant coordinate system ichidagi 3B joylashuvidir.

Bu yondashuv 3B CAD modelining o‘rnini to‘liq bosadimi?

Yo‘q. Tadqiqotning muhokama bo‘limi buni aniq cheklaydi. Taklif etilgan usul high-precision geometric reconstruction maqsadi uchun ishlab chiqilmagan.

Maqsad qilingan foydalanish misollari:

  • asset inventory yaratish,
  • brownfield raqamli egizagini boshlash uchun asosiy fazoviy qatlam yaratish,
  • inspection planning,
  • remote monitoring,
  • aktivlarning taxminiy fazoviy munosabatlarini aniqlash

kabi vazifalardir.

Shu sabab olingan koordinatalarni ishlab chiqarish toleransi yoki aniq reverse engineering o‘lchovi sifatida talqin qilish manba tomonidan qo‘llab-quvvatlanmaydi.

Turkiya nuqtayi nazaridan bu nimani anglatadi?

Usul ayniqsa amaldagi BIM/CAD modeli yetishmaydigan brownfield obyektlarini nishonga olgani uchun Turkiyadagi uzoq yillardan beri ishlayotgan ishlab chiqarish korxonalari, energetika obyektlari yoki murakkab mexanik xonalar uchun tadqiq etishga arzigulik yondashuv bo‘lishi mumkin. Biroq tadqiqot Melburnda faqat bitta plant room-da o‘tkazilgan.

Turkiyadagi obyekt uchun ayni AP yoki joylashuv xatolari olinadi, deb aytib bo‘lmaydi. Mahalliy tekshiruvda nuqta buluti zichligi, skanerlash sifati, obyektning aktiv sinflari, quvurlar zichligi, kichik komponentlar o‘lchami va foundation model tegishli uskuna terminologiyasini taniydimi-yo‘qmi alohida sinovdan o‘tkazilishi kerak.

Tadqiqot qo‘llab-quvvatlaydigan xulosalar

  • Bitta sanoat nuqta bulutidan, obyektga xos belgilangan o‘quv ma’lumotlar to‘plamini tayyorlamasdan 3B aktivlarni aniqlash va taxminiy lokalizatsiya qilish ushbu tajriba muhitida mumkinligini ko‘rsatadi.
  • Taklif etilgan to‘liq pipeline ayni taqqoslashda OpenIns3D boshlang‘ichidan yuqoriroq AP25 va AP50 bergan.
  • Devorni olib tashlash, multiple zoom va recognition-aware refinement bosqichlarini kumulyativ qo‘shish ishlash ko‘rsatkichini bosqichma-bosqich oshirgan.
  • GPT-4o + Grounding DINO kombinatsiyasi ko‘rib chiqilgan sanoat tasvirlarida sinovdan o‘tkazilgan boshqa visual grounding variantlariga qaraganda yaxshiroq sifatli aniqlashlarni ko‘rsatgan.
  • Recognition-aware refinement qo‘shilishi 2-jadvaldagi eng katta yakuniy AP o‘sishini bergan.
  • 11 aktivni mahalliy koordinata tizimiga qayta proyeksiya qilish natijasida 0,105–0,312 m oralig‘ida alohida 3B lokalizatsiya xatolari qayd etilgan.
  • ±%10 parametr sezgirligi tahlilida ishlatilgan barcha perturbation-lar AP25-ni pasaytirgan; ayniqsa \(\tau_J\) threshold eng yuqori sezgirlikni ko‘rsatgan.

Tadqiqot qo‘llab-quvvatlamaydigan yoki sinovdan o‘tkazmagan xulosalar

  • Barcha sanoat obyektlarida bir xil ishlash ko‘rsatishi sinovdan o‘tkazilmagan.
  • Turli mamlakatlar, sanoat tarmoqlari yoki skaner tizimlarida cross-site generalisation tajribasi bajarilmagan.
  • Yuqori aniqlikdagi CAD/reverse-engineering sifatidagi geometrik qayta tiklash ko‘rsatilmagan.
  • “Zero-shot” natijalar foundation models-siz olinmagan; obyektga xos yangi supervised training bajarilmagan.
  • Har qanday mutlaqo noma’lum aktiv kategoriyasi cheksiz tarzda kashf qilinishi ko‘rsatilmagan; GPT-4o bosqichida oldindan belgilangan sanoat aktivlari lug‘ati ishlatiladi.
  • AP farqlarining statistik ahamiyatliligi uchun takroriy tajriba, confidence interval yoki gipoteza testi hisobot qilinmagan.
  • Variable-height camera positioning ta’siri boshqa yaxshilanishlardan mustaqil ablation qatorida o‘lchanmagan.
  • Point-cloud downsampling ta’siri miqdoriy jihatdan sinovdan o‘tkazilmagan.
  • Prompt variantlarining ishlashga ta’siri tizimli robustness tajribasi bilan o‘lchanmagan.

Tadqiqot Usuli va Natijalari

Tajriba muhiti

Baholash Melburndagi bir bino ichida joylashgan murakkab plant room-da o‘tkazilgan.

Tajriba komponentiManbada berilgan ma’lumot
3B skanerLeica BLK360
Jami nuqtalar soni271.348.287
Nuqta bulutini qayta ishlashCloudCompare v2.13.2
GPU2 × NVIDIA L40, har biri 48 GB VRAM
CPU resursi16 vCPU
Tizim xotirasi241 GB
Operatsion tizimUbuntu 20.04
Foundation modelGPT-4o, gpt-4o-2024-11-20
2B groundingGrounding DINO

OpenIns3D bilan to‘liq tizim natijalari

AktivOpenIns3D AP25Taklif etilgan AP25OpenIns3D AP50Taklif etilgan AP50
O‘rtacha35,8448,1326,8934,98
Cabinet44,658,340,242,8
Control Panel52,365,443,349,2
Electrical Kit18,335,17,820,3
Gas/Oil Burner041,3024,4
Ladder74,376,150,951,2
Pump16,121,36,415,9
Tank78,880,468,169,8
Valve33,436,427,629,1
Duct7,310,706,2
Fire Extinguisher33,356,324,640,9

Eng katta farq gas/oil burner sinfida ko‘rinadi. OpenIns3D boshlang‘ichi AP25 va AP50-da 0 bergan bo‘lsa, taklif etilgan framework mos ravishda 41,3 va 24,4 qiymatlarga erishgan.

Electrical kit uchun AP25 18,3-dan 35,1-ga, AP50 7,8-dan 20,3-ga; fire extinguisher uchun AP25 33,3-dan 56,3-ga va AP50 24,6-dan 40,9-ga oshgan.

Biroq har bir sinfda bir xil miqdordagi o‘sish kuzatilmaydi. Masalan, tank va ladder allaqachon boshlang‘ich usulda kuchli sinflar bo‘lgan va ularning o‘sishi cheklanganroq. Bu tizimning asosiy afzalligi ayniqsa murakkab, kichik, to‘silgan yoki foundation model uchun qiyinroq aktivlarda namoyon bo‘lishi mumkinligini ko‘rsatadi; biroq bu talqin faqat ushbu test sahnasiga tegishli.

Bosqichma-bosqich yaxshilanishlarning ta’siri

Verianla Live: Ko‘rishlarni yaratish va refinement bosqichlarining AP ishlashiga ta’siri

Grafik ayni tadqiqot va ayni baholash protokolida boshlang‘ich OpenIns3D tizimiga qo‘shilgan yaxshilanishlarning kumulyativ AP25 va AP50 natijalarini ko‘rsatadi.

KonfiguratsiyaAP25AP50
OpenIns3D boshlang‘ichi35,8426,89
+ Devorni olib tashlash38,2227,10
+ Multiple zoom + devorni olib tashlash42,6328,82
+ Multiple zoom + devorni olib tashlash + recognition-aware refinement48,1334,98
 

Verianla Live: Manba tadqiqotining 2-jadval ma’lumotlari ishlatilgan. Qiymatlar kumulyativ konfiguratsiyalarni ko‘rsatadi; har bir komponentning mustaqil marginal ta’siri sifatida talqin qilinmasligi kerak.

Devorni olib tashlash boshlang‘ich AP25 qiymatini 35,84-dan 38,22-ga oshirgan bo‘lsa, AP50 faqat 26,89-dan 27,10-ga ko‘tarilgan.

Multiple zoom qo‘shilganda AP25 42,63, AP50 28,82 bo‘lgan.

Yakuniy recognition-aware refinement bosqichi bilan AP25:

\[ 42{,}63\rightarrow48{,}13 \]

va AP50:

\[ 28{,}82\rightarrow34{,}98 \]

darajasiga ko‘tarilgan.

2-jadval boshlang‘ichdan yakungacha umumiy farqni AP25 uchun 12,29, AP50 uchun 8,09 deb beradi. Bular boshlang‘ich va yakuniy AP qiymatlarining arifmetik farqlaridir.

Recognition-aware refinement parametrlari qanchalik sezgir?

Manbaning asosiy parametrlar to‘plami:

ParametrStandart qiymat
\(\delta\)10 px
\(\beta\)1,0
\(\gamma\)0,3
\(\tau_A\)0,01
\(\tau_J\)0,1
\(\tau_{\mathrm{IoU}}\)0,3
\(\tau_C\)0,15

Har bir parametr alohida ±%10 o‘zgartirilganda qayd etilgan AP25 farqlari quyidagicha:

Parametr−%10 uchun ΔAP25+%10 uchun ΔAP25
Image boundary margin \(\delta\)−0,09−0,11
Area contribution weight \(\beta\)−0,10−0,14
Truncation penalty \(\gamma\)−0,09−0,12
Minimum projected area \(\tau_A\)−0,10−0,11
View suitability threshold \(\tau_J\)−0,65−0,55
IoU overlap threshold \(\tau_{\mathrm{IoU}}\)−0,06−0,08
View clutter threshold \(\tau_C\)−0,05−0,06

Barcha perturbation-larning manfiy bo‘lishi mualliflar tanlagan asosiy konfiguratsiya ushbu mahalliy oraliqda sinab ko‘rilgan eng yaxshi nuqta ekanini ko‘rsatadi. Eng sezilarli sezgirlik:

\[ \tau_J \]

view suitability threshold-da kuzatiladi. Bunga qarshi, clutter modelini belgilovchi \(\tau_{\mathrm{IoU}}\) va \(\tau_C\) o‘zgarishlari kichikroq ta’sir ko‘rsatgan.

3B lokalizatsiya xatolari qaysi darajada?

Tadqiqot lokalizatsiya qilingan 11 aktiv uchun ground-truth koordinatasi bilan aniqlangan joy o‘rtasidagi 3B Yevklid masofasini alohida-alohida hisobot qiladi:

Aktiv ID3B mutlaq lokalizatsiya xatosi (m)
10,180
20,121
30,122
40,202
50,162
60,227
70,312
80,135
90,114
100,105
110,174

Qayd etilgan eng past xato 0,105 m, eng yuqori xato 0,312 m. Manba bu jadval uchun alohida o‘rtacha lokalizatsiya xatosi metrikasini hisobot qilmaydi; natijalarni alohida aktivlar bo‘yicha ko‘rsatadi.

Mualliflar bu aniqlik darajasini aniq geometrik reverse engineering uchun emas, balki keng ko‘lamli ekspluatatsiya va texnik xizmat dasturlarida aktivning mavjudligi, taxminiy geometrik qamrovi va fazoviy munosabatlarini aniqlash uchun yetarli deb hisoblaydi.

Point cloud zichligi nega hanuz muhim?

Zero-shot foundation model ishlatilishi kirish geometriyasining sifatini ahamiyatsiz qilib qo‘ymaydi. Manba point-cloud fidelity aniqlash ko‘rsatkichiga bevosita ta’sir qilishi mumkinligini ta’kidlaydi.

Moderate down-sampling hisoblash xarajatini kamaytirishi mumkinligi haqida sifat kuzatuvlari bor, ammo haddan tashqari point reduction kichik valve va duct kabi obyektlarning nozik geometriyasini yo‘qotishi mumkin.

Biroq tadqiqot down-sampling nisbati bilan AP yoki lokalizatsiya xatosi o‘rtasida miqdoriy tajriba bermaydi.

Hisoblash xarajati qanchalik muhim?

271 milliondan ortiq nuqtali katta sahnalardan yuqori aniqlikdagi ko‘plab virtual tasvirlar yaratish hisoblash jihatidan qimmat. Tadqiqotchilar katta point cloud-larni kichikroq hududlarga bo‘lib yukni kamaytirishni taklif qiladilar.

Buning ham narxi bor: bo‘linish chegaralaridagi geometrik kontekst va fazoviy ma’lumot yo‘qolishi mumkin. Shu sabab masshtablanuvchanlik faqat GPU qo‘shish emas, balki sahnani qanday bo‘lish masalasini ham hal qilishni talab qiladi.

Prompt engineering nega cheklov?

GPT-4o va Grounding DINO-ga yuboriladigan prompt-dagi so‘z tanlovi, tafsilot darajasi va ifoda usuli natijalarni o‘zgartirishi mumkin. Manba prompt engineering-ni ochiq cheklov sifatida ko‘rsatadi.

Kelajak tadqiqotlar uchun takliflardan biri retrieval-augmented generation yordamida aktiv ma’lumotini tashqi knowledge base-dan olish va prompt-ni kontekstga qarab avtomatik boyitishdir.

Tadqiqotning kelajak yo‘nalishlari

Maqola uch asosiy sohani ajratib ko‘rsatadi:

  1. Spatial zoning: IFC ma’lumot modellari va knowledge graph yordamida katta sanoat nuqta bulutlarini mazmunli fazoviy zonalarga ajratish.
  2. Adaptive image rendering: Kichik valve/flange kabi aktivlar uchun yuqori sifat, katta aktivlar uchun tejamkorroq rendering ishlatish.
  3. RAG qo‘llab-quvvatlagan prompt engineering: Sanoat aktivlari bilimini retrieval orqali prompt-ga dinamik qo‘shish.

Eng muhim metodologik cheklovlar

  • Baholash faqat bitta sanoat plant room-da o‘tkazilgan.
  • Aktiv va muhit xilma-xilligining turli obyektlarga ko‘chirilishi tajribada ko‘rsatilmagan.
  • Chang, namlik, yoritish, sensor noise va occlusion kabi turli dala sharoitlari point-cloud sifatini o‘zgartirishi mumkin.
  • Katta point cloud rendering yuqori hisoblash xarajatiga ega.
  • Point-cloud segmentatsiyasi hudud chegaralarida ma’lumot yo‘qotilishiga olib kelishi mumkin.
  • Kichik va maxsus sanoat uskunalarini aniqlash hanuz qiyin.
  • Prompt engineering natijaga sezilarli ta’sir qiladi.
  • Down-sampling ta’siri miqdoriy baholanmagan.
  • AP farqlari uchun uncertainty yoki statistik ahamiyatlilik tahlili berilmagan.

Manba va Usul Haqida Izoh

To‘liq asl tadqiqot nomi: Zero-Shot 3D Asset Detection and Localisation Through Visual Grounding in Industrial Point Clouds

Mualliflar: Masoud Kamali; Behnam Atazadeh; Abbas Rajabifard; Yiqun Chen.

Teng birinchi/teng hissa: Manbada teng birinchi muallif yoki teng hissa bayonoti mavjud emas.

Mas’ul muallif: Behnam Atazadeh.

Muassasa: The Centre for Spatial Data Infrastructures and Land Administration, Department of Infrastructure Engineering, The University of Melbourne, Melbourne, Victoria, Australia.

Manba turi: Taqrizdan o‘tgan original tadqiqot maqolasi; kompyuter ko‘rishi, 3B sahnani tushunish va sanoat aktivlarini lokalizatsiya qilish tadqiqoti.

Jurnal: AI.

Nashriyot: MDPI, Basel, Shveysariya.

Bibliografik yozuv: AI, 2026, Jild 7, Son 6, Maqola 205.

DOI: 10.3390/ai7060205.

Qabul qilindi / qayta ko‘rib chiqildi / qabul qilindi / nashr: 2 Mart 2026 / 18 May 2026 / 26 May 2026 / 5 Iyun 2026.

Taqriz holati: Taqrizdan o‘tgan jurnal nashri.

Litsenziya: Creative Commons Attribution (CC BY).

Academic Editors: Miguel Angel Cazorla; Emanuele Frontoni.

Asosiy tadqiqot muammosi: Belgilangan sanoat o‘quv ma’lumotlar to‘plami yoki amaldagi CAD modeli mavjud bo‘lmagan murakkab sanoat muhitlarida faqat point cloud ma’lumotidan zero-shot aktiv aniqlash va taxminiy 3B lokalizatsiya.

Kirish ma’lumoti: Leica BLK360 bilan olingan 271.348.287 nuqtali sanoat point cloud.

Asosiy usul: Virtual camera positioning → image generation → GPT-4o semantic interpretation → Grounding DINO visual grounding → recognition-aware camera refinement → depth/intrinsic/extrinsic asosidagi 3B asset localisation.

Foundation model: GPT-4o, manbada `gpt-4o-2024-11-20` versiya yorlig‘i bilan ko‘rsatilgan.

Visual grounding modeli: Grounding DINO.

Baseline: OpenIns3D; nazoratli taqqoslashda GPT-4o + Grounding DINO visual grounding konfiguratsiyasi baseline va taklif etilgan usulda izchil qo‘llangan.

Asosiy detection natijasi: O‘rtacha AP25 35,84-dan 48,13-ga, AP50 26,89-dan 34,98-ga oshgan.

Incremental natija: OpenIns3D → wall removal → multiple zoom + wall removal → recognition-aware refinement ketma-ketligida AP25 35,84 → 38,22 → 42,63 → 48,13 va AP50 26,89 → 27,10 → 28,82 → 34,98.

Lokalizatsiya baholashi: Ground-truth-ga nisbatan 11 aktivning 3B Yevklid joylashuv xatolari alohida ko‘rsatilgan va 0,105–0,312 m oralig‘ida bo‘lgan.

Parametr sezgirligi: Recognition-aware refinement parametrlari ±%10 o‘zgartirilgan; barcha perturbation-lar AP25-da pasayish keltirib chiqargan va eng sezgir parametr \(\tau_J\) view suitability threshold bo‘lgan.

Uskuna: 2 × NVIDIA L40 48 GB VRAM; 16 vCPU; 241 GB RAM.

Operatsion tizim: Ubuntu 20.04.

Point-cloud dasturi: CloudCompare v2.13.2.

Moliyalashtirish: Australian Research Council, IH210100048 va DE220100094 raqamli grantlar.

Ma’lumotlar mavjudligi: Tadqiqotda ishlatilgan ma’lumotlar kengroq va davom etayotgan tadqiqot/ishlab chiqish loyihasi sabab mas’ul muallifdan asosli so‘rov orqali olinishi mumkinligi bildirilgan.

Etika qo‘mitasi: Qo‘llanmaydi.

Xabardor rozilik: Qo‘llanmaydi.

Manfaatlar to‘qnashuvi: Mualliflar manfaatlar to‘qnashuvi yo‘qligini bildirgan.

Minnatdorchilik: University of Melbourne Research Computing Services va Petascale Campus Initiative ko‘magidan tashqari Emerson va Rockfield sanoat hamkorlarining ko‘magi qayd etilgan; mualliflar maqoladagi qarashlar o‘zlariga tegishli ekanini ham alohida bildirgan.

Muallif hissalari: Konseptuallashtirish M.K. va B.A.; metodologiya M.K., B.A. va Y.C.; dasturiy ta’minot M.K.; tekshirish M.K. va B.A.; formal tahlil M.K.; tadqiqot M.K., B.A. va Y.C.; resurslar M.K., B.A. va Y.C.; ma’lumotlar kuratsiyasi M.K.; dastlabki qoralama M.K.; ko‘rib chiqish va tahrir barcha mualliflar; vizualizatsiya M.K.; nazorat B.A., A.R. va Y.C.; loyiha boshqaruvi A.R. va Y.C.; moliyalashtirishni jalb qilish B.A. va A.R. tomonidan bajarilgan.

Manba ichidagi formula va hisobot izohlari

Recognition-aware refinement bo‘limidagi projected-area formulasi manbada:

\[ A_i= \frac{(x_2-x_1)-(y_2-y_1)}{W H} \]

deb yozilgan. “Maydon nisbati” tavsifi bilan matematik ifoda o‘rtasida ehtimoliy nomuvofiqlik mavjud; Verianla matnida u standart bounding-box maydoni formulasiga yashirincha o‘zgartirilmagan.

Xuddi shuningdek, field-of-view yangilanishida \(f'_x\) uchun \(f_z\) ishlatilgan, lekin izoh \(f_x,f_y\)-ni boshlang‘ich focal length-lar deb ta’riflaydi. Manba \(f_z\)-ni bu kontekstda izohlamaydi.

2-jadval boshlang‘ich va yakuniy usul o‘rtasidagi AP25 farqini 12,29 deb ko‘rsatadi. Natijalar bo‘limidagi “%12,29” ifodasi ushbu arifmetik AP farqini foiz belgisi bilan yozadi. Shu sabab bu yerda “12,29 AP ball” bilan “%12,29 nisbiy yaxshilanish” bir xil narsa sifatida ishlatilmagan.

Manba annotatsiyasidagi “significantly outperforming” ifodasiga qaramay, taqqoslash uchun takroriy baholash noaniqligi, confidence interval yoki formal statistik significance testi qayd etilmagan. Verianla bayoni ishlash farqini raqamli qiymatlari bilan beradi; statistik ahamiyatlilik xulosasini qo‘shmaydi.

Ilmiy talqin chegarasi

Ushbu tadqiqotning asosiy yutug‘i bitta murakkab plant room-dagi point cloud ma’lumotini foundation models va adaptiv virtual kamera yaratish bilan birlashtirib, belgilangan domain-specific o‘qitish talab qilmasdan yuqoriroq aniqlash natijasi va amaliy taxminiy 3B lokalizatsiyani ko‘rsatganidir.

Shunga qaramay, natija bitta obyekt bo‘yicha tekshiruvga asoslangan. Sanoat aktivlarining geometriyasi, sensor shovqini, skanerlash zichligi, occlusion tuzilishi va foundation modelning aktiv terminologiyasini tanish qobiliyati boshqa muhitlarda boshqacha bo‘ladi.

Shu sabab AP25 48,13 va AP50 34,98 qiymatlari “sanoat obyektlarida umumiy muvaffaqiyat foizi” sifatida emas, balki ushbu tadqiqot belgilagan test sahnasi, aktiv sinflari, point cloud va baholash protokoliga tegishli model ko‘rsatkichi sifatida o‘qilishi kerak.

Xuddi shuningdek, 0,105–0,312 m lokalizatsiya xatolari ham yuqori aniqlikdagi survey/CAD aniqligi kafolati emas. Manba usulni aniq ravishda asset inventory, digital-twin initialisation va inspection planning kabi taxminiy fazoviy joylashuv operatsion qiymatga ega bo‘lgan ilovalarga yo‘naltiradi.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati