Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Муҳандисӣ / Муайянсозӣ ва Ҷойгиркунии Zero-Shot-и Дороиҳои 3Б Тавассути Асосноккунии Визуалӣ дар Абрҳои Нуқтаии Саноатӣ
Муҳандисӣ

Муайянсозӣ ва Ҷойгиркунии Zero-Shot-и Дороиҳои 3Б Тавассути Асосноккунии Визуалӣ дар Абрҳои Нуқтаии Саноатӣ

Ин таҳқиқот чаҳорчӯбаи zero-shot-ро пешниҳод мекунад, ки дар объектҳои мавҷудаи бе модели навшудаи CAD ё маҷмӯи калони маълумоти омӯзишии тамғагузоришуда барои дороиҳои саноатӣ, танҳо аз як абри нуқтаии 3Б таҷҳизотро муайян карда, ҷойгиршавии тахминии фазоии онҳоро меёбад.

19/08/2026  Veri Anla 22 боздид
Муайянсозӣ ва Ҷойгиркунии Zero-Shot-и Дороиҳои 3Б Тавассути Асосноккунии Визуалӣ дар Абрҳои Нуқтаии Саноатӣ

Ин таҳқиқот чаҳорчӯбаи zero-shot-ро пешниҳод мекунад, ки дар объектҳои мавҷудаи бе модели навшудаи CAD ё маҷмӯи калони маълумоти омӯзишии тамғагузоришуда барои дороиҳои саноатӣ, танҳо аз як абри нуқтаии 3Б таҷҳизотро муайян карда, ҷойгиршавии тахминии фазоии онҳоро меёбад. Система ба ҷойи он ки абри нуқтаиро мустақиман ба детектори объекти 3Б диҳад, аввал бо камераҳои виртуалӣ дар баландӣ ва сатҳҳои гуногуни наздиккунӣ тасвирҳои саҳнаро тавлид мекунад. Тасвирҳо бо GPT-4o аз ҷиҳати семантикӣ шарҳ дода мешаванд, тавсифҳои тавлидшудаи объект ба Grounding DINO интиқол меёбанд, bounding box-ҳои 2Б муайян мешаванд ва бо истифода аз depth ва параметрҳои камера натиҷаҳо боз ба системаи координатаҳои маҳаллии 3Б баргардонда мешаванд. Дар ҳолатҳое, ки нуқтаҳои назари собит кофӣ нестанд, система бо меъёрҳое чун андозаи объект дар тасвир, аз кадр берун рафтан ва бо объектҳои дигар ҳампӯш шудан камераро аз нав ҷойгир карда, тасвирро дубора тавлид мекунад.

Дар маълумоти 271.348.287 нуқта, ки аз як plant room-и мураккаб дар Мелбурн бо сканери лазерии Leica BLK360 гирифта шудааст, усули пешниҳодшуда дар ҳамон инфрасохтори асосноккунии визуалӣ арзиши AP25-ро аз 35,84 то 48,13 ва арзиши AP50-ро аз 26,89 то 34,98 нисбат ба OpenIns3D-и ибтидоӣ боло бурд. Бахусус, синфи gas/oil burner, ки системаи ибтидоӣ дар AP25 тамоман муайян карда натавониста буд, дар системаи пешниҳодшуда ба 41,3 AP25 расид; барои electrical kit, control panel, fire extinguisher ва баъзе синфҳои дигар низ афзоишҳои назаррас гузориш шуданд. Дар ҷадвали ҷойгиркунии 3Б барои 11 дороӣ хатогиҳои инфиродии ҷойгиршавии Евклидӣ аз 0,105 то 0,312 метр тағйир меёбанд. Аммо натиҷаҳо танҳо дар як муҳити саноатӣ ба даст омадаанд ва усул на ҳамчун системаи бозсозии геометрии дақиқбаланд, балки барои сенарияҳое чун инвентаризатсияи дороиҳо, қабати ибтидоии дугоники рақамӣ, мониторинги фосилавӣ ва банақшагирии инспексия, ки маълумоти тахминии фазоӣ кофист, арзёбӣ шудааст.

Чаро муайянсозии дороиҳои 3Б дар объектҳои саноатӣ душвор аст?

Масъалаи асосӣ танҳо “ёфтани объект дар абри нуқтаӣ” нест. Дар объектҳои саноатӣ насосҳо, клапанҳо, зарфҳо, панелҳои барқӣ, системаҳои duct, зинаҳо, burner-ҳо ва шабакаҳои зичи қубурҳо дар андозаҳо ва баландии гуногун ва аксаран ба шакле ҷойгир мешаванд, ки якдигарро мепӯшонанд. Дар ҳоле ки рӯи пеши таҷҳизот намоён аст, тарафи дигари он метавонад бо қубур ё девор пӯшида шавад; клапани хурд дар тасвири васеъкунҷаи саҳна то чанд пиксел хурд шуда метавонад.

Усулҳои классикии назоратшавандаи муайянсозии объекти 3Б кӯшиш мекунанд ин мушкилро бо маҷмӯи калони маълумоти тамғагузоришуда ҳал кунанд. Аммо аз сабаби гуногунии таҷҳизоти хоси ҳар як объекти саноатӣ, сохтани чунин маҷмӯи маълумот гарон ва вақтталаб аст. Дар маҷмӯи стандартии маълумоти ронандагии худмухтор ё муҳити дохилӣ синфҳое чун автомобил, пиёдагард, курсӣ ва миз мавҷуданд, аммо таҷҳизоте чун gas/oil burner ё electrical kit-и махсус дар plant room одатан намояндагӣ намешавад.

Аз ин рӯ саволи асосии таҳқиқот чунин аст: оё танҳо аз абри нуқтаии мавҷуда, бе омӯзонидани модели тамғагузоришудаи махсус барои объект, дороиҳои саноатиро муайян карда, онҳоро боз ба ҷойгиршавии 3Б баргардондан мумкин аст?

“Zero-shot” дар ин ҷо дақиқ чӣ маъно дорад?

Дар таҳқиқот zero-shot маънои онро дорад, ки барои системаи пешниҳодшуда маҷмӯи нави маълумоти омӯзишии тамғагузоришудаи махсус барои объекти саноатӣ омода нашудааст. Foundation model-ҳои пешакӣ омӯзонидашуда чун GPT-4o ва Grounding DINO истифода мешаванд.

Пас система “ҳеҷ чиз наомӯхтааст” нест. Он аз моделҳое истифода мебарад, ки қаблан дар маълумоти калон омӯзонида шудаанд; сифр он domain-specific supervised training аст, ки барои муайян кардани таҷҳизоти ҳамин plant room анҷом дода нашудааст.

Ғайр аз ин, GPT-4o объектҳои дар тасвир бударо аз луғати пешакӣ муайяншудаи дороиҳои саноатӣ, ки дар таҳқиқот таъриф шудааст, ҷустуҷӯ мекунад. Аз ин рӯ қобилияти zero-shot дар сатҳи амалӣ бояд ҳамчун омезиши синфҳои саноатии пешакӣ муайяншуда ва дониши foundation model фаҳмида шавад.

Чаро усул абри нуқтаиро мустақиман тасниф намекунад?

Равиши муҳаққиқон ин аст, ки барои истифода аз қобилияти фаҳмиши визуалии моделҳои пурқуввати 2Б vision–language, абри нуқтаии 3Б-ро аз камераҳои гуногуни виртуалӣ ба тасвирҳои саҳнаи 2Б табдил диҳанд.

Мантиқи ин тарҳ чунин аст:

  1. Дар абри нуқтаӣ камераҳои виртуалӣ ҷойгир карда мешаванд.
  2. Аз ин камераҳо тасвирҳои саҳнаи 2Б ва depth map-ҳо render мешаванд.
  3. Foundation model-ҳо муайян мекунанд, ки дар тасвирҳо кадом дороиҳои саноатӣ мавҷуданд.
  4. Муайянсозии 2Б бо истифода аз маълумоти depth ва параметрҳои камера боз ба саҳнаи 3Б проексия карда мешавад.

Аз ин рӯ таҳқиқот байни “2Б ё 3Б” интихоб намекунад; маълумоти геометрии 3Б-ро бо фаҳмиши визуалии 2Б foundation-model дар як pipeline муттаҳид мекунад.

Системаи панҷмарҳила чӣ гуна кор мекунад?

Усули асосии мақола аз панҷ марҳилаи асосӣ иборат аст:

  1. Virtual Camera Positioning: Ҷойгир кардани камераҳои виртуалӣ дар минтақаҳои мувофиқи саҳнаи саноатӣ ва баландии гуногун.
  2. Image Generation: Тавлиди тасвирҳои саҳна аз абри нуқтаӣ дар нуқтаҳои назар ва сатҳҳои гуногуни zoom.
  3. Visual Grounding: Муайянсозии семантикӣ бо GPT-4o ва тавлиди bounding box-и 2Б бо Grounding DINO.
  4. Recognition-Aware Refinement: Аз нав танзим кардани автоматии параметрҳои камера барои объектҳои нокифоя намоён ва дубора render кардани тасвир.
  5. Asset Localisation: Баргардондани муайянсозиҳои 2Б ба координатаҳои маҳаллии 3Б бо истифода аз depth, intrinsics ва extrinsics.

Хусусияти муҳими схемаи усул дар он аст, ки марҳилаи чорум раванди яксамта нест. Агар сифати шиносоӣ паст бошад, камера аз нав танзим шуда, тасвирҳои нав сохта мешаванд. Ҳамин тавр, детектори объект танҳо бо тасвири додашуда маҳдуд намемонад; система кӯшиш мекунад нуқтаи назари наверо эҷод кунад, ки объект дар он беҳтар намоён бошад.

Чаро камераҳои виртуалӣ дар баландии гуногун ҷойгир карда мешаванд?

Нуқтаҳои назари васеъкунҷаи собити OpenIns3D метавонанд дар муҳити дохилии содатар кофӣ бошанд; аммо дар plant room-и саноатӣ шумораи зиёди қубурҳои наздики шифт метавонанд таҷҳизоти сатҳи поёнро пӯшонанд. Ба ҳамин тарз таҷҳизоти баланд, агар танҳо аз камераҳои паст дида шавад, метавонад нопурра намоён гардад.

Аз ин рӯ равиши пешниҳодшуда камераҳоро дар як баландӣ нигоҳ намедорад. Бо баланд бардоштани ҳадди болоии баландӣ намоёнии таҷҳизоти баланд ва бо тағйир додани ҳадди поёнӣ намоёнии таҷҳизоти сатҳи фарш аз кунҷҳои гуногун зиёд карда мешавад.

Аммо таҳқиқот саҳми ин стратегияи баландии тағйирёбандаро бо ablation experiment-и алоҳида чен намекунад. Бинобар ин дар манбаъ рақаме ба шакли “multi-height camera positioning танҳо X AP дод” вуҷуд надорад.

Чаро normal, medium ва close-up zoom якҷоя истифода мешаванд?

Дар саҳнаи саноатӣ зарф ва клапани хурд як масштаби физикӣ надоранд. Агар танҳо як сатҳи собити zoom истифода шавад, ё контексти умумии саҳна гум мешавад, ё тафсилоти визуалии таҷҳизоти хурд нокифоя мемонад.

Таҳқиқот ин мушкилро бо механизми zoom-и сеқабата:

  • normal,
  • medium,
  • close-up

ҳал мекунад. Ба ин тарз ҳам контексти муҳити ҳамон саҳна ва ҳам тафсилоти таҷҳизоти хурд ба foundation model нишон дода мешавад.

Бартараф кардани девор чӣ маъно дорад?

Дар ин ҷо нест кардани девори физикии объект дар назар нест. Ҳангоми render кардани абри нуқтаӣ деворҳои сарҳадии берунӣ бо истифода аз threshold-и муайян аз тавлиди тасвир хориҷ карда мешаванд. Ҳадаф ин аст, ки дороиҳои паси девори берунӣ ё наздики он барои камераҳои виртуалӣ намоён шаванд.

Муқоисаҳои пеш ва баъди бартараф кардани девор дар мақола нишон медиҳанд, ки таҷҳизоте чун pump ва tank, ки бо девор пӯшида шудаанд, дар тасвирҳои виртуалӣ метавонанд намоёнтар шаванд.

Чӣ гуна муайян мешавад, ки кадом тасвири саҳна “хуб” аст?

Тасвирҳои номзади аввалин renderшуда баробар ҳисобида намешаванд. Барои ҳар тасвир ду меъёр ҳисоб карда мешавад:

  • Edge density: Таносуби пикселҳои канорӣ дар тасвир пас аз Canny edge detection.
  • Texture variance: Дисперсияи шиддати пикселҳои сатҳи хокистарӣ.

Дар манбаъ холҳои тасвир чунин муайян шудаанд:

\[ score_i= 0.6\times\text{edge density} + 0.4\times\text{texture variance} \]

.

Параметрҳои intrinsic-и камераи тасвири номзаде, ки холи баландтарин мегирад, барои тавлиди нуқтаҳои назари баъдӣ боз истифода мешаванд. Мақсад интихоби танзими тасвирест, ки аз ҷиҳати маълумоти геометрӣ ва текстуравӣ бойтар аст.

Depth-based filtering чӣ кор мекунад?

Ҳатто агар тасвир ба таври визуалӣ тавлид шуда бошад, қисми зиёди он метавонад холӣ, occluded ё бе маълумоти дурусти сатҳи 3Б бошад. Аз ин рӯ depth map-и ҳар render арзёбӣ мешавад.

Таносуби намоёнӣ:

\[ V= \frac{|D_{\mathrm{valid}}|}{|D|} \]

муайян мешавад. \(D_{\mathrm{valid}}\) пикселҳои дорои depth-и дурустро ва \(D\) ҳамаи пикселҳои тасвирро ифода мекунад.

Танҳо тасвирҳое нигоҳ дошта мешаванд, ки шарти:

\[ V\geq\sigma \]

-ро иҷро мекунанд.

Дар намунаҳои намоёнии паст ва баланд, depth map-и нуқтаҳои назари пастсифат танҳо минтақаҳои хурду кандашудаи ранга дорад, дар ҳоле ки дар намоёнии баланд харитаи depth зичтар ва пайвастатар аст. Ин филтркунӣ барои кам кардани таъсири геометрияи нопурра ба проексияи бозгаштии 3Б равона шудааст.

Чаро GPT-4o ва Grounding DINO якҷоя истифода мешаванд?

Вазифаҳои ду модели pipeline фарқ мекунанд.

GPT-4o тасвири саҳнаи renderшударо аз ҷиҳати семантикӣ таҳлил мекунад ва объектҳои намоёнро аз луғати пешакӣ муайяншудаи дороиҳои саноатӣ муайян мекунад. Барои ҳар намуна он:

  • категорияи дороӣ,
  • шумораи намунаҳо,
  • ҷойи тахминӣ дар тасвир,
  • андозаи нисбӣ,
  • тавсифи намуди зоҳирӣ ва контекст

месозад.

Дар ин марҳила ҳанӯз bounding box-и дақиқ вуҷуд надорад.

Grounding DINO бошад тавсифи забони табиии сохтаи GPT-4o-ро ба visual grounding prompt табдил дода, барои объекти дахлдор axis-aligned 2Б bounding box тавлид мекунад.

Вақте ки якчанд объекти як синф мавҷуданд, ба prompt маълумоти ҷойгиршавӣ ва андоза илова мешавад, то намунаҳо аз ҳам фарқ карда шаванд.

Чаро Grounding DINO танҳо кофӣ ҳисоб нашуд?

Дар муқоисаи сифатии таҳқиқот ODISE ва YOLO-World қисми муҳими дороиҳои мураккаби саноатиро аз даст додаанд. Grounding DINO ҷойгиркунии беҳтар медиҳад, аммо дар баъзе синфҳои махсуси таҷҳизот танҳо истифода шуда, маҳдуд мемонад.

Дар Расми 2, махсусан gas oil burner ва control panel дар намунаи сеюм аз ҷониби GPT-4o + Grounding DINO муайян шуданд, дар ҳоле ки моделҳои дигари муқоисашуда онҳоро аз даст доданд. Аз нав муайян шудани синфи Pump дар нуқтаҳои назари гуногун низ яке аз мисолҳои истифодаи контексти саҳна аз ҷониби ин омезиш аст.

Чаро Recognition-aware viewpoint refinement лозим аст?

Ҳатто тавлиди шумораи зиёди камера ва сатҳҳои zoom кафолат намедиҳад, ки ҳар объект хуб намоён мешавад. Объект метавонад:

  • дар тасвир хеле хурд монад,
  • дар канор бурида шавад,
  • бо объектҳои дигар пӯшида шавад,
  • аз кунҷи номуносиб дида шавад.

Фарқи таҳқиқот дар он аст, ки ин нокомиҳоро чен карда, ба камера ҳамчун бозхурд медиҳад.

Андозаи объект дар тасвир чӣ гуна чен карда мешавад?

Дар манбаъ барои projected area ratio чунин ифода чоп шудааст:

\[ A_i= \frac{ (x_2-x_1)-(y_2-y_1) }{ W\cdot H }. \]

\((x_1,y_1,x_2,y_2)\) координатаҳои bounding box ва \(W,H\) паҳно ва баландии тасвирро ифода мекунанд.

Ёддошти садоқат ба манбаъ: Гарчанде мақола онро “projected area ratio” меномад, ба ҷойи зарб кардани паҳно ва баландӣ байни онҳо аломати тарҳро чоп мекунад. Матни Verianla формуларо бесадо ба формулаи стандартии масоҳати росткунҷа иваз намекунад; шакли манбаъ айнан нигоҳ дошта мешавад.

Аз кадр берун рафтани объект чӣ гуна санҷида мешавад?

Truncation indicator:

\[ T_i= \begin{cases} 1, & x_1\leq\delta \ \text{veya}\ y_1\leq\delta \ \text{veya}\ x_2\geq W-\delta \ \text{veya}\ y_2\geq H-\delta,\\ 0, & \text{aksi durumda} \end{cases} \]

муайян мешавад.

Агар bounding box-и объект ба канорҳои тасвир аз маржаи муайяншудаи \(\delta\) наздиктар шавад, нуқтаи назар ҳамчун “truncated” ишора мешавад.

Холи view suitability чӣ гуна ҳисоб мешавад?

Масштаби объект ва truncation якҷоя ба:

\[ J_{\mathrm{view},i} = \beta\ln(1+A_i)-\gamma T_i \]

табдил дода мешаванд.

Объекти калонтар ва пурра дар дохили тасвир ҷойгирифта холи мувофиқати баландтар медиҳад, дар ҳоле ки объекте, ки аз кадр мебарояд, ҷарима мешавад.

Дар саҳнаҳои серобъект қуттиҳои ҳампӯш чӣ гуна ба ҳисоб гирифта мешаванд?

Арзишҳои IoU барои ҷуфтҳои bounding box-и як нуқтаи назар ҳисоб шуда, аз ҳиссаи ҷуфтҳое, ки аз threshold-и:

\[ \tau_{\mathrm{IoU}} \]

мегузаранд, clutter score \(C_v\) гирифта мешавад.

\(C_v\)-и баланд нишон медиҳад, ки бисёр объектҳо дар тасвир ҳампӯш шудаанд ва нуқтаи назар метавонад барои grounding номуносиб бошад.

Аз нав танзим кардани камера кай фаъол мешавад?

Тибқи манбаъ:

  • \(A_i<\tau_A\): объект хеле хурд → zoom-in ё масофаи камераро кам кун.
  • \(T_i=1\): объект аз кадр мебарояд → field of view-ро васеъ кун ё камераро ҳаракат деҳ.
  • \(J_{\mathrm{view},i}<\tau_J\): кунҷи назар нокифоя → yaw/pitch-ро тағйир деҳ.
  • \(C_v>\tau_C\): саҳна хеле серобъект → баландӣ ё самти камераро тағйир деҳ.

Афзалият инчунин бо:

\[ S_i= w_1\max(0,\tau_A-A_i) + w_2\max(0,\tau_J-J_{\mathrm{view},i}) + w_3T_i \]

severity score муайян мешавад.

Field of view ва позаи камера чӣ гуна тағйир меёбанд?

Дар манбаъ навсозии дарозии фокус:

\[ f'_x= f_z \left( 1-\frac{\Delta FOV}{100} \right), \qquad f'_y= f_y \left( 1-\frac{\Delta FOV}{100} \right) \]

чоп шудааст.

Аммо дарҳол баъд матн focal length-ҳои ибтидоиро:

\[ f_x,\;f_y \]

муайян мекунад ва \(f_z\)-ро шарҳ намедиҳад. Аз ин рӯ дар муодилаи \(f'_x\) истифода шудани \(f_z\) метавонад номутобиқии ишорагузорӣ ё хатои типографӣ дар дохили манбаъ бошад. Ислоҳи дар манбаъ набуда анҷом дода нашудааст.

Самти камера бо:

\[ P'= P\cdot R_{\mathrm{yaw}}(\theta) \cdot R_{\mathrm{pitch}}(\phi) \]

тағйир дода мешавад, дар ҳоле ки ҳаракати радиалии камера чунин дода шудааст:

\[ p'_{\mathrm{cam}} = p_{\mathrm{scene}} + (1+\Delta r) \frac{ p_{\mathrm{cam}}-p_{\mathrm{scene}} }{ \|p_{\mathrm{cam}}-p_{\mathrm{scene}}\| } \]

.

Bounding box-и 2Б чӣ гуна боз ба ҷойгиршавии 3Б табдил меёбад?

Visual grounding объектро дар тасвир меёбад; аммо барои дугоники рақамӣ бояд маълум бошад, ки объект дар координатаҳои завод дар куҷост.

Агар пиксели тасвир:

\[ (u,v) \]

ва depth-и мувофиқ:

\[ d \]

маълум бошанд, координатаи камера бо:

\[ P_C= K^{-1} [u,v,1]^T d \]

ҳисоб карда мешавад.

Сипас бо истифода аз параметрҳои extrinsic-и камера:

\[ P_L= R P_C+t \]

табдил татбиқ мешавад.

Дар ин ҷо \(P_L\) ҷойгиршавии 3Б-и объект дар plant coordinate system-и маҳаллӣ мебошад.

Оё ин равиш модели 3Б CAD-ро пурра иваз мекунад?

Не. Қисми муҳокимаи таҳқиқот инро равшан маҳдуд мекунад. Усули пешниҳодшуда барои high-precision geometric reconstruction тарҳрезӣ нашудааст.

Намунаҳои истифодаи ҳадафӣ:

  • сохтани asset inventory,
  • эҷоди қабати асосии фазоӣ барои оғоз кардани дугоники рақамии brownfield,
  • inspection planning,
  • remote monitoring,
  • муайян кардани муносибатҳои тахминии фазоии дороиҳо

мебошанд.

Аз ин рӯ тафсири координатаҳои гирифташуда ҳамчун tolerance-и истеҳсолӣ ё ченаки дақиқи reverse engineering аз ҷониби манбаъ дастгирӣ намешавад.

Ин барои Туркия чӣ маъно дорад?

Азбаски усул махсусан объектҳои brownfield-ро ҳадаф мегирад, ки модели навшудаи BIM/CAD надоранд, он метавонад барои корхонаҳои истеҳсолии солҳо фаъол, объектҳои энергетикӣ ё утоқҳои мураккаби механикӣ дар Туркия самти арзандаи таҳқиқот бошад. Аммо таҳқиқот танҳо дар як plant room дар Мелбурн анҷом дода шудааст.

Гуфтан мумкин нест, ки барои объекти Туркия ҳамон арзишҳои AP ё хатои ҷойгиршавӣ ба даст меоянд. Дар санҷиши маҳаллӣ зичии абри нуқтаӣ, сифати скан, синфҳои дороиҳои объект, зичии қубурҳо, андозаи компонентҳои хурд ва ин ки foundation model истилоҳоти таҷҳизоти дахлдорро мешиносад ё не, бояд алоҳида санҷида шавад.

Натиҷаҳое, ки таҳқиқот дастгирӣ мекунад

  • Дар ин муҳити таҷрибавӣ нишон медиҳад, ки аз як абри нуқтаии саноатӣ, бе омода кардани маҷмӯи маълумоти омӯзишии тамғагузоришудаи махсус барои объект, муайянсозии дороиҳои 3Б ва ҷойгиркунии тахминии онҳо мумкин аст.
  • Pipeline-и пурраи пешниҳодшуда дар ҳамон муқоиса нисбат ба OpenIns3D-и ибтидоӣ AP25 ва AP50-и баландтар додааст.
  • Иловаи кумулятивии бартараф кардани девор, multiple zoom ва recognition-aware refinement нишондиҳандаро қадам ба қадам баланд кардааст.
  • Омезиши GPT-4o + Grounding DINO дар тасвирҳои саноатии баррасишуда нисбат ба дигар вариантҳои санҷидашудаи visual grounding муайянсозиҳои сифатан беҳтар нишон додааст.
  • Илова шудани recognition-aware refinement бузургтарин афзоиши ниҳоии AP-ро дар Ҷадвали 2 ба вуҷуд овардааст.
  • Дар натиҷаи проексияи бозгашт ба системаи координатаҳои маҳаллӣ барои 11 дороӣ хатогиҳои инфиродии ҷойгиркунии 3Б дар доираи 0,105–0,312 m гузориш шудаанд.
  • Дар таҳлили ҳассосияти параметрҳои ±%10 ҳамаи perturbation-ҳои истифодашуда AP25-ро паст кардаанд; бахусус threshold-и \(\tau_J\) баландтарин ҳассосиятро нишон додааст.

Натиҷаҳое, ки таҳқиқот дастгирӣ намекунад ё насанҷидааст

  • Санҷида нашудааст, ки дар ҳамаи объектҳои саноатӣ ҳамон нишондиҳандаро диҳад.
  • Дар кишварҳои гуногун, бахшҳои саноатӣ ё системаҳои сканер cross-site generalisation experiment гузаронида нашудааст.
  • Бозсозии геометрӣ дар сатҳи CAD/reverse-engineering-и дақиқбаланд нишон дода нашудааст.
  • Натиҷаҳои “zero-shot” бе foundation models ба даст наомадаанд; supervised training-и нави махсус барои объект анҷом дода нашудааст.
  • Нишон дода нашудааст, ки ҳар гуна категорияи комилан ношиноси дороӣ бе маҳдудият кашф карда шавад; дар марҳилаи GPT-4o луғати пешакӣ муайяншудаи дороиҳои саноатӣ истифода мешавад.
  • Барои аҳамияти омории фарқҳои AP таҷрибаи такрорӣ, confidence interval ё санҷиши гипотеза гузориш нашудааст.
  • Таъсири Variable-height camera positioning дар сатри мустақили ablation аз дигар беҳбудиҳо чен нашудааст.
  • Таъсири Point-cloud downsampling ба таври миқдорӣ санҷида нашудааст.
  • Таъсири вариантҳои prompt ба нишондиҳанда бо robustness experiment-и систематикӣ чен нашудааст.

Усул ва Натиҷаҳои Таҳқиқот

Муҳити таҷрибавӣ

Арзёбӣ дар plant room-и мураккабе, ки дар дохили як бино дар Мелбурн ҷойгир аст, анҷом дода шудааст.

Ҷузъи таҷрибаМаълумоти дар манбаъ додашуда
Сканери 3БLeica BLK360
Шумораи умумии нуқтаҳо271.348.287
Коркарди абри нуқтаӣCloudCompare v2.13.2
GPU2 × NVIDIA L40, ҳар кадом 48 GB VRAM
Манбаи CPU16 vCPU
Хотираи система241 GB
Системаи амалиётӣUbuntu 20.04
Foundation modelGPT-4o, gpt-4o-2024-11-20
2Б groundingGrounding DINO

Натиҷаҳои системаи пурра бо OpenIns3D

ДороӣOpenIns3D AP25AP25-и пешниҳодшудаOpenIns3D AP50AP50-и пешниҳодшуда
Миёна35,8448,1326,8934,98
Cabinet44,658,340,242,8
Control Panel52,365,443,349,2
Electrical Kit18,335,17,820,3
Gas/Oil Burner041,3024,4
Ladder74,376,150,951,2
Pump16,121,36,415,9
Tank78,880,468,169,8
Valve33,436,427,629,1
Duct7,310,706,2
Fire Extinguisher33,356,324,640,9

Фарқи аз ҳама намоён дар синфи gas/oil burner дида мешавад. OpenIns3D-и ибтидоӣ ҳам дар AP25 ва ҳам дар AP50 арзиши 0 додааст, дар ҳоле ки framework-и пешниҳодшуда мутаносибан ба 41,3 ва 24,4 расидааст.

Барои electrical kit AP25 аз 18,3 то 35,1, AP50 аз 7,8 то 20,3; барои fire extinguisher AP25 аз 33,3 то 56,3 ва AP50 аз 24,6 то 40,9 боло рафтааст.

Аммо дар ҳар синф афзоиши якхела дида намешавад. Масалан, tank ва ladder аллакай дар усули ибтидоӣ синфҳои қавӣ буданд ва афзоиши онҳо маҳдудтар аст. Ин нишон медиҳад, ки бартарии асосии система метавонад махсусан дар дороиҳои мураккаб, хурд, пӯшидашуда ё барои foundation model душвортар намоён шавад; аммо ин тафсир танҳо ба ҳамин саҳнаи санҷишӣ дахл дорад.

Таъсири беҳбудиҳои марҳилавӣ

Verianla Live: Таъсири тавлиди нуқтаи назар ва марҳилаҳои refinement ба нишондиҳандаи AP

График натиҷаҳои кумулятивии AP25 ва AP50-и беҳбудиҳоеро нишон медиҳад, ки дар ҳамон таҳқиқот ва ҳамон протоколи арзёбӣ ба системаи ибтидоии OpenIns3D илова шудаанд.

КонфигуратсияAP25AP50
OpenIns3D ибтидоӣ35,8426,89
+ Бартараф кардани девор38,2227,10
+ Multiple zoom + бартараф кардани девор42,6328,82
+ Multiple zoom + бартараф кардани девор + recognition-aware refinement48,1334,98
 

Verianla Live: Маълумоти Ҷадвали 2-и таҳқиқоти манбаъ истифода шудааст. Арзишҳо конфигуратсияҳои кумулятивиро нишон медиҳанд; набояд ҳамчун таъсири маржиналии мустақили ҳар ҷузъ тафсир шаванд.

Бартараф кардани девор AP25-и ибтидоиро аз 35,84 то 38,22 баланд кард, дар ҳоле ки AP50 танҳо аз 26,89 то 27,10 боло рафт.

Бо иловаи multiple zoom, AP25 42,63 ва AP50 28,82 шуд.

Бо марҳилаи ниҳоии recognition-aware refinement, AP25:

\[ 42{,}63\rightarrow48{,}13 \]

ва AP50:

\[ 28{,}82\rightarrow34{,}98 \]

шуд.

Ҷадвали 2 фарқи умумиро аз оғоз то натиҷаи ниҳоӣ барои AP25 ҳамчун 12,29 ва барои AP50 ҳамчун 8,09 медиҳад. Инҳо фарқҳои арифметикии арзишҳои ибтидоӣ ва ниҳоии AP мебошанд.

Параметрҳои recognition-aware refinement то чӣ андоза ҳассосанд?

Маҷмӯи асосии параметрҳои манбаъ:

ПараметрАрзиши пешфарз
\(\delta\)10 px
\(\beta\)1,0
\(\gamma\)0,3
\(\tau_A\)0,01
\(\tau_J\)0,1
\(\tau_{\mathrm{IoU}}\)0,3
\(\tau_C\)0,15

Ҳангоми алоҳида ±%10 тағйир додани ҳар параметр фарқҳои гузоришшудаи AP25 чунинанд:

ПараметрΔAP25 барои −%10ΔAP25 барои +%10
Image boundary margin \(\delta\)−0,09−0,11
Area contribution weight \(\beta\)−0,10−0,14
Truncation penalty \(\gamma\)−0,09−0,12
Minimum projected area \(\tau_A\)−0,10−0,11
View suitability threshold \(\tau_J\)−0,65−0,55
IoU overlap threshold \(\tau_{\mathrm{IoU}}\)−0,06−0,08
View clutter threshold \(\tau_C\)−0,05−0,06

Манфӣ будани ҳамаи perturbation-ҳо нишон медиҳад, ки конфигуратсияи асосии интихобкардаи муаллифон дар ин диапазони маҳаллӣ беҳтарин нуқтаи санҷидашуда будааст. Ҳассосияти аз ҳама намоён дар:

\[ \tau_J \]

view suitability threshold дида мешавад. Дар муқоиса, тағйироти \(\tau_{\mathrm{IoU}}\) ва \(\tau_C\), ки clutter model-ро муайян мекунанд, таъсири хурдтар нишон додаанд.

Хатогиҳои ҷойгиркунии 3Б дар чӣ сатҳанд?

Таҳқиқот барои 11 дороии ҷойгиршуда масофаи Евклидии 3Б байни координатаи ground-truth ва ҷойи муайяншударо алоҳида гузориш мекунад:

ID-и дороӣХатои мутлақи ҷойгиркунии 3Б (m)
10,180
20,121
30,122
40,202
50,162
60,227
70,312
80,135
90,114
100,105
110,174

Камтарин хатои гузоришшуда 0,105 m ва баландтарин 0,312 m аст. Манбаъ барои ин ҷадвал метрикаи алоҳидаи хатои миёнаи ҷойгиркуниро гузориш намекунад; натиҷаҳоро барои ҳар дороӣ алоҳида нишон медиҳад.

Муаллифон ин сатҳи дақиқиро на барои reverse engineering-и геометрии дақиқ, балки барои барномаҳои калони амалиётӣ ва нигоҳдорӣ, ки дар онҳо мавҷудияти дороӣ, фарогирии тахминии геометрӣ ва муносибатҳои фазоӣ бояд муайян шаванд, кофӣ мешуморанд.

Чаро зичии point cloud ҳанӯз ҳам муҳим аст?

Истифодаи zero-shot foundation model сифати геометрияи воридиро беаҳамият намекунад. Манбаъ қайд мекунад, ки point-cloud fidelity метавонад бевосита ба нишондиҳандаи муайянсозӣ таъсир расонад.

Мушоҳидаҳои сифатӣ мавҷуданд, ки moderate down-sampling метавонад хароҷоти ҳисоббарориро кам кунад, аммо point reduction-и аз ҳад зиёд метавонад геометрияи нозуки объектҳои хурд чун valve ва duct-ро аз байн барад.

Аммо таҳқиқот байни таносуби down-sampling ва AP ё хатои ҷойгиркунӣ таҷрибаи миқдорӣ пешниҳод намекунад.

Хароҷоти ҳисоббарорӣ то чӣ андоза муҳим аст?

Тавлиди шумораи зиёди тасвирҳои виртуалии баландсифат аз саҳнаҳои дорои беш аз 271 миллион нуқта аз ҷиҳати ҳисоббарорӣ гарон аст. Муҳаққиқон пешниҳод мекунанд, ки point cloud-ҳои калон ба минтақаҳои хурдтар тақсим карда шаванд, то сарборӣ кам гардад.

Аммо ин низ арзиши худро дорад: контексти геометрӣ ва маълумоти фазоӣ дар марзҳои тақсимот гум шуда метавонанд. Аз ин рӯ миқёспазирӣ танҳо илова кардани GPU нест; масъалаи чӣ гуна тақсим кардани саҳна низ бояд ҳал шавад.

Чаро prompt engineering маҳдудият аст?

Интихоби калима, сатҳи тафсилот ва тарзи ифода дар prompt-е, ки ба GPT-4o ва Grounding DINO фиристода мешавад, метавонад натиҷаҳоро тағйир диҳад. Манбаъ prompt engineering-ро ҳамчун маҳдудияти ошкор баён мекунад.

Яке аз пешниҳодҳои кори оянда истифодаи retrieval-augmented generation барои гирифтани маълумоти дороӣ аз knowledge base-и беруна ва ғанӣ кардани автоматии prompt мувофиқи контекст аст.

Самтҳои таҳқиқоти оянда

Мақола се самти асосиро пешбарӣ мекунад:

  1. Spatial zoning: Тақсим кардани абрҳои бузурги нуқтаии саноатӣ ба минтақаҳои маънодори фазоӣ бо истифода аз моделҳои маълумотии IFC ва knowledge graph.
  2. Adaptive image rendering: Истифодаи rendering-и босифаттар барои дороиҳои хурд чун valve/flange ва rendering-и сарфакорона барои дороиҳои калон.
  3. RAG-supported prompt engineering: Дохил кардани динамикии дониши дороиҳои саноатӣ ба prompt тавассути retrieval.

Муҳимтарин маҳдудиятҳои методологӣ

  • Арзёбӣ танҳо дар як plant room-и саноатӣ анҷом дода шудааст.
  • Интиқолпазирии гуногунии дороӣ ва муҳит ба объектҳои дигар ба таври таҷрибавӣ нишон дода нашудааст.
  • Шароити гуногуни саҳроӣ чун чанг, намнокӣ, рӯшноӣ, sensor noise ва occlusion метавонад сифати point-cloud-ро тағйир диҳад.
  • Rendering-и point cloud-и калон хароҷоти баланди ҳисоббарорӣ дорад.
  • Сегментатсияи point-cloud метавонад дар сарҳадҳои минтақа боиси гум шудани маълумот шавад.
  • Муайянсозии таҷҳизоти хурд ва махсуси саноатӣ ҳанӯз ҳам душвор аст.
  • Prompt engineering ба натиҷа таъсири назаррас дорад.
  • Таъсири down-sampling ба таври миқдорӣ чен нашудааст.
  • Барои фарқҳои AP таҳлили uncertainty ё аҳамияти оморӣ дода нашудааст.

Ёддошт оид ба Манбаъ ва Усул

Номи пурраи аслии таҳқиқот: Zero-Shot 3D Asset Detection and Localisation Through Visual Grounding in Industrial Point Clouds

Муаллифон: Masoud Kamali; Behnam Atazadeh; Abbas Rajabifard; Yiqun Chen.

Муаллифи якуми баробар/саҳми баробар: Дар манбаъ изҳорот дар бораи муаллифи якуми баробар ё саҳми баробар мавҷуд нест.

Муаллифи масъул: Behnam Atazadeh.

Муассиса: The Centre for Spatial Data Infrastructures and Land Administration, Department of Infrastructure Engineering, The University of Melbourne, Melbourne, Victoria, Australia.

Навъи манбаъ: Мақолаи аслии таҳқиқотии рецензияшуда; таҳқиқот дар соҳаи биниши компютерӣ, фаҳмиши саҳнаи 3Б ва ҷойгиркунии дороиҳои саноатӣ.

Маҷалла: AI.

Ношир: MDPI, Basel, Швейтсария.

Сабти библиографӣ: AI, 2026, Ҷилди 7, Шумораи 6, Мақолаи 205.

DOI: 10.3390/ai7060205.

Қабул / бозбинӣ / пазируфта / нашр: 2 Март 2026 / 18 Май 2026 / 26 Май 2026 / 5 Июн 2026.

Ҳолати рецензия: Нашри маҷаллаи рецензияшуда.

Литсензия: Creative Commons Attribution (CC BY).

Academic Editors: Miguel Angel Cazorla; Emanuele Frontoni.

Масъалаи асосии таҳқиқот: Муайянсозии zero-shot-и дороӣ ва ҷойгиркунии тахминии 3Б танҳо аз маълумоти point cloud дар муҳитҳои мураккаби саноатӣ, ки маҷмӯи маълумоти омӯзишии тамғагузоришуда ё модели навшудаи CAD надоранд.

Маълумоти воридӣ: Point cloud-и саноатии 271.348.287 нуқта, ки бо Leica BLK360 гирифта шудааст.

Усули асосӣ: Virtual camera positioning → image generation → GPT-4o semantic interpretation → Grounding DINO visual grounding → recognition-aware camera refinement → 3Б asset localisation дар асоси depth/intrinsic/extrinsic.

Foundation model: GPT-4o, дар манбаъ бо нишони версияи `gpt-4o-2024-11-20` нишон дода шудааст.

Модели visual grounding: Grounding DINO.

Baseline: OpenIns3D; дар муқоисаи назоратшаванда конфигуратсияи GPT-4o + Grounding DINO visual grounding ҳам дар baseline ва ҳам дар усули пешниҳодшуда пайваста истифода шудааст.

Натиҷаи асосии detection: AP25-и миёна аз 35,84 то 48,13 ва AP50 аз 26,89 то 34,98 боло рафтааст.

Натиҷаи incremental: OpenIns3D → wall removal → multiple zoom + wall removal → recognition-aware refinement мутаносибан AP25 35,84 → 38,22 → 42,63 → 48,13 ва AP50 26,89 → 27,10 → 28,82 → 34,98.

Арзёбии ҷойгиркунӣ: Хатогиҳои ҷойгиршавии Евклидии 3Б барои 11 дороӣ нисбат ба ground-truth алоҳида дода шуда, дар доираи 0,105–0,312 m ба амал омадаанд.

Ҳассосияти параметр: Параметрҳои recognition-aware refinement ±%10 тағйир дода шуданд; ҳамаи perturbation-ҳо боиси коҳиши AP25 шуданд ва параметри аз ҳама ҳассос \(\tau_J\) view suitability threshold буд.

Таҷҳизот: 2 × NVIDIA L40 48 GB VRAM; 16 vCPU; 241 GB RAM.

Системаи амалиётӣ: Ubuntu 20.04.

Барномаи point-cloud: CloudCompare v2.13.2.

Маблағгузорӣ: Australian Research Council, грантҳои рақами IH210100048 ва DE220100094.

Дастрасии маълумот: Гузориш шудааст, ки маълумоти истифодашуда дар таҳқиқот бинобар лоиҳаи васеътар ва идомадори таҳқиқотӣ/таҳия аз муаллифи масъул бо дархости асоснок дастрас шуда метавонад.

Кумитаи ахлоқ: Татбиқ намешавад.

Ризоияти огоҳона: Татбиқ намешавад.

Бархӯрди манфиатҳо: Муаллифон изҳор кардаанд, ки бархӯрди манфиатҳо вуҷуд надорад.

Сипосгузорӣ: Илова бар дастгирии University of Melbourne Research Computing Services ва Petascale Campus Initiative, дастгирии шарикони саноатии Emerson ва Rockfield зикр шудааст; муаллифон инчунин таъкид мекунанд, ки андешаҳои мақола ба худи онҳо тааллуқ доранд.

Саҳми муаллифон: Консептуализатсия M.K. ва B.A.; методология M.K., B.A. ва Y.C.; нармафзор M.K.; валидация M.K. ва B.A.; таҳлили формалӣ M.K.; таҳқиқот M.K., B.A. ва Y.C.; захираҳо M.K., B.A. ва Y.C.; курацияи маълумот M.K.; тарҳи аввал M.K.; бозбинӣ ва таҳрир ҳамаи муаллифон; визуализатсия M.K.; роҳбарӣ B.A., A.R. ва Y.C.; идоракунии лоиҳа A.R. ва Y.C.; дарёфти маблағгузорӣ B.A. ва A.R.

Ёддоштҳои формула ва гузориш дар дохили манбаъ

Формулаи projected-area дар бахши recognition-aware refinement дар манбаъ чунин навишта шудааст:

\[ A_i= \frac{(x_2-x_1)-(y_2-y_1)}{W H} \]

. Байни тавсифи “таносуби масоҳат” ва ифодаи математикӣ номутобиқии эҳтимолӣ вуҷуд дорад; дар матни Verianla он бесадо ба формулаи стандартии масоҳати bounding-box иваз нашудааст.

Ба ҳамин монанд, дар навсозии field-of-view барои \(f'_x\) аз \(f_z\) истифода шудааст, аммо тавсиф \(f_x,f_y\)-ро ҳамчун focal length-ҳои ибтидоӣ муайян мекунад. Манбаъ \(f_z\)-ро дар ин контекст шарҳ намедиҳад.

Ҷадвали 2 фарқи AP25 байни усули ибтидоӣ ва ниҳоиро 12,29 нишон медиҳад. Ифодаи “%12,29” дар бахши натиҷаҳо ин фарқи арифметикии AP-ро бо аломати фоиз менависад. Аз ин рӯ дар ин ҷо “12,29 нуқтаи AP” ва “%12,29 беҳбудии нисбӣ” ҳамчун як чиз истифода нашудаанд.

Бо вуҷуди ифодаи “significantly outperforming” дар хулосаи манбаъ, барои муқоиса номуайянии арзёбии такрорӣ, confidence interval ё санҷиши formal statistical significance гузориш нашудааст. Баёни Verianla фарқи нишондиҳандаро бо арзишҳои ададӣ медиҳад ва натиҷаи аҳамияти омориро илова намекунад.

Ҳудуди тафсири илмӣ

Муваффақияти асосии ин таҳқиқот дар он аст, ки маълумоти point cloud-и як plant room-и мураккабро бо foundation models ва тавлиди мутобиқшавандаи камераи виртуалӣ якҷоя карда, бе ниёз ба domain-specific training-и тамғагузоришуда, нишондиҳандаи беҳтари муайянсозӣ ва ҷойгиркунии тахминии 3Б-и қобили истифода нишон додааст.

Бо вуҷуди ин, натиҷа ба санҷиш дар як объект такя мекунад. Геометрияи дороиҳои саноатӣ, садои сенсор, зичии скан, сохтори occlusion ва қобилияти foundation model барои шинохтани истилоҳоти дороӣ дар муҳитҳои дигар фарқ хоҳад кард.

Аз ин рӯ AP25 48,13 ва AP50 34,98 набояд ҳамчун “фоизи умумии муваффақият дар объектҳои саноатӣ” хонда шаванд, балки ҳамчун нишондиҳандаи модел барои саҳнаи санҷишӣ, синфҳои дороӣ, point cloud ва протоколи арзёбии муайяншудаи ҳамин таҳқиқот.

Ҳамин тавр, хатогиҳои ҷойгиркунии 0,105–0,312 m низ кафолати дақиқии survey/CAD-и баланддақиқ нестанд. Манбаъ усулро равшан барои барномаҳои asset inventory, digital-twin initialisation ва inspection planning ҷой медиҳад, ки дар онҳо ҷойгиршавии тахминии фазоӣ арзиши амалиётӣ дорад.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо