Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Инженерия / Өнөр жай чекит булуттарында визуалдык негиздөө аркылуу Zero-Shot 3Б активдерди аныктоо жана жайгаштыруу
Инженерия

Өнөр жай чекит булуттарында визуалдык негиздөө аркылуу Zero-Shot 3Б активдерди аныктоо жана жайгаштыруу

Бул изилдөө актуалдуу CAD модели же өнөр жай активдерине таандык чоң белгиленген окутуу маалымат топтому жок иштеп турган объекттерде бир гана 3Б чекит булутунан жабдууларды аныктап, алардын болжолдуу мейкиндиктик жайгашуусун белгилөөгө багытталган zero-shot алкагын сунуштайт.

19/08/2026  Veri Anla 29 көрүү
Өнөр жай чекит булуттарында визуалдык негиздөө аркылуу Zero-Shot 3Б активдерди аныктоо жана жайгаштыруу

Бул изилдөө актуалдуу CAD модели же өнөр жай активдерине таандык чоң белгиленген окутуу маалымат топтому жок иштеп турган объекттерде бир гана 3Б чекит булутунан жабдууларды аныктап, алардын болжолдуу мейкиндиктик жайгашуусун белгилөөгө багытталган zero-shot алкагын сунуштайт. Система чекит булутун түздөн-түз 3Б объект детекторуна берүүнүн ордуна, алгач виртуалдык камералар аркылуу ар кандай бийиктик жана жакындатуу деңгээлдеринде көрүнүш сүрөттөрүн түзөт. Сүрөттөр GPT-4o аркылуу семантикалык жактан чечмеленет, түзүлгөн объект сүрөттөмөлөрү Grounding DINO-го өткөрүлөт, 2Б bounding box-тор аныкталат жана depth менен камера параметрлери колдонулуп, натыйжалар кайрадан 3Б локалдык координаттар системасына көчүрүлөт. Туруктуу көрүү чекиттери жетишсиз болгон учурларда система объекттин сүрөттөгү көлөмү, кадрдан чыгып кетиши жана башка объекттер менен капталышы сыяктуу критерийлерди колдонуп, камераны кайра жайгаштырып, сүрөттү кайра түзөт.

Мельбурндагы татаал plant room-дан Leica BLK360 лазердик сканери менен алынган 271.348.287 чекиттен турган маалыматта сунушталган ыкма, ошол эле визуалдык негиздөө инфраструктурасы менен бааланган OpenIns3D баштапкы вариантындагы AP25 маанисин 35,84төн 48,13кө, AP50 маанисин 26,89дан 34,98ге жогорулатты. Айрыкча баштапкы система AP25 боюнча таптакыр аныктай албаган gas/oil burner классы сунушталган системада 41,3 AP25ке жетти; electrical kit, control panel, fire extinguisher жана башка айрым класстарда да олуттуу өсүштөр маалымдалды. 3Б локалдаштыруу таблицасында 11 актив үчүн жеке Евклиддик жайгашуу каталары 0,105 менен 0,312 метрдин арасында өзгөрөт. Бирок натыйжалар бир гана өнөр жай чөйрөсүндө алынган жана ыкма жогорку тактыктагы геометриялык кайра куруу системасы катары эмес, активдердин инвентаризациясы, санарип эгиздин баштапкы катмары, аралыктан мониторинг жана инспекцияны пландоо сыяктуу болжолдуу мейкиндиктик маалымат жетиштүү болгон колдонуу сценарийлери үчүн бааланган.

Өнөр жай объекттеринде 3Б активдерди аныктоо эмне үчүн кыйын?

Негизги көйгөй жөн гана “чекит булутунан объект табуу” эмес. Өнөр жай объекттеринде насостор, клапандар, резервуарлар, электр панелдери, duct системалары, тепкичтер, burner-лер жана жыш түтүк линиялары ар түрдүү өлчөмдө, ар кандай бийиктикте жана көбүнчө бири-бирин жаап калгыдай жайгашат. Жабдуунун алдыңкы бети көрүнүп турганда, башка бети түтүктөр же дубал менен жабылышы мүмкүн; кичинекей клапан кең бурчтуу көрүнүш сүрөтүндө бир нече пикселге чейин кичирейиши мүмкүн.

Классикалык көзөмөлдөнгөн 3Б объект аныктоо ыкмалары бул көйгөйдү чоң жана белгиленген маалымат топтомдору менен чечүүгө аракет кылат. Бирок белгилүү бир өнөр жай объектине мүнөздүү жабдуулардын ар түрдүүлүгүнөн улам мындай маалымат топтомдорун түзүү кымбат жана көп убакытты талап кылат. Стандарттуу автономдуу айдоо же ички мейкиндик маалымат топтомдорунда автоунаа, жөө жүргүнчү, отургуч жана үстөл сыяктуу класстар бар болсо, plant room ичиндеги gas/oil burner же атайын electrical kit сыяктуу жабдуулар адатта көрсөтүлбөйт.

Ошондуктан изилдөөнүн негизги суроосу мындай: бар болгон чекит булутун гана колдонуп, объектке мүнөздүү белгиленген моделди окутпастан, өнөр жай активдерин аныктап, аларды кайра 3Б жайгашууга жайгаштырууга болобу?

Бул жерде “zero-shot” так эмнени билдирет?

Изилдөөдө zero-shot түшүнүгү сунушталган система үчүн жаңы өнөр жай объектине мүнөздүү белгиленген окутуу маалымат топтому даярдалбаганын билдирет. GPT-4o жана Grounding DINO сыяктуу алдын ала окутулган foundation моделдери колдонулат.

Демек, система “эч нерсе үйрөнгөн эмес” дегенди билдирбейт. Ал алдын ала чоң маалыматта окутулган моделдерди пайдаланат; нөл болгон нерсе — ушул plant room ичиндеги жабдууларды аныктоо үчүн жүргүзүлгөн domain-specific supervised training процесси.

Мындан тышкары, GPT-4o сүрөттөрдөгү объекттерди изилдөөдө аныкталган алдын ала белгиленген өнөр жай активдеринин сөздүгүнөн издейт. Ошондуктан колдонмо деңгээлиндеги zero-shot мүмкүнчүлүгү алдын ала белгиленген өнөр жай класстары менен foundation model билиминин айкалышы катары түшүнүлүшү керек.

Ыкма эмне үчүн чекит булутун түздөн-түз классификациялабайт?

Изилдөөчүлөрдүн мамилеси күчтүү 2Б vision–language моделдеринин визуалдык түшүнүү мүмкүнчүлүгүн пайдалануу үчүн 3Б чекит булутун ар кандай виртуалдык камералардан алынган 2Б көрүнүш сүрөттөрүнө айландырууга негизделет.

Бул долбоордун логикасы төмөнкүдөй:

  1. Чекит булутуна виртуалдык камералар жайгаштырылат.
  2. Бул камералардан 2Б көрүнүш сүрөттөрү жана depth map-тер render кылынат.
  3. Foundation моделдер сүрөттөрдө кайсы өнөр жай активдери бар экенин аныктайт.
  4. 2Б аныктоолор сүрөттүн depth маалыматы жана камера параметрлери колдонулуп кайра 3Б көрүнүшкө проекцияланат.

Ошондуктан изилдөө “2Б же 3Б” ортосунда тандоо жасабайт; 3Б геометриялык маалыматты 2Б foundation-model визуалдык түшүнүүсү менен бир pipeline ичинде айкалыштырат.

Беш баскычтуу система кантип иштейт?

Макаланын негизги ыкмасы беш негизги баскычтан турат:

  1. Virtual Camera Positioning: Виртуалдык камераларды өнөр жай көрүнүшүнүн ылайыктуу аймактарына жана ар кандай бийиктиктерге жайгаштыруу.
  2. Image Generation: Чекит булутунан ар түрдүү көрүү жана zoom деңгээлдеринде көрүнүш сүрөттөрүн түзүү.
  3. Visual Grounding: GPT-4o менен семантикалык аныктоо жана Grounding DINO менен 2Б bounding box түзүү.
  4. Recognition-Aware Refinement: Жетишсиз көрүнгөн объекттер үчүн камера параметрлерин автоматтык түрдө кайра жөндөө жана сүрөттү кайра render кылуу.
  5. Asset Localisation: 2Б аныктоолорду depth, intrinsics жана extrinsics колдонуп локалдык 3Б координаттарга кайра өткөрүү.

Изилдөөнүн ыкма схемасындагы маанилүү өзгөчөлүк — төртүнчү баскыч бир багыттуу процесс эмес. Таануу сапаты төмөн болсо, камера кайра жөндөлүп, жаңы сүрөттөр түзүлөт. Ошентип, объект детектору өзүнө берилген сүрөт менен гана чектелбестен, система объект жакшыраак көрүнгөн жаңы көрүү позициясын түзүүгө аракет кылат.

Виртуалдык камералар эмне үчүн ар кандай бийиктиктерге жайгаштырылат?

OpenIns3Dнин кең бурчтуу туруктуу көрүнүштөрү жөнөкөй ички мейкиндиктерде жетиштүү болушу мүмкүн; бирок өнөр жай plant room ичинде шыпка жакын көп түтүк линиялары төмөнкү деңгээлдеги жабдууларды жаап калышы мүмкүн. Ошондой эле бийик жабдуу төмөн камералардан гана каралганда толук эмес көрүнүшү мүмкүн.

Ошондуктан сунушталган ыкма камераларды бир гана бийиктикте кармабайт. Жогорку бийиктик чеги көтөрүлүп, бийик жабдуулардын, ал эми төмөнкү чеги өзгөртүлүп, пол деңгээлиндеги жабдуулардын ар кандай бурчтардан көрүнүүсү жогорулатылат.

Бирок изилдөө бул өзгөрмө бийиктик стратегиясынын салымын өзүнчө ablation эксперименти менен өлчөбөйт. Демек, булакта “multi-height камера жайгашуусу өзү эле X AP берди” деген сан жок.

Normal, medium жана close-up zoom эмне үчүн бирге колдонулат?

Өнөр жай көрүнүшүндө резервуар менен кичинекей клапан бирдей физикалык масштабда эмес. Бир гана туруктуу zoom деңгээли колдонулса, же жалпы көрүнүш контексти жоголот, же кичинекей жабдуулардын визуалдык деталдары жетишсиз болуп калат.

Изилдөө бул көйгөйдү:

  • normal,
  • medium,
  • close-up

болгон үч масштабдуу zoom механизми менен чечет. Ошентип, бир эле көрүнүштүн айлана-чөйрөлүк контексти да, кичинекей жабдуулардын деталдары да foundation modelге көрсөтүлөт.

Дубалды алып салуу эмнени билдирет?

Бул жерде физикалык объекттеги дубалды жок кылуу жөнүндө сөз болгон жок. Чекит булуту render кылынганда сырткы чек ара дубалдары белгилүү бир босого колдонулуп, сүрөт түзүүдөн чыгарылат. Максат — сырткы дубалдын артында же ага жакын жайгашкан активдерди виртуалдык камералар көрө алышын камсыз кылуу.

Макаладагы дубалды алып салууга чейинки/кийинки салыштыруулар дубал менен жабылган pump жана tank сыяктуу жабдуулар виртуалдык сүрөттөрдө көбүрөөк көрүнүшү мүмкүн экенин көрсөтөт.

Кайсы көрүнүш сүрөтү “жакшы” экенине кантип чечим чыгарылат?

Алгач render кылынган талапкер сүрөттөр тең деп кабыл алынбайт. Ар бир сүрөт үчүн эки көрсөткүч эсептелет:

  • Edge density: Canny edge detection кийин сүрөттөгү чет пикселдердин үлүшү.
  • Texture variance: боз деңгээлдеги пиксел интенсивдүүлүктөрүнүн дисперсиясы.

Булакта сүрөттүн упайы:

\[ score_i= 0.6\times\text{edge density} + 0.4\times\text{texture variance} \]

деп аныкталат.

Эң жогорку упай алган талапкер сүрөттүн intrinsic камера параметрлери кийинки көрүнүштөрдү түзүүдө кайра колдонулат. Бул жердеги идея — геометриялык жана текстуралык маалыматка байыраак сүрөт жөндөөсүн тандоо.

Depth-based filtering эмне кылат?

Сүрөт визуалдык түрдө түзүлгөн болсо да, анын чоң бөлүгү бош, occluded же жарактуу 3Б бет маалыматына ээ болбошу мүмкүн. Ошондуктан ар бир renderдин depth map-и бааланат.

Көрүнүү катышы:

\[ V= \frac{|D_{\mathrm{valid}}|}{|D|} \]

деп аныкталат. \(D_{\mathrm{valid}}\) жарактуу depth мааниси бар пикселдерди, ал эми \(D\) сүрөттөгү бардык пикселдерди билдирет.

Төмөнкү шартты:

\[ V\geq\sigma \]

аткарган сүрөттөр гана сакталат.

Изилдөөнүн төмөн жана жогорку көрүнүктүүлүк мисалдарында сапаты төмөн көрүнүштөрдүн depth map-теринде майда жана үзүлмө түстүү аймактар гана көрүнсө, жогорку көрүнүктүүлүктө depth картасы тыгызыраак жана үзгүлтүксүз болот. Бул чыпкалоо кийинки 3Б кайра проекциялоонун толук эмес геометриядан таасир алышын азайтууга багытталган.

GPT-4o менен Grounding DINO эмне үчүн бирге колдонулат?

Pipelineдагы эки моделдин милдеттери ар башка.

GPT-4o render кылынган көрүнүш сүрөтүн семантикалык жактан талдайт жана изилдөөдө алдын ала белгиленген өнөр жай активдеринин сөздүгүнөн көрүнгөн объекттерди аныктайт. Ар бир мисал үчүн:

  • актив категориясы,
  • мисалдардын саны,
  • сүрөттөгү болжолдуу жайгашуу,
  • салыштырмалуу өлчөм,
  • көрүнүш жана контекст сүрөттөмөсү

түзөт.

Бул баскычта так bounding box али жок.

Grounding DINO болсо GPT-4o түзгөн табигый тилдеги сүрөттөмөнү visual grounding promptка айландырып, тиешелүү объект үчүн axis-aligned 2Б bounding box түзөт.

Бир класска таандык бир нече объект болгондо promptка жайгашуу жана өлчөм маалыматы кошулуп, мисалдарды бири-биринен айырмалоо максат кылынат.

Эмне үчүн Grounding DINO жалгыз жетиштүү деп эсептелген эмес?

Изилдөөнүн сапаттык салыштыруусунда ODISE жана YOLO-World татаал өнөр жай активдеринин олуттуу бөлүгүн өткөрүп жиберген. Grounding DINO жакшыраак локалдаштыруу бергенине карабастан, айрым атайын жабдуу класстарында жалгыз колдонулганда чектелүү болгон.

2-сүрөттө айрыкча үчүнчү мисалдагы gas oil burner жана control panel GPT-4o + Grounding DINO айкалышы тарабынан аныкталган, башка салыштырылган моделдер болсо аларды өткөрүп жиберген. Pump классынын ар башка көрүнүштөрдө кайра аныкталышы да сунушталган айкалыш көрүнүш контекстинен пайдалана алган мисалдардын бири.

Recognition-aware viewpoint refinement эмне үчүн керек?

Көп сандагы камера жана zoom деңгээлин түзүү да ар бир объект жакшы көрүнөрүн кепилдебейт. Объект:

  • сүрөттө өтө кичине болуп калышы мүмкүн,
  • четинде кесилип калышы мүмкүн,
  • башка объекттер менен жабылышы мүмкүн,
  • ылайыксыз бурчтан көрүнүшү мүмкүн.

Изилдөөнүн айырмасы — ушул кемчиликтерди өлчөп, камерага кайра байланыш катары берүүдө.

Объекттин сүрөттөгү өлчөмү кантип өлчөнөт?

Булакта projected area ratio үчүн төмөнкү туюнтма басылган:

\[ A_i= \frac{ (x_2-x_1)-(y_2-y_1) }{ W\cdot H }. \]

\((x_1,y_1,x_2,y_2)\) bounding box координаттарын, \(W,H\) сүрөттүн туурасын жана бийиктигин билдирет.

Булакка берилгендик жөнүндө эскертүү: Макала муну “projected area ratio” деп аныктаганы менен, туурасы менен бийиктигин көбөйтүүнүн ордуна алардын ортосунда кемитүү белгисин басат. Verianla тексти формуланы стандарттуу тик төрт бурчтуктун аянт формуласына унчукпай өзгөртпөйт; булактагы көрсөтүлүшү так сакталат.

Объекттин кадрдан чыгып кетиши кантип текшерилет?

Truncation indicator:

\[ T_i= \begin{cases} 1, & x_1\leq\delta \ \text{veya}\ y_1\leq\delta \ \text{veya}\ x_2\geq W-\delta \ \text{veya}\ y_2\geq H-\delta,\\ 0, & \text{aksi durumda} \end{cases} \]

деп аныкталат.

Объекттин bounding box-у сүрөттүн четтерине белгиленген \(\delta\) маржасынан да жакындаса, көрүнүш “truncated” деп белгиленет.

View suitability упайы кантип эсептелет?

Объект масштабы жана truncation бирге:

\[ J_{\mathrm{view},i} = \beta\ln(1+A_i)-\gamma T_i \]

туюнтмасына айландырылат.

Чоңураак жана толугу менен сүрөттүн ичине баткан объект жогорку ылайыктуулук упайын берет, ал эми кадрдан чыгып кеткен объект жазаланат.

Тыгыз көрүнүштөрдө бири-бирине кабатталган кутулар кантип эске алынат?

Бир көрүнүштөгү bounding box жуптарынын IoU маанилери эсептелип, белгилүү:

\[ \tau_{\mathrm{IoU}} \]

босогосунан жогору болгон жуптардын үлүшүнөн clutter score \(C_v\) алынат.

Жогорку \(C_v\) көп объект сүрөттө бири-бирине кабатталганын жана көрүнүш grounding үчүн ылайыксыз болушу мүмкүн экенин көрсөтөт.

Камераны кайра жөндөө качан ишке кирет?

Булакка ылайык:

  • \(A_i<\tau_A\): объект өтө кичине → zoom-in же камера аралыкты азайт.
  • \(T_i=1\): объект кадрдан чыгып жатат → field of view кеңейт же камераны жылдыр.
  • \(J_{\mathrm{view},i}<\tau_J\): көрүү бурчу жетишсиз → yaw/pitch өзгөрт.
  • \(C_v>\tau_C\): көрүнүш өтө тыгыз → бийиктикти же камера багытын өзгөрт.

Артыкчылык дагы:

\[ S_i= w_1\max(0,\tau_A-A_i) + w_2\max(0,\tau_J-J_{\mathrm{view},i}) + w_3T_i \]

severity score аркылуу аныкталат.

Field of view жана камера позасы кантип өзгөртүлөт?

Булакта фокустук аралыкты жаңыртуу:

\[ f'_x= f_z \left( 1-\frac{\Delta FOV}{100} \right), \qquad f'_y= f_y \left( 1-\frac{\Delta FOV}{100} \right) \]

деп басылган.

Бирок андан кийинки текстте баштапкы focal lengthтер:

\[ f_x,\;f_y \]

деп аныкталып, \(f_z\) түшүндүрүлбөйт. Ошондуктан \(f'_x\) теңдемесиндеги \(f_z\) булак ичиндеги нотациялык дал келбестик же типографиялык ката болушу мүмкүн. Булакта жок түзөтүү жасалган эмес.

Камеранын багыты:

\[ P'= P\cdot R_{\mathrm{yaw}}(\theta) \cdot R_{\mathrm{pitch}}(\phi) \]

аркылуу өзгөртүлөт, ал эми радиалдык камера кыймылы:

\[ p'_{\mathrm{cam}} = p_{\mathrm{scene}} + (1+\Delta r) \frac{ p_{\mathrm{cam}}-p_{\mathrm{scene}} }{ \|p_{\mathrm{cam}}-p_{\mathrm{scene}}\| } \]

түрүндө берилет.

2Б bounding box кайра 3Б жайгашууга кантип айланат?

Visual grounding объектти сүрөттөн табат; бирок санарип эгиз үчүн объекттин завод координатасында кайда турганы керек.

Сүрөт пиксели:

\[ (u,v) \]

жана ага туура келген depth:

\[ d \]

белгилүү болгондо камера координатасы:

\[ P_C= K^{-1} [u,v,1]^T d \]

аркылуу эсептелет.

Андан кийин камеранын extrinsic параметрлери колдонулуп:

\[ P_L= R P_C+t \]

трансформациясы колдонулат.

Бул жерде \(P_L\) — объекттин локалдык plant coordinate system ичиндеги 3Б жайгашуусу.

Бул ыкма 3Б CAD моделин толугу менен алмаштырабы?

Жок. Изилдөөнүн талкуу бөлүмү муну ачык чектейт. Сунушталган ыкма high-precision geometric reconstruction максаты үчүн иштелип чыккан эмес.

Максатталган колдонуу мисалдары:

  • asset inventory түзүү,
  • brownfield санарип эгизин баштоо үчүн негизги мейкиндик катмарын түзүү,
  • inspection planning,
  • remote monitoring,
  • активдердин болжолдуу мейкиндиктик мамилелерин аныктоо

сыяктуу милдеттер.

Демек, алынган координаттарды өндүрүштүк толеранс же так reverse engineering өлчөөсү катары түшүндүрүү булак тарабынан колдоого алынбайт.

Түркия үчүн бул эмнени билдирет?

Ыкма актуалдуу BIM/CAD модели жетишпеген brownfield объекттерин өзгөчө көздөгөндүктөн, Түркиядагы узак убакыттан бери иштеп келе жаткан өндүрүш объекттери, энергетикалык объекттер же татаал механикалык бөлмөлөр үчүн изилдөөгө арзый турган ыкманы сунуштай алат. Бирок изилдөө Мельбурндагы бир гана plant room ичинде жүргүзүлгөн.

Түркиядагы объект үчүн ошол эле AP же жайгашуу катасы маанилери алынат деп айтууга болбойт. Жергиликтүү текшерүүдө чекит булутунун тыгыздыгы, сканерлөө сапаты, объекттеги актив класстары, түтүк системасынын тыгыздыгы, майда компоненттердин өлчөмү жана foundation model тиешелүү жабдуу терминологиясын тааныйбы же жокпу өзүнчө текшерилиши керек.

Изилдөө колдогон жыйынтыктар

  • Бир гана өнөр жай чекит булутунан, объектке мүнөздүү белгиленген окутуу маалымат топтомун даярдабастан, 3Б активдерди аныктоо жана болжолдуу локалдаштыруу ушул эксперименттик чөйрөдө мүмкүн экенин көрсөтөт.
  • Сунушталган толук pipeline ошол эле салыштырууда OpenIns3D баштапкы вариантынан жогорку AP25 жана AP50 көрсөткөн.
  • Дубалды алып салуу, multiple zoom жана recognition-aware refinement баскычтарын кумулятивдүү кошуу көрсөткүчтү этап-этабы менен жогорулаткан.
  • GPT-4o + Grounding DINO айкалышы каралган өнөр жай сүрөттөрүндө сыналган башка visual grounding варианттарына караганда жакшыраак сапаттык аныктоолорду көрсөткөн.
  • Recognition-aware refinement кошулушу 2-таблицадагы эң чоң акыркы AP өсүшүн берген.
  • 11 активди локалдык координаттар системасына кайра проекциялоонун натыйжасында 0,105–0,312 m аралыгында жеке 3Б локалдаштыруу каталары билдирилген.
  • ±%10 параметр сезгичтик анализинде колдонулган бардык perturbationдар AP25ти төмөндөткөн; айрыкча \(\tau_J\) босогосу эң жогорку сезгичтикти көрсөткөн.

Изилдөө колдобогон же текшербеген жыйынтыктар

  • Бардык өнөр жай объекттеринде бирдей көрсөткүч көрсөтөрү текшерилген эмес.
  • Ар башка өлкөлөрдө, өнөр жай тармактарында же сканер системаларында cross-site generalisation эксперименти жүргүзүлгөн эмес.
  • Жогорку тактыктагы CAD/reverse-engineering сапатындагы геометриялык кайра куруу көрсөтүлгөн эмес.
  • “Zero-shot” натыйжалар foundation models жок алынган эмес; объектке мүнөздүү жаңы supervised training жүргүзүлгөн эмес.
  • Ар кандай толугу менен белгисиз актив категориясы чексиз түрдө табылары көрсөтүлгөн эмес; GPT-4o баскычында алдын ала белгиленген өнөр жай активдеринин сөздүгү колдонулат.
  • AP айырмаларынын статистикалык маанилүүлүгү үчүн кайталанма эксперимент, confidence interval же гипотеза тести берилген эмес.
  • Variable-height camera positioning таасири башка жакшыртуулардан өзүнчө ablation сабында өлчөнгөн эмес.
  • Point-cloud downsampling таасири сандык түрдө текшерилген эмес.
  • Prompt варианттарынын көрсөткүчкө таасири системалуу robustness эксперименти менен өлчөнгөн эмес.

Изилдөөнүн Ыкмасы жана Жыйынтыктары

Эксперименттик чөйрө

Баалоо Мельбурндагы имараттын ичинде жайгашкан татаал plant room ичинде жүргүзүлгөн.

Эксперимент компонентиБулакта берилген маалымат
3Б сканерLeica BLK360
Жалпы чекит саны271.348.287
Чекит булутун иштетүүCloudCompare v2.13.2
GPU2 × NVIDIA L40, ар бири 48 GB VRAM
CPU ресурсу16 vCPU
Система эс тутуму241 GB
Иштетүү системасыUbuntu 20.04
Foundation modelGPT-4o, gpt-4o-2024-11-20
2Б groundingGrounding DINO

OpenIns3D менен толук системанын натыйжалары

АктивOpenIns3D AP25Сунушталган AP25OpenIns3D AP50Сунушталган AP50
Орточо35,8448,1326,8934,98
Cabinet44,658,340,242,8
Control Panel52,365,443,349,2
Electrical Kit18,335,17,820,3
Gas/Oil Burner041,3024,4
Ladder74,376,150,951,2
Pump16,121,36,415,9
Tank78,880,468,169,8
Valve33,436,427,629,1
Duct7,310,706,2
Fire Extinguisher33,356,324,640,9

Эң көрүнүктүү айырма gas/oil burner классында байкалат. OpenIns3D баштапкы варианты AP25 жана AP50 боюнча 0 көрсөткөн, ал эми сунушталган framework тиешелүүлүгүнө жараша 41,3 жана 24,4 маанилерине жеткен.

Electrical kit үчүн AP25 18,3төн 35,1ге, AP50 7,8ден 20,3кө; fire extinguisher үчүн AP25 33,3төн 56,3кө жана AP50 24,6дан 40,9га жогорулаган.

Бирок ар бир класста бирдей өлчөмдө өсүш болбойт. Мисалы, tank жана ladder баштапкы ыкмада эле күчтүү класстар болгон жана алардын өсүшү чектелүүрөөк. Бул системанын негизги артыкчылыгы айрыкча татаал, кичинекей, жашырынган же foundation model үчүн кыйыныраак активдерде көрүнүшү мүмкүн экенин көрсөтөт; бирок бул түшүндүрмө ушул тест талаасына гана тиешелүү.

Этаптык жакшыртуулардын таасири

Verianla Live: Көрүнүш түзүү жана refinement баскычтарынын AP көрсөткүчүнө таасири

График ошол эле изилдөөдө жана ошол эле баалоо протоколунда баштапкы OpenIns3D системасына кошулган жакшыртуулардын кумулятивдүү AP25 жана AP50 натыйжаларын көрсөтөт.

КонфигурацияAP25AP50
OpenIns3D баштапкы варианты35,8426,89
+ Дубалды алып салуу38,2227,10
+ Multiple zoom + дубалды алып салуу42,6328,82
+ Multiple zoom + дубалды алып салуу + recognition-aware refinement48,1334,98
 

Verianla Live: Булактагы изилдөөнүн 2-таблица маалыматтары колдонулган. Маанилер кумулятивдүү конфигурацияларды көрсөтөт; ар бир компоненттин көз карандысыз маржиналдык таасири катары чечмеленбеши керек.

Дубалды алып салуу баштапкы AP25 маанисин 35,84төн 38,22ге жогорулаткан, ал эми AP50 болгону 26,89дан 27,10го көтөрүлгөн.

Multiple zoom кошулганда AP25 42,63, AP50 28,82 болгон.

Акыркы recognition-aware refinement баскычы менен AP25:

\[ 42{,}63\rightarrow48{,}13 \]

жана AP50:

\[ 28{,}82\rightarrow34{,}98 \]

деңгээлине чыккан.

2-таблица баштапкыдан акыркыга чейинки жалпы айырманы AP25 үчүн 12,29, AP50 үчүн 8,09 деп берет. Бул баштапкы жана акыркы AP маанилеринин арифметикалык айырмасы.

Recognition-aware refinement параметрлери канчалык сезгич?

Булактын негизги параметр топтому:

ПараметрДемейки маани
\(\delta\)10 px
\(\beta\)1,0
\(\gamma\)0,3
\(\tau_A\)0,01
\(\tau_J\)0,1
\(\tau_{\mathrm{IoU}}\)0,3
\(\tau_C\)0,15

Ар бир параметр өзүнчө ±%10 өзгөртүлгөндө маалымдалган AP25 айырмалары төмөнкүдөй:

Параметр−%10 үчүн ΔAP25+%10 үчүн ΔAP25
Image boundary margin \(\delta\)−0,09−0,11
Area contribution weight \(\beta\)−0,10−0,14
Truncation penalty \(\gamma\)−0,09−0,12
Minimum projected area \(\tau_A\)−0,10−0,11
View suitability threshold \(\tau_J\)−0,65−0,55
IoU overlap threshold \(\tau_{\mathrm{IoU}}\)−0,06−0,08
View clutter threshold \(\tau_C\)−0,05−0,06

Бардык perturbationдардын терс болушу авторлор тандаган негизги конфигурация ушул локалдык диапазондо сыналган эң жакшы чекит болгонун көрсөтөт. Эң көрүнүктүү сезгичтик:

\[ \tau_J \]

view suitability threshold үчүн байкалат. Ал эми clutter моделин аныктаган \(\tau_{\mathrm{IoU}}\) жана \(\tau_C\) өзгөрүүлөрү азыраак таасир көрсөткөн.

3Б локалдаштыруу каталары кандай деңгээлде?

Изилдөө локалдаштырылган 11 актив үчүн ground-truth координаты менен аныкталган жайгашуунун ортосундагы 3Б Евклиддик аралыкты өз-өзүнчө берет:

Актив ID3Б абсолюттук локалдаштыруу катасы (m)
10,180
20,121
30,122
40,202
50,162
60,227
70,312
80,135
90,114
100,105
110,174

Маалымдалган эң төмөн ката 0,105 m, эң жогорку ката 0,312 m. Булак бул таблица үчүн өзүнчө орточо локалдаштыруу ката метрикасын бербейт; натыйжаларды ар бир актив боюнча көрсөтөт.

Авторлор бул тактык деңгээлин так геометриялык reverse engineering үчүн эмес, кең масштабдагы эксплуатация жана тейлөө колдонмолорунда активдин бар-жогун, болжолдуу геометриялык камтуусун жана мейкиндиктик мамилелерин аныктоо үчүн жетиштүү деп эсептешет.

Point cloud тыгыздыгы эмне үчүн дагы деле маанилүү?

Zero-shot foundation model колдонулушу кирүүчү геометриянын сапатын маанисиз кылбайт. Булак point-cloud fidelity аныктоо көрсөткүчүнө түз таасир этиши мүмкүн экенин белгилейт.

Moderate down-sampling эсептөө чыгымын азайтышы мүмкүн деген сапаттык байкоолор бар, бирок ашыкча point reduction майда valve жана duct сыяктуу объекттердин назик геометриясын жоготушу мүмкүн.

Бирок изилдөө down-sampling катышы менен AP же локалдаштыруу катасынын ортосунда сандык эксперимент бербейт.

Эсептөө чыгымы канчалык маанилүү?

271 миллиондон ашык чекити бар чоң көрүнүштөрдөн жогорку чечилиште көп сандагы виртуалдык сүрөттөрдү түзүү эсептөө жагынан кымбат. Изилдөөчүлөр чоң point cloud-тарды кичирээк аймактарга бөлүп, жүктү азайтууну сунушташат.

Мунун да баасы бар: бөлүү чектериндеги геометриялык контекст жана мейкиндиктик маалымат жоголушу мүмкүн. Ошондуктан масштабдуулук GPU кошуу менен эле чектелбейт, көрүнүштү кантип бөлүү маселесин да чечүүнү талап кылат.

Prompt engineering эмне үчүн чектөө болуп саналат?

GPT-4o жана Grounding DINO-го жөнөтүлгөн promptтагы сөз тандоо, деталдуулук деңгээли жана билдирүү формасы натыйжаларды өзгөртө алат. Булак prompt engineeringди ачык чектөө катары көрсөтөт.

Келечектеги изилдөөлөрдүн сунуштарынын бири — retrieval-augmented generation колдонуп, актив тууралуу маалыматты тышкы knowledge baseден алып, promptту контекстке жараша автоматтык түрдө байытуу.

Изилдөөнүн келечектеги багыттары

Макала үч негизги багытты баса белгилейт:

  1. Spatial zoning: IFC маалымат моделдери жана knowledge graph колдонуп, чоң өнөр жай чекит булуттарын маанилүү мейкиндик зоналарына бөлүү.
  2. Adaptive image rendering: Кичинекей valve/flange сыяктуу активдерде жогорку сапат, чоң активдерде үнөмдүү rendering колдонуу.
  3. RAG колдоосу бар prompt engineering: Өнөр жай активдери тууралуу билимди retrieval аркылуу promptка динамикалык кошуу.

Эң маанилүү методологиялык чектөөлөр

  • Баалоо бир гана өнөр жай plant room ичинде жүргүзүлгөн.
  • Актив жана чөйрө ар түрдүүлүгүнүн башка объекттерге өткөрүлүшү эксперименттик түрдө көрсөтүлгөн эмес.
  • Чаң, нымдуулук, жарыктандыруу, sensor noise жана occlusion сыяктуу ар кандай талаа шарттары point-cloud сапатын өзгөртө алат.
  • Чоң point cloud rendering жогорку эсептөө чыгымына ээ.
  • Point-cloud сегментациясы аймак чектеринде маалымат жоготуусуна алып келиши мүмкүн.
  • Кичинекей жана атайын өнөр жай жабдууларын аныктоо дагы деле кыйын.
  • Prompt engineering натыйжага олуттуу таасир этет.
  • Down-sampling таасири сандык түрдө өлчөнгөн эмес.
  • AP айырмалары үчүн uncertainty же статистикалык маанилүүлүк анализи берилген эмес.

Булак жана Ыкма Жөнүндө Эскертүү

Толук оригиналдуу изилдөө аталышы: Zero-Shot 3D Asset Detection and Localisation Through Visual Grounding in Industrial Point Clouds

Авторлор: Masoud Kamali; Behnam Atazadeh; Abbas Rajabifard; Yiqun Chen.

Тең биринчи/тең салым: Булакта тең биринчи автор же тең салым тууралуу билдирүү жок.

Жооптуу автор: Behnam Atazadeh.

Мекеме: The Centre for Spatial Data Infrastructures and Land Administration, Department of Infrastructure Engineering, The University of Melbourne, Melbourne, Victoria, Australia.

Булактын түрү: Рецензияланган оригиналдуу изилдөө макаласы; компьютердик көрүү, 3Б көрүнүштү түшүнүү жана өнөр жай активдерин локалдаштыруу боюнча изилдөө.

Журнал: AI.

Басма: MDPI, Basel, Швейцария.

Библиографиялык жазуу: AI, 2026, Том 7, Сан 6, Макала 205.

DOI: 10.3390/ai7060205.

Келип түшкөн / ревизия / кабыл алынган / жарыяланган: 2 Март 2026 / 18 Май 2026 / 26 Май 2026 / 5 Июнь 2026.

Рецензия статусу: Рецензияланган журналдык басылма.

Лицензия: Creative Commons Attribution (CC BY).

Academic Editors: Miguel Angel Cazorla; Emanuele Frontoni.

Негизги изилдөө көйгөйү: Белгиленген өнөр жай окутуу маалымат топтому же актуалдуу CAD модели жок татаал өнөр жай чөйрөлөрүндө point cloud маалыматын гана колдонуп zero-shot актив аныктоо жана болжолдуу 3Б локалдаштыруу.

Кирүүчү маалымат: Leica BLK360 менен алынган 271.348.287 чекиттен турган өнөр жай point cloud-у.

Негизги ыкма: Virtual camera positioning → image generation → GPT-4o semantic interpretation → Grounding DINO visual grounding → recognition-aware camera refinement → depth/intrinsic/extrinsic негизиндеги 3Б asset localisation.

Foundation model: GPT-4o, булакта `gpt-4o-2024-11-20` версия белгиси менен көрсөтүлгөн.

Visual grounding модели: Grounding DINO.

Baseline: OpenIns3D; көзөмөлдөнгөн салыштырууда GPT-4o + Grounding DINO visual grounding конфигурациясы baseline жана сунушталган ыкмада бирдей колдонулган.

Негизги detection натыйжасы: Орточо AP25 35,84төн 48,13кө, AP50 26,89дан 34,98ге жогорулаган.

Incremental натыйжа: OpenIns3D → wall removal → multiple zoom + wall removal → recognition-aware refinement иретинде AP25 35,84 → 38,22 → 42,63 → 48,13 жана AP50 26,89 → 27,10 → 28,82 → 34,98.

Локалдаштыруу баалоосу: Ground-truthка салыштырмалуу 11 активдин 3Б Евклиддик жайгашуу каталары өз-өзүнчө берилип, 0,105–0,312 m аралыгында болгон.

Параметр сезгичтиги: Recognition-aware refinement параметрлери ±%10 өзгөртүлгөн; бардык perturbationдар AP25те төмөндөө жараткан жана эң сезгич параметр \(\tau_J\) view suitability threshold болгон.

Жабдык: 2 × NVIDIA L40 48 GB VRAM; 16 vCPU; 241 GB RAM.

Иштетүү системасы: Ubuntu 20.04.

Point-cloud программасы: CloudCompare v2.13.2.

Каржылоо: Australian Research Council, IH210100048 жана DE220100094 номерлүү гранттар.

Маалымат жеткиликтүүлүгү: Изилдөөдө колдонулган маалыматтар кеңири жана уланып жаткан изилдөө/өнүктүрүү долбооруна байланыштуу жооптуу автордон негиздүү суроо-талап менен алынышы мүмкүн экени билдирилген.

Этикалык комитет: Колдонулбайт.

Маалымдалган макулдук: Колдонулбайт.

Кызыкчылыктардын кагылышы: Авторлор кызыкчылыктардын кагылышы жок экенин билдиришкен.

Ыраазычылык: University of Melbourne Research Computing Services жана Petascale Campus Initiative колдоосунан тышкары Emerson жана Rockfield өнөр жай өнөктөштөрүнүн колдоосу белгиленген; авторлор макаладагы көз караштар өздөрүнө таандык экенин да өзүнчө билдиришкен.

Авторлордун салымдары: Концептуалдаштыруу M.K. жана B.A.; методология M.K., B.A. жана Y.C.; программалык камсыздоо M.K.; валидация M.K. жана B.A.; формалдык анализ M.K.; изилдөө M.K., B.A. жана Y.C.; ресурстар M.K., B.A. жана Y.C.; маалыматтарды курациялоо M.K.; алгачкы долбоор M.K.; карап чыгуу жана редакциялоо бардык авторлор; визуалдаштыруу M.K.; жетекчилик B.A., A.R. жана Y.C.; долбоорду башкаруу A.R. жана Y.C.; каржылоону алуу B.A. жана A.R. тарабынан аткарылган.

Булактагы формула жана отчеттуулук эскертүүлөрү

Recognition-aware refinement бөлүмүндөгү projected-area формуласы булакта:

\[ A_i= \frac{(x_2-x_1)-(y_2-y_1)}{W H} \]

деп жазылган. “Аянт катышы” түшүндүрмөсү менен математикалык туюнтманын ортосунда мүмкүн болгон дал келбестик бар; Verianla текстинде ал стандарттуу bounding-box аянт формуласына унчукпай өзгөртүлгөн эмес.

Ошондой эле field-of-view жаңыртуусунда \(f'_x\) үчүн \(f_z\) колдонулган, бирок түшүндүрмө \(f_x,f_y\) маанилерин баштапкы focal lengthтер деп аныктайт. Булак \(f_z\) маанисин бул контекстте түшүндүрбөйт.

2-таблица баштапкы жана акыркы ыкманын ортосундагы AP25 айырмасын 12,29 деп көрсөтөт. Натыйжалар бөлүмүндөгү “%12,29” туюнтмасы бул арифметикалык AP айырмасын пайыз белгиси менен жазат. Ошондуктан бул жерде “12,29 AP упайы” менен “%12,29 салыштырмалуу жакшыртуу” бир эле нерсе катары колдонулган эмес.

Булактын аннотациясындагы “significantly outperforming” деген сөз айкашына карабастан, салыштыруу үчүн кайталанма баалоо белгисиздиги, confidence interval же формалдуу статистикалык significance тести берилбейт. Verianla баяны көрсөткүч айырмасын сандык маанилери менен берет; статистикалык маанилүүлүк жыйынтыгын кошпойт.

Илимий түшүндүрмөнүн чеги

Бул изилдөөнүн негизги жетишкендиги — бир гана татаал plant room ичиндеги point cloud маалыматтарын foundation models жана адаптивдүү виртуалдык камера түзүү менен айкалыштырып, белгиленген domain-specific окутууну талап кылбастан жогорку аныктоо көрсөткүчүн жана колдонууга жарамдуу болжолдуу 3Б локалдаштырууну көрсөткөнү.

Ошентсе да, натыйжа бир объекттеги текшерүүгө негизделет. Өнөр жай активдеринин геометриясы, сенсор ызы-чуусу, сканерлөө тыгыздыгы, occlusion түзүмү жана foundation modelдин актив терминологиясын таануу мүмкүнчүлүгү башка чөйрөлөрдө башкача болот.

Ошондуктан AP25 48,13 жана AP50 34,98 маанилери “өнөр жай объекттериндеги жалпы ийгилик пайызы” катары эмес, ушул изилдөө аныктаган тест талаасына, актив класстарына, point cloud жана баалоо протоколуна тиешелүү моделдин көрсөткүчү катары окулушу керек.

Ошол сыяктуу 0,105–0,312 m локалдаштыруу каталары да жогорку тактыктагы survey/CAD тактыгынын кепилдиги эмес. Булак ыкманы asset inventory, digital-twin initialisation жана inspection planning сыяктуу болжолдуу мейкиндиктик жайгашуу операциялык баалуулукка ээ болгон колдонмолорго ачык түрдө багыттайт.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты