Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Муҳандисӣ / Чаҳорчӯбаи муттаҳидаи ронандагии автономии шарҳпазир тавассути интихоби саҳна бо cross-attention ва ҳамгироии семантикӣ–объектӣ
Муҳандисӣ

Чаҳорчӯбаи муттаҳидаи ронандагии автономии шарҳпазир тавассути интихоби саҳна бо cross-attention ва ҳамгироии семантикӣ–объектӣ

Ин таҳқиқот ҳадаф дорад, ки модели ронандагии автономӣ на танҳо қарорҳои рафториро тавлид кунад, балки аз ҳамон намоиши визуалӣ сабабҳои бо ин қарорҳо вобаста ва барои инсон тафсиршавандаро низ пешгӯӣ намояд.

11/08/2026  Veri Anla 11 боздид
Чаҳорчӯбаи муттаҳидаи ронандагии автономии шарҳпазир тавассути интихоби саҳна бо cross-attention ва ҳамгироии семантикӣ–объектӣ

Ин таҳқиқот ҳадаф дорад, ки модели ронандагии автономӣ на танҳо қарорҳои рафторӣ ба монанди “ба пеш ҳаракат кун”, “ист”, “ба чап гард” ё “ба рост гард”-ро тавлид кунад, балки аз ҳамон намоиши визуалӣ сабабҳои бо ин қарорҳо вобаста ва барои инсон тафсиршавандаро низ пешгӯӣ намояд. Системае, ки CrossAD ном дорад, кодгузори муштараки визуалии асосёфта ба Swin Transformer-ро бо Object Selection Module (OSM), ки маънои сатҳи саҳнаро мебарорад, Object-Token Extractor (OTE), ки токенҳои маҳаллии объектии мустақил аз синфро нигоҳ медорад, ва модули Semantic–Object Fusion (SOF), ки ин ду навъи иттилоъро муттаҳид мекунад, якҷо месозад. Дар benchmark-и BDD-OIA, CrossAD дар бахши тафсир бо \(F1_m=0,417\) ва \(F1_{all}=0,584\) баландтарин қиматҳоро миёни усулҳои муқоисашуда гузориш кардааст; дар nu-AD бошад барои рафтор \(0,848/0,887\) ва барои тафсир \(0,909/0,919\) ба даст овардааст. Бо вуҷуди ин, натиҷаҳо арзёбиҳои офлайнии benchmark мебошанд; система аз ҷиҳати амнияти ронандагии closed-loop ё кори саҳроӣ дар мошини воқеӣ тасдиқ нашудааст.

Ғояи асосии меъмории CrossAD ин аст, ки иттилои “саҳна дар маҷмӯъ чӣ мегӯяд” ва “кадом объект ё минтақаи мушаххаси маҳаллӣ метавонад ба қарор таъсир расонад” пеш аз омехта шудан дар як намояндагӣ алоҳида нигоҳ дошта шаванд. OSM бо фарзияи он ки ҳамаи токенҳои визуалии тасвири роҳ яксон муҳим нестанд, онҳоро хол медиҳад ва зермаҷмӯи аз ҳама иттилоотиро тавассути cross-attention ба як вектори семантикии сатҳи саҳна табдил медиҳад. OTE бошад аз ҳамон пайдарпаии токенҳои Swin-T бо истифода аз холдиҳандаи ҷудогона ҳашт токени маҳаллиро интихоб мекунад. Барои он ки ин токенҳо ба объектҳои маънодор ба монанди чароғаки роҳ, мошини пеш ё дучархасавор мувофиқат кунанд, bounding box ё нишони сегментатсия дода намешавад; интихоб аз ҳадафи муштараки омӯзиши вазифаҳои рафтор ва тафсир омӯхта мешавад.

Гарчанде шохаҳои рафтор ва шарҳ дар система як вурудро истифода мебаранд, дар марҳилаи қарори ниҳоӣ як вектори хусусиятро намехонанд. Сарлавҳаи рафтор намояндагии муттаҳидшудаи вектори семантикии аз OSM омада ва токенҳои маҳаллии аз OTE омадаро тавассути cross-attention истифода мебарад. Сарлавҳаи тафсир бошад тавассути skip connection мустақиман вектори семантикии сатҳи саҳнаи OSM-ро истифода мекунад. Муҳаққиқон ин роҳнамоии асимметриро ба идеяе асос мекунанд, ки қарори рафтор метавонад аз объектҳои мушаххаси маҳаллӣ, аммо нишонаҳои шарҳ аз ҳолати умумитари саҳна дар сатҳҳои гуногун истифода баранд.

Дар истифодаи шашкамераи nu-AD танҳо якҷо кардани камераҳо кофӣ нест. Дар аблатсияи таҳқиқот миёнагирии токенҳои шаш камера бе нигоҳ доштани шахсияти камера ҳатто аз истифодаи як камераи пеш натиҷаи пасттар додааст. Муаллифон инро бо он вобаста медонанд, ки шабака дидгоҳҳои фазоӣ монанд, вале маъноӣ фарқкунанда, ба монанди пеш-чап ва ақиб-чапро фарқ карда наметавонад. Аз ин рӯ, ба ҳар камера танҳо вектори шахсияти омӯзишшавандаи 768-андоза илова шудааст; барои шаш камера бори иловагӣ ҳамагӣ 4608 параметр будааст.

Дар бахши шарҳи забони табиӣ як маҳдудияти муҳим вуҷуд дорад. TinyLlama-1.1B, ки бо LoRA мутобиқ карда шудааст, тасвири хоми камераро мустақим намехонад ва озодона асос намесозад. Модел бо нишонаҳои рафтор ва тафсире, ки қаблан аз ҷониби CrossAD пешгӯӣ шудаанд, шартӣ мешавад. Пас, таҳқиқот месанҷад, ки ҷумлаи тавлидшуда бо баромади сохторёфтаи қарор то чӣ андоза мувофиқ аст; он нишон намедиҳад, ки модели забонӣ сабаби визуалии қарорро ба таври сабабӣ кашф кардааст.

Аз нуқтаи назари Туркия, таҳқиқот намунаи меъмориест, ки нишон медиҳад дар таҳқиқоти мошини автономӣ метавон на танҳо ба дақиқии қарор, балки ба он ки модел кадом ҳолати саҳнаро ҳамчун асоси қарор гузориш мекунад, ҳамчун баромади ҷудогона нигоҳ кард. Аммо аз таҳқиқоти мавҷуда баровардан мумкин нест, ки ин натиҷаҳои benchmark барои геометрияи роҳ, аломатҳои ҳаракат, рафтори ронандагон, шароити обу ҳаво ё тарҳи сенсорҳои мошини воқеӣ дар Туркия эътибор доранд. Барои чунин истифода омӯзиши дубора дар додаҳои маҳаллӣ, тасдиқи мустақил ва озмоишҳои мошини воқеӣ лозиманд.

CrossAD кадом мушкилро ҳал кардан мехоҳад?

Дар ронандагии автономӣ дуруст пешгӯӣ шудани амали модел худ аз худ нишон намедиҳад, ки чаро модел он қарорро гирифтааст. Мушкилоти таҳқиқот ҳамин ҷудоӣ аст: оё як модел метавонад ҳам рафтори ронандагӣ ва ҳам сабабҳои саҳнавии барои инсон фаҳмоеро, ки бо ин рафтор вобастаанд, якҷо тавлид кунад?

Муҳаққиқон аз маҳдудияти се равиши маъмул оғоз мекунанд. Аввал, дар системаҳои бисёрмарҳилае, ки пеш аз ҳама object detection ё segmentation мекунанд ва баъдан ин баромадро ба забони табиӣ табдил медиҳанд, хатогиҳои барвақти дарк метавонанд ба шарҳи баъдӣ интиқол ёбанд. Дуюм, харитаҳои аҳамияти пас аз коркард, ба монанди Grad-CAM, метавонанд нишон диҳанд, ки як минтақаи пикселӣ муҳим аст, вале “чаро муҳим” будани онро бо ҷумлаи семантикӣ шарҳ надиҳанд. Сеюм, вақте қарор ва шарҳ аз шабакаҳои ҷудогона меоянд, кафолат нест, ки шарҳ ба ҳамон далеле такя мекунад, ки дар қарори рафтор истифода шудааст.

CrossAD бинобар ин пешгӯии рафтор ва нишонаҳои тафсирро аз кодгузори муштараки визуалии Swin-T тавлид мекунад.

Модел кадом рафторҳоро пешгӯӣ мекунад?

Ҳар ду benchmark чор нишонаи рафторро истифода мекунанд:

  • Forward — ҳаракат ба пеш,
  • Stop — истодан ё сустшавӣ,
  • Left — гардиш ба чап,
  • Right — гардиш ба рост.

Ин вазифа таснифоти классикии яксинфӣ нест. Азбаски дар як саҳна якчанд нишонаи рафтор ҳамзамон фаъол шуда метавонанд, дар ҳар ду сарлавҳаи рафтор ва тафсир activation-и sigmoid истифода шудааст.

Дар BDD-OIA инчунин 21 нишонаи тафсир ва дар nu-AD 8 нишонаи тафсир мавҷуд аст. BDD-OIA бештар ба сабабҳои консептуалӣ, ба мисли аломати ҳаракат, хатти роҳ ё монеа; nu-AD бошад ба шарҳҳои фазоӣ, аз ҷумла кушодагии минтақаҳои пеш, пеш-чап, ақиб-чап ва ҳолати чароғаки роҳ тамаркуз мекунад.

Кодгузори визуалӣ чӣ кор мекунад?

Кодгузори асосии визуалӣ модели Swin-T мебошад, ки пешакӣ дар ImageNet омӯзонида шудааст. Як тасвири 224 × 224 пиксел дар марҳилаи охир ба харитаи хусусияти фазоии 7 × 7 ва аз он ба:

\[ N=49 \]

токени фазоӣ табдил меёбад. Андозаи хусусияти ҳар токен:

\[ d=768 \]

дода шудааст.

Ҳамин тавр, дар BDD-OIA андозаи пайдарпаии асосии токенҳо \(49\times768\), дар nu-AD бо шаш камера бошад, пас аз якҷо шудани пайдарпаии шаш камера \(294\times768\) аст.

Чаро Object Selection Module лозим аст?

Қисми зиёди тасвири ронандагӣ метавонад минтақаҳои визуалие дошта бошад, ки барои қарор ҳамеша яксон муфид нестанд, ба мисли осмон, фасади бино, сатҳи якранги роҳ ё наботот. Вазифаи OSM ба ҷойи хулосаи ҳамаи токенҳо бо вазни баробар, интихоб кардани токенҳои барои қарор иттилоотитар мебошад.

Аввал ба ҳар токен иттилои мавқеи уфуқӣ илова мешавад. Дар шабакаи токении 7 × 7 координатаи уфуқии токен:

\[ x_j\in[-1,1] \]

ифода шуда, бо табдили хаттии омӯзишшаванда ба фазои токении 768-андоза бурда мешавад:

\[ p_j=W_px_j+b_p \]

\[ \tilde z_j=z_j+p_j \]

Ҳадафи ин иттилои иловагӣ махсусан дар қарорҳои ронандагии рост/чап нигоҳ доштани он аст, ки далели визуалӣ аз кадом минтақаи уфуқии тасвир омадааст.

Сипас ҳар токен:

\[ s_j=W_s\tilde z_j+b_s \]

хол мегирад ва токенҳои баландтарин нигоҳ дошта мешаванд.

Маҷмӯи додаҳоШумораи ибтидоии токенТокени нигоҳдоштаи OSM
BDD-OIA4916
nu-AD29464

Дар таърифи pooled query-и OSM фарқи дохили манбаъ ҳаст

Муодилаи (5) дар Бахши 3.3 мегӯяд, ки query-и cross-attention миёнаи тамоми пайдарпаии токенҳои position-aware аст:

\[ q_{pool} = \frac{1}{N} \sum_{j=1}^{N}\tilde z_j \]

ва сипас:

\[ h_{sem} = MHA(q_{pool},Z_{top},Z_{top}) \]

амалӣ мешавад.

Аммо қадами 4-и Algorithm 1-и мақола query-ро:

qpool ← Mean(Ztop)

таъриф мекунад. Яъне дар ин ҷо танҳо миёнаи токенҳои интихобшудаи top-K истифода мешавад. Ин ду таъриф яксон нестанд. Азбаски манбаъ дар ин матн равшан намекунад, ки дар татбиқи воқеӣ кадомаш истифода шудааст, мақолаи Verianla яке аз ин ду таърифро хомӯшона “дуруст” эълон намекунад.

Object-Token Extractor чӣ кор мекунад?

Дар ҳоле ки OSM хулосаи умумии семантикии саҳнаро тавлид мекунад, OTE мехоҳад далелҳои мушаххаси маҳаллӣ гум нашаванд. Ҳамон пайдарпаии токенҳои визуалӣ бо MLP-и хурди ҷудогона хол мегирад:

\[ r_j=g(z_j) \]

ва токенҳои дорои баландтарин хол:

\[ K_{obj}=8 \]

интихоб мешаванд.

Токенҳои интихобшуда аз қабати хаттӣ, GELU, dropout ва LayerNorm гузашта, ба маҷмӯи ниҳоии object-token табдил меёбанд:

\[ O\in\mathbb{R}^{8\times768} \]

Ифодаи “object” дар ин ҷо набояд ба маънои классикии детектори объект фаҳмида шавад. Модел bounding box, номи синф ё маскаи сегментатсияи аз ҷониби инсон нишондодашуда надорад. Он ки токенҳо чиро ифода мекунанд, end-to-end аз loss-ҳои рафтор ва шарҳ омӯхта мешавад.

Semantic–Object Fusion чӣ гуна кор мекунад?

Дар модули SOF вектори семантикӣ ҳамчун query ва ҳашт object token ҳамчун key ва value истифода мешаванд:

\[ a=MHA(h_{sem},O,O) \]

Сипас residual connection ва LayerNorm татбиқ мешаванд:

\[ u=LayerNorm(h_{sem}+a) \]

ва пас аз feed-forward network-и дуқабата:

\[ h_{fuse} = LayerNorm(u+FFN(u)) \]

ба даст меояд.

Ин вектори \(h_{fuse}\) вуруди сарлавҳаи рафтор аст.

Чаро сарлавҳаҳои рафтор ва тафсир хусусиятҳои гуногунро мехонанд?

Сарлавҳаи рафтор:

\[ \hat B_i = \sigma(MLP_{beh}(h_{fuse})) \]

ва сарлавҳаи тафсир:

\[ \hat E_i = \sigma(MLP_{int}(h_{sem})) \]

ҳисоб мешаванд.

Гипотезаи муҳаққиқон ин аст, ки нишонаҳои тафсир ба хусусиятҳои сатҳи саҳна, ба мисли “чароғ сурх аст”, “минтақаи пеш кушода аст” ё “дар рост хатти рост ҳаст” мувофиқтаранд; қарори рафтор бошад ҳамзамон аз контексти саҳна ва объектҳои маҳаллии мушаххас истифода мекунад.

Аз ин рӯ, сарлавҳаи тафсир бе гузаштан аз fusion-и объект мустақиман ба semantic vector пайваст мешавад.

Чӣ гуна пешгирӣ мешавад, ки object token-ҳо нусхаи ҳамдигар бошанд?

Барои кам кардани он ки ҳашт токени OTE ҳамон далели визуалиро такроран интихоб кунанд, diversity regularizer истифода шудааст. Барои матритсаи токении \(\tilde O\), ки аз рӯи сатр L2-нормализатсия шудааст:

\[ L_{div} = \left\| \tilde O\tilde O^T-I_{K_{obj}} \right\|_F^2 \]

ҳисоб мешавад.

Loss-и умумӣ:

\[ L_{total} = \alpha L_{VB} + \beta L_{des} + \lambda L_{div} \]

ва вазнҳои истифодашуда:

\[ (\alpha,\beta,\lambda) = (0,5,\ 1,0,\ 0,005) \]

мебошанд.

Дар loss-и рафтор барои Forward, Stop, Left ва Right вазнҳои собити синф:

\[ [1,0,\ 1,0,\ 2,0,\ 2,0] \]

истифода шудаанд; ҳамин тавр синфҳои гардиш, ки камтар намояндагӣ шудаанд, бештар вазн гирифтаанд.

Шаш камера чӣ гуна якҷо мешаванд?

Дар nu-AD ҳар яке аз шаш камера алоҳида бо Swin-T коркард мешавад. Ба ҳар камера embedding-и шахсияти омӯзишшавандаи 768-андоза илова мегардад:

\[ T= Concat( Z^{(1)}+e_1,\ldots,Z^{(6)}+e_6 ) \]

Ин усул бе калон кардани андозаи токен шахсияти камераро ба хусусиятҳо ворид мекунад.

Шумораи параметрҳои иловагӣ барои шаш камера:

\[ 6\times768=4608 \]

аст ва нисбат ба андозаи шабакаи визуалӣ хеле хурд мебошад.

Оё нишон дода шудааст, ки шахсияти камера воқеан муҳим аст?

Таҳқиқоти аблатсия дар ин масъала натиҷаи қавӣ, вале пурра изолятсиянашуда медиҳад.

ВариантСохторРафтор F1mТафсир F1mOverall рафтор F1
V1Як камераи пеш0,8250,8620,851
V26 камера, миёнаи токенҳо0,7570,7470,792
V36 камера + camera embedding + cyclic LR0,8380,9050,877
V4Модели пурра0,8480,9090,887

Якҷо кардани шаш камера бе иттилои шахсият нисбат ба V1 рафтор F1m-ро аз 0,825 то 0,757 ва тафсир F1m-ро аз 0,862 то 0,747 паст кардааст.

Дар V3 иҷроиш хеле барқарор мешавад. Аммо V3 ҳамзамон се тағйиротро дорад: camera embedding, cyclic learning-rate ва буҷети дигари омӯзиш. Аз ин рӯ, муҳаққиқон ошкоро мегӯянд, ки фоидаи V2→V3 набояд ҳамчун таъсири сабабии изолятсияшудаи танҳо camera embedding хонда шавад.

Additive camera embedding ё concatenation?

Дар муқоисаи ҷудогона, илова кардани шахсияти камера ба токен бо додани шахсияти камера тавассути concatenation + projection муқоиса шудааст.

Усули additive барои тафсир \(F1_m=0,909\), усули concatenation бошад \(0,908\) додааст. Бо иҷроиши тақрибан баробар, равиши concatenation тақрибан 0,59 миллион параметри иловагӣ талаб кардааст, дар ҳоле ки additive embedding танҳо 4608 параметр илова намудааст.

Натиҷаҳои BDD-OIA чиро нишон медиҳанд?

УсулРафтор F1mРафтор F1allТафсир F1mТафсир F1all
OIA0,7180,7340,2080,422
Inaction0,6940,7140,3470,565
NLE-DM0,7230,7330,3120,517
Interrelation0,7010,7220,3350,537
CrossAD0,7160,7390,4170,584

CrossAD дар бахши тафсир дар ҳар ду метрика баландтарин қиматро медиҳад. Дар бахши рафтор, гарчанде overall F1 баландтарин аст, class-mean F1 аз NLE-DM пасттар мебошад.

Чаро гардиш ба чап мушкил аст?

Тақсимоти рафтор дар додаҳои омӯзишии BDD-OIA:

РафторШумораи намунаБасомад
Forward8734%54,3
Stop7277%45,2
Left1210%7,5
Right10.660%66,3

Бояд дар хотир дошт, ки нишонаҳо ҳамдигарро истисно намекунанд; бинобар ин аз %100 зиёд шудани ҷамъбасти фоизҳо хато нест.

Натиҷаҳои синфии F1-и CrossAD:

СинфCrossAD F1
Forward0,839
Stop0,803
Left0,580
Right0,641

Гардиш ба чап синфи асосиест, ки миёнаи рафтори CrossAD-ро паст мекунад. NLE-DM дар ҳамин синф 0,651 гузориш мекунад.

Натиҷаҳои nu-AD чиро нишон медиҳанд?

Verianla Live: CrossAD ва усулҳои қаблӣ дар nu-AD

Ҷадвал чор метрикаи aggregate F1-ро дар муқоисаи test split-и nu-AD аз таҳқиқот нишон медиҳад.

УсулРафтор F1mРафтор F1allТафсир F1mТафсир F1all
OIA0,7390,7710,8530,852
NLE-DM0,7600,8360,8820,879
VB-CASeg0,7670,8440,9070,903
CrossAD0,8480,8870,9090,919
 

Verianla Live: Қиматҳо аз муқоисаи test split-и nu-AD дар таҳқиқот гирифта шудаанд. Ҳатто агар муҳаррики график хомӯш бошад, қиматҳои манбаи илмӣ дар ҷадвали боло нигоҳ дошта мешаванд.

Дар nu-AD, CrossAD дар ҳамаи чор ченаки aggregate баландтарин қимати ҷадвалро ба даст меорад. Нисбат ба VB-CASeg фоидаи class-mean F1 барои рафтор 0,081 ва фоидаи overall F1 барои рафтор 0,043 мебошад. Фарқи бахши тафсир хурдтар аст: 0,002 дар class-mean F1 ва 0,016 дар overall F1.

Оё OSM воқеан ба минтақаҳои вобаста ба ҳаракат нигоҳ мекунад?

Дар визуализатсияи OSM-и таҳқиқот вазнҳои attention дар болои grid-и токении 7 × 7 рӯи тасвири вурудӣ гузошта шудаанд. Дар саҳнаи намунавӣ нишон дода мешавад, ки вазнҳои баландтар дар хатҳои роҳ, тирҳои самти ҳаракат ва долони ҳаракати пеши мошин ҷамъ мешаванд, дар ҳоле ки биноҳои канорӣ вазни пасттар мегиранд.

Ин визуал нишон медиҳад, ки OSM ҳадди ақал дар мисоли пешниҳодшуда метавонад минтақаҳои вобаста ба вазифаро барҷаста кунад. Бо вуҷуди ин, як attention map набояд ҳамчун шарҳи сабабии ҳамаи қарорҳои модел тафсир шавад.

Шарҳи забони табиӣ чӣ гуна тавлид мешавад?

Дар система ду роҳи тавлиди шарҳ мавҷуд аст.

Роҳи аввал: муҳаррики қоидаи детерминистӣ. Барои BDD-OIA 47 ва барои nu-AD 18 шаблон мавҷуд аст. Нишонаҳои фаъоли рафтор ва сабаб бо қоидаҳо хонда шуда, ҷумлаи назоратшаванда сохта мешавад.

Роҳи дуюм: версияи TinyLlama-1.1B, ки бо Low-Rank Adaptation мутобиқ шудааст.

Параметрҳои LoRA:

  • rank \(r=2\),
  • миқёс \(\alpha_{LoRA}=64\),
  • тақрибан 12.300 ҷуфти prompt–completion,
  • тақсимоти %90 омӯзиш / %10 тасдиқ.

Prompt векторҳои рафтор ва тафсири пешгӯишударо дар бар мегирад. Яъне TinyLlama тасвири саҳнаро мустақим намебинад.

Verianla Live: Занҷири CrossAD аз тасвир то рафтор ва шарҳи забони табиӣ

Раванди зер қадамҳои асосиро, ки дар тавсифи меъморӣ ва inference-и таҳқиқот дода шудаанд, ҷамъбаст мекунад.

МарҳилаАмалиётБаромад / ҳадаф
1. Кодгузории визуалӣТасвири як камера ё шаш камера бо Swin-T ба токенҳои фазоӣ табдил мешавад.Пайдарпаии муштараки хусусиятҳои визуалӣ
2. Интихоби саҳнаOSM иттилои мавқеи уфуқиро илова мекунад, токенҳоро хол медиҳад ва top-K токени саҳнаро интихоб мекунад.Зермаҷмӯи саҳнаи муҳим барои қарор
3. Хулосаи семантикӣБо cross-attention semantic vector-и сатҳи саҳна тавлид мешавад.hsem
4. Интихоби токени маҳаллӣOTE аз ҳамон пайдарпаии токенҳои визуалӣ бо холдиҳандаи ҷудогона ҳашт object token интихоб мекунад.O ∈ R8×768
5. Semantic–object fusionSemantic vector ҳамчун query ва object token-ҳо ҳамчун key/value бо cross-attention якҷо мешаванд.hfuse
6. Пешгӯии рафторСарлавҳаи рафтор fused representation-ро мехонад.Эҳтимолҳои Forward / Stop / Left / Right
7. Пешгӯии тафсирСарлавҳаи тафсир semantic vector-ро тавассути skip connection мустақим мехонад.Нишонаҳои бисёргонаи сабабҳои барои инсон фаҳмо
8. Тавлиди забонНишонаҳои пешгӯишудаи рафтор ва тафсир ба муҳаррики қоида ё LoRA-TinyLlama дода мешаванд.Асоси забони табиӣ
 

Verianla Live: Ҷараён ба меъмории манбаъ асос ёфтааст. Махсусан нигоҳ дошта шудааст, ки генератори забон токенҳои хоми визуалиро мустақим истифода намекунад.

Шарҳҳои забони табиӣ то чӣ андоза мувофиқанд?

Дар held-out test set-и BDD-OIA бо \(n=4572\) намуна се санҷиши асосӣ гузориш шудааст:

Меъёри санҷишНатиҷа
Зикр шудани рафтори пешгӯишуда дар ҷумла%99,93
Истифодаи калимаи вобаста ба эътимоди пешгӯӣ%99,80
Ҳамоҳангӣ бо ҳадди ақал як нишонаи саҳна%92,11

Ин натиҷаҳо нишон медиҳанд, ки генератори забон баромадҳои сохторёфтаи аз модел гирифташударо асосан дар ҷумла нигоҳ медорад. Аммо онҳо худ аз худ нишон намедиҳанд, ки шарҳ дар ҷаҳони воқеӣ дуруст аст ё ба далели визуалӣ сабабӣ пайваст мебошад.

Вақте қарор дуруст аст, шарҳ беҳтар аст?

Муҳаққиқон намунаҳоеро, ки вектори рафторашон пурра дуруст ва нодуруст пешгӯӣ шудааст, ҷудогона арзёбӣ карданд.

ЗермаҷмӯаnROUGE-LҲамоҳангӣ бо нишонаи саҳна
Пешгӯии рафтор дуруст11110,8016%92,64
Пешгӯии рафтор нодуруст34610,6788%91,94

Фарқи ROUGE-L:

\[ 0,8016-0,6788=0,1228 \]

гузориш шудааст.

Илова бар ин, вақте ба ҳамон генератори забон ба ҷойи нишонаҳои пешгӯишуда нишонаҳои ҳақиқӣ дода шуданд, ROUGE-L:

\[ 0,7087\rightarrow0,9226 \]

баланд шуда, фарқ 0,2139 будааст.

Муҳаққиқон инро чунин тафсир мекунанд, ки сифати тавлиди забони табиӣ бо дақиқии пешгӯии upstream-и рафтор маҳдуд мешавад.

Ин “садоқати шарҳ” дақиқан чиро исбот мекунад?

Фарқгузории худи таҳқиқот дар ин ҷо махсусан муҳим аст. Азбаски генератори забон бо пешгӯиҳои сохторёфта шартӣ шудааст, вақте рафтор нодуруст аст, метавонад ҳамон рафтори нодурустро мутобиқ шарҳ диҳад. Ин метавонад садоқати генератори забонро ба қарори модел нишон диҳад; аммо исбот намекунад, ки модел қарорро воқеан аз сабаби объекти дурусти визуалӣ гирифтааст.

Муаллифон инро ошкоро байни “decision-level faithfulness to the structured outputs” ва “causal grounding to the raw visual evidence” ҷудо мекунанд.

Аз ин рӯ, таҳқиқоти мавҷуда даъвои зеринро дастгирӣ мекунад:

“Генератори забон асосан шарҳе тавлид мекунад, ки ба пешгӯиҳои сохторёфтаи CrossAD мувофиқ аст.”

Аммо даъвои қавитарро дастгирӣ намекунад:

“Ҷумлаи тавлидшуда далели сабабии воқеии визуалиро исбот мекунад, ки боиси қарори модел дар тасвири хом шудааст.”

Дар стресс-тестҳо чӣ шуд?

Таҳқиқот 15 варианти душворро дар панҷ гурӯҳи сенария баррасӣ кардааст:

  • гардиш ба чап,
  • пӯшиш/occlusion,
  • шароити шабона,
  • аломатҳои мураккаби ҳаракат,
  • саҳнаҳои бисёробъектӣ.
СенарияЭътимоди BDD-OIAЭътимоди nu-ADЭнтропияи BDD-OIA
Гардиш ба чап0,2878 ± 0,02670,2754 ± 0,00171,3747 ± 0,0103
Occlusion0,2904 ± 0,01310,2580 ± 0,00141,3768 ± 0,0054
Шаб0,3109 ± 0,01600,2684 ± 0,00051,3689 ± 0,0063
Аломатҳои мураккаб0,2771 ± 0,00000,2719 ± 0,00001,3835 ± 0,0000
Бисёробъектӣ0,3031 ± 0,02900,2641 ± 0,00431,3666 ± 0,0184

Барои чор синф энтропияи назариявии максималӣ:

\[ \ln4\approx1,386 \]

аст, бинобар ин қиматҳои сатҳи тақрибан 1,37 дар ин намунаҳо ба номуайянии баланд ишора мекунанд. Худи манбаъ ин натиҷаҳои стресс-тестро омори популятсионӣ не, балки натиҷаҳои ташхисии рафтори модел дар шароити душвор меномад.

Натиҷаҳое, ки таҳқиқот дастгирӣ мекунад

  • Аз як кодгузори визуалии Swin-T рафтор ва нишонаҳои сабабҳои барои инсон фаҳмо якҷо пешгӯӣ шудаанд.
  • OSM semantic representation-и сатҳи саҳнаро бо интихоби top-K токен ва cross-attention тавлид мекунад.
  • OTE бе bounding-box ё segmentation supervision ҳашт class-agnostic object token интихоб мекунад.
  • SOF semantic vector ва object token-ҳоро тавассути cross-attention муттаҳид мекунад.
  • Дар BDD-OIA, CrossAD баландтарин ду метрикаи interpretation F1-ро миёни усулҳои муқоисашуда гузориш кардааст.
  • Дар nu-AD, CrossAD дар ҳамаи чор метрикаи aggregate рафтор/тафсир F1 миёни усулҳои муқоисашуда баландтарин натиҷаро гузориш кардааст.
  • Дар nu-AD, миёнагирии токенҳои шаш камера бе нигоҳ доштани шахсияти камера иҷроишро нисбат ба як камера паст кардааст.
  • Ҳалли additive camera embedding бо дақиқии хеле монанд ба concatenation параметрҳои иловагии хеле камтар истифода кардааст.
  • Шарҳҳои тавлидкардаи LoRA-TinyLlama бо баромадҳои сохторёфтаи модел сатҳи баланди мувофиқат нишон додаанд.
  • Паст шудани ROUGE-L дар пешгӯиҳои нодурусти рафтор дастгирӣ мекунад, ки тавлиди забон бо дақиқии пешгӯии upstream маҳдуд аст.

Натиҷаҳое, ки таҳқиқот дастгирӣ намекунад ё ҳанӯз тасдиқ накардааст

  • CrossAD бо озмоиши closed-loop ронандагии автономӣ дар мошини воқеӣ тасдиқ нашудааст.
  • Қиматҳои benchmark F1 меъёри воқеии амнияти роҳ нестанд.
  • Исбот нашудааст, ки модел берун аз BDD-OIA ва nu-AD ҳамон иҷроишро нишон медиҳад.
  • Умумисозии мустақим ба роҳ ва шароити ҳаракати Туркия санҷида нашудааст.
  • Модел пайдарпаии дарозмуддати вақтро истифода намекунад; сохтори асосӣ ба як кадр ё тасвирҳои камераи ҳамзамон гирифташуда такя мекунад.
  • Object token-ҳо бо нишонаҳои назоратшавандаи объект номгузорӣ ё дар сатҳи bounding-box тасдиқ нашудаанд.
  • Визуализатсияи attention-и OSM худ ба худ далели шарҳи сабабӣ нест.
  • Азбаски LoRA-TinyLlama мустақиман бо токенҳои хоми визуалӣ шартӣ нест, садоқати сабабии визуалии баромади забони табиӣ исбот нашудааст.
  • Тамоми фарқи аблатсияи V2→V3-ро танҳо ба механизми camera embedding нисбат додан мумкин нест.
  • Қимати 27,4 миллион параметр ҳамаи параметрҳои шабакаи асосии яхкардашудаи TinyLlama-1.1B-ро ифода намекунад.

Усул ва Натиҷаҳои Таҳқиқот

Маҷмӯаҳои додаҳои benchmark

Маҷмӯи додаҳоМанбаъКамераСинфи рафторКатегорияи тафсир
BDD-OIABDD100K1421
nu-ADnuScenes648

Андозаҳои асосии tensor-и CrossAD

ҶузъBDD-OIAnu-AD
Вуруд3 × 224 × 2246 × 3 × 224 × 224
Пайдарпаии токени Swin-T49 × 768294 × 768
Токени интихобшудаи OSM16 × 76864 × 768
Semantic vector768768
Object token8 × 7688 × 768
Fused representation768768
Баромади рафтор44
Баромади тафсир218

Муҳити омӯзиш ва оптимизатсия

ПараметрТанзими додашуда дар манбаъ
FrameworkPyTorch 2.7.1
CUDA11.8
GPUNVIDIA RTX 3080 Ti
Тасвири омӯзишТағйири андоза ба 256 × 256 → random 224 × 224 crop
InferenceDeterministic center crop
OptimizerAdamW
Weight decay10⁻⁴
Swin-T learning rate2 × 10⁻⁶
Learning rate-и модулҳои вазифа10⁻⁴
Warm-up3 epoch linear
Precisionbfloat16 mixed precision
Gradient clippingL2 norm 0,5
nu-AD mini-batch2 surround-view tuple
Gradient accumulation8 mini-batch
Effective batch size16

Swin-T дар се epoch-и аввал ях карда шуда, баъд тадриҷан кушода шудааст. Дар BDD-OIA horizontal flip истифода нашудааст, зеро гуфта мешавад он маънои рост/чапро баръакс мекунад. Дар nu-AD бошад камераҳо ва нишонаҳои мувофиқ якҷо аз нав харитасозӣ шуда, flip-и геометрии мувофиқ татбиқ шудааст.

Функсияи loss

Барои рафтор class-weighted binary cross-entropy:

\[ L_{VB} = BCE_{w_B}(\hat B_i,B_i) \]

истифода шудааст.

Барои тафсир, бо вазнҳои синфи мусбат, ки аз басомадҳои додаҳои омӯзиш ҳисоб ва бо ҳадди боло бурида шудаанд:

\[ L_{des} = BCE_{w+}(\hat E_i,E_i) \]

истифода шудааст.

Ҳадафи ниҳоӣ бо гуногунии object token:

\[ L_{total} = 0,5L_{VB} + 1,0L_{des} + 0,005L_{div} \]

мебошад.

Натиҷаҳои асосии BDD-OIA

УсулF1beh mF1beh allF1des mF1des allForwardStopLeftRight
Local selector0,6990,7110,1960,4060,8100,7620,6000,624
OIA0,7180,7340,2080,4220,8290,7810,6300,634
Inaction0,6940,7140,3470,5650,8000,7470,6120,619
NLE-DM0,7230,7330,3120,5170,8270,7600,6510,653
Interrelation0,7010,7220,3350,5370,8020,7530,6190,625
CrossAD0,7160,7390,4170,5840,8390,8030,5800,641

Гарчанде CrossAD дар тафсир қавӣ аст, аз рӯи class-mean F1-и рафтор дар BDD-OIA баландтарин усули ҷадвал нест. Ин фарқ бояд дар тафсири натиҷа нигоҳ дошта шавад.

Натиҷаҳои асосии nu-AD

УсулF1beh mF1beh allF1des mF1des all
OIA0,7390,7710,8530,852
NLE-DM0,7600,8360,8820,879
VB-CASeg0,7670,8440,9070,903
CrossAD0,8480,8870,9090,919

Натиҷаҳои синфии CrossAD дар nu-AD

РафторF1
Forward0,963
Stop0,852
Left0,760
Right0,818

Аблатсияи бисёркамера

ВариантКамераForwardStopLeftRightF1des mF1des allF1beh all
V1 — як камера10,9630,8240,7390,7730,8620,8670,851
V2 — миёнаи токенҳо60,9540,7850,5820,7080,7470,7800,792
V3 — cam embedding + cyclic LR60,9580,8370,7520,8050,9050,9170,877
V4 — модели пурра60,9630,8520,7600,8180,9090,9190,887

Муқоисаи V3 ва V2 аблатсияи холиси танҳо таъсири camera embedding нест; худи мақола мегӯяд, ки V3 аз V2 инчунин аз рӯи optimiser schedule ва буҷети омӯзиш фарқ мекунад.

Муқоисаи самаранокӣ

УсулПараметрRuntime / тасвирnu-AD F1beh mnu-AD F1des all
OIA21,68 M65,63 ms0,7390,852
NLE-DM41,55 M47,10 ms0,7600,879
VB-CASeg28,11 M52,78 ms0,7670,903
CrossAD27,4 M50,9 ms0,8480,919

Дар ҷадвали муфассали мураккабии манбаъ, шохаи визуалии CrossAD ҳамчун 22,21 M параметр, 17,89 G MAC ва 35,78 G FLOP гузориш шудааст. Ин профил барои вуруди шашкамераи nu-AD ва batch size 1 таҳия шудааст.

Барои модули TinyLLaMA-LoRA рақами 4,51 M танҳо параметрҳои омӯзишшавандаи LoRA adapter-ро ифода мекунад. Модели асосии TinyLlama-1.1B ях карда шудааст; бинобар ин қимати 27,4 M набояд ҳамчун андозаи умумии система бо тамоми параметрҳои физикии модели забонӣ тафсир шавад.

Таҳлили садоқати забони табиӣ

МеъёрЗермаҷмӯаҚимат
Зикри рафтор дар ҷумлаҲамаи тест%99,93
Зикри ифодаи эътимодҲамаи тест%99,80
Ҳамоҳангӣ бо нишонаи саҳнаҲамаи тест%92,11
ROUGE-LРафтор пурра дуруст, n=11110,8016
ROUGE-LРафтор нодуруст, n=34610,6788
ROUGE-LТавлид бо нишонаҳои пешгӯишуда0,7087
ROUGE-LOracle generation бо нишонаҳои ҳақиқӣ0,9226

Садоқат дар ин ҷо ба нишонаҳои сохторёфтаи рафтор ва тафсир равона аст. Худи таҳқиқот мегӯяд, ки ин натиҷаҳо causal faithfulness ба далели хоми визуалӣ таъмин намекунанд.

Нуқтаҳои техникии диққат дар манбаъ

OSM pooled query: Муодилаи (5) миёнаи ҳамаи position-aware token-ҳоро истифода мекунад, дар ҳоле ки Algorithm 1 миёнаи токенҳои интихобшудаи \(Z_{top}\)-ро истифода мекунад.

Аблатсияи V2–V3: Азбаски дар баробари camera embedding cyclic learning rate ва буҷети омӯзиш низ тағйир меёбанд, фоидаро танҳо ба camera embedding сабабӣ нисбат додан мумкин нест.

Шумораи параметрҳо: Рақами 27,4 M барои CrossAD андозаи умумии deployed model нест, ки ҳамаи параметрҳои яхкардашудаи асосии TinyLlama-1.1B-ро дар бар гирад.

Терминологияи F1-и BDD-OIA: Қимати 0,716 дар Table 6 class-mean behaviour F1 аст; overall behaviour F1 0,739 мебошад. Дар матни баъдӣ 0,716 ҳамчун “behaviour-prediction accuracy” номида шудааст.

Садоқати шарҳ: Language generator label-conditioned аст. Аз ин рӯ, садоқати сатҳи қарор ва садоқати сабабӣ ба далели хоми визуалӣ бояд аз ҳам ҷудо карда шаванд.

Ёддошт оид ба Манбаъ ва Усул

Номи пурраи аслии таҳқиқот: A Unified Explainable Autonomous Driving Framework via Cross-Attention Scene Selection and Semantic–Object Fusion

Муаллифон: Habib Dhahri, Fahad Alotaibi, Awais Mahmood, Mousa Jari.

Тартиби муаллифон: Тартиби манбаъ айнан нигоҳ дошта шудааст.

Муаллифи масъул: Habib Dhahri.

Саҳми баробар/муаллифи аввали баробар: Дар манбаъ чунин баёнот нест.

Муассиса: College of Applied Computer Science, King Saud University, Riyadh 11545, Saudi Arabia.

Маҷалла: Machines.

Ношир: MDPI.

Сабти библиографӣ: Machines 2026, 14, 677.

DOI: 10.3390/machines14060677.

Пайванди расмии нашр:https://doi.org/10.3390/machines14060677

Санаи нашр: 10 June 2026.

Навъи манбаъ ва ҳолати рецензия: Мақолаи аслии рецензияшудаи таҳқиқотӣ мебошад. Таҳқиқот ба таҳия ва арзёбии модели deep learning дар benchmark-ҳои кушодаи BDD-OIA ва nu-AD асос ёфтааст.

Иҷозатнома: Creative Commons Attribution (CC BY).

Маблағгузорӣ: Таҳқиқот аз ҷониби King Saud University, Riyadh дар доираи Ongoing Research Funding program бо рақами ORF-2026-2100 дастгирӣ шудааст.

Дастрасии дода ва код: Дар таҳқиқот benchmark-ҳои кушодаи BDD-OIA ва nu-AD истифода шудаанд. Муаллифон гуфтаанд, ки stratified subset manifest, sampling scripts, training code, rule-engine templates ва evaluation scripts тавассути GitHub дастрас шудаанд; LoRA-адаптатсияшудаи TinyLlama checkpoint пас аз қабул нашр мешавад.

Бархӯрди манфиатҳо: Муаллифон изҳор кардаанд, ки бархӯрди манфиатҳо вуҷуд надорад.

Саҳми муаллифон: Habib Dhahri ва Fahad Alotaibi дар консептуализатсия; Habib Dhahri, Awais Mahmood ва Mousa Jari дар усул; Habib Dhahri дар нармафзор; ҳамаи чор муаллиф дар тасдиқ; Habib Dhahri дар таҳлили расмӣ ва идоракунии додаҳо; Habib Dhahri ва Mousa Jari дар таҳқиқ; Fahad Alotaibi ва Awais Mahmood дар захираҳо; Habib Dhahri дар лоиҳаи аввал ва визуализатсия; Fahad Alotaibi, Awais Mahmood ва Mousa Jari дар бозбинӣ/таҳрир; Awais Mahmood ва Mousa Jari дар назорат; Fahad Alotaibi дар идоракунии лоиҳа ва дарёфти маблағгузорӣ иштирок кардаанд.

Меъморӣ, андозаҳои tensor, loss functions, танзимоти омӯзиш, натиҷаҳои benchmark, аблатсияҳо, қиматҳои самаранокӣ, натиҷаҳои шарҳи забони табиӣ, стресс-тестҳо ва маҳдудиятҳои ин мақолаи Verianla ба таҳқиқоти манбаи баррасишуда асос ёфтаанд. Ба ҷуз тасдиқи шахсияти библиографӣ, аз манбаъҳои беруна натиҷаи нави илмии модел ё даъвои иҷроиш илова нашудааст.

Ҳадди асосии методологӣ: Таҳқиқот арзёбии офлайнии моделро дар benchmark-ҳои BDD-OIA ва nu-AD пешниҳод мекунад. Closed-loop driving дар мошини воқеӣ, озмоиши саҳроӣ, истифодаи дарозмуддат, сертификатсияи амният ё тасдиқи мустақил дар кишварҳо ва тақсимоти гуногуни ҳаракат анҷом дода нашудааст. Модел асосан тасвирҳои статикӣ/кадрҳои камераро истифода мекунад ва long-term temporal reasoning қисми асосии меъмории мавҷуда нест.

Ҳадди explainability: Генератори шарҳи LoRA-TinyLlama мустақиман бо токенҳои хоми визуалӣ шартӣ намешавад; он аз нишонаҳои пешгӯишудаи рафтор ва тафсир шарҳ месозад. Аз ин рӯ, таҳқиқот finding-и decision-level faithfulness ба қарорҳои сохторёфтаро пешниҳод мекунад; далели causal faithfulness ба далели хоми визуалӣ пешниҳод намекунад.

Ёддошти номувофиқии дохили манбаъ оид ба OSM: Муодилаи (5) дар Бахши 3.3 pooled query-ро ҳамчун миёнаи ҳамаи position-aware token-ҳо таъриф мекунад, дар ҳоле ки қадами 4-и Algorithm 1 танҳо миёнаи top-K token-ҳои интихобшударо истифода мекунад. Манбаъ ин ду таърифро ҳамчун як татбиқи ниҳоӣ ҳамоҳанг намекунад.

Ҳадди аблатсия: Тағйир байни V2 ва V3 танҳо camera embedding нест; cyclic learning-rate schedule ва буҷети омӯзиш низ тағйир мекунанд. Манбаъ бинобар ин фоидаи V2→V3-ро ҳамчун таъсири сабабии танҳо camera embedding арзёбӣ намекунад.

Ёддошти андозаи модел: Қимати CrossAD 27,4 M дар ҷадвали самаранокӣ ва қимати 4,51 M барои TinyLLaMA-LoRA ҳамаи параметрҳои шабакаи асосии яхкардашудаи TinyLlama бо тақрибан 1,1 миллиард параметрро ифода намекунанд. 4,51 M танҳо параметрҳои омӯзишшавандаи LoRA adapter мебошанд.

Ёддошти терминологияи F1: Дар BDD-OIA Table 6 қимати behaviour mean F1-и CrossAD 0,716 ва overall behaviour F1 0,739 мебошад. Дар муҳокимаи баъдии шарҳи забони табиӣ қимати 0,716 ҳамчун “behaviour-prediction accuracy” номида шудааст. Дар мақолаи Verianla ин ду ченак ҷудо нигоҳ дошта шудаанд.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо