Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Инженерия / CM-VLA: Камера мейкиндиги жана эксперттер аралашмасы аркылуу роботтор арасында аз үлгүлүү аракет өткөрүү
Инженерия

CM-VLA: Камера мейкиндиги жана эксперттер аралашмасы аркылуу роботтор арасында аз үлгүлүү аракет өткөрүү

CM-VLA ар башка робот денелери арасында аз сандагы жаңы көрсөтүм менен тапшырма өткөрүүнү жеңилдетүү үчүн камера мейкиндигиндеги жалпы аракет семантикасын роботко мүнөздүү аткаруу саясатынын өзүнөн ажыраткан Vision-Language-Action архитектурасы болуп саналат.

11/09/2026  Veri Anla 47 көрүү
CM-VLA: Камера мейкиндиги жана эксперттер аралашмасы аркылуу роботтор арасында аз үлгүлүү аракет өткөрүү

CM-VLA, ар башка робот денелери арасында аз сандагы жаңы көрсөтүм менен тапшырма өткөрүүнү жеңилдетүү үчүн камера мейкиндигинде жалпы аракет семантикасы менен роботко мүнөздүү аткаруу саясатын бир-биринен ажыраткан Vision-Language-Action архитектурасы болуп саналат. Модел Camera-space Unified Actions (CU-Actions) деп аталган камера-мейкиндиги аракеттерин VLM негизги модулу үчүн көмөкчү көзөмөл катары колдонот; андан соң embodiment-aware Mixture-of-Experts (MoE) flow policy ортақ семантикани максат роботтун кинематикалык түзүлүшүнө ва башкаруу өзгөчөлүктөрүнө ылайык үзгүлтүксүз робот-мейкиндиги аракеттерине айландырат. Изилдөөдө CM-VLA ME-LIBERO узаринда %97,9 орточо ийгиликке, көрүлбөгөн роботторго 100 көрсөтүмдүк өткөрүүдө %59,7 ва 300 көрсөтүмдө %92,3 орточо ийгиликке жеткен. Реал Sawyer робот такрубаларинда орточо нормалдаштырылган балл %74 катары билдирилген. Ошол эле учурда натыйжалар бир колдуу енд-еффектор делта көзөмөл контекстинде алынган ва моделин ики қоллу роботтора, бакариқли аллара ва я айырмали аракет маканларина ейни перформансла генишланакайи көрсөтүлгөн эмес.

Vision-Language-Action модели визуал мушахида ва табии дил окутууатларини роботун икра еда бмененкайи аракетлара чевиран чоксмодалли роботика саясати синфидир. CM-VLA-нин айирики өзгөчөлүки “на едмененкайина” даир роботтор арасинда пайлашменен бмененн семантикани камера мейкиндигинде ойранмаси ва “нека икра едмененкайина” даир робота ксас икрани айрика експертлар қаришиги саясатина бураксмасидир.

Эмне үчүн ар башка роботтор арасында тапшырма өткөрүү кыйын?

Робот манипуляция тапшырмасы семантикалык жактан бирдей калса да, тапшириги ерина етиран физикалык робот өзгөргөндө маселе жөнөкөй координата өзгөртүүдөн татаалыраак болот. Роботларин муун сандары, байланыш узундуктары, иш мейкиндиктери, сенсорлору, проприосептив вазийят пайланмалари, камера жайгашуулары, башкаруу жыштыктары ва гриппер механизмдери айырмали ола бмененр.

Мисалы, “жашыл кездемени ал да табактын үстүнө кой” көрсөтмөсү UR5, Franka Panda, Sawyer, KUKA iiwa, Kinova3 ва xArm учун бирдей тапшырма семантикасын алып жүрөт. Бирок ар бир роботтун ейни сонландирики аракетини ерина етирмак учун ехтияк дуйдугу төмөн деңгээлдеги аракет буйруктары бирдей эмес.

Изилдөөин ала алдиги негизги маселе бу ики савийянин мовкуд VLA системларинда кифаят қадар айришдирилмамасидир. Визуал кодлайики камерадан галан горунтуну емал едаркан, аракет етикети чокс маалымат дастинда роботун оз координат системинда муайян кылынат. Белаликла модел тапшириги ойранмакла янаши, камера менен робот координат системи арасиндаки чеврилмани да ортук шакилда халл етмая макбур қалир.

CM-VLA деген эмне?

CM-VLA камера мейкиндигинде муайян едилмиш денедан асили олмаян аракет семантикасини висион-лаңуаге онургасинда ойранан ва бу семантикани embodiment-aware Mixture-of-Experts flow policy васитасменен максат роботтун үзгүлтүксүз идараетма командаларина чевиран кросс-ембодимент VLA архитектурасы болуп саналат. Моделин негизги айырмаи камера мейкиндигиндеки қаврайиш ёнлу “на едилмалидир?” тамсили менен робот мейкиндигиндаки икра ёнлу “нека едилмалидир?” идараетмасини ики айри ойранма маселеи кими еле алмасидир.

Камера-мейкиндигиндеги бириккен аракеттер

Изилдөөин негизги ара тамсили Камера-спаке Унифиед Актион, яни CU-Action-дир. Хар заман аддиминдаки камера-мейкиндиги аракети бела муайян кылынат:

\[ a_t^c=(\Delta p_t^c,\Delta r_t^c,g_t) \]

Бурада:

  • \(\Delta p_t^c\) сонландирикинин камера координат системиндаки трансласия дайишимини;
  • \(\Delta r_t^c\) камера координат системиндаки фирланма дайишимини;
  • \(g_t\) гриппер командасини тамсил едир.

Бу гостаримин илимий ролу роботун оз ойнақ ва я база координатлариндан мумкун қадар мустақил ара аракет семантикаси яратмақдир. Камера горунтусу да камера мейкиндигинде мушахида едилдийи учун аракет көзөмөлинин ейни хандаси баглама дашинмаси мушахида менен аракет етикети арасиндаки уйгунсузлугу азалтмаги мақсадлайир.

Ахамийятли бир детал CU-Actions-ин бирбаша сон робот идараетма командаси кими колдонуу едилмамасидир. Изилдөөдө дискретизед CU-Actions VLM онургасинин окутууи учун көмөкчү көзөмөл вазифаси горур. Чыныгы икра едменен бмененн үзгүлтүксүз робот аракетлари айрика довнстреам поликй тарафиндан ярадилир.

CM-VLA “эмне жасаларын” жана “кантип жасаларын” кантип ажыратат?

CM-VLA-да камера-мейкиндиги VLM қати визуал мушахида ва дил көрсөтмөсүндан ембодимент-агностик аракет семантикасини ойранарак “на едмененкайини” тамсил едир; робот-мейкиндиги MoE flow policy иса роботун проприосептив вазийяти ва ембодимент шартиндан колдонуу едарак ейни семантиканин конкрет робот узаринда “нека татбиқ едмененкайини” үзгүлтүксүз идараетма сиқналларина чевирир.

Висион-лаңуаге негизги модулу

VLM онургаси PaliGemma негизгилидир. PaliGemma SigLIP визуал кодлайикиси менен Gemma дил моделини бирлашдирир. Модела бир неча RGB мушахидаси ва дил көрсөтмөсү верилир:

\[ \pi_\phi(a_t^c,\hat l_t \mid I_t^1,\ldots,I_t^n,l) \]

Бурада \(a_t^c\) CU-Action, \(\hat l_t\) иса тапшырма плани, алт тапшырма айрими, аракет примитиве-лари ва гриппер мовқейи кими алава қаврайиш ёнлу тапшырма қурулушуну тамсил едан токенлашдирилмиш реасониң чиксишидир.

VLM-ин сечилмиш қатлариндан алинан гизли вазийятлар ачар-даяр өзгөчөлүкларина проексия кылынат:

\[ K_t^{(m)}=H_t^{(m)}W_K^{(m)}, \qquad V_t^{(m)}=H_t^{(m)}W_V^{(m)} \]

Бу өзгөчөлүклар:

\[ C_t=\{(K_t^{(m)},V_t^{(m)})\}_{m\in M} \]

шартландирма чокслугуну жаратат ва кросс-аттентион узариндан үзгүлтүксүз робот аракети ярадан алт саясата отурулур. Авторлорин дизайнинда вакиб мақам ялниз сон VLM қатиндан колдонуу етмак авазина сечилмиш қатлар узра заңин КВ шартландирмаси тамин етмакдир.

CU-Action окутуу максаттары

Матн реасониң чиксиши учун каусал аттентион ва токен-токен проқнозу колдонуу олунур:

\[ L_{cot}=-\sum_{k=1}^{K}\log\pi_\phi(l_t^k\mid v_t,l_t^{<k}) \]

Discretized CU-Actions учун иса бутун аракет ардикиллигиндаки алақалари бирликда моделлая билмак максатыла фулл-аттентион колдонуу олунур:

\[ L_{cu\_action}=-\sum_{m=1}^{M}\log\pi_\phi(a_m^c\mid v_t,l) \]

Авторлор бу сечимин CU-Action ардикиллигинда даха бутов ва юмшақ кечидли аракет қурулушлари ойранмая комак етдийини билдиретлар.

Робот-мейкиндиги Mixture-of-Experts саясаты

Икинки мархалада модел камера-мейкиндиги семантикасини чыныгы роботун ишлада бмененкайи үзгүлтүксүз робот-спаке актион, яни RS-Actions-а чевирир. Бунун учун флов матчиң негизгили Трансформер саясати колдонуу олунур.

Саясатин илк қатлари бутун роботтор учун ортақ емал апарир. Даха дариндаки сон алти блок иса MoE блокларидир. Ембодимент шарти \(e_k\) ортақ тамсилла бирлашдирмененрак робота ксас експерт ёнландирмаси учун колдонуу олунур.

Хар токен учун роутер ёнландирменен бмененн експертлар узаринда ехтимал пайланмаси жаратат:

\[ \alpha_{t,u}^{(\ell)} = \operatorname{Softmax} \left( Router_\ell( LN(\tilde z_{t,u}^{(\ell)}) ) \right) \]

ялниз ан юксак скорлу Top-K експерт активлашдирилир.

Бөлүшүлгөн эксперт менен багытталган эксперттердин айырмасы

Хар MoE блокунда үзгүлтүксүз актив олан бир шаред експерт ва ембодимент айырмаларини моделлаян експерт ховузу вардир:

\[ MoE_{\ell,u}(\tilde z) = E_{\ell}^{sh}(\tilde z) + \sum_{j\in TopK(\alpha)} \alpha_jE_{\ell,j}(\tilde z) \]

шаред експерт роботтор арасинда ортақ олан икра қурулушуну ойранмая ёналиб. Роутед експерц иса кинематик сархадлар, идараетма тезлийи, аракет интерфейси ва икра формаси кими роботтор арасинда дайишан өзгөчөлүклари удур.

Бурадаки илимий фикир “хар робот учун так експерт” яратмақ дейил. Авторлор ксусусменен оверкомплете експерт поол колдонуу едир ва експертларин айырмали роботтор арасинда қисман пайлашилмасини истайирлар.

Embodiment-aware роутиң лосс

CM-VLA-нин маанилүү ениликлариндан бири роутер-ин ялниз тапшырма мазмунуна дейил, робот денесинин икра өзгөчөлүкларина да хассас експерт сечимлари ойранмасини ташвиқ едан \(L_{emb}\) иткисидир.

Негизги формаси:

\[ L_{emb}=L_{intra}+\lambda_{sep}L_{inter} \]

\(L_{intra}\) ейни ембодимент учун айырмали тапшырмалардаки ёнландирма нумуналаринин бир-бирина яксин қалмасини ташвиқ едир. \(L_{inter}\) иса айырмали ембодимент прототипларинин муайян маргин даксилинда бир-бирина хаддиндан артиқ яксинлашмасини казаландирир.

Бу иткинин максаты тапшырма айырмаи менен робот айырмаини қаришдирмадан, ейни тапшырма семантикаси алтинда робот икрасиндан қайнақланан айырмаларин експерт сечиминда горунан хала галмасидир.

Лоад-баланкиң лосс

Спарсе MoE системларинда бир неча експертин үзгүлтүксүз сечилмаси ва дигарларинин колдонуу едилмамаси “експерт коллапсе” маселеина ёл ача бмененр. CM-VLA буну азалтмақ учун експертларин емпирик колдонуу тезлийи менен гозланан роутиң ехтималини колдонуу едан баланслашдирма термини татбиқ едир:

\[ L_{bal}=\sum_{j=1}^{N_E}f_jP_j \]

Булакда бу терминин ембодимент айримини арадан қалдирмақ учун дейил, експерт ховузунун хаддиндан артиқ бир неча експертда сикслашмасинин қаршисини алмақ учун колдонуу едилдийи ксусусменен вургуланир.

Флов-матчиң лосс

Робот-мейкиндиги үзгүлтүксүз аракетлари флов матчиң менен ярадилир. Чыныгы аракет чунк-и \(A_t^r\), Гауссиан сас-кую \(\epsilon\) ва аксин замани \(\tau\) колдонуу едмененрак:

\[ x_t^\tau=(1-\tau)\epsilon+\tau A_t^r \]

шаклинда сас-куйлу ара вазийята чеврилир. Хадаф вектор сахаси:

\[ u_t^\tau=A_t^r-\epsilon \]

кими муайян кылынат ва саясат бу вектор сахасини ойранир:

\[ L_{fm} = \mathbb{E} \left[ \|v_\theta(x_t^\tau,\tau,q_t,e_k;C_t)-u_t^\tau\|_2^2 \right] \]

Умуми окутуу иткиси:

\[ L=L_{fm}+\lambda_{bal}L_{bal}+\lambda_{emb}L_{emb} \]

шаклиндадир. Булакда \(\lambda_{bal}=0.15\) ва \(\lambda_{emb}=1\) кими берилген.

CU-Actions чыныгы дүйнөдө кантип түзүлөт?

Симулясияда робот сонландирики позу ва камера калибрланмаси бирбаша алчатан олдугундан робот мейкиндигиндаки посе камера координатларина чеврилир. Ардикил ики кадр арасиндаки нисби камера-мейкиндиги аракети:

\[ \Delta T_t^c=T_{t+1}^c(T_t^c)^{-1} \]

менен хесабланир ва трансласия, фирланма менен гриппер вазийятина айрмененрақ CU-Action етикети ярадилир.

Чыныгы роботда бирбаша камера-робот екстринсик чеврилмасиндан колдонуу етмак ойнақ сифир сурушмалари, линк толеранслари, ленс дисторсияси, интринсик ксата ва ханд-ее калибрлама ксаталариндан тасирлана бмененр. Буна гора изилдөө чыныгы дуня етикетларинда маркер-фрее FEEPE методундан ярарланир.

Алава Б-да гостарилдийи кими енд-еффектор CAD модели учун 80 баксиш букаги ва 12 ин-плане ротасия колдонуу едмененрак умумиликда 960 реферанс темплате түзүлгөн. DINOv2 өзгөчөлүклари менен хадаф горунтуя ан яксин беш реферанс горунуш сечилмиш, 2Д–3Д уйгунлуқлари ва PnP менен башлаңик позу таксмин кылынган. Темпорал кейфраме методу ан чокс саккиз кейфраме колдонуу едир ва кейфраме енмененма букаги 10° кими берилген.

Изилдөөнүн методу жана табылгалары

Модель жана окутуу инфраструктурасы

  • Таксмини модел олчусу: 4 милярд параметр.
  • VLM башлаңики: PaliGemma-3B.
  • VLM қат сайи: 18.
  • Гизли олчу: 2048.
  • Визуал енкодер: SigLIP.
  • Горунту олчусу: 224 × 224.
  • Талим аваданлиги: 16 NVIDIA A800, хар бири 80 ГБ.
  • Он окутуу муддати: 14 гун.
  • Глобал батч сизе: 512.
  • Оптимизер: AdamW.
  • \(\beta_1=0.9\), \(\beta_2=0.95\).
  • Талим аддими: 60.000.
  • Башлаңик леарниң рате: 5×10⁻⁵.
  • Варм-уп: 2.000 аддим.
  • Леарниң-рате счедуле: косине декай.
  • Актион хоризон: Х=50.
  • MoE: 16 роутед експерт + 1 үзгүлтүксүз актив шаред експерт.
  • Роутиң: Top-4.
  • \(L_{inter}\) маргин даяри: 0,25.

Алдын ала окутуу маалымат булактары

Он окутуу маалымат ховузу Open X-Embodiment (OXE), LIBERO ва DROID маалымат дастлариндан түзүлгөн ва умумиликда 19 ембодимент менен муксталиф манипулясия тапшырмаларини ахата едир.

ME-LIBERO деген эмне?

ME-LIBERO орижинал LIBERO бенчмарк-ини ейни тапшырма семантикасини айырмали робот денелари алтинда қийматландиракак шакилда генишландиран чокс-ембодимент тест мухитидир. Изилдөөдө алти бир колдуу робот колдонуу кылынган:

  • UR5
  • Franka Panda
  • Sawyer
  • KUKA iiwa
  • Kinova3
  • xArm

Дил көрсөтмөсү, обектлар, сахна дузани, тапшырма хадафи ва битирма шартлари сабит саксланаркан роботун визуал мушахидаси, CU-Actions, RS-Actions, кинематик қурулушу, иш геометрияси ва проприосептив статистикалари дайишир. Бу дизайн ембодимент хетерогенлийинин тапшырма семантикасиндан мумкун қадар айришдирилмасини мақсадлайир.

CM-VLA Фев-шот робот өткөрүүсүндө канчалык ийгиликтүү?

ME-LIBERO леаве-оне-робот-оут баалоосинда CM-VLA-нин алти хадаф робот узаринда орта ийгилик нисбати 50 көрсөтүмдө %33,7, 100 көрсөтүмдө %59,7, 300 көрсөтүмдө %92,3, 500 көрсөтүмдө %93,5 ва 1000 көрсөтүмдө %97,0-дир. Изилдөөин баалоо протоколунда модел 100-шот шартинда алти максат роботтун хамисинда ан юксак натыйжани алда етмиш, 300-шот шартинда иса алти роботун дордунда ан юксак перформанси көрсөткөн.

LIBERO ва ME-LIBERO натыйжалари

МетодLIBERO орточоME-LIBERO орточо
OpenVLA76,5%73,2%
π092,1%84,9%
π0.596,9%94,5%
OC-VLA95,0%95,7%
CM-VLA97,0%97,9%

Так ембодимент LIBERO мухитинда CM-VLA %97,0 менен ан юксак орта натыйжани вермишдир. чокс ембодимент ME-LIBERO мухитинда иса айырма даха да айдин олмуш ва CM-VLA %97,9-а жеткен.

Чыныгы Sawyer роботуу баалооси

Чыныгы дуня такрубалари Sawyer роботу узаринда дорд айырмали умуммененшдирма шартинда апарилмишдир:

  • айырмали макан мунасибатлари,
  • айырмали хадаф раңлари,
  • ейни сахнада айырмали хадафлар,
  • айырмали сахналардан ибарат оут-оф-домаин умуммененшдирма.
МетодОрточо нормалдаштырылган балл
OpenVLA19
π044
π0.560
OC-VLA55
CM-VLA74

CM-VLA дорд чыныгы дуня шартинин хамисинда муқайиса едмененн методлардан даха юксак натыйжа вермишдир. Ан боюк нисби устунлуюн сахнанин там дайишдийи оут-оф-домаин шартда мушахида олунмаси авторлорин камера-мейкиндиги семантикасинин визуал пайланма дайишмаларина қарши даха мохкам трансфер едменен билдийи шархини дастаклайир.

Леаве-оне-робот-оут фев-шот өткөрүү

Бу такрубада алти роботдан бири окутуу замани тамамменен канарда саксланир. Қалан беш роботла модел ойрадилдикдан андан соң горунмаян хадаф робота ялниз 50, 100, 300, 500 ва я 1000 көрсөтүм вермененрак фине-туниң апарилир.

Максат робот көрсөтүм саныОрточо ийгилик
50-шот33,7%
100-шот59,7%
300-шот92,3%
500-шот93,5%
1000-шот97,0%

Авторлор практики маналилиқ хаддини %90 орта ийгилик кими готурдукда CM-VLA-нин бу хадда чатмақ учун лазим олан көрсөтүм сайи баксиминдан рақиб методлара гора таксминан %13,6–69,7 маалымат самаралилийи артиши тамин етдийини билдиретлар.

100-шот шартинда робота ксас CM-VLA натыйжалари UR5 учун %59,8; Franka учун %60,9; Sawyer учун %52,6; KUKA iiwa учун %61,0; Kinova3 учун %60,4 ва xArm учун %63,4 кими берилген.

Камера-мейкиндиги көзөмөлү чындап айырма жаратабы?

VLM көзөмөлүME-LIBERO100-шот300-шот
Стандарт91,8%50,9%84,2%
Discretized RS-Actions94,1%55,8%87,3%
Discretized CU-Actions97,9%59,7%92,3%

RS-Actions авазина CU-Actions менен VLM көзөмөлү ME-LIBERO ийгиликуну %94,1-дан %97,9-а, 100-шот трансферини %55,8-дан %59,7-я ва 300-шот трансферини %87,3-дан %92,3-а чиксармишдир.

MoE саясатынын абляциясы

СаясатME-LIBERO100-шот300-шот
Dense Flow Policy95,2%22,3%50,0%
Vanilla Sparse MoE98,0%4,8%15,7%
MoE + Shared Expert97,8%7,8%25,7%
Shared Expert + Лбал94,7%6,8%23,4%
Shared Expert + Лемб95,2%40,6%82,0%
Толук CM-VLA97,9%59,7%92,3%

Бу таблица маанилүү илимий натыйжани ортая қоюр: ялниз даха боюк ва я спарсе бир MoE колдонуу едилмаси кросс-ембодимент трансфер учун етарли дейил. Vanilla Sparse MoE окутуу пайланмасинда юксак натыйжа верса да, горунмаян роботторда кидди шакилда ийгиликсуз олмушдур.

Ан боюк трансфер яксшмененшмаси embodiment-aware роутиң лосс алава едилдикда ортая чиксмишдир. Лоад-баланкиң лосс иса такбашина юксак трансфер яратмаса да, експерт колдонуусинин бир неча експерта чокмасинин қаршисини алан тамамлайики рол ойнайир.

Эксперттер чындап роботтор боюнча адистешеби?

Булакнин 14-ку бетсиндаки Сүрөт 6-да 16 роутед експерт-ин алти робот учун активлашма статистикалари верилир. UR5 ксусусменен Е1, Е6, Е9 ва Е12; Franka Panda иса Е2, Е8, Е10 ва Е11 експертларини даха гуклу активлашдирмишдир. Ошол эле учурда хеч бир експерт ялниз бир робота ксас дейил ва бутун експертларда сифирдан боюк колдонуу мушахида олунур.

Бу давраниш моделин “робот кимлийи = експерт” кими кобуд уйгунлашдирма ойранмадийини; бази икра өзгөчөлүкларини роботтор арасинда пайлашаркан базмененрини ембодимент-а ксас айирдигини душундурур.

Franka учун MoE даринлийи боюнка апармененн анализда ан сикс колдонуу олунан дорд експертин умуми активлашма пайи биринки қатда таксминан %43,4 икан алтинки MoE қатинда таксминан %63,4-а юксалмишдир. Авторлор буну ембодимент-спесифик икстисаслашманин еркан қатда қафил ортая чиксмадиги, аракет тамсили даринлашдикка мархалали шакилда формалашдиги кими шарх едирлар.

Эксперт саны жана Top-K сезгичтиги

Алава Е-даки такрубаларда ан яксши комбинасия 16 роутед експерт ва Top-4 кими тапилмишдир:

Эксперт саныTop-KME-LIBERO100-шот300-шот
8296,9%54,2%88,1%
8497,2%56,4%89,7%
16297,4%57,9%90,8%
16497,9%59,7%92,3%
32897,3%57,9%90,9%

чокс аз експерт ембодимент айырмаларини моделлама тутумуну чектелгенлашдираркан, хаддиндан артиқ чокс експерт пайлашими азалдарақ роутиң-ин парчаланмасина ёл ача бмененр. Банзар шакилда чокс ашаги Top-K ифада тутумуну чектелгенлашдирир; чокс юксак Top-K иса спарсе икстисаслашмани заифладир.

Ембодимент шартынын мазмуну

Там ембодимент ембеддиң \(e_k\) дорд нов маалымат ехтива едир:

  • робот кимлийи,
  • қолун сарбастлик даракаси,
  • линк узунлугу статистикалари,
  • гриппер типи.

ялниз ИД колдонуу едилдикда 100-шот натыйжаси %53,9 ва 300-шот натыйжаси %87,0 икан там ембодимент ачиқламаси менен бу даярлар мувафиқ оларақ %59,7 ва %92,3-а юксалмишдир. Бу натыйжа қазанкин ялниз робот етикетинин азбарланмасиндан қайнақланмадигина даир абласион дастак тамин едир.

Изилдөөин дастакладийи натыйжалар

  • Камера-мейкиндиги CU-Action көзөмөли бу такруба дузанинда робот-спаке актион көзөмөлиндан даха юксак кросс-ембодимент трансфер перформанси тамин етмишдир.
  • Пайлашмененн експерт, embodiment-aware роутиң ва лоад-баланкиң бирликда колдонуу едилдикда горунмаян роботтора трансфер айдин шакилда яксшмененшмишдир.
  • CM-VLA хам LIBERO, хам да ME-LIBERO-да муқайиса едмененн негизги VLA баселине-лариндан даха юксак орта ийгилик вермишдир.
  • Чыныгы Sawyer роботу баалоосинда CM-VLA ан юксак орточо нормалдаштырылган баллу яратмишдир.
  • Фев-шот леаве-оне-робот-оут такрубаларинда ксусусменен 50–300 көрсөтүм аралигинда гуклу нумуна самаралилийи алынган.
  • Роутиң анализи айырмали роботторин айырмали, лакин қисман пайлашилмиш експерт колдонуу наксишлари инкишаф етдирдийини көрсөтөт.

Изилдөөин дастакламадийи натыйжалар

  • CM-VLA-нин бутун робот новларинда ейни ийгилику гостаракайи субут едилмамишдир.
  • Бимануал манипулясия қийматландирилмамишдир.
  • Декстероус-ханд көзөмөли қийматландирилмамишдир.
  • Енд-еффектор делта ксарикинда юксак олчулу аракет маканларинда ейни перформанс көрсөтүлгөн эмес.
  • ME-LIBERO симулясия натыйжалари такбашина гениш миқясли санае саха ийгилику манасина галмир.
  • Чыныгы дуня такрубалари Sawyer роботу ва булакда муайян едмененн тапшырма шартлари менен чектелгендур.
  • “Стате-оф-тхе-арт” ифадаси ялниз изилдөөин сечдийи баселине ва баалоо протоколлари контекстинда шарх едилмалидир.

Чектөөлөр

Изилдөөин илк негизги чектелгенийяти аркситектуранин негизгиан бир колдуу енд-еффектор делта көзөмөл маселеина гора инкишаф етдирилмиш олмасидир. Авторлор ики қоллу манипулясия, декстероус ханд ва даха юксак олчулу идараетма интерфейсларини галакак иш сахалари кими ачиқ көрсөтөтлар.

Икинки чектелгенийят чыныгы дунядаки CU-Action етикетларинин FEEPE негизгили посе естиматион системиндан галмасидир. Уст гриппер мустависинин камера баксишина таксминан паралел олдугу халларда поз таксмин ксатаси арта бмененр.

Учунку оларақ чыныгы робот такрубаларинин ахатаси симулясия бенчмарк-ина нисбатан даха дардир. Натикалар айырмали физики роботтор, фабрик шараитлари, узунмуддатли иш, тахлукасизлик баксиминдан критик тапшырмалар ва я идараетма гекикмаларинин гениш спектри учун бирбаша умуммененшдирменен билмаз.

Дордунку оларақ таксминан 4 милярд параметрли моделин 16 адад 80 ГБ NVIDIA A800 узаринда 14 гун он окутуу талаб етмаси методун хесаблама ксаркинин ашаги олмадигини билдирет. Мақаланин “фев-шот” устунлую хадаф робот учун лазим олан ени көрсөтүм сайина аиддир; негизги моделин илкин окутуу ксаркинин кичик олдугу анламина галмир.

Булак жана метод эскертүүсү

Түп нуска баш ат: CM-VLA: Камера-Спаке-Гуидед Mixture-of-Experts Поликй фор Фев-шот Кросс-Ембодимент Трансфер

Авторлор: Bo Liu, Liming Zhang, Yuhan Wang, Yong Liu.

Жооптуу автор: Yong Liu.

Мекеме: Nanjing University of Science and Technology, Нанжиң, Jiangsu, China.

Алава афилиясия: State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery, Xuzhou, Jiangsu, China.

Булак түрү: Препринт изилдөө мақаласи; райчи баалоосиндан кечмамишдир.

Платформа: SSRN.

SSRN DOI: 10.2139/ссрн.6915199.

Жарыяланган дата: 10 июн 2026.

Расмий каттоо: https://ssrn.com/abstract=6915199

Каржылоо: Натионал Натурал Скиенке Фунд оф China, Грант Но. 61473155.

Кызыкчылыктар кагылышы: Авторлор билинан рақиб малийя мараги ва я иши тасирлая бмененкак шаксси мунасибат олмадигини баян етмишдир.

Автордук салымдар: Bo Liu метод, изилдөө, маалымат курасияси ва илк қаралама; Liming Zhang проқрам таминати ва маалымат курасияси; Yuhan Wang маалымат курасияси; Yong Liu консептуаллашдирма, малийя таминати ва язи баалооси вазифаларини узарина готурмушдур.

Код жана көрсөтүүлөр: Булак изилдөө код ва демонстрасияларин lbycdy.github.io/CM-VLA/ унванинда яйимланакагини билдирет.

Методик сархад: Тапинтмененр бир колдуу енд-еффектор делта көзөмөли, LIBERO/ME-LIBERO бенчмарк-лари ва булакда муайян едмененн чыныгы Sawyer робот баалооларина аиддир. Даха гениш ембодимент ва аракет маканларинда мустақил догрулама лазимдир.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты