Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Muhandislik / CM-VLA: Kamera makoni va ekspertlar aralashmasi bilan robotlar o‘rtasida oz namunali harakat transferi
Muhandislik

CM-VLA: Kamera makoni va ekspertlar aralashmasi bilan robotlar o‘rtasida oz namunali harakat transferi

CM-VLA turli robot tanalari o‘rtasida oz sonli yangi namoyishlar bilan vazifa transferini osonlashtirish uchun kamera makonidagi umumiy harakat semantikasi bilan robotga xos ijro siyosatini bir-biridan ajratadigan Vision-Language-Action arxitekturasidir.

11/09/2026  Veri Anla 42 marta ko‘rildi
CM-VLA: Kamera makoni va ekspertlar aralashmasi bilan robotlar o‘rtasida oz namunali harakat transferi

CM-VLA, turli robot tanalari o‘rtasida oz sonli yangi namoyishlar bilan vazifa transferini osonlashtirish uchun kamera makonidagi umumiy harakat semantikasi bilan robotga xos ijro siyosatini bir-biridan ajratadigan Vision-Language-Action arxitekturasidir. Model Camera-space Unified Actions (CU-Actions) deb ataladigan kamera-makoni harakatlarini VLM asosiy moduli uchun yordamchi nazorat sifatida ishlatadi; so‘ng embodiment-aware Mixture-of-Experts (MoE) flow policy umumiy semantikani maqsad robotning kinematik tuzilishiga va boshqaruv xususiyatlariga mos uzluksiz robot-makoni harakatlariga aylantiradi. Tadqiqotda CM-VLA ME-LIBERO da %97,9 o‘rtacha muvaffaqiyatga, ko‘rilmagan robotlarga 100 namoyishli transferda %59,7 va 300 namoyishda %92,3 o‘rtacha muvaffaqiyatga erishgan. Real Sawyer robot tajribalarida o‘rtacha normallashtirilgan skor %74 deb bildirilgan. Shu bilan birga natijalar bir qo‘lli end-effector delta nazorat kontekstida olingan va modelin iki qollu robotlara, bacariqli allara va ya farqli harakat makonlarina eyni performansla kengayishi ko‘rsatilmagan.

Vision-Language-Action modeli vizual kuzatuv va tabiiy til ko‘rsatmalarini robot bajara oladigan harakatlarga aylantiradigan ko‘p modalli robototexnika siyosati sinfidir. CM-VLA-nin ajratib turuvchi xususiyati “nima qilinishiga” dair robotlar arasinda ulashilishi mumkin bo‘lgan semantikani kamera makoninda o‘rganishi va “qanday bajarilishiga” dair robota xas ijroni alohida ekspertlar aralashmasi siyosatiga qoldirishidir.

Nega turli robotlar o‘rtasida vazifa transferi qiyin?

Robot manipulyatsiya vazifasi semantik jihatdan bir xil qolsa ham, vazifani bajaradigan fizik robot o‘zgarganda problem oddiy koordinata transformatsiyasidan ko‘ra murakkabroq bo‘ladi. Robotlarin bo‘g‘im sonlari, link uzunliklari, ish makonlari, sensorlari, proprioseptiv holat taqsimotlari, kamera pozitsiyalari, boshqaruv chastotalari va gripper mexanizmlari farqli ola bilar.

Masalan, “yashil matoni ol va likopcha ustiga qo‘y” ko‘rsatmasi UR5, Franka Panda, Sawyer, KUKA iiwa, Kinova3 va xArm uchun bir xil vazifa semantikasini olib yuradi. Ammo har bir robotning bir xil end-effector harakatini yerina yetirmak uchun talab qiladigan quyi darajadagi harakat buyruqlari bir xil emas.

Tadqiqotlamin ko‘rib chiqqan asosiy muammo bu iki darajaning mavjud VLA sistemlarinda yetarlicha ajratilmaganidir. Vizual kodlayici kameradan galan tasvirni qayta ishlaganda, harakat yorlig‘i ko‘p ma’lumot to‘plamida robotning o‘z koordinata tizimida aniqlanadi. Shunday qilib model vazifani o‘rganish bilan birga, kamera ila robot koordinat sistemi orasidagi transformatsiyani ham yashirin tarzda hal qilishga majbur bo‘ladi.

CM-VLA nima?

CM-VLA kamera makoninda mu‘ayyan edilmish tanadan mustaqil harakat semantikasini vision-language asosiy modulinda o‘rganadigan va bu semantikani embodiment-aware Mixture-of-Experts flow policy orqali maqsad robotning uzluksiz boshqaruv buyruqlariga aylantiradigan cross-embodiment VLA arxitekturasidir. Modelin asosiy farqi kamera makonindaki idrokka oid “na edilmalidir?” tasviri ila robot makonindaki ijroga oid “neca edilmalidir?” boshqaruvini ikki alohida o‘rganish muammosi sifatida ko‘rishidir.

Kamera-makoni birlashtirilgan harakatlari

Tadqiqotlamin asas ara tasviri Camera-space Unified Action, ya’ni CU-Action-dir. Har bir vaqt qadamidagi kamera-makoni harakati quyidagicha aniqlanadi:

\[ a_t^c=(\Delta p_t^c,\Delta r_t^c,g_t) \]

Bu yerda:

  • \(\Delta p_t^c\) end-effectorning kamera koordinat sistemindaki translyatsiya o‘zgarishini;
  • \(\Delta r_t^c\) kamera koordinat sistemindaki aylanish o‘zgarishini;
  • \(g_t\) gripper buyrug‘ini ifodalaydi.

Bu tasvirning ilmiy roli robotning o‘z oynaq va ya baza koordinatlarindan imkon qadar mustaqil oraliq harakat semantikasini yaratishdir. Kamera go‘ru‘ntu‘su‘ da kamera makoninda kuzatilgani uchun harakat nazoratinin eyni geometrik kontekstga dashinmasi mu‘shahida ila harakat yorlig‘i arasindaki nomuvofiqlikni kamaytirishni maqsad qiladi.

Muhim bir tafsilot CU-Actions-in bevosita yakuniy robot boshqaruv buyrug‘i kimi istifada edilmamasidir. Tadqiqotda discretized CU-Actions VLM asosiy modulinin o‘qitishi uchun yordamchi nazorat vazifasini bajaradi. Haqiqiy bajarilishi mumkin bo‘lgan uzluksiz robot harakatlari alohida downstream policy tomonidan yaratiladi.

CM-VLA “na edilacayini” va “neca edilacayini” qanday ajratadi?

CM-VLA-da kamera-makoni VLM qatlami vizual kuzatuv va dil ko‘rsatmasindan embodiment-agnostic harakat semantikasini o‘yranarak “na edilacayini” tamsil edir; robot-makoni MoE flow policy isa robotning proprioseptiv vaziyyati va embodiment shartindan foydalanib eyni semantikanin konkret robot da “qanday qo‘llanishini” uzluksiz idaraetma signallariga aylantiradi.

Vision-language asosiy moduli

VLM asosiy moduli PaliGemma asoslangan. PaliGemma SigLIP vizual kodlayicisi ila Gemma dil modelini birlashtiradi. Modela bir nechta RGB mu‘shahidasi va dil ko‘rsatmasi beriladi:

\[ \pi_\phi(a_t^c,\hat l_t \mid I_t^1,\ldots,I_t^n,l) \]

Burada \(a_t^c\) CU-Action, \(\hat l_t\) isa vazifa rejasi, quyi vazifa ajratilishi, harakat primitive-lari va gripper pozitsiyasi kimi qo‘shimcha idrokka oid tapshiriq tuzilishini tamsil edan tokenlashtirilgan reasoning chiqishidir.

VLM-in tanlangan qatlaridan olingan yashirin holatlar kalit-qiymat xususiyatlariga proyeksiya qilinadi:

\[ K_t^{(m)}=H_t^{(m)}W_K^{(m)}, \qquad V_t^{(m)}=H_t^{(m)}W_V^{(m)} \]

Bu xu‘susiyyatlar:

\[ C_t=\{(K_t^{(m)},V_t^{(m)})\}_{m\in M} \]

shartlantirish to‘plamini yaratadi va cross-attention dan uzluksiz robot harakati yaradan quyi siyosatga uzatiladi. Mualliflarin dizayninda muhim nuqta yalniz son VLM qatlamindan istifada etmak o‘rniga sechilmish qatlar u‘zra boy KV shartlandirmasi ta’minlashdir.

CU-Action o‘qitish maqsadlari

Matn reasoning chiqishi uchun causal attention va token-token bashorati ishlatiladi:

\[ L_{cot}=-\sum_{k=1}^{K}\log\pi_\phi(l_t^k\mid v_t,l_t^{<k}) \]

Discretized CU-Actions uchun isa butun harakat ketma-ketligidagi munosabatlarni birgalikda modellashtirish maqsadida full-attention ishlatiladi:

\[ L_{cu\_action}=-\sum_{m=1}^{M}\log\pi_\phi(a_m^c\mid v_t,l) \]

Mualliflar bu sechimin CU-Action ardicillig‘inda daha bu‘to‘v va yumshaq kechidli harakat qurulushlari o‘yranmaya ko‘mak etdiyini bildiradilar.

Robot-makoni Mixture-of-Experts siyosati

Ikkinchi bosqichda model kamera-makoni semantikasini haqiqiy robot ishlata oladigan uzluksiz robot-space action, ya’ni RS-Actions-a chevirir. Bunun uchun flow matching asoslangan Transformer siyosati ishlatiladi.

Siyosatin birinchi qatlari barcha robotlar uchun umumiy ishlov beradi. Daha darindaki oxirgi olti blok isa MoE bloklaridir. Embodiment sharti \(e_k\) o‘rtachaq tamsilla birlashtirilib robota xas ekspert yo‘naltirishi uchun ishlatiladi.

Har bir token uchun router yo‘nlandirila bilan ekspertlar da ehtimollik taqsimotini yaratadi:

\[ \alpha_{t,u}^{(\ell)} = \operatorname{Softmax} \left( Router_\ell( LN(\tilde z_{t,u}^{(\ell)}) ) \right) \]

Yalniz eng yuqori balli Top-K ekspert faollashtiriladi.

Ulashilgan ekspert bilan yo‘naltirilgan ekspertlar farqi

Har MoE blokunda doim faol bo‘lgan bir shared expert va embodiment farqlarini modellayan ekspertlar havzasi vardir:

\[ MoE_{\ell,u}(\tilde z) = E_{\ell}^{sh}(\tilde z) + \sum_{j\in TopK(\alpha)} \alpha_jE_{\ell,j}(\tilde z) \]

Shared expert robotlar arasinda o‘rtachaq olan ijro tuzilishini o‘rganishga qaratilgan. Routed experts isa kinematik chegaralar, idaraetma tezliyi, harakat interfeysi va ijro formasi kimi robotlar arasinda dayishan xususiyatlarni singdiradi.

Buradaki ilmiy g‘oya “har robot uchun tak ekspert” yaratish emas. Mualliflar ayniqsa overcomplete expert pool istifada edir va ekspertlarin farqli robotlar arasinda qisman ulashilishini maqsad qiladilar.

Embodiment-aware routing loss

CM-VLA-nin muhim yangiliklaridan biri router-in faqat vazifa mazmuniga emas, robot tanasining ijro xususiyatlariga ham sezgir ekspert sechimlari o‘rganishini rag‘batlantiradigan \(L_{emb}\) lossidir.

Asosiy shakli:

\[ L_{emb}=L_{intra}+\lambda_{sep}L_{inter} \]

\(L_{intra}\) eyni embodiment uchun farqli tapshiriqlardaki yo‘nlandirma nu‘munalarinin bir-birina yaqin qolishini rag‘batlantiradi. \(L_{inter}\) isa farqli embodiment prototiplarinin mu‘ayyan margin daxilinda bir-birina haddan tashqari yaqinlashishini jazolaydi.

Bu itkinin maqsadi tapshiriq farqi ila robot farqini aralashtirmasdan, eyni tapshiriq semantikasi altinda robot ijrosindan kelib chiqadigan farqlarning ekspert sechiminda ko‘rinadigan bo‘lishidir.

Load-balancing loss

Sparse MoE sistemlarinda bir nechta ekspertin uzluksiz sechilmasi va digarlarinin istifada edilmamasi “expert collapse” problemina yol acha bilar. CM-VLA bunu azaltmaq uchun ekspertlarin empirik istifada tezliyi ila go‘zlanan routing ehtimalini istifada edan balanslashdirma termini tatbiq edir:

\[ L_{bal}=\sum_{j=1}^{N_E}f_jP_j \]

Manbada bu terminin embodiment ayrimini aradan qaldirmaq uchun deyil, ekspertlar havzasinun haddindan artiq bir nechta ekspertda sixlashmasinin qarshisini almaq uchun istifada edildiyi ayniqsa vurg‘ulanir.

Flow-matching loss

Robot-makoni uzluksiz harakatlari flow matching ila yaradilir. Gerchak harakat chunk-i \(A_t^r\), Gaussian sas-ku‘yu‘ \(\epsilon\) va axin zamani \(\tau\) istifada edilarak:

\[ x_t^\tau=(1-\tau)\epsilon+\tau A_t^r \]

shaklinda sas-ku‘ylu‘ ara vaziyyata chevrilir. Hadaf vektor sahasi:

\[ u_t^\tau=A_t^r-\epsilon \]

kimi mu‘ayyan edilir va siyosat bu vektor sahasini o‘yranir:

\[ L_{fm} = \mathbb{E} \left[ \|v_\theta(x_t^\tau,\tau,q_t,e_k;C_t)-u_t^\tau\|_2^2 \right] \]

U‘mumi o‘qitish itkisi:

\[ L=L_{fm}+\lambda_{bal}L_{bal}+\lambda_{emb}L_{emb} \]

shaklindadir. Manbada \(\lambda_{bal}=0.15\) va \(\lambda_{emb}=1\) kimi verilmishdir.

CU-Actions gerchak du‘nyada neca yaradilir?

Simulyasiyada robot sonlandirici pozu va kamera kalibrlanmasi birbasha alchatan oldug‘undan robot makonindaki pose kamera koordinatlarina chevrilir. Ardicil iki kadr arasindaki nisbi kamera-makoni harakati:

\[ \Delta T_t^c=T_{t+1}^c(T_t^c)^{-1} \]

ila hesablanir va translasiya, firlanma ila gripper vaziyyatina ayrilaraq CU-Action etiketi yaradilir.

Gerchak robotda birbasha kamera-robot extrinsic chevrilmasindan istifada etmak oynaq sifir su‘ru‘shmalari, link toleranslari, lens distorsiyasi, intrinsic xata va hand-eye kalibrlama xatalarindan tasirlana bilar. Buna go‘ra tadqiqot gerchak du‘nya etiketlarinda marker-free FEEPE metodundan yararlanir.

Alava B-da go‘starildiyi kimi end-effector CAD modeli uchun 80 baxish bucag‘i va 12 in-plane rotasiya istifada edilarak u‘mumilikda 960 referans template yaradilmishdir. DINOv2 xu‘susiyyatlari ila hadaf go‘ru‘ntu‘ya an yaxin besh referans go‘ru‘nu‘sh sechilmish, 2D–3D uyg‘unluqlari va PnP ila bashlang‘ic pozu taxmin edilmishdir. Temporal keyframe metodu an chox sakkiz keyframe istifada edir va keyframe yenilama bucag‘i 10° kimi verilmishdir.

Tadqiqotlamin metodu va tapintilari

Model va o‘qitish infrastrukturu

  • Taxminiy model o‘lchami: 4 milyard parametr.
  • VLM bashlang‘ici: PaliGemma-3B.
  • VLM qat sayi: 18.
  • Gizli o‘lchu‘: 2048.
  • Vizual encoder: SigLIP.
  • Tasvir o‘lchami: 224 × 224.
  • Talim apparati: 16 NVIDIA A800, har biri 80 GB.
  • O‘n o‘qitish davomiyligi: 14 gu‘n.
  • Global batch size: 512.
  • Optimizer: AdamW.
  • \(\beta_1=0.9\), \(\beta_2=0.95\).
  • Talim qadami: 60.000.
  • Bashlang‘ic learning rate: 5×10⁻⁵.
  • Warm-up: 2.000 qadam.
  • Learning-rate schedule: cosine decay.
  • Action horizon: H=50.
  • MoE: 16 routed expert + 1 uzluksiz aktiv shared expert.
  • Routing: Top-4.
  • \(L_{inter}\) margin qiymati: 0,25.

O‘n o‘qitish ma’lumot manbalari

O‘n o‘qitish ma’lumot hovuzu Open X-Embodiment (OXE), LIBERO va DROID ma’lumot dastlarindan yaradilmishdir va u‘mumilikda 19 embodiment ila mu‘xtalif manipulyasiya tapshiriqlarini ahata edir.

ME-LIBERO nadir?

ME-LIBERO orijinal LIBERO benchmark-ini eyni tapshiriq semantikasini farqli robot go‘vdalari altinda qiymatlandiracak shakilda kenglandiran chox-embodiment test muhitidir. Tadqiqotda alti bir qo‘lli robot istifada edilmishdir:

  • UR5
  • Franka Panda
  • Sawyer
  • KUKA iiwa
  • Kinova3
  • xArm

Dil ko‘rsatmasi, obyektlar, sahna du‘zani, tapshiriq hadafi va bitirma shartlari doimiy saxlanarkan robotning vizual kuzatuvsi, CU-Actions, RS-Actions, kinematik qurulushu, ish geometriyasi va proprioseptiv statistikalari dayishir. Bu dizayn embodiment heterogenliyinin tapshiriq semantikasindan mu‘mku‘n qadar ayrishdirilmasini maqsadlayir.

CM-VLA Few-Shot robot transferinda na qadar muvaffaqiyatludur?

ME-LIBERO leave-one-robot-out baholashsinda CM-VLA-nin alti hadaf robot da o‘rtacha muvaffaqiyat nisbati 50 namoyishda %33,7, 100 namoyishda %59,7, 300 namoyishda %92,3, 500 namoyishda %93,5 va 1000 namoyishda %97,0-dir. Tadqiqotlamin baholash protokolunda model 100-shot shartinda alti maqsad robotning hamisinda an yu‘ksak natijani qo‘lga etmish, 300-shot shartinda isa alti robotning do‘rdu‘nda an yu‘ksak performansi ko‘rsatgan.

LIBERO va ME-LIBERO natijalari

MetodLIBERO o‘rtachaME-LIBERO o‘rtacha
OpenVLA76,5%73,2%
π092,1%84,9%
π0.596,9%94,5%
OC-VLA95,0%95,7%
CM-VLA97,0%97,9%

Tak embodiment LIBERO muhitinda CM-VLA %97,0 ila an yu‘ksak o‘rtacha natijani bergan. Chox embodiment ME-LIBERO muhitinda isa farq daha da aydin olmush va CM-VLA %97,9-a erishgan.

Gerchak Sawyer roboti baholashsi

Gerchak du‘nya tajribalari Sawyer roboti da do‘rd farqli u‘mumilashdirma shartinda o‘tkazilgan:

  • farqli makon mu‘nasibatlari,
  • farqli hadaf ranglari,
  • eyni sahnada farqli hadaflar,
  • farqli sahnalardan ibarat out-of-domain u‘mumilashdirma.
MetodO‘rtacha normallashdirilmish skor
OpenVLA19
π044
π0.560
OC-VLA55
CM-VLA74

CM-VLA do‘rd gerchak du‘nya shartinin hamisinda mu‘qayisa edilan metodlardan daha yu‘ksak natija bergan. An bo‘yu‘k nisbi u‘stu‘nlu‘yu‘n sahnanin to‘liq dayishdiyi out-of-domain shartda mu‘shahida olunmasi mu‘alliflarin kamera-makoni semantikasinin vizual paylanma dayishmalarina qarshi daha mo‘hkam transfer edila bildiyi sharhini dastaklayir.

Leave-one-robot-out few-shot transferi

Bu tajribada alti robotdan biri o‘qitish zamani to‘liqamila kanarda saqlanadi. Qalan besh robotla model o‘yradildikdan so‘ng ko‘rilmagan hadaf robota yalniz 50, 100, 300, 500 va ya 1000 namoyish verilarak fine-tuning aparilir.

Hadaf robot namoyish sayiO‘rtacha muvaffaqiyat
50-shot33,7%
100-shot59,7%
300-shot92,3%
500-shot93,5%
1000-shot97,0%

Mualliflar praktiki manaliliq haddini %90 o‘rtacha muvaffaqiyat kimi go‘tu‘rdu‘kda CM-VLA-nin bu hadda chatmaq uchun lazim olan namoyish sayi baximindan raqib metodlara go‘ra taxminan %13,6–69,7 ma’lumot samaraliliyi artishi tamin etdiyini bildiradilar.

100-shot shartinda robota xas CM-VLA natijalari UR5 uchun %59,8; Franka uchun %60,9; Sawyer uchun %52,6; KUKA iiwa uchun %61,0; Kinova3 uchun %60,4 va xArm uchun %63,4 kimi verilmishdir.

Kamera-makoni nazorati haqiqatan farq yaradirmi?

VLM nazoratiME-LIBERO100-shot300-shot
Standart91,8%50,9%84,2%
Discretized RS-Actions94,1%55,8%87,3%
Discretized CU-Actions97,9%59,7%92,3%

RS-Actions o‘rniga CU-Actions ila VLM nazorati ME-LIBERO muvaffaqiyatunu %94,1-dan %97,9-a, 100-shot transferini %55,8-dan %59,7-ya va 300-shot transferini %87,3-dan %92,3-a chixarmishdir.

MoE siyosatinin ablasiyasi

SiyosatME-LIBERO100-shot300-shot
Dense Flow Policy95,2%22,3%50,0%
Vanilla Sparse MoE98,0%4,8%15,7%
MoE + Shared Expert97,8%7,8%25,7%
Shared Expert + Lbal94,7%6,8%23,4%
Shared Expert + Lemb95,2%40,6%82,0%
To‘liq CM-VLA97,9%59,7%92,3%

Bu jadval mu‘hu‘m elmi natijani o‘rtachaya qoyur: yalniz daha bo‘yu‘k va ya sparse bir MoE istifada edilmasi cross-embodiment transfer uchun yetarli deyil. Vanilla Sparse MoE o‘qitish paylanmasinda yu‘ksak natija versa da, ko‘rilmagan robotlarda ciddi shakilda muvaffaqiyatsuz olmushdur.

An bo‘yu‘k transfer yaxshilashmasi embodiment-aware routing loss qo‘shimcha edildikda o‘rtachaya chixmishdir. Load-balancing loss isa takbashina yu‘ksak transfer yaratmasa da, ekspert istifadasinin bir nechta eksperta cho‘kmasinin qarshisini alan to‘liqamlayici rol oynayir.

Ekspertlar haqiqatan robotlara go‘ra ixtisaslashirmi?

Manbanin 14-cu‘ sahifasindaki Shakil 6-da 16 routed expert-in alti robot uchun aktivlashma statistikalari beriladi. UR5 ayniqsa E1, E6, E9 va E12; Franka Panda isa E2, E8, E10 va E11 ekspertlarini daha gu‘clu‘ aktivlashdirmishdir. Shu bilan birga hech bir ekspert yalniz bir robota xas deyil va bu‘tu‘n ekspertlarda sifirdan bo‘yu‘k istifada mu‘shahida olunur.

Bu davranish modelin “robot kimliyi = ekspert” kimi kobud uyg‘unlashdirma o‘yranmadiyini; bazi ijro xu‘susiyyatlarini robotlar arasinda paylasharkan bazilarini embodiment-a xas ayirdig‘ini du‘shu‘ndu‘ru‘r.

Franka uchun MoE darinliyi boyunca aparilan analizda an six istifada olunan do‘rd ekspertin u‘mumi aktivlashma payi birinci qatda taxminan %43,4 ikan altinci MoE qatlaminda taxminan %63,4-a yu‘ksalmishdir. Mualliflar bunu embodiment-spesifik ixtisaslashmanin erkan qatda qafil o‘rtachaya chixmadig‘i, harakat tasviri darinlashdikca marhalali shakilda formalashdig‘i kimi sharh edirlar.

Ekspert sayi va Top-K hassaslig‘i

Alava E-daki tajribalarda an yaxshi kombinasiya 16 routed expert va Top-4 kimi tapilmishdir:

Ekspert sayiTop-KME-LIBERO100-shot300-shot
8296,9%54,2%88,1%
8497,2%56,4%89,7%
16297,4%57,9%90,8%
16497,9%59,7%92,3%
32897,3%57,9%90,9%

Chox az ekspert embodiment farqlarini modellama tutumunu mahdudlashdirarkan, haddindan artiq chox ekspert paylashimi azaldaraq routing-in parchalanmasina yol acha bilar. Banzar shakilda chox ashag‘i Top-K ifada tutumunu mahdudlashdirir; chox yu‘ksak Top-K isa sparse ixtisaslashmani zaifladir.

Embodiment shartinin mazmunu

To‘liq embodiment embedding \(e_k\) do‘rd no‘v ma’lumot ehtiva edir:

  • robot kimliyi,
  • qolun sarbastlik daracasi,
  • link uzunlug‘u statistikalari,
  • gripper tipi.

Yalniz ID istifada edildikda 100-shot natijasi %53,9 va 300-shot natijasi %87,0 ikan to‘liq embodiment achiqlamasi ila bu qiymatlar mu‘vafiq olaraq %59,7 va %92,3-a yu‘ksalmishdir. Bu natija qazancin yalniz robot etiketinin azbarlanmasindan qaynaqlanmadig‘ina dair ablasion dastak tamin edir.

Tadqiqotlamin dastakladiyi natijalar

  • Kamera-makoni CU-Action nazorati bu tajriba du‘zaninda robot-space action nazoratindan daha yu‘ksak cross-embodiment transfer performansi tamin etmishdir.
  • Ulashilgan ekspert, embodiment-aware routing va load-balancing birlikda istifada edildikda ko‘rilmagan robotlara transfer aydin shakilda yaxshilashmishdir.
  • CM-VLA ham LIBERO, ham da ME-LIBERO-da mu‘qayisa edilan asas VLA baseline-larindan daha yu‘ksak o‘rtacha muvaffaqiyat bergan.
  • Gerchak Sawyer robot baholashsinda CM-VLA an yu‘ksak o‘rtacha normallashtirilgan skoru yaratgan.
  • Few-shot leave-one-robot-out tajribalarida ayniqsa 50–300 namoyish aralig‘inda gu‘clu‘ nu‘muna samaraliliyi olingan.
  • Routing analizi farqli robotlarin farqli, lakin qisman paylashilmish ekspert istifada naxishlari inkishaf etdirdiyini ko‘rsatadi.

Tadqiqotlamin dastaklamadiyi natijalar

  • CM-VLA-nin bu‘tu‘n robot no‘vlarinda eyni muvaffaqiyatu go‘staracayi su‘but edilmamishdir.
  • Bimanual manipulyasiya qiymatlandirilmamishdir.
  • Dexterous-hand nazorati qiymatlandirilmamishdir.
  • End-effector delta xaricinda yu‘ksak o‘lchu‘lu‘ harakat makonlarinda eyni performans go‘starilmamishdir.
  • ME-LIBERO simulyasiya natijalari takbashina keng miqyasli sanaye saha muvaffaqiyatu manasina galmir.
  • Gerchak du‘nya tajribalari Sawyer roboti va manbada mu‘ayyan edilan tapshiriq shartlari ila cheklangan.
  • “State-of-the-art” ifadasi yalniz tadqiqotlamin sechdiyi baseline va baholash protokollari kontekstinda sharh edilmalidir.

Cheklovlar

Tadqiqotlamin ilk asas cheklovi arxitekturanin asasan bir qo‘lli end-effector delta nazorat problemina go‘ra inkishaf etdirilmish olmasidir. Mualliflar iki qollu manipulyasiya, dexterous hand va daha yu‘ksak o‘lchu‘lu‘ idaraetma interfeyslarini galacak ish sahalari kimi achiq ko‘rsatadilar.

Ikinci cheklov gerchak du‘nyadaki CU-Action etiketlarinin FEEPE asasli pose estimation sistemindan galmasidir. U‘st gripper mu‘stavisinin kamera baxishina taxminan paralel oldug‘u hallarda poz taxmin xatasi arta bilar.

U‘chu‘ncu‘ olaraq gerchak robot tajribalarinin ahatasi simulyasiya benchmark-ina nisbatan daha dardir. Naticalar farqli fiziki robotlar, fabrik sharaitlari, uzunmu‘ddatli ish, tahlu‘kasizlik baximindan kritik tapshiriqlar va ya idaraetma gecikmalarinin keng spektri uchun birbasha u‘mumilashdirila bilmaz.

To‘rtinchidan taxminan 4 milyard parametrli modelin 16 adad 80 GB NVIDIA A800 da 14 gu‘n o‘n o‘qitish talab etmasi metodun hesablama xarcinin ashag‘i olmadig‘ini bildiradi. Maqalanin “few-shot” u‘stu‘nlu‘yu‘ hadaf robot uchun lazim olan yeni namoyish sayina aiddir; asas modelin ilkin o‘qitish xarcinin kichik oldug‘u anlamina galmir.

Manba va usul eslatmasi

Asl sarlavha: CM-VLA: Camera-Space-Guided Mixture-of-Experts Policy for Few-shot Cross-Embodiment Transfer

Mualliflar: Bo Liu, Liming Zhang, Yuhan Wang, Yong Liu.

Mas’ul muallif: Yong Liu.

Muassasa: Nanjing University of Science and Technology, Nanjing, Jiangsu, China.

Qo‘shimcha affiliatsiya: State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery, Xuzhou, Jiangsu, China.

Manba turi: Preprint tadqiqot maqalasi; taqriz baholashidan o‘tmagan.

Platforma: SSRN.

SSRN DOI: 10.2139/ssrn.6915199.

Nashr sanasi: 10 iyun 2026.

Rasmiy qayd: https://ssrn.com/abstract=6915199

Moliyalashtirish: National Natural Science Fund of China, Grant No. 61473155.

Manfaatlar to‘qnashuvi: Mualliflar bilinan raqib maliyya marag‘i va ya ishi tasirlaya bilacak shaxsi mu‘nasibat olmadig‘ini bayan etmishdir.

Muallif hissalari: Bo Liu metod, tadqiqot, ma’lumot kurasiyasi va ilk qaralama; Liming Zhang proqram taminati va ma’lumot kurasiyasi; Yuhan Wang ma’lumot kurasiyasi; Yong Liu konseptuallashdirma, maliyya taminati va yazi baholashsi vazifalarini u‘zarina go‘tu‘rmu‘shdu‘r.

Kod va namoyishlar: Manba tadqiqot kod va demonstrasiyalarin lbycdy.github.io/CM-VLA/ u‘nvaninda yayimlanacag‘ini bildiradi.

Uslubiy chegara: Tapintilar bir qo‘lli end-effector delta nazorati, LIBERO/ME-LIBERO benchmark-lari va manbada mu‘ayyan edilan gerchak Sawyer robot baholashlarina aiddir. Kengroq embodiment va harakat makonlarinda mustaqil tasdiqlash zarur.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati