Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Kompyuter fanlari / UIGaze: Vizual-til modellari foydalanuvchi interfeyslaridagi inson vizual diqqatini qanchalik yaqindan taqlid qila oladi?
Kompyuter fanlari

UIGaze: Vizual-til modellari foydalanuvchi interfeyslaridagi inson vizual diqqatini qanchalik yaqindan taqlid qila oladi?

Min Song, Yoonseong Lee va Yeonhu Seo tomonidan ishlab chiqilgan UIGaze tadqiqoti vizual-til modellari (Vision Language Models, VLM) foydalanuvchi interfeysiga qarayotgan insonlarning vizual diqqat taqsimotini haqiqiy ko‘z kuzatuvi ma’lumotlariga qanchalik yaqinlashtira olishini sinovdan o‘tkazadi.

12/08/2026  Veri Anla 41 marta ko‘rildi
UIGaze: Vizual-til modellari foydalanuvchi interfeyslaridagi inson vizual diqqatini qanchalik yaqindan taqlid qila oladi?

Min Song, Yoonseong Lee va Yeonhu Seo tomonidan ishlab chiqilgan UIGaze tadqiqoti vizual-til modellari (Vision Language Models, VLM) foydalanuvchi interfeysiga qarayotgan insonlarning vizual diqqat taqsimotini haqiqiy ko‘z kuzatuvi ma’lumotlariga qanchalik yaqinlashtira olishini sinovdan o‘tkazadi. Tadqiqotda 62 ishtirokchidan olingan ko‘z kuzatuvi ma’lumotlarini o‘z ichiga olgan UEyes ma’lumotlar to‘plamidagi 1.980 ta foydalanuvchi interfeysi tasviridan foydalanilgan; har biri 495 ta tasvirni o‘z ichiga olgan veb-sahifa, ish stoli interfeysi, mobil interfeys va poster kabi to‘rtta kategoriya baholangan. To‘qqizta VLM hech qanday ko‘z kuzatuvi ma’lumotlari bilan o‘qitilmagan holda zero-shot vazifada 30–50 ta qarash nuqtasini bashorat qiladi. Bu nuqtalar Gauss xiralashtirishi orqali saliyentlik xaritalariga aylantiriladi va inson qarash xaritalari bilan CC, SIM va KL metrikalari orqali taqqoslanadi. Eng kuchli umumiy natija 7 soniyalik kuzatuv muddatida GPT-5.4 tomonidan olinadi: CC=0,408, SIM=0,503 va KL=1,345. Natijalar VLM bashoratlari insonlarning dastlabki qarash fiksatsiyalaridan ko‘ra, interfeysni bir necha soniya ko‘zdan kechirganidan keyin shakllanadigan tadqiqotchi diqqat xatti-harakatiga ko‘proq o‘xshashini ko‘rsatadi. Shunga qaramay, ko‘z kuzatuvi bilan moslik o‘rtacha darajada qoladi va modellar haqiqiy foydalanuvchi tadqiqotlarining o‘rnini bosadigan aniqlikda ekani ko‘rsatilmagan.

Kuzatuv davomiyligi bu farqning eng aniq ko‘rsatkichlaridan biridir. GPT-5.4 ning korrelyatsiya koeffitsiyenti 1 soniyalik inson qarash xaritasiga nisbatan 0,217 bo‘lsa, 3 soniyada 0,326 ga, 7 soniyada esa 0,408 ga ko‘tariladi. Shunga o‘xshash tendensiya modellarning aksariyatida kuzatiladi. Tadqiqotchilar buni VLMlarning tasvirni yaxlit tahlil qilib, semantik jihatdan muhim hududlarni aniqlashi bilan izohlaydi: bu xatti-harakat inson ko‘zining dastlabki lahzada beradigan tez yo‘nalish reaksiyasidan ko‘ra, vaqt davomida rivojlanadigan ongli va tadqiqotchi skanerlashga ko‘proq o‘xshaydi.

Interfeys turi ham natijalarni sezilarli darajada o‘zgartiradi. GPT-5.4, 7 soniyalik taqqoslashda ish stoli interfeyslarida CC=0,506 bilan tadqiqotdagi barcha model-kategoriya kombinatsiyalari orasida eng yuqori korrelyatsiyaga erishadi. Xuddi shu model mobil interfeyslarda 0,369, posterlarda 0,388 va veb-interfeyslarda 0,371 qiymat beradi. Bunga qarshi, foydalanuvchi interfeyslarida avtonom amallarni bajarish uchun ishlab chiqilgan UI-TARS 1.5 ning umumiy 7 soniyalik CC qiymati atigi 0,086; mobil interfeyslarda esa CC=-0,008. Shu sababli tadqiqotning muhim xulosalaridan biri shuki, interfeysda qaysi elementni bosish yoki qaysi amalni bajarish kerakligini aniqlay olish insonlarning qayerga qarashini modellashtirish bilan bir xil qobiliyat emas.

Turkiya nuqtai nazaridan: Tadqiqot Janubiy Koreyada joylashgan tadqiqotchilar tomonidan olib borilgan bo‘lsa-da, UEyes ma’lumotlar to‘plami asosidagi baholash Turkiyaga xos foydalanuvchi xatti-harakatlarini o‘lchamaydi. Natijalar Turkiyadagi elektron tijorat saytlari, korporativ veb-interfeyslar, mobil ilovalar yoki davlat xizmatlari ekranlari uchun bevosita foydalanuvchi xatti-harakati ma’lumoti sifatida qabul qilinmasligi kerak. Shunga qaramay, zero-shot VLM asosidagi diqqat bashorati dizaynning dastlabki bosqichida haqiqiy ko‘z kuzatuvi sinovi o‘tkazilishidan oldin ehtimoliy diqqat hududlarini dastlabki tekshirish uchun tadqiq etishga arzigulik vosita bo‘lishi mumkin. Turk foydalanuvchilar uchun yaroqliligini ko‘rsatish til, o‘qish yo‘nalishi, yosh, tajriba, madaniy fon va interfeys odatlarini qamrab oluvchi mahalliy ko‘z kuzatuvi ma’lumotlari bilan alohida tasdiqlashni talab qiladi.

Tadqiqotning asosiy savoli nima?

Foydalanuvchi interfeysi dizaynida ekranda qaysi elementlar mavjudligi bilangina emas, odamlar ushbu elementlarning qaysilariga qarashi va diqqatini ekran bo‘ylab qanday taqsimlashi ham muhimdir. Ko‘z kuzatuvi tadqiqotlaridan olinadigan saliyentlik xaritalari sarlavhalar, tugmalar, menyular, tasvirlar va boshqa interfeys komponentlarining diqqatni tortish darajasini ko‘rsatishi mumkin. Biroq haqiqiy ko‘z kuzatuvi tajribasi ishtirokchilar, maxsus apparatura, vaqt va ma’lumot yig‘ish infratuzilmasini talab qiladi.

UIGaze tadqiqotining savoli shu nuqtada paydo bo‘ladi: Tasvirlarni va vizual kontentdagi ma’noni talqin qila oladigan zamonaviy VLMlar, maxsus ravishda ko‘z kuzatuvi ma’lumotlari ustida o‘qitilmagan holda, foydalanuvchi interfeysida odamlar qarashi ehtimoli yuqori bo‘lgan hududlarni bashorat qila oladimi?

Tadqiqotchilar buni foydalanuvchi interfeysi elementini topish vazifasi sifatida emas, butun ekran bo‘ylab inson qarash taqsimotini bashorat qilish muammosi sifatida ko‘rib chiqadi. Bu farq muhimdir. Masalan, modelga “qidiruv tugmasini top” deyilganda muayyan obyekt koordinatasini topish, odamlar erkin ko‘rayotgan ekranda diqqat zichligi butun tasvir bo‘ylab qanday tarqalishini bashorat qilish bilan bir xil muammo emas.

Nega UEyes ma’lumotlar to‘plamidan foydalanildi?

Ground truth sifatida UEyes ko‘z kuzatuvi ma’lumotlar to‘plamidan foydalanilgan. Ma’lumotlar to‘plami jami 1.980 ta foydalanuvchi interfeysi ekran tasviridan iborat bo‘lib, to‘rtta kategoriya teng taqsimlangan:

Interfeys kategoriyasiTasvirlar soni
Veb-sahifa495
Ish stoli foydalanuvchi interfeysi495
Mobil foydalanuvchi interfeysi495
Poster495
Jami1.980

UEyes ma’lumotlari 62 ishtirokchining laboratoriya sharoitida yuqori aniqlikdagi ko‘z kuzatuvchi qurilma yordamida to‘plangan qarash o‘lchovlarini o‘z ichiga oladi. Har bir ishtirokchi tasvirlarni 7 soniya davomida ko‘radi. Ma’lumotlar to‘plamida 1, 3 va 7 soniyalik uchta alohida vaqt oynasiga mos saliyentlik xaritalari mavjud.

Bu uch davomiylik tadqiqotning muhim qismidir. Bir soniyalik xarita tasvir bilan ilk uchrashuvdagi diqqat xatti-harakatiga yaqinroq bo‘lsa, 7 soniyalik xarita foydalanuvchiga ekranni ko‘rib chiqish uchun ko‘proq vaqt berilgan holatdagi tadqiqotchi vizual xatti-harakatni ifodalaydi. Shu tariqa UIGaze faqat “model insonga o‘xshaydimi?” savolini emas, inson diqqatining qaysi vaqt bosqichiga ko‘proq o‘xshashini ham o‘rganishi mumkin.

VLMlardan qarash nuqtalari qanday olindi?

Tadqiqotchilar har bir ekran tasvirini VLMga yagona zero-shot prompt bilan yuboradi. Modeldan odamlar qarashi ehtimoli yuqori bo‘lgan 30–50 ta nuqtani normallashtirilgan x va y koordinatalari hamda har bir nuqta uchun intensivlik qiymati bilan ishlab chiqish so‘raladi.

Jarayon uchta asosiy bosqichdan iborat:

  1. Interfeys tasviri VLMga yuboriladi va modeldan qarash koordinatalari so‘raladi.
  2. Normallashtirilgan koordinatalar asl ekran tasvirining piksel o‘lchamlariga o‘tkaziladi.
  3. Har bir nuqtaga intensivlik qiymati bilan og‘irlangan Gauss xiralashtirishi qo‘llanib, uzluksiz saliyentlik xaritasi hosil qilinadi.

Gauss xiralashtirishining standart og‘ishi \(\sigma=40\) piksel sifatida belgilangan. Tadqiqotchilar bu qiymatni UEyes issiqlik xaritalarini yaratish parametrlariga moslashtirish va taxminan 1 darajalik vizual burchak yondashuvini saqlash maqsadida qo‘llagan.

Modeldan bevosita yangi issiqlik xaritasi tasvirini chizish so‘ralmasligining ham metodologik sababi bor. Generativ tasvir modeli asl foydalanuvchi interfeysidagi piksellarni o‘zgartirishi mumkin. Bunday holatda model chiqishi bilan ko‘z kuzatuvi ground truth o‘rtasida piksel darajasida ishonchli taqqoslash qilib bo‘lmaydi. Koordinata ishlab chiqish yondashuvi asl interfeys geometriyasini o‘zgartirmasdan baholash imkonini beradi.

Qaysi modellar taqqoslandi?

Tadqiqot besh provayderdan to‘qqizta VLMni bir xil baholash pipeline’ida taqqoslaydi. Tadqiqotda foydalanilgan model versiyalari va snapshot sanalari quyidagicha:

ProvayderModelTadqiqotda foydalanilgan snapshot
OpenAIGPT-5.42026-03-05
OpenAIGPT-5.4-mini2026-03-17
GoogleGemini 3.1 Pro2026-02-19
GoogleGemini 3.1 Flash Lite2026-03-03
AnthropicClaude Opus 4.62026-02-05
AnthropicClaude Sonnet 4.62026-02-17
QwenQwen 3.5 Plus2026-02-16
QwenQwen 3.5 Flash2026-02-24
ByteDanceUI-TARS 1.5Model identifikatorida sana ko‘rsatilmagan

Barcha modellar tadqiqotda OpenRouter API orqali umumiy interfeys yordamida ishga tushirilgan. Bu tafsilot tajriba turli model provayderlarini bir xil koordinata ishlab chiqish va baholash pipeline’iga kiritgani jihatidan muhimdir.

CC, SIM va KL nimani o‘lchaydi?

VLM yaratgan saliyentlik xaritasi bilan haqiqiy inson ko‘z kuzatuvi xaritasi uchta standart mezon orqali taqqoslangan.

CC (Correlation Coefficient): Bashorat qilingan xarita bilan haqiqiy xaritaning fazoviy naqshlari o‘rtasidagi chiziqli korrelyatsiyani o‘lchaydi. Qiymatning 1 ga yaqinlashishi yuqoriroq o‘xshashlikni anglatadi.

SIM (Similarity): Ikki xaritani ehtimollik taqsimotlari sifatida ko‘rib, ularning qanchalik ustma-ust tushishini o‘lchaydi. 1 qiymati bir xil taqsimotni ifodalaydi.

KL divergence: Haqiqiy diqqat taqsimotini bashorat qilingan taqsimot bilan ifodalashda yuzaga keladigan axborot yo‘qotilishini o‘lchaydi. Bu yerda pastroq qiymat yaxshiroq moslikni anglatadi.

Shu sababli CC va SIM uchun yuqori, KL uchun esa past qiymatlar afzal hisoblanadi.

Tajriba qanday takrorlandi?

1.980 ta tasvirning har biri to‘qqizta model bilan baholangan va model chiqishlaridagi o‘zgaruvchanlikni hisobga olish uchun har bir model-tasvir juftligi bo‘yicha uchta mustaqil ishga tushirish bajarilgan. Har bir bashorat, shuningdek, 1, 3 va 7 soniyalik inson qarash xaritalarining uchalasi bilan taqqoslangan.

Tadqiqotchilar uchta takror yetarlimi-yo‘qligini aniqlash uchun 40 ta tasvirdan iborat kichik to‘plamda 10 takrorli pilot tajriba o‘tkazgan. Uch va 10 takror orqali olingan o‘rtacha metrikalar o‘rtasida e’tiborsiz darajadagi farq topilgani uchun to‘liq tajribada uchta takror ishlatilgan. Tajribalar 2026-yil aprel oyida o‘tkazilgani ko‘rsatilgan.

7 soniyadagi umumiy natija nimani ko‘rsatadi?

Yetti soniyalik inson qarash xaritalariga nisbatan eng yuqori moslik GPT-5.4 tomonidan olingan. Biroq CC=0,408 qiymati to‘liq yoki juda yuqori darajadagi inson bilan moslikni emas, tadqiqotchilar ham ta’riflaganidek, o‘rtacha darajadagi xulqiy moslikni ko‘rsatadi.

ModelCC ↑SIM ↑KL ↓
GPT-5.40,408 ± 0,1690,503 ± 0,0851,345 ± 0,793
Claude Opus 4.60,344 ± 0,2000,468 ± 0,1021,670 ± 0,957
Qwen 3.5 Plus0,337 ± 0,1670,466 ± 0,0851,612 ± 0,869
Qwen 3.5 Flash0,295 ± 0,1710,424 ± 0,1022,214 ± 1,372
GPT-5.4-mini0,289 ± 0,1710,453 ± 0,0841,600 ± 0,918
Claude Sonnet 4.60,279 ± 0,1950,436 ± 0,1101,924 ± 1,247
Gemini 3.1 Pro0,144 ± 0,2280,255 ± 0,1965,457 ± 3,385
Gemini 3.1 Flash Lite0,105 ± 0,2420,234 ± 0,2165,823 ± 3,871
UI-TARS 1.50,086 ± 0,1710,142 ± 0,1437,448 ± 2,580

Qwen 3.5 Plus va Qwen 3.5 Flash uchun ikki tasvirda doimiy javob muvaffaqiyatsizligi kuzatilgani sababli ushbu ikki model metrikalari 1.980 emas, qolgan 1.978 ta tasvir bo‘yicha hisoblangan.

Verianla Live: VLMlarning 7 soniyalik inson qarashi bilan CC mosligi

Grafik tadqiqotning 2-jadvalida berilgan 7 soniyalik o‘rtacha CC qiymatlarini taqqoslaydi. CC qiymatining oshishi VLM tomonidan bashorat qilingan vizual diqqat taqsimoti inson ko‘z kuzatuvi xaritasining fazoviy naqshiga ko‘proq o‘xshashini ko‘rsatadi. Bu qiymatlar model muvaffaqiyatini umumiy ma’noda emas, faqat ushbu tadqiqotdagi qarash xaritasi mosligini o‘lchaydi.

ModelCCMezonManba
GPT-5.40,4087 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
Claude Opus 4.60,3447 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
Qwen 3.5 Plus0,3377 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
Qwen 3.5 Flash0,2957 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
GPT-5.4-mini0,2897 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
Claude Sonnet 4.60,2797 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
Gemini 3.1 Pro0,1447 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
Gemini 3.1 Flash Lite0,1057 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
UI-TARS 1.50,0867 soniyalik inson qarash xaritasi bilan o‘rtacha korrelyatsiya2-jadval
 

Verianla Live: Vizualizatsiya ushbu maqoladagi ko‘rinadigan ilmiy ma’lumotlar jadvalidan brauzerda yaratiladi. Jadval ilmiy source-of-truth sifatida saqlanadi.

Nega inson qarashi bilan o‘xshashlik vaqt o‘tishi bilan ortadi?

Tadqiqotning diqqatga sazovor natijalaridan biri shuki, deyarli barcha modellarda 7 soniyalik qarash taqsimotiga moslik 1 soniyalik taqsimotga qaraganda yuqoriroqdir.

Model1 soniya CC3 soniya CC7 soniya CC
GPT-5.40,217 ± 0,1430,326 ± 0,1630,408 ± 0,169
Claude Opus 4.60,227 ± 0,1570,303 ± 0,1810,344 ± 0,200
Qwen 3.5 Plus0,161 ± 0,1310,245 ± 0,1620,337 ± 0,167
Qwen 3.5 Flash0,135 ± 0,1370,210 ± 0,1620,295 ± 0,171
GPT-5.4-mini0,154 ± 0,1330,220 ± 0,1610,289 ± 0,171
Claude Sonnet 4.60,142 ± 0,1490,213 ± 0,1780,279 ± 0,195
Gemini 3.1 Pro0,059 ± 0,1400,103 ± 0,1890,144 ± 0,228
Gemini 3.1 Flash Lite0,038 ± 0,1470,070 ± 0,1960,105 ± 0,242
UI-TARS 1.50,078 ± 0,1530,101 ± 0,1800,086 ± 0,171

GPT-5.4 uchun 1 soniyadan 7 soniyagacha CC o‘sishi nisbiy ravishda %88. Biroq 1 soniyalik o‘lchovda eng yuqori CC GPT-5.4 ga emas, Claude Opus 4.6 ga tegishli: 0,227 ga qarshi 0,217. GPT-5.4 keyinchalik 3 va 7 soniyalik baholashlarda oldinga chiqadi.

Tadqiqotchilar bu natijani turli modellar inson vizual diqqatining turli vaqt komponentlarini turli darajada tutib olishi mumkinligiga ishora sifatida baholaydi. Umumiy naqsh esa VLMlar tezkor dastlabki fiksatsiyadan ko‘ra, semantik yo‘naltirilgan tadqiqotchi qarashga yaqinlashishini ko‘rsatadi.

Interfeys tuzilishi natijani qanchalik o‘zgartiradi?

Yetti soniyalik CC natijalari interfeys kategoriyalariga ajratilganda model xatti-harakati yanada aniq ko‘rinadi:

ModelIsh stoliMobilPosterVeb
GPT-5.40,506 ± 0,1560,369 ± 0,1650,388 ± 0,1690,371 ± 0,145
Claude Opus 4.60,404 ± 0,1930,275 ± 0,2100,371 ± 0,1830,325 ± 0,191
Qwen 3.5 Plus0,402 ± 0,1620,325 ± 0,1580,323 ± 0,1820,298 ± 0,146
GPT-5.4-mini0,399 ± 0,1680,230 ± 0,1480,255 ± 0,1770,272 ± 0,134
Claude Sonnet 4.60,393 ± 0,1800,187 ± 0,2030,270 ± 0,1670,265 ± 0,167
Qwen 3.5 Flash0,359 ± 0,1850,312 ± 0,1630,246 ± 0,1680,263 ± 0,145
Gemini 3.1 Pro0,220 ± 0,2580,134 ± 0,2130,129 ± 0,2080,093 ± 0,211
Gemini 3.1 Flash Lite0,113 ± 0,2580,112 ± 0,2500,186 ± 0,2400,007 ± 0,179
UI-TARS 1.50,108 ± 0,171-0,008 ± 0,1110,169 ± 0,1730,076 ± 0,171

GPT-5.4 ning ish stoli interfeyslaridagi 0,506 CC qiymati tadqiqotdagi eng yuqori model-kategoriya natijasidir. Tadqiqotchilar ish stoli interfeyslari odatda menyu, kontent maydoni, yon panel va boshqa funksional hududlar o‘rtasida aniqroq vizual iyerarxiya yaratishini VLMlar uchun kuchli fazoviy ishoralar berishi mumkinligi bilan izohlaydi.

Shunga qaramay, natijalarni “soddaroq ekran har doim osonroq” tarzida talqin qilib bo‘lmaydi. Masalan, posterlarda dekorativ elementlar inson diqqatiga semantik muhimlikdan farqli tarzda ta’sir qilishi mumkin. Mobil interfeyslarda esa tor ko‘rish maydonidagi zich va o‘zaro raqobat qiluvchi interaktiv elementlar model bashoratlari bilan inson qarashi o‘rtasidagi farqni kattalashtirishi mumkin.

1-rasm nimani ko‘rsatadi?

Tadqiqotning 5-sahifasidagi 1-rasm GPT-5.4 ning 7 soniyalik baholashdagi vakillik qiluvchi eng yaxshi va eng yomon misollarini yonma-yon ko‘rsatadi. Har bir qatorda chapda asl foydalanuvchi interfeysi, o‘rtada model bashorat qilgan saliyentlik xaritasi va o‘ngda UEyes haqiqiy ko‘z kuzatuvi xaritasi joylashgan.

Yuqoridagi muvaffaqiyatli ish stoli misolida model diqqatni jamlagan hudud haqiqiy inson qarash zichligi bilan sezilarli darajada ustma-ust tushadi. Tadqiqotchilar ushbu ekranning aniq vizual iyerarxiyasi va bir-biridan ajratilgan funksional hududlarini model uchun afzallik sifatida talqin qiladi.

Pastdagi mobil misolda esa farq ancha kattadir. GPT-5.4 semantik jihatdan muhim deb hisoblagan ko‘plab interfeys elementlariga tarqoq diqqat nuqtalarini joylashtiradi, haqiqiy inson qarash ma’lumotlari esa muayyan interaktiv hududlarda ko‘proq jamlanadi. Bu misol VLMning “qaysi elementlar mazmunli?” degan savolga bergan javobi bilan inson ko‘zining haqiqatan “qayerga qarashi” o‘rtasidagi farqni vizual tarzda ko‘rsatadi.

UI-TARS natijasi nima uchun muhim?

UI-TARS 1.5 foydalanuvchi interfeysi bilan o‘zaro ishlashga maxsus mo‘ljallangan model bo‘lishiga qaramay, inson qarashini bashorat qilishda to‘qqiz model orasida oxirgi o‘rinda turadi. Umumiy 7 soniyalik natijada CC=0,086 va KL=7,448 olinadi. Kategoriyalar bo‘yicha KL og‘ishi 5,4 dan 8,8 gacha ekani, mobil CC esa -0,008 gacha tushishi ko‘rsatiladi.

Tadqiqotchilar bu natijani ikki vazifaning tubdan farq qilishi bilan izohlaydi. Interfeys agenti ko‘rsatmani bajarish uchun bosiladigan yoki amal qilinadigan elementni topishni o‘rganishi mumkin. Inson vizual diqqati esa bitta maqsad elementdan iborat emas; u vizual saliyentlik, maket zichligi, semantik ma’no va interaktiv ishoralarning butun ekran bo‘ylab kombinatsiyasidan shakllanadi.

Zero-shot VLM bilan maxsus diqqat modeli bir xil narsa emas

Tadqiqotda UEyes ustida qayta o‘qitilgan UMSI modelining oldingi tadqiqotda AUC=0,878 ga erishgani keltiriladi. UIGaze’dagi eng kuchli VLM esa zero-shot sharoitida 7 soniyada CC=0,408 ga erishadi.

Bu ikki sonni bevosita taqqoslash to‘g‘ri emas; chunki AUC va CC turli metrikalardir. Tadqiqotchilar ham ularni bir-biriga qarshi to‘g‘ridan-to‘g‘ri ishlash musobaqasi sifatida ko‘rsatmaydi. Bu yerdagi ilmiy farq soha uchun maxsus ko‘z kuzatuvi ma’lumotlari bilan o‘qitilgan model va hech qanday diqqat ma’lumoti bilan qayta o‘qitilmagan holda to‘g‘ridan-to‘g‘ri qo‘llanilgan umumiy maqsadli VLM o‘rtasidadir.

VLM yondashuvining afzalligi aniqlikda emas, foydalanish to‘sig‘ining pastligida namoyon bo‘ladi: ko‘z kuzatuvi o‘quv ma’lumoti, qo‘shimcha model o‘qitishi yoki fine-tuning talab qilmasdan yangi ekran tasviriga qo‘llanishi mumkin. Shu sababli tadqiqotchilar VLM asosidagi xaritalarni rasmiy foydalanuvchi sinovining o‘rniga emas, balki dastlabki dizayn ko‘rib chiqishida ishlatilishi mumkin bo‘lgan taxminiy dastlabki signal sifatida baholaydi.

Tadqiqot qo‘llab-quvvatlaydigan xulosalar

  • Zamonaviy VLMlar zero-shot sharoitida inson UI qarash taqsimoti bilan o‘lchanadigan, biroq o‘rtacha darajadagi moslik ko‘rsatishi mumkin.
  • Inson qarashi bilan moslik umuman olganda 1 soniyadan 7 soniyaga qarab ortadi.
  • Bu vaqt xatti-harakati VLM bashoratlari dastlabki refleksiv qarashdan ko‘ra tadqiqotchi va semantik diqqat taqsimotiga o‘xshashini qo‘llab-quvvatlaydi.
  • Model muvaffaqiyati interfeys kategoriyasiga qarab o‘zgaradi.
  • Aniq vizual iyerarxiyaga ega ayrim ish stoli interfeyslarida yuqoriroq moslik olinadi.
  • UI’da amal bajarish qobiliyati inson qarash taqsimotini to‘g‘ri bashorat qilish qobiliyatiga teng emas.
  • VLM asosidagi yondashuv haqiqiy foydalanuvchi ma’lumotlari bo‘lmagan dastlabki dizayn bosqichlarida taxminiy diqqat oldindan baholashini taqdim etishi mumkin.

Tadqiqot qo‘llab-quvvatlamaydigan yoki sinovdan o‘tkazmagan xulosalar

  • VLM saliyentlik xaritalari haqiqiy ko‘z kuzatuvi tadqiqotlarining o‘rnini bosishi mumkinligi ko‘rsatilmagan.
  • CC=0,408 qiymati inson qarashi to‘g‘ri yoki to‘liq nusxalanganini anglatmaydi.
  • Modelning umumiy vizual-til qobiliyati yoki UI-agent ishlashi ushbu tajribadan chiqarib bo‘lmaydi; tadqiqot faqat inson diqqat taqsimoti bilan xulqiy moslikni o‘lchaydi.
  • Tadqiqot individual foydalanuvchilarning qarash xatti-harakatini bashorat qilmaydi; ground truth 62 ishtirokchining agregatsiyalangan ma’lumotlaridir.
  • Yosh, tajriba, madaniyat yoki boshqa demografik xususiyatlar bo‘yicha model aniqligi sinovdan o‘tkazilmagan.
  • Faqat bitta zero-shot prompt ishlatilgani uchun turli prompt dizaynlari natijani qanday o‘zgartirishi aniqlanmagan.
  • VLMlar va maxsus o‘qitilgan saliyentlik modellari bir xil metrikalar bilan nazoratli head-to-head tajribada taqqoslanmagan.
  • Natijalarni Turkiyadagi foydalanuvchilarning diqqat xatti-harakatiga bevosita umumlashtirib bo‘lmaydi.

Tadqiqotning usuli va natijalari

Tajriba dizaynining texnik xulosasi

Tajriba komponentiManbada berilgan qiymat yoki usul
Ma’lumotlar to‘plamiUEyes
Jami UI tasviri1.980
Kategoriyalar soni4
Har kategoriya uchun tasvir495
Ko‘z kuzatuvi ishtirokchisi62
Jami ko‘rish davomiyligi7 soniya
Baholangan inson qarash davomiyliklari1 s, 3 s, 7 s
VLMlar soni9
Har model uchun so‘ralgan qarash nuqtasi30–50
KoordinatalarNormallashtirilgan x, y va intensivlik
Gauss xiralashtirishi\(\sigma=40\) piksel
Har model-tasvir juftligi uchun takror3
Pilot tajriba40 ta tasvir ustida 10 takror
Baholash metrikalariCC, SIM, KL divergence
Modelga kirishOpenRouter API
Tajriba vaqti2026-yil aprel

Eng kuchli va eng zaif umumiy natija

Yetti soniyalik ground truth bo‘yicha GPT-5.4 uchta metrikaning barchasida eng kuchli umumiy natijani beradi: CC=0,408 ± 0,169, SIM=0,503 ± 0,085 va KL=1,345 ± 0,793.

UI-TARS 1.5 esa xuddi shu baholashda CC=0,086 ± 0,171, SIM=0,142 ± 0,143 va KL=7,448 ± 2,580 bilan eng past umumiy moslikni ko‘rsatadi.

Bu taqqoslashda “eng kuchli” iborasi inson ko‘z kuzatuvi xaritasi bilan o‘xshashlikni anglatadi; modellar boshqa vizual vazifalardagi umumiy ishlash reytingini anglatmaydi.

Vaqt natijalarining texnik talqini

GPT-5.4 uchun CC ketma-ketligi

\[ 0{,}217\;(1\,s) \rightarrow 0{,}326\;(3\,s) \rightarrow 0{,}408\;(7\,s) \]

ko‘rinishidadir.

Claude Opus 4.6 uchun xuddi shu ketma-ketlik

\[ 0{,}227 \rightarrow 0{,}303 \rightarrow 0{,}344 \]

va Qwen 3.5 Plus uchun

\[ 0{,}161 \rightarrow 0{,}245 \rightarrow 0{,}337 \]

sifatida berilgan. Ko‘pchilik modellardagi ushbu monoton o‘sish VLM bashorat qilgan fazoviy diqqat uzoqroq davom etgan inson skanerlashi bilan tobora ko‘proq ustma-ust tushishini ko‘rsatadi.

UI-TARS 1.5 ushbu umumiy naqshning yaqqol istisnosidir. CC qiymatlari 0,078 → 0,101 → 0,086 bo‘lgani sababli 7 soniyada uzluksiz yaxshilanish kuzatilmaydi.

Interfeys kategoriyasining ta’siri

GPT-5.4 da eng yuqori kategoriya CC qiymati ish stolida 0,506. Qwen 3.5 Plus ham ish stolida 0,402 ga, Claude Opus 4.6 esa 0,404 ga erishadi. Bu natija eng kuchli modellar aniq iyerarxiyaga ega ish stoli maketlarida inson qarashi bilan yuqoriroq umumiy fazoviy tuzilmani tutib ola olishini ko‘rsatadi.

Biroq kategoriya ta’siri barcha modellarda bir xil emas. Masalan, Qwen 3.5 Flash mobil interfeyslarda CC=0,312 ga erishar ekan, posterlarda 0,246 gacha tushadi. Claude Opus 4.6 esa posterlarda 0,371 bilan mobildagi 0,275 qiymatidan yuqori moslik ko‘rsatadi. Demak, muayyan UI kategoriyasi barcha VLMlar uchun universal ravishda oson yoki qiyin degan xulosa qo‘llab-quvvatlanmaydi.

Noaniqlik va tajribaviy cheklovlar

Jadvallarda faqat o‘rtacha qiymatlar emas, standart og‘ishlar ham berilgan va ayrim past ishlashli modellarda standart og‘ishlar o‘rtacha CC kattaligiga nisbatan ancha yuqori. Bu holat tasvirlar o‘rtasida model xatti-harakati sezilarli darajada o‘zgarishi mumkinligini ko‘rsatadi.

Bundan tashqari, tadqiqot quyidagi metodologik cheklovlarni ochiq ko‘rsatadi:

  • Faqat bitta zero-shot prompt ishlatilgan.
  • So‘ralgan 30–50 qarash nuqtasi sonini yoki vaqtga oid ifodalarni o‘zgartirish sinovdan o‘tkazilmagan.
  • UEyes ma’lumotlari 62 ishtirokchining ko‘z harakatlarini agregatsiyalaydi va individual farqlarni ko‘rinmas qiladi.
  • Yosh, tajriba va madaniy fon kabi demografik o‘zgaruvchilar bo‘yicha alohida baholash qilinmagan.
  • Faqat CC, SIM va KL metrikalari ishlatilgan.
  • AUC-Judd va NSS kabi qo‘shimcha metrikalar boshqa ishlash jihatlarini ko‘rsatishi mumkinligi qayd etilgan.
  • Zero-shot VLMlar bilan UEyes ustida o‘qitilgan CNN asosidagi saliyentlik modellari bir xil metrikalar yordamida nazoratli tarzda taqqoslanmagan.

Amaliy foydalanish nuqtai nazaridan xulosa nima?

Tadqiqotchilar VLM asosidagi diqqat bashoratini ko‘z kuzatuvi tajribalarining muqobili sifatida emas, ayniqsa hali haqiqiy foydalanuvchilari bo‘lmagan yoki dastlabki prototip bosqichidagi interfeyslar uchun foydalanish to‘sig‘i past bo‘lgan dastlabki signal sifatida joylashtiradi.

Masalan, model bashoratlari foydalanuvchi testi o‘tkazilishidan oldin dizayndagi ehtimoliy diqqat ko‘r nuqtalarini aniqlash yoki A/B testidan oldin interfeysni tezkor dastlabki tekshiruvdan o‘tkazish uchun ishlatilishi mumkin. Biroq o‘rtacha darajadagi korrelyatsiya qiymatlari va dastlabki fiksatsiyalardagi zaiflik tufayli kritik UX qarorlarini faqat VLM issiqlik xaritasiga asoslash ushbu tadqiqot natijalari bilan qo‘llab-quvvatlanmaydi.

Manba va usul eslatmasi

Tadqiqotning to‘liq asl nomi: UIGaze: How Closely Can VLMs Approximate Human Visual Attention on User Interfaces?

Mualliflar: Min Song, Yoonseong Lee, Yeonhu Seo.

Mualliflar tartibi: Min Song → Yoonseong Lee → Yeonhu Seo.

Teng hissa/teng birinchi muallif: Ko‘rib chiqilgan versiyada teng birinchi muallif yoki teng hissa bayonoti mavjud emas.

Mas’ul muallif: Manba ma’lum bir muallifni ochiq ravishda “corresponding author” sifatida belgilamaydi. Uchala muallifning ham institutsional e-mail manzillari sarlavha bo‘limida berilgan; shu sababli tasdiqlanmagan mas’ul muallif tayinlanmagan.

Muassasa: Xebec Inc., South Korea. Uchala muallif uchun ham bir xil muassasa ko‘rsatilgan.

Manba turi: arXiv preprint.

Taqriz holati: Ushbu ish taqrizdan o‘tmagan preprintdir; natijalar ushbu nashr bosqichi hisobga olingan holda baholanishi kerak. 12 August 2026 holatiga ko‘ra mustaqil rasmiy bibliografik tekshiruvda taqrizli jurnal yoki konferensiya versiyasi tasdiqlanmagan.

arXiv: arXiv:2604.26352v1 [cs.HC].

arXiv DataCite DOI: 10.48550/arXiv.2604.26352. Ushbu DOI arXiv yozuvining DOI raqamidir; taqrizli jurnal DOI sifatida talqin qilinmasligi kerak.

Yuborilgan sana: 29 April 2026.

Mavzu sohasi: Computer Science — Human-Computer Interaction (cs.HC).

Jurnal/konferensiya: Ko‘rib chiqilgan versiyada tasdiqlangan taqrizli jurnal yoki konferensiya ma’lumoti mavjud emas.

Nashriyot: Taqrizli nashr uchun tasdiqlangan nashriyot mavjud emas; manba arXiv’da chop etilgan preprintdir.

Rasmiy havola: https://arxiv.org/abs/2604.26352

Litsenziya: CC BY 4.0 (Creative Commons Attribution 4.0 International). Qayta foydalanish va moslashtirish amalga oshirilsa, tegishli iqtibos va o‘zgartirish haqidagi ma’lumot saqlanishi kerak.

Ma’lumotlar va kod mavjudligi: Tadqiqotchilar kodni, model bashoratlarini va baholash natijalarini ommaga ochiq taqdim etganini bildiradi. Tadqiqotda ko‘rsatilgan loyiha manzili: https://github.com/dunward/uigaze

Moliyalashtirish: Ko‘rib chiqilgan olti sahifalik versiyada alohida moliyalashtirish yoki minnatdorchilik bo‘limi mavjud emas; moliyalashtirish ma’lumoti tasdiqlanmagani uchun qo‘shilmagan.

Manfaatlar to‘qnashuvi: Ko‘rib chiqilgan versiyada alohida manfaatlar to‘qnashuvi bayonoti mavjud emas. Bundan mualliflarda manfaatlar to‘qnashuvi yo‘q degan xulosa chiqarilmagan.

Asosiy metodologik cheklov: Tadqiqot haqiqiy foydalanuvchilarning agregatsiyalangan ko‘z kuzatuvi ma’lumotlari bilan VLM bashoratlari o‘rtasidagi fazoviy o‘xshashlikni o‘lchaydi. U individual qarash xatti-harakatini bashorat qilmaydi. Modeller bitta zero-shot prompt bilan baholangan va faqat CC, SIM hamda KL metrikalari ishlatilgan. VLMlar bilan UEyes ustida maxsus o‘qitilgan saliency modellari bir xil metrikalar bilan nazoratli head-to-head tajribada taqqoslanmagan.

Vizual baholash: Tadqiqotning 5-sahifasidagi 1-rasm GPT-5.4 ning 7 soniyalik baholashdagi vakillik qiluvchi eng yaxshi va eng yomon misollarini asl UI, VLM bashorati va UEyes ko‘z kuzatuvi ground truth ko‘rinishida yonma-yon ko‘rsatadi. Muvaffaqiyatli misolda model va inson zichlik hududlari ko‘proq ustma-ust tushsa, zich mobil interfeys misolida model ko‘plab semantik elementlarga tarqoq diqqat ajratadi va haqiqiy inson fiksatsiyalari aniqroq hududlarda jamlanadi.

Verianla Live ma’lumot manbai: Maqoladagi Live grafik faqat tadqiqotning 2-jadvalida keltirilgan 7 soniyalik o‘rtacha CC qiymatlaridan foydalanadi. Manbada bo‘lmagan ma’lumot nuqtasi, interpolatsiya yoki oraliq qiymat yaratilmagan.

Ilmiy mazmun chegarasi: Ushbu Verianla maqolasidagi tajriba tuzilishi, modellar, sonli qiymatlar, talqinlar va cheklovlar ko‘rib chiqilgan tadqiqotga asoslanadi. Tashqi tasdiqlash faqat sarlavha, mualliflar, arXiv identifikatori, DOI, sana, nashr holati va litsenziya kabi bibliografik maydonlar uchun ishlatilgan; tashqi manbalardan yangi ilmiy topilma qo‘shilmagan.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati