Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Илми компютер / UIGaze: Моделҳои визуалӣ-забонӣ таваҷҷуҳи визуалии инсонро дар интерфейсҳои корбар то чӣ андоза наздик тақлид карда метавонанд?
Илми компютер

UIGaze: Моделҳои визуалӣ-забонӣ таваҷҷуҳи визуалии инсонро дар интерфейсҳои корбар то чӣ андоза наздик тақлид карда метавонанд?

Таҳқиқоти UIGaze, ки аз ҷониби Min Song, Yoonseong Lee ва Yeonhu Seo таҳия шудааст, месанҷад, ки моделҳои визуалӣ-забонӣ (Vision Language Models, VLM) то чӣ андоза метавонанд тақсимоти таваҷҷуҳи визуалии инсонро ҳангоми нигоҳ кардан ба интерфейси корбар ба маълумоти воқеии пайгирии чашм наздик кунанд.

12/08/2026  Veri Anla 39 боздид
UIGaze: Моделҳои визуалӣ-забонӣ таваҷҷуҳи визуалии инсонро дар интерфейсҳои корбар то чӣ андоза наздик тақлид карда метавонанд?

Таҳқиқоти UIGaze, ки аз ҷониби Min Song, Yoonseong Lee ва Yeonhu Seo таҳия шудааст, месанҷад, ки моделҳои визуалӣ-забонӣ (Vision Language Models, VLM) то чӣ андоза метавонанд тақсимоти таваҷҷуҳи визуалии инсонро ҳангоми нигоҳ кардан ба интерфейси корбар ба маълумоти воқеии пайгирии чашм наздик кунанд. Дар таҳқиқот 1.980 тасвири интерфейси корбар аз маҷмӯаи додаҳои UEyes истифода шудааст, ки маълумоти пайгирии чашми 62 иштирокчиро дар бар мегирад; чор категория — саҳифаи веб, интерфейси мизи корӣ, интерфейси мобилӣ ва постер — арзёбӣ шудаанд, ки ҳар кадом 495 тасвир доранд. Нӯҳ VLM бе омӯзиш бо ягон маълумоти пайгирии чашм, дар вазифаи zero-shot 30–50 нуқтаи нигоҳро пешгӯӣ мекунанд. Ин нуқтаҳо бо норавшании Гауссӣ ба харитаҳои салийентӣ табдил дода шуда, бо харитаҳои нигоҳии инсон аз рӯи метрикаҳои CC, SIM ва KL муқоиса мешаванд. Натиҷаи умумии қавитарин дар давраи мушоҳидаи 7 сония аз ҷониби GPT-5.4 ба даст омадааст: CC=0,408, SIM=0,503 ва KL=1,345. Натиҷаҳо нишон медиҳанд, ки пешгӯиҳои VLM бештар ба рафтори таваҷҷуҳи таҳқиқотии инсон пас аз чанд сония баррасии интерфейс монанданд, на ба фиксатсияҳои аввалини нигоҳ. Бо вуҷуди ин, мувофиқат бо пайгирии чашм дар сатҳи миёна мемонад ва нишон дода нашудааст, ки моделҳо бо дақиқие кор мекунанд, ки омӯзишҳои воқеии корбарро иваз карда тавонанд.

Давомнокии мушоҳида яке аз равшантарин нишондиҳандаҳои ин фарқият аст. Коэффисиенти коррелятсияи GPT-5.4 нисбат ба харитаи нигоҳии 1-сонияи инсон 0,217 аст, дар 3 сония ба 0,326 ва дар 7 сония ба 0,408 мерасад. Тамоюли монанд дар аксари моделҳо дида мешавад. Муҳаққиқон инро ба он вобаста мекунанд, ки VLMҳо тасвирро дар маҷмӯъ таҳлил намуда, минтақаҳои аз ҷиҳати семантикӣ муҳимро муайян мекунанд: чунин рафтор бештар ба сканкунии бошуурона ва таҳқиқотие монанд аст, ки бо гузашти вақт инкишоф меёбад, на ба вокуниши зудии самтгирии чашми инсон дар лаҳзаи аввал.

Навъи интерфейс низ натиҷаҳоро ба таври назаррас тағйир медиҳад. GPT-5.4 дар муқоисаи 7-сония дар интерфейсҳои мизи корӣ бо CC=0,506 ба баландтарин коррелятсия дар байни ҳамаи комбинатсияҳои модел-категорияи таҳқиқот мерасад. Ҳамин модел барои интерфейсҳои мобилӣ 0,369, барои постерҳо 0,388 ва барои интерфейсҳои веб 0,371 медиҳад. Баръакс, UI-TARS 1.5, ки барои иҷрои амалҳои автономӣ дар интерфейсҳои корбар тарҳрезӣ шудааст, арзиши умумии CC-и 7-сонияаш танҳо 0,086 аст; дар интерфейсҳои мобилӣ бошад CC=-0,008. Аз ин рӯ, яке аз натиҷаҳои муҳими таҳқиқот ин аст, ки қобилияти муайян кардани он ки дар интерфейс кадом унсурро пахш кардан ё кадом амалро иҷро кардан лозим аст, ҳамон қобилияте нест, ки ҷойи нигоҳ кардани одамонро модел кунад.

Аз назари Туркия: Гарчанде таҳқиқот аз ҷониби муҳаққиқони мустақар дар Кореяи Ҷанубӣ анҷом дода шудааст, арзёбӣ тавассути маҷмӯаи UEyes рафтори махсуси корбарони Туркияро чен намекунад. Натиҷаҳо набояд ҳамчун маълумоти мустақими рафтори корбар барои сомонаҳои тиҷорати электронии Туркия, интерфейсҳои веби корпоративӣ, барномаҳои мобилӣ ё экранҳои хадамоти давлатӣ қабул карда шаванд. Бо вуҷуди ин, пешгӯии таваҷҷуҳ дар асоси VLM дар ҳолати zero-shot метавонад дар марҳилаи аввали тарҳрезӣ, пеш аз гузаронидани санҷиши воқеии пайгирии чашм, ҳамчун воситаи арзандаи таҳқиқот барои санҷиши ибтидоии минтақаҳои эҳтимолии таваҷҷуҳ истифода шавад. Барои исботи эътиборнокӣ барои корбарони туркӣ, тасдиқи алоҳида бо маълумоти маҳаллии пайгирии чашм лозим аст, ки забон, самти хондан, синну сол, таҷриба, заминаи фарҳангӣ ва одатҳои истифодаи интерфейсро дар бар гирад.

Саволи асосии таҳқиқот чист?

Дар тарҳрезии интерфейси корбар на танҳо он муҳим аст, ки дар экран кадом унсурҳо мавҷуданд, балки инчунин одамон ба кадоме аз онҳо нигоҳ мекунанд ва таваҷҷуҳи худро дар тамоми экран чӣ гуна тақсим мекунанд. Харитаҳои салийентӣ, ки аз таҳқиқоти пайгирии чашм гирифта мешаванд, метавонанд сатҳи ҷалби таваҷҷуҳи сарлавҳаҳо, тугмаҳо, менюҳо, тасвирҳо ва дигар ҷузъҳои интерфейсро нишон диҳанд. Аммо озмоиши воқеии пайгирии чашм иштирокчиён, таҷҳизоти махсус, вақт ва инфрасохтори ҷамъоварии додаҳоро талаб мекунад.

Саволи таҳқиқоти UIGaze дар ҳамин ҷо ба миён меояд: Оё VLMҳои муосир, ки метавонанд тасвирҳо ва маънои мундариҷаи визуалиро тафсир кунанд, бидуни омӯзиши махсус бо маълумоти пайгирии чашм метавонанд минтақаҳоеро дар интерфейси корбар пешгӯӣ кунанд, ки одамон эҳтимол ба онҳо нигоҳ мекунанд?

Муҳаққиқон инро на ҳамчун вазифаи ёфтани як унсури интерфейси корбар, балки ҳамчун масъалаи пешгӯии тақсимоти нигоҳии инсон дар тамоми экран баррасӣ мекунанд. Ин фарқият муҳим аст. Масалан, вақте ба модел гуфта мешавад «тугмаи ҷустуҷӯро ёб», ёфтани координатаи як объекти мушаххас бо пешгӯии он ки зичии таваҷҷуҳ дар экране, ки одамон озодона тамошо мекунанд, дар тамоми тасвир чӣ гуна паҳн мешавад, як масъала нест.

Чаро маҷмӯаи додаҳои UEyes истифода шуд?

Ҳамчун ground truth маҷмӯаи додаҳои пайгирии чашми UEyes истифода шудааст. Маҷмӯа дар маҷмӯъ аз 1.980 акси экрани интерфейси корбар иборат буда, чор категория ба таври баробар пешниҳод шудаанд:

Категорияи интерфейсШумораи тасвирҳо
Саҳифаи веб495
Интерфейси мизи корӣ495
Интерфейси мобилӣ495
Постер495
Ҳамагӣ1.980

Маълумоти UEyes андозагириҳои нигоҳии 62 иштирокчиро дар бар мегирад, ки дар шароити лабораторӣ бо истифода аз пайгиркунандаи чашми дақиқ ҷамъоварӣ шудаанд. Ҳар иштирокчӣ тасвирҳоро 7 сония тамошо мекунад. Дар маҷмӯаи додаҳо харитаҳои салийентӣ барои се равзанаи алоҳидаи вақт — 1, 3 ва 7 сония — мавҷуданд.

Ин се давомнокӣ қисми муҳими таҳқиқот мебошанд. Харитаи яксониягӣ ба рафтори таваҷҷуҳ ҳангоми вохӯрии аввал бо тасвир наздиктар аст, дар ҳоле ки харитаи 7-сониягӣ рафтори визуалии таҳқиқотиро ҳангоми додани вақти бештар барои баррасии экран ифода мекунад. Ба ин тартиб, UIGaze метавонад на танҳо саволи «модел ба инсон монанд аст?» балки инчунин ба кадом марҳилаи замонии таваҷҷуҳи инсон бештар монанд аст-ро таҳқиқ кунад.

Нуқтаҳои нигоҳ аз VLMҳо чӣ гуна гирифта шуданд?

Муҳаққиқон ҳар акси экранро ба VLM бо як дархости ягонаи zero-shot мефиристанд. Аз модел дархост мешавад, ки 30–50 нуқтаеро, ки одамон эҳтимол ба онҳо нигоҳ мекунанд, бо координатаҳои нормализатсияшудаи x ва y ва арзиши шиддат барои ҳар нуқта тавлид кунад.

Раванд аз се марҳилаи асосӣ иборат аст:

  1. Тасвири интерфейс ба VLM фиристода мешавад ва аз модел координатаҳои нигоҳ дархост мешаванд.
  2. Координатаҳои нормализатсияшуда ба андозаҳои пикселии акси аслии экран баргардонида мешаванд.
  3. Ба ҳар нуқта норавшании Гауссӣ, ки бо арзиши шиддат вазн дода шудааст, татбиқ карда шуда, харитаи пайвастаи салийентӣ сохта мешавад.

Инҳирофи стандартии норавшии Гауссӣ ҳамчун \(\sigma=40\) пиксел муайян шудааст. Муҳаққиқон ин арзишро барои мутобиқ шудан ба параметрҳои сохтани heatmap-ҳои UEyes ва нигоҳ доштани тахмини тақрибан 1 дараҷаи кунҷи визуалӣ истифода мебаранд.

Сабаби методологии он низ вуҷуд дорад, ки аз модел мустақиман кашидани тасвири нави heatmap талаб карда намешавад. Модели тавлидкунандаи тасвир метавонад пикселҳои интерфейси аслии корбарро тағйир диҳад. Дар ин ҳолат муқоисаи боэътимоди сатҳи пиксел байни баромади модел ва ground truth-и пайгирии чашм имконнопазир мешавад. Равиши тавлиди координата имкон медиҳад, ки геометрияи интерфейси аслӣ тағйир наёбад.

Кадом моделҳо муқоиса шуданд?

Таҳқиқот нӯҳ VLM аз панҷ таъминкунандаро дар як pipeline-и ягонаи арзёбӣ муқоиса мекунад. Версияҳои модел ва санаҳои snapshot, ки дар таҳқиқот истифода шудаанд, чунинанд:

ТаъминкунандаМоделSnapshot-и истифодашуда дар таҳқиқот
OpenAIGPT-5.42026-03-05
OpenAIGPT-5.4-mini2026-03-17
GoogleGemini 3.1 Pro2026-02-19
GoogleGemini 3.1 Flash Lite2026-03-03
AnthropicClaude Opus 4.62026-02-05
AnthropicClaude Sonnet 4.62026-02-17
QwenQwen 3.5 Plus2026-02-16
QwenQwen 3.5 Flash2026-02-24
ByteDanceUI-TARS 1.5Дар идентификатори модел сана нишон дода нашудааст

Ҳамаи моделҳо дар таҳқиқот тавассути OpenRouter API бо интерфейси умумӣ иҷро шудаанд. Ин ҷузъият аз он ҷиҳат муҳим аст, ки таҷриба таъминкунандагони гуногуни моделро ба як pipeline-и ягонаи тавлиди координата ва арзёбӣ ворид кардааст.

CC, SIM ва KL чиро чен мекунанд?

Харитаи салийентие, ки VLM сохтааст, бо харитаи воқеии пайгирии чашми инсон аз рӯи се меъёри стандартӣ муқоиса шудааст.

CC (Correlation Coefficient): Коррелятсияи хаттии байни намунаҳои фазоии харитаи пешгӯишуда ва харитаи воқеиро чен мекунад. Наздик шудани арзиш ба 1 маънои монандии бештарро дорад.

SIM (Similarity): Ду харитаро ҳамчун тақсимоти эҳтимолият баррасӣ карда, дараҷаи ҳампӯшии онҳоро чен мекунад. Арзиши 1 тақсимоти якхеларо ифода мекунад.

KL divergence: Талафи иттилоотро ҳангоми ифода кардани тақсимоти воқеии таваҷҷуҳ бо тақсимоти пешгӯишуда чен мекунад. Дар ин ҷо арзиши пасттар маънои мувофиқати беҳтарро дорад.

Аз ин рӯ, барои CC ва SIM арзишҳои баланд ва барои KL арзишҳои паст афзал дониста мешаванд.

Таҷриба чӣ гуна такрор карда шуд?

Ҳар яке аз 1.980 тасвир бо нӯҳ модел арзёбӣ шуда, барои ба ҳисоб гирифтани тағйирёбии баромади модел барои ҳар ҷуфти модел-тасвир се иҷрои мустақил анҷом дода шудааст. Ҳар пешгӯӣ инчунин бо ҳар се харитаи нигоҳии инсонии 1, 3 ва 7 сония муқоиса шудааст.

Муҳаққиқон барои муайян кардани кофӣ будани се такрор дар зермаҷмӯаи 40 тасвир таҷрибаи пилотии 10-такрорӣ гузарониданд. Азбаски байни метрикаҳои миёнаи се ва 10 такрор фарқи ночиз ёфт шуд, дар таҷрибаи пурра се такрор истифода гардид. Гуфта мешавад, ки таҷрибаҳо дар April 2026 гузаронида шудаанд.

Натиҷаи умумӣ дар 7 сония чиро нишон медиҳад?

Баландтарин мувофиқат ба харитаҳои нигоҳии ҳафтсонияи инсон аз ҷониби GPT-5.4 ба даст омадааст. Аммо арзиши CC=0,408 на мувофиқати комил ё хеле баланд ба инсон, балки мувофиқати рафтории сатҳи миёнаро нишон медиҳад, тавре ки худи муҳаққиқон низ тавсиф мекунанд.

МоделCC ↑SIM ↑KL ↓
GPT-5.40,408 ± 0,1690,503 ± 0,0851,345 ± 0,793
Claude Opus 4.60,344 ± 0,2000,468 ± 0,1021,670 ± 0,957
Qwen 3.5 Plus0,337 ± 0,1670,466 ± 0,0851,612 ± 0,869
Qwen 3.5 Flash0,295 ± 0,1710,424 ± 0,1022,214 ± 1,372
GPT-5.4-mini0,289 ± 0,1710,453 ± 0,0841,600 ± 0,918
Claude Sonnet 4.60,279 ± 0,1950,436 ± 0,1101,924 ± 1,247
Gemini 3.1 Pro0,144 ± 0,2280,255 ± 0,1965,457 ± 3,385
Gemini 3.1 Flash Lite0,105 ± 0,2420,234 ± 0,2165,823 ± 3,871
UI-TARS 1.50,086 ± 0,1710,142 ± 0,1437,448 ± 2,580

Азбаски барои Qwen 3.5 Plus ва Qwen 3.5 Flash дар ду тасвир нокомии доимии ҷавоб рух додааст, метрикаҳои ин ду модел на бар асоси 1.980, балки бар асоси 1.978 тасвири боқимонда ҳисоб шудаанд.

Verianla Live: Мувофиқати CC-и VLMҳо бо нигоҳии 7-сонияи инсон

График арзишҳои миёнаи CC-и 7-сонияро, ки дар Ҷадвали 2-и таҳқиқот дода шудаанд, муқоиса мекунад. Баланд шудани CC нишон медиҳад, ки тақсимоти таваҷҷуҳи визуалии пешгӯишудаи VLM бештар ба намунаи фазоии харитаи пайгирии чашми инсон монанд мешавад. Ин арзишҳо муваффақияти умумии моделро не, балки танҳо мувофиқати харитаи нигоҳро дар ҳамин таҳқиқот чен мекунанд.

МоделCCМеъёрМанбаъ
GPT-5.40,408Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
Claude Opus 4.60,344Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
Qwen 3.5 Plus0,337Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
Qwen 3.5 Flash0,295Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
GPT-5.4-mini0,289Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
Claude Sonnet 4.60,279Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
Gemini 3.1 Pro0,144Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
Gemini 3.1 Flash Lite0,105Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
UI-TARS 1.50,086Коррелятсияи миёна бо харитаи нигоҳии 7-сонияи инсонҶадвали 2
 

Verianla Live: Визуализатсия аз ҷадвали намоёни маълумоти илмии ҳамин мақола дар браузер сохта мешавад. Ҷадвал ҳамчун science source-of-truth нигоҳ дошта мешавад.

Чаро монандӣ бо нигоҳии инсон бо гузашти вақт меафзояд?

Яке аз натиҷаҳои ҷолиби таҳқиқот ин аст, ки тақрибан дар ҳамаи моделҳо мувофиқат ба тақсимоти нигоҳии 7-сония аз тақсимоти 1-сония баландтар аст.

МоделCC-и 1 сонияCC-и 3 сонияCC-и 7 сония
GPT-5.40,217 ± 0,1430,326 ± 0,1630,408 ± 0,169
Claude Opus 4.60,227 ± 0,1570,303 ± 0,1810,344 ± 0,200
Qwen 3.5 Plus0,161 ± 0,1310,245 ± 0,1620,337 ± 0,167
Qwen 3.5 Flash0,135 ± 0,1370,210 ± 0,1620,295 ± 0,171
GPT-5.4-mini0,154 ± 0,1330,220 ± 0,1610,289 ± 0,171
Claude Sonnet 4.60,142 ± 0,1490,213 ± 0,1780,279 ± 0,195
Gemini 3.1 Pro0,059 ± 0,1400,103 ± 0,1890,144 ± 0,228
Gemini 3.1 Flash Lite0,038 ± 0,1470,070 ± 0,1960,105 ± 0,242
UI-TARS 1.50,078 ± 0,1530,101 ± 0,1800,086 ± 0,171

Барои GPT-5.4 афзоиши CC аз 1 сония то 7 сония ба таври нисбӣ %88 аст. Аммо дар ченаки 1-сония баландтарин CC на ба GPT-5.4, балки ба Claude Opus 4.6 тааллуқ дорад: 0,227 дар муқобили 0,217. GPT-5.4 баъдан дар арзёбиҳои 3 ва 7 сония пешсаф мешавад.

Муҳаққиқон ин натиҷаро ҳамчун ишора ба он арзёбӣ мекунанд, ки моделҳои гуногун метавонанд ҷузъҳои гуногуни замонии таваҷҷуҳи визуалии инсонро дар сатҳҳои гуногун фаро гиранд. Намунаи умумӣ ин аст, ки VLMҳо бештар ба нигоҳии таҳқиқотии аз ҷиҳати семантикӣ роҳнамоишуда наздик мешаванд, на ба фиксатсияи зудии аввал.

Сохтори интерфейс натиҷаро то чӣ андоза тағйир медиҳад?

Вақте натиҷаҳои CC-и ҳафтсония аз рӯи категорияҳои интерфейс ҷудо мешаванд, рафтори модел боз ҳам равшантар мегардад:

МоделМизи корӣМобилӣПостерВеб
GPT-5.40,506 ± 0,1560,369 ± 0,1650,388 ± 0,1690,371 ± 0,145
Claude Opus 4.60,404 ± 0,1930,275 ± 0,2100,371 ± 0,1830,325 ± 0,191
Qwen 3.5 Plus0,402 ± 0,1620,325 ± 0,1580,323 ± 0,1820,298 ± 0,146
GPT-5.4-mini0,399 ± 0,1680,230 ± 0,1480,255 ± 0,1770,272 ± 0,134
Claude Sonnet 4.60,393 ± 0,1800,187 ± 0,2030,270 ± 0,1670,265 ± 0,167
Qwen 3.5 Flash0,359 ± 0,1850,312 ± 0,1630,246 ± 0,1680,263 ± 0,145
Gemini 3.1 Pro0,220 ± 0,2580,134 ± 0,2130,129 ± 0,2080,093 ± 0,211
Gemini 3.1 Flash Lite0,113 ± 0,2580,112 ± 0,2500,186 ± 0,2400,007 ± 0,179
UI-TARS 1.50,108 ± 0,171-0,008 ± 0,1110,169 ± 0,1730,076 ± 0,171

Арзиши 0,506-и CC-и GPT-5.4 дар интерфейсҳои мизи корӣ баландтарин натиҷаи модел-категория дар таҳқиқот аст. Муҳаққиқон баррасӣ мекунанд, ки интерфейсҳои мизи корӣ одатан байни меню, минтақаи мундариҷа, панели паҳлӯӣ ва дигар минтақаҳои функсионалӣ иерархияи визуалии равшантар месозанд ва ин метавонад ба VLMҳо ишораҳои фазоии қавӣ диҳад.

Бо вуҷуди ин, натиҷаҳоро набояд ба шакли «экрани содатар ҳамеша осонтар аст» тафсир кард. Масалан, дар постерҳо унсурҳои ороишӣ метавонанд ба таваҷҷуҳи инсон ба тарзе таъсир расонанд, ки аз аҳамияти семантикӣ фарқ мекунад. Дар интерфейсҳои мобилӣ бошад, унсурҳои зич ва бо ҳам рақобаткунандаи интерактивӣ дар майдони танги намоиш метавонанд фарқи байни пешгӯиҳои модел ва нигоҳии инсонро зиёд кунанд.

Расми 1 чиро нишон медиҳад?

Расми 1 дар саҳифаи 5-и таҳқиқот намунаҳои намояндагии беҳтарин ва бадтарини GPT-5.4-ро дар арзёбии 7-сония паҳлу ба паҳлу нишон медиҳад. Дар ҳар сатр дар тарафи чап интерфейси аслии корбар, дар миёна харитаи салийентии пешгӯишуда аз ҷониби модел ва дар тарафи рост харитаи воқеии пайгирии чашми UEyes ҷойгир аст.

Дар мисоли муваффақи мизи кории боло минтақае, ки модел таваҷҷуҳро дар он мутамарказ мекунад, ба зичии воқеии нигоҳии инсон ба таври назаррас мувофиқ меояд. Муҳаққиқон иерархияи равшани визуалӣ ва минтақаҳои функсионалии ҷудошудаи ин экранро ҳамчун бартарӣ барои модел шарҳ медиҳанд.

Дар мисоли мобилии поёнӣ фарқият хеле бузургтар аст. GPT-5.4 ба бисёр унсурҳои интерфейс, ки аз ҷиҳати семантикӣ муҳим мешуморад, нуқтаҳои таваҷҷуҳи пароканда мегузорад, дар ҳоле ки маълумоти воқеии нигоҳии инсон дар минтақаҳои муайяни интерактивӣ бештар гурӯҳбандӣ мешавад. Ин мисол фарқи байни ҷавоби VLM ба саволи «кадом унсурҳо маънодор ҳастанд?» ва он ки чашми инсон воқеан «ба куҷо нигоҳ мекунад»-ро ба таври визуалӣ нишон медиҳад.

Чаро натиҷаи UI-TARS муҳим аст?

Гарчанде UI-TARS 1.5 модели махсус барои ҳамкорӣ бо интерфейси корбар аст, дар пешгӯии нигоҳии инсон дар байни нӯҳ модел дар ҷойи охирин қарор мегирад. Дар натиҷаи умумии 7-сония CC=0,086 ва KL=7,448 ба даст меояд. Гуфта мешавад, ки инҳирофи KL аз рӯи категорияҳо аз 5,4 то 8,8 аст; CC-и мобилӣ бошад то -0,008 поён меравад.

Муҳаққиқон ин натиҷаро бо он шарҳ медиҳанд, ки ду вазифа аз асос фарқ мекунанд. Агенти интерфейс метавонад ёд гирад, ки барои иҷрои дастур унсури пахшшаванда ё амалшавандаро пайдо кунад. Таваҷҷуҳи визуалии инсон бошад, аз як унсури ҳадаф иборат нест; он аз омезиши салийентии визуалӣ, зичии тарҳ, маънои семантикӣ ва ишораҳои интерактивӣ дар тамоми экран шакл мегирад.

VLM-и zero-shot ва модели махсуси таваҷҷуҳ як чиз нестанд

Дар таҳқиқот оварда мешавад, ки модели UMSI, ки дар UEyes бозомӯзӣ шудааст, дар таҳқиқоти қаблӣ ба AUC=0,878 расидааст. Қавитарин VLM дар UIGaze бошад, дар шароити zero-shot дар 7 сония CC=0,408 ба даст меорад.

Муқоисаи мустақими ин ду рақам дуруст нест; зеро AUC ва CC метрикаҳои гуногунанд. Муҳаққиқон низ онҳоро ҳамчун рақобати мустақими иҷроиш пешниҳод намекунанд. Фарқи илмӣ дар ин ҷо байни модели бо маълумоти махсуси пайгирии чашм барои соҳа омӯзонидашуда ва VLM-и умумимақсаде мебошад, ки бидуни бозомӯзӣ бо маълумоти таваҷҷуҳ мустақиман истифода шудааст.

Бартарии равиши VLM на дар дақиқӣ, балки дар остонаи пасти истифода зоҳир мешавад: онро метавон ба акси нави экран бидуни маълумоти омӯзишии пайгирии чашм, омӯзиши иловагии модел ё fine-tuning татбиқ кард. Аз ин рӯ, муҳаққиқон харитаҳои VLM-ро на ҳамчун ҷойгузини санҷиши расмии корбар, балки ҳамчун сигнали тахминии ибтидоӣ барои баррасии аввали тарҳ арзёбӣ мекунанд.

Натиҷаҳое, ки таҳқиқот дастгирӣ мекунад

  • VLMҳои муосир метавонанд дар шароити zero-shot бо тақсимоти нигоҳии UI-и инсон мувофиқати ченшаванда, вале сатҳи миёна нишон диҳанд.
  • Мувофиқат бо нигоҳии инсон умуман аз 1 сония ба 7 сония меафзояд.
  • Ин рафтори замонӣ дастгирӣ мекунад, ки пешгӯиҳои VLM бештар ба тақсимоти таваҷҷуҳи таҳқиқотӣ ва семантикӣ монанданд, на ба нигоҳии аввалини рефлексӣ.
  • Муваффақияти модел аз категорияи интерфейс вобаста тағйир меёбад.
  • Дар баъзе интерфейсҳои мизи корӣ бо иерархияи визуалии равшан мувофиқати баландтар ба даст меояд.
  • Қобилияти иҷрои амал дар UI бо қобилияти дуруст пешгӯӣ кардани тақсимоти нигоҳии инсон баробар нест.
  • Равиши асосёфта ба VLM метавонад дар марҳилаҳои аввали тарҳрезӣ, ки маълумоти воқеии корбар вуҷуд надорад, арзёбии тахминии ибтидоии таваҷҷуҳ пешниҳод кунад.

Натиҷаҳое, ки таҳқиқот дастгирӣ намекунад ё озмоиш накардааст

  • Нишон дода нашудааст, ки харитаҳои салийентии VLM метавонанд ҷойгузини таҳқиқоти воқеии пайгирии чашм шаванд.
  • Арзиши CC=0,408 маънои онро надорад, ки нигоҳии инсон дуруст ё пурра нусхабардорӣ шудааст.
  • Аз ин таҷриба қобилияти умумии визуалӣ-забонии модел ё иҷроиши агенти UI бароварда намешавад; таҳқиқот танҳо мувофиқати рафториро бо тақсимоти таваҷҷуҳи инсон чен мекунад.
  • Таҳқиқот рафтори нигоҳии корбарони инфиродиро пешгӯӣ намекунад; ground truth маълумоти агрегатшудаи 62 иштирокчӣ мебошад.
  • Дақиқии модел аз рӯи синну сол, таҷриба, фарҳанг ё дигар хусусиятҳои демографӣ озмоиш нашудааст.
  • Азбаски танҳо як дархости zero-shot истифода шудааст, таъсири тарҳҳои гуногуни prompt ба натиҷа муайян нашудааст.
  • VLMҳо ва моделҳои махсус омӯзонидашудаи салийентӣ дар таҷрибаи назоратшавандаи head-to-head бо метрикаҳои якхела муқоиса нашудаанд.
  • Натиҷаҳоро ба рафтори таваҷҷуҳи корбарони Туркия мустақиман умумӣ кардан мумкин нест.

Усул ва натиҷаҳои таҳқиқот

Хулосаи техникии тарҳи таҷриба

Ҷузъи таҷрибаАрзиш ё усули дар манбаъ додашуда
Маҷмӯаи додаҳоUEyes
Ҳамагӣ тасвирҳои UI1.980
Шумораи категорияҳо4
Тасвир барои ҳар категория495
Иштирокчии пайгирии чашм62
Давомнокии умумии тамошо7 сония
Давомнокиҳои нигоҳии инсон, ки арзёбӣ шуданд1 s, 3 s, 7 s
Шумораи VLM9
Нуқтаҳои нигоҳ, ки барои ҳар модел дархост шуданд30–50
Координатаҳоx, y ва шиддати нормализатсияшуда
Норавшии Гауссӣ\(\sigma=40\) пиксел
Такрор барои ҳар ҷуфти модел-тасвир3
Таҷрибаи пилотӣ10 такрор дар 40 тасвир
Метрикаҳои арзёбӣCC, SIM, KL divergence
Дастрасӣ ба моделOpenRouter API
Вақти таҷрибаApril 2026

Қавитарин ва заифтарин натиҷаи умумӣ

Аз рӯи ground truth-и ҳафтсония GPT-5.4 дар ҳамаи се метрика қавитарин натиҷаи умумиро медиҳад: CC=0,408 ± 0,169, SIM=0,503 ± 0,085 ва KL=1,345 ± 0,793.

UI-TARS 1.5 бошад, дар ҳамин арзёбӣ бо CC=0,086 ± 0,171, SIM=0,142 ± 0,143 ва KL=7,448 ± 2,580 пасттарин мувофиқати умумиро нишон медиҳад.

Дар ин муқоиса ибораи «қавитарин» монандӣ ба харитаи пайгирии чашми инсонро ифода мекунад; он рейтинги умумии иҷроиши моделҳо дар дигар вазифаҳои визуалиро маъно надорад.

Тафсири техникии натиҷаҳои замонӣ

Барои GPT-5.4 тартиби CC чунин аст:

\[ 0{,}217\;(1\,s) \rightarrow 0{,}326\;(3\,s) \rightarrow 0{,}408\;(7\,s) \]

чунин аст.

Барои Claude Opus 4.6 ҳамин тартиб

\[ 0{,}227 \rightarrow 0{,}303 \rightarrow 0{,}344 \]

ва барои Qwen 3.5 Plus

\[ 0{,}161 \rightarrow 0{,}245 \rightarrow 0{,}337 \]

дода шудааст. Ин афзоиши монотонӣ дар аксари моделҳо нишон медиҳад, ки таваҷҷуҳи фазоии пешгӯишудаи VLM бо сканкунии дарозмуддати инсон бештар ҳампӯш мешавад.

UI-TARS 1.5 истиснои равшани ин намунаи умумӣ аст. Азбаски арзишҳои CC 0,078 → 0,101 → 0,086 мебошанд, дар 7 сония беҳбудии пайваста дида намешавад.

Таъсири категорияи интерфейс

Дар GPT-5.4 баландтарин CC-и категория дар мизи корӣ 0,506 аст. Qwen 3.5 Plus низ дар мизи корӣ ба 0,402 ва Claude Opus 4.6 ба 0,404 мерасад. Ин натиҷа нишон медиҳад, ки моделҳои қавитар метавонанд дар тарҳҳои мизи кории дорои иерархияи равшан бо нигоҳии инсон сохтори фазоии муштараки бештарро фаро гиранд.

Баръакс, таъсири категория дар ҳамаи моделҳо яксон нест. Масалан, Qwen 3.5 Flash дар интерфейсҳои мобилӣ CC=0,312 ба даст меорад, дар постерҳо бошад ба 0,246 мефарояд. Claude Opus 4.6 дар постерҳо бо 0,371 аз арзиши 0,275-и мобилӣ мувофиқати баландтар нишон медиҳад. Аз ин рӯ, хулосае, ки як категорияи муайяни UI барои ҳамаи VLMҳо универсалӣ осон ё душвор аст, дастгирӣ намешавад.

Номуайянӣ ва маҳдудиятҳои таҷрибавӣ

Дар ҷадвалҳо на танҳо миёнаҳо, балки инҳирофҳои стандартӣ низ дода шудаанд ва дар баъзе моделҳои камсамар инҳирофҳои стандартӣ нисбат ба бузургии миёнаи CC хеле баланданд. Ин нишон медиҳад, ки рафтори модел метавонад байни тасвирҳо ба таври назаррас тағйир ёбад.

Илова бар ин, таҳқиқот маҳдудиятҳои методологии зеринро ошкоро зикр мекунад:

  • Танҳо як дархости zero-shot истифода шудааст.
  • Тағйир додани шумораи дархостшудаи 30–50 нуқтаи нигоҳ ё ибораҳои замонӣ санҷида нашудааст.
  • Маълумоти UEyes ҳаракатҳои чашми 62 иштирокчиро агрегат мекунад ва фарқиятҳои инфиродиро ноаён месозад.
  • Арзёбии ҷудогона аз рӯи тағйирёбандаҳои демографӣ, монанди синну сол, таҷриба ва заминаи фарҳангӣ гузаронида нашудааст.
  • Танҳо метрикаҳои CC, SIM ва KL истифода шудаанд.
  • Зикр мешавад, ки метрикаҳои иловагӣ, аз ҷумла AUC-Judd ва NSS, метавонанд ҷанбаҳои дигари иҷроишро нишон диҳанд.
  • VLMҳои zero-shot бо моделҳои салийентии асосёфта ба CNN, ки дар UEyes омӯзонида шудаанд, бо метрикаҳои якхела ба таври назоратшуда муқоиса нашудаанд.

Аз нигоҳи истифодаи амалӣ натиҷа чист?

Муҳаққиқон пешгӯии таваҷҷуҳ дар асоси VLM-ро на ҳамчун алтернативаи озмоишҳои пайгирии чашм, балки ҳамчун сигнали ибтидоии камхарҷ барои интерфейсҳое ҷойгир мекунанд, ки ҳанӯз корбари воқеӣ надоранд ё дар марҳилаи прототипи барвақтӣ ҳастанд.

Масалан, пешгӯиҳои модел метавонанд барои муайян кардани нуқтаҳои эҳтимолии кӯри таваҷҷуҳ дар тарҳ пеш аз санҷиши корбар ё барои санҷиши тези ибтидоии интерфейс пеш аз A/B test истифода шаванд. Аммо бо сабаби арзишҳои коррелятсияи сатҳи миёна ва заъф дар фиксатсияҳои аввал, такя кардани қарорҳои муҳими UX танҳо ба heatmap-и VLM аз ҷониби натиҷаҳои ин таҳқиқот дастгирӣ намешавад.

Ёддошти манбаъ ва усул

Номи пурраи аслии таҳқиқот: UIGaze: How Closely Can VLMs Approximate Human Visual Attention on User Interfaces?

Муаллифон: Min Song, Yoonseong Lee, Yeonhu Seo.

Тартиби муаллифон: Min Song → Yoonseong Lee → Yeonhu Seo.

Ҳиссаи баробар/муаллифи аввали баробар: Дар версияи баррасишуда изҳорот дар бораи муаллифи аввали баробар ё ҳиссаи баробар вуҷуд надорад.

Муаллифи масъул: Манбаъ ягон муаллифи мушаххасро ошкоро ҳамчун “corresponding author” муайян намекунад. Суроғаҳои почтаи электронии муассисавии ҳар се муаллиф дар қисми сарлавҳа оварда шудаанд; аз ин рӯ, таъйини тасдиқнашудаи муаллифи масъул анҷом дода нашудааст.

Муассиса: Xebec Inc., South Korea. Барои ҳар се муаллиф ҳамон муассиса нишон дода шудааст.

Навъи манбаъ: arXiv preprint.

Вазъи тақриз: Ин кор preprint-и аз тақриз нагузашта мебошад; натиҷаҳо бояд бо дарназардошти ҳамин марҳилаи нашр арзёбӣ шаванд. То 12 August 2026 дар санҷиши мустақили расмии библиографӣ версияи тақризшудаи маҷалла ё конфронс тасдиқ нашудааст.

arXiv: arXiv:2604.26352v1 [cs.HC].

arXiv DataCite DOI: 10.48550/arXiv.2604.26352. Ин DOI-и сабти arXiv аст; набояд ҳамчун DOI-и маҷаллаи тақризшуда тафсир карда шавад.

Санаи ирсол: 29 April 2026.

Соҳаи мавзӯъ: Computer Science — Human-Computer Interaction (cs.HC).

Маҷалла/конфронс: Дар версияи баррасишуда маълумоти тасдиқшуда дар бораи маҷалла ё конфронси тақризшуда вуҷуд надорад.

Ношир: Барои нашри тақризшуда ношири тасдиқшуда вуҷуд надорад; манбаъ preprint-и дар arXiv нашршуда мебошад.

Пайванди расмӣ: https://arxiv.org/abs/2604.26352

Литсензия: CC BY 4.0 (Creative Commons Attribution 4.0 International). Ҳангоми истифодаи дубора ва мутобиқсозӣ бояд иқтибоси мувофиқ ва маълумот дар бораи тағйирот нигоҳ дошта шавад.

Дастрасии додаҳо ва код: Муҳаққиқон мегӯянд, ки код, пешгӯиҳои модел ва натиҷаҳои арзёбиро ба таври оммавӣ дастрас кардаанд. Суроғаи лоиҳа, ки дар таҳқиқот дода шудааст: https://github.com/dunward/uigaze

Маблағгузорӣ: Дар версияи шашсаҳифагии баррасишуда бахши алоҳидаи маблағгузорӣ ё сипосгузорӣ вуҷуд надорад; азбаски маълумоти маблағгузорӣ тасдиқ нашудааст, илова карда нашудааст.

Бархӯрди манфиатҳо: Дар версияи баррасишуда изҳороти алоҳида дар бораи бархӯрди манфиатҳо вуҷуд надорад. Аз ин факт хулоса бароварда нашудааст, ки муаллифон бархӯрди манфиатҳо надоранд.

Маҳдудияти асосии методологӣ: Таҳқиқот монандии фазоиро байни маълумоти агрегатшудаи пайгирии чашми корбарони воқеӣ ва пешгӯиҳои VLM чен мекунад. Он рафтори нигоҳии инфиродиро пешгӯӣ намекунад. Моделҳо бо як дархости zero-shot арзёбӣ шудаанд ва танҳо метрикаҳои CC, SIM ва KL истифода шудаанд. VLMҳо ва моделҳои saliency, ки махсус дар UEyes омӯзонида шудаанд, дар таҷрибаи назоратшавандаи head-to-head бо метрикаҳои якхела муқоиса нашудаанд.

Арзёбии визуалӣ: Расми 1 дар саҳифаи 5-и таҳқиқот намунаҳои намояндагии беҳтарин ва бадтарини GPT-5.4-ро дар арзёбии 7-сония дар шакли UI-и аслӣ, пешгӯии VLM ва ground truth-и пайгирии чашми UEyes паҳлу ба паҳлу нишон медиҳад. Дар мисоли муваффақ минтақаҳои зичии модел ва инсон бештар ҳампӯш мешаванд, дар ҳоле ки дар мисоли интерфейси зичи мобилӣ модел таваҷҷуҳро ба бисёр унсурҳои семантикӣ пароканда мекунад ва фиксатсияҳои воқеии инсон дар минтақаҳои мушаххастар мутамарказ мешаванд.

Манбаи маълумоти Verianla Live: Графики Live дар мақола танҳо арзишҳои миёнаи CC-и 7-сонияро истифода мебарад, ки дар Ҷадвали 2-и таҳқиқот гузориш шудаанд. Нуқтаи додаи дар манбаъ набуда, интерполятсия ё арзиши миёнарав сохта нашудааст.

Ҳудуди мундариҷаи илмӣ: Тарҳи таҷриба, моделҳо, арзишҳои ададӣ, тафсирҳо ва маҳдудиятҳои ин мақолаи Verianla ба таҳқиқоти баррасишуда асос ёфтаанд. Тасдиқи беруна танҳо барои майдонҳои библиографӣ, аз ҷумла сарлавҳа, муаллифон, идентификатори arXiv, DOI, сана, вазъи нашр ва литсензия истифода шудааст; аз манбаъҳои беруна бозёфти нави илмӣ илова нашудааст.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо