Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Муҳандисӣ / Ошкорсозии Объектҳои Зондкунии Фосилавӣ бо Таваҷҷуҳи Визуалии Монанд ба Инсон: Иҷроиши Баландтар ва Мувофиқати Мағз–Модел бо GVA
Муҳандисӣ

Ошкорсозии Объектҳои Зондкунии Фосилавӣ бо Таваҷҷуҳи Визуалии Монанд ба Инсон: Иҷроиши Баландтар ва Мувофиқати Мағз–Модел бо GVA

Guided-Search Visual Attention (GVA) чаҳорчӯбаи таваҷҷуҳи илҳомгирифта аз мағз мебошад, ки коркарди хусусиятҳоро дар шабакаҳои ошкорсозии объектҳои зондкунии фосилавӣ тавассути моделсозии якҷояи намоёнии визуалии бармеангехта аз ангезанда ва роҳнамоии таваҷҷуҳи ҳадафманд танзим мекунад.

15/09/2026  Veri Anla 112 боздид
Ошкорсозии Объектҳои Зондкунии Фосилавӣ бо Таваҷҷуҳи Визуалии Монанд ба Инсон: Иҷроиши Баландтар ва Мувофиқати Мағз–Модел бо GVA

Guided-Search Visual Attention (GVA) як чаҳорчӯбаи таваҷҷуҳи илҳомгирифта аз мағз мебошад, ки раванди коркарди хусусиятҳоро дар шабакаҳои ошкорсозии объектҳои зондкунии фосилавӣ тавассути моделсозии ҳамзамони намоёнии визуалии бармеангехта аз ангезанда ва роҳнамоии таваҷҷуҳи ҳадафманд дар ҷустуҷӯи визуалии инсон танзим мекунад. Таҳқиқот GVA-ро ба панҷ меъмории гуногуни ошкорсозии объект — Faster R-CNN, RetinaNet, YOLOv5s, YOLOv8n ва CenterNet — ворид карда, иҷроишро дар маҷмӯаи додаҳои DIOR, мувофиқати рафторӣ бо инсонро бо додаҳои ҳамзамони пайгирии чашм ва мувофиқати намояндагии мағз–моделро бо representational similarity analysis-и асосёфта ба EEG арзёбӣ кардааст. Дар категорияи ҳавопаймо ҳамаи меъмориҳо афзоиши AP50 нишон доданд ва бузургтарин афзоиши мутлақ барои YOLOv5 +0,260 буд. Коррелятсияи Pearson байни харитаи таваҷҷуҳи GVA ва тақсимоти fixation-и инсон ба 0,740 расид; дар таҳлили EEG–model RSA афзоишҳои равшантарини мувофиқат дар минтақаи оксипиталӣ, ки бо рамзгузории барвақти визуалӣ алоқаманд аст, ва дар минтақаи фронталӣ, ки бо назорати таваҷҷуҳи top-down алоқаманд аст, гузориш шуданд. Бо вуҷуди ин, таҳқиқот ҳанӯз preprint-и аз баррасии ҳамтоён нагузашта мебошад ва мувофиқати мағз бояд танҳо дар доираи чаҳорчӯбаи ченкунии EEG/RSA-и истифодашуда тафсир карда шавад.

Дар моделҳои муосири зондкунии фосилавӣ механизмҳои attention ба таври васеъ истифода мешаванд; аммо қисми зиёди ин механизмҳо на барои тақлид кардани таваҷҷуҳи визуалии инсон, балки барои мустақиман беҳина кардани иҷроиши вазифа омӯхта мешаванд. Аз ин рӯ, минтақаҳое, ки модел ба онҳо таваҷҷуҳ мекунад, метавонанд аз минтақаҳое, ки нозирони касбии инсон дар тасвир меҷӯянд, фарқ кунанд.

Нуқтаи оғози мақола ҳамин фарқият аст. Ба ҷойи мустақиман мутобиқ кардани таваҷҷуҳи модел ба харитаҳои fixation-и инсон, муҳаққиқон пешниҳод мекунанд, ки механизми guided search, ки дар асоси ҷустуҷӯи визуалии инсон қарор дорад, ба модули ҳисоббарорӣ табдил дода шавад. Ҳамин тавр, ба ҷойи танҳо нусхабардорӣ кардани натиҷаи рафтори инсон, ду раванди асосие, ки тақсимоти таваҷҷуҳро ба вуҷуд меоранд, моделсозӣ мешаванд.

Раванди аввал stimulus-driven saliency мебошад, яъне хусусиятҳои сатҳи пасти тасвир, аз қабили канорҳо, фарқи ранг ва ғайриодӣ будани маҳаллӣ, таваҷҷуҳро худ аз худ ҷалб мекунанд. Раванди дуюм target-directed guidance мебошад, яъне ҳадафи вазифаи нозир, масалан “ман ҳавопаймо меҷӯям”, таваҷҷуҳро ба минтақаҳои шабеҳи ҳадаф равона мекунад. GVA ин ду харитаро муттаҳид карда, минтақаҳоеро, ки ҳам аз ҷиҳати визуалӣ ҷолиб ва ҳам аз нигоҳи вазифа муҳиманд, бартарӣ медиҳад.

Чаро Таваҷҷуҳи Визуалии Монанд ба Инсон дар Ошкорсозии Объектҳои Зондкунии Фосилавӣ Муҳим аст?

Таваҷҷуҳи визуалии монанд ба инсон ҳадаф дорад, ки модел на танҳо ба хусусиятҳои аз ҷиҳати оморӣ қавии тасвир, балки ба минтақаҳои визуалӣ ва марбут ба вазифа, ки инсон ҳангоми ҷустуҷӯи ҳадаф ба онҳо афзалият медиҳад, тамаркуз кунад. Азбаски дар тасвирҳои зондкунии фосилавӣ ҳадафҳо метавонанд хурд, пароканда ва дар заминаи зич ҷойгир бошанд, чунин механизми таваҷҷуҳ метавонад натиҷаҳои мусбати бардурӯғро кам кунад, ҳадафҳои аз дастрафтаро коҳиш диҳад ва муқоисаи қарорҳои моделро бо стратегияҳои ҷустуҷӯи визуалии инсон осонтар созад.

Дар тасвирҳои зондкунии фосилавӣ хатҳои парвозу нишасти фурудгоҳ, сатҳҳои замин, минтақаҳои обӣ, биноҳо ё дигар текстураҳои зич метавонанд, ҳарчанд ҳадаф набошанд, хусусиятҳои қавии визуалӣ ба вуҷуд оранд. Detector-и анъанавӣ метавонад дар ин минтақаҳо activation-и баланд тавлид карда, bounding box-ҳои нолозим созад.

Нозири инсон бошад, ба ҳамаи минтақаҳои контрасти баланд дар тасвир яксон муносибат намекунад. Ӯ намоёнии визуалии аз худи тасвир бармеомадаро бо дониши пешакӣ дар бораи объекти мавриди ҷустуҷӯ муттаҳид мекунад. Guided search theory ҷустуҷӯи визуалии инсонро маҳз ҳамчун муттаҳидшавии ин ду ҷараёни иттилоотӣ консептуалӣ мекунад.

Guided Search Theory Чӣ Гуна ба Модели GVA Табдил Дода Мешавад?

GVA ду манбаи асосии таваҷҷуҳро дар guided search theory ҳамчун ду роҳи ҷудогонаи ҳисоббарорӣ амалӣ мекунад: роҳи bottom-up хусусиятҳои визуалии мустақил аз вазифа, ба монанди канорҳо ва ғайриодӣ будани рангро аз тасвир мебарорад, дар ҳоле ки роҳи top-down аз дониши визуалии омӯхташуда дар бораи синфи ҳадаф харитаи эҳтимолияти ҳадаф месозад. Ин ду харита дар сатҳи пиксел зарб мешаванд, то харитаи умумии афзалият ба вуҷуд ояд ва танҳо минтақаҳое, ки ҳам намоён ва ҳам ба вазифа марбутанд, таваҷҷуҳи қавӣ мегиранд.

Bottom-up: Роҳи намоёнии бармеангехта аз ангезанда

Роҳи stimulus-driven saliency бидуни донистани он ки ҳадаф чист, аз рӯи хусусиятҳои визуалии худи тасвир харитаи таваҷҷуҳ месозад. Манбаъ ин занҷири коркардро бо қадамҳои классикии пурра шарҳшавандаи коркарди тасвир месозад.

Аввал тасвир бо mean-shift filtering коркард ва ба фазои ранги CIE-Lab табдил дода мешавад. Сипас Gaussian pyramid-и се-миқёс истифода мешавад:

  • 1× ҳалли аслӣ,
  • 0,5× миқёс,
  • 0,25× миқёс.

Дар ҳар миқёс хусусиятҳои канорӣ бо 3×3 Sobel operator бароварда мешаванд. Илова бар ин, харитаи color-rarity ҳисоб карда мешавад, ки чен мекунад ҳар пиксел нисбат ба муҳити атроф то чӣ андоза ранги нодир ё ғайриодӣ дорад.

Bottom-up attention map дар манбаъ чунин таъриф мешавад:

\[ M_{bu}(x,y)= \mathcal{N} \left[ \sum_{s=1}^{3} w_s \left( E_s(x,y)+C_s(x,y) \right) \right] \]

Дар ин ҷо \(E_s\) харитаи хусусиятҳои канорӣ дар миқёси s, \(C_s\) харитаи нодирии ранг, \(w_s\) вазни миқёс ва \(\mathcal{N}\) min-max normalization-ро ифода мекунад.

Top-down: Роҳи роҳнамоии ҳадафманд

Роҳи дуюм иттилои махсуси ҳадафро ба attention map меорад. Дар таҳқиқот барои омӯзиши имзоҳои ранги Lab-и ҳадафҳои ҳавопаймо Random Forest classifier дар 500 намунаи ҳавопаймои дастӣ нишонгузоришуда омӯзонида шудааст.

Random Forest:

  • 10 дарахт,
  • умқи максималӣ 5

истифода мекунад ва барои ҳар пиксел эҳтимолияти ҳадафро тавлид мекунад. Ин харита бо 5×5 Gaussian kernel ва \(\sigma=2\) ҳамвор карда мешавад.

Top-down guidance map:

\[ M_{td}(x,y)= \mathcal{N} \left[ G_{\sigma=2} * RF(Lab(x,y)) \right] \]

ба ин шакл ифода мешавад.

Random Forest-и ин ҷо бо пораҳои ёрирасони тасвир, ки аз қисмҳои train/test-и detector мустақиланд, омӯзонида шудааст, то аз ихроҷи додаҳо пешгирӣ шавад.

Ин ду роҳи таваҷҷуҳ чӣ гуна муттаҳид мешаванд?

Харитаҳои bottom-up ва top-down attention бо element-wise multiplication муттаҳид мешаванд. Ҳамин тавр, мақсад пахш кардани минтақаҳое мебошад, ки танҳо аз ҷиҳати физикӣ ҷолиб, вале ба ҳадаф бетааллуқанд, инчунин минтақаҳое, ки ба ҳадаф шабеҳанд, аммо далели визуалии заиф доранд.

Харитаи муттаҳидшуда бо marker-controlled watershed algorithm ба минтақаҳои номзад тақсим мешавад. Манбаъ мегӯяд, ки номзадҳо бо шартҳои зерин филтр карда мешаванд:

  • масоҳат: 50–8000 пиксел,
  • таносуби тарафҳо: 0,2–5.

Дар марказҳои минтақаҳои дуруст kernel-ҳои дуандозаи Gaussian бо \(\sigma=10\) пиксел ҷойгир карда мешаванд, то attention map-и ниҳоии монанд ба инсон сохта шавад:

\[ A_{GVA}(x,y)= \mathcal{N} \left[ \sum_{k=1}^{K} \mathcal{G} \left( (x,y);c_k,\sigma=10 \right) \right] \]

Дар ин ҷо \(K\) шумораи минтақаҳои дурусти номзад ва \(c_k\) марказҳои ин минтақаҳоро ифода мекунад.

Оё GVA Дар Ҳақиқат Модули Таваҷҷуҳи Бепараметр аст?

Ворид кардани GVA ба шабакаи detector параметрҳои нави омӯзишшавандаи шабакаи амиқ илова намекунад ва роҳи bottom-up saliency аз амалиётҳои детерминистии коркарди тасвир иборат аст; аммо роҳи top-down guidance аз Random Forest-и дар 500 намунаи нишонгузоришуда омӯзондашуда истифода мебарад. Аз ин рӯ, истилоҳи “parameter-free” дар манбаъ набояд чунин фаҳмида шавад, ки дар тамоми занҷири ҳисоббарории GVA ягон ҷузъи омӯзишшуда вуҷуд надорад; балки маънояш он аст, ки ба меъмории detector параметрҳои нави оптимизатсияшавандаи neural network илова намешаванд.

Ин фарқ аз ҷиҳати методологӣ муҳим аст. Манбаъ мегӯяд, ки шохаҳои classification ва regression-и detector тағйир дода нашудаанд, GVA native loss functions-ро нигоҳ медорад ва ба омӯзиши detector learnable layer-и нав илова намекунад.

Бо вуҷуди ин, Random Forest, ки барои сохтани target-directed attention map истифода мешавад, пешакӣ омӯзонида мешавад. Пас, ҷузъи top-down-и GVA иттилои омӯхташуда дар бораи синфи ҳадафро дар бар мегирад.

GVA ба панҷ detector-и гуногун чӣ гуна ворид карда мешавад?

МеъморӣНавъи detectorРавиши ворид кардани GVA
Faster R-CNNДумарҳилаӣGVA candidate box-ҳое, ки бо Watershed ҳосил мешаванд, ба ҷойи anchor-ҳои зичи классикӣ истифода мешаванд; миёнаи attention score дар минтақа ҳамчун proposal confidence арзёбӣ мешавад.
RetinaNetЯкмарҳилаӣ, anchor-basedНомзадҳои GVA ба ҷойи multi-scale anchor grid-ҳои пешакӣ муайяншуда истифода мешаванд.
YOLOv5sЯкмарҳилаӣ, anchor-basedGVA binary mask ба андозаи feature map мутобиқ карда мешавад; gradient backpropagation ва минтақаҳои баромад бо минтақаҳои attention-и монанд ба инсон маҳдуд карда мешаванд.
YOLOv8nЯкмарҳилаӣGVA mask ба миқёси feature-map мутобиқ шуда, feature allocation ва минтақаҳои prediction-ро модул мекунад.
CenterNetAnchor-freeGVA mask-и аз нав миқёсшуда center-point heatmap prediction-ҳоро модул мекунад.

Қарори муҳими тарроҳии таҳқиқот ҷойгир кардани GVA байни detector backbone ва Feature Pyramid Network (FPN) мебошад, то меъмории асосии detector то ҳадди имкон камтар тағйир ёбад.

Усул ва Натиҷаҳои Таҳқиқот

Маҷмӯаи додаҳои EEGET-RSOD барои пайгирии чашм ва EEG

Маҷмӯаи додаҳои EEGET-RSOD ҳамчун benchmark барои рафтори инсон ва намояндагии мағз истифода шудааст. Ин маҷмӯа 1.000 тасвири оптикии зондкунии фосилавии 800×800 пикселиро аз DIOR дар бар мегирад.

Ба таҳқиқот 38 иштирокчӣ дохил шуданд ва манбаъ мегӯяд, ки ҳамаи онҳо informed consent-и хаттӣ додаанд. Тасдиқи ахлоқӣ аз ҷониби Beijing Normal University Ethics Committee бо рақами 20221024111 дода шудааст.

ЧенакТаҷҳизот / параметр
Пайгирии чашмSMI RED250, 250 Hz
EEGNE Enobio, 32 канал, 500 Hz, ҷойгиршавии 10–20
Ҳамоҳангсозӣ<2 ms trigger error
Давомнокии ангезанда3000 ms
Экрани холӣ500 ms

Fixation-ҳо бо I-DT algorithm бароварда шуданд ва group fixation heatmap-ҳо бо \(\sigma=8\) Gaussian kernel сохта шуданд.

Пешкоркарди EEG

Ба сигналҳои EEG:

  • филтркунии 0,5–45 Hz,
  • mastoid re-referencing,
  • тозакунии artefact бо ICA,
  • −200–0 ms baseline correction

татбиқ шудааст.

Чор минтақаи функсионалӣ бо равзанаҳои гуногуни вақт муайян шуданд:

Минтақаи мағзРавзанаи вақт
Оксипиталӣ0–300 ms
Темпоралӣ100–400 ms
Фронталӣ200–500 ms
Париеталӣ300–600 ms

Whole-brain Representational Similarity Matrices бошад дар равзанаи 0–600 ms сохта шуданд.

Тартиби омӯзиши detector

Қисми асосии таҷрибаҳои detector дар зермаҷмӯаи ҳавопаймоии DIOR иҷро шудааст.

ПараметрҚимат
Train / validation / test7 : 2 : 1
FrameworkPyTorch
GPURTX 4090
Batch size16
Ҳалли вуруд800×800
Epoch300
Оғози backboneImageNet pre-trained
Интихоби checkpointБаландтарин AP50

GVA Иҷроиши Ошкорсозии Объектро То Чӣ Андоза Афзоиш Дод?

Дар санҷиши ҳавопаймои DIOR, илова кардани GVA AP50-ро дар ҳамаи панҷ detector зиёд кард; бузургтарин афзоиши мутлақи байни меъмориҳо дар YOLOv5 буд, ки аз 0,680 то 0,940 боло рафта, +0,260 шуд. Моделҳои дорои иҷроиши ибтидоии заифтар фоидаи бештар гирифтанд, дар ҳоле ки афзоишҳо дар RetinaNet ва YOLOv8, ки аллакай иҷроиши баланд доштанд, хурдтар буданд.

МоделBaseline PrecisionBaseline RecallBaseline AP50GVA PrecisionGVA RecallGVA AP50Фарқи AP50
Faster R-CNN0,9150,4420,6000,7860,7390,760+0,160
YOLOv50,7170,6470,6800,9790,9070,940+0,260
CenterNet0,8410,7750,8100,9010,8520,880+0,070
RetinaNet0,9820,8740,9200,9910,9180,950+0,030
YOLOv80,9820,9320,9200,9740,9380,960+0,040

Барои Faster R-CNN, baseline model бо вуҷуди precision-и хеле баланд танҳо recall-и 0,442 нишон дод. Пас аз GVA, recall то 0,739 боло рафт, precision то 0,786 поён шуд, вале AP50 дар маҷмӯъ аз 0,600 то 0,760 афзоиш ёфт.

Дар YOLOv5 ҳам precision ва ҳам recall ҳамзамон афзоиш ёфтанд ва ин модел бузургтарин фоидаи умумии detector-ро ба даст овард.

Чаро моделҳои қавӣ камтар фоида мегиранд?

Тафсири манбаъ ин аст, ки моделҳои дорои иҷроиши ибтидоии пасттар барои беҳбуд дар пахш кардани замина ва тавозуни precision–recall имконияти бештар доранд. Азбаски baseline-ҳои қавӣ ба монанди RetinaNet ва YOLOv8 аллакай feature fusion ва рафтори attention-и пешрафта доранд, GVA дар ин моделҳо бештар ҳамчун таъсири танзими нозук амал мекунад.

Оё GVA Ба Ҳадафҳои Гуногуни Зондкунии Фосилавӣ Умумӣ Шуда Тавонист?

Дар таҷрибаи чорсинфаи YOLOv5, GVA дар ҳамаи категорияҳои ҳавопаймо, киштӣ, зарфи нигоҳдорӣ ва пул афзоиши AP50 дод; миёнаи AP50 аз 0,666 то 0,855 боло рафт. Аммо андозаи фоида вобаста ба геометрияи ҳадаф хеле фарқ мекард: бузургтарин афзоиш дар зарфҳои нигоҳдорӣ ва хурдтарин дар пулҳо буд.

КатегорияBaseline AP50GVA AP50Фарқи мутлақ
Ҳавопаймо0,6800,942+0,262
Киштӣ0,9140,958+0,044
Зарфи нигоҳдорӣ0,4930,918+0,425
Пул0,5760,603+0,027
Миёна0,6660,855+0,189

Манбаъ пешниҳод мекунад, ки механизми канор ва color-rarity барои ҳадафҳои дорои геометрияи паймон ва мунтазам самараноктар аст, дар ҳоле ки пулҳо, ки сохторҳои дарози хаттӣ мебошанд, бо тарҳи ҳозираи saliency камтар мутобиқанд.

Барои ҳавопаймо AP50 дар таҷрибаи асосии панҷ-модел 0,940 ва дар таҷрибаи байни категорияҳо 0,942 гузориш шудааст. Инҳо қиматҳои ҷадвалҳои гуногуни таҷрибавӣ мебошанд ва набояд маҷбуран ба як қимат баробар карда шаванд.

GVA Бо Ҳаракатҳои Чашми Инсон То Чӣ Андоза Мувофиқ аст?

Дар муқоиса бо human fixation heatmap-ҳо барои GVA CC=0,740, NSS=2,600 ва KL=0,898 гузориш шудааст; ин қиматҳо нишон медиҳанд, ки attention-и модел нисбат ба baseline detector-ҳо ба тақсимоти нигоҳҳои инсон наздиктар аст. Бо вуҷуди ин, метрикаҳои истифодашуда ҷанбаҳои гуногуни таваҷҷуҳро чен мекунанд ва набояд ба як “фоизи монандӣ ба инсон” муттаҳид карда шаванд.

Метрикаҳои мувофиқати таваҷҷуҳ

МетрикаЧиро чен мекунад?Самти беҳтар
CCКоррелятсияи умумии фазоӣ байни attention map-ҳоБаланд
SSIMМонандии фазоӣ/сохторӣБаланд
NSSТамаркузи model saliency дар нуқтаҳои fixation-и инсонБаланд
KL divergenceФарқи байни ду тақсимоти эҳтимолияти таваҷҷуҳПаст

Аблясияи GVA чӣ нишон дод?

Манбаъ чор системаро муқоиса мекунад:

  1. Itti saliency baseline,
  2. танҳо stimulus-driven saliency,
  3. танҳо target-directed guidance,
  4. Guided-Search Visual Attention-и пурра.
УсулCCSSIMNSSKL
Itti0,3880,3570,9201,562
Stimulus-driven0,5050,6132,5982,090
Target-directed0,5110,5652,0171,826
Full GVA0,7400,5812,6000,898

Ин ҷадвал нишон медиҳад, ки тарҳи ду-роҳа махсусан барои CC ва KL пуррагии қавӣ медиҳад. GVA баландтарин CC ва NSS ва пасттарин KL-ро медиҳад.

Номувофиқати дохили манбаъ: ҳарчанд матни ҳамон бахш мегӯяд, ки full GVA аз усулҳои як-роҳа “дар ҳамаи метрикаҳо” бартар аст, дар Figure 4 SSIM-и stimulus-driven 0,613 ва SSIM-и full GVA 0,581 мебошад. Аз ин рӯ, барои SSIM Figure 4 ин ҷумлаи матнро дастгирӣ намекунад.

Мувофиқати Мағз–Модел Чӣ Гуна Чен Карда Шуд?

Мувофиқати мағз–модел тавассути Spearman correlation байни Representational Similarity Matrices-и аз хусусиятҳои P3, P4 ва P5 дар қабатҳои FPN-и detector сохташуда ва RSM-ҳои аз fixation-locked EEG signals сохташуда чен карда шуд. Ин усул мустақиман нишон намедиҳад, ки модел “мисли мағз фикр мекунад”; балки месанҷад, ки муносибатҳои намояндагӣ байни ангезандаҳои гуногун то чӣ андоза ба геометрияи намояндагӣ дар EEG-и инсон монанданд.

Сохтани model RSM-ҳо

Target ва background regions бо ROI-Align аз P3, P4 ва P5 feature map-ҳо бурида, pooled ва normalize карда шуданд. Model RSM-ҳо бо истифода аз cosine dissimilarity байни ҳар ҷуфти ангезанда сохта шуданд.

Сохтани EEG RSM-ҳо

EEG epoch-ҳо аз рӯи нишонҳои fixation-и чашм ба target ва background ҷудо шуданд. ERP signals дар чор минтақаи кортикалӣ ба feature vectors-и мувофиқ ба тартиби model feature табдил дода шуданд, Fisher-Z transform татбиқ шуд ва байни иштирокчиён миёна гирифта шуд.

Муносибати байни модел ва EEG RSM бо Spearman rank correlation чен карда шуд; аҳаммияти оморӣ бо 5.000 permutation test ва FDR correction арзёбӣ гардид.

Миёни қабатҳои P3, P4 ва P5 чӣ рӯй дод?

Дар baseline detector-ҳо коррелятсияҳои мағз–модел паст ва номунтазам буданд; Spearman's r тақрибан дар доираи 0,006–0,024 буд.

Пас аз GVA мувофиқат дар ҳамаи меъмориҳо афзоиш ёфт ва дар маҷмӯъ градиенти қабатӣ, ки аз P3 то P5 қавитар мешавад, пайдо гардид.

Афзоишҳои максималии RSA, ки манбаъ барои P3–P5 гузориш кардааст:

МоделАфзоиши максималии RSAАфзоиши миёнаи RSA
Faster R-CNN133%108%
YOLOv550%73%
RetinaNet14%13%
CenterNet40%78%
YOLOv84%31%

Бояд дар хотир дошт, ки ин афзоишҳои фоизӣ нисбат ба коррелятсияҳои ибтидоии паст афзоишҳои нисбӣ мебошанд; қиматҳои мутлақи RSA ҳанӯз хурд мемонанд.

GVA Бо Кадом Минтақаҳои Мағз Бештар Мувофиқ Шуд?

Дар таҳлили минтақавии RSA, бузургтарин афзоиши миёна дар кортекси оксипиталӣ Δρ=0,012 ва дуюмин афзоиши калон дар кортекси фронталӣ Δρ=0,008 гузориш шудааст. Афзоишҳои пареталӣ Δρ=0,001 ва темпоралӣ Δρ=0,003 хурдтар буданд ва манбаъ мегӯяд, ки аксаран аз ҷиҳати оморӣ аҳаммиятнок набуданд.

Манбаъ ин тақсимотро бо ду роҳи меъмории GVA алоқаманд мекунад:

  • Афзоиши оксипиталӣ: коркарди хусусиятҳои барвақти визуалӣ, аз қабили канор ва контрасти ранг, тавассути роҳи bottom-up saliency,
  • Афзоиши фронталӣ: моделсозии назорати top-down attention-и ҳадафманд тавассути роҳи task-guidance.

Ин тафсир гипотезаи механистӣ мебошад. Ҳалли фазоии EEG, тавре ки худи манбаъ низ ҳамчун маҳдудият зикр мекунад, барои баровардани хулосаҳои нозуки механизми кортикалӣ имкон намедиҳад.

Оё иерархияи қабатҳо ва иерархияи визуалии инсон як чизанд?

Манбаъ афзоиши RSA аз P3 то P5 пас аз GVA-ро ҳамчун намунае тафсир мекунад, ки бо тартиби иерархии коркарди системаи визуалии инсон мувофиқ аст. Аммо нишон дода нашудааст, ки хусусиятҳои P3/P4/P5-и detector бо марҳилаҳои мушаххаси коркарди кортикалӣ аз ҷиҳати анатомӣ як ба як баробар бошанд.

Ифодаи дуруст ин аст, ки афзоиши мувофиқати намояндагӣ ба самти қабатҳои амиқтар дар model feature hierarchy дар доираи чаҳорчӯбаи EEG/RSA-и истифодашуда намунаеро ба вуҷуд меорад, ки ба иерархияи коркарди визуалии инсон бештар мувофиқ аст.

Арзёбии оморӣ

Барои eye-tracking attention metrics one-way ANOVA, FDR-adjusted Tukey HSD ва 1.000 bootstrap sample истифода шудаанд.

Барои Neural RSA 5.000 permutation test истифода шуда, дар сатҳи \(\alpha=0,05\) FDR correction анҷом дода шудааст.

Манбаъ дар муқоисаҳои асосии visual alignment FDR-corrected \(p<0,001\)-ро гузориш мекунад.

Натиҷаҳои дастгиришавандаи таҳқиқот

  • GVA чаҳорчӯбаи attention-и ду-роҳа аст, ки механизмҳои bottom-up ва top-down-и guided search theory-ро муттаҳид мекунад.
  • Дар санҷиши ҳавопаймои DIOR, GVA AP50-ро дар ҳамаи панҷ detector-и санҷидашуда зиёд кард.
  • Бузургтарин афзоиши AP50-и ҳавопаймо байни меъмориҳо барои YOLOv5 +0,260 буд.
  • Дар таҷрибаи умумисозии чор категорияи YOLOv5, миёнаи AP50 аз 0,666 то 0,855 боло рафт.
  • GVA attention map бо тақсимоти human fixation ба CC=0,740 расид.
  • Дар Figure 4, Full GVA дар CC, NSS ва KL аз роҳҳои якка пештар аст.
  • Қиматҳои EEG–model RSA пас аз GVA дар меъмориҳои санҷидашуда афзоиш ёфтанд.
  • Афзоишҳои барҷастатарини RSA-и минтақавӣ дар минтақаҳои оксипиталӣ ва фронталӣ гузориш шуданд.
  • Ворид кардани GVA ба detector native classification/regression branches ва loss functions-ро тағйир намедиҳад.

Натиҷаҳои дастгиринашавандаи таҳқиқот

  • Нишон дода нашудааст, ки detector-ҳои бо GVA истифодашаванда ҳамон ҳисоберо иҷро мекунанд, ки мағзи инсон анҷом медиҳад.
  • Қимати CC=0,740-ро наметавон ба маънои умумӣ ҳамчун “модел %74 ба мағзи инсон монанд аст” тафсир кард.
  • EEG RSA correlation далели ҳамарзии клиникӣ ё биологӣ нест.
  • Cognitive alignment data ҳанӯз барои категорияҳои ҳадаф ғайр аз ҳавопаймо тасдиқ нашудааст.
  • Нишон дода нашудааст, ки GVA дар SAR ё hyperspectral images ҳамон иҷроишро медиҳад.
  • Исбот нашудааст, ки GVA дар ҳамаи detector-ҳои зондкунии фосилавӣ ҳамон афзоиши AP50-ро таъмин мекунад.
  • Ибораи “parameter-free” маънои онро надорад, ки top-down Random Forest тамоман омӯзонида нашудааст.
  • Figure 4 нишон намедиҳад, ки full GVA дар SSIM аз stimulus-driven роҳ бартар аст.
  • Натиҷаҳои preprint набояд ҳамчун далели ниҳоии баррасишудаи ҳамтоён арзёбӣ шаванд.

Маҳдудиятҳои таҳқиқот

Манбаъ се маҳдудияти асосиро ошкоро баён мекунад.

  1. Маҳдудияти додаҳои когнитивӣ: арзёбии eye-tracking ва EEG alignment танҳо барои ҳадафҳои ҳавопаймо дастрас аст. Гарчанде иҷроиши detector дар категорияҳои дигар санҷида шудааст, human cognitive benchmark-и мувофиқ ҳоло вуҷуд надорад.
  2. Маҳдудияти modality: таҳқиқот танҳо дар optical remote sensing images анҷом дода шудааст; SAR ва hyperspectral images санҷида нашудаанд.
  3. Ҳалли фазоии EEG: EEG таҳлили neural mechanism-ро ба минтақаҳои функсионалии макроскопии мағз маҳдуд мекунад.

Самтҳои таҳқиқоти оянда

Муаллифон пешниҳод мекунанд, ки bottom-up saliency mechanism метавонад ба sensor modality-ҳои гуногун мутобиқ карда шавад. Барои SAR polarimetric signatures ва барои hyperspectral images spectral band features метавонанд ҳамчун намояндаҳои ҷойгузини иттилои ранг истифода шаванд.

Дар барномаҳои мушоҳидаи минтақаҳои калон, ки намунаҳои нишонгузоришуда каманд, омӯзиши top-down prior бо unsupervised ё self-supervised methods низ ҳамчун самти таҳқиқоти оянда зикр шудааст.

Таҳқиқот ҳамчунин пешниҳод мекунад, ки азбаски ворид кардани GVA ба detector trainable neural-network parameters-и нав илова намекунад, он барои lightweight ва edge-processing architectures потенсиал дорад; аммо дар дастгоҳи воқеии edge таҷрибаи муфассали latency ё истеъмоли энергия гузориш нашудааст.

Ёддошт оид ба Манбаъ ва Усул

Унвони аслӣ: Embedding human-like visual attention for brain-aligned and high-performance remote sensing object detection

Муаллифон: Bing He, Tong Qin, Dajun Xing, Ying Qu, Qiaosong Hei, Chunfeng Gao, Zheng Gong, Qiao Wang, Weihua Dong

Навъи манбаъ: Мақолаи таҳқиқотии preprint.

Рақами сабти SSRN: 7346288.

Боргузорӣ ба SSRN: 24 августи 2026.

Ҳолати peer review: Манбаъ ба таври ошкоро ибораи “This preprint research paper has not been peer reviewed”-ро дар бар мегирад.

Усули асосӣ: Guided-Search Visual Attention (GVA).

Асоси назариявӣ: Guided search theory; муттаҳид кардани роҳҳои stimulus-driven saliency ва target-directed guidance барои сохтани priority map.

Detector-ҳо: Faster R-CNN, RetinaNet, YOLOv5s, YOLOv8n ва CenterNet.

Маҷмӯаи асосии додаҳои ошкорсозии объект: DIOR.

Cognitive benchmark: EEGET-RSOD; 1.000 тасвири 800×800 remote sensing ва додаҳои ҳамзамони eye-tracking–EEG аз 38 иштирокчӣ.

Тасдиқи ахлоқӣ: Beijing Normal University Ethics Committee, No. 20221024111.

Eye tracker: SMI RED250, 250 Hz.

EEG: NE Enobio, 32 канал, 500 Hz, ҷойгиршавии 10–20.

Visual alignment metrics: Pearson correlation coefficient (CC), structural similarity index (SSIM), normalized scanpath saliency (NSS), Kullback–Leibler divergence (KL).

Neural alignment method: Representational Similarity Analysis (RSA), model P3/P4/P5 FPN features ва fixation-locked EEG RSMs.

Data availability: Манбаъ маҷмӯаи додаҳои EEGET-RSOD-ро дар Figshare бо DOI 10.6084/m9.figshare.26943565 нишон медиҳад.

Code availability: Манбаъ мегӯяд, ки code-и таҳлил дар repository-и GitHub бо номи “Bing-1997/Human-like_visual_attention_embedding_framework” мавҷуд аст.

Нюанси муҳими дохили манбаъ: GVA ба detector trainable neural-network parameters-и нав илова намекунад; аммо роҳи target-directed аз Random Forest-и дар 500 намунаи нишонгузоришуда омӯзондашуда истифода мебарад.

Номувофиқати муҳими дохили манбаъ: дар Figure 4 full GVA SSIM=0,581 ва stimulus-driven saliency SSIM=0,613 аст; бинобар ин, ҷумлаи ҳамон бахш “full GVA all metrics'te üstündür” аз нигоҳи SSIM бо шакл мувофиқ нест.

Ҳадди асосии тафсир: Натиҷаи “Brain-aligned” маънои монандии намояндагӣ/таваҷҷуҳи ченшуда бо EEG/RSA ва eye-tracking metrics-ро дорад; он маънои ҳамарзии мустақими механизми биологӣ ё нусхабардории раванди ҳисоббарории мағзро надорад.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо