Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Компьютер илими / Чакан үлгүлүү HCI баалоолорунда шарттуу Gaussian моделдөө: Жасалма интеллект колдогон саламаттык сактоо дизайн куралдарында Simpson парадоксун чечүү
Компьютер илими

Чакан үлгүлүү HCI баалоолорунда шарттуу Gaussian моделдөө: Жасалма интеллект колдогон саламаттык сактоо дизайн куралдарында Simpson парадоксун чечүү

Бул изилдөө адис катышуучуларды табуу кыйын болгон саламаттык сактоо тармагындагы адам–компьютер өз ара аракеттенүүсү (Human–Computer Interaction, HCI) изилдөөлөрүндө чакан үлгүлөрдү кантип талдоо керектигин Simpson парадоксу аркылуу карайт.

19/08/2026  Veri Anla 33 көрүү
Чакан үлгүлүү HCI баалоолорунда шарттуу Gaussian моделдөө: Жасалма интеллект колдогон саламаттык сактоо дизайн куралдарында Simpson парадоксун чечүү

Бул изилдөө адис катышуучуларды табуу кыйын болгон саламаттык сактоо тармагындагы адам–компьютер өз ара аракеттенүүсү (Human–Computer Interaction, HCI) изилдөөлөрүндө чакан үлгүлөрдү кантип талдоо керектигин Simpson парадоксу аркылуу карайт. Төрт кесипкөй UI/UX дизайнер бир эле саламаттык сактоо программасынын интерфейс тапшырмаларын адегенде салттуу ыкма менен, андан кийин GPT-негизиндеги жасалма интеллект колдогон дизайн куралы менен аткарды. Сегиз байкоонун баары бир эле маалымат топтому сыяктуу бириктирилгенде, дизайн убактысы менен автоматтык IEC 62366 proxy-шайкештик упайынын ортосунда күчтүү жана статистикалык жактан маанилүү терс корреляция табылды: \(r=-0{,}76\), \(p=0{,}029\), \(n=8\). Ал эми салттуу шарт өз ичинде \(r=-0{,}33\), \(p=0{,}67\); AI колдогон шарт өз ичинде \(r=+0{,}18\), \(p=0{,}82\) көрсөткүчүн берди. Эки шарттын ичиндеги корреляция тең маанилүү болгон жок жана алардын белгилери бири-биринен айырмаланды. Ошондуктан бириктирилген корреляция “тезирээк иштөө жакшыраак шайкештикке алып келет” деп чечмелене турган чыныгы жеке байланыш эмес, эки башка эксперименттик шарттын бири-биринен бөлүнүп турушу жараткан aggregation artefact катары бааланды.

Чийки маалыматтарда төрт дизайнердин тең AI колдогон шартта кыскараак убакыт иштеп, ошол эле учурда жогорураак автоматтык proxy-шайкештик упайын алганы көрүндү. Орточо тапшырма убактысы 92,5 мүнөттөн 23,0 мүнөткө; орточо proxy-шайкештик упайы %63,3төн %82,8ге өзгөрдү. Бирок бардык катышуучулар шарттарды бир эле тартипте бүтүргөндүктөн, бул айырмачылыктардын баарын түздөн-түз AI куралына таандык кылууга болбойт; практика, үйрөнүү жана тапшырмага тааныш болуу эффекттери жыйынтыктарга салым кошкон болушу мүмкүн. Мындан тышкары, болгону төрт дизайнердин болушу Gaussian бөлүштүрүү божомолу, дисперсиянын өзгөрүшү жана тажрыйба топторунун ортосундагы айырмачылыктар боюнча күчтүү жалпылоолорду жасоого тоскоол болот. Изилдөөнүн негизги салымы “төрт адам жетиштүү” деген доомат эмес; чакан үлгү сөзсүз болгон учурда белгилүү эксперименттик шарттарды жоготуп жиберген бириктирүү жаңылыштыруу мүмкүн экенин жана шарт боюнча бөлүнгөн талдоо маалыматтын чыныгы түзүлүшүн ачыгыраак көрсөтө аларын көрсөтүү болуп саналат.

Simpson парадоксу деген эмне?

Simpson парадоксу — кичи топтор өзүнчө каралганда көрүнгөн байланыштар маалыматтар бириктирилгенде жоголуп, өзгөрүп же тескери багытта көрүнүп калышы мүмкүн болгон көрүнүш. Маселе жөн гана математикалык кызыгуу эмес. Изилдөөчү топ же эксперименттик шарт тууралуу маалыматты эске албай, бардык байкоолорду бир эле бөлүштүрүүдөн чыккандай талдаганда, ар башка топтордун орточо маанилеринин ортосундагы аралык жасалма корреляция жаратышы мүмкүн.

Бул изилдөөдөгү мисал абдан ачык. Салттуу дизайн шарты жалпысынан жогорку убакыт–төмөнүрөөк шайкештик аймагында; AI колдогон шарт болсо төмөн убакыт–жогорураак шайкештик аймагында жайгашат. Эки топ бирге регрессияга киргизилгенде, график сол жогору жактан оң төмөн жакка созулган күчтүү терс тенденцияны пайда кылат.

Бирок изилдөөнүн негизги суроосу “сегиз көз карандысыз байкоодо убакыт менен шайкештиктин ортосунда байланыш барбы?” деген эмес. Ошол эле төрт адам эки башка шартта өлчөнгөн. Шартка таандыктык жана адамды жупташтыруу эксперименттик дизайндын негизги бөлүктөрү.

Эмне үчүн бириктирилген талдоо жаңылыш жыйынтык берди?

Сегиз байкоо бирге эсептелгенде:

\[ r_{\mathrm{pooled}}=-0{,}76,\qquad p=0{,}029,\qquad n=8. \]

Бул санды өзүнчө окуганда кыскараак убакытта дизайн жасоо жогорураак IEC 62366 шайкештиги менен туруктуу байланышта деген ой жаралышы мүмкүн. Авторлор мындай чечмелөө колдоого алынбай турганын өзгөчө белгилешет.

Шарттар өзүнчө кармалганда:

\[ r_{\mathrm{traditional}}=-0{,}33, \qquad p=0{,}67, \qquad n=4 \]

жана:

\[ r_{\mathrm{AI}}=+0{,}18, \qquad p=0{,}82, \qquad n=4 \]

алынат.

Эки корреляция тең статистикалык жактан маанилүү эмес; мындан тышкары, бири терс, экинчиси оң. Ошондуктан булак изилдөө \(-0{,}76\) болгон бириктирилген коэффициент шарттардын ортосундагы жайгашуу айырмасынан түзүлгөнүн жана дизайнерлердин өз ичиндеги ылдамдык–шайкештик механизмин билдирбегенин жүйөлөйт.

Жеке дизайнерлер чындыгында кандай кыймылдады?

ДизайнерСалттуу убакыт (мүн)AI колдогон убакыт (мүн)Салттуу proxy-шайкештикAI колдогон proxy-шайкештик
D19033%64%93
D28832%50%75
D312010%63%83
D47217%76%80

Төрт дизайнердин баары салттуу шарттан AI колдогон шартка өткөндө графикте бир эле жалпы багытта жылды: убакыт азайды жана автоматтык proxy-шайкештик упайы жогорулады. Бул жеке жупташкан кыймыл шарт тууралуу маалыматты жок кылган бириктирилген корреляцияны эмне үчүн этият чечмелөө керектигин көрсөтөт.

Шарттуу Gaussian модель эмне кылат?

Изилдөө сунуштаган ыкмада ар бир эксперименттик шарт өзүнчө эки өзгөрмөлүү Gaussian кыскача сүрөттөмөсү катары берилет:

\[ p(x\mid k)= \mathcal N(x;\mu_k,\Sigma_k), \]

мында:

\[ x= \begin{bmatrix} \text{süre}\\ \text{proxy-uyum} \end{bmatrix} \]

жана \(k\) traditional же AI-assisted шартын көрсөтөт.

\(\mu_k\) ар бир шарттын борборун; \(\Sigma_k\) ошол шартта байкалган дисперсия жана covariance түзүлүшүн билдирет.

Бул моделдин максаты төрт байкоодон ишенимдүү популяция бөлүштүрүүсүн баалоо эмес. Авторлор Gaussian компоненттерин шартка мүнөздүү борборлорду, чачыраңкы абалды жана бирге өзгөрүү багытын тартиптүү көрсөткөн сүрөттөөчү кыскача жыйынтыктар катары колдонушат.

Бул чындап Gaussian Mixture Modelби?

Макала терминологияны атайын тактайт. Изилдөө алгач иштелип чыккан мезгилде “conditional GMM” аталышы колдонулган болсо да, колдонулган ыкма классикалык unsupervised Gaussian Mixture Model эмес.

Классикалык GMMде:

  • кайсы байкоо кайсы кластерге таандык экени белгисиз болушу мүмкүн,
  • mixing weights бааланат,
  • Expectation–Maximisation сыяктуу алгоритмдер колдонулушу мүмкүн,
  • компоненттердин саны BIC сыяктуу критерийлер менен тандалышы мүмкүн.

Бул изилдөөдө болсо салттуу жана AI колдогон шарт белгилери эксперименттик дизайндан мурда эле белгилүү. Эки компонент ачылып табылбайт, башынан аныкталат. EM колдонулган эмес, latent cluster изделген эмес жана BIC менен компонент саны тандалган эмес.

Ошондуктан авторлор азыркы текстте негизги аталыш катары conditional Gaussian model деген түшүнүктү колдонушат.

Шарт борборлору канчалык айырмаланат?

Салттуу шарттын борбору:

\[ \mu_{\mathrm{traditional}} = (92{,}5\ \mathrm{dk},\;63{,}3\%) \]

болсо, AI колдогон шарттын борбору:

\[ \mu_{\mathrm{AI}} = (23{,}0\ \mathrm{dk},\;82{,}8\%) \]

деп берилет.

Үлгүдөгү борборлордун айырмасы AI шарты салттуу шартка салыштырмалуу орточо 69,5 мүнөт кыскараак жана автоматтык proxy-шайкештик мааниси 19,5 пайыздык пункт жогорураак болгонун көрсөтөт.

Бирок шарттардын тартиби туруктуу болгондуктан “AI куралы өзү эле 69,5 мүнөт үнөмдөдү” же “AI куралы өзү эле шайкештикти 19,5 пунктка көбөйттү” деген жыйынтык чыгарууга болбойт. Бул маанилер изилдөө жүргүзүлгөн тартипте байкалган шарттардын айырмасы.

IEC 62366 упайы чындыгында эмнени өлчөйт?

Изилдөөдө колдонулган экинчи негизги өлчөм IEC 62366-1:2015 менен шайкештикти баалоо үчүн өзүнчө GPT-негизиндеги курал чыгарган пайыздык упай. Баалоо рубрикасы беш өлчөмдү камтыйт:

  1. Колдонуу катасын азайтуу: коопсуздук үчүн маанилүү өз ара аракеттерде ката кетирүү мүмкүнчүлүктөрүн азайтуу.
  2. Маалымат иерархиясы: критикалык жана негизги тапшырма маалыматынын визуалдык жана түзүмдүк артыкчылыгы.
  3. Кайтарым байланыштын айкындыгы: системанын жооптору, ката абалдары жана ырастоолор ачык болушу.
  4. Жеткиликтүүлүк: окулушу, контраст, максат өлчөмү жана клиникалык колдонуу чөйрөсүнө байланышкан жеткиликтүүлүк өзгөчөлүктөрү.
  5. Медициналык түзмөк интерфейси конвенциялары: белгилүү терминология жана өз ара аракеттенүү күтүүлөрүнө шайкештик.

Бул упай расмий IEC 62366 сертификаты же жөнгө салуучу шайкештик чечими эмес. Рубрика баалоо куралы тарабынан стандарттан чыгарылган жана адис адам баалоочуларына каршы текшерилген эмес. Ошондуктан авторлор бул өлчөмдү “consistency-controlled proxy measure” деп чектешет.

Бир эле модель үй-бүлөсүнүн жаратып да, баалап да жатканы эмне үчүн маанилүү?

AI колдогон дизайн куралы изилдөө учурунда ChatGPT аркылуу жеткиликтүү болгон GPT-4o-негизиндеги атайын GPT. Өзүнчө compliance scorer да GPT-4o модель үй-бүлөсүндө иштеген башка атайын GPT катары курулган.

Авторлор мунун мүмкүн болгон model-family bias жаратарын ачык моюнга алышат. Дизайн жаратууда колдонулган модель үй-бүлөсү чыгарган үлгүлөр ошол эле үй-бүлөдөн келген баалоо системасына түзүмдүк жактан көбүрөөк ылайыктуу көрүнүшү мүмкүн.

Ошондуктан шайкештик упайларын көз карандысыз эксперттер тарабынан текшерүү келечекте жүргүзүлүүгө тийиш болгон негизги методологиялык контролдордун бири.

Үлгүдөгү стандарттык четтөөлөр эмнени көрсөтөт?

Булакта байкалган үлгү стандарттык четтөөлөрү төмөнкүдөй:

ӨлчөмСалттуу шартAI колдогон шарт
Тапшырма убактысы20,0 мүн11,3 мүн
Proxy-шайкештик10,6 пайыздык пункт7,6 пайыздык пункт

Эки өлчөмдө тең үлгүнүн стандарттык четтөөсү AI шартында кичине. Бирок болгону төрт байкоо болгондуктан, бул айырма популяция дисперсиясы чындыгында азайганын далилдебейт.

Brown–Forsythe түрүндөгү Levene тестинде убакыт үчүн:

\[ W=0{,}16,\qquad p=0{,}70 \]

жана proxy-шайкештик үчүн:

\[ W=0{,}12,\qquad p=0{,}74 \]

алынган.

Авторлор бул жыйынтыктарды “дисперсиялар тең” деп чечмелешпейт. \(n=4\) болгондуктан тесттин күчү өтө төмөн; учурдагы маалымат дисперсиянын тарышын ырастай да, четке кага да албайт.

Тажрыйба деңгээлине жараша кандай үлгү байкалды?

ДизайнерПрофильБайкалган убакыт кыскарышыБайкалган proxy-шайкештик өсүшү
D1Орто UI / Жогорку AI%63+29 пайыздык пункт
D2Орто UI / Жогорку AI%64+25 пайыздык пункт
D3Төмөн UI / Бир аз AI%92+20 пайыздык пункт
D4Жогорку UI / Төмөн AI%76+4 пайыздык пункт

UI тажрыйбасы эң төмөн D3 дизайнер 120 мүнөттөн 10 мүнөткө түшүп, үлгүдөгү эң чоң убакыт айырмасын көрсөткөн. AI тажрыйбасы жогорку D1 жана D2 болсо тиешелүүлүгүнө жараша +29 жана +25 пайыздык пункт менен автоматтык proxy-шайкештиктеги эң чоң өсүштөргө ээ.

Бул маанилер тажрыйба топторунун ортосунда далилденген өз ара аракеттенүү эффекттери эмес. Ар бир профиль үчүн бир дизайнер же өтө аз байкоо болгондуктан, авторлор муну келечектеги изилдөөлөр үчүн гипотеза жаратуучу изилдөөчүлүк үлгүлөр катары гана баалашат.

Дизайнерлердин пикирлери эмне деди?

Phase 1де төрт дизайнердин баары AI колдогон курал идеядан визуалдык дизайнга өтүү процессин тездеткенин айтышты. Үч дизайнер курал дизайн көз карашын конкреттүү дизайнга айландырууда пайдалуу болгонун билдирди.

Ал эми тажрыйбалуураак эки дизайнер демейки кадам-кадам багыттоо алардын эксперттик иш агымында керексиз сүрүлүү жаратканын айтты. Булакта бул пикир formal thematic analysis катары берилбейт; болгону чакан үлгүдөн алынган кайталануучу темалардын сүрөттөөчү кыскача жыйынтыгы катары баяндалат.

Бул байкоо куралды кантип өзгөрттү?

Изилдөөчүлөр биринчи этаптагы гетерогендүүлүктү гана баяндабастан, аны экинчи этапта куралды кайра дизайн кылуу үчүн колдонушкан.

Жаңы курал сессия башында колдонуучунун:

  • AI куралдары менен тажрыйбасын,
  • UI дизайн тажрыйбасын

сурайт жана эки өз ара аракеттенүү режиминин бирин тандайт.

Тажрыйбасы азыраак колдонуучу: ачык дизайн чечимдери, inline багыттоо жана кадам-кадам “handholding” режими.

Тажрыйбалуураак колдонуучу: азыраак scaffolding камтыган ачык/free-form режим.

Мындан тышкары, биринчи куралдын визуалдык өндүрүшкө гана таянган ыкмасына кошумча түрдө UI элементтерин түздөн-түз түзөтүүгө боло турган real-canvas бет кошулган.

Экинчи этапта эмне болду?

Phase 2ге D1, D2 жана D3 катышты. D4 бул этапка катышкан жок.

ДизайнерPhase 1 AI куралы (мүн)Phase 2 ыңгайлашкан курал (мүн)Байкалган убакыт өзгөрүшү
D13310−%70
D23217−%47
D31032+%220

AI тажрыйбасы жогорку D1 жана D2 ыңгайлашкан курал менен дагы ылдамдады. UI тажрыйбасы төмөн D3 болсо мурдагы 10 мүнөттүн ордуна 32 мүнөт коротту.

Булак бул өсүштү автоматтык түрдө начарлоо деп чечмелебейт. D3 ачык пикиринде дизайн үстүндө узагыраак итерация кылганын жана жыйынтыкты көбүрөөк жакшыртканын билдирген. Ошентсе да, изилдөөдө объективдүү Phase 2 сапат өлчөмү жок болгондуктан:

“жайыраак, анткени кылдаттыгы көбүрөөк”

менен:

“жайыраак, анткени курал көбүрөөк чектеди”

ыктымалдыктарын сандык жактан ажырата албайт.

Эмне үчүн Phase 2нин сапат өлчөмүн Phase 1 менен салыштыруу мүмкүн эмес?

Phase 1де сапат/шайкештик үчүн GPT-негизиндеги IEC 62366 proxy-упайы колдонулган. Phase 2де ошол эле автоматтык баалоо кайталанган эмес; анын ордуна катышуучулар беш баллдык канааттануу/сапат баалоосун жүргүзүшкөн.

Үч дизайнер тең 4/5 берип, scaffolding ылайыктуу экенин билдирген. Бирок:

\[ \text{IEC 62366 proxy-puanı} \neq \text{öznel 5 puanlık memnuniyet} \]

болгондуктан Phase 1 жана Phase 2 сапат маанилерин түз салыштырууга болбойт.

Gaussian божомолу чындап текшерилгенби?

Жок. Изилдөөчүлөр \(n=4\) байкоо менен bivariate normality божомолун маанилүү түрдө ырастоо мүмкүн эмес экенин ачык белгилешет.

Shapiro–Wilk, Kolmogorov–Smirnov же Anderson–Darling сыяктуу тесттер бул көлөмдөгү үлгүдө чечмелене турган күчкө ээ эмес. Төрт чекиттен турган Q–Q графиги да бөлүштүрүү формасын ишенимдүү аныктай албайт.

Ошондуктан conditional Gaussian model formal likelihood inference үчүн текшерилген ыктымалдык модели катары эмес, шарттарды уюштурган жана визуалдык түрдө кыскача көрсөткөн курал катары колдонулат.

Paired t-test эмнени көрсөттү?

Ошол эле катышуучулар эки шартта өлчөнгөндүктөн, изилдөөчүлөр стандарттуу paired t-test салыштыруусун да жүргүзүшкөн.

Убакыт айырмасы үчүн:

\[ \bar d=69{,}5\ \mathrm{dk}, \]

\[ t(3)=5{,}15, \qquad p=0{,}014, \]

\[ 95\%\ GA=[26{,}5,\;112{,}5], \qquad d_z=2{,}57. \]

Proxy-шайкештик айырмасы үчүн:

\[ \bar d=19{,}5\ \text{yüzde puanı}, \]

\[ t(3)=3{,}56, \qquad p=0{,}038, \]

\[ 95\%\ GA=[2{,}0,\;37{,}0], \qquad d_z=1{,}78. \]

Авторлор paired t-testти эки шарттын орточо айырмасы тууралуу негизги inferential comparator катары колдонушат. Conditional Gaussian model болсо Simpson парадоксун жана шарттарга/колдонуучу профилдерине жараша түзүмдүк гетерогендүүлүктү көрүнөө кылат. Башкача айтканда, conditional model paired t-testтин ордуна колдонулбайт.

Wilcoxon тести эмне үчүн маанилүү чыккан жок?

Exact Wilcoxon signed-rank test эки жыйынтык үчүн тең:

\[ W=0,\qquad p=0{,}125 \]

берди.

Бирок төрт жупташтыруунун баары бир багытта болгондо эки тараптуу exact Wilcoxon тестинде алынуучу эң кичине p-маани:

\[ 2\left(\frac12\right)^4=0{,}125 \]

болгондуктан, изилдөө бул жыйынтыкты “эффект жок” деп чечмелебейт. Бул үлгү көлөмүндө тесттин p-маани ажырымдуулугу баары бир 0,05тен төмөн түшө албайт.

Эмне үчүн mixed-effects model колдонулган жок?

Төрт дизайнер random-effect дисперсия компоненттерин ишенимдүү баалоо үчүн өтө эле чектелген топ деңгээлинин саны. Изилдөөчүлөр random-intercept моделин сынап көргөн, бирок максимум likelihood чечими үч optimizer менен кайра аракет кылынганына карабастан converge болгон эмес; бир L-BFGS конфигурациясында singular design matrix алынган.

Random-slope модели математикалык жактан converge болгону менен, болгону төрт адамда ашыкча параметрлүү болгондуктан дисперсия компоненттери чечмеленбейт деп кабыл алынган.

Эмне үчүн Bayesian hierarchical model колдонулган жок?

Изилдөөнүн баасына ылайык \(n=4\) болгондо дизайнерлер аралык дисперсияны билдирген hyperparameter маалыматтан жетиштүү аныкталбайт. Алсыз prior колдонулганда posterior негизинен priorду кайра бериши мүмкүн; күчтүү prior колдонулганда жыйынтык андан да түз prior тарабынан аныкталышы мүмкүн.

Ошондуктан Bayesian hierarchical model чоңураак маалымат топтому үчүн келечектеги иш катары калтырылган.

Изилдөө колдогон жыйынтыктар

Биринчиден, бул үлгүдө салттуу жана AI колдогон шарттар бириктирилгенде күчтүү терс корреляция пайда болгон, бирок шарттар өзүнчө талданганда ошол эле байланыш көрүнгөн эмес. Изилдөөнүн Simpson парадоксу/aggregation artefact дооматынын түз эмпирикалык негизи ушул.

Экинчиден, төрт дизайнердин баарында AI колдогон шарт салттуу шартка салыштырмалуу кыскараак убакыт жана жогорураак автоматтык proxy-шайкештик упайы менен кошо байкалган.

Үчүнчүдөн, шартка мүнөздүү талдоо дизайнерлер арасында ар башка жооп профилдери бар экенин көрсөткөн; бирок бул профилдер чакан үлгүгө байланыштуу гипотеза жаратуучу деңгээлде.

Төртүнчүдөн, Phase 1де байкалган scaffolding гетерогендүүлүгү куралдын тажрыйбага ылайыкташтырылган экинчи версиясын долбоорлоого алып келип, Phase 2де дизайнерлер арасында эки багыттуу убакыт жообу байкалган.

Изилдөө колдобогон же текшербеген жыйынтыктар

Изилдөө төрт адам чакан үлгү үчүн жалпысынан жетиштүү экенин көрсөтпөйт. Авторлор мунун тескерисин ачык моюнга алышат.

Изилдөө байкалган бардык жакшыртуунун себептик булагы AI куралы экенин далилдебейт. Шарттар counterbalanced болбогондуктан практика жана тапшырмага тааныштык эффекттери ажыратылган эмес.

Изилдөө GPT-негизиндеги шайкештик упайы чыныгы жөнгө салуучу IEC 62366 шайкештигине барабар экенин көрсөтпөйт.

Изилдөө AI шартында чыныгы популяция дисперсиясы төмөн экенин далилдебейт.

Изилдөө белгилүү тажрыйба деңгээлиндеги бардык дизайнерлер бирдей жооп берерин көрсөтпөйт.

Phase 2 ыңгайлашкан курал сапат жагынан артык экенин далилдебейт. Phase 2де Phase 1дегидей объективдүү/proxy сапат өлчөмү колдонулган эмес.

Conditional Gaussian model formal чакан-үлгүлүү inferential чечим катары текшерилген эмес. Макаладагы негизги функциясы шарт түзүлүшүн сактаган сүрөттөөчү жана диагностикалык талдоо.

Түркия үчүн эмнени билдирет?

Изилдөө Япониядагы университетке байланышкан изилдөөчүлөр тарабынан жүргүзүлгөн жана болгону төрт кесипкөй дизайнерден турган ыңгайлуу үлгү колдонулган. Түркиядагы саламаттык сактоо программаларынын дизайнерлери же медициналык түзмөк өндүрүүчүлөрү үчүн түз натыйжалуулук жыйынтыгын бербейт.

Бирок методологиялык кабар өлкөгө гана тиешелүү эмес: адис катышуучулар аз болгон саламаттык сактоо HCI, медициналык программалык камсыздоо, өнөр жай интерфейси же башка коопсуздук-критикалык UX изилдөөлөрүндө шарттарды бир жалпы топко бириктирүүдөн мурда шарт ичиндеги үлгүлөр текшерилиши керек. Түркия контекстинде ушул эле ыкманы колдонуу жергиликтүү дизайнерлер менен чоңураак жана шарттардын тартиби тең салмакталган көз карандысыз изилдөөлөрдү талап кылат.

Изилдөөнүн Ыкмасы жана Жыйынтыктары

Phase 1 эксперименттик дизайны

Төрт кесипкөй UI/UX дизайнер саламаттык сактоо программалык интерфейстери үчүн бир эле дизайн тапшырмаларын эки шартта аткарды:

  1. Салттуу иш агымы: AI дизайн куралы колдонулбаган кол менен аткарылуучу ыкма.
  2. AI колдогон иш агымы: саламаттык сактоо HCI принциптери жана IEC 62366 билими менен түзүлгөн GPT-негизиндеги курал.

Катышуучулардын өзгөчөлүктөрү төмөнкүдөй:

IDUI тажрыйбасыAI тажрыйбасыФон
D1ОртоЖогоркуHealthcare UX, 3+ жыл
D2ОртоЖогоркуMedical software, 4 жыл
D3ТөмөнБир азЖалпы UX; саламаттык сактоо тармагына өтүү
D4ЖогоркуТөмөнУлук дизайнер, 8+ жыл

Тапшырмалар Portable Health Clinic мобилдик системасы үчүн коопсуз кирүү экраны жана саламаттык сактоо кызматкеринин dashboard'у сыяктуу саламаттык интерфейстерин камтыган. Талаптар каталарды алдын алуу, маалымат иерархиясы жана жеткиликтүүлүк өлчөмдөрүн камтыган.

Сессиялар болжол менен 90 мүнөткө пландалган, бирок катуу убакыт чеги колдонулган эмес. Убакыт тапшырма башталгандан дизайнердин акыркы тапшыруусуна чейин катталган.

Шарт тартибинин дизайнга таасири

Төрт катышуучунун баары:

адегенде traditional → андан кийин AI-assisted

тартибин карманган.

Изилдөөчүлөр муну AI куралы менен алдын ала таанышуу кол менен дизайнга таасир этпесин деп тандашкан. Бирок бул чечим экинчи шарттагы жыйынтыктарды тапшырманы үйрөнүү жана тааныштык менен аралаштырат.

Ошондуктан изилдөө randomised же counterbalanced causal trial катары эмес, sequentially unbalanced exploratory comparison катары чечмеленет.

AI дизайн куралынын түзүлүшү

AI шартында колдонулган колдонмо табигый тилдеги сурамдар менен иштеген GPT-негизиндеги дизайн куралы. Курал:

  • тексттик сүрөттөмөлөрдөн интерфейс mockup'тарын түзө алган,
  • HCI жана колдонууга ыңгайлуулук принциптерине жараша жакшыртууларды сунуштай алган,
  • мүмкүн болгон колдонуу каталарын белгилеп бере алган,
  • саламаттык UX үлгүлөрүн жана IEC 62366 билимин дизайн процессине кошо алган.

Изилдөө мезгилинде курал ChatGPT платформасында атайын GPT форматында жана GPT-4o модель үй-бүлөсү менен иштеген.

Негизги өлчөмдөр

Эки баштапкы сандык өлчөм чогултулган:

  1. Тапшырманы бүтүрүү убактысы: мүнөт.
  2. IEC 62366 proxy-шайкештик упайы: өзүнчө GPT-негизиндеги баалоо куралынан алынган пайыздык маани.

Чийки убакыт маалыматтары жана Verianla Live

Төрт катышуучунун баарында AI колдогон шартта тапшырма убактысы төмөн. Төмөнкү Verianla Live графиги бир гана ошол эле бирдиктеги убакыт маалыматтарын салыштырат; compliance упайлары убакыт огуна аралаштырылган эмес.

Verianla Live: Салттуу жана AI колдогон тапшырма убакыттары

График төрт дизайнердин ошол эле изилдөөдөгү салттуу жана AI колдогон шарттарда өлчөнгөн тапшырма бүтүрүү убакыттарын мүнөт менен көрсөтөт.

ДизайнерСалттуу убакыт (мүн)AI колдогон убакыт (мүн)
D19033
D28832
D312010
D47217
 

Verianla Live: Визуалдаштыруу булак изилдөөдөгү 2-таблицанын тапшырма убактысы маанилеринен түзүлөт. Көрүнгөн таблица илимий source-of-truth катары сакталат.

Орточо убакыт:

\[ 92{,}5\ \mathrm{dk} \rightarrow 23{,}0\ \mathrm{dk} \]

болуп өзгөргөн. Булак муну байкалган орточо мааниде болжол менен %75 азайуу деп билдирет. Шарттардын тартиби туруктуу болгондуктан бул пайыз таза себептик AI эффекти эмес.

Proxy-шайкештик жыйынтыктары

ДизайнерСалттуу proxy-шайкештикAI колдогон proxy-шайкештикАйырма
D1%64%93+29 пайыздык пункт
D2%50%75+25 пайыздык пункт
D3%63%83+20 пайыздык пункт
D4%76%80+4 пайыздык пункт

Үлгүнүн орточо мааниси:

\[ 63{,}3\% \rightarrow 82{,}8\% \]

болуп өзгөрүп, төрт дизайнердин баарында багыт оң болгон. Бирок бул упай автоматтык жана эксперттик текшерүүдөн өтпөгөн proxy экенин өзгөчө сактоо керек.

Simpson парадоксунун сандык кыскача жыйынтыгы

ТалдооКорреляция \(r\)pnБулактын чечмелөөсү
Бардык байкоолор бириктирилген−0,760,0298Маанилүү көрүнгөн, бирок шарттар аралык айырма түзгөн aggregation artefact
Салттуу шарт гана−0,330,674Маанилүү эмес
AI колдогон шарт гана+0,180,824Маанилүү эмес

Булак изилдөөнүн методологиялык дооматы дал ушул айырмадан келип чыгат: шарттарды бөлүү бириктирилген корреляцияда көрүнбөгөн эксперименттик түзүлүштү кайра кайтарат.

Paired талдоо менен conditional моделдин милдеттери ар башка

ЫкмаБул изилдөөдөгү ролу
Paired t-testОшол эле катышуучунун эки шарттын ортосундагы орточо айырмасын inferential түрдө текшерет.
Conditional Gaussian modelАр бир шарттын борборун, чачырашын жана бирге өзгөрүүчү түзүлүшүн өзүнчө сактайт; aggregation artefactты көрүнөө кылат.
Wilcoxon signed-rankRank-негизиндеги контрол; \(n=4\) болгондо минималдуу эки тараптуу p=0,125 болгондуктан inferential ажырымдуулук жетишсиз.
Repeated-measures ANOVAЭки шарттуу дизайнда paired t-test менен математикалык жактан эквиваленттүү.
Linear mixed-effectsТөрт random-effect деңгээли болгондуктан ишенимдүү бааланган эмес.
Bayesian hierarchical modelБул үлгүдө between-designer дисперсиясы priorга ашыкча көз каранды болгондуктан колдонулган эмес.

Monte Carlo кошумча талдоосу эмнени көрсөтөт?

Макаланын кошумча материалында эксперименттик дизайнга ылайыкташтырылган Monte Carlo симуляциясы баяндалат. Булак тексттин жыйынтыгына ылайык, within-condition correlation нөл болуп аныкталган маалымат өндүрүү процессинде \(n=4\) адам/шарт деңгээлинде 10.000 симуляциянын %56сында бириктирилген талдоо статистикалык жактан маанилүү терс корреляция жараткан.

Бул симуляция макаладагы бир гана параметр конфигурациясына тиешелүү. Ар башка үлгү көлөмдөрү, эффект чоңдуктары, корреляция түзүлүштөрү жана нормалдуу бөлүштүрүүдөн четтөөлөр үчүн жалпы operating characteristics изилдөөсү жүргүзүлгөн эмес.

Phase 2нин методологиялык мааниси

Экинчи этаптын негизги салымы — conditional талдоодон чыккан колдонуучу гетерогендүүлүгү гипотезасын конкреттүү продукт дизайнын өзгөртүүгө айландыруу:

талдоо → тажрыйбага көз каранды scaffolding гипотезасы → куралды кайра дизайн кылуу → жаңы колдонуучу жоопторун байкоо.

Авторлор бул цикл iterative HCI designга гана таандык уникалдуу ыкма эмес экенин моюнга алышат. Conditional моделдин салымы бириктирилген талдоо тегиздеп жибере турган гетерогендүүлүктү түзүмдүк жактан сактоо болуп саналат.

Изилдөөнүн методологиялык сунуштары

  1. Шарт айырмасы күтүлсө, адегенде шарттарды өзүнчө кара.
  2. Pooled корреляция менен within-condition корреляцияларын салыштырып Simpson парадоксун текшер.
  3. Ар бир шарт үчүн орточо маанини, чачыраууну жана корреляцияларды өзүнчө билдир.
  4. Чакан үлгүдө дисперсия айырмаларын inferential чындык катары эмес, сүрөттөөчү статистика катары көрсөт.
  5. Тажрыйба жана эксперттик деңгээл сыяктуу тиешелүү колдонуучу өзгөчөлүктөрү боюнча жоопторду изилдөөчүлүк түрдө кара.
  6. Within-subject дизайндын pairing түзүлүшүн inferential талдоо учурунда сакта.

Негизги чектөөлөр

  • Phase 1 болгону төрт дизайнерди камтыйт.
  • Phase 2 болгону үч дизайнерди камтыйт.
  • Катышуучулар convenience sampling аркылуу кесиптик тармактардан тандалган.
  • Шарт тартиби туруктуу жана counterbalanced эмес.
  • Практика/үйрөнүү эффекти AI эффектинен ажыратылбайт.
  • Тапшырмалар бир гана мобилдик саламаттык сактоо программасынын контекстинде.
  • IEC 62366 упайлоо системасы көз карандысыз адам эксперттери менен текшерилген эмес.
  • Дизайн куралы менен compliance scorer бир эле GPT-4o модель үй-бүлөсүндө.
  • Gaussian бөлүштүрүү божомолу \(n=4\) болгондо текшерилбейт.
  • Шарттар аралык дисперсия айырмасы далилденген эмес.
  • Experience-indexed жыйынтыктар жеке байкоолордон алынган изилдөөчүлүк үлгүлөр.
  • Phase 2де D4 катышкан эмес.
  • Phase 2де Phase 1деги IEC 62366 proxy-упайы кайталанган эмес.
  • Phase 2нин 5 баллдык субъективдүү сапат/канааттануу өлчөмү Phase 1дин proxy-compliance метрикасы менен түз салыштырылбайт.

Келечектеги изилдөөлөр

Авторлор сунуштаган кийинки кадамдар — чоңураак жана counterbalanced үлгүлөр, шарт дисперсияларын жетиштүү күч менен текшерүү, Gaussian goodness-of-fit баалоосу, моделди ар башка үлгү жана корреляция шарттарында симуляция аркылуу кеңири мүнөздөө жана автоматтык IEC 62366 упайын эксперт адам баалоочулары менен inter-rater reliability талдоо.

Алкакты авиация интерфейстери, финансылык кызматтардын compliance UIлары жана жеткиликтүүлүк милдеттүү болгон мамлекеттик интерфейстер сыяктуу саламаттык сактоодон тышкаркы коопсуздук-критикалык тармактарда текшерүү да сунушталат.

Булак жана Ыкма Жөнүндө Эскертүү

Толук оригинал изилдөө аталышы: Conditional Gaussian Modelling for Small-Sample HCI Evaluation: Resolving Simpson’s Paradox in AI-Assisted Healthcare Design Tools

Авторлор: Mohammad Bilal Firoz; Ashir Ahmed.

Тең биринчи/тең салым: Булакта көрсөтүлгөн эмес.

Жооптуу автор: Mohammad Bilal Firoz.

Мекеме: Department of Information Science and Technology, Kyushu University, Fukuoka 819-0395, Japan.

Булак түрү: Адам катышуучулары бар, чакан үлгүлүү HCI/usability изилдөө макаласы; эки этаптуу изилдөөчүлүк баалоо жана методологиялык талдоо.

Рецензия статусу: Рецензияланган журналдык жарыя.

Журнал: AI.

Басмакана: MDPI, Basel, Швейцария.

Библиографиялык жазуу: AI, 2026, Том 7, Сан 6, Макала 199.

DOI: 10.3390/ai7060199.

Кабыл алуу / ревизия / кабыл кылуу / жарыялоо: 31 март 2026 / 22 май 2026 / 26 май 2026 / 30 май 2026.

Лицензия: Creative Commons Attribution (CC BY).

Academic Editors: Zubaer Mannan; Asif Karim; Nur Alam Md.

Phase 1 үлгүсү: Төрт кесипкөй UI/UX дизайнер.

Phase 2 үлгүсү: Биринчи этаптагы дизайнерлердин үчөө; D4 катышкан эмес.

Изилдөө дизайны: Within-subjects, бирок шарттардын тартиби туруктуу, sequentially unbalanced exploratory comparison. Бардык дизайнерлер traditional шартын биринчи, AI-assisted шартын экинчи аткарган.

AI дизайн куралы: Изилдөө мезгилинде ChatGPT платформасы аркылуу жеткиликтүү болгон GPT-4o-негизиндеги custom GPT.

Compliance баалоо куралы: Дизайн куралынан өзүнчө, бирок дагы GPT-4o модель үй-бүлөсүнө курулган custom GPT.

Compliance метрикасынын статусу: IEC 62366-1:2015 шайкештиги үчүн автоматтык жана consistency-controlled proxy өлчөм; текшерилген жөнгө салуучу шайкештик чечими эмес жана эксперт адам баалоосу менен inter-rater reliability түзүлгөн эмес.

Негизги методологиялык ыкма: Белгилүү эксперименттик шарттарга жараша condition-stratified bivariate Gaussian summaries. Unsurpervised GMM, EM алгоритми, BIC component selection же latent cluster discovery колдонулган эмес.

Негизги статистикалар: Pearson корреляциялары, paired t-test, exact Wilcoxon signed-rank, Brown–Forsythe түрүндөгү Levene variance тести жана repeated-measures ANOVA эквиваленттүүлүгү. Linear mixed-effects fit сыналган, бирок ишенимдүү колдонулган эмес; Bayesian hierarchical талдоо колдонулган эмес.

Phase 1деги негизги байкалган айырма: Орточо убакыт 92,5 мүнөттөн 23,0 мүнөткө; автоматтык proxy-шайкештик орточосу %63,3төн %82,8ге өзгөргөн. Шарт тартиби туруктуу болгондуктан маанилерди таза себептик курал эффекти катары чечмелөөгө болбойт.

Simpson парадоксу жыйынтыгы: Pooled \(r=-0{,}76\), \(p=0{,}029\), \(n=8\); traditional \(r=-0{,}33\), \(p=0{,}67\), \(n=4\); AI-assisted \(r=+0{,}18\), \(p=0{,}82\), \(n=4\).

Paired t-test: Убакыт үнөмдөө үчүн \(t(3)=5{,}15\), \(p=0{,}014\), \(d_z=2{,}57\); proxy-шайкештик өсүшү үчүн \(t(3)=3{,}56\), \(p=0{,}038\), \(d_z=1{,}78\).

Каржылоо: Изилдөө тышкы каржылоо алган эмес.

Этика кеңеши: Булакка ылайык тиешелүү жапон институттук көрсөтмөлөрүнүн алкагында формалдуу этика кеңешинин уруксаты зарыл деп эсептелген эмес. Изилдөө пациент, клиникалык кийлигишүү, биологиялык үлгү же жеке саламаттык маалыматтарын камтыбаган, ыктыярдуу бойго жеткен кесипкөйлөр менен жүргүзүлгөн non-medical жана non-interventional usability баалоосу катары аныкталган. Изилдөөчүлөр иш Helsinki декларациясынын принциптерине ылайык жүргүзүлгөнүн билдиришет.

Маалымдалган макулдук: Бардык катышуучулардан макулдук алынган; анонимдүү катышуучу коддорун, анонимдүү дизайн жазууларынын цитаталарын жана тапшырмаларда түзүлгөн интерфейс дизайндарын жарыялоого да макулдук берилгени көрсөтүлгөн.

Маалымат жеткиликтүүлүгү: Изилдөөнүн оригинал салымдары макалада жана Supplementary Materials ичинде камтылганы, кошумча суроолор жооптуу авторго багытталышы мүмкүн экени айтылат.

Кошумча материал: AI дизайн куралдары, эксперименттик маалыматтар, тапшырма сүрөттөмөлөрү, үлгү дизайндар, изилдөө протоколу, статистикалык деталдар, маалымат/курал жеткиликтүүлүгү, Q–Q графиктери, Simpson парадоксу Monte Carlo талдоосу жана кайра өндүрүлүүчүлүк скрипти бөлүмдөрү бар экени билдирилет.

Автордук салымдар: Концептуалдаштыруу M.B.F. жана A.A.; методология M.B.F.; формалдык талдоо M.B.F.; изилдөө M.B.F.; алгачкы долбоор M.B.F.; карап чыгуу жана редакциялоо A.A.; визуалдаштыруу M.B.F.; жетекчилик A.A. тарабынан аткарылган.

Генеративдүү AI колдонуу билдирүүсү: Экспериментте UI/UX дизайн куралы жана IEC 62366 proxy-баалоо куралы GPT-4o-негизиндеги custom GPTлер катары колдонулган. Булак ошондой эле макаланы даярдоодо тилди оңдоо, редакциялоо жана статистикалык эсептөөлөрдү текшерүүгө көмөк көрсөтүү максатында Claude Opus 4.7 колдонулганын; бардык статистикалар авторлор тарабынан каралып, текшерилгенин жана мазмун үчүн авторлор жооптуу экенин билдирет.

Кызыкчылыктардын кагылышы: Авторлор кызыкчылыктардын кагылышын билдиришкен эмес.

Илимий чечмелөө чеги

Изилдөөнүн негизги методологиялык билдирүүсү чакан үлгү жетиштүү болуп калат деген эмес; сөзсүз чакан үлгүлөрдө эксперименттик түзүлүштү жок кылган бириктирүү кошумча ката да жаратышы мүмкүн деген ой. Conditional Gaussian ыкмасы бул изилдөөдө шарт түзүлүшүн сактаган сүрөттөөчү/диагностикалык алкак болуп, чоң үлгүлүү ырастоочу статистикалык изилдөөлөрдүн ордун баспайт.

AI шартында байкалган кыскараак убакыт жана жогорураак proxy-шайкештик упайын шарттардын тартиби туруктуу болгондуктан AI куралынын гана себептик таасирине таандык кылууга болбойт. Изилдөөчүлөр ушул эле чектөөнү бүткүл иш боюнча кайталашат.

IEC 62366 пайызы чыныгы медициналык түзмөктүн жөнгө салуучу шайкештиги текшерилгенин билдирбейт. Колдонулган GPT-негизиндеги рубрика көз карандысыз эксперттик баалоого каршы текшерилбегендиктен, макаладагы маанилер автоматтык proxy-шайкештик өлчөмү катары гана каралышы керек.

Phase 2де тажрыйбага жараша байкалган эки багыттуу убакыт жообу да ырастоочу өз ара аракеттенүү тести эмес. Үч дизайнер, туруктуу тапшырма тартиби жана башка сапат өлчөмү болгондуктан, жыйынтык дизайн гипотезасын жаратуучу мүнөздө гана.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты