
Ushbu tadqiqot mutaxassis ishtirokchilarni topish qiyin boʻlgan sogʻliqni saqlash sohasidagi inson–kompyuter oʻzaro taʼsiri (Human–Computer Interaction, HCI) tadqiqotlarida kichik namunalarni qanday tahlil qilish kerakligini Simpson paradoksi orqali oʻrganadi. Toʻrt nafar professional UI/UX dizayner bir xil sogʻliqni saqlash dasturiy taʼminoti interfeysi vazifalarini avval anʼanaviy usulda, soʻng GPT asosidagi sunʼiy intellekt yordamidagi dizayn vositasi bilan bajardi. Sakkizta kuzatuvning barchasi bitta maʼlumotlar toʻplamidek birlashtirilganda, dizayn vaqti bilan avtomatik IEC 62366 proxy-muvofiqlik balli oʻrtasida kuchli va statistik jihatdan ahamiyatli manfiy korrelyatsiya topildi: \(r=-0{,}76\), \(p=0{,}029\), \(n=8\). Bunga qarshi, anʼanaviy shart oʻz ichida \(r=-0{,}33\), \(p=0{,}67\); AI yordamidagi shart esa oʻz ichida \(r=+0{,}18\), \(p=0{,}82\) natija berdi. Har ikkala shart ichidagi korrelyatsiya ham ahamiyatli emas edi va ularning ishoralari bir-biridan farq qilardi. Shu sababli umumlashtirib hovuzlangan korrelyatsiya “tezroq ishlash yaxshiroq muvofiqlikka olib keladi” tarzida talqin qilinadigan haqiqiy individual bogʻliqlik emas, balki ikki xil tajriba shartining bir-biridan ajralib turishi hosil qilgan aggregation artefact sifatida baholandi.
Xom maʼlumotlarda barcha toʻrt dizayner AI yordamidagi shartda ham qisqaroq vaqt ishlagani, ham yuqoriroq avtomatik proxy-muvofiqlik balli olgani koʻrindi. Oʻrtacha vazifa vaqti 92,5 daqiqadan 23,0 daqiqaga; oʻrtacha proxy-muvofiqlik balli esa %63,3 dan %82,8 gacha oʻzgardi. Biroq barcha ishtirokchilar shartlarni bir xil ketma-ketlikda bajargani sababli, bu farqlarning barchasini bevosita AI vositasiga bogʻlab boʻlmaydi; mashq, oʻrganish va vazifaga tanishlik taʼsirlari natijalarga hissa qoʻshgan boʻlishi mumkin. Bundan tashqari, atigi toʻrt dizaynerning mavjudligi Gaussian taqsimot farazi, dispersiya oʻzgarishlari va tajriba guruhlari oʻrtasidagi farqlar haqida kuchli umumlashtirishlar qilishga toʻsqinlik qiladi. Tadqiqotning asosiy hissasi “toʻrt kishi yetarli” degan daʼvo emas; kichik namuna muqarrar boʻlganda maʼlum tajriba shartlarini yoʻqotib yuboradigan hovuzlash chalgʻituvchi boʻlishi mumkinligini va shartlarga ajratilgan tahlil maʼlumotning haqiqiy tuzilishini yanada aniq koʻrsata olishini namoyish etishdir.
Simpson paradoksi nima?
Simpson paradoksi — quyi guruhlar alohida tekshirilganda koʻrinadigan bogʻliqliklar maʼlumotlar birlashtirilganda yoʻqolishi, oʻzgarishi yoki teskari yoʻnalishda koʻrinishi holatidir. Muammo shunchaki matematik qiziqish emas. Tadqiqotchi guruh yoki tajriba sharti haqidagi maʼlumotni hisobga olmasdan barcha kuzatuvlarni bitta taqsimotdan kelgandek tahlil qilsa, turli guruhlarning oʻrtacha qiymatlari orasidagi masofa sunʼiy korrelyatsiya hosil qilishi mumkin.
Ushbu tadqiqotdagi misol ancha ravshan. Anʼanaviy dizayn sharti umuman olganda yuqori vaqt–pastroq muvofiqlik hududida; AI yordamidagi shart esa past vaqt–yuqoriroq muvofiqlik hududida joylashgan. Ikki toʻplam birga regressiyaga kiritilganda, grafik chap yuqoridan oʻng pastga choʻzilgan kuchli manfiy tendensiyani hosil qiladi.
Biroq tadqiqotning asl savoli “sakkizta mustaqil kuzatuvda vaqt bilan muvofiqlik oʻrtasida bogʻliqlik bormi?” emas. Ayni toʻrt kishi ikki xil shart ostida oʻlchangan. Shartga mansublik va shaxslar juftligi tajriba dizaynining asosiy qismlaridir.
Nega hovuzlangan tahlil chalgʻituvchi chiqdi?
Sakkizta kuzatuv birgalikda hisoblanganda:
\[ r_{\mathrm{pooled}}=-0{,}76,\qquad p=0{,}029,\qquad n=8. \]
Bu raqamning oʻzi oʻqilsa, qisqaroq vaqtda dizayn qilish yuqoriroq IEC 62366 muvofiqligi bilan uzluksiz bogʻliq degan xulosa kelib chiqishi mumkin. Mualliflar bunday talqin qoʻllab-quvvatlanmasligini alohida taʼkidlaydilar.
Shartlar alohida saqlanganda:
\[ r_{\mathrm{traditional}}=-0{,}33, \qquad p=0{,}67, \qquad n=4 \]
va:
\[ r_{\mathrm{AI}}=+0{,}18, \qquad p=0{,}82, \qquad n=4 \]
natijalar olinadi.
Har ikkala korrelyatsiya ham statistik jihatdan ahamiyatli emas; bundan tashqari, biri manfiy, ikkinchisi musbat. Shu sababli manba tadqiqot \(-0{,}76\) boʻlgan hovuzlangan koeffitsiyent shartlar orasidagi joylashuv farqidan yuzaga kelganini va dizaynerlarning oʻz ichidagi tezlik–muvofiqlik mexanizmini ifodalamaganini taʼkidlaydi.
Individual dizaynerlar amalda qanday harakatlandi?
| Dizayner | Anʼanaviy vaqt (daq) | AI yordamidagi vaqt (daq) | Anʼanaviy proxy-muvofiqlik | AI yordamidagi proxy-muvofiqlik |
|---|---|---|---|---|
| D1 | 90 | 33 | %64 | %93 |
| D2 | 88 | 32 | %50 | %75 |
| D3 | 120 | 10 | %63 | %83 |
| D4 | 72 | 17 | %76 | %80 |
Toʻrt dizaynerning barchasi anʼanaviy shartdan AI yordamidagi shartga oʻtganda grafikda bir xil umumiy yoʻnalishda siljidi: vaqt kamaydi va avtomatik proxy-muvofiqlik balli oshdi. Ushbu individual juftlangan harakat shart maʼlumotini yoʻqotadigan hovuzlangan korrelyatsiyani nega ehtiyotkor talqin qilish kerakligini koʻrsatadi.
Shartli Gaussian model nima qiladi?
Tadqiqot taklif qilgan yondashuvda har bir tajriba sharti alohida ikki oʻzgaruvchili Gaussian xulosasi sifatida ifodalanadi:
\[ p(x\mid k)= \mathcal N(x;\mu_k,\Sigma_k), \]
bu yerda:
\[ x= \begin{bmatrix} \text{süre}\\ \text{proxy-uyum} \end{bmatrix} \]
va \(k\) traditional yoki AI-assisted shartini bildiradi.
\(\mu_k\) har bir shartning markazini; \(\Sigma_k\) esa oʻsha shartdagi kuzatilgan dispersiya va covariance tuzilishini ifodalaydi.
Ushbu modelning maqsadi toʻrtta kuzatuvdan ishonchli populyatsiya taqsimotini baholash emas. Mualliflar Gaussian komponentlaridan shartga xos markazlar, tarqalish va birgalikdagi oʻzgarish yoʻnalishini tartibli tarzda koʻrsatuvchi tavsifiy xulosalar sifatida foydalanadilar.
Bu haqiqatan Gaussian Mixture Modelmi?
Maqola terminologiyani alohida aniqlashtiradi. Tadqiqot dastlab ishlab chiqilgan davrda “conditional GMM” nomi ishlatilgan boʻlsa-da, qoʻllangan usul klassik unsupervised Gaussian Mixture Model emas.
Klassik GMMda:
- qaysi kuzatuv qaysi klasterga tegishli ekani nomaʼlum boʻlishi mumkin,
- mixing weights baholanadi,
- Expectation–Maximisation kabi algoritmlardan foydalanish mumkin,
- komponentlar soni BIC kabi mezonlar bilan tanlanishi mumkin.
Bu tadqiqotda esa anʼanaviy va AI yordamidagi shart yorliqlari tajriba dizaynidan avvaldan maʼlum. Ikki komponent kashf qilinmaydi, boshidan belgilangan. EM ishlatilmagan, latent cluster qidirilmagan va BIC bilan komponentlar soni tanlanmagan.
Shu sababli mualliflar joriy matnda asosiy nom sifatida conditional Gaussian model iborasidan foydalanadilar.
Shart markazlari qanchalik farq qiladi?
Anʼanaviy shart markazi:
\[ \mu_{\mathrm{traditional}} = (92{,}5\ \mathrm{dk},\;63{,}3\%) \]
boʻlsa, AI yordamidagi shart markazi:
\[ \mu_{\mathrm{AI}} = (23{,}0\ \mathrm{dk},\;82{,}8\%) \]
deb berilgan.
Namunadagi markazlar farqi AI sharti anʼanaviy shartga nisbatan oʻrtacha 69,5 daqiqa qisqaroq va avtomatik proxy-muvofiqlik qiymati 19,5 foiz punkti yuqoriroq ekanini koʻrsatadi.
Biroq shartlar ketma-ketligi qatʼiy boʻlgani sababli “AI vositasi oʻzi 69,5 daqiqa tejadi” yoki “AI vositasi oʻzi muvofiqlikni 19,5 punktga oshirdi” degan xulosa chiqarib boʻlmaydi. Bu qiymatlar tadqiqot amalga oshirilgan tartibda kuzatilgan shartlar farqidir.
IEC 62366 balli amalda nimani oʻlchaydi?
Tadqiqotda ishlatilgan ikkinchi asosiy oʻlchov — IEC 62366-1:2015 bilan moslikni baholash uchun alohida GPT asosidagi vosita yaratgan foiz balli. Baholash rubrikasi besh oʻlchamni oʻz ichiga oladi:
- Foydalanish xatosini kamaytirish: xavfsizlik nuqtayi nazaridan muhim oʻzaro taʼsirlarda xato imkoniyatlarini kamaytirish.
- Axborot iyerarxiyasi: kritik va birlamchi vazifa axborotining vizual va tuzilmaviy ustuvorligi.
- Qayta aloqa ravshanligi: tizim javoblari, xato holatlari va tasdiqlarning aniq boʻlishi.
- Foydalanish imkoniyati: oʻqish qulayligi, kontrast, nishon oʻlchami va klinik foydalanish muhiti bilan bogʻliq accessibility xususiyatlari.
- Tibbiy qurilma interfeysi konvensiyalari: maʼlum terminologiya va oʻzaro taʼsir kutishlariga moslik.
Ushbu ball rasmiy IEC 62366 sertifikatsiyasi yoki regulyator muvofiqlik qarori emas. Rubrika baholash vositasi tomonidan standartdan chiqarilgan va inson ekspert baholovchilariga qarshi validatsiya qilinmagan. Shu sababli mualliflar oʻlchovni “consistency-controlled proxy measure” bilan cheklaydilar.
Ayni model oilasi ham yaratishi, ham baholashi nega muhim?
AI yordamidagi dizayn vositasi tadqiqot davrida ChatGPT orqali foydalanilgan GPT-4o asosidagi maxsus GPT hisoblanadi. Alohida compliance scorer ham GPT-4o model oilasida ishlovchi boshqa maxsus GPT sifatida qurilgan.
Mualliflar buning ehtimoliy model-family bias hosil qilishi mumkinligini ochiq tan oladilar. Dizayn yaratishda foydalanilgan model oilasi ishlab chiqargan naqshlar shu oiladan kelgan baholash tizimiga tuzilmaviy jihatdan koʻproq mos koʻrinishi mumkin.
Shuning uchun muvofiqlik ballarini mustaqil ekspertlar tomonidan tasdiqlash kelajakda amalga oshirilishi kerak boʻlgan asosiy metodologik nazoratlardan biridir.
Namunadagi standart ogʻishlar nimani koʻrsatadi?
Manbada kuzatilgan namuna standart ogʻishlari quyidagicha:
| Oʻlchov | Anʼanaviy shart | AI yordamidagi shart |
|---|---|---|
| Vazifa vaqti | 20,0 daq | 11,3 daq |
| Proxy-muvofiqlik | 10,6 foiz punkti | 7,6 foiz punkti |
Har ikkala oʻlchovda ham namuna standart ogʻishi AI shartida kichikroq. Biroq atigi toʻrtta kuzatuv mavjudligi sababli, bu farq populyatsiya dispersiyasi haqiqatan kamayganini isbotlamaydi.
Brown–Forsythe shaklidagi Levene testida vaqt uchun:
\[ W=0{,}16,\qquad p=0{,}70 \]
va proxy-muvofiqlik uchun:
\[ W=0{,}12,\qquad p=0{,}74 \]
natija olingan.
Mualliflar bu natijalarni “dispersiyalar teng” deb talqin qilmaydi. \(n=4\) boʻlgani uchun test quvvati juda past; mavjud data dispersiya torayishini na tasdiqlashi, na inkor qilishi mumkin.
Tajriba darajasiga koʻra qanday naqsh kuzatildi?
| Dizayner | Profil | Kuzatilgan vaqt kamayishi | Kuzatilgan proxy-muvofiqlik oshishi |
|---|---|---|---|
| D1 | Oʻrta UI / Yuqori AI | %63 | +29 foiz punkti |
| D2 | Oʻrta UI / Yuqori AI | %64 | +25 foiz punkti |
| D3 | Past UI / Bir oz AI | %92 | +20 foiz punkti |
| D4 | Yuqori UI / Past AI | %76 | +4 foiz punkti |
UI tajribasi eng past boʻlgan D3 120 daqiqadan 10 daqiqaga tushib, namunadagi eng katta vaqt farqini koʻrsatgan. AI tajribasi yuqori D1 va D2 esa mos ravishda +29 va +25 foiz punkt bilan avtomatik proxy-muvofiqlikdagi eng katta oshishlarga ega.
Bu qiymatlar tajriba guruhlari oʻrtasida isbotlangan oʻzaro taʼsir effektlari emas. Har bir profil uchun bittadan dizayner yoki juda oz kuzatuv boʻlgani sababli, mualliflar ularni faqat kelajak tadqiqotlari uchun gipoteza hosil qiluvchi eksplorativ naqshlar sifatida baholaydilar.
Dizaynerlarning fikr-mulohazalari nima dedi?
Phase 1 da toʻrt dizaynerning barchasi AI yordamidagi vosita gʻoyadan vizual dizaynga oʻtish jarayonini tezlashtirganini bildirdi. Uch dizayner vosita dizayn qarashini aniq dizaynga aylantirishda foydali ekanini aytdi.
Bunga qarshi, tajribaliroq ikki dizayner standart qadam-baqadam yoʻnaltirish ularning ekspert ish oqimida keraksiz ishqalanish hosil qilganini aytdi. Manbada bu fikr-mulohaza formal thematic analysis sifatida taqdim etilmaydi; faqat kichik namunadan olingan takrorlanuvchi mavzularning tavsifiy xulosasi sifatida qayd etiladi.
Bu kuzatuv vositani qanday oʻzgartirdi?
Tadqiqotchilar birinchi bosqichdagi geterogenlikni faqat qayd etib qolmay, ikkinchi bosqichda vositani qayta loyihalash uchun undan foydalandilar.
Yangi vosita sessiya boshida foydalanuvchining:
- AI vositalari bilan tajribasini,
- UI dizayn tajribasini
soʻraydi va ikki oʻzaro taʼsir rejimidan birini tanlaydi.
Kamroq tajribali foydalanuvchi: ochiq dizayn qarorlari, inline yoʻriqnoma va qadam-baqadam “handholding” rejimi.
Tajribaliroq foydalanuvchi: kamroq scaffolding oʻz ichiga olgan ochiq/free-form rejim.
Bundan tashqari, birinchi vositaning faqat vizual yaratishga tayangan yondashuviga qoʻshimcha ravishda UI elementlarini toʻgʻridan-toʻgʻri tahrirlash mumkin boʻlgan real-canvas yuzasi qoʻshildi.
Ikkinchi bosqichda nima boʻldi?
Phase 2 da D1, D2 va D3 qatnashdi. D4 bu bosqichda ishtirok etmadi.
| Dizayner | Phase 1 AI vositasi (daq) | Phase 2 moslashuvchan vosita (daq) | Kuzatilgan vaqt oʻzgarishi |
|---|---|---|---|
| D1 | 33 | 10 | −%70 |
| D2 | 32 | 17 | −%47 |
| D3 | 10 | 32 | +%220 |
AI tajribasi yuqori D1 va D2 moslashtirilgan vosita bilan yanada tezlashdi. UI tajribasi past D3 esa oldingi 10 daqiqa oʻrniga 32 daqiqa sarfladi.
Manba bu oshishni avtomatik ravishda yomonlashuv deb talqin qilmaydi. D3 ochiq fikr-mulohazasida dizayn ustida uzoqroq iteratsiya qilgani va chiqishni koʻproq takomillashtirganini bildirgan. Shunga qaramay, tadqiqotda obyektiv Phase 2 sifat oʻlchovi boʻlmagani sababli:
“sekinroq, chunki ehtiyotkorroq”
bilan:
“sekinroq, chunki vosita koʻproq chekladi”
ehtimollarini miqdoriy ravishda ajratib boʻlmaydi.
Nega Phase 2 sifat oʻlchovi Phase 1 bilan solishtirib boʻlmaydi?
Phase 1 da sifat/muvofiqlik uchun GPT asosidagi IEC 62366 proxy-balli ishlatilgan. Phase 2 da ayni avtomatik baholash takrorlanmagan; uning oʻrniga ishtirokchilar besh ballik qoniqish/sifat baholashini amalga oshirgan.
Uch dizayner ham 4/5 ball bergan va scaffolding mosligini bildirgan. Biroq:
\[ \text{IEC 62366 proxy-puanı} \neq \text{öznel 5 puanlık memnuniyet} \]
boʻlgani sababli Phase 1 va Phase 2 sifat qiymatlarini bevosita solishtirib boʻlmaydi.
Gaussian farazi haqiqatan sinovdan oʻtkazildimi?
Yoʻq. Tadqiqotchilar \(n=4\) kuzatuv bilan bivariate normality farazini mazmunli tarzda tasdiqlab boʻlmasligini ochiq aytadilar.
Shapiro–Wilk, Kolmogorov–Smirnov yoki Anderson–Darling kabi testlarning bunday hajmdagi namunada talqin qilinadigan quvvati yoʻq. Toʻrtta nuqtadan iborat Q–Q grafigi ham taqsimot shaklini ishonchli aniqlay olmaydi.
Shu sababli conditional Gaussian model formal likelihood inference uchun validatsiyadan oʻtgan ehtimollik modeli sifatida emas, shartlarni tartiblaydigan va vizual xulosa qiladigan vosita sifatida ishlatiladi.
Paired t-test nimani koʻrsatdi?
Ayni ishtirokchilar ikki shartda oʻlchangani sababli tadqiqotchilar standart paired t-test taqqoslashini ham oʻtkazdilar.
Vaqt farqi uchun:
\[ \bar d=69{,}5\ \mathrm{dk}, \]
\[ t(3)=5{,}15, \qquad p=0{,}014, \]
\[ 95\%\ GA=[26{,}5,\;112{,}5], \qquad d_z=2{,}57. \]
Proxy-muvofiqlik farqi uchun:
\[ \bar d=19{,}5\ \text{yüzde puanı}, \]
\[ t(3)=3{,}56, \qquad p=0{,}038, \]
\[ 95\%\ GA=[2{,}0,\;37{,}0], \qquad d_z=1{,}78. \]
Mualliflar paired t-test ni ikki shart oʻrtasidagi oʻrtacha farq haqida asosiy inferential comparator sifatida ishlatadilar. Conditional Gaussian model esa buning oʻrniga Simpson paradoksini va shartlar/foydalanuvchi profillariga koʻra tuzilmaviy geterogenlikni koʻrinadigan qiladi. Yaʼni conditional model paired t-test oʻrniga qoʻyilmaydi.
Nega Wilcoxon testi ahamiyatli chiqmadi?
Exact Wilcoxon signed-rank test ikkala natija uchun:
\[ W=0,\qquad p=0{,}125 \]
natija berdi.
Biroq toʻrtta juftlikning barchasi bir yoʻnalishda boʻlganda ikki tomonlama exact Wilcoxon testida olinishi mumkin boʻlgan eng kichik p-qiymat:
\[ 2\left(\frac12\right)^4=0{,}125 \]
boʻlgani uchun tadqiqot bu natijani “taʼsir yoʻq” deb talqin qilmaydi. Ushbu namuna hajmida testning p-qiymat rezolyutsiyasi baribir 0,05 dan pastga tusha olmaydi.
Nega mixed-effects model ishlatilmadi?
Toʻrt dizayner random-effect dispersiya komponentlarini ishonchli baholash uchun nihoyatda cheklangan guruh darajalari sonidir. Tadqiqotchilar random-intercept modelini sinab koʻrishgan, biroq maksimum likelihood yechimi uch optimizer bilan qayta urinishga qaramay converge qilmagan; bir L-BFGS konfiguratsiyasida singular design matrix olingan.
Random-slope modeli matematik jihatdan converge qilgan boʻlsa-da, atigi toʻrt kishida ortiqcha parametrli boʻlgani sababli dispersiya komponentlari talqin qilib boʻlmaydigan deb qabul qilingan.
Nega Bayesian hierarchical model qoʻllanmadi?
Tadqiqot bahosiga koʻra \(n=4\) da dizaynerlararo dispersiyani ifodalovchi hyperparameter data tomonidan yetarlicha aniqlanmaydi. Zaif prior ishlatilganda posterior katta darajada prior ni qaytarishi mumkin; kuchli prior ishlatilganda natija yanada bevosita prior tomonidan belgilanishi mumkin.
Shu sababli Bayesian hierarchical model kattaroq maʼlumotlar toʻplami uchun kelajakdagi ish sifatida qoldirilgan.
Tadqiqot qoʻllab-quvvatlaydigan natijalar
Birinchidan, ushbu namunada anʼanaviy va AI yordamidagi shartlar birlashtirilganda kuchli manfiy korrelyatsiya yuzaga kelgan, biroq shartlar alohida tahlil qilinganda ayni bogʻliqlik kuzatilmagan. Tadqiqotning Simpson paradoksi/aggregation artefact daʼvosining toʻgʻridan-toʻgʻri empirik asosi shudir.
Ikkinchidan, toʻrt dizaynerning barchasida AI yordamidagi shart anʼanaviy shartga nisbatan qisqaroq vaqt va yuqoriroq avtomatik proxy-muvofiqlik balli bilan birga kuzatilgan.
Uchinchidan, shartga xos tahlil dizaynerlar orasida turli javob profillari mavjudligini koʻrsatgan; biroq bu profillar kichik namuna sababli gipoteza hosil qiluvchi darajadadir.
Toʻrtinchidan, Phase 1 da kuzatilgan scaffolding geterogenligi vositaning tajribaga moslashtirilgan ikkinchi versiyasini loyihalashga olib kelgan va Phase 2 da dizaynerlar oʻrtasida ikki yoʻnalishli vaqt javobi kuzatilgan.
Tadqiqot qoʻllab-quvvatlamaydigan yoki sinovdan oʻtkazmagan natijalar
Tadqiqot toʻrt kishi kichik namuna uchun umuman yetarli ekanini koʻrsatmaydi. Mualliflar aksini ochiq tan oladilar.
Tadqiqot AI vositasi kuzatilgan barcha yaxshilanishning sababiy manbai ekanini isbotlamaydi. Shartlar counterbalanced boʻlmagani sababli mashq va vazifaga tanishlik taʼsirlari ajratilmagan.
Tadqiqot GPT asosidagi muvofiqlik balli haqiqiy regulyator IEC 62366 muvofiqligiga teng ekanini koʻrsatmaydi.
Tadqiqot AI shartida haqiqiy populyatsiya dispersiyasi pastroq ekanini isbotlamaydi.
Tadqiqot muayyan tajriba darajasidagi barcha dizaynerlar bir xil tarzda javob berishini koʻrsatmaydi.
Phase 2 moslashuvchan vosita sifat jihatidan ustun ekanini isbotlamaydi. Phase 2 da Phase 1 bilan ayni obyektiv/proxy sifat oʻlchovi ishlatilmagan.
Conditional Gaussian model formal kichik-namuna inferential yechim sifatida validatsiya qilinmagan. Maqoladagi asosiy vazifasi shart tuzilishini saqlaydigan tavsifiy va diagnostik tahlildir.
Turkiya nuqtayi nazaridan nimani anglatadi?
Tadqiqot Yaponiyadagi universitetga aloqador tadqiqotchilar tomonidan oʻtkazilgan va faqat toʻrt professional dizaynerdan iborat qulaylik namunasi ishlatilgan. Turkiyadagi sogʻliqni saqlash dasturiy taʼminoti dizaynerlari yoki tibbiy qurilma ishlab chiqaruvchilari uchun bevosita samaradorlik natijasini taqdim etmaydi.
Biroq metodologik xabar mamlakatga xos emas: mutaxassis ishtirokchilar kam boʻlgan sogʻliqni saqlash HCI, tibbiy dasturiy taʼminot, sanoat interfeysi yoki boshqa xavfsizlik-kritik UX tadqiqotlarida shartlarni bitta hovuzda birlashtirishdan oldin shart ichidagi naqshlarni tekshirish kerak. Turkiya kontekstida ayni usulni qoʻllash mahalliy dizaynerlar bilan kattaroq va shartlar ketma-ketligi muvozanatlashtirilgan mustaqil tadqiqotlarni talab qiladi.
Tadqiqot Usuli va Natijalari
Phase 1 tajriba dizayni
Toʻrt professional UI/UX dizayner sogʻliqni saqlash dasturiy taʼminoti interfeyslari uchun bir xil dizayn vazifalarini ikki shartda bajardi:
- Anʼanaviy ish oqimi: AI dizayn vositasidan foydalanmasdan qoʻlda bajariladigan yondashuv.
- AI yordamidagi ish oqimi: sogʻliqni saqlash HCI tamoyillari va IEC 62366 bilimlari bilan tuzilgan GPT asosidagi vosita.
Ishtirokchilar xususiyatlari quyidagicha:
| ID | UI tajribasi | AI tajribasi | Fon |
|---|---|---|---|
| D1 | Oʻrta | Yuqori | Healthcare UX, 3+ yil |
| D2 | Oʻrta | Yuqori | Medical software, 4 yil |
| D3 | Past | Bir oz | Umumiy UX; sogʻliqni saqlash sohasiga oʻtish |
| D4 | Yuqori | Past | Katta dizayner, 8+ yil |
Vazifalarga Portable Health Clinic mobil tizimi uchun xavfsiz kirish ekrani va tibbiyot xodimi dashboard'i kabi sogʻliq interfeyslari kirgan. Talablar xatolarni oldini olish, axborot iyerarxiyasi va accessibility oʻlchamlarini qamrab olgan.
Sessiyalar taxminan 90 daqiqaga rejalashtirilgan, biroq qatʼiy vaqt cheklovi qoʻllanmagan. Vaqt vazifa boshlanishidan dizayner yakuniy topshirigʻigacha qayd etilgan.
Shartlar ketma-ketligining dizaynga taʼsiri
Toʻrt ishtirokchining barchasi:
avval traditional → keyin AI-assisted
ketma-ketligini kuzatgan.
Tadqiqotchilar buni AI vositasi bilan oldindan tanishish qoʻlda dizaynga taʼsir qilmasligi uchun tanlaganlar. Buning evaziga bu qaror ikkinchi shartdagi natijalarni vazifani oʻrganish va tanishlik bilan aralashtiradi.
Shu sababli tadqiqot randomised yoki counterbalanced causal trial sifatida emas, balki sequentially unbalanced exploratory comparison sifatida talqin qilinadi.
AI dizayn vositasining tuzilishi
AI shartida ishlatilgan dastur tabiiy til soʻrovlari bilan ishlovchi GPT asosidagi dizayn vositasidir. Vosita:
- matnli tavsiflardan interfeys mockup'larini yarata olgan,
- HCI va foydalanish qulayligi tamoyillariga koʻra takomillashtirishlarni taklif qila olgan,
- potensial foydalanish xatolarini belgilay olgan,
- sogʻliqni saqlash UX naqshlari va IEC 62366 bilimlarini dizayn jarayoniga qoʻsha olgan.
Tadqiqot davrida vosita ChatGPT platformasida maxsus GPT shaklida va GPT-4o model oilasi bilan ishlagan.
Asosiy oʻlchovlar
Ikkita birlamchi miqdoriy oʻlchov toʻplangan:
- Vazifani bajarish vaqti: daqiqa.
- IEC 62366 proxy-muvofiqlik balli: alohida GPT asosidagi baholash vositasidan olingan foiz qiymati.
Xom vaqt maʼlumotlari va Verianla Live
Toʻrt ishtirokchining barchasida AI yordamidagi shartda vazifa vaqti pastroq. Quyidagi Verianla Live grafigi faqat bir xil birlikdagi vaqt maʼlumotlarini solishtiradi; compliance ballari vaqt oʻqiga aralashtirilmagan.
Oʻrtacha vaqt:
\[ 92{,}5\ \mathrm{dk} \rightarrow 23{,}0\ \mathrm{dk} \]
koʻrinishida oʻzgargan. Manba buni kuzatilgan oʻrtacha qiymatda taxminan %75 kamayish deb qayd etadi. Shartlar ketma-ketligi qatʼiy boʻlgani sababli bu foiz sof sababiy AI taʼsiri emas.
Proxy-muvofiqlik natijalari
| Dizayner | Anʼanaviy proxy-muvofiqlik | AI yordamidagi proxy-muvofiqlik | Farq |
|---|---|---|---|
| D1 | %64 | %93 | +29 foiz punkti |
| D2 | %50 | %75 | +25 foiz punkti |
| D3 | %63 | %83 | +20 foiz punkti |
| D4 | %76 | %80 | +4 foiz punkti |
Namuna oʻrtachasi:
\[ 63{,}3\% \rightarrow 82{,}8\% \]
koʻrinishida oʻzgargan va barcha toʻrt dizaynerda yoʻnalish musbat boʻlgan. Biroq ball avtomatik va ekspert validatsiyasidan oʻtmagan proxy ekanini alohida saqlash kerak.
Simpson paradoksining sonli xulosasi
| Tahlil | Korrelyatsiya \(r\) | p | n | Manba talqini |
|---|---|---|---|---|
| Barcha kuzatuvlar hovuzlangan | −0,76 | 0,029 | 8 | Ahamiyatli koʻringan, ammo shartlararo farq hosil qilgan aggregation artefact |
| Faqat anʼanaviy shart | −0,33 | 0,67 | 4 | Ahamiyatli emas |
| Faqat AI yordamidagi shart | +0,18 | 0,82 | 4 | Ahamiyatli emas |
Manba tadqiqotning metodologik daʼvosi aynan shu farqdan kelib chiqadi: shartlarni ajratish hovuzlangan korrelyatsiyada koʻrinmaydigan tajriba tuzilishini qayta tiklaydi.
Paired tahlil va conditional modelning vazifalari turlicha
| Usul | Ushbu tadqiqotdagi roli |
|---|---|
| Paired t-test | Ayni ishtirokchining ikki shart oʻrtasidagi oʻrtacha farqini inferential ravishda sinovdan oʻtkazadi. |
| Conditional Gaussian model | Har bir shart markazi, tarqalishi va birgalikdagi oʻzgaruvchi tuzilishini alohida saqlaydi; aggregation artefact ni koʻrinadigan qiladi. |
| Wilcoxon signed-rank | Rank asosidagi nazorat; \(n=4\) da minimal ikki tomonlama p=0,125 sababli inferential aniqlik yetarli emas. |
| Repeated-measures ANOVA | Ikki shartli dizaynda paired t-test bilan matematik jihatdan ekvivalent. |
| Linear mixed-effects | Toʻrtta random-effect darajasi sababli ishonchli baholab boʻlmagan. |
| Bayesian hierarchical model | Ushbu namunada between-designer dispersiyasi prior ga haddan tashqari bogʻliq boʻlishi sababli qoʻllanmagan. |
Monte Carlo qoʻshimcha tahlili nimani koʻrsatadi?
Maqolaning qoʻshimcha materialida tajriba dizayniga moslashtirilgan Monte Carlo simulyatsiyasi qayd etiladi. Manba matn xulosasidagi natijaga koʻra, within-condition correlation nol qilib belgilangan maʼlumot yaratish jarayonida \(n=4\) kishi/shart darajasida 10.000 simulyatsiyaning %56 ida hovuzlangan tahlil statistik jihatdan ahamiyatli manfiy korrelyatsiya hosil qilgan.
Ushbu simulyatsiya maqoladagi bitta parametr konfiguratsiyasiga tegishli. Turli namuna hajmlari, effekt kattaliklari, korrelyatsiya tuzilmalari va normal taqsimotdan ogʻishlar uchun umumiy operating characteristics tadqiqoti oʻtkazilmagan.
Phase 2 ning metodologik maʼnosi
Ikkinchi bosqichning asosiy hissasi conditional tahlildan kelib chiqqan foydalanuvchi geterogenligi gipotezasini aniq mahsulot dizayni oʻzgarishiga aylantirishdir:
tahlil → tajribaga bogʻliq scaffolding gipotezasi → vositani qayta loyihalash → yangi foydalanuvchi javoblarini kuzatish.
Mualliflar bu sikl iterative HCI design ga xos noyob usul emasligini tan oladilar. Conditional modelning hissasi hovuzlangan tahlil tekislab yuboradigan geterogenlikni tuzilmaviy ravishda saqlashidir.
Tadqiqotning metodologik tavsiyalari
- Shartlar farqi kutilsa, avval shartlarni alohida koʻrib chiq.
- Pooled korrelyatsiya bilan within-condition korrelyatsiyalarini solishtirib Simpson paradoksi tekshiruvini oʻtkaz.
- Har bir shart uchun oʻrtacha, tarqalish va korrelyatsiyalarni alohida qayd et.
- Kichik namunada dispersiya farqlarini inferential haqiqatlar sifatida emas, tavsifiy statistika sifatida taqdim et.
- Tajriba va ekspertlik kabi tegishli foydalanuvchi xususiyatlariga koʻra javoblarni eksplorativ tarzda tekshir.
- Within-subject dizaynning pairing tuzilishini inferential tahlil paytida saqla.
Asosiy cheklovlar
- Phase 1 faqat toʻrt dizaynerni oʻz ichiga oladi.
- Phase 2 faqat uch dizaynerni oʻz ichiga oladi.
- Ishtirokchilar convenience sampling orqali professional tarmoqlardan tanlangan.
- Shartlar ketma-ketligi qatʼiy va counterbalanced emas.
- Mashq/oʻrganish taʼsirini AI taʼsiridan ajratib boʻlmaydi.
- Vazifalar faqat bitta mobil sogʻliqni saqlash dasturiy taʼminoti kontekstida.
- IEC 62366 ballash tizimi mustaqil inson ekspertlari bilan validatsiya qilinmagan.
- Dizayn vositasi va compliance scorer ayni GPT-4o model oilasiga mansub.
- Gaussian taqsimot farazi \(n=4\) da sinovdan oʻtkazib boʻlmaydi.
- Shartlararo dispersiya farqi isbotlanmagan.
- Experience-indexed natijalar individual kuzatuvlardan chiqarilgan eksplorativ naqshlardir.
- Phase 2 da D4 qatnashmagan.
- Phase 2 da Phase 1 dagi IEC 62366 proxy-balli takrorlanmagan.
- Phase 2 ning 5 ballik subyektiv sifat/qoniqish oʻlchovi Phase 1 ning proxy-compliance metrikasi bilan bevosita solishtirib boʻlmaydi.
Kelgusi tadqiqotlar
Mualliflar taklif qilgan keyingi qadamlar kattaroq va counterbalanced namunalar, shart dispersiyalarini yetarli quvvat bilan sinovdan oʻtkazish, Gaussian goodness-of-fit baholashi, modelni turli namuna va korrelyatsiya shartlarida simulyatsiya bilan keng qamrovli tavsiflash va avtomatik IEC 62366 ballini ekspert inson baholovchilari bilan inter-rater reliability tahlil qilishdir.
Doirani aviatsiya interfeyslari, moliyaviy xizmatlarning compliance UI lari va accessibility talabi mavjud davlat interfeyslari kabi sogʻliqni saqlashdan tashqari xavfsizlik-kritik sohalarda sinovdan oʻtkazish ham taklif etiladi.
Manba va Usul Haqida Izoh
Toʻliq asl tadqiqot nomi: Conditional Gaussian Modelling for Small-Sample HCI Evaluation: Resolving Simpson’s Paradox in AI-Assisted Healthcare Design Tools
Mualliflar: Mohammad Bilal Firoz; Ashir Ahmed.
Teng birinchi/teng hissa: Manbada koʻrsatilmagan.
Masʼul muallif: Mohammad Bilal Firoz.
Muassasa: Department of Information Science and Technology, Kyushu University, Fukuoka 819-0395, Japan.
Manba turi: Inson ishtirokchilari qatnashgan, kichik namunali HCI/usability tadqiqot maqolasi; ikki bosqichli eksplorativ baholash va metodologik tahlil.
Taqriz holati: Taqrizdan oʻtgan jurnal nashri.
Jurnal: AI.
Nashriyot: MDPI, Basel, Shveysariya.
Bibliografik qayd: AI, 2026, Jild 7, Son 6, Maqola 199.
DOI: 10.3390/ai7060199.
Qabul qilish / tahrir / qabul / nashr: 31-mart 2026 / 22-may 2026 / 26-may 2026 / 30-may 2026.
Litsenziya: Creative Commons Attribution (CC BY).
Academic Editors: Zubaer Mannan; Asif Karim; Nur Alam Md.
Phase 1 namunasi: Toʻrt professional UI/UX dizayner.
Phase 2 namunasi: Birinchi bosqichdagi dizaynerlarning uchtasi; D4 qatnashmagan.
Tadqiqot dizayni: Within-subjects, biroq shartlar ketma-ketligi qatʼiy, sequentially unbalanced exploratory comparison. Barcha dizaynerlar traditional shartni birinchi, AI-assisted shartni ikkinchi bajargan.
AI dizayn vositasi: Tadqiqot davrida ChatGPT platformasi orqali foydalanilgan GPT-4o asosidagi custom GPT.
Compliance baholash vositasi: Dizayn vositasidan alohida, biroq yana GPT-4o model oilasiga qurilgan custom GPT.
Compliance metrikasining holati: IEC 62366-1:2015 mosligi uchun avtomatik va consistency-controlled proxy oʻlchov; validatsiyadan oʻtgan regulyator muvofiqlik qarori emas va ekspert inson baholashi bilan inter-rater reliability oʻrnatilmagan.
Asosiy metodologik usul: Maʼlum tajriba shartlariga koʻra condition-stratified bivariate Gaussian summaries. Unsurpervised GMM, EM algoritmi, BIC component selection yoki latent cluster discovery ishlatilmagan.
Asosiy statistikalar: Pearson korrelyatsiyalari, paired t-test, exact Wilcoxon signed-rank, Brown–Forsythe shaklidagi Levene variance testi va repeated-measures ANOVA ekvivalentligi. Linear mixed-effects fit sinab koʻrilgan, biroq ishonchli foydalanib boʻlmagan; Bayesian hierarchical tahlil qoʻllanmagan.
Phase 1 dagi asosiy kuzatilgan farq: Oʻrtacha vaqt 92,5 daqiqadan 23,0 daqiqaga; avtomatik proxy-muvofiqlik oʻrtachasi %63,3 dan %82,8 gacha oʻzgargan. Shartlar ketma-ketligi qatʼiy boʻlgani sababli qiymatlarni sof sababiy vosita taʼsiri deb talqin qilib boʻlmaydi.
Simpson paradoksi natijasi: Pooled \(r=-0{,}76\), \(p=0{,}029\), \(n=8\); traditional \(r=-0{,}33\), \(p=0{,}67\), \(n=4\); AI-assisted \(r=+0{,}18\), \(p=0{,}82\), \(n=4\).
Paired t-test: Vaqt tejalishi uchun \(t(3)=5{,}15\), \(p=0{,}014\), \(d_z=2{,}57\); proxy-muvofiqlik oshishi uchun \(t(3)=3{,}56\), \(p=0{,}038\), \(d_z=1{,}78\).
Moliyalashtirish: Tadqiqot tashqi moliyalashtirish olmagan.
Etika kengashi: Manbaga koʻra, tegishli Yaponiya institutsional yoʻriqnomalari doirasida formal etika kengashi tasdigʻi zarur deb topilmagan. Tadqiqot bemor, klinik aralashuv, biologik namuna yoki shaxsiy sogʻliq maʼlumotlarini oʻz ichiga olmaydigan, ixtiyoriy voyaga yetgan professionallar bilan oʻtkazilgan non-medical va non-interventional usability baholashi sifatida taʼriflangan. Tadqiqotchilar ish Helsinki deklaratsiyasi tamoyillariga muvofiq olib borilganini bildiradilar.
Xabardor qilingan rozilik: Barcha ishtirokchilardan rozilik olingan; anonim ishtirokchi kodlari, anonim dizayn qaydlari iqtiboslari va vazifalarda yaratilgan interfeys dizaynlarini nashr qilishga ham rozilik berilgani qayd etiladi.
Maʼlumotlar mavjudligi: Tadqiqotning asl hissalari maqola va Supplementary Materials ichida ekani, qoʻshimcha savollar masʼul muallifga yoʻnaltirilishi mumkinligi aytiladi.
Qoʻshimcha material: AI dizayn vositalari, tajriba maʼlumotlari, vazifa tavsiflari, namuna dizaynlar, tadqiqot protokoli, statistik tafsilotlar, maʼlumot/vosita mavjudligi, Q–Q grafiklari, Simpson paradoksi Monte Carlo tahlili va qayta ishlab chiqilish skripti bo'limlari mavjudligi bildiriladi.
Muallif hissalari: Konseptualizatsiya M.B.F. va A.A.; metodologiya M.B.F.; formal tahlil M.B.F.; tadqiqot M.B.F.; dastlabki qoralama M.B.F.; koʻrib chiqish va tahrirlash A.A.; vizualizatsiya M.B.F.; rahbarlik A.A. tomonidan bajarilgan.
Generativ AI ishlatish bayonoti: Tajribada UI/UX dizayn vositasi va IEC 62366 proxy-baholash vositasi GPT-4o asosidagi custom GPT lar sifatida ishlatilgan. Manba shuningdek maqola tayyorlanayotganda til tuzatish, tahrir va statistik hisoblarni tekshirishni qoʻllab-quvvatlash maqsadida Claude Opus 4.7 ishlatilganini; barcha statistikalar mualliflar tomonidan koʻrib chiqilib tasdiqlanganini va mazmun uchun mualliflar javobgar ekanini bildiradi.
Manfaatlar toʻqnashuvi: Mualliflar manfaatlar toʻqnashuvini bildirmagan.
Ilmiy talqin chegarasi
Tadqiqotning asosiy metodologik xabari kichik namuna yetarli boʻlib qolishi emas; muqarrar kichik namunalarda tajriba tuzilishini yoʻq qiluvchi hovuzlash qoʻshimcha xato ham hosil qilishi mumkinligidir. Conditional Gaussian yondashuvi ushbu tadqiqotda shart tuzilishini saqlovchi tavsifiy/diagnostik doira boʻlib, katta namunali tasdiqlovchi statistik tadqiqotlar oʻrnini bosmaydi.
AI shartida kuzatilgan qisqaroq vaqt va yuqoriroq proxy-muvofiqlik ballini shartlar ketma-ketligi qatʼiy boʻlgani sababli faqat AI vositasining sababiy taʼsiriga bogʻlab boʻlmaydi. Tadqiqotchilar ayni cheklovni tadqiqot davomida takrorlaydilar.
IEC 62366 foizi haqiqiy tibbiy qurilmaning regulyator muvofiqligi tasdiqlanganini anglatmaydi. Ishlatilgan GPT asosidagi rubrika mustaqil ekspert baholashiga qarshi validatsiya qilinmagani sababli, maqoladagi qiymatlar faqat avtomatik proxy-muvofiqlik oʻlchovi sifatida koʻrilishi kerak.
Phase 2 da tajribaga qarab kuzatilgan ikki yoʻnalishli vaqt javobi ham tasdiqlovchi oʻzaro taʼsir testi emas. Uch dizayner, qatʼiy vazifa ketma-ketligi va boshqa sifat oʻlchovi sababli natija faqat dizayn gipotezasi hosil qiluvchi xususiyatga ega.

Izoh qoldiring
E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan