
Ushbu tadqiqot ko‘z, burun, og‘iz, soch yoki yuz terisi kabi yuz komponenti semantik niqob bilan to‘liq yashirilganda zamonaviy sun’iy intellektga asoslangan tasvirni to‘ldirish (image inpainting) usullari yetishmayotgan hududni qay darajada qayta yarata olishini taqqoslaydi. CelebA-HQ/CelebAMask-HQ yuz tasvirlari va 12 xil semantik niqob sinfidan foydalanib MI-GAN, Latent-based, CMT, MAT, LaMa, Co-Mod-GAN, MADF va cheklangan miqyosda RePaint kabi turli arxitektura oilalari baholangan. Tadqiqotning ikkinchi bosqichida MAT modeli 24.000 ta o‘quv tasviri bilan tasodifiy, semantik va bu ikki niqob turini birlashtiruvchi aralash strategiyalar asosida noldan qayta o‘qitilgan va 6000 ta tasvirda sinovdan o‘tkazilgan. Aralash niqobli o‘qitish FID bo‘yicha 12 ta semantik niqob sinfining 10 tasida eng past qiymatni bergan; bir sinfda tasodifiy niqob bilan teng natija olingan, eng keng birlashtirilgan niqob sinfida esa yomonroq ishlagan. Shunga qaramay, tadqiqot to‘liq yopilgan yuz komponentlari xatosiz yoki asl shaxsga identiklik jihatidan to‘g‘ri tarzda qayta tiklanishini ko‘rsatmaydi.
Tadqiqotning asosiy qiyinligi tasodifiy niqoblar bilan semantik niqoblar o‘rtasidagi axborot farqidir. Tasodifiy niqob ko‘z, lab yoki soch hududining faqat bir qismini yopishi mumkin va model qolgan piksel tuzilishidan foydalanishi mumkin. Semantik niqob esa maqsad komponentning barchasini olib tashlab, mahalliy strukturaviy ishoralarni yo‘q qiladi. Bunday holatda model ko‘rinmayotgan hududni faqat atrofdagi yuz geometriyasi, tekstura, simmetriya va o‘qitish davomida o‘rgangan statistik bog‘lanishlar asosida taxmin qilishi kerak.
Tadqiqotning vizual tajribalari bu farq faqat metrikalarda emas, yaratilgan yuzlarda ham namoyon bo‘lishini ko‘rsatadi. Modellar qalin yoki qora kipriklar, noto‘g‘ri hizalangan ko‘z qorachig‘i, qo‘shilib ketgan lab va tishlar, aniq ko‘rinadigan niqob chegaralari, o‘zgargan teri ranglari, tabiiy bo‘lmagan soch oqimi, yetishmayotgan quloqlar yoki ayrim holatlarda qo‘shimcha ko‘z kabi strukturaviy xatolarni hosil qilishi mumkin. Shu sababli past FID qiymati o‘z-o‘zidan anatomik yoki identiklik jihatidan mukammal rekonstruksiya degani emas.
| Tajriba elementi | Tadqiqotda ishlatilgan tuzilma | Talqin chegarasi |
|---|---|---|
| Asosiy ma’lumotlar to‘plami | Taxminan 30.000 ta CelebA-HQ yuz tasviri, 1024 × 1024 | Klinik bemor yoki travma ma’lumotlar to‘plami emas. |
| Semantik niqob sinfi | 12 sinf (A–L) | Belgilangan yuz komponentlari to‘liq yashiriladi. |
| Baholangan o‘lchamlar | 256, 512 va 1024 | Har bir model barcha o‘lchamlarda baholanmagan. |
| Asosiy metrikalar | FID, P-IDS, U-IDS | P-IDS/U-IDS yo‘nalishi bo‘yicha manbada ta’rif–talqin nomuvofiqligi mavjud. |
| MAT qayta o‘qitish | 24.000 o‘quv + 6000 test tasviri | 512 × 512 o‘lchamda bajarilgan. |
| Niqob o‘qitish strategiyalari | Tasodifiy, semantik, aralash | Aralash yondashuv ko‘pchilik, ammo barcha niqob sinflarida ustun emas. |
Nega tasvirni to‘ldirish muammosi semantik niqoblarda qiyinlashadi?
Tasvirni to‘ldirish — tasvirdagi yetishmayotgan yoki yashirilgan hududni atrofdagi ma’lumotdan foydalanib sun’iy tarzda qayta yaratishdir. Inson yuzlarida bu vazifa ayniqsa qiyin; chunki ko‘zlarning o‘zaro joylashuvi, burun–og‘iz geometriyasi, jag‘ tuzilishi, soch oqimi, teri rangi va yuz simmetriyasi kabi bir-biri bilan bog‘liq ko‘plab xususiyatlar mavjud.
Tadqiqotda ishlatilgan semantik niqoblar tasodifiy shakldagi bo‘shliqlardan farq qiladi. Niqoblar ma’lum anatomik/vizual komponentning segmentatsiya yorlig‘idan foydalanib o‘sha komponentning barchasini yashiradi. Masalan, ko‘z niqobi ko‘zlar bilan birga qoshlarni; og‘iz sinflari yuqori lab, pastki lab va og‘iz hududining turli kombinatsiyalarini; soch niqobi barcha sochni; “face” niqobi esa bo‘yin, ko‘z, burun, og‘iz va quloqlar bundan mustasno holda yuz terisini yopadi.
Bu amal modelga qisman ko‘rinib turgan ko‘z yoki lab qoldirmagani sabab rekonstruksiya muammosi noaniq bo‘lib qoladi. Bir xil ko‘rinib turgan yuz atrofiga mos kelishi mumkin bo‘lgan ko‘plab ko‘z, lab yoki soch shakllari mavjud. Demak, yaratilgan tasvir vizual jihatdan ishonarli bo‘lishi yashirilgan asl komponent aynan qayta tiklanganini anglatmaydi.
Qaysi sun’iy intellekt modellari ko‘rib chiqildi?
Tadqiqotchilar avvalgi tasvirni to‘ldirish adabiyotidan turli arxitektura oilalarini ifodalovchi usullarni tanlaganlar. Ular orasida GAN asosidagi, Transformer asosidagi, latent tasvirga tayanuvchi va diffuziya asosidagi tizimlar mavjud.
| Model | Asosiy o‘lcham ma’lumoti | Tadqiqotdagi roli |
|---|---|---|
| MI-GAN | 256 | Mobil qurilmalar uchun ishlab chiqilgan yengil tasvirni to‘ldirish modeli. |
| Latent-based | 256 | Diskret latent kodlarga asoslangan ko‘plikka yo‘naltirilgan tasvirni to‘ldirish yondashuvi. |
| CMT | 256 | Continuous-Mask-Aware Transformer yondashuvi. |
| MAT | 256 va 512 | Mask-Aware Transformer; CelebA va FFHQ modellari baholangan. |
| LaMa | 256, 512 va manba jadvallarida 1024 | Fourier convolutions ishlatadigan keng niqobli inpainting yondashuvi. |
| Co-Mod-GAN | 512 va 1024 | Yuqori o‘lchamli tasvirni to‘ldirishda baholangan. |
| MADF | 512 | Mask-aware cascaded refinement yondashuvi. |
| RePaint | Manba model jadvalida 256 | Diffuziya asosidagi usul; yuqori hisoblash xarajati sabab faqat cheklangan namuna bilan baholangan. |
RePaint ning qamrovi boshqa modellardan sezilarli darajada farq qiladi. Tadqiqotchilar bitta tasvirni bitta semantik niqob sinfi bilan to‘ldirish taxminan besh daqiqa davom etishini; 10 ta tasvirni 12 sinf bo‘yicha baholash taxminan 10 soat talab qilishini bildirganlar. Shu sababli RePaint faqat 10 ta tasvirda sinab ko‘rilgan va boshqa usullar bilan bir xil miqyosdagi sonli taqqoslashga kiritilmagan.
Ma’lumotlar to‘plami va semantik segmentatsiya qanday ishlatildi?
Tadqiqotda CelebA-HQ asosidagi taxminan 30.000 ta yuqori sifatli yuz tasviri ishlatilgan. Asl tasvirlar 1024 × 1024 o‘lchamda bo‘lib, model talablariga qarab qayta o‘lchamlangan. Yuz semantik segmentatsiyasida 19 sinfli tuzilma asos qilib olingan.
Tadqiqotning 1-rasmi asl yuz tasviri yonida yuzning semantik qismlarga bo‘lingan ko‘rinishini ko‘rsatadi. Soch, yuz terisi, ko‘zlar/qoshlar, burun, quloqlar, yuqori lab, pastki lab va og‘iz alohida hududlar sifatida kodlangan. Shu tariqa tasodifiy to‘rtburchak yoki cho‘tka izi shaklidagi niqoblar o‘rniga haqiqiy yuz komponentining chegaralarini kuzatuvchi niqoblar ishlab chiqilgan.
| Niqob | Yashiriladigan asosiy komponent |
|---|---|
| A | Ko‘zlar va qoshlar |
| B | Burun |
| C | Yuqori lab + pastki lab + og‘iz |
| D | Pastki lab |
| E | Yuqori lab |
| F | Og‘iz |
| G | Soch |
| H | Quloqlar/tegishli sirg‘a hududi |
| I | Yuz terisi |
| J | Burun + yuqori lab + pastki lab + og‘iz |
| K | Ko‘zlar + burun + lablar + og‘iz |
| L | Yuz terisi + soch + quloqlar |
Verianla Live: Tajribaning asosiy oqimi
| Bosqich | Tadqiqotdagi amal |
|---|---|
| 1. Yuz tasvirlari | CelebA-HQ/CelebAMask-HQ tasvirlari ishlatildi. |
| 2. Semantik segmentatsiya | 19 sinfli yuz segmentatsiyasidan maqsad komponentlar olindi. |
| 3. Niqob yaratish | A–L oralig‘ida 12 ta semantik niqob sinfi ta’riflandi. |
| 4. Oldindan o‘qitilgan model taqqoslash | Turli GAN, Transformer, latent va diffuziya asosidagi modellar baholandi. |
| 5. O‘lcham taqqoslash | Model qo‘lloviga qarab 256, 512 va 1024 o‘lchamlar ko‘rib chiqildi. |
| 6. MAT qayta o‘qitish | Tasodifiy, semantik va aralash niqoblar bilan uchta alohida o‘qitish bajarildi. |
| 7. Statistik validatsiya | 6000 ta tasvirdan yaratilgan bootstrap quyi namunalari bilan FID farqlari sinovdan o‘tkazildi. |
FID, P-IDS va U-IDS nimani o‘lchaydi?
Tadqiqotchilar piksel darajasidagi PSNR va SSIM o‘rniga Inception xususiyatlar fazosiga asoslangan idrok metrikalarini tanlaganlar. Eng asosiy o‘lchov Fréchet Inception Distance (FID) qiymatidir. FID haqiqiy va yaratilgan tasvir taqsimotlarining xususiyatlar fazosidagi farqini solishtiradi va tadqiqotda pastroq FID yaxshiroq natija sifatida baholangan:
\[ FID(p_r,p_g)=\|\mu_r-\mu_g\|_2^2+ Tr\left(\Sigma_r+\Sigma_g-2(\Sigma_r\Sigma_g)^{1/2}\right) \]
Bu yerda \(\mu_r\) va \(\mu_g\) haqiqiy va yaratilgan tasvir xususiyatlarining o‘rtachalarini; \(\Sigma_r\) va \(\Sigma_g\) esa kovariatsiya matritsalarini ifodalaydi.
Maqola P-IDS va U-IDS o‘lchovlaridan ham foydalanadi. Biroq manbada muhim metodologik nomuvofiqlik mavjud. Berilgan tenglamalar bu o‘lchovlarni haqiqiy va yaratilgan tasvir xususiyatlari o‘rtasidagi kvadrat masofalarning o‘rtachasi sifatida yozadi:
\[ P\text{-}IDS=\frac{1}{N}\sum_{i=1}^{N}\|f(x_i)-f(x'_i)\|_2^2 \]
\[ U\text{-}IDS=\frac{1}{N}\sum_{i=1}^{N}\|f_u(x_i)-f_u(x'_i)\|_2^2 \]
Bu tenglama shaklida kichikroq masofa yaqinroq xususiyat mosligini anglatadi. Ammo tadqiqotning 4-jadval izohi va natija talqinlari P-IDS/U-IDS uchun yuqoriroq qiymatlarni eng yaxshi ishlash sifatida tartiblaydi. Manba bu yo‘nalish farqini izohlamagani sabab, bu yerda P-IDS va U-IDS natijalari mualliflar xabar qilgan shaklda beriladi, ammo metrika yo‘nalishi mustaqil ravishda qat’iy aniqlanmaydi.
256 o‘lchamda qaysi modellar ajralib turdi?
256 × 256 o‘lchamda FID bo‘yicha MI-GAN 12 ta semantik niqob sinfining 10 tasida eng yaxshi uchlikka kirgan va to‘rtta sinfda eng yaxshi qiymatni bergan. Latent-based model to‘qqiz sinfda eng yaxshi uchlikka kirgan va oltita sinfda eng yaxshi FID qiymatini bergan. MAT esa sakkiz niqob sinfida eng yaxshi uchlik orasida bo‘lgan.
Tadqiqotning o‘z P-IDS talqiniga ko‘ra MI-GAN barcha niqob sinflarida eng yuqori P-IDS qiymatini bergan; U-IDS bo‘yicha esa 10 ta sinfda eng yuqori natijani ko‘rsatgan. Biroq yuqorida qayd etilgan P-IDS/U-IDS yo‘nalishiga oid tenglama–talqin nomuvofiqligi sabab bu tartib FID natijalari kabi qat’iy talqin qilinmasligi kerak.
512 o‘lchamda vizual xatolar nimalar edi?
512 × 512 taqqoslashda MAT ning FFHQ modeli FID bo‘yicha 12 ta niqob sinfining barchasida eng yaxshi uch model orasiga kirgan va yettita sinfda eng yaxshi FID qiymatini bergan. CelebA asosidagi MAT modeli 11 ta sinfda eng yaxshi uchlikka kirgan.
Biroq tadqiqotning 2-rasmidagi vizual misollar sonli ballarning o‘zi yetarli emasligini ko‘rsatadi. Tadqiqotchilar LaMa va MADF ko‘zlarni tiklashda xira yoki bir-biriga aralashgan ko‘zlar hosil qilishi mumkinligini; LaMa ayrim burun niqoblarida kichik burun va ikki og‘izga o‘xshash tuzilma yaratishi mumkinligini; MAT ayrim yuz niqoblarida kipriklarni qalinlashtirishini; Co-Mod-GAN burun atrofida ko‘rinadigan chegaralar qoldirishi mumkinligini; MADF esa ayrim namunalarda qo‘shimcha ko‘z yoki lablar ustiga chiqib ketgan tishlar yaratishi mumkinligini bildirganlar.
1024 o‘lchamda Co-Mod-GAN va LaMa o‘rtasidagi farq
1024 × 1024 baholashda faqat Co-Mod-GAN va LaMa taqqoslangan. FID bo‘yicha Co-Mod-GAN 12 ta semantik niqob sinfining 11 tasida LaMa dan pastroq qiymat olgan. Yagona istisno yuqori lab niqobi E bo‘lib, bunda LaMa ning FID qiymati 0,37, Co-Mod-GAN ning qiymati 0,72.
Verianla Live: 1024 o‘lchamda tanlangan murakkab niqoblarda FID
Pastroq FID yaxshiroq taqsimot o‘xshashligini anglatadi. Ushbu vizualizatsiya ayniqsa katta yoki strukturaviy jihatdan murakkab semantik hududlarni ko‘rsatadi.
| Niqob sinfi | Co-Mod-GAN FID | LaMa FID |
|---|---|---|
| G — Soch | 11,60 | 41,85 |
| I — Yuz | 11,24 | 33,61 |
| J — Burun + og‘iz hududi | 3,93 | 9,20 |
| K — Ko‘z + burun + og‘iz hududi | 6,23 | 18,58 |
| L — Yuz + soch + quloqlar | 65,73 | 206,07 |
3-rasmda LaMa ning 256, 512 va 1024 o‘lchamdagi namunalari yonma-yon ko‘rsatilgan va o‘lcham oshgani sari ayrim yuz komponentlarida sezilarli buzilishlar ko‘rinishi mumkin. 4-rasmda esa Co-Mod-GAN ning 512 va 1024 chiqishlari bir-biriga yaqinroq ko‘rinadi. Bu kuzatuv manba mualliflarining Co-Mod-GAN ni yuqori o‘lcham uchun samaraliroq model sifatida baholashiga asos bo‘lgan.
Shunga qaramay, usul matnida “LaMa yuqori o‘lchamda samarasiz deb topilgani sabab 512 va 256 da baholandi” degan ma’nodagi jumla bor, ammo keyingi bo‘lim, 5-jadval va 3-rasm 1024 LaMa natijalarini aniq ko‘rsatadi. Bu manba ichidagi ziddiyat yechilmasdan saqlanishi kerak.
Qaysi yuz komponentlari modellar uchun muammoliroq?
Natijalar bitta model barcha yuz hududlarida ishonchli ustunlik ko‘rsatmasligini ochib beradi. Manba tadqiqotining model bo‘yicha vizual tahlilida quyidagi xato turlari qayd etilgan:
- Ko‘z: haddan tashqari qalin kiprik, qora ko‘z, ko‘z qorachig‘i hizasi yoki rang nomuvofiqligi, xira yoki aralashgan ko‘z tuzilishi.
- Og‘iz va lablar: lablarning qo‘shilib ketishi, realistik bo‘lmagan yoki darz ketgan tishlar, tishlarning lab ustiga chiqib ketishi, pastki lab hizasi va rang muammolari.
- Yuz terisi: niqob chegaralarining ko‘rinishi, teri rangi farqi, yuzning qisqarishi/ingichkalashishi, aksga o‘xshash tuzilmalar.
- Soch: tabiiy bo‘lmagan oqim, rang davomiyligining yo‘qolishi, bo‘lak-bo‘lak soch hosil bo‘lishi yoki niqobdagi ayrim hududlarning fon/quloq bilan to‘ldirilishi.
- Quloq: yetishmayotgan quloq yoki quloq hududining soch bilan almashtirilishi.
- Burun: ko‘plab modellarda nisbatan muvaffaqiyatli bo‘lsa-da ayrim hollarda yetishmayotgan, kichik yoki chegarasi aniq rekonstruksiya.
Qo‘shimcha A1-rasm ko‘z, og‘iz/lab, yuz va burun+og‘iz kombinatsiyalarining kattalashtirilgan kesimlarini model bo‘yicha taqqoslaydi. Bu yaqin ko‘rinish to‘liq tasvirda sezish qiyin bo‘lgan kiprik qalinligi, lab–tish qo‘shilishi va rang o‘tishi kabi nuqsonlarni aniqroq ko‘rsatadi.
Tadqiqot Usuli va Natijalari
Tajriba apparati
| Komponent | Tadqiqotda bildirilgan xususiyat |
|---|---|
| GPU | 2 × NVIDIA A800 Active |
| GPU xotirasi | Har bir GPU uchun 40 GB |
| CUDA | 12.0 |
| CPU | Intel Xeon w9-3495X |
| CPU yadrosi | 56 yadro, 1,9–4,8 GHz |
| RAM | 256 GB |
| Saqlashdan foydalanish | 286 GB |
Model ishlash vaqtlari
Tadqiqot RePaint dan tashqari usullar bitta tasvirni 0,3 soniyadan kam vaqtda to‘ldira olishini bildiradi. 6-jadvalga ko‘ra 2000 ta tasvirni qayta ishlash vaqtlari quyidagicha:
| Model | Manba 6-jadvalda bildirilgan vaqt |
|---|---|
| MAT | 256: 3 daq; 512: 5 daq |
| Co-Mod-GAN | 512: 1 daq; 1024: 2 daq |
| MADF | 512 ustunida 6 daq |
| CMT | 512 ustunida 1 daq |
| Latent-based | 512 ustunida 10 daq |
| MI-GAN | 512 ustunida 2 daq |
| LaMa | 256: 0,5–1 daq; 512: 1,5 daq; 1024: 5 daq |
| RePaint | 512 ustunida taxminan 5 daq/tasvir |
Bu yerda manba ichidagi o‘lcham nomuvofiqligi mavjud. Model tanlovi 1-jadval CMT, Latent-based, MI-GAN va RePaint uchun 256 o‘lchamni bildiradi, hisoblash vaqti 6-jadval esa ushbu modellarning vaqtlarini 512 × 512 ustuniga joylashtiradi. Maqola buning sababini tushuntirmaydi; shu sababli vaqt jadvali yuqorida manbada ko‘ringan tarzda berilgan.
MAT nega qayta o‘qitildi?
512 o‘lchamdagi taqqoslashlarda kuchli natija bergan MAT semantik niqob muammosi uchun uchta alohida o‘qitish strategiyasini taqqoslashda ishlatilgan:
- Faqat tasodifiy niqoblar bilan o‘qitish,
- Faqat semantik niqoblar bilan o‘qitish,
- Tasodifiy va semantik niqoblar birgalikda ishlatiladigan aralash o‘qitish.
MAT modeli har bir tajribada noldan boshlangan. O‘qitishda 24.000 ta tasvir, testda 6000 ta tasvir ishlatilgan. Adam optimizer ning o‘rganish tezligi \(1\times10^{-4}\), \(\beta_1=0.9\) va \(\beta_2=0.999\) deb belgilangan; batch size 8 va o‘qitish muddati 100 epoch qilib qo‘llangan. Batch hajmi har bir GPU uchun mavjud 40 GB xotira chegarasi sabab 8 bilan cheklangan.
Standart data augmentation sifatida tasodifiy gorizontal ag‘darish va burish ishlatilgan, qo‘shimcha rang jitter yoki boshqa geometrik transformatsiya qo‘llanmagan. Har bir o‘qitish sessiyasi taxminan 7 kun 13 soat davom etgani bildirilgan.
Nega tasodifiy niqob faqat semantik niqobdan yaxshiroq chiqdi?
Dastlabki qayta o‘qitish natijasida, test semantik niqoblar bilan o‘tkazilganiga qaramay faqat tasodifiy niqoblar bilan o‘qitilgan MAT modeli faqat semantik niqoblar bilan o‘qitilgan MAT ga qaraganda umuman pastroq FID bergan. Mualliflar buni tasodifiy niqoblar ancha xilma-xil yo‘qolgan hududlar yaratishi va modelni butun tasvirdagi kontekstual bog‘lanishlarni o‘rganishga majbur qilishi bilan izohlaydilar.
Bu tushuntirish tadqiqot tomonidan taklif etilgan talqindir. Tadqiqot overfitting mekanizmini alohida tajribalar bilan bevosita o‘lchamagan; shuning uchun “tasodifiy niqob albatta overfitting ni kamaytiradi” degan sababiy umumlashtirish qilinmasligi kerak.
Aralash niqob strategiyasining FID natijalari
| Niqob | Tasodifiy o‘qitish FID | Semantik o‘qitish FID | Aralash o‘qitish FID |
|---|---|---|---|
| A | 1,46 | 1,78 | 1,25 |
| B | 0,93 | 0,95 | 0,93 |
| C | 2,01 | 3,73 | 1,59 |
| D | 0,75 | 1,20 | 0,71 |
| E | 0,74 | 1,40 | 0,56 |
| F | 2,36 | 2,05 | 1,24 |
| G — Soch | 12,51 | 17,38 | 7,10 |
| H | 3,90 | 3,91 | 3,33 |
| I — Yuz | 8,16 | 9,25 | 5,69 |
| J | 2,46 | 4,00 | 2,20 |
| K | 3,56 | 5,00 | 3,03 |
| L — Yuz + soch + quloqlar | 115,51 | 114,35 | 130,82 |
Aralash o‘qitish A, C, D, E, F, G, H, I, J va K sinflarida ikkala yakka strategiyadan ham pastroq FID bergan. B sinfida tasodifiy o‘qitish bilan bir xil FID qiymati 0,93 olingan. Eng keng niqob L sinfida esa aralash o‘qitish FID si 130,82 ga ko‘tarilgan va tasodifiy hamda semantik o‘qitishdan yomonroq bo‘lgan. Shu sababli natijani “aralash usul har doim ustun” deb umumlashtirib bo‘lmaydi.
Bootstrap validatsiyasi nimani ko‘rsatdi?
Tadqiqotchilar FID farqlari faqat ma’lum test namunalaridan kelib chiqadimi yoki yo‘qmi tekshirish uchun 6000 ta tasvirdan iborat test to‘plamidan bootstrap tahlili o‘tkazganlar. Har bir baholashda 1000 ta noyob tasvir tanlangan va jarayon 100 marta takrorlangan. Bir xil tasvir bitta bootstrap namunasida takrorlanmagan, biroq turli bootstrap namunalarida yana uchrashi mumkin bo‘lgan.
Qo‘shimcha A2-jadvalda aralash niqobli o‘qitish A, C, D, E, F, G, I, J va K niqob sinflarida ham tasodifiy, ham semantik o‘qitishdan pastroq FID bergani va farqlar p<0,01 darajada statistik ahamiyatli ekani ko‘rsatilgan. B va H uchun bu ikki tomonlama ahamiyat belgilanmagan; L sinfida aralash yondashuv yomonroq FID bergan.
| Tanlangan niqob | Tasodifiy FID, o‘rtacha ± SS | Semantik FID, o‘rtacha ± SS | Aralash FID, o‘rtacha ± SS | Manba natijasi |
|---|---|---|---|---|
| C — To‘liq og‘iz/lab | 2,03 ± 0,05 | 3,76 ± 0,09 | 1,60 ± 0,04 | Aralash, ikkalasidan p<0,01 pastroq. |
| G — Soch | 12,66 ± 0,33 | 17,43 ± 0,42 | 7,15 ± 0,21 | Aralash, ikkalasidan p<0,01 pastroq. |
| I — Yuz | 8,22 ± 0,21 | 9,30 ± 0,24 | 5,71 ± 0,15 | Aralash, ikkalasidan p<0,01 pastroq. |
| L — Yuz + soch + quloq | 116,10 ± 3,23 | 114,90 ± 3,19 | 131,45 ± 3,51 | Aralash yondashuv ustun emas. |
Vizual misollar aralash yondashuvni qanday ko‘rsatadi?
5-rasmda tasodifiy, semantik va aralash niqob bilan o‘qitilgan MAT modellarining yuz, soch va to‘liq og‘iz/lab tiklashlari yonma-yon ko‘rsatilgan. Mualliflarning vizual bahosiga ko‘ra tasodifiy niqob bilan o‘qitilgan model yuz rangini atrofga yaxshiroq aralashtira olsa-da, yuz geometriyasi qisqa va nomuvofiq ko‘rinishi mumkin. Semantik o‘qitish yuz shakliga yaqinroq bo‘lishi mumkin, ammo teri rangi atrof bilan mos kelmasligi mumkin. Aralash o‘qitish ushbu ikki xato turi o‘rtasida muvozanatliroq natija bergan.
Sochda tasodifiy o‘qitish soch oqimida, semantik o‘qitish esa rang davomiyligida muammo berishi mumkin bo‘lsa, aralash strategiya ikki xususiyatni yaxshiroq muvozanatlashtirgan. Og‘iz misolida ham aralash o‘qitish vizual jihatdan qolgan ikki strategiyadan yaxshiroq ko‘rsatilgan. Biroq bular tanlangan vizual misollardir; tadqiqot mustaqil inson baholovchilari bilan ko‘r qilinadigan idrok foydalanuvchi tadqiqotini taqdim etmaydi.
Tadqiqot ta’riflagan strukturaviy cheklovlar
Tadqiqotchilar faqat o‘qitish ma’lumotini o‘zgartirish bilan muammoni to‘liq hal qilib bo‘lmasligini va mavjud arxitekturalarda strukturaviy chegaralar borligini ta’kidlaydilar:
- Mahalliy receptive field va convolutional bias: To‘liq semantik niqob CNN/GAN modellar foydalanishi mumkin bo‘lgan mahalliy ishoralarni butunlay yo‘q qilishi mumkin.
- Zaif global va semantik mulohaza: Transformer va diffuziya modellari keng kontekstni modellashtira olsa-da tasvirdagi anatomik komponentlar o‘rtasidagi aniq strukturaviy munosabatni har doim saqlay olmaydi.
- Cheklangan strukturaviy priorlar: Modellar yuz anatomiyasini ochiq qoidalar ko‘rinishida bilmaydi; asosan o‘qitish ma’lumotlaridagi statistik bog‘lanishlarni o‘rganadi.
- Noaniqlik: To‘liq ko‘rinmaydigan komponent uchun vizual jihatdan maqbul bir nechta yechim bo‘lishi mumkin.
Mualliflar kelajakda yuz komponentlarini ochiq modellashtiradigan, yuz geometriyasi va komponent bog‘liqligini hisobga oladigan arxitekturalarni; adaptiv niqob o‘qitish va komponentga xos loss funksiyalarini o‘rganishni tavsiya qiladilar.
Tadqiqot nimani isbotlamaydi?
- Niqob ostida bo‘lgan asl ko‘z, og‘iz, burun yoki soch identiklik jihatidan to‘g‘ri tarzda qayta tiklanishi mumkinligini isbotlamaydi.
- Yaratilgan yuz komponentlari anatomik jihatdan tibbiy rekonstruksiya uchun ishonchli ekanini isbotlamaydi.
- Tadqiqot haqiqiy bemor, travma, kuyish yoki jarrohlik yuz rekonstruksiyasi ma’lumotlaridan foydalanmaydi.
- Maxfiylikni himoya qilish yoki yuzni tanish tizimlarida haqiqiy identiklikni saqlash muvaffaqiyatini o‘lchamaydi.
- Aralash niqob yondashuvi barcha niqoblarda yoki barcha inpainting arxitekturalarida ustun ekanini ko‘rsatmaydi.
- Past FID inson ko‘zi yoki identiklikni saqlash nuqtayi nazaridan mukammal natija degani ekanini ko‘rsatmaydi.
- RePaint boshqa modellar bilan teng namuna soni va hisoblash budjeti ostida taqqoslanmagani sabab diffuziya modellari umuman yomonroq degan xulosani qo‘llab-quvvatlamaydi.
Manba va Usul Haqida Izoh
| To‘liq asl tadqiqot nomi | Evaluating AI-Based Image Inpainting Techniques for Facial Components Restoration Using Semantic Masks |
|---|---|
| Mualliflar | Hussein Sharadga; Abdullah Hayajneh; Erchin Serpedin |
| Teng hissa | Manbada teng birinchi/teng hissa bayonoti ko‘rsatilmagan. |
| Mas’ul muallif | Hussein Sharadga |
| Muassasalar | School of Engineering, Texas A&M International University, AQSh; King Abdullah II School of Engineering, Princess Sumaya University for Technology, Iordaniya; Department of Electrical and Computer Engineering, Texas A&M University, AQSh. |
| Manba turi | Taqrizdan o‘tgan tadqiqot maqolasi; qiyosiy sun’iy intellekt/tasvirni qayta ishlash benchmark va qayta o‘qitish tadqiqoti. |
| Taqriz holati | Taqrizdan o‘tgan jurnalda chop etilgan maqola; preprint emas. |
| Jurnal | AI |
| Nashriyot | MDPI |
| Jild / son / maqola | 2026, 7(4), 119 |
| DOI | 10.3390/ai7040119 |
| Qabul / reviziya / qabul qilish / nashr | 8-fevral 2026 / 12-mart 2026 / 23-mart 2026 / 30-mart 2026 |
| Rasmiy havola | https://doi.org/10.3390/ai7040119 |
| Litsenziya | Creative Commons Attribution (CC BY). |
Moliyalashtirish, ma’lumotlar va manfaatlar to‘qnashuvi
Mualliflar tadqiqot tashqi moliyalashtirish olmaganini bildirganlar. Maqolani qayta ishlash to‘lovi Texas A&M International University tomonidan qoplangani ko‘rsatilgan. Mualliflar manfaatlar to‘qnashuvi yo‘qligini e’lon qilganlar.
Tadqiqotda ishlatilgan yuz tasvirlari ommaga ochiq CelebAMask-HQ ma’lumotlar to‘plamidan olingan va manba tadqiqot bu to‘plam faqat notijorat tadqiqot maqsadida ishlatilganini bildiradi. Mualliflar xom yuz tasvirlarini qayta tarqatish huquqiga ega emasliklarini aytadilar.
Generativ sun’iy intellektdan foydalanish bayonoti
Manba tadqiqotning minnatdorchilik bo‘limida mualliflar maqolaning o‘qilishini yaxshilash maqsadida ChatGPT ning “GPT-5 mini, free version” versiyasidan foydalanganlarini; keyin mazmunni o‘zlari ko‘rib chiqib tahrir qilganlarini va chop etilgan matn uchun mas’uliyatni o‘z zimmalariga olganlarini bildirganlar. Bu bayon tadqiqotning eksperimental tasvirni to‘ldirish natijalari ChatGPT tomonidan yaratilgan degani emas.
Muallif hissalari
Konseptualizatsiyaga uchala muallif ham hissa qo‘shgan. Metodologiya, dasturiy ta’minot, ma’lumotlar kuratsiyasi va loyiha boshqaruvi Hussein Sharadga va Abdullah Hayajneh tomonidan bajarilgan; validatsiya va tadqiqot ishlarida uchala muallif ham qatnashgan. Asl qoralama Hussein Sharadga va Abdullah Hayajneh tomonidan tayyorlangan; uchala muallif ham ko‘rib chiqish va tahrirlash jarayoniga hissa qo‘shgan.
Manba ichidagi nomuvofiqliklar qaydi
- P-IDS va U-IDS tenglamalari masofa o‘lchovi ko‘rinishida ta’riflangan bo‘lsa, jadvallar va matn yuqori qiymatni yaxshiroq ishlash sifatida talqin qiladi. Manba bu farqni izohlamaydi.
- Usul matni LaMa yuqori o‘lchamda samarasiz deb topilgani sabab 256 va 512 da baholanganini aytadi, biroq keyinchalik 1024 LaMa natijalari beriladi.
- Model 1-jadval CMT, Latent-based, MI-GAN va RePaint uchun 256 o‘lchamni bildiradi, hisoblash vaqti 6-jadval esa bu modellarning vaqtlarini 512 × 512 ustunida ko‘rsatadi.
Asosiy cheklovlar
- Natijalar bitta asosiy yuz ma’lumotlar to‘plami oilasiga asoslangan.
- Klinik yoki travmatik yuz rekonstruksiyasi ma’lumotlar to‘plami ishlatilmagan.
- Har bir model bir xil o‘lchamlarda va bir xil hisoblash budjeti bilan sinovdan o‘tkazilmagan.
- RePaint faqat 10 ta tasvirda cheklangan tarzda baholangan.
- Vizual sifat baholari uchun mustaqil, ko‘r qilingan inson baholovchi tadqiqoti taqdim etilmagan.
- FID taqsimotga asoslangan idrok o‘xshashligi o‘lchovidir; asl shaxsning haqiqiy yo‘qolgan yuz komponenti qayta yaratilganini isbotlamaydi.
- Eng keng L semantik niqob sinfida aralash o‘qitish yomonroq FID hosil qilgan.
- Manbada P-IDS/U-IDS metrika yo‘nalishiga oid ta’rif va talqin nomuvofiqligi mavjud.
Tadqiqotning eng kuchli natijasi to‘liq yashirilgan semantik yuz komponentlari mavjud tasvirni to‘ldirish modellari uchun hanuz qiyin muammo bo‘lib qolayotgani va niqob xilma-xilligi o‘qitish ishlashiga sezilarli ta’sir ko‘rsatishi mumkinligidir. Aralash tasodifiy–semantik o‘qitish strategiyasi ko‘plab yuz komponentlarida FID ni yaxshilagan bo‘lsa-da, tadqiqot mukammal yuz rekonstruksiyasiga erishilganini emas, aksincha bu hanuz ochiq tadqiqot muammosi ekanini ko‘rsatadi.

Izoh qoldiring
E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan