Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / Semantik Maskalardan İstifadə Edərək Üz Komponentlərinin Bərpasında Süni İntellekt Əsaslı Görüntü Tamamlama Texnikalarının Qiymətləndirilməsi
Kompüter Elmləri

Semantik Maskalardan İstifadə Edərək Üz Komponentlərinin Bərpasında Süni İntellekt Əsaslı Görüntü Tamamlama Texnikalarının Qiymətləndirilməsi

Bu araşdırma göz, burun, ağız, saç və ya üz dərisi kimi üz komponenti semantik maska ilə tamamilə gizlədildikdə müasir süni intellekt əsaslı görüntü tamamlama (image inpainting) üsullarının çatışmayan sahəni nə dərəcədə yenidən yarada bildiyini müqayisə edir.

19/08/2026  Veri Anla 36 baxış
Semantik Maskalardan İstifadə Edərək Üz Komponentlərinin Bərpasında Süni İntellekt Əsaslı Görüntü Tamamlama Texnikalarının Qiymətləndirilməsi

Bu araşdırma göz, burun, ağız, saç və ya üz dərisi kimi üz komponenti semantik maska ilə tamamilə gizlədildikdə müasir süni intellekt əsaslı görüntü tamamlama (image inpainting) üsullarının çatışmayan sahəni nə dərəcədə yenidən yarada bildiyini müqayisə edir. CelebA-HQ/CelebAMask-HQ üz təsvirləri və 12 müxtəlif semantik maska sinfindən istifadə etməklə MI-GAN, Latent-based, CMT, MAT, LaMa, Co-Mod-GAN, MADF və məhdud miqyasda RePaint kimi fərqli arxitektura ailələri qiymətləndirilib. Tədqiqatın ikinci mərhələsində MAT modeli 24.000 təlim görüntüsü ilə təsadüfi, semantik və bu iki maska tipini birləşdirən qarışıq strategiyalar altında sıfırdan yenidən öyrədilib və 6000 görüntü üzərində sınaqdan keçirilib. Qarışıq maska təlimi FID baxımından 12 semantik maska sinfinin 10-da ən aşağı dəyəri verib; bir sinifdə təsadüfi maska ilə eyni nəticə əldə edib, ən geniş birləşik maska sinfində isə daha zəif performans göstərib. Buna baxmayaraq tədqiqat tamamilə örtülmüş üz komponentlərinin qüsursuz və ya orijinal şəxsə identiklik baxımından düzgün şəkildə bərpa edilə bildiyini göstərmir.

Araşdırmanın əsas çətinliyi təsadüfi maskalarla semantik maskalar arasındakı informasiya fərqidir. Təsadüfi maska gözün, dodağın və ya saç bölgəsinin yalnız bir hissəsini örtə bilər və model qalan piksel quruluşundan faydalana bilər. Semantik maska isə hədəf komponentin tamamını aradan qaldıraraq lokal struktur ipuclarını yox edir. Bu halda model görünməyən sahəni yalnız ətrafdakı üz həndəsəsi, tekstura, simmetriya və təlim zamanı öyrəndiyi statistik əlaqələr əsasında proqnozlaşdırmaq məcburiyyətində qalır.

Tədqiqatın vizual təcrübələri bu fərqin yalnız metriklərdə deyil, yaradılmış üzlərdə də ortaya çıxdığını göstərir. Modellər qalın və ya qara kirpiklər, yanlış hizalanmış göz bəbəkləri, birləşmiş dodaq və dişlər, nəzərə çarpan maska sərhədləri, dəyişən dəri tonları, qeyri-real saç axını, çatışmayan qulaqlar və ya bəzi hallarda əlavə göz kimi struktur xətaları yarada bilər. Buna görə aşağı FID dəyəri təkbaşına anatomik və ya identiklik baxımından qüsursuz rekonstruksiya demək deyil.

Təcrübə elementiTədqiqatda istifadə olunan quruluşŞərh sərhədi
Əsas məlumat dəstiTəxminən 30.000 CelebA-HQ üz görüntüsü, 1024 × 1024Klinik xəstə və ya travma məlumat dəsti deyil.
Semantik maska sinfi12 sinif (A–L)Müəyyən edilmiş üz komponentləri tamamilə gizlədilir.
Qiymətləndirilən çözünürlüklər256, 512 və 1024Hər model bütün çözünürlüklərdə qiymətləndirilməyib.
Əsas metriklərFID, P-IDS, U-IDSP-IDS/U-IDS istiqaməti barədə mənbədə tərif–şərh uyğunsuzluğu var.
MAT yenidən təlimi24.000 təlim + 6000 test görüntüsü512 × 512 çözünürlükdə həyata keçirilib.
Maska təlim strategiyalarıTəsadüfi, semantik, qarışıqQarışıq yanaşma əksər, lakin bütün maska siniflərində üstün deyil.

Görüntü tamamlama problemi niyə semantik maskalarda çətinləşir?

Görüntü tamamlama təsvirin çatışmayan və ya gizlənmiş sahəsinin ətrafdakı məlumatdan istifadə etməklə süni şəkildə yenidən qurulmasıdır. İnsan üzlərində bu vəzifə xüsusilə çətindir; çünki gözlərin bir-birinə nisbətən mövqeyi, burun–ağız həndəsəsi, çənə quruluşu, saç axını, dəri tonu və üz simmetriyası kimi çoxsaylı əlaqəli xüsusiyyətlər var.

Tədqiqatda istifadə edilən semantik maskalar təsadüfi formalı boşluqlardan fərqlənir. Maskalar müəyyən anatomik/vizual komponentin segmentasiya etiketindən istifadə etməklə həmin komponentin tamamını gizlədir. Məsələn, göz maskası gözlərlə birlikdə qaşları; ağız sinifləri üst dodaq, alt dodaq və ağız sahəsinin müxtəlif kombinasiyalarını; saç maskası saçın tamamını; “face” maskası isə boyun, göz, burun, ağız və qulaqlar istisna olmaqla üz dərisini örtür.

Bu əməliyyat modelə qismən görünən göz və ya dodaq saxlamadığı üçün rekonstruksiya problemi qeyri-müəyyənləşir. Eyni görünən üz ətrafına uyğun ola biləcək çoxsaylı mümkün göz, dodaq və ya saç forması mövcuddur. Buna görə yaradılan təsvirin vizual baxımdan inandırıcı olması gizlədilən orijinal komponentin həqiqətən eynisinin geri gətirildiyi demək deyil.

Hansı süni intellekt modelləri araşdırılıb?

Araşdırmaçılar əvvəlki görüntü tamamlama ədəbiyyatından fərqli arxitektura ailələrini təmsil edən üsulları seçiblər. Bunlara GAN əsaslı, Transformer əsaslı, latent təsvirə söykənən və diffuziya əsaslı sistemlər daxildir.

ModelƏsas çözünürlük məlumatıTədqiqatdakı rolu
MI-GAN256Mobil cihazlar üçün hazırlanmış yüngül görüntü tamamlama modeli.
Latent-based256Diskret latent kodlara əsaslanan plüralist görüntü tamamlama yanaşması.
CMT256Continuous-Mask-Aware Transformer yanaşması.
MAT256 və 512Mask-Aware Transformer; CelebA və FFHQ modelləri qiymətləndirildi.
LaMa256, 512 və mənbə cədvəllərində 1024Fourier convolutions istifadə edən geniş maskalı inpainting yanaşması.
Co-Mod-GAN512 və 1024Yüksək çözünürlüklü görüntü tamamlamada qiymətləndirildi.
MADF512Mask-aware cascaded refinement yanaşması.
RePaintMənbə model cədvəlində 256Diffuziya əsaslı üsul; yüksək hesablama xərci səbəbilə yalnız məhdud nümunə ilə qiymətləndirildi.

RePaint-in əhatəsi digər modellərdən açıq şəkildə fərqlənir. Araşdırmaçılar bir görüntünü bir semantik maska sinfi ilə tamamlamağın təxminən beş dəqiqə çəkdiyini; 10 görüntünün 12 sinif üzrə qiymətləndirilməsinin təxminən 10 saat tələb etdiyini bildiriblər. Buna görə RePaint yalnız 10 görüntü üzərində sınaqdan keçirilib və digər üsullarla eyni miqyaslı kəmiyyət müqayisəsinə daxil edilməyib.

Məlumat dəsti və semantik segmentasiya necə istifadə edildi?

Araşdırmada CelebA-HQ əsaslı təxminən 30.000 yüksək keyfiyyətli üz görüntüsündən istifadə edilib. Orijinal görüntülər 1024 × 1024 çözünürlükdədir və model tələblərinə uyğun olaraq yenidən ölçüləndirilib. Üz semantik segmentasiyasında 19 sinifli quruluş əsas götürülüb.

Tədqiqatın Şəkil 1-i orijinal üz görüntüsünün yanında üzün semantik olaraq hissələrə bölündüyü görünüşü göstərir. Saç, üz dərisi, gözlər/qaşlar, burun, qulaqlar, üst dodaq, alt dodaq və ağız fərqli sahələr kimi kodlanıb. Beləliklə təsadüfi düzbucaqlı və ya fırça izi formalı maskalar əvəzinə real üz komponentinin sərhədlərini izləyən maskalar yaradıla bilib.

MaskaGizlədilən əsas komponent
AGözlər və qaşlar
BBurun
CÜst dodaq + alt dodaq + ağız
DAlt dodaq
EÜst dodaq
FAğız
GSaç
HQulaqlar/əlaqəli sırğa sahəsi
IÜz dərisi
JBurun + üst dodaq + alt dodaq + ağız
KGözlər + burun + dodaqlar + ağız
LÜz dərisi + saç + qulaqlar

Verianla Live: Təcrübənin əsas axını

MərhələTədqiqatdakı əməliyyat
1. Üz görüntüləriCelebA-HQ/CelebAMask-HQ görüntüləri istifadə edildi.
2. Semantik segmentasiya19 sinifli üz segmentasiyasından hədəf komponentlər çıxarıldı.
3. Maska yaratmaA–L arasında 12 semantik maska sinfi müəyyən edildi.
4. Əvvəlcədən öyrədilmiş model müqayisəsiFərqli GAN, Transformer, latent və diffuziya əsaslı modellər qiymətləndirildi.
5. Çözünürlük müqayisəsiModel dəstəyinə görə 256, 512 və 1024 çözünürlüklər araşdırıldı.
6. MAT yenidən təlimiTəsadüfi, semantik və qarışıq maskalarla üç ayrı təlim həyata keçirildi.
7. Statistik doğrulama6000 görüntüdən yaradılan bootstrap alt nümunələri ilə FID fərqləri sınaqdan keçirildi.
 

FID, P-IDS və U-IDS nəyi ölçür?

Araşdırmaçılar piksel səviyyəli PSNR və SSIM əvəzinə Inception xüsusiyyət fəzasına əsaslanan qavrayış metriklərinə üstünlük veriblər. Əsas ölçü Fréchet Inception Distance (FID) dəyəridir. FID real və yaradılmış görüntü paylanmalarının xüsusiyyət fəzasındakı fərqini müqayisə edir və tədqiqatda daha aşağı FID daha yaxşı nəticə hesab edilir:

\[ FID(p_r,p_g)=\|\mu_r-\mu_g\|_2^2+ Tr\left(\Sigma_r+\Sigma_g-2(\Sigma_r\Sigma_g)^{1/2}\right) \]

Burada \(\mu_r\) və \(\mu_g\) real və yaradılmış görüntü xüsusiyyətlərinin ortalamalarını; \(\Sigma_r\) və \(\Sigma_g\) isə kovariasiya matrislərini təmsil edir.

Məqalə həmçinin P-IDS və U-IDS ölçülərindən istifadə edir. Bununla belə mənbədə mühüm metodoloji uyğunsuzluq var. Verilən tənliklər bu ölçüləri real və yaradılmış görüntü xüsusiyyətləri arasındakı kvadratik məsafələrin ortalaması kimi yazır:

\[ P\text{-}IDS=\frac{1}{N}\sum_{i=1}^{N}\|f(x_i)-f(x'_i)\|_2^2 \]

\[ U\text{-}IDS=\frac{1}{N}\sum_{i=1}^{N}\|f_u(x_i)-f_u(x'_i)\|_2^2 \]

Bu tənlik formasında daha kiçik məsafə daha yaxın xüsusiyyət uyğunluğu deməkdir. Lakin tədqiqatın Cədvəl 4 izahı və nəticə şərhləri P-IDS/U-IDS üçün daha yüksək dəyərləri ən yaxşı performans kimi sıralayır. Mənbə bu istiqamət fərqini izah etmədiyi üçün burada P-IDS və U-IDS nəticələri müəlliflərin hesabat verdiyi şəkildə təqdim ediləcək, lakin metrik istiqaməti müstəqil olaraq qəti şəkildə müəyyən edilməyəcək.

256 çözünürlükdə hansı modellər önə çıxdı?

256 × 256 çözünürlükdə FID baxımından MI-GAN 12 semantik maska sinfinin 10-da ilk üçlüyə daxil olub və dörd sinifdə ən yaxşı dəyəri verib. Latent-based model doqquz sinifdə ilk üçə daxil olub və altı sinifdə ən yaxşı FID dəyərini verib. MAT isə səkkiz maska sinfində ilk üç arasında yer alıb.

Tədqiqatın öz P-IDS şərhinə görə MI-GAN bütün maska siniflərində ən yüksək P-IDS dəyərini verib; U-IDS-də isə 10 sinifdə ən yüksək nəticəni göstərib. Bununla belə yuxarıda qeyd edilən P-IDS/U-IDS istiqaməti üzrə tənlik–şərh uyğunsuzluğu səbəbindən bu sıralama FID nəticələri ilə eyni qətiyyətlə şərh edilməməlidir.

512 çözünürlükdə vizual xətalar nələr idi?

512 × 512 müqayisəsində MAT-ın FFHQ modeli FID baxımından 12 maska sinfinin hamısında ilk üç model arasında yer alıb və yeddi sinifdə ən yaxşı FID dəyərini verib. CelebA əsaslı MAT modeli 11 sinifdə ilk üçlüyə daxil olub.

Lakin tədqiqatın Şəkil 2-dəki vizual nümunələri kəmiyyət skorlarının təkbaşına kifayət etmədiyini göstərir. Araşdırmaçılar LaMa və MADF-nin göz bərpalarında bulanıq və ya bir-birinə qarışmış gözlər yarada bildiyini; LaMa-nın bəzi burun maskalarında kiçik burun və ikiqat ağıza bənzər quruluş yarada bildiyini; MAT-ın bəzi üz maskalarında kirpikləri qalınlaşdırdığını; Co-Mod-GAN-ın burun ətrafında görünən sərhədlər buraxa bildiyini; MADF-nin isə bəzi nümunələrdə əlavə göz və ya dodaqların üzərinə daşan dişlər yarada bildiyini bildiriblər.

1024 çözünürlükdə Co-Mod-GAN ilə LaMa arasındakı fərq

1024 × 1024 qiymətləndirməsində yalnız Co-Mod-GAN və LaMa müqayisə edilib. FID baxımından Co-Mod-GAN 12 semantik maska sinfinin 11-də LaMa-dan daha aşağı dəyər əldə edib. Yeganə istisna üst dodaq maskası E-dir; burada LaMa-nın FID dəyəri 0,37, Co-Mod-GAN-ın dəyəri 0,72-dir.

Verianla Live: 1024 çözünürlükdə seçilmiş çətin maskalarda FID

Daha aşağı FID daha yaxşı paylanma oxşarlığını ifadə edir. Bu vizuallaşdırma xüsusilə böyük və ya struktur baxımdan çətin semantik sahələri göstərir.

Maska sinfiCo-Mod-GAN FIDLaMa FID
G — Saç11,6041,85
I — Üz11,2433,61
J — Burun + ağız sahəsi3,939,20
K — Göz + burun + ağız sahəsi6,2318,58
L — Üz + saç + qulaqlar65,73206,07
 

Şəkil 3-də LaMa-nın 256, 512 və 1024 çözünürlükdəki nümunələri yanaşı göstərilir və çözünürlük artdıqca bəzi üz komponentlərində nəzərəçarpacaq pozuntular görünə bilir. Şəkil 4-də isə Co-Mod-GAN-ın 512 və 1024 çıxışları bir-birinə daha yaxın görünür. Bu müşahidə mənbə müəlliflərinin Co-Mod-GAN-ı yüksək çözünürlük üçün daha effektiv model kimi qiymətləndirməsinə əsas verir.

Bununla belə metod mətnində “LaMa yüksək çözünürlükdə təsirsiz tapıldığı üçün 512 və 256-da qiymətləndirildi” mənasına gələn ifadə olmasına baxmayaraq, sonrakı bölmə, Cədvəl 5 və Şəkil 3 açıq şəkildə 1024 LaMa nəticələri təqdim edir. Bu mənbədaxili ziddiyyət həll edilmədən qorunmalıdır.

Hansı üz komponentləri modellər üçün daha problemli idi?

Nəticələr vahid modelin bütün üz sahələrində etibarlı üstünlük göstərmədiyini ortaya qoyur. Mənbə tədqiqatın model əsaslı vizual təhlilində aşağıdakı xəta növləri bildirilib:

  • Göz: həddindən artıq qalın kirpik, qara göz, göz bəbəyi hizası və ya rəng uyğunsuzluğu, bulanıq və ya qarışmış göz quruluşu.
  • Ağız və dodaq: dodaqların birləşməsi, qeyri-real və ya çatlamış dişlər, dişlərin dodağın üzərinə daşması, alt dodaq hizası və rəng problemləri.
  • Üz dərisi: maska sərhədlərinin görünməsi, dəri tonu fərqi, üzün qısalması/incəlməsi, əks olunma bənzəri quruluşlar.
  • Saç: qeyri-təbii axın, rəng davamlılığının itməsi, hissə-hissə saç yaradılması və ya maskadakı bəzi sahələrin fon/qulaqla doldurulması.
  • Qulaq: çatışmayan qulaq və ya qulaq sahəsinin saçla əvəz olunması.
  • Burun: bir çox modeldə nisbətən uğurlu olsa da bəzi hallarda çatışmayan, kiçik və ya sərhədləri görünən rekonstruksiya.

Əlavə Şəkil A1 göz, ağız/dodaq, üz və burun+ağız kombinasiyalarının yaxınlaşdırılmış kəsiklərini model əsasında müqayisə edir. Bu yaxın görünüş tam görüntüdə fərq edilməsi çətin olan kirpik qalınlığı, dodaq–diş birləşməsi və rəng keçidi kimi qüsurları daha aydın göstərir.

Tədqiqatın Metodu və Nəticələri

Təcrübə avadanlığı

KomponentTədqiqatda bildirilən xüsusiyyət
GPU2 × NVIDIA A800 Active
GPU yaddaşıGPU başına 40 GB
CUDA12.0
CPUIntel Xeon w9-3495X
CPU nüvəsi56 nüvə, 1,9–4,8 GHz
RAM256 GB
Yaddaş istifadəsi286 GB

Model işləmə müddətləri

Tədqiqat RePaint istisna olmaqla üsulların bir görüntünü 0,3 saniyədən az müddətdə tamamlaya bildiyini bildirir. Cədvəl 6-ya görə 2000 görüntünün emal müddətləri aşağıdakı kimidir:

ModelMənbə Cədvəl 6-da bildirilən müddət
MAT256: 3 dəq; 512: 5 dəq
Co-Mod-GAN512: 1 dəq; 1024: 2 dəq
MADF512 sütununda 6 dəq
CMT512 sütununda 1 dəq
Latent-based512 sütununda 10 dəq
MI-GAN512 sütununda 2 dəq
LaMa256: 0,5–1 dəq; 512: 1,5 dəq; 1024: 5 dəq
RePaint512 sütununda təxminən 5 dəq/görüntü

Burada mənbədaxili çözünürlük uyğunsuzluğu var. Model seçimi Cədvəl 1 CMT, Latent-based, MI-GAN və RePaint üçün 256 çözünürlük göstərdiyi halda hesablama müddəti Cədvəl 6 bu modellərin müddətlərini 512 × 512 sütununa yerləşdirir. Məqalə bunun səbəbini açıqlamır; buna görə müddət cədvəli yuxarıda mənbədə göründüyü kimi təqdim edilib.

MAT niyə yenidən öyrədildi?

512 çözünürlük müqayisələrində güclü nəticə verən MAT semantik maska problemi üçün üç ayrı təlim strategiyasının müqayisəsində istifadə edilib:

  1. Yalnız təsadüfi maskalarla təlim,
  2. Yalnız semantik maskalarla təlim,
  3. Təsadüfi və semantik maskaların birlikdə istifadə edildiyi qarışıq təlim.

MAT modeli hər təcrübədə sıfırdan başladılıb. Təlimdə 24.000 görüntü, testdə 6000 görüntü istifadə edilib. Adam optimizer-in öyrənmə sürəti \(1\times10^{-4}\), \(\beta_1=0.9\) və \(\beta_2=0.999\) olaraq müəyyən edilib; batch size 8 və təlim müddəti 100 epoch tətbiq edilib. Batch ölçüsü GPU başına mövcud 40 GB yaddaş məhdudiyyətinə görə 8 ilə məhdudlaşdırılıb.

Standart məlumat artırma kimi təsadüfi üfüqi çevirmə və döndürmə istifadə edilib, əlavə rəng jitter və başqa həndəsi transformasiya tətbiq edilməyib. Hər təlim sessiyasının təxminən 7 gün 13 saat davam etdiyi bildirilib.

Təsadüfi maska niyə yalnız semantik maskadan daha yaxşı nəticə verdi?

İlk yenidən təlim nəticəsində semantik maskalarla test aparılmasına baxmayaraq yalnız təsadüfi maskalarla öyrədilmiş MAT modeli yalnız semantik maskalarla öyrədilmiş MAT-dan ümumilikdə daha aşağı FID verib. Müəlliflər bunu təsadüfi maskaların daha müxtəlif itkin sahələr yaratması və modeli görüntünün bütünündəki kontekstual əlaqələri öyrənməyə məcbur etməsi ilə izah edirlər.

Bu izah tədqiqat tərəfindən təklif olunan şərhdir. Araşdırma overfitting mexanizmini ayrıca təcrübələrlə birbaşa ölçməyib; buna görə “təsadüfi maska mütləq overfitting-i azaldır” kimi səbəb-nəticə ümumiləşdirməsi aparılmamalıdır.

Qarışıq maska strategiyasının FID nəticələri

MaskaTəsadüfi təlim FIDSemantik təlim FIDQarışıq təlim FID
A1,461,781,25
B0,930,950,93
C2,013,731,59
D0,751,200,71
E0,741,400,56
F2,362,051,24
G — Saç12,5117,387,10
H3,903,913,33
I — Üz8,169,255,69
J2,464,002,20
K3,565,003,03
L — Üz + saç + qulaqlar115,51114,35130,82

Qarışıq təlim A, C, D, E, F, G, H, I, J və K siniflərində hər iki tək strategiyadan daha aşağı FID verib. B sinfində təsadüfi təlimlə eyni FID dəyəri olan 0,93 əldə edilib. Ən geniş maska L sinfində isə qarışıq təlimin FID-si 130,82-yə yüksəlib və həm təsadüfi, həm də semantik təlimdən daha pis olub. Buna görə nəticə “qarışıq üsul bütün hallarda üstündür” kimi ümumiləşdirilə bilməz.

Verianla Live: Çətin üz komponentlərində təlim strategiyalarının FID müqayisəsi

Daha aşağı FID daha yaxşıdır. C tam ağız/dodaq sahəsini, G saçı, I üz dərisini və L üz+saç+qulaqların birlikdə gizlədildiyi ən geniş maskanı təmsil edir.

MaskaTəsadüfiSemantikQarışıq
C — Tam ağız/dodaq2,013,731,59
G — Saç12,5117,387,10
I — Üz8,169,255,69
L — Üz + saç + qulaq115,51114,35130,82
 

Bootstrap doğrulaması nə göstərdi?

Araşdırmaçılar FID fərqlərinin yalnız müəyyən test nümunələrindən qaynaqlanıb-qaynaqlanmadığını yoxlamaq üçün 6000 görüntülük test dəstindən bootstrap analizi aparıblar. Hər qiymətləndirmədə 1000 unikal görüntü seçilib və proses 100 dəfə təkrarlanıb. Eyni görüntü bir bootstrap nümunəsində təkrarlanmayıb, lakin müxtəlif bootstrap nümunələrində yenidən yer ala bilib.

Əlavə Cədvəl A2-də qarışıq maska təliminin A, C, D, E, F, G, I, J və K maska siniflərində həm təsadüfi, həm semantik təlimdən daha aşağı FID verdiyi və fərqlərin p<0,01 səviyyəsində statistik olaraq əhəmiyyətli olduğu işarələnib. B və H üçün bu ikitərəfli əhəmiyyət işarələnməyib; L sinfində qarışıq yanaşma daha pis FID verib.

Seçilmiş maskaTəsadüfi FID, orta ± SSSemantik FID, orta ± SSQarışıq FID, orta ± SSMənbə nəticəsi
C — Tam ağız/dodaq2,03 ± 0,053,76 ± 0,091,60 ± 0,04Qarışıq, hər ikisindən p<0,01 daha aşağı.
G — Saç12,66 ± 0,3317,43 ± 0,427,15 ± 0,21Qarışıq, hər ikisindən p<0,01 daha aşağı.
I — Üz8,22 ± 0,219,30 ± 0,245,71 ± 0,15Qarışıq, hər ikisindən p<0,01 daha aşağı.
L — Üz + saç + qulaq116,10 ± 3,23114,90 ± 3,19131,45 ± 3,51Qarışıq yanaşma üstün deyil.

Vizual nümunələr qarışıq yanaşmanı necə göstərir?

Şəkil 5-də təsadüfi, semantik və qarışıq maska ilə öyrədilmiş MAT modellərinin üz, saç və tam ağız/dodaq bərpaları yanaşı göstərilib. Müəlliflərin vizual qiymətləndirməsinə görə təsadüfi maska ilə öyrədilmiş model üz rəngini ətrafa daha yaxşı qarışdıra bilsə də üz həndəsəsi qısa və uyğunsuz görünə bilər. Semantik təlim üz formasına daha çox yaxınlaşa bilər, lakin dəri tonu ətrafla uyğun gəlməyə bilər. Qarışıq təlim bu iki xəta tipi arasında daha balanslı nəticə yaradıb.

Saçda təsadüfi təlim saç axınında, semantik təlim isə rəng davamlılığında problem yaşaya bilərkən, qarışıq strategiya hər iki xüsusiyyəti daha yaxşı balanslaşdırıb. Ağız nümunəsində də qarışıq təlim vizual olaraq digər iki strategiyadan daha yaxşı təqdim edilib. Lakin bunlar seçilmiş vizual nümunələrdir; tədqiqat müstəqil insan qiymətləndiricilərlə korlaşdırılmış qavrayış istifadəçi araşdırması hesabat vermir.

Tədqiqatın müəyyən etdiyi struktur məhdudiyyətləri

Araşdırmaçılar yalnız təlim məlumatını dəyişməklə problemin tam həll edilə bilməyəcəyini və mövcud arxitekturaların struktur limitləri olduğunu müdafiə edirlər:

  • Lokal receptive field və convolutional bias: Tam semantik maska CNN/GAN modellərinin istifadə edə biləcəyi lokal ipuclarını tamamilə yox edə bilər.
  • Zəif qlobal və semantik mühakimə: Transformer və diffuziya modelləri geniş konteksti modelləşdirə bilsə də görüntüdəki anatomik komponentlər arasındakı dəqiq struktur əlaqəni həmişə qoruya bilmir.
  • Məhdud struktur öncüllər: Modellər üz anatomiyasını açıq qaydalar şəklində bilmir; əsasən təlim məlumatındakı statistik əlaqələri öyrənir.
  • Qeyri-müəyyənlik: Tamamilə görünməyən komponent üçün birdən çox vizual cəhətdən məqbul həll ola bilər.

Müəlliflər gələcəkdə üz komponentlərini açıq şəkildə modelləşdirən, üz həndəsəsini və komponent asılılıqlarını nəzərə alan arxitekturaların; adaptiv maska təlimlərinin və komponentə xas itki funksiyalarının araşdırılmasını tövsiyə edirlər.

Tədqiqat nəyi sübut etmir?

  • Maskanın altında olan orijinal göz, ağız, burun və ya saçın identiklik baxımından düzgün şəkildə bərpa edilə bildiyini sübut etmir.
  • Yaradılmış üz komponentlərinin anatomik olaraq tibbi rekonstruksiya üçün etibarlı olduğunu sübut etmir.
  • Tədqiqat real xəstə, travma, yanıq və ya cərrahi üz rekonstruksiyası məlumatından istifadə etmir.
  • Məxfilik qorunması və ya üz tanıma sistemlərində real identikliyin qorunması uğurunu ölçmür.
  • Qarışıq maska yanaşmasının bütün maskalarda və ya bütün inpainting arxitekturalarında üstün olduğunu göstərmir.
  • Aşağı FID-in insan gözü və ya identikliyin qorunması baxımından qüsursuz nəticə demək olduğunu göstərmir.
  • RePaint digər modellərlə eyni nümunə sayı və hesablama büdcəsi altında müqayisə edilmədiyi üçün diffuziya modellərinin ümumilikdə daha pis olduğu nəticəsini dəstəkləmir.

Mənbə və Metod Qeydi

Tam orijinal tədqiqat adıEvaluating AI-Based Image Inpainting Techniques for Facial Components Restoration Using Semantic Masks
MüəlliflərHussein Sharadga; Abdullah Hayajneh; Erchin Serpedin
Bərabər töhfəMənbədə bərabər birinci/bərabər töhfə bəyanı göstərilməyib.
Məsul müəllifHussein Sharadga
QurumlarSchool of Engineering, Texas A&M International University, ABŞ; King Abdullah II School of Engineering, Princess Sumaya University for Technology, İordaniya; Department of Electrical and Computer Engineering, Texas A&M University, ABŞ.
Mənbə növüRəyli tədqiqat məqaləsi; müqayisəli süni intellekt/görüntü emalı benchmark və yenidən təlim tədqiqatı.
Rəyləndirmə statusuRəyli jurnalda dərc edilmiş məqalə; preprint deyil.
JurnalAI
NəşriyyatMDPI
Cild / say / məqalə2026, 7(4), 119
DOI10.3390/ai7040119
Alınma / reviziya / qəbul / nəşr8 fevral 2026 / 12 mart 2026 / 23 mart 2026 / 30 mart 2026
Rəsmi keçidhttps://doi.org/10.3390/ai7040119
LisenziyaCreative Commons Attribution (CC BY).

Maliyyələşdirmə, məlumat və maraqlar toqquşması

Müəlliflər tədqiqatın xarici maliyyələşdirmə almadığını bildiriblər. Məqalə emal haqqının Texas A&M International University tərəfindən ödənildiyi qeyd olunub. Müəlliflər maraqlar toqquşması olmadığını bəyan ediblər.

Tədqiqatda istifadə edilən üz görüntüləri ictimaiyyətə açıq CelebAMask-HQ məlumat dəstindən alınıb və mənbə tədqiqat bu məlumat dəstinin yalnız qeyri-kommersiya tədqiqat məqsədilə istifadə olunduğunu bildirir. Müəlliflər xam üz görüntülərini yenidən yaymaq icazəsinə sahib olmadıqlarını deyirlər.

Generativ süni intellekt istifadəsi bəyanatı

Mənbə tədqiqatın təşəkkür bölməsində müəlliflər məqalənin oxunaqlığını yaxşılaşdırmaq məqsədilə ChatGPT-nin “GPT-5 mini, free version” versiyasından istifadə etdiklərini; daha sonra məzmunu özlərinin nəzərdən keçirib redaktə etdiklərini və yayımlanan mətnin məsuliyyətini üzərlərinə götürdüklərini bildiriblər. Bu bəyan tədqiqatın eksperimental görüntü tamamlama nəticələrinin ChatGPT tərəfindən yaradıldığı demək deyil.

Müəllif töhfələri

Konseptuallaşdırmaya hər üç müəllif töhfə verib. Metodologiya, proqram təminatı, məlumat kurasiyası və layihə idarəçiliyi Hussein Sharadga və Abdullah Hayajneh tərəfindən aparılıb; doğrulama və araşdırma işlərində hər üç müəllif iştirak edib. Orijinal layihə Hussein Sharadga və Abdullah Hayajneh tərəfindən hazırlanıb; hər üç müəllif nəzərdən keçirmə və redaktə prosesinə töhfə verib.

Mənbədaxili uyğunsuzluqların qeydi

  • P-IDS və U-IDS tənlikləri məsafə ölçüsü şəklində müəyyən edilərkən cədvəllər və mətn daha yüksək dəyəri daha yaxşı performans kimi şərh edir. Mənbə bu fərqi açıqlamır.
  • Metod mətni LaMa-nın yüksək çözünürlükdə təsirsiz tapıldığı üçün 256 və 512-də qiymətləndirildiyini deyərkən daha sonra 1024 LaMa nəticələri hesabat verilir.
  • Model Cədvəl 1 CMT, Latent-based, MI-GAN və RePaint üçün 256 çözünürlük bildirdiyi halda hesablama müddəti Cədvəl 6 bu modellərin müddətlərini 512 × 512 sütununda göstərir.

Əsas məhdudiyyətlər

  • Nəticələr bir əsas üz məlumat dəsti ailəsinə əsaslanır.
  • Klinik və ya travmatik üz rekonstruksiyası məlumat dəsti istifadə edilməyib.
  • Hər model eyni çözünürlüklərdə və eyni hesablama büdcəsi ilə sınaqdan keçirilməyib.
  • RePaint yalnız 10 görüntü üzərində məhdud şəkildə qiymətləndirilib.
  • Vizual keyfiyyət qiymətləndirmələri üçün müstəqil, korlaşdırılmış insan qiymətləndirici araşdırması təqdim edilməyib.
  • FID paylanma əsaslı qavrayış oxşarlığı ölçüsüdür; orijinal şəxsin həqiqi itkin üz komponentinin yenidən yaradıldığını sübut etmir.
  • Ən geniş L semantik maska sinfində qarışıq təlim daha pis FID yaradıb.
  • Mənbədə P-IDS/U-IDS metrik istiqaməti ilə bağlı tərif və şərh uyğunsuzluğu var.

Tədqiqatın ən güclü nəticəsi tamamilə gizlədilmiş semantik üz komponentlərinin mövcud görüntü tamamlama modelləri üçün hələ də çətin problem olması və maska müxtəlifliyinin təlim performansına əhəmiyyətli təsir göstərə bilməsidir. Qarışıq təsadüfi–semantik təlim strategiyası bir çox üz komponentində FID-i yaxşılaşdırsa da, tədqiqat qüsursuz üz rekonstruksiyasına çatıldığını deyil, əksinə bunun hələ də açıq araşdırma problemi olduğunu göstərir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy