Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / LogicPainter: İnsan Məntiqinə Əsaslanan Süni İntellekt Rəssamlığında Qatlı Fırça Zərbəsi Emalı və Diffuziya Yönümlü Təkmilləşdirmə
Kompüter Elmləri

LogicPainter: İnsan Məntiqinə Əsaslanan Süni İntellekt Rəssamlığında Qatlı Fırça Zərbəsi Emalı və Diffuziya Yönümlü Təkmilləşdirmə

LogicPainter istinad görüntüsünü bir addımda stilizə etmək əvəzinə onu açıq fırça zərbələri ilə, ön planı arxa plandan əvvəl işləyərək və kobud quruluşdan incə detallara doğru irəliləyərək yenidən yaradan insan məntiqindən ilhamlanan neyron rəsm çərçivəsidir. Sistem saliency mask modulu, sketcher, controllable stroke generator, layer renderer və rəqəmsal canvas komponentlərini birləşdirir.

13/09/2026  Veri Anla 126 baxış
LogicPainter: İnsan Məntiqinə Əsaslanan Süni İntellekt Rəssamlığında Qatlı Fırça Zərbəsi Emalı və Diffuziya Yönümlü Təkmilləşdirmə

LogicPainter, istinad görüntüsünü bir addımda stilizə etmək əvəzinə onu açıq fırça zərbələri ilə, ön planı arxa plandan əvvəl işləyərək və kobud quruluşdan incə detallara doğru irəliləyərək yenidən yaradan insan məntiqindən ilhamlanan neyron rəsm çərçivəsidir. Sistem saliency mask modulu, sketcher, controllable stroke generator, layer renderer və rəqəmsal canvas komponentlərini birləşdirir. Fırça parametrləri təsadüfi başlanğıcdan etibarən xüsusiyyət-məkanı itkisi üzərindən iterativ şəkildə optimallaşdırılır və bu proses məqalədə diffuziya yönümlü təkmilləşdirmə kimi şərh olunur. CelebA, ImageNet və real dünya fotoşəkilləri üzərində aparılan təcrübələr və istifadəçi tədqiqatları LogicPainter-ın məzmun sədaqəti, rəssamlıq görünüşü və insana bənzər boyama ardıcıllığı arasında güclü tarazlıq qura bildiyini göstərir. Bununla belə, iş hakem qiymətləndirməsindən keçməmiş preprintdir və “insan məntiqi” nəticəsi real insan rəssamlarının koqnitiv prosesinin birbaşa ölçümü deyil, istifadəçilərin sistemin boyama ardıcıllığına dair qavrayışına əsaslanan eksperimental qiymətləndirmədir.

LogicPainter-ın əsas yeniliyi süni intellekt rəssamlığını yalnız görüntüdən-görüntüyə çevrilmə problemi kimi görməməsidir. Sistem boyamanı hansı bölgənin əvvəl işlənəcəyi, fırça zərbələrinin necə yaradılacağı, canvas-ın hansı ardıcıllıqla yenilənəcəyi və detalın qat-qat necə artırılacağı açıq şəkildə modelləşdirilən prosedur vizual yaratma prosesi kimi müəyyən edir.

LogicPainter Nədir?

LogicPainter istinad görüntüsünü birbaşa vahid stilizə olunmuş çıxış kimi yaratmaq əvəzinə onu fırça zərbələri ilə mərhələli şəkildə quran; ön planı əvvəl, arxa planı sonra boyayan və hər bölgəni kobud quruluşdan incə detallara doğru qatlayan süni intellekt rəsm çərçivəsidir.

İşin başlanğıc nöqtəsi klassik görüntü stil ötürülməsi ilə həqiqi mənada “boyama prosesi” arasında fərq olduğu fikridir. Stil ötürmə modeli son görüntünü birbaşa çevirə bilər. LogicPainter isə görüntünün necə yarandığını da modelləşdirməyə çalışır: sketch yaradılır, əsas obyekt müəyyən edilir, ön plan boyanır, arxa plan əlavə olunur və fırça zərbələri getdikcə kiçilən miqyaslarda təkmilləşdirilir.

Buna görə işdə AI painting belə konseptuallaşdırılır: son görüntünün bir dəfəlik yaradılması deyil, açıq və ardıcıl fırça zərbələri ilə mərhələli şəkildə meydana gətirilməsi.

Tədqiqat problemi

Müəlliflərin qeyd etdiyi əsas problem iki hissəlidir. Bir çox mövcud neyron rəsm sistemi stroke-by-stroke işləmə həyata keçirsə də, hansı obyektin əvvəl boyanmalı olduğunu insan rəssamların istifadə edə biləcəyi semantik prioritetlərə görə açıq şəkildə modelləşdirmir. Digər tərəfdən, detalı qorumaq ilə görünən rəssamlıq fırça xarakterini gücləndirmək arasında aydın kompromis vardır.

Bir üsul görüntü məzmununu həddən artıq sıx qoruduqda nəticə fotoqrafik rekonstruksiyaya yaxınlaşa bilər. Fırça teksturasını və stilizasiyanı həddən artıq gücləndirdikdə isə obyekt quruluşu və kiçik semantik detallar itə bilər. LogicPainter bu iki məqsədi eyni pipeline daxilində birlikdə həll etməyə çalışır.

LogicPainter İnsana Bənzər Boyama Ardıcıllığını Necə Modelləşdirir?

LogicPainter görüntünü saliency əsasında ön plan və arxa plana ayırır; əvvəl əsas obyekti üç qat boyunca kobud formadan incə detallara qədər işləyir, sonra eyni canvas vəziyyətini qoruyaraq arxa planı yenə qatlı şəkildə tamamlayır. Beləliklə sistem bütün görüntünü başlanğıcdan eyni əhəmiyyətdə boyamaq əvəzinə semantik “əsas obyekt əvvəl, mühit sonra” qaydasını tətbiq edir.

Beş əsas komponent

Məqalənin Şəkil 2-sində LogicPainter arxitekturası beş əsas modula ayrılır:

  1. Salience mask module: İstinad görüntüsündəki əsas ön plan obyektini müəyyən edir.
  2. Sketcher: İlkin canvas üzərinə struktur eskiz öncülü yerləşdirir.
  3. Stroke generator: Forması və rəngi idarə oluna bilən rəssamlıq fırça zərbələri yaradır.
  4. Layer renderer: Fırça zərbələrini qatlar boyunca canvas-a yerləşdirir və optimallaşdırır.
  5. Digital canvas: Bütün iterativ əməliyyatların toplandığı görüntü vəziyyətidir.

Ön plan maskası \(M_f\), arxa plan maskası isə \(M_b\) ilə göstərilir. Bu iki maska yalnız diqqət çəkisi kimi istifadə edilmir; rəsmin real boyama ardıcıllığını müəyyən edir.

Mərhələ 1: Ön plan

Birinci mərhələdə model yalnız ön plan maskası ilə müəyyən edilən əsas obyekt üzərində işləyir. Sketcher-in yaratdığı əsas kontur qlobal quruluşun formalaşmasına kömək edir. Layer renderer və stroke generator birlikdə əsas obyekti üç həllolma/detal qatında irəlilədir.

Mərhələ 2: Arxa plan

İkinci mərhələ boş canvas ilə başlamır. Ön plan mərhələsinin tamamlanmış canvas-ı birbaşa ilkin vəziyyət kimi istifadə olunur. Beləliklə arxa plan artıq yaradılmış əsas obyektin ətrafına yerləşdirilir və ön planın semantik prioriteti qorunur.

Kobuddan-İncəyə Qatlı İşləmə Nə Deməkdir?

Kobuddan-incəyə işləmə birinci qatda geniş sahələri və ümumi rəng/quruluş kompozisiyasını böyük və seyrək fırça zərbələri ilə qurmaq, sonrakı qatlarda daha çox və vizual olaraq daha kiçik zərbələrdən istifadə etməklə forma, tekstura və lokal detalı tədricən artırmaq deməkdir.

LogicPainter əksər təcrübələrdə üç qat istifadə edir. Birinci qat ümumi quruluşu və əsas rəng paylanmasını qurur. İkinci və üçüncü qatlar getdikcə daha sıx grid-lər üzərindən daha kiçik vizual miqyasda zərbələr əlavə edir.

Qat \(l\) üçün grid sayı mənbədə bu formula ilə müəyyən edilir:

\[ W_l=(2^{l+1}-1)^2 \]

Burada \(W_l\) müvafiq qatdakı grid sayıdır. Hər grid daxilində \(\sigma\) ədəd fırça zərbəsi istifadə edilərsə, ümumi zərbə sayı:

\[ T=W_l\times \sigma \]

olur.

Mənbənin verdiyi nümunədə \(\sigma=3\) və \(l=1\) üçün:

\[ T=(2^{1+1}-1)^2 \times 3 =3^2\times3 =27 \]

fırça zərbəsi istifadə olunur.

Qat indeksi artdıqca eyni canvas üzərində daha çox grid istifadə edildiyi üçün hər lokal bölgə daha incə miqyaslı zərbələrlə işlənə bilər. Bu mexanizm vizual olaraq “geniş boya blokları → orta miqyaslı formalar → incə detallar” keçidini yaradır.

Canvas yenilənməsi

Hər fırça zərbəsi alpha compositing məntiqi ilə mövcud canvas üzərinə yerləşdirilir. Mənbədə canvas yenilənməsi belə verilir:

\[ O^{t+1}_{l} = O^{t}_{l}\odot(1-\alpha_t) + \alpha_t\times m_t \]

Burada \(O^{t}_{l}\), \(l\)-ci qatda \(t\)-ci zərbədən əvvəlki canvas vəziyyətidir; \(\alpha_t\) fırça zərbəsinin alpha dəstəyini, \(m_t\) isə rəng parametrlərini təmsil edir. Tənlik yeni zərbənin əvvəlki canvas vəziyyətinə öz maskası nisbətində qarışdırılmasını təsvir edir.

Qatın tamamlanması

Bir qatda bütün \(T\) zərbələri yerləşdirildikdə:

\[ O_l=O^{T}_{l} \]

əldə edilir. Son rəsm isə qatların uyğun yenidən ölçüləndirilməsi və hizalanması ilə birləşdirilməsi kimi müəyyən edilir:

\[ O=\sum_{l=1}^{L} U_l(O_l) \]

İşdə son qat indeksi \(L=3\)-dür.

Stroke Generator Necə İşləyir?

LogicPainter-ın stroke generator-u fırça formasını və fırça rəngini tək GAN çıxışına buraxmaq əvəzinə iki generator istifadə edərək əvvəl zərbə prototipini yaradır, sonra ikinci generator ilə zərbəni təmizləyib hədəf rəngə yenidən boyayır; beləliklə canvas üzərinə təkrar-təkrar bindirilə bilən daha sabit və idarəolunan fırça primitivləri əldə edilir.

Müəlliflər standart GAN əsaslı fırça istehsalının bəzi hallarda ağ fonda çirkli və ya heterogen piksel dəyərləri yarada bildiyini qeyd edirlər. Belə çıxış canvas üzərinə çox sayda dəfə birbaşa bindirildikdə arzuolunmaz rəng ləkələrinə səbəb ola bilər.

LogicPainter buna görə iki generatorlu quruluş istifadə edir:

  • \(G\): Təsadüfi parametrlərdən əsas fırça zərbəsi morfologiyasını yaradır.
  • \(G'\): Yaradılmış zərbəni hədəf rəng parametrləri ilə yenidən rəngləndirir və təmizləyir.
  • \(D\): Həqiqi stroke nümunələri ilə iki generatorun çıxışlarını ayırd etməyə çalışan discriminator-dur.

Discriminator itkisi

Mənbə discriminator itkisini belə müəyyən edir:

\[ \mathcal{L}_D= \frac{1}{K} \sum_{k=1}^{K} \left[ -\log D(x_k) -\log(1-D(G(n_k))) -\log(1-D(G'(G(n_k),m_k))) \right] \]

Birinci termin həqiqi stroke nümunələrinin həqiqi kimi təsnif edilməsini, ikinci və üçüncü terminlər isə iki generator çıxışının saxta kimi ayrılmasını təşviq edir.

Birinci generator itkisi

\[ \mathcal{L}_G= \frac{1}{K} \sum_{k=1}^{K} -\log D(G(n_k)) \]

Bu itki \(G\)-nin yaratdığı stroke prototiplərini discriminator baxımından həqiqi stroke nümunələrinə yaxınlaşdırmağı hədəfləyir.

İkinci generator itkisi

\[ \mathcal{L}_{G'}= \frac{1}{K} \sum_{k=1}^{K} -\log D(G'(G(n_k),m_k)) \]

İkinci generator yenidən rənglənmiş stroke çıxışını realistik etməyə çalışır.

Alpha əsaslı yenidən rəngləmə

Fırçanın son rəngli forması mənbədə:

\[ S=\alpha\times m_t \]

kimi ifadə edilir.

Stroke prototipindən alpha dəstəyi:

\[ \alpha_t=\phi(G(n_t)) \]

ilə çıxarılır və son stroke:

\[ S=G'(G(n_t),m_t) = \phi(G(n_t))\times m_t \]

kimi əldə edilir. Bu ayrım fırçanın həndəsi dəstəyi ilə rəng məlumatını bir-birindən ayırır.

Diffuziya Yönümlü Təkmilləşdirmə Həqiqi DDPM-dirmi?

Xeyr. LogicPainter standart DDPM mənasında piksel məkanında ehtimallı irəli və geri diffuziya zənciri qurmur; iş təsadüfi başlanmış fırça parametrlərinin və canvas vəziyyətlərinin hədəf görüntüyə doğru təkrarlanan qradiyent yeniləmələri ilə düzəldilməsini tərs-diffuziyaya bənzər təkmilləşdirmə prosesi kimi şərh edir.

Bu fərq məqalənin düzgün başa düşülməsi baxımından kritikdir. LogicPainter-ın istifadə etdiyi yanaşmada “noise → denoising → image” formasında klassik piksel-məkanı DDPM istehsalı həyata keçirilmir.

Bunun əvəzinə latent stroke parametrləri:

\[ z_l^t=\{n_l^t,m_l^t\} \]

kimi müəyyən edilir. \(n_l^t\) zərbənin prototip formasını, \(m_l^t\) isə rəng parametrlərini idarə edir.

Müvafiq stroke:

\[ S_l^t=G'(G(n_l^t),m_l^t) \]

formasında yaradılır.

Daha sonra canvas keçidi abstrakt olaraq:

\[ O_l^{t+1}=\mathcal{T}(O_l^t,z_l^t) \]

şəklində ifadə edilir. Buradakı \(\mathcal{T}\) diferensiallaşdırıla bilən stroke render və compositing operatorudur.

Feature-space discrepancy

Model xam piksel fərqini birbaşa optimallaşdırmaq əvəzinə ResNet əsaslı xüsusiyyət təmsilindən istifadə edir. Ön plan mərhələsində itki:

\[ \mathcal{L}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_f)_j - R(O\odot M_f)_j \right\| \]

şəklindədir.

Arxa plan üçün eyni quruluş \(M_b\) maskası ilə:

\[ \mathcal{L}_{bg}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_b)_j - R(O\odot M_b)_j \right\| \]

kimi istifadə olunur.

Burada \(R(\cdot)\) ResNet feature extractor-u, \(J\) çıxarılan feature map sayını təmsil edir.

Stroke parametrlərinin yenilənməsi

Stroke parametrləri qradiyent əsaslı optimallaşdırma ilə:

\[ z_l^{t+1} = z_l^t - \eta\nabla_{z_l^t}\mathcal{L}_l^t \]

şəklində yenilənir.

\(\eta\) addım ölçüsüdür. Beləliklə hədəf məzmunu zəif təmsil edən stroke konfiqurasiyaları tədricən düzəldilir.

Canvas inkişafı:

\[ O_l^0\rightarrow O_l^1\rightarrow \cdots \rightarrow O_l^T \]

şəklində irəliləyir. Müəlliflər bu zənciri tərs-diffuziyaya bənzər təkmilləşdirmə kimi şərh edirlər; lakin açıq şəkildə bunun DDPM mənasında dəqiq Markov diffuziya modeli iddiası olmadığını bildirirlər.

İşin Metodu və Nəticələri

Təcrübə infrastrukturu

Bütün təcrübələr Intel i7-7700K CPU və NVIDIA Titan RTX GPU olan workstation üzərində aparılmışdır.

Qiymətləndirmə üçün üç məlumat mənbəyi istifadə edilmişdir:

  • CelebA,
  • ImageNet,
  • real dünya fotoşəkilləri.

Test görüntüləri portret, heyvan, bitki, çiçək və bina kimi müxtəlif semantik kateqoriyaları əhatə edir.

Standart LogicPainter konfiqurasiyası:

  • iki mərhələli ön plan/arxa plan boyama,
  • üç render qatı,
  • ResNet əsaslı feature extraction loss,
  • grid başına \(\sigma=3\) stroke

istifadə edir.

Vizual müqayisələr

Şəkil 6-da CelebA, ImageNet və real fotoşəkillərdəki istehsal prosesi göstərilir. Görüntülərdə əsas obyekt əvvəl kobud fırça izləri ilə formalaşır, sonra detalları artır və son mərhələdə arxa plan tamamlanır.

Müəlliflərin vizual qiymətləndirməsinə görə üz strukturları, heyvan konturları, çiçək ləçəkləri və bina həndəsələri stilizasiyadan sonra böyük ölçüdə tanınan qalır. Eyni zamanda son görüntülər sadəcə fotoqrafik rekonstruksiya əvəzinə görünən fırça izi yaradır.

Rəqib üsullarla müqayisə

LogicPainter üç nümayəndə üsulla müqayisə edilmişdir:

ÜsulMənbədə vurğulanan güclü tərəfMənbədə vurğulanan məhdudiyyət
SNPAydın stroke və stil görünüşüİncə semantik məzmunun bir hissəsini itirə bilməsi
PTFGüclü stroke əsaslı stilizasiyaStruktur detalın stil xatirinə zəifləyə bilməsi
LTPMəzmunun qorunmasıÇıxışın fotoqrafik rekonstruksiyaya yaxın qala bilməsi
LogicPainterMəzmun, stroke görünüşü və boyama ardıcıllığı arasında tarazlıqHər fərdi qiymətləndirmə meyarında ən yüksək balı almır

İstifadəçi Tədqiqatları LogicPainter Haqqında Nə Göstərdi?

İstifadəçi tədqiqatları LogicPainter-ın xüsusilə rəng, estetik bütövlük və insana bənzər boyama ardıcıllığı baxımından güclü qavranıldığını; buna qarşılıq tekstura və ya sırf məzmun qorunması kimi bəzi fərdi meyarlarda rəqib üsulların daha yüksək bal ala bildiyini göstərir.

Birinci istifadəçi tədqiqatı

İlk istifadəçi tədqiqatına ümumilikdə 20 iştirakçı daxil edilmişdir. İştirakçılar 18–40 yaş aralığında müxtəlif yaş, cins və təhsil qruplarındandır; iştirakçıların %10-u sənət təcrübəsinə malikdir.

Hər nəticə 1,0–5,0 şkalasında aşağıdakı beş meyarla qiymətləndirilmişdir:

  • Content,
  • Texture,
  • Colour,
  • Style,
  • Beauty.

Sənət təcrübəsi olan iştirakçılarda LogicPainter

MeyarOrtaStandart sapma%95 etibar intervalı
Content3,8880,1033,838–3,937
Texture3,7130,0483,690–3,735
Colour4,5880,1184,531–4,644
Style4,5750,1324,511–4,639
Beauty4,1250,0654,094–4,156

Bu qrupda rəng, stil və gözəllik meyarları %95 etibar səviyyəsində 4 baldan yuxarı qalmışdır. Xüsusilə Colour metrikası üçün 4,531–4,644 intervalı bildirilir.

Sənət təcrübəsi olmayan iştirakçılarda LogicPainter

MeyarOrtaStandart sapma%95 etibar intervalı
Content4,3880,1444,319–4,456
Texture3,6880,1493,616–3,759
Colour4,4750,4054,280–4,670
Style4,4880,4114,290–4,685
Beauty4,1880,1254,127–4,248

Sənət təcrübəsi olmayan iştirakçılarda Content, Colour, Style və Beauty meyarlarının %95 etibar intervalları 4 baldan yuxarı qalmışdır.

İkinci istifadəçi tədqiqatı: boyama ardıcıllığı

İkinci istifadəçi tədqiqatında iştirakçılar yalnız son görüntünü deyil, üsulların yaratdığı boyama videolarını da qiymətləndirmişlər. Şkala yenə 1–5 arasındadır və yüksək dəyər prosesin insan rəssamın boyama praktikasına daha yaxın qavranıldığını ifadə edir.

Şəkil 9-da LogicPainter həm sənət təcrübəsi olan, həm də olmayan qruplarda 5-ə yaxın qiymətləndirmələr almış və müqayisə edilən SNP, PTF və LTP üsullarından açıq şəkildə daha yüksək qiymətləndirilmişdir. Mənbə şəkil dəqiq bar dəyərlərini mətnlə vermədiyi üçün burada qrafikdən yeni dəqiq rəqəm çıxarılmamışdır.

Ablasiya Tədqiqatları Hansı Komponentlərin Vacib Olduğunu Göstərdi?

Ablasiya təcrübələri son rəsm keyfiyyətinin yalnız əsas arxitekturadan deyil, istifadə olunan feature extractor-dan, stroke stilindən, qat ardıcıllığından və hər grid-dəki stroke sayından da asılı olduğunu; xüsusilə ResNet xüsusiyyətləri və orta sıxlıqdakı \(\sigma=3\) parametrinin məzmunun qorunması ilə hesablama xərci arasında uyğun tarazlıq yaratdığını göstərmişdir.

ResNet və GoogleNet

Feature-extraction loss üçün ResNet və GoogleNet müqayisə edilmişdir. Mənbə nəticələrinə görə GoogleNet əsaslı xüsusiyyətlər bəzi nümunələrdə daha çox məzmun detalı itirərkən ResNet struktur məzmun ilə stilizə görünüş arasında daha güclü tarazlıq yaratmışdır.

Stroke stili

Standart stroke stilinə əlavə olaraq Neural Painter mənşəli pastelə bənzər stroke verilənlər dəsti də sınaqdan keçirilmişdir. Bu dəyişiklik model arxitekturasını dəyişmədən daha pastel və ya akvarelə bənzər vizual nəticələrin yaradıla bildiyini göstərmişdir.

Qat ardıcıllığı

Standart model bütün foreground qatlarını tamamladıqdan sonra background qatlarına keçir. Ablasiya təcrübəsində alternativ olaraq eyni qat daxilində foreground və background birlikdə işlənmiş, sonra bir üst qata keçilmişdir.

Nəticələr LogicPainter-ın müxtəlif boyama ardıcıllıqlarını dəstəkləyə bildiyini, buna baxmayaraq kobuddan-incəyə işləmə xüsusiyyətini qoruduğunu göstərir.

Stroke sayı

Grid başına stroke sayı \(\sigma=1\) ilə \(\sigma=5\) arasında sınaqdan keçirilmişdir.

  • \(\sigma=1\): Nəticələr daha seyrəkdir və detal itkisi daha yüksəkdir.
  • \(\sigma=5\): Daha çox incə detal qorunur.
  • \(\sigma=3\): Vizual keyfiyyət ilə hesablama xərci arasında mənbə tərəfindən yaxşı kompromis kimi seçilmişdir.

Yeni stroke stili

Müəlliflər həmçinin kubik Bézier əyriləri boyunca hərəkət edən dəyişən diametrli boş dairələrdən istifadə edən alternativ stroke mexanizmi hazırlamışlar. Bu təcrübələrdə də əsas semantik məzmun qorunarkən fərqli tekstura və bədii xarakterlərin yaradıla bildiyi göstərilmişdir.

İşin dəstəklədiyi nəticələr

  • Foreground-first/background-second düzəni açıq şəkildə tətbiq edilə bilər.
  • Qatlı coarse-to-fine rendering vizual detalı mərhələli şəkildə artıra bilər.
  • İki mərhələli stroke generator forma və rəng nəzarətini bir-birindən ayıra bilər.
  • Feature-space loss stroke parametrlərinin iterativ optimallaşdırılmasında istifadə oluna bilər.
  • LogicPainter müxtəlif stroke stillərini dəstəkləyə bilər.
  • İstifadəçilər LogicPainter-ın boyama ardıcıllığını müqayisə edilən üsullardan daha insana bənzər qiymətləndirmişlər.
  • Model məzmunun qorunması ilə rəssamlıq stili arasında rəqabətqabiliyyətli tarazlıq təqdim edir.

İşin dəstəkləmədiyi nəticələr

  • LogicPainter real insan rəssamlarının koqnitiv prosesini tam modelləşdirdiyini sübut etmir.
  • “Human-logic” ifadəsi insan beyninin neyrokoqnitiv modeli deyil.
  • LogicPainter standart DDPM deyil.
  • Üsul hər fərdi istifadəçi metrikasında bütün rəqiblərdən üstün deyil.
  • 20 nəfərlik ilk istifadəçi tədqiqatı bütün əhalini təmsil edən böyük miqyaslı davranış tədqiqatı deyil.
  • İş real fiziki boya, fırça sürtünməsi və ya maye boya dinamikasını simulyasiya etmir.
  • Dinamik səhnələr və istifadəçi yönləndirməli seçim nəzarəti mövcud işdə həll olunmuş problemlər deyil; gələcək iş kimi təklif olunur.

Gələcək iş istiqamətləri

Müəlliflər gələcəkdə üsulun dinamik səhnələrə genişləndirilməsini, istifadəçi tərəfindən yönəldilən rəsm seçimlərinin sistemə daxil edilməsini və daha çox bədii stroke stilinin dəstəklənməsini təklif edirlər. Bu xüsusiyyətlər mövcud sistemin sınaqdan keçirilmiş imkanları deyil, gələcəkdə araşdırılması planlaşdırılan istiqamətlərdir.

Mənbə və Metod Qeydi

Orijinal başlıq: LogicPainter: Layered Stroke Rendering with Diffusion-Driven Refinement for Human-Logic AI Painting.

Müəlliflər: Qian Wang, Cai Guo, Hong-Ning Dai, Maaike Kleinsmann, Yike Guo və Pan Wang.

Məsul müəllif: Pan Wang.

Qurumlar: Guangdong University of Technology, Hanshan Normal University, Hong Kong Baptist University, Delft University of Technology və The Hong Kong University of Science and Technology.

ORCID: Mənbə Qian Wang üçün 0000-0002-5892-8093 ORCID məlumatını verir.

Platforma: SSRN.

SSRN Abstract No.: 7023467.

Mənbə növü: Tədqiqat preprinti.

Hakemlik vəziyyəti: Hakem qiymətləndirməsindən keçməmişdir.

DOI: Mənbədə göstərilməmişdir.

Jurnal: Hakemli son jurnal qeydi mənbədə verilmir. Səhifə altlarında “Preprint submitted to Elsevier” ifadəsi mövcuddur.

Maliyyələşdirmə: Mənbə tədqiqat layihəsinin “National Science Foundation No. 62402122” tərəfindən dəstəkləndiyini bildirir.

Əsas metod: Saliency əsaslı foreground/background ayrımı, sketch prior, GAN əsaslı iki mərhələli stroke generator, ResNet feature-space loss, coarse-to-fine layer renderer, diferensiallaşdırıla bilən stroke compositing və qradiyent əsaslı iterative stroke optimisation.

Verilənlər dəstləri: CelebA, ImageNet və real dünya fotoşəkilləri.

Müqayisə edilən üsullar: Stylized Neural Painting (SNP), Paint Transformer (PTF) və Learning to Paint (LTP).

Avadanlıq: Intel i7-7700K CPU və NVIDIA Titan RTX GPU.

Standart rendering parametri: Üç qat və grid başına \(\sigma=3\) fırça zərbəsi.

Əsas metodoloji məhdudiyyət: “Diffusion-driven” ifadəsi klassik DDPM ilə eyni mənalı deyil. Mənbə p və q keçidlərini tam DDPM Markov zənciri iddiası üçün deyil, stroke-canvas vəziyyətlərinin iterativ təkmilləşdirilməsini konseptuallaşdırmaq üçün istifadə etdiyini açıq şəkildə bildirir.

İstifadəçi tədqiqatı məhdudiyyəti: İnsana bənzər boyama düzəninə dair nəticələr istifadəçi qavrayışına əsaslanır. İlk tədqiqat 20 iştirakçı ilə aparılmışdır və bu qiymətləndirmə real rəssamların koqnitiv proseslərinin eksperimental neyroelmi ölçümü deyil.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy