
LogicPainter, bir referans görüntüyü tek adımda stilize etmek yerine onu açık fırça darbeleriyle, ön planı arka plandan önce işleyerek ve kaba yapıdan ince ayrıntıya doğru ilerleyerek yeniden oluşturan insan mantığı esinli bir nöral resim çerçevesidir. Sistem; saliency mask modülü, sketcher, controllable stroke generator, layer renderer ve dijital canvas bileşenlerini birleştirir. Fırça parametreleri rastgele başlangıçtan itibaren özellik-uzayı kaybı üzerinden iteratif biçimde optimize edilir ve bu süreç makalede difüzyon güdümlü iyileştirme olarak yorumlanır. CelebA, ImageNet ve gerçek dünya fotoğrafları üzerindeki deneyler ile kullanıcı çalışmaları, LogicPainter'ın içerik sadakati, resimsel görünüm ve insan benzeri boyama sırası arasında güçlü bir denge kurabildiğini göstermektedir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiş bir preprinttir ve “insan mantığı” sonucu gerçek insan ressamların bilişsel sürecinin doğrudan ölçümü değil, kullanıcıların sistemin boyama sırasına ilişkin algısına dayanan deneysel bir değerlendirmedir.
LogicPainter'ın temel yeniliği, yapay zekâ resmini yalnız bir görüntüden görüntüye dönüşüm problemi olarak ele almamasıdır. Sistem boyamayı, hangi bölgenin önce ele alınacağı, fırça darbelerinin nasıl oluşturulacağı, canvas'ın hangi sırayla güncelleneceği ve ayrıntının katmandan katmana nasıl artırılacağı açık biçimde modellenen prosedürel bir görsel oluşturma süreci olarak tanımlar.
LogicPainter Nedir?
LogicPainter, referans görüntüyü doğrudan tek bir stilize çıktı olarak üretmek yerine fırça darbeleriyle aşamalı biçimde oluşturan; ön planı önce, arka planı sonra boyayan ve her bölgeyi kaba yapıdan ince ayrıntıya doğru katmanlandıran bir yapay zekâ resimleme çerçevesidir.
Çalışmanın çıkış noktası, klasik görüntü stil aktarımı ile gerçek anlamda “boyama süreci” arasında fark bulunduğu görüşüdür. Bir stil aktarım modeli nihai görüntüyü doğrudan dönüştürebilir. LogicPainter ise görüntünün nasıl oluştuğunu da modellemeye çalışır: bir sketch oluşturulur, temel nesne belirlenir, ön plan boyanır, arka plan eklenir ve fırça darbeleri gittikçe küçülen ölçeklerde iyileştirilir.
Bu nedenle çalışmada AI painting şu şekilde kavramsallaştırılmaktadır: nihai görüntünün tek atışta oluşturulması değil, açık ve sıralı fırça darbeleriyle kademeli olarak meydana getirilmesi.
Araştırma problemi
Yazarların belirttiği temel problem iki parçalıdır. Birçok mevcut nöral resim sistemi stroke-by-stroke işleme gerçekleştirse bile, hangi nesnenin önce boyanması gerektiğini insan ressamların kullanabileceği anlamsal önceliklere göre açık biçimde modellememektedir. Diğer taraftan ayrıntıyı korumak ile görünür resimsel fırça karakterini güçlendirmek arasında belirgin bir ödünleşim vardır.
Bir yöntem görüntü içeriğini çok sıkı koruduğunda sonuç fotoğrafik rekonstrüksiyona yaklaşabilir. Fırça dokusunu ve stilizasyonu fazla güçlendirdiğinde ise nesne yapısı ve küçük semantik ayrıntılar kaybolabilir. LogicPainter bu iki hedefi aynı pipeline içinde birlikte ele almaya çalışmaktadır.
LogicPainter İnsan Benzeri Boyama Sırasını Nasıl Modelliyor?
LogicPainter görüntüyü saliency tabanlı olarak ön plan ve arka plana ayırır; önce ana nesneyi üç katman boyunca kaba biçimden ince ayrıntıya kadar işler, ardından aynı canvas durumunu koruyarak arka planı yine katmanlı biçimde tamamlar. Böylece sistem tüm görüntüyü başlangıçtan itibaren eşit önemde boyamak yerine semantik bir “ana nesne önce, çevre sonra” düzeni uygular.
Beş temel bileşen
Makalenin Şekil 2'sinde LogicPainter mimarisi beş ana modüle ayrılmaktadır:
- Salience mask module: Referans görüntüdeki ana ön plan nesnesini belirler.
- Sketcher: İlk canvas üzerine yapısal bir eskiz öncülü yerleştirir.
- Stroke generator: Biçimi ve rengi kontrol edilebilir resimsel fırça darbeleri üretir.
- Layer renderer: Fırça darbelerini katmanlar boyunca canvas'a yerleştirir ve optimize eder.
- Digital canvas: Tüm iteratif işlemlerin biriktiği görüntü durumudur.
Ön plan maskesi \(M_f\), arka plan maskesi ise \(M_b\) ile gösterilir. Bu iki maske yalnız dikkat ağırlığı olarak kullanılmaz; resmin gerçek boyama sırasını belirler.
Aşama 1: Ön plan
İlk aşamada model yalnız ön plan maskesiyle belirlenen ana nesne üzerinde çalışır. Sketcher tarafından oluşturulan temel kontur, global yapının kurulmasına yardımcı olur. Layer renderer ve stroke generator birlikte ana nesneyi üç çözünürlük/ayrıntı katmanında ilerletir.
Aşama 2: Arka plan
İkinci aşama boş bir canvas ile başlamaz. Ön plan aşamasının tamamlanmış canvas'ı doğrudan başlangıç durumu olarak kullanılır. Böylece arka plan, zaten oluşturulmuş ana nesnenin çevresine yerleştirilir ve ön planın semantik önceliği korunur.
Kaba-İnceden Katmanlı İşleme Ne Anlama Geliyor?
Kaba-inceden işleme, ilk katmanda geniş alanları ve genel renk/yapı kompozisyonunu büyük ve seyrek fırça darbeleriyle kurmak, sonraki katmanlarda daha fazla ve görsel olarak daha küçük darbeler kullanarak şekil, doku ve yerel ayrıntıyı giderek artırmak anlamına gelir.
LogicPainter çoğu deneyde üç katman kullanmaktadır. Birinci katman genel yapı ve ana renk dağılımını kurar. İkinci ve üçüncü katmanlar giderek daha yoğun grid'ler üzerinden daha küçük görsel ölçekte darbeler ekler.
Katman \(l\) için grid sayısı kaynakta şu formülle tanımlanmaktadır:
\[ W_l=(2^{l+1}-1)^2 \]
Burada \(W_l\), ilgili katmandaki grid sayısıdır. Her grid içinde \(\sigma\) adet fırça darbesi kullanılırsa toplam darbe sayısı:
\[ T=W_l\times \sigma \]
olur.
Kaynağın verdiği örnekte \(\sigma=3\) ve \(l=1\) için:
\[ T=(2^{1+1}-1)^2 \times 3 =3^2\times3 =27 \]
fırça darbesi kullanılır.
Katman indeksi arttıkça aynı canvas üzerinde daha fazla grid kullanıldığı için her yerel bölge daha ince ölçekli darbelerle işlenebilir. Bu mekanizma görsel olarak “geniş boya blokları → orta ölçekli formlar → ince ayrıntılar” geçişini üretir.
Canvas güncellemesi
Her fırça darbesi alpha compositing mantığıyla mevcut canvas üzerine yerleştirilir. Kaynakta canvas güncellemesi şu şekilde verilir:
\[ O^{t+1}_{l} = O^{t}_{l}\odot(1-\alpha_t) + \alpha_t\times m_t \]
Burada \(O^{t}_{l}\), \(l\). katmanda \(t\). darbeden önceki canvas durumudur; \(\alpha_t\) fırça darbesinin alpha desteğini, \(m_t\) ise renk parametrelerini temsil eder. Denklem, yeni darbenin önceki canvas durumuna kendi maskesi oranında karıştırılmasını tanımlar.
Katmanın tamamlanması
Bir katmandaki bütün \(T\) darbeleri yerleştirildiğinde:
\[ O_l=O^{T}_{l} \]
elde edilir. Nihai resim ise katmanların uygun yeniden boyutlandırma ve hizalama işlemleriyle bir araya getirilmesiyle tanımlanır:
\[ O=\sum_{l=1}^{L} U_l(O_l) \]
Çalışmada son katman indeksi \(L=3\)'tür.
Stroke Generator Nasıl Çalışıyor?
LogicPainter'ın stroke generator'ı, fırça biçimini ve fırça rengini tek bir GAN çıktısına bırakmak yerine iki üretici kullanarak önce darbe prototipini üretir, ardından ikinci üreticiyle darbeyi temizleyip hedef renge yeniden boyar; böylece canvas'a tekrar tekrar bindirilebilecek daha kararlı ve kontrol edilebilir fırça ilkelleri elde edilir.
Yazarlar standart GAN tabanlı fırça üretiminin bazı durumlarda beyaz arka planda kirli veya heterojen piksel değerleri oluşturabildiğini belirtmektedir. Bu tür çıktı, doğrudan canvas üzerine çok sayıda kez bindirildiğinde istenmeyen renk lekelerine yol açabilir.
LogicPainter bu nedenle iki üreticili bir yapı kullanır:
- \(G\): Rastgele parametrelerden temel fırça darbesi morfolojisini üretir.
- \(G'\): Oluşturulan darbeyi hedef renk parametreleriyle yeniden renklendirir ve temizler.
- \(D\): Gerçek stroke örnekleriyle iki üreticinin çıktılarını ayırt etmeye çalışan discriminator'dır.
Discriminator kaybı
Kaynak discriminator kaybını şu şekilde tanımlar:
\[ \mathcal{L}_D= \frac{1}{K} \sum_{k=1}^{K} \left[ -\log D(x_k) -\log(1-D(G(n_k))) -\log(1-D(G'(G(n_k),m_k))) \right] \]
Birinci terim gerçek stroke örneklerinin gerçek olarak sınıflandırılmasını, ikinci ve üçüncü terimler ise iki generator çıktısının sahte olarak ayrıştırılmasını teşvik eder.
Birinci generator kaybı
\[ \mathcal{L}_G= \frac{1}{K} \sum_{k=1}^{K} -\log D(G(n_k)) \]
Bu kayıp \(G\)'nin ürettiği stroke prototiplerini discriminator açısından gerçek stroke örneklerine yaklaştırmayı amaçlar.
İkinci generator kaybı
\[ \mathcal{L}_{G'}= \frac{1}{K} \sum_{k=1}^{K} -\log D(G'(G(n_k),m_k)) \]
İkinci generator ise yeniden renklendirilen stroke çıktısını gerçekçi hale getirmeye çalışır.
Alpha tabanlı yeniden renklendirme
Fırçanın nihai renkli biçimi kaynakta:
\[ S=\alpha\times m_t \]
olarak ifade edilir.
Stroke prototipinden alpha desteği:
\[ \alpha_t=\phi(G(n_t)) \]
ile çıkarılır ve nihai stroke:
\[ S=G'(G(n_t),m_t) = \phi(G(n_t))\times m_t \]
olarak elde edilir. Bu ayrım, fırçanın geometrik desteği ile renk bilgisini birbirinden ayırır.
Difüzyon Güdümlü İyileştirme Gerçek Bir DDPM midir?
Hayır. LogicPainter standart DDPM anlamında piksel uzayında olasılıksal bir ileri ve geri difüzyon zinciri kurmaz; çalışma, rastgele başlatılmış fırça parametrelerinin ve canvas durumlarının hedef görüntüye doğru tekrarlanan gradyan güncellemeleriyle düzeltilmesini ters-difüzyona benzer bir iyileştirme süreci olarak yorumlamaktadır.
Bu ayrım makalenin doğru anlaşılması açısından kritiktir. LogicPainter'ın kullandığı yaklaşımda “noise → denoising → image” biçiminde klasik bir piksel-uzayı DDPM üretimi yapılmaz.
Bunun yerine latent stroke parametreleri:
\[ z_l^t=\{n_l^t,m_l^t\} \]
olarak tanımlanır. \(n_l^t\) darbenin prototip biçimini, \(m_l^t\) ise renk parametrelerini kontrol eder.
İlgili stroke:
\[ S_l^t=G'(G(n_l^t),m_l^t) \]
biçiminde üretilir.
Daha sonra canvas geçişi soyut olarak:
\[ O_l^{t+1}=\mathcal{T}(O_l^t,z_l^t) \]
şeklinde ifade edilir. Buradaki \(\mathcal{T}\), diferansiyellenebilir stroke render ve compositing operatörüdür.
Feature-space discrepancy
Model ham piksel farkını doğrudan optimize etmek yerine ResNet tabanlı özellik temsilini kullanmaktadır. Ön plan aşamasındaki kayıp:
\[ \mathcal{L}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_f)_j - R(O\odot M_f)_j \right\| \]
şeklindedir.
Arka plan için aynı yapı \(M_b\) maskesiyle:
\[ \mathcal{L}_{bg}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_b)_j - R(O\odot M_b)_j \right\| \]
olarak kullanılır.
Burada \(R(\cdot)\) ResNet feature extractor'ı, \(J\) çıkarılan feature map sayısını temsil eder.
Stroke parametrelerinin güncellenmesi
Stroke parametreleri gradyan tabanlı optimizasyonla:
\[ z_l^{t+1} = z_l^t - \eta\nabla_{z_l^t}\mathcal{L}_l^t \]
biçiminde güncellenir.
\(\eta\) adım büyüklüğüdür. Böylece hedef içeriği kötü temsil eden stroke konfigürasyonları kademeli olarak düzeltilir.
Canvas gelişimi:
\[ O_l^0\rightarrow O_l^1\rightarrow \cdots \rightarrow O_l^T \]
biçiminde ilerler. Yazarlar bu zinciri ters-difüzyon benzeri bir iyileştirme olarak yorumlar; ancak açık biçimde bunun DDPM anlamında kesin bir Markov difüzyon modeli iddiası olmadığını belirtir.
Çalışmanın Yöntemi ve Bulguları
Deney altyapısı
Bütün deneyler Intel i7-7700K CPU ve NVIDIA Titan RTX GPU bulunan bir workstation üzerinde gerçekleştirilmiştir.
Değerlendirme için üç veri kaynağı kullanılmıştır:
- CelebA,
- ImageNet,
- gerçek dünya fotoğrafları.
Test görüntüleri portre, hayvan, bitki, çiçek ve bina gibi farklı semantik kategorileri kapsamaktadır.
Varsayılan LogicPainter yapılandırması:
- iki aşamalı ön plan/arka plan boyama,
- üç render katmanı,
- ResNet tabanlı feature extraction loss,
- grid başına \(\sigma=3\) stroke
kullanmaktadır.
Görsel karşılaştırmalar
Şekil 6'da CelebA, ImageNet ve gerçek fotoğraflardaki üretim süreci gösterilmektedir. Görsellerde ana nesne önce kaba fırça izleriyle oluşmakta, daha sonra ayrıntıları artmakta ve son aşamada arka plan tamamlanmaktadır.
Yazarların görsel değerlendirmesine göre yüz yapıları, hayvan konturları, çiçek yaprakları ve bina geometrileri stilizasyon sonrasında büyük ölçüde tanınabilir kalmaktadır. Aynı zamanda nihai görüntüler salt fotoğraf rekonstrüksiyonu yerine görünür fırça izi üretmektedir.
Rakip yöntemlerle karşılaştırma
LogicPainter üç temsilci yöntemle karşılaştırılmıştır:
| Yöntem | Kaynakta vurgulanan güçlü yön | Kaynakta vurgulanan sınırlılık |
|---|---|---|
| SNP | Belirgin stroke ve stil görünümü | İnce semantik içeriğin bir kısmını kaybedebilme |
| PTF | Güçlü stroke tabanlı stilizasyon | Yapısal ayrıntının stil uğruna zayıflayabilmesi |
| LTP | İçerik koruma | Çıktının fotoğrafik rekonstrüksiyona yakın kalabilmesi |
| LogicPainter | İçerik, stroke görünümü ve boyama sırası arasında denge | Her bireysel değerlendirme ölçütünde en yüksek puanı almamaktadır |
Kullanıcı Çalışmaları LogicPainter Hakkında Ne Gösterdi?
Kullanıcı çalışmaları, LogicPainter'ın özellikle renk, estetik bütünlük ve insan benzeri boyama sırası açısından güçlü algılandığını; buna karşılık doku veya salt içerik koruma gibi bazı tekil kriterlerde rakip yöntemlerin daha yüksek puan alabildiğini göstermektedir.
Birinci kullanıcı çalışması
İlk kullanıcı çalışmasına toplam 20 katılımcı dahil edilmiştir. Katılımcılar 18–40 yaş aralığında farklı yaş, cinsiyet ve eğitim gruplarındandır; katılımcıların %10'u sanat geçmişine sahiptir.
Her sonuç 1,0–5,0 ölçeğinde şu beş kriterle değerlendirilmiştir:
- Content,
- Texture,
- Colour,
- Style,
- Beauty.
Sanat geçmişi olan katılımcılarda LogicPainter
| Kriter | Ortalama | Standart sapma | %95 güven aralığı |
|---|---|---|---|
| Content | 3,888 | 0,103 | 3,838–3,937 |
| Texture | 3,713 | 0,048 | 3,690–3,735 |
| Colour | 4,588 | 0,118 | 4,531–4,644 |
| Style | 4,575 | 0,132 | 4,511–4,639 |
| Beauty | 4,125 | 0,065 | 4,094–4,156 |
Bu grupta renk, stil ve güzellik ölçütleri %95 güven düzeyinde 4 puanın üzerinde kalmıştır. Özellikle Colour metriği için 4,531–4,644 aralığı raporlanmaktadır.
Sanat geçmişi olmayan katılımcılarda LogicPainter
| Kriter | Ortalama | Standart sapma | %95 güven aralığı |
|---|---|---|---|
| Content | 4,388 | 0,144 | 4,319–4,456 |
| Texture | 3,688 | 0,149 | 3,616–3,759 |
| Colour | 4,475 | 0,405 | 4,280–4,670 |
| Style | 4,488 | 0,411 | 4,290–4,685 |
| Beauty | 4,188 | 0,125 | 4,127–4,248 |
Sanat geçmişi olmayan katılımcılarda Content, Colour, Style ve Beauty ölçütlerinin %95 güven aralıkları 4 puanın üzerinde kalmıştır.
İkinci kullanıcı çalışması: boyama sırası
İkinci kullanıcı çalışmasında katılımcılar yalnız nihai görüntüyü değil, yöntemlerin oluşturduğu boyama videolarını değerlendirmiştir. Ölçek yine 1–5 arasındadır ve yüksek değer, sürecin insan ressamın boyama pratiğine daha yakın algılandığını ifade etmektedir.
Şekil 9'da LogicPainter hem sanat geçmişi olan hem de olmayan gruplarda 5'e yakın değerlendirmeler almış ve karşılaştırılan SNP, PTF ve LTP yöntemlerinden açık biçimde daha yüksek değerlendirilmiştir. Kaynak şekli kesin bar değerlerini metin halinde vermediği için burada grafikten yeni kesin sayı türetilmemiştir.
Ablasyon Çalışmaları Hangi Bileşenlerin Önemli Olduğunu Gösterdi?
Ablasyon deneyleri, nihai resim kalitesinin yalnız ana mimariye değil kullanılan feature extractor'a, stroke stiline, katman sırasına ve her grid'deki stroke sayısına da bağlı olduğunu; özellikle ResNet özellikleri ve orta yoğunluktaki \(\sigma=3\) ayarının içerik korunumu ile hesaplama maliyeti arasında uygun bir denge sunduğunu göstermiştir.
ResNet ve GoogleNet
Feature-extraction loss için ResNet ve GoogleNet karşılaştırılmıştır. Kaynak sonuçlarına göre GoogleNet tabanlı özellikler bazı örneklerde daha fazla içerik ayrıntısı kaybederken ResNet, yapısal içerik ile stilize görünüm arasında daha güçlü denge sağlamıştır.
Stroke stili
Varsayılan stroke stiline ek olarak Neural Painter kaynaklı pastel benzeri stroke veri seti de denenmiştir. Bu değişiklik, modelin mimarisini değiştirmeden daha pastel veya suluboya benzeri görsel sonuçlar üretilebildiğini göstermiştir.
Katman sırası
Varsayılan model bütün foreground katmanlarını tamamladıktan sonra background katmanlarına geçer. Ablasyon deneyinde bunun alternatifi olarak aynı katman içinde foreground ve background birlikte işlenmiş ve sonra bir üst katmana geçilmiştir.
Sonuçlar, LogicPainter'ın farklı boyama sıralarını destekleyebildiğini, buna rağmen kaba-inceden işleme özelliğini koruduğunu göstermektedir.
Stroke sayısı
Grid başına stroke sayısı \(\sigma=1\) ile \(\sigma=5\) arasında test edilmiştir.
- \(\sigma=1\): Sonuçlar daha seyrek ve ayrıntı kaybı daha yüksektir.
- \(\sigma=5\): Daha fazla ince ayrıntı korunmaktadır.
- \(\sigma=3\): Görsel kalite ile hesaplama maliyeti arasında kaynak tarafından iyi bir uzlaşma olarak seçilmiştir.
Yeni stroke stili
Yazarlar ayrıca kübik Bézier eğrileri boyunca hareket eden değişken çaplı içi boş daireler kullanan alternatif bir stroke mekanizması tasarlamıştır. Bu deneylerde de temel semantik içerik korunurken farklı doku ve artistik karakterlerin üretilebildiği gösterilmiştir.
Çalışmanın desteklediği sonuçlar
- Foreground-first/background-second düzeni açık biçimde uygulanabilir.
- Katmanlı coarse-to-fine rendering görsel ayrıntıyı kademeli olarak artırabilir.
- İki aşamalı stroke generator, şekil ve renk kontrolünü birbirinden ayırabilir.
- Feature-space loss, stroke parametrelerinin iteratif optimizasyonunda kullanılabilir.
- LogicPainter farklı stroke stillerini destekleyebilir.
- Kullanıcılar LogicPainter'ın boyama sırasını karşılaştırılan yöntemlerden daha insan benzeri olarak değerlendirmiştir.
- Model içerik koruma ile resimsel stil arasında rekabetçi bir denge sunmaktadır.
Çalışmanın desteklemediği sonuçlar
- LogicPainter gerçek insan ressamların bilişsel sürecini eksiksiz modellediğini kanıtlamamaktadır.
- “Human-logic” ifadesi insan beyninin nörobilişsel modeli değildir.
- LogicPainter standart bir DDPM değildir.
- Yöntem her bireysel kullanıcı metriğinde bütün rakiplerden üstün değildir.
- 20 kişilik ilk kullanıcı çalışması bütün nüfusu temsil eden büyük ölçekli bir davranış araştırması değildir.
- Çalışma gerçek fiziksel boya, fırça sürtünmesi veya akışkan boya dinamiğini simüle etmemektedir.
- Dinamik sahneler ve kullanıcı yönlendirmeli tercih kontrolü mevcut çalışmada çözülmüş problemler değildir; gelecek çalışma olarak önerilmektedir.
Gelecek çalışma yönleri
Yazarlar gelecekte yöntemin dinamik sahnelere genişletilmesini, kullanıcı tarafından yönlendirilen resim tercihlerini sisteme dahil etmeyi ve daha fazla sanatsal stroke stilini desteklemeyi önermektedir. Bu özellikler mevcut sistemin test edilmiş yetenekleri değil, gelecekte araştırılması planlanan yönlerdir.
Kaynak ve Yöntem Notu
Özgün başlık: LogicPainter: Layered Stroke Rendering with Diffusion-Driven Refinement for Human-Logic AI Painting.
Yazarlar: Qian Wang, Cai Guo, Hong-Ning Dai, Maaike Kleinsmann, Yike Guo ve Pan Wang.
Sorumlu yazar: Pan Wang.
Kurumlar: Guangdong University of Technology, Hanshan Normal University, Hong Kong Baptist University, Delft University of Technology ve The Hong Kong University of Science and Technology.
ORCID: Kaynak, Qian Wang için 0000-0002-5892-8093 ORCID bilgisini vermektedir.
Platform: SSRN.
SSRN Abstract No.: 7023467.
Kaynak türü: Araştırma preprinti.
Hakemlik durumu: Hakem değerlendirmesinden geçmemiştir.
DOI: Kaynakta belirtilmemiştir.
Dergi: Hakemli nihai dergi kaydı kaynakta verilmemektedir. Sayfa altlarında “Preprint submitted to Elsevier” ifadesi bulunmaktadır.
Finansman: Kaynak, araştırma projesinin “National Science Foundation No. 62402122” tarafından desteklendiğini belirtmektedir.
Temel yöntem: Saliency tabanlı foreground/background ayrımı, sketch prior, GAN tabanlı iki aşamalı stroke generator, ResNet feature-space loss, coarse-to-fine layer renderer, diferansiyellenebilir stroke compositing ve gradyan tabanlı iterative stroke optimisation.
Veri kümeleri: CelebA, ImageNet ve gerçek dünya fotoğrafları.
Karşılaştırılan yöntemler: Stylized Neural Painting (SNP), Paint Transformer (PTF) ve Learning to Paint (LTP).
Donanım: Intel i7-7700K CPU ve NVIDIA Titan RTX GPU.
Varsayılan rendering ayarı: Üç katman ve grid başına \(\sigma=3\) fırça darbesi.
Temel yöntemsel sınırlılık: “Diffusion-driven” ifadesi klasik DDPM ile eş anlamlı değildir. Kaynak, p ve q geçişlerini tam bir DDPM Markov zinciri iddiası için değil, stroke-canvas durumlarının iteratif iyileştirilmesini kavramsallaştırmak için kullandığını açıkça belirtmektedir.
Kullanıcı çalışması sınırı: İnsan benzeri boyama düzenine ilişkin sonuçlar kullanıcı algısına dayanmaktadır. İlk çalışma 20 katılımcıyla yapılmıştır ve bu değerlendirme gerçek ressamların bilişsel süreçlerinin deneysel nörobilimsel ölçümü değildir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir