Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Kompyuter fanlari / LogicPainter: Inson Mantig‘iga Asoslangan Sun’iy Intellekt Rasmida Qatlamli Mo‘yqalam Zarbalari va Diffusion-Driven Takomillashtirish
Kompyuter fanlari

LogicPainter: Inson Mantig‘iga Asoslangan Sun’iy Intellekt Rasmida Qatlamli Mo‘yqalam Zarbalari va Diffusion-Driven Takomillashtirish

LogicPainter referens tasvirni bir qadamda stilizatsiya qilish o‘rniga uni aniq mo‘yqalam zarbalari bilan, oldingi rejani orqa rejadan avval ishlab va qo‘pol tuzilishdan nozik tafsilotlarga tomon ilgarilab qayta yaratadigan inson mantig‘idan ilhomlangan neyron rasm chizish doirasidir. Tizim saliency mask moduli, sketcher, controllable stroke generator, layer renderer va raqamli canvas komponentlarini birlashtiradi.

13/09/2026  Veri Anla 113 marta ko‘rildi
LogicPainter: Inson Mantig‘iga Asoslangan Sun’iy Intellekt Rasmida Qatlamli Mo‘yqalam Zarbalari va Diffusion-Driven Takomillashtirish

LogicPainter, referens tasvirni bir qadamda stilizatsiya qilish o‘rniga uni aniq mo‘yqalam zarbalari bilan, oldingi rejani orqa rejadan avval ishlab va qo‘pol tuzilishdan nozik tafsilotlarga tomon ilgarilab qayta yaratadigan inson mantig‘idan ilhomlangan neyron rasm chizish doirasidir. Tizim saliency mask moduli, sketcher, controllable stroke generator, layer renderer va raqamli canvas komponentlarini birlashtiradi. Mo‘yqalam parametrlari tasodifiy boshlanishdan feature-space loss orqali iterativ tarzda optimallashtiriladi va bu jarayon maqolada diffusion-driven refinement sifatida talqin qilinadi. CelebA, ImageNet va real dunyo suratlari ustidagi tajribalar hamda foydalanuvchi tadqiqotlari LogicPainter mazmunga sodiqlik, rassomona ko‘rinish va insonga o‘xshash bo‘yash ketma-ketligi o‘rtasida kuchli muvozanat yarata olishini ko‘rsatadi. Biroq ish peer review’dan o‘tmagan preprint bo‘lib, “inson mantig‘i” natijasi haqiqiy rassomlarning kognitiv jarayonlarini bevosita o‘lchash emas, balki foydalanuvchilarning tizim bo‘yash ketma-ketligiga oid idrokiga asoslangan eksperimental baholashdir.

LogicPainter’ning asosiy yangiligi sun’iy intellekt rasm yaratishni faqat tasvirdan-tasvirga o‘zgartirish muammosi sifatida ko‘rmasligidir. Tizim bo‘yashni qaysi hudud avval ishlanishi, mo‘yqalam zarbalari qanday yaratilishi, canvas qaysi tartibda yangilanishi va tafsilot qatlamdan qatlamga qanday oshirilishi aniq modellashtiriladigan protseduraviy vizual yaratish jarayoni sifatida belgilaydi.

LogicPainter Nima?

LogicPainter referens tasvirni bevosita bitta stilizatsiyalangan chiqish sifatida yaratish o‘rniga uni mo‘yqalam zarbalari bilan bosqichma-bosqich quradigan; oldingi rejani avval, orqa rejani keyin bo‘yaydigan va har bir hududni qo‘pol tuzilishdan nozik tafsilotlarga tomon qatlamlaydigan sun’iy intellekt rasm chizish doirasidir.

Ishning boshlang‘ich nuqtasi klassik tasvir uslubini ko‘chirish bilan haqiqiy ma’nodagi “bo‘yash jarayoni” o‘rtasida farq bor degan qarashdir. Uslub ko‘chirish modeli yakuniy tasvirni to‘g‘ridan-to‘g‘ri o‘zgartirishi mumkin. LogicPainter esa tasvir qanday hosil bo‘lishini ham modellashtirishga urinadi: sketch yaratiladi, asosiy obyekt aniqlanadi, oldingi reja bo‘yaladi, orqa reja qo‘shiladi va mo‘yqalam zarbalari tobora kichrayib boruvchi masshtablarda takomillashtiriladi.

Shu sababli tadqiqotda AI painting quyidagicha konseptuallashtiriladi: yakuniy tasvirni bir martada yaratish emas, balki aniq va ketma-ket mo‘yqalam zarbalari orqali bosqichma-bosqich hosil qilish.

Tadqiqot muammosi

Mualliflar ko‘rsatgan asosiy muammo ikki qismdan iborat. Ko‘plab mavjud neyron rasm tizimlari stroke-by-stroke ishlov berishni bajarsa ham, qaysi obyekt avval bo‘yalishi kerakligini inson rassomlari foydalanishi mumkin bo‘lgan semantik ustuvorliklarga ko‘ra aniq modellashtirmaydi. Boshqa tomondan, tafsilotni saqlash bilan ko‘rinadigan rassomona mo‘yqalam xarakterini kuchaytirish o‘rtasida yaqqol murosa mavjud.

Agar usul tasvir mazmunini juda qattiq saqlasa, natija fotografik rekonstruksiyaga yaqinlashishi mumkin. Mo‘yqalam teksturasi va stilizatsiyani ortiqcha kuchaytirsa esa obyekt tuzilishi va kichik semantik tafsilotlar yo‘qolishi mumkin. LogicPainter bu ikki maqsadni bir pipeline ichida birgalikda ko‘rib chiqishga urinadi.

LogicPainter Insonga O‘xshash Bo‘yash Ketma-ketligini Qanday Modellashtiradi?

LogicPainter tasvirni saliency asosida oldingi va orqa rejaga ajratadi; avval asosiy obyektni uch qatlam davomida qo‘pol shakldan nozik tafsilotlargacha ishlaydi, so‘ng ayni canvas holatini saqlagan holda orqa rejani yana qatlamli tarzda yakunlaydi. Shu tariqa tizim butun tasvirni boshidan teng ahamiyatda bo‘yash o‘rniga semantik “asosiy obyekt avval, muhit keyin” tartibini qo‘llaydi.

Besh asosiy komponent

Maqolaning 2-rasmida LogicPainter arxitekturasi besh asosiy modulga bo‘linadi:

  1. Salience mask module: Referens tasvirdagi asosiy oldingi reja obyektini aniqlaydi.
  2. Sketcher: Dastlabki canvas ustiga strukturaviy eskiz oldshartini joylashtiradi.
  3. Stroke generator: Shakli va rangi boshqariladigan rassomona mo‘yqalam zarbalarini hosil qiladi.
  4. Layer renderer: Mo‘yqalam zarbalarini qatlamlar bo‘ylab canvas’ga joylashtiradi va optimallashtiradi.
  5. Digital canvas: Barcha iterativ jarayonlar yig‘iladigan tasvir holatidir.

Oldingi reja maskasi \(M_f\), orqa reja maskasi esa \(M_b\) bilan belgilanadi. Bu ikki maska faqat diqqat og‘irligi sifatida ishlatilmaydi; rasmning haqiqiy bo‘yash ketma-ketligini belgilaydi.

1-bosqich: Oldingi reja

Birinchi bosqichda model faqat oldingi reja maskasi bilan aniqlangan asosiy obyekt ustida ishlaydi. Sketcher yaratgan asosiy kontur global tuzilishni qurishga yordam beradi. Layer renderer va stroke generator birgalikda asosiy obyektni uchta ruxsat/tafsilot qatlamida rivojlantiradi.

2-bosqich: Orqa reja

Ikkinchi bosqich bo‘sh canvas bilan boshlanmaydi. Oldingi reja bosqichida yakunlangan canvas bevosita boshlang‘ich holat sifatida ishlatiladi. Shunday qilib, orqa reja allaqachon yaratilgan asosiy obyekt atrofida joylashtiriladi va oldingi rejaning semantik ustuvorligi saqlanadi.

Qo‘poldan-Nozikgacha Qatlamli Ishlov Berish Nimani Anglatadi?

Qo‘poldan-nozikgacha ishlov berish birinchi qatlamda keng hududlar va umumiy rang/tuzilish kompozitsiyasini katta va siyrak mo‘yqalam zarbalari bilan qurish, keyingi qatlamlarda esa ko‘proq va vizual jihatdan kichikroq zarbalardan foydalanib shakl, tekstura va mahalliy tafsilotni asta-sekin oshirishni anglatadi.

LogicPainter ko‘pchilik tajribalarda uch qatlamdan foydalanadi. Birinchi qatlam umumiy tuzilish va asosiy rang taqsimotini quradi. Ikkinchi va uchinchi qatlamlar tobora zichlashib boruvchi grid’lar orqali kichikroq vizual masshtabdagi zarbalarni qo‘shadi.

\(l\) qatlam uchun grid soni manbada quyidagi formula bilan aniqlanadi:

\[ W_l=(2^{l+1}-1)^2 \]

Bu yerda \(W_l\) tegishli qatlamdagi grid sonidir. Har bir grid ichida \(\sigma\) ta mo‘yqalam zarbasi ishlatilsa, umumiy zarbalar soni:

\[ T=W_l\times \sigma \]

bo‘ladi.

Manbada keltirilgan misolda \(\sigma=3\) va \(l=1\) uchun:

\[ T=(2^{1+1}-1)^2 \times 3 =3^2\times3 =27 \]

mo‘yqalam zarbasi ishlatiladi.

Qatlam indeksi oshgani sari ayni canvas ustida ko‘proq grid ishlatiladi, shuning uchun har bir mahalliy hudud yanada nozik masshtabdagi zarbalar bilan ishlanishi mumkin. Bu mexanizm vizual ravishda “keng bo‘yoq bloklari → o‘rta masshtabdagi shakllar → nozik tafsilotlar” o‘tishini yaratadi.

Canvas yangilanishi

Har bir mo‘yqalam zarbasi alpha compositing mantiqi bilan mavjud canvas ustiga joylashtiriladi. Manbada canvas yangilanishi quyidagicha berilgan:

\[ O^{t+1}_{l} = O^{t}_{l}\odot(1-\alpha_t) + \alpha_t\times m_t \]

Bu yerda \(O^{t}_{l}\) — \(l\)-qatlamdagi \(t\)-zarbadan oldingi canvas holati; \(\alpha_t\) mo‘yqalam zarbasining alpha tayanchini, \(m_t\) esa rang parametrlarini ifodalaydi. Tenglama yangi zarbaning avvalgi canvas holatiga o‘z maskasi nisbatida aralashtirilishini tavsiflaydi.

Qatlamni yakunlash

Bir qatlamdagi barcha \(T\) zarba joylashtirilganda:

\[ O_l=O^{T}_{l} \]

hosil bo‘ladi. Yakuniy rasm esa qatlamlarni mos qayta o‘lchamlash va tekislash amallari bilan birlashtirish orqali aniqlanadi:

\[ O=\sum_{l=1}^{L} U_l(O_l) \]

Tadqiqotda yakuniy qatlam indeksi \(L=3\).

Stroke Generator Qanday Ishlaydi?

LogicPainter’ning stroke generator’i mo‘yqalam shakli va rangini bitta GAN chiqishiga topshirish o‘rniga ikki generator yordamida avval zarba prototipini hosil qiladi, so‘ng ikkinchi generator bilan zarbani tozalab maqsad rangiga qayta bo‘yaydi; natijada canvas ustiga qayta-qayta qo‘yish mumkin bo‘lgan barqarorroq va boshqariladigan mo‘yqalam primitivlari olinadi.

Mualliflar standart GAN asosidagi mo‘yqalam generatsiyasi ayrim hollarda oq fonda iflos yoki geterogen piksel qiymatlarini yuzaga keltirishi mumkinligini qayd etadi. Bunday chiqish canvas ustiga ko‘p marta bevosita qo‘yilganda istalmagan rang dog‘lariga olib kelishi mumkin.

Shu sababli LogicPainter ikki generatorli tuzilishdan foydalanadi:

  • \(G\): Tasodifiy parametrlardan asosiy mo‘yqalam zarbasi morfologiyasini hosil qiladi.
  • \(G'\): Yaratilgan zarbani maqsad rang parametrlari bilan qayta bo‘yaydi va tozalaydi.
  • \(D\): Haqiqiy stroke namunalarini ikki generator chiqishlaridan farqlashga urinadigan discriminator.

Discriminator yo‘qotishi

Manba discriminator yo‘qotishini quyidagicha aniqlaydi:

\[ \mathcal{L}_D= \frac{1}{K} \sum_{k=1}^{K} \left[ -\log D(x_k) -\log(1-D(G(n_k))) -\log(1-D(G'(G(n_k),m_k))) \right] \]

Birinchi had haqiqiy stroke namunalarining haqiqiy deb tasniflanishini, ikkinchi va uchinchi hadlar esa ikki generator chiqishlarining soxta sifatida ajratilishini rag‘batlantiradi.

Birinchi generator yo‘qotishi

\[ \mathcal{L}_G= \frac{1}{K} \sum_{k=1}^{K} -\log D(G(n_k)) \]

Bu yo‘qotish \(G\) yaratgan stroke prototiplarini discriminator nuqtai nazaridan haqiqiy stroke namunalariga yaqinlashtirishni maqsad qiladi.

Ikkinchi generator yo‘qotishi

\[ \mathcal{L}_{G'}= \frac{1}{K} \sum_{k=1}^{K} -\log D(G'(G(n_k),m_k)) \]

Ikkinchi generator qayta ranglangan stroke chiqishini realistik qilishga urinadi.

Alpha asosidagi qayta ranglash

Mo‘yqalamning yakuniy rangli shakli manbada:

\[ S=\alpha\times m_t \]

ko‘rinishida ifodalanadi.

Stroke prototipidan alpha tayanchi:

\[ \alpha_t=\phi(G(n_t)) \]

orqali olinadi va yakuniy stroke:

\[ S=G'(G(n_t),m_t) = \phi(G(n_t))\times m_t \]

ko‘rinishida hosil bo‘ladi. Bu ajratish mo‘yqalamning geometrik tayanchi bilan rang ma’lumotini bir-biridan ajratadi.

Diffusion-Driven Refinement Haqiqiy DDPMmi?

Yo‘q. LogicPainter standart DDPM ma’nosida piksel fazosida ehtimollik asosidagi oldinga va orqaga diffusion zanjirini qurmaydi; tadqiqot tasodifiy boshlangan mo‘yqalam parametrlarini va canvas holatlarini maqsad tasvirga qarab takroriy gradient yangilanishlari bilan tuzatishni reverse-diffusion’ga o‘xshash refinement jarayoni sifatida talqin qiladi.

Bu farq maqolani to‘g‘ri tushunish uchun muhimdir. LogicPainter yondashuvida “noise → denoising → image” ko‘rinishidagi klassik piksel-fazosi DDPM generatsiyasi bajarilmaydi.

Buning o‘rniga latent stroke parametrlari:

\[ z_l^t=\{n_l^t,m_l^t\} \]

deb aniqlanadi. \(n_l^t\) zarbaning prototip shaklini, \(m_l^t\) esa rang parametrlarini boshqaradi.

Tegishli stroke:

\[ S_l^t=G'(G(n_l^t),m_l^t) \]

ko‘rinishida hosil qilinadi.

Keyin canvas o‘tishi abstrakt tarzda:

\[ O_l^{t+1}=\mathcal{T}(O_l^t,z_l^t) \]

deb ifodalanadi. Bu yerdagi \(\mathcal{T}\) differensiallanuvchi stroke render va compositing operatoridir.

Feature-space discrepancy

Model xom piksel farqini bevosita optimallashtirish o‘rniga ResNet asosidagi feature ifodasidan foydalanadi. Oldingi reja bosqichidagi yo‘qotish:

\[ \mathcal{L}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_f)_j - R(O\odot M_f)_j \right\| \]

ko‘rinishidadir.

Orqa reja uchun ayni tuzilma \(M_b\) maskasi bilan:

\[ \mathcal{L}_{bg}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_b)_j - R(O\odot M_b)_j \right\| \]

ko‘rinishida qo‘llanadi.

Bu yerda \(R(\cdot)\) ResNet feature extractor’ni, \(J\) esa chiqarilgan feature map sonini bildiradi.

Stroke parametrlarini yangilash

Stroke parametrlari gradient asosidagi optimallashtirish bilan:

\[ z_l^{t+1} = z_l^t - \eta\nabla_{z_l^t}\mathcal{L}_l^t \]

ko‘rinishida yangilanadi.

\(\eta\) qadam kattaligidir. Shu tariqa maqsad mazmunni yomon ifodalovchi stroke konfiguratsiyalari bosqichma-bosqich tuzatiladi.

Canvas rivojlanishi:

\[ O_l^0\rightarrow O_l^1\rightarrow \cdots \rightarrow O_l^T \]

ko‘rinishida davom etadi. Mualliflar bu zanjirni reverse-diffusion’ga o‘xshash refinement sifatida talqin qiladi; biroq bu DDPM ma’nosida aniq Markov diffusion modeli haqidagi da’vo emasligini ochiq aytadi.

Tadqiqot Metodi va Natijalari

Tajriba infratuzilmasi

Barcha tajribalar Intel i7-7700K CPU va NVIDIA Titan RTX GPU mavjud workstation’da o‘tkazilgan.

Baholash uchun uchta ma’lumot manbasi ishlatilgan:

  • CelebA,
  • ImageNet,
  • real dunyo suratlari.

Test tasvirlari portret, hayvon, o‘simlik, gul va bino kabi turli semantik kategoriyalarni qamrab oladi.

Standart LogicPainter konfiguratsiyasi:

  • ikki bosqichli oldingi reja/orqa reja bo‘yash,
  • uch render qatlami,
  • ResNet asosidagi feature extraction loss,
  • har bir grid uchun \(\sigma=3\) stroke

dan foydalanadi.

Vizual taqqoslashlar

6-rasmda CelebA, ImageNet va real suratlar uchun ishlab chiqarish jarayoni ko‘rsatilgan. Tasvirlarda asosiy obyekt avval qo‘pol mo‘yqalam izlari bilan paydo bo‘ladi, keyin tafsilotlari ortadi va oxirgi bosqichda orqa reja yakunlanadi.

Mualliflarning vizual bahosiga ko‘ra yuz tuzilmalari, hayvon konturlari, gul barglari va bino geometriyalari stilizatsiyadan keyin katta darajada tanib bo‘ladigan holda qoladi. Shu bilan birga yakuniy tasvirlar shunchaki fotografik rekonstruksiya emas, ko‘rinadigan mo‘yqalam izlarini hosil qiladi.

Raqib usullar bilan taqqoslash

LogicPainter uchta vakil usul bilan taqqoslangan:

UsulManbada ta’kidlangan kuchli tomonManbada ta’kidlangan cheklov
SNPYaqqol stroke va uslub ko‘rinishiNozik semantik mazmunning bir qismini yo‘qotishi mumkin
PTFKuchli stroke asosidagi stilizatsiyaStrukturaviy tafsilot uslub foydasiga zaiflashishi mumkin
LTPMazmunni saqlashChiqish fotografik rekonstruksiyaga yaqin qolishi mumkin
LogicPainterMazmun, stroke ko‘rinishi va bo‘yash ketma-ketligi o‘rtasidagi muvozanatHar bir alohida baholash mezonida eng yuqori ballni olmaydi

Foydalanuvchi Tadqiqotlari LogicPainter Haqida Nimani Ko‘rsatdi?

Foydalanuvchi tadqiqotlari LogicPainter ayniqsa rang, estetik yaxlitlik va insonga o‘xshash bo‘yash ketma-ketligi jihatidan kuchli qabul qilinganini; biroq tekstura yoki sof mazmunni saqlash kabi ayrim yakka mezonlarda raqib usullar yuqoriroq ball olishi mumkinligini ko‘rsatadi.

Birinchi foydalanuvchi tadqiqoti

Birinchi foydalanuvchi tadqiqotiga jami 20 ishtirokchi kiritilgan. Ishtirokchilar 18–40 yosh oralig‘idagi turli yosh, jins va ta’lim guruhlaridan; ishtirokchilarning %10i san’at tajribasiga ega.

Har bir natija 1,0–5,0 shkalasida quyidagi besh mezon bilan baholangan:

  • Content,
  • Texture,
  • Colour,
  • Style,
  • Beauty.

San’at tajribasiga ega ishtirokchilarda LogicPainter

MezonO‘rtachaStandart og‘ish%95 ishonch oralig‘i
Content3,8880,1033,838–3,937
Texture3,7130,0483,690–3,735
Colour4,5880,1184,531–4,644
Style4,5750,1324,511–4,639
Beauty4,1250,0654,094–4,156

Bu guruhda rang, uslub va go‘zallik mezonlari %95 ishonch darajasida 4 balldan yuqori bo‘lib qolgan. Ayniqsa Colour metrikasi uchun 4,531–4,644 oralig‘i qayd etilgan.

San’at tajribasi bo‘lmagan ishtirokchilarda LogicPainter

MezonO‘rtachaStandart og‘ish%95 ishonch oralig‘i
Content4,3880,1444,319–4,456
Texture3,6880,1493,616–3,759
Colour4,4750,4054,280–4,670
Style4,4880,4114,290–4,685
Beauty4,1880,1254,127–4,248

San’at tajribasi bo‘lmagan ishtirokchilarda Content, Colour, Style va Beauty mezonlarining %95 ishonch oralig‘lari 4 balldan yuqori bo‘lib qolgan.

Ikkinchi foydalanuvchi tadqiqoti: bo‘yash ketma-ketligi

Ikkinchi foydalanuvchi tadqiqotida ishtirokchilar faqat yakuniy tasvirni emas, usullar yaratgan bo‘yash videolarini ham baholagan. Shkala yana 1–5 oralig‘ida bo‘lib, yuqori qiymat jarayon inson rassomining bo‘yash amaliyotiga yaqinroq qabul qilinganini anglatadi.

9-rasmda LogicPainter ham san’at tajribasiga ega, ham ega bo‘lmagan guruhlarda 5 ga yaqin baholar olgan va taqqoslangan SNP, PTF hamda LTP usullaridan aniq ravishda yuqoriroq baholangan. Manba rasmida aniq bar qiymatlari matn ko‘rinishida berilmagani sababli, bu yerda grafikdan yangi aniq son chiqarilmagan.

Ablatsiya Tadqiqotlari Qaysi Komponentlar Muhimligini Ko‘rsatdi?

Ablatsiya tajribalari yakuniy rasm sifati faqat asosiy arxitekturaga emas, ishlatilgan feature extractor’ga, stroke uslubiga, qatlam tartibiga va har bir grid’dagi stroke soniga ham bog‘liqligini; ayniqsa ResNet feature’lari va o‘rtacha zichlikdagi \(\sigma=3\) sozlamasi mazmunni saqlash bilan hisoblash xarajati o‘rtasida mos muvozanat taklif qilishini ko‘rsatdi.

ResNet va GoogleNet

Feature-extraction loss uchun ResNet va GoogleNet taqqoslangan. Manba natijalariga ko‘ra GoogleNet asosidagi feature’lar ayrim misollarda ko‘proq mazmun tafsilotini yo‘qotgan bo‘lsa, ResNet strukturaviy mazmun bilan stilizatsiyalangan ko‘rinish o‘rtasida kuchliroq muvozanat yaratgan.

Stroke uslubi

Standart stroke uslubiga qo‘shimcha ravishda Neural Painter manbali pastelga o‘xshash stroke ma’lumotlar to‘plami ham sinab ko‘rilgan. Bu o‘zgarish model arxitekturasini o‘zgartirmasdan yanada pastel yoki akvarelga o‘xshash vizual natijalarni hosil qilish mumkinligini ko‘rsatgan.

Qatlam tartibi

Standart model barcha foreground qatlamlarini tugatgach, background qatlamlariga o‘tadi. Ablatsiya tajribasida muqobil variant sifatida ayni qatlam ichida foreground va background birgalikda ishlangan, so‘ng yuqoriroq qatlamga o‘tilgan.

Natijalar LogicPainter turli bo‘yash ketma-ketliklarini qo‘llab-quvvatlashi mumkinligini, shu bilan birga qo‘poldan-nozikgacha ishlov berish xususiyatini saqlashini ko‘rsatadi.

Stroke soni

Har bir grid uchun stroke soni \(\sigma=1\) dan \(\sigma=5\) gacha sinovdan o‘tkazilgan.

  • \(\sigma=1\): Natijalar siyrakroq va tafsilot yo‘qotilishi yuqoriroq.
  • \(\sigma=5\): Ko‘proq nozik tafsilot saqlanadi.
  • \(\sigma=3\): Vizual sifat bilan hisoblash xarajati o‘rtasida manba tomonidan yaxshi murosa sifatida tanlangan.

Yangi stroke uslubi

Mualliflar, shuningdek, kubik Bézier egri chiziqlari bo‘ylab harakatlanuvchi o‘zgaruvchan diametrli ichi bo‘sh doiralardan foydalanadigan muqobil stroke mexanizmini ishlab chiqqan. Bu tajribalarda ham asosiy semantik mazmun saqlangan holda turli tekstura va badiiy xarakterlar yaratilishi mumkinligi ko‘rsatilgan.

Tadqiqot qo‘llab-quvvatlaydigan xulosalar

  • Foreground-first/background-second tartibi aniq qo‘llanishi mumkin.
  • Qatlamli coarse-to-fine rendering vizual tafsilotni bosqichma-bosqich oshirishi mumkin.
  • Ikki bosqichli stroke generator shakl va rang nazoratini bir-biridan ajratishi mumkin.
  • Feature-space loss stroke parametrlarini iterativ optimallashtirishda ishlatilishi mumkin.
  • LogicPainter turli stroke uslublarini qo‘llab-quvvatlashi mumkin.
  • Foydalanuvchilar LogicPainter’ning bo‘yash ketma-ketligini taqqoslangan usullarga qaraganda insonga o‘xshashroq deb baholagan.
  • Model mazmunni saqlash bilan rassomona uslub o‘rtasida raqobatbardosh muvozanat taklif qiladi.

Tadqiqot qo‘llab-quvvatlamaydigan xulosalar

  • LogicPainter haqiqiy rassomlarning kognitiv jarayonini to‘liq modellashtirishini isbotlamaydi.
  • “Human-logic” iborasi inson miyasining neyrokognitiv modeli emas.
  • LogicPainter standart DDPM emas.
  • Usul har bir alohida foydalanuvchi metrikasida barcha raqiblardan ustun emas.
  • 20 kishilik birinchi foydalanuvchi tadqiqoti butun aholini ifodalovchi keng ko‘lamli xulq-atvor tadqiqoti emas.
  • Tadqiqot haqiqiy fizik bo‘yoq, mo‘yqalam ishqalanishi yoki suyuq bo‘yoq dinamikasini simulyatsiya qilmaydi.
  • Dinamik sahnalar va foydalanuvchi boshqaradigan tanlov nazorati mavjud tadqiqotda hal qilingan muammolar emas; kelajakdagi ish sifatida taklif etilgan.

Kelajakdagi tadqiqot yo‘nalishlari

Mualliflar kelajakda usulni dinamik sahnalarga kengaytirish, foydalanuvchi boshqaradigan rasm afzalliklarini tizimga kiritish va ko‘proq badiiy stroke uslublarini qo‘llab-quvvatlashni taklif qiladi. Bu xususiyatlar mavjud tizimning sinovdan o‘tgan qobiliyatlari emas, balki kelajakda o‘rganilishi rejalashtirilgan yo‘nalishlardir.

Manba va Usul Izohi

Asl sarlavha: LogicPainter: Layered Stroke Rendering with Diffusion-Driven Refinement for Human-Logic AI Painting.

Mualliflar: Qian Wang, Cai Guo, Hong-Ning Dai, Maaike Kleinsmann, Yike Guo va Pan Wang.

Mas’ul muallif: Pan Wang.

Muassasalar: Guangdong University of Technology, Hanshan Normal University, Hong Kong Baptist University, Delft University of Technology va The Hong Kong University of Science and Technology.

ORCID: Manba Qian Wang uchun 0000-0002-5892-8093 ORCID ma’lumotini beradi.

Platforma: SSRN.

SSRN Abstract No.: 7023467.

Manba turi: Tadqiqot preprinti.

Peer review holati: Peer review’dan o‘tmagan.

DOI: Manbada ko‘rsatilmagan.

Jurnal: Yakuniy peer-reviewed jurnal qaydi manbada berilmagan. Sahifa pastlarida “Preprint submitted to Elsevier” iborasi mavjud.

Moliyalashtirish: Manba tadqiqot loyihasi “National Science Foundation No. 62402122” tomonidan qo‘llab-quvvatlanganini bildiradi.

Asosiy usul: Saliency asosidagi foreground/background ajratish, sketch prior, GAN asosidagi ikki bosqichli stroke generator, ResNet feature-space loss, coarse-to-fine layer renderer, differensiallanuvchi stroke compositing va gradient asosidagi iterative stroke optimisation.

Ma’lumotlar to‘plamlari: CelebA, ImageNet va real dunyo suratlari.

Taqqoslangan usullar: Stylized Neural Painting (SNP), Paint Transformer (PTF) va Learning to Paint (LTP).

Uskuna: Intel i7-7700K CPU va NVIDIA Titan RTX GPU.

Standart rendering sozlamasi: Uch qatlam va har bir grid uchun \(\sigma=3\) mo‘yqalam zarbasi.

Asosiy metodologik cheklov: “Diffusion-driven” iborasi klassik DDPM bilan aynan bir ma’noni anglatmaydi. Manba p va q o‘tishlarini to‘liq DDPM Markov zanjiri da’vosi uchun emas, balki stroke-canvas holatlarining iterativ takomillashtirilishini konseptuallashtirish uchun ishlatishini ochiq aytadi.

Foydalanuvchi tadqiqoti chegarasi: Insonga o‘xshash bo‘yash tartibiga oid xulosalar foydalanuvchi idrokiga asoslangan. Birinchi tadqiqot 20 ishtirokchi bilan o‘tkazilgan va bu baholash haqiqiy rassomlarning kognitiv jarayonlarini eksperimental neyroilmiy o‘lchash emas.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati