Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Sayansi ya Kompyuta / LogicPainter: Uchoraji wa AI kwa Mantiki ya Binadamu kwa Utoaji wa Mipigo ya Brashi kwa Tabaka na Uboreshaji Unaoongozwa na Diffusion
Sayansi ya Kompyuta

LogicPainter: Uchoraji wa AI kwa Mantiki ya Binadamu kwa Utoaji wa Mipigo ya Brashi kwa Tabaka na Uboreshaji Unaoongozwa na Diffusion

LogicPainter ni mfumo wa uchoraji wa neva uliohamasishwa na mantiki ya binadamu ambao, badala ya kuufanya picha rejea kuwa ya mtindo fulani kwa hatua moja, huiunda upya kwa mipigo ya wazi ya brashi, ukichakata sehemu ya mbele kabla ya mandharinyuma na kusonga kutoka muundo wa jumla hadi maelezo madogo. Mfumo unaunganisha moduli ya saliency mask, sketcher, controllable stroke generator, layer renderer na digital canvas.

13/09/2026  Veri Anla Imetazamwa mara 114
LogicPainter: Uchoraji wa AI kwa Mantiki ya Binadamu kwa Utoaji wa Mipigo ya Brashi kwa Tabaka na Uboreshaji Unaoongozwa na Diffusion

LogicPainter, ni mfumo wa uchoraji wa neva uliohamasishwa na mantiki ya binadamu ambao, badala ya kuufanya picha rejea kuwa ya mtindo fulani kwa hatua moja, huiunda upya kwa mipigo ya wazi ya brashi, ukichakata sehemu ya mbele kabla ya mandharinyuma na kusonga kutoka muundo wa jumla hadi maelezo madogo. Mfumo unaunganisha moduli ya saliency mask, sketcher, controllable stroke generator, layer renderer na digital canvas. Vigezo vya brashi huboreshwa kwa hatua zinazojirudia kutoka mwanzo wa nasibu kupitia feature-space loss, na mchakato huu unatafsiriwa katika makala kama diffusion-driven refinement. Majaribio kwenye CelebA, ImageNet na picha za ulimwengu halisi pamoja na tafiti za watumiaji yanaonyesha kwamba LogicPainter inaweza kusawazisha kwa nguvu uaminifu wa maudhui, mwonekano wa kichoraji na mpangilio wa uchoraji unaofanana na wa binadamu. Hata hivyo, kazi hii ni preprint ambayo haijapitia peer review, na hitimisho la “mantiki ya binadamu” si kipimo cha moja kwa moja cha mchakato wa utambuzi wa wachoraji halisi, bali ni tathmini ya majaribio inayotegemea mtazamo wa watumiaji kuhusu mpangilio wa uchoraji wa mfumo.

Ubunifu mkuu wa LogicPainter ni kwamba hauchukulii uchoraji wa AI kama tatizo la kubadilisha picha kuwa picha pekee. Mfumo hufafanua uchoraji kama mchakato wa kiutaratibu wa uundaji wa taswira ambapo eneo gani lishughulikiwe kwanza, mipigo ya brashi itengenezweje, canvas isasishwe kwa mpangilio gani na maelezo yaongezeke vipi kutoka tabaka moja hadi jingine, yote yanaigwa kwa uwazi.

LogicPainter ni Nini?

LogicPainter ni mfumo wa uchoraji wa AI unaojenga picha rejea hatua kwa hatua kwa mipigo ya brashi badala ya kuitoa moja kwa moja kama picha moja iliyostailishwa; hupaka sehemu ya mbele kwanza, mandharinyuma baadaye, na hujenga kila eneo kwa tabaka kutoka muundo wa jumla hadi maelezo madogo.

Msingi wa kazi hii ni mtazamo kwamba kuna tofauti kati ya uhamishaji wa mtindo wa picha wa kawaida na “mchakato wa uchoraji” kwa maana halisi. Muundo wa uhamishaji wa mtindo unaweza kubadilisha picha ya mwisho moja kwa moja. LogicPainter, kwa upande mwingine, hujaribu pia kuiga jinsi picha inavyoundwa: sketch hutengenezwa, kitu kikuu hutambuliwa, sehemu ya mbele hupakwa, mandharinyuma huongezwa, na mipigo ya brashi huboreshwa katika vipimo vinavyozidi kuwa vidogo.

Kwa hiyo, AI painting katika kazi hii inaelezewa hivi: si kuunda picha ya mwisho kwa jaribio moja, bali kuijenga hatua kwa hatua kwa mipigo ya brashi iliyo wazi na yenye mpangilio.

Tatizo la utafiti

Tatizo kuu lililoainishwa na waandishi lina sehemu mbili. Ingawa mifumo mingi ya sasa ya uchoraji wa neva hufanya uchakataji wa stroke-by-stroke, haibainishi wazi ni kitu gani kinapaswa kupakwa kwanza kulingana na vipaumbele vya kisemantiki ambavyo wachoraji wa binadamu wanaweza kutumia. Kwa upande mwingine, kuna biashara ya wazi kati ya kuhifadhi maelezo na kuimarisha tabia inayoonekana ya brashi ya kichoraji.

Mbinu inapohifadhi maudhui ya picha kwa ukali sana, matokeo yanaweza kukaribia ujenzi upya wa picha wa kifotografia. Inapoimarisha mno tekstura ya brashi na ustailishaji, muundo wa kitu na maelezo madogo ya kisemantiki yanaweza kupotea. LogicPainter hujaribu kushughulikia malengo haya mawili ndani ya pipeline moja.

LogicPainter Huigaje Mpangilio wa Uchoraji Unaofanana na wa Binadamu?

LogicPainter hugawanya picha kuwa sehemu ya mbele na mandharinyuma kwa msingi wa saliency; kwanza huchakata kitu kikuu katika tabaka tatu kutoka umbo la jumla hadi maelezo madogo, kisha hukamilisha mandharinyuma kwa tabaka huku ikihifadhi hali ileile ya canvas. Hivyo, badala ya kupaka picha nzima kwa umuhimu sawa tangu mwanzo, mfumo hutumia mpangilio wa kisemantiki wa “kitu kikuu kwanza, mazingira baadaye”.

Vipengele vitano vya msingi

Katika Kielelezo 2 cha makala, usanifu wa LogicPainter umegawanywa katika moduli tano kuu:

  1. Salience mask module: Hutambua kitu kikuu cha sehemu ya mbele katika picha rejea.
  2. Sketcher: Huweka kianzilishi cha sketch ya kimuundo kwenye canvas ya awali.
  3. Stroke generator: Hutengeneza mipigo ya brashi ya kichoraji yenye umbo na rangi zinazoweza kudhibitiwa.
  4. Layer renderer: Huweka na kuboresha mipigo ya brashi kwenye canvas kupitia tabaka mbalimbali.
  5. Digital canvas: Ni hali ya picha ambamo michakato yote inayojirudia hukusanyika.

Mask ya sehemu ya mbele huonyeshwa kwa \(M_f\), na mask ya mandharinyuma kwa \(M_b\). Mask hizi mbili hazitumiki tu kama uzito wa umakini; zinaamua mpangilio halisi wa uchoraji wa picha.

Hatua ya 1: Sehemu ya mbele

Katika hatua ya kwanza, modeli hufanya kazi tu kwenye kitu kikuu kilichoainishwa na mask ya sehemu ya mbele. Kontua ya msingi inayotengenezwa na Sketcher husaidia kujenga muundo wa jumla. Layer renderer na stroke generator kwa pamoja huendeleza kitu kikuu katika tabaka tatu za azimio/maelezo.

Hatua ya 2: Mandharinyuma

Hatua ya pili haianzi na canvas tupu. Canvas iliyokamilika kutoka hatua ya sehemu ya mbele hutumika moja kwa moja kama hali ya kuanzia. Kwa hivyo, mandharinyuma huwekwa kuzunguka kitu kikuu ambacho tayari kimeundwa, huku kipaumbele cha kisemantiki cha sehemu ya mbele kikihifadhiwa.

Uchakataji wa Tabaka Kutoka Jumla Hadi Maelezo Madogo Unamaanisha Nini?

Uchakataji kutoka jumla hadi maelezo madogo unamaanisha kujenga katika tabaka la kwanza maeneo mapana na mpangilio wa jumla wa rangi/muundo kwa mipigo mikubwa na michache ya brashi, kisha kuongeza taratibu umbo, tekstura na maelezo ya eneo kwa kutumia mipigo mingi zaidi na midogo zaidi kwa mwonekano katika tabaka zinazofuata.

LogicPainter hutumia tabaka tatu katika majaribio mengi. Tabaka la kwanza hujenga muundo wa jumla na usambazaji mkuu wa rangi. Tabaka la pili na la tatu huongeza mipigo ya kipimo kidogo zaidi kupitia grid zinazozidi kuwa zenye msongamano.

Kwa tabaka \(l\), idadi ya grid inaelezwa katika chanzo kwa fomula ifuatayo:

\[ W_l=(2^{l+1}-1)^2 \]

Hapa \(W_l\) ni idadi ya grid katika tabaka husika. Ikiwa mipigo \(\sigma\) ya brashi inatumika katika kila grid, jumla ya mipigo ni:

\[ T=W_l\times \sigma \]

kuwa.

Katika mfano uliotolewa na chanzo, kwa \(\sigma=3\) na \(l=1\):

\[ T=(2^{1+1}-1)^2 \times 3 =3^2\times3 =27 \]

mipigo ya brashi hutumika.

Kadiri faharisi ya tabaka inavyoongezeka, grid nyingi zaidi hutumika kwenye canvas ileile, hivyo kila eneo la ndani linaweza kuchakatwa kwa mipigo ya kipimo kidogo zaidi. Utaratibu huu hutengeneza kwa mwonekano mpito wa “vitalu vikubwa vya rangi → maumbo ya kipimo cha kati → maelezo madogo”.

Usasishaji wa canvas

Kila mpigo wa brashi huwekwa kwenye canvas iliyopo kwa mantiki ya alpha compositing. Chanzo kinatoa usasishaji wa canvas kama ifuatavyo:

\[ O^{t+1}_{l} = O^{t}_{l}\odot(1-\alpha_t) + \alpha_t\times m_t \]

Hapa \(O^{t}_{l}\) ni hali ya canvas katika tabaka \(l\) kabla ya mpigo wa \(t\); \(\alpha_t\) inawakilisha msaada wa alpha wa mpigo wa brashi, na \(m_t\) inawakilisha vigezo vya rangi. Mlinganyo unaeleza jinsi mpigo mpya unavyochanganywa na hali ya awali ya canvas kulingana na uwiano wa mask yake.

Kukamilika kwa tabaka

Wakati mipigo yote \(T\) katika tabaka imewekwa:

\[ O_l=O^{T}_{l} \]

hupatikana. Picha ya mwisho inaelezwa kwa kuunganisha tabaka kwa kubadilisha ukubwa na kupangilia kwa kufaa:

\[ O=\sum_{l=1}^{L} U_l(O_l) \]

Katika kazi hii, faharisi ya tabaka la mwisho ni \(L=3\).

Stroke Generator Hufanyaje Kazi?

Stroke generator ya LogicPainter haitoi umbo na rangi ya brashi kwa output moja ya GAN; badala yake hutumia generator mbili, kwanza kutengeneza prototipu ya mpigo, kisha generator ya pili kusafisha mpigo huo na kuupaka upya katika rangi lengwa. Hivyo hupatikana primitiva za brashi zilizo thabiti na zinazodhibitika zaidi, ambazo zinaweza kuwekwa mara kwa mara kwenye canvas.

Waandishi wanaeleza kuwa uzalishaji wa brashi unaotegemea GAN ya kawaida unaweza wakati mwingine kutoa thamani chafu au zisizo sawia za pikseli kwenye usuli mweupe. Output ya aina hii inaweza kusababisha madoa ya rangi yasiyotakiwa inapowekwa moja kwa moja mara nyingi kwenye canvas.

Kwa hiyo LogicPainter hutumia muundo wenye generator mbili:

  • \(G\): Hutengeneza mofolojia ya msingi ya mpigo wa brashi kutoka kwa vigezo vya nasibu.
  • \(G'\): Hupaka upya na kusafisha mpigo uliotengenezwa kwa kutumia vigezo vya rangi lengwa.
  • \(D\): Ni discriminator inayojaribu kutofautisha sampuli halisi za stroke na output za generator mbili.

Hasara ya discriminator

Chanzo kinafafanua hasara ya discriminator kama ifuatavyo:

\[ \mathcal{L}_D= \frac{1}{K} \sum_{k=1}^{K} \left[ -\log D(x_k) -\log(1-D(G(n_k))) -\log(1-D(G'(G(n_k),m_k))) \right] \]

Sehemu ya kwanza huhamasisha sampuli halisi za stroke kutambuliwa kuwa halisi, huku sehemu ya pili na ya tatu zikihamasisha output za generator mbili kutambuliwa kuwa bandia.

Hasara ya generator ya kwanza

\[ \mathcal{L}_G= \frac{1}{K} \sum_{k=1}^{K} -\log D(G(n_k)) \]

Hasara hii inalenga kufanya prototipu za stroke zinazotengenezwa na \(G\) zikaribie sampuli halisi za stroke kutoka mtazamo wa discriminator.

Hasara ya generator ya pili

\[ \mathcal{L}_{G'}= \frac{1}{K} \sum_{k=1}^{K} -\log D(G'(G(n_k),m_k)) \]

Generator ya pili hujaribu kufanya output ya stroke iliyopakwa upya ionekane halisi.

Upakaji upya wa rangi unaotegemea Alpha

Umbo la mwisho lenye rangi la brashi linaelezwa katika chanzo kama:

\[ S=\alpha\times m_t \]

.

Msaada wa alpha kutoka kwenye prototipu ya stroke:

\[ \alpha_t=\phi(G(n_t)) \]

hutolewa, na stroke ya mwisho:

\[ S=G'(G(n_t),m_t) = \phi(G(n_t))\times m_t \]

hupatikana. Mgawanyo huu unatenganisha msaada wa kijiometria wa brashi na taarifa ya rangi.

Je, Diffusion-Driven Refinement ni DDPM Halisi?

Hapana. LogicPainter haijengi mnyororo wa uwezekano wa diffusion kwenda mbele na nyuma katika nafasi ya pikseli kwa maana ya DDPM ya kawaida; kazi hii hutafsiri kusahihisha vigezo vya brashi vilivyoanzishwa kwa nasibu na hali za canvas kupitia masasisho ya gradient yanayorudiwa kuelekea picha lengwa kama mchakato wa refinement unaofanana na reverse-diffusion.

Tofauti hii ni muhimu kwa kuelewa makala kwa usahihi. Katika mbinu ya LogicPainter, hakuna uzalishaji wa kawaida wa pixel-space DDPM wa aina “noise → denoising → image”.

Badala yake, latent stroke parameters:

\[ z_l^t=\{n_l^t,m_l^t\} \]

hufafanuliwa. \(n_l^t\) hudhibiti umbo la prototipu ya mpigo, na \(m_l^t\) hudhibiti vigezo vya rangi.

Stroke husika:

\[ S_l^t=G'(G(n_l^t),m_l^t) \]

hutengenezwa kwa namna hii.

Kisha mpito wa canvas huwakilishwa kwa ujumla kama:

\[ O_l^{t+1}=\mathcal{T}(O_l^t,z_l^t) \]

. Hapa \(\mathcal{T}\) ni operator inayoweza kutofautishwa ya stroke render na compositing.

Feature-space discrepancy

Badala ya kuboresha moja kwa moja tofauti ghafi ya pikseli, modeli hutumia uwakilishi wa feature unaotegemea ResNet. Hasara katika hatua ya sehemu ya mbele ni:

\[ \mathcal{L}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_f)_j - R(O\odot M_f)_j \right\| \]

.

Kwa mandharinyuma, muundo huo huo hutumiwa na mask \(M_b\):

\[ \mathcal{L}_{bg}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_b)_j - R(O\odot M_b)_j \right\| \]

.

Hapa \(R(\cdot)\) ni ResNet feature extractor na \(J\) inawakilisha idadi ya feature map zilizotolewa.

Usasishaji wa vigezo vya stroke

Vigezo vya stroke husasishwa kwa uboreshaji unaotegemea gradient kama:

\[ z_l^{t+1} = z_l^t - \eta\nabla_{z_l^t}\mathcal{L}_l^t \]

.

\(\eta\) ni ukubwa wa hatua. Kwa njia hii, usanidi wa stroke unaowakilisha vibaya maudhui lengwa husahihishwa hatua kwa hatua.

Maendeleo ya canvas:

\[ O_l^0\rightarrow O_l^1\rightarrow \cdots \rightarrow O_l^T \]

huendelea kwa namna hii. Waandishi hutafsiri mnyororo huu kama refinement unaofanana na reverse-diffusion; lakini wanaeleza wazi kwamba hii si dai la modeli kamili ya Markov diffusion kwa maana ya DDPM.

Mbinu na Matokeo ya Utafiti

Miundombinu ya majaribio

Majaribio yote yalifanywa kwenye workstation yenye Intel i7-7700K CPU na NVIDIA Titan RTX GPU.

Vyanzo vitatu vya data vilitumika kwa tathmini:

  • CelebA,
  • ImageNet,
  • picha za ulimwengu halisi.

Picha za majaribio zinajumuisha makundi mbalimbali ya kisemantiki kama picha za watu, wanyama, mimea, maua na majengo.

Usanidi chaguo-msingi wa LogicPainter:

  • uchoraji wa hatua mbili wa sehemu ya mbele/mandharinyuma,
  • tabaka tatu za render,
  • ResNet-based feature extraction loss,
  • \(\sigma=3\) stroke kwa kila grid

hutumika.

Ulinganisho wa kuona

Katika Kielelezo 6, mchakato wa uzalishaji kwenye CelebA, ImageNet na picha halisi unaonyeshwa. Katika picha, kitu kikuu huanza kuonekana kwa alama za brashi za jumla, kisha maelezo yake huongezeka, na katika hatua ya mwisho mandharinyuma hukamilishwa.

Kulingana na tathmini ya kuona ya waandishi, miundo ya nyuso, kontua za wanyama, petali za maua na jiometri za majengo hubaki kutambulika kwa kiasi kikubwa baada ya ustailishaji. Wakati huohuo, picha za mwisho huzalisha alama zinazoonekana za brashi badala ya kuwa ujenzi upya wa picha wa kifotografia pekee.

Ulinganisho na mbinu shindani

LogicPainter ililinganishwa na mbinu tatu wakilishi:

MbinuNguvu iliyosisitizwa katika chanzoKizuizi kilichosisitizwa katika chanzo
SNPMwonekano dhahiri wa stroke na mtindoInaweza kupoteza baadhi ya maudhui madogo ya kisemantiki
PTFUstailishaji wenye nguvu unaotegemea strokeMaelezo ya kimuundo yanaweza kudhoofika kwa ajili ya mtindo
LTPUhifadhi wa maudhuiOutput inaweza kubaki karibu na ujenzi upya wa picha wa kifotografia
LogicPainterUsawaziko kati ya maudhui, mwonekano wa stroke na mpangilio wa uchorajiHaipati alama ya juu zaidi katika kila kipimo binafsi cha tathmini

Tafiti za Watumiaji Zilionyesha Nini Kuhusu LogicPainter?

Tafiti za watumiaji zinaonyesha kwamba LogicPainter ilionekana kuwa na nguvu hasa katika rangi, mshikamano wa urembo na mpangilio wa uchoraji unaofanana na wa binadamu; hata hivyo, katika baadhi ya vigezo binafsi kama tekstura au uhifadhi wa maudhui pekee, mbinu shindani ziliweza kupata alama za juu zaidi.

Utafiti wa kwanza wa watumiaji

Jumla ya washiriki 20 walijumuishwa katika utafiti wa kwanza wa watumiaji. Washiriki walikuwa wa umri wa miaka 18–40 kutoka makundi tofauti ya umri, jinsia na elimu; %10 ya washiriki walikuwa na historia ya sanaa.

Kila matokeo yalitathminiwa kwa vigezo vitano vifuatavyo kwenye kipimo cha 1,0–5,0:

  • Content,
  • Texture,
  • Colour,
  • Style,
  • Beauty.

LogicPainter kwa washiriki wenye historia ya sanaa

KigezoWastaniMkengeuko wa kawaidaKipindi cha kujiamini cha %95
Content3,8880,1033,838–3,937
Texture3,7130,0483,690–3,735
Colour4,5880,1184,531–4,644
Style4,5750,1324,511–4,639
Beauty4,1250,0654,094–4,156

Katika kundi hili, vigezo vya rangi, mtindo na uzuri vilibaki juu ya pointi 4 katika kiwango cha kujiamini cha %95. Hasa kwa kipimo cha Colour, kipindi cha 4,531–4,644 kiliripotiwa.

LogicPainter kwa washiriki wasio na historia ya sanaa

KigezoWastaniMkengeuko wa kawaidaKipindi cha kujiamini cha %95
Content4,3880,1444,319–4,456
Texture3,6880,1493,616–3,759
Colour4,4750,4054,280–4,670
Style4,4880,4114,290–4,685
Beauty4,1880,1254,127–4,248

Kwa washiriki wasio na historia ya sanaa, vipindi vya kujiamini vya %95 kwa Content, Colour, Style na Beauty vilibaki juu ya pointi 4.

Utafiti wa pili wa watumiaji: mpangilio wa uchoraji

Katika utafiti wa pili wa watumiaji, washiriki hawakutathmini tu picha ya mwisho, bali pia video za uchoraji zilizotengenezwa na mbinu. Kipimo kilikuwa tena 1–5, na thamani ya juu inaonyesha kwamba mchakato ulionekana kuwa karibu zaidi na desturi ya uchoraji ya msanii wa binadamu.

Katika Kielelezo 9, LogicPainter ilipata tathmini zilizo karibu na 5 kwa makundi yenye na yasiyo na historia ya sanaa, na ilitathminiwa wazi zaidi kuliko SNP, PTF na LTP zilizolinganishwa. Kwa kuwa kielelezo chanzo hakitoi thamani kamili za bar kwa maandishi, hakuna nambari mpya kamili iliyotolewa kutoka kwenye grafu hapa.

Tafiti za Ablation Zilionyesha Vipengele Gani Ni Muhimu?

Majaribio ya ablation yalionyesha kwamba ubora wa picha ya mwisho hautegemei tu usanifu mkuu, bali pia feature extractor inayotumika, mtindo wa stroke, mpangilio wa tabaka na idadi ya stroke katika kila grid; hasa feature za ResNet na mpangilio wa msongamano wa kati wa \(\sigma=3\) hutoa uwiano unaofaa kati ya uhifadhi wa maudhui na gharama ya kompyuta.

ResNet na GoogleNet

ResNet na GoogleNet zililinganishwa kwa feature-extraction loss. Kulingana na matokeo ya chanzo, feature zinazotegemea GoogleNet zilipoteza maelezo zaidi ya maudhui katika baadhi ya mifano, huku ResNet ikitoa usawaziko wenye nguvu zaidi kati ya maudhui ya kimuundo na mwonekano uliostailishwa.

Mtindo wa stroke

Mbali na mtindo chaguo-msingi wa stroke, seti ya data ya stroke inayofanana na pastel kutoka Neural Painter pia ilijaribiwa. Mabadiliko haya yalionyesha kwamba matokeo ya kuona yanayofanana zaidi na pastel au watercolor yanaweza kutengenezwa bila kubadilisha usanifu wa modeli.

Mpangilio wa tabaka

Modeli chaguo-msingi hukamilisha tabaka zote za foreground kabla ya kuhamia tabaka za background. Katika jaribio la ablation, kama mbadala, foreground na background zilichakatwa pamoja ndani ya tabaka moja, kisha mfumo ukahamia tabaka la juu zaidi.

Matokeo yanaonyesha kwamba LogicPainter inaweza kuunga mkono mipangilio tofauti ya uchoraji huku ikiendelea kuhifadhi sifa ya uchakataji kutoka jumla hadi maelezo madogo.

Idadi ya stroke

Idadi ya stroke kwa kila grid ilijaribiwa kati ya \(\sigma=1\) na \(\sigma=5\).

  • \(\sigma=1\): Matokeo yana msongamano mdogo na upotevu mkubwa zaidi wa maelezo.
  • \(\sigma=5\): Maelezo madogo zaidi huhifadhiwa.
  • \(\sigma=3\): Ilichaguliwa na chanzo kama maelewano mazuri kati ya ubora wa kuona na gharama ya kompyuta.

Mtindo mpya wa stroke

Waandishi pia walitengeneza utaratibu mbadala wa stroke unaotumia miduara tupu yenye kipenyo kinachobadilika inayosogea kwenye mikunjo ya cubic Bézier. Katika majaribio haya pia ilionyeshwa kwamba tekstura na tabia mbalimbali za kisanii zinaweza kutengenezwa huku maudhui ya msingi ya kisemantiki yakihifadhiwa.

Hitimisho zinazoungwa mkono na utafiti

  • Mpangilio wa foreground-first/background-second unaweza kutekelezwa wazi.
  • Layered coarse-to-fine rendering inaweza kuongeza maelezo ya kuona hatua kwa hatua.
  • Stroke generator ya hatua mbili inaweza kutenganisha udhibiti wa umbo na rangi.
  • Feature-space loss inaweza kutumika katika uboreshaji wa iterativu wa vigezo vya stroke.
  • LogicPainter inaweza kuunga mkono mitindo tofauti ya stroke.
  • Watumiaji walitathmini mpangilio wa uchoraji wa LogicPainter kuwa unaofanana zaidi na wa binadamu kuliko mbinu zilizolinganishwa.
  • Modeli hutoa usawaziko shindani kati ya uhifadhi wa maudhui na mtindo wa kichoraji.

Hitimisho ambazo utafiti hauungi mkono

  • LogicPainter haithibitishi kwamba inaiga kikamilifu mchakato wa utambuzi wa wachoraji halisi wa binadamu.
  • Kauli “Human-logic” si modeli ya neurokognitivi ya ubongo wa binadamu.
  • LogicPainter si DDPM ya kawaida.
  • Mbinu haizidi washindani wote katika kila kipimo binafsi cha mtumiaji.
  • Utafiti wa kwanza wa watumiaji wenye watu 20 si utafiti mkubwa wa kitabia unaowakilisha idadi yote ya watu.
  • Kazi haisimulii rangi halisi ya kimwili, msuguano wa brashi au mienendo ya rangi ya kimiminika.
  • Mandhari yenye mabadiliko na udhibiti wa mapendeleo unaoongozwa na mtumiaji si matatizo yaliyotatuliwa katika kazi ya sasa; yamependekezwa kama kazi ya baadaye.

Mwelekeo wa kazi za baadaye

Waandishi wanapendekeza kwa siku zijazo kupanua mbinu hadi mandhari yenye mabadiliko, kuingiza mapendeleo ya uchoraji yanayoongozwa na mtumiaji katika mfumo, na kuunga mkono mitindo zaidi ya kisanii ya stroke. Vipengele hivi si uwezo uliothibitishwa wa mfumo wa sasa, bali ni maeneo yaliyopangwa kuchunguzwa baadaye.

Maelezo ya Chanzo na Mbinu

Kichwa asili: LogicPainter: Layered Stroke Rendering with Diffusion-Driven Refinement for Human-Logic AI Painting.

Waandishi: Qian Wang, Cai Guo, Hong-Ning Dai, Maaike Kleinsmann, Yike Guo na Pan Wang.

Mwandishi anayewajibika: Pan Wang.

Taasisi: Guangdong University of Technology, Hanshan Normal University, Hong Kong Baptist University, Delft University of Technology na The Hong Kong University of Science and Technology.

ORCID: Chanzo kinatoa taarifa ya ORCID 0000-0002-5892-8093 kwa Qian Wang.

Jukwaa: SSRN.

SSRN Abstract No.: 7023467.

Aina ya chanzo: Preprint ya utafiti.

Hali ya peer review: Haijapitia peer review.

DOI: Haijatajwa katika chanzo.

Jarida: Rekodi ya mwisho ya jarida lililopitiwa na wenzao haijatolewa katika chanzo. Chini ya kurasa kuna kauli “Preprint submitted to Elsevier”.

Ufadhili: Chanzo kinaeleza kwamba mradi wa utafiti uliungwa mkono na “National Science Foundation No. 62402122”.

Mbinu kuu: Utenganishaji wa foreground/background unaotegemea saliency, sketch prior, stroke generator ya hatua mbili inayotegemea GAN, ResNet feature-space loss, coarse-to-fine layer renderer, stroke compositing inayoweza kutofautishwa na iterative stroke optimisation inayotegemea gradient.

Seti za data: CelebA, ImageNet na picha za ulimwengu halisi.

Mbinu zilizolinganishwa: Stylized Neural Painting (SNP), Paint Transformer (PTF) na Learning to Paint (LTP).

Vifaa: Intel i7-7700K CPU na NVIDIA Titan RTX GPU.

Mpangilio chaguo-msingi wa rendering: Tabaka tatu na mipigo \(\sigma=3\) ya brashi kwa kila grid.

Kizuizi kikuu cha kimetodolojia: Kauli “Diffusion-driven” si sawa na DDPM ya kawaida. Chanzo kinaeleza wazi kwamba hutumia mipito ya p na q si kudai mnyororo kamili wa DDPM Markov, bali kuainisha dhana ya uboreshaji wa iterativu wa hali za stroke-canvas.

Kizuizi cha utafiti wa watumiaji: Matokeo kuhusu mpangilio wa uchoraji unaofanana na wa binadamu yanategemea mtazamo wa watumiaji. Utafiti wa kwanza ulifanywa na washiriki 20, na tathmini hii si kipimo cha majaribio cha nyurosayansi cha michakato ya utambuzi ya wachoraji halisi.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy