Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Компьютер илими / LogicPainter: Адам Логикасына Негизделген Жасалма Интеллект Сүрөтчүлүгүндө Катмарлуу Щетка Соккуларын Иштетүү жана Diffusion-Driven Refinement
Компьютер илими

LogicPainter: Адам Логикасына Негизделген Жасалма Интеллект Сүрөтчүлүгүндө Катмарлуу Щетка Соккуларын Иштетүү жана Diffusion-Driven Refinement

LogicPainter шилтеме сүрөттү бир кадамда стилдештирүүнүн ордуна аны ачык щетка соккулары менен, алдыңкы планды арткы пландан мурда иштеп жана орой түзүлүштөн майда деталдарга карай илгерилеп кайра түзгөн адам логикасынан шыктанган нейрондук сүрөт тартуу алкагы. Система saliency mask модулун, sketcher, controllable stroke generator, layer renderer жана санарип canvas компоненттерин бириктирет.

13/09/2026  Veri Anla 135 көрүү
LogicPainter: Адам Логикасына Негизделген Жасалма Интеллект Сүрөтчүлүгүндө Катмарлуу Щетка Соккуларын Иштетүү жана Diffusion-Driven Refinement

LogicPainter, шилтеме сүрөттү бир кадамда стилдештирүүнүн ордуна аны ачык щетка соккулары менен, алдыңкы планды арткы пландан мурда иштеп жана орой түзүлүштөн майда деталдарга карай илгерилеп кайра түзгөн адам логикасынан шыктанган нейрондук сүрөт тартуу алкагы. Система saliency mask модулун, sketcher, controllable stroke generator, layer renderer жана санарип canvas компоненттерин бириктирет. Щетка параметрлери кокустук баштапкы абалдан feature-space loss аркылуу итеративдүү оптималдаштырылат жана бул процесс макалада diffusion-driven refinement катары чечмеленет. CelebA, ImageNet жана реалдуу дүйнөдөгү сүрөттөрдө жүргүзүлгөн эксперименттер менен колдонуучу изилдөөлөр LogicPainter мазмунга берилгендик, сүрөтчүлүк көрүнүш жана адамга окшош боёо тартибинин ортосунда күчтүү тең салмак түзө аларын көрсөтөт. Ошол эле учурда бул иш рецензиядан өтпөгөн preprint болуп саналат жана “адам логикасы” жыйынтыгы чыныгы адам сүрөтчүлөрүнүн когнитивдик процесстерин түз өлчөө эмес, колдонуучулардын системанын боёо тартибин кабыл алуусуна негизделген эксперименттик баалоо.

LogicPainter'дын негизги жаңычылдыгы жасалма интеллект сүрөтчүлүгүн жөн гана сүрөттөн-сүрөткө өзгөртүү маселеси катары карабаганында. Система боёону кайсы аймак биринчи иштетилери, щетка соккулары кандай түзүлөрү, canvas кандай тартипте жаңыланары жана детал катмардан катмарга кантип көбөйөрү ачык моделденген процедуралык визуал түзүү процесси катары аныктайт.

LogicPainter деген эмне?

LogicPainter шилтеме сүрөттү түз эле бир стилдештирилген жыйынтык катары чыгаруунун ордуна аны щетка соккулары менен этап-этабы менен түзгөн; алдыңкы планды биринчи, арткы планды кийин боёгон жана ар бир аймакты орой түзүлүштөн майда деталдарга карай катмарлаган жасалма интеллект сүрөт тартуу алкагы.

Изилдөөнүн баштапкы көз карашы классикалык сүрөт стилин өткөрүү менен чыныгы маанидеги “боёо процесси” ортосунда айырма бар деген пикир. Стиль өткөрүү модели акыркы сүрөттү түз өзгөртө алат. LogicPainter болсо сүрөт кантип пайда болорун да моделдөөгө аракет кылат: sketch түзүлөт, негизги объект аныкталат, алдыңкы план боёлот, арткы план кошулат жана щетка соккулары бара-бара кичирейген масштабдарда жакшыртылат.

Ошондуктан изилдөөдө AI painting мындайча түшүндүрүлөт: акыркы сүрөттү бир жолку түзүү эмес, ачык жана ырааттуу щетка соккулары менен акырындап калыптандыруу.

Изилдөө маселеси

Авторлор белгилеген негизги маселе эки бөлүктөн турат. Көптөгөн учурдагы нейрондук сүрөт системалары stroke-by-stroke иштетүүнү аткарса да, кайсы объект биринчи боёлушу керектигин адам сүрөтчүлөрү колдоно ала турган семантикалык артыкчылыктарга ылайык ачык моделдебейт. Экинчи жагынан, деталдарды сактоо менен көрүнүктүү сүрөтчүлүк щетка мүнөзүн күчөтүүнүн ортосунда айкын компромисс бар.

Эгер ыкма сүрөт мазмунун өтө катуу сактаса, натыйжа фотографиялык реконструкцияга жакындашы мүмкүн. Щетка текстурасын жана стилдештирүүнү өтө күчөтсө, объекттин түзүлүшү жана майда семантикалык деталдар жоголушу мүмкүн. LogicPainter бул эки максатты бир pipeline ичинде чогуу чечүүгө аракет кылат.

LogicPainter Адамга Окшош Боёо Тартибин Кантип Моделдейт?

LogicPainter сүрөттү saliency негизинде алдыңкы жана арткы планга бөлөт; адегенде негизги объектти үч катмар боюнча орой формадан майда деталдарга чейин иштетет, андан кийин ошол эле canvas абалын сактап арткы планды дагы катмарлуу түрдө толуктайт. Ошентип система бүт сүрөттү башынан бирдей маанилүү боёонун ордуна семантикалык “негизги объект биринчи, айлана-чөйрө кийин” тартибин колдонот.

Беш негизги компонент

Макаланын 2-сүрөтүндө LogicPainter архитектурасы беш негизги модулга бөлүнөт:

  1. Salience mask module: Шилтеме сүрөттөгү негизги алдыңкы план объектин аныктайт.
  2. Sketcher: Баштапкы canvas үстүнө структуралык эскиз алдын-ала формасын жайгаштырат.
  3. Stroke generator: Формасы жана түсү башкарылуучу сүрөтчүлүк щетка соккуларын чыгарат.
  4. Layer renderer: Щетка соккуларын катмарлар боюнча canvas'ка жайгаштырып, оптималдаштырат.
  5. Digital canvas: Бардык итеративдүү операциялар топтолгон сүрөт абалы.

Алдыңкы план маскасы \(M_f\), арткы план маскасы \(M_b\) менен белгиленет. Бул эки маска көңүл буруу салмагы катары гана колдонулбастан, сүрөттүн чыныгы боёо тартибин аныктайт.

1-этап: Алдыңкы план

Биринчи этапта модель алдыңкы план маскасы аныктаган негизги объектте гана иштейт. Sketcher түзгөн негизги контур глобалдык түзүлүштү орнотууга жардам берет. Layer renderer жана stroke generator негизги объектти үч чечилиш/детал катмарында биргелешип өнүктүрөт.

2-этап: Арткы план

Экинчи этап бош canvas менен башталбайт. Алдыңкы план этабында бүтүп калган canvas түздөн-түз баштапкы абал катары колдонулат. Ошентип арткы план мурда түзүлгөн негизги объекттин айланасына жайгашып, алдыңкы пландын семантикалык артыкчылыгы сакталат.

Оройдон-Майдага Катмарлуу Иштетүү Эмне Дегенди Билдирет?

Оройдон-майдага иштетүү биринчи катмарда чоң аймактарды жана жалпы түс/түзүлүш композициясын чоң жана сейрек щетка соккулары менен түзүп, кийинки катмарларда көбүрөөк жана визуалдык жактан кичине соккуларды колдонуп форма, текстура жана жергиликтүү деталдарды акырындап көбөйтүү дегенди билдирет.

LogicPainter көпчүлүк эксперименттерде үч катмар колдонот. Биринчи катмар жалпы түзүлүштү жана негизги түс бөлүштүрүлүшүн түзөт. Экинчи жана үчүнчү катмарлар барган сайын тыгыз grid'дер аркылуу кичирээк визуалдык масштабдагы соккуларды кошот.

\(l\) катмары үчүн grid саны булакта төмөнкү формула менен аныкталат:

\[ W_l=(2^{l+1}-1)^2 \]

Бул жерде \(W_l\) тиешелүү катмардагы grid саны. Ар бир grid ичинде \(\sigma\) щетка соккусу колдонулса, жалпы сокку саны:

\[ T=W_l\times \sigma \]

болот.

Булакта берилген мисалда \(\sigma=3\) жана \(l=1\) үчүн:

\[ T=(2^{1+1}-1)^2 \times 3 =3^2\times3 =27 \]

щетка соккусу колдонулат.

Катмар индекси өскөн сайын ошол эле canvas'та көбүрөөк grid колдонулгандыктан, ар бир жергиликтүү аймак майда масштабдагы соккулар менен иштелиши мүмкүн. Бул механизм визуалдык түрдө “кең боёк блоктору → орто масштабдагы формалар → майда деталдар” өтүүсүн түзөт.

Canvas жаңыртуусу

Ар бир щетка соккусу alpha compositing логикасы менен учурдагы canvas үстүнө жайгаштырылат. Булакта canvas жаңыртуусу төмөнкүдөй берилет:

\[ O^{t+1}_{l} = O^{t}_{l}\odot(1-\alpha_t) + \alpha_t\times m_t \]

Бул жерде \(O^{t}_{l}\) — \(l\)-катмардагы \(t\)-соккудан мурдагы canvas абалы; \(\alpha_t\) щетка соккусунун alpha колдоосун, \(m_t\) болсо түс параметрлерин билдирет. Теңдеме жаңы соккунун мурдагы canvas абалына өз маскасынын катышында аралашуусун сүрөттөйт.

Катмарды аяктоо

Бир катмардагы бардык \(T\) соккулар жайгаштырылганда:

\[ O_l=O^{T}_{l} \]

алынат. Акыркы сүрөт катмарларды ылайыктуу кайра өлчөмдөө жана тегиздөө операциялары менен бириктирүү аркылуу аныкталат:

\[ O=\sum_{l=1}^{L} U_l(O_l) \]

Изилдөөдө акыркы катмар индекси \(L=3\).

Stroke Generator Кантип Иштейт?

LogicPainter'дын stroke generator'у щетка формасын жана түсүн бир гана GAN чыгышына калтырбай, эки генератор колдонуп адегенде сокку прототибин чыгарат, андан соң экинчи генератор менен соккуну тазалап, максаттуу түскө кайра боёйт; мунун натыйжасында canvas үстүнө кайра-кайра жайгаштырууга боло турган туруктуураак жана башкарылуучу щетка примитивдери алынат.

Авторлор стандарттык GAN негизиндеги щетка генерациясы айрым учурларда ак фондо булганган же гетерогендик пиксел маанилерин түзө аларын белгилешет. Мындай чыгыш canvas үстүнө көп жолу түздөн-түз кошулганда каалабаган түс тактарына алып келиши мүмкүн.

Ошондуктан LogicPainter эки генераторлуу түзүлүштү колдонот:

  • \(G\): Кокустук параметрлерден негизги щетка соккусунун морфологиясын чыгарат.
  • \(G'\): Түзүлгөн соккуну максаттуу түс параметрлери менен кайра боёп, тазалайт.
  • \(D\): Чыныгы stroke үлгүлөрү менен эки генератордун чыгыштарын айырмалоого аракет кылган discriminator.

Discriminator жоготуусу

Булак discriminator жоготуусун төмөнкүдөй аныктайт:

\[ \mathcal{L}_D= \frac{1}{K} \sum_{k=1}^{K} \left[ -\log D(x_k) -\log(1-D(G(n_k))) -\log(1-D(G'(G(n_k),m_k))) \right] \]

Биринчи мүчө чыныгы stroke үлгүлөрүнүн чыныгы катары классификацияланышын, экинчи жана үчүнчү мүчөлөр эки generator чыгышынын жасалма катары ажыратылышын колдойт.

Биринчи generator жоготуусу

\[ \mathcal{L}_G= \frac{1}{K} \sum_{k=1}^{K} -\log D(G(n_k)) \]

Бул жоготуу \(G\) чыгарган stroke прототиптерин discriminator көз карашынан чыныгы stroke үлгүлөрүнө жакындатууну көздөйт.

Экинчи generator жоготуусу

\[ \mathcal{L}_{G'}= \frac{1}{K} \sum_{k=1}^{K} -\log D(G'(G(n_k),m_k)) \]

Экинчи generator кайра боёлгон stroke чыгышын реалисттүү кылууга аракет кылат.

Alpha негизиндеги кайра боёо

Щетканын акыркы түстүү формасы булакта:

\[ S=\alpha\times m_t \]

деп берилет.

Stroke прототибинен alpha колдоосу:

\[ \alpha_t=\phi(G(n_t)) \]

аркылуу алынат жана акыркы stroke:

\[ S=G'(G(n_t),m_t) = \phi(G(n_t))\times m_t \]

түрүндө алынат. Бул бөлүү щетканын геометриялык колдоосу менен түс маалыматын бири-биринен ажыратат.

Diffusion-Driven Refinement Чыныгы DDPMби?

Жок. LogicPainter стандарттык DDPM маанисинде пиксел мейкиндигинде ыктымалдуу алдыга жана артка diffusion чынжырын курбайт; изилдөө кокустук башталган щетка параметрлерин жана canvas абалдарын максаттуу сүрөткө карай кайталанган gradient жаңыртуулары менен оңдоону reverse-diffusion'га окшош refinement процесси катары чечмелейт.

Бул айырма макаланы туура түшүнүү үчүн өтө маанилүү. LogicPainter колдонгон ыкмада “noise → denoising → image” түрүндөгү классикалык пиксел-мейкиндик DDPM генерациясы жүргүзүлбөйт.

Анын ордуна latent stroke параметрлери:

\[ z_l^t=\{n_l^t,m_l^t\} \]

деп аныкталат. \(n_l^t\) соккунун прототип формасын, \(m_l^t\) болсо түс параметрлерин башкарат.

Тиешелүү stroke:

\[ S_l^t=G'(G(n_l^t),m_l^t) \]

түрүндө чыгарылат.

Андан кийин canvas өтүүсү абстракттуу түрдө:

\[ O_l^{t+1}=\mathcal{T}(O_l^t,z_l^t) \]

деп берилет. Бул жердеги \(\mathcal{T}\) — дифференциалдануучу stroke render жана compositing оператору.

Feature-space discrepancy

Модель чийки пиксел айырмасын түздөн-түз оптималдаштыруунун ордуна ResNet негизиндеги feature өкүлчүлүгүн колдонот. Алдыңкы план этабындагы жоготуу:

\[ \mathcal{L}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_f)_j - R(O\odot M_f)_j \right\| \]

түрүндө.

Арткы план үчүн ошол эле түзүлүш \(M_b\) маскасы менен:

\[ \mathcal{L}_{bg}(I,O)= \frac{1}{J} \sum_{j=1}^{J} \left\| R(I\odot M_b)_j - R(O\odot M_b)_j \right\| \]

түрүндө колдонулат.

Бул жерде \(R(\cdot)\) — ResNet feature extractor, \(J\) — алынган feature map саны.

Stroke параметрлерин жаңыртуу

Stroke параметрлери gradient негизиндеги оптималдаштыруу менен:

\[ z_l^{t+1} = z_l^t - \eta\nabla_{z_l^t}\mathcal{L}_l^t \]

түрүндө жаңыланат.

\(\eta\) — кадам өлчөмү. Ошентип максаттуу мазмунду начар чагылдырган stroke конфигурациялары акырындап оңдолот.

Canvas өнүгүүсү:

\[ O_l^0\rightarrow O_l^1\rightarrow \cdots \rightarrow O_l^T \]

түрүндө жүрөт. Авторлор бул чынжырды reverse-diffusion'га окшош refinement катары түшүндүрүшөт; бирок мунун DDPM маанисиндеги так Markov diffusion модели деген доомат эмес экенин ачык айтышат.

Изилдөөнүн Методу жана Натыйжалары

Эксперименттик инфраструктура

Бардык эксперименттер Intel i7-7700K CPU жана NVIDIA Titan RTX GPU бар workstation'да жүргүзүлгөн.

Баалоо үчүн үч маалымат булагы колдонулган:

  • CelebA,
  • ImageNet,
  • реалдуу дүйнөдөгү сүрөттөр.

Тест сүрөттөрү портрет, жаныбар, өсүмдүк, гүл жана имарат сыяктуу ар кандай семантикалык категорияларды камтыйт.

Демейки LogicPainter конфигурациясы:

  • эки этаптуу алдыңкы план/арткы план боёо,
  • үч render катмары,
  • ResNet негизиндеги feature extraction loss,
  • ар бир grid үчүн \(\sigma=3\) stroke

колдонот.

Визуалдык салыштыруулар

6-сүрөттө CelebA, ImageNet жана реалдуу сүрөттөрдөгү өндүрүү процесси көрсөтүлгөн. Сүрөттөрдө негизги объект адегенде орой щетка издери менен пайда болуп, кийин деталдары көбөйүп, акыркы этапта арткы план толукталат.

Авторлордун визуалдык баалоосуна ылайык, бет түзүлүштөрү, жаныбар контурлары, гүл жалбырактары жана имарат геометриялары стилдештирүүдөн кийин негизинен таанылуучу бойдон калат. Ошол эле учурда акыркы сүрөттөр жөн гана фотографиялык реконструкция эмес, көрүнүктүү щетка издерин жаратат.

Атаандаш ыкмалар менен салыштыруу

LogicPainter үч өкүл ыкма менен салыштырылган:

ЫкмаБулакта баса белгиленген күчтүү жагыБулакта баса белгиленген чектөө
SNPАйкын stroke жана стиль көрүнүшүМайда семантикалык мазмундун бир бөлүгүн жоготушу мүмкүн
PTFКүчтүү stroke негизиндеги стилдештирүүСтруктуралык детал стиль үчүн алсырап калышы мүмкүн
LTPМазмунду сактооЧыгыш фотографиялык реконструкцияга жакын калышы мүмкүн
LogicPainterМазмун, stroke көрүнүшү жана боёо тартибинин ортосундагы тең салмакАр бир жеке баалоо критерийинде эң жогорку балл албайт

Колдонуучу Изилдөөлөр LogicPainter Жөнүндө Эмне Көрсөттү?

Колдонуучу изилдөөлөр LogicPainter айрыкча түс, эстетикалык бүтүндүк жана адамга окшош боёо тартиби жагынан күчтүү кабыл алынганын; ошол эле учурда текстура же таза мазмунду сактоо сыяктуу айрым жеке критерийлерде атаандаш ыкмалар жогорку балл ала аларын көрсөтөт.

Биринчи колдонуучу изилдөөсү

Биринчи колдонуучу изилдөөсүнө жалпы 20 катышуучу киргизилген. Катышуучулар 18–40 жаш аралыгындагы ар кандай курак, жыныс жана билим берүү топторунан; катышуучулардын %10унда искусство тажрыйбасы бар.

Ар бир натыйжа 1,0–5,0 шкаласында төмөнкү беш критерий боюнча бааланган:

  • Content,
  • Texture,
  • Colour,
  • Style,
  • Beauty.

Искусство тажрыйбасы бар катышуучулардагы LogicPainter

КритерийОрточоСтандарттык четтөө%95 ишеним аралыгы
Content3,8880,1033,838–3,937
Texture3,7130,0483,690–3,735
Colour4,5880,1184,531–4,644
Style4,5750,1324,511–4,639
Beauty4,1250,0654,094–4,156

Бул топто түс, стиль жана сулуулук критерийлери %95 ишеним деңгээлинде 4 баллдан жогору калган. Айрыкча Colour метрикасы үчүн 4,531–4,644 аралыгы билдирилген.

Искусство тажрыйбасы жок катышуучулардагы LogicPainter

КритерийОрточоСтандарттык четтөө%95 ишеним аралыгы
Content4,3880,1444,319–4,456
Texture3,6880,1493,616–3,759
Colour4,4750,4054,280–4,670
Style4,4880,4114,290–4,685
Beauty4,1880,1254,127–4,248

Искусство тажрыйбасы жок катышуучуларда Content, Colour, Style жана Beauty критерийлеринин %95 ишеним аралыктары 4 баллдан жогору калган.

Экинчи колдонуучу изилдөөсү: боёо тартиби

Экинчи колдонуучу изилдөөсүндө катышуучулар акыркы сүрөттү гана эмес, ыкмалар түзгөн боёо видеолорун да баалашкан. Шкала кайрадан 1–5 жана жогорку мааниси процесстин адам сүрөтчүнүн боёо практикасына жакыныраак кабыл алынганын билдирет.

9-сүрөттө LogicPainter искусство тажрыйбасы бар да, жок да топтордо 5ке жакын бааларды алып, салыштырылган SNP, PTF жана LTP ыкмаларынан ачык түрдө жогору бааланган. Булак сүрөтүндө так bar маанилери текст түрүндө берилбегендиктен, бул жерде графиктен жаңы так сан чыгарылган жок.

Аblation Изилдөөлөрү Кайсы Компоненттер Маанилүү Экенин Көрсөттү?

Ablation эксперименттери акыркы сүрөт сапаты негизги архитектурага гана эмес, колдонулган feature extractor'го, stroke стилине, катмар тартибине жана ар бир grid'деги stroke санына да көз каранды экенин; айрыкча ResNet өзгөчөлүктөрү жана орточо тыгыздыктагы \(\sigma=3\) жөндөөсү мазмунду сактоо менен эсептөө чыгымынын ортосунда ылайыктуу тең салмак бергенин көрсөттү.

ResNet жана GoogleNet

Feature-extraction loss үчүн ResNet жана GoogleNet салыштырылган. Булак натыйжаларына ылайык, GoogleNet негизиндеги feature'лер айрым мисалдарда көбүрөөк мазмун деталдарын жоготсо, ResNet структуралык мазмун менен стилдештирилген көрүнүштүн ортосунда күчтүүрөөк тең салмак берген.

Stroke стили

Демейки stroke стилине кошумча Neural Painter'ден алынган пастелге окшош stroke маалымат топтому да сыналган. Бул өзгөртүү модель архитектурасын өзгөртпөстөн пастелге же акварелге окшош визуалдык натыйжаларды чыгарууга болорун көрсөттү.

Катмар тартиби

Демейки модель бардык foreground катмарларын бүтүргөндөн кийин background катмарларына өтөт. Ablation экспериментинде альтернатива катары ошол эле катмарда foreground жана background чогуу иштетилип, андан кийин кийинки жогорку катмарга өткөн.

Натыйжалар LogicPainter ар кандай боёо тартиптерин колдой аларын, ошого карабастан оройдон-майдага иштетүү касиетин сактай турганын көрсөтөт.

Stroke саны

Ар бир grid үчүн stroke саны \(\sigma=1\) менен \(\sigma=5\) ортосунда сыналган.

  • \(\sigma=1\): Натыйжалар сейрек жана детал жоготуусу жогору.
  • \(\sigma=5\): Көбүрөөк майда детал сакталат.
  • \(\sigma=3\): Визуалдык сапат менен эсептөө чыгымынын ортосунда жакшы компромисс катары булак тарабынан тандалган.

Жаңы stroke стили

Авторлор ошондой эле кубдук Bézier ийри сызыктары боюнча кыймылдаган өзгөрмө диаметрдеги бош тегеректерди колдонгон альтернативдүү stroke механизмин иштеп чыгышкан. Бул эксперименттерде да негизги семантикалык мазмун сакталган бойдон ар кандай текстуралар жана көркөм мүнөздөр чыгарылышы мүмкүн экени көрсөтүлгөн.

Изилдөө колдогон жыйынтыктар

  • Foreground-first/background-second тартиби ачык түрдө колдонулушу мүмкүн.
  • Катмарлуу coarse-to-fine rendering визуалдык деталдарды этап-этабы менен көбөйтө алат.
  • Эки этаптуу stroke generator форма жана түс башкаруусун бири-биринен ажырата алат.
  • Feature-space loss stroke параметрлерин итеративдүү оптималдаштырууда колдонулушу мүмкүн.
  • LogicPainter ар кандай stroke стилдерин колдой алат.
  • Колдонуучулар LogicPainter'дын боёо тартибин салыштырылган ыкмаларга караганда адамга көбүрөөк окшош деп баалашкан.
  • Модель мазмунду сактоо менен сүрөтчүлүк стиль ортосунда атаандаштыкка жөндөмдүү тең салмак сунуштайт.

Изилдөө колдобогон жыйынтыктар

  • LogicPainter чыныгы адам сүрөтчүлөрүнүн когнитивдик процессин толук моделдей турганын далилдебейт.
  • “Human-logic” деген сөз айкашы адам мээсинин нейрокогнитивдик модели эмес.
  • LogicPainter стандарттык DDPM эмес.
  • Ыкма ар бир жеке колдонуучу метрикасында бардык атаандаштардан жогору эмес.
  • 20 адам катышкан биринчи колдонуучу изилдөөсү бүт калкты өкүлчүлүк кылган чоң масштабдагы жүрүм-турум изилдөөсү эмес.
  • Изилдөө чыныгы физикалык боёкту, щетка сүрүлүүсүн же суюк боёк динамикасын симуляциялабайт.
  • Динамикалык көрүнүштөр жана колдонуучу багыттаган тандоо көзөмөлү учурдагы изилдөөдө чечилген маселелер эмес; келечектеги иш катары сунушталат.

Келечектеги изилдөө багыттары

Авторлор келечекте ыкманы динамикалык көрүнүштөргө кеңейтүүнү, колдонуучу багыттаган сүрөт артыкчылыктарын системага кошууну жана көбүрөөк көркөм stroke стилдерин колдоону сунушташат. Бул өзгөчөлүктөр учурдагы системанын сыналган мүмкүнчүлүктөрү эмес, келечекте изилдениши пландалган багыттар.

Булак жана Метод Эскертүүсү

Түпнуска аталышы: LogicPainter: Layered Stroke Rendering with Diffusion-Driven Refinement for Human-Logic AI Painting.

Авторлор: Qian Wang, Cai Guo, Hong-Ning Dai, Maaike Kleinsmann, Yike Guo жана Pan Wang.

Жооптуу автор: Pan Wang.

Мекемелер: Guangdong University of Technology, Hanshan Normal University, Hong Kong Baptist University, Delft University of Technology жана The Hong Kong University of Science and Technology.

ORCID: Булак Qian Wang үчүн 0000-0002-5892-8093 ORCID маалыматын берет.

Платформа: SSRN.

SSRN Abstract No.: 7023467.

Булактын түрү: Изилдөө preprint'и.

Рецензия абалы: Рецензиядан өткөн эмес.

DOI: Булакта көрсөтүлгөн эмес.

Журнал: Рецензияланган акыркы журнал жазуусу булакта берилген эмес. Баракчалардын төмөн жагында “Preprint submitted to Elsevier” деген сөз айкашы бар.

Каржылоо: Булак изилдөө долбоору “National Science Foundation No. 62402122” тарабынан колдоого алынганын билдирет.

Негизги метод: Saliency негизиндеги foreground/background бөлүү, sketch prior, GAN негизиндеги эки этаптуу stroke generator, ResNet feature-space loss, coarse-to-fine layer renderer, дифференциалдануучу stroke compositing жана gradient негизиндеги iterative stroke optimisation.

Маалымат топтомдору: CelebA, ImageNet жана реалдуу дүйнөдөгү сүрөттөр.

Салыштырылган ыкмалар: Stylized Neural Painting (SNP), Paint Transformer (PTF) жана Learning to Paint (LTP).

Жабдык: Intel i7-7700K CPU жана NVIDIA Titan RTX GPU.

Демейки rendering жөндөөсү: Үч катмар жана ар бир grid үчүн \(\sigma=3\) щетка соккусу.

Негизги методологиялык чектөө: “Diffusion-driven” сөз айкашы классикалык DDPM менен бир маанилүү эмес. Булак p жана q өтүүлөрүн толук DDPM Markov чынжыры деген доомат үчүн эмес, stroke-canvas абалдарынын итеративдүү жакшыртылышын концептуалдаштыруу үчүн колдонорун ачык белгилейт.

Колдонуучу изилдөөсүнүн чеги: Адамга окшош боёо тартибине байланышкан жыйынтыктар колдонуучу кабыл алуусуна негизделген. Биринчи изилдөө 20 катышуучу менен жүргүзүлгөн жана бул баалоо чыныгы сүрөтчүлөрдүн когнитивдик процесстеринин эксперименттик нейроилимий өлчөөсү эмес.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты