Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Илмҳои судӣ / Мусобиқаи Силоҳҳо Байни Тавлид ва Ошкорсозии Deepfake
Илмҳои судӣ

Мусобиқаи Силоҳҳо Байни Тавлид ва Ошкорсозии Deepfake

Ин баррасии систематикӣ эволютсияи рақобатии тавлид ва ошкорсозии deepfake-ро дар солҳои 2014–2025 меомӯзад. Таҳқиқот нишон медиҳад, ки бо гузариш аз GAN ба autoencoder, diffusion ва системаҳои бисёрмодалӣ, нишонаҳои ошкорсозӣ пайваста тағйир меёбанд. Муаллифон cue drift, се даври adversarial ва гузариш ба санҷиши семантикӣ, физикӣ, бисёрмодалӣ, watermark ва content provenance-ро ҳамчун самти асосии дифои оянда пешниҳод мекунанд.

29/06/2026  Veri Anla 72 боздид
Мусобиқаи Силоҳҳо Байни Тавлид ва Ошкорсозии Deepfake

Технологияи deepfake раванди тавлид ё тағйир додани тасвир, видео, садо ё омезиши онҳо бо истифода аз шабакаҳои амиқи нейронӣ ба гунае мебошад, ки воқеӣ менамоянд. Дар назари аввал ин мавзӯъ метавонад танҳо ба видеоҳои сохтаи чеҳра ё мундариҷаи дасткоришудае, ки дар шабакаҳои иҷтимоӣ паҳн мешавад, монанд намояд. Аммо таҳқиқот таъкид мекунад, ки технологияи deepfake акнун аз доираи нақзи махфияти шахсӣ хеле фаротар рафта, ба як минтақаи васеи хавф табдил ёфтааст. Суханрониҳои сиёсии сохта, қаллобии молиявӣ тавассути клоникунии овоз, коҳиши эътимоди ҷамъиятӣ, хавфи амнияти миллӣ, мушкили санҷиши расонаҳо ва эътимоднокии далелҳои рақамӣ аз таъсирҳои мустақими ин соҳа мебошанд.

Нуқтаи оғози мақола номувозинии сохторӣ байни сифати тавлиди deepfake ва қобилияти умумисозии системаҳои ошкорсозии deepfake мебошад. Дар ҳоле ки моделҳои тавлидкунанда ҳарчи воқеӣтар, идорашавандатар ва бисёрмодалӣ мешаванд, системаҳои ошкорсозӣ аксаран ба нишонаҳое вобаста мемонанд, ки дар маҷмӯаҳои додаҳои пешина омӯхта шудаанд. Натиҷаи Deepfake-Eval-2024, ки дар таҳқиқот оварда шудааст, ин холигиро мушаххас мекунад: системаҳои муосири ошкорсозӣ, ки дар маҷмӯаҳои додаҳои қаблӣ омӯзонда шудаанд, ҳангоми арзёбӣ дар мундариҷаи воқеии deepfake-и аз шабакаҳои иҷтимоӣ дар соли 2024 ҷамъоваришуда, дар арзишҳои AUC тақрибан %50 коҳиш нишон медиҳанд. Аз ҳама коҳиши калон дар намунаҳои бар diffusion асосёфта мушоҳида шудааст, ки равшан нишон медиҳад чаро нишонаҳои кӯҳнаи ошкорсозӣ дар муқобили моделҳои нави тавлид заиф мешаванд.

Дар ин ҷо мафҳуми муҳим AUC, яъне Area Under the ROC Curve мебошад. AUC қобилияти модели ошкорсозиро барои ҷудо кардани намунаҳои воқеӣ ва сохта дар остонаҳои гуногуни қарор чен мекунад. Ба таври содда, он месанҷад, ки модел дар ҷудокунии «воқеӣ ё сохта?» то чӣ андоза боэътимод рейтинг мекунад. Коҳиши AUC маънои онро дорад, ки нишонаҳои дар муҳити қаблӣ омӯхташуда дар муҳити нав дигар ба ҳамон андоза кор намекунанд. Мушкилоте, ки таҳқиқот таъкид мекунад, маҳз ҳамин аст: муваффақияти баланд дар маҷмӯаи додаҳои лабораторӣ дар мундариҷаи фишурдашуда, буридашуда, дубора боршуда ва бо моделҳои гуногуни тавлид офаридашуда дар шабакаҳои иҷтимоӣ ба ҳамон андоза нигоҳ дошта намешавад.

Мақола мегӯяд, ки аксари шарҳҳои мавҷуда тавлид ва ошкорсозиро ҳамчун ду хатти параллел, вале ҷудо тавсиф мекунанд. Аммо ба назари муаллифон, динамикаи асосии соҳа даврӣ аст. Системаи ошкорсозӣ як нишона пайдо мекунад; модели тавлидкунанда ин нишонаҳоро коҳиш медиҳад; системаи ошкорсозӣ ба нишонаи сатҳи баландтар мегузарад. Аз ин рӯ, чаҳорчӯбаи асосии пешниҳодшуда adversarial evolution, яъне эволютсияест, ки дар он ҷониби ҳамлагар ва дифоъкунанда пайваста якдигарро аз нав шакл медиҳанд.

Яке аз муҳимтарин мафҳумҳои таҳқиқот cue drift, яъне кӯчиши нишонаи ошкорсозӣ мебошад. Дар ошкорсозии deepfake «cue» из ё аломатест, ки барои гирифтани мундариҷаи сохта истифода мешавад. Ин нишона баъзан намунаи сунъӣ дар фазои басомад, баъзан марзи пайвасткунии канори чеҳра, баъзан вайроншавӣ дар сигнали гардиши хун, баъзан номувофиқии садо ва ҳаракати лаб, ё баъзан ҳаракати физикии видеоест, ки ба ҷаҳони воқеӣ мувофиқат намекунад. «Cue drift» бошад, иваз шудани ҷойи ин нишонаҳо бо рушди моделҳои тавлидкунанда аст. Агар системаи ошкорсозӣ ба нишонаи як давра аз ҳад зиёд такя кунад, вақте модели насли нав онро бартараф мекунад, дифоъ заиф мешавад.

Таҳқиқот давраи 2014–2025-ро ба се даври асосии нишонаҳои ошкорсозӣ ҷудо мекунад. Даври аввал frequency-cue era, яъне давраи нишонаҳои басомадӣ мебошад. Ин давра тақрибан солҳои 2014–2019-ро дар бар мегирад ва махсусан бо тавлиди GAN асосёфта алоқаманд аст. Моделҳои GAN ҳангоми тавлиди тасвир аз амалҳои муайяни upsampling истифода мекунанд. Ин амалҳо метавонанд изҳои басомадие эҷод кунанд, ки дар тасвирҳои табиии бо камера гирифташуда вуҷуд надоранд. Системаҳои ошкорсозӣ дар ин давра кӯшиш мекарданд бо дидани фазои басомадии тасвир мундариҷаи сохтаро муайян кунанд.

Яке аз нишонаҳои муҳими техникӣ дар ин давра намунаҳои даврие мебошанд, ки амали transposed convolution эҷод мекунад. Дар таҳқиқот дар тасвирҳои GAN аз тамаркузи энергия тақрибан дар минтақаҳои басомадии (±0.25, ±0.25) сухан меравад. Ин изҳо аз намунаҳои табиие, ки аз камера ва сенсор дар тасвирҳои муқаррарӣ пайдо мешаванд, фарқ мекунанд. Бо як ташбеҳи рӯзмарра, метавон чунин тасаввур кард: матои ҳақиқӣ ноустувориҳои табиии бофтан дорад, аммо нақши сохтаи мошин метавонад хатҳои микроскопии такроршаванда гузорад. Системаҳои ошкорсозии басомадӣ ба рӯйи тасвир не, балки ба ҳамин нақшҳои ноаён менигаранд.

Дар таҳқиқот амали асосии таҳлили басомад бо муносибати зерин шарҳ дода мешавад:

\[ P(r)=\frac{1}{2\pi}\int_{0}^{2\pi}|F(r\cos\theta,r\sin\theta)|\,d\theta \]

Дар ин формула F(u,v) намояндагии тасвир дар фазои басомад аст. r радиусро дар фазои басомад ва θ самти кунҷиро нишон медиҳад. P(r) бо миёнагирии энергияи басомадӣ дар самтҳои гуногун профили якченакаи энергияи радиалӣ месозад. Маънои формула чунин аст: чен карда мешавад, ки тасвир дар кадом минтақаҳои басомадӣ ҷамъшавии ғайритабиии энергия дорад. Агар дар тасвирҳои сохтаи GAN дар минтақаҳои муайяни басомадӣ қуллаҳои сунъӣ пайдо шаванд, ин метавонад барои ошкорсозӣ истифода шавад.

Аммо даври аввал низ маҳдудият дорад. Бо рушди меъмориҳои GAN, махсусан равишҳои alias-free ба монанди StyleGAN3, ин изҳои басомадӣ коҳиш меёбанд. Илова бар ин, системаҳои ивазкунии чеҳра ба ҷойи тавлиди чеҳра аз сифр ба ҷойгир кардани як чеҳра рӯйи видеои дигар мегузаранд. Ҳамин тавр, изи сохтакорӣ аз фазои басомад ба марзҳои пайвасткунии чеҳра ва устувории биологӣ дар тӯли вақт кӯч мекунад.

Даври дуюм blending-boundary and deep-representation era, яъне давраи марзи пайвасткунӣ ва намояндагии амиқ мебошад. Ин давра тақрибан солҳои 2018–2023 барҷаста аст. Системаҳои autoencoder ё face reenactment ба монанди DeepFaceLab, FaceSwap ва First Order Motion Model дар ин замина муҳиманд. Ин системаҳо аксаран шахсияти як нафарро ба ҳаракати чеҳраи дигар ё видеои ҳадаф мегузоранд. Азбаски минтақаи чеҳра дар кадри ҳадаф композит мешавад, дар гирди чеҳра ё матни он изҳое ба монанди марз, маска, номувофиқии ранг, ҳамворшавӣ ва вайроншавии биофизиологӣ боқӣ монда метавонанд.

Системаҳои ивазкунии чеҳраи autoencoder асосёфта одатан бо мантиқи shared encoder–independent decoder кор мекунанд. Encoder-и муштарак хусусиятҳои сохтории ғайришахсиятӣ, ба монанди поза, ифода ва рӯшноиро аз чеҳра мегирад; decoder-ҳои гуногун бошанд, матни чеҳраи шахсияти манбаъ ва ҳадафро аз нав месозанд. Шакли 7 дар таҳқиқот ин механизмро ба таври схемавӣ нишон медиҳад. Ин равиш баъзе ноустувориҳои омӯзиши GAN-ро коҳиш дода, ивазкунии чеҳраро амалӣ мегардонад. Аммо талафи азнавсозии сатҳи пиксел метавонад ҷузъиёти басомади баланди матни чеҳраро ҳамвор кунад. Ин ҳолат дар таҳқиқот ҳамчун намуди “waxy”, яъне ҳамвории монанди муми, баррасӣ мешавад.

Усулҳои ошкорсозии ин давра кӯшиш мекунанд марзҳоеро пайдо кунанд, ки чеҳраи сохта ба кадри ҳадаф часпонда шудааст. Равишҳое ба монанди Face X-ray ва Self-Blended Images кӯшиш мекунанд марзи омехтаро, ки аз раванди ивазкунии чеҳра боқӣ мемонад, мустақим модел кунанд. Илова бар ин, равишҳое мисли FakeCatcher кӯшиш мекунанд аз тағйироти хеле хурди ранги пӯсти рӯй сигналҳои remote photoplethysmography, яъне фотоплетизмографияи дурдаст/rPPG-ро, ки бо тапиши дил алоқаманданд, бароранд. Дар чеҳраи воқеии инсон гардиши хун ва ранги пӯст дар тӯли вақт ритми биологӣ доранд; дар видеои сохта ин ритм аксаран дуруст нигоҳ дошта намешавад.

Даври сеюм semantic and physical-consistency era, яъне давраи устувории семантикӣ ва физикӣ мебошад. Ин давра солҳои 2022–2025-ро дар бар мегирад ва бо моделҳои diffusion, системаҳои бузурги тавлиди видео ва равишҳои бисёрмодалӣ алоқаманд аст. Системаҳо ба монанди Stable Diffusion, DiT, DreamBooth ва Sora дар тавлиди тасвир ва видео воқеиятнокии хеле баланд, назорати шартӣ ва устувории зоҳирии физикиро пешниҳод мекунанд. Дар ин нуқта изҳои басомадӣ, марзҳои оддии пайвасткунӣ ё аномалияҳои ҷудогонаи пиксел барои ошкорсозӣ кофӣ набошанд.

Моделҳои diffusion асосан раванди denoising-ро истифода мекунанд, ки аз садо ба дода ҳаракат мекунад. Модел аввал раванди қадам ба қадам илова кардани садо ба додаҳоро меомӯзад ва баъд ин равандро баръакс гардонда, аз садо тасвир ё видеои маънодор месозад. Дар таҳқиқот асоси эҳтимолии моделҳои diffusion бо муносибати ELBO-и зерин дода шудааст:

\[ \mathbb{E}[-\log p_{\theta}(x_0)] \leq \mathbb{E}_{q}\left[-\log p(x_T)-\sum_{t\geq 1}\log\frac{p_{\theta}(x_{t-1}|x_t)}{q(x_t|x_{t-1})}\right] \]

Дар ин формула x0 намунаи воқеӣ/дода, xT ҳолати ниҳоии пур аз садо, q(xt|xt-1) раванди илова кардани садо дар самти пеш ва pθ(xt-1|xt) раванди баръакси модели омӯхташуда барои бартараф кардани садо ва наздик шудан ба дода мебошад. θ параметрҳои моделро нишон медиҳад. Аз нигоҳи техникӣ, ин ифода мегӯяд, ки модел ба ҷойи ҳисоб кардани мустақими тақсимоти додаҳои воқеӣ кӯшиш мекунад онро тавассути ҳадди поён омӯзад.

Дар омӯзиши амалӣ ин ҳадафи мураккаб, тавре ки Ho ва ҳамкоронаш нишон додаанд, ба талафи пешгӯии садо содда карда мешавад. Формулаи соддакардашудаи loss, ки дар таҳқиқот дода шудааст, чунин аст:

\[ L_{simple}(\theta)=\mathbb{E}_{t,x_0,\epsilon}\left[\left\|\epsilon-\epsilon_{\theta}\left(\sqrt{\bar{\alpha}_t}x_0+\sqrt{1-\bar{\alpha}_t}\epsilon,t\right)\right\|^2\right] \]

Дар ин формула ε садои воқеиест, ки ба дода илова шудааст; εθ садое мебошад, ки модел пешгӯӣ мекунад; t қадами вақт/садо; \bar{α}t коэффициенте, ки ҷадвали садоро муайян мекунад; ва x0 намунаи додаҳои тозаи ибтидоӣ мебошад. Маънои рӯзмарраи формула чунин аст: модел меомӯзад, ки «ба ин тасвир чӣ садо илова шуда буд?». Вақте ба ин савол ба қадри кофӣ хуб ҷавоб дода метавонад, метавонад баръакс ҳаракат карда, аз садо тасвири воқеӣ тавлид кунад.

Қисми душвортарини моделҳои diffusion барои ошкорсозӣ он аст, ки раванди тавлид метавонад ба омори тасвирҳои табиӣ хеле наздик шавад. Қуллаҳои сунъии дар фазои басомад дидашудаи давраи GAN дар баромадҳои diffusion сусттар буда метавонанд. Дар тавлиди видео низ моделҳои монанди Sora бо порчабандии фазо-замон ва меъмориҳои DiT ҳаракат, рӯшноӣ, ҳамкории физикӣ ва вобастагиҳои дурро беҳтар модел мекунанд. Ин ҳолат ошкорсозиро аз сатҳи пиксел ба сатҳи баландтар мебарад: Оё видео ба қонунҳои физика мувофиқат мекунад? Оё садо ва ҳаракати лаб дар ҳақиқат ҳамоҳанганд? Оё оҳанги эҳсосии нутқ бо ифодаи чеҳра мувофиқ аст? Оё соя, манбаи рӯшноӣ ва самти ҳаракат ба як ҷаҳони физикӣ тааллуқ доранд?

Мақола соҳаи deepfake-и бисёрмодалиро ҳамчун як остонаи муҳими ҷудогона баррасӣ мекунад. Дар давраҳои аввал сохтакорӣ бештар бо тасвири чеҳра маҳдуд буд. Баъд системаҳои мутобиқ кардани ҳаракати лаб ва садо рушд карданд. Системаҳо ба монанди Wav2Lip дар тавлиди ҳаракати лаби мувофиқ ба овози сухан хеле қавӣ шуданд. Сипас моделҳои сари сухангӯи бар NeRF ва diffusion асосёфта ифодаи чеҳра, ҳаракати даҳон, оҳанги овоз ва устувории шахсиятро якҷоя тавлид карданд. Имрӯз ва дар ояндаи наздик хавф танҳо видеои сохта нест; садои сохта, чеҳраи сохта, забони бадани сохта, эҳсоси сохта ва сенарияи сухани сохтаи мутобиқ ба контекст метавонанд якҷоя тавлид шаванд.

Аз ин рӯ, таҳқиқот сохтакории бисёрмодалиро дар се сатҳ баррасӣ мекунад: temporal synchronisation, яъне ҳамоҳангии вақтӣ; emotional consistency, яъне мувофиқати эҳсосӣ; ва biomechanical consistency, яъне мувофиқати биомеханикӣ. Дар нутқи воқеӣ ҳаракати лаб, оғози садо, ритми нафас, мушакҳои рӯй, ҳаракати чашм, оҳанг ва шиддати эҳсосӣ аз ҳам мустақил нестанд. Ҳатто агар мундариҷаи сохта хеле воқеӣ намояд, дар яке аз ин қабатҳо номувофиқии хурд боқӣ монда метавонад.

Масалан, лағжишҳои зиёда аз 40–60 миллисония байни садо ва ҳаракати лаб метавонанд дар дарки инсон ҳисси ғайритабиӣ ба вуҷуд оранд. Ба ҳамин монанд, агар чеҳраи шахс хандон намояд, вале оҳанги овоз гиря ё тарсро ифода кунад, номувофиқии эҳсосӣ пайдо мешавад. Пӯшидани лаб ва тарзҳои талаффуз дар забонҳои гуногун низ муҳиманд. Дар таҳқиқот гуфта мешавад, ки муносибатҳои фонема–визема дар забонҳое ба монанди чинӣ ва англисӣ метавонанд нишонаи ошкорсозии deepfake бошанд. Ин маънои онро дорад, ки системаҳои ошкорсозӣ бояд на танҳо коркарди тасвир, балки дониш дар бораи забон, фонетика, ҳаракати бадан ва биологияи инсонро низ истифода кунанд.

Бахши усули таҳқиқот нишон медиҳад, ки ин шарҳ аз манбаъҳои тасодуфӣ интихобшуда ташкил нашудааст. Муҳаққиқон протоколи ба PRISMA мутобиқшударо истифода кардаанд. IEEE Xplore, ACM Digital Library, Web of Science ва arXiv ҷустуҷӯ шудаанд. Истилоҳҳои ҷустуҷӯ дар се гурӯҳ сохта шудаанд: истилоҳҳои тавлид, истилоҳҳои ошкорсозӣ ва истилоҳҳои модалият. Дар тарафи тавлид истилоҳҳои deepfake, face forgery, face swap, talking head, diffusion model, GAN ва autoencoder; дар тарафи ошкорсозӣ detection, forensics, authentication ва anti-spoofing; ва дар тарафи модалият истилоҳҳои image, video, audio ва multimodal истифода шудаанд.

Ҷараёни PRISMA дар Шакли 2-и таҳқиқот нишон дода мешавад. Дар ҷустуҷӯи аввал 1.486 сабт ёфт шудааст. Пас аз хориҷ кардани 312 такрор, 1.174 сабт дар сатҳи унвон ва хулоса санҷида шудаанд. 627 сабт ба сабаби берун аз мавзӯъ будан хориҷ шудаанд. 547 матни пурра барои мувофиқат арзёбӣ шуда, 211 таҳқиқот ба синтези сифатӣ дохил карда шудааст. Аз ин 211 таҳқиқот 83-тояш ба усулҳои тавлид, 75-тояш ба усулҳои ошкорсозӣ, 31-тояш ба маҷмӯаҳои додаҳо ва арзёбӣ, ва 22-тояш ба идоракунӣ, ахлоқ ва сиёсат тааллуқ доранд. Ин рақамҳо нишон медиҳанд, ки таҳқиқот на танҳо моделҳои техникӣ, балки ҷанбаҳои маҷмӯаи дода ва идоракуниро низ фаро мегирад.

Таҳқиқот махсус таъкид мекунад, ки meta-analysis анҷом надодааст. Сабаб он аст, ки таҳқиқотҳои дохилшуда аз рӯи маҷмӯаҳои дода, протоколҳои арзёбӣ, сатҳҳои фишурдашавӣ, усулҳои буридани чеҳра, суръатҳои намунагирӣ ва тарзи ҳисоботдиҳӣ хеле гуногунанд. Яъне муҳаққиқон кӯшиш накардаанд як андозаи умумии таъсир ҳисоб кунанд. Ба ҷойи он синтези мавзӯӣ анҷом дода, дар ҳар давр ба се чиз нигаристаанд: кадом усулҳои тавлид бартарӣ доранд, ин усулҳо кадом изҳоро мегузоранд ё кадом изҳои кӯҳнаро пахш мекунанд, ва усулҳои ошкорсозӣ ин изҳоро чӣ гуна ба ченак табдил медиҳанд.

Муқоисаи технологияҳои тавлид низ дар таҳқиқот муҳим аст. GAN, autoencoder ва diffusion наслҳое нестанд, ки ҳатман пайдарпай якдигарро пурра иваз карда бошанд; дар бисёр давраҳо онҳо параллел истифода шудаанд. GAN-ҳо метавонанд дар inference-и тез ва ҷузъиёти тезу равшан бартарӣ дошта бошанд, аммо мушкилоте ба монанди изҳои басомадӣ ва ноустувории омӯзиш доранд. Системаҳои autoencoder ивазкунии чеҳраи устувортар ва амалӣ медиҳанд, аммо метавонанд дар матни рӯй ҳамворшавӣ ва гум шудани ҷузъиёти басомади баланд ба вуҷуд оранд. Моделҳои diffusion воқеиятнокии баланд ва назорати шартӣ медиҳанд, вале аз сабаби намунагирии итеративӣ сусттар ва аз ҷиҳати ҳисоббарорӣ гаронтаранд. Системаҳои бисёрмодалӣ ҳамоҳангсозии садо, тасвир, матн ва вақтро якҷоя ҳадаф мегиранд; аммо дар видеоҳои дароз drifting-и шахсият, номувофиқии эҳсосӣ ва мушкилоти real-time то ҳол муҳиманд.

Бахши метрикаҳои арзёбии мақола нишон медиҳад, ки дар таҳқиқоти deepfake як рақами муваффақият кофӣ нест. Дар тарафи ошкорсозӣ ченакҳои AUC, EER, IoU ва ACC истифода мешаванд. Дар тарафи сифати тавлид FID, Id-Acc, FVD, TCM, IS, LPIPS, CLIP Score ва NIQE мавҷуданд. Дар тарафи мувофиқати бисёрмодалӣ LSE-D/C ва MOS барҷастаанд. Матритсаи се меҳварие, ки таҳқиқот пешниҳод мекунад, ин ченакҳоро дар як чаҳорчӯба ҷамъ мекунад.

EER, яъне Equal Error Rate, остонаеро нишон медиҳад, ки дар он сатҳи қабули нодуруст ва радкунии нодуруст баробар мешаванд. Он дар контекстҳои адлияи рақамӣ ва биометрӣ муҳим аст, зеро мундариҷаи сохтаро воқеӣ қабул кардан ва мундариҷаи воқеиро сохта донистан ҳар ду хавфҳои гуногун, вале ҷиддӣ доранд. IoU, яъне Intersection over Union, чен мекунад, ки минтақае, ки сохта ҳисобида мешавад, то чӣ андоза бо минтақаи воқеан нишондодашудаи сохта мувофиқат дорад. Ин барои посух додан ба саволи «сохтакорӣ дар кадом қисми тасвир аст?» зарур мебошад, на танҳо гуфтан, ки «видео сохта аст».

Дар метрикаҳои сифати тавлид FID чен мекунад, ки тасвирҳои тавлидшуда то чӣ андоза ба тақсимоти тасвирҳои воқеӣ монанданд. Id-Acc дар барномаҳои ивазкунии чеҳра месанҷад, ки шахсияти ҳадаф нигоҳ дошта шудааст ё не. FVD-ро метавон ҳамтои видеоии FID донист ва он устувории вақтро ба назар мегирад. TCM бо гирифтани номувофиқии optical flow байни кадрҳо мушкилоте ба монанди flicker ё ларзишро чен мекунад. Дар тарафи бисёрмодалӣ LSE-D/C ҳамоҳангии ҳаракати лаб ва садои нутқро; MOS бошад, рейтинги воқеиятнокие, ки арзёбони инсонӣ эҳсос мекунанд, ифода мекунад.

Бахши маҷмӯаҳои додаҳо низ нишон медиҳад, ки соҳаи deepfake чӣ гуна васеъ шудааст. Дар давраҳои аввал маҷмӯаҳои хурди видеоӣ ба монанди UADFV ва DF-TIMIT истифода мешуданд. Баъдтар маҷмӯаҳои калонтар ва душвортаре ба монанди FaceForensics++, Celeb-DF, DFDC ва WildDeepfake ба вуҷуд омаданд. Дар тарафи тасвир CelebA-HQ, FFHQ, маҷмӯаҳои PGGAN/StyleGAN ва маҷмӯаҳои давраи diffusion ба монанди Fake2M барҷастаанд. Дар тарафи бисёрмодалӣ FakeAVCeleb, KoDF, LAV-DF, MADD, Codecfake ва DDL кӯшиш мекунанд ба талаботи deepfake-и садо–видео, нутқи бисёрзабона, манипулятсияи маҳаллӣ ва тамғагузории дақиқ ҷавоб диҳанд.

Ҳар яке аз ин маҷмӯаҳои дода мушкили дигареро намоён мекунад. FaceForensics++ барои муқоисаи стандартӣ қавӣ аст, аммо метавонад барои forgeries-и насли нави хеле воқеӣ маҳдуд бошад. Celeb-DF сохтакории тозатарро месанҷад. DFDC дар миқёси саноатӣ тақсимоти мураккаб ва воқеӣ медиҳад. WildDeepfake душвории мундариҷаи гетерогенеро, ки дар интернет гардиш мекунад, инъикос мекунад. LAV-DF барои арзёбии сенарияҳое муфид аст, ки танҳо қисми кӯтоҳи видео дасткорӣ шудааст. MADD ва KoDF аз марказияти англисӣ берун шуда, масъалаҳои бисёрзабона ва байнифарҳангиро ба миён меоранд.

Бахши идоракунӣ муҳимтарин қисми таҳқиқотест, ки аз шарҳи техникӣ берун меравад. Ба назари муаллифон, мубориза бо deepfake танҳо бо сохтани детектори беҳтар ҳал намешавад. Зеро баъд аз паҳн шудани мундариҷаи сохта, ошкор кардани он аксаран дифои дершуда мебошад. Аз ин рӯ, таҳқиқот пешниҳод мекунад, ки абзорҳое ба монанди generation-time watermarking, яъне гузоштани watermark дар вақти тавлид; content provenance, яъне тасдиқи манбаъ ва таърихи коркарди мундариҷа; blockchain-based evidence preservation, яъне ҳифзи далел бо блокчейн; ва risk-tiered regulation, яъне танзими бар асоси сатҳи хавф, якҷоя баррасӣ шаванд.

Дар ин нуқта усулҳое ба монанди Stable Signature, Tree-ring Watermarks ва SynthID мисол оварда мешаванд. Stable Signature қабати watermark-и омӯхташавандаро дар decoder-и latent diffusion ҷой медиҳад. Tree-ring Watermarks аломати ноаён, вале барқароршавандаро дар фазои Fourier-и садои ибтидоӣ рамзгузорӣ мекунад. SynthID кӯшиш мекунад дар раванди тавлид изи омории ангушт гузорад, ки чашми инсон онро намебинад, аммо системаи санҷишӣ мехонад. Ин равишҳо ҳадаф доранд ба ҷойи кӯшиши гирифтани мундариҷаи сохта пас аз паҳншавӣ, дар манбаи тавлид из боқӣ гузоранд.

Стандартҳои provenance-и мундариҷа ба монанди C2PA низ дар ин чаҳорчӯба муҳиманд. Агар бо роҳи криптографӣ тасдиқ шавад, ки акс ё видео бо кадом дастгоҳ сабт шудааст, бо кадом нармафзор коркард шудааст, чӣ тағйирот дар он анҷом дода шудааст ва занҷир дар куҷо канда шудааст, ошкорсозӣ танҳо дар сатҳи «алгоритм инро сохта донист» намемонад. Дар тамоми давраи зиндагии мундариҷа занҷири далел сохтан мумкин аст. Ин махсусан барои рӯзноманигорӣ, ҳуқуқ, суғурта, амният, равандҳои судӣ ва иртиботи ҷамъиятӣ муҳим аст.

Таҳқиқот чаҳорчӯбаи технология–ҳуқуқ–ахлоқро бо EU AI Act, NIST AI Risk Management Framework, чораҳои Чин оид ба AI-и тавлидӣ ва тавсияҳои ахлоқии AI-и UNESCO алоқаманд мекунад. Абзорҳои техникӣ уҳдадориҳои танзимиро иҷроишпазир мекунанд; чаҳорчӯбаҳои танзимӣ ба стандартҳои техникӣ самт медиҳанд; саводи расонаии ҷомеа бошад, имкон медиҳад ин сигналҳо дуруст фаҳмида шаванд. Яъне танҳо watermark гузоштан кофӣ нест; одамон ва муассисаҳо бояд донанд, ки ин watermark чӣ маъно дорад, дар кадом ҳолат боэътимод аст ва кай метавонад нокифоя бошад.

Аз нигоҳи гузашта, аҳамияти таҳқиқот дар он аст, ки таърихи deepfake-ро аз пайдарпаии оддии «GAN омад, autoencoder омад, diffusion омад» бароварда, аз рӯи кӯчиши нишонаҳои ошкорсозӣ аз нав шарҳ медиҳад. Ин барои фаҳмидани адабиёт динамикаи бештар медиҳад. Зеро он чизе, ки воқеан соҳаро тағйир медиҳад, на танҳо меъмориҳои нави модел, балки шикастани нишонаҳои кӯҳнаи дифоъ ва гузаштан ба сатҳҳои нави дифоъ мебошад.

Аз нигоҳи имрӯз, аҳамияти он дар афзоиши босуръати хавфи deepfake дар шабакаҳои иҷтимоӣ, бахши молиявӣ, иртиботи сиёсӣ ва тасдиқи шахсияти рақамӣ аст. Овози роҳбари ширкатро метавон клон кард, видеои сохтаи сиёсатмадор метавонад дар лаҳзаи буҳрон паҳн шавад, тасвири маҳрамонаи шахс сохта шавад, ё эътимоди манбаи хабар коста гардад. Системаҳои ошкорсозӣ бояд на танҳо бо муваффақияти лабораторӣ, балки дар тақсимоти воқеии ҷаҳон, дар мундариҷаи фишурдашуда ва дубора боршуда, дар забонҳои гуногун, гурӯҳҳои гуногуни чеҳра ва моделҳои нави тавлид санҷида шаванд.

Аз нигоҳи оянда, таҳқиқот пешбинӣ мекунад, ки ошкорсозӣ ҳарчи бештар аз таснифи post-hoc ба тасдиқ дар манбаъ мегузарад. Яъне дар оянда дифои асосӣ танҳо детекторҳое нахоҳад буд, ки мепурсанд «ин видео сохта аст?». Ба ҷойи он, мундариҷа дар вақти тавлид watermark мешавад, маълумоти provenance ба таври криптографӣ пайваст мегардад, платформаҳо онро месанҷанд, мундариҷаи шубҳанок бо системаҳои бисёрмодалии ошкорсозӣ таҳлил мешавад ва ҳангоми зарурат занҷири далели судӣ сохта мешавад. Ин яке аз паёмҳои стратегии асосии таҳқиқот аст.

Қувваи асосии таҳқиқот дар он аст, ки тавлид, ошкорсозӣ, маҷмӯаи дода, метрика ва идоракуниро дар як чаҳорчӯба муттаҳид мекунад. Он танҳо рӯйхати моделҳои техникӣ намедиҳад; шарҳ медиҳад, ки ҳар парадигмаи тавлид кадом нишонаи ошкорсозиро заиф мекунад ва дифоъ чӣ гуна ба нишонаҳои нав кӯч мекунад. Илова бар ин, шаклҳо ва ҷадвалҳо ин далелро дастгирӣ мекунанд: Шакли 1 эволютсияи тавлид ва ошкорсозиро дар хати вақт нишон медиҳад; Шакли 2 раванди интихоби PRISMA-ро шарҳ медиҳад; Ҷадвали 2 дар се давр ҷамъбаст мекунад, ки кадом роҳи тавлид кадом изҳоро мегузорад ва кадом усулҳои ошкорсозӣ посух медиҳанд; Ҷадвали 8 матритсаи арзёбӣ ва Ҷадвали 9 ҷавобҳои техникӣ ва идоракуниро муттаҳид мекунад.

Маҳдудиятҳо низ бояд бодиққат гуфта шаванд. Таҳқиқот preprint аст ва аз peer review нагузаштааст. Он натиҷаи нави таҷрибавӣ тавлид намекунад; адабиёти мавҷударо синтез мекунад. Андозаи таъсири meta-analytic ҳисоб намекунад, зеро маҷмӯаҳои дода ва протоколҳо хеле гетерогенанд. Баъзе арзишҳои performance аз протоколҳои худи мақолаҳои аслӣ гирифта шудаанд ва муқоисаи мутлақи онҳо байни таҳқиқот ҳамеша боэътимод нест. Илова бар ин, дар соҳаҳое ба монанди ошкорсозии MLLM-based далел ҳанӯз дар марҳилаи аввал аст; таҳқиқот низ эҳтиёткор буда, мегӯяд, ки ин системаҳо ҳанӯз барои moderating-и real-time ҷойгузини детекторҳои махсуси баркамол нестанд.

Он чизе, ки таҳқиқот мегӯяд, чунин аст: тавлид ва ошкорсозии deepfake якҷоя эволютсия мекунанд; ҳар парадигмаи нави тавлид нишонаҳои кӯҳнаи ошкорсозиро заиф месозад ва усулҳои ошкорсозӣ ба равишҳои семантикӣ, физикӣ, бисёрмодалӣ ва тасдиқи манбаъ дар сатҳи баландтар мегузаранд. Он чизе, ки намегӯяд, ин аст: ҳар deepfake ҳатман ошкор мешавад, watermark тамоми мушкилро ҳал мекунад, системаҳои MLLM аз имрӯз детектори боэътимоданд ё як метрика барои чен кардани амнияти deepfake кофист. Баръакс, таҳқиқот таъкид мекунад, ки соҳа ба меъмории дифои бисёрқабата, динамикӣ ва пайваста навшаванда ниёз дорад.

Усул ва Натиҷаҳои Таҳқиқот

Ин таҳқиқот кори таҷрибавии таҳияи модел нест, балки синтези адабиёт дар шакли баррасии систематикӣ мебошад. Муҳаққиқон адабиёти тавлид, ошкорсозӣ, маҷмӯаҳои дода, метрикаҳои арзёбӣ ва идоракунии deepfake-ро дар давраи 2014–2025 ҷустуҷӯ карда, натиҷаҳоро дар чаҳорчӯбаи “adversarial evolution” аз нав ташкил кардаанд.

Усули ҷустуҷӯи манбаъҳои таҳқиқот:

Унсури усулРавиши истифодашуда дар таҳқиқотМаъно
Давраи ҷустуҷӯ1 январи 2014 – 31 декабри 2025.Соҳа аз зуҳури GAN то diffusion ва моделҳои бузурги тавлиди видео пайгирӣ шудааст.
Пойгоҳҳои додаIEEE Xplore, ACM Digital Library, Web of Science, arXiv.Ҳам мақолаҳои peer-reviewed ва ҳам preprint-ҳои бисёр истинодшуда ва таъсиргузор дар соҳа ҷустуҷӯ шудаанд.
Гурӯҳҳои ҷустуҷӯИстилоҳҳои тавлид, ошкорсозӣ ва модалият.Тавлиди deepfake, ошкорсозии судӣ, тасвир, видео, садо ва мундариҷаи бисёрмодалӣ якҷо фаро гирифта шудаанд.
Равиши интихобПротоколи систематикии интихоби мутобиқшуда ба PRISMA.Ҳадаф пайгиришаванда ва такроршаванда кардани интихоби адабиёт мебошад.
Усули синтезТаҳлили мавзӯӣ.Таҳқиқотҳо аз рӯи парадигмаи тавлид, парадигмаи ошкорсозӣ ва соли нашр гурӯҳбандӣ шудаанд.

Раванди интихоби PRISMA:

МарҳилаШумораШарҳ
Сабтҳои аввал ёфтшуда1.486Аз IEEE Xplore, ACM Digital Library, Web of Science ва arXiv гирифта шудаанд.
Сабтҳои такрории хориҷшуда312Ҳампӯшии байни пойгоҳҳои дода тоза карда шудааст.
Санҷиши унвон/хулоса1.174Сабтҳои боқимонда аз рӯи мувофиқати мавзӯъ арзёбӣ шудаанд.
Сабтҳои берун аз мавзӯъ хориҷшуда627Таҳқиқоти умумии generative modeling ё таҳлили судии ғайри-deepfake хориҷ шудаанд.
Арзёбии матни пурра547Матнҳои пурра мувофиқи меъёрҳои дохилкунӣ баррасӣ шудаанд.
Таҳқиқоти дохилшуда ба синтези сифатӣ21183 таҳқиқоти тавлид, 75 ошкорсозӣ, 31 маҷмӯаи дода/метрика ва 22 идоракунӣ/ахлоқ/сиёсат.

Меҳварҳои асосии гурӯҳбандии таҳқиқотҳо:

  • Парадигмаи тавлид: усулҳои GAN-based, autoencoder-based, diffusion-based ва multimodal/hybrid.
  • Парадигмаи ошкорсозӣ: artefact-ҳои физикӣ, намояндагиҳои амиқ, механизмҳои баландбардории robust-ӣ, санҷишҳои мувофиқати бисёрмодалӣ ва усулҳои дифои фаъол.
  • Меҳвари вақт: таҳқиқотҳо ба се даври adversarial-и ҳампӯш пайваст шудаанд.

Се даври adversarial-и ошкорсозӣ:

ДаврДавраТарафи тавлидНишонаи ошкорсозӣРушде, ки даврро заиф кард
Давраи нишонаи басомад2014–2019Моделҳои GAN, StyleGAN, cGAN, CycleGAN ва монанди онҳо.Аномалияҳои басомад, изҳои checkerboard, номувофиқии PRNU, номувофиқии позаи сар.Меъмориҳои alias-free ва системаҳои ивазкунии чеҳраи autoencoder-based ин изҳоро заиф карданд.
Давраи марзи пайвасткунӣ ва намояндагии амиқ2018–2023Системаҳои ивазкунии чеҳра/reenactment ба монанди DeepFaceLab, FaceSwap, FOMM.Марзҳои омехтаи чеҳра, матни рӯйи ҳамвор, вайроншавии биофизиологӣ ба монанди rPPG ва нафас.Равандҳои denoising-и diffusion ва моделҳои видеоии дорои устувории бештари физикӣ ин изҳоро коҳиш доданд.
Давраи устувории семантикӣ ва физикӣ2022–2025Системаҳои монанди Stable Diffusion, DiT, DreamBooth ва Sora.Хатои азнавсозии diffusion, номувофиқии биомеханикии садо–тасвир, вайроншавии қонунҳои физика, тасдиқи манбаъ.Пешбинӣ мешавад, ки маркази дифои навбатӣ watermark ва provenance verification дар манбаъ хоҳад буд.

Муқоисаи парадигмаҳои тавлиди deepfake:

ПарадигмаПринсипи асосӣҶиҳати қавӣҶиҳати заифИстифодаи маъмул
GANМутобиқсозии тақсимот дар рақобати adversarial байни generator ва discriminator.Inference-и тез, ҷузъиёти тез, manipulation-и latent space.Изҳои басомадӣ, mode collapse, identity drift дар кадрҳои видео.Синтези real-time-и чеҳра ва ивазкунии чеҳра.
AutoencoderАзнавсозии encoder–decoder.Омӯзиши устувортар, амалӣ будани ивазкунии чеҳра, pipeline-и шахсӣ.Гум шудани ҷузъиёти басомади баланд, сатҳи ҳамвор монанди мум, умумисозии маҳдуд.Ивазкунии шахсият ба монанди DeepFaceLab ва FaceSwap.
DiffusionDenoising-и итеративӣ аз садо ба дода.Фотореализм, назорати шартӣ бо матн/тасвир, наздикшавӣ ба омори тасвирҳои табиӣ.Намунагирии суст, хароҷоти баланди ҳисоббарорӣ, мушкили identity–attribute entanglement.Тавлиди тасвир/видеои баландсифат ва синтези шахсисозишуда.
Системаҳои бисёрмодалӣҲамоҳангсозии якҷояи садо, тасвир, матн ва ҷараёни вақт.Инсони рақамии сухангӯ, ҳамоҳангии садо–лаб, назорати эҳсос ва семантика.Identity drift дар видеои дароз, номувофиқии эҳсосӣ, мушкили real-time ва амният.Инсони рақамӣ, ислоҳи дубляж, аватари сухангӯ, хавфи social engineering.

Муносибатҳои асосии омӯзишии diffusion model, ки дар таҳқиқот дода шудаанд:

\[ \mathbb{E}[-\log p_{\theta}(x_0)] \leq \mathbb{E}_{q}\left[-\log p(x_T)-\sum_{t\geq 1}\log\frac{p_{\theta}(x_{t-1}|x_t)}{q(x_t|x_{t-1})}\right] \]

Ин формула чаҳорчӯбаи эҳтимолии омӯзиши diffusion model-ро нишон медиҳад. Модел ба ҷойи ҳисоб кардани мустақими эҳтимоли тақсимоти дода, раванди баръакси denoising-ро омӯхта ба дода наздик мешавад. Дар ин ҷо x0 намунаи тоза, xT намунаи пур аз садо, q раванди пеши садодиҳӣ, pθ раванди баръакси омӯхташуда ва θ параметрҳои модел мебошанд.

\[ L_{simple}(\theta)=\mathbb{E}_{t,x_0,\epsilon}\left[\left\|\epsilon-\epsilon_{\theta}\left(\sqrt{\bar{\alpha}_t}x_0+\sqrt{1-\bar{\alpha}_t}\epsilon,t\right)\right\|^2\right] \]

Ин формула нишон медиҳад, ки diffusion model дар амал метавонад тавассути пешгӯии садо омӯзонда шавад. ε садои воқеӣ, εθ садои пешгӯишудаи модел, \bar{α}t коэффициенти ҷадвали садо ва t қадами denoising-ро ифода мекунад. Вазифаи модел ин аст, ки садои додаи пур аз садоро дуруст пешгӯӣ намуда, дар самти баръакс намунаи воқеӣ тавлид кунад.

Муносибати асосии истифодашуда дар ошкорсозии басомадӣ:

\[ P(r)=\frac{1}{2\pi}\int_{0}^{2\pi}|F(r\cos\theta,r\sin\theta)|\,d\theta \]

Ин формула профили радиалии энергияи тасвирро дар фазои басомад мебарорад. F намояндагии басомадии тасвир, r сатҳи радиус/басомад, θ самти кунҷӣ ва P(r) энергияи миёнаи басомадии мустақил аз самт мебошанд. Азбаски қуллаҳои муайяни басомадӣ дар тасвирҳои GAN метавонанд аз тасвирҳои табиӣ фарқ кунанд, ин профил барои ошкорсозии сохтакорӣ истифода мешавад.

Матритсаи се меҳварии арзёбӣ, ки таҳқиқот пешниҳод мекунад:

МеҳварМетрикаҳоЧиро чен мекунад?
Performance-и ошкорсозӣAUC, EER, IoU, ACC.Қобилияти система барои ҷудо кардани мундариҷаи воқеӣ ва сохта ва ҷойгир кардани минтақаи сохтаро чен мекунад.
Сифати тавлидFID, Id-Acc, FVD, TCM, IS, LPIPS, CLIP Score, NIQE.Воқеиятнокӣ, ҳифзи шахсият, устувории видео ва мувофиқати мундариҷаи тавлидшуда бо матнро чен мекунад.
Мувофиқати бисёрмодалӣLSE-D/C, MOS.Ҳамоҳангии садо–лаб, воқеиятнокии дарки инсон ва мувофиқати бисёрмодалиро чен мекунад.

Оилаҳои асосии маҷмӯаи додаҳо:

Гурӯҳи маҷмӯаи додаМисолҳоНақши он дар таҳқиқот
Маҷмӯаҳои тасвирCelebA-HQ, FFHQ, PGGAN/StyleGAN sets, iFakeFaceDB, Fake2M.Барои тавлиди чеҳраи статикӣ, GAN fingerprint, ошкорсозии тасвири diffusion ва сифати тасвири сохта истифода мешаванд.
Маҷмӯаҳои видеоUADFV, DF-TIMIT, FaceForensics++, Celeb-DF, DFDC, WildDeepfake, FFIW-10K, DFDC-Medical.Барои ивазкунии чеҳра, шароити шабакаи иҷтимоӣ, фишурдашавӣ, тақсимоти воқеии муҳит ва сохтакории domain-specific истифода мешаванд.
Маҷмӯаҳои бисёрмодалӣFakeAVCeleb, KoDF, LAV-DF, MADD, Codecfake, DDL.Барои deepfake-и садо–видео, сохтакории нутқи бисёрзабона, манипулятсияи маҳаллӣ ва тамғагузории майда истифода мешаванд.

Натиҷаҳои асосии техникии муайянкардаи баррасӣ:

  • Соҳаи тавлид ва ошкорсозии deepfake ду хатти мустақил нест, балки системаи ҳамла–дифоъест, ки мутақобилан эволютсия мекунад.
  • Изҳои басомадии давраи GAN бо меъмориҳои alias-free ва усулҳои нави тавлид камтар боэътимод шудаанд.
  • Системаҳои autoencoder ва ивазкунии чеҳра нишонаҳои нав ба монанди марзҳои омехтаи чеҳра ва вайроншавии сигналҳои биофизиологиро ба вуҷуд оварданд.
  • Моделҳои diffusion ба омори тасвирҳои табиӣ бештар наздик шуда, қудрати детекторҳои frequency ва pixel-based-ро коҳиш доданд.
  • Барои ошкорсозии deepfake-и бисёрмодалӣ на танҳо тасвир, балки садо, ҳаракати лаб, эҳсос, просодия, нафас, ҳаракати биомеханикӣ ва контексти семантикӣ бояд якҷоя арзёбӣ шаванд.
  • Системаҳои MLLM-based метавонанд тавзеҳ истеҳсол кунанд; аммо барои moderating-и real-time ва эътимоднокии баланд ҳанӯз ба қадри кофӣ баркамол нестанд.
  • Watermark ва provenance verification дар манбаъ метавонанд дар оянда хатти асосии дифоъ бошанд, ки усулҳои post-hoc detection-ро пурра мекунанд.

Пешниҳодҳои идоракунии таҳқиқот:

МушкилотҶавоби техникӣҶавоби идоракунӣ
Нокомии детекторҳо дар соҳаҳои нави додаCausal reasoning, domain adaptation, self-blended training, benchmark-ҳои пайваста навшаванда.Арзёбии даврӣ ва идоракунии хавф дар тамоми давраи зиндагӣ барои платформаҳо ва танзимгарон.
Паҳншавии сохтакории бисёрмодалӣҲамоҳангии садо–тасвир, мувофиқати эҳсосӣ, санҷиши биомеханикӣ ва физикӣ.Стандартҳои тамғагузории бисёрмодалӣ ва масъулияти платформаҳо.
Нокифоя будани қарори танҳо «сохта/воқеӣ»Ҷойгиркунии майда, model fingerprint, attribution-и манбаъ.Занҷири далели судӣ, сабти блокчейнӣ ва provenance-и криптографӣ.
Performance-и ноодилона дар забон ва фарҳангҳои гуногунМаҷмӯаҳои додаи бисёрзабона, бисёрфарҳангӣ ва фарогири тақсимоти гуногуни чеҳра.Назорати баробарӣ, зидди табъиз ва мутобиқати стандарти ҷаҳонӣ.
Душвории гирифтани мундариҷаи сохта пас аз паҳншавӣStable Signature, Tree-ring Watermarks, SynthID, C2PA provenance.Тамғагузорӣ дар вақти тавлид, санҷиши манбаъ ва танзими бар асоси хавф.

Маҳдудиятҳои ошкори таҳқиқот:

  • Таҳқиқот preprint аст ва аз peer review нагузаштааст.
  • Модели нави таҷрибавӣ ё маҷмӯаи додаи нав тавлид намекунад.
  • Meta-analysis анҷом нашудааст, зеро маҷмӯаҳои дода, протоколҳо ва тарзи ҳисоботдиҳӣ дар адабиёт хеле гетерогенанд.
  • Арзишҳои performance-и овардашуда ба шароити мақолаҳои аслӣ вобастаанд; ҳангоми муқоисаи мутлақ бояд эҳтиёт кард.
  • Ошкорсозии MLLM-based метавонад ҳанӯз танҳо дар зермаҷмӯаҳои хурд ва curated арзёбӣ шуда бошад; муқоисаҳои миқёси воқеии ҷаҳон каманд.
  • Метрикаҳои стандартӣ барои устувории физикӣ ва семантикӣ ҳанӯз ба қадри кофӣ баркамол нестанд.
  • Ҳарчанд watermark ва provenance пурқувватанд, мушкилоти counter-forensic removal, re-encoding ва interoperability байни платформаҳо идома доранд.

Натиҷаи умумӣ: Ба гуфтаи таҳқиқот, мубориза бо deepfake мушкиле нест, ки бо як детектор ё як қонун ҳал шавад. Моделҳои тавлид, системаҳои ошкорсозӣ, маҷмӯаҳои дода, метрикаҳои арзёбӣ, стандартҳои watermark/provenance, масъулияти платформа, ҳуқуқ ва огоҳии ҷомеа бояд якҷоя рушд кунанд. Дифои воқеӣ дар соҳаи deepfake аз гирифтани як изи хатои ҷудогона дар тасвир ба сӯи меъмории ҳамаҷонибаи эътимод мегузарад, ки аз тавлиди мундариҷа то паҳншавӣ ва санҷиши судии он идома меёбад.

Ёддошт оид ба Манбаъ ва Усул

Ин мақола бар асоси таҳқиқоти Mengze Li, Gang Liang, Kui Zhao, Liangyin Chen, Junren Chen ва Jiayi Liu бо унвони “Adversarial Evolution of Deepfake Generation and Detection: A Systematic Review of Paradigms, Evaluation, and Governance” таҳия шудааст.

Матни манбаъ як мақолаи систематикии preprint мебошад, ки адабиёти тавлид ва ошкорсозии deepfake-ро дар давраи 2014–2025 ба таври систематикӣ баррасӣ мекунад. Азбаски дар матн ба таври равшан “This preprint research paper has not been peer reviewed” навишта шудааст, таҳқиқот аз peer review нагузаштааст. Аз ин рӯ, натиҷаҳо бояд на ҳамчун хулосаҳои ниҳоии дар маҷаллаи peer-reviewed тасдиқшуда, балки ҳамчун синтези фарогир, вале ҳанӯз барои арзёбӣ кушодаи адабиёт хонда шаванд.

Усули таҳқиқот ба ҷустуҷӯи систематикии адабиёт, ки ба PRISMA мутобиқ карда шудааст, асос меёбад. Пойгоҳҳои IEEE Xplore, ACM Digital Library, Web of Science ва arXiv ҷустуҷӯ шудаанд; аз 1.486 сабт 211 таҳқиқот ба синтези сифатӣ дохил карда шудааст. Ин таҳқиқотҳо таҳти сарлавҳаҳои усулҳои тавлид, усулҳои ошкорсозӣ, маҷмӯаҳои дода/арзёбӣ ва идоракунӣ/ахлоқ/сиёсат гурӯҳбандӣ шудаанд.

Ҳангоми омода кардани ин мундариҷа мафҳумҳои асосии таҳқиқот, модели се даври adversarial, хатҳои тавлиди GAN–autoencoder–diffusion, рушди deepfake-и бисёрмодалӣ, усулҳои ошкорсозӣ, формулаҳои diffusion, формулаи таҳлили басомад, муқоисаи маҷмӯаҳои дода ва метрикаҳо, матритсаи се меҳварии арзёбӣ, чаҳорчӯбаи technology–law–ethics, тавсияҳои watermark ва C2PA provenance дар манбаъ нигоҳ дошта шудаанд. Натиҷаи нави таҷрибавии дар PDF набуда, кафолати қатъии муваффақият, иддаои ошкоршавии боэътимоди ҳамаи deepfake-ҳо ё пешниҳоди як роҳи ягонаи ҳуқуқӣ/техникӣ илова нашудааст.

Ин таҳқиқот махсусан аз як ҷиҳат бояд эҳтиёткорона хонда шавад: сатҳҳои муваффақияти дар соҳаи deepfake detection гузоришшуда аксаран ба маҷмӯаи дода, сатҳи фишурдашавӣ, усули буридани чеҳра, ҷудокунии train/test, модели тавлид ва тақсимоти воқеии ҷаҳон вобастаанд. Аз ин рӯ, баланд будани муваффақияти як детектор дар benchmark-и муайян маънои онро надорад, ки он ҳар мундариҷаи нави deepfake-и дар шабакаҳои иҷтимоӣ паҳншударо бо ҳамон муваффақият мегирад.

Муҳимтарин саҳми таҳқиқот дар он аст, ки масъалаи deepfake-ро на танҳо дар сатҳи «мундариҷаи сохта чӣ гуна ошкор мешавад?», балки ҳамчун занҷири тавлид–ошкорсозӣ–арзёбӣ–идоракунӣ баррасӣ мекунад. Ин занҷир нишон медиҳад, ки барои сохтани экосистемаи боэътимоди расонаҳои рақамӣ, дар баробари детекторҳои техникӣ, тасдиқи манбаъ, маълумоти provenance, уҳдадориҳои ҳуқуқӣ, стандартҳои ахлоқӣ ва огоҳии ҷомеа низ заруранд.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо