
Эҷоди видео бо зеҳни сунъӣ босуръат пешрафт мекунад. Акнун на танҳо клипҳои кӯтоҳи чандсония, балки видеоҳои зиёда аз як дақиқа, рекламаҳо, муҳтавои услуби влог, муаррифии маҳсулот ва ҳикоягӯӣ низ эҷод карда мешаванд. Аммо саволи муҳим вуҷуд дорад: оё агар модел саҳнаи кӯтоҳро хуб эҷод кунад, дар видеои дароз ҳамон қаҳрамон, ҳамон ҷараёни ҳикоя, ҳамон ҳамоҳангии садо ва гузаришҳои мантиқиро нигоҳ дошта метавонад?
Tengfei Liu ва ҳамкоронаш барои ҷустуҷӯи ҷавоб ба ин савол системаи арзёбии LongAV-Compass-ро пешниҳод мекунанд. Ин система эҷоди видеои садодори дарозтар аз як дақиқаро дар се намуди вазифа меомӯзад: эҷоди видеои садодор аз матн, эҷоди видеои садодор аз тасвир ва эҷоди видеои идома аз видеои мавҷуд.
Таҳқиқот тавассути 284 намунаи озмоишӣ 11 системаи гуногуни эҷоди видеоро арзёбӣ мекунад. Натиҷаҳо нишон медиҳанд, ки гарчанде моделҳои муосир дар клипҳои кӯтоҳ таъсирбахш ба назар расанд ҳам, дар ҳикояи дарозмуддат, пайдарҳамии қаҳрамон, гузаришҳои саҳна ва ҳамоҳангии садо-видео ҳанӯз душворӣ мекашанд.
Имрӯз бисёр моделҳои зеҳни сунъӣ метавонанд видеоҳои кӯтоҳ эҷод кунанд. Дар саҳнаи чандсония сифати визуалӣ метавонад баланд бошад, ҳаракатҳо таъсирбахш ба назар расанд ва ғояи асосии матн тақрибан гирифта шавад.
Аммо эҷоди видеои дароз мушкили дигар аст. Дар видеои якдақиқагӣ танҳо эҷод кардани тасвири зебо кофӣ нест. Модел бояд инҳоро низ нигоҳ дорад:
- Қаҳрамон ё маҳсулот бояд якхела бимонад.
- Гузаришҳои саҳна бояд мантиқӣ бошанд.
- Набояд пайдарҳамии ҳодисаҳоро гум кунад.
- Садо бояд бо ҳаракатҳои тасвир ҳамоҳанг бошад.
- Ҳикоя бояд аз аввал то охир пайдарҳам пеш равад.
- Дар муҳтавое монанди муаррифии маҳсулот ё реклама ваъдаҳои додашуда ва равандҳои нишондодашуда бояд якдигарро пурра кунанд.
Бисёре аз benchmarkҳои мавҷуд, яъне тестҳои арзёбии модел, одатан ба видеоҳои кӯтоҳи 5-10 сония тамаркуз мекунанд. Ин тестҳо метавонанд барои чен кардани сифати визуалӣ ё ҳамоҳангӣ бо матн дар клипҳои кӯтоҳ муфид бошанд. Аммо метавонанд дар гирифтани вайрониҳои дар видеои дароз пайдошаванда нокифоя бошанд.
Аз ин рӯ муҳаққиқон ба ин савол тамаркуз мекунанд:
Моделҳои видеои зеҳни сунъӣро чӣ гуна метавонем дақиқтар озмунем, ки оё онҳо ҳақиқатан қодир ба эҷоди видеои дароз ва садодоранд?
Усул чӣ пешниҳод мекунад?
Мақола benchmark-и нави LongAV-Compass-ро пешниҳод мекунад. Benchmark ҳадаф дорад эҷоди видеои садодори дарози моделҳои зеҳни сунъӣро муфассалтар ва ташхисӣ чен кунад.
LongAV-Compass се намуди асосии вазифаро фаро мегирад:
1. T2AV – Text-to-Audio-Video
Эҷоди видеои садодор аз матн. Модел кӯшиш мекунад аз сенария ё тавсифи матнии додашуда видеои дарозе эҷод кунад, ки ҳам тасвир ва ҳам садо дошта бошад.
2. I2AV – Image-to-Audio-Video
Эҷоди видеои садодор аз тасвир. Модел бо истифодаи тасвири референс ва сенарияи додашуда видеои дароз эҷод мекунад. Саволи муҳим дар ин ҷо чунин аст: оё шахс, объект, маҳсулот ё саҳнаи тасвир дар тӯли видеои дароз нигоҳ дошта мешавад?
3. V2AV – Video-to-Audio-Video
Эҷоди идомаи видеои садодор аз видео. Модел видеои кӯтоҳи оғозиро мегирад ва онро мувофиқи сенария идома медиҳад. Ҳадаф дар ин ҷо эҷод кардани идома бидуни вайрон кардани услуб, қаҳрамон, саҳна ва ҷараёни видеои оғозӣ аст.
LongAV-Compass дар маҷмӯъ 284 намунаи озмоишӣ дорад:
- 128 намунаи эҷоди видеои садодор аз матн
- 115 намунаи эҷоди видеои садодор аз тасвир
- 41 намунаи эҷоди идома аз видео
Ин намунаҳо танҳо тасодуфӣ интихоб нашудаанд. Муҳаққиқон тестҳоро мувофиқи сенарияҳои гуногуни истифода ва сатҳҳои душворӣ танзим мекунанд.
Сенарияҳои истифода чунинанд:
- Vlog
- Видеоҳои эҷодкунандагони муҳтаво
- Рекламаҳои performance
- Рекламаҳои бренд
Сатҳҳои душворӣ бошад аз L1 то L4 боло мераванд. Аз саҳнаҳои содда ба ҳикояҳои душвортаре, ки бисёрҳодиса, бисёрҳунарпеша ва ҷараёни сабабӣ-натиҷавӣ талаб мекунанд, пеш меравад.
Формулаҳо чӣ мегӯянд?
Дар ин мақола формулаҳои зичи математикӣ, ки хонандаро душвор кунанд, пеш намеоянд. Қувваи асосии таҳқиқот дар он аст, ки системаи андозагирӣ чӣ гуна сохта шудааст.
Муҳаққиқон ба ҷои додани як «балли умумӣ», эҷоди видеои дарозро ба бисёр қисмҳо тақсим мекунанд. Зеро як модел метавонад аз ҷиҳати визуалӣ хуб бошад, вале ҳамоҳангии садо-видео заиф бошад. Модели дигар метавонад тасвири маҳсулотро нигоҳ дорад, вале ҳикояро ба анҷом нарасонад.
Андозаҳои асосии ченшаванда чунинанд:
Event Fulfillment – Иҷрои ҳодиса
Оё модел ҳодисаҳои дар сенария дархостшударо ҳақиқатан эҷод карда метавонад? Масалан, агар гуфта шавад «маҳсулот ба барг пошида мешавад», оё дар видео ҳақиқатан ин ҳодиса дида мешавад?
Visual Quality – Сифати визуалӣ
Оё ҳаракатҳо табиӣ ҳастанд? Оё объектҳо вайрон мешаванд? Оё дар тасвир сунъӣ будан, кандашавӣ, вайроншавии шакл ё талафи сифат ҳаст?
Long-form Continuity – Пайвастагии ҳикояи дароз
Оё видео аз аввал то охир пайдарҳам аст? Оё қаҳрамон, маҳсулот, саҳна ва ҷараёни ҳодиса нигоҳ дошта мешаванд?
Transition Stability – Устувории гузариш
Оё байни саҳнаҳо кадри сиёҳ, ларзиш, кандашавии ногаҳонӣ, яхбандӣ ё ҷаҳиши ғайримантиқӣ ҳаст?
Holistic Presentation – Сифати умумии пешниҳод
Оё видео ҳамчун кори анҷомёфта ба назар мерасад? Оё қобили тамошо, мураттаб ва мувофиқи ҳадаф аст?
Text-Video Alignment – Ҳамоҳангии матн-видео
Видео бо тавсиф ва сенарияи додашуда то чӣ андоза ҳамоҳанг аст?
Audio-Video Synchronization – Синхронизатсияи садо-видео
Оё гуфтор, эффект, мусиқӣ ё садои муҳит бо ҳодисаҳои тасвир аз ҷиҳати вақт ҳамоҳанг аст?
Audio Quality – Сифати садо
Оё садо реалистӣ аст, ба саҳна мувофиқ аст ва вайрониҳои нороҳаткунанда дорад?
Long-Audio Coherence – Пайдарҳамии садои дароз
Оё садо дар тӯли як дақиқа бекандашавӣ, бетакрори бемаънӣ ва бетағйири ногаҳонии сатҳи садо идома меёбад?
Ин системаи андозагирӣ ба мо мегӯяд: муваффақият дар эҷоди видеои дароз танҳо бо саволи «оё тасвир зебо аст?» чен карда намешавад. Садо, пайдарҳамии ҳодиса, ҳикоя, пайдарҳамии визуалӣ ва гузаришҳои саҳна бояд якҷоя арзёбӣ шаванд.
Агар график / ҷадвал / схема бошад, паёми асосӣ чист?
Тасвирҳо ва ҷадвалҳои мақола нишон медиҳанд, ки LongAV-Compass бештар аз як ҷадвали оддии ҷобаҷогузории моделро ҳадаф дорад.
Схемаи умумии система дар мақола:
Схемаи калони саҳифаи 2 нишон медиҳад, ки LongAV-Compass видеоро на ҳамчун як порчаи ягона, балки дар сатҳҳои гуногуни тафсилот арзёбӣ мекунад. Видеои пурра, клипҳои ҳодисавӣ, гузаришҳои саҳна ва кадрҳои намунавӣ алоҳида омӯхта мешаванд. Паёми асосӣ чунин аст: дар эҷоди видеои дароз хатоҳо гоҳе на дар як кадр, балки дар гузариши байни ҳодисаҳо ё дар ҷараёни умумии видео пайдо мешаванд.
Ҷадвали муқоисаи benchmark:
Ҷадвали муқоисаи мақола нишон медиҳад, ки аксари benchmarkҳои қаблӣ ба видеои кӯтоҳ ё як намуди вазифа тамаркуз кардаанд. LongAV-Compass бошад кӯшиш мекунад эҷоди видеои садодорро аз матн, аз тасвир ва аз видео дар як сохтори ягона арзёбӣ кунад. Ҳамчунин ба истеҳсоле тамаркуз мекунад, ки давомнокии миёнаи видео зиёда аз як дақиқа аст.
Ҷадвали фарогирии вазифа:
284 намунаи LongAV-Compass бо қисмати T2AV дорои 879 ҳодиса ва 2.115 гирифтан, қисмати I2AV дорои 807 ҳодиса ва 1.989 гирифтан, ва қисмати V2AV дорои 235 ҳодиса ва 731 гирифтан сохта шудааст. Ин нишон медиҳад, ки тестҳо танҳо бо мантиқи «як фармон, як видеои кӯтоҳ» нестанд; онҳо тавассути занҷирҳои ҳодиса сохта шудаанд.
Графики тақсимоти сенария ва душворӣ:
Тасвири тақсимоти даврашакли мақола нишон медиҳад, ки тестҳо ба соҳаҳои гуногун монанди влог, видеоҳои эҷодкунандагони муҳтаво, рекламаҳои performance ва рекламаҳои бренд паҳн шудаанд. Ин муҳим аст, зеро як модел метавонад дар услуби влоги ҷолиб хуб кор кунад, вале дар сенарияи муаррифии маҳсулот ё реклама душворӣ кашад.
Схемаи эҷоди маълумот:
Схемаи раванди сохтани маълумоти мақола шарҳ медиҳад, ки намунаҳои озмоишӣ ҳам аз видеоҳои воқеӣ ва ҳам аз қолабҳои сенария эҷод шудаанд. Баъдтар ин намунаҳо аз назорати инсонӣ ва арзёбии сифати бо дастгирии зеҳни сунъӣ мегузаранд. Паёми асосӣ чунин аст: Benchmark танҳо аз фармонҳои тасодуфӣ иборат нест; сохтори ҳодиса, воқеият ва арзиши арзёбӣ назорат карда мешаванд.
Ҷадвалҳои натиҷаи модел:
Ҷадвалҳои T2AV, I2AV ва V2AV самаранокии Seedance 2.0, Kling 3.0, Veo 3.1 ва моделҳои гуногуни манбаи кушодро дар меъёрҳои гуногун нишон медиҳанд. Дар ин ҷо гуфтан душвор аст, ки як модел дар ҳама соҳа бартарии мутлақ дорад. Масалан, баъзе моделҳо ҳодисаҳои матнро беҳтар иҷро мекунанд, баъзеҳо дар сифати садо ё гузаришҳои саҳна қавитар ба назар мерасанд.
Графики ҳамоҳангӣ бо инсон:
Графики муқоисаи арзёбии инсонӣ бо холҳои худкори мақола нишон медиҳад, ки холҳои LongAV-Compass ба афзалиятҳои инсонӣ ба дараҷаи баланд наздиканд. Ин водор мекунад фикр кунем, ки benchmark танҳо аз андозагириҳои техникӣ иборат нест; он ҳамчунин бо идроки инсонӣ то андозае натиҷаи ҳамоҳанг медиҳад.
Таҷрибаҳо чӣ гуна гузаронида шудаанд?
Муҳаққиқон 11 системаи гуногуни эҷоди видеоро меозмоянд. Онҳо ба се гурӯҳ тақсим мешаванд:
- Моделҳои баста / тиҷоратӣ
- Моделҳои манбаи кушод
- Усулҳои бар асоси агент
Дар байни моделҳои тиҷоратӣ Seedance 2.0, Kling 3.0 ва Veo 3.1 ҷой доранд. Дар тарафи манбаи кушод моделҳое монанди LTX 2.3, LongCat, Wan2.2-I2V-A14B, HunyuanVideo 1.5-I2V, Helios, Open-Sora ва davinci-magihuman арзёбӣ мешаванд. Ҳамчунин VideoDirectorGPT ҳамчун намунаи бар асоси агент шомил карда мешавад.
Дар тестҳо давомнокии ҳадафии видео ҳадди ақал 60 сония муайян карда мешавад ва аксари натиҷаҳо дар фосилаи 60-120 сония арзёбӣ мешаванд.
Моделҳо мувофиқи намуди вуруди дастгиришаванда озмуда мешаванд. Масалан, агар баъзе моделҳо садо эҷод карда натавонанд, ин моделҳо бо метрикаҳои видео арзёбӣ мешаванд, вале дар метрикаҳои садо ҳамчун «мувофиқ нест» дида мешаванд.
Дар раванди арзёбӣ танҳо як ҳол истифода намешавад. Ҳар видео алоҳида аз ҷиҳати ҳодиса, гузариш, сатҳи видеои пурра ва ҳамоҳангии садо-видео омӯхта мешавад. Ҳамин тавр, куҷо муваффақ ва куҷо заиф будани модел равшантар дида мешавад.
Натиҷаҳо чӣ нишон медиҳанд?
Натиҷаҳо нишон медиҳанд, ки моделҳои муосири эҷоди видеои садодори дароз то дараҷае ҷанбаҳои қавӣ ва заифи гуногун доранд, ки бо як ҳол шарҳ дода намешаванд.
Дар вазифаи эҷоди видеои садодор аз матн Kling 3.0 аз ҷиҳати иҷрои ҳодисаҳо ва пайвастагии шакли дароз қавӣ ба назар мерасад. Seedance 2.0 бошад дар сифати визуалӣ, пешниҳоди умумӣ ва меъёрҳои садо ҷудо мешавад.
Дар вазифаи эҷоди видеои садодор аз тасвир Seedance 2.0 умуман самаранокии қавӣ нишон медиҳад. Kling 3.0 аз ҷиҳати нигоҳ доштани тасвири референс дар кадри аввал натиҷаи хуб медиҳад. Аммо яке аз ёфтаҳои муҳими мақола чунин аст: ҳатто агар модел шахс ё объекти тасвири референсро ҳамчун тасвир нигоҳ дорад ҳам, метавонад дар нигоҳ доштани ҷараёни ҳодиса ва пайвастагии ҳикоя дар видеои дароз душворӣ кашад.
Дар вазифаи эҷоди идома аз видео Seedance 2.0 ба таври равшан ҷудо мешавад. Махсусан аз ҷиҳати мутобиқат бо видеои оғозӣ, идомаи ҳодиса, сифати визуалӣ ва сифати садо натиҷаҳои қавӣ медиҳад. Veo 3.1 гарчанде баъзе ҳодисаҳоро ба таври маънодор идома дода тавонад ҳам, пас аз ҳудуди видеои референс дар пайвастагӣ ва устувории гузариш метавонад натиҷаҳои заифтар нишон диҳад.
Дида мешавад, ки моделҳои манбаи кушод дар баъзе меъёрҳо натиҷаҳои қобили қабул медиҳанд; аммо дар соҳаҳое монанди ҳикояи дароз, пайдарҳамии ҳодиса, намоиши маҳсулот, якпорчагии визуалӣ ва ҳамоҳангии садо-видео ҳанӯз фарқи назаррас бо моделҳои тиҷоратӣ вуҷуд дорад.
Яке аз ёфтаҳои қобили таваҷҷуҳтарини мақола он аст, ки сенарияи рекламаҳои performance барои моделҳо махсусан душвор аст. Зеро дар чунин видеоҳо нишон додани маҳсулот, шарҳи функсияи он, пешравии мантиқии раванди истифода ва эҷоди ҷараёни боваркунонанда лозим аст. Моделҳо аксар вақт метавонанд маҳсулотро нишон диҳанд, вале дар шарҳи функсияаш бо пайдарҳамии дуруст ё нигоҳ доштани ҷараёни сабабӣ-натиҷавӣ душворӣ мекашанд.
Чаро ин муҳим аст?
Ин таҳқиқот нишон медиҳад, ки эҷоди видео бо зеҳни сунъӣ танҳо масъалаи «эҷод кардани тасвири зебо» нест.
Моделе, ки дар клипи кӯтоҳ таъсирбахш ба назар мерасад, дар видеои дароз метавонад ин мушкилотро аз сар гузаронад:
- Чеҳра ё либоси қаҳрамон метавонад тағйир ёбад.
- Маҳсулот дар як саҳна якхела ва дар саҳнаи дигар дигархела ба назар расад.
- Садо бо ҳодисаи тасвир мувофиқ набошад.
- Ҳикоя он чизеро, ки дар аввал ваъда кардааст, ба анҷом нарасонад.
- Дар гузаришҳои саҳна кандашавӣ ё яхбандӣ пайдо шавад.
- Дар видеои рекламавӣ функсияи маҳсулот нодуруст ё нопурра шарҳ дода шавад.
Аз ин рӯ барои озмудани системаҳои зеҳни сунъӣ, ки видеои дароз эҷод мекунанд, абзорҳои муфассалтари арзёбӣ лозиманд. LongAV-Compass кӯшиш мекунад ба ин ниёз ҷавоб диҳад.
Барои хонандаи Verianla паёми асосӣ чунин аст: «видео эҷод карда тавонистани» модели зеҳни сунъӣ маънои онро надорад, ки он метавонад ҳикояи дароз ва пайдарҳами видеои садодор бисозад. Имтиҳони асосӣ дар эҷоди видеои дароз — нигоҳ доштани пайвастагӣ, пайдарҳамӣ, ҳамоҳангии садо ва ҷараёни ҳодиса аст.
Нуктаҳое, ки бояд ба назар гирифт
Ин мақола benchmark-и қавӣ пешниҳод мекунад; аммо баъзе маҳдудиятҳо вуҷуд доранд.
Аввалан, таҳқиқот ба назар мерасад ҳамчун preprint-и arXiv нашр шудааст. Аз ин рӯ дастгирии натиҷаҳо бо раванди нашри peer-review ва тасдиқҳои мустақил муҳим аст.
Дуюм, версияҳои моделҳои арзёбишаванда бо гузашти вақт метавонанд тағйир ёбанд. Хидматҳои тиҷоратии зеҳни сунъӣ зуд-зуд нав мешаванд, бинобар ин натиҷаҳои имрӯз гирифташуда дар оянда метавонанд фарқ кунанд.
Сеюм, гарчанде системаҳои арзёбии худкор ба арзёбии инсонӣ наздик шаванд ҳам, ҷои пурраи ҳукми инсониро намегиранд. Гарчанде дар мақола таҳқиқоти ҳамоҳангӣ бо инсон гузаронида шуда бошад ҳам, он дар сатҳи пилот аст.
Чорум, баъзе метрикаҳо ба моделҳои муайяни визуалӣ ё намояндагии бисёрмодалӣ такя мекунанд. Масалан, абзорҳое монанди CLIP, DINO-v2, ArcFace ва ImageBind гарчанде сигналҳои муфид диҳанд ҳам, муваффақияти эстетикӣ, ҳикоявӣ ва тиҷоратии видеоро пурра чен карда наметавонанд.
Панҷум, ҷобаҷогузории моделҳо ба сенарияҳои озмоиши истифодашуда вобаста аст. Намудҳои гуногуни муҳтаво монанди влог, реклама, муаррифии маҳсулот ё видеои ҳикоявӣ метавонанд моделҳоро ба таври гуногун душвор гардонанд.
Хулоса
LongAV-Compass системаи ҳамаҷонибаи озмоишро барои арзёбии эҷоди видеои садодори дароз бо зеҳни сунъӣ пешниҳод мекунад. Таҳқиқот бо он ҷудо мешавад, ки эҷоди видеои садодори дарозро аз матн, аз тасвир ва аз видео дар як сохтори ягона баррасӣ мекунад.
Натиҷаи асосии таҳқиқот чунин аст: гарчанде моделҳои муосири эҷоди видео дар клипҳои кӯтоҳ таъсирбахш ба назар расанд ҳам, дар муҳтавои зиёда аз як дақиқа пайдарҳамии қаҳрамон, пайдарҳамии ҳодиса, гузаришҳои саҳна, синхронизатсияи садо-видео ва якпорчагии ҳикоя ҳанӯз имтиҳони ҷиддӣ аст.
Ин benchmark на танҳо барои ҷобаҷогузории моделҳо, балки барои ташхис кардани он ки моделҳо куҷо ноком мешаванд, тарҳрезӣ шудааст. Ин метавонад барои муҳаққиқоне, ки мехоҳанд дар оянда видеоҳои боэътимодтар, пайдарҳамтар ва дарозтари зеҳни сунъӣ эҷод кунанд, қадами муҳим бошад.
Аз назари Verianla паёми асосии ин мақола равшан аст: пешрафти асосӣ дар эҷоди видео бо зеҳни сунъӣ танҳо эҷод кардани кадрҳои зеботар нест; қодир будан ба нигоҳ доштани маъно, садо, қаҳрамон ва ҳикоя дар тӯли муддати дароз аст.
Эзоҳи манбаъ ва усул
Ин муҳтаво бо истифода аз таҳқиқоти академикӣ бо номи “LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV”, ки аз ҷониби Tengfei Liu, Yang Shi, Xuanyu Zhu ва ҳамкоронаш омода шудааст, дар формати таҳририи Verianla мустақилона омода гардидааст.
Таҳқиқот дар arXiv ҳамчун preprint бо санаи 25 майи 2026 дида мешавад. Ин навишта тарҷумаи калима-ба-калима нест; усул, ҷадвалҳо, графикҳо, таҷрибаҳо ва натиҷаҳои мақола содда карда, барои хонандаи тоҷик аз нав шарҳ дода шудаанд. Муҳтаво ҳадафи иттилоотӣ ва таълимӣ дорад. Барои интихоби модели зеҳни сунъӣ, эҷоди видеои тиҷоратӣ ё арзёбии системаи техникӣ набояд ҳамчун роҳнамои ягонаи қарор истифода шавад.

Шарҳ гузоред
Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд