Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / Süni İntellekt Uzun Video Yarada Bilirmi, Yoxsa Yalnız Qısa Kliplərdə Uğurludur?
Kompüter Elmləri

Süni İntellekt Uzun Video Yarada Bilirmi, Yoxsa Yalnız Qısa Kliplərdə Uğurludur?

Süni intellektlə video istehsalı sürətlə inkişaf edir. Artıq yalnız bir neçə saniyəlik qısa kliplər deyil, bir dəqiqədən uzun videolar, reklamlar, vloq tipli məzmunlar, məhsul təqdimatları və hekayə formatları da yaradıla bilir. Lakin mühüm sual qalır: model qısa səhnəni yaxşı yaradırsa, uzun videoda eyni personajı, eyni hekayə axınını, səs uyğunluğunu və məntiqli keçidləri də qoruya bilirmi?

02/06/2026  Veri Anla 46 baxış
Süni İntellekt Uzun Video Yarada Bilirmi, Yoxsa Yalnız Qısa Kliplərdə Uğurludur?

Süni intellektlə video istehsalı sürətlə inkişaf edir. Artıq yalnız bir neçə saniyəlik qısa kliplər deyil, bir dəqiqədən uzun videolar, reklamlar, vloq tipli məzmunlar, məhsul təqdimatları və hekayə anlatımları da yaradıla bilir. Lakin mühüm bir sual var: model qısa səhnəni yaxşı yaradırsa, uzun videoda eyni personajı, eyni hekayə axınını, eyni səs uyğunluğunu və məntiqli keçidləri qoruya bilirmi?

Tengfei Liu və həmkarları bu suala cavab tapmaq üçün LongAV-Compass adlı qiymətləndirmə sistemi təklif edir. Sistem bir dəqiqədən uzun audio-video istehsalını üç müxtəlif tapşırıq üzrə araşdırır: mətndən audio-video yaratma, təsvirdən audio-video yaratma və mövcud videonun davamını yaratma.

Tədqiqat 284 test nümunəsi əsasında 11 fərqli video istehsal sistemini qiymətləndirir. Nəticələr göstərir ki, müasir modellər qısa kliplərdə təsirli görünsələr də, uzunmüddətli nəql, personaj ardıcıllığı, səhnə keçidləri və audio-video uyğunluğu baxımından hələ də çətinlik çəkirlər.

Bu gün bir çox süni intellekt modeli qısa videolar yarada bilir. Bir neçə saniyəlik səhnədə vizual keyfiyyət yüksək ola, hərəkətlər təsirli görünə və mətndəki əsas fikir təxminən əks oluna bilər.

Lakin uzun video istehsalı fərqli problemdir. Bir dəqiqəlik videoda modelin yalnız gözəl görüntü yaratması kifayət deyil. O, aşağıdakıları da qorumalıdır:

  • Personaj və ya məhsul eyni qalmalıdır.
  • Səhnələr arasındakı keçidlər məntiqli olmalıdır.
  • Hadisələrin ardıcıllığı itirilməməlidir.
  • Səs görüntüdəki hərəkətlərlə uyğun olmalıdır.
  • Hekayə əvvəldən sona qədər ardıcıl inkişaf etməlidir.
  • Məhsul təqdimatı və ya reklam kimi məzmunlarda verilən vədlər və göstərilən əməliyyatlar bir-birini tamamlamalıdır.

Mövcud benchmarkların, yəni model qiymətləndirmə testlərinin əksəriyyəti adətən 5–10 saniyəlik qısa videolara fokuslanır. Bu testlər qısa kliplərdə vizual keyfiyyəti və ya mətnlə uyğunluğu ölçmək üçün faydalı ola bilər, lakin uzun videolarda yaranan pozuntuları müəyyən etməkdə yetərsiz qala bilər.

Buna görə tədqiqatçılar bu suala fokuslanırlar:

Süni intellekt video modellərini həqiqətən uzun və audio-video istehsal edə biləcək şəkildə necə daha düzgün sınaqdan keçirə bilərik?

Metod nə təklif edir?

Məqalə LongAV-Compass adlı yeni benchmark təklif edir. Benchmark süni intellekt modellərinin uzun audio-video istehsalını daha detallı və diaqnostik şəkildə ölçməyi hədəfləyir.

LongAV-Compass üç əsas tapşırıq növünü əhatə edir:

1. T2AV – Text-to-Audio-Video
Mətndən audio-video istehsalı. Model verilmiş ssenari və ya mətn təsvirindən həm görüntü, həm də səs olan uzun video yaratmağa çalışır.

2. I2AV – Image-to-Audio-Video
Təsvirdən audio-video istehsalı. Model verilmiş istinad görüntüsündən və ssenaridən istifadə edərək uzun video yaradır. Burada əsas sual budur: təsvirdəki insan, obyekt, məhsul və ya səhnə uzun video boyunca qoruna bilirmi?

3. V2AV – Video-to-Audio-Video
Videodan audio-video davamı yaratma. Model qısa başlanğıc videosunu götürür və onu ssenariyə uyğun şəkildə davam etdirir. Məqsəd başlanğıc videodakı üslubu, personajı, səhnəni və axını pozmadan davam yaratmaqdır.

LongAV-Compass ümumilikdə 284 test nümunəsi ehtiva edir:

  • 128 mətndən audio-video istehsalı nümunəsi
  • 115 təsvirdən audio-video istehsalı nümunəsi
  • 41 videodan davam istehsalı nümunəsi

Bu nümunələr təsadüfi seçilməyib. Tədqiqatçılar testləri müxtəlif istifadə ssenarilərinə və çətinlik səviyyələrinə görə təşkil ediblər.

İstifadə ssenariləri bunlardır:

  • Vloq
  • Məzmun yaradıcılarının videoları
  • Performans reklamları
  • Brend reklamları

Çətinlik səviyyələri L1-dən L4-ə qədər yüksəlir. Sadə səhnələrdən çoxsaylı hadisə və aktorun olduğu, səbəb-nəticə ardıcıllığı tələb edən daha çətin nəqllərə doğru irəliləyir.

Formullar nəyi izah edir?

Bu məqalədə oxucunu çətinləşdirəcək sıx riyazi formulalar ön planda deyil. Tədqiqatın əsas gücü ölçmə sisteminin necə qurulmasındadır.

Tədqiqatçılar vahid “ümumi bal” vermək əvəzinə, uzun video istehsalını bir neçə hissəyə ayırırlar. Çünki model vizual olaraq yaxşı ola bilər, amma audio-video uyğunluğu zəif qala bilər. Başqa model məhsulun görüntüsünü qoruya bilər, lakin hekayəni tamamlaya bilməz.

Ölçülən əsas istiqamətlər bunlardır:

Event Fulfillment – Hadisənin yerinə yetirilməsi
Model ssenaridə tələb olunan hadisələri həqiqətən yarada bildimi? Məsələn, “məhsul yarpağa püskürdülür” deyilirsə, videoda bu hadisə doğrudan görünürmü?

Visual Quality – Vizual keyfiyyət
Hərəkətlər təbiidirmi? Obyektlər deformasiyaya uğrayırmı? Görüntüdə sünilik, qırılma, forma pozuntusu və ya keyfiyyət itkisi varmı?

Long-form Continuity – Uzunmüddətli nəql ardıcıllığı
Video əvvəldən sona qədər ardıcıldırmı? Personaj, məhsul, səhnə və hadisələrin axını qorunurmu?

Transition Stability – Keçid sabitliyi
Səhnələr arasında qara kadr, titrəmə, qəfil qırılma, donma və ya məntiqsiz sıçrayış varmı?

Holistic Presentation – Ümumi təqdimat keyfiyyəti
Video tamamlanmış iş təsiri bağışlayırmı? İzlənilə bilən, nizamlı və məqsədinə uyğun görünürmü?

Text-Video Alignment – Mətn-video uyğunluğu
Video verilmiş təsvir və ssenari ilə nə dərəcədə uyğundur?

Audio-Video Synchronization – Audio-video sinxronizasiyası
Danışıq, effekt, musiqi və ya mühit səsi görüntüdəki hadisələrlə zaman baxımından uyğun gəlirmi?

Audio Quality – Səs keyfiyyəti
Səs realistikdirmi, səhnəyə uyğundurmu, narahatedici təhriflər ehtiva edirmi?

Long-Audio Coherence – Uzunmüddətli səs ardıcıllığı
Səs bir dəqiqə boyunca kəsilmədən, mənasız təkrara düşmədən və qəfil səs səviyyəsi dəyişmələri yaratmadan davam edirmi?

Bu ölçmə sistemi göstərir ki, uzun video istehsalında uğuru yalnız “görüntü gözəldirmi?” sualı ilə ölçmək olmaz. Səs, hadisə ardıcıllığı, nəql, vizual ardıcıllıq və səhnə keçidləri birlikdə qiymətləndirilməlidir.

Qrafik / cədvəl / sxem varsa, əsas mesaj nədir?

Məqalədəki vizuallar və cədvəllər LongAV-Compass-ın adi model sıralama cədvəlindən daha artıq məqsəd daşıdığını göstərir.

Məqalədəki ümumi sistem sxemi:
2-ci səhifədəki böyük sxem LongAV-Compass-ın videonu vahid bütöv kimi deyil, müxtəlif detal səviyyələrində qiymətləndirdiyini göstərir. Tam video, hadisə əsaslı kliplər, səhnə keçidləri və nümunə kadrlar ayrıca araşdırılır. Əsas mesaj budur: uzun video istehsalında səhvlər bəzən tək kadrda deyil, hadisələrarası keçiddə və ya videonun ümumi axınında ortaya çıxır.

Benchmark müqayisə cədvəli:
Məqalədəki müqayisə cədvəli əvvəlki benchmarkların əksəriyyətinin qısa video və ya tək tapşırıq növünə fokuslandığını göstərir. LongAV-Compass isə mətndən, təsvirdən və videodan audio-video istehsalını eyni çərçivədə qiymətləndirməyə çalışır. Bundan əlavə, orta müddəti bir dəqiqəni aşan videolara fokuslanır.

Tapşırıq əhatəsi cədvəli:
LongAV-Compass-ın 284 nümunəsi; 879 hadisə və 2.115 çəkilişi əhatə edən T2AV bölümü, 807 hadisə və 1.989 çəkilişi əhatə edən I2AV bölümü, 235 hadisə və 731 çəkilişi əhatə edən V2AV bölümü ilə strukturlaşdırılıb. Bu, testlərin sadəcə “bir əmr, bir qısa video” məntiqində deyil, hadisə zəncirləri üzərində qurulduğunu göstərir.

Ssenari və çətinlik bölgüsü qrafiki:
Məqalədəki dairəvi bölgü vizualı testlərin vloq, məzmun yaradıcı videoları, performans reklamları və brend reklamları kimi fərqli sahələrə yayıldığını göstərir. Bu mühümdür, çünki model əyləncəli vloq üslubunda yaxşı işlədiyi halda məhsul təqdimatı və ya reklam ssenarisində çətinlik çəkə bilər.

Məlumatların yaradılması sxemi:
Məqalədəki məlumat qurma prosesi sxemi test nümunələrinin həm real videolardan, həm də ssenari şablonlarından hazırlandığını göstərir. Daha sonra nümunələr insan nəzarətindən və süni intellekt dəstəkli keyfiyyət qiymətləndirməsindən keçirilir. Əsas mesaj budur: benchmark yalnız təsadüfi əmrlərdən ibarət deyil; hadisə quruluşu, reallıq və qiymətləndirmə dəyəri yoxlanılır.

Model nəticələri cədvəlləri:
T2AV, I2AV və V2AV cədvəlləri Seedance 2.0, Kling 3.0, Veo 3.1 və müxtəlif açıq mənbəli modellərin fərqli meyarlardakı performansını göstərir. Burada bir modelin bütün sahələrdə mütləq üstün olduğunu demək çətindir. Məsələn, bəzi modellər mətndəki hadisələri daha yaxşı yerinə yetirdiyi halda, digərləri səs keyfiyyəti və ya səhnə keçidlərində daha güclü görünə bilər.

İnsan qiymətləndirməsi ilə uyğunluq qrafiki:
Məqalədə insan qiymətləndirmələri ilə avtomatik balların müqayisə olunduğu qrafik LongAV-Compass ballarının insan seçimlərinə yüksək dərəcədə yaxın olduğunu göstərir. Bu, benchmarkın yalnız texniki ölçmələrdən ibarət olmadığını, insan qavrayışı ilə də müəyyən dərəcədə uyğun nəticələr verdiyini göstərir.

Təcrübələr necə aparılıb?

Tədqiqatçılar 11 fərqli video istehsal sistemini sınaqdan keçiriblər. Bunlar üç qrupa bölünür:

  • Qapalı / kommersiya modelləri
  • Açıq mənbəli modellər
  • Agent əsaslı üsullar

Kommersiya modelləri arasında Seedance 2.0, Kling 3.0 və Veo 3.1 yer alır. Açıq mənbə tərəfində LTX 2.3, LongCat, Wan2.2-I2V-A14B, HunyuanVideo 1.5-I2V, Helios, Open-Sora və davinci-magihuman kimi modellər qiymətləndirilir. VideoDirectorGPT də agent əsaslı nümunə kimi daxil edilir.

Testlərdə hədəf video müddəti ən azı 60 saniyə müəyyən edilib və çıxışların əksəriyyəti 60–120 saniyə aralığında qiymətləndirilib.

Modellər dəstəklədikləri giriş növünə görə sınaqdan keçirilib. Məsələn, bəzi modellər səs yarada bilmirsə, həmin modellər video metrikləri ilə qiymətləndirilir, səs metriklərində isə “uyğun deyil” kimi qeyd olunur.

Qiymətləndirmədə tək baldan istifadə olunmur. Hər video hadisə, keçid, tam video səviyyəsi və audio-video uyğunluğu baxımından ayrıca araşdırılır. Beləliklə modelin harada güclü, harada zəif olduğu daha aydın görünür.

Nəticələr nə göstərir?

Nəticələr göstərir ki, müasir uzun audio-video istehsal modellərinin güclü və zəif tərəfləri tək balla izah edilə bilməyəcək qədər müxtəlifdir.

Mətndən audio-video istehsalı tapşırığında Kling 3.0 hadisələri yerinə yetirmə və uzunmüddətli ardıcıllıq baxımından güclü görünür. Seedance 2.0 isə vizual keyfiyyət, ümumi təqdimat və səs meyarlarında önə çıxır.

Təsvirdən audio-video istehsalı tapşırığında Seedance 2.0 ümumilikdə güclü performans göstərir. Kling 3.0 istinad görüntüsünün ilk kadrda qorunması baxımından yaxşı nəticə verir. Lakin məqalənin mühüm nəticələrindən biri budur: model istinad təsvirdəki insanı və ya obyekti vizual olaraq qorusa belə, uzun videoda hadisə axınını və nəql ardıcıllığını saxlamaqda çətinlik çəkə bilər.

Videodan davam istehsalı tapşırığında Seedance 2.0 aydın şəkildə önə çıxır. Xüsusilə başlanğıc videosuna uyğunluq, hadisələrin davamlılığı, vizual keyfiyyət və səs keyfiyyəti baxımından güclü nəticələr verir. Veo 3.1 bəzi hadisələri mənalı şəkildə davam etdirə bilsə də, istinad videosunun sərhədindən sonra ardıcıllıq və keçid sabitliyi baxımından daha zəif nəticələr göstərə bilər.

Açıq mənbəli modellərin bəzi meyarlarda qənaətbəxş nəticələr verdiyi görünür; lakin uzun nəql, hadisə ardıcıllığı, məhsul nümayişi, vizual bütövlük və audio-video uyğunluğu kimi sahələrdə kommersiya modelləri ilə aralarında hələ də nəzərəçarpan fərq var.

Məqalənin ən diqqətçəkən nəticələrindən biri performans reklamları ssenarisinin modellər üçün xüsusilə çətin olmasıdır. Çünki belə videolarda məhsulun göstərilməsi, funksiyasının izah edilməsi, istifadə prosesinin məntiqli inkişafı və inandırıcı axının qurulması tələb olunur. Modellər çox vaxt məhsulu göstərə bilsələr də, funksiyanı düzgün ardıcıllıqla izah etməkdə və ya səbəb-nəticə axınını qorumaqda çətinlik çəkirlər.

Bu niyə vacibdir?

Bu tədqiqat göstərir ki, süni intellektlə video istehsalı yalnız “gözəl görüntü yaratmaq” məsələsi deyil.

Qısa klipdə təsirli görünən model uzun videoda aşağıdakı problemlərlə üzləşə bilər:

  • Personajın üzü və ya geyimi dəyişə bilər.
  • Məhsul bir səhnədə fərqli, başqa səhnədə başqa cür görünə bilər.
  • Səs görüntüdəki hadisə ilə uyğun gəlməyə bilər.
  • Hekayə başlanğıcda vəd etdiyi məqamı tamamlaya bilməyə bilər.
  • Səhnə keçidlərində qırılma və ya donma yarana bilər.
  • Reklam videosunda məhsulun funksiyası yanlış və ya natamam izah edilə bilər.

Buna görə uzun video yaradan süni intellekt sistemlərini sınaqdan keçirmək üçün daha detallı qiymətləndirmə vasitələrinə ehtiyac var. LongAV-Compass bu ehtiyaca cavab verməyə çalışır.

Verianla oxucusu üçün əsas mesaj budur: süni intellekt modelinin “video yarada bilməsi” onun uzun və ardıcıl audio-video hekayəsi qura bilməsi demək deyil. Uzun video istehsalında əsas sınaq ardıcıllığı, tutarlılığı, səs uyğunluğunu və hadisə axınını qoruya bilməkdir.

Diqqət edilməli məqamlar

Bu məqalə güclü benchmark təklif edir, lakin bəzi məhdudiyyətlər var.

Birincisi, tədqiqat arXiv-də preprint kimi yayımlanıb. Buna görə nəticələrin ekspert rəyi prosesi və müstəqil təsdiqlərlə dəstəklənməsi vacibdir.

İkincisi, qiymətləndirilən modellərin versiyaları zamanla dəyişə bilər. Kommersiya süni intellekt xidmətləri tez-tez yeniləndiyi üçün bu gün əldə edilən nəticələr gələcəkdə fərqli ola bilər.

Üçüncüsü, avtomatik qiymətləndirmə sistemləri insan qiymətləndirməsinə yaxınlaşsa da, insan mühakiməsini tam əvəz etmir. Məqalədə insan uyğunluğu üzrə araşdırma aparılsa da, bu pilot səviyyəsindədir.

Dördüncüsü, bəzi metriklər müəyyən vizual və ya multimodal təmsil modellərinə əsaslanır. CLIP, DINO-v2, ArcFace və ImageBind kimi vasitələr faydalı siqnallar versə də, videonun estetik, nəql və kommersiya uğurunu tam ölçə bilməz.

Beşincisi, model sıralamaları istifadə edilən test ssenarilərindən asılıdır. Vloq, reklam, məhsul təqdimatı və ya hekayə videosu kimi fərqli məzmun növləri modelləri fərqli şəkildə çətinləşdirə bilər.

Nəticə

LongAV-Compass süni intellektlə uzun audio-video istehsalını qiymətləndirmək üçün əhatəli test sistemi təklif edir. Tədqiqat mətndən, təsvirdən və videodan uzun audio-video istehsalını eyni çərçivədə qiymətləndirməsi ilə diqqət çəkir.

Araşdırmanın əsas nəticəsi budur: müasir video istehsal modelləri qısa kliplərdə təsirli görünsələr də, bir dəqiqəni aşan məzmunlarda personaj ardıcıllığı, hadisə sırası, səhnə keçidləri, audio-video sinxronizasiyası və nəql bütövlüyü hələ də ciddi sınaqdır.

Bu benchmark yalnız modelləri sıralamaq üçün deyil, onların harada uğursuz olduğunu diaqnoz etmək üçün hazırlanıb. Bu da gələcəkdə daha etibarlı, daha ardıcıl və daha uzun süni intellekt videoları yaratmaq istəyən tədqiqatçılar üçün mühüm addım ola bilər.

Verianla baxımından məqalənin əsas mesajı aydındır: süni intellektlə video istehsalında əsas inkişaf yalnız daha gözəl kadrlar yaratmaq deyil; uzun müddət ərzində mənanı, səsi, personajı və hekayəni qorumaqdır.

Mənbə və metod qeydi

Bu məzmun Tengfei Liu, Yang Shi, Xuanyu Zhu və həmkarlarının hazırladığı “LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV” adlı akademik tədqiqat əsasında Verianla redaksiya formatında orijinal şəkildə hazırlanıb.

Tədqiqat arXiv-də 25 may 2026 tarixli preprint kimi görünür. Bu yazı sözbəsöz tərcümə deyil; məqalədəki metod, cədvəllər, qrafiklər, təcrübələr və nəticələr sadələşdirilərək yenidən izah olunub. Məzmun məlumatlandırma və təhsil məqsədi daşıyır. Süni intellekt modeli seçimi, kommersiya video istehsalı və ya texniki sistem qiymətləndirməsi üçün təkbaşına qərar bələdçisi kimi istifadə edilməməlidir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy