Akademik tadqiqotlar, tushunarli til

Verianla | O‘zbekcha akademik tadqiqotlar va ilm-fan

27 Sentabr 2026, Yakshanba
VERİANLAMustaqil ilmiy nashriyot
Menyuni ochish yoki yopish
...
Bosh sahifa / Amaliy fanlar / Kompyuter fanlari / Sun’iy intellekt gapirayotganda tabiiyroq ishoralar ishlab chiqa oladimi?
Kompyuter fanlari

Sun’iy intellekt gapirayotganda tabiiyroq ishoralar ishlab chiqa oladimi?

Yangi akademik tadqiqot virtual avatarlarning gapirayotganda tabiiyroq qo‘l-bilak harakatlari qilishi uchun DuoGesture nomli sun’iy intellekt modelini taklif qiladi. Bu model inson ishoralarini ikki alohida oqimda ko‘rib chiqadi: gapning ma’nosiga bog‘liq semantik ishoralar va gapning ritmiga hamroh bo‘ladigan beat ishoralari.

02/06/2026  Veri Anla 33 marta ko‘rildi
Sun’iy intellekt gapirayotganda tabiiyroq ishoralar ishlab chiqa oladimi?

Muammo nimada? Odamlar gapirganda, ular shunchaki tovush chiqarmaydilar.

İnsan iletişimi yalnızca kelimelerden oluşmaz. Konuşurken ellerimizi hareket ettirir, başımızı oynatır, yüz ifadeleri kullanır ve beden ritmimizle konuşmaya eşlik ederiz.

Bu hareketlerin bir kısmı konuşmanın anlamıyla doğrudan ilişkilidir. Örneğin “şuraya gittim” derken eliyle yön göstermek, “büyük” derken elleri açmak veya “paylaşmak” derken avuç içini uzatmak semantik jestlere örnek olabilir.

Bazı hareketler ise daha çok konuşmanın ritmine eşlik eder. Bunlar genellikle küçük, tekrarlı ve vurguya bağlı el hareketleridir. Bu tür hareketlere beat jestleri denir. Beat jestleri kelimenin tam anlamını çizmez; ama konuşmanın akışını, vurgusunu ve ritmini destekler.

Sanal avatarlar, dijital insanlar, oyun karakterleri, eğitim asistanları ve sosyal robotlar için bu jestleri doğal üretmek önemlidir. Çünkü yalnızca ağız hareketi yapan ama bedeni donuk kalan bir avatar, kullanıcıya mekanik veya güvensiz görünebilir.

Bu çalışmanın temel sorusu şudur:

Yapay zekâ, konuşmanın hem anlamını hem ritmini dikkate alarak daha doğal jestler üretebilir mi?

Mevcut Modellerde Sorun Ne?

Birçok konuşma-jest üretim modeli, tüm jestleri tek bir hareket akışı gibi işler. Yani model konuşmayı alır ve buna karşılık gelen beden hareketini tek bir sistemle üretmeye çalışır.

Ancak araştırmacılara göre bu yaklaşım üç önemli soruna yol açabilir.

Birincisi, konuşma ile hareket zamanlaması her zaman iyi hizalanmayabilir. Avatar bazen doğru anda hareket etmez veya konuşmanın vurgusuyla uyumsuz hareket üretebilir.

İkincisi, semantik jestler zayıf kalabilir. Model “paylaşmak”, “göstermek”, “büyük”, “burada”, “yukarı” gibi anlamı beden hareketine bağlayan kelimeleri yeterince iyi jestleştiremeyebilir.

Üçüncüsü, beat hareketleri titrek veya yapay görünebilir. İnsan kolu biyomekanik sınırlara sahiptir; yani kol hareketleri bir anda yön değiştiren rastgele titreşimler gibi değil, ağırlık ve atalet taşıyan hareketler gibi görünür.

DuoGesture bu sorunlara şu fikirle yaklaşıyor:

Semantik jest ve beat jest aynı hareket türü değildir; bu yüzden aynı mekanizmayla üretilmemelidir.

DuoGesture Ne Öneriyor?

DuoGesture, konuşmayla birlikte jest üretimini iki akışa ayırıyor.

Semantik akış, konuşmanın anlamıyla ilişkili jestleri üretmeye çalışıyor. Örneğin belirli kelimeler, ifadeler veya duygu bağlamları hangi beden hareketini çağrıştırabilir?

Beat akışı, konuşmanın ritmi, vurgu yapısı ve zamanlamasıyla uyumlu küçük ritmik hareketleri üretmeye çalışıyor.

Bu iki akış tamamen bağımsız değildir. Model, her karede semantik jestin mi yoksa beat hareketinin mi daha baskın olacağına karar veren bir kapı mekanizması kullanır. Böylece model her an “şimdi anlam odaklı bir jest mi gerekir, yoksa ritmik konuşma hareketi mi daha uygun?” sorusunu yanıtlamaya çalışır.

Şekil 1 Ne Anlatıyor?

Makaledeki Şekil 1, DuoGesture’in genel fikrini gösteriyor. Modelin iki ana yolu var: semantik akış ve beat akışı.

Semantik tarafta konuşma metni, hareketle ilişkili anlam temsillerine dönüştürülüyor. Beat tarafında ise sesin ritmi ve konuşmacı bilgisi hareket akışını yönlendiriyor. Bu iki akışın çıktısı, kare kare değişen bir ağırlıkla birleştiriliyor.

Şeklin ana mesajı şudur:

DuoGesture, konuşma jestini tek parça bir hareket olarak değil, anlam ve ritim arasında sürekli değişen bir karışım olarak görüyor.

Bu, insan iletişimine daha yakın bir yaklaşım sunar. Çünkü insan konuşurken bazen kelimenin anlamını çizen bir el hareketi yapar, bazen de yalnızca ritme eşlik eden küçük vuruşlar yapar.

MGSC: Kelimeden Harekete Daha Anlamlı Köprü

DuoGesture’in ilk önemli bileşeni MGSC, yani Motion-Grounded Semantic Conditioning modülüdür.

Klasik modellerde kelimeler genellikle BERT, FastText veya benzeri metin temsilleriyle verilir. Bu temsiller dil anlamını taşır; fakat bir kelimenin bedende nasıl bir hareketle ifade edilebileceğini doğrudan bilmeyebilir.

Örneğin “paylaşmak” kelimesi dilsel olarak bir anlam taşır. Ama bu kelimenin bedensel karşılığı avuç açma, eli uzatma veya bir şeyi karşıya verme hareketi olabilir. Salt metin temsili, bu hareket biçimini her zaman iyi yakalayamaz.

MGSC bu boşluğu kapatmak için metni hareketle ilişkilendirilmiş temsillerle destekler. Yani model yalnızca “ne söylendi?” sorusuna değil, “bu anlam nasıl bir harekete dönüşebilir?” sorusuna da yaklaşmaya çalışır.

Bu özellikle nadir geçen kelimeler için önemlidir. Veri setinde çok az görülen bir kelime, klasik model için zor olabilir. Ama hareketle ilişkilendirilmiş semantik temsil, bu kelimeye daha uygun bir jest önceliği sağlayabilir.

S-VIB: Hangi Anda Semantik Jest Devreye Girmeli?

DuoGesture’in ikinci önemli bileşeni S-VIB, yani Semantic Variational Information Bottleneck modülüdür.

Bu modül, semantik akışın ne zaman devreye gireceğine karar verir. Her kare için bir ağırlık üretir. Bu ağırlık Ψ sembolüyle gösterilir.

Sade biçimde şöyle düşünebiliriz:

Ψ değeri 0’a yakınsa: Beat akışı baskındır. Hareket daha çok konuşma ritmine eşlik eder.
Ψ değeri 1’e yakınsa: Semantik akış baskındır. Hareket daha çok konuşmanın anlamını ifade eder.

Bu kapı mekanizması rastgele veya sabit değildir. Model konuşmanın içeriğini, zamanlamasını ve semantik işaretleri dikkate alarak öğrenir.

Buradaki en önemli nokta şudur: Kapı her zaman semantik akışı açarsa model anlam odaklı ama fazla hareketli olabilir. Kapı hiç açılmazsa jestler yalnızca ritmik kalır ve anlam zayıflar. S-VIB, bu çöküşü önlemek için değişken ve kontrollü bir seçim yapısı kullanır.

Formül Ne Anlatıyor? İki Hareket Akışı Nasıl Birleşiyor?

Makaledeki en anlaşılır temel formüllerden biri, beat ve semantik hareket akışlarının nasıl karıştırıldığını anlatır:

Zr = (1 − Ψ) Zbr + Ψ Zsr

Bu formülü sadeleştirelim.

Zbr, beat akışından gelen hareket temsilidir.
Zsr, semantik akıştan gelen hareket temsilidir.
Ψ, o anda semantik hareketin ne kadar baskın olacağını belirleyen kapı değeridir.
Zr, iki akışın birleşmiş son hareket temsilidir.

Agar Ψ past bo'lsa, harakat ko'proq ritm oqimidan kelib chiqadi.
Eğer Ψ yüksekse, hareket daha çok semantik akıştan gelir.

Ushbu formulaning ibratli jihati quyidagicha:

Model “ya tamamen ritim ya tamamen anlam” demiyor. Her karede ikisinin oranını ayarlıyor. İnsan jestleri de çoğu zaman böyledir; bir hareket hem ritme uyar hem de belli ölçüde anlam taşır.

IBP: Beat Hareketleri Neden Biyomekanik Olmalı?

DuoGesture’in üçüncü önemli bileşeni IBP, yani Inertial Beat Prior’dır.

Bu bölüm, beat hareketlerinin daha doğal görünmesi için insan kolunun biyomekanik özelliklerinden yararlanır. İnsan kolu ağırlıksız bir çizgi gibi hareket etmez. Omuz, kol, önkol ve elin kütlesi, hareketin yumuşaklığını ve ritmini etkiler.

Beat jestleri genellikle ritmik ve tekrarlıdır. Eğer yapay zekâ bu hareketleri fiziksel sınırlardan tamamen bağımsız üretirse, hareketler titrek veya mekanik görünebilir.

IBP, beat akışına eğitim sırasında bir düzgünlük baskısı uygular. Ama bunu tüm hareketlere körü körüne yapmaz. Özellikle kol zinciri ve beat kareleri üzerinde etkili olur. Semantik jestlerin anlam taşıyan vurgularını fazla bastırmamak için semantik karelerde bu etki azaltılır.

IBP Formülü Ne Söylüyor?

Makaledeki IBP ağırlık formülü şu fikri taşır:

τj,t = τbase × √(mj / mmax) × (1 − Ψt) × (1 + α σ²ϕ,t)

Bu formülü sadeleştirelim.

τj,t, belirli bir eklem ve zaman için ne kadar yumuşatma uygulanacağını belirler.
mj, ilgili beden parçasının kütle oranıdır.
mmax eng og'ir mos yozuvlar segmentidir.
Ψt, o anda semantik akışın ne kadar aktif olduğunu gösterir.
σ²ϕ,t, kapı kararındaki belirsizliği temsil eder.

Bu formülün sade mesajı şudur:

Beat hareketlerinde, kolun ağırlığı ve ataletine daha uygun bir yumuşaklık uygulanır. Ancak semantik jest devredeyse bu yumuşatma azalır. Çünkü semantik hareketin anlam taşıyan keskinliği gereksiz yere bastırılmamalıdır.

Bu, çalışmanın “biyomekanik olarak bilgilendirilmiş” tarafıdır.

Şekil 2 Ne Gösteriyor?

Makaledeki Şekil 2, DuoGesture’in işlem hattını daha ayrıntılı gösteriyor.

Birinci bölümde MGSC, metin, duygu ve hareketle ilişkili temsilleri birleştirerek semantik hareket bilgisini oluşturuyor.

İkinci bölümde S-VIB, bu semantik bilgiyi ve ses zamanlamasını kullanarak semantik kapıyı hesaplıyor.

Üçüncü bölümde beat ve semantik hareket kodları birleştiriliyor. Seçilen hareket kodları daha sonra jest animasyonuna dönüştürülüyor.

Bu şekil, modelin yalnızca ses ve metin alıp hareket üretmediğini; hareketi anlam, zamanlama, duygu, konuşmacı ve biyomekanik düzenlilik üzerinden çok katmanlı biçimde kurduğunu gösteriyor.

Şekil 3 Ne Anlatıyor?

Şekil 3, Two-Stream Hierarchical Blender yani iki akışlı hiyerarşik karıştırıcı yapısını anlatıyor.

Beat akışı, ses özellikleri, konuşmacı kimliği ve başlangıç pozuyla ritmik hareket temsilleri üretir. Semantik akış ise MGSC’den gelen anlam temsillerini kullanır. Eller, üst gövde, alt gövde ve yüz gibi bölgeler ayrı ayrı ele alınır.

Bu önemlidir çünkü insan bedeni tek blok gibi hareket etmez. El hareketi, gövde duruşu ve yüz ifadesi farklı ama ilişkili dinamiklere sahiptir. Model, bu bölgeler arasında dikkat mekanizmalarıyla bilgi alışverişi kurar.

Şeklin ana mesajı:

Doğal jest üretmek için yalnızca el hareketi değil, beden bölgeleri arasındaki uyum da önemlidir.

Tajribalar uchun qaysi ma'lumotlar to'plami ishlatilgan?

Araştırmacılar DuoGesture’i BEAT2 adlı konuşma-jest veri seti üzerinde test ediyor.

BEAT2 yaklaşık 76 saatlik konuşma, hareket, yüz ifadesi ve konuşmacı kimliği verisi içeriyor. Veri setinde 30 konuşmacı bulunuyor. Ayrıca semantik ve beat jest türleri için kare düzeyinde etiketler yer alıyor.

Bu, DuoGesture için önemli bir avantajdır. Çünkü modelin iki farklı jest türünü ayırarak öğrenebilmesi için veri setinde bu ayrımı destekleyen etiketlere ihtiyaç vardır.

Deneyler iki ortamda yapılmış:

Tek konuşmacı ayarı: Speaker 2 üzerinde test.
Çok konuşmacı ayarı: 25 konuşmacı üzerinden test.

Bu sayede modelin hem belirli bir konuşmacıya hem de daha geniş konuşmacı çeşitliliğine karşı davranışı incelenmiş.

Tablo 1 Ne Gösteriyor?

Tablo 1, DuoGesture’i birçok güçlü konuşma-jest üretim modeliyle karşılaştırıyor.

Ana ölçüt FGD, yani Fréchet Gesture Distance olarak verilmiş. FGD düşük olduğunda, üretilen jestlerin gerçek insan hareket dağılımına daha yakın olduğu kabul edilir.

Tek konuşmacı ayarında DuoGesture en düşük FGD değerine ulaşıyor:

DuoGesture: 4,101
SemTalk: 4,278
PyraMotion: 4,612

Çok konuşmacı ayarında da DuoGesture en iyi FGD değerini veriyor:

DuoGesture: 4,081
GestureLSM: 4,268
SemTalk: 5,214
EMAGE: 5,643

Bu sonuçlar, DuoGesture’in hareket gerçekçiliği açısından güçlü bir konumda olduğunu gösteriyor.

Ancak tabloda önemli bir nokta daha var: Beat Alignment veya Diversity gibi bazı ikincil metriklerde başka modeller daha yüksek sonuçlar alabiliyor. Araştırmacılar bu yüzden tek bir metriğe bakılmaması gerektiğini belirtiyor. Çok yüksek beat uyumu bazen abartılı ritmik hareket anlamına gelebilir; çok yüksek çeşitlilik de her zaman doğal ve anlamlı hareket demek değildir.

Tablo 2 Ne Anlatıyor?

Tablo 2, DuoGesture’in bileşenlerini tek tek çıkararak hangi parçanın ne katkı verdiğini inceliyor.

Sonuçlara göre:

MGSC çıkarıldığında FGD 4,081’den 4,803’e kötüleşiyor. Bu, hareketle temellendirilmiş semantik koşullandırmanın en büyük gerçekçilik katkısını verdiğini gösteriyor.

IBP çıkarıldığında beat alignment düşüyor. Bu, biyomekanik atalet önceliğinin ritmik hareketleri daha tutarlı hale getirdiğini destekliyor.

S-VIB yerine daha basit kapı kullanıldığında çeşitlilik azalıyor. Bu da değişken ve stokastik kapı mekanizmasının hareket dağılımını daha geniş tuttuğunu düşündürüyor.

Bu tablo, modelin üç ana parçasının birbirini tamamladığını gösteriyor:

MGSC anlamı güçlendiriyor.
S-VIB ne zaman anlam jesti yapılacağını seçiyor.
IBP ritmik hareketi daha yumuşak ve doğal hale getiriyor.

Kullanıcı Çalışması Ne Söylüyor?

Araştırmacılar 30 ana dili İngilizce olan katılımcıyla kontrollü bir kullanıcı çalışması yapmış. Katılımcılar 35 saniyelik videoları izlemiş ve hareketleri üç açıdan değerlendirmiş:

  • Doğallık
  • Hareket çeşitliliği
  • Konuşma içeriği ve zamanlamasıyla uyum

Karşılaştırılan sistemler arasında gerçek hareket, DuoGesture, SemTalk ve EMAGE yer alıyor.

Beklendiği gibi gerçek insan hareketleri en yüksek puanları alıyor. Üretilen hareketler arasında ise DuoGesture genel olarak daha güçlü algısal değerlendirmeler elde ediyor.

Bu sonuç önemlidir çünkü yalnızca sayısal metrikler her zaman insan algısını tam yansıtmaz. Kullanıcı çalışması, DuoGesture’in ürettiği hareketlerin izleyiciler tarafından daha doğal ve konuşmayla daha uyumlu algılanabileceğini destekliyor.

Şekil 5 Ne Gösteriyor?

Şekil 5, farklı modellerin belirli konuşma parçaları için ürettiği jestleri görsel olarak karşılaştırıyor.

Örnek ifadeler arasında “to get”, “in this way”, “I can share” ve “more drama” gibi konuşma parçaları yer alıyor.

DuoGesture, özellikle anlam taşıyan ifadelerde daha belirgin kol hareketleri ve daha anlaşılır hareket yapıları üretiyor. Beat ağırlıklı ifadelerde ise konuşma ritmiyle uyumlu ama aşırı pürüzsüzleşmeyen hareketler sunuyor.

Ushbu rasmning ta'limiy xabari:

Model yalnızca “hareket var mı?” sorusunu değil, “bu hareket konuşmanın anlamına ve ritmine uygun mu?” sorusunu hedefliyor.

Ek Analiz: Beat ve Semantik Jestler Gerçekten Farklı mı?

Makalenin ek bölümünde, BEAT2 veri setindeki beat ve semantik hareketler karşılaştırılıyor.

Sonuçlar iki jest türünün kinematik olarak farklı olduğunu gösteriyor.

Beat hareketlerinde omuz hareketinin tepe frekansı yaklaşık 1,12 Hz. Semantik hareketlerde bu değer yaklaşık 1,69 Hz. Ayrıca semantik hareketlerde omuz ve önkol arasındaki eşzamanlılık daha yüksek.

Spektral analizde beat hareketlerin daha dar ve belirgin ritmik enerjiye sahip olduğu, semantik hareketlerin ise daha geniş ve daha az tonal bir yapıda olduğu görülüyor.

Bu sonuçlar DuoGesture’in temel fikrini destekliyor:

Beat ve semantik jestler gerçekten farklı hareket profillerine sahipse, onları ayrı akışlarda modellemek anlamlı olabilir.

Araştırma Ne Söylüyor?

Çalışmanın ana mesajı şudur:

Konuşma-jest üretiminde tüm hareketleri tek bir model akışıyla üretmek yerine, semantik ve beat jestleri ayrı ama etkileşimli süreçler olarak ele almak daha başarılı olabilir.

DuoGesture, anlamı hareketle ilişkilendiren MGSC, kare düzeyinde akış seçimi yapan S-VIB ve ritmik hareketi biyomekanik olarak yumuşatan IBP bileşenlerini birleştiriyor.

Deneyler, modelin BEAT2 üzerinde daha düşük FGD değerleri elde ettiğini, bileşenlerin birbirini tamamladığını ve kullanıcıların üretilen hareketleri daha doğal bulduğunu gösteriyor.

Bu Neden Önemli?

Sanal avatarlar ve yapay zekâ karakterleri giderek daha fazla alanda kullanılıyor: eğitim, müşteri hizmetleri, oyun, metaverse, dijital terapiler, dil öğrenimi, işaret dili destek sistemleri ve sosyal robotlar.

Bu sistemlerde yalnızca doğru ses üretmek yetmez. Beden dili, kullanıcının güvenini ve etkileşim kalitesini etkiler.

Yanlış zamanda yapılan bir jest, anlamı olmayan el hareketleri veya titrek beden animasyonu, avatarı doğal olmaktan uzaklaştırır. Bu nedenle konuşma-jest üretimi, yapay zekâ insan etkileşiminde önemli bir araştırma alanıdır.

DuoGesture’in önemi, jestleri yalnızca hareket olarak değil, iletişimsel işlevleri olan farklı türler olarak ele almasıdır. Bu yaklaşım, gelecekte daha anlamlı, daha ritmik ve daha ikna edici dijital karakterler geliştirmek için bir yön gösterebilir.

Dikkat Edilmesi Gereken Noktalar

Bu çalışma dikkatli okunmalıdır.

İlk olarak, çalışma preprinttir. Hakem değerlendirmesinden geçtiği varsayılmamalıdır.

İkinci olarak, model BEAT2 veri seti üzerinde test edilmiştir. Farklı diller, kültürler, konuşma biçimleri ve beden dili normları için sonuçlar değişebilir.

Üçüncü olarak, MGSC önceden eğitilmiş metin-hareket temsillerine dayanır. Bu temsillerin kapsadığı veri ve olası önyargılar modelin hareket üretimini etkileyebilir.

Dördüncü olarak, IBP daha çok kol zinciri ve beat hareketleri için tasarlanmıştır. Tüm beden hareketleri, nesne etkileşimleri veya temas içeren hareketler için yeterli olmayabilir.

Beşinci olarak, FGD ve diğer metrikler faydalıdır; ancak jestlerin iletişimsel anlamını ve kültürel uygunluğunu tamamen ölçmez. Bu yüzden daha iyi anlam temelli değerlendirme metriklerine ihtiyaç vardır.

Son olarak, bu model gerçek insan iletişimini tamamen temsil etmez. İnsan jestleri bağlama, kültüre, niyete, sosyal ilişkiye ve bireysel stile göre değişir.

Sonuç

DuoGesture çalışması, konuşmayla birlikte jest üretimi için önemli bir araştırma yönü sunuyor. Model, insan jestlerini tek bir hareket akışı olarak görmek yerine, semantik ve beat hareketleri ayırıyor; sonra bunları kare kare değişen bir kapı mekanizmasıyla birleştiriyor.

Sonuçlar, bu yaklaşımın BEAT2 veri setinde daha gerçekçi hareket dağılımı sağladığını, kullanıcılar tarafından daha doğal algılandığını ve bileşenlerin birbirini tamamladığını gösteriyor.

Bu çalışma, yapay zekâ avatarlarının geleceği için güçlü bir fikri hatırlatıyor:

Doğal beden dili yalnızca hareket etmek değildir; doğru anda, doğru ritimde ve doğru anlamla hareket etmektir.

Kaynak ve Yöntem Notu

Bu içerik, Ferdinand Paar, Lanmiao Liu, Aslı Özyürek, Serge Thill ve Esam Ghaleb tarafından hazırlanan “DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation” başlıklı akademik çalışmadan yararlanılarak Verianla editoryal formatında özgün olarak hazırlanmıştır.

Çalışma arXiv üzerinde yayımlanmış preprint niteliğindedir. İçerik bilgilendirme ve eğitim amacı taşır. Yapay zekâ avatar tasarımı, klinik iletişim, psikoloji, dil terapisi, insan-robot etkileşimi veya profesyonel animasyon üretimi konusunda uzman danışmanlık yerine geçmez.


Ulashish:

Izohlar ko‘rib chiqilgandan keyin e’lon qilinadi.Izohingiz tasdiqlash jarayoniga yuboriladi va ma’qullangach ko‘rinadi.

Izoh qoldiring

E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan

Bu saytda cookie-fayllarga ruxsat berish foydalanish tajribangizni yaxshilaydi. Cookie-fayllar siyosati