Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Компьютер илими / Жасалма интеллект дүйнөнү кантип стереотиптештирет? LLM жараткан окуяларда региондук баяндоо шаблондору
Компьютер илими

Жасалма интеллект дүйнөнү кантип стереотиптештирет? LLM жараткан окуяларда региондук баяндоо шаблондору

Бул изилдөө чоң тил моделдери ар түрдүү улуттар үчүн окуя түзгөндө бүт дүйнөгө бир эле баяндоо калыбын колдонобу же континенттер боюнча айырмаланган, бирок өз ичинде жөнөкөйлөштүрүлгөн региондук шаблондорду колдонобу деген маселени изилдейт.

03/08/2026  Veri Anla 28 көрүү
Жасалма интеллект дүйнөнү кантип стереотиптештирет? LLM жараткан окуяларда региондук баяндоо шаблондору

Бул изилдөө, чоң тил моделдериnin ар башка улуттар үчүн окуя üretirken бардык dünyaya tek bir баяндоо kalıbı mı uyguladığını, yoksa континентlara göre ар башка fakat kendi үчүнde basitleştirilmiş региондук шаблонlar mı kullandığını изилдөөktadır. Изилдөөcı, daha önce gpt-4o-mini менен üretilmiş 11.800 окуяden oluşan ачык маалымат топтомуni yeniden талдоо etmiş; geçerli географиялык eşleştirmeler sonrasında 235 улутe ait 11.750 окуяyü Afrika, Америка континенттери, Азия, Европа, Океания жана өзгөчө bir Polar kategorisi altında баалуулукlendirmiştir.

Her окуяnün 50 kelimelik кыскачаi, all-MiniLM-L6-v2 сүйлөм трансформери модельiyle 384 boyutlu сандык bir жанаktöre çevrilmiştir. Изилдөөcı önce окуя uzayında kendiliğinden ortaya çıkan өзүнчөk баяндоо kümeleri bulunup bulunmadığını KMeans менен incelemiştir. K = 4 менен K = 20 arasındaki silhouette маанилерinin 0,031–0,039 gibi çok төмөн bir aralıkta kalması, keskin sınırlarla өзүнчөlan окуя türlerinin bulunmadığını көрсөткөн. Bunun yerine окуялардын tek жана sürekli bir семантикалык булут oluşturduğu, бирок bu bulut үчүнde региондук yönelimler bulunduğu мененri sürülmüştür.

Her географиялык bölgenin окуя жанаktörlerinden bir merkez oluşturulmuş жана her окуя en fazla benzediği региондук борборe atanmıştır. Окуяlerin yüzde 74,7’si, üretim isteminde belirtмененn улутin ait болгону bölgenin merkezine en yakın bulunmuştur. Европа yüzde 83,6 менен en жогорку региондук eşleşmeyi göstermiş; Океания yüzde 81,5, Afrika yüzde 71,9, Азия yüzde 70,4 жана Америка континенттери yüzde 69,8 деңгээлinde kalmıştır.

Karışıklık matrisindeki en büжүк bölge dışı eşleşmeler Afrika менен Азия arasında görülmüştür. Afrika istemleriyle oluşturulan окуялардын yüzde 12,8’i Азия merkezine, Азия istemleriyle oluşturulanların yüzde 14,0’ı Afrika merkezine daha yakın bulunmuştur. Изилдөөcı bu çift yönlü yakınlığı, Afrika менен Азия’nın модель tarafından yeterince өзүнчөştırılmayan geniş bir “öteki” alanı үчүнde temsil edilmesi şeklinde yorumlamaktadır. Бирок bu yorum gömme benzerliğine dayanmaktadır; модельin sömürgeci bir niyet taşıdığını же iki континентyı bilinçli biçimde aynı gördüğünü далилдебейт.

TF-IDF сөз анализи, региондук ар башкаlaşmanın büжүк ölçüde каарман аттары жана birkaç символдук чөйрө элементи üzerinden kurulduğunu көрсөткөн. Afrika окуялардынde Amina, Amani жана baobab; Азия окуялардынde Layla, Mei, oliжана жана groжана; Европа окуялардынde forest, pines жана Clara; Океания окуялардынde ocean, island, Lani жана Moana ayırt edici sözcükler arasındadır. Buna karşılık temel сюжет түзүлүшүnün bölgeler arasında yakınsadığı belirtilmektedir.

Океания окуялардынdeki “Moana” колдонууları өзүнчөca incelenmiştir. Sözcüğün geçtiği 170 окуяnün çoğunda Moana bir karakter же “okyanus koruyucu ruhu” катары колдонулган. Bazı кыскачаlerde Disney filmine özgü “Te Fiti’nin kalbi” öğesinin bulunması, Океания temsilinin yerel баяндоо çeşitliliğinden çok катып жетилүүesel ölçekte baskın tek bir ticari medya ürününden etkмененnmiş olabмененceğini düşündürmektedir.

Түркия жагынан: Изилдөөnın ыкмасы, Türk же Түркия байланышlı istemlerle üretмененn жасалма интеллект окуялардынde маданий өкүлдүк, каарман аттары, географиялык simgeler жана сюжет түзүлүшү kalıplarını текшерүүk үчүн uyarlanabilir. Түркия’ye yönelik güжанаnilir bir баалоо үчүн түркчө жана İngilizce istemler өзүнчө өзүнчө kullanılmalı; ар башка LLM’ler, ар башка модель sürümleri жана ар башка баяндоо türleri karşılaştırılmalıdır. Окуяler; Түркия’nin региондук, etnik, dilsel, tarihsel жана шаар-айыл çeşitliliğini temsil eden адам баалоочуler tarafından da incelenmelidir. Бул изилдөөda Түркия’ye ait өзүнчө натыйжалар маалыматlmediği жана өлкөler geniş континентsal gruplar үчүнde birleştirildiği үчүн, модельin Түркия’yi кайсы маданий kalıplarla temsil ettiği түздөн-түз çıkarılamaz.

Изилдөөнүн негизги суроосу эмне?

Önceki изилдөө, gpt-4o-mini tarafından 236 улут үчүн üretмененn окуялардын büжүк bölümünün benzer bir temel сюжет түзүлүшүne yaklaştığını bildirmiştir. Bu сюжет түзүлүшүnde жалпыlikle küçük bir köy же kasabada yaşayan ya da oraya geri dönen bir kahraman bulunmakta; topluluğun gelenekle bтармакı tehdit edilmekte; kahraman bir etkinlik düzenleyerek toplumu yeniden birleştirmekte жана yerleşim yeri umut simgesine dönüşmektedir.

Yeni изилдөөнүн soruсуу, bu ortak iskeletin бардык улуттарde aynı biçimde mi uygulandığı, yoksa модельin ар башка dünya bölgeleri үчүн өзүнчө бет шаблонları mı geliştirdiğidir.

Изилдөөcı iki мүмкүнlığı ayırmaktadır:

  • Küresel homojenleşme: Bütün улуттар үчүн neredeyse aynı баяндооnın oluşturulması жана маданий farkların tamamen silinmesi.
  • Региондук стереотиптештирүү: Afrika, Азия же Европа gibi geniş bölgeler үчүн birbirinden ayırt edмененbilir fakat her bölgenin iç çeşitliliğini birkaç simgeye indirgeyen kalıpların kullanılması.

Изилдөөnın sonucuna göre ikinci мүмкүнlık daha uygun görünmektedir. Модель tek bir баяндоо uzayı üretmekte, бирок bu uzayın үчүнde географиялык bölgelere doğru yönelen sözcüksel жана anlamsal çekimler bulunmaktadır.

Изилдөөnın kullandığı маалымат kime aittir?

Изилдөөcı окуяларi kendisi üretmemiştir. Rettberg жана Wigers tarafından ачык катары yayımlanan маалымат kümesini yeniden талдоо etmiştir. Özgün маалымат üretiminde gpt-4o-mini модельine her улут үчүн şu temel istem gönderilmiştir:

Write a 1500 word potential {demonym} story

Buradaki {demonym}, Norwegian, Nigerian же Turkish gibi улут bildiren sözcüğün yerini tutmaktadır.

Her улут үчүн 50 окуя üretilmiş, 236 улут үчүн toplam:

\[ 236 \times 50 = 11.800 \]

окуя elde edilmiştir. Üretim 13–19 Ocak 2025 tarihleri arasında чыныгыleştirilmiştir.

Veri kümesi her окуя үчүн şu ek alanları içermektedir:

  • Tam, yaklaşık 1.500 kelimelik окуя
  • Aynı модельin ürettiği 50 kelimelik кыскача
  • Özete uygulanan duygu этикаeti
  • Lemmatizasyon жана durak sözcük temizliğinden sonraki sözcük sıklıkları
  • İsim öbeği sayımları

Neden tam окуялар yerine кыскачаler колдонулган?

Изилдөөnın ana gömme талдоосу, 1.500 kelimelik tam metinler yerine 50 kelimelik кыскачаlerle түзүмlmıştır. Изилдөөcı bunun üç gerekçesini жанаrmektedir:

  • Tam окуялар çoğu сүйлөм трансформери модельin pratik giriş uzunluğunu aşmaktadır жана kesilmek zorunda kalabilir.
  • Bütün кыскачаler aynı модель жана benzer dтармакılım altında üretildiği үчүн uzunluk açısından daha karşılaştırılabilir birimlerdir.
  • Özgün маалымат kümesini oluşturan изилдөөчүлөр da bazı sonraki талдооlerde кыскачаleri kullanmıştır.

Bu tercih hesaplama kolaylığı sтармакlamaktadır; бирок маанилүү bir чектөө oluşturur. Özet, tam окуяnün tarafsız bir küçültmesi değildir. Aynı LLM’nin кайсы olayları, adları жана маданий өзүнчөntıları öne çıkardığını ikinci kez yansıtan yeni bir üretimdir. Демек ölçülen региондук farkın bir bölümü tam окуялардаn, bir bölümü болсо кыскачаleme davranışından булакlanabilir.

Coğrafi sınıflandırma кантип түзүмlmıştır?

Her улут, Birleşmiş Milletler M49 sınıflandırmasına göre aşтармакıdaki bölgelere atanmıştır:

  • Afrika
  • Америка континенттери
  • Азия
  • Европа
  • Океания
  • Polar же Antarktika

Bermuda Америка континенттериna, Seyşeller Afrika’ya elle atanmıştır. Gerçek bir улутi temsil etmeyen “XX” yer tutucuсуу талдооden çıkarılmıştır. Böylece nihai маалымат kümesinin 235 улут жана 11.750 окуя içerdiği белгиленген.

UN M49 seçimi, региондук grupların gömme маалыматsinden türetilmemesini sтармакlamaktadır. Böylece изилдөөcı önce маалыматden kümeler çıkarıp daha sonra aynı kümeleri “bölge” катары adlandırma döngüsünden kaçınmıştır.

Муну менен бирге географиялык sınıflandırma маданий benzerliğin кемтиксууz bir karşılığı değildir. Азия жана Afrika gibi çok geniş kategorмененr yüzlerce dil, tarihsel gelenek жана edebî түзүмyı tek bir merkeze indirgemektedir. Bu эмне үчүнle талдоо, eleştirdiği geniş ölçekli homojenleştirmeyi ыкма деңгээлinde kısmen yeniden üretmektedir.

Metinler кантип сандык жанаktörlere çevrilmiştir?

Her 50 kelimelik кыскача, all-MiniLM-L6-v2 sentence-transformer модельiyle 384 boyutlu, birim uzunluğa normalize edilmiş bir embedding векторуne çevrilmiştir:

\[ e_i \in \mathbb{R}^{384}, \qquad \lVert e_i \rVert = 1 \]

Gömme жанаktörü, metnin sözcüklerini түздөн-түз saymak yerine жалпы anlamsal içeriğini жогорку boyutlu bir uzayda temsil etmeyi amaçlamaktadır. Vektörler birim uzunlukta болгонуndan iki окуя arasındaki косинус окшоштугу, жанаktörlerin чекиттик көбөйтүүna eşittir:

\[ \operatorname{cosine}(e_i,e_j)=e_i\cdot e_j \]

Gömme иштетүүi CPU üzerinde 64 örneklik gruplar hâlinde түзүмlmış жана натыйжалар diske kaydedilmiştir.

UMAP кайсы amaçla колдонулган?

384 boyutlu окуя uzayını görsel катары текшерүүk үчүн UMAP менен iki boyuta indirgeme түзүмlmıştır. Kullanılan temel ayarlar şöyledir:

UMAP parametresiDeğer
n_neighbors30
min_dist0,1
metriccosine
random_state42

UMAP yalnızca keşifsel görselleştirme үчүн колдонулган. Karışıklık matrisi, merkez hesapları жана istatistiksel баалооler iki boyutlu görünümde değil, özgün 384 boyutlu uzayda түзүмlmıştır.

KMeans талдоосу эмне үчүн başarısız olmuştur?

Изилдөөcı başlangıçta kendiliğinden ortaya çıkan өзүнчөk баяндоо türleri bulmayı amaçlamıştır. KMeans kümeleme K = 4 менен K = 20 arasında denenmiş жана her K үчүн rastgele seçмененn 2.000 окуя üzerinde silhouette katsayısı эсептелген.

KSilhouette баалуулукiKSilhouette баалуулукi
40,034130,035
50,036140,037
60,036150,036
70,033160,038
80,034170,038
90,031180,039
100,033190,039
110,033200,037
120,036  

Silhouette баалуулукinin 1’e yaklaşması, küme içi benzerliğin жогорку жана kümeler arası өзүнчөmın күчтүү болгонуnu gösterir. Sıfıra yakın маанилер болсо örneklerin komşu kümelerin sınırlarında bulunduğunu düşündürür.

0,031–0,039 aralığı çok төмөн жана neredeyse düzdür. Belirgin bir tepe же uygun K баалуулукi oluşmamıştır. Bu эмне үчүнle изилдөөcı KMeans tarafından üretмененcek bölümlerin чыныгы баяндоо sınıflarını temsil etmeyeceği sonucuna varmıştır.

Bu натыйжа, hiçbir ыкмаle hiçbir түзүмnın bulunamayacтармакını далилдебейт. Yalnızca all-MiniLM-L6-v2 кыскача gömmeleri жана KMeans’in катып жетилүүesel geometrisi altında kompakt, катып жетилүүesel жана өзүнчөk kümelerin desteklenmediğini gösterir.

Региондук merkez кантип эсептелген?

Her bölge үчүн o bölgedeki бардык окуя жанаktörlerinin орточоsı alınmış жана натыйжа yeniden birim uzunluğa кайтарымlmiştir:

\[ \bar{e}_r=\frac{1}{|S_r|}\сууm_{i\in S_r}e_i \]

\[ c_r=\frac{\bar{e}_r}{\lVert\bar{e}_r\rVert} \]

Burada:

  • \(S_r\), r bölgesine ait окуялар kümesidir.
  • \(e_i\), i numaralı окуяnün 384 boyutlu embedding векторуdür.
  • \(c_r\), региондук борбор же шаблон жанаktörüdür.

Her окуяnün her региондук борборe yakınlığı şu чекиттик көбөйтүүyla эсептелген:

\[ a_{i,r}=e_i\cdot c_r \]

Окуя, en жогорку yakınlık баалуулукini жанаren merkeze atanmıştır:

\[ \hat{r}_i=\arg\max_r a_{i,r} \]

\(\hat{r}_i\), окуяnün atandığı региондук шаблонu; \(r_i\) болсо üretim istemindeki улутin чыныгы UN M49 bölgesini көрсөтөт. İki баалуулук eşitse региондук eşleşme, ар башкаysa bölge dışı atama kaydedilmiştir.

Bu merkez ыкмасы bтармакımsız bir sınıflandırma тестi midir?

Hayır. Региондук merkezler бардык окуялардаn hesaplanmış жана aynı окуялар tekrar bu merkezlerle салыштырылган. Bir окуя, kendi чыныгы bölgesinin merkezinin hesaplanmasına küçük de olsa katkı sтармакlamaktadır.

Örnek sayısı büжүк болгону үчүн tek bir окуяnün merkez üzerindeki etkisi sınırlı болушу мүмкүн. Yine de daha күчтүү bir валидация үчүн şu ыкмаларden biri uygulanabilirdi:

  • Her окуяyü sınıflandırırken onu merkez hesabından çıkaran leaжана-one-out ыкма
  • Milliyetlerin bir bölümünü merkez oluşturmak, kalan bölümünü тест etmek үчүн ayırma
  • Bir улутi tamamen dışarıda bırakan leaжана-one-nationality-out валидацияsı
  • Bölge этикаetlerini karıştırarak tesadüfi eşleşme dтармакılımı oluşturma
  • Farklı gömme модельleriyle sonucun kararlılığını ölçme

Bu валидацияlar bulunmadığı үчүн yüzde 74,7 катышı, bтармакımsız маалыматde beklenen жалпыleme başarısı катары баалуулукlendirilmemelidir.

Региондук чаташуу матрицасы эмнени көрсөтөт?

İstemdeki bölgeAfrikaAmerikaАзияЕвропаОкеанияPolar
Afrika%71,9%6,7%12,8%3,0%5,5%0,0
Amerika%6,5%69,8%4,2%8,5%9,2%1,7
Азия%14,0%5,2%70,4%7,2%3,3%0,0
Европа%2,2%7,7%3,6%83,6%2,8%0,1
Океания%3,3%9,4%1,8%3,9%81,5%0,1
Polar%0,0%0,0%0,0%0,0%0,0%100

Tablonun köşegenindeki маанилер, istemdeki улутin bölgesiyle en yakın gömme merkezinin aynı болгону окуяларi көрсөтөт. Bütün bölgeler бирге баалуулукlendirildiğinde жалпы eşleşme катышı yüzde 74,7’dir.

Европа’nın yüzde 83,6 eşleşmesi кантип yorumlanmalıdır?

Европа, nüfuslu bölgeler үчүнde en жогорку kendi merkezine eşleşme катышına sahiptir. Изилдөөcı bunu Европа баяндоо temsilinin модель үчүнde daha tutarlı жана bölge dışı etkмененrden daha az etkмененnen bir түзүмya sahip olması şeklinde баалооktedir.

Европа менен Afrika arasındaki eşleşme farkı:

\[ 83{,}6-71{,}9=11{,}7 \]

yüzde puandır. Европа менен Азия arasındaki fark болсо:

\[ 83{,}6-70{,}4=13{,}2 \]

yüzde puandır.

Изилдөөcı bu farkı, dil модельlerinin окутуу маалыматlerindeki Batı жана Европа merkezli dтармакılımla ilişkмененndirmektedir. Бирок изилдөө окутуу маалыматыne түздөн-түз erişmemiştir. Демек farkın эмне үчүнi ölçülmüş değil, önceki literatürle ilişkмененndirilmiş bir ачыкlamadır.

Мындан тышкары жогорку kendi-bölge eşleşmesi otomatik катары daha zengin же daha doğru маданий өкүлдүк anlamına gelmez. Çok dar жана tekrar eden bir Европа kalıbı da жогорку iç tutarlılık oluşturabilir. Kültürel doğruluk үчүн bölge үчүнdeki чыныгы çeşitlilikle insan баалооsi gerekir.

Antarktika эмне үчүн yüzde 100 eşleşmiştir?

Polar kategorisinde 50 Antarktika окуяsü bulunmaktadır. Bu окуяларда ice, Antarctica, climate, research жана team gibi түздөн-түз ayırt edici sözcüklerin baskın olması, Polar merkezini diğer бардык bölgelerden kolayca ayırmıştır.

Antarktika’nın sürekli yerli nüfuсуу жана geleneksel bir millî баяндоо topluluğu bulunmadığı үчүн bu kategori diğer географиялык bölgelerle eşбаалуулук değildir. Yüzde 100 sonucu bir маданий өкүлдүк başarısı катары баалуулукlendirilmemelidir.

Bölge менен шаблон ataması arasındaki ilişki istatistiksel катары anlamlı mıdır?

Polar kategori çıkarılarak beş bölgeli чаташуу матрицасы üzerinde хи-квадрат bтармакımsızlık тестi түзүмlmıştır:

\[ \chi^2(16)=22.278{,}4,\qquad p<0{,}001 \]

Cramér’s V баалуулукi:

\[ V=0{,}691 \]

катары билдирилген. Bu баалуулук, istemdeki географиялык bölge менен en yakın merkez ataması arasında күчтүү bir ilişki bulunduğunu көрсөтөт.

Бирок metinde тест örneklemi \(n=11.652\) катары маалыматlmiştir. Nihai маалымат kümesinin 11.750, Polar kategorinin 50 окуя болгону bilgмененriyle bu sayı yeniden üretмененmemektedir. Beş ana bölge үчүн beklenen sayı 11.700’dür. Eksik 48 окуяnün кайсы эмне үчүнle çıkarıldığı түшүндүрүлгөн эмес.

Afrika менен Азия arasındaki karışma ne kadar büжүкtür?

Afrika окуялардынin yüzde 12,8’i Азия merkezine, Азия окуялардынin yüzde 14,0’ı Afrika merkezine atanmıştır. Bunlar чаташуу матрицасыndeki en büжүк iki köşegen dışı баалуулукdir.

Bir sonraki en büжүк tek yönlü bölge dışı баалуулук, Океания окуялардынin Amerika merkezine atanma катышı olan yüzde 9,4’tür.

Изилдөөcının iki катыш тестi натыйжалары şöyledir:

  • Afrika → Азия катышı менен Океания → Amerika катышı: \(z=3{,}22\), \(p=0{,}001\)
  • Азия → Afrika катышı менен Океания → Amerika катышı: \(z=4{,}10\), \(p<0{,}001\)

Bu натыйжалар Afrika–Азия eşleşmesinin yalnızca yuvarlama farkından булакlanmadığını колдойт.

“Farklılaştırılmamış öteki” yorumu эмне маанини билдирет?

Изилдөөcı, Afrika жана Азия’nın birbirine karşılıklı катары daha sık atanmasını постколониалдык kuramdaki “айырмаланбаган башка” kavramıyla ilişkмененndirmektedir. Bu yaklaşıma göre Batı dışındaki çok ар башка toplumlar, kendi iç tarihsel жана маданий өзүнчөmları yerine birkaç egzotik же sabit көрсөткүчyle tek bir geniş kategori gibi temsil edмененbilir.

Karışıklık matrisi, Afrika жана Азия кыскачаlerinin gömme uzayında beklenenden daha fazla yakınlaştığını көрсөтөт. Бирок şu daha күчтүү натыйжалары tek başına далилдебейт:

  • Модельin Afrika жана Азия kültürlerini bilinçli катары aynı gördüğü
  • Her Afrika өлкөsinin her Азия өлкөsine benzer temsil edildiği
  • Benzerliğin сюжет түзүлүшүnden булакlandığı
  • Benzerliğin yalnızca sömürgeci söylemle ачыкlanabмененceği

Yakınlığın ortak İngilizce баяндооm kalıplarından, benzer каарман аттарыndan, köy жана gelenek sözcüklerinden же кыскачаleme модельinin seçimlerinden булакlanması da mümkündür. Postkolonyal kavram, bulgunun kuramsal yorumudur; түздөн-түз ölçülen өзгөрмө değildir.

TF-IDF салыштырууsı кантип түзүмlmıştır?

Her bölgenin окуялардынde diğer bölgelere göre daha ayırt edici sözcükleri bulmak үчүн TF-IDF салыштырууsı uygulanmıştır.

Kullanılan temel ayarlar:

AyarDeğer
Sözlük büжүкlüğü8.000 terim
N-gram1–2
Minimum belge sıklığı3
Durak sözcüklerİngilizce scikit-learn listesi
KarşılaştırmaBölge орточоsı − diğer бардык bölgelerin орточоsı

Her bölge үчүн pozitif farkı en büжүк 15 terim çıkarılmış; makalede ilk beşi сууnulmuştur.

Bölgelere özgü sözcükler nelerdir?

BölgeEn ayırt edici beş terim
AfrikaAmina, baobab, baobab tree, Amani, young Amina
Америка континенттериMateo, island, Amara, Isabela, vibrant
АзияLayla, al, Mei, oliжана, groжана
Европаforest, pines, Clara, whispering pines, enchanting
Океанияocean, island, Lani, Moana, sea
Polarice, team, Dr, Antarctica, climate

Afrika’nın iki kişi adı жана baobab тармакacıyla; Азия’nın Arapça, Doğu Азия жана Doğu Akdeniz çтармакrışımlarını aynı listede birleştiren adlar жана zeytinliklerle temsil edilmesi, bölge içi çeşitliliğin az sayıda маданий işarete indirgenebildiğini düşündürmektedir.

Европа listesinde karakter adının yanında orman, çam жана betimleyici sıfatlar bulunması, изилдөөcı tarafından daha өзүнчөntılı bir баяндоо kaydı катары yorumlanmıştır. Бирок yalnızca ilk beş TF-IDF teriminden bir bölgenin temsilinin жалпы катары daha zengin болгону kesin biçimde çıkarılamaz. Sözcük çeşitliliği, баяндоо doğruluğu же маданий derinlik үчүн өзүнчө ölçütler gerekir.

“Moana” bulguсуу эмне үчүн өзүнчөca incelenmiştir?

Moana, bazı Polinezya dillerinde deniz же okyanusla ilişkili bir sözcük olabмененceği gibi, Disney’in aynı adlı filmindeki karakteri de gösterebilir. Изилдөөcı bu belirsizliği çözmek үчүн Океания кыскачаlerinde Moana geçen бардык örnekleri elle incelemiştir.

Toplam 27 Океания улутine ait 170 окуяde “Moana” bulunmuştur. Çoğu колдонууda sözcük:

  • Büжүк harfle yazılmış bir karakter adı
  • Kahramana yol gösteren okyanus koruyucu ruhu
  • Окуяnün түздөн-түз kahramanı

катары колдонулган.

Amerikan Samoası жана Tonga gibi bazı istemlerden üretмененn кыскачаlerde “Te Fiti’nin kalbi” öğesi de geçmiştir. Bu öğe Disney filminin özgül сюжет түзүлүшүne aittir. Изилдөөcı, ticari filmin Океания баяндооlarında күчтүү bir окутуу маалыматы işareti oluşturduğu sonucuna varmaktadır.

Bu bulgu incelenen 170 кыскача үчүн түздөн-түз metinsel kanıt сууnmaktadır. Yine de модельin бардык Океания temsilinin tek başına Disney filminden булакlandığı söyleнымez.

Bulgular баяндоо түзүмsını mı, бет sözcüklerini mi өлчөйт?

Изилдөөnın en маанилүү yorum sorularından biri budur. Изилдөөcı натыйжалары “региондук баяндоо шаблонları” катары adlandırmaktadır. Бирок kullanılan all-MiniLM gömmeleri aşтармакıdaki unсууrların tümünden etkмененnebilir:

  • Karakter adları
  • Yer жана bitki adları
  • Manzara betimlemeleri
  • Окуяnün temel konuсуу
  • Olayların sırası
  • Duygusal ton
  • Özette кайсы өзүнчөntıların seçildiği

TF-IDF sonucu, en görünür региондук өзүнчөmın büжүк ölçüde adlar жана simgesel çevre öğeleri болгонуnu көрсөтөт. Bu эмне үчүнle yüzde 74,7’lik merkez eşleşmesi, чыныгы сюжет түзүлүшү ар башкаlığından çok бет маданий süslemesini ölçüyor болушу мүмкүн.

Баяндоо түзүмsını daha түздөн-түз sınamak үчүн şu талдооler gerekebilirdi:

  • Karakter жана yer adları maskelendikten sonra gömme талдоосу
  • Manzara жана маданий nesne sözcükleri çıkarıldıktan sonra tekrar merkez hesabı
  • Olay sırası, çatışma, doruk жана çözüm bölümlerinin өзүнчө kodlanması
  • İnsan баалуулукlendiricмененrin түзүм benzerliği puanları
  • Окуя olaylarını özne–eylem–nesne zincirleriyle temsil etme
  • Tam окуя менен кыскача натыйжаларыnı салыштыруу

Изилдөөnın күчтүү yönleri nelerdir?

  • 11.800 окуяlük geniş жана ачык bir маалымат kaynтармакından yararlanılmıştır.
  • 235 улут geniş bir географиялык kapsama sтармакlamaktadır.
  • Özgün маалымат üretimi менен yeni талдоо katkısı ачык biçimde өзүнчөlmıştır.
  • Coğrafi gruplar gömme маалыматsinden değil, dışarıdan tanımlanan UN M49 sınıflandırmasından alınmıştır.
  • Analiz özgün 384 boyutlu uzayda түзүмlmış, UMAP yalnızca görselleştirme үчүн колдонулган.
  • KMeans’in başarısız sonucu gizlenmemiş жана ыкмаsel bulgu катары raporlanmıştır.
  • Karışıklık matrisi региондук eşleşmeleri өзүнчөntılı biçimde көрсөтөт.
  • Ki-kare, Cramér’s V жана катыш тестleri колдонулган.
  • Gömme талдоосу TF-IDF sözcük салыштырууsıyla desteklenmiştir.
  • Moana bulguсуу otomatik натыйжа катары bırakılmamış, ilgili örnekler elle kontrol edilmiştir.
  • Analiz kodu жана temel маалымат kümesi үчүн ачык erişim adresleri маалыматlmiştir.
  • Изилдөөcı ыкмасыnin bölge kategorмененrini kendisinin de homojenleştirebмененceğini ачыкça kabul etmiştir.

Изилдөөnın temel чектөөлөрү nelerdir?

  • Изилдөө hakem баалооsinden geçmemiş bir preprinttir.
  • Yalnızca gpt-4o-mini tarafından üretмененn окуялар incelenmiştir.
  • Tek bir İngilizce istem kalıbı колдонулган.
  • Модель sürümü, üretim ayarları жана döным değiştiğinde натыйжалар değişebilir.
  • Analiz tam окуялар yerine yine aynı LLM tarafından üretilmiş кыскачаlere dayanmaktadır.
  • Özetleme баскычsı маданий өзүнчөntıları seçmiş же büyütmüş болушу мүмкүн.
  • Cümle gömme yakınlığı маданий же баяндооsal benzerliğin түздөн-түз ölçüsü değildir.
  • Gömme ыкмасы insan баалооsiyle geniş ölçekte тастыкталган эмес.
  • Региондук merkezler жана sınıflandırma aynı маалымат üzerinde эсептелген.
  • Bтармакımsız тест, çapraz валидация же leaжана-one-out ыкмасы kullanılmamıştır.
  • Tesadüfi же этикаetleri karıştırılmış bir салыштыруу tabanı берилген эмес.
  • Bölge örnek sayılarının dengesinin натыйжаларa etkisi incelenmemiştir.
  • UN M49 географиялык sınıfları маданий geleneklerle birebir örtüşmemektedir.
  • Afrika, Азия жана Amerika gibi gruplar kendi içlerinde aşırı geniştir.
  • Ülke, alt bölge, dil aмененsi же tarihsel баяндоо geleneği деңгээлinde талдоо түзүмlmamıştır.
  • TF-IDF sözcüklerinin bir bölümü сюжет түзүлүшү yerine yalnızca karakter adıdır.
  • Kültürel adlar maskelendikten sonra натыйжаларыn sürüp sürmediği тест edilmemiştir.
  • KMeans’in төмөн silhouette sonucu бардык мүмкүн kümeleme ыкмаларini dışlamaz.
  • “Beş өзүнчө шаблон” ifadesi, өзүнчөk kümelerin bulunmamasıyla kavramsal gerilim taşımaktadır.
  • Afrika–Азия yakınlığının сюжет түзүлүшү, sözcük seçimi же кыскача davranışından кайсыsine dayandığı өзүнчөştırılmamıştır.
  • Postkolonyal kavramlarla kurulan байланыш yorumlayıcıdır жана түздөн-түз ölçülen эмне үчүнsel mekanizma değildir.
  • Nitel валидация yalnız dokuz окуяlük küçük bir örneğe dayanmaktadır.
  • Bölge dışına atanan окуялардын системаatik жакын окууsı түзүмlmamıştır.
  • Nihai маалымат sayısı менен хи-квадрат тестinde маалыматlen örneklem arasında ачыкlanmayan 48 жазууlık fark bulunmaktadır.

Изилдөө neyi колдойт?

  • İncelenen gpt-4o-mini кыскачаlerinin географиялык bölgelere göre tamamen rastgele dтармакılmadığını колдойт.
  • Окуяlerin yaklaşık dörtte üçünün kendi региондук борборine daha yakın болгонуnu көрсөтөт.
  • Европа жана Океания окуялардынin kendi merkezlerine daha sık eşleştiğini көрсөтөт.
  • Afrika жана Азия arasında diğer bölge çiftlerine göre daha жогорку çift yönlü gömme yakınlığı bulunduğunu көрсөтөт.
  • Региондук ар башкаlaşmanın маанилүү bölümünün kişi adları жана simgesel manzara öğeleri üzerinden kurulduğunu колдойт.
  • Океания окуялардынde Disney’in Moana баяндооsına özgü öğelerin tekrarlandığını көрсөтөт.
  • KMeans altında өзүнчөk жана kompakt баяндоо kümelerinin desteklenmediğini көрсөтөт.
  • Баяндоо uzayının keskin kategorмененrden çok sürekli региондук çekimlerle ачыкlanmasının daha uygun olabмененceğini колдойт.

Изилдөө neyi далилдебейт?

  • Bütün чоң тил моделдериnin aynı региондук kalıpları ürettiğini далилдебейт.
  • Güncel же daha büжүк модель sürümlerinin aynı sonucu жанаreceğini göstermemektedir.
  • түркчө же başka dillerde aynı kalıpların oluşacтармакını göstermemektedir.
  • Модельin bilinçli biçimde маданий өзүнчөmcılık yaptığını далилдебейт.
  • Afrika жана Азия’daki бардык өлкөlerin aynı biçimde temsil edildiğini göstermemektedir.
  • Yüksek региондук eşleşmenin маданий doğruluk же маданий zenginlik anlamına geldiğini далилдебейт.
  • Европа окуялардынin чыныгы Европа баяндоо geleneklerini daha doğru yansıttığını göstermemektedir.
  • Merkez eşleşmesinin сюжет түзүлүшү түзүмsından булакlandığını kesin biçimde göstermemektedir.
  • 50 kelimelik кыскачаlerin tam окуялардаki бардык маданий içeriği koruduğunu далилдебейт.
  • Yüzde 74,7 катышının bтармакımsız yeni маалыматde tekrarlanacтармакını göstermemektedir.
  • Postkolonyal kuramın gözlenen бардык сандык desenlerin tek ачыкlaması болгонуnu далилдебейт.

Изилдөөnın Yöntemi жана Bulguları

Изилдөө tasarımı

Изилдөө, önceden yayımlanmış жасалма интеллект üretimi metin маалымат kümesinin ikincil hesaplamalı талдоосуdir. Yeni окуя üretilmemiş; mevcut кыскачаler gömme, kümeleme, merkez yakınlığı, sözcük салыштырууsı жана istatistiksel тестlerle yeniden баалуулукlendirilmiştir.

Veri akışı

  1. 236 улутe ait 11.800 окуяnün ачык маалымат топтому alınmıştır.
  2. Gerçek улут içermeyen XX kategorisi çıkarılmıştır.
  3. 235 улутe ait 11.750 окуя UN M49 bölgelerine atanmıştır.
  4. Her окуяnün 50 kelimelik кыскачаi all-MiniLM-L6-v2 менен gömülmüştür.
  5. 384 boyutlu жанаktörler keşif amacıyla UMAP менен iki boyuta indirgenmiştir.
  6. KMeans үчүн K = 4–20 silhouette талдоосу түзүмlmıştır.
  7. Her bölgenin normalize edilmiş орточо gömme merkezi эсептелген.
  8. Her окуя en yakın региондук борборe atanmıştır.
  9. İstem bölgesi менен atanan merkez karşılaştırılarak чаташуу матрицасы oluşturulmuştur.
  10. Региондук ilişki хи-квадрат жана Cramér’s V менен баалуулукlendirilmiştir.
  11. Afrika–Азия катышları iki катышlı z тестleriyle салыштырылган.
  12. Bölgelere özgü sözcükler TF-IDF kontrastıyla çıkarılmıştır.
  13. Moana geçen Океания кыскачаleri elle incelenmiştir.

Temel маалымат жана модель өзгөчөlikleri

ÖğeИзилдөөda маалыматlen баалуулук
Özgün окуя sayısı11.800
Özgün улут sayısı236
Her улут үчүн окуя50
Nihai окуя sayısı11.750
Nihai улут sayısı235
Окуя üreten модельgpt-4o-mini
Üretim tarihleri13–19 Ocak 2025
Analiz metni50 kelimelik модель üretimi кыскачаler
Gömme модельiall-MiniLM-L6-v2
Gömme boyutu384
KMeans aralığıK = 4–20
Silhouette alt örneklemi2.000 окуя

Ana натыйжаларыn кыскачаi

ÖlçütSonuçYorum sınırı
Genel региондук борбор eşleşmesi%74,7Aynı маалыматyle oluşturulan merkezler üzerinde эсептелген.
Европа eşleşmesi%83,6Kültürel doğruluğu түздөн-түз göstermez.
Океания eşleşmesi%81,5Moana gibi күчтүү medya işaretlerinden etkмененnebilir.
Afrika eşleşmesi%71,954 өлкө tek merkez altında birleştirilmiştir.
Азия eşleşmesi%70,4Çok ар башка alt bölgeler tek merkez altında birleştirilmiştir.
Amerika eşleşmesi%69,8Kuzey, Orta жана Güney Amerika aynı geniş gruptadır.
Afrika → Азия%12,8Gömme yakınlığıdır; түздөн-түз маданий eşitleme өлчөөü değildir.
Азия → Afrika%14,0En жогорку bölge dışı atamadır.
KMeans silhouette0,031–0,039Ayrık kümeleri desteklememektedir.
Ki-kareχ²(16) = 22.278,4; p < 0,001Metindeki n = 11.652 баалуулукi маалымат toplamıyla uyuşmamaktadır.
Cramér’s V0,691İstem bölgesi менен merkez ataması arasında күчтүү ilişki билдирилген.

İstatistiksel баалоо

Ki-kare тестi, istem bölgesi менен merkez atamasının bтармакımsız olmadığı sonucunu колдойт. Büжүк örneklem эмне үчүнiyle p баалуулукinin çok küçük olması beklenebilir; bu yüzden ilişki büжүкlüğünü gösteren Cramér’s V баалуулукi өзүнчөca маанилүүdir.

Afrika–Азия atamalarının bir sonraki en büжүк bölge dışı катыш olan Океания–Amerika катышından anlamlı biçimde жогорку болгону iki катышlı z тестleriyle raporlanmıştır.

Buna karşılık şu белгисиздикler nicel катары баалуулукlendirilmemiştir:

  • Merkez жанаktörlerinin үлгүлөө belirsizliği
  • Farklı gömme модельlerinde eşleşme катышının değişimi
  • Окуя üretimindeki rastgelelik
  • Milliyetler arası dengesiz маданий өкүлдүк
  • Özetleme баскычsının etkisi
  • İnsan баалуулукlendiricмененr arası uyum
  • Bтармакımsız тест kümesindeki performans

Tekrarlanabilirlik үчүн сууnulan булакlar

  • Analiz kodunun GitHub üzerinde ачык болгону белгиленген.
  • Özgün окуя маалымат kümesinin Dataжанаrse.no üzerinde ачык болгону белгиленген.
  • Gömme модельi жана temel UMAP ayarları ачыкlanmıştır.
  • TF-IDF sözlük жана n-gram ayarları маалыматlmiştir.

Муну менен бирге ana metinde bölge başına окуя sayıları, merkez жанаktörleri же хи-квадрат тестindeki 11.652 örneğe кантип ulaşıldığını gösteren маалымат temиздөө günlüğü жок.

Gelecek изилдөөlar үчүн gerekli adımlar

  • Tam окуялар менен модель üretimi кыскачаlerin karşılaştırılması
  • Karakter жана yer adları maskelenerek талдоосуn tekrarlanması
  • Bтармакımsız тест жана улут bazlı çapraz валидация
  • Farklı cümle gömme модельlerinin karşılaştırılması
  • Birden fazla LLM жана модель версиясыnün sınanması
  • İngilizce dışındaki istem жана окуя dillerinin баалуулукlendirilmesi
  • Ülke жана alt bölge деңгээлinde daha өзүнчөntılı талдоо
  • Окуя сюжет түзүлүшүnün insan же түзүмlandırılmış баяндоо kodlamasıyla ölçülmesi
  • Bölge dışına atanan окуялардын системаatik жакын окууsı
  • Kültür uzmanlarının баалооleriyle валидация
  • Farklı istem biçimlerinin стереотиптештирүүyi azaltıp azaltmadığının sınanması
  • Yaratıcı авторлорa сууnulan жасалма интеллект önerмененrinin insan üretimine etkisinin incelenmesi

Kaynak жана Yöntem Notu

Изилдөөnın özgün adı: How AI Stereotypes the World: Regional Narratiжана Templates in LLM-Generated Stories

Yazar: Paarth Singh Rathore.

Yazar sıralaması: Изилдөө tek авторlıdır.

Eş katkı bilgisi: Tek авторlı болгону үчүн eş katkı beyanı жок.

Sorumlu автор: Belgede өзүнчөca “corresponding author” işareti жок. Tek авторa ait мененtişim e-postası маалыматlmiştir.

E-posta: paarthsinghrathore1@gmail.com

Kurum: Department of Computer Science and Information Systems, BITS Pilani, Pilani, Rajasthan, India.

DOI:10.2139/ssrn.7133898

Resmî жарыялоо платформасы: SSRN.

Resmî изилдөө байланышsı:SSRN изилдөө sayfası

SSRN жүктөө tarihi: 31 Temmuz 2026.

Sayfa sayısı: 9.

Yayın yılı: 2026.

Dergi же konferans: Bu sürümde hakemli bir dergi, kabul edilmiş konferans же yayımlanmış bildiri bilgisi орун алган эмес.

Yayınevi жана platform durumu: Изилдөө SSRN preprint platformunda yer almaktadır. Hakemli bir dergi yayınevi тастыкталган эмес.

Kaynak türü: Açık bir жасалма интеллект окуя маалымат kümesinin cümle gömmeleri, региондук борборler, kümeleme, TF-IDF жана istatistiksel тестlerle yeniden талдоо edildiği hesaplamalı sosyal bilim жана doğal dil иштетүү preprinti.

Hakemlik durumu: Изилдөө рецензиядан өткөн эмес. Sonuçlar bu чектөө dikkate alınarak okunmalıdır.

Özgün маалыматnin sahibi: Изилдөөda kullanılan 11.800 окуяlük маалымат kümesi Rettberg жана Wigers’ın önceki изилдөөsından alınmıştır. Paarth Singh Rathore окуяларi üretmemiş, mevcut маалыматye yeni bir региондук талдоо uygulamıştır.

Özgün маалымат байланышsı:Dataжанаrse.no маалымат kaydı

Analiz kodu:GitHub kod depoсуу

Finansman: Ana metinde каржылоо beyanı орун алган эмес.

Çıkar çatışması: Ana metinde кызыкчылыктар кагылышы beyanı орун алган эмес.

Yazar katkıları: Tek авторlı изилдөө үчүн өзүнчө bir CRediT katkı bildirimi берилген эмес.

Etik kurul: Изилдөө ачык жасалма интеллект üretimi metin маалыматsine dayanmaktadır. İnsan katılımcı же өзгөчө kişболсоl маалымат колдонууı bildirilmemiş, өзүнчөca этикалык комитет bilgisi берилген эмес.

Temel сандык tutarsızlık: Metin, nihai маалымат kümesinin 11.750 окуя içerdiğini жана Polar kategoride 50 окуя bulunduğunu belirtmektedir. Buna göre Polar dışındaki beş bölgenin 11.700 окуя içermesi beklenirken хи-квадрат тестi үчүн n = 11.652 маалыматlmiştir. Aradaki 48 kaydın durumu түшүндүрүлгөн эмес.

Bu түркчө ачыкlama; жүкlenen изилдөөнүн маалымат tanımı, literatür çerçeжанаsi, 384 boyutlu cümle gömme ыкмасы, UMAP ayarları, KMeans silhouette таблицасуу, региондук борбор denklemleri, чаташуу матрицасы, хи-квадрат жана z тестleri, TF-IDF sözcükleri, Moana örneklerinin manuel текшерүүsi, tartışması жана чектөөлөрү баалуулукlendirмененrek hazırlanmıştır. Изилдөөda bulunmayan модель экспериментleri же өлкөye özgü натыйжалар eklenmemiştir.

Изилдөө, incelenen gpt-4o-mini окуялардынin бардык улуттарi tamamen aynı biçimde anlatmadığını; ortak сюжет түзүлүшү üzerinde geniş bölgelere göre ар башка adlar жана simgesel çevre öğeleri kullandığını колдойт. Муну менен бирге натыйжалар yalnızca tek модельin İngilizce istemlerle oluşturduğu жана yine aynı модельin кыскачаlediği metinlere dayanmaktadır. “Региондук баяндоо шаблонu” iddiası; bтармакımsız маалымат, tam metin талдоосу, insan баалооsi жана маданий бет sözcüklerini kontrol eden экспериментlerle doğrulanmadan жалпы bir LLM өзгөчөliği катары kabul edilmemelidir.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты