Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / Böyük Dil Modeli Ekosisteminin Xəritələndirilməsi: Arxitekturalar, Uyğunlaşdırma Metodları və Benchmark Performanslarının Model Ailələri Arasında İncelənməsi
Kompüter Elmləri

Böyük Dil Modeli Ekosisteminin Xəritələndirilməsi: Arxitekturalar, Uyğunlaşdırma Metodları və Benchmark Performanslarının Model Ailələri Arasında İncelənməsi

Böyük dil modelləri artıq yalnız daha çox parametrə malik mətn istehsalçıları kimi inkişaf etmir.

19/08/2026  Veri Anla 26 baxış
Böyük Dil Modeli Ekosisteminin Xəritələndirilməsi: Arxitekturalar, Uyğunlaşdırma Metodları və Benchmark Performanslarının Model Ailələri Arasında İncelənməsi

Böyük dil modelləri artıq yalnız daha çox parametrə malik mətn istehsalçıları kimi inkişaf etmir. Müasir sistemlər; diqqət mexanizminin necə hesablandığı, hansı mütəxəssislərin aktivləşdirildiyi, yüz minlərlə və ya milyonlarla token uzunluğundakı kontekstin necə emal edildiyi, görüntü–səs–video kimi fərqli məlumat növlərinin necə birləşdirildiyi və insan üstünlükləri ilə təhlükəsizlik qaydalarının modelə necə ötürüldüyü kimi çoxsaylı arxitektura və təlim qərarlarının birləşməsindən ibarətdir. Bu icmal tədqiqatı GPT, LLaMA 2, Gemini, Claude, DeepSeek, Falcon və Qwen olmaqla yeddi böyük LLM ailəsini ortaq bir taksonomiya altında müqayisə etməyi məqsəd qoyur.

Tədqiqatçılar açıq texniki hesabatlardan, model kartlarından və model sənədlərindən istifadə edərək 50-dən çox təmsilçi LLM arxitekturasını yenidən qurmuş; modelləri diqqət mexanizmi, normallaşdırma, mövqesəl kodlama, dense və ya mixture-of-experts yönləndirməsi, kontekst idarəetməsi, təlim strategiyası, uyğunlaşdırma və multimodal qabiliyyət kimi ölçülərdə kodlaşdırmışdır. Tədqiqat bu taksonomiyanı interaktiv şəkildə araşdırmaq üçün açıq mənbəli LLM Model Explorer interfeysini də təqdim edir.

Məqalənin müqayisəli benchmark cədvəlində GPT-4/GPT-4o ailəsi MMLU-da %86,4 və GSM8K-da %92,0; Gemini 1.5 HumanEval-da %74,9; Claude 3.x SWE-bench-də %49,0; DeepSeek ailəsi GSM8K-da %89,4 və SWE-bench-də %42,5 kimi göstərilmişdir. Lakin bu rəqəmlər tək bir ortaq benchmark sınağında istehsal edilməmişdir. Fərqli model versiyaları, istehsalçı hesabatları, leaderboard-lar, prompting metodları və qiymətləndirmə protokollarından derlənmişdir. Mənbə tədqiqatı buna görə dəyərlərin göstərici xarakter daşıdığını və modellər arasında tam olaraq birbaşa müqayisə edilə bilməyəcəyini açıq şəkildə bildirir.

Tədqiqatın əsas töhfəsi müəyyən bir LLM-nin “qalib” olduğunu elan etməkdən çox, müasir böyük dil modellərinin hansı dizayn oxlarında bir-birindən ayrıldığını görünən hala gətirməsidir. İcmalın təklif etdiyi başlıca meyillər; daha səmərəli diqqət mexanizmlərinə keçid, uzun kontekst üçün modulyar hesablama axtarışı, açıq çəkili modellərdə RoPE və RMSNorm kimi komponentlərin yayğınlaşması, multimodal sistemlərin böyüməsi və RLHF, RLAIF və ya Constitutional AI kimi uyğunlaşdırma metodlarının model inkişafında mərkəzi hala gəlməsidir.

Bununla belə taksonomiyadan çıxarılan bəzi güclü nəticələr eksperimental olaraq doğrulanmış arxitektura qanunları deyil. Xüsusilə “32K-dan uzun kontekstə malik bütün modellər sparse expert routing istifadə edir” nəticəsi tədqiqatın öz GPT-4o və Claude kontekst cədvəlləri ilə uyğun gəlmir. Benchmark fərqlərini müəyyən arxitektura xüsusiyyətlərinə bağlayan izahlar da kontrollu ablasiya təcrübələrindən deyil, ailələrarası müşahidəli müqayisələrdən törədilmişdir.

Tədqiqatın əhatə dairəsiMənbədə bildirilən quruluşNecə şərh edilməlidir?
LLM ailəsi7GPT, LLaMA 2, Gemini, Claude, DeepSeek, Falcon və Qwen
Yenidən qurulan arxitektura50+Texniki sənəd və model kartlarından yüksək səviyyədə yenidən qurulmuşdur.
Əsas müqayisə oxlarıArxitektura, təlim, uyğunlaşdırma, kontekst, multimodallıq, təhlükəsizlik, benchmarkOrtaq bir taksonomiya altında araşdırılmışdır.
Benchmark metoduİkincil mənbələrdən bildirilən nəticələrOrtaq təcrübə mühitində yenidən ölçülmüş nəticələr deyil.
İnteraktiv alətLLM Model ExplorerTaksonomiyadakı xüsusiyyətlərin model əsasında müqayisə edilməsini təmin edir.
Əsas elmi sərhədKontrollu səbəb-nəticə arxitektura müqayisəsi yoxdurTaksonomiya əlaqələri hipotez yaradır; səbəbliyi sübut etmir.

Niyə yalnız “neçə milyard parametr?” sualı artıq kifayət deyil?

İlk böyük dil modeli nəsillərində miqyas artımı başlıca irəliləyiş oxlarından biri idi. Tədqiqatın tarixi anlatımında GPT-2-nin 2019-dakı böyük miqyaslı əvvəlcədən təlim yanaşmasından GPT-3-ün 175 milyard parametrinə, daha sonra uzun kontekstli və multimodal modellərin ortaya çıxmasına uzanan bir dönüşüm təsvir edilir.

Lakin tədqiqatçılara görə müasir LLM dizayn sahəsi artıq tək bir böyüklük oxuna endirilə bilməz. Parametr sayı yaxın olan iki sistem; attention mexanizmi, aktiv ekspert sayı, normallaşdırma metodu, mövqesəl kodlama, məlumat qarışığı, instruction tuning, uyğunlaşdırma və ya multimodal encoder quruluşu səbəbindən çox fərqli hesablama və davranış profilləri göstərə bilər.

Tədqiqat hansı yeddi model ailəsini araşdırır?

Model ailəsiMənbədə araşdırılan təmsilçi modellərTədqiqatın önə çıxardığı əsas xüsusiyyət
GPTGPT-2, GPT-3/3.5, GPT-4, GPT-4o, O1Decoder-only Transformer, böyük miqyaslı əvvəlcədən təlim, multimodallıq və RLHF
LLaMALLaMA, LLaMA 2, Code LLaMARoPE, GQA, RMSNorm və açıq çəkili ekosistem
GeminiGemini 1.x və Gemini 1.5Multimodallıq, uzun kontekst və mənbədə MoE kimi təsvir edilən quruluş
ClaudeClaude 2, Claude 3 və 3.5 variantlarıUzun kontekst, Constitutional AI və RLAIF
DeepSeekDeepSeek-V2/V3 və Reasoner/R1MLA, MoE və reasoning yönümlü təlim
FalconFalcon 7B/40B/180B, Falcon 2, Falcon 3 və MambaMulti-query/multigroup attention və state-space variantları
QwenQwen, Qwen2 və Qwen-MaxRoPE, RMSNorm, SwiGLU, çoxdillilik və kod/riyaziyyat ixtisaslaşması

Attention mexanizmləri niyə fərqlənir?

Klassik Transformer-dəki multi-head attention hər attention head üçün ayrı query, key və value proyeksiyalarından istifadə edir. Böyük modellərdə xüsusilə key–value önbelleği uzun kontekst və yüksək eyni-vaxtlı istifadəçi yükü altında mühüm yaddaş xərcinə çevrilir.

Tədqiqat bu problemə fərqli ailələrin fərqli həllər gətirdiyini vurğulayır. LLaMA 2-də Grouped Query Attention (GQA), Falcon və Qwen ailəsində multi-query və ya multigroup attention, DeepSeek-də isə Multi-Head Latent Attention (MLA) kimi yanaşmalar bu xərci azaltmağı hədəfləyir.

DeepSeek-in MLA yanaşması key–value təmsillərini daha aşağı ölçülü latent göstəricilərə sıxışdıraraq hesablama və saxlanma yükünü azaltmağı məqsəd qoyur. Falcon-un multi-query/multigroup yanaşması da key və value proyeksiyalarının attention head-ləri arasında daha çox paylaşılması yolu ilə KV-cache yükünü azaltmağa yönəlmişdir.

Mixture-of-Experts nə təmin edir?

Mixture-of-Experts (MoE) yanaşmasında modelin bütün parametrləri hər token üçün eyni anda aktivləşdirilmir. Bir yönləndirmə mexanizmi girişə görə müəyyən ekspert alt şəbəkələrini seçir. Beləliklə ümumi model tutumu böyüyərkən token başına aktiv hesablama ümumi parametr sayından daha aşağı saxlanıla bilər.

Mənbə tədqiqatı bu yanaşmanı xüsusilə Gemini və DeepSeek ailələrinin miqyaslanma və uzun kontekst strategiyaları ilə əlaqələndirir. DeepSeek-R1 üçün 671 milyard ümumi parametrə qarşı token başına təxminən 37 milyard aktiv parametr məlumatı verilir.

Ancaq MoE-nin mövcudluğu təkbaşına daha yaxşı reasoning, daha uzun kontekst və ya daha yüksək benchmark performansının səbəbi kimi qəbul edilə bilməz. Yönləndirmə metodu, təlim məlumatı, aktiv ekspert sayı, attention arxitekturası və post-training prosesi nəticələrə birlikdə təsir edir.

Falcon Mamba niyə fərqlidir?

Falcon Mamba 7B, klassik self-attention əvəzinə Mamba state-space modelindən istifadə etməsi səbəbindən tədqiqatdakı mühüm arxitektura ayrımlarından biridir. Mənbə bunun uzun ardıcıllıqlarda xətti zamanlı emal və təxminən sabit yaddaş davranışı hədəflədiyini bildirir.

Falcon 3 ailəsində Transformer və state-space yanaşmalarının birlikdə olması müasir LLM inkişafının artıq yalnız Transformer daxilindəki variasiyalardan deyil, attention xarici uzun-ardıcıllıq arxitekturalarından da ibarət olduğunu göstərir.

RMSNorm, RoPE və SwiGLU niyə tez-tez görünür?

Tədqiqatın taksonomiyasında açıq çəkili model ailələrinin bir hissəsində üç komponentin tez-tez təkrarlandığı görünür: RMSNorm, Rotary Positional Embedding (RoPE) və SwiGLU.

RMSNorm normallaşdırma xərcini sadələşdirərkən; RoPE attention mexanizminin içinə nisbi mövqe məlumatını daşıyır. SwiGLU isə gated aktivasiya quruluşundan istifadə edir. Tədqiqat LLaMA 2 və Qwen-i bu komponentlərin aydın nümunələri kimi nəzərdən keçirir.

Multimodal modellərdə nə dəyişir?

Mətndən kənar görüntü, səs və video məlumatını emal etmək üçün modelin yalnız bir tokenizer və dil decoder-indən ibarət olması kifayət deyil. Tədqiqatda Gemini, GPT-4o və Claude 3 bu dönüşümün fərqli nümunələri kimi araşdırılır.

Gemini arxitektura sxemində fərqli məlumat növlərinin modality-specific encoder-lar üzərindən emal edilib cross-modal attention yolu ilə ortaq bir latent sahəyə köçürülməsi göstərilir. Tədqiqat GPT-4o-nu isə mətn, kod, görüntü, səs və video emal edə bilən birləşik multimodal dizayn kimi nəzərdən keçirir.

Uyğunlaşdırma: RLHF nə edir?

Reinforcement Learning from Human Feedback (RLHF), əvvəlcədən təlim almış modelin yalnız növbəti token ehtimalını optimallaşdırmaq əvəzinə insan üstünlükləri ilə daha uyğun çıxışlar verməsi üçün istifadə olunan post-training metodlarından biridir.

Mənbə tədqiqatı GPT-4, LLaMA 2, Claude, DeepSeek və Qwen kimi ailələrdə müxtəlif supervised fine-tuning və üstünlük optimallaşdırması formalarının istifadə edildiyini izah edir.

Bununla birlikdə müəlliflər RLHF-nin təhlükəsizliyi qəti şəkildə həll etmədiyini vurğulayırlar. İnsan geri bildirimi bahalıdır; reward hacking ortaya çıxa bilər; təhlükəsizlik təlimi həddindən artıq rədd davranışına yol aça bilər və jailbreak və ya adversarial prompting riskləri tamamilə aradan qalxmır.

Constitutional AI və RLAIF nədir?

Claude ailəsi tədqiqatda alignment yanaşması baxımından ayrıca bir kateqoriya kimi nəzərdən keçirilir. Constitutional AI-da modelin müəyyən prinsiplər çərçivəsində öz çıxışını tənqid etməsi və yenidən tənzimləməsi məqsəd qoyulur. Reinforcement Learning from AI Feedback (RLAIF) isə insan qiymətləndirməsinin bir hissəsinin AI tərəfindən verilən geri bildirimlə dəstəklənməsini ehtiva edir.

Mənbə müəllifləri bu yanaşmanın insan annotasiyasından asılılığı azalda biləcəyini, lakin AI geri bildiriminin model qaynaqlı qərəzləri yenidən istehsal etmə riski olduğunu bildirirlər.

Taksonomiyanın üç əsas örüntüsü

Məqalə yeddi model ailəsini ortaq ölçülərə yerləşdirdikdən sonra üç ailələrarası örüntü təklif edir.

Mənbənin örüntüsüMüqayisə edilən oxlarMüəlliflərin çıxarımıVerianla şərh sərhədi
A — Alignment–Efficiency DivergenceAlignment strategiyası × attention optimallaşdırmasıDərin uyğunlaşdırma ilə ən irəli attention səmərəliliyinin eyni modeldə birlikdə görünmədiyi irəli sürülür.Kəmiyyət olaraq müəyyən edilmiş iki oxda kontrollu performans testi deyil.
B — Context–Routing Co-AdoptionKontekst uzunluğu × expert routing>32K kontekstli modellərin sparse/modulyar routing istifadə etdiyi irəli sürülür.Mənbənin GPT-4o və Claude cədvəlləri ilə universal ifadə uyğun gəlmir.
C — Open-Weight ConvergenceAçıqlıq × normallaşdırma × mövqesəl kodlamaAçıq çəkili modellərin RMSNorm + RoPE ətrafında qruplaşdığı irəli sürülür.Model ailəsi daxilində bütün variantlar üçün eyni səviyyədə texniki açıqlıq yoxdur.

Pattern B-dəki daxili uyğunsuzluq niyə vacibdir?

Tədqiqatın Pattern B mətni, araşdırılan modellər içində 32K-dan daha uzun context window təmin edən “hər modelin” sparse expert routing və ya selective state-space qatlarından istifadə etdiyini ifadə edir.

Lakin eyni mənbədə olan müqayisə cədvəli GPT-4/GPT-4o üçün 128K, Claude 2/3 üçün isə 100K–200K context window bildirir. Bu iki ailənin müvafiq arxitektura xülasələrində sparse MoE və ya selective state-space routing göstərilmir.

Buna görə mənbə daxilindəki məlumatlar “uzun context ilə modulyar hesablama arasında bəzi ailələrdə birlikdə görünmə” şərhini dəstəkləyə bilər; lakin “32K-dan yuxarı bütün modellər bundan istifadə edir” nəticəsini öz cədvəlləri əsasında dəstəkləmir.

“Açıq model” ilə “açıq mənbə” eyni şeydirmi?

Mənbə tədqiqatında modellər qapalı, açıq çəkili, qismən açıq və ya tədqiqat lisenziyalı kimi fərqli kateqoriyalarda nəzərdən keçirilir. Bu ayrım vacibdir. Model çəkilərinin yayımlanması; təlim məlumatının, tam təlim kodunun, post-training xəttinin və təhlükəsizlik sisteminin hamısının açıq olduğu mənasına gəlmir.

Bu səbəbdən tədqiqatdakı “open-source ecosystem” ifadəsi oxunarkən hər ailə üçün real açıqlıq səviyyəsinin fərqli ola biləcəyi nəzərə alınmalıdır.

Benchmark nəticələri niyə tək bir liqa cədvəli deyil?

Məqalənin Tablo 2-si beş benchmark-ı yan-yana verir: MMLU, HumanEval, GSM8K, SWE-bench və MathVista. Lakin cədvəl hüceyrələrinin hamısı eyni model versiyası, eyni tarix, eyni prompting strategiyası və ya eyni evaluation harness altında ölçülməmişdir.

Üstəlik cədvəl bəzi sətirlərdə tək bir modeli deyil, ailə daxilində birdən çox variantı birlikdə təmsil edir: “GPT-4/GPT-4o”, “Claude 3.x (Opus/Sonnet)”, “Gemini 1.5 (Pro/Ultra)” və ya “DeepSeek (V3/Reasoner)” kimi.

Dolayısıyla bir sətirdəki MMLU skoru ilə eyni sətirdəki SWE-bench skorunun mütləq eyni checkpoint və ya eyni model variantından gəldiyi fərz edilməməlidir.

İstehsalçı və müstəqil benchmark fərqi

Tədqiqat istehsalçılar tərəfindən bildirilən nəticələrlə müstəqil qiymətləndirmələr arasında fərqlər ola bildiyini və istehsalçı skorlarının MMLU-da təxminən 2–8 faiz bəndi, GPQA-Diamond və SWE-bench kimi daha yeni benchmark-larda bəzi hallarda təxminən 10–15 bənd daha yüksək ola bildiyini ifadə edir.

Müəlliflər bunun prompting metodu, qiymətləndirmə proqramı, model versiyası və mümkün evaluation-set contamination kimi amillərdən qaynaqlana biləcəyini bildirirlər. Bununla birlikdə bu 2–8 və 10–15 bəndlik fərqləri yaradan bütün cütləşdirilmiş ölçmələrin xam məlumat cədvəli məqalədə təqdim edilmir. Buna görə bu aralıqlar müstəqil bir meta-analiz nəticəsi kimi qiymətləndirilməməlidir.

Tədqiqatın dəstəklədiyi nəticələr

  • Müasir LLM ailələri eyni əsas Transformer kökündən gəlsələr də attention, normallaşdırma, routing, context, multimodallıq və alignment ölçülərində əhəmiyyətli dərəcədə fərqlənir.
  • GQA, MQA, MLA, FlashAttention, MoE və state-space yanaşmaları böyük miqyaslı modellərdə səmərəlilik və uzun-ardıcıllıq emalı problemlərinə yönəlmiş fərqli texniki həllər təqdim edir.
  • RLHF tək alignment yanaşması deyil; Constitutional AI və RLAIF kimi alternativ və ya tamamlayıcı yanaşmalar da istifadə olunur.
  • Açıq çəkili və qapalı model inkişaf ekosistemləri şəffaflıq, yenidən istehsal edilə bilmə, xərc və təhlükəsizlik mühəndisliyi baxımından fərqli ödünləşmələr ehtiva edir.
  • Model seçimi yalnız benchmark skoruna deyil, istifadə sahəsi, context ehtiyacı, multimodallıq, xərc, təhlükəsizlik və yerləşdirmə şərtlərinə görə aparılmalıdır.
  • Benchmark nəticələrinin model versiyası və qiymətləndirmə protokolu məlumatı olmadan birbaşa müqayisəsi etibarlı deyil.

Tədqiqatın sübut etmədiyi nəticələr

  • Hər tapşırıq üçün tək bir LLM ailəsinin mütləq ən yaxşı olduğu sübut edilməmişdir.
  • Tablo 2 dəyərləri ortaq kontrollu təcrübədə əldə edilmiş baş-başa model müqayisəsi deyil.
  • Bir benchmark fərqinin yalnız bir attention mexanizmi, MoE və ya alignment metodu tərəfindən yaradıldığı sübut edilməmişdir.
  • Constitutional AI-ın attention səmərəliliyi ilə zəruri fiziki trade-off yaratdığı eksperimental olaraq göstərilməmişdir.
  • Uzun context üçün sparse expert routing-in zəruri şərt olduğu mənbə məlumatları ilə sübut olunmur.
  • Açıq çəkili modellərin qapalı modellərdən ümumən daha təhlükəsiz və ya daha təhlükəli olduğu nəticəsinə gəlmək olmaz.
  • Benchmark-dakı yüksək performans real dünya etibarlılığı, factuality və ya təhlükəsiz istifadə zəmanəti deyil.

Türkiyə baxımından nə ifadə edir?

Tədqiqat Türkiyəyə məxsus bir LLM müqayisəsi aparmır və türkcə benchmark nəticələrini ayrıca bir təcrübə qrupu kimi təqdim etmir. Buna görə cədvəldə yüksək nəticə göstərən bir modelin türkcə hüquq, səhiyyə, təhsil, sənaye və ya ictimai sektor tətbiqlərində eyni performansı göstərəcəyi fərz edilə bilməz.

Türkiyədəki bir qurum üçün model seçimi ediləcəksə, bu taksonomiya arxitektura üzrə ilkin seçim aləti kimi istifadə oluna bilər; lakin türkcə dil performansı, sahə terminologiyası, məlumat yerləşməsi, şəxsi məlumatların qorunması, gecikmə, xərc, qurumdaxili hostinq tələbləri və yerli istifadə ssenariləri ayrıca test edilməlidir. Bu yerli doğrulama mənbə tədqiqatının həyata keçirdiyi analiz deyil.

Tədqiqatın Metodu və Nəticələri

Bu tədqiqat klassik sistematik icmaldırmı?

Məqalə geniş bir icmal və taksonomiya tədqiqatıdır; lakin mənbə mətnində PRISMA kimi sistematik ədəbiyyat axtarışı protokolu, əvvəlcədən müəyyən edilmiş verilənlər bazası axtarış sətirləri, daxil etmə/xaric etmə axış sxemi və ya tədqiqat keyfiyyəti meta-analizi təqdim edilmir.

Müəlliflər model seçimini üç meyara əsaslandırır:

  1. texniki sənədləşmənin mövcudluğu,
  2. arxitektura müxtəlifliyi,
  3. tədqiqat və sənaye istifadəsi baxımından əhəmiyyət.

Bu meyarlarla GPT, LLaMA 2, Gemini, Claude, DeepSeek, Falcon və Qwen ailələri seçilmişdir.

Arxitekturalar necə yenidən quruldu?

Müəlliflər modellərin arxitektura sxemlərini ictimaiyyətə açıq texniki hesabatlardan, system card-lardan və model sənədləşmələrindən yenidən qurmuşdur. Xüsusilə qapalı sistemlərin implementation ayrıntıları yayımlanmadığı üçün sxemlər yüksək səviyyədə və ortaq abstraksiya səviyyəsində saxlanılmışdır.

Qiymətləndirilən başlıca arxitektura ölçüləri bunlardır:

  • Multi-Head Attention (MHA), Grouped Query Attention (GQA), Multi-Query Attention (MQA) və Multi-Head Latent Attention (MLA),
  • LayerNorm və RMSNorm,
  • dense və mixture-of-experts routing,
  • context handling və positional encoding,
  • alignment və training pipeline-ları.

Taksonomiya necə yaradıldı?

Hər model kateqorik və ədədi xüsusiyyətlərdən ibarət bir xüsusiyyət vektoru ilə təmsil edilmişdir. Tədqiqat yalnız açıq sənədləşmədə olan xüsusiyyətlərin kodlaşdırıldığını və məlumat qeyri-müəyyən olduqda həddindən artıq detallandırmadan qaçmaq üçün “conservative labeling” tətbiq edildiyini bildirir.

Sonra taksonomiya ölçüləri ikili və ya çoxlu əlaqələr üzərindən müqayisə edilmişdir. Məsələn alignment metodu attention səmərəliliyi ilə; context length expert routing ilə; model açıqlığı normallaşdırma və positional encoding ilə birlikdə araşdırılmışdır.

Verianla Live: LLM taksonomiyasının yaradılma prosesi

Bu proses mənbə tədqiqatının 3.1 bölməsindəki metodologiyaya əsaslanır. “Nəticə” mərhələsindəki struktur örüntülər kontrollu eksperimental səbəblik deyil, müqayisəli taksonomiyadan çıxarılan nəticələrdir.

MərhələMənbə tədqiqatındakı əməliyyat
1. Model ailəsi seçimiSənədləşmə, arxitektura müxtəlifliyi və tədqiqat/sənaye əhəmiyyəti meyarları ilə yeddi ailə seçildi.
2. Texniki mənbələrin toplanmasıTexniki hesabatlar, system card-lar və model sənədləşməsi istifadə edildi.
3. Arxitektura yenidən qurulması50-dən çox təmsilçi arxitektura ortaq bir abstraksiya səviyyəsində yenidən quruldu.
4. Xüsusiyyət kodlamasıAttention, normallaşdırma, routing, context, positional encoding, training və alignment ölçüləri kodlaşdırıldı.
5. Ailələrarası müqayisəTaksonomiya ölçülərinin ikili və çoxlu əlaqələri araşdırıldı.
6. Benchmark ilə əlaqələndirməTaksonomiya örüntüləri mənbələrdə bildirilən benchmark nəticələri ilə müqayisə edildi.
7. Hipotez istehsalıAlignment–efficiency, context–routing və open-weight convergence örüntüləri təklif edildi.
 

Mənbənin benchmark cədvəli

Aşağıdakı dəyərlər məqalənin Tablo 2-sindən köçürülmüşdür. Mənbə tədqiqatının öz xəbərdarlığı qorunmalıdır: nəticələr fərqli mənbə və protokollardan gəldiyi üçün qəti və birbaşa model sıralaması deyil.

Model ailəsiMMLU (%)HumanEval Pass@1 (%)GSM8K (%)SWE-bench Pass@1 (%)MathVista (%)
GPT-4 / GPT-4o86,467,092,033,263,8
Claude 3.x (Opus/Sonnet)82,160,188,049,060,5
Gemini 1.5 (Pro/Ultra)81,974,987,835,059,2
LLaMA 2 (70B)68,948,156,818,044,1
Falcon (180B/Falcon 2)66,545,255,415,341,6
DeepSeek (V3/Reasoner)79,872,689,442,561,2
Qwen (Qwen2/Qwen-Max)78,565,383,736,458,1

Verianla Live: Mənbə tədqiqatındakı beş benchmark üzrə model ailələri

Qrafikin elmi source-of-truth məlumatı aşağıdakı görünən cədvəldir. Benchmark-lar fərqli bacarıqları ölçür və nəticələr tək bir ortaq qiymətləndirmə koşusunda əldə edilməmişdir. Qrafik yalnız mənbə Tablo 2-də bildirilən dəyərlərin kəşf məqsədli vizual müqayisəsidir.

Model ailəsiMMLU (%)HumanEval (%)GSM8K (%)SWE-bench (%)MathVista (%)
GPT-4 / GPT-4o86,467,092,033,263,8
Claude 3.x82,160,188,049,060,5
Gemini 1.581,974,987,835,059,2
LLaMA 268,948,156,818,044,1
Falcon66,545,255,415,341,6
DeepSeek79,872,689,442,561,2
Qwen78,565,383,736,458,1
 

Vacib: Buradakı dəyərlər “hansı LLM qəti ən yaxşıdır?” sualına cavab verən kontrollu baş-başa təcrübə deyil.

Benchmark-ların mənası

BenchmarkTədqiqatdakı istifadə məqsədi
MMLUFərqli bilik və problem sahələrində ümumi dil modeli performansı
HumanEvalProqramlaşdırma/kod istehsalı performansı
GSM8KRiyazi sözlü məsələ həlli
SWE-benchReal proqram mühəndisliyi problemləri üzərində kodlama qabiliyyəti
MathVistaVizual və riyazi mühakimənin birləşdiyi tapşırıqlar

Model ailələrinin context və multimodallıq müqayisəsi

AiləMənbədə bildirilən contextMultimodal quruluşUyğunlaşdırma / təhlükəsizlik
GPT-4 / GPT-4o128K GPT-4oMətn, görüntü, səs, videoSFT, RLHF, PPO, moderasiya və məzmun filtrləri
GPT-O18K–32KMətnSFT, RLHF və reasoning yönümlü mükafat modelləri
LLaMA 24KMətnSFT, RLHF, Ghost Attention və safety reward modelləri
Gemini 1.51M-ə qədərMətn, görüntü, səs, video, kodRLHF, expert gating və moderasiya
Claude 2/3100K–200KMətn; Claude 3-də görüntüConstitutional AI, RLAIF, self-critique və red teaming
Falcon4K–32KƏsas ailə mətn; Falcon 2-də VLM variantıSafety classifier və LoRA əsaslı uyğunlaşdırma
DeepSeek R1/V332K–128KTədqiqatda əsasən mətnGRPO, SFT, sintetik məlumat, rejection sampling
Qwen32K+Tədqiqatın müqayisə cədvəlində mətnSFT, RLHF, preference optimization və bias mitigation

Taksonomiyanın benchmark fərqlərinə gətirdiyi izah

Mənbə tədqiqatının Tablo 6-sı üç nümunə benchmark fərqini arxitektura ölçüləri ilə əlaqələndirir:

BenchmarkAilə AAilə BSkor fərqiMənbənin əlaqələndirdiyi taksonomiya ölçüləri
GSM8KDeepSeek-V3: %89,4LLaMA 2: %56,8+32,6 faiz bəndiMLA/GQA, MTP/next-token prediction, rejection-sampled RL/Ghost Attention RLHF
SWE-benchClaude 3.x: %49,0GPT-4o: %33,2+15,8 faiz bəndiConstitutional AI + RLAIF/RLHF-PPO və 200K/128K context
HumanEvalGemini 1.5: %74,9LLaMA 2: %48,1+26,8 faiz bəndiMoE/dense Transformer və 1M/4K context

Bu cədvəl birbaşa mexanizm testi deyil. Hər müqayisədə model ailələri məlumat, parametr, post-training, model versiyası və evaluation protocol daxil olmaqla çoxsaylı başqa dəyişəndə də fərqlənir. Mənbə tədqiqatı bunu açıq şəkildə qəbul edərək analizlərin səbəblik deyil, “structured explanatory hypotheses” yaratdığını bildirir.

Alignment–efficiency çıxarımı niyə hipotez səviyyəsindədir?

Müəlliflər Claude-dakı Constitutional AI/RLAIF dərinliyinin daha az efficiency-optimized attention ilə birlikdə görünməsini, DeepSeek, Falcon və Gemini kimi attention səmərəliliyinə ağırlıq verən ailələrdə isə daha sadə uyğunlaşdırma xətlərinin istifadə edilməsini bir trade-off kimi şərh edirlər.

Lakin tədqiqatda “alignment depth” və “attention efficiency” üçün ortaq kəmiyyət skoru müəyyən edilməmiş; eyni model üzərində yalnız alignment və ya yalnız attention metodu dəyişdirilərək kontrollu ablasiya aparılmamışdır. Buna görə əlaqə tədqiqatın taksonomik müşahidəsidir; hesablama baxımından zərurət kimi sübut edilmiş deyil.

Context–routing çıxarımındakı mənbədaxili uyğunsuzluq

Pattern B-nin əsas cümləsi, 32K-dan böyük context window istifadə edən hər modelin sparse expert routing və ya selective state-space layer istifadə etdiyini irəli sürür.

Lakin eyni məqalənin öz müqayisə cədvəlində:

  • GPT-4o üçün 128K context,
  • Claude 2/3 üçün 100K–200K context

bildirilməsinə baxmayaraq bu ailələrin arxitektura izahlarında MoE və ya selective SSM routing verilmir.

Dolayısıyla “every >32K-context model” ümumiləşdirməsi mənbə daxilində tutarlı deyil. Bu Verianla məqaləsində sözügedən örüntü yalnız müəlliflərin təklif etdiyi hipotez kimi aktarılmışdır.

Açıq çəkili model yaxınlaşması

Tədqiqatın Pattern C çıxarımına görə LLaMA 2, Falcon və Qwen kimi açıq/açıq çəkili sistemlər RoPE və RMSNorm kimi yaxşı bilinən komponentlərin ətrafında daha çox qruplaşarkən qapalı modellər daha heterogen dizayn sahələrinə yayılır.

Müəlliflər bunu açıq model icmalarında yenidən istehsal edilə bilən və doğrulana bilən komponentlərin seçilməsi ilə əlaqələndirirlər. Lakin xüsusilə qapalı modellərin arxitektura ayrıntıları məhdud olduğu üçün qapalı sistemlərin real dizayn məkanının hamısı müşahidə edilə bilmir. Bu çıxarım da doğrulanmış səbəb mexanizmi kimi deyil, müqayisəli taksonomiya şərhi kimi qiymətləndirilməlidir.

İş dünyası və ictimai nəticələr

Tədqiqata görə LLM-lər sənəd hazırlama, kod istehsalı, məlumat analizi və müştəri dəstəyi kimi bilik intensiv işlərdə məhsuldarlıq potensialı daşıyarkən axıcı, lakin səhv məzmun istehsalı, insan nəzarətinin azalması və yanlış çıxışa həddindən artıq güvən kimi risklər yarada bilər.

Təhsildə fərdiləşdirilmiş geri bildirim imkanları akademik bütövlük və tənqidi düşünmə problemləri ilə birlikdə nəzərdən keçirilir. Aşağı resurslu dillərdəki performans fərqləri isə yalnız arxitekturanın deyil, məlumat əhatəsi və mədəni təmsilin də model davranışına təsir etdiyini göstərir.

Tədqiqatın gələcəyə yönəlik araşdırma başlıqları

  • Standartlaşdırılmış və yenidən istehsal edilə bilən LLM qiymətləndirməsi,
  • aşağı resurslu dillər və mədəni kontekstlərdə cross-lingual generalization,
  • uzun context və memory-augmented modellər,
  • state-space və attention–memory hibridləri,
  • model kartları, məlumat səhifələri və bias audit mexanizmləri,
  • red teaming və daha şəffaf təhlükəsizlik hesabatı,
  • hesablama və enerji xərclərinin azaldılması,
  • məlumat mənşəyi, əqli mülkiyyət, məxfilik və təmsil ədaləti.

Mənbə və Metod Qeydi

Tam özgün çalışma adıMapping the LLM Landscape: A Cross-Family Survey of Architectures, Alignment Methods, and Benchmark Performance
MüəlliflərDeepshikha Bhati; Fnu Neha; Devi Sri Bandaru; Matthew Weber; Ishan Dilipbhai Gajera
Müəllif sırası1. Deepshikha Bhati; 2. Fnu Neha; 3. Devi Sri Bandaru; 4. Matthew Weber; 5. Ishan Dilipbhai Gajera
Bərabər töhfə / bərabər birinci müəllifMənbə tədqiqatında bərabər töhfə və ya bərabər birinci müəllif bəyanı göstərilməmişdir.
Məsul müəllifDeepshikha Bhati
QurumDepartment of Computer Science, Kent State University, Kent, Ohio, ABŞ
Mənbə növüMüqayisəli icmal, arxitektura taksonomiyası və LLM model ailəsi araşdırması.
Rəyçilik vəziyyətiRəyli jurnalda yayımlanmış icmal məqaləsidir; preprint deyil.
JurnalAI
NəşriyyatMDPI
Cild / say / məqalə2026, 7(4), 142
DOI10.3390/ai7040142
Alınma tarixi11 Mart 2026
Reviziya tarixi7 Aprel 2026
Qəbul tarixi11 Aprel 2026
Yayın tarixi16 Aprel 2026
Rəsmi bağlantıhttps://doi.org/10.3390/ai7040142
LisenziyaCreative Commons Attribution (CC BY).

Tədqiqatın məlumat və analiz xarakteri

Bu tədqiqat yeni bir əsas LLM öyrətmir və yeddi model ailəsini ortaq hesablama infrastrukturu üzərində yenidən benchmark etmir. Əsas elmi məlumat mənbəyi ictimaiyyətə açıq texniki hesabatlar, system card-lar, model sənədləşməsi və benchmark mənbələridir.

Müəlliflər bu sənədlərdən 50-dən çox model arxitekturasını ortaq bir abstraksiya səviyyəsində yenidən qurmuş, xüsusiyyətlərini kodlaşdırmış və LLM Model Explorer tətbiqi daxilində yan-yana müqayisə edilə bilən hala gətirmişdir.

Məqalənin məlumat əlçatanlığı bəyanına görə analizdə istifadə olunan məlumatlar əsas mətn daxilində təqdim edilmişdir. Tədqiqatın hazırladığı LLM Model Explorer-in mənbə kodu və canlı göstərim ünvanları da məqalənin metod bölməsində paylaşılmışdır.

Maliyyələşdirmə

Tədqiqat Kent State University-nin Open Access APC Support Fund proqramı tərəfindən qismən dəstəklənmişdir.

Etik komitə və məlumatlandırılmış razılıq

Mənbə tədqiqatında Institutional Review Board və informed consent sahələri “Not applicable” kimi bildirilmişdir. Tədqiqat insan iştirakçılar üzərində yeni təcrübə və ya klinik məlumat toplama ehtiva etmir.

Maraqlar toqquşması

Müəlliflər maraqlar toqquşmasının olmadığını bildirmişdir.

Müəllif töhfələri

Konseptuallaşdırma: Deepshikha Bhati və Devi Sri Bandaru. Metodologiya: Deepshikha Bhati və Devi Sri Bandaru. Doğrulama: Deepshikha Bhati, Fnu Neha və Devi Sri Bandaru. Formal analiz: Deepshikha Bhati və Devi Sri Bandaru. Gözdən keçirmə və redaktə: Deepshikha Bhati, Fnu Neha, Devi Sri Bandaru, Matthew Weber və Ishan Dilipbhai Gajera.

Tədqiqatın əsas metodoloji məhdudiyyətləri

  • Model ailələri əvvəlcədən müəyyən edilmiş sistematik ədəbiyyat axtarışı protokolu yerinə sənədləşmə, müxtəliflik və əhəmiyyət meyarları ilə seçilmişdir.
  • Qapalı modellərin arxitektura və təlim ayrıntıları tam açıqlanmadığı üçün yenidən qurulan sxemlər yüksək səviyyəli abstraksiyalardır.
  • 50-dən çox arxitekturanın bütün implementation ayrıntıları müstəqil olaraq doğrulana bilən deyil.
  • Benchmark skorları tək bir ortaq evaluation harness istifadə edilərək yenidən hesablanmamışdır.
  • Bəzi benchmark sətirləri tək bir model yerinə bir ailədəki birdən çox variantı birlikdə təmsil edir.
  • Vendor-reported və independent benchmark nəticələrinin mənbəyi hüceyrə əsasında tək cədvəldə ayrılmamışdır.
  • Benchmark nəticələri prompting, model versiyası, tarix və qiymətləndirmə protokolu baxımından fərqlilik göstərə bilər.
  • Taksonomiya ölçüləri arasındakı əlaqələr müşahidəli/müqayisəlidir; kontrollu ablasiya təcrübəsi aparılmamışdır.
  • Architecture–benchmark əlaqələrindən səbəblik çıxarıla bilməz.
  • Alignment depth və attention efficiency üçün ortaq kəmiyyət indeksi müəyyən edilməmişdir.
  • “32K-dan uzun kontekstə malik bütün modellər expert routing istifadə edir” çıxarımı eyni məqalədəki GPT-4o və Claude context məlumatları ilə uyğun gəlmir.
  • Açıq çəkili modellərin RMSNorm + RoPE yaxınlaşmasına dair şərh ailə daxilindəki bütün model variantları üçün bərabər sənədləşmə səviyyəsinə əsaslanmır.
  • Mənbə tədqiqatı sürətlə dəyişən bir texnologiya sahəsini müəyyən bir tarix aralığında xəritələndirir; taksonomiya gələcək model nəsillərini avtomatik olaraq təmsil etmir.

Mənbədaxili kritik uyğunsuzluğun açıq qeydi

Mənbənin Pattern B çıxarımında “every model in our survey supporting context windows exceeding 32K tokens” üçün sparse expert routing və ya selective state-space yanaşmasının olduğu irəli sürülür. Buna qarşı eyni tədqiqatın müqayisə cədvəli GPT-4o üçün 128K və Claude 2/3 üçün 100K–200K context window verərkən bu iki ailə üçün sözügedən routing quruluşları göstərilmir. Buna görə universal xarakterli Pattern B cümləsi mənbə daxilindəki digər məlumatlarla tutarlı deyil.

Pattern A və benchmark performans izahları üçün də oxşar şəkildə səbəbi qətilik istifadə edilməməlidir. Tədqiqatın özü benchmark fərqlərini izah edərkən sözügedən analizlərin causality yaratmadığını bildirir.

Nəticə olaraq tədqiqatın ən güclü töhfəsi “hansı LLM ən yaxşıdır?” sualına qəti cavab verməsi deyil. Əsas töhfə böyük dil modeli ailələrinin arxitektura, təlim, alignment, context, multimodallıq və açıqlıq ölçülərini tək bir ortaq müqayisə çərçivəsinə yerləşdirməsi; model sənədlərindən yenidən qurulan arxitekturaları araşdırıla bilən bir taksonomiya və interaktiv alət halına gətirməsidir.

Bu Verianla mətnindəki elmi arxitektura izahları, müqayisə dəyərləri, çıxarımlar və məhdudiyyətlər yüklənən mənbə tədqiqatına əsaslanır. Biblioqrafik kimlik və rəyçilik vəziyyəti xaricində xarici mənbələrdən yeni LLM performans nəticəsi əsas elmi mətnə əlavə edilməmişdir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy