Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Bilgisayar Bilimi / Büyük Dil Modeli Ekosisteminin Haritalanması: Mimariler, Hizalama Yöntemleri ve Benchmark Performanslarının Model Aileleri Arası İncelemesi
Bilgisayar Bilimi

Büyük Dil Modeli Ekosisteminin Haritalanması: Mimariler, Hizalama Yöntemleri ve Benchmark Performanslarının Model Aileleri Arası İncelemesi

Büyük dil modelleri artık yalnızca daha fazla parametreye sahip metin üreticileri olarak gelişmiyor.

19/08/2026  Veri Anla 24 görüntüleme
Büyük Dil Modeli Ekosisteminin Haritalanması: Mimariler, Hizalama Yöntemleri ve Benchmark Performanslarının Model Aileleri Arası İncelemesi

Büyük dil modelleri artık yalnızca daha fazla parametreye sahip metin üreticileri olarak gelişmiyor. Güncel sistemler; dikkat mekanizmasının nasıl hesaplandığı, hangi uzmanların etkinleştirildiği, yüz binlerce veya milyonlarca token uzunluğundaki bağlamın nasıl işlendiği, görüntü–ses–video gibi farklı veri türlerinin nasıl birleştirildiği ve insan tercihleriyle güvenlik kurallarının modele nasıl aktarıldığı gibi çok sayıda mimari ve eğitim kararının birleşiminden oluşuyor. Bu derleme çalışması, GPT, LLaMA 2, Gemini, Claude, DeepSeek, Falcon ve Qwen olmak üzere yedi büyük LLM ailesini ortak bir taksonomi altında karşılaştırmayı amaçlıyor.

Araştırmacılar halka açık teknik raporlar, model kartları ve model belgelerinden yararlanarak 50'den fazla temsilî LLM mimarisini yeniden yapılandırmış; modelleri dikkat mekanizması, normalizasyon, konumsal kodlama, dense veya mixture-of-experts yönlendirme, bağlam yönetimi, eğitim stratejisi, hizalama ve multimodal yetenek gibi boyutlarda kodlamıştır. Çalışma ayrıca bu taksonomiyi etkileşimli olarak incelemek için açık kaynak kodlu bir LLM Model Explorer arayüzü sunmaktadır.

Makalenin karşılaştırmalı benchmark tablosunda GPT-4/GPT-4o ailesi MMLU'da %86,4 ve GSM8K'da %92,0; Gemini 1.5 HumanEval'da %74,9; Claude 3.x SWE-bench'te %49,0; DeepSeek ailesi GSM8K'da %89,4 ve SWE-bench'te %42,5 olarak listelenmiştir. Ancak bu rakamlar tek bir ortak benchmark koşusunda üretilmemiştir. Farklı model sürümleri, üretici raporları, leaderboard'lar, prompting yöntemleri ve değerlendirme protokollerinden derlenmiştir. Kaynak çalışma bu nedenle değerlerin gösterge niteliğinde olduğunu ve modeller arasında tam olarak doğrudan karşılaştırılamayacağını açıkça belirtmektedir.

Çalışmanın asıl katkısı belirli bir LLM'nin “kazanan” olduğunu ilan etmekten çok, modern büyük dil modellerinin hangi tasarım eksenlerinde birbirinden ayrıldığını görünür hâle getirmesidir. Derlemenin önerdiği başlıca eğilimler; daha verimli dikkat mekanizmalarına geçiş, uzun bağlam için modüler hesaplama arayışı, açık ağırlıklı modellerde RoPE ve RMSNorm gibi bileşenlerin yaygınlaşması, multimodal sistemlerin büyümesi ve RLHF, RLAIF veya Constitutional AI gibi hizalama yöntemlerinin model geliştirmede merkezi hâle gelmesidir.

Bununla birlikte taksonomiden türetilen bazı güçlü çıkarımlar deneysel olarak doğrulanmış mimari yasalar değildir. Özellikle “32K'dan uzun bağlama sahip bütün modeller sparse expert routing kullanır” çıkarımı çalışmanın kendi GPT-4o ve Claude bağlam tablolarıyla uyuşmamaktadır. Benchmark farklarını belirli mimari özelliklere bağlayan açıklamalar da kontrollü ablasyon deneylerinden değil, aileler arası gözlemsel karşılaştırmalardan türetilmiştir.

Çalışmanın kapsamıKaynakta bildirilen yapıNasıl yorumlanmalı?
LLM ailesi7GPT, LLaMA 2, Gemini, Claude, DeepSeek, Falcon ve Qwen
Yeniden oluşturulan mimari50+Teknik belge ve model kartlarından yüksek seviyede yeniden yapılandırılmıştır.
Temel karşılaştırma eksenleriMimari, eğitim, hizalama, bağlam, multimodalite, güvenlik, benchmarkOrtak bir taksonomi altında incelenmiştir.
Benchmark yöntemiİkincil kaynaklardan raporlanan sonuçlarOrtak deney ortamında yeniden ölçülmüş sonuçlar değildir.
Etkileşimli araçLLM Model ExplorerTaksonomideki özelliklerin model bazında karşılaştırılmasını sağlar.
Temel bilimsel sınırKontrollü nedensel mimari karşılaştırması yokTaksonomi ilişkileri hipotez üretir; nedenselliği kanıtlamaz.

Neden yalnız “kaç milyar parametre?” sorusu artık yeterli değil?

İlk büyük dil modeli kuşaklarında ölçek artışı başlıca ilerleme eksenlerinden biriydi. Çalışmanın tarihsel anlatımında GPT-2'nin 2019'daki büyük ölçekli ön eğitim yaklaşımından GPT-3'ün 175 milyar parametresine, daha sonra uzun bağlamlı ve multimodal modellerin ortaya çıkışına uzanan bir dönüşüm anlatılmaktadır.

Fakat araştırmacılara göre modern LLM tasarım alanı artık tek bir büyüklük eksenine indirgenemez. Aynı parametre sayısına yakın iki sistem; attention mekanizması, aktif uzman sayısı, normalizasyon yöntemi, konumsal kodlama, veri karışımı, instruction tuning, hizalama veya multimodal encoder yapısı nedeniyle çok farklı hesaplama ve davranış profilleri gösterebilir.

Çalışma hangi yedi model ailesini inceliyor?

Model ailesiKaynakta incelenen temsilî modellerÇalışmanın öne çıkardığı temel özellik
GPTGPT-2, GPT-3/3.5, GPT-4, GPT-4o, O1Decoder-only Transformer, büyük ölçekli ön eğitim, multimodalite ve RLHF
LLaMALLaMA, LLaMA 2, Code LLaMARoPE, GQA, RMSNorm ve açık ağırlıklı ekosistem
GeminiGemini 1.x ve Gemini 1.5Multimodalite, uzun bağlam ve kaynakta MoE olarak tanımlanan yapı
ClaudeClaude 2, Claude 3 ve 3.5 varyantlarıUzun bağlam, Constitutional AI ve RLAIF
DeepSeekDeepSeek-V2/V3 ve Reasoner/R1MLA, MoE ve reasoning odaklı eğitim
FalconFalcon 7B/40B/180B, Falcon 2, Falcon 3 ve MambaMulti-query/multigroup attention ve state-space varyantları
QwenQwen, Qwen2 ve Qwen-MaxRoPE, RMSNorm, SwiGLU, çok dillilik ve kod/matematik uzmanlaşması

Attention mekanizmaları neden farklılaşıyor?

Klasik Transformer'daki multi-head attention, her attention head için ayrı query, key ve value projeksiyonları kullanır. Büyük modellerde özellikle key–value önbelleği, uzun bağlam ve yüksek eşzamanlı kullanıcı yükü altında önemli bir bellek maliyetine dönüşür.

Çalışma bu soruna farklı ailelerin farklı çözümler getirdiğini vurgulamaktadır. LLaMA 2'de Grouped Query Attention (GQA), Falcon ve Qwen ailesinde multi-query veya multigroup attention, DeepSeek'te ise Multi-Head Latent Attention (MLA) gibi yaklaşımlar bu maliyeti azaltmayı hedeflemektedir.

DeepSeek'in MLA yaklaşımı, key–value temsillerini daha düşük boyutlu latent gösterimlere sıkıştırarak hesaplama ve depolama yükünü azaltmayı amaçlar. Falcon'un multi-query/multigroup yaklaşımı da key ve value projeksiyonlarının attention head'leri arasında daha fazla paylaşılması yoluyla KV-cache yükünü azaltmaya yöneliktir.

Mixture-of-Experts ne sağlıyor?

Mixture-of-Experts (MoE) yaklaşımında modelin bütün parametreleri her token için aynı anda etkinleştirilmez. Bir yönlendirme mekanizması girdiye göre belirli uzman alt ağlarını seçer. Böylece toplam model kapasitesi büyürken token başına aktif hesaplama toplam parametre sayısından daha düşük tutulabilir.

Kaynak çalışma bu yaklaşımı özellikle Gemini ve DeepSeek ailelerinin ölçeklenme ve uzun bağlam stratejileriyle ilişkilendirmektedir. DeepSeek-R1 için 671 milyar toplam parametreye karşı token başına yaklaşık 37 milyar aktif parametre bilgisi verilmektedir.

Ancak MoE'nin varlığı tek başına daha iyi reasoning, daha uzun bağlam veya daha yüksek benchmark performansının nedeni olarak kabul edilemez. Yönlendirme yöntemi, eğitim verisi, aktif uzman sayısı, attention mimarisi ve post-training süreci sonuçları birlikte etkiler.

Falcon Mamba neden farklı?

Falcon Mamba 7B, klasik self-attention yerine Mamba state-space modelini kullanması nedeniyle çalışmadaki önemli mimari ayrımlardan biridir. Kaynak, bunun uzun dizilerde doğrusal zamanlı işleme ve yaklaşık sabit bellek davranışı hedeflediğini belirtmektedir.

Falcon 3 ailesinde Transformer ve state-space yaklaşımlarının birlikte bulunması, modern LLM geliştirmesinin artık yalnız Transformer içindeki varyasyonlardan değil, attention dışı uzun-dizi mimarilerinden de oluştuğunu göstermektedir.

RMSNorm, RoPE ve SwiGLU neden sık görülüyor?

Çalışmanın taksonomisinde açık ağırlıklı model ailelerinin bir bölümünde üç bileşenin sık tekrarlandığı görülür: RMSNorm, Rotary Positional Embedding (RoPE) ve SwiGLU.

RMSNorm normalizasyon maliyetini sadeleştirirken; RoPE attention mekanizmasının içine göreli konum bilgisini taşır. SwiGLU ise gated aktivasyon yapısı kullanır. Çalışma LLaMA 2 ve Qwen'i bu bileşenlerin belirgin örnekleri olarak ele almaktadır.

Multimodal modellerde ne değişiyor?

Metin dışındaki görüntü, ses ve video bilgisini işlemek için modelin yalnız bir tokenizer ve dil decoder'ından ibaret olması yeterli değildir. Çalışmada Gemini, GPT-4o ve Claude 3 bu dönüşümün farklı örnekleri olarak incelenmektedir.

Gemini mimari şemasında farklı veri türlerinin modality-specific encoder'lar üzerinden işlenip cross-modal attention yoluyla ortak bir latent alana aktarılması gösterilmektedir. Çalışma GPT-4o'yu ise metin, kod, görüntü, ses ve video işleyebilen birleşik multimodal tasarım olarak ele almaktadır.

Hizalama: RLHF ne yapıyor?

Reinforcement Learning from Human Feedback (RLHF), önceden eğitilmiş modelin yalnız bir sonraki token olasılığını optimize etmek yerine, insan tercihleriyle daha uyumlu çıktılar vermesi için kullanılan post-training yöntemlerinden biridir.

Kaynak çalışma GPT-4, LLaMA 2, Claude, DeepSeek ve Qwen gibi ailelerde çeşitli supervised fine-tuning ve tercih optimizasyonu biçimlerinin kullanıldığını anlatmaktadır.

Bununla birlikte yazarlar RLHF'nin güvenliği kesin olarak çözmediğini vurgular. İnsan geri bildirimi pahalıdır; reward hacking ortaya çıkabilir; güvenlik eğitimi aşırı ret davranışına yol açabilir ve jailbreak ya da adversarial prompting riskleri tamamen ortadan kalkmaz.

Constitutional AI ve RLAIF nedir?

Claude ailesi, çalışmada alignment yaklaşımı açısından ayrı bir kategori olarak ele alınmaktadır. Constitutional AI'da modelin belirli ilkeler çerçevesinde kendi çıktısını eleştirmesi ve yeniden düzenlemesi amaçlanır. Reinforcement Learning from AI Feedback (RLAIF) ise insan değerlendirmesinin bir bölümünün AI tarafından sağlanan geri bildirimle desteklenmesini içerir.

Kaynak yazarları bu yaklaşımın insan anotasyonuna bağımlılığı azaltabileceğini, fakat AI geri bildiriminin model kaynaklı önyargıları yeniden üretme riski bulunduğunu belirtmektedir.

Taksonominin üç ana örüntüsü

Makale yedi model ailesini ortak boyutlara yerleştirdikten sonra üç çapraz-aile örüntüsü öneriyor.

Kaynağın örüntüsüKarşılaştırılan eksenlerYazarların çıkarımıVerianla yorum sınırı
A — Alignment–Efficiency DivergenceAlignment stratejisi × attention optimizasyonuDerin hizalama ile en ileri attention verimliliğinin aynı modelde birlikte görülmediği öne sürülüyor.Nicel olarak tanımlanmış iki eksende kontrollü performans testi değildir.
B — Context–Routing Co-AdoptionBağlam uzunluğu × expert routing>32K bağlamlı modellerin sparse/modüler routing kullandığı ileri sürülüyor.Kaynağın GPT-4o ve Claude tablolarıyla evrensel ifade uyuşmuyor.
C — Open-Weight ConvergenceAçıklık × normalizasyon × konumsal kodlamaAçık ağırlıklı modellerin RMSNorm + RoPE çevresinde kümelendiği öne sürülüyor.Model ailesi içindeki bütün varyantlar için aynı düzeyde teknik açıklık bulunmuyor.

Pattern B'deki iç tutarsızlık neden önemli?

Çalışmanın Pattern B metni, incelenen modeller içinde 32K'dan daha uzun context window sağlayan “her modelin” sparse expert routing veya selective state-space katmanları kullandığını ifade etmektedir.

Ancak aynı kaynakta bulunan karşılaştırma tablosu GPT-4/GPT-4o için 128K, Claude 2/3 için ise 100K–200K context window bildirmektedir. Bu iki ailenin ilgili mimari özetlerinde sparse MoE veya selective state-space routing belirtilmemektedir.

Bu nedenle kaynak içindeki veriler “uzun context ile modüler hesaplama arasında bazı ailelerde birlikte görülme” yorumunu destekleyebilir; fakat “32K'nın üzerindeki bütün modeller bunu kullanıyor” sonucunu kendi tabloları üzerinden desteklememektedir.

“Açık model” ile “açık kaynak” aynı şey mi?

Kaynak çalışmada modeller kapalı, açık ağırlıklı, kısmen açık veya araştırma lisanslı gibi farklı kategorilerde ele alınmaktadır. Bu ayrım önemlidir. Model ağırlıklarının yayımlanması; eğitim verisinin, tam eğitim kodunun, post-training hattının ve güvenlik sisteminin tamamının açık olduğu anlamına gelmez.

Bu nedenle çalışmadaki “open-source ecosystem” ifadesi okunurken her aile için gerçek açıklık düzeyinin farklı olabileceği dikkate alınmalıdır.

Benchmark sonuçları neden tek bir lig tablosu değildir?

Makalenin Tablo 2'si beş benchmark'ı yan yana verir: MMLU, HumanEval, GSM8K, SWE-bench ve MathVista. Fakat tablo hücrelerinin tamamı aynı model sürümü, aynı tarih, aynı prompting stratejisi veya aynı evaluation harness altında ölçülmemiştir.

Üstelik tablo bazı satırlarda tek bir modeli değil aile içindeki birden fazla varyantı birlikte temsil etmektedir: “GPT-4/GPT-4o”, “Claude 3.x (Opus/Sonnet)”, “Gemini 1.5 (Pro/Ultra)” veya “DeepSeek (V3/Reasoner)” gibi.

Dolayısıyla bir satırdaki MMLU skoru ile aynı satırdaki SWE-bench skorunun mutlaka aynı checkpoint veya aynı model varyantından geldiği varsayılmamalıdır.

Üretici ve bağımsız benchmark farkı

Çalışma, üreticiler tarafından raporlanan sonuçlarla bağımsız değerlendirmeler arasında farklar bulunabildiğini ve üretici skorlarının MMLU'da yaklaşık 2–8 yüzde puanı, GPQA-Diamond ve SWE-bench gibi daha yeni benchmark'larda bazı durumlarda yaklaşık 10–15 puan daha yüksek olabildiğini ifade etmektedir.

Yazarlar bunun prompting yöntemi, değerlendirme yazılımı, model sürümü ve olası evaluation-set contamination gibi etkenlerden kaynaklanabileceğini belirtmektedir. Bununla birlikte bu 2–8 ve 10–15 puanlık farkları oluşturan tüm eşleştirilmiş ölçümlerin ham veri tablosu makalede sunulmamaktadır. Bu nedenle bu aralıklar bağımsız bir meta-analiz sonucu olarak değerlendirilmemelidir.

Çalışmanın desteklediği sonuçlar

  • Modern LLM aileleri aynı temel Transformer kökeninden gelseler de attention, normalizasyon, routing, context, multimodalite ve alignment boyutlarında önemli ölçüde farklılaşmaktadır.
  • GQA, MQA, MLA, FlashAttention, MoE ve state-space yaklaşımları büyük ölçekli modellerde verimlilik ve uzun-dizi işleme sorunlarına yönelik farklı teknik çözümler sunmaktadır.
  • RLHF tek alignment yaklaşımı değildir; Constitutional AI ve RLAIF gibi alternatif veya tamamlayıcı yaklaşımlar da kullanılmaktadır.
  • Açık ağırlıklı ve kapalı model geliştirme ekosistemleri şeffaflık, yeniden üretilebilirlik, maliyet ve güvenlik mühendisliği bakımından farklı ödünleşimler içerir.
  • Model seçimi yalnız benchmark skoruna değil kullanım alanı, context ihtiyacı, multimodalite, maliyet, güvenlik ve dağıtım koşullarına göre yapılmalıdır.
  • Benchmark sonuçlarının model sürümü ve değerlendirme protokolü bilgisi olmadan doğrudan karşılaştırılması güvenilir değildir.

Çalışmanın kanıtlamadığı sonuçlar

  • Her görev için tek bir LLM ailesinin mutlak olarak en iyi olduğu kanıtlanmamıştır.
  • Tablo 2 değerleri ortak kontrollü deneyde elde edilmiş başa baş model karşılaştırması değildir.
  • Bir benchmark farkının yalnız bir attention mekanizması, MoE veya alignment yöntemi tarafından oluşturulduğu kanıtlanmamıştır.
  • Constitutional AI'ın attention verimliliğiyle zorunlu fiziksel bir trade-off oluşturduğu deneysel olarak gösterilmemiştir.
  • Uzun context için sparse expert routing'in zorunlu koşul olduğu kaynak verileriyle kanıtlanmamaktadır.
  • Açık ağırlıklı modellerin kapalı modellerden genel olarak daha güvenli veya daha güvensiz olduğu sonucuna varılamaz.
  • Benchmark'taki yüksek performans gerçek dünya güvenilirliği, factuality veya güvenli kullanım garantisi değildir.

Türkiye açısından ne ifade ediyor?

Çalışma Türkiye'ye özgü bir LLM karşılaştırması yapmamaktadır ve Türkçe benchmark sonuçlarını ayrı bir deney grubu olarak sunmamaktadır. Bu nedenle tabloda yüksek sonuç gösteren bir modelin Türkçe hukuk, sağlık, eğitim, sanayi veya kamu uygulamalarında aynı performansı göstereceği varsayılamaz.

Türkiye'deki bir kuruluş için model seçimi yapılacaksa bu taksonomi mimari ön eleme aracı olarak kullanılabilir; ancak Türkçe dil performansı, alan terminolojisi, veri yerleşimi, kişisel verilerin korunması, gecikme, maliyet, kurum içi barındırma gereksinimleri ve yerel kullanım senaryoları ayrıca test edilmelidir. Bu yerel doğrulama, kaynak çalışmanın gerçekleştirdiği analiz değildir.

Çalışmanın Yöntemi ve Bulguları

Bu çalışma klasik sistematik derleme mi?

Makale kapsamlı bir derleme ve taksonomi çalışmasıdır; ancak kaynak metinde PRISMA benzeri bir sistematik literatür tarama protokolü, önceden belirlenmiş veri tabanı arama dizileri, dahil etme/dışlama akış şeması veya çalışma kalitesi meta-analizi sunulmamaktadır.

Yazarlar model seçimini üç ölçüte dayandırmaktadır:

  1. teknik dokümantasyonun bulunabilirliği,
  2. mimari çeşitlilik,
  3. araştırma ve endüstriyel kullanım açısından önem.

Bu ölçütlerle GPT, LLaMA 2, Gemini, Claude, DeepSeek, Falcon ve Qwen aileleri seçilmiştir.

Mimariler nasıl yeniden oluşturuldu?

Yazarlar modellerin mimari şemalarını kamuya açık teknik raporlar, system card'lar ve model dokümantasyonlarından yeniden oluşturmuştur. Özellikle kapalı sistemlerin implementation ayrıntıları yayımlanmadığı için şemalar yüksek seviyede ve ortak soyutlama düzeyinde tutulmuştur.

Değerlendirilen başlıca mimari boyutlar şunlardır:

  • Multi-Head Attention (MHA), Grouped Query Attention (GQA), Multi-Query Attention (MQA) ve Multi-Head Latent Attention (MLA),
  • LayerNorm ve RMSNorm,
  • dense ve mixture-of-experts routing,
  • context handling ve positional encoding,
  • alignment ve training pipeline'ları.

Taksonomi nasıl oluşturuldu?

Her model kategorik ve sayısal özelliklerden oluşan bir özellik vektörüyle temsil edilmiştir. Çalışma, yalnız açık dokümantasyonda bulunan özelliklerin kodlandığını ve bilgi belirsiz olduğunda aşırı ayrıntılandırmadan kaçınmak için “conservative labeling” uygulandığını belirtmektedir.

Ardından taksonomi boyutları ikili veya çoklu ilişkiler üzerinden karşılaştırılmıştır. Örneğin alignment yöntemi attention verimliliğiyle; context length expert routing ile; model açıklığı normalizasyon ve positional encoding ile birlikte incelenmiştir.

Verianla Live: LLM taksonomisinin oluşturulma süreci

Bu süreç kaynak çalışmanın 3.1 bölümündeki metodolojiye dayanır. “Sonuç” aşamasındaki yapısal örüntüler kontrollü deneysel nedensellik değil, karşılaştırmalı taksonomiden türetilmiş çıkarımlardır.

AşamaKaynak çalışmadaki işlem
1. Model ailesi seçimiDokümantasyon, mimari çeşitlilik ve araştırma/endüstri önemi ölçütleriyle yedi aile seçildi.
2. Teknik kaynakların toplanmasıTeknik raporlar, system card'lar ve model dokümantasyonu kullanıldı.
3. Mimari yeniden yapılandırma50'den fazla temsilî mimari ortak bir soyutlama düzeyinde yeniden oluşturuldu.
4. Özellik kodlamaAttention, normalizasyon, routing, context, positional encoding, training ve alignment boyutları kodlandı.
5. Çapraz-aile karşılaştırmasıTaksonomi boyutlarının ikili ve çoklu ilişkileri incelendi.
6. Benchmark ile ilişkilendirmeTaksonomi örüntüleri kaynaklarda raporlanan benchmark sonuçlarıyla karşılaştırıldı.
7. Hipotez üretimiAlignment–efficiency, context–routing ve open-weight convergence örüntüleri önerildi.
 

Kaynağın benchmark tablosu

Aşağıdaki değerler makalenin Tablo 2'sinden aktarılmıştır. Kaynak çalışmanın kendi uyarısı korunmalıdır: sonuçlar farklı kaynak ve protokollerden geldiği için kesin ve doğrudan model sıralaması değildir.

Model ailesiMMLU (%)HumanEval Pass@1 (%)GSM8K (%)SWE-bench Pass@1 (%)MathVista (%)
GPT-4 / GPT-4o86,467,092,033,263,8
Claude 3.x (Opus/Sonnet)82,160,188,049,060,5
Gemini 1.5 (Pro/Ultra)81,974,987,835,059,2
LLaMA 2 (70B)68,948,156,818,044,1
Falcon (180B/Falcon 2)66,545,255,415,341,6
DeepSeek (V3/Reasoner)79,872,689,442,561,2
Qwen (Qwen2/Qwen-Max)78,565,383,736,458,1

Verianla Live: Kaynak çalışmadaki beş benchmark üzerinden model aileleri

Grafiğin bilimsel source-of-truth verisi aşağıdaki görünür tablodur. Benchmark'lar farklı becerileri ölçer ve sonuçlar tek bir ortak değerlendirme koşusunda elde edilmemiştir. Grafik yalnız kaynak Tablo 2'deki raporlanan değerlerin keşif amaçlı görsel karşılaştırmasıdır.

Model ailesiMMLU (%)HumanEval (%)GSM8K (%)SWE-bench (%)MathVista (%)
GPT-4 / GPT-4o86,467,092,033,263,8
Claude 3.x82,160,188,049,060,5
Gemini 1.581,974,987,835,059,2
LLaMA 268,948,156,818,044,1
Falcon66,545,255,415,341,6
DeepSeek79,872,689,442,561,2
Qwen78,565,383,736,458,1
 

Önemli: Buradaki değerler “hangi LLM kesin en iyidir?” sorusuna cevap veren kontrollü başa baş deney değildir.

Benchmark'ların anlamı

BenchmarkÇalışmadaki kullanım amacı
MMLUFarklı bilgi ve problem alanlarında genel dil modeli performansı
HumanEvalProgramlama/kod üretimi performansı
GSM8KMatematiksel sözel problem çözme
SWE-benchGerçek yazılım mühendisliği problemleri üzerinde kodlama yeteneği
MathVistaGörsel ve matematiksel muhakemenin birleştiği görevler

Model ailelerinin context ve multimodalite karşılaştırması

AileKaynakta bildirilen contextMultimodal yapıHizalama / güvenlik
GPT-4 / GPT-4o128K GPT-4oMetin, görüntü, ses, videoSFT, RLHF, PPO, moderasyon ve içerik filtreleri
GPT-O18K–32KMetinSFT, RLHF ve reasoning odaklı ödül modelleri
LLaMA 24KMetinSFT, RLHF, Ghost Attention ve safety reward modelleri
Gemini 1.51M'a kadarMetin, görüntü, ses, video, kodRLHF, expert gating ve moderasyon
Claude 2/3100K–200KMetin; Claude 3'te görüntüConstitutional AI, RLAIF, self-critique ve red teaming
Falcon4K–32KTemel aile metin; Falcon 2'de VLM varyantıSafety classifier ve LoRA tabanlı hizalama
DeepSeek R1/V332K–128KÇalışmada esas olarak metinGRPO, SFT, sentetik veri, rejection sampling
Qwen32K+Çalışmanın karşılaştırma tablosunda metinSFT, RLHF, preference optimization ve bias mitigation

Taksonominin benchmark farklarına getirdiği açıklama

Kaynak çalışmanın Tablo 6'sı üç örnek benchmark farkını mimari boyutlarla ilişkilendirmektedir:

BenchmarkAile AAile BSkor farkıKaynağın ilişkilendirdiği taksonomi boyutları
GSM8KDeepSeek-V3: %89,4LLaMA 2: %56,8+32,6 yüzde puanıMLA/GQA, MTP/next-token prediction, rejection-sampled RL/Ghost Attention RLHF
SWE-benchClaude 3.x: %49,0GPT-4o: %33,2+15,8 yüzde puanıConstitutional AI + RLAIF/RLHF-PPO ve 200K/128K context
HumanEvalGemini 1.5: %74,9LLaMA 2: %48,1+26,8 yüzde puanıMoE/dense Transformer ve 1M/4K context

Bu tablo doğrudan mekanizma testi değildir. Her karşılaştırmada model aileleri veri, parametre, post-training, model sürümü ve evaluation protocol dahil çok sayıda başka değişkende de farklılaşmaktadır. Kaynak çalışma bunu açıkça kabul ederek analizlerin nedensellik değil “structured explanatory hypotheses” oluşturduğunu belirtmektedir.

Alignment–efficiency çıkarımı neden hipotez düzeyinde?

Yazarlar Claude'daki Constitutional AI/RLAIF derinliğinin daha az efficiency-optimized attention ile birlikte görülmesini, DeepSeek, Falcon ve Gemini gibi attention verimliliğine ağırlık veren ailelerde ise daha basit hizalama hatlarının kullanılmasını bir trade-off olarak yorumlamaktadır.

Fakat çalışmada “alignment depth” ve “attention efficiency” için ortak nicel skor tanımlanmamış; aynı model üzerinde yalnız alignment veya yalnız attention yöntemi değiştirilerek kontrollü ablasyon yapılmamıştır. Bu nedenle ilişki çalışmanın taksonomik gözlemidir; hesaplamalı zorunluluk olarak kanıtlanmış değildir.

Context–routing çıkarımındaki kaynak içi uyuşmazlık

Pattern B'nin temel cümlesi, 32K'dan büyük context window kullanan her modelin sparse expert routing veya selective state-space layer kullandığını öne sürmektedir.

Fakat aynı makalenin kendi karşılaştırma tablosunda:

  • GPT-4o için 128K context,
  • Claude 2/3 için 100K–200K context

bildirilmesine rağmen bu ailelerin mimari açıklamalarında MoE veya selective SSM routing verilmemektedir.

Dolayısıyla “every >32K-context model” genellemesi kaynak içinde tutarlı değildir. Bu Verianla makalesinde söz konusu örüntü yalnız yazarların önerdiği hipotez olarak aktarılmıştır.

Açık ağırlıklı model yakınsaması

Çalışmanın Pattern C çıkarımına göre LLaMA 2, Falcon ve Qwen gibi açık/açık ağırlıklı sistemler RoPE ve RMSNorm gibi iyi bilinen bileşenlerin çevresinde daha fazla kümelenirken kapalı modeller daha heterojen tasarım alanlarına yayılmaktadır.

Yazarlar bunu açık model topluluklarında yeniden üretilebilir ve doğrulanabilir bileşenlerin tercih edilmesiyle ilişkilendirmektedir. Ancak özellikle kapalı modellerin mimari ayrıntıları sınırlı olduğu için kapalı sistemlerin gerçek tasarım uzayının tamamı gözlemlenemez. Bu çıkarım da doğrulanmış nedensel mekanizma olarak değil karşılaştırmalı taksonomi yorumu olarak değerlendirilmelidir.

İş dünyası ve toplumsal sonuçlar

Çalışmaya göre LLM'ler doküman hazırlama, kod üretimi, veri analizi ve müşteri desteği gibi bilgi yoğun işlerde üretkenlik potansiyeli taşırken akıcı fakat hatalı içerik üretimi, insan denetiminin azalması ve yanlış çıktıya aşırı güven gibi riskler oluşturabilir.

Eğitimde kişiselleştirilmiş geri bildirim fırsatları akademik bütünlük ve eleştirel düşünme sorunlarıyla birlikte ele alınmaktadır. Düşük kaynaklı dillerdeki performans farklılıkları ise yalnız mimarinin değil veri kapsamı ve kültürel temsilin de model davranışını etkilediğini göstermektedir.

Çalışmanın geleceğe yönelik araştırma başlıkları

  • Standartlaştırılmış ve yeniden üretilebilir LLM değerlendirmesi,
  • düşük kaynaklı diller ve kültürel bağlamlarda cross-lingual generalization,
  • uzun context ve memory-augmented modeller,
  • state-space ve attention–memory hibritleri,
  • model kartları, veri sayfaları ve bias audit mekanizmaları,
  • red teaming ve daha şeffaf güvenlik raporlaması,
  • hesaplama ve enerji maliyetlerinin azaltılması,
  • veri kökeni, fikrî mülkiyet, gizlilik ve temsil adaleti.

Kaynak ve Yöntem Notu

Tam özgün çalışma adıMapping the LLM Landscape: A Cross-Family Survey of Architectures, Alignment Methods, and Benchmark Performance
YazarlarDeepshikha Bhati; Fnu Neha; Devi Sri Bandaru; Matthew Weber; Ishan Dilipbhai Gajera
Yazar sırası1. Deepshikha Bhati; 2. Fnu Neha; 3. Devi Sri Bandaru; 4. Matthew Weber; 5. Ishan Dilipbhai Gajera
Eş katkı / eş birinci yazarKaynak çalışmada eş katkı veya eş birinci yazar beyanı belirtilmemiştir.
Sorumlu yazarDeepshikha Bhati
KurumDepartment of Computer Science, Kent State University, Kent, Ohio, ABD
Kaynak türüKarşılaştırmalı derleme, mimari taksonomi ve LLM model ailesi incelemesi.
Hakemlik durumuHakemli dergide yayımlanmış derleme makalesidir; preprint değildir.
DergiAI
YayıneviMDPI
Cilt / sayı / makale2026, 7(4), 142
DOI10.3390/ai7040142
Alınma tarihi11 Mart 2026
Revizyon tarihi7 Nisan 2026
Kabul tarihi11 Nisan 2026
Yayın tarihi16 Nisan 2026
Resmî bağlantıhttps://doi.org/10.3390/ai7040142
LisansCreative Commons Attribution (CC BY).

Çalışmanın veri ve analiz niteliği

Bu çalışma yeni bir temel LLM eğitmemekte ve yedi model ailesini ortak hesaplama altyapısında yeniden benchmark etmemektedir. Temel bilimsel veri kaynağı kamuya açık teknik raporlar, system card'lar, model dokümantasyonu ve benchmark kaynaklarıdır.

Yazarlar bu belgelerden 50'den fazla model mimarisini ortak bir soyutlama düzeyinde yeniden oluşturmuş, özelliklerini kodlamış ve bir LLM Model Explorer uygulaması içinde yan yana karşılaştırılabilir hâle getirmiştir.

Makalenin veri erişilebilirliği beyanına göre analizde kullanılan veriler ana metin içinde sunulmuştur. Çalışmanın geliştirdiği LLM Model Explorer'ın kaynak kodu ve canlı gösterim adresleri de makalenin yöntem bölümünde paylaşılmıştır.

Finansman

Çalışma, Kent State University'nin Open Access APC Support Fund programı tarafından kısmen desteklenmiştir.

Etik kurul ve bilgilendirilmiş onam

Kaynak çalışmada Institutional Review Board ve informed consent alanları “Not applicable” olarak bildirilmiştir. Çalışma insan katılımcılar üzerinde yeni deney veya klinik veri toplama içermemektedir.

Çıkar çatışması

Yazarlar çıkar çatışması bulunmadığını bildirmiştir.

Yazar katkıları

Kavramsallaştırma: Deepshikha Bhati ve Devi Sri Bandaru. Metodoloji: Deepshikha Bhati ve Devi Sri Bandaru. Doğrulama: Deepshikha Bhati, Fnu Neha ve Devi Sri Bandaru. Biçimsel analiz: Deepshikha Bhati ve Devi Sri Bandaru. Gözden geçirme ve düzenleme: Deepshikha Bhati, Fnu Neha, Devi Sri Bandaru, Matthew Weber ve Ishan Dilipbhai Gajera.

Çalışmanın temel yöntemsel sınırlılıkları

  • Model aileleri önceden tanımlanmış sistematik literatür tarama protokolü yerine dokümantasyon, çeşitlilik ve önem ölçütleriyle seçilmiştir.
  • Kapalı modellerin mimari ve eğitim ayrıntıları tam açıklanmadığından yeniden oluşturulan şemalar yüksek seviyeli soyutlamalardır.
  • 50'den fazla mimarinin tüm implementation ayrıntıları bağımsız olarak doğrulanabilir değildir.
  • Benchmark skorları tek bir ortak evaluation harness kullanılarak yeniden hesaplanmamıştır.
  • Bazı benchmark satırları tek bir model yerine bir ailedeki birden fazla varyantı birlikte temsil etmektedir.
  • Vendor-reported ve independent benchmark sonuçlarının kaynağı hücre bazında tek tabloda ayrıştırılmamıştır.
  • Benchmark sonuçları prompting, model sürümü, tarih ve değerlendirme protokolü açısından farklılık gösterebilir.
  • Taksonomi boyutları arasındaki ilişkiler gözlemsel/karşılaştırmalıdır; kontrollü ablasyon deneyi yapılmamıştır.
  • Architecture–benchmark ilişkilerinden nedensellik çıkarılamaz.
  • Alignment depth ve attention efficiency için ortak nicel indeks tanımlanmamıştır.
  • “32K'dan uzun bağlama sahip bütün modeller expert routing kullanır” çıkarımı, aynı makaledeki GPT-4o ve Claude context bilgileriyle uyuşmamaktadır.
  • Açık ağırlıklı modellerin RMSNorm + RoPE yakınsamasına ilişkin yorum aile içindeki bütün model varyantları için eşit dokümantasyon düzeyine dayanmamaktadır.
  • Kaynak çalışma hızlı değişen bir teknoloji alanını belirli bir tarih aralığında haritalamaktadır; taksonomi gelecekteki model kuşaklarını otomatik olarak temsil etmez.

Kaynak içi kritik tutarsızlığın açık kaydı

Kaynağın Pattern B çıkarımında “every model in our survey supporting context windows exceeding 32K tokens” için sparse expert routing veya selective state-space yaklaşımı bulunduğu ileri sürülmektedir. Buna karşın aynı çalışmanın karşılaştırma tablosu GPT-4o için 128K ve Claude 2/3 için 100K–200K context window verirken bu iki aile için söz konusu routing yapıları belirtilmemektedir. Bu nedenle evrensel nitelikteki Pattern B cümlesi kaynak içindeki diğer bilgilerle tutarlı değildir.

Pattern A ve benchmark performans açıklamaları için de benzer biçimde nedensel kesinlik kullanılmamalıdır. Çalışmanın kendisi benchmark farklarını açıklarken söz konusu analizlerin causality oluşturmadığını belirtmektedir.

Sonuç olarak araştırmanın en güçlü katkısı “hangi LLM en iyidir?” sorusuna kesin cevap vermesi değildir. Esas katkı, büyük dil modeli ailelerinin mimari, eğitim, alignment, context, multimodalite ve açıklık boyutlarını tek bir ortak karşılaştırma çerçevesine yerleştirmesi; model belgelerinden yeniden oluşturulan mimarileri incelenebilir bir taksonomi ve etkileşimli araç hâline getirmesidir.

Bu Verianla metnindeki bilimsel mimari açıklamalar, karşılaştırma değerleri, çıkarımlar ve sınırlılıklar yüklenen kaynak çalışmaya dayanmaktadır. Bibliyografik kimlik ve hakemlik durumu dışında dış kaynaklardan yeni LLM performans sonucu ana bilimsel metne eklenmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy