Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Matematik / Faz Geçişleriyle Ortaya Çıkış: Yapay Zekâ, Evrim ve Fizikte Ortak Yakınsama Mekanizması Arayışı
Matematik

Faz Geçişleriyle Ortaya Çıkış: Yapay Zekâ, Evrim ve Fizikte Ortak Yakınsama Mekanizması Arayışı

Çalışmanın temel problemi, bilimde uzun zamandır ayrı ayrı tartışılan bazı yakınsama olaylarının ortak bir matematiksel açıklamaya sahip olup olamayacağıdır. Yapay zekâda farklı mimarilerle veya farklı başlangıç koşullarıyla eğitilen modellerin benzer temsiller geliştirmesi, yalnızca pratik bir mühendislik gözlemi değildir.

29/06/2026  Veri Anla 40 görüntüleme
Faz Geçişleriyle Ortaya Çıkış: Yapay Zekâ, Evrim ve Fizikte Ortak Yakınsama Mekanizması Arayışı

Çalışmanın temel problemi, bilimde uzun zamandır ayrı ayrı tartışılan bazı yakınsama olaylarının ortak bir matematiksel açıklamaya sahip olup olamayacağıdır. Yapay zekâda farklı mimarilerle veya farklı başlangıç koşullarıyla eğitilen modellerin benzer temsiller geliştirmesi, yalnızca pratik bir mühendislik gözlemi değildir. Eğer gerçekten farklı modeller aynı tür iç yapılara yaklaşıyorsa, bu durum “öğrenilen temsil”in yalnızca rastgele eğitim sürecinin ürünü olmadığını, sistemin kısıtları tarafından yönlendirilen daha derin bir yapı olabileceğini düşündürür.

İkinci problem grokking davranışıdır. Grokking, bir modelin önce eğitim verisini ezberlemesi, uzun süre test verisinde başarısız kalması, sonra aniden genelleme yapmaya başlamasıdır. Günlük bir benzetmeyle, bir öğrencinin önce bütün örnekleri ezberleyip problemi gerçekten anlamaması, fakat uzun bir bekleme döneminden sonra bir anda “kuralı kavraması” gibidir. Yapay zekâ bağlamında bu süreç daha teknik bir anlama sahiptir: modelin ezberleme devresinden genelleme devresine geçtiği düşünülür.

Üçüncü problem biyolojiden gelir. Farklı evrimsel soyların, uzun bağımsız evrimsel geçmişlere rağmen benzer metabolik çözümlere ulaşması, klasik anlamda “ortak seçilim baskısı” ile açıklanabilir; ancak çalışma, bunun nicel ve yapısal olarak neden bu kadar sık ve belirli biçimlerde gerçekleştiğinin daha genel bir çerçeveyle ele alınabileceğini savunur.

Çalışmanın ana önerisi bu üç gözlemi tek bir ilkeye bağlamaktır: sistemlerde rakip mekanizmalar vardır; bu mekanizmalar enerji, entropi, bilgi ve fiziksel uygunluk gibi kısıtlar altında yarışır; enerji bütçesi kritik bir eşik olan Ec çevresinde değiştiğinde sistem, çoklu olasılık alanından daha dar ve kararlı bir çözüme doğru geçer.

Bu fikri anlamak için faz geçişi kavramı önemlidir. Fizikte suyun buza dönüşmesi veya mıknatıslanmada düzenin ortaya çıkması gibi olaylarda sistem yavaş yavaş değişiyor gibi görünürken belirli bir eşikte niteliksel bir dönüşüm yaşanır. Çalışma, grokking gibi yapay zekâ olaylarını da bu tür bir geçişe benzetir: model bir süre ezberleme ve genelleme mekanizmaları arasında rekabet eder, sonra belirli bir noktada genelleme mekanizması baskın hale gelir.

HEF’in matematiksel çekirdeği şu tuple ile verilir:

\[ H = (R^{(1)}, L, A_0, G, mode, E) \]

Bu ifadedeki değişkenler şöyle açıklanabilir:

  • R(1): Sistemin başlangıç düzeyindeki ilkel elemanlarını ifade eder. Makine öğrenmesinde bunlar token embeddingleri olabilir; biyolojide prebiotik moleküller; fizikte alanın Fourier modları olabilir.
  • L: Bu ilkel elemanlardan mantıksal ifadeler kurmaya yarayan dildir. Çalışmada atomik ifadeler, fiziksel negasyon, uygun birleşimler, ayrışımlar, çıkarımlar ve nedensel sıralamalar bu dilin parçalarıdır.
  • A0: Başlangıçta kullanılabilen mekanizma kümesidir.
  • G: Yeni mekanizma indeksleri üretebilen üretim kuralıdır.
  • mode: Sistemin kontrollü mü yoksa kendi kendine yeni mekanizmalar üretebilen bir modda mı çalıştığını belirtir.
  • E: Enerji bütçesidir. Çalışmada ortaya çıkış ve yakınsama davranışının merkezinde bu büyüklük bulunur.

HEF yalnızca bu altılı yapıdan oluşmaz. Çalışmada ayrıca fiziksel kısıt seti şu şekilde tanımlanır:

\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]

Burada Pthermo termodinamik kısıtları, Pinfo bilgi kuramsal kısıtları, Φ ise bu iki kısıt alanı arasında kurulan çeviri haritasını temsil eder. Çalışmanın iddiasına göre termodinamik kısıtlarla bilgi kuramsal kısıtlar birbirinden kopuk değildir; Landauer İlkesi ve Jarzynski Eşitliği gibi fiziksel ilkeler aracılığıyla ilişkilendirilebilir.

Termodinamik tarafta üç temel kısıt verilir:

  • P1: Enerjinin korunumu. Toplam enerji değişimi sıfır olmalıdır.
  • P2: İkinci yasa. Toplam entropi azalmamalıdır.
  • P3: Pozitif sıcaklık. Sistem T > 0 koşulunda değerlendirilir.

Bilgi kuramı tarafında ise üç karşılık bulunur:

  • P4: Karşılıklı bilgi sınırı. İki değişken arasındaki karşılıklı bilgi, bu değişkenlerin tekil entropilerinden büyük olamaz.
  • P5: Koşullu entropinin negatif olmaması. Bir değişkenin başka bir değişken bilindiğinde kalan belirsizliği negatif olamaz.
  • P6: Veri İşleme Eşitsizliği yani Data Processing Inequality. Bir bilgi akışı zincirinde işlenmiş temsil, ilk kaynaktan daha fazla bilgi yaratamaz.

Çalışmada kullanılan önemli temel ilişkilerden biri Landauer İlkesiyle bağlantılıdır. Çalışmanın mantığını açıklamak için şu ilişki öne çıkar:

\[ W \geq k_B T \ln 2 \cdot \Delta H \]

Burada W, bilgi silme ya da bilgi işlem süreci için gereken minimum işi; kB, Boltzmann sabitini; T, sıcaklığı; ΔH, silinen veya değiştirilen bilgi miktarını ifade eder. Bu ilişki, bilginin fiziksel maliyeti olduğunu anlatır. Günlük dille söylersek, bir bilgisayarda bilgiyi işlemek “bedava” değildir; fiziksel dünyada bunun enerji ve entropi karşılığı vardır.

Çalışmada mekanizma maliyeti şu biçimde tanımlanır:

\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]

Bu formülde α, bir mekanizma indeksidir. φ, mantıksal dilde oluşturulan bir formüldür. ΔEα(φ), mekanizmanın uygulandığı formülde enerji değişimini; ΔHα(φ), bilgi içeriği değişimini; Eμ ise kanonik fiziksel ölçü altında beklenen değeri ifade eder. Bu formül, bir mekanizmanın yalnızca “ne ürettiğini” değil, bunu hangi fiziksel-bilgisel maliyetle yaptığını ölçmeye çalışır.

Enerji bütçesine göre izin verilen mekanizmalar şu şekilde yazılır:

\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]

Burada A*, fiziksel olarak kabul edilebilir mekanizmalar kümesidir. A*(E) ise enerji bütçesi E altında gerçekten kullanılabilir olan alt kümedir. Bu ifade, HEF’in ana sezgisini çok net gösterir: Her mekanizma teorik olarak mümkün olsa bile, enerji bütçesi onu karşılamıyorsa sistemin gerçek davranışına katılamaz.

Çalışmadaki kritik eşik Ec burada devreye girer. Ec, mekanizma çeşitliliği ile yakınsama arasındaki kırılma noktası olarak sunulur. E yüksek olduğunda birden fazla mekanizma rekabet edebilir. Bu durum keşif rejimine benzer: sistem birçok olası yolu dener, temsil yapıları karışık ve gürültülü olabilir. E, Ec eşiğinin altına indiğinde ise yalnızca en düşük maliyetli mekanizma baskın hale gelir; sistem tekil bir sabit noktaya doğru yakınsar.

Bu durum çalışmada Energy-Diversity Trade-off, yani enerji-çeşitlilik dengesi olarak ele alınır. Enerji arttıkça daha fazla mekanizma erişilebilir hale gelir; ancak belirli koşullarda düşük enerji rejimi, sistemi daha güçlü bir yakınsamaya iter. Bu fikir ilk bakışta ters gelebilir. Çünkü günlük hayatta daha fazla enerji daha fazla imkân gibi düşünülür. Fakat burada mesele, sistemin hangi mekanizmaları “karşılayabildiği” ve bu mekanizmaların nasıl rekabet ettiğidir. Bazı durumlarda fazla mekanizma, daha fazla çeşitlilik ama daha az kararlılık anlamına gelebilir; düşük enerji ise seçenekleri azaltarak tek bir kararlı çözüme yönlendirebilir.

Çalışmada sabit nokta yakınsaması Banach Sabit Nokta Teoremiyle ilişkilendirilir. Basitleştirilmiş haliyle, eğer bir dönüşüm her uygulandığında noktaları birbirine daha çok yaklaştırıyorsa, sistem sonunda tek bir sabit noktaya yakınsar. Çalışmadaki metrik daralma fikri şu tür bir ilişkiyle ifade edilebilir:

\[ d_H(T_k(R_1), T_k(R_2)) \leq c_{\alpha^*} \cdot d_H(R_1, R_2), \quad 0 < c_{\alpha^*} < 1 \]

Burada dH, Hausdorff metriğidir; iki kümenin birbirine ne kadar uzak olduğunu ölçer. Tk, k seviyesindeki üretici haritadır. R1 ve R2, iki farklı başlangıç veya temsil kümesi olabilir. cα* ise 1’den küçük bir daralma katsayısıdır. Bu katsayı 1’den küçük olduğunda, her iterasyon iki yapıyı birbirine yaklaştırır. Çalışmanın Universal Feature Convergence iddiası bu mantığa dayanır.

Çalışmada verilen önemli sonuçlardan biri şudur: İki HEF örneği aynı fiziksel kısıt setini P paylaşıyor ve E < Ec rejiminde çalışıyorsa, başlangıç koşulları, mimari veya eğitim verisi farklı olsa bile aynı sabit nokta temsiline yakınsayabilir. Bu, yapay zekâdaki “farklı modeller neden benzer özellikleri öğreniyor?” sorusuna aday bir açıklama sunar.

Makine öğrenmesi uygulamasında HEF, özellikle modüler aritmetik grokking deneyleriyle sınanır. Burada model, örneğin [ (a+b) \mod p ] biçimindeki görevlerde önce eğitim örneklerini ezberler, sonra gecikmeli biçimde genelleme yapar. Çalışma, bu süreci üç fazlı bir anlatımla açıklar:

  1. Keşif rejimi: E > Ec. Ezberleme mekanizması ve genelleme mekanizması birlikte rekabet eder. Eğitim doğruluğu hızla artabilir, ancak test doğruluğu düşük kalır.
  2. Grok boşluğu: Model eğitim verisini ezberlemiştir, fakat genelleme devresi henüz baskın değildir. Ağırlık normu Ec geçişinin ampirik izi olarak zirveye yaklaşır.
  3. Yakınsama rejimi: E < Ec. Genelleme mekanizması baskın hale gelir. Test doğruluğu ani biçimde yükselir ve sabit bir platoya yaklaşır.

Çalışmada grokking gecikmesi için revize edilmiş ölçekleme ilişkisi şu şekilde verilir:

\[ \Delta t \propto \frac{1}{frac \cdot p \cdot \lambda} \]

Burada Δt, grokking gecikmesini; frac, eğitim fraksiyonunu; p, modüler aritmetikte kullanılan asal sayıyı; λ, weight decay yani ağırlık bozunumu katsayısını temsil eder. Bu formülün anlamı şudur: p, eğitim kapsamı veya ağırlık bozunumu arttıkça belirli rejimlerde grokking gecikmesi kısalabilir. Ancak çalışma bu ilişkinin sınırsız geçerli olmadığını da vurgular. Özellikle çok yüksek λ değerlerinde genelleme devresi oluşmadan ağırlık sinyali aşırı bastırılabilir; bu durum mechanism starvation, yani mekanizma açlığı olarak adlandırılır.

Çalışmada kritik weight decay eşiği için şu aralık bildirilir:

\[ \lambda_c(p=97) \in (2, 4) \]

Bu, p = 97 için λ değerinin 2 ile 4 arasında bir kritik bölgeye sahip olduğunu gösterir. Metindeki deneylerde λ = 1 ve λ = 2 koşullarında grokking güvenilir biçimde gözlenirken, λ = 4 koşulunda bazı tohumlarda başarısızlık ve osilasyon görülür. Bu sonuç, HEF’in yalnızca “daha fazla weight decay daha hızlı grokking verir” gibi basit bir iddiada bulunmadığını gösterir. Ağırlık bozunumu genelleme yönünde baskı oluşturabilir; fakat aşırı olduğunda gerekli mekanizmanın kurulmasını da engelleyebilir.

Çalışmadaki deneysel sonuçlar dikkatle ayrıştırılmalıdır. Özette HEF’in 111 grokking deneyiyle doğrulandığı belirtilir. Daha ayrıntılı deney bölümünde ise 90 ana deney ve 21 doğrulama deneyi anlatılır. Ana deneylerde p ∈ {23, 31, 41}, eğitim fraksiyonu frac ∈ {0.40, 0.50, 0.60}, weight decay λ ∈ {1.0, 2.0} ve beş farklı seed kullanılır. Doğrulama deneylerinde ise p ∈ {53, 67, 83, 97} ve ek λ sınamaları yer alır.

En önemli deneysel bulgulardan biri, ana deneylerde 90 koşudan 89’unun grokking göstermesidir. Bu 89 grokked modelin final test doğruluğu:

\[ 0.9745 \pm 0.014 \]

olarak raporlanır. Varyasyon katsayısı yaklaşık %1.47’dir. ANOVA sonuçlarında p, λ, frac ve seed gibi faktörlerin final doğruluk üzerinde anlamlı belirleyici olmadığı aktarılır. Çalışma bunu, aynı fiziksel kısıtları paylaşan sistemlerin aynı sabit noktaya yakınsadığı iddiasıyla ilişkilendirir.

Bir başka önemli bulgu, ağırlık normu izidir. Çalışmada, koşuların %92.1’inde ağırlık normunun grokking olayından önce zirve yaptığı ve medyan öncül sürenin yaklaşık 1.050 adım olduğu belirtilir. Bu, Ec geçişinin ölçülebilir bir ampirik parmak izi olarak yorumlanır. Günlük bir benzetmeyle, sistem genelleme davranışına geçmeden önce iç gerilimini en yüksek seviyeye çıkarır; sonra daha düzenli ve kararlı bir yapıya oturur.

Şekil 1 bu üç fazlı anlatımın görsel temelini verir. Soldaki grafik, normalize edilmiş ağırlık normunun eğitim adımları boyunca önce yükseldiğini, sonra zirve yaptığını ve ardından düştüğünü gösterir. Grafikte bu süreç “Exploration”, “Grok gap” ve “Convergence” fazlarıyla ilişkilendirilir. Sağdaki grafik ise test doğruluğu eğrilerinin normalize zaman ekseninde tanh benzeri bir kırılmaya çöktüğünü gösterir. Bu görsel anlatım, çalışmanın grokking’i Landau-Ginzburg türü bir faz geçişi olarak yorumlamasının temel dayanaklarından biridir.

Çalışmada tanh çöküşü şu fonksiyonla ifade edilir:

\[ \sigma(t) = \frac{1}{2}\left(1 + \tanh\left(\frac{t-\Delta t}{\tau}\right)\right) \]

Bu formülde σ(t), normalize edilmiş test doğruluğu benzeri geçiş eğrisini; t, eğitim zamanını; Δt, grokking geçiş zamanını; τ, geçişin keskinliğini belirleyen zaman ölçeğini gösterir. Tanh fonksiyonu, düşük değerden yüksek değere yumuşak ama belirgin bir geçiş üretir. Bu nedenle faz geçişleri ve alan teorisi bağlamında sık kullanılan bir biçimdir. Çalışma, grokking doğruluk eğrilerinin bu yapıya uymasını “mean-field / Landau-Ginzburg universality class” yorumu için kullanır.

Şekil 2, Universal Feature Convergence iddiasını deneysel olarak desteklemek için final test doğruluğu dağılımını gösterir. Histogramda ve p ile λ gruplamalarında modellerin yaklaşık aynı final doğruluk bölgesine geldiği görülür. Çalışmanın yorumu, farklı hiperparametre ayarlarına ve başlangıç koşullarına rağmen sistemlerin aynı sabit nokta temsil sınıfına yakınsadığıdır. Ancak bu sonuçların belirli modüler aritmetik deneyleri ve kullanılan küçük ölçekli transformer mimarisi bağlamında elde edildiği unutulmamalıdır.

Şekil 3 ise G2 ölçekleme ve λc geçişiyle ilgilidir. Soldaki grafik, grokking gecikmesinin p’ye göre log-log ölçekte değişimini gösterir ve gözlenen eğimin β = -1.39 ± 0.20 olduğunu bildirir. Bu, revize edilen [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] ilişkisiyle kısmi uyumlu görülür. Ortadaki grafik, p = 97 için λ = 4 durumunda bazı koşuların başarısız olduğunu ve λc eşiğinin (2, 4) aralığında yer aldığını gösterir. Sağdaki grafik ise p büyüdükçe klasik iki fazlı grokking davranışının daha eşzamanlı öğrenmeye doğru kayabildiğini anlatır.

Çalışma, HEF’i yalnızca makine öğrenmesine uygulamaz. EOM başlığı altında prebiotik kimya ve evrimsel biyolojiye, IFF başlığı altında bilgi alan teorisi ve renormalizasyon grubu akışlarına, RSID başlığı altında nanoparçacık sinyal tespitine de örnekleme yapar. Bu alanlardaki uygulamalar, HEF’in farklı domainlerde aynı yapısal soruyu sorabildiğini göstermek için kullanılır: sistemin ilkel elemanları nelerdir, hangi mekanizmalar çalışır, enerji bütçesi nedir, hangi fiziksel ve bilgisel kısıtlar geçerlidir ve kritik eşikte hangi yakınsama türü doğar?

Çalışmanın biyolojiyle ilgili en dikkat çekici tahmini, anaerobik maya soylarının aynı filogenetik uzaklıkta aerobik soylarına göre daha yüksek genomik yakınsama göstermesi gerektiğidir. Bu, HEF’in enerji kısıtlarıyla metabolik yakınsama arasında bağ kurma girişimidir. Yapay zekâ alanındaki diğer tahmin, daha yüksek weight decay ile eğitilmiş büyük dil modellerinin daha yüksek nedensel etkiye sahip temsiller üretebileceğidir. Üçüncü tahmin ise grokking’in belirli bir λc(p) eşiğinin ötesinde mekanizma açlığı nedeniyle başarısız olmasıdır.

Burada önemli olan, bu tahminlerin çalışmanın kendi ifadesiyle yanlışlanabilir olmasıdır. Yani HEF yalnızca geçmiş gözlemleri açıklamaya çalışan esnek bir hikâye olarak kalmamalı; yeni deneylerle desteklenmeli, düzeltilmeli veya reddedilmelidir. Çalışmanın sonunda açık deney protokolleri verilmesi bu açıdan değerlidir.

Gündelik yaşama etkisi açısından bu çalışma doğrudan bir ürün veya uygulama geliştirme makalesi değildir. Fakat başarılı olursa, yapay zekâ modellerinin ne zaman ezberden genellemeye geçtiğini anlamada, eğitim sürecindeki kritik eşikleri tespit etmede, weight decay gibi hiperparametrelerin yanlış kullanımından doğan başarısızlıkları öngörmede ve farklı alanlardaki karmaşık yakınsama olaylarını karşılaştırmada önemli bir kavramsal araç sağlayabilir. Daha geniş açıdan bakıldığında, “karmaşık sistemler neden bazen aynı çözüme varır?” sorusuna matematiksel bir dil kazandırmaya çalışır.

Çalışmanın güçlü yönleri arasında açık matematiksel çerçeve kurması, fiziksel ve bilgi kuramsal kısıtları aynı yapı içinde birleştirmeye çalışması, grokking deneyleriyle ampirik destek sunması, görsel olarak anlaşılabilir Ec parmak izi önermesi ve yanlışlanabilir alanlar arası tahminler üretmesi sayılabilir.

Sınırlılıkları da dikkatle belirtilmelidir. Birincisi, HEF çok geniş alanlara uygulanmak istendiği için bazı bağlantılar henüz aday çerçeve düzeyindedir. İkincisi, metrik daralma koşulu A6 çalışmada önemli bir teknik koşuldur; bazı durumlarda teorik olarak temellendirilse de genel durumda kendiliğinden çıkmadığı, ek yapı gerektirdiği çalışmanın içinde de tartışılır. Üçüncüsü, grokking deneyleri belirli görevler, belirli küçük transformer düzenekleri ve belirli hiperparametre aralıklarıyla sınırlıdır. Dördüncüsü, biyoloji, büyük dil modeli ve nanoparçacık tahminleri henüz bu metinde tamamlanmış bağımsız doğrulama olarak sunulmaz; bunlar açık deneysel tahminlerdir.

Çalışmanın söylediği şey ile söylemediği şey net ayrılmalıdır. Çalışma, tüm emergence olaylarının HEF ile açıklandığını söylemez. Evrimdeki tüm yakınsamaları, tüm sinir ağı temsil benzerliklerini veya tüm fiziksel faz geçişlerini tek modelle kesin biçimde çözdüğünü iddia etmez. Daha sınırlı ve daha bilimsel olarak anlamlı iddiası, bazı yakınsama olaylarında enerji eşiği, mekanizma rekabeti ve fiziksel-bilgisel kısıtlar üzerinden ortak bir faz geçişi motifinin bulunabileceğidir.

Çalışmanın Yöntemi ve Bulguları

Çalışmanın yöntemi beş ana katmanda özetlenebilir: teorik HEF tanımı, fiziksel temel, yakınsama teoremleri, mekanizma manzarası sınıflaması ve grokking deneyleri.

1. HEF’in temel yapısı

Çalışmada HEF şu yapı ile tanımlanır:

\[ H = (R^{(1)}, L, A_0, G, mode, E) \]

BileşenAnlamıÖrnek yorum
R(1)Başlangıç düzeyi ilkel elemanlarToken embeddingleri, prebiotik moleküller veya Fourier modları olabilir.
LMantıksal dilİlkel elemanlardan fiziksel olarak uygun birleşimler ve ilişkiler kurar.
A0Başlangıç mekanizmalarıModel ağırlık başlatması, reaksiyon kümesi veya ilgili operatörler gibi düşünülebilir.
GÜretim kuralıYeni mekanizma indeksleri oluşturabilir.
modeÇalışma moduKontrollü veya kendi kendine mekanizma üreten sistem.
EEnerji bütçesiSistemin hangi mekanizmaları karşılayabileceğini belirler.

Bu yapı fiziksel kısıt setiyle tamamlanır:

\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]

Çalışmada Φ haritası, termodinamik kısıtlar ile bilgi kuramsal kısıtlar arasında düzen koruyan bir eşleme olarak kurulur. Bu eşleme Landauer İlkesi, Jarzynski Eşitliği, Gibbs entropisi ve Veri İşleme Eşitsizliği gibi temellere dayandırılır.

2. Kanonik fiziksel ölçü ve mekanizma maliyeti

Çalışmada her ilkel elemana Gibbs ağırlığı atanır:

\[ p_i = \frac{e^{-E_i/k_B T}}{Z^{(k)}} \]

\[ Z^{(k)} = \sum_{j=1}^{N_k} e^{-E_j/k_B T} \]

Burada pi, i’inci elemanın olasılık ağırlığıdır. Ei, enerji; kB, Boltzmann sabiti; T, sıcaklık; Z(k), bölüm fonksiyonu; Nk, k düzeyindeki eleman sayısıdır. Bu yapı, düşük enerjili durumların daha yüksek ağırlık taşıdığı kanonik fiziksel ölçüyü kurar.

Mekanizma maliyeti ise şu şekilde verilir:

\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]

Bu formül, mekanizmanın enerji ve bilgi değişimi açısından beklenen maliyetini hesaplar. Böylece HEF’te mekanizma seçimi yalnızca soyut mantıksal uygunluğa değil, fiziksel-bilgisel maliyete de bağlanır.

3. Kritik enerji eşiği ve yakınsama

Enerji bütçesine bağlı mekanizma kümesi:

\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]

şeklinde tanımlanır. Çalışmaya göre E değiştikçe bu kümenin büyüklüğü ve çeşitliliği değişir. Ec, yeni mekanizmaların bütçeye dahil olma hızının en yüksek olduğu kritik düzey olarak tanımlanır. Sonlu mekanizma maliyetleri için bu sezgi şu ayrık ifade ile temsil edilir:

\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]

Burada cj, sıralı maliyet değerlerini; Δj, ilgili maliyet düzeyinde yeni eklenen mekanizma sayısını gösterir. Bu formül, Ec değerini mekanizma çeşitliliğinin en hızlı değiştiği nokta olarak tanımlar.

4. Ana teoremler

Teorem / sonuçÇalışmadaki anlamıDikkat edilmesi gereken nokta
Physical Feasibility TheoremÜretilen her seviyedeki varlıkların termodinamik ve bilgi kuramsal kısıtları birlikte sağladığını söyler.A1–A4 varsayımlarına dayanır.
Energy-Diversity TheoremEnerji arttıkça mekanizma çeşitliliğinin azalmadığını ve Ec altında sabit noktaya yakınsama oluştuğunu belirtir.Yakınsama için A6 gibi daralma koşulları önemlidir.
Universal Feature ConvergenceAynı P kısıtlarını paylaşan iki sistemin E < Ec altında aynı sabit noktaya yakınsayabileceğini söyler.Başlangıç farklarından bağımsızlık iddiası belirli varsayımlar altında geçerlidir.
Causal Emergence TheoremSabit noktanın mikro düzeye göre daha yüksek Effective Information taşıyabileceğini savunur.NDA yani Non-Degeneracy Assumption gerektirir.

5. Causal Emergence ve Effective Information

Çalışmada nedensel ortaya çıkış şu Effective Information tanımıyla ele alınır:

\[ EI_k = H_{\mu}(T_k(R^{(k)})) - H_{\mu}(T_k(R^{(k)}) \mid R^{(k)}) \]

Burada EIk, k düzeyindeki etkin bilgiyi; Hμ, kanonik ölçü altındaki entropiyi; Tk, üretici haritayı; R(k), k düzeyindeki temsil veya varlık kümesini ifade eder. İlk terim çıktı çeşitliliğini, ikinci terim ise girdiyi bilmeye rağmen kalan nedensel gürültüyü temsil eder. Çalışmanın iddiasına göre E < Ec rejiminde mekanizma seçimi deterministik hale geldiği için nedensel gürültü azalır.

6. Makine öğrenmesi deneyleri

Deney bileşeniÇalışmada verilen ayrıntı
GörevModüler toplama: (a+b) mod p
Model2 katmanlı transformer, 128 boyut, 4 başlık
OptimizasyonFull-batch AdamW, sabit öğrenme oranı 10-3
Ana deneylerp ∈ {23, 31, 41}, frac ∈ {0.40, 0.50, 0.60}, λ ∈ {1.0, 2.0}, 5 seed; toplam 90 koşu
Doğrulama deneylerip ∈ {53, 67, 83, 97} ve p = 97 için λ ∈ {1.0, 2.0, 4.0}; toplam 21 koşu
Grokking ölçütüTest doğruluğunun iki ardışık değerlendirmede %95’i aşması
Kaydedilen ölçümlerGradient energy, ağırlık normu, eğitim/test doğruluğu

7. Deneysel bulgular

BulgularSayısal değerÇalışmadaki yorum
Universal Convergence89/90 ana koşu grokked; final test doğruluğu 0.9745 ± 0.014Farklı p, frac, λ ve seed koşullarına rağmen benzer sabit noktaya yakınsama.
Varyasyon katsayısıCV ≈ %1.47Final doğrulukların dar bir aralıkta toplandığı yorumu yapılır.
Weight-norm Ec fingerprintKoşuların %92.1’inde ağırlık normu grokking’den önce zirve yapar; medyan öncül süre ≈ 1.050 adımEc geçişinin modelden bağımsız ampirik izi olarak yorumlanır.
Landau-Ginzburg çöküşüPer-run R2 = 0.93; ortalama çöküş R2 = 0.79Grokking’in tanh kink benzeri faz geçişi sınıfına yerleştirilebileceği savunulur.
G2 ölçeklemeβ = -1.39 ± 0.20, R2 = 0.91Revize edilmiş [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] ilişkisiyle kısmi uyum.
λc eşiğiλc(p=97) ∈ (2, 4)Çok yüksek weight decay, mekanizma açlığına ve grokking başarısızlığına yol açabilir.

8. Şekillerin anlattığı bilimsel içerik

Şekil 1, HEF’in üç fazlı enerji anlatımını gösterir. Sol panelde ağırlık normunun önce yükselmesi, sonra Ec çevresinde zirve yapması ve ardından düşmesi, keşif rejiminden yakınsama rejimine geçişin göstergesi olarak yorumlanır. Sağ panelde normalize test doğruluğu eğrilerinin tanh biçimli bir kırılmaya çökmesi, grokking’in Landau-Ginzburg benzeri bir faz geçişi olarak ele alınmasına temel oluşturur.

Şekil 2, final test doğruluklarının p ve λ gruplarına göre anlamlı biçimde ayrışmadığını gösterir. Bu, Universal Feature Convergence iddiasının deneysel desteklerinden biri olarak sunulur. Ancak bu sonuç yalnızca ilgili deney tasarımındaki grokked modeller için geçerlidir; tüm model ölçeklerine genellenmiş kesin bir sonuç değildir.

Şekil 3, grokking gecikmesinin p’ye göre ölçeklenmesini, λ = 4 civarında başarısızlık rejimini ve p büyüdükçe ezberleme ile genelleme arasındaki ayrımın değişmesini gösterir. Bu şekil, HEF’in yalnızca geçişi açıklamaya değil, geçişin hangi hiperparametre koşullarında başarısız olabileceğini tahmin etmeye çalıştığını gösterir.

9. Alanlar arası tahminler

  • P1: Anaerobik maya soylarının, aynı filogenetik uzaklıktaki aerobik soylara göre daha yüksek genomik yakınsama göstermesi beklenir.
  • P2: Daha yüksek weight decay ile eğitilen büyük dil modellerinin daha yüksek nedensel etkiye sahip temsiller üretmesi beklenir.
  • P3: Belirli bir kritik λc(p) eşiğinin ötesinde grokking, mekanizma açlığı nedeniyle başarısız olmalıdır.

10. Sınırlılıklar ve açık problemler

  • HEF tüm emergence olaylarını açıklayan tamamlanmış bir teori olarak sunulmaz; belirli yakınsama motifleri için aday çerçevedir.
  • A6 metrik daralma koşulu genel olarak A1–A5’ten otomatik çıkmaz; çalışma bunun için ek yapılar veya ampirik doğrulama gerektiğini kabul eder.
  • Grokking deneyleri belirli küçük ölçekli transformer ve modüler aritmetik bağlamına dayanır.
  • G2 formülünün önceki hali metinde revize edilmiştir; yeni formül için daha büyük ve ayrıştırıcı deneyler açık protokol olarak bırakılır.
  • LLM, evrimsel biyoloji ve nanoparçacık tahminleri bu çalışmada tamamlanmış bağımsız doğrulama değil, test edilebilir gelecek tahminleri olarak verilmiştir.
  • Reproducibility bölümünde Zenodo DOI alanı “to be deposited” durumunda görünür; bu nedenle veri arşivinin nihai DOI bilgisi metin üzerinden tamamlanmış görünmemektedir.

Kaynak ve Yöntem Notu

Bu makale, Truong Xuan Khanh tarafından hazırlanan “Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems” başlıklı çalışmaya dayanarak hazırlanmıştır. Çalışmada yazarın H&K Research Studio, Clevix LLC, Hanoi, Vietnam bağlantısı ve Mayıs 2026 tarihi verilmiştir. Metnin ilk sayfasında arXiv submit bilgisi yer aldığı için çalışma, metin üzerinden arXiv gönderimi / preprint niteliğinde teorik-ampirik araştırma çalışması olarak değerlendirilmiştir.

Metinde hakemli dergi kabulü, DOI ile yayımlanmış nihai versiyon veya açık hakem değerlendirmesi bilgisi bulunmadığı için çalışma için hakemliği metin üzerinden doğrulanamayan çalışma ifadesi kullanılmalıdır. Bu nedenle sonuçlar, özellikle HEF’in geniş alanlara uygulanabilirliği ve biyoloji/LLM/nanomedicine tahminleri bakımından dikkatli okunmalıdır.

Bu içerik hazırlanırken çalışmada verilen HEF tanımı, fiziksel kısıt seti, termodinamik-bilgi kuramı eşlemeleri, ana teoremler, grokking deneyleri, şekiller, sayısal sonuçlar, açık protokoller ve sınırlılıklar esas alınmıştır. PDF’de olmayan kesin uygulama başarısı, hakemli yayın kabulü, klinik veya ticari etki, tüm yapay zekâ modellerine genelleme ya da tüm evrimsel süreçleri açıklama gibi iddialar eklenmemiştir.

Çalışmanın deneysel kısmı özellikle modüler aritmetik grokking görevleriyle sınırlıdır. HEF’in evrimsel biyoloji, büyük dil modelleri ve nanoparçacık sinyal tespiti için sunduğu sonuçlar bu metinde daha çok alanlar arası tahmin ve teorik uygulama olarak yer alır. Bu tahminlerin bilimsel değeri, bağımsız deneylerle desteklenmesine, düzeltilmesine veya yanlışlanmasına bağlıdır.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy