
Bilimde “ortaya çıkış” ya da İngilizce karşılığıyla emergence, basit parçaların bir araya gelmesiyle parçaların tek tek sahip olmadığı yeni bir düzenin, davranışın veya işlevin doğması anlamına gelir. Bir sinir ağının yalnızca sayısal ağırlıklardan oluşmasına rağmen görüntülerde kenarları, eğrileri veya soyut özellikleri ayırt etmeye başlaması buna örnektir. Benzer şekilde, basit moleküllerden metabolik ağların oluşması ya da fiziksel alanlarda düzenli fazların ortaya çıkması da emergence tartışmalarının merkezindedir.
Ancak bu çalışma yalnızca “karmaşık sistemlerde yeni özellikler ortaya çıkar” demekle yetinmez. Daha özel bir soruya odaklanır: Neden farklı sistemler bazen aynı sonuca yakınsar? Eğer iki sinir ağı farklı başlangıç ağırlıklarıyla eğitiliyor ama benzer iç temsiller geliştiriyorsa, bu yalnızca tesadüf müdür? Eğer farklı evrimsel soylar aynı metabolik çözüm sınıflarına tekrar tekrar ulaşıyorsa, bu yalnızca çevresel baskının kaba bir sonucu mudur? Eğer grokking farklı görevlerde ani genelleme biçiminde ortaya çıkıyorsa, bu ani geçişin zamanı ve biçimi hangi yapısal nedenlere bağlıdır?
Yazarın cevabı, bu olayların arkasında ortak bir mekanizma rekabeti yapısı olabileceğidir. Bir sistemde birden fazla olası mekanizma vardır. Bazıları hızlı ama yüzeysel çözümler üretir; bazıları daha yavaş fakat daha genel ve kararlı çözümler oluşturur. Yapay zekâdaki grokking örneğinde bu, ezberleme mekanizması ile genelleme mekanizması arasındaki rekabet olarak düşünülebilir. Model önce eğitim verisini ezberleyebilir; fakat ağırlık bozunumu gibi süreçler zamanla ezberleme çözümünü daha maliyetli hale getirirken genelleme devresinin baskınlaşmasına izin verebilir.
Çalışmanın temel kavramlarından biri kritik enerji eşiğidir:
\[ E_c \]
Burada Ec, sistemin davranış rejimini değiştiren kritik enerji bütçesidir. E yüksekken sistem birden fazla mekanizmayı aynı anda “karşılayabilir”; bu, keşif ve rekabet rejimidir. E, kritik eşik çevresine geldiğinde mekanizmalar arasında seçilim keskinleşir. E < Ec olduğunda ise en düşük maliyetli veya fiziksel kısıtlar bakımından en kararlı mekanizma baskın hale gelir ve sistem sabit bir noktaya doğru yakınsar.
Bu mantık, fiziksel faz geçişlerine benzer. Suyun sıcaklığı düşerken moleküller bir anda “buz olmayı seçmez”; fakat belirli bir eşikte sistemin düzeni niteliksel olarak değişir. HEF’in grokking yorumunda da modelin test doğruluğu uzun süre düşük kalabilir; sonra sistem belirli bir iç eşiği geçince genelleme davranışı hızla ortaya çıkar.
HEF çerçevesi şu altılı yapı ile tanımlanır:
\[ H = (R^{(1)}, L, A_0, G, mode, E) \]
Bu formülde H, Hierarchical Emergence Framework örneğini temsil eder. R(1), sistemin başlangıçtaki ilkel eleman kümesidir. Makine öğrenmesinde bu, token embeddingleri gibi düşük düzeyli temsil öğeleri olabilir. Biyolojide prebiotik moleküller; fizikte ise Fourier modları örnek verilir. L, bu öğelerden mantıksal ifadeler kurmaya yarayan dili gösterir. A0, başlangıç mekanizma kümesidir. G, yeni mekanizmalar üretebilen kuraldır. mode, sistemin kontrollü mü yoksa kendi kendine yeni mekanizmalar üreten bir modda mı çalıştığını belirtir. E ise enerji bütçesidir.
Bu yapı, çalışmada fiziksel kısıt setiyle birlikte ele alınır:
\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]
Burada Pthermo termodinamik kısıtları, Pinfo bilgi kuramsal kısıtları, Φ ise bu iki alan arasındaki çeviri haritasını gösterir. Çalışmanın önemli taraflarından biri, termodinamik yasalar ile bilgi kuramı ilkelerini aynı emergence çerçevesinde birleştirmeye çalışmasıdır.
Termodinamik tarafta üç kısıt verilir:
- P1: Enerjinin korunumu. Toplam enerji değişimi sıfır olmalıdır.
- P2: İkinci yasa. Toplam entropi azalmamalıdır.
- P3: Pozitif sıcaklık. Sistem T > 0 koşulunda değerlendirilir.
Bilgi kuramı tarafında bunlara karşılık gelen üç kısıt tanımlanır:
- P4: Karşılıklı bilgi sınırı. İki değişken arasındaki bilgi, değişkenlerin kendi bilgi içeriklerinden fazla olamaz.
- P5: Koşullu entropinin negatif olmaması. Bir şey bilindiğinde kalan belirsizlik azalabilir, ama negatif belirsizlik oluşmaz.
- P6: Veri İşleme Eşitsizliği. Bir bilgi işleme zincirinde sonraki temsil, önceki kaynaktan kendiliğinden daha fazla bilgi yaratamaz.
Bu ilişkiyi anlamak için çalışmanın dayandığı temel fiziksel fikirlerden biri Landauer İlkesiyle açıklanabilir:
\[ W \geq k_B T \ln 2 \cdot \Delta H \]
Bu formül, bilgi işlemenin fiziksel bir maliyeti olduğunu söyler. W, gereken iş ya da enerji maliyetidir. kB, Boltzmann sabitidir. T, sıcaklıktır. ΔH, işlenen veya silinen bilgi miktarıdır. Bu ilişki, “bilgi soyut görünse bile fiziksel dünyada bedelsiz değildir” fikrini taşır. Çalışma, mekanizmaların seçimini de bu tür enerji-bilgi maliyetleriyle ilişkilendirir.
Mekanizma maliyeti şu şekilde yazılır:
\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]
Burada α, bir mekanizmayı; φ, mantıksal dil içinde oluşturulmuş bir ifadeyi; ΔEα(φ), mekanizmanın enerji değişimini; ΔHα(φ), bilgi içeriği değişimini; Eμ, kanonik fiziksel ölçü altında beklenen değeri ifade eder. Bu formül, bir mekanizmanın yalnızca işe yarayıp yaramadığını değil, fiziksel ve bilgisel açıdan ne kadar maliyetli olduğunu da ölçmeye çalışır.
Enerji bütçesi altında kabul edilen mekanizmalar şu şekilde tanımlanır:
\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]
A*, fiziksel olarak kabul edilebilir mekanizmaların tamamıdır. A*(E) ise enerji bütçesi E içinde çalışabilecek mekanizmaların alt kümesidir. Bu tanım, HEF’in en önemli düşüncesini içerir: Bir mekanizma mantıksal olarak mümkün olabilir; fakat enerji bütçesi onu karşılamıyorsa sistemin gerçek davranışında rol alamaz.
Çalışmada Ec, mekanizma çeşitliliğinin kritik değişim noktası olarak tanımlanır. Sonlu mekanizma maliyetleri için verilen ayrık karakterizasyon şöyledir:
\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]
Bu formülde cj, sıralanmış mekanizma maliyetlerini; Δj, ilgili maliyet düzeyinde bütçeye yeni dahil olan mekanizma sayısını gösterir. Yani Ec, sisteme yeni mekanizmaların en hızlı dahil olduğu kritik maliyet düzeyi olarak seçilir. Sürekli sistemlerde bu, faz geçişlerinde görülen duyarlılık artışına benzetilir.
HEF’in yakınsama iddiası, metrik daralma fikrine dayanır. Çalışmada bu mantık Hausdorff metriği ve Banach Sabit Nokta Teoremi ile kurulur:
\[ d_H(T_k(R_1), T_k(R_2)) \leq c_{\alpha^*} \cdot d_H(R_1, R_2), \quad 0 < c_{\alpha^*} < 1 \]
Bu formülde dH, iki küme arasındaki Hausdorff uzaklığını; Tk, k seviyesindeki üretici haritayı; R1 ve R2, iki temsil veya varlık kümesini; cα*, daralma katsayısını temsil eder. Katsayı 1’den küçükse, sistem her adımda farklı başlangıçlardan gelen yapıları birbirine yaklaştırır. Bu nedenle, belirli koşullar altında iki ayrı sistem aynı sabit noktaya yakınsayabilir.
Çalışmanın Universal Feature Convergence sonucu bu noktadan doğar. Eğer iki HEF örneği aynı fiziksel kısıt setini P paylaşıyor ve E < Ec rejiminde çalışıyorsa, başlangıç elemanları, mimari ayrıntıları veya üretim yolları farklı olsa bile aynı sabit nokta temsil sınıfına yakınsayabilir. Yapay zekâ açısından bu, farklı modellerin neden benzer iç temsiller geliştirdiğini açıklamak için aday bir mekanizma sunar.
Çalışma, yakınsamanın tek başına “nedensel ortaya çıkış” anlamına gelmediğini de vurgular. Çünkü her şeyi tek bir sabit çıktıya sıkıştıran önemsiz bir mekanizma da yakınsayabilir; fakat bu, anlamlı nedensel güç üretmez. Bu nedenle çalışma Effective Information kavramını kullanır:
\[ EI_k = H_{\mu}(T_k(R^{(k)})) - H_{\mu}(T_k(R^{(k)}) \mid R^{(k)}) \]
Burada EIk, k düzeyindeki etkin bilgiyi gösterir. İlk terim çıktı çeşitliliğini, ikinci terim ise girdiyi bilmeye rağmen kalan nedensel gürültüyü ifade eder. Eğer E < Ec rejiminde mekanizma seçimi daha deterministik hale gelirse, nedensel gürültü azalır. Çalışmanın Causal Emergence Theorem sonucu, belirli ek varsayımlar altında sabit nokta düzeyinin mikro düzeye göre daha yüksek etkin bilgi taşıyabileceğini savunur.
Makine öğrenmesi örneğinde HEF, özellikle grokking sürecine uygulanır. Grokking, bir modelin eğitim verisini ezberledikten çok sonra test verisinde genelleme yapmaya başlamasıdır. Bu çalışmada grokking üç fazlı bir HEF yörüngesi olarak anlatılır:
- Keşif rejimi: E > Ec. Ezberleme ve genelleme mekanizmaları birlikte mevcuttur. Eğitim doğruluğu artarken test doğruluğu düşük kalabilir.
- Grok boşluğu: Model eğitim verisini ezberlemiştir, fakat genelleme devresi henüz baskın değildir. Ağırlık normu faz sınırına yaklaşırken zirve yapar.
- Yakınsama rejimi: E < Ec. Genelleme mekanizması baskın hale gelir; test doğruluğu hızlı biçimde yükselir ve sabit bir platoya yaklaşır.
Çalışmada grokking gecikmesi için revize edilen ölçekleme ilişkisi şudur:
\[ \Delta t \propto \frac{1}{frac \cdot p \cdot \lambda} \]
Burada Δt, grokking gecikmesini; frac, eğitim verisi fraksiyonunu; p, modüler aritmetik görevindeki asal sayıyı; λ, weight decay yani ağırlık bozunumu katsayısını temsil eder. Bu ilişki, belirli orta λ rejimlerinde daha fazla eğitim sinyali ve uygun weight decay baskısının genelleme devresinin daha erken kurulmasına yardımcı olabileceğini söyler.
Ancak çalışma burada önemli bir sınırlama da koyar. λ çok yükseldiğinde sistem genelleme mekanizmasını kuracak sinyali de kaybedebilir. Bu durum mechanism starvation, yani mekanizma açlığı olarak adlandırılır. p = 97 için kritik aralık şu şekilde verilir:
\[ \lambda_c(p=97) \in (2, 4) \]
Bu, λ = 1 ve λ = 2 değerlerinde grokking güvenilir biçimde görülürken, λ = 4 seviyesinde bazı koşuların başarısız olmasıyla ilişkilendirilir. Dolayısıyla çalışma, weight decay’in her zaman artırılması gereken basit bir ayar olduğunu söylemez; belirli eşiğin ötesinde mekanizma oluşumunu bozabileceğini savunur.
Çalışmanın deneysel bölümünde kullanılan ana görev modüler toplama problemidir:
\[ (a+b) \mod p \]
Bu görevde modelin yalnızca örnekleri ezberlemesi yeterli değildir; gerçekten genelleme yapabilmesi için modüler yapıyı öğrenmesi gerekir. Bu nedenle grokking araştırmalarında sık kullanılan bir test alanıdır.
Deneylerde 2 katmanlı transformer, 128 boyutlu temsil, 4 attention head, full-batch AdamW ve sabit 10-3 öğrenme oranı kullanılır. Ana deney setinde p ∈ {23, 31, 41}, eğitim fraksiyonu frac ∈ {0.40, 0.50, 0.60}, weight decay λ ∈ {1.0, 2.0} ve beş farklı seed yer alır. Doğrulama setinde p ∈ {53, 67, 83, 97} ve p = 97 için ek λ deneyleri bulunur.
Çalışmanın en güçlü ampirik noktalarından biri, grokked modellerin final test doğruluklarının dar bir aralıkta toplanmasıdır:
\[ 0.9745 \pm 0.014 \]
Bu sonuç, varyasyon katsayısının yaklaşık %1.47 olmasıyla birlikte, farklı hiperparametre koşullarına rağmen aynı sabit nokta temsil davranışına yakınsama iddiasını desteklemek için kullanılır. Ancak bu sonuç belirli küçük ölçekli transformer ve modüler aritmetik deneyleri bağlamındadır; bütün yapay zekâ sistemlerine doğrudan genellenmiş kesin bir sonuç değildir.
Çalışmadaki şekiller, teorik iddianın görsel omurgasını oluşturur. Şekil 1’in sol panelinde, ağırlık normunun eğitim boyunca önce yükseldiği, sonra Ec çevresinde zirve yaptığı ve ardından düştüğü gösterilir. Bu zirvenin grokking olayından medyan olarak yaklaşık 1.050 adım önce geldiği belirtilir. Bu, çalışmada Ec geçişinin ampirik parmak izi olarak yorumlanır.
Şekil 1’in sağ panelinde, normalize edilmiş test doğruluğu eğrileri tanh biçimli bir geçiş eğrisi üzerine çöker. Bu eğri şu şekilde yazılır:
\[ \sigma(t) = \frac{1}{2}\left(1 + \tanh\left(\frac{t-\Delta t}{\tau}\right)\right) \]
Burada σ(t), normalize test doğruluğu benzeri geçiş fonksiyonudur. t, eğitim zamanını; Δt, grokking geçiş zamanını; τ, geçiş genişliğini veya keskinliğini belirleyen zaman ölçeğini gösterir. Tanh fonksiyonu düşük durumdan yüksek duruma yumuşak ama belirgin bir geçiş üretir. Bu nedenle çalışma, grokking davranışını Landau-Ginzburg mean-field evrensellik sınıfıyla ilişkilendirir.
Şekil 2, final test doğruluklarının dağılımını ve p ile λ gruplarına göre ayrışıp ayrışmadığını gösterir. Grafikte modellerin yaklaşık aynı final doğruluk bandında toplandığı ve p ile λ etkisinin anlamlı bulunmadığı aktarılır. Bu, Universal Feature Convergence iddiasının deneysel desteği olarak yorumlanır.
Şekil 3, grokking gecikmesinin p’ye göre ölçeklenmesini ve λc geçişini gösterir. Soldaki log-log grafikte gözlenen eğim:
\[ \beta = -1.39 \pm 0.20 \]
olarak verilir ve R2 = 0.91 raporlanır. Bu sonuç, revize edilen [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] ilişkisiyle kısmi uyumlu görülür. Ortadaki panelde λ = 4 koşulunda bazı seed’lerin başarısız olduğu gösterilerek mekanizma açlığı sınıfı desteklenir. Sağdaki panel ise p büyüdükçe klasik iki aşamalı grokking davranışının daha eşzamanlı öğrenme görünümüne yaklaşabileceğini anlatır.
HEF’in ilginç tarafı, çalışmanın bunu yalnızca makine öğrenmesine uygulamamasıdır. Biyolojide prebiotik moleküllerden otokatalitik ağlara ve metabolik yakınsamaya, fizikte Fourier modları ve renormalizasyon grubu akışlarına, nanoparçacık sinyal tespitinde bağlanma konfigürasyonlarına kadar farklı örnekler verilir. Bu örneklerin tamamında aynı soru sorulur: İlkel elemanlar nelerdir, hangi mekanizmalar mümkündür, hangi fiziksel-bilgisel kısıtlar geçerlidir ve kritik enerji eşiği hangi yakınsamayı doğurur?
Çalışmanın üç yanlışlanabilir tahmini vardır. Birincisi, anaerobik maya soylarının aynı filogenetik uzaklıkta aerobik soylarına göre daha yüksek genomik yakınsama göstermesi gerektiğidir. İkincisi, daha yüksek weight decay ile eğitilen büyük dil modellerinin daha yüksek nedensel etkiye sahip temsiller üreteceği yönündedir. Üçüncüsü, kritik bir λc(p) eşiğinin ötesinde grokking’in mekanizma açlığı nedeniyle başarısız olmasıdır.
Bu tahminler önemlidir; çünkü teori yalnızca geçmiş gözlemleri anlatan esnek bir açıklama olarak kalmak istemez. Kendi yanlışlanma yollarını da sunar. Eğer anaerobik soylar beklenen yakınsamayı göstermezse, eğer LLM temsillerinde weight decay ile nedensel etki arasında beklenen ilişki bulunmazsa ya da λc eşiği deneysel olarak desteklenmezse, HEF’in kapsamı daraltılmalı veya modeli revize edilmelidir.
Çalışmanın günlük yaşama etkisi doğrudan bir cihaz, ilaç veya yazılım ürünü üretmek değildir. Ancak yapay zekâ sistemlerinin eğitim davranışını anlamak, ezberleme ile genelleme arasındaki geçişleri ölçmek, hiperparametre ayarlarında kritik eşikleri fark etmek ve karmaşık sistemlerde neden benzer çözümlerin tekrar tekrar ortaya çıktığını açıklamak açısından kavramsal bir katkı sunar. Eğer HEF daha geniş deneylerle desteklenirse, yapay zekâ eğitim süreçlerinde “model ne zaman gerçekten öğrenmeye başlıyor?” sorusuna daha ölçülebilir yanıtlar üretilebilir.
Çalışmanın güçlü yönleri; açık matematiksel yapı kurması, fiziksel ve bilgi kuramsal kısıtları birlikte ele alması, grokking deneylerinden sayısal destek sunması, şekillerle ölçülebilir bir Ec parmak izi önermesi ve alanlar arası yanlışlanabilir tahminler üretmesidir.
Sınırlılıkları ise en az güçlü yönleri kadar önemlidir. HEF, tüm emergence olaylarını açıklayan tamamlanmış bir teori değildir. A6 metrik daralma koşulu, genel durumda otomatik olarak çıkmaz; çalışma bunun için ek yapısal koşullar veya ampirik doğrulama gerektiğini kabul eder. Grokking deneyleri küçük ölçekli transformer ve modüler aritmetik görevleriyle sınırlıdır. Biyoloji, büyük dil modeli ve nanoparçacık tahminleri bu metinde tamamlanmış bağımsız doğrulamalar değil, gelecekte test edilmesi gereken öngörülerdir. Reproducibility bölümünde Zenodo DOI alanının “to be deposited” olarak görünmesi de veri arşivi bilgisinin metin üzerinden tamamlanmış olmadığını gösterir.
Bu nedenle çalışma, kesinleşmiş bir genel emergence yasası olarak değil, karmaşık sistemlerde yakınsama olaylarını faz geçişleri ve mekanizma manzaraları üzerinden açıklamaya çalışan iddialı, matematiksel ve test edilebilir bir çerçeve olarak okunmalıdır.
Çalışmanın Yöntemi ve Bulguları
Çalışmanın yöntemi dört ana eksen üzerinde kuruludur: HEF’in matematiksel tanımı, fiziksel-bilgi kuramsal temel, sabit nokta ve nedensel ortaya çıkış teoremleri, grokking deneyleriyle ampirik sınama.
1. HEF tuple yapısı
| Bileşen | Tanım | Makine öğrenmesi örneği |
|---|---|---|
| R(1) | Başlangıç ilkel eleman kümesi | Token embeddingleri |
| L | İlkel elemanlardan ifadeler kuran mantıksal dil | Attention örüntüleri ve devre yapıları |
| A0 | Başlangıç mekanizma kümesi | Ağırlık başlatma ve model bileşenleri |
| G | Yeni mekanizma indeksleri üreten kural | Gradient descent / optimizasyon süreci |
| mode | Kontrollü veya kendi kendine üretici çalışma biçimi | Kontrollü eğitim süreci |
| E | Enerji bütçesi | η∥∇L∥2 gibi eğitim enerjisi vekilleri |
2. Fiziksel ve bilgi kuramsal kısıtlar
| Termodinamik kısıt | Bilgi kuramsal karşılık | Anlamı |
|---|---|---|
| P1: Enerjinin korunumu | P4: Karşılıklı bilgi sınırı | Bilgi üretimi fiziksel maliyetten bağımsız düşünülemez. |
| P2: İkinci yasa | P5: Koşullu entropi ≥ 0 | Belirsizlik ve entropi fiziksel süreçlerde negatifleşmez. |
| P3: Pozitif sıcaklık | P6: Veri İşleme Eşitsizliği | Bir işleme zinciri kendiliğinden fazladan bilgi yaratamaz. |
3. Kanonik fiziksel ölçü
Çalışmada her ilkel öğe için Gibbs ağırlığı kullanılır:
\[ p_i = \frac{e^{-E_i/k_B T}}{Z^{(k)}} \]
\[ Z^{(k)} = \sum_{j=1}^{N_k} e^{-E_j/k_B T} \]
Burada pi, i’inci öğenin ağırlığıdır. Ei, enerji; kB, Boltzmann sabiti; T, sıcaklık; Z(k), bölüm fonksiyonu; Nk, k düzeyindeki eleman sayısıdır. Bu yapı, düşük enerjili durumların daha yüksek olasılık ağırlığına sahip olduğu bir fiziksel ölçü kurar.
4. Mekanizma maliyeti ve Ec
Mekanizma maliyeti:
\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]
Enerji bütçesine göre kabul edilen mekanizmalar:
\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]
Kritik enerji eşiği:
\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]
Bu üç formül birlikte çalışmanın enerji-çeşitlilik dengesini kurar. Mekanizmaların maliyeti vardır; enerji bütçesi bu mekanizmaların hangilerinin çalışabileceğini belirler; Ec ise mekanizma çeşitliliğinin rejim değiştirdiği kritik eşiktir.
5. Ana teorik sonuçlar
| Sonuç | Çalışmadaki işlevi | Koşul / dikkat notu |
|---|---|---|
| Physical Feasibility Theorem | Üretilen varlıkların termodinamik ve bilgi kuramsal kısıtları birlikte sağladığını savunur. | A1–A4 varsayımlarına dayanır. |
| Energy-Diversity Theorem | Enerji ile mekanizma çeşitliliği arasındaki ilişkiyi ve Ec eşiğini kurar. | A1–A6 varsayımları altında yakınsama sonucu verir. |
| Universal Feature Convergence | Aynı P kısıtlarını paylaşan sistemlerin aynı sabit noktaya yakınsayabileceğini söyler. | A5 ve A6 kritik rol oynar. |
| Causal Emergence Theorem | Sabit noktanın mikro düzeye göre daha yüksek Effective Information taşıyabileceğini savunur. | NDA varsayımı gerekir. |
6. Grokking deney düzeneği
| Deney öğesi | Çalışmada verilen bilgi |
|---|---|
| Görev | Modüler toplama: (a+b) mod p |
| Model | 2 katmanlı transformer, 128 boyut, 4 head |
| Optimizasyon | Full-batch AdamW, sabit öğrenme oranı 10-3 |
| Ana deneyler | 90 koşu: p ∈ {23, 31, 41}, frac ∈ {0.40, 0.50, 0.60}, λ ∈ {1.0, 2.0}, 5 seed |
| Doğrulama deneyleri | 21 koşu: p ∈ {53, 67, 83, 97} ve p = 97 için λ ∈ {1.0, 2.0, 4.0} |
| Grokking ölçütü | Test doğruluğunun iki ardışık değerlendirmede %95’i aşması |
| Kaydedilen değişkenler | Gradient energy, ağırlık normu, eğitim/test doğruluğu |
7. Ampirik bulgular
| Bulgular | Raporlanan değer | Yorum |
|---|---|---|
| Grokked koşular | 89/90 ana koşu | Modellerin büyük çoğunluğu grokking davranışı göstermiştir. |
| Final test doğruluğu | 0.9745 ± 0.014 | Farklı p, frac, λ ve seed koşullarına rağmen dar bir aralıkta yakınsama. |
| Varyasyon katsayısı | Yaklaşık %1.47 | Final doğrulukların düşük göreli değişkenliğe sahip olduğu belirtilir. |
| Ağırlık normu Ec izi | %92.1 koşuda grokking’den önce zirve; medyan öncül süre ≈ 1.050 adım | Ec geçişinin ampirik parmak izi olarak yorumlanır. |
| Tanh çöküşü | Per-run R2 = 0.93; ortalama çöküş R2 = 0.79 | Grokking, Landau-Ginzburg benzeri faz geçişi sınıfına yerleştirilir. |
| G2 ölçekleme | β = -1.39 ± 0.20, R2 = 0.91 | Revize edilen gecikme formülüyle kısmi uyumlu görülür. |
| λc geçişi | λc(p=97) ∈ (2, 4) | Aşırı weight decay mekanizma açlığına yol açabilir. |
8. Şekillerin teknik anlamı
- Şekil 1: Ağırlık normu önce yükselir, Ec çevresinde zirve yapar, sonra düşer. Aynı şeklin sağ panelinde test doğruluğu tanh benzeri bir geçişe çöker. Bu, HEF’in üç fazlı grokking anlatımının ana görsel kanıtıdır.
- Şekil 2: Final test doğrulukları p ve λ gruplarına göre anlamlı biçimde ayrışmaz. Bu, Universal Feature Convergence yorumunu desteklemek için kullanılır.
- Şekil 3: Grokking gecikmesinin p’ye göre ölçeklenmesi, λ = 4 civarındaki başarısızlık rejimi ve p büyüdükçe iki fazlı grokking’in daha eşzamanlı öğrenmeye yaklaşması gösterilir.
9. Yanlışlanabilir tahminler
| Tahmin | Alan | İddia |
|---|---|---|
| P1 | Evrimsel biyoloji | Anaerobik maya soyları, aynı filogenetik uzaklıkta aerobik soylardan daha yüksek genomik yakınsama göstermelidir. |
| P2 | Büyük dil modelleri | Daha yüksek weight decay ile eğitilen LLM’ler daha yüksek nedensel etkiye sahip temsiller üretebilir. |
| P3 | Grokking | λc(p) eşiğinin ötesinde grokking mekanizma açlığı nedeniyle başarısız olmalıdır. |
10. Güçlü yönler ve sınırlılıklar
| Güçlü yönler | Sınırlılıklar |
|---|---|
| Fiziksel ve bilgi kuramsal kısıtları tek çerçevede birleştirir. | HEF tüm emergence olaylarını açıklayan tamamlanmış bir teori olarak sunulmaz. |
| Grokking için ölçülebilir Ec parmak izi önerir. | Deneyler küçük ölçekli transformer ve modüler aritmetik görevleriyle sınırlıdır. |
| Yanlışlanabilir alanlar arası tahminler üretir. | Biyoloji, LLM ve nanoparçacık tahminleri bu metinde bağımsız doğrulanmış sonuçlar değildir. |
| Matematiksel teoremlerle açık bir iskelet kurar. | A6 metrik daralma koşulu genel durumda ek yapı veya ampirik doğrulama gerektirir. |
Kaynak ve Yöntem Notu
Bu makale, Truong Xuan Khanh tarafından hazırlanan “Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems” başlıklı çalışmaya dayanılarak hazırlanmıştır. Çalışmada yazarın H&K Research Studio, Clevix LLC, Hanoi, Vietnam bağlantısı ve Mayıs 2026 tarihi verilmiştir. Metnin ilk sayfasında arXiv gönderim bilgisi bulunduğu için çalışma, arXiv gönderimi / preprint niteliğinde teorik-ampirik araştırma çalışması olarak ele alınmıştır.
Metin içinde hakemli bir dergide yayımlandığını, DOI ile nihai yayına dönüştüğünü veya hakem değerlendirmesinden geçtiğini gösteren açık bilgi doğrulanamadığı için çalışma için hakemliği metin üzerinden doğrulanamayan çalışma ifadesi kullanılmalıdır. Bu nedenle HEF’in geniş kapsamlı iddiaları, özellikle biyoloji, büyük dil modelleri ve nanoparçacık uygulamaları açısından dikkatli değerlendirilmelidir.
Bu içerikte yalnızca çalışmada verilen teorik tanımlar, formüller, deney koşulları, görsel bulgular, sayısal sonuçlar, sınırlılıklar ve açık tahminler kullanılmıştır. PDF’de bulunmayan kesin hakemli yayın kabulü, tüm yapay zekâ sistemlerinde doğrulanmış genelleme, biyolojik tahminlerin tamamlanmış deneysel kanıtı, klinik etki, ticari başarı veya güvenlik garantisi gibi iddialar eklenmemiştir.
Çalışmanın grokking bulguları, modüler aritmetik görevlerinde küçük ölçekli transformer deneyleriyle desteklenmiştir. HEF’in diğer alanlara uygulanması ise metinde daha çok teorik eşleme ve test edilebilir tahmin düzeyinde sunulur. Bu nedenle çalışma, güçlü bir matematiksel öneri ve deneysel başlangıç kanıtı içerse de, nihai değeri bağımsız tekrarlar ve yeni alanlarda yapılacak doğrulama/yanlışlama çalışmalarıyla belirlenecektir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir