Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Riyaziyyat / Mürəkkəb Sistemlərdə Ortaya Çıxışın Həddi: HEF Çərçivəsi Süni İntellekti, Təkamülü və Fizikanı Eyni Faza Keçidi Məntiqində Necə Birləşdirir?
Riyaziyyat

Mürəkkəb Sistemlərdə Ortaya Çıxışın Həddi: HEF Çərçivəsi Süni İntellekti, Təkamülü və Fizikanı Eyni Faza Keçidi Məntiqində Necə Birləşdirir?

Elmdə “ortaya çıxış”, yaxud ingiliscə emergence, sadə hissələrin birləşməsi nəticəsində həmin hissələrin ayrı-ayrılıqda malik olmadığı yeni nizamın, davranışın və ya funksiyanın yaranması deməkdir.

29/06/2026  Veri Anla 26 baxış
Mürəkkəb Sistemlərdə Ortaya Çıxışın Həddi: HEF Çərçivəsi Süni İntellekti, Təkamülü və Fizikanı Eyni Faza Keçidi Məntiqində Necə Birləşdirir?

Elmdə “ortaya çıxış”, yaxud ingiliscə qarşılığı ilə emergence, sadə hissələrin birləşməsi nəticəsində həmin hissələrin ayrı-ayrılıqda malik olmadığı yeni nizamın, davranışın və ya funksiyanın yaranması deməkdir. Neyron şəbəkəsinin yalnız ədədi çəkilərdən ibarət olmasına baxmayaraq şəkillərdə kənarları, əyriləri və ya abstrakt xüsusiyyətləri ayırd etməyə başlaması buna nümunədir. Eyni şəkildə sadə molekullardan metabolik şəbəkələrin yaranması və ya fiziki sahələrdə nizamlı fazaların ortaya çıxması da emergence müzakirələrinin mərkəzindədir.

Lakin bu tədqiqat yalnız “mürəkkəb sistemlərdə yeni xüsusiyyətlər yaranır” deməklə kifayətlənmir. Daha konkret bir suala fokuslanır: Niyə fərqli sistemlər bəzən eyni nəticəyə yaxınlaşır? Əgər iki neyron şəbəkəsi fərqli başlanğıc çəkiləri ilə öyrədilir, lakin oxşar daxili təsvirlər yaradırsa, bu sadəcə təsadüfdürmü? Əgər fərqli təkamül xətləri eyni metabolik həll siniflərinə təkrar-təkrar çatırsa, bu yalnız ekoloji təzyiqin kobud nəticəsidirmi? Əgər grokking fərqli tapşırıqlarda qəfil ümumiləşdirmə formasında ortaya çıxırsa, bu ani keçidin vaxtı və forması hansı struktur səbəblərdən asılıdır?

Müəllifin cavabı budur ki, bu hadisələrin arxasında ortaq mexanizm rəqabəti strukturu ola bilər. Sistemdə bir neçə mümkün mexanizm vardır. Bəziləri sürətli, lakin səthi həllər yaradır; bəziləri daha yavaş, amma daha ümumi və sabit həllər qurur. Süni intellektdə grokking nümunəsində bunu əzbərləmə mexanizmi ilə ümumiləşdirmə mexanizmi arasındakı rəqabət kimi düşünmək olar. Model əvvəlcə təlim məlumatını əzbərləyə bilər; lakin weight decay kimi proseslər zamanla əzbərləmə həllini daha bahalı hala gətirərkən ümumiləşdirmə dövrəsinin üstünləşməsinə imkan verə bilər.

Tədqiqatın əsas anlayışlarından biri kritik enerji həddidir:

\[ E_c \]

Burada Ec, sistemin davranış rejimini dəyişdirən kritik enerji büdcəsidir. E yüksək olduqda sistem eyni anda bir neçə mexanizmi “qarşılaya” bilər; bu, kəşf və rəqabət rejimidir. E kritik həddin ətrafına gəldikdə mexanizmlər arasındakı seçim kəskinləşir. E < Ec olduqda isə ən aşağı xərcli və ya fiziki məhdudiyyətlər baxımından ən sabit mexanizm üstün olur və sistem sabit nöqtəyə doğru yaxınlaşır.

Bu məntiq fiziki faza keçidlərinə bənzəyir. Suyun temperaturu düşərkən molekullar birdən “buz olmağı seçmir”; lakin müəyyən həddə sistemin nizamı keyfiyyətcə dəyişir. HEF-in grokking şərhində də modelin test dəqiqliyi uzun müddət aşağı qala bilər; sonra sistem müəyyən daxili həddi keçdikdə ümumiləşdirmə davranışı sürətlə meydana çıxır.

HEF çərçivəsi bu altılı quruluşla müəyyən edilir:

\[ H = (R^{(1)}, L, A_0, G, mode, E) \]

Bu formulda H, Hierarchical Emergence Framework nümunəsini təmsil edir. R(1), sistemin başlanğıcdakı ilkin elementlər çoxluğudur. Maşın öyrənməsində bu, token embeddingləri kimi aşağı səviyyəli təsvir elementləri ola bilər. Biologiyada prebiotik molekullar; fizikada isə Fourier modları nümunə göstərilir. L, bu elementlərdən məntiqi ifadələr qurmağa yarayan dili göstərir. A0, başlanğıc mexanizmlər çoxluğudur. G, yeni mexanizmlər yarada bilən qaydadır. mode, sistemin idarə olunan rejimdə, yoxsa öz-özünə yeni mexanizmlər yaradan rejimdə işlədiyini göstərir. E isə enerji büdcəsidir.

Bu quruluş tədqiqatda fiziki məhdudiyyətlər çoxluğu ilə birlikdə nəzərdən keçirilir:

\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]

Burada Pthermo termodinamik məhdudiyyətləri, Pinfo informasiya-nəzəri məhdudiyyətləri, Φ isə bu iki sahə arasındakı tərcümə xəritəsini göstərir. Tədqiqatın mühüm tərəflərindən biri termodinamik qanunlarla informasiya nəzəriyyəsi prinsiplərini eyni emergence çərçivəsində birləşdirməyə çalışmasıdır.

Termodinamik tərəfdə üç məhdudiyyət verilir:

  • P1: Enerjinin qorunması. Ümumi enerji dəyişməsi sıfır olmalıdır.
  • P2: İkinci qanun. Ümumi entropiya azalmamalıdır.
  • P3: Müsbət temperatur. Sistem T > 0 şərtində qiymətləndirilir.

İnformasiya nəzəriyyəsi tərəfində bunlara uyğun üç məhdudiyyət müəyyən edilir:

  • P4: Qarşılıqlı informasiya sərhədi. İki dəyişən arasındakı informasiya dəyişənlərin öz informasiya məzmunundan çox ola bilməz.
  • P5: Şərti entropiyanın mənfi olmaması. Bir şey məlum olduqda qalan qeyri-müəyyənlik azala bilər, amma mənfi qeyri-müəyyənlik yaranmır.
  • P6: Məlumat Emalı Bərabərsizliyi. İnformasiya emalı zəncirində sonrakı təsvir əvvəlki mənbədən öz-özünə daha çox informasiya yarada bilməz.

Bu əlaqəni anlamaq üçün tədqiqatın əsaslandığı fundamental fiziki ideyalardan biri Landauer Prinsipi ilə izah edilə bilər:

\[ W \geq k_B T \ln 2 \cdot \Delta H \]

Bu formul informasiya emalının fiziki xərcinin olduğunu bildirir. W, tələb olunan işi və ya enerji xərcini göstərir. kB, Boltzmann sabitidir. T, temperaturdur. ΔH, emal olunan və ya silinən informasiya miqdarıdır. Bu münasibət “informasiya abstrakt görünsə belə fiziki dünyada xərcsiz deyil” fikrini daşıyır. Tədqiqat mexanizmlərin seçimini də belə enerji-informasiya xərcləri ilə əlaqələndirir.

Mexanizm xərci belə yazılır:

\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]

Burada α, mexanizmi; φ, məntiqi dil daxilində qurulmuş ifadəni; ΔEα(φ), mexanizmin enerji dəyişməsini; ΔHα(φ), informasiya məzmununun dəyişməsini; Eμ, kanonik fiziki ölçü altında gözlənilən dəyəri ifadə edir. Bu formula mexanizmin yalnız işləyib-işləmədiyini deyil, fiziki və informasiya baxımından nə qədər bahalı olduğunu da ölçməyə çalışır.

Enerji büdcəsi altında qəbul olunan mexanizmlər belə müəyyən edilir:

\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]

A*, fiziki baxımdan qəbul edilə bilən bütün mexanizmlərdir. A*(E) isə E enerji büdcəsi daxilində işləyə bilən mexanizmlərin alt çoxluğudur. Bu tərif HEF-in ən mühüm düşüncəsini ehtiva edir: mexanizm məntiqi baxımdan mümkün ola bilər; lakin enerji büdcəsi onu qarşılamırsa sistemin real davranışında rol ala bilməz.

Tədqiqatda Ec, mexanizm müxtəlifliyinin kritik dəyişmə nöqtəsi kimi müəyyən edilir. Sonlu mexanizm xərcləri üçün verilən diskret xarakteristika belədir:

\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]

Bu formulda cj, sıralanmış mexanizm xərclərini; Δj, müvafiq xərc səviyyəsində büdcəyə yeni daxil olan mexanizmlərin sayını göstərir. Yəni Ec, sistemə yeni mexanizmlərin ən sürətlə daxil olduğu kritik xərc səviyyəsi kimi seçilir. Davamlı sistemlərdə bu, faza keçidlərində görünən həssaslığın artmasına bənzədilir.

HEF-in yaxınlaşma iddiası metrik daralma fikrinə əsaslanır. Tədqiqatda bu məntiq Hausdorff metriki və Banach Sabit Nöqtə Teoremi ilə qurulur:

\[ d_H(T_k(R_1), T_k(R_2)) \leq c_{\alpha^*} \cdot d_H(R_1, R_2), \quad 0 < c_{\alpha^*} < 1 \]

Bu formulda dH, iki çoxluq arasındakı Hausdorff məsafəsini; Tk, k səviyyəsindəki generativ xəritəni; R1 və R2, iki təsvir və ya varlıq çoxluğunu; cα*, daralma əmsalını təmsil edir. Əmsal 1-dən kiçikdirsə, sistem hər addımda fərqli başlanğıclardan gələn strukturları bir-birinə yaxınlaşdırır. Buna görə müəyyən şərtlər altında iki ayrı sistem eyni sabit nöqtəyə yaxınlaşa bilər.

Tədqiqatın Universal Feature Convergence nəticəsi buradan yaranır. Əgər iki HEF nümunəsi eyni P fiziki məhdudiyyətlər çoxluğunu paylaşır və E < Ec rejimində işləyirsə, başlanğıc elementləri, arxitektura detalları və ya generasiya yolları fərqli olsa belə eyni sabit nöqtə təsvir sinfinə yaxınlaşa bilər. Süni intellekt baxımından bu, fərqli modellərin niyə oxşar daxili təsvirlər inkişaf etdirdiyini izah etmək üçün namizəd mexanizm təqdim edir.

Tədqiqat yaxınlaşmanın təkbaşına “səbəbli ortaya çıxış” demək olmadığını da vurğulayır. Çünki hər şeyi tək sabit çıxışa sıxışdıran mənasız mexanizm də yaxınlaşa bilər; lakin bu, mənalı səbəb gücü yaratmır. Buna görə tədqiqat Effective Information anlayışından istifadə edir:

\[ EI_k = H_{\mu}(T_k(R^{(k)})) - H_{\mu}(T_k(R^{(k)}) \mid R^{(k)}) \]

Burada EIk, k səviyyəsində effektiv informasiyanı göstərir. Birinci termin çıxış müxtəlifliyini, ikinci termin isə girdi məlum olsa da qalan səbəb səs-küyünü ifadə edir. E < Ec rejimində mexanizm seçimi daha deterministik hala gəlsə, səbəb səs-küyü azalır. Tədqiqatın Causal Emergence Theorem nəticəsi müəyyən əlavə fərziyyələr altında sabit nöqtə səviyyəsinin mikro səviyyəyə nisbətən daha yüksək effektiv informasiya daşıya biləcəyini müdafiə edir.

Maşın öyrənməsi nümunəsində HEF xüsusilə grokking prosesinə tətbiq edilir. Grokking modelin təlim məlumatını əzbərlədikdən xeyli sonra test məlumatında ümumiləşdirməyə başlamasıdır. Bu tədqiqatda grokking üçfazalı HEF trayektoriyası kimi təsvir edilir:

  1. Kəşf rejimi: E > Ec. Əzbərləmə və ümumiləşdirmə mexanizmləri birlikdə mövcuddur. Təlim dəqiqliyi yüksələrkən test dəqiqliyi aşağı qala bilər.
  2. Grok boşluğu: Model təlim məlumatını əzbərləyib, lakin ümumiləşdirmə dövrəsi hələ dominant deyil. Çəki norması faza sərhədinə yaxınlaşarkən zirvəyə çatır.
  3. Yaxınlaşma rejimi: E < Ec. Ümumiləşdirmə mexanizmi üstün olur; test dəqiqliyi sürətlə yüksəlir və sabit platoya yaxınlaşır.

Tədqiqatda grokking gecikməsi üçün yenidən işlənmiş miqyaslama münasibəti budur:

\[ \Delta t \propto \frac{1}{frac \cdot p \cdot \lambda} \]

Burada Δt, grokking gecikməsini; frac, təlim məlumatı fraksiyasını; p, modulyar arifmetika tapşırığındakı sadə ədədi; λ, weight decay, yəni çəki zəifləməsi əmsalını təmsil edir. Bu münasibət müəyyən orta λ rejimlərində daha çox təlim siqnalı və uyğun weight decay təzyiqinin ümumiləşdirmə dövrəsinin daha erkən qurulmasına kömək edə biləcəyini bildirir.

Lakin tədqiqat burada mühüm məhdudiyyət də qoyur. λ çox yüksəldikdə sistem ümumiləşdirmə mexanizmini quracaq siqnalı da itirə bilər. Bu hal mechanism starvation, yəni mexanizm aclığı adlandırılır. p = 97 üçün kritik interval belə verilir:

\[ \lambda_c(p=97) \in (2, 4) \]

Bu, λ = 1 və λ = 2 dəyərlərində grokking etibarlı şəkildə müşahidə edilərkən λ = 4 səviyyəsində bəzi gedişlərin uğursuz olması ilə əlaqələndirilir. Beləliklə tədqiqat weight decay-in həmişə artırılmalı olan sadə parametr olduğunu demir; müəyyən həddən sonra mexanizmin yaranmasını poza biləcəyini müdafiə edir.

Tədqiqatın eksperimental bölməsində istifadə olunan əsas tapşırıq modulyar toplama problemidir:

\[ (a+b) \mod p \]

Bu tapşırıqda modelin yalnız nümunələri əzbərləməsi kifayət deyil; həqiqətən ümumiləşdirmə edə bilməsi üçün modulyar strukturu öyrənməsi lazımdır. Buna görə grokking tədqiqatlarında tez-tez istifadə edilən sınaq sahəsidir.

Təcrübələrdə 2 qatlı transformer, 128 ölçülü təsvir, 4 attention head, full-batch AdamW və sabit 10-3 öyrənmə sürəti istifadə olunur. Əsas təcrübə dəstində p ∈ {23, 31, 41}, təlim fraksiyası frac ∈ {0.40, 0.50, 0.60}, weight decay λ ∈ {1.0, 2.0} və beş fərqli seed yer alır. Doğrulama dəstində p ∈ {53, 67, 83, 97} və p = 97 üçün əlavə λ təcrübələri mövcuddur.

Tədqiqatın ən güclü empirik məqamlarından biri grokked modellərin son test dəqiqliklərinin dar intervalda toplanmasıdır:

\[ 0.9745 \pm 0.014 \]

Bu nəticə variasiya əmsalının təxminən %1.47 olması ilə birlikdə, fərqli hiperparametr şərtlərinə baxmayaraq eyni sabit nöqtə təsvir davranışına yaxınlaşma iddiasını dəstəkləmək üçün istifadə olunur. Lakin bu nəticə konkret kiçikmiqyaslı transformer və modulyar arifmetika təcrübələri kontekstindədir; bütün süni intellekt sistemlərinə birbaşa ümumiləşdirilmiş qəti nəticə deyil.

Tədqiqatdakı şəkillər nəzəri iddianın vizual onurğasını təşkil edir. Şəkil 1-in sol panelində çəki normasının təlim boyu əvvəlcə yüksəldiyi, sonra Ec ətrafında zirvəyə çatdığı və ardınca düşdüyü göstərilir. Bu zirvənin grokking hadisəsindən median olaraq təxminən 1.050 addım əvvəl gəldiyi bildirilir. Bu, tədqiqatda Ec keçidinin empirik barmaq izi kimi şərh edilir.

Şəkil 1-in sağ panelində normallaşdırılmış test dəqiqliyi əyriləri tanh formalı keçid əyrisi üzərinə çökür. Bu əyri belə yazılır:

\[ \sigma(t) = \frac{1}{2}\left(1 + \tanh\left(\frac{t-\Delta t}{\tau}\right)\right) \]

Burada σ(t), normallaşdırılmış test dəqiqliyinə bənzər keçid funksiyasıdır. t, təlim zamanını; Δt, grokking keçid vaxtını; τ, keçidin genişliyini və ya kəskinliyini müəyyən edən zaman miqyasını göstərir. Tanh funksiyası aşağı vəziyyətdən yüksək vəziyyətə yumşaq, amma aydın keçid yaradır. Buna görə tədqiqat grokking davranışını Landau-Ginzburg mean-field universallıq sinfi ilə əlaqələndirir.

Şəkil 2 son test dəqiqliklərinin paylanmasını və p ilə λ qruplarına görə ayrılıb-ayrılmadığını göstərir. Qrafikdə modellərin təxminən eyni son dəqiqlik zolağında toplandığı və p ilə λ təsirinin əhəmiyyətli olmadığı bildirilir. Bu, Universal Feature Convergence iddiasının eksperimental dəstəyi kimi şərh edilir.

Şəkil 3 grokking gecikməsinin p-yə görə miqyaslanmasını və λc keçidini göstərir. Soldakı log-log qrafikdə müşahidə olunan meyl:

\[ \beta = -1.39 \pm 0.20 \]

kimi verilir və R2 = 0.91 hesabat olunur. Bu nəticə yenidən işlənmiş [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] münasibəti ilə qismən uyğun sayılır. Ortadakı paneldə λ = 4 şərtində bəzi seed-lərin uğursuz olduğu göstərilərək mexanizm aclığı sinfi dəstəklənir. Sağdakı panel isə p böyüdükcə klassik iki mərhələli grokking davranışının daha sinxron öyrənmə görünüşünə yaxınlaşa biləcəyini göstərir.

HEF-in maraqlı tərəfi tədqiqatın bunu yalnız maşın öyrənməsinə tətbiq etməməsidir. Biologiyada prebiotik molekullardan avtokatalitik şəbəkələrə və metabolik yaxınlaşmaya, fizikada Fourier modları və renormallaşdırma qrupu axınlarına, nanohissəcik siqnal aşkarlanmasında bağlanma konfiqurasiyalarına qədər fərqli nümunələr verilir. Bu nümunələrin hamısında eyni sual soruşulur: İlkin elementlər nələrdir, hansı mexanizmlər mümkündür, hansı fiziki-informasiya məhdudiyyətləri keçərlidir və kritik enerji həddi hansı yaxınlaşmanı yaradır?

Tədqiqatın üç falsifikasiya oluna bilən proqnozu vardır. Birincisi, anaerob maya xətlərinin eyni filogenetik uzaqlıqdakı aerob xətlərdən daha yüksək genomik yaxınlaşma göstərməsidir. İkincisi, daha yüksək weight decay ilə öyrədilən böyük dil modellərinin daha yüksək səbəb təsirinə malik təsvirlər yaratmasıdır. Üçüncüsü, kritik λc(p) həddindən sonra grokking-in mexanizm aclığı səbəbindən uğursuz olmasıdır.

Bu proqnozlar vacibdir, çünki nəzəriyyə yalnız keçmiş müşahidələri izah edən elastik izah kimi qalmaq istəmir. Öz yanlışlanma yollarını da təqdim edir. Əgər anaerob xətlər gözlənən yaxınlaşmanı göstərməzsə, LLM təsvirlərində weight decay ilə səbəb təsiri arasında gözlənən əlaqə tapılmazsa və ya λc həddi eksperimental olaraq dəstəklənməzsə, HEF-in əhatəsi daraldılmalı və ya model yenidən işlənməlidir.

Tədqiqatın gündəlik həyata təsiri birbaşa cihaz, dərman və ya proqram məhsulu yaratmaq deyil. Lakin süni intellekt sistemlərinin təlim davranışını anlamaq, əzbərləmə ilə ümumiləşdirmə arasındakı keçidləri ölçmək, hiperparametr tənzimləmələrində kritik hədləri görmək və mürəkkəb sistemlərdə niyə oxşar həllərin təkrar-təkrar ortaya çıxdığını izah etmək baxımından konseptual töhfə təqdim edir. Əgər HEF daha geniş təcrübələrlə dəstəklənərsə, süni intellekt təlim proseslərində “model nə zaman həqiqətən öyrənməyə başlayır?” sualına daha ölçülə bilən cavablar verilə bilər.

Tədqiqatın güclü tərəfləri açıq riyazi struktur qurması, fiziki və informasiya-nəzəri məhdudiyyətləri birlikdə nəzərdən keçirməsi, grokking təcrübələrindən rəqəmsal dəstək təqdim etməsi, şəkillərlə ölçülə bilən Ec barmaq izi təklif etməsi və sahələrarası falsifikasiya oluna bilən proqnozlar yaratmasıdır.

Məhdudiyyətlər isə ən az güclü tərəflər qədər vacibdir. HEF bütün emergence hadisələrini izah edən tamamlanmış nəzəriyyə deyil. A6 metrik daralma şərti ümumi halda avtomatik çıxmır; tədqiqat bunun üçün əlavə struktur şərtləri və ya empirik doğrulama lazım olduğunu qəbul edir. Grokking təcrübələri kiçikmiqyaslı transformer və modulyar arifmetika tapşırıqları ilə məhduddur. Biologiya, böyük dil modeli və nanohissəcik proqnozları bu mətndə tamamlanmış müstəqil doğrulamalar deyil, gələcəkdə sınaqdan keçirilməli proqnozlardır. Reproducibility bölməsində Zenodo DOI sahəsinin “to be deposited” kimi görünməsi də məlumat arxivi məlumatının mətn üzərindən tamamlanmadığını göstərir.

Buna görə tədqiqat yekunlaşmış ümumi emergence qanunu kimi deyil, mürəkkəb sistemlərdə yaxınlaşma hadisələrini faza keçidləri və mexanizm landşaftları vasitəsilə izah etməyə çalışan iddialı, riyazi və sınaqdan keçirilə bilən çərçivə kimi oxunmalıdır.

Tədqiqatın Metodu və Nəticələri

Tədqiqatın metodu dörd əsas ox üzərində qurulub: HEF-in riyazi tərifi, fiziki-informasiya nəzəri əsas, sabit nöqtə və səbəbli ortaya çıxış teoremləri, grokking təcrübələri ilə empirik sınaq.

1. HEF tuple quruluşu

KomponentTərifMaşın öyrənməsi nümunəsi
R(1)Başlanğıc ilkin elementlər çoxluğuToken embeddingləri
Lİlkin elementlərdən ifadələr quran məntiqi dilAttention nümunələri və dövrə strukturları
A0Başlanğıc mexanizmlər çoxluğuÇəki başlanğıcı və model komponentləri
GYeni mexanizm indeksləri yaradan qaydaGradient descent / optimallaşdırma prosesi
modeİdarə olunan və ya öz-özünə generativ iş rejimiİdarə olunan təlim prosesi
EEnerji büdcəsiη∥∇L∥2 kimi təlim enerjisi proksiləri

2. Fiziki və informasiya-nəzəri məhdudiyyətlər

Termodinamik məhdudiyyətİnformasiya-nəzəri qarşılıqMənası
P1: Enerjinin qorunmasıP4: Qarşılıqlı informasiya sərhədiİnformasiya istehsalı fiziki xərcdən ayrı düşünülə bilməz.
P2: İkinci qanunP5: Şərti entropiya ≥ 0Qeyri-müəyyənlik və entropiya fiziki proseslərdə mənfiləşmir.
P3: Müsbət temperaturP6: Məlumat Emalı BərabərsizliyiEmal zənciri öz-özünə əlavə informasiya yarada bilməz.

3. Kanonik fiziki ölçü

Tədqiqatda hər ilkin element üçün Gibbs çəkisi istifadə olunur:

\[ p_i = \frac{e^{-E_i/k_B T}}{Z^{(k)}} \]

\[ Z^{(k)} = \sum_{j=1}^{N_k} e^{-E_j/k_B T} \]

Burada pi, i-ci elementin çəkisidir. Ei, enerji; kB, Boltzmann sabiti; T, temperatur; Z(k), bölmə funksiyası; Nk, k səviyyəsindəki elementlərin sayıdır. Bu struktur aşağı enerjili vəziyyətlərin daha yüksək ehtimal çəkisinə malik olduğu fiziki ölçü qurur.

4. Mexanizm xərci və Ec

Mexanizm xərci:

\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]

Enerji büdcəsinə görə qəbul edilən mexanizmlər:

\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]

Kritik enerji həddi:

\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]

Bu üç formula birlikdə tədqiqatın enerji-müxtəliflik tarazlığını qurur. Mexanizmlərin xərci var; enerji büdcəsi bu mexanizmlərdən hansının işləyə biləcəyini müəyyən edir; Ec isə mexanizm müxtəlifliyinin rejim dəyişdirdiyi kritik həddir.

5. Əsas nəzəri nəticələr

NəticəTədqiqatdakı funksiyasıŞərt / diqqət qeydi
Physical Feasibility TheoremYaradılan varlıqların termodinamik və informasiya-nəzəri məhdudiyyətləri birlikdə təmin etdiyini müdafiə edir.A1–A4 fərziyyələrinə əsaslanır.
Energy-Diversity TheoremEnerji ilə mexanizm müxtəlifliyi arasındakı əlaqəni və Ec həddini qurur.A1–A6 fərziyyələri altında yaxınlaşma nəticəsi verir.
Universal Feature ConvergenceEyni P məhdudiyyətlərini paylaşan sistemlərin eyni sabit nöqtəyə yaxınlaşa biləcəyini bildirir.A5 və A6 kritik rol oynayır.
Causal Emergence TheoremSabit nöqtənin mikro səviyyəyə nisbətən daha yüksək Effective Information daşıya biləcəyini müdafiə edir.NDA fərziyyəsi tələb olunur.

6. Grokking təcrübə quruluşu

Təcrübə elementiTədqiqatda verilən məlumat
TapşırıqModulyar toplama: (a+b) mod p
Model2 qatlı transformer, 128 ölçü, 4 head
OptimallaşdırmaFull-batch AdamW, sabit öyrənmə sürəti 10-3
Əsas təcrübələr90 gediş: p ∈ {23, 31, 41}, frac ∈ {0.40, 0.50, 0.60}, λ ∈ {1.0, 2.0}, 5 seed
Doğrulama təcrübələri21 gediş: p ∈ {53, 67, 83, 97} və p = 97 üçün λ ∈ {1.0, 2.0, 4.0}
Grokking meyarıTest dəqiqliyinin iki ardıcıl qiymətləndirmədə %95-i keçməsi
Qeydə alınan dəyişənlərGradient energy, çəki norması, təlim/test dəqiqliyi

7. Empirik tapıntılar

TapıntıHesabat verilən dəyərŞərh
Grokked gedişlər89/90 əsas gedişModellərin böyük əksəriyyəti grokking davranışı göstərmişdir.
Son test dəqiqliyi0.9745 ± 0.014Fərqli p, frac, λ və seed şərtlərinə baxmayaraq dar intervalda yaxınlaşma.
Variasiya əmsalıTəxminən %1.47Son dəqiqliklərin aşağı nisbi dəyişkənliyə malik olduğu qeyd olunur.
Çəki norması Ec izi%92.1 gedişdə grokking-dən əvvəl zirvə; median öncül müddət ≈ 1.050 addımEc keçidinin empirik barmaq izi kimi şərh edilir.
Tanh çöküşüPer-run R2 = 0.93; orta çöküş R2 = 0.79Grokking Landau-Ginzburg-a bənzər faza keçidi sinfinə yerləşdirilir.
G2 miqyaslamasıβ = -1.39 ± 0.20, R2 = 0.91Yenidən işlənmiş gecikmə formulu ilə qismən uyğun sayılır.
λc keçidiλc(p=97) ∈ (2, 4)Həddən artıq weight decay mexanizm aclığına səbəb ola bilər.

8. Şəkillərin texniki mənası

  • Şəkil 1: Çəki norması əvvəlcə yüksəlir, Ec ətrafında zirvəyə çatır, sonra düşür. Eyni şəklin sağ panelində test dəqiqliyi tanh-a bənzər keçidə çökür. Bu, HEF-in üçfazalı grokking təsvirinin əsas vizual sübutudur.
  • Şəkil 2: Son test dəqiqlikləri p və λ qruplarına görə əhəmiyyətli şəkildə ayrılmır. Bu, Universal Feature Convergence şərhini dəstəkləmək üçün istifadə olunur.
  • Şəkil 3: Grokking gecikməsinin p-yə görə miqyaslanması, λ = 4 ətrafındakı uğursuzluq rejimi və p böyüdükcə ikifazalı grokking-in daha sinxron öyrənməyə yaxınlaşması göstərilir.

9. Falsifikasiya oluna bilən proqnozlar

ProqnozSahəİddia
P1Təkamül biologiyasıAnaerob maya xətləri eyni filogenetik uzaqlıqdakı aerob xətlərdən daha yüksək genomik yaxınlaşma göstərməlidir.
P2Böyük dil modelləriDaha yüksək weight decay ilə öyrədilən LLM-lər daha yüksək səbəb təsirinə malik təsvirlər yarada bilər.
P3Grokkingλc(p) həddindən sonra grokking mexanizm aclığı səbəbindən uğursuz olmalıdır.

10. Güclü tərəflər və məhdudiyyətlər

Güclü tərəflərMəhdudiyyətlər
Fiziki və informasiya-nəzəri məhdudiyyətləri vahid çərçivədə birləşdirir.HEF bütün emergence hadisələrini izah edən tamamlanmış nəzəriyyə kimi təqdim edilmir.
Grokking üçün ölçülə bilən Ec barmaq izi təklif edir.Təcrübələr kiçikmiqyaslı transformer və modulyar arifmetika tapşırıqları ilə məhduddur.
Falsifikasiya oluna bilən sahələrarası proqnozlar yaradır.Biologiya, LLM və nanohissəcik proqnozları bu mətndə müstəqil doğrulanmış nəticələr deyil.
Riyazi teoremlərlə açıq skelet qurur.A6 metrik daralma şərti ümumi halda əlavə struktur və ya empirik doğrulama tələb edir.

Mənbə və Metod Qeydi

Bu məqalə Truong Xuan Khanh tərəfindən hazırlanmış “Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems” başlıqlı tədqiqata əsasən hazırlanmışdır. Tədqiqatda müəllifin H&K Research Studio, Clevix LLC, Hanoi, Vietnam əlaqəsi və May 2026 tarixi verilib. Mətnin ilk səhifəsində arXiv göndəriş məlumatı olduğuna görə tədqiqat arXiv göndərişi / preprint xarakterli nəzəri-empirik tədqiqat işi kimi nəzərdən keçirilib.

Mətndə onun resenziyalı jurnalda yayımlandığını, DOI ilə yekun nəşrə çevrildiyini və ya resenziya qiymətləndirməsindən keçdiyini göstərən açıq məlumat təsdiqlənə bilmədiyi üçün tədqiqat üçün resenziya vəziyyəti mətn əsasında təsdiqlənə bilməyən iş ifadəsi işlədilməlidir. Buna görə HEF-in genişmiqyaslı iddiaları, xüsusilə biologiya, böyük dil modelləri və nanohissəcik tətbiqləri baxımından ehtiyatla qiymətləndirilməlidir.

Bu məzmunda yalnız tədqiqatda verilən nəzəri təriflər, formullar, təcrübə şərtləri, vizual tapıntılar, rəqəmsal nəticələr, məhdudiyyətlər və açıq proqnozlar istifadə edilmişdir. PDF-də olmayan qəti resenziyalı nəşr qəbulu, bütün süni intellekt sistemlərində doğrulanmış ümumiləşdirmə, bioloji proqnozların tamamlanmış eksperimental sübutu, klinik təsir, kommersiya uğuru və ya təhlükəsizlik zəmanəti kimi iddialar əlavə edilməmişdir.

Tədqiqatın grokking tapıntıları modulyar arifmetika tapşırıqlarında kiçikmiqyaslı transformer təcrübələri ilə dəstəklənmişdir. HEF-in digər sahələrə tətbiqi isə mətndə daha çox nəzəri uyğunlaşdırma və sınaqdan keçirilə bilən proqnoz səviyyəsində təqdim olunur. Buna görə tədqiqat güclü riyazi təklif və ilkin eksperimental sübutlar ehtiva etsə də, yekun dəyəri müstəqil təkrarlar və yeni sahələrdə aparılacaq doğrulama/yanlışlama tədqiqatları ilə müəyyən ediləcək.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy