
Tədqiqatın əsas problemi elmdə uzun müddətdir ayrı-ayrılıqda müzakirə edilən bəzi yaxınlaşma hadisələrinin ortaq riyazi izaha malik olub-olmamasıdır. Süni intellektdə fərqli arxitekturalarla və ya fərqli başlanğıc şərtləri ilə öyrədilən modellərin oxşar təsvirlər inkişaf etdirməsi yalnız praktik mühəndislik müşahidəsi deyil. Əgər həqiqətən fərqli modellər eyni tip daxili strukturlara yaxınlaşırsa, bu hal “öyrənilən təsvir”in sadəcə təsadüfi təlim prosesinin məhsulu olmadığını, sistemin məhdudiyyətləri tərəfindən istiqamətləndirilən daha dərin bir struktur ola biləcəyini düşündürür.
İkinci problem grokking davranışıdır. Grokking, modelin əvvəlcə təlim məlumatını əzbərləməsi, uzun müddət test məlumatında uğursuz qalması, sonra isə qəfil ümumiləşdirməyə başlamasıdır. Gündəlik bənzətmə ilə bu, şagirdin əvvəlcə bütün nümunələri əzbərləyib problemi həqiqətən anlamaması, lakin uzun gözləmə dövründən sonra birdən “qaydanı dərk etməsi” kimidir. Süni intellekt kontekstində bu proses daha texniki məna daşıyır: modelin əzbərləmə dövrəsindən ümumiləşdirmə dövrəsinə keçdiyi düşünülür.
Üçüncü problem biologiyadan gəlir. Fərqli təkamül xətlərinin uzun və müstəqil təkamül tarixlərinə baxmayaraq oxşar metabolik həllərə çatması klassik mənada “ortaq seçmə təzyiqi” ilə izah oluna bilər; lakin tədqiqat bunun kəmiyyət və struktur baxımından niyə bu qədər tez-tez və müəyyən formalarda baş verdiyinin daha ümumi çərçivədə nəzərdən keçirilə biləcəyini müdafiə edir.
Tədqiqatın əsas təklifi bu üç müşahidəni vahid prinsipə bağlamaqdır: sistemlərdə rəqabət aparan mexanizmlər mövcuddur; bu mexanizmlər enerji, entropiya, informasiya və fiziki uyğunluq kimi məhdudiyyətlər altında yarışır; enerji büdcəsi kritik hədd olan Ec ətrafında dəyişdikdə sistem çoxsaylı ehtimallar məkanından daha dar və sabit həllə doğru keçir.
Bu fikri anlamaq üçün faza keçidi anlayışı vacibdir. Fizikada suyun buza çevrilməsi və ya maqnitləşmədə nizamın meydana çıxması kimi hadisələrdə sistem tədricən dəyişirmiş kimi görünsə də, müəyyən həddə keyfiyyətcə dönüş baş verir. Tədqiqat grokking kimi süni intellekt hadisələrini də belə keçidə bənzədir: model bir müddət əzbərləmə və ümumiləşdirmə mexanizmləri arasında rəqabət aparır, sonra müəyyən nöqtədə ümumiləşdirmə mexanizmi üstün olur.
HEF-in riyazi nüvəsi aşağıdakı tuple ilə verilir:
\[ H = (R^{(1)}, L, A_0, G, mode, E) \]
Bu ifadədəki dəyişənlər belə izah edilə bilər:
- R(1): Sistemin başlanğıc səviyyəsindəki ilkin elementləri ifadə edir. Maşın öyrənməsində bunlar token embeddingləri ola bilər; biologiyada prebiotik molekullar; fizikada isə sahənin Fourier modları ola bilər.
- L: Bu ilkin elementlərdən məntiqi ifadələr qurmağa imkan verən dildir. Tədqiqatda atomik ifadələr, fiziki inkar, uyğun birləşmələr, ayrılmalar, çıxarımlar və səbəb ardıcıllıqları bu dilin hissələridir.
- A0: Başlanğıcda istifadə edilə bilən mexanizmlər çoxluğudur.
- G: Yeni mexanizm indeksləri yarada bilən generasiya qaydasıdır.
- mode: Sistemin idarə olunan rejimdə, yoxsa öz-özünə yeni mexanizmlər yarada bilən rejimdə işlədiyini göstərir.
- E: Enerji büdcəsidir. Tədqiqatda yaranma və yaxınlaşma davranışının mərkəzində bu kəmiyyət dayanır.
HEF yalnız bu altılı strukturdan ibarət deyil. Tədqiqatda fiziki məhdudiyyətlər çoxluğu da belə müəyyən edilir:
\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]
Burada Pthermo termodinamik məhdudiyyətləri, Pinfo informasiya-nəzəri məhdudiyyətləri, Φ isə bu iki məhdudiyyət sahəsi arasında qurulan tərcümə xəritəsini təmsil edir. Tədqiqatın iddiasına görə termodinamik məhdudiyyətlərlə informasiya-nəzəri məhdudiyyətlər bir-birindən qopuq deyil; Landauer Prinsipi və Jarzynski Bərabərliyi kimi fiziki prinsiplərlə əlaqələndirilə bilər.
Termodinamik tərəfdə üç əsas məhdudiyyət verilir:
- P1: Enerjinin qorunması. Ümumi enerji dəyişməsi sıfır olmalıdır.
- P2: İkinci qanun. Ümumi entropiya azalmamalıdır.
- P3: Müsbət temperatur. Sistem T > 0 şərtində qiymətləndirilir.
İnformasiya nəzəriyyəsi tərəfində isə üç uyğun qarşılıq var:
- P4: Qarşılıqlı informasiya sərhədi. İki dəyişən arasındakı qarşılıqlı informasiya bu dəyişənlərin ayrı-ayrı entropiyalarından böyük ola bilməz.
- P5: Şərti entropiyanın mənfi olmaması. Bir dəyişən başqa dəyişən məlum olduqda qalan qeyri-müəyyənlik mənfi ola bilməz.
- P6: Məlumat Emalı Bərabərsizliyi yəni Data Processing Inequality. İnformasiya axını zəncirində emal olunmuş təsvir ilkin mənbədən daha çox informasiya yarada bilməz.
Tədqiqatda istifadə olunan mühüm əsas münasibətlərdən biri Landauer Prinsipi ilə əlaqəlidir. Tədqiqatın məntiqini izah etmək üçün aşağıdakı münasibət önə çıxır:
\[ W \geq k_B T \ln 2 \cdot \Delta H \]
Burada W, informasiyanın silinməsi və ya informasiya emalı prosesi üçün tələb olunan minimum işi; kB, Boltzmann sabitini; T, temperaturu; ΔH, silinən və ya dəyişdirilən informasiya miqdarını ifadə edir. Bu münasibət informasiyanın fiziki qiymətinin olduğunu göstərir. Gündəlik dillə desək, kompüterdə informasiyanı emal etmək “pulsuz” deyil; fiziki dünyada bunun enerji və entropiya qarşılığı vardır.
Tədqiqatda mexanizm xərci belə müəyyən edilir:
\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]
Bu formulda α, mexanizm indeksidir. φ, məntiqi dildə qurulan formuldur. ΔEα(φ), mexanizmin tətbiq olunduğu formulda enerji dəyişməsini; ΔHα(φ), informasiya məzmununun dəyişməsini; Eμ isə kanonik fiziki ölçü altında gözlənilən qiyməti ifadə edir. Bu formula mexanizmin yalnız “nə yaratdığını” deyil, bunu hansı fiziki-informasiya xərci ilə etdiyini ölçməyə çalışır.
Enerji büdcəsinə görə icazə verilən mexanizmlər belə yazılır:
\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]
Burada A*, fiziki baxımdan qəbul edilə bilən mexanizmlər çoxluğudur. A*(E) isə E enerji büdcəsi altında həqiqətən istifadə oluna bilən alt çoxluqdur. Bu ifadə HEF-in əsas intuitiv fikrini çox aydın göstərir: hər mexanizm nəzəri cəhətdən mümkün olsa belə, enerji büdcəsi onu qarşılamırsa sistemin real davranışında iştirak edə bilməz.
Tədqiqatdakı kritik hədd Ec burada işə düşür. Ec, mexanizm müxtəlifliyi ilə yaxınlaşma arasındakı qırılma nöqtəsi kimi təqdim edilir. E yüksək olduqda bir neçə mexanizm rəqabət apara bilər. Bu, kəşf rejiminə bənzəyir: sistem bir çox mümkün yolu sınayır, təsvir strukturları qarışıq və səs-küylü ola bilər. E, Ec həddinin altına endikdə isə yalnız ən aşağı xərcli mexanizm üstün olur; sistem tək sabit nöqtəyə doğru yaxınlaşır.
Bu hal tədqiqatda Energy-Diversity Trade-off, yəni enerji-müxtəliflik tarazlığı kimi nəzərdən keçirilir. Enerji artdıqca daha çox mexanizm əlçatan olur; lakin müəyyən şərtlərdə aşağı enerji rejimi sistemi daha güclü yaxınlaşmaya məcbur edir. Bu fikir ilk baxışda əks-intuitiv görünə bilər. Çünki gündəlik həyatda daha çox enerji daha çox imkan kimi düşünülür. Lakin burada məsələ sistemin hansı mexanizmləri “qarşılaya bildiyi” və bu mexanizmlərin necə rəqabət apardığıdır. Bəzi hallarda çoxlu mexanizm daha çox müxtəliflik, lakin daha az sabitlik demək ola bilər; aşağı enerji isə seçimləri azaldaraq sistemi tək sabit həllə yönəldə bilər.
Tədqiqatda sabit nöqtəyə yaxınlaşma Banach Sabit Nöqtə Teoremi ilə əlaqələndirilir. Sadələşdirilmiş formada, əgər bir çevirmə hər tətbiqdə nöqtələri bir-birinə daha çox yaxınlaşdırırsa, sistem sonda tək sabit nöqtəyə yaxınlaşır. Tədqiqatdakı metrik daralma ideyası bu tip münasibətlə ifadə oluna bilər:
\[ d_H(T_k(R_1), T_k(R_2)) \leq c_{\alpha^*} \cdot d_H(R_1, R_2), \quad 0 < c_{\alpha^*} < 1 \]
Burada dH, Hausdorff metrikidir; iki çoxluğun bir-birindən nə qədər uzaq olduğunu ölçür. Tk, k səviyyəsindəki generativ xəritədir. R1 və R2, iki fərqli başlanğıc və ya təsvir çoxluğu ola bilər. cα* isə 1-dən kiçik daralma əmsalıdır. Bu əmsal 1-dən kiçik olduqda hər iterasiya iki strukturu bir-birinə yaxınlaşdırır. Tədqiqatın Universal Feature Convergence iddiası bu məntiqə əsaslanır.
Tədqiqatda verilən mühüm nəticələrdən biri budur: İki HEF nümunəsi eyni fiziki məhdudiyyətlər çoxluğunu P paylaşır və E < Ec rejimində işləyirsə, başlanğıc şərtləri, arxitektura və ya təlim məlumatı fərqli olsa belə eyni sabit nöqtə təsvirinə yaxınlaşa bilər. Bu, süni intellektdə “fərqli modellər niyə oxşar xüsusiyyətlər öyrənir?” sualına namizəd izah təqdim edir.
Maşın öyrənməsi tətbiqində HEF xüsusilə modulyar arifmetik grokking təcrübələri ilə sınaqdan keçirilir. Burada model, məsələn [ (a+b) \mod p ] formasındakı tapşırıqlarda əvvəlcə təlim nümunələrini əzbərləyir, sonra gecikmiş şəkildə ümumiləşdirmə edir. Tədqiqat bu prosesi üçfazalı təsvirlə izah edir:
- Kəşf rejimi: E > Ec. Əzbərləmə mexanizmi ilə ümumiləşdirmə mexanizmi birlikdə rəqabət aparır. Təlim dəqiqliyi sürətlə arta bilər, lakin test dəqiqliyi aşağı qala bilər.
- Grok boşluğu: Model təlim məlumatını əzbərləyib, lakin ümumiləşdirmə dövrəsi hələ üstün deyil. Çəki norması Ec keçidinin empirik izi kimi zirvəyə yaxınlaşır.
- Yaxınlaşma rejimi: E < Ec. Ümumiləşdirmə mexanizmi üstün olur. Test dəqiqliyi qəfil yüksəlir və sabit platoya yaxınlaşır.
Tədqiqatda grokking gecikməsi üçün yenidən işlənmiş miqyaslama münasibəti belə verilir:
\[ \Delta t \propto \frac{1}{frac \cdot p \cdot \lambda} \]
Burada Δt, grokking gecikməsini; frac, təlim fraksiyasını; p, modulyar arifmetikada istifadə olunan sadə ədədi; λ, weight decay, yəni çəki zəifləməsi əmsalını təmsil edir. Bu formulun mənası budur: p, təlim əhatəsi və ya çəki zəifləməsi artdıqca müəyyən rejimlərdə grokking gecikməsi qısala bilər. Lakin tədqiqat bu münasibətin sərhədsiz keçərli olmadığını da vurğulayır. Xüsusilə çox yüksək λ dəyərlərində ümumiləşdirmə dövrəsi yaranmadan çəki siqnalı həddən artıq zəifləyə bilər; bu hal mechanism starvation, yəni mexanizm aclığı adlandırılır.
Tədqiqatda kritik weight decay həddi üçün bu interval bildirilir:
\[ \lambda_c(p=97) \in (2, 4) \]
Bu, p = 97 üçün λ dəyərinin 2 ilə 4 arasında kritik bölgəyə malik olduğunu göstərir. Mətndəki təcrübələrdə λ = 1 və λ = 2 şərtlərində grokking etibarlı şəkildə müşahidə edilərkən, λ = 4 şərtində bəzi seed-lərdə uğursuzluq və osillasiya görünür. Bu nəticə HEF-in sadəcə “daha çox weight decay daha sürətli grokking yaradır” kimi sadə iddia irəli sürmədiyini göstərir. Çəki zəifləməsi ümumiləşdirmə istiqamətində təzyiq yarada bilər; lakin həddən artıq olduqda lazım olan mexanizmin qurulmasına da mane ola bilər.
Tədqiqatdakı eksperimental nəticələr diqqətlə ayrılmalıdır. Xülasədə HEF-in 111 grokking təcrübəsi ilə doğrulandığı qeyd olunur. Daha detallı təcrübə bölməsində isə 90 əsas təcrübə və 21 doğrulama təcrübəsi təsvir edilir. Əsas təcrübələrdə p ∈ {23, 31, 41}, təlim fraksiyası frac ∈ {0.40, 0.50, 0.60}, weight decay λ ∈ {1.0, 2.0} və beş fərqli seed istifadə olunur. Doğrulama təcrübələrində isə p ∈ {53, 67, 83, 97} və əlavə λ sınaqları yer alır.
Ən mühüm eksperimental tapıntılardan biri əsas təcrübələrdə 90 gedişdən 89-unun grokking göstərməsidir. Bu 89 grokked modelin son test dəqiqliyi:
\[ 0.9745 \pm 0.014 \]
kimi hesabat verilir. Variasiya əmsalı təxminən %1.47-dir. ANOVA nəticələrində p, λ, frac və seed kimi amillərin son dəqiqlik üzərində əhəmiyyətli determinant olmadığı bildirilir. Tədqiqat bunu eyni fiziki məhdudiyyətləri paylaşan sistemlərin eyni sabit nöqtəyə yaxınlaşdığı iddiası ilə əlaqələndirir.
Digər mühüm tapıntı çəki norması izidir. Tədqiqatda gedişlərin %92.1-ində çəki normasının grokking hadisəsindən əvvəl zirvəyə çatdığı və median öncül müddətin təxminən 1.050 addım olduğu bildirilir. Bu, Ec keçidinin ölçülə bilən empirik barmaq izi kimi şərh edilir. Gündəlik bənzətmə ilə sistem ümumiləşdirmə davranışına keçməzdən əvvəl daxili gərginliyini ən yüksək səviyyəyə çıxarır; sonra daha nizamlı və sabit struktura oturur.
Şəkil 1 bu üçfazalı təsvirin vizual əsasını verir. Soldakı qrafik normallaşdırılmış çəki normasının təlim addımları boyunca əvvəlcə yüksəldiyini, sonra zirvəyə çatdığını və ardınca düşdüyünü göstərir. Qrafikdə bu proses “Exploration”, “Grok gap” və “Convergence” fazaları ilə əlaqələndirilir. Sağdakı qrafik isə test dəqiqliyi əyrilərinin normallaşdırılmış zaman oxunda tanh-a bənzər qırılmaya çökdüyünü göstərir. Bu vizual təsvir tədqiqatın grokking-i Landau-Ginzburg tipli faza keçidi kimi şərh etməsinin əsas dayaqlarından biridir.
Tədqiqatda tanh çöküşü bu funksiya ilə ifadə edilir:
\[ \sigma(t) = \frac{1}{2}\left(1 + \tanh\left(\frac{t-\Delta t}{\tau}\right)\right) \]
Bu formulda σ(t), normallaşdırılmış test dəqiqliyinə bənzər keçid əyrisini; t, təlim zamanını; Δt, grokking keçid vaxtını; τ, keçidin kəskinliyini müəyyən edən zaman miqyasını göstərir. Tanh funksiyası aşağı dəyərdən yüksək dəyərə yumşaq, lakin aydın keçid yaradır. Buna görə faza keçidləri və sahə nəzəriyyəsi kontekstində tez-tez istifadə olunan formadır. Tədqiqat grokking dəqiqlik əyrilərinin bu quruluşa uyğunlaşmasını “mean-field / Landau-Ginzburg universality class” şərhi üçün istifadə edir.
Şəkil 2 Universal Feature Convergence iddiasını eksperimental olaraq dəstəkləmək üçün son test dəqiqliyi paylanmasını göstərir. Histogramda və p ilə λ qruplaşdırmalarında modellərin təxminən eyni son dəqiqlik bölgəsinə gəldiyi görünür. Tədqiqatın şərhi budur ki, fərqli hiperparametr tənzimləmələrinə və başlanğıc şərtlərinə baxmayaraq sistemlər eyni sabit nöqtə təsvir sinfinə yaxınlaşır. Lakin bu nəticələrin konkret modulyar arifmetik təcrübələr və istifadə edilən kiçikmiqyaslı transformer arxitekturası kontekstində əldə edildiyi unudulmamalıdır.
Şəkil 3 isə G2 miqyaslaması və λc keçidi ilə bağlıdır. Soldakı qrafik grokking gecikməsinin p-yə görə log-log miqyasda dəyişməsini göstərir və müşahidə olunan meylin β = -1.39 ± 0.20 olduğunu bildirir. Bu, yenidən işlənmiş [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] münasibəti ilə qismən uyğun sayılır. Ortadakı qrafik p = 97 üçün λ = 4 halında bəzi gedişlərin uğursuz olduğunu və λc həddinin (2, 4) intervalında yerləşdiyini göstərir. Sağdakı qrafik isə p böyüdükcə klassik ikifazalı grokking davranışının daha sinxron öyrənməyə doğru dəyişə bildiyini izah edir.
Tədqiqat HEF-i yalnız maşın öyrənməsinə tətbiq etmir. EOM başlığı altında prebiotik kimya və təkamül biologiyasına, IFF başlığı altında informasiya sahəsi nəzəriyyəsi və renormallaşdırma qrupu axınlarına, RSID başlığı altında nanohissəcik siqnal aşkarlanmasına da nümunə tətbiqlər verir. Bu sahələrdəki tətbiqlər HEF-in fərqli domenlərdə eyni struktur sualı verə bildiyini göstərmək üçün istifadə olunur: sistemin ilkin elementləri nələrdir, hansı mexanizmlər işləyir, enerji büdcəsi nədir, hansı fiziki və informasiya məhdudiyyətləri keçərlidir və kritik həddə hansı yaxınlaşma tipi yaranır?
Tədqiqatın biologiya ilə bağlı ən diqqətçəkən proqnozu anaerob maya xətlərinin eyni filogenetik uzaqlıqdakı aerob xətlərə nisbətən daha yüksək genomik yaxınlaşma göstərməli olduğudur. Bu, HEF-in enerji məhdudiyyətləri ilə metabolik yaxınlaşma arasında əlaqə qurmaq cəhdidir. Süni intellekt sahəsində digər proqnoz daha yüksək weight decay ilə öyrədilmiş böyük dil modellərinin daha yüksək səbəb təsirinə malik təsvirlər yarada bilməsidir. Üçüncü proqnoz isə grokking-in müəyyən λc(p) həddindən sonra mexanizm aclığı səbəbindən uğursuz olmasıdır.
Burada vacib olan budur ki, bu proqnozlar tədqiqatın öz ifadəsi ilə falsifikasiya oluna biləndir. Yəni HEF yalnız keçmiş müşahidələri izah edən elastik hekayə kimi qalmamalı; yeni təcrübələrlə dəstəklənməli, düzəldilməli və ya rədd edilməlidir. Tədqiqatın sonunda açıq eksperimental protokolların verilməsi bu baxımdan dəyərlidir.
Gündəlik həyata təsir baxımından bu tədqiqat birbaşa məhsul və ya tətbiq hazırlama məqaləsi deyil. Lakin uğurlu olarsa, süni intellekt modellərinin nə zaman əzbərdən ümumiləşdirməyə keçdiyini anlamaqda, təlim prosesində kritik hədləri aşkarlamaqda, weight decay kimi hiperparametrlərin yanlış istifadəsindən doğan uğursuzluqları proqnozlaşdırmaqda və müxtəlif sahələrdə mürəkkəb yaxınlaşma hadisələrini müqayisə etməkdə mühüm konseptual alət təmin edə bilər. Daha geniş baxışda “mürəkkəb sistemlər niyə bəzən eyni həllə çatır?” sualına riyazi dil qazandırmağa çalışır.
Tədqiqatın güclü tərəfləri arasında açıq riyazi çərçivə qurması, fiziki və informasiya-nəzəri məhdudiyyətləri eyni strukturda birləşdirməyə çalışması, grokking təcrübələri ilə empirik dəstək təqdim etməsi, vizual olaraq anlaşılan Ec barmaq izi təklif etməsi və falsifikasiya oluna bilən sahələrarası proqnozlar yaratması sayılır.
Məhdudiyyətlər də diqqətlə qeyd edilməlidir. Birincisi, HEF çox geniş sahələrə tətbiq edilmək istəndiyinə görə bəzi əlaqələr hələ namizəd çərçivə səviyyəsindədir. İkincisi, metrik daralma şərti A6 tədqiqatda vacib texniki şərtdir; bəzi hallarda nəzəri əsaslandırılsa da, ümumi halda öz-özünə çıxmadığı və əlavə struktur tələb etdiyi tədqiqatın özündə də müzakirə edilir. Üçüncüsü, grokking təcrübələri müəyyən tapşırıqlar, müəyyən kiçik transformer quruluşları və müəyyən hiperparametr intervalları ilə məhduddur. Dördüncüsü, biologiya, böyük dil modeli və nanohissəcik proqnozları bu mətndə tamamlanmış müstəqil doğrulama kimi təqdim edilmir; bunlar açıq eksperimental proqnozlardır.
Tədqiqatın dediyi ilə demədiyi şey aydın ayrılmalıdır. Tədqiqat bütün emergence hadisələrinin HEF ilə izah edildiyini demir. Təkamüldəki bütün yaxınlaşmaları, bütün neyron şəbəkə təsvir oxşarlıqlarını və ya bütün fiziki faza keçidlərini tək model ilə qəti həll etdiyini iddia etmir. Daha məhdud və elmi baxımdan daha mənalı iddiası budur ki, bəzi yaxınlaşma hadisələrində enerji həddi, mexanizm rəqabəti və fiziki-informasiya məhdudiyyətləri üzərindən ortaq faza keçidi motivi mövcud ola bilər.
Tədqiqatın Metodu və Nəticələri
Tədqiqatın metodu beş əsas qatda ümumiləşdirilə bilər: nəzəri HEF tərifi, fiziki əsas, yaxınlaşma teoremləri, mexanizm landşaftının təsnifatı və grokking təcrübələri.
1. HEF-in əsas quruluşu
Tədqiqatda HEF aşağıdakı quruluşla müəyyən edilir:
\[ H = (R^{(1)}, L, A_0, G, mode, E) \]
| Komponent | Mənası | Nümunə şərh |
|---|---|---|
| R(1) | Başlanğıc səviyyəli ilkin elementlər | Token embeddingləri, prebiotik molekullar və ya Fourier modları ola bilər. |
| L | Məntiqi dil | İlkin elementlərdən fiziki cəhətdən uyğun birləşmələr və münasibətlər qurur. |
| A0 | Başlanğıc mexanizmləri | Model çəkilərinin başlanğıc vəziyyəti, reaksiya çoxluğu və ya uyğun operatorlar kimi düşünülə bilər. |
| G | Generasiya qaydası | Yeni mexanizm indeksləri yarada bilər. |
| mode | İş rejimi | İdarə olunan və ya öz-özünə mexanizm yaradan sistem. |
| E | Enerji büdcəsi | Sistemin hansı mexanizmləri qarşılaya biləcəyini müəyyən edir. |
Bu quruluş fiziki məhdudiyyətlər çoxluğu ilə tamamlanır:
\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]
Tədqiqatda Φ xəritəsi termodinamik məhdudiyyətlərlə informasiya-nəzəri məhdudiyyətlər arasında nizamı qoruyan uyğunlaşdırma kimi qurulur. Bu uyğunlaşdırma Landauer Prinsipi, Jarzynski Bərabərliyi, Gibbs entropiyası və Məlumat Emalı Bərabərsizliyi kimi əsaslara söykənir.
2. Kanonik fiziki ölçü və mexanizm xərci
Tədqiqatda hər ilkin elementə Gibbs çəkisi verilir:
\[ p_i = \frac{e^{-E_i/k_B T}}{Z^{(k)}} \]
\[ Z^{(k)} = \sum_{j=1}^{N_k} e^{-E_j/k_B T} \]
Burada pi, i-ci elementin ehtimal çəkisidir. Ei, enerji; kB, Boltzmann sabiti; T, temperatur; Z(k), bölmə funksiyası; Nk, k səviyyəsindəki elementlərin sayıdır. Bu struktur aşağı enerjili vəziyyətlərin daha yüksək çəki daşıdığı kanonik fiziki ölçünü qurur.
Mexanizm xərci isə belə verilir:
\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]
Bu formula mexanizmin enerji və informasiya dəyişməsi baxımından gözlənilən xərcini hesablayır. Beləliklə HEF-də mexanizm seçimi yalnız abstrakt məntiqi uyğunluğa deyil, fiziki-informasiya xərcinə də bağlanır.
3. Kritik enerji həddi və yaxınlaşma
Enerji büdcəsindən asılı mexanizm çoxluğu:
\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]
şəklində müəyyən edilir. Tədqiqata görə E dəyişdikcə bu çoxluğun ölçüsü və müxtəlifliyi dəyişir. Ec, yeni mexanizmlərin büdcəyə daxilolma sürətinin ən yüksək olduğu kritik səviyyə kimi təyin edilir. Sonlu mexanizm xərcləri üçün bu intuisiya aşağıdakı diskret ifadə ilə təmsil edilir:
\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]
Burada cj, sıralanmış xərc dəyərlərini; Δj, müvafiq xərc səviyyəsində yeni əlavə edilən mexanizmlərin sayını göstərir. Bu formula Ec dəyərini mexanizm müxtəlifliyinin ən sürətlə dəyişdiyi nöqtə kimi müəyyən edir.
4. Əsas teoremlər
| Teorem / nəticə | Tədqiqatdakı mənası | Diqqət edilməli məqam |
|---|---|---|
| Physical Feasibility Theorem | Yaradılan hər səviyyədəki varlıqların termodinamik və informasiya-nəzəri məhdudiyyətləri birlikdə təmin etdiyini bildirir. | A1–A4 fərziyyələrinə əsaslanır. |
| Energy-Diversity Theorem | Enerji artdıqca mexanizm müxtəlifliyinin azalmadığını və Ec altında sabit nöqtəyə yaxınlaşma yarandığını bildirir. | Yaxınlaşma üçün A6 kimi daralma şərtləri vacibdir. |
| Universal Feature Convergence | Eyni P məhdudiyyətlərini paylaşan iki sistemin E < Ec altında eyni sabit nöqtəyə yaxınlaşa biləcəyini bildirir. | Başlanğıc fərqlərindən müstəqillik iddiası müəyyən fərziyyələr altında keçərlidir. |
| Causal Emergence Theorem | Sabit nöqtənin mikro səviyyəyə nisbətən daha yüksək Effective Information daşıya biləcəyini müdafiə edir. | NDA, yəni Non-Degeneracy Assumption tələb edir. |
5. Causal Emergence və Effective Information
Tədqiqatda səbəbli ortaya çıxış bu Effective Information tərifi ilə nəzərdən keçirilir:
\[ EI_k = H_{\mu}(T_k(R^{(k)})) - H_{\mu}(T_k(R^{(k)}) \mid R^{(k)}) \]
Burada EIk, k səviyyəsindəki effektiv informasiyanı; Hμ, kanonik ölçü altındakı entropiyanı; Tk, generativ xəritəni; R(k), k səviyyəsindəki təsvir və ya varlıq çoxluğunu ifadə edir. Birinci termin çıxış müxtəlifliyini, ikinci termin isə girdi məlum olsa belə qalan səbəb səs-küyünü təmsil edir. Tədqiqatın iddiasına görə E < Ec rejimində mexanizm seçimi deterministik hala gəldiyi üçün səbəb səs-küyü azalır.
6. Maşın öyrənməsi təcrübələri
| Təcrübə komponenti | Tədqiqatda verilən detal |
|---|---|
| Tapşırıq | Modulyar toplama: (a+b) mod p |
| Model | 2 qatlı transformer, 128 ölçü, 4 başlıq |
| Optimallaşdırma | Full-batch AdamW, sabit öyrənmə sürəti 10-3 |
| Əsas təcrübələr | p ∈ {23, 31, 41}, frac ∈ {0.40, 0.50, 0.60}, λ ∈ {1.0, 2.0}, 5 seed; cəmi 90 gediş |
| Doğrulama təcrübələri | p ∈ {53, 67, 83, 97} və p = 97 üçün λ ∈ {1.0, 2.0, 4.0}; cəmi 21 gediş |
| Grokking meyarı | Test dəqiqliyinin iki ardıcıl qiymətləndirmədə %95-i keçməsi |
| Qeydə alınan ölçmələr | Gradient energy, çəki norması, təlim/test dəqiqliyi |
7. Eksperimental tapıntılar
| Tapıntı | Rəqəmsal dəyər | Tədqiqatdakı şərh |
|---|---|---|
| Universal Convergence | 89/90 əsas gediş grokked; son test dəqiqliyi 0.9745 ± 0.014 | Fərqli p, frac, λ və seed şərtlərinə baxmayaraq oxşar sabit nöqtəyə yaxınlaşma. |
| Variasiya əmsalı | CV ≈ %1.47 | Son dəqiqliklərin dar intervalda toplandığı şərh edilir. |
| Weight-norm Ec fingerprint | Gedişlərin %92.1-ində çəki norması grokking-dən əvvəl zirvəyə çatır; median öncül müddət ≈ 1.050 addım | Ec keçidinin modeldən müstəqil empirik izi kimi şərh edilir. |
| Landau-Ginzburg çöküşü | Per-run R2 = 0.93; orta çöküş R2 = 0.79 | Grokking-in tanh kink-ə bənzər faza keçidi sinfinə yerləşdirilə biləcəyi müdafiə olunur. |
| G2 miqyaslaması | β = -1.39 ± 0.20, R2 = 0.91 | Yenidən işlənmiş [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] münasibəti ilə qismən uyğunluq. |
| λc həddi | λc(p=97) ∈ (2, 4) | Çox yüksək weight decay mexanizm aclığına və grokking uğursuzluğuna səbəb ola bilər. |
8. Şəkillərin izah etdiyi elmi məzmun
Şəkil 1, HEF-in üçfazalı enerji təsvirini göstərir. Sol paneldə çəki normasının əvvəlcə yüksəlməsi, sonra Ec ətrafında zirvəyə çatması və ardınca düşməsi kəşf rejimindən yaxınlaşma rejiminə keçidin göstəricisi kimi şərh edilir. Sağ paneldə normallaşdırılmış test dəqiqliyi əyrilərinin tanh formalı qırılmaya çöküşü grokking-in Landau-Ginzburg-a bənzər faza keçidi kimi nəzərdən keçirilməsinə əsas yaradır.
Şəkil 2, son test dəqiqliyinin p və λ qruplarına görə əhəmiyyətli şəkildə ayrılmadığını göstərir. Bu Universal Feature Convergence iddiasının eksperimental dayaqlarından biri kimi təqdim edilir. Lakin bu nəticə yalnız müvafiq təcrübə dizaynındakı grokked modellər üçün keçərlidir; bütün model miqyaslarına ümumiləşdirilmiş qəti nəticə deyil.
Şəkil 3, grokking gecikməsinin p-yə görə miqyaslanmasını, λ = 4 ətrafındakı uğursuzluq rejimini və p böyüdükcə əzbərləmə ilə ümumiləşdirmə arasındakı fərqin dəyişməsini göstərir. Bu şəkil HEF-in yalnız keçidi izah etməyə deyil, keçidin hansı hiperparametr şərtlərində uğursuz ola biləcəyini proqnozlaşdırmağa çalışdığını göstərir.
9. Sahələrarası proqnozlar
- P1: Anaerob maya xətlərinin eyni filogenetik uzaqlıqdakı aerob xətlərə nisbətən daha yüksək genomik yaxınlaşma göstərməsi gözlənilir.
- P2: Daha yüksək weight decay ilə öyrədilən böyük dil modellərinin daha yüksək səbəb təsirinə malik təsvirlər yaratması gözlənilir.
- P3: Müəyyən kritik λc(p) həddindən sonra grokking mexanizm aclığı səbəbindən uğursuz olmalıdır.
10. Məhdudiyyətlər və açıq problemlər
- HEF bütün emergence hadisələrini izah edən tamamlanmış nəzəriyyə kimi təqdim edilmir; müəyyən yaxınlaşma motivləri üçün namizəd çərçivədir.
- A6 metrik daralma şərti ümumilikdə A1–A5-dən avtomatik çıxmır; tədqiqat bunun üçün əlavə strukturların və ya empirik doğrulamanın lazım olduğunu qəbul edir.
- Grokking təcrübələri müəyyən kiçikmiqyaslı transformer və modulyar arifmetika kontekstinə əsaslanır.
- G2 formulunun əvvəlki forması mətndə yenidən işlənmişdir; yeni formula üçün daha böyük və ayırdedici təcrübələr açıq protokol kimi saxlanılır.
- LLM, təkamül biologiyası və nanohissəcik proqnozları bu tədqiqatda tamamlanmış müstəqil doğrulama deyil, sınaqdan keçirilə bilən gələcək proqnozlar kimi verilir.
- Reproducibility bölməsində Zenodo DOI sahəsi “to be deposited” vəziyyətində görünür; buna görə məlumat arxivinin yekun DOI məlumatı mətn üzərindən tamamlanmış görünmür.
Mənbə və Metod Qeydi
Bu məqalə Truong Xuan Khanh tərəfindən hazırlanmış “Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems” başlıqlı tədqiqata əsasən hazırlanmışdır. Tədqiqatda müəllifin H&K Research Studio, Clevix LLC, Hanoi, Vietnam əlaqəsi və May 2026 tarixi verilib. Mətnin ilk səhifəsində arXiv submit məlumatı olduğu üçün tədqiqat mətnə əsasən arXiv göndərişi / preprint xarakterli nəzəri-empirik tədqiqat işi kimi qiymətləndirilmişdir.
Mətndə resenziyalı jurnal qəbulu, DOI ilə yayımlanmış yekun versiya və ya açıq resenziya qiymətləndirməsi barədə məlumat olmadığı üçün tədqiqat üçün resenziya vəziyyəti mətn əsasında təsdiqlənə bilməyən iş ifadəsi işlədilməlidir. Buna görə nəticələr, xüsusilə HEF-in geniş sahələrə tətbiq edilə bilməsi və biologiya/LLM/nanomedicine proqnozları baxımından ehtiyatla oxunmalıdır.
Bu məzmun hazırlanarkən tədqiqatda verilən HEF tərifi, fiziki məhdudiyyətlər çoxluğu, termodinamika-informasiya nəzəriyyəsi uyğunlaşdırmaları, əsas teoremlər, grokking təcrübələri, şəkillər, rəqəmsal nəticələr, açıq protokollar və məhdudiyyətlər əsas götürülmüşdür. PDF-də olmayan qəti tətbiq uğuru, resenziyalı nəşr qəbulu, klinik və ya kommersiya təsiri, bütün süni intellekt modellərinə ümumiləşdirmə və ya bütün təkamül proseslərini izah etmə kimi iddialar əlavə edilməmişdir.
Tədqiqatın eksperimental hissəsi xüsusilə modulyar arifmetika grokking tapşırıqları ilə məhduddur. HEF-in təkamül biologiyası, böyük dil modelləri və nanohissəcik siqnal aşkarlanması üçün təqdim etdiyi nəticələr bu mətndə daha çox sahələrarası proqnoz və nəzəri tətbiq kimi yer alır. Bu proqnozların elmi dəyəri onların müstəqil təcrübələrlə dəstəklənməsindən, düzəldilməsindən və ya yanlışlanmasından asılıdır.

Şərh yazın
E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib