
Fanda “yuzaga chiqish” yoki inglizcha atamasi bilan emergence, oddiy qismlar birlashganda ularning har birida alohida bo‘lmagan yangi tartib, xulq yoki funksiyaning paydo bo‘lishini anglatadi. Bir neyron tarmoq faqat sonli og‘irliklardan iborat bo‘lishiga qaramay, tasvirdagi chetlarni, egri chiziqlarni yoki mavhum xususiyatlarni ajrata boshlashi bunga misol bo‘la oladi. Xuddi shuningdek, oddiy molekulalardan metabolik tarmoqlarning hosil bo‘lishi yoki fizik maydonlarda tartibli fazalarning yuzaga kelishi ham emergence muhokamalarining markazidadir.
Ammo bu ish faqat “murakkab tizimlarda yangi xususiyatlar paydo bo‘ladi” deyish bilan cheklanmaydi. U aniqroq savolga e’tibor qaratadi: Nega turli tizimlar ba’zan bir xil natijaga yaqinlashadi? Agar ikki neyron tarmoq turli boshlang‘ich og‘irliklar bilan o‘qitilsa-yu, ammo o‘xshash ichki tasvirlanishlar ishlab chiqsa, bu shunchaki tasodifmi? Agar turli evolyutsion shoxlar bir xil metabolik yechim sinflariga qayta-qayta yetsa, bu faqat atrof-muhit bosimining qo‘pol natijasimi? Agar grokking turli vazifalarda keskin umumlashtirish ko‘rinishida yuzaga chiqsa, bu keskin o‘tishning vaqti hamda shakli qaysi tuzilmaviy sabablarga bog‘liq?
Muallifning javobi shuki, bu hodisalar ortida umumiy mexanizm raqobati tuzilmasi bo‘lishi mumkin. Tizimda bir nechta mumkin bo‘lgan mexanizm mavjud bo‘ladi. Ayrimlari tez, ammo yuzaki yechimlar beradi; boshqalari esa sekinroq, lekin yanada umumiy va barqaror yechimlar hosil qiladi. Sun’iy intellektdagi grokking misolida bu yodlash mexanizmi bilan umumlashtirish mexanizmi o‘rtasidagi raqobat sifatida talqin qilinadi. Model avval o‘quv ma’lumotini yodlashi mumkin; biroq weight decay kabi jarayonlar vaqt o‘tishi bilan yodlash yechimini qimmatlashtirar ekan, umumlashtirish devresining ustunlashishiga yo‘l beradi.
Tadqiqotning asosiy tushunchalaridan biri kritik energiya chegarasidir:
\[ E_c \]
Bu yerda Ec tizimning xulq rejimini o‘zgartiradigan kritik energiya budjetidir. E yuqori bo‘lganda tizim bir vaqtning o‘zida bir nechta mexanizmni “qamrab olishi” mumkin; bu esa kashfiyot va raqobat rejimidir. E kritik chegara atrofida bo‘lganda mexanizmlar orasidagi tanlov keskinlashadi. E < Ec bo‘lganda esa eng kam xarajatli yoki fizik cheklovlar nuqtayi nazaridan eng barqaror mexanizm ustun keladi va tizim sobit nuqtaga tomon yaqinlashadi.
Bu mantiq fizik faza o‘tishlariga o‘xshaydi. Suv soviganda molekulalar bir zumda “muz bo‘lishni tanlamaydi”; biroq ma’lum bir chegarada tizim tartibi sifat jihatdan o‘zgaradi. HEF ning grokking talqinida ham modelning test aniqligi uzoq vaqt past bo‘lib turishi mumkin; so‘ng tizim ma’lum ichki chegaradan o‘tgach, umumlashtirish xulqi tezda yuzaga chiqadi.
HEF ramkasi quyidagi oltilik tuzilma bilan ta’riflanadi:
\[ H = (R^{(1)}, L, A_0, G, mode, E) \]
Bu formulada H Hierarchical Emergence Framework namunasini ifodalaydi. R(1) tizimning boshlang‘ich ibtidoiy elementlar to‘plamidir. Mashinaviy o‘rganishda bu token embeddinglari kabi past darajadagi tasvirlanish unsurlari bo‘lishi mumkin. Biologiyada prebiotik molekulalar; fizikada esa Fourier modlari misol keltiriladi. L bu elementlardan mantiqiy ifodalar qurishga xizmat qiladigan tilni ko‘rsatadi. A0 boshlang‘ich mexanizm to‘plamidir. G yangi mexanizmlar ishlab chiqara oladigan qoida bo‘lib xizmat qiladi. mode tizim boshqariladigan rejimdami yoki o‘zi yangi mexanizm ishlab chiqaradigan rejimdami, shuni bildiradi. E esa energiya budjetidir.
Bu tuzilma ishda fizik cheklovlar to‘plami bilan birgalikda ko‘riladi:
\[ P = (P_{\mathrm{thermo}}, P_{\mathrm{info}}, \Phi) \]
Bu yerda Pthermo termodinamik cheklovlarni, Pinfo axborot nazariyasi cheklovlarini, Φ esa bu ikki soha orasidagi tarjima xaritasini bildiradi. Tadqiqotning muhim jihatlaridan biri termodinamik qonunlar bilan axborot nazariyasi tamoyillarini ayni bir emergence ramkasida birlashtirishga urinishi hisoblanadi.
Termodinamik tomonda uch cheklov beriladi:
- P1: Energiyaning saqlanishi. Umumiy energiya o‘zgarishi nol bo‘lishi kerak.
- P2: Ikkinchi qonun. Umumiy entropiya kamaymasligi kerak.
- P3: Musbat harorat. Tizim T > 0 sharoitida baholanadi.
Axborot nazariyasi tomonda bunga mos uch cheklov aniqlanadi:
- P4: O‘zaro axborot chegarasi. Ikki o‘zgaruvchi orasidagi axborot ularning o‘z axborot mazmunidan ortiq bo‘la olmaydi.
- P5: Shartli entropiyaning manfiy bo‘lmasligi. Bir narsa ma’lum bo‘lganda qolgan noaniqlik kamayishi mumkin, ammo manfiy noaniqlik paydo bo‘lmaydi.
- P6: Ma’lumotni qayta ishlash tengsizliksi. Bir axborot ishlov zanjirida keyingi tasvirlanish oldingi manbadan o‘z-o‘zidan ko‘proq axborot hosil qila olmaydi.
Bu munosabatni tushunish uchun tadqiqot tayanadigan asosiy fizik g‘oyalardan biri Landauer Prinsipi bilan izohlanadi:
\[ W \geq k_B T \ln 2 \cdot \Delta H \]
Bu formula axborotni qayta ishlashning fizik xarajati borligini aytadi. W — kerakli ish yoki energiya xarajati. kB — Boltsman doimiysi. T — harorat. ΔH — ishlangan yoki o‘chirilgan axborot miqdori. Bu munosabat “axborot mavhum ko‘rinsa ham, fizik dunyoda u bepul emas” degan fikrni bildiradi. Ish mexanizmlar tanlovini ham ana shunday energiya-axborot xarajatlari bilan bog‘laydi.
Mexanizm xarajati quyidagicha yoziladi:
\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]
Bu yerda α bir mexanizmni; φ mantiqiy til ichida qurilgan ifodani; ΔEα(φ) mexanizmning energiya o‘zgarishini; ΔHα(φ) axborot mazmuni o‘zgarishini; Eμ esa kanonik fizik o‘lchov ostidagi kutilgan qiymatni ifodalaydi. Bu formula mexanizmning faqat foydaliligini emas, balki fizik va axborotiy jihatdan qanchalik qimmatga tushishini ham o‘lchashga intiladi.
Energiyа budjeti ostida qabul qilinadigan mexanizmlar quyidagicha aniqlanadi:
\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]
A* — fizik jihatdan maqbul barcha mexanizmlar to‘plami. A*(E) esa E energiya budjeti ichida ishlay oladigan mexanizmlar qism to‘plamidir. Bu ta’rif HEF ning eng muhim g‘oyasini o‘z ichiga oladi: bir mexanizm mantiqan mumkin bo‘lishi mumkin; biroq energiya budjeti uni qoplamasa, u tizimning haqiqiy xulqida rol o‘ynay olmaydi.
Ishda Ec mexanizm xilma-xilligining kritik o‘zgarish nuqtasi sifatida belgilanadi. Chekli mexanizm xarajatlari uchun berilgan diskret tavsif quyidagicha:
\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]
Bu formulada cj tartiblangan mexanizm xarajatlarini; Δj esa tegishli xarajat darajasida budjetga yangi qo‘shilgan mexanizm sonini ko‘rsatadi. Ya’ni Ec — tizimga yangi mexanizmlar eng tez qo‘shiladigan kritik xarajat darajasi sifatida tanlanadi. Uzluksiz tizimlarda bu faza o‘tishlarida kuzatiladigan sezgirlik oshishiga o‘xshatiladi.
HEF ning yaqinlashuv da’vosi metrik qisqarish g‘oyasiga tayangan. Ishda bu mantiq Hausdorff metrikasi va Banach Sobit Nuqta Teoremasi bilan quriladi:
\[ d_H(T_k(R_1), T_k(R_2)) \leq c_{\alpha^*} \cdot d_H(R_1, R_2), \quad 0 < c_{\alpha^*} < 1 \]
Bu formulada dH ikkita to‘plam orasidagi Hausdorff masofasini; Tk k darajadagi ishlab chiqaruvchi xaritani; R1 va R2 esa ikki tasvirlanish yoki mavjudot to‘plamini; cα* qisqarish koeffitsientini bildiradi. Ko‘rsatkich 1 dan kichik bo‘lsa, tizim har qadamda turli boshlanishlardan kelgan tuzilmalarni bir-biriga yaqinlashtiradi. Shu sababli ma’lum sharoitlarda ikki alohida tizim bir xil sobit nuqtaga yaqinlashishi mumkin.
Ishning Universal Feature Convergence natijasi shu joydan kelib chiqadi. Agar ikki HEF namunasi bir xil fizik cheklovlar to‘plami P ni bo‘lishsa va E < Ec rejimida ishlasa, boshlang‘ich elementlari, arxitektura tafsilotlari yoki ishlab chiqarish yo‘llari turlicha bo‘lsa ham bir xil sobit nuqtali tasvirlanish sinfiga yaqinlashishi mumkin. Sun’iy intellekt nuqtayi nazaridan bu turli modellar nima uchun o‘xshash ichki tasvirlanishlar hosil qilishini tushuntirish uchun nomzod mexanizm beradi.
Ish yaqinlashuvning o‘zi “sababiy yuzaga chiqish” degani emasligini ham ta’kidlaydi. Chunki hamma narsani bitta sobit chiqishga siqib qo‘yadigan oddiy mexanizm ham yaqinlashishi mumkin; ammo bu mazmunli sababiy quvvat yaratmaydi. Shu sababli ish Effective Information tushunchasidan foydalanadi:
\[ EI_k = H_{\mu}(T_k(R^{(k)})) - H_{\mu}(T_k(R^{(k)}) \mid R^{(k)}) \]
Bu yerda EIk k darajadagi samarali axborotni bildiradi. Birinchi had chiqish xilma-xilligini, ikkinchi had esa kirishni bilgan holda qoladigan sababiy shovqinni ifodalaydi. Agar E < Ec rejimida mexanizm tanlovi yanada determinizmga yaqinlashsa, sababiy shovqin kamayadi. Ishdagi Causal Emergence Theorem esa ayrim qo‘shimcha farazlar ostida sobit nuqta darajasi mikrodarajaga qaraganda yuqoriroq samarali axborotga ega bo‘lishi mumkinligini ilgari suradi.
Mashinaviy o‘rganish misolida HEF ayniqsa grokking jarayoniga tatbiq qilinadi. Grokking — model o‘quv ma’lumotini yodlab olganidan ancha keyin test ma’lumotida umumlashtirishni boshlashi. Bu ishda grokking uch fazali HEF yo‘li sifatida tasvirlanadi:
- Kashfiyot rejimi: E > Ec. Yodlash va umumlashtirish mexanizmlari birga mavjud bo‘ladi. O‘quv aniqligi oshar ekan, test aniqligi past bo‘lib qolishi mumkin.
- Grok bo‘shlig‘i: model o‘quv ma’lumotini yodlagan, lekin umumlashtirish devresi hali ustun emas. Weight normasi faza chegarasiga yaqinlashar ekan cho‘qqiga chiqadi.
- Yaqinlashuv rejimi: E < Ec. Umumlashtirish mexanizmi ustun keladi; test aniqligi tez o‘sadi va barqaror plato tomon boradi.
Grokking kechikishi uchun ishda qayta ko‘rib chiqilgan masshtablash munosabati quyidagicha beriladi:
\[ \Delta t \propto \frac{1}{frac \cdot p \cdot \lambda} \]
Bu yerda Δt grokking kechikishini; frac o‘qitish ma’lumotining ulushini; p modulyar arifmetika vazifasidagi tub sonni; λ esa weight decay, ya’ni vazn so‘nish koeffitsientini ifodalaydi. Bu munosabat ma’lum o‘rta λ rejimlarida ko‘proq o‘quv signali va mos weight decay bosimi umumlashtirish devresining ertaroq qurilishiga yordam berishini anglatadi.
Lekin ish bu yerda muhim cheklovni ham qo‘yadi. λ juda oshsa, tizim umumlashtirish mexanizmini quradigan signalni ham yo‘qotib qo‘yishi mumkin. Bu holat mechanism starvation, ya’ni mexanizm ochligi deb ataladi. p = 97 uchun kritik oraliq quyidagicha beriladi:
\[ \lambda_c(p=97) \in (2, 4) \]
Bu λ = 1 va λ = 2 da grokking ishonchli kuzatilgan bo‘lsa-da, λ = 4 darajasida ayrim urinishlarning muvaffaqiyatsiz bo‘lishi bilan bog‘lanadi. Demak, ish weight decay har doim oshirilishi kerak bo‘lgan oddiy sozlama emasligini, ma’lum chegaradan keyin mexanizm hosil bo‘lishiga zarar yetkazishi mumkinligini ko‘rsatadi.
Ishning tajribaviy qismida asosiy vazifa modulyar qo‘shish muammosi hisoblanadi:
\[ (a+b) \mod p \]
Bu vazifada model uchun shunchaki misollarni yodlash yetarli emas; u haqiqatan umumlashtira olishi uchun modulyar tuzilmani o‘rganishi kerak. Shu sababli u grokking tadqiqotlarida keng ishlatiladigan sinov maydonidir.
Tajribalarda 2 qatlamli transformer, 128 o‘lchamli tasvirlanish, 4 attention head, full-batch AdamW va doimiy 10-3 o‘rganish tezligi ishlatiladi. Asosiy tajriba to‘plamida p ∈ {23, 31, 41}, o‘qitish ulushi frac ∈ {0.40, 0.50, 0.60}, weight decay λ ∈ {1.0, 2.0} va besh xil seed mavjud. Tasdiqlovchi to‘plamda p ∈ {53, 67, 83, 97} hamda p = 97 uchun qo‘shimcha λ sinovlari bor.
Ishning eng kuchli empirik nuqtalaridan biri grokked modellar final test aniqliklarining tor diapazonda to‘planganidir:
\[ 0.9745 \pm 0.014 \]
Bu natija taxminan 1.47% variatsiya koeffitsienti bilan birga, turli giperparametr sharoitlariga qaramay bir xil sobit nuqtali tasvirlanish xulqiga yaqinlashuv da’vosini qo‘llab-quvvatlash uchun ishlatiladi. Ammo bu natija faqat kichik o‘lchamli transformerlar va modulyar arifmetika tajribalari doirasida amal qiladi; u butun sun’iy intellekt tizimlariga bevosita umumlashtirilgan qat’iy xulosa emas.
Shakllar nazariy da’voning vizual ustunini tashkil qiladi. 1-shaklning chap panelida weight normasi o‘qitish davomida avval ko‘tarilib, so‘ng Ec atrofida cho‘qqiga chiqib, keyin pasayishi ko‘rsatiladi. Bu cho‘qqining grokking hodisasidan mediana bo‘yicha taxminan 1.050 qadam oldin kelishi aytiladi. Bu ishda Ec o‘tishining empirik barmoq izi sifatida talqin qilinadi.
1-shaklning o‘ng panelida normallashtirilgan test aniqligi egri chiziqlari tanh shaklidagi o‘tish egri chizig‘iga qulaydi. Bu egri chiziq quyidagicha yoziladi:
\[ \sigma(t) = \frac{1}{2}\left(1 + \tanh\left(\frac{t-\Delta t}{\tau}\right)\right) \]
Bu yerda σ(t) normallashtirilgan test aniqligiga o‘xshash o‘tish funksiyasidir. t o‘qitish vaqtini; Δt grokking o‘tish vaqtini; τ esa o‘tish kengligi yoki keskinligini belgilovchi vaqt o‘lchovini bildiradi. Tanh funksiyasi past holatdan yuqori holatga silliq, lekin aniq o‘tish hosil qiladi. Shu sababli ish grokking xulqini Landau-Ginzburg mean-field universallik sinfi bilan bog‘laydi.
2-shakl final test aniqliklarining taqsimoti va p hamda λ guruhlariga ko‘ra ajralish bor-yo‘qligini ko‘rsatadi. Grafikda modellar taxminan bir xil final aniqlik oralig‘ida jamlangani va p hamda λ ta’siri ahamiyatli emasligi aytiladi. Bu Universal Feature Convergence da’vosining eksperimental tayanchlaridan biri sifatida talqin qilinadi.
3-shakl grokking kechikishining p ga nisbatan masshtablanishini va λc o‘tishini ko‘rsatadi. Chapdagi log-log grafikda kuzatilgan qiyalik:
\[ \beta = -1.39 \pm 0.20 \]
deb beriladi va R2 = 0.91 qayd etiladi. Bu natija qayta ko‘rib chiqilgan [ \Delta t \propto 1/(frac \cdot p \cdot \lambda) ] munosabati bilan qisman mos deb baholanadi. O‘rta panelda λ = 4 holatida ayrim seedlar muvaffaqiyatsiz bo‘lgani ko‘rsatilib, mexanizm ochligi sinfi qo‘llab-quvvatlanadi. O‘ng panel esa p kattalashgani sari klassik ikki bosqichli grokking xulqi yanada bir vaqtda o‘rganishga yaqinlashishi mumkinligini tushuntiradi.
HEF ning qiziq tomoni shundaki, ish uni faqat mashinaviy o‘rganishga tatbiq etmaydi. Biologiyada prebiotik molekulalardan otokatalitik tarmoqlar va metabolik yaqinlashuvgacha, fizikada Fourier modlari va renormalizatsiya guruhi oqimlarigacha, nanopartikula signal aniqlashida esa bog‘lanish konfiguratsiyalarigacha turli misollar keltiriladi. Bu misollarning barchasida bitta savol beriladi: ibtidoiy elementlar nimalar, qaysi mexanizmlar mumkin, qaysi fizik-axborotiy cheklovlar amal qiladi va kritik energiya chegarasi qaysi yaqinlashuvni keltirib chiqaradi?
Ishning uchta noto‘g‘rilanishi mumkin bo‘lgan taxmini bor. Birinchisi, anaerob xamirturush shoxlari bir xil filogenetik masofadagi aerob shoxlarga qaraganda yuqoriroq genomik yaqinlashuv ko‘rsatishi kerakligi. Ikkinchisi, yuqoriroq weight decay bilan o‘qitilgan katta til modellari ko‘proq sababiy ta’sirga ega tasvirlanishlar hosil qilishi mumkinligi. Uchinchisi, kritik λc(p) chegarasidan o‘tganda grokking mexanizm ochligi sababli muvaffaqiyatsiz bo‘lishi.
Bu taxminlar muhim, chunki nazariya faqat o‘tmish kuzatuvlarini tushuntirib beruvchi moslashuvchan hikoya bo‘lib qolishni istamaydi. U o‘zining noto‘g‘rilanish yo‘llarini ham ko‘rsatadi. Agar anaerob shoxlar kutilgan yaqinlashuvni bermasa, agar LLM tasvirlanishlarida weight decay bilan sababiy ta’sir orasida kutilgan aloqa topilmasa yoki λc chegarasi tajribada qo‘llab-quvvatlanmasa, HEF doirasi toraytirilishi yoki model qayta ko‘rib chiqilishi kerak.
Ishning kundalik hayotga bevosita ta’siri yangi qurilma, dori yoki dastur mahsuloti yaratish emas. Ammo u sun’iy intellekt tizimlarining o‘qitish xulqini tushunish, yodlash bilan umumlashtirish orasidagi o‘tishlarni o‘lchash, giperparametr sozlamalarida kritik chegaralarni sezish va murakkab tizimlarda nega o‘xshash yechimlar qayta-qayta yuzaga chiqishini tushuntirish uchun konseptual hissa qo‘shadi. Agar HEF kengroq tajribalar bilan qo‘llab-quvvatlansa, sun’iy intellekt o‘qitish jarayonida “model qachon chinakam o‘rganishni boshlaydi?” degan savolga yanada o‘lchab bo‘ladigan javoblar berishi mumkin.
Ishning kuchli tomonlari — aniq matematik tuzilma qurishi, fizik va axborot nazariyasi cheklovlarini birgalikda ko‘rib chiqishi, grokking tajribalaridan sonli dalil berishi, shakllar orqali o‘lchanadigan Ec barmoq izini taklif qilishi va sohalararo noto‘g‘rilanishi mumkin bo‘lgan taxminlar ishlab chiqishidadir.
Cheklovlari esa kam emas. HEF barcha emergence hodisalarini tushuntiruvchi tugallangan nazariya emas. A6 metrik qisqarish sharti umumiy holatda avtomatik kelib chiqmaydi; ish buning uchun qo‘shimcha tuzilmaviy shartlar yoki empirik tasdiq zarurligini tan oladi. Grokking tajribalari kichik o‘lchamli transformer va modulyar arifmetika vazifalari bilan cheklangan. Biologiya, katta til modeli va nanopartikula taxminlari bu matnda yakunlangan mustaqil tasdiqlar emas, balki kelajakda sinovdan o‘tkazilishi kerak bo‘lgan bashoratlardir. Reproducibility bo‘limida Zenodo DOI maydonining “to be deposited” bo‘lib ko‘rinishi ham ma’lumot arxivi haqidagi axborot matn orqali yakunlanmaganini ko‘rsatadi.
Shu sababli ishni murakkab tizimlardagi yaqinlashuv hodisalarini faza o‘tishlari va mexanizm manzaralari orqali tushuntirishga urinadigan ambitsiyali, matematik va sinovdan o‘tishi mumkin bo‘lgan ramka sifatida o‘qish kerak.
Tadqiqot usuli va natijalari
Tadqiqot usuli to‘rt asosiy o‘qda qurilgan: HEF ning matematik ta’rifi, fizik-axborotiy asos, sobit nuqta va sababiy yuzaga chiqish teoremalari, grokking tajribalari bilan empirik sinov.
1. HEF tuple tuzilmasi
| Qism | Ta’rif | Mashinaviy o‘rganish misoli |
|---|---|---|
| R(1) | Boshlang‘ich ibtidoiy elementlar to‘plami | Token embeddinglari |
| L | Ibtidoiy elementlardan ifodalar tuzuvchi mantiqiy til | Attention naqshlari va devre tuzilmalari |
| A0 | Boshlang‘ich mexanizm to‘plami | Og‘irliklar boshlang‘ichi va model qismlari |
| G | Yangi mexanizm indekslarini hosil qiluvchi qoida | Gradient descent / optimallashtirish jarayoni |
| mode | Boshqariladigan yoki o‘z-o‘zidan hosil qiluvchi ish rejimi | Boshqariladigan o‘qitish jarayoni |
| E | Energiyа budjeti | η∥∇L∥2 kabi o‘qitish energiyasi vakillari |
2. Fizik va axborot nazariyasi cheklovlari
| Termodinamik cheklov | Axborot nazariyasi mosligi | Ma’nosi |
|---|---|---|
| P1: Energiyaning saqlanishi | P4: O‘zaro axborot chegarasi | Axborot yaratish fizik xarajatsiz bo‘lishi mumkin emas. |
| P2: Ikkinchi qonun | P5: Shartli entropiya ≥ 0 | Noaniqlik va entropiya fizik jarayonlarda manfiylashmaydi. |
| P3: Musbat harorat | P6: Ma’lumotni qayta ishlash tengsizliksi | Axborot ishlov zanjiri o‘z-o‘zidan ortiqcha axborot yarata olmaydi. |
3. Kanonik fizik o‘lchov
Ishda har bir ibtidoiy element uchun Gibbs og‘irligi ishlatiladi:
\[ p_i = \frac{e^{-E_i/k_B T}}{Z^{(k)}} \]
\[ Z^{(k)} = \sum_{j=1}^{N_k} e^{-E_j/k_B T} \]
Bu yerda pi i-chi elementning og‘irligi. Ei — energiya; kB — Boltsman doimiysi; T — harorat; Z(k) — bo‘linish funksiyasi; Nk — k darajadagi elementlar soni. Bu tuzilma past energiyali holatlar yuqoriroq ehtimollik og‘irligiga ega bo‘ladigan fizik o‘lchovni quradi.
4. Mexanizm xarajati va Ec
Mexanizm xarajati:
\[ cost(\alpha) = E_{\mu}\left[\Delta E_{\alpha}(\phi) + k_B T \Delta H_{\alpha}(\phi)\right] \]
Energiyа budjetiga ko‘ra qabul qilinadigan mexanizmlar:
\[ A^*(E) = \{\alpha \in A^* \mid cost(\alpha) \leq E\} \]
Kritik energiya chegarasi:
\[ E_c = c_{j^*}, \quad j^* = \arg\max_j \frac{\Delta_j}{c_j - c_{j-1}} \]
Bu uch formula birgalikda ishning energiya-xilma-xillik muvozanatini quradi. Mexanizmlarning xarajati bor; energiya budjeti ulardan qaysilari ishlashini belgilaydi; Ec esa mexanizm xilma-xilligi rejim o‘zgartiradigan kritik chegara hisoblanadi.
5. Asosiy nazariy natijalar
| Natija | Ishdagi vazifasi | Shart / ehtiyot notasi |
|---|---|---|
| Physical Feasibility Theorem | Yaratilgan mavjudotlar termodinamik va axborot nazariyasi cheklovlarini birgalikda qanoatlantirishini ta’kidlaydi. | A1–A4 farazlariga tayanadi. |
| Energy-Diversity Theorem | Energiyа va mexanizm xilma-xilligi orasidagi munosabatni hamda Ec chegarasini o‘rnatadi. | A1–A6 farazlari ostida yaqinlashuv natijasi beradi. |
| Universal Feature Convergence | Xuddi shu P cheklovlarini bo‘lishuvchi tizimlar bir xil sobit nuqtaga yaqinlashishi mumkinligini aytadi. | A5 va A6 muhim rol o‘ynaydi. |
| Causal Emergence Theorem | Sobit nuqta mikro darajaga qaraganda yuqoriroq Effective Information ga ega bo‘lishi mumkinligini ilgari suradi. | NDA farazi talab qilinadi. |
6. Grokking tajriba dizayni
| Tajriba elementi | Ishda berilgan ma’lumot |
|---|---|
| Vazifa | Modulyar qo‘shish: (a+b) mod p |
| Model | 2 qatlamli transformer, 128 o‘lcham, 4 head |
| Optimallashtirish | Full-batch AdamW, doimiy o‘rganish tezligi 10-3 |
| Asosiy tajribalar | 90 ta run: p ∈ {23, 31, 41}, frac ∈ {0.40, 0.50, 0.60}, λ ∈ {1.0, 2.0}, 5 seed |
| Tasdiqlovchi tajribalar | 21 ta run: p ∈ {53, 67, 83, 97} va p = 97 uchun λ ∈ {1.0, 2.0, 4.0} |
| Grokking mezoni | Test aniqligining ikki ketma-ket baholashda 95% dan oshishi |
| Qayd etilgan o‘zgaruvchilar | Gradient energy, weight norm, o‘quv/test aniqligi |
7. Empirik natijalar
| Natija | Berilgan qiymat | Talqin |
|---|---|---|
| Grokked runlar | 89/90 asosiy run | Modellarning katta qismi grokking xulqini ko‘rsatgan. |
| Yakuniy test aniqligi | 0.9745 ± 0.014 | Turli p, frac, λ va seed sharoitlariga qaramay tor oraliqqa yaqinlashuv. |
| Variatsiya koeffitsienti | Taxminan 1.47% | Yakuniy aniqliklar past nisbiy o‘zgaruvchanlikka ega ekanini bildiradi. |
| Weight norm Ec izi | Runlarning 92.1% ida grokkingdan oldin cho‘qqi; mediana oldi muddat ≈ 1.050 qadam | Ec o‘tishining empirik barmoq izi sifatida talqin qilinadi. |
| Tanh qulash | Har bir run uchun R2 = 0.93; o‘rtacha qulash R2 = 0.79 | Grokking ni Landau-Ginzburgga o‘xshash faza o‘tish sinfiga joylashtiradi. |
| G2 masshtablash | β = -1.39 ± 0.20, R2 = 0.91 | Qayta ko‘rib chiqilgan kechikish formulasi bilan qisman mos keladi. |
| λc o‘tishi | λc(p=97) ∈ (2, 4) | Haddan tashqari weight decay mexanizm ochligiga olib kelishi mumkin. |
8. Shakllarning texnik ma’nosi
- 1-shakl: Weight norm avval ko‘tariladi, Ec atrofida cho‘qqiga chiqadi, so‘ng pasayadi. Xuddi shu shaklning o‘ng panelida test aniqligi tanhga o‘xshash o‘tishga qulaydi. Bu HEF ning uch fazali grokking hikoyasining asosiy vizual dalilidir.
- 2-shakl: Yakuniy test aniqliklari p va λ guruhlariga ko‘ra sezilarli ajralmaydi. Bu Universal Feature Convergence talqinini qo‘llab-quvvatlash uchun ishlatiladi.
- 3-shakl: Grokking kechikishining p ga nisbatan masshtablari, λ = 4 atrofidagi muvaffaqiyatsizlik rejimi va p kattalashgani sari ikki fazali grokkingning yanada bir vaqtda o‘rganishga yaqinlashishi ko‘rsatiladi.
9. Noto‘g‘rilanishi mumkin bo‘lgan taxminlar
| Taxmin | Soha | Da’vo |
|---|---|---|
| P1 | Evolyutsion biologiya | Anaerob xamirturush shoxlari bir xil filogenetik masofadagi aerob shoxlarga qaraganda yuqoriroq genomik yaqinlashuv ko‘rsatishi kerak. |
| P2 | Katta til modellari | Yuqoriroq weight decay bilan o‘qitilgan LLM lar yuqoriroq sababiy ta’sirga ega tasvirlanishlar hosil qilishi mumkin. |
| P3 | Grokking | λc(p) chegarasidan o‘tganda grokking mexanizm ochligi sababli muvaffaqiyatsiz bo‘lishi kerak. |
10. Kuchli tomonlar va cheklovlar
| Kuchli tomonlar | Cheklovlar |
|---|---|
| Fizik va axborot nazariyasi cheklovlarini bitta ramkada birlashtiradi. | HEF barcha emergence hodisalarini to‘liq tushuntiruvchi yakunlangan nazariya sifatida taqdim etilmaydi. |
| Grokking uchun o‘lchab bo‘ladigan Ec barmoq izini taklif etadi. | Tajribalar kichik o‘lchamli transformer va modulyar arifmetika vazifalari bilan cheklangan. |
| Noto‘g‘rilanishi mumkin bo‘lgan sohalararo taxminlar beradi. | Biologiya, LLM va nanopartikula taxminlari bu matnda mustaqil tasdiqlangan natijalar emas. |
| Matematik teoremalar bilan ochiq skelet quradi. | A6 metrik qisqarish sharti umumiy holatda qo‘shimcha tuzilma yoki empirik tasdiq talab qiladi. |
Manba va usul izohi
Ushbu maqola Truong Xuan Khanh tomonidan tayyorlangan “Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems” nomli ishga asoslanib tayyorlangan. Ishda muallifning H&K Research Studio, Clevix LLC, Hanoi, Vietnam bilan aloqasi va 2026-yil may sanasi berilgan. Matnning birinchi sahifasida arXiv topshirish ma’lumoti borligi uchun ish arXiv topshirig‘i / preprint xarakteridagi nazariy-empirik tadqiqot sifatida ko‘rib chiqilgan.
Matn ichida u hakamli jurnalda chop etilgani, DOI bilan yakuniy nashrga aylangani yoki hakamlikdan o‘tgani haqida ochiq tasdiq topilmagani sababli bu ish uchun matn orqali hakamligi tasdiqlanmagan ish iborasi ishlatilishi kerak. Shu sababli HEF ning keng qamrovli da’volari, ayniqsa biologiya, katta til modellari va nanopartikula qo‘llanishlari nuqtayi nazaridan ehtiyotkor baholanishi kerak.
Bu kontentda faqat ishda berilgan nazariy ta’riflar, formulalar, tajriba shartlari, vizual natijalar, sonli natijalar, cheklovlar va ochiq taxminlardan foydalanildi. PDF da bo‘lmagan aniq hakamli nashr qabulі, barcha sun’iy intellekt tizimlarida tasdiqlangan umumlashuv, biologik taxminlarning to‘liq tajribaviy isboti, klinik ta’sir, tijoriy muvaffaqiyat yoki xavfsizlik kafolati kabi da’volar qo‘shilmadi.
Ishning grokking natijalari modulyar arifmetika vazifalarida kichik o‘lchamli transformer tajribalari bilan qo‘llab-quvvatlangan. HEF ning boshqa sohalarga tatbiqi esa matnda ko‘proq nazariy moslashtirish va sinovdan o‘tkazilishi mumkin bo‘lgan taxmin darajasida beriladi. Shu bois ish kuchli matematik taklif va dastlabki empirik dalilni o‘z ichiga olsa-da, uning yakuniy qiymati mustaqil takrorlar va yangi sohalarda o‘tkaziladigan tasdiqlash/noto‘g‘rilash ishlari bilan belgilanadi.

Izoh qoldiring
E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan