
Ushbu tadqiqot Ethereum va Bitcoin kabi ma’lumotlar tuzilishi bir-biridan farq qiluvchi blokcheynlardagi firibgarlik hisoblarini yagona model orqali aniqlash mumkin yoki yo‘qligini o‘rganadi. Tadqiqotchilar hisoblarning tranzaksiya tarixini katta til modeli (LLM) yordamida matnli xulosalarga aylantiruvchi, ushbu xulosalardagi farqlovchi ma’lumotlarni ehtimoliy gallyutsinatsiya va vazifaga aloqasiz qismlardan ajratib oluvchi hamda olingan matn ifodalarini tranzaksiya grafigi bilan birlashtiruvchi UniDetect nomli usulni ishlab chiqdilar. Ethereum tajribalarida UniDetect 92,65% F1, 94,82% AUC va 68,94% Kolmogorov-Smirnov (KS) qiymatlarini; Bitcoin-M va Bitcoin-L ma’lumotlar to‘plamlarida esa mos ravishda 92,98% va 93,41% F1 natijalarini qayd etdi. Shunga qaramay, tadqiqot preprint hisoblanadi; tarmoqlararo nollik (zero-shot) qo‘llashda firibgarlik hisoblari bo‘yicha to‘liqlik (recall) 94,58% dan yuqori bo‘lsa-da, aniqlikning (precision) taxminan 60–63% atrofida qolishi juda ko‘p sonli oddiy hisoblarning noto‘g‘ri signal (false alarm) sifatida belgilanishi mumkinligini ko‘rsatadi.
UniDetect’ning asosiy g‘oyasi blokcheyn tranzaksiyalarini faqatgina miqdor, chastota yoki tugun darajasi kabi sonli parametrlar bilan cheklamaslikdir. Model mablag‘lar oqimining yig‘ilish yoki tarqatilish shaklini, tranzaksiya vaqtini, kontragentlar xilma-xilligini va tranzaksiya grafigidagi qo‘shnichilik modellarini yagona umumiy ifodaga jamlaydi. Katta til modeli hisoblarning o‘tmishdagi faoliyatini tushuntiruvchi matnli dalillarni yaratadi, grafik neyron tarmog‘i (GNN) esa hisobning tranzaksiyalar tarmog‘idagi tuzilmaviy o‘rni va aloqalarini baholaydi.
Tadqiqotning eng e’tiborga molik natijasi ayni bir modelning turli xil blokcheynlarda yuqori to‘liqlik (recall) ko‘rsatkichiga erisha olishidir. Biroq “firibgarlik hisoblarining 94,58% dan ortig‘ini aniqlash” xulosasi umumiy to‘g‘rilik (accuracy) degani emas. Bu qiymat firibgarlik sinfidagi to‘liqlikni ifodalaydi; ayni tajribalarda aniqlikning (precision) past bo‘lishi modelni real nazorat tizimlarida yakka o‘zi uzil-kesil qaror chiqaruvchi mexanizm sifatida qo‘llamaslik kerakligini ko‘rsatadi.
Tadqiqotning asosiy savoli nima?
Tadqiqotning asosiy savoli — ma’lumotlar tuzilishi, tranzaksiya mexanizmlari va voqealar ma’nosi bir-biridan farq qiluvchi blokcheynlarda firibgarlik hisoblarini yagona ifoda va yagona tasniflagich yordamida aniqlash mumkinmi degan masaladir. An’anaviy usullarning katta qismi Ethereum yoki Bitcoin kabi muayyan tarmoq uchun qo‘lda ishlab chiqilgan belgilarga (feature engineering) tayanadi. Ethereum uchun foydali bo‘lgan gaz (gas) sarfi, aqlli shartnoma chaqiruvlari yoki kiruvchi xabarlar kabi parametrlar Bitcoin’da ayni shaklda mavjud emas. Bitcoin’ning tranzaksiya kirishlari (inputs), chiqishlari (outputs) va UTXO ko‘p manzilli tuzilishi ham Ethereum’dagi hisobga asoslangan (account-based) tranzaksiya mantig‘idan farq qiladi.
Mualliflar keltirgan soha hisobotlariga ko‘ra, 2025-yilning birinchi yarmida kriptovalyuta firibgarliklaridan ko‘rilgan zararlar 2,47 milliard AQSh dollaridan oshgan; murakkab noqonuniy ishlarning qariyb 20 foizi o‘ndan ortiq blokcheynga tarqalgan va zanjirlararo (cross-chain) jinoiy faoliyat hajmi 21,8 milliard AQSh dollaridan oshib ketgan. Ushbu raqamlar tadqiqotda ilmiy turtki sifatida qo‘llanilgan; UniDetect tajribalari bu iqtisodiy yo‘qotishlarni to‘g‘ridan-to‘g‘ri o‘lchamagan.
Mavjud usullardagi qaysi bo‘shliq nishonga olingan?
Tadqiqot mavjud yondashuvlardagi uchta asosiy cheklovni bartaraf etishga qaratilgan:
- Muayyan tarmoqqa xos parametrlar muhandisligi: Ko‘plab modellar ekspertlar tomonidan muayyan blokcheyn uchun belgilangan sonli parametrlarga tayanadi. Bu belgilar boshqa tarmoqqa ko‘chirilganda ayni ma’no yoki ma’lumot ekvivalentini topa olmasligi mumkin.
- Tranzaksiya semantikasining cheklangan ifodasi: Tranzaksiya miqdori, chastotasi va graf tuzilishi muhim bo‘lsa-da, ayrim blokcheynlarda tranzaksiya xabarlari, shartnoma jurnallari va xulq-atvor ketma-ketliklari kabi matnli yoki yarim tuzilmali ma’lumotlar ham mavjud.
- Til va graf modellarining bir-biridan uzilgan holda ishlatilishi: Oldingi ko‘p tarmoqli modellar tranzaksiya ketma-ketliklari yoki graf tuzilishini umumlashtirishga uringan bo‘lsa-da, soha bilimi, matnli ma’no va tranzaksiya topologiyasi ko‘pincha ayni bir o‘rganish jarayonida birgalikda optimallashtirilmaydi.
Mualliflar UniDetect’ni katta til modellarini maxsus nozik sozlash strategiyalari orqali geterogen blokcheyn firibgarligiga tatbiq etgan ilk urinish sifatida taqdim etadilar. Ushbu “birinchi” degan ta’rif tadqiqotchilarning shaxsiy da’vosidir; maqolada mustaqil tizimli adabiyotlar tasdig‘i keltirilmagan.
Katta til modelini qo‘llashdagi uchta qiyinchilik
C1: Geterogen blokcheynlarni umumiy tarzda tushunish
Model Ethereum, Bitcoin va kelajakda boshqa tarmoqlarda duch kelishi mumkin bo‘lgan turli tranzaksiya yozuvlarini umumiy xulq-atvor tilida ifodalashi lozim. UniDetect buning uchun xom tranzaksiyalarni to‘g‘ridan-to‘g‘ri bir xil sonli ustunlarga majburlash o‘rniga, har bir tarmoqning tranzaksiya ma’lumotlaridan hisob darajasida tabiiy til xulosasini yaratadi.
C2: Gallyutsinatsiya va asossiz xulosalarni cheklash
Katta til modeli tranzaksiya yozuvida mavjud bo‘lmagan aloqalar, vaqt, tashkilot yoki jinoyat bog‘liqliklarini to‘qib chiqarishi (gallyutsinatsiya qilishi) mumkin. Firibgarlikni aniqlashda bu holat oddiy matn xatosi emas, balki qonuniy hisobning asossiz jinoyatchiga chiqarilishi xavfini tug‘diradi. UniDetect bu xatarni kamaytirish uchun farqlovchi xulosa va qoldiq xulosa yaratuvchi ikkita alohida tahliliy agentdan foydalanadi.
C3: Matn bilan ulkan tranzaksiya grafigini samarali birlashtirish
Millionlab tugunlar va yuz millionlab qirralardan iborat tranzaksiyalar grafigini to‘liq matnga aylantirib, til modeliga kiritish hisoblash quvvati jihatidan imkonsizdir. Shu sababli UniDetect markaziy hisob atrofida kichik quyi grafni (subgrafni) tanlab oladi, so‘ngra tuzilmaviy ahamiyat bo‘yicha siqish usulini qo‘llaydi va faqat tanlangan tugunlarning matnli xulosalarini grafik neyron tarmog‘iga uzatadi.
Tranzaksiya grafigi qanday ta’riflangan?
Tranzaksiyalar tarmog‘i yo‘naltirilgan graf sifatida ifodalanadi:
\[ G = (V,E) \]
Bu yerda \(V\) — hisob yoki manzil tugunlari, \(E\) esa yo‘naltirilgan tranzaksiya qirralaridir. Graf \(n\) ta tugun va \(m\) ta tranzaksiya qirrasiga ega. Qirralarning belgilari quyidagi matritsa bilan ifodalanadi:
\[ X_E \in \mathbb{R}^{m \times d} \]
Har bir qator bitta tranzaksiya qirrasiga, \(d\) esa ushbu qirraning parametrlar soniga to‘g‘ri keladi. Parametrlar tarmoqqa qarab tranzaksiya miqdori, soni, kirish qiymati, chiqish qiymati yoki komissiya to‘lovi kabi ma’lumotlarni o‘z ichiga oladi.
Firibgarlikni aniqlash ikkilik tugun tasnifi (binary node classification) sifatida shakllantirilgan:
\[ f:(V,E,X_E,Y_L)\longrightarrow Y_U \]
\(Y_L\) — belgilangan (yorliqlangan) tugunlar, \(Y_U\) esa sinfi bashorat qilinishi kerak bo‘lgan tugunlardir. Natija hisobning oddiy yoki firibgar sinfga tegishli ekani ehtimolini bildiradi.
Quyi graf (subgraf) qanday tanlanadi?
UniDetect belgilangan hisobni markaziy tugun deb oladi va uning atrofidagi ikki qadamli (two-hop) qo‘shnichilikni tanlaydi. Har bir qadamda o‘rtacha tranzaksiya qiymati eng yuqori bo‘lgan ko‘pi bilan \(K\) ta qo‘shniga ustuvorlik beriladi:
\[ C_h = \bigcup_{v \in C_{h-1}} \operatorname{topK}\left(\mathcal{N}_v,K,R[v,\mathcal{N}_v]\right) \]
- \(C_h\): \(h\)-bosqichda tanlangan tugunlar to‘plami.
- \(C_0\): markaziy hisobning o‘zi.
- \(\mathcal{N}_v\): \(v\) tugunining bir qadamli qo‘shnilari.
- \(K\): har bir bosqichda saqlanadigan maksimal qo‘shnilar soni; tajribalarda 10 deb olingan.
- \(R[v,\mathcal{N}_v]\): markaz bilan nomzod qo‘shni o‘rtasidagi o‘rtacha tranzaksiya qiymati.
Tranzaksiya qiymatining birligi ishlatilgan tarmoqqa bog‘liq (Ethereum uchun ETH, Bitcoin uchun BTC). Agar o‘rtacha tranzaksiya qiymatlari teng bo‘lib qolsa, umumiy tranzaksiya qiymati yuqoriroq bo‘lgan ma’lumot tanlanadi.
Tuzilmaviy ahamiyat bo‘yicha grafni siqish (SIGC) qanday ishlaydi?
Ikki qadamli va har qadamda 10 ta qo‘shniga ega tanlanma juda tez kengayib ketishi mumkin. Tadqiqotchilar ushbu grafni ixchamlashtirish uchun Structural Importance Graph Compression (SIGC) algoritmini yaratganlar. Har bir qo‘shni tugunning tuzilmaviy ahamiyat bali quyidagicha hisoblanadi:
\[ S_u = \frac{\log(a_u^{in}+a_u^{out}+1)+\beta\log(d_u^{in}+d_u^{out}+1)}{L_u+1} \]
- \(a_u^{in}\) va \(a_u^{out}\): qo‘shni tugunning kiruvchi va chiquvchi tranzaksiya hajmlari.
- \(d_u^{in}\) va \(d_u^{out}\): tugunning quyi graf ichidagi kiruvchi va chiquvchi darajalari (bog‘lanishlar soni).
- \(L_u\): markaziy tugundan qo‘shni tugungacha bo‘lgan eng qisqa yo‘l uzunligi (BFS orqali topiladi).
- \(\beta\): moliyaviy hajm bilan tuzilmaviy aloqadorlik o‘rtasidagi muvozanat koeffitsiyenti; tajribalarda 2 deb olingan.
Tranzaksiya hajmi va ulanishlar darajasi ortgan sari ahamiyat bali oshadi, markaziy hisobdan uzoqlashgan sari esa pasayadi. Agar quyi graf \(N_c\) tugun chegarasidan oshib ketsa, eng yuqori ballga ega tugunlar saqlab qolinadi. Aloqa uzilib qolmasligi uchun markaziy tugun bilan saqlangan tugunlar o‘rtasidagi eng qisqa yo‘llardagi oraliq tugun va qirralar ham siqilgan grafga kiritiladi. Tajribalarda \(N_c\) qiymati 10 ga teng.
Kriminalistik tahlil agenti qanday ma’lumotlarni umumlashtiradi?
Graf shakllantirilgach, LLM asosidagi kriminalistik tahlil agenti har bir hisobning tranzaksiya tarixini 3–5 ta gapdan iborat matnga aylantiradi. Qo‘llanma shabloni to‘rtta o‘lchovga tayanadi:
| Tahlil o‘lchovi | Baholanadigan ma’lumot | Ko‘rsatilgan namuna chegaralar |
|---|---|---|
| Qiymat oqimi | Hisobning sof qabul qiluvchi, sof tarqatuvchi yoki muvozanatli ekani | Ethereum misolida 1 000 ETH dan yuqori yirik, 100 ETH dan past kichik hajm |
| Kontragentlar nisbati | Kiruvchi va chiquvchi hamkorlar nisbati orqali to‘plash yoki tarqatish moyilligi | Nisbat 2 dan katta bo‘lsa to‘plash, 0,5 dan kichik bo‘lsa tarqatish belgisi |
| Vaqt taqsimoti | Faollik davomiyligi, to‘satdan zichlashuv, kechasi yoki dam olish kunlari faolligi | Qat’iy chegara o‘rniga vaqtinchalik to‘planish (klasterlashuv) qidiriladi |
| Gaz sarfi | Jami gaz va chiquvchi tranzaksiya boshiga o‘rtacha gaz | 1 milliard gwei dan yuqori jami yoki 100 000 gwei dan yuqori o‘rtacha yuqori sarf; 50 000 gwei dan past kam sarf |
Ushbu chegaralar modelga yo‘nalish beruvchi qoidalardir; tadqiqot bular barcha blokcheynlar uchun mutlaq qoidalar ekanini isbotlamaydi. Ayniqsa ETH va gwei atamalari faqat Ethereum’ga xosdir. Bitcoin kabi gaz tushunchasi bo‘lmagan tarmoqlarda bu shablon qanday moslashtirilgani batafsil ko‘rsatilmagan.
Nima uchun farqlovchi xulosa va qoldiq xulosa ajratilgan?
Dastlabki tranzaksiya xulosasi ikkita alohida agentga yuboriladi:
- Farqlovchi xulosa agenti (Discriminative agent): Firibgarlik tasnifiga bevosita aloqador tranzaksiya modellarini, mablag‘ oqimlarini, shubhali manzillarni va vaqt belgilarini ajratib oladi (masalan, qisqa vaqtda zich o‘tkazmalar, ko‘p manbalardan bitta hisobga to‘plab, so‘ng ko‘plab manzillarga tez tarqatish, yuqori xavfli manzillar bilan aloqa).
- Qoldiq xulosa agenti (Residual agent): Tasnifga bevosita aloqador bo‘lmagan xolis faktlarni hamda model to‘qib chiqarishi mumkin bo‘lgan asossiz xulosalarni ajratadi (masalan, hisobning to‘qqiz yildan beri faolligi kabi to‘g‘ri, ammo jinoyat belgisi bo‘lmagan ma’lumotlar yoki to‘qilgan tashkilot nomlari).
Farqlovchi agent har bir manzil bo‘yicha eng xarakterli belgini bitta gapda ifodalashga yo‘naltirilgan. Qoldiq agent esa faqat tekshirilishi mumkin bo‘lgan sonlar va vaqt oraliqlarini saqlashi, “firibgar”, “xavfli” yoki “oddiy” kabi baholovchi so‘zlarni ishlatmasligi kerak.
Matnli xulosalar graf ifodasiga qanday aylantiriladi?
Farqlovchi xulosa, qoldiq xulosa va dastlabki xulosa Sentence-BERT modeli yordamida vektorlarga aylantiriladi. Bu vektorlar graf tugunlarining boshlang‘ich parametrlari bo‘lib xizmat qiladi. So‘ng Dual-PGNN nomli ikki yo‘lli grafik neyron tarmog‘i matnli belgilarni tranzaksiya qo‘shnichiligi bilan birga qayta ishlaydi.
Ikki yo‘lli tizim markaziy hisobning o‘z matnli belgilari qo‘shni tugunlar ta’sirida yuvilib ketishining oldini oladi. Bu firibgarlar o‘zlarini oddiy hisoblar orasida yashirishga uringan “qo‘shnichilik kamuflyaji” muammosini yengishga yordam beradi.
Uch ko‘rinishli yo‘qotish funksiyasi qanday tuzilgan?
Farqlovchi xulosa yo‘qotishi
Farqlovchi xulosaning firibgarlikni to‘g‘ri topishi ikkilik kross-entropiya bilan o‘lchanadi:
\[ \mathcal{L}_v^D = -\sum_{v \in V}\left[y_v\log(p_v^D)+(1-y_v)\log(1-p_v^D)\right] \]
- \(y_v\): tugunning haqiqiy yorlig‘i.
- \(p_v^D\): farqlovchi xulosadan olingan firibgarlik ehtimoli.
Qoldiq xulosa yo‘qotishi
Qoldiq xulosa tasniflagichga hech qanday farqlovchi signal bermasligi kerak. Buning uchun uning bashorati teng ehtimolli (50/50) taqsimotga yaqinlashtiriladi:
\[ \mathcal{L}_v^R = \sum_{v \in V}D_{KL}(p_v^R\parallel U_v) = \sum_{v \in V}\sum_{k\in\{0,1\}}p_v^R(k)\log\frac{p_v^R(k)}{U_v(k)} \]
- \(p_v^R\): qoldiq xulosadan chiqqan sinf ehtimolligi.
- \(U_v\): tekis taqsimot (ikkala sinf uchun 0,5).
- \(D_{KL}\): Kullbak-Leybler (KL) tafovuti.
Ortogonal yo‘qotish
Farqlovchi va qoldiq belgilar bir-biriga aralashib ketmasligi uchun ularning skalyar ko‘paytmasi nolga intiltiriladi:
\[ \mathcal{L}_v^O = \left\lVert S_v^D \cdot S_v^R \right\rVert_2^2 \]
\(S_v^D\) — farqlovchi, \(S_v^R\) — qoldiq tugun ifodasi.
Jami yo‘qotish
\[ \mathcal{L}_v = \mathcal{L}_v^D+\lambda_1\mathcal{L}_v^R+\lambda_2\mathcal{L}_v^O \]
Tajribalarda \(\lambda_1=0{,}05\) va \(\lambda_2=0{,}3\) qilib belgilangan.
Mustahkamlovchi o‘rganish (RL) katta til modelini qanday yo‘naltiradi?
Birinchi o‘qitish bosqichida graf kodlagich muzlatiladi, xulosa agentlarining LLM parametrlari LoRA yordamida sozlanadi. Jami yo‘qotish mukofotga aylantiriladi:
\[ R_v = \exp(-\mathcal{L}_v) \]
Yo‘qotish kamaysa, mukofot 1 ga yaqinlashadi. So‘ngra siljuvchi o‘rtacha ayirilib, ustunlik (advantage) hisoblanadi:
\[ \hat{A}_v = R_v-b_t \]
Ketma-ketlik darajasidagi REINFORCE yo‘qotishi:
\[ \mathcal{L}_v^{RL}=-\hat{A}_v\left(\log p_v^{Disc}+\log p_v^{Resi}\right) \]
Yuqori mukofot olgan xulosalarning paydo bo‘lish ehtimoli oshiriladi, past mukofot olganlarniki kamaytiriladi.
9-rasmdagi yaqinlashuv grafigida tekislangan mukofot dastlabki 50 qadamda nol atrofidan 0,5 ga ko‘tariladi va o‘qitish davomida 0,5–0,6 oralig‘ida barqaror saqlanadi.
Ikkinchi bosqichda grafik neyron tarmog‘i qanday o‘qitiladi?
Ikkinchi bosqichda LLM muzlatiladi va Dual-PGNN o‘qitiladi. Farqlovchi yoki qoldiq ifoda dastlabki xulosa ifodasi bilan alohida yo‘llardan qayta ishlanadi:
\[ \hat{Z}_v^{D/R}=\operatorname{GNN}(\hat{r}_v^{D/R},A_v)+\theta(\hat{r}_v^{D/R}) \]
\[ \hat{Z}_v^O=\operatorname{GNN}(\chi_v,A_v)+\theta(\chi_v) \]
So‘nggi ifoda e’tibor (attention) og‘irliklari orqali birlashtiriladi:
\[ \hat{S}_v^{D/R}=W_1\hat{Z}_v^{D/R}+W_2\hat{Z}_v^O \]
\(W_1\) va \(W_2\) o‘rganiladigan e’tibor og‘irliklaridir.
1- va 2-rasmlar nimani tushuntiradi?
1-rasm an’anaviy tarmoqqa xos modellar bilan UniDetect o‘rtasidagi farqni ko‘rsatadi. An’anaviy tomonda Bitcoin va Ethereum uchun alohida parametrlar va alohida GNN tuzilmalari ishlaydi. UniDetect da esa turli tarmoqlarning amallari dastlab umumiy tranzaksiya tiliga o‘giriladi, so‘ngra ko‘p tarmoqli graf va matn ifodasi yagona tasniflagichga uzatiladi.
2-rasm o‘qitish va xulosa chiqarish (inference) jarayonini to‘liq aks ettiradi. O‘qitishda quyi graf yaratish, xulosa yozish, farqlovchi va qoldiq qismlarni ajratish, RL orqali LLMni sozlash va Dual-PGNN ni o‘qitish qadamlari ko‘rsatilgan. Xulosa chiqarishda esa qoldiq agent ishlatilmaydi; tahlil xulosasi va farqlovchi xulosa graf kodlagich orqali to‘g‘ridan-to‘g‘ri firibgarlik ehtimoliga aylantiriladi.
Qaysi ma’lumotlar to‘plamlaridan foydalanilgan?
Tadqiqotda uchta blokcheyn ma’lumotlar to‘plami va tarmoqdan tashqari umumlashtirish tajribasi uchun bitta Instagram grafigi ishlatilgan:
| Ma’lumotlar to‘plami | Jami tugunlar | Qirralar | Firibgar yoki ijobiy yorliq | Oddiy yoki salbiy yorliq | Firibgar/ijobiy ulushi |
|---|---|---|---|---|---|
| Ethereum | 187 960 | 397 038 | 1 991 | 1 439 | 1,06% |
| Bitcoin-M | 2 505 841 | 14 181 316 | 46 930 | 213 026 | 1,87% |
| Bitcoin-L | 20 085 231 | 203 419 765 | 362 391 | 1 271 556 | 1,80% |
| 11 339 | 198 448 | 4 115 biznes hisob | 7 224 oddiy hisob | 36,29% |
Ethereum yorliqlari Etherscan Label Cloud, XLabelCloud va CryptoScamDB bazalaridan olingan (fishing, Upbit xakerlik hujumlari, qimor va honeypot hisoblari). Maynerlar va rasmiy xizmat ko‘rsatuvchilar oddiy sinfga kiritilgan. Tranzaksiyalar 2015-yil 7-avgustdan 2025-yil 10-aprelgacha bo‘lgan davrni qamrab oladi.
Bitcoin-M 2015-yil iyunigacha bo‘lgan dastlabki 1,5 million tranzaksiyani, Bitcoin-L esa 2015-yil iyun–sentyabr oylari oralig‘idagi amallarni o‘z ichiga oladi. Qimor va mikser xizmatlariga bog‘liq manzillar firibgarlik deb belgilangan, qolganlari oddiy hisoblangan.
Instagram tajribasida esa vazifa firibgarlikni aniqlash emas, balki biznes hisoblari bilan oddiy foydalanuvchi hisoblarini ajratishdan iborat bo‘lgan.
Baholash ko‘rsatkichlari va qiyoslash modellari
Ma’lumotlar 80% o‘qitish, 10% tekshirish (val) va 10% test qismlariga bo‘lingan. UniDetect jami 20 ta taqqoslash usuli bilan solishtirilgan (DeepWalk, GCN, GAT, GraphSAGE, CARE-GNN, BWGNN, GRIT, Trans2Vec, TSGN, Ethident, TEGDetector, SIGTRAN, BERT4ETH, DIAM va boshqalar).
UniDetect’ning tayanch LLM modeli — Gemma-3-4B-it, matn kodlagichi — Sentence-BERT, graf arxitekturasi — CARE-GNN omboriga asoslangan Dual-PGNN dir.
Ko‘rsatkichlar: Aniqlik (Precision), To‘liqlik (Recall), F1-ball, AUC va Kolmogorov-Smirnov (KS).
\[ KS=\max_x\left|F_1(x)-F_2(x)\right| \]
Asosiy tajriba natijalari
| Ma’lumotlar to‘plami | Aniqlik (Precision) | To‘liqlik (Recall) | F1-ball | AUC | KS |
|---|---|---|---|---|---|
| Ethereum | 91,39% ± 0,60 | 93,95% ± 0,56 | 92,65% ± 0,34 | 94,82% ± 0,24 | 68,94% ± 0,12 |
| Bitcoin-M | 90,61% ± 0,48 | 95,47% ± 0,99 | 92,98% ± 0,64 | 93,83% ± 0,32 | 70,45% ± 1,16 |
| Bitcoin-L | 90,61% ± 0,50 | 96,43% ± 1,16 | 93,41% ± 0,49 | 95,22% ± 0,71 | 72,25% ± 0,66 |
Ethereum’da eng yaxshi taqqoslash modeliga nisbatan UniDetect F1 bo‘yicha 8,56, AUC bo‘yicha 12,15 va KS bo‘yicha 7,58 foiz bandga yuqori natija ko‘rsatgan. Sozlanmagan (zero-shot) variantida F1 85,38% bo‘lgan bo‘lsa, to‘liq modelda 92,65% ga yetgan.
Bitcoin-M da F1 bo‘yicha 5,41, Bitcoin-L da esa 3,61 foiz bandga o‘sish qayd etilgan.
Zanjirlararo nollik (cross-chain zero-shot) tajribasi nimani ko‘rsatadi?
Ethereum’da o‘qitilgan model to‘g‘ridan-to‘g‘ri Bitcoin’ga qo‘llanilganda (5a-rasm), tasniflash chegarasi 0,45 dan 0,70 gacha o‘zgartirilganda to‘liqlik (recall) 94,58% dan 100% gacha saqlanib qolgan. Biroq aniqlik (precision) taxminan 60,07% dan 63,25% gacha, F1 esa 73,46% dan 77,50% gacha tushib qolgan.
Bu shuni anglatadiki, model firibgar hisoblarning katta qismini payqay oladi, ammo ko‘plab oddiy hisoblarga ham asossiz “firibgar” deb xato baho berib yuboradi (yuqori false positive).
Ablatsiya (komponentlarni ajratish) tajribalari
| Model varianti | F1-ball | AUC | Graf yaratish vaqti | Xulosa |
|---|---|---|---|---|
| SIGC siqishsiz | 93,62% | 94,14% | 40,37 soniya/hisob | F1 biroz oshadi, ammo vaqt sarfi 32 baravar ko‘payadi |
| Ikki bosqichli o‘qitishsiz | 85,65% | 82,52% | Keltirilmagan | Birgalikdagi o‘qitish muhimligini ko‘rsatadi |
| Qoldiq xulosa agentsiz | 78,37% | 79,81% | Keltirilmagan | Eng katta pasayish yuz beradi |
| Mustahkamlovchi o‘rganishsiz (RLsiz) | 87,50% | 86,63% | Keltirilmagan | Teskari aloqaning matn sifatiga hissasini ko‘rsatadi |
| Dual-PGNN siz | 88,50% | 89,63% | Keltirilmagan | Markaziy tugun belgisini saqlovchi ikki yo‘l muhim |
| To‘liq UniDetect | 92,65% | 94,82% | 1,26 soniya/hisob | Aniqlik va tezlik o‘rtasidagi eng maqbul muvozanat |
Qoldiq agentning olib tashlanishi F1 ni 14,28 va AUC ni 15,01 foiz bandga tushirib yuborgan. Bu gallyutsinatsiyalarni alohida ifoda sifatida ajratishning hal qiluvchi rolini tasdiqlaydi.
Hisoblash xarajatlari
| Tarkibiy qism | Hisobot qilingan xarajat |
|---|---|
| Quyi graf tanlash va siqish | 1,26 soniya/hisob |
| 1-bosqich: LLM nozik sozlash (RL) | 12,42 soat |
| 2-bosqich: GNN o‘qitish | 0,38 soat |
| Onlayn xulosa chiqarish kechikishi | 1,47 millisoniya/namuna |
| Xulosa chiqarish o‘tkazuvchanligi | 680 namuna/soniya |
| Gemma-3-4B-it va LoRA jami parametrlari | 4 303,30 million |
| O‘qitiladigan LLM parametrlari | 3,22 million (jami hajmning ~0,07%i) |
| Dual-PGNN parametrlari | 0,04 million |
Xulosa chiqarish juda tez (1,47 ms) bo‘lsa-da, 12,42 soatlik LLM o‘qitilishi, ikkita A6000 GPU talab etilishi va har bir hisob uchun 1,26 soniyalik dastlabki ishlov sarfi tizimning umumiy resurs talabi yuqoriligini ko‘rsatadi.
Haqiqiy hisob misoli va gallyutsinatsiya muammosi
Ethereum tarmog‘idagi amaliy misolda hisob to‘qqiz yil davomida 81 ta noyob manzil bilan 3 742 ta tranzaksiya amalga oshirgani keltiriladi. Dastlabki LLM xulosasi tranzaksiyalar asosan Yevropa ish vaqtida o‘tkazilgani va hisob Yevropolning 2022-yilgi hisobotida qayd etilganini yozgan. Bu ikki ma’lumot tranzaksiya bazasida yo‘q bo‘lgan gallyutsinatsiyadir. Qoldiq xulosa agenti bu asossiz jumlalarni ajratib olgan, farqlovchi xulosa esa faqat real tranzaksiya modellarini saqlab qolgan.
Bu holat UniDetect gallyutsinatsiyani butunlay yo‘q qilishini isbotlamaydi; faqat filtrlashga urinishini ko‘rsatadi. Amaliyotda filtrlash agenti ham xato qilishi mumkin.
Tadqiqotning kuchli tomonlari
- Ethereum va Bitcoin kabi ikki xil tuzilishdagi blokcheynda yagona arxitektura sinalgani;
- 3 ta blokcheyn to‘plami, 20 ta taqqoslash usuli va KS o‘lchovi qo‘llanilgani;
- Ablatsiya, sezgirlik, xarajat va yaqinlashuv tahlillari to‘liq berilgani;
- Manzillar va yorliqlar shablonlardan chiqarilib, axborot sizib chiqishi (data leakage) oldi olingani;
- Gallyutsinatsiyalarni ajratish maxsus o‘qitish maqsadi qilib belgilangani;
- LoRA orqali 4,3 milliardlik modelning atigi 3,22 million parametri tejamkor sozlangani;
- Tarmoqlararo tajribada to‘liqlik va aniqlik muvozanati ochiq ko‘rsatilgani.
Tadqiqotning cheklovlari
- Preprint holati: Taqrizdan o‘tgani tasdiqlanmagan arXiv qo‘lyozmasidir.
- Kodning ochiqlanmagani: GitHub omborida kodlar hali to‘liq e’lon qilinmagan.
- Tarmoqlar soni kamligi: “Universal” deb nomlangan bo‘lsa-da, faqat Ethereum va Bitcoin’da tekshirilgan.
- Eski Bitcoin ma’lumotlari: 2015-yil ma’lumotlari zamonaviy DeFi, L2 va mikser amaliyotlarini aks ettirmasligi mumkin.
- Yorliqlar noaniqligi: Barcha qimor va mikser manzillarini to‘g‘ridan-to‘g‘ri firibgar deb hisoblash munozaralidir.
- Oddiy hisoblar tanlovi: Faqat mayner va birjalar oddiy sinf deb olingan, oddiy foydalanuvchilar to‘liq qamralmagan.
- Yuqori xato signallar: Zanjirlararo aniqlik 60–63% atrofida bo‘lib, ko‘plab begunoh hisoblarni firibgarga chiqarish xavfi bor.
- Statistik testlar yetishmasligi: Taqqoslashlar bo‘yicha ishonchlilik oraliqlari va p-qiymatlari berilmagan.
- Real sinov yo‘qligi: Model birja yoki huquq-tartibot idoralarida jonli ish rejimida sinalmagan.
Tadqiqot nima deydi?
- LLM xulosalarini graf tugun parametri sifatida ishlatish an’anaviy graf usullariga qaraganda yuqoriroq natija berdi.
- Farqlovchi va qoldiq xulosalarni ajratish model sifatini sezilarli darajada oshirdi.
- Graf siqish (SIGC) hisoblash vaqtini 40,37 soniyadan 1,26 soniyaga tushirdi.
- Ethereum’da o‘qitilgan model Bitcoin’dagi firibgar hisoblarning katta qismini aniqlay oldi.
- Matn-graf sintezi Instagram hisoblarini tasniflashga ham muvaffaqiyatli ko‘chirildi.
Tadqiqot nima demaydi?
- UniDetect barcha blokcheynlarda bir xil yuqori aniqlikda ishlashini isbotlamaydi.
- Hisobning qonunan jinoyatchi ekanini qat’iy belgilab bermaydi.
- Yuqori to‘liqlik past xato signallar bilan birga kelganini ko‘rsatmaydi.
- LLM gallyutsinatsiyalari butunlay yo‘q qilinganini da’vo qilmaydi.
- Inson nazoratisiz avtomatik jazo qo‘llash uchun tayyor ekanini bildirmaydi.
- Kiberhujumchilarning maxsus graf kamuflyajlariga qarshi mutlaq chidamlilikni kafolatlamaydi.
Amaliyot uchun ahamiyati
UniDetect blokcheyn tahlilchilariga minglab amallarni birma-bir ko‘rib chiqish o‘rniga, shubhali hisoblarni matnli tushuntirishlar va graf aloqalari orqali saralab berishda yordamchi vosita bo‘lishi mumkin. Potensial sohalar — birjalar komplayens tizimlari, AML (pul yuvishga qarshi kurash) xizmatlari va tergov organlaridir.
Biroq tarmoqlararo aniqlik pastligi sababli tizim avtomatik hukm chiqaruvchi emas, balki chuqur tekshiruv uchun shubhali hisoblarni ajratib beruvchi birlamchi elak (screening) vazifasini bajarishi lozim.
Tadqiqotning metodologiyasi va natijalari
| Texnik element | Qo‘llanilgan usul |
|---|---|
| Vazifa | Oddiy va firibgar hisoblar uchun ikkilik tugun tasnifi |
| Blokcheynlar | Ethereum, Bitcoin-M va Bitcoin-L |
| Tarmoqdan tashqari sinov | Instagram biznes va oddiy hisoblar tasnifi |
| Ma’lumotlar taqsimoti | 80% o‘qitish, 10% tekshirish, 10% test |
| Qo‘shnichilik tanlanmasi | 2 qadam (hop); har qadamda o‘rtacha hajm bo‘yicha maksimal 10 qo‘shni |
| Graf siqish | SIGC; β=2, tugunlar chegarasi Nc=10 |
| Kriminalistik agent | Hajm, kontragentlar, vaqt va gaz sarfidan 3–5 gaplik matn xulosasi |
| Farqlovchi agent | Tranzaksiya modeli, mablag‘ oqimi, xavfli manzil belgilarini ajratish |
| Qoldiq agent | Aloqasiz faktlar va gallyutsinatsiyalarni ajratish |
| LLM arxitekturasi | Gemma-3-4B-it va LoRA nozik sozlash |
| Matn kodlagichi | Sentence-BERT |
| Graf kodlagichi | 2 qatlamli, 64 o‘lchamli Dual-PGNN (CARE-GNN tayanchi) |
| Yo‘qotish funksiyasi | Ikkilik kross-entropiya, KL tafovuti va ortogonal regulyator |
| Yo‘qotish vaznlari | λ1=0,05 va λ2=0,3 |
| Optimizator | AdamW, 5 × 10-6 o‘rganish tezligi, erta to‘xtatish |
| O‘qitish sikli | 2 ta tashqi davr, 10 ta ichki davr |
| Uskuna | Intel Xeon Gold 6248R, 128 GB RAM, 2 ta NVIDIA A6000 GPU |
| Qiyoslangan modellar | 20 ta umumiy graf, anomaliya va blokcheyn usullari |
| Ko‘rsatkichlar | Aniqlik, To‘liqlik, F1, AUC va KS |
Manba va metodologiya eslatmasi
To‘liq asl nomi: UniDetect: LLM-Driven Universal Fraud Detection across Heterogeneous Blockchains
Mualliflar: Shuyi Miao; Wangjie Qiu; Shengda Zhuo; Fei Shen; Dan Lin; Xingtong Yu; Tat-Seng Chua; Zhiming Zheng.
Mas’ul mualliflar: Shuyi Miao (shuyimiao@buaa.edu.cn), Wangjie Qiu, Fei Shen.
Tashkilotlar:
- Beihang University, Pekin, Xitoy.
- Jinan University, Guanchjou, Xitoy.
- National University of Singapore, Singapur.
- Sun Yat-Sen University, Guanchjou, Xitoy.
- The Chinese University of Hong Kong, Gonkong.
DOI: 10.48550/arXiv.2604.12329 (DataCite DOI).
Manba turi: Kompyuter fanlari bo‘yicha metodologik va eksperimental preprint maqola.
Nashr yili: 2026.
Platforma: arXiv (cs.CR, cs.SI).
Taqriz holati: Taqrizdan o‘tmagan preprint.
Rasmiy havola:https://arxiv.org/abs/2604.12329
Loyiha ombori:https://github.com/msy0513/UniDetect
Ushbu Verianla maqolasi yuklangan PDF matni, matematik usullari, jadvallari, tajriba natijalari va cheklovlari asosida tayyorlangan. Tashqi manbalar faqatgina bibliografik ma’lumotlarni tekshirish uchun ishlatilgan.
Asosiy cheklovlar: taqrizdan o‘tmaganlik, faqat Ethereum va Bitcoin da sinov o‘tkazilganligi, Bitcoin ma’lumotlarining 2015-yilga tegishliligi, yorliqlardagi ehtimoliy xatoliklar, zanjirlararo aniqlikning pastligi (yuqori false positive) va manba kodining hali to‘liq ochiqlanmaganligidir.

Izoh qoldiring
E-pochta manzilingiz chop etilmaydi. Majburiy maydonlar * bilan belgilangan