
Ин таҳқиқот равиши худназоратшавандаи зеҳни сунъӣ бо номи E_LogBERT-ро таҳия кардааст, то номҳои рӯйдодҳо ва арзишҳои рақамии трафикро дар журналҳои шабакаҳои телекоммуникатсионӣ якҷоя коркард кунад. Муҳаққиқон 45 метрикаи қабул–ирсолро, ки аз воситаи bmon ҳар ду сония гирифта мешуд, ба ҷумлаҳои тавсифии тамғадори вақт табдил доданд; дар тӯли ҳафт рӯз 13.608.000 сатри журнал ва 27.216.000 токени рамзӣ-рақамӣ ҷамъ оварданд. Модел шахсияти рамзии метрикаро бо embedding-и BERT ва арзиши рақамии ба таври динамикӣ нормализатсияшударо бо қабати хаттии омӯзишшаванда дар ҳамон фазои 768-андоза муттаҳид мекунад. Дар таҳқиқот барои E_LogBERT %92 дақиқӣ, %90 precision, %89 recall, %89,5 F1 ва %96 AUC гузориш шудааст. Аммо шарҳ дода нашудааст, ки label-ҳои congestion чӣ гуна сохта шудаанд, додаҳои training ва test-и мустақил чӣ гуна ҷудо шудаанд, натиҷаҳо миёнаи чанд такрор мебошанд ва низом congestion-ро чанд вақт пештар пешгӯӣ кардааст.
Фарқи асосии равиш кӯшиши нигоҳ доштани бузургиҳои рақамӣ мебошад, ки дар моделҳои классикии LogBERT аксаран ҳазф мешаванд ё ба як токени ягонаи [NUM] коҳиш дода мешаванд. Масалан, ҳадаф ин аст, ки модел на танҳо рӯйдоди “Bytes_Rx”, балки ҷойгоҳи арзиши ҷории ин метрика дар диапазони маъмулро низ омӯзад. E_LogBERT бо ҳадафи Masked Log Key Prediction, ки метрикаҳои маскшудаи журналҳои normal-ро пешгӯӣ мекунад, ва Volume of Hypersphere Minimization, ки равзанаҳои normal-и шабакаро дар атрофи як маркази умумии embedding ҷамъ мекунад, омӯзонида мешавад. Холи anomaly аз якҷоякунии ҳамин ду сигнал ҳосил мешавад.
Аз нигоҳи Туркия: Равиши таҳқиқотро метавон дар операторони телекоммуникатсионӣ, интернет-провайдерҳо, марказҳои дода, шабакаҳои корпоративӣ, инфрасохтори шабакавии муниципалӣ ва network operation center-ҳои Туркия барои назорати барвақти зичии трафик ва инҳирофҳои иҷроиш таҳқиқ кард. Пеш аз татбиқ модел бояд бо журналҳои аз шабакаҳои воқеии операторӣ гирифташуда ва аз маълумоти шахсӣ покшуда; бо истеҳсолкунандагони гуногуни таҷҳизот, шабакаҳои ядроии 4G–5G, низомҳои дастрасии собит, трафики IPv4–IPv6 ва давраҳои гуногуни сарборӣ тасдиқ карда шавад. Оғози воқеии congestion, forecast horizon, арзиши false alarm ва таъсири дахолат ба сифати хизмат бояд равшан чен карда шаванд. Азбаски таҳқиқот дар як оператори Туркия озмоиши саҳроӣ, додаҳои миллии шабака, эътимоднокии production environment ё муваффақияти ошкоркунии ҳамлаи киберӣ пешниҳод намекунад, сатҳи муваффақияти хоси кишварро мустақиман баровардан мумкин нест.
Чаро журналҳои шабакаи телекоммуникатсионӣ навъи душвори дода мебошанд?
Дар шабакаҳои муосири алоқа router-ҳо, вазифаҳои виртуалии шабака, firewall-ҳо, платформаҳои овозӣ ва воситаҳои мониторинг пайваста журнал истеҳсол мекунанд. Ин журналҳо на танҳо маълумоти “рӯйдод рух дод”-ро, балки арзишҳои доимо тағйирёбандаи рақамиро, монанди миқдори байтҳои қабулшуда ва ирсолшуда, шумораи пакетҳо, пакетҳои партофташуда, хатои CRC, мушкили reassembly ва трафики multicast низ дар бар мегиранд.
Нуқтаи оғози таҳқиқот ин аст, ки қисми муҳими моделҳои анъанавии таҳлили журнал арзишҳои рақамиро:
- комилан ҳазф мекунанд,
- ба як токени ягонаи
[NUM]табдил медиҳанд, - ҳамчун омори ҷудогона ва мустақил аз матн коркард мекунанд
ва аз ҳамин сабаб маълумоти миқдориро аз даст медиҳанд. Гарчанде “Bytes_Rx = 100” ва “Bytes_Rx = 100.000” як рӯйдоди рамзиро ифода мекунанд, аз нуқтаи назари ҳолати шабака маънои яксон надоранд. Congestion ва баъзе рӯйдодҳои амниятӣ аксаран на аз номи рӯйдод, балки аз бузургии арзишҳо ва тағйири онҳо дар вақт фаҳмида мешаванд.
Равиши асосии LogBERT чист?
LogBERT пайдарпаии журналҳоро ба ҷумлаҳои забони табиӣ монанд мекунад. Як рӯйдоди журналро ҳамчун калима, журналҳои пайдарпай дар вақтро ҳамчун ҷумла ё sequence баррасӣ мекунад. Бо механизми bidirectional attention-и BERT муносибати як рӯйдод ҳам бо рӯйдодҳои пешина ва ҳам баъдӣ омӯхта мешавад.
Дар таҳқиқот ду ҳадафи худназоратшавандаи LogBERT асос гирифта шудааст:
- Masked Log Key Prediction: Баъзе калидҳои журнал дар sequence маск карда мешаванд ва аз модел талаб мешавад, ки бо нигоҳ ба context калиди нопадидро пешгӯӣ кунад.
- Volume of Hypersphere Minimization: Embedding-ҳои умумии sequence-ҳои журнал, ки normal қабул шудаанд, дар атрофи як маркази умумӣ фишурда мешаванд.
Коҳиши дақиқии пешгӯии маскшуда ё дур шудани sequence-ҳои нав аз маркази embedding метавонад ҳамчун аломати anomaly истифода шавад.
E_LogBERT кадом холигиро ҳадаф мегирад?
Ба гуфтаи муҳаққиқон, холигии асосӣ он аст, ки арзишҳои пайвастаи вобаста ба калидҳои рамзии журнал дар як модели контекстӣ коркард намешаванд. E_LogBERT чор саҳми зеринро пеш мегузорад:
- Табдил додани raw bmon output ба ҷумлаҳои журналии тавсифии тамғадори вақт,
- Иҷрои dynamic min–max normalization мутобиқи тақсимоти тағйирёбандаи трафик,
- Истифодаи ҳамзамони ҳадафҳои MLKP ва VHM барои воридоти рамзӣ ва рақамӣ,
- Якҷоя кардани ҷамъоварии дода, training, anomaly scoring, alarm ва visualization дар 13 модул.
Додаҳо чӣ гуна ҷамъоварӣ шуданд?
Омори шабака бо bmon, яъне Bandwidth Monitor, ки дар Linux кор мекунад, гирифта шуд. bmon барои ҳар network interface 45 метрикаи гуногун медиҳад. Азбаски ҳар метрика арзиши Rx барои трафики қабулшуда ва Tx барои трафики ирсолшуда дорад, дар ҳар даври ченкунӣ ҳамагӣ 90 метрикаи рамзӣ ҳосил мешавад.
Баъзе метрикаҳои ченшуда:
- Bytes ва Packets,
- Dropped ва Errors,
- CRC Error, Frame Error ва FIFO Error,
- Collisions ва Carrier Error,
- Ҳисобкунакҳои packet, delivery, forwarding ва reassembly барои IPv6,
- Нишондиҳандаҳои Multicast ва ICMPv6.
Скрипти ҷамъоварии дода ба оғози ҳар дақиқа синхрон мешавад, 60 сония устувории ибтидоиро интизор мешавад ва аз интерфейси WANbridge ҳар ду сония 45 сатр мехонад. Ҳар сатр ба қолаби умумии зерин табдил дода мешавад:
[тамғаи вақт]: Интерфейс: Metric_Rx арзиши X дорад, дар ҳоле ки Metric_Tx арзиши Y дорад.
Шакли 1 дар саҳифаи панҷум, дар тарафи чап raw output-и сутундори bmon-ро, ки барои инсон тафсираш душвор аст, ва дар тарафи рост журналҳои форматшудаеро нишон медиҳад, ки ҳар ченкуниро ба ҷумлаи тамғадори вақт табдил медиҳанд. Ин раванд номи метрика, самти трафик, воҳид ва арзиши рақамиро нигоҳ медорад.
Муҳити test шабакаи воқеии операторӣ буд?
Не. Таҳқиқот муҳити тестии реалистӣ сохтааст; аммо дода аз production network-и оператори тиҷоратии мобилӣ гирифта нашудааст. Сохторе, ки Unified Telecom Platform ном дорад, аз ҷузъҳои зерин иборат аст:
- Host-и физикӣ бо Zorin OS,
- Процессори 8-core-и 3,0 GHz,
- 32 GB RAM ва 200 GB SSD,
- NVIDIA T4 GPU бо 16 GB memory,
- Virtual machine manager-и асосёфта ба KVM/QEMU,
- Virtual machine-и pfSense дар нақши ISP gateway,
- Virtual machine-и Issabel дар нақши VoIP operator platform,
- Интерфейси WANbridge, ки ду virtual machine-ро мепайвандад ва мониторинг мешавад.
Шакли 6 дар саҳифаи понздаҳум network function-ҳои virtualized, local network access ва wide area network connection-ро дар ду virtual machine нишон медиҳад. Ин сохтор ба озмоиши назоратшаванда имкон медиҳад; аммо гуногунии дастгоҳҳо, рафтори корбар, мураккабии протокол ва scale-и шабакаи воқеии операторӣ дар ҳамон сатҳ ифода нашудаанд.
Ҳаҷми маҷмӯаи дода
| Хусусияти дода | Арзиши гузоришшуда дар таҳқиқот |
|---|---|
| Муддати ҷамъоварӣ | 168 соат, 7 рӯз |
| Фосилаи ченкунӣ | 2 сония |
| Сатри журнал дар ҳар ченкунӣ | 45 |
| Шумораи сатрҳои рӯзона | 1.944.000 |
| Шумораи сатрҳои ҳафтрӯза | 13.608.000 |
| Самти рақамӣ дар ҳар сатр | Rx ва Tx, ҳамагӣ 2 |
| Ҳамаи mixed token | 27.216.000 |
| Шумораи sequence-ҳои даҳсонияӣ | 60.480 |
Дар ҳар ченкунии дусонияӣ 45 сатр ва 90 арзиши Rx/Tx ҳосил мешавад. Панҷ даври ченкунӣ якҷоя шуда, равзанаи даҳсонияии 450 token сохта мешавад ва бо илова кардани [CLS] ба оғози sequence дарозии умумии input ба 451 мерасад.
Аз raw counter-ҳо кадом нишондиҳандаҳои шабака бароварда мешаванд?
Таҳқиқот мегӯяд, ки counter-ҳои bmon метавонанд барои баъзе нишондиҳандаҳои сатҳи боло истифода шаванд. Network interface utilization:
\[ U=\frac{T}{C} \]
таъриф шудааст. Дар ин ҷо \(T\) суръати трафик ва \(C\) capacity-и умумии интерфейс мебошад.
Packet delivery ratio:
\[ PDR=\frac{\sum N_R}{\sum N_S}\times100 \]
дода шудааст. \(\sum N_S\) шумораи packet-ҳои ирсолшуда ва \(\sum N_R\) шумораи packet-ҳои қабулшударо нишон медиҳад.
Throughput-и муассир бошад дар манбаъ:
\[ \mathrm{Throughput}=PDR\times\mathrm{Data\ Rate} \]
ифода шудааст.
Муҳаққиқон болоравии якҷояи баъзе counter-ҳоро ҳамчун ишораи operational шарҳ медиҳанд:
- Афзоиши Dropped ва FIFO Error метавонад ба buffer overflow,
- афзоиши CRC Error ва Frame Error ба мушкилоти physical link,
- афзоиши Collision ва Carrier Error ба duplex setting ё hardware issue,
- шумораи зиёди packet бо миқдори ками byte ба small-packet traffic flood
ишора кунад. Инҳо шарҳҳои diagnostic-и таҳқиқот мебошанд; дар таҷрибаҳои E_LogBERT барои ҳар рӯйдод classification-и сабаби ҷудогона анҷом дода нашудааст.
Арзишҳои рақамӣ чӣ гуна ба BERT интиқол дода шуданд?
Таҳқиқот мегӯяд, ки дар ҳар input position ду манбаи иттилоот вуҷуд дорад:
- Шахсияти дискретии рамзӣ, монанди номи метрика,
- Бузургии пайвастаи рақамии normalized.
Номи метрикаи рамзӣ аз word embedding matrix-и BERT ба вектори 768-андоза табдил дода мешавад. Арзиши рақамӣ бошад тавассути:
nn.Linear(1, 768)
ба ҳамон андоза projected мешавад. Ду вектор ҷамъ шуда, ба модел дода мешаванд. Ҷамъкунӣ ба ҷамъкунии word, position ва type embedding-ҳои BERT монанд карда шудааст.
Ифодае, ки ин равиш ҳадаф дорад, чунин ҷамъбаст мешавад:
\[ \mathbf{e}_i= \mathbf{e}_{metric,i} + \mathbf{e}_{numeric,i} + \mathbf{e}_{position,i}. \]
Аммо дар ҷои дигари матни манбаъ ҳамин раванд ҳамчун “якҷоя кардани номи метрика ва арзиши normalized дар як mixed token” шарҳ дода шудааст. Агар ҳар арзиши гуногуни рақамӣ қисми vocabulary мебуд, vocabulary-и собити 92 token имконнопазир мешуд. Аз ин рӯ, implementation-и воқеӣ эҳтимолан separate symbolic embedding ва numeric projection мебошад; аммо манбаъ ин фарқро равшан ва бидуни зиддият намедиҳад.
Dynamic min–max normalization
Арзишҳои рақамӣ аз рӯи minimum ва maximum-и ҷорӣ normalized мешаванд. Transform-и умумии min–max:
\[ v_{norm}= \frac{v-v_{min}} {v_{max}-v_{min}} \]
мебошад.
Таҳқиқот мегӯяд, ки ин ҳудудҳо бо омадани арзишҳои нави трафик нав мешаванд. Ҳамин тавр, вобастагии низом аз диапазонҳои собити дастӣ кам карда мешавад. Аммо:
- minimum ва maximum дар кадом time window нигоҳ дошта мешаванд,
- outlier-ҳо аз вайрон кардани scale чӣ гуна боздошта мешаванд,
- оё test data ба normalization statistics дохил мешавад ё не,
- ҳангоми distribution shift-и ногаҳонӣ арзишҳои кӯҳна чӣ гуна фаромӯш мешаванд
шарҳ дода нашудааст.
Ҳадафи Masked Log Key Prediction
%15 token-ҳои ғайр аз [CLS] ба таври тасодуфӣ mask мешаванд. Hidden vector дар қабати охирини Transformer ба probability distribution барои 92 symbolic class табдил меёбад:
\[ \mathbf{y}_m= \operatorname{softmax} \left( \mathbf{W}_{MLKP}\mathbf{H}_m+\mathbf{b}_{MLKP} \right). \]
Модел меомӯзад, ки дар sequence-ҳои normal-и журнал metrika-ҳои maskшуда дуруст пешгӯӣ шаванд. Агар sequence-и нав ба pattern-ҳои маъмулӣ мувофиқ набошад, кам шудани masked prediction accuracy интизор мешавад.
Дар манбаъ навишти cross-entropy equation равшан нест; prediction probability ва true class indicator ба назар бо як symbol навишта шудаанд. Loss-и мақсаднок standard cross-entropy байни true class indicator ва predicted probability мебошад.
Ҳадафи Volume of Hypersphere Minimization
Ҳолати умумии ҳар sequence бо embedding-и 768-андозаи token-и [CLS] ифода мешавад. Аз sequence-ҳои normal-и ибтидоӣ як марказ ҳисоб карда мешавад:
\[ \mathbf{c}= \frac{1}{N_{init}} \sum_{n=1}^{N_{init}} \mathbf{H}_{[CLS],n}. \]
Сипас марказ собит нигоҳ дошта шуда, embedding-ҳои sequence-ҳои normal ба ҳамин марказ наздик карда мешаванд:
\[ L_{VHM}= \frac{1}{B} \sum_{b=1}^{B} \left\| \mathbf{H}_{[CLS],b}-\mathbf{c} \right\|_2^2. \]
Ҳамин тавр ҳадаф ин аст, ки ҳолатҳои normal-и шабака дар high-dimensional space кластери компакт ташкил кунанд. Sequence-ҳое, ки муносибатҳои маъмулӣ байни metrika-ҳоро вайрон мекунанд, бояд аз марказ дуртар бошанд.
Ҳадафи умумии омӯзиш
Ду self-supervised loss бо вазнҳо якҷоя мешаванд:
\[ L_{total}= \alpha L_{MLKP} + \beta L_{VHM}. \]
Манбаъ мегӯяд, ки одатан \(\alpha=0{,}5\) ва \(\beta=0{,}5\) истифода шудаанд ва инчунин:
\[ \alpha+\beta=1 \]
шарт нигоҳ дошта мешавад.
Холи anomaly чӣ гуна ҳисоб мешавад?
Anomaly score-и модел masked prediction accuracy ва VHM center distance-ро якҷоя мекунад:
\[ A(S)= 1- \left[ \alpha\,MLKP_{norm}(S) + \beta\left(1-VHM_{norm}(S)\right) \right]. \]
Ҳадаф ин аст, ки score ба сифр наздик бошад sequence normal, ба як наздик бошад anomalous ҳисоб шавад. Таҳқиқот се operational region муайян кардааст:
| Anomaly score | Шарҳи истифодашуда дар манбаъ |
|---|---|
| 0–0,825 | Congestion нест |
| 0,825–0,960 | Congestion эҳтимолӣ |
| 0,960 ва болотар | Congestion наздикшаванда |
Нишон дода нашудааст, ки ин threshold-ҳо бо ROC analysis, validation optimization ё operational cost calculation чӣ гуна муайян шудаанд. Илова бар ин, манбаъ мефаҳмонад, ки агар ҳам \(\alpha\) ва ҳам \(\beta\) сифр бошанд, score 1 мешавад. Ин ҳолат бо маҳдудияти қаблан додашудаи \(\alpha+\beta=1\) мувофиқат намекунад.
Андозаи модели E_LogBERT
Модел modified BERT-Base core истифода мекунад:
- 12 Transformer layer,
- 768 hidden dimension,
- 12 attention head,
- 451 input position,
- Vocabulary-и 92-element, ки аз 90 metrika ва 2 special token иборат аст.
Дар таҳқиқот шумораи умумии trainable parameter 86.691.164 дода шудааст. Истифодаи vocabulary-и хурди 92 metrika ба ҷойи embedding table-и тақрибан 30 ҳазор калимаи standard BERT-Base word embedding layer-ро хурд мекунад. Қисми асосии Transformer core бошад нигоҳ дошта мешавад.
Мушкилоти ҷадвали параметрҳо
Дар ҷадвали параметрҳои саҳифаҳои ёздаҳум ва бисту чорум баъзе номуайяниҳои техникӣ мавҷуданд:
- Дар қисми attention \(W_V\) ду маротиба навишта шудааст; эҳтимолан яке аз сатрҳо бояд output projection \(W_O\) бошад.
- 768 weight ва 768 bias parameter-и қабати
Linear(1,768), ки барои арзиши рақамӣ шарҳ дода шудааст, дар ҷадвал дида намешавад. - Табдили 768 ба 1 барои VHM ҳамчун 768 parameter дода шудааст, possible bias нишон дода нашудааст.
- Бандҳои ҷудогонаи ҷадвал ҳамаи bias term-ҳои standard BERT layer-ро ба таври равшан нишон намедиҳанд.
Аз ин рӯ, шумораи умумии гузоришшуда бе model code танҳо аз рӯи ҷадвал мустақилона тасдиқ карда намешавад.
Меъмории низоми сенздаҳмодулӣ
Шакли 2 дар саҳифаи ҳаштум 13 software module-ро, ки дар атрофи модел кор мекунанд, дар шакли бастаи ягона нишон медиҳад:
| Модул | Вазифаи он дар таҳқиқот |
|---|---|
config.py | Параметрҳои низом ва configuration-и марказӣ |
data_structures.py | Объектҳои стандартии дода |
logger_config.py | Сабти рӯйдодҳои низом |
utils.py | Функсияҳои умумии ёрирасон |
extract_normalize_format_embed.py | Parsing-и журнал, normalization ва сохтани mixed token |
sequence_buffer.py | Сохтани равзанаи 450 token аз панҷ даври ченкунӣ |
dataloader.py | Табдили sequence-ҳо ба PyTorch tensor ва masking |
train.py | Омӯзиши пайвастаи модел |
log_model.py | Модели E_LogBERT |
anomaly.py | Anomaly score ва decision mechanism |
livemonitor.py | Scheduling-и workflow |
predict_log.py | Таҳлили таърихӣ ва пешгӯии ҳолати оянда |
dashboard.py | Live metrics, alarm-ҳо ва performance-и модел |
Шакли 3 дар саҳифаи нӯҳум низомро ба шаш марҳила ҷудо мекунад:
- Инфрасохтор ва тавлиди дода,
- Configuration ва object-ҳои дода,
- Preprocessing ва омодасозии равзанаҳои даҳсонияӣ,
- Training ва inference-и модел,
- Anomaly scoring ва logging,
- Visualization ва prediction.
Шакли 5 дар саҳифаи чордаҳум ҷараёни file, parameter, model weight, alarm ва log байни ҳамаи module-ҳоро муфассал нишон медиҳад. Меъморӣ фарогир аст; аммо мураккабии шакл худ ба худ барои дубора сохтани низом кофӣ нест. Source code-и module-ҳо ва interface schema-ҳо мубодила нашудаанд.
Кори real-time чӣ гуна таъриф шудааст?
Низом ҳар ду сония ченкунии нав мегирад, аз панҷ даври ченкунӣ sequence-и даҳсонияӣ месозад ва ҳадаф дорад, ки training, inference ва alarm process-ро дар даври даҳсонияӣ иҷро кунад.
Дар саҳифаи панҷум гуфта шудааст, ки истифодаи processor аз ҷониби data collection script дар test hardware аз %5 поён мондааст. Аммо:
- Вақти inference-и BERT барои як sequence,
- муддати воқеии training-и нӯҳ epoch,
- дар чанд давр time limit-и даҳсонияӣ иҷро шудааст,
- GPU memory ва energy consumption,
- масштабшавӣ ба чанд interface-и ҳамзамон
чен нашудаанд. Аз ин рӯ, хусусияти “real-time” дар сатҳи architectural objective ва demonstration аст; бо benchmark-и пурраи performance тасдиқ нашудааст.
Dashboard-и live
Шакли 4 дар саҳифаҳои дувоздаҳум ва бисту ҳафтум dashboard-и live monitoring-и асосёфта ба Streamlit-ро нишон медиҳад. Дар тасвир:
- 156 total event,
- 0,408 anomaly score,
- ҳолати “No Congestion”,
- арзиши F1 0,874,
- сифати дода “Excellent”,
- anomaly score дар тӯли вақт,
- threshold-ҳои congestion эҳтимолӣ ва congestion наздикшаванда
мавҷуданд. Dashboard мавҷудияти prototype-и коркунандаи низомро дастгирӣ мекунад. Аммо як screenshot дақиқии alarm ё эътимоднокии дарозмуддати production-ро исбот намекунад.
Натиҷаҳои муқоисавӣ
| Меъёр | E_LogBERT | KTeleBERT | Фарқ |
|---|---|---|---|
| Дақиқӣ | %92 | %78 | 14 банди фоизӣ |
| Precision | %90 | %75 | 15 банди фоизӣ |
| Recall | %89 | %74 | 15 банди фоизӣ |
| F1 | %89,5 | %74,5 | 15 банди фоизӣ |
| AUC | %96 | %84 | 12 банди фоизӣ |
Шакли 7 дар саҳифаи ҳабдаҳум нишон медиҳад, ки сутунҳои E_LogBERT аз сутунҳои KTeleBERT дар панҷ меъёр баландтаранд. Аммо comparison protocol шарҳ дода нашудааст:
- Оё KTeleBERT дар ҳамон додаҳо аз нав омӯзонида шудааст ё не,
- hyperparameter-ҳо чӣ гуна интихоб шудаанд,
- оё ду модел ҳамон training ва test split-ро истифода кардаанд,
- натиҷаҳо як run мебошанд ё миёнаи такрорҳо
маълум нест.
Abstract мегӯяд, ки LogBERT-и асосӣ низ пас гузошта шудааст; аммо дар ҷадвал ё графики натиҷа барои baseline LogBERT арзиши рақамӣ дода нашудааст.
Таъсири шумораи epoch
| Epoch | Дақиқии synchronized E_LogBERT | Дақиқии baseline-и unsynchronized |
|---|---|---|
| 3 | %78 | %65 |
| 5 | %85 | %70 |
| 7 | %89 | %74 |
| 9 | %92 | %78 |
| 11 | %92 | %80 |
| 13 | %90 | %81 |
| 15 | %88 | %80 |
Шакли 8 нишон медиҳад, ки дақиқии E_LogBERT дар epoch-и нӯҳум ба %92 расида, дар epoch-и ёздаҳум ҳамон монда ва баъдан коҳиш ёфтааст. Муҳаққиқон нӯҳ epoch-ро ҳамчун мувозинати мувофиқ байни дақиқӣ ва time cost интихоб кардаанд.
Коҳиш метавонад ба overtraining ё тағйири data stream вобаста бошад; аммо азбаски таҳқиқот training ва validation loss, random seed ё repeated experiment-ҳоро пешниҳод намекунад, муайян кардан мумкин нест, ки ин воқеан overfitting аст.
Фарқ байни “пешгӯии congestion” ва “anomaly detection”
Дар арзёбии таҳқиқот як ҳадди муҳимми консептуалӣ вуҷуд дорад. Anomaly detection муайян мекунад, ки pattern дар равзанаи ҷорӣ ё гузашта аз normal фарқ мекунад ё не. Пешгӯии congestion-и оянда бошад талаб мекунад:
- target time-и оянда,
- forecast horizon,
- оғози воқеии congestion,
- вақти байни prediction ва event,
- false alarm ва miss rate-и early warning
муайян карда шаванд.
Anomaly score-и E_LogBERT муфассал дода шудааст, аммо target ва evaluation metric-ҳои future-state prediction пешниҳод нашудаанд. Аз ин рӯ, таҳқиқот барои real-time anomaly monitoring далел медиҳад; аммо бо ҳамон равшанӣ исбот намекунад, ки congestion-ро муддати муайян пештар пешгӯӣ мекунад.
Оё ошкоркунии cyberattack нишон дода шудааст?
Таҳқиқот мегӯяд, ки DDoS, small-packet flood traffic ва болоравии ғайримуқаррарии bandwidth назариявӣ метавонанд дар counter-ҳои bmon дида шаванд. Аммо дар таҷрибаҳо:
- attack scenario-и муайян,
- controlled attack injection,
- attack type label,
- recall барои ҳар attack,
- false positive analysis
пешниҳод нашудаанд. Аз ин рӯ, аз ин таҳқиқот хулоса кардан мумкин нест, ки E_LogBERT cyberattack-ҳоро барвақт ошкор мекунад.
Ҷиҳатҳои қавии таҳқиқот
- Аз даст рафтани арзишҳои рақамӣ дар таҳлили journal ҳамчун масъалаи амалӣ баррасӣ шудааст.
- Дар тӯли ҳафт рӯз додаҳои дорои ҳалли баланди вақт ҷамъоварӣ шудаанд.
- Raw network counter-ҳо ба формати тавсифии тамғадори вақт табдил дода шудаанд.
- Арзишҳои Rx ва Tx бо identity-ҳои ҷудогона нигоҳ дошта шудаанд.
- Self-supervised learning ҳадаф дорад ниёз ба labeled anomaly-ро кам кунад.
- Data collection, model, alarm ва visualization дар як низоми modular муттаҳид шудаанд.
- Dashboard-и live monitoring-и коркунанда пешниҳод шудааст.
- Шумораи parameter, software dependency ва test hardware гузориш шудаанд.
- Илова бар accuracy, precision, recall, F1 ва AUC низ дода шудаанд.
- LoRA, federated learning ва зарурати validation дар операторҳои гуногун ҳамчун future work қабул шудаанд.
Маҳдудиятҳои таҳқиқот
- Таҳқиқот аз арзёбии ҳамтоён нагузаштааст.
- Додаҳо аз controlled virtual test environment гирифта шудаанд, на production network-и оператори тиҷоратӣ.
- Дода танҳо як муҳити ҳафтрӯзаро фаро мегирад.
- Шарҳ дода нашудааст, ки congestion sample-ҳо чӣ гуна сохта шудаанд ва ground truth label чӣ гуна муайян шудааст.
- Training, validation ва test split дода нашудааст.
- Temporal data leakage чӣ гуна пешгирӣ шудааст, шарҳ дода нашудааст.
- Class distribution ва raw confusion matrix values мавҷуд нестанд.
- Multiple training repeat, standard deviation ва confidence interval дода нашудаанд.
- Нишон дода нашудааст, ки муқоисаи KTeleBERT дар ҳамон шароит анҷом шудааст.
- Барои baseline LogBERT натиҷаи рақамии муқоисавӣ пешниҳод нашудааст.
- Future forecast horizon ва early warning time чен нашудаанд.
- Алгоритми муфассали dynamic normalization шарҳ дода нашудааст.
- Тавсифи mixed token дар дохили худ мувофиқ нест.
- Дар parameter table сатрҳои гумшуда ё такрорӣ мавҷуданд.
- Барои anomaly threshold-ҳо validation analysis пешниҳод нашудааст.
- Хавфи model drift ё омӯзидани anomalous data ҳамчун normal дар continuous training баррасӣ нашудааст.
- Model inference time ва end-to-end latency чен нашудаанд.
- Code, data, model weight ва reproducibility script мубодила нашудаанд.
- Cyberattack detection performance таҷрибавӣ санҷида нашудааст.
Таҳқиқот чиро дастгирӣ мекунад?
- Нишон медиҳад, ки symbolic metric name ва numeric magnitude метавонанд дар як BERT-based model коркард шаванд.
- Нишон медиҳад, ки bmon output метавонад ба descriptive timestamped log sequence табдил дода шавад.
- Нишон медиҳад, ки MLKP ва VHM objective-ҳо метавонанд якҷоя дар mixed metric sequence татбиқ шаванд.
- Prototype-и коркунандаеро пешниҳод мекунад, ки дар равзанаҳои даҳсонияӣ anomaly score истеҳсол мекунад.
- Нишон медиҳад, ки дар controlled UTP data metric-ҳои гузоришшуда аз baseline result-и KTeleBERT баландтаранд.
- Нишон медиҳад, ки real-time dashboard ва alarm logging infrastructure метавонанд ба ҳамон architecture пайваст шаванд.
Таҳқиқот чиро исбот намекунад?
- Исбот намекунад, ки E_LogBERT дар network-и воқеии mobile operator бо %92 accuracy кор мекунад.
- Бо рақам нишон намедиҳад, ки congestion-ро муддати муайян пештар пешгӯӣ мекунад.
- Исбот намекунад, ки дар ҳамаи dataset-ҳо аз KTeleBERT ва LogBERT беҳтар аст.
- Нишон намедиҳад, ки модел ба log-ҳои vendor ва operator-и гуногун бе retraining интиқол меёбад.
- Нишон намедиҳад, ки намудҳои cyberattack-ро ошкор ё тасниф мекунад.
- Нишон намедиҳад, ки threshold-ҳои 0,825 ва 0,960 universal мебошанд.
- Исбот намекунад, ки continuous online training model drift-ро бехатар пешгирӣ мекунад.
- Нишон намедиҳад, ки ҳамаи training ва inference operation-ҳои даҳсонияӣ ҳамеша дар hardware-и нишоншуда анҷом меёбанд.
- Production environment availability, fault tolerance ё long-term operational stability пешниҳод намекунад.
- Energy efficiency ё carbon impact-и UTP-и solar-powered-ро чен намекунад.
Аҳамият аз нигоҳи гузашта, имрӯз ва оянда
Дар гузашта network monitoring бештар ба threshold-ҳои собит, rule-based alarm systems ва dashboard-ҳои аз ҷониби инсон омодашуда такя мекард. Баъдан statistical method-ҳо ва deep network-ҳое таҳия шуданд, ки log sequence-ҳоро меомӯзанд. Моделҳо ба монанди LogBERT муносибатҳои contextual event-ро омӯхтанд, аммо дар бисёр application-ҳо numeric value ҳамчун маълумоти дуюмдараҷа ё гумшуда боқӣ монд.
Имрӯз ҷиҳати муҳими E_LogBERT кӯшиши он аст, ки номи log event ва numeric magnitude-и ченшударо дар як context баррасӣ кунад. Ин идея берун аз network congestion метавонад ба mixed log systems, монанди server load, data center performance, cloud services ва industrial telemetry низ мутобиқ шавад.
Дар оянда арзиши воқеии усул вақте равшан мешавад, ки independent validation дар operator-ҳои гуногун, open data ва code, forecast horizon-и муайян барои congestion-и оянда, online learning safety ва edge-device performance нишон дода шаванд. LoRA ва federated learning-и пешниҳодшуда аз ҷониби муҳаққиқон барои data privacy ва кам кардани computational cost омӯхта шуда метавонанд; аммо ин хусусиятҳо дар таҳқиқоти ҷорӣ татбиқ нашудаанд.
Усул ва натиҷаҳои таҳқиқот
Хулосаи техникии тарҳи таҳқиқот
| Ҷузъ | Равиши татбиқшуда дар таҳқиқот |
|---|---|
| Навъи таҳқиқот | Self-supervised AI model ва real-time network monitoring prototype |
| Манбаи дода | bmon network interface counter-ҳо |
| Муҳити test | UTP аз pfSense ва Issabel virtual machine-ҳо |
| Интерфейси monitored | WANbridge |
| Шумораи metrika | 45 metrika × Rx/Tx = 90 symbolic metrika |
| Фосилаи ҷамъоварӣ | 2 сония |
| Муддати ҷамъоварӣ | 7 рӯз |
| Log line | 13.608.000 |
| Mixed token | 27.216.000 |
| Шумораи sequence | 60.480 |
| Дарозии sequence | 450 metric token + [CLS] = 451 |
| Модел | Modified BERT-Base-и 12-layer |
| Hidden dimension | 768 |
| Attention head | 12 |
| Vocabulary | 90 metrika + [CLS] + [MASK] = 92 |
| Numeric representation | Dynamic normalization ва Linear(1,768) projection |
| Self-supervised objective | MLKP ва VHM |
| Masking ratio | %15 |
| Loss weights | Одатан α = 0,5 ва β = 0,5 |
| Reported parameter | 86.691.164 |
| Software module | 13 |
| Hardware | 8-core CPU, 32 GB RAM, NVIDIA T4 16 GB |
| Data sharing | Мавҷуд нест |
| Code sharing | Мавҷуд нест |
Performance-и асосии гузоришшуда
| Меъёр | E_LogBERT | KTeleBERT |
|---|---|---|
| Дақиқӣ | 0,92 | 0,78 |
| Precision | 0,90 | 0,75 |
| Recall | 0,89 | 0,74 |
| F1 | 0,895 | 0,745 |
| AUC | 0,96 | 0,84 |
Функсияи илмии шаклҳо
| Шакл | Мундариҷаи нишоншуда | Функсияи илмӣ |
|---|---|---|
| Шакли 1 | Табдили raw bmon output ба descriptive timestamped logs | Нишон додани data preparation process |
| Шакли 2 | Меъмории E_LogBERT бо 13 module | Ҷамъбасти software component ва task-ҳо |
| Шакли 3 | Workflow-и шашмарҳилагии низом | Нишон додани тартиби раванд аз data generation то alarm ва prediction |
| Шакли 4 | Live congestion monitoring dashboard | Нишон додани visualization-и anomaly score ва network state |
| Шакли 5 | Detailed module and file flow | Нишон додани connection байни system component-ҳо |
| Шакли 6 | Unified Telecom Platform test environment | Шарҳи virtualized network structure, ки дода дар он ҷамъ шуд |
| Шакли 7 | E_LogBERT ва KTeleBERT performance bars | Нишон додани фарқҳои reported accuracy, precision, recall, F1 ва AUC |
| Шакли 8 | Accuracy вобаста ба epoch count | Асоснок кардани интихоби training-и нӯҳ epoch |
Маълумоти гумшуда барои бозтавлиди натиҷаҳо
- Таърифи кушода ва ченшавандаи congestion class,
- Шумораи normal ва congested sample-ҳо,
- Labeling ё event-generation protocol,
- Time-based training–validation–test split,
- Random seed ва training repeat,
- KTeleBERT ва LogBERT hyperparameter-ҳо,
- Dynamic normalization window,
- Усули интихоби anomaly threshold,
- Model inference ва training latency,
- Source code ва version info,
- Trained model weight,
- Raw ё anonymized dataset.
Шарҳи техникӣ
Идеяи муҳимтарини тадқиқотии E_LogBERT ин аст, ки metric identity ва numeric magnitude дар network log ҳамчун embedding-ҳои ҷудо, аммо ҳамандоза коркард шаванд. Ин равиш метавонад quantitative relationships-ро, ки моделҳои танҳо event order-ро меомӯзанда аз даст медиҳанд, ба attention mechanism ворид кунад.
Бо вуҷуди ин, қувваи далелии classification value-ҳои баланд ба evaluation protocol вобаста аст. Агар overlapping window-ҳое, ки аз ҳамон sequence-и ҳафтрӯза random split шудаанд, ҳам дар training ва ҳам test истифода шуда бошанд, монандии бузург байни window-ҳои ҳамсоя метавонад натиҷаҳоро сунъӣ баланд кунад. Азбаски манбаъ splitting method-ро шарҳ намедиҳад, ин эҳтимолро истисно кардан мумкин нест.
Ба ҳамин монанд, бе таърифи ground-truth congestion label, accuracy-и %92 худ ба худ маънои operational надорад. Congestion бояд бо capacity utilization, latency, packet loss ё quality-of-service threshold пайваст карда шавад ва чен карда шавад, ки модел ин threshold-ро чанд вақт пештар пешгӯӣ мекунад.
Ёддошт оид ба манбаъ ва усул
Номи пурраи аслии таҳқиқот: E_LogBERT: Enhanced LogBERT for Realistic Telecom Networks Traffic
Муаллифон: Kareem A. Mostafa, El-Sayed Soliman A. Said, Abdelhady A. Ammar, Sayed A. Nouh ва M. Zaki.
Тартиби муаллифон: Тартиби сабти расмии SSRN нигоҳ дошта шудааст.
Саҳми баробар: Изҳороти саҳм мегӯяд, ки ҳамаи муаллифон ба омодасозии мақола баробар саҳм гузоштаанд.
Муаллифи масъул: Kareem A. Mostafa. Дар сабти SSRN ҳамчун “Contact Author” нишон дода шудааст.
Муассиса 1: Al-Azhar University, Cairo – Faculty of Engineering, Nasr City, Cairo 11371, Миср. Барои Kareem A. Mostafa гузориш шудааст.
Муассиса 2: Al-Azhar University, Qena 83513, Миср. Барои El-Sayed Soliman A. Said гузориш шудааст.
Муассисаҳои дигар: Пайвастагии муассисавии Abdelhady A. Ammar, Sayed A. Nouh ва M. Zaki дар версияи боршуда ва сабти расмии SSRN мавҷуд нест.
Пайванди расмии манбаъ:Саҳифаи сабти расмии SSRN
Платформаи нашр: SSRN.
Санаи боргузорӣ: 24 Июн 2026.
Соли нашр: 2026.
Шумораи саҳифаҳо: 30.
Маҷалла: Дар ин манбаъ номи маҷаллаи муайяни ҳамтоёнӣ ё версияи қабулшудаи маҷалла вуҷуд надорад.
Ношири ҳамтоёнӣ: Мавҷуд нест. SSRN платформаи паҳнкунии preprint мебошад.
Навъи манбаъ: Мақолаи тадқиқотии preprint, ки дар network test environment дода ҷамъ мекунад, mixed symbolic-numeric BERT model ва modular real-time monitoring prototype пешниҳод мекунад.
Вазъи ҳамтоёнӣ: Таҳқиқот аз арзёбии ҳамтоён нагузаштааст. Дар ҳамаи саҳифаҳои файл огоҳии “Preprint not peer reviewed” мавҷуд аст.
Маблағгузорӣ: Гуфта шудааст, ки open-access funding аз ҷониби ҳамкории Science, Technology & Innovation Funding Authority ва Egyptian Knowledge Bank таъмин шудааст. Буҷети рушди техникӣ ё project number-и ҷудогона гузориш нашудааст.
Саҳми муаллифон: Гуфта шудааст, ки ҳамаи муаллифон ба рушди идеяҳои аслӣ, навиштани мақола ва баррасии ҳамаи бахшҳо баробар саҳм гузоштаанд.
Бархӯрди манфиатҳо: Муаллифон изҳор кардаанд, ки competing interest вуҷуд надорад.
Дастрасӣ ба дода ва мавод: “Not applicable” гузориш шудааст. Data repository ё anonymized log dataset пешниҳод нашудааст.
Дастрасӣ ба code ва model: Пайванди source code, model weight, dependency lock file ё reproducibility package дода нашудааст.
Ҳадди асосии validation: Таҳқиқот дар controlled UTP test environment performance value-ҳои баланд гузориш мекунад; аммо азбаски independent test split, congestion labeling method, forecast horizon ва uncertainty-и такрорҳо пешниҳод нашудаанд, accuracy-и %92 набояд ҳамчун performance-и тасдиқшуда барои network-и воқеии operator шарҳ дода шавад.
Огоҳии мутобиқати architecture: Mixed token generation дар манбаъ бо ду тарзи гуногун шарҳ дода шудааст. Дар parameter table сатри такрории \(W_V\) ва қабати гумшудаи numeric projection вуҷуд дорад. Ин нуқтаҳо хомӯшона ислоҳ нашудаанд.
Огоҳии anomaly score: Барои training weight-ҳо шарти \(\alpha+\beta=1\) дода шудааст, аммо баъдан ҳолати \(\alpha=\beta=0\) шарҳ дода шудааст. Ин ду таъриф математикӣ ҳамзамон дуруст буда наметавонанд.
Ҳадди иддаои prediction: Таҳқиқот current anomaly score ва congestion classification пешниҳод мекунад; аммо experiment-и алоҳидае, ки congestion-и оянда чанд сония ё дақиқа пештар пешгӯӣ мешавад, вуҷуд надорад.
Ин мундариҷаи тоҷикӣ танҳо дар асоси матн, муодилаҳо, ҷадвалҳо, system diagram, dashboard ва experiment result-ҳои гузоришшудаи таҳқиқоти боршуда омода шудааст. Ягон иддаои operator field success, cyberattack detection accuracy, production environment reliability ё performance-и хоси Туркия, ки дар таҳқиқот нест, илова нашудааст.

Шарҳ гузоред
Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд