Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Sayansi ya Kompyuta / Ujifunzaji wa Kuimarisha wa Actor–Identifier–Critic kwa Udhibiti Bora Unaobadilika Usiohitaji Modeli wa Mifumo Isiyo ya Mstari chini ya Upotevu wa Pakiti wa Stochastic
Sayansi ya Kompyuta

Ujifunzaji wa Kuimarisha wa Actor–Identifier–Critic kwa Udhibiti Bora Unaobadilika Usiohitaji Modeli wa Mifumo Isiyo ya Mstari chini ya Upotevu wa Pakiti wa Stochastic

Katika mifumo ya udhibiti inayofanya kazi kupitia mtandao, kupotea kwa pakiti za vipimo au za udhibiti kunaweza kusababisha kidhibiti kutopata hali halisi ya mfumo kwa wakati au amri ya udhibiti iliyotolewa kutofika kwa aktueta.

15/08/2026  Veri Anla Imetazamwa mara 32
Ujifunzaji wa Kuimarisha wa Actor–Identifier–Critic kwa Udhibiti Bora Unaobadilika Usiohitaji Modeli wa Mifumo Isiyo ya Mstari chini ya Upotevu wa Pakiti wa Stochastic

Katika mifumo ya udhibiti inayofanya kazi kupitia mtandao, kupotea kwa pakiti za vipimo au za udhibiti kunaweza kusababisha kidhibiti kutopata hali halisi ya mfumo kwa wakati au amri ya udhibiti iliyotolewa kutofika kwa aktueta. Utafiti huu unatengeneza usanifu wa Actor-Identifier-Critic (AIC) ili kufuatilia njia ya rejea katika mazingira kama haya bila kujua mapema kazi zisizo za mstari za mienendo ya mfumo \(f(x)\) na \(g(x)\).

Katika muundo wa AIC, actor huzalisha amri ya udhibiti; identifier/kitambulishaji hukadiria mienendo isiyojulikana ya mfumo na hali inayofuata ya mfumo; critic/mkosoaji hutathmini gharama ya muda mrefu ya sera ya sasa ya udhibiti. Kazi ya pili muhimu ya Identifier si tu kukadiria taarifa ya hali iliyopotea: pia huunda kiunganishi cha kati cha kihisabati kinachowezesha uhamishaji wa gradient kutoka critic kwenda actor katika muundo usiotegemea modeli.

Uwasilishaji wa pakiti umetengenezwa kwa vigeu vya Bernoulli, na tatizo la udhibiti limeundwa kupitia mlinganyo wa Bernoulli Hamilton–Jacobi–Bellman (BHJB) unaozingatia kwa uzito hali zinazowezekana za baadaye zenye na zisizo na upotevu wa pakiti. Kanuni za kujifunza za mitandao ya actor, identifier na critic zimefafanuliwa tofauti; uchanganuzi wa uthabiti umefanywa kwa mbinu ya Lyapunov na chanzo kimehitimisha kuwa kosa la ufuatiliaji la mfumo wa mzunguko uliofungwa ni uniform ultimate bounded (UUB).

Mbinu imejaribiwa katika mifumo miwili isiyo ya mstari ya benchmark. Katika uigaji wa SIMO na MIMO chini ya hali tano za mawasiliano, kila jaribio lilirudiwa mara tano; Normalized Root Mean Square Error (NRMSE) na Pearson Correlation Coefficient (PCC) ziliripotiwa. Katika mojawapo ya hali zilizojaribiwa kwa kina zaidi, \(\bar{\gamma}_s=0.8,\bar{\gamma}_c=0.7\), thamani ya wastani ya NRMSE baada ya konverjensi ya mfumo wa MIMO ilitolewa kuwa 0,0670, na thamani ya PCC kuwa 0,9926. Katika hali hiyo hiyo, thamani za mfumo wa SIMO zilikuwa 0,0281 na 0,9995 kwa mtiririko huo.

Katika mfano wa tatu, kidhibiti cha AIC kimetumika kwa modeli ya mfumo wa nguvu wa Virtual Synchronous Machine (VSM) wenye inertia ya chini ya kipepeo. Baada ya kutolingana kwa nguvu, uigaji usiodhibitiwa ulionyesha mitetemo ya masafa ikiongezeka, huku AIC ilipowashwa masafa ya uigaji yalirejeshwa kwenye rejea ya 50 Hz. Chanzo kinaonyesha hili kama mfano wa uwezekano wa kutumia AIC katika mifumo ya nguvu; hata hivyo, matokeo haya si jaribio la gridi halisi ya umeme wala inverter ya kimwili.

Kwa mtazamo wa Uturuki, utafiti huu una thamani ya kimetodolojia kwa tafiti za udhibiti mahiri zinazostahimili upotevu wa pakiti katika mitandao ya mawasiliano ya viwandani, mifumo ya nishati inayodhibitiwa kwa mbali, mikrogridi, uzalishaji unaotegemea inverter na mifumo ya sensor–aktuator isiyotumia waya. Hata hivyo, viwango vya makosa vilivyopatikana katika uigaji haviwezi kudaiwa kutumika moja kwa moja kwa gridi halisi ya umeme ya Uturuki, Ethernet ya viwandani, 5G/6G au mfumo wa udhibiti usiotumia waya. Katika matumizi halisi, ucheleweshaji, upotevu wa pakiti mfululizo/burst, kelele za vipimo, muda wa kukokotoa, mipaka ya aktueta na usalama wa maunzi lazima zithibitishwe tofauti.

Tatizo kuu la udhibiti ni nini?

Utafiti unazingatia mfumo ufuatao wa affine usio wa mstari wa muda endelevu:

\[ \dot{x}(t)=f(x(t))+g(x(t))u(t) \]

Hapa \(x\) inawakilisha hali za mfumo, \(u\) ingizo la udhibiti, na \(f(x)\) pamoja na \(g(x)\) mienendo ya mfumo inayodhaniwa kutokujulikana mapema na kidhibiti.

Kwa kurahisisha uchanganuzi, waandishi huongeza na kutoa kwenye mfumo neno \(A_cx(t)\) lenye muundo wa diagonal na sifa ya Hurwitz, na kutumia:

\[ \dot{x}(t) = A_cx(t)+f_c(x(t))+g(x(t))u(t) \]

na:

\[ f_c(x)=f(x)-A_cx \]

.

Mabadiliko ya hali za mfumo katika hatua ndogo ya \(\Delta t\) huzingatiwa kwa makadirio ya Euler:

\[ x(t+\Delta t) \approx x(t)+\dot{x}(t)\Delta t \]

.

Dhana kuu za utafiti ni zipi?

  • Mfumo usio wa mstari unaweza kuangaliwa.
  • Kazi \(g(x)\) haijulikani lakini imewekewa kikomo na mpaka wa juu wenye thamani yenye kikomo.
  • \(f(x)\) na \(g(x)\) ni kazi endelevu za Lipschitz.
  • Njia ya rejea inayotakiwa \(x_d(t)\) na derivative yake ni laini na zimewekewa mipaka.
  • Dhana ya boundedness inawekwa kwa kazi za msingi zinazotumika katika mtandao wa Critic na uzito bora wa critic.

Dhana hizi ni muhimu; neno “model-free” halimaanishi kuwa hakuna dhana yoyote ya kihisabati inayofanywa kuhusu mfumo. Kidhibiti kimeundwa kufanya kazi bila kujua modeli ya nambari ya \(f(x)\) na \(g(x)\), lakini masharti ya kimuundo kama observability, mwendelezo wa Lipschitz na boundedness ni sehemu ya uchanganuzi.

Upotevu wa pakiti unatengenezwa vipi?

Kwa chaneli kutoka sensor kwenda kidhibiti:

\[ x_s(t)=\gamma_sx(t) \]

hufafanuliwa. Hapa:

\[ \gamma_s= \begin{cases} 1,& \text{paket ulaştı}\\ 0,& \text{paket kayboldu} \end{cases} \]

Kwa chaneli kutoka kidhibiti kwenda aktueta, hutumiwa:

\[ u(t)=\gamma_cu_c(t) \]

na \(\gamma_c\) pia ni kigeu cha Bernoulli kwa namna hiyo hiyo.

Chanzo hufafanua:

\[ P(\gamma_s=1)=\bar{\gamma}_s,\qquad P(\gamma_c=1)=\bar{\gamma}_c \]

na kutaja \(\bar{\gamma}_s\) na \(\bar{\gamma}_c\) kama uwezekano wa pakiti kufika kwa mafanikio. Kwa hiyo, kwa mfano \(\bar{\gamma}_c=0.7\), kwa mujibu wa ufafanuzi wa kihisabati, ni modeli ya Bernoulli ambapo amri za udhibiti hufika kwa uwezekano wa %70 na hupotea kwa uwezekano wa %30.

Tatizo la ufuatiliaji bora linafafanuliwaje?

Kosa la ufuatiliaji hufafanuliwa kama:

\[ e(t)=x(t)-x_d(t) \]

. Lengo la sera ya udhibiti ni kupunguza kosa la ufuatiliaji na nishati ya udhibiti inayotumika:

\[ J= \int_t^\infty \left[ e(\tau)^TQe(\tau) + \hat{u}_c(\tau)^TR\hat{u}_c(\tau) \right]d\tau \]

\(Q\) na \(R\) ni matrisi za uzito positive definite. Kwa hiyo kujifunza hakutumii tu lengo la “fuata rejea”; ukubwa wa amri ya udhibiti pia ni sehemu ya gharama ya uboreshaji.

Mitandao mitatu katika Actor–Identifier–Critic hufanya nini?

Kielelezo 1 kwenye ukurasa wa 3 wa utafiti kinaonyesha mtiririko mkuu wa usanifu wa AIC. Mfumo wa kimwili umeunganishwa na kidhibiti cha RL kupitia mtandao wa mawasiliano wa aktueta na sensor. Ndani ya kidhibiti kuna mitandao mitatu tofauti ya neva.

1. Identifier: Tabaka linalojifunza mienendo isiyojulikana

Identifier hukadiria usemi usiojulikana:

\[ f_c(x(t))+g(x(t))u_c(t) \]

kwa kutumia mtandao wa neva:

\[ F_i(x_s,u_c) = \hat{W}_i \sigma(\hat{V}_i\bar{x}) \]

Hapa:

\[ \bar{x}=[x_s,u_c] \]

na bipolar sigmoid hutumika kama aktivasheni:

\[ \sigma(x)=\frac{2}{1+e^{-x}}-1 \]

Hali ya baadaye inayokadiriwa na Identifier hutumika kwa kazi mbili tofauti: kukamilisha taarifa ya hali inayokosekana wakati pakiti ya sensor inapotea, na kutoa modeli ya kati inayoweza kutofautishwa badala ya mienendo isiyojulikana ya mfumo katika hesabu ya gradient kutoka critic kwenda actor.

2. Critic: Mtandao unaojifunza gharama ya sera ya udhibiti

Critic hukadiria kazi ya thamani isiyojulikana kama:

\[ \hat{V}(t) = F_c(\hat{e}_s(t)) = \hat{W}_c\Psi_c(\hat{e}_s(t)) \]

. Ishara ya kujifunza ya Critic inategemea kosa la temporal-difference.

Mojawapo ya vipengele vinavyotofautisha utafiti ni kuingiza uwezekano wa upotevu wa pakiti katika usemi wa kawaida wa HJB na kuunda mlinganyo wa model-free Bernoulli Hamilton–Jacobi–Bellman (BHJB):

\[ \hat{V}(t) = \int_t^{t+\Delta t} \left[ \hat{e}_s^TQ\hat{e}_s+ \hat{u}_c^TR\hat{u}_c \right]d\tau + \bar{\gamma}_c F_c(\hat{e}_s(t+\Delta t)) \big|_{u=\hat{u}_c} + (1-\bar{\gamma}_c) F_c(\hat{e}_s(t+\Delta t)) \big|_{u=0} \]

Kwa hivyo thamani ya baadaye huzingatia si tu hali ambayo amri ya udhibiti inafika kwa aktueta, bali pia hali ambayo amri inapotea.

3. Actor: Mtandao unaozalisha amri ya udhibiti

Sera iliyokadiriwa ya udhibiti ya actor ni:

\[ \hat{u}_c(t) = \hat{W}_a \sigma \left( \hat{V}_a\hat{e}_s(t) \right) \]

. Lengo la actor ni kukaribia sera ya udhibiti inayopunguza Hamiltonian.

Kwa nini Identifier huongezwa kwenye muundo wa kawaida wa actor–critic?

Kama modeli ingejulikana, \(g(x)\) ingeweza kutumiwa kuhesabu derivative ya kazi ya thamani ya baadaye ya critic kwa kuzingatia ingizo la udhibiti. Lakini utafiti hauwezi kufanya hivyo moja kwa moja wakati \(f(x)\) na \(g(x)\) hazijulikani.

Kwa hiyo mnyororo wa gradient hupitishwa kupitia identifier kama:

\[ \frac{\partial\hat V(t+\Delta t)} {\partial\hat u_c(t)} = \frac{\partial\hat V} {\partial\hat e_s} \cdot \frac{\partial\hat e_s} {\partial F_i} \cdot \frac{\partial F_i} {\partial\hat u_c} \]

.

Kwa hiyo, katika usanifu uliopendekezwa Identifier si “mkadiriaji wa hali” tu, bali pia daraja la gradient la mafunzo ya actor yasiyotegemea modeli.

Hesabu ya mbele ya stochastic hufanywaje?

Kielelezo 2 na Kielelezo 3 kwenye kurasa za 4 na 5 vinaonyesha kuwa katika masasisho ya identifier na critic, mustakabali mbili sambamba—wenye na usio na upotevu wa pakiti—hupewa uzito kwa uwezekano.

Identifier hukadiria hali ya baadaye kama:

\[ \hat{x}_s(t+\Delta t) = \bar{\gamma}_c \hat{x}_s(t+\Delta t)|_{u=\hat u_c} + (1-\bar{\gamma}_c) \hat{x}_s(t+\Delta t)|_{u=0} \]

.

Muundo huu haumaanishi kuwa mustakabali mbili za kimwili hutokea kwa wakati mmoja katika muda halisi; ni kuzingatia pamoja athari zinazotarajiwa za uwezekano wa pakiti ya udhibiti kufika na kupotea katika hesabu ya mafunzo.

Uthabiti unachanganuliwaje?

Kazi ya jumla ya Lyapunov imeundwa kama:

\[ L=L_a+L_i+L_c \]

kutokana na vipengele vya actor, identifier na critic.

Utafiti una teorema nne:

  • Teorema 1: UUB ya kosa la uzito wa Identifier kwa kiwango kinachofaa cha kujifunza inaegemezwa kwenye matokeo ya awali ya uthabiti.
  • Teorema 2: Mfumo wa mzunguko uliofungwa unapochukuliwa kuwa thabiti, inapendekezwa kuwa identifier hukadiria mfumo chini ya upotevu wa pakiti kwa kosa lililowekewa mipaka.
  • Teorema 3: Uchanganuzi wa Lyapunov unaonyesha kuwa kosa la makadirio ya uzito wa Critic ni UUB chini ya sharti \(0<\eta_c<2\).
  • Teorema 4: Inaonyeshwa kuwa chini ya sera ya Actor, kosa la ufuatiliaji wa hali ya mzunguko uliofungwa ni UUB.

Mpaka wa kosa la ufuatiliaji unaopatikana katika chanzo ni:

\[ \|\hat e_s(t)\| \le \sqrt{ \frac{C}{\lambda_{\min}(Q)} } \]

.

Matokeo haya ni matokeo ya uniform ultimate boundedness. Kwa maneno mengine, dai la uchanganuzi si kwamba kosa hukaribia kabisa sifuri kwa asymptotiki katika hali zote; ni kwamba hubaki ndani ya eneo lenye mipaka chini ya dhana na vigezo fulani vya usanifu.

Kwa nini \(\Delta t\) na kiwango cha kujifunza ni muhimu?

Chanzo kinaonyesha kuwa \(\Delta t\) na kiwango cha kujifunza cha actor \(\eta_a\) ni vigezo vya usanifu vinavyoathiri mpaka wa juu wa kosa. Kwa hiyo utendaji wa AIC hauathiriwi tu na muundo wa mtandao, bali pia na uchaguzi wa hatua ya muda na vigezo vya kujifunza.

Matokeo yanayoungwa mkono na utafiti

  • Usanifu wa AIC ulifuatilia njia ya rejea katika uigaji wa SIMO na MIMO uliotafitiwa licha ya mienendo ya plant kutokujulikana.
  • Chini ya upotevu wa pakiti wa aina ya Bernoulli katika chaneli za sensor na udhibiti, makosa ya ufuatiliaji yalibaki na mipaka katika uigaji.
  • Identifier ilitoa modeli ya kukadiria ya mienendo isiyojulikana na pia ilitumika kama kiunganishi cha gradient ya critic–actor.
  • Katika hali zote tano za mawasiliano, thamani za PCC baada ya konverjensi ziliripotiwa katika anuwai ya 0,9988–0,9998 kwa SIMO na 0,9926–0,9965 kwa MIMO.
  • Katika uigaji wa VSM, AIC ilirejesha masafa kwenye rejea ya 50 Hz baada ya kutolingana kwa nguvu.
  • Chanzo kinatoa uchanganuzi wa uthabiti wa Lyapunov/UUB kwa mitandao ya actor, identifier na critic.

Matokeo ambayo utafiti hauungi mkono au haujayajaribu

  • Haijaonyeshwa kuwa kidhibiti cha AIC kitatoa utendaji ule ule kwenye maunzi halisi ya viwandani au gridi ya nguvu ya kimwili.
  • Hakuna hardware-in-the-loop ya maabara au jaribio la kidhibiti cha muda halisi katika utafiti.
  • Ucheleweshaji wa mawasiliano haujajaribiwa katika mbinu ya sasa; waandishi wanauainisha kama mada ya kazi ya baadaye.
  • Upotevu wa pakiti wa burst/mfululizo nje ya modeli ya Bernoulli, miundo ya chaneli ya Markov au mashambulizi mabaya ya mawasiliano hayamo katika wigo mkuu wa majaribio wa utafiti huu.
  • Matokeo ya uthabiti wa UUB si sawa na dai la kosa la kudumu sifuri au uthabiti wa asymptotiki wa kimataifa kwa hali zote za mwanzo.
  • Mfano wa VSM si jaribio la inverter halisi au gridi ya kitaifa.
  • Matokeo ya NRMSE na PCC yanahusu tu mifumo miwili ya benchmark na uigaji uliofanywa kwa hyperparameters zilizotajwa.

Mbinu na Matokeo ya Utafiti

Mfumo wa benchmark wa SIMO

Jaribio la kwanza ni mfumo usio wa mstari wa SIMO wenye vigeu viwili vya hali na ingizo moja la udhibiti. Njia ya rejea imechaguliwa kuwa:

\[ x_d= \begin{bmatrix} \sin(t)\\ \cos(t)+\sin(t) \end{bmatrix} \]

.

Gharama ya utendaji iliyotumiwa ni:

\[ V= \int_t^\infty \frac{1}{2} \left( e_1^2+ e_2^2+ 5\times10^{-4}\hat u_c^2 \right)d\tau \]

.

Kigezo cha SIMOActorIdentifierCritic
Idadi ya neuroni883
AktivasheniSigmoidSigmoid\(\Psi_c\)
Kiwango cha kujifunza\(10^2\)\(10^{-3}\)\(10^{-9}\)
Muda wa uigaji20 sekunde

Kielelezo 4 kwenye ukurasa wa 8 kinaonyesha kwamba hali mbili za mfumo zinafuatilia ishara za rejea, makosa ya ufuatiliaji yanapungua baada ya awamu ya mpito ya mwanzo, na amri ya udhibiti hubaki na mipaka. Paneli ya chini ya kielelezo hicho inaonyesha matukio ya upotevu wa pakiti katika muda.

Katika Kielelezo 5, njia ya kosa ya pande mbili \((e_1,e_2)\) husogea kutoka nukta ya mwanzo hadi eneo dogo karibu na sifuri. Taswira hii inawasilishwa katika chanzo kama uwakilishi wa nambari wa tabia ya UUB.

Tabia ya kujifunza ya mitandao ya AIC

Kielelezo 6 kwenye ukurasa wa 8 kinaonyesha mwendo wa ishara za kosa za critic, actor na identifier pamoja na gradient za actor katika muda. Baada ya awamu ya kwanza ya mpito, makosa ya mitandao na gradient zinaonekana kubaki katika maeneo yenye mipaka.

Kielelezo 7 kinaonyesha nafasi ya thamani iliyojifunzwa na critic kama uso wa takriban quadratic. Kielelezo 8 ni ukaguzi unaoonyesha kuwa mwelekeo wa gradient wa \(\hat g(x)\) uliojifunzwa na identifier hubaki kwa kiasi kikubwa na ishara sawa na mwelekeo wa \(g(x)\) wa mfumo halisi wa benchmark.

Mfumo wa benchmark wa MIMO

Jaribio la pili ni mfumo nonlinear wa MIMO wenye hali mbili na miingizo miwili ya udhibiti. Mfumo uliigwa kwa sekunde 30.

Kigezo cha MIMOActorIdentifierCritic
Idadi ya neuroni6423
AktivasheniSigmoidSigmoid\(\Psi_c\)
Kiwango cha kujifunza10\(10^{-3}\)\(10^{-3}\)
Muda wa uigaji30 sekunde

Kielelezo 9 kwenye ukurasa wa 9 kinaonyesha kuwa hali mbili hufuata rejea zao baada ya awamu ya mpito. Hata katika vipindi ambavyo upotevu wa pakiti uliendelea, amri za udhibiti ziliendelea kuzalishwa na makosa ya ufuatiliaji yakakonverji kwenye eneo lenye mipaka.

Hali tano za upotevu wa pakiti ziliundwaje?

Hali tano za mawasiliano zilitumiwa katika uchanganuzi wa kiasi:

Hali\(\bar{\gamma}_s\)\(\bar{\gamma}_c\)Hali kwa mujibu wa ufafanuzi wa kihisabati
11,01,0Hakuna upotevu wa pakiti
21,00,8Hakuna upotevu wa pakiti ya sensor; upotevu wa uwezekano wa %20 katika chaneli ya udhibiti
30,81,0Upotevu wa uwezekano wa %20 katika chaneli ya sensor; chaneli ya udhibiti haina upotevu
40,90,9Upotevu wa uwezekano wa %10 katika chaneli zote mbili
50,80,7Upotevu wa uwezekano wa %20 kwenye sensor na %30 kwenye chaneli ya udhibiti

Asilimia hizi zimetokana na uwezekano wa mafanikio wa uwasilishaji \(P(\gamma=1)=\bar{\gamma}\) uliofafanuliwa katika chanzo. Kinyume na lebo ya “Dropout rate” iliyotumiwa katika majedwali ya vigezo, ufafanuzi wa kihisabati unatoa \(\bar{\gamma}\) kama uwezekano wa uwasilishaji kufanikiwa.

Utendaji ulipimwaje?

Vipimo viwili vya msingi vilitumiwa:

Normalized Root Mean Square Error (NRMSE): hupima ukubwa wa wastani wa kosa uliorekebishwa kati ya njia inayofuatiliwa na rejea. Thamani ya chini inaonyesha ufuatiliaji bora.

Pearson Correlation Coefficient (PCC): hupima uhusiano kati ya njia halisi ya hali na njia ya rejea inayotakiwa. Thamani zilizo karibu na 1 zinaonyesha ulinganifu mkubwa wa mstari.

Kila uigaji ulirudiwa mara 5 na thamani za juu, wastani na mkengeuko wa kawaida ziliripotiwa.

Pia vipindi viwili tofauti vya tathmini vilitumiwa:

  • OTE — Overall Tracking Error: hujumuisha muda wote wa uigaji.
  • PCTE — Post-Convergence Tracking Error: hutathmini utendaji wa ufuatiliaji baada ya awamu ya awali ya konverjensi.

Matokeo ya kiasi ya mfumo wa SIMO

\(\bar{\gamma}_s,\bar{\gamma}_c\)Wastani wa OTE NRMSEWastani wa OTE PCCWastani wa PCTE NRMSEWastani wa PCTE PCCMuda wa kutulia
1,0 / 1,00,16110,97250,03890,99882,224 s
1,0 / 0,80,14580,97560,02970,99932,124 s
0,8 / 1,00,09980,98850,02070,99981,792 s
0,9 / 0,90,12390,98150,02370,99961,937 s
0,8 / 0,70,12480,97990,02810,99951,871 s

Katika matokeo haya inaonekana kuwa kadiri upotevu wa pakiti unavyoongezeka, thamani za kosa haziongezeki kwa lazima kwa njia ya monotoniki. Kwa mfano, katika baadhi ya hali za dropout, SIMO NRMSE ilikuwa chini kuliko katika hali isiyo na upotevu. Kwa kuwa matokeo ya utafiti yanategemea majaribio ya stochastic na mchakato wa kujifunza unaobadilika, haiwezekani kuhitimisha kutoka jedwali moja kwamba “upotevu wa pakiti huboresha utendaji”.

Matokeo ya kiasi ya mfumo wa MIMO

\(\bar{\gamma}_s,\bar{\gamma}_c\)Wastani wa OTE NRMSEWastani wa OTE PCCWastani wa PCTE NRMSEWastani wa PCTE PCCMuda wa kutulia
1,0 / 1,00,11250,96250,04490,99655,796 s
1,0 / 0,80,17450,91530,05510,99436,231 s
0,8 / 1,00,17290,94040,06660,99376,424 s
0,9 / 0,90,19350,92310,05120,99465,037 s
0,8 / 0,70,23010,89790,06700,99265,278 s

Katika mfumo wa MIMO, upotevu wa pakiti unahusishwa na kupungua kwa utendaji kunakoonekana zaidi hasa katika kipimo cha OTE kinachojumuisha uigaji wote. Wakati wastani wa OTE NRMSE ulikuwa 0,1125 bila upotevu, uliongezeka hadi 0,2301 katika hali ya \(\bar{\gamma}_s=0.8,\bar{\gamma}_c=0.7\). Hata hivyo, baada ya konverjensi ya awali PCTE PCC ilibaki juu ya 0,99 katika hali zote.

Verianla Live: Kosa la ufuatiliaji baada ya konverjensi katika mfumo wa MIMO chini ya upotevu wa pakiti

Thamani zifuatazo ni matokeo ya MIMO PCTE wastani wa NRMSE yaliyoripotiwa katika Jedwali III la utafiti. \(\bar{\gamma}_s\) na \(\bar{\gamma}_c\) zimefafanuliwa katika chanzo kama uwezekano wa uwasilishaji wa pakiti kufanikiwa. NRMSE ya chini inaonyesha kosa la ufuatiliaji lililo chini.

\(\bar{\gamma}_s / \bar{\gamma}_c\)PCTE wastani wa NRMSEChanzo
1,0 / 1,00,0449Jedwali III
1,0 / 0,80,0551Jedwali III
0,8 / 1,00,0666Jedwali III
0,9 / 0,90,0512Jedwali III
0,8 / 0,70,0670Jedwali III
 

Verianla Live: Taswira huundwa kutoka kwenye jedwali la data za kisayansi linaloonekana. Hali zinawakilisha uwezekano tofauti wa mafanikio ya pakiti za sensor/aktuator; hazipaswi kutafsiriwa kama mhimili mmoja wa monotoniki wa “kiwango cha upotevu wa pakiti”.

Mfano wa mfumo wa nguvu wa VSM

Mfano wa mwisho wa matumizi ni mienendo ya Virtual Synchronous Machine (VSM) ya mfumo wa nguvu wenye sehemu kubwa ya uzalishaji unaotegemea inverter. Kwa kuwa inertia ya kimwili ya kuzunguka katika jenereta za kawaida za synchronous haipo kiasili katika inverter, udhibiti wa VSM hutumiwa kuiga tabia ya inertia ya kipepeo.

Sehemu husika ya mienendo ya VSM katika chanzo ni:

\[ f(x)= \begin{bmatrix} \omega-\omega_{nom}\\ \frac{1}{H} \left[ -D_p(\omega-\omega_{nom}) -\frac{EV_c}{X_{eq}}\sin(\delta) \right] \end{bmatrix} \]

na matrisi ya ingizo la udhibiti ni:

\[ g(x)= \begin{bmatrix} 0\\ 1/H \end{bmatrix} \]

.

Masafa ya rejea yamewekwa kuwa:

\[ \omega_d=\omega_{nom}=50\ \mathrm{Hz} \]

.

Kielelezo 13(a) kwenye ukurasa wa 11 kinaonyesha kwamba baada ya kutolingana kwa nguvu kulikotumika katika \(t=0\), masafa ya VSM isiyodhibitiwa yanaonyesha mitetemo inayoongezeka karibu na 50 Hz; Kielelezo 13(b) kinaonyesha kuwa AIC inapowashwa masafa yanarejeshwa hadi 50 Hz. Paneli za chini za kielelezo hicho zinaonyesha amri ya udhibiti na matukio ya upotevu wa pakiti.

Utafiti hauripoti NRMSE, PCC au kipimo cha ubora wa masafa kinachotegemea kiwango halisi cha gridi kwa mfano huu. Kwa hiyo matokeo ya mfumo wa nguvu yanategemea hasa tabia ya mfululizo wa muda wa uigaji.

Nguvu za utafiti

Nguvu ya utafiti ni kuingiza upotevu wa pakiti moja kwa moja kwenye kazi ya thamani na mlinganyo wa kujifunza, badala ya kuuchukulia tu kama usumbufu unaoongezwa baadaye kwenye uigaji. Matumizi ya Identifier kwa kukadiria taarifa inayokosekana na pia kama kiunganishi cha gradient ya critic–actor ndiyo mchango mkuu wa kimuundo wa usanifu wa AIC uliopendekezwa.

Pia, mbinu haijaonyeshwa katika mfano mmoja tu; imejaribiwa katika miktadha mitatu tofauti ya udhibiti—SIMO, MIMO na mienendo ya mfumo wa nguvu. Katika majaribio ya SIMO na MIMO, matumizi ya hali tano tofauti za mawasiliano na marudio matano, pamoja na kuripoti wastani na mikengeuko ya kawaida, yanatoa udhibiti wa kiasi wenye nguvu zaidi kuliko tathmini inayotegemea mlolongo mmoja wa nasibu wa upotevu wa pakiti.

Mapungufu makuu

Hata hivyo, utafiti unategemea kabisa uigaji wa nambari. Hali ambazo upotevu wa pakiti katika mtandao halisi unaweza kuwa wa mfululizo, wenye uhusiano au unaotegemea hali ya mzigo tofauti na matukio huru ya Bernoulli hazijajaribiwa.

Chanzo pia kinaacha ucheleweshaji wa mawasiliano nje ya kazi ya sasa na kuutaja kama mada ya utafiti wa baadaye. Kwa kuwa katika mifumo halisi ya udhibiti iliyounganishwa kwenye mtandao ucheleweshaji na upotevu wa pakiti vinaweza kutokea kwa wakati mmoja, matokeo ya sasa hayapaswi kutathminiwa kama dhamana ya moja kwa moja ya uaminifu wa mtandao wa muda halisi.

Mwisho, kutotegemea modeli kunamaanisha, kwa mtazamo wa kidhibiti, kwamba kazi \(f(x)\) na \(g(x)\) za mfumo hazitolewi mapema. Ili kuzalisha tabia ya plant za benchmark na VSM, milinganyo halisi ya mfumo, bila shaka, hutumiwa upande wa uigaji. Tofauti hii ni muhimu ili kuzuia tafsiri potofu kwamba “hakuna modeli ya mfumo iliyotumika katika utafiti”.

Maelezo ya Chanzo na Mbinu

Tam özgün çalışma adı: Actor-Identifier-Critic Reinforcement Learning for Adaptive Model-Free Optimal Control of Nonlinear Systems with Stochastic Packet Dropouts

Waandishi: Kianoush Aqabakee, Kosar Behnia, Amirhossein Heydarian Ardakani, Farzaneh Abdollahi na Elham Shirazi.

Mpangilio wa waandishi: Mpangilio katika toleo la chanzo umehifadhiwa kama ulivyo.

Mwandishi wa kwanza wa pamoja/mchango sawa: Hakuna tamko la mchango sawa katika toleo lililochunguzwa.

Mwandishi wa mawasiliano: Kwa kuwa hakuna alama tofauti ya corresponding-author katika chanzo, hakuna mwandishi maalum aliyetangazwa kama mwandishi wa mawasiliano.

Maelezo ya mawasiliano yaliyotolewa katika chanzo: Kianoush Aqabakee — kianoush.aqabakee@aut.ac.ir; Kosar Behnia — kosar.behnia@aut.ac.ir; Farzaneh Abdollahi — f_abdollahi@aut.ac.ir; Amirhossein Heydarian Ardakani — a.heydarian@utwente.nl; Elham Shirazi — e.shirazi@utwente.nl.

Taasisi: Department of Electrical Engineering, Amirkabir University of Technology, Tehran, Iran; Faculty of Engineering Technology, University of Twente, Enschede, Netherlands.

Jukwaa: arXiv.

Kitambulisho cha arXiv: 2605.28569.

Toleo lililochunguzwa: arXiv:2605.28569v2.

Uwasilishaji wa kwanza: 27 Mei 2026.

Marekebisho ya v2: 28 Mei 2026.

Kategoria: Systems and Control (eess.SY).

arXiv/DataCite DOI: 10.48550/arXiv.2605.28569.

Rekodi rasmi:https://arxiv.org/abs/2605.28569

Aina ya chanzo na hali ya uhakiki: Kazi iliyochunguzwa ni preprint ya utafiti ya arXiv. Hakuna uchapishaji wa mwisho wa jarida uliopitiwa na wahakiki au taarifa ya journal-reference iliyothibitishwa katika rekodi rasmi ya arXiv.

Jarida/mchapishaji: Hakuna uchapishaji wa asili wa jarida au mkutano uliopitiwa na wahakiki uliotajwa kwa toleo lililochunguzwa. arXiv ni jukwaa la preprint na halipaswi kutathminiwa kama jarida lililopitiwa na wahakiki.

Leseni: arXiv perpetual non-exclusive distribution license. Leseni hii haipaswi kutafsiriwa kama leseni ya matumizi tena ya Creative Commons.

Ufadhili: Hakuna tamko tofauti la ufadhili lililotambuliwa katika toleo lililochunguzwa.

Mgongano wa maslahi: Hakuna tamko tofauti la competing-interests lililotambuliwa katika toleo lililochunguzwa.

Upatikanaji wa data/msimbo: Hakuna tamko tofauti la data availability au hifadhi ya wazi ya msimbo lililotambuliwa katika toleo lililochunguzwa.

Michango ya CRediT: Hakuna CRediT authorship contribution statement tofauti katika toleo lililochunguzwa.

Mbinu kuu: Muundo wa kujifunza kwa kuimarisha wa Actor-Identifier-Critic kwa mifumo ya affine isiyo ya mstari ya muda endelevu; upotevu wa pakiti wa Bernoulli katika sensor na aktueta; model-free BHJB; neural-network identifier; sasisho la critic la temporal-difference; sasisho la actor linalotegemea kupunguza Hamiltonian na uchanganuzi wa uthabiti wa UUB unaotegemea Lyapunov.

Uthibitishaji: Benchmark mbili za nambari nonlinear — SIMO na MIMO — pamoja na uigaji wa mfumo wa nguvu unaotegemea Virtual Synchronous Machine. Uchanganuzi wa kiasi wa SIMO na MIMO umetathminiwa kwa marudio matano katika hali tano tofauti za uwasilishaji wa pakiti.

Dokezo la uwezekano wa pakiti ndani ya chanzo: Katika sehemu ya mbinu, \(\bar{\gamma}_s\) na \(\bar{\gamma}_c\) zimefafanuliwa kama uwezekano wa pakiti kupokelewa kwa mafanikio. Hata hivyo, katika majedwali ya vigezo vya SIMO na MIMO, mstari wa ukubwa huo huo umetajwa “Dropout rate”. Katika maelezo haya ya Verianla, ufafanuzi wa kihisabati umechukuliwa kuwa msingi na thamani zimetafsiriwa kama uwezekano wa mafanikio ya uwasilishaji.

Dokezo la alama ndani ya chanzo: Mbinu kuu hufafanua chaneli ya sensor kwa \(\gamma_s\) na chaneli ya udhibiti kwa \(\gamma_c\), huku baadhi ya majedwali/grafu za uigaji zikitumia alama \(\gamma_p\). Chanzo hakielezi tofauti hii ya alama; katika maandishi ya Verianla alama hizo hazijatafsiriwa kimya kimya kama kigeu kipya cha kimwili.

Mpaka wa uthabiti: Uchanganuzi wa Lyapunov wa utafiti unategemea matokeo ya UUB. Usemi huu si dhamana ya kosa la ufuatiliaji sifuri la asymptotiki ya kimataifa katika hali zote.

Mpaka wa uthibitishaji wa majaribio: Hakuna plant ya kimwili, hardware-in-the-loop, mtandao halisi wa mawasiliano, inverter halisi au jaribio la gridi ya umeme. Matumizi ya mfumo wa nguvu pia ni uigaji wa nambari wa VSM.

Kazi ya baadaye: Waandishi wanasema watazingatia ucheleweshaji wa mawasiliano kama tatizo la mfumo wa udhibiti uliounganishwa kwenye mtandao katika kazi zijazo.

Msingi wa maudhui: Maelezo haya ya Verianla yanategemea ufafanuzi wa tatizo, milinganyo, muundo wa Actor-Identifier-Critic, kanuni za kujifunza, uchanganuzi wa Lyapunov, algoriti, uigaji wa SIMO/MIMO, matokeo ya kiasi ya Jedwali III na mfano wa mfumo wa nguvu wa VSM wa kazi iliyochunguzwa. Hakuna matokeo mapya ya kisayansi yaliyoongezwa kutoka vyanzo vya nje isipokuwa uthibitishaji wa utambulisho wa bibliografia.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy