Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / Stoxastik Paket İtkiləri Altında Qeyri-Xətti Sistemlərin Adaptiv Modeldən Asılı Olmayan Optimal İdarəetməsi üçün Actor–Identifier–Critic Möhkəmləndirici Öyrənməsi
Kompüter Elmləri

Stoxastik Paket İtkiləri Altında Qeyri-Xətti Sistemlərin Adaptiv Modeldən Asılı Olmayan Optimal İdarəetməsi üçün Actor–Identifier–Critic Möhkəmləndirici Öyrənməsi

Şəbəkə üzərindən işləyən idarəetmə sistemlərində ölçmə və ya idarəetmə paketlərinin itməsi, nəzarətçinin sistemin real vəziyyətini vaxtında öyrənə bilməməsinə və ya yaratdığı idarəetmə əmrinin aktuatora çatmamasına səbəb ola bilər.

15/08/2026  Veri Anla 18 baxış
Stoxastik Paket İtkiləri Altında Qeyri-Xətti Sistemlərin Adaptiv Modeldən Asılı Olmayan Optimal İdarəetməsi üçün Actor–Identifier–Critic Möhkəmləndirici Öyrənməsi

Şəbəkə üzərindən işləyən idarəetmə sistemlərində ölçmə və ya idarəetmə paketlərinin itməsi, nəzarətçinin sistemin real vəziyyətini vaxtında öyrənə bilməməsinə və ya yaratdığı idarəetmə əmrinin aktuatora çatmamasına səbəb ola bilər. Bu tədqiqat sistemin qeyri-xətti dinamik funksiyaları \(f(x)\) və \(g(x)\) əvvəlcədən məlum olmadan belə bir mühitdə istinad trayektoriyasının izlənməsini həyata keçirmək məqsədilə Actor-Identifier-Critic (AIC) arxitekturasını inkişaf etdirir.

AIC quruluşunda aktor idarəetmə əmrini yaradır; identifier/tanımlayıcı naməlum sistem dinamikasını və növbəti sistem vəziyyətini proqnozlaşdırır; critic/tənqidçi isə mövcud idarəetmə siyasətinin uzunmüddətli xərcini qiymətləndirir. Identifier-in ikinci mühüm funksiyası yalnız itmiş vəziyyət məlumatını proqnozlaşdırmaq deyil: modeldən asılı olmayan quruluşda critic-dən aktora gradient ötürülməsini mümkün edən riyazi aralıq əlaqəni də yaradır.

Paket ötürülmələri Bernoulli dəyişənləri ilə modelləşdirilmiş və idarəetmə problemi paket itkisinin olduğu və olmadığı mümkün gələcək vəziyyətləri çəkili şəkildə nəzərə alan Bernoulli Hamilton–Jacobi–Bellman (BHJB) tənliyi üzərində qurulmuşdur. Aktor, identifier və critic şəbəkələrinin öyrənmə qaydaları ayrıca müəyyən edilmiş; dayanıqlıq təhlili Lyapunov üsulu ilə aparılmış və mənbədə qapalı dövrə izləmə xətasının uniform ultimate bounded (UUB) olduğu nəticəsinə gəlinmişdir.

Metod iki qeyri-xətti benchmark sistemində sınaqdan keçirilmişdir. Beş rabitə şərti altında aparılan SIMO və MIMO simulyasiyalarında hər təcrübə beş dəfə təkrarlanmış; Normalized Root Mean Square Error (NRMSE) və Pearson Correlation Coefficient (PCC) hesabat edilmişdir. Ən intensiv sınaqdan keçirilən ssenarilərdən biri olan \(\bar{\gamma}_s=0.8,\bar{\gamma}_c=0.7\) şərtində MIMO sisteminin yaxınlaşmadan sonrakı orta NRMSE dəyəri 0,0670, PCC dəyəri isə 0,9926 olaraq verilmişdir. Eyni ssenaridə SIMO sistemi üçün dəyərlər müvafiq olaraq 0,0281 və 0,9995-dir.

Üçüncü nümunədə AIC nəzarətçisi aşağı virtual ətalətli Virtual Synchronous Machine (VSM) güc sistemi modelinə tətbiq edilmişdir. Güc balanssızlığından sonra nəzarətsiz modeldə tezlik rəqslərinin artdığı görülərkən, AIC istifadə edildikdə simulyasiya tezliyi yenidən 50 Hz istinadına qaytarılmışdır. Mənbə bunu AIC yanaşmasının güc sistemlərinə mümkün tətbiq edilə bilməsinin nümunəsi kimi təqdim edir; lakin bu nəticə real elektrik şəbəkəsi və ya fiziki inverter təcrübəsi deyil.

Türkiyə baxımından bu tədqiqat sənaye rabitə şəbəkələri, uzaqdan idarə olunan enerji sistemləri, mikroşəbəkələr, inverter əsaslı istehsal və simsiz sensor–aktuator sistemlərində paket itkisinə davamlı ağıllı idarəetmə araşdırmaları üçün metodoloji dəyər daşıyır. Bununla belə, simulyasiyalarda əldə edilmiş xəta göstəricilərinin real Türkiyə elektrik şəbəkəsi, sənaye Ethernet-i, 5G/6G və ya simsiz idarəetmə sistemi üçün birbaşa keçərli olduğunu demək olmaz. Real tətbiqdə gecikmə, ardıcıl/burst paket itkisi, ölçmə səs-küyü, hesablama müddəti, aktuator məhdudiyyətləri və aparat təhlükəsizliyi ayrıca yoxlanmalıdır.

Əsas idarəetmə problemi nədir?

Tədqiqat aşağıdakı davamlı zamanlı affine qeyri-xətti sistemi nəzərdən keçirir:

\[ \dot{x}(t)=f(x(t))+g(x(t))u(t) \]

Burada \(x\) sistem vəziyyətlərini, \(u\) idarəetmə girişini, \(f(x)\) və \(g(x)\) isə nəzarətçi tərəfindən əvvəlcədən məlum olmadığı fərz edilən sistem dinamikasını təmsil edir.

Müəlliflər təhlili asanlaşdırmaq üçün sistemə diaqonal və Hurwitz xassəli \(A_cx(t)\) terminini əlavə edib çıxaraq:

\[ \dot{x}(t) = A_cx(t)+f_c(x(t))+g(x(t))u(t) \]

və:

\[ f_c(x)=f(x)-A_cx \]

formasından istifadə edirlər.

Sistem vəziyyətlərinin kiçik \(\Delta t\) addımındakı inkişafı Euler yanaşması ilə:

\[ x(t+\Delta t) \approx x(t)+\dot{x}(t)\Delta t \]

şəklində nəzərdən keçirilir.

Tədqiqatın əsas fərziyyələri hansılardır?

  • Qeyri-xətti sistem müşahidə oluna biləndir.
  • \(g(x)\) funksiyası naməlumdur, lakin sonlu yuxarı sərhədlə məhduddur.
  • \(f(x)\) və \(g(x)\) davamlı Lipschitz funksiyalarıdır.
  • İstənilən istinad trayektoriyası \(x_d(t)\) və onun törəməsi hamar və məhduddur.
  • Critic şəbəkəsində istifadə olunan bazis funksiyaları və ideal critic çəkiləri üçün məhdudluq fərziyyəsi qoyulur.

Bu fərziyyələr mühümdür; “model-free” ifadəsi sistem haqqında heç bir riyazi fərziyyə edilmədiyi anlamına gəlmir. Nəzarətçi \(f(x)\) və \(g(x)\)-in ədədi modelini bilmədən işləmək üçün hazırlanmışdır, lakin müşahidə oluna bilmə, Lipschitz davamlılığı və məhdudluq kimi struktur şərtlər təhlilin bir hissəsidir.

Paket itkiləri necə modelləşdirilir?

Sensordan nəzarətçiyə gedən kanal üçün:

\[ x_s(t)=\gamma_sx(t) \]

müəyyən edilir. Burada:

\[ \gamma_s= \begin{cases} 1,& \text{paket ulaştı}\\ 0,& \text{paket kayboldu} \end{cases} \]

Nəzarətçidən aktuatora gedən kanal üçün isə:

\[ u(t)=\gamma_cu_c(t) \]

istifadə olunur və \(\gamma_c\) eyni şəkildə Bernoulli dəyişənidir.

Mənbə:

\[ P(\gamma_s=1)=\bar{\gamma}_s,\qquad P(\gamma_c=1)=\bar{\gamma}_c \]

tərifi ilə \(\bar{\gamma}_s\) və \(\bar{\gamma}_c\)-ni paketin uğurla çatma ehtimalları kimi müəyyən edir. Buna görə, məsələn, \(\bar{\gamma}_c=0.7\) riyazi tərifə görə idarəetmə əmrlərinin %70 ehtimalla çatdığı və %30 ehtimalla itdiyi Bernoulli modeli deməkdir.

Optimal izləmə problemi necə müəyyən edilir?

İzləmə xətası:

\[ e(t)=x(t)-x_d(t) \]

kimi müəyyən edilmişdir. İdarəetmə siyasətinin məqsədi həm izləmə xətasını, həm də istifadə olunan idarəetmə enerjisini azaltmaqdır:

\[ J= \int_t^\infty \left[ e(\tau)^TQe(\tau) + \hat{u}_c(\tau)^TR\hat{u}_c(\tau) \right]d\tau \]

\(Q\) və \(R\) müsbət müəyyən çəkili matrislərdir. Buna görə öyrənmə yalnız “istinadı izlə” məqsədindən istifadə etmir; idarəetmə əmrinin böyüklüyü də optimallaşdırma xərcinin bir hissəsidir.

Actor–Identifier–Critic quruluşunda üç şəbəkə nə edir?

Tədqiqatın 3-cü səhifəsindəki Şəkil 1, AIC arxitekturasının əsas axınını göstərir. Fiziki sistem aktuator və sensor rabitə şəbəkəsi vasitəsilə RL nəzarətçisinə qoşulur. Nəzarətçi daxilində üç fərqli neyron şəbəkəsi vardır.

1. Identifier: Naməlum dinamikanı öyrənən qat

Identifier naməlum:

\[ f_c(x(t))+g(x(t))u_c(t) \]

ifadəsini neyron şəbəkəsi ilə yaxınlaşdırır:

\[ F_i(x_s,u_c) = \hat{W}_i \sigma(\hat{V}_i\bar{x}) \]

Burada:

\[ \bar{x}=[x_s,u_c] \]

və aktivasiya kimi bipolar sigmoid istifadə olunur:

\[ \sigma(x)=\frac{2}{1+e^{-x}}-1 \]

Identifier-in proqnozlaşdırdığı gələcək vəziyyət iki fərqli məqsədlə istifadə olunur: sensor paketi itdiyi zaman çatışmayan vəziyyət məlumatını tamamlamaq və critic-dən aktora doğru gradient hesabında naməlum sistem dinamikasının yerinə diferensiallana bilən aralıq model təqdim etmək.

2. Critic: İdarəetmə siyasətinin xərcini öyrənən şəbəkə

Critic naməlum dəyər funksiyasını:

\[ \hat{V}(t) = F_c(\hat{e}_s(t)) = \hat{W}_c\Psi_c(\hat{e}_s(t)) \]

şəklində yaxınlaşdırır. Critic-in öyrənmə siqnalı temporal-difference xətasına əsaslanır.

Tədqiqatın fərqləndirici cəhətlərindən biri klassik HJB ifadəsinə paket itkisi ehtimalını daxil etməklə model-free Bernoulli Hamilton–Jacobi–Bellman (BHJB) tənliyini yaratmasıdır:

\[ \hat{V}(t) = \int_t^{t+\Delta t} \left[ \hat{e}_s^TQ\hat{e}_s+ \hat{u}_c^TR\hat{u}_c \right]d\tau + \bar{\gamma}_c F_c(\hat{e}_s(t+\Delta t)) \big|_{u=\hat{u}_c} + (1-\bar{\gamma}_c) F_c(\hat{e}_s(t+\Delta t)) \big|_{u=0} \]

Beləliklə gələcək dəyər yalnız idarəetmə əmrinin aktuatora çatdığı hal üzrə deyil, əmr itdikdə yaranan hal üzrə də nəzərə alınır.

3. Actor: İdarəetmə əmrini yaradan şəbəkə

Aktorun təxmin etdiyi idarəetmə siyasəti:

\[ \hat{u}_c(t) = \hat{W}_a \sigma \left( \hat{V}_a\hat{e}_s(t) \right) \]

şəklindədir. Aktorun məqsədi Hamiltonian-ı minimumlaşdıran idarəetmə siyasətinə yaxınlaşmaqdır.

Identifier niyə klassik actor–critic quruluşuna əlavə edilir?

Model məlum olsaydı, critic-in gələcək dəyər funksiyasının idarəetmə girişinə görə törəməsini hesablamaq üçün \(g(x)\) istifadə edilə bilərdi. Lakin iş \(f(x)\) və \(g(x)\)-in məlum olmadığı halda bunu birbaşa edə bilmir.

Buna görə gradient zənciri:

\[ \frac{\partial\hat V(t+\Delta t)} {\partial\hat u_c(t)} = \frac{\partial\hat V} {\partial\hat e_s} \cdot \frac{\partial\hat e_s} {\partial F_i} \cdot \frac{\partial F_i} {\partial\hat u_c} \]

şəklində identifier üzərindən ötürülür.

Təklif edilən arxitekturda identifier buna görə yalnız “vəziyyət qiymətləndiricisi” deyil, modeldən asılı olmayan aktor təliminin gradient körpüsüdür.

Stoxastik irəli hesablama necə aparılır?

4-cü və 5-ci səhifələrdəki Şəkil 2 və Şəkil 3, identifier və critic yeniləmələrində paket itkisinin olduğu və olmadığı iki paralel gələcəyin ehtimalla çəkiləndiyini göstərir.

Identifier gələcək vəziyyəti:

\[ \hat{x}_s(t+\Delta t) = \bar{\gamma}_c \hat{x}_s(t+\Delta t)|_{u=\hat u_c} + (1-\bar{\gamma}_c) \hat{x}_s(t+\Delta t)|_{u=0} \]

şəklində proqnozlaşdırır.

Bu quruluş real zamanda eyni anda iki fiziki gələcəyin baş verdiyi demək deyil; təlim hesabında idarəetmə paketinin çatması və itməsi ehtimallarının gözlənilən təsirlərinin birlikdə nəzərə alınmasıdır.

Dayanıqlıq necə təhlil edilir?

Ümumi Lyapunov funksiyası:

\[ L=L_a+L_i+L_c \]

şəklində aktor, identifier və critic komponentlərindən qurulmuşdur.

Tədqiqatda dörd teorem vardır:

  • Teorem 1: Identifier çəkisi xətasının uyğun öyrənmə sürətində UUB olduğu əvvəlki dayanıqlıq nəticəsinə əsaslandırılır.
  • Teorem 2: Qapalı dövrənin stabil olduğu qəbul ediləndə identifier-in paket itkiləri altında sistemi məhdud xətayla qiymətləndirdiyi irəli sürülür.
  • Teorem 3: Critic çəki qiymətləndirmə xətasının \(0<\eta_c<2\) şərti altında UUB olduğu Lyapunov təhlili ilə göstərilir.
  • Teorem 4: Aktor siyasəti altında qapalı dövrə vəziyyət izləmə xətasının UUB olduğu göstərilir.

Mənbənin əldə etdiyi izləmə xəta sərhədi:

\[ \|\hat e_s(t)\| \le \sqrt{ \frac{C}{\lambda_{\min}(Q)} } \]

şəklindədir.

Bu nəticə uniform ultimate boundedness nəticəsidir. Başqa sözlə, analitik iddia bütün şərtlərdə xətanın riyazi olaraq tam sıfıra asimptotik yaxınlaşması deyil; müəyyən fərziyyələr və layihə parametrləri altında məhdud bölgə daxilində qalmasıdır.

\(\Delta t\) və öyrənmə sürəti niyə vacibdir?

Mənbə \(\Delta t\) və aktorun öyrənmə sürəti \(\eta_a\)-nın xəta yuxarı sərhədinə təsir edən layihə parametrləri olduğuna diqqət çəkir. Buna görə AIC-nin performansına yalnız şəbəkə quruluşu deyil, zaman addımı və öyrənmə parametrlərinin seçimi də təsir edir.

Tədqiqatın dəstəklədiyi nəticələr

  • AIC arxitekturası araşdırılan SIMO və MIMO simulyasiyalarında naməlum plant dinamikası ilə istinad trayektoriyasını izləmişdir.
  • Bernoulli tipli sensor və idarəetmə kanalı paket itkiləri altında izləmə xətaları simulyasiyalarda məhdud qalmışdır.
  • Identifier naməlum dinamikanın təxmini modelini təmin etməklə yanaşı critic–actor gradient bağlantısı kimi də istifadə edilmişdir.
  • Beş rabitə ssenarisinin hamısında yaxınlaşmadan sonrakı PCC dəyərləri SIMO üçün 0,9988–0,9998, MIMO üçün 0,9926–0,9965 aralığında hesabat edilmişdir.
  • VSM simulyasiyasında AIC güc balanssızlığından sonra tezliyi 50 Hz istinadına qaytarmışdır.
  • Mənbədə aktor, identifier və critic şəbəkələri üçün Lyapunov/UUB əsaslı dayanıqlıq təhlili təqdim edilmişdir.

Tədqiqatın dəstəkləmədiyi və ya sınaqdan keçirmədiyi nəticələr

  • AIC nəzarətçisinin real sənaye aparatında və ya fiziki güc şəbəkəsində eyni performansı verəcəyi göstərilməmişdir.
  • Tədqiqatda laboratoriya əsaslı hardware-in-the-loop və ya real vaxt nəzarətçi testi yoxdur.
  • Rabitə gecikməsi mövcud üsulda sınaqdan keçirilməmişdir; müəlliflər bunu gələcək tədqiqat mövzusu kimi qeyd edirlər.
  • Bernoulli modeli xaricində burst/ardıcıl paket itkisi, Markov kanal quruluşları və ya zərərli rabitə hücumları bu işin əsas sınaq əhatəsinə daxil deyil.
  • UUB dayanıqlıq nəticəsi bütün başlanğıc şərtlərində sıfır daimi xəta və ya qlobal asimptotik dayanıqlıq iddiası ilə eyni məna daşımır.
  • VSM nümunəsi real inverter və ya milli şəbəkə təcrübəsi deyil.
  • NRMSE və PCC nəticələri yalnız işdə istifadə olunan iki benchmark sistem və göstərilən hiperparametrlərlə aparılan simulyasiyalara aiddir.

Tədqiqatın Metodu və Nəticələri

SIMO benchmark sistemi

İlk sınaq iki vəziyyət dəyişəni və tək idarəetmə girişi olan qeyri-xətti SIMO sistemidir. İstinad trayektoriyası:

\[ x_d= \begin{bmatrix} \sin(t)\\ \cos(t)+\sin(t) \end{bmatrix} \]

kimi seçilmişdir.

İstifadə olunan performans xərci:

\[ V= \int_t^\infty \frac{1}{2} \left( e_1^2+ e_2^2+ 5\times10^{-4}\hat u_c^2 \right)d\tau \]

şəklindədir.

SIMO parametriAktorIdentifierCritic
Neyron sayı883
AktivasiyaSigmoidSigmoid\(\Psi_c\)
Öyrənmə sürəti\(10^2\)\(10^{-3}\)\(10^{-9}\)
Simulyasiya müddəti20 saniyə

8-ci səhifədəki Şəkil 4, iki sistem vəziyyətinin istinad siqnallarını izlədiyini, ilkin keçid rejimindən sonra izləmə xətalarının azaldığını və idarəetmə əmrinin məhdud qaldığını göstərir. Eyni şəklin alt panelində paket itkisi hadisələri zaman üzrə göstərilmişdir.

Şəkil 5-də ikiölçülü \((e_1,e_2)\) xəta trayektoriyası başlanğıc nöqtəsindən sıfır ətrafındakı kiçik bölgəyə doğru irəliləyir. Bu vizual mənbədə UUB davranışının ədədi qarşılığı kimi təqdim olunur.

AIC şəbəkələrinin öyrənmə davranışı

8-ci səhifədəki Şəkil 6, critic, actor və identifier xəta siqnalları ilə aktor gradientlərinin zaman üzrə hərəkətini göstərir. İlk keçid dövründən sonra şəbəkə xətaları və gradientlərinin məhdud bölgələrdə qaldığı görünür.

Şəkil 7, critic tərəfindən öyrənilən dəyər fəzasını təxminən kvadratik səth kimi göstərir. Şəkil 8 isə identifier tərəfindən öyrənilən \(\hat g(x)\) gradient istiqamətinin real benchmark sistemi \(g(x)\) istiqaməti ilə böyük ölçüdə eyni işarədə qaldığını göstərən yoxlamadır.

MIMO benchmark sistemi

İkinci sınaq iki vəziyyət və iki idarəetmə girişi olan nonlinear MIMO sistemidir. Sistem 30 saniyə simulyasiya edilmişdir.

MIMO parametriAktorIdentifierCritic
Neyron sayı6423
AktivasiyaSigmoidSigmoid\(\Psi_c\)
Öyrənmə sürəti10\(10^{-3}\)\(10^{-3}\)
Simulyasiya müddəti30 saniyə

9-cu səhifədəki Şəkil 9, iki vəziyyətin keçid rejimindən sonra istinadlarını izlədiyini göstərir. Paket itkiləri davam edən dövrlərdə də idarəetmə əmrləri yaradılmağa davam etmiş və izləmə xətaları məhdud bölgəyə yaxınlaşmışdır.

Beş paket itkisi ssenarisi necə yaradıldı?

Kəmiyyət təhlilində beş rabitə vəziyyəti istifadə edilmişdir:

Ssenari\(\bar{\gamma}_s\)\(\bar{\gamma}_c\)Riyazi tərifə görə vəziyyət
11,01,0Paket itkisi yoxdur
21,00,8Sensor paket itkisi yoxdur; idarəetmə kanalında %20 ehtimallı itki
30,81,0Sensor kanalında %20 ehtimallı itki; idarəetmə kanalı itkisiz
40,90,9Hər iki kanalda %10 ehtimallı itki
50,80,7Sensorda %20, idarəetmə kanalında %30 ehtimallı itki

Buradakı faizlər mənbədə müəyyən edilən \(P(\gamma=1)=\bar{\gamma}\) uğurlu ötürmə ehtimallarından törədilmişdir. Parametr cədvəllərində istifadə olunan “Dropout rate” etiketinin əksinə, riyazi tərif \(\bar{\gamma}\)-nı uğurlu ötürmə ehtimalı kimi verir.

Performans necə ölçüldü?

İki əsas meyar istifadə edilmişdir:

Normalized Root Mean Square Error (NRMSE): izlənən trayektoriya ilə istinad arasındakı normallaşdırılmış orta xəta böyüklüyünü ölçür. Daha aşağı dəyər daha yaxşı izləməni göstərir.

Pearson Correlation Coefficient (PCC): real vəziyyət trayektoriyası ilə istənilən istinad trayektoriyasının korrelyasiyasını ölçür. 1-ə yaxın dəyərlər güclü xətti uyğunluğu göstərir.

Hər simulyasiya 5 dəfə təkrarlanmış və maksimum, orta və standart yayınma dəyərləri hesabat edilmişdir.

Həmçinin iki fərqli qiymətləndirmə dövrü istifadə edilmişdir:

  • OTE — Overall Tracking Error: bütün simulyasiya müddətini əhatə edir.
  • PCTE — Post-Convergence Tracking Error: ilkin yaxınlaşma rejimindən sonrakı izləmə performansını qiymətləndirir.

SIMO sisteminin kəmiyyət nəticələri

\(\bar{\gamma}_s,\bar{\gamma}_c\)OTE orta NRMSEOTE orta PCCPCTE orta NRMSEPCTE orta PCCYerləşmə vaxtı
1,0 / 1,00,16110,97250,03890,99882,224 s
1,0 / 0,80,14580,97560,02970,99932,124 s
0,8 / 1,00,09980,98850,02070,99981,792 s
0,9 / 0,90,12390,98150,02370,99961,937 s
0,8 / 0,70,12480,97990,02810,99951,871 s

Bu nəticələrdə paket itkisi artdıqca xəta dəyərlərinin məcburi şəkildə monoton yüksəlmədiyi görünür. Məsələn, bəzi dropout ssenarilərində SIMO NRMSE itkisiz ssenaridən daha aşağı olmuşdur. Tədqiqatın nəticələri stoxastik təcrübələrə və adaptiv öyrənmə prosesinə əsaslandığı üçün tək cədvəldən “paket itkisi performansı yaxşılaşdırır” nəticəsi çıxarıla bilməz.

MIMO sisteminin kəmiyyət nəticələri

\(\bar{\gamma}_s,\bar{\gamma}_c\)OTE orta NRMSEOTE orta PCCPCTE orta NRMSEPCTE orta PCCYerləşmə vaxtı
1,0 / 1,00,11250,96250,04490,99655,796 s
1,0 / 0,80,17450,91530,05510,99436,231 s
0,8 / 1,00,17290,94040,06660,99376,424 s
0,9 / 0,90,19350,92310,05120,99465,037 s
0,8 / 0,70,23010,89790,06700,99265,278 s

MIMO sistemində paket itkiləri xüsusilə bütün simulyasiyanı əhatə edən OTE metrikasında daha aydın performans itkisi ilə əlaqəlidir. İtkisiz halda orta OTE NRMSE 0,1125 ikən \(\bar{\gamma}_s=0.8,\bar{\gamma}_c=0.7\) ssenarisində 0,2301-ə yüksəlmişdir. Bununla belə, ilkin yaxınlaşmadan sonra PCTE PCC bütün ssenarilərdə 0,99-dan yuxarı qalmışdır.

Verianla Live: MIMO sistemində paket itkiləri altında yaxınlaşmadan sonrakı izləmə xətası

Aşağıdakı dəyərlər tədqiqatın Cədvəl III-də hesabat edilmiş MIMO PCTE orta NRMSE nəticələridir. \(\bar{\gamma}_s\) və \(\bar{\gamma}_c\) mənbədə uğurlu paket ötürmə ehtimalları kimi müəyyən edilmişdir. Daha aşağı NRMSE daha aşağı izləmə xətasını göstərir.

\(\bar{\gamma}_s / \bar{\gamma}_c\)PCTE orta NRMSEMənbə
1,0 / 1,00,0449Cədvəl III
1,0 / 0,80,0551Cədvəl III
0,8 / 1,00,0666Cədvəl III
0,9 / 0,90,0512Cədvəl III
0,8 / 0,70,0670Cədvəl III
 

Verianla Live: Vizualizasiya görünən elmi məlumat cədvəlindən yaradılır. Ssenarilər müxtəlif sensor/aktuator paket uğur ehtimallarını təmsil edir; təkölçülü monoton “paket itkisi səviyyəsi” oxu kimi şərh edilməməlidir.

VSM güc sistemi nümunəsi

Son tətbiq nümunəsi inverter əsaslı istehsal payının yüksək olduğu güc sisteminin Virtual Synchronous Machine (VSM) dinamikasıdır. Klassik sinxron generatorlardakı fiziki fırlanma ətaləti inverterlərdə təbii şəkildə olmadığından, VSM idarəetməsi virtual ətalət davranışını təqlid etmək üçün istifadə olunur.

Mənbədə VSM dinamikasının müvafiq hissəsi:

\[ f(x)= \begin{bmatrix} \omega-\omega_{nom}\\ \frac{1}{H} \left[ -D_p(\omega-\omega_{nom}) -\frac{EV_c}{X_{eq}}\sin(\delta) \right] \end{bmatrix} \]

və idarəetmə giriş matrisi:

\[ g(x)= \begin{bmatrix} 0\\ 1/H \end{bmatrix} \]

kimi müəyyən edilmişdir.

İstinad tezliyi:

\[ \omega_d=\omega_{nom}=50\ \mathrm{Hz} \]

kimi müəyyən edilmişdir.

11-ci səhifədəki Şəkil 13(a), \(t=0\)-da tətbiq edilən güc balanssızlığından sonra nəzarətsiz VSM tezliyinin 50 Hz ətrafında artan rəqs göstərdiyini; Şəkil 13(b) isə AIC idarəetməsi açıldıqda tezliyin yenidən 50 Hz-ə gətirildiyini göstərir. Eyni şəklin alt panellərində idarəetmə əmri və paket itkisi hadisələri yer alır.

Tədqiqat bu nümunə üçün ayrıca NRMSE, PCC və ya real şəbəkə standartına əsaslanan tezlik keyfiyyəti metrikası hesabat etmir. Buna görə güc sistemi nəticəsi əsasən simulyasiya zaman sırasının davranışına əsaslanır.

Tədqiqatın güclü tərəfləri

Araşdırmanın güclü cəhəti paket itkisini yalnız sonradan simulyasiyaya əlavə edilmiş bozucu kimi deyil, dəyər funksiyası və öyrənmə tənliyinə birbaşa daxil etməsidir. Identifier-in həm çatışmayan məlumatın proqnozu, həm də critic–actor gradient bağlantısı kimi istifadəsi təklif edilən AIC arxitekturasının əsas struktur töhfəsini təşkil edir.

Üstəlik, metod yalnız tək nümunədə göstərilməmiş; SIMO, MIMO və güc sistemi dinamikası olmaqla üç fərqli idarəetmə kontekstində sınaqdan keçirilmişdir. SIMO və MIMO testlərində beş müxtəlif rabitə vəziyyəti və beş təkrar istifadə edilərək orta və standart yayınmaların hesabat edilməsi, qiymətləndirməni tək təsadüfi paket itkisi ardıcıllığından asılı yanaşmadan daha güclü edir.

Əsas məhdudiyyətlər

Bununla belə, tədqiqat tamamilə ədədi simulyasiyaya əsaslanır. Real şəbəkədə paket itkilərinin müstəqil Bernoulli hadisələrindən fərqli olaraq ardıcıl, korrelyasiyalı və ya yük vəziyyətindən asılı ola biləcəyi hallar sınaqdan keçirilməmişdir.

Mənbə həmçinin rabitə gecikməsini mövcud işin xaricində saxlayır və bunu gələcək tədqiqat mövzusu kimi qeyd edir. Real şəbəkəyə qoşulmuş idarəetmə sistemlərində gecikmə ilə paket itkisinin eyni anda baş verməsi mühüm olduğuna görə mövcud nəticələr birbaşa real vaxt şəbəkə etibarlılığı zəmanəti kimi qiymətləndirilməməlidir.

Nəhayət, modeldən asılı olmamaq nəzarətçi baxımından sistemin \(f(x)\) və \(g(x)\) funksiyalarının əvvəlcədən verilməməsini ifadə edir. Benchmark və VSM plant-larının davranışını yaratmaq üçün simulyasiya tərəfində təbii olaraq real sistem tənlikləri istifadə edilir. Bu fərq “tədqiqatda heç bir sistem modeli istifadə edilmədi” kimi yanlış şərhin qarşısını almaq üçün vacibdir.

Mənbə və Metod Qeydi

Tam özgün çalışma adı: Actor-Identifier-Critic Reinforcement Learning for Adaptive Model-Free Optimal Control of Nonlinear Systems with Stochastic Packet Dropouts

Müəlliflər: Kianoush Aqabakee, Kosar Behnia, Amirhossein Heydarian Ardakani, Farzaneh Abdollahi və Elham Shirazi.

Müəllif sırası: Mənbə versiyasındakı sıra olduğu kimi qorunmuşdur.

Birgə birinci müəllif/bərabər töhfə: Araşdırılan versiyada bərabər töhfə bəyanatı yoxdur.

Məsul müəllif: Mənbədə ayrıca corresponding-author işarəsi olmadığından müəyyən bir müəllif məsul müəllif kimi elan edilməyib.

Mənbədə verilmiş əlaqə məlumatları: Kianoush Aqabakee — kianoush.aqabakee@aut.ac.ir; Kosar Behnia — kosar.behnia@aut.ac.ir; Farzaneh Abdollahi — f_abdollahi@aut.ac.ir; Amirhossein Heydarian Ardakani — a.heydarian@utwente.nl; Elham Shirazi — e.shirazi@utwente.nl.

Qurumlar: Department of Electrical Engineering, Amirkabir University of Technology, Tehran, Iran; Faculty of Engineering Technology, University of Twente, Enschede, Netherlands.

Platforma: arXiv.

arXiv identifikatoru: 2605.28569.

Araşdırılan versiya: arXiv:2605.28569v2.

İlk göndəriş: 27 May 2026.

v2 reviziyası: 28 May 2026.

Kateqoriya: Systems and Control (eess.SY).

arXiv/DataCite DOI: 10.48550/arXiv.2605.28569.

Rəsmi qeyd:https://arxiv.org/abs/2605.28569

Mənbə növü və rəyçilik statusu: Araşdırılan iş arXiv tədqiqat preprintidir. Rəsmi arXiv qeydində rəyli yekun jurnal nəşri və ya journal-reference məlumatı təsdiqlənməmişdir.

Jurnal/nəşriyyat: Araşdırılan versiya üçün orijinal rəyli jurnal və ya konfrans nəşri göstərilmir. arXiv preprint platformasıdır və rəyli jurnal kimi qiymətləndirilməməlidir.

Lisenziya: arXiv perpetual non-exclusive distribution license. Bu lisenziya Creative Commons təkrar istifadə lisenziyası kimi şərh edilməməlidir.

Maliyyələşdirmə: Araşdırılan versiyada ayrıca maliyyələşdirmə bəyanatı aşkar edilməmişdir.

Maraqların toqquşması: Araşdırılan versiyada ayrıca competing-interests bəyanatı aşkar edilməmişdir.

Məlumat/kod əlçatanlığı: Araşdırılan versiyada ayrıca data availability və ya açıq kod deposu bəyanatı aşkar edilməmişdir.

CRediT töhfələri: Araşdırılan versiyada ayrıca CRediT authorship contribution statement yoxdur.

Əsas metod: Davamlı zamanlı affine qeyri-xətti sistemlər üçün Actor-Identifier-Critic möhkəmləndirici öyrənmə quruluşu; Bernoulli sensor və aktuator paket itkiləri; model-free BHJB; neural-network identifier; temporal-difference critic yeniləməsi; Hamiltonian minimumlaşdırmasına əsaslanan actor yeniləməsi və Lyapunov əsaslı UUB dayanıqlıq təhlili.

Doğrulama: İki nonlinear ədədi benchmark — SIMO və MIMO — və Virtual Synchronous Machine əsaslı güc sistemi simulyasiyası. SIMO və MIMO kəmiyyət təhlilləri beş müxtəlif paket ötürmə ssenarisində beş təkrarla qiymətləndirilmişdir.

Mənbədaxili paket ehtimalı qeydi: Metod bölməsində \(\bar{\gamma}_s\) və \(\bar{\gamma}_c\) paketlərin uğurla qəbul edilmə ehtimalı kimi müəyyən edilmişdir. Buna qarşılıq SIMO və MIMO parametr cədvəllərində eyni kəmiyyətlərin sətir başlığında “Dropout rate” ifadəsi istifadə olunur. Bu Verianla izahında riyazi tərif əsas götürülmüş və dəyərlər ötürmə uğur ehtimalı kimi şərh edilmişdir.

Mənbədaxili simvol qeydi: Əsas metod sensor kanalını \(\gamma_s\), idarəetmə kanalını \(\gamma_c\) ilə müəyyən edərkən bəzi simulyasiya cədvəl/qrafikləri \(\gamma_p\) göstərimindən istifadə edir. Mənbə bu göstərim dəyişikliyini ayrıca izah etmir; Verianla mətnində simvollar səssiz şəkildə yeni fiziki dəyişən kimi şərh edilməmişdir.

Dayanıqlıq sərhədi: Tədqiqatın Lyapunov təhlili UUB nəticəsinə əsaslanır. Bu ifadə bütün şərtlərdə qlobal asimptotik sıfır izləmə xətası zəmanəti deyil.

Eksperimental doğrulama sərhədi: Fiziki plant, hardware-in-the-loop, real rabitə şəbəkəsi, real inverter və ya elektrik şəbəkəsi sınağı yoxdur. Güc sistemi tətbiqi də ədədi VSM simulyasiyasıdır.

Gələcək iş: Müəlliflər rabitə gecikməsini şəbəkəyə bağlı idarəetmə sistemi problemi kimi gələcəkdə nəzərdən keçirməyi qeyd edirlər.

Məzmun əsası: Bu Verianla izahı araşdırılan işin problem tərifinə, tənliklərinə, Actor-Identifier-Critic quruluşuna, öyrənmə qaydalarına, Lyapunov təhlillərinə, alqoritminə, SIMO/MIMO simulyasiyalarına, Cədvəl III kəmiyyət nəticələrinə və VSM güc sistemi nümunəsinə əsaslanır. Biblioqrafik kimliyin yoxlanması xaricində xarici mənbələrdən yeni elmi nəticə əlavə edilməmişdir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy