Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Bilgisayar Bilimi / Stokastik Paket Kayıpları Altındaki Doğrusal Olmayan Sistemlerin Uyarlamalı Modelden Bağımsız Optimal Kontrolü için Aktör–Tanımlayıcı–Eleştirmen Pekiştirmeli Öğrenmesi
Bilgisayar Bilimi

Stokastik Paket Kayıpları Altındaki Doğrusal Olmayan Sistemlerin Uyarlamalı Modelden Bağımsız Optimal Kontrolü için Aktör–Tanımlayıcı–Eleştirmen Pekiştirmeli Öğrenmesi

Ağ üzerinden çalışan kontrol sistemlerinde ölçüm veya kontrol paketlerinin kaybolması, kontrolcünün sistemin gerçek durumunu zamanında öğrenememesine veya ürettiği kontrol komutunun aktüatöre ulaşmamasına neden olabilir.

15/08/2026  Veri Anla 19 görüntüleme
Stokastik Paket Kayıpları Altındaki Doğrusal Olmayan Sistemlerin Uyarlamalı Modelden Bağımsız Optimal Kontrolü için Aktör–Tanımlayıcı–Eleştirmen Pekiştirmeli Öğrenmesi

Ağ üzerinden çalışan kontrol sistemlerinde ölçüm veya kontrol paketlerinin kaybolması, kontrolcünün sistemin gerçek durumunu zamanında öğrenememesine veya ürettiği kontrol komutunun aktüatöre ulaşmamasına neden olabilir. Bu çalışma, sistemin doğrusal olmayan dinamik fonksiyonları \(f(x)\) ve \(g(x)\) önceden bilinmeden böyle bir ortamda referans yörünge takibini gerçekleştirmek amacıyla Actor-Identifier-Critic (AIC) mimarisini geliştirmektedir.

AIC yapısında aktör kontrol komutunu üretir; identifier/tanımlayıcı bilinmeyen sistem dinamiklerini ve sonraki sistem durumunu tahmin eder; critic/eleştirmen ise mevcut kontrol politikasının uzun dönem maliyetini değerlendirir. Identifier'ın ikinci önemli işlevi, yalnız kaybolan durum bilgisini tahmin etmek değildir: modelden bağımsız yapıda critic'ten aktöre gradyan aktarımının gerçekleşmesini sağlayan matematiksel ara bağlantıyı da oluşturur.

Paket iletimleri Bernoulli değişkenleriyle modellenmiş ve kontrol problemi paket kaybı bulunan ve bulunmayan olası gelecek durumları ağırlıklı olarak hesaba katan bir Bernoulli Hamilton–Jacobi–Bellman (BHJB) denklemi üzerinden kurulmuştur. Aktör, identifier ve critic ağlarının öğrenme kuralları ayrı ayrı tanımlanmış; kararlılık analizi Lyapunov yöntemiyle gerçekleştirilmiş ve kaynakta kapalı çevrim izleme hatasının uniform ultimate bounded (UUB) olduğu sonucuna ulaşılmıştır.

Yöntem iki doğrusal olmayan benchmark sisteminde sınanmıştır. Beş iletişim koşulu altında yapılan SIMO ve MIMO simülasyonlarında her deney beş kez tekrarlanmış; Normalized Root Mean Square Error (NRMSE) ve Pearson Correlation Coefficient (PCC) raporlanmıştır. En yoğun test edilen senaryolardan biri olan \(\bar{\gamma}_s=0.8,\bar{\gamma}_c=0.7\) koşulunda MIMO sisteminin yakınsama sonrası ortalama NRMSE değeri 0,0670, PCC değeri ise 0,9926 olarak verilmiştir. Aynı senaryoda SIMO sisteminde değerler sırasıyla 0,0281 ve 0,9995'tir.

Üçüncü örnekte AIC kontrolcü, düşük sanal ataletli bir Virtual Synchronous Machine (VSM) güç sistemi modeline uygulanmıştır. Güç dengesizliği sonrasında kontrolsüz modelde frekans salınımlarının büyüdüğü görülürken, AIC kullanıldığında simülasyon frekansı yeniden 50 Hz referansına taşımıştır. Kaynak bunu AIC yaklaşımının güç sistemlerine olası uygulanabilirliğinin bir örneği olarak sunmaktadır; ancak bu sonuç gerçek elektrik şebekesi veya fiziksel inverter deneyi değildir.

Türkiye açısından çalışma; endüstriyel haberleşme ağları, uzaktan kontrol edilen enerji sistemleri, mikroşebekeler, inverter tabanlı üretim ve kablosuz sensör–aktüatör sistemlerinde paket kaybına dayanıklı akıllı kontrol araştırmaları için yöntemsel değer taşımaktadır. Bununla birlikte simülasyonlarda elde edilen hata oranlarının gerçek Türk elektrik şebekesi, endüstriyel Ethernet, 5G/6G veya kablosuz kontrol sistemi için doğrudan geçerli olduğu söylenemez. Gerçek uygulamada gecikme, ardışık/burst paket kaybı, ölçüm gürültüsü, hesaplama süresi, aktüatör sınırları ve donanım güvenliği ayrıca doğrulanmalıdır.

Temel kontrol problemi nedir?

Çalışma aşağıdaki sürekli zamanlı affine doğrusal olmayan sistemi ele almaktadır:

\[ \dot{x}(t)=f(x(t))+g(x(t))u(t) \]

Burada \(x\) sistem durumlarını, \(u\) kontrol girişini, \(f(x)\) ve \(g(x)\) ise kontrolcü tarafından önceden bilinmediği varsayılan sistem dinamiklerini temsil etmektedir.

Yazarlar analizi kolaylaştırmak için sisteme diyagonal ve Hurwitz özellikli \(A_cx(t)\) terimini ekleyip çıkararak:

\[ \dot{x}(t) = A_cx(t)+f_c(x(t))+g(x(t))u(t) \]

ve:

\[ f_c(x)=f(x)-A_cx \]

biçimini kullanmaktadır.

Sistem durumlarının küçük bir \(\Delta t\) adımındaki gelişimi Euler yaklaşımıyla:

\[ x(t+\Delta t) \approx x(t)+\dot{x}(t)\Delta t \]

şeklinde ele alınmaktadır.

Çalışmanın temel varsayımları nelerdir?

  • Doğrusal olmayan sistem gözlemlenebilirdir.
  • \(g(x)\) fonksiyonu bilinmeyen ancak sonlu bir üst sınırla sınırlıdır.
  • \(f(x)\) ve \(g(x)\) sürekli Lipschitz fonksiyonlarıdır.
  • İstenen referans yörüngesi \(x_d(t)\) ve türevi düzgün ve sınırlıdır.
  • Critic ağında kullanılan baz fonksiyonları ve ideal critic ağırlıkları için sınırlılık varsayımı yapılmaktadır.

Bu varsayımlar önemlidir; “model-free” ifadesi sistem hakkında hiçbir matematiksel varsayım yapılmadığı anlamına gelmemektedir. Kontrolcü \(f(x)\) ve \(g(x)\)'in sayısal modelini bilmeden çalışacak şekilde tasarlanmıştır, ancak gözlemlenebilirlik, Lipschitz sürekliliği ve sınırlılık gibi yapısal koşullar analizin parçasıdır.

Paket kayıpları nasıl modelleniyor?

Sensörden kontrolcüye giden kanal için:

\[ x_s(t)=\gamma_sx(t) \]

tanımlanmaktadır. Burada:

\[ \gamma_s= \begin{cases} 1,& \text{paket ulaştı}\\ 0,& \text{paket kayboldu} \end{cases} \]

Kontrolcüden aktüatöre giden kanal için ise:

\[ u(t)=\gamma_cu_c(t) \]

kullanılır ve \(\gamma_c\) aynı biçimde Bernoulli değişkenidir.

Kaynak:

\[ P(\gamma_s=1)=\bar{\gamma}_s,\qquad P(\gamma_c=1)=\bar{\gamma}_c \]

tanımıyla \(\bar{\gamma}_s\) ve \(\bar{\gamma}_c\)'yi paketin başarıyla ulaştığı olasılıklar olarak tanımlamaktadır. Dolayısıyla örneğin \(\bar{\gamma}_c=0.7\), matematiksel tanıma göre kontrol komutlarının %70 olasılıkla ulaştığı ve %30 olasılıkla kaybolduğu Bernoulli modeli anlamına gelir.

Optimal takip problemi nasıl tanımlanıyor?

İzleme hatası:

\[ e(t)=x(t)-x_d(t) \]

olarak tanımlanmıştır. Kontrol politikasının amacı hem izleme hatasını hem de kullanılan kontrol enerjisini küçültmektir:

\[ J= \int_t^\infty \left[ e(\tau)^TQe(\tau) + \hat{u}_c(\tau)^TR\hat{u}_c(\tau) \right]d\tau \]

\(Q\) ve \(R\) pozitif tanımlı ağırlık matrisleridir. Bu nedenle öğrenme yalnız “referansı takip et” hedefi kullanmaz; kontrol komutunun büyüklüğü de optimizasyon maliyetinin bir parçasıdır.

Actor–Identifier–Critic yapısında üç ağ ne yapıyor?

Çalışmanın 3. sayfasındaki Şekil 1, AIC mimarisinin temel akışını göstermektedir. Fiziksel sistem, aktüatör ve sensör haberleşme ağı üzerinden RL kontrolcüye bağlanır. Kontrolcü içinde üç farklı sinir ağı bulunmaktadır.

1. Identifier: Bilinmeyen dinamiği öğrenen katman

Identifier, bilinmeyen:

\[ f_c(x(t))+g(x(t))u_c(t) \]

ifadesini bir sinir ağı ile yaklaşıklar:

\[ F_i(x_s,u_c) = \hat{W}_i \sigma(\hat{V}_i\bar{x}) \]

Burada:

\[ \bar{x}=[x_s,u_c] \]

ve aktivasyon olarak bipolar sigmoid kullanılır:

\[ \sigma(x)=\frac{2}{1+e^{-x}}-1 \]

Identifier'ın tahmin ettiği gelecek durum, iki farklı işlev için kullanılır: sensör paketi kaybolduğunda eksik durum bilgisini tamamlamak ve critic'ten aktöre doğru gradyan hesabında bilinmeyen sistem dinamiğinin yerine diferansiyellenebilir bir ara model sağlamak.

2. Critic: Kontrol politikasının maliyetini öğrenen ağ

Critic, bilinmeyen değer fonksiyonunu:

\[ \hat{V}(t) = F_c(\hat{e}_s(t)) = \hat{W}_c\Psi_c(\hat{e}_s(t)) \]

biçiminde yaklaşıklar. Critic'in öğrenme sinyali temporal-difference hatasına dayanmaktadır.

Çalışmanın ayırt edici noktalarından biri, klasik HJB ifadesine paket kaybı olasılığını dahil ederek model-free Bernoulli Hamilton–Jacobi–Bellman (BHJB) denklemini oluşturmasıdır:

\[ \hat{V}(t) = \int_t^{t+\Delta t} \left[ \hat{e}_s^TQ\hat{e}_s+ \hat{u}_c^TR\hat{u}_c \right]d\tau + \bar{\gamma}_c F_c(\hat{e}_s(t+\Delta t)) \big|_{u=\hat{u}_c} + (1-\bar{\gamma}_c) F_c(\hat{e}_s(t+\Delta t)) \big|_{u=0} \]

Böylece gelecek değer yalnız kontrol komutunun aktüatöre ulaştığı durum üzerinden değil, komutun kaybolduğu durum üzerinden de hesaba katılır.

3. Actor: Kontrol komutunu üreten ağ

Aktörün tahmin edilen kontrol politikası:

\[ \hat{u}_c(t) = \hat{W}_a \sigma \left( \hat{V}_a\hat{e}_s(t) \right) \]

biçimindedir. Aktörün amacı Hamiltonian'ı minimize eden kontrol politikasına yaklaşmaktır.

Identifier neden klasik actor–critic yapısına ekleniyor?

Model biliniyor olsaydı critic'in gelecekteki değer fonksiyonunun kontrol girdisine göre türevini hesaplamak için \(g(x)\) kullanılabilirdi. Ancak çalışma \(f(x)\) ve \(g(x)\)'in bilinmediği durumda bunu doğrudan yapamaz.

Bu nedenle gradyan zinciri:

\[ \frac{\partial\hat V(t+\Delta t)} {\partial\hat u_c(t)} = \frac{\partial\hat V} {\partial\hat e_s} \cdot \frac{\partial\hat e_s} {\partial F_i} \cdot \frac{\partial F_i} {\partial\hat u_c} \]

biçiminde identifier üzerinden geçirilir.

Çalışmanın önerdiği mimaride identifier bu nedenle yalnız “durum kestiricisi” değil, modelden bağımsız aktör eğitiminin gradyan köprüsüdür.

Stokastik ileri hesaplama nasıl yapılıyor?

4. ve 5. sayfalardaki Şekil 2 ve Şekil 3, identifier ve critic güncellemelerinde paket kaybı bulunan ve bulunmayan iki paralel geleceğin olasılıkla ağırlıklandırıldığını göstermektedir.

Identifier gelecekteki durumu:

\[ \hat{x}_s(t+\Delta t) = \bar{\gamma}_c \hat{x}_s(t+\Delta t)|_{u=\hat u_c} + (1-\bar{\gamma}_c) \hat{x}_s(t+\Delta t)|_{u=0} \]

biçiminde tahmin etmektedir.

Bu yapı gerçek zamanda aynı anda iki fiziksel geleceğin gerçekleştiği anlamına gelmez; eğitim hesabında kontrol paketinin ulaşması ve kaybolması olasılıklarının beklenen etkisinin birlikte hesaba katılmasıdır.

Kararlılık nasıl analiz ediliyor?

Toplam Lyapunov fonksiyonu:

\[ L=L_a+L_i+L_c \]

biçiminde aktör, identifier ve critic bileşenlerinden oluşturulmuştur.

Çalışmada dört teorem bulunmaktadır:

  • Teorem 1: Identifier ağırlık hatasının uygun öğrenme oranında UUB olduğu önceki kararlılık sonucuna dayandırılır.
  • Teorem 2: Kapalı çevrim stabil kabul edildiğinde identifier'ın paket kayıpları altında sistemi sınırlı hatayla tahmin ettiği ileri sürülür.
  • Teorem 3: Critic ağırlık tahmin hatasının \(0<\eta_c<2\) koşulu altında UUB olduğu Lyapunov analiziyle gösterilir.
  • Teorem 4: Aktör politikası altında kapalı çevrim durum izleme hatasının UUB olduğu gösterilir.

Kaynağın ulaştığı izleme hata sınırı:

\[ \|\hat e_s(t)\| \le \sqrt{ \frac{C}{\lambda_{\min}(Q)} } \]

biçimindedir.

Bu sonuç uniform ultimate boundedness sonucudur. Başka bir ifadeyle analitik iddia, tüm koşullarda hatanın matematiksel olarak tam sıfıra asimptotik yakınsaması değil; belirli varsayımlar ve tasarım parametreleri altında sınırlı bir bölge içinde kalmasıdır.

\(\Delta t\) ve öğrenme oranı neden önemli?

Kaynak, \(\Delta t\) ve aktör öğrenme oranı \(\eta_a\)'nın hata üst sınırını etkileyen tasarım parametreleri olduğuna dikkat çekmektedir. Bu nedenle AIC'nin performansı yalnız ağ yapısından değil, zaman adımı ve öğrenme parametrelerinin seçiminden de etkilenmektedir.

Çalışmanın desteklediği sonuçlar

  • AIC mimarisi incelenen SIMO ve MIMO simülasyonlarında bilinmeyen plant dinamiğiyle referans yörünge takibi gerçekleştirmiştir.
  • Bernoulli tipi sensör ve kontrol kanalı paket kayıpları altında izleme hataları simülasyonlarda sınırlı kalmıştır.
  • Identifier, bilinmeyen dinamiklerin yaklaşık modelini sağlarken critic–actor gradyan bağlantısı olarak da kullanılmıştır.
  • Beş iletişim senaryosunun tamamında yakınsama sonrası PCC değerleri SIMO için 0,9988–0,9998, MIMO için 0,9926–0,9965 aralığında raporlanmıştır.
  • VSM simülasyonunda AIC, güç dengesizliği sonrasında frekansı 50 Hz referansına geri taşımıştır.
  • Kaynakta aktör, identifier ve critic ağları için Lyapunov/UUB tabanlı kararlılık analizi sunulmuştur.

Çalışmanın desteklemediği veya test etmediği sonuçlar

  • AIC kontrolcünün gerçek endüstriyel donanımda veya fiziksel güç şebekesinde aynı performansı vereceği gösterilmemiştir.
  • Çalışmada laboratuvar tabanlı hardware-in-the-loop veya gerçek zamanlı kontrolcü testi bulunmamaktadır.
  • İletişim gecikmesi mevcut yöntemde test edilmemiştir; yazarlar bunu gelecek çalışma konusu olarak belirtmektedir.
  • Bernoulli modeli dışındaki burst/ardışık paket kaybı, Markov kanal yapıları veya kötü niyetli haberleşme saldırıları bu çalışmanın ana deney kapsamına dahil değildir.
  • UUB kararlılık sonucu, tüm başlangıç koşullarında sıfır kalıcı hata veya global asimptotik kararlılık iddiasıyla eş anlamlı değildir.
  • VSM örneği gerçek inverter veya ulusal şebeke deneyi değildir.
  • NRMSE ve PCC sonuçları yalnız çalışmada kullanılan iki benchmark sistem ve belirtilen hiperparametrelerle yapılan simülasyonlara aittir.

Çalışmanın Yöntemi ve Bulguları

SIMO benchmark sistemi

İlk test, iki durum değişkeni ve tek kontrol girişi bulunan doğrusal olmayan SIMO sistemidir. Referans yörünge:

\[ x_d= \begin{bmatrix} \sin(t)\\ \cos(t)+\sin(t) \end{bmatrix} \]

olarak seçilmiştir.

Kullanılan performans maliyeti:

\[ V= \int_t^\infty \frac{1}{2} \left( e_1^2+ e_2^2+ 5\times10^{-4}\hat u_c^2 \right)d\tau \]

şeklindedir.

SIMO parametresiAktörIdentifierCritic
Nöron sayısı883
AktivasyonSigmoidSigmoid\(\Psi_c\)
Öğrenme oranı\(10^2\)\(10^{-3}\)\(10^{-9}\)
Simülasyon süresi20 saniye

8. sayfadaki Şekil 4, iki sistem durumunun referans sinyallerini izlediğini, başlangıçtaki geçici rejimin ardından izleme hatalarının küçüldüğünü ve kontrol komutunun sınırlı kaldığını göstermektedir. Aynı şeklin alt panelinde paket kaybı olayları zaman içinde gösterilmiştir.

Şekil 5'te iki boyutlu \((e_1,e_2)\) hata yörüngesi başlangıç noktasından sıfır çevresindeki küçük bir bölgeye ilerlemektedir. Bu görsel, kaynakta UUB davranışının sayısal karşılığı olarak sunulmaktadır.

AIC ağlarının öğrenme davranışı

8. sayfadaki Şekil 6, critic, actor ve identifier hata sinyalleri ile aktör gradyanlarının zaman içindeki hareketini göstermektedir. İlk geçiş döneminden sonra ağ hata ve gradyanlarının sınırlı bölgelerde kaldığı görülmektedir.

Şekil 7, critic tarafından öğrenilen değer uzayını yaklaşık kuadratik bir yüzey şeklinde göstermektedir. Şekil 8 ise identifier tarafından öğrenilen \(\hat g(x)\) gradyan yönünün gerçek benchmark sistemi \(g(x)\) yönüyle büyük ölçüde aynı işarette kaldığını gösteren bir kontrol sunmaktadır.

MIMO benchmark sistemi

İkinci test iki durum ve iki kontrol girişine sahip nonlinear MIMO sistemidir. Sistem 30 saniye simüle edilmiştir.

MIMO parametresiAktörIdentifierCritic
Nöron sayısı6423
AktivasyonSigmoidSigmoid\(\Psi_c\)
Öğrenme oranı10\(10^{-3}\)\(10^{-3}\)
Simülasyon süresi30 saniye

9. sayfadaki Şekil 9, iki durumun geçici rejim sonrasında referanslarını izlediğini göstermektedir. Paket kayıplarının sürdüğü dönemlerde de kontrol komutları üretilmeye devam etmiş ve izleme hataları sınırlı bir bölgeye yakınsamıştır.

Beş paket kaybı senaryosu nasıl oluşturuldu?

Nicel analizde beş iletişim durumu kullanılmıştır:

Senaryo\(\bar{\gamma}_s\)\(\bar{\gamma}_c\)Matematiksel tanıma göre durum
11,01,0Paket kaybı yok
21,00,8Sensör paketi kaybı yok; kontrol kanalında %20 olasılıklı kayıp
30,81,0Sensör kanalında %20 olasılıklı kayıp; kontrol kanalı kayıpsız
40,90,9Her iki kanalda %10 olasılıklı kayıp
50,80,7Sensörde %20, kontrol kanalında %30 olasılıklı kayıp

Buradaki yüzdeler kaynakta tanımlanan \(P(\gamma=1)=\bar{\gamma}\) başarı olasılıklarından türetilmiştir. Parametre tablolarında kullanılan “Dropout rate” etiketinin aksine matematiksel tanım \(\bar{\gamma}\)'yı başarılı iletim olasılığı olarak vermektedir.

Performans nasıl ölçüldü?

İki temel ölçüt kullanılmıştır:

Normalized Root Mean Square Error (NRMSE): izlenen yörünge ile referans arasındaki normalize edilmiş ortalama hata büyüklüğünü ölçmektedir. Daha düşük değer daha iyi izlemeyi ifade eder.

Pearson Correlation Coefficient (PCC): gerçek durum yörüngesi ile istenen referans yörüngesinin korelasyonunu ölçmektedir. 1'e yakın değerler güçlü doğrusal uyumu göstermektedir.

Her simülasyon 5 kez tekrarlanmış ve maksimum, ortalama ile standart sapma değerleri raporlanmıştır.

Ayrıca iki farklı değerlendirme dönemi kullanılmıştır:

  • OTE — Overall Tracking Error: tüm simülasyon süresini kapsar.
  • PCTE — Post-Convergence Tracking Error: başlangıç yakınsama rejimi sonrasındaki izleme performansını değerlendirir.

SIMO sisteminin nicel sonuçları

\(\bar{\gamma}_s,\bar{\gamma}_c\)OTE ort. NRMSEOTE ort. PCCPCTE ort. NRMSEPCTE ort. PCCYerleşme zamanı
1,0 / 1,00,16110,97250,03890,99882,224 s
1,0 / 0,80,14580,97560,02970,99932,124 s
0,8 / 1,00,09980,98850,02070,99981,792 s
0,9 / 0,90,12390,98150,02370,99961,937 s
0,8 / 0,70,12480,97990,02810,99951,871 s

Bu sonuçlarda paket kaybı arttıkça hata değerlerinin zorunlu olarak monoton yükselmediği görülmektedir. Örneğin bazı dropout senaryolarında SIMO NRMSE, kayıpsız senaryodan daha düşük çıkmıştır. Çalışmanın sonuçları stokastik deneylere ve adaptif öğrenme sürecine dayandığı için tek bir tablodan “paket kaybı performansı iyileştirir” sonucu çıkarılamaz.

MIMO sisteminin nicel sonuçları

\(\bar{\gamma}_s,\bar{\gamma}_c\)OTE ort. NRMSEOTE ort. PCCPCTE ort. NRMSEPCTE ort. PCCYerleşme zamanı
1,0 / 1,00,11250,96250,04490,99655,796 s
1,0 / 0,80,17450,91530,05510,99436,231 s
0,8 / 1,00,17290,94040,06660,99376,424 s
0,9 / 0,90,19350,92310,05120,99465,037 s
0,8 / 0,70,23010,89790,06700,99265,278 s

MIMO sisteminde paket kayıpları özellikle tüm simülasyonu kapsayan OTE metriğinde daha belirgin performans kaybıyla ilişkilidir. Kayıpsız durumda ortalama OTE NRMSE 0,1125 iken \(\bar{\gamma}_s=0.8,\bar{\gamma}_c=0.7\) senaryosunda 0,2301'e yükselmiştir. Bununla birlikte başlangıç yakınsaması sonrasında PCTE PCC bütün senaryolarda 0,99'un üzerinde kalmıştır.

Verianla Live: MIMO sisteminde paket kayıpları altında yakınsama sonrası izleme hatası

Aşağıdaki değerler çalışmanın Tablo III'ünde raporlanan MIMO PCTE ortalama NRMSE sonuçlarıdır. \(\bar{\gamma}_s\) ve \(\bar{\gamma}_c\) kaynakta başarılı paket iletim olasılıkları olarak tanımlanmıştır. Daha düşük NRMSE daha düşük izleme hatasını ifade eder.

\(\bar{\gamma}_s / \bar{\gamma}_c\)PCTE ortalama NRMSEKaynak
1,0 / 1,00,0449Tablo III
1,0 / 0,80,0551Tablo III
0,8 / 1,00,0666Tablo III
0,9 / 0,90,0512Tablo III
0,8 / 0,70,0670Tablo III
 

Verianla Live: Görselleştirme görünür bilimsel veri tablosundan oluşturulur. Senaryolar farklı sensör/aktüatör paket başarı olasılıklarını temsil eder; tek boyutlu monoton bir “paket kaybı seviyesi” ekseni olarak yorumlanmamalıdır.

VSM güç sistemi örneği

Son uygulama örneği, inverter tabanlı üretim oranının yüksek olduğu bir güç sisteminin Virtual Synchronous Machine (VSM) dinamiğidir. Klasik senkron jeneratörlerdeki fiziksel dönel atalet inverterlerde doğal olarak bulunmadığı için VSM kontrolü sanal atalet davranışını taklit etmek amacıyla kullanılır.

Kaynakta VSM dinamiğinin ilgili bölümü:

\[ f(x)= \begin{bmatrix} \omega-\omega_{nom}\\ \frac{1}{H} \left[ -D_p(\omega-\omega_{nom}) -\frac{EV_c}{X_{eq}}\sin(\delta) \right] \end{bmatrix} \]

ve kontrol giriş matrisi:

\[ g(x)= \begin{bmatrix} 0\\ 1/H \end{bmatrix} \]

olarak tanımlanmıştır.

Referans frekans:

\[ \omega_d=\omega_{nom}=50\ \mathrm{Hz} \]

olarak belirlenmiştir.

11. sayfadaki Şekil 13(a), \(t=0\)'da uygulanan güç dengesizliğinden sonra kontrolsüz VSM frekansının 50 Hz çevresinde büyüyen salınım gösterdiğini; Şekil 13(b) ise AIC kontrolü açıldığında frekansın yeniden 50 Hz'e getirildiğini göstermektedir. Aynı şeklin alt panellerinde kontrol komutu ve paket kaybı olayları yer almaktadır.

Çalışma bu örnek için ayrı bir NRMSE, PCC veya gerçek şebeke standardına dayalı frekans kalite metriği raporlamamaktadır. Dolayısıyla güç sistemi sonucu esas olarak simülasyon zaman serisinin davranışına dayanmaktadır.

Çalışmanın güçlü yönleri

Araştırmanın güçlü tarafı, paket kaybını yalnız simülasyona sonradan eklenen bir bozucu olarak değil, değer fonksiyonu ve öğrenme denklemine doğrudan dahil etmesidir. Identifier'ın hem eksik bilgi tahmini hem de critic–actor gradyan bağlantısı olarak kullanılması, önerilen AIC mimarisinin temel yapısal katkısını oluşturmaktadır.

Ayrıca yöntem yalnız tek bir örnek üzerinde gösterilmemiş; SIMO, MIMO ve güç sistemi dinamiği olmak üzere üç farklı kontrol bağlamında sınanmıştır. SIMO ve MIMO testlerinde beş farklı iletişim durumu ve beş tekrar kullanılarak ortalama ile standart sapmaların raporlanması, tek bir rastgele paket kaybı dizisine bağlı değerlendirmeden daha güçlü bir nicel kontrol sağlamaktadır.

Temel sınırlılıklar

Bununla birlikte çalışma tamamen sayısal simülasyona dayanmaktadır. Gerçek ağdaki paket kayıplarının bağımsız Bernoulli olaylarından farklı olarak ardışık, korelasyonlu veya yük durumuna bağlı olabileceği durumlar test edilmemiştir.

Kaynak ayrıca haberleşme gecikmesini mevcut çalışmanın dışına bırakmakta ve bunu gelecek araştırma konusu olarak belirtmektedir. Gerçek ağ bağlantılı kontrol sistemlerinde gecikme ile paket kaybının aynı anda meydana gelmesi önemli olduğundan, mevcut sonuçların doğrudan gerçek zamanlı ağ güvenilirliği garantisi olarak değerlendirilmemesi gerekir.

Son olarak, modelden bağımsızlık kontrolcü açısından sistemin \(f(x)\) ve \(g(x)\) fonksiyonlarının önceden verilmemesini ifade etmektedir. Benchmark ve VSM plant'larının davranışını üretmek için simülasyon tarafında elbette gerçek sistem denklemleri kullanılmaktadır. Bu ayrım, “çalışmada hiçbir sistem modeli kullanılmadı” şeklindeki hatalı yorumun önüne geçmek açısından önemlidir.

Kaynak ve Yöntem Notu

Tam özgün çalışma adı: Actor-Identifier-Critic Reinforcement Learning for Adaptive Model-Free Optimal Control of Nonlinear Systems with Stochastic Packet Dropouts

Yazarlar: Kianoush Aqabakee, Kosar Behnia, Amirhossein Heydarian Ardakani, Farzaneh Abdollahi ve Elham Shirazi.

Yazar sırası: Kaynak sürümündeki sıra aynen korunmuştur.

Eş birinci yazar/eş katkı: İncelenen sürümde eş katkı beyanı bulunmamaktadır.

Sorumlu yazar: Kaynakta ayrı bir corresponding-author işareti bulunmadığından belirli bir yazar sorumlu yazar olarak ilan edilmemiştir.

Kaynakta verilen iletişim bilgileri: Kianoush Aqabakee — kianoush.aqabakee@aut.ac.ir; Kosar Behnia — kosar.behnia@aut.ac.ir; Farzaneh Abdollahi — f_abdollahi@aut.ac.ir; Amirhossein Heydarian Ardakani — a.heydarian@utwente.nl; Elham Shirazi — e.shirazi@utwente.nl.

Kurumlar: Department of Electrical Engineering, Amirkabir University of Technology, Tehran, Iran; Faculty of Engineering Technology, University of Twente, Enschede, Netherlands.

Platform: arXiv.

arXiv kimliği: 2605.28569.

İncelenen sürüm: arXiv:2605.28569v2.

İlk gönderim: 27 Mayıs 2026.

v2 revizyonu: 28 Mayıs 2026.

Kategori: Systems and Control (eess.SY).

arXiv/DataCite DOI: 10.48550/arXiv.2605.28569.

Resmî kayıt:https://arxiv.org/abs/2605.28569

Kaynak türü ve hakemlik durumu: İncelenen çalışma bir arXiv araştırma preprintidir. Resmî arXiv kaydında hakemli nihai dergi yayını veya journal-reference bilgisi doğrulanmamıştır.

Dergi/yayınevi: İncelenen sürüm için özgün hakemli dergi veya konferans yayını belirtilmemektedir. arXiv bir preprint platformudur ve hakemli dergi olarak değerlendirilmemelidir.

Lisans: arXiv perpetual non-exclusive distribution license. Bu lisans Creative Commons yeniden kullanım lisansı olarak yorumlanmamalıdır.

Finansman: İncelenen sürümde ayrı finansman beyanı tespit edilmemiştir.

Çıkar çatışması: İncelenen sürümde ayrı competing-interests beyanı tespit edilmemiştir.

Veri/kod erişilebilirliği: İncelenen sürümde ayrı data availability veya açık kod deposu beyanı tespit edilmemiştir.

CRediT katkıları: İncelenen sürümde ayrı CRediT authorship contribution statement bulunmamaktadır.

Temel yöntem: Sürekli zamanlı affine doğrusal olmayan sistemler için Actor-Identifier-Critic pekiştirmeli öğrenme yapısı; Bernoulli sensör ve aktüatör paket kayıpları; model-free BHJB; neural-network identifier; temporal-difference critic güncellemesi; Hamiltonian minimizasyonuna dayalı actor güncellemesi ve Lyapunov tabanlı UUB kararlılık analizi.

Doğrulama: İki nonlinear sayısal benchmark — SIMO ve MIMO — ile Virtual Synchronous Machine tabanlı güç sistemi simülasyonu. SIMO ve MIMO nicel analizleri beş farklı paket iletim senaryosunda beşer tekrarla değerlendirilmiştir.

Kaynak içi paket olasılığı notu: Yöntem bölümünde \(\bar{\gamma}_s\) ve \(\bar{\gamma}_c\), paketlerin başarıyla alınma olasılığı olarak tanımlanmıştır. Buna karşılık SIMO ve MIMO parametre tablolarında aynı büyüklüklerin satır başlığında “Dropout rate” ifadesi kullanılmaktadır. Bu Verianla açıklamasında matematiksel tanım esas alınmış ve değerler iletim başarı olasılığı olarak yorumlanmıştır.

Kaynak içi sembol notu: Ana yöntem sensör kanalını \(\gamma_s\), kontrol kanalını \(\gamma_c\) ile tanımlarken bazı simülasyon tabloları/grafikleri \(\gamma_p\) gösterimini kullanmaktadır. Kaynak bu gösterim değişikliğini ayrıca açıklamamaktadır; Verianla metninde semboller sessizce yeni bir fiziksel değişken olarak yorumlanmamıştır.

Kararlılık sınırı: Çalışmanın Lyapunov analizi UUB sonucuna dayanmaktadır. Bu ifade bütün koşullarda global asimptotik sıfır izleme hatası garantisi değildir.

Deneysel doğrulama sınırı: Fiziksel plant, hardware-in-the-loop, gerçek haberleşme ağı, gerçek inverter veya elektrik şebekesi testi bulunmamaktadır. Güç sistemi uygulaması da sayısal VSM simülasyonudur.

Gelecek çalışma: Yazarlar iletişim gecikmesini ağ bağlantılı kontrol sistemi problemi olarak gelecekte ele almayı belirtmektedir.

İçerik temeli: Bu Verianla açıklaması incelenen çalışmanın problem tanımı, denklemleri, Actor-Identifier-Critic yapısı, öğrenme kuralları, Lyapunov analizleri, algoritması, SIMO/MIMO simülasyonları, Tablo III nicel sonuçları ve VSM güç sistemi örneğine dayanmaktadır. Bibliyografik kimlik doğrulaması dışında dış kaynaklardan yeni bilimsel bulgu eklenmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy