
Bu çalışma, farklı iletişim gecikmelerine sahip mikroşebekelerin ortak bir enerji yönetimi politikası öğrenmesini sağlamak için bayatlık ve fiziksel güvenlik farkındalıklı asenkron federatif pekiştirmeli öğrenme çerçevesi SPA-AFRL’yi geliştirmiştir. Yöntem, gecikerek ulaşan yerel model güncellemelerinin etkisini üstel olarak azaltan bir federatif toplulaştırma mekanizmasını, yapay zekânın ürettiği eylemleri batarya ve güç sistemi sınırları içine yansıtan güvenlik operatörüyle birleştirmektedir. Los Angeles bölgesindeki altı bina türünü temsil eden simülasyonlarda SPA-AFRL daha hızlı yakınsama, yüzde 10-90 batarya doluluk sınırlarının korunması ve örnek 24 saatlik ekonomik yük dağıtımında -3,10 ABD doları net maliyet, başka bir ifadeyle 3,10 ABD doları gelir bildirmiştir. Bununla birlikte sonuçlar gerçek mikroşebeke saha deneyi değil, simülasyon çıktısıdır ve teorik yakınsama iddiası politika ağının daralma özelliği ile fiziksel sistemin giriş-durum kararlılığı gibi varsayımlara bağlıdır.
SPA-AFRL’nin temel problemi, federatif öğrenmede farklı hızlarda çalışan mikroşebekelerden gelen model güncellemelerinin aynı değerde kabul edilmesidir. Bir mikroşebekenin güncellemesi merkezi sunucuya geç ulaştığında, güncellemenin dayandığı küresel model çoktan değişmiş olabilir. Çalışma bu durumu model bayatlığı veya gecikmiş güncelleme problemi olarak ele almakta ve gecikme arttıkça güncellemenin ağırlığını azaltmaktadır.
İkinci problem fiziksel güvenliktir. Pekiştirmeli öğrenme ajanı eğitim sırasında bataryanın aşırı dolmasına, aşırı boşalmasına veya izin verilen şebeke alış-satış gücünün aşılmasına yol açabilecek bir eylem önerebilir. SPA-AFRL, önerilen eylemi doğrudan uygulamak yerine en yakın fiziksel olarak uygulanabilir eyleme izdüşürmektedir. Böylece güvenlik yalnızca ödül fonksiyonundaki cezalara bırakılmamakta, karar uygulanmadan önce matematiksel bir uygunluk kontrolünden geçirilmektedir.
Türkiye açısından çalışma; organize sanayi bölgeleri, kampüsler, hastaneler, ticari binalar ve yenilenebilir enerji içeren yerel enerji topluluklarında veri merkezileştirilmeden ortak enerji yönetimi politikası geliştirilmesi için araştırılabilecek bir yaklaşım sunmaktadır. Ancak kullanılan yük, hava durumu, tarife ve güneş üretimi koşulları Los Angeles bölgesine aittir. Türkiye’deki elektrik tarifeleri, dağıtım sistemi kuralları, batarya teknik sınırları, iklim bölgeleri ve veri haberleşme altyapısıyla yeniden modellenmeden Türkiye için ekonomik kazanç veya saha güvenliği sonucu çıkarılamaz.
Araştırmanın temel sorusu nedir?
Araştırmanın temel sorusu şudur: Farklı iletişim gecikmelerine ve yerel çalışma koşullarına sahip dağıtık mikroşebekeler, verilerini merkezi bir sunucuda toplamadan ortak bir enerji yönetimi politikası öğrenirken hem model yakınsaması hem de fiziksel cihaz güvenliği nasıl korunabilir?
Federatif pekiştirmeli öğrenmede her mikroşebeke kendi yerel verisi ve ortamıyla bir politika modeli eğitir. Merkezî sunucu ham yük, üretim veya kullanıcı verisini almak yerine model parametrelerini birleştirir. Ancak mikroşebekelerin işlem gücü, ağ bağlantısı ve yerel eğitim süresi farklı olduğunda bütün güncellemeler aynı anda gelmez. Geç gelen bir güncellemenin doğrudan küresel modele eklenmesi, güncel politikayı eski bilgi yönünde bozabilir.
Ayrıca pekiştirmeli öğrenme ajanının yüksek ödül ararken fiziksel sınırları ihlal etmesi mümkündür. Örneğin ajan, kısa vadeli maliyeti azaltmak amacıyla bataryayı izin verilen doluluk sınırının dışına çıkaran veya cihaz gücünü aşan bir eylem önerebilir. Çalışma, iletişim katmanındaki bayat model problemiyle fiziksel katmandaki güvenlik problemini aynı kapalı çevrim içinde ele almaktadır.
SPA-AFRL ne anlama gelmektedir?
SPA-AFRL, Staleness-and Physics-Aware Asynchronous Federated Reinforcement Learning ifadesinin kısaltmasıdır. Türkçe olarak “Bayatlık ve Fiziksel Güvenlik Farkındalıklı Asenkron Federatif Pekiştirmeli Öğrenme” şeklinde açıklanabilir.
Çerçeve iki temel mekanizma içerir:
- Bayatlık farkındalıklı asenkron toplulaştırma: Merkezi sunucu, geç gelen güncellemelerin küresel model üzerindeki etkisini azaltır.
- Fiziksel güvenlik izdüşümü: Yerel yapay zekâ politikasının önerdiği eylem, mikroşebekenin güvenli ve uygulanabilir eylem kümesine yansıtılır.
Federatif pekiştirmeli öğrenmenin iş akışı nasıldır?
Federatif öğrenmenin temel süreci dört adımdan oluşmaktadır:
- Merkezî sunucu güncel küresel model parametrelerini yerel mikroşebeke ajanlarına gönderir.
- Her ajan kendi özel verileri ve fiziksel ortamıyla yerel pekiştirmeli öğrenme eğitimi yapar.
- Ajanlar ham verileri değil, öğrenilen model parametresi değişimlerini merkezî sunucuya yükler.
- Sunucu gelen güncellemeleri birleştirerek yeni küresel modeli oluşturur.
SPA-AFRL’de bu süreç senkron değildir. Sunucu bütün ajanların aynı anda tamamlanmasını beklemez. Bir ajan güncellemesini gönderdiğinde, güncelleme hemen değerlendirilir ve bayatlık ağırlığına göre küresel modele eklenir.
Mikroşebekenin fiziksel yapısı nasıl modellenmiştir?
Her mikroşebeke; yerel elektrik yükü, fotovoltaik üretim sistemi, batarya enerji depolama sistemi ve ana şebeke ya da diğer mikroşebekelerle enerji alışverişi yapan bir birim olarak modellenmiştir.
Bataryanın doluluk oranı, diğer adıyla şarj durumu (state of charge, SOC), şu ilişkiyle güncellenmektedir:
\[ SOC_i(t+1)=SOC_i(t)+\left(\eta_i^{ch}P_i^{ch}(t)-\frac{P_i^{dis}(t)}{\eta_i^{dis}}\right)\frac{\Delta t}{E_i^{cap}} \]
Burada:
- SOCi(t), i numaralı mikroşebekenin mevcut batarya doluluk oranıdır.
- Pich(t), batarya şarj gücüdür.
- Pidis(t), batarya deşarj gücüdür.
- ηich ve ηidis, şarj ve deşarj verimleridir.
- Eicap, bataryanın nominal enerji kapasitesidir.
- Δt, kontrol zaman aralığıdır.
Formül, bataryaya giren kullanılabilir enerjinin doluluk oranını artırdığını, bataryadan çıkan enerjinin ise deşarj verimi dikkate alınarak doluluk oranını azalttığını ifade eder.
Elektrik güç dengesi nasıl korunmaktadır?
Mikroşebekede üretilen ve satın alınan güç, tüketilen, depolanan ve satılan güce eşit olmalıdır:
\[ P_i^{pv}(t)+P_i^{dis}(t)+P_i^{buy}(t)=P_i^{load}(t)+P_i^{ch}(t)+P_i^{sell}(t) \]
Pipv fotovoltaik üretimi, Piload yerel yükü, Pibuy satın alınan gücü ve Pisell satılan gücü göstermektedir. Bu denklem, enerji yönetimi kararlarının yalnız ekonomik değil, fiziksel arz-talep dengesi içinde verilmesini sağlar.
Şarj, deşarj, şebekeden alış ve şebekeye satış güçleri ayrıca sıfır ile cihazların tanımlanan azami güç değerleri arasında sınırlandırılmıştır:
\[ 0\leq P_i^{ch}(t)\leq P_{i,max}^{ch} \]
\[ 0\leq P_i^{dis}(t)\leq P_{i,max}^{dis} \]
\[ 0\leq P_i^{buy}(t)\leq P_{i,max}^{grid} \]
\[ 0\leq P_i^{sell}(t)\leq P_{i,max}^{grid} \]
Batarya doluluk oranı da şu sınırlar içinde tutulmaktadır:
\[ SOC_i^{min}\leq SOC_i(t)\leq SOC_i^{max} \]
Simülasyondaki güvenli SOC aralığı yüzde 10 ile yüzde 90 olarak belirlenmiştir.
Fiziksel olarak uygulanabilir eylem kümesi nedir?
Yerel ajanın karar vektörü şarj, deşarj, elektrik satın alma ve elektrik satma bileşenlerinden oluşmaktadır:
\[ a_i(t)=[P_i^{ch}(t),P_i^{dis}(t),P_i^{buy}(t),P_i^{sell}(t)]^{T} \]
Bu eylemlerden bütün güç ve cihaz sınırlarını karşılayanlar fiziksel olarak uygulanabilir küme Fi(t) içinde yer alır. Çalışma, söz konusu sınırların doğrusal eşitlik ve eşitsizliklerden oluştuğunu ve uygulanabilir kümenin kapalı, boş olmayan ve dışbükey olduğunu kabul etmektedir.
Markov karar sürecinin durumu ve eylemi nelerdir?
Her mikroşebeke ajanının durumu şu bilgileri içermektedir:
\[ s_i(t)=[SOC_i(t),P_i^{pv}(t),P_i^{load}(t),\lambda_{buy}^{grid}(t),\hat{P}_i^{pv}(t+1),\hat{P}_i^{load}(t+1)]^{T} \]
Durum vektöründe mevcut batarya doluluğu, anlık güneş üretimi, anlık yük, şebekeden elektrik satın alma fiyatı ve bir sonraki zaman penceresi için tahmin edilen güneş üretimi ile yük bilgisi yer almaktadır.
Bu yapı, ajanın yalnız mevcut koşullara tepki vermek yerine yakın gelecekteki üretim ve talep beklentisini de kararına katmasını amaçlamaktadır.
Ödül fonksiyonu neyi teşvik etmektedir?
Yerel ajanın ödülü şu şekilde tanımlanmıştır:
\[ R_i(t)=-C_{trans,i}(t)-\mu\|a_i^{ML}(t)-a_i^{*}(t)\|^{2} \]
Burada Ctrans,i enerji işlem maliyetidir. aiML, yapay zekâ politikasının ham eylemi; ai* ise fiziksel güvenlik izdüşümünden sonra uygulanabilen eylemdir.
Ödül iki hedefi birlikte gözetir:
- Enerji satın alma, satma ve depolama kararlarının toplam ekonomik maliyetini azaltmak.
- Yapay zekânın önerdiği ham eylem ile güvenli eylem arasındaki farkı küçültmek.
İkinci ceza terimi, ajanın zamanla yalnızca güvenlik operatörü tarafından düzeltilen kararlar üretmek yerine fiziksel sınırlara daha yakın eylemler öğrenmesini amaçlar.
Üç yerel operatör nasıl çalışmaktadır?
Yerel mikroşebeke ajanının karar süreci üç operatöre ayrılmıştır:
- Tahmin operatörü: Geçmiş verilerden gelecek yük ve fotovoltaik üretim tahmini üretir.
- Politika operatörü: Mevcut ve tahmin edilen durumdan ham enerji yönetimi eylemi oluşturur.
- Güvenlik izdüşüm operatörü: Ham eylemi fiziksel olarak uygulanabilir kümeye yansıtır.
Politika ağının ürettiği ham eylem:
\[ a_i^{ML}(t)=T_{\pi}(s_i(t)\mid\theta_i) \]
olarak ifade edilmiştir. θi, yerel politika ağının parametreleridir.
Güvenli eylem ise şu optimizasyonla hesaplanır:
\[ a_i^{*}(t)=T_x(a_i^{ML}(t))=\arg\min_{a\in F_i(t)}\frac{1}{2}\|a-a_i^{ML}(t)\|^{2} \]
Bu formül, yapay zekânın önerdiği eyleme Öklid uzaklığı bakımından en yakın uygulanabilir eylemi seçer. Başka bir ifadeyle güvenlik operatörü, kararı tamamen yeniden üretmek yerine yalnızca fiziksel sınırları karşılayacak kadar düzeltmeye çalışır.
Güvenlik izdüşümünün matematiksel özelliği nedir?
Kapalı ve dışbükey bir kümeye ortogonal izdüşüm, genişletmeyen bir operatördür:
\[ \|P_C(x)-P_C(y)\|\leq\|x-y\| \]
Daha güçlü biçimi olan kesin genişletmeme özelliği ise şöyledir:
\[ \langle P_C(x)-P_C(y),x-y\rangle\geq\|P_C(x)-P_C(y)\|^{2} \]
Bu özellik, izdüşümün iki farklı eylem arasındaki mesafeyi büyütmediği anlamına gelir. Çalışmanın teorik yaklaşımında bu özellik, fiziksel güvenlik katmanının siber-fiziksel geri besleme içindeki hataları büyütmemesinin dayanağıdır.
Actor-Critic öğrenmesi nasıl uygulanmıştır?
Her yerel ajan bir Actor-Critic mimarisi kullanmaktadır. Actor ağı eylemi üretirken Critic ağı durum-eylem çiftinin beklenen uzun dönem değerini tahmin eder.
Actor kaybı şu şekilde tanımlanmıştır:
\[ L_A(\theta_i)=-E[Q(s_i,a_i^{ML})]+\mu E[\|\pi(s_i\mid\theta_i)-a_i^{*}\|^{2}] \]
İlk terim beklenen getiriyi artırmaya, ikinci terim ise politikanın çıktısını güvenli eyleme yaklaştırmaya çalışır.
Critic kaybı:
\[ L_C(\phi_i)=E[(R_i+\gamma Q(s_i',a_i'\mid\phi_i')-Q(s_i,a_i^{ML}\mid\phi_i))^{2}] \]
şeklindedir. Burada γ gelecekteki ödüllerin bugünkü karar üzerindeki ağırlığını belirleyen indirim katsayısıdır. İfade, gerçekleşen ödül ve sonraki durum değerinden oluşan zamansal fark hedefiyle mevcut değer tahmini arasındaki karesel hatayı azaltır.
Asenkron güncellemelerde model bayatlığı nasıl ölçülmektedir?
Yerel ajan, eğitim başında aldığı küresel modelin zaman damgasını kaydeder. Yerel eğitim tamamlanıp güncelleme sunucuya ulaştığında, aradaki küresel model güncelleme sayısı model bayatlığı olarak değerlendirilir.
Bayatlığa bağlı ağırlık şu şekilde hesaplanır:
\[ w_i=\exp(-\lambda\tau_i) \]
τi güncellemenin bayatlık derecesi, λ ise gecikme cezalandırma katsayısıdır. Gecikme sıfıra yakın olduğunda ağırlık 1’e yaklaşır. Gecikme büyüdükçe ağırlık üstel biçimde azalır.
Bu mekanizma eski güncellemeyi tamamen yasaklamaz; yalnızca küresel modeli değiştirme gücünü azaltır.
Küresel model nasıl güncellenmektedir?
Merkezî sunucu, Krasnosel’skii-Mann yaklaşımına dayanan yuvarlanan bir güncelleme kullanır:
\[ \theta_{global}\leftarrow(1-\beta w_i)\theta_{global}+\beta w_i(\theta_{global}+\Delta\theta_i) \]
β gevşetme parametresi, wi bayatlık ağırlığı ve Δθi yerel model değişimidir. Denklem sadeleştirildiğinde güncellemenin küresel modele βwiΔθi eklediği görülür.
Yeni ve güncel bir yerel model daha büyük, gecikmiş bir model ise daha küçük değişiklik oluşturur. Sunucu diğer mikroşebekeleri beklemeden güncellemeyi gerçekleştirdiği için protokol engellemeyen asenkron bir yapıdadır.
Belgedeki bayatlık formülünde bir tutarsızlık var mıdır?
Evet. Ana metindeki 20 numaralı denklem bayatlığı tpull-tpush biçiminde göstermektedir. Bu sıra, yükleme zamanı indirme zamanından büyükse negatif bir bayatlık değeri üretebilir. Buna karşılık Algorithm 1 içinde bayatlık doğru zaman sırasıyla tpush-tpull olarak hesaplanmaktadır.
Algoritmanın işleyişi ve üstel azalma mantığı, ikinci tanımın amaçlandığını göstermektedir. Ancak çalışma metni sessizce düzeltilmemeli; iki gösterim arasındaki işaret tutarsızlığı kaynakta bulunan bir notasyon hatası olarak değerlendirilmelidir.
Mikroşebekeler arasındaki enerji fiyatı nasıl belirlenmektedir?
İç ticaret fiyatı, mikroşebekenin ana şebekeye satış fiyatı ile ana şebekeden alış fiyatı arasında tutulur:
\[ \lambda_{sell}^{grid}(t)\leq\lambda_{int}(t)\leq\lambda_{buy}^{grid}(t) \]
İç fiyat, toplam enerji açığının arz ve talep toplamına oranına göre hesaplanır:
\[ \lambda_{int}(t)=\lambda_{sell}^{grid}(t)+\frac{D(t)}{S(t)+D(t)}(\lambda_{buy}^{grid}(t)-\lambda_{sell}^{grid}(t)) \]
Talep arttığında iç ticaret fiyatı şebekeden alış fiyatına, arz fazlası arttığında ise şebekeye satış fiyatına yaklaşır. Böylece hem enerji fazlası bulunan hem de enerji açığı bulunan mikroşebekelerin iç ticarete katılması teşvik edilir.
Çalışma alış ve satış eşleştirme oranlarını şu şekilde tanımlar:
\[ r_{buy}(t)=\min\left(1,\frac{S(t)}{D(t)}\right) \]
\[ r_{sell}(t)=\min\left(1,\frac{D(t)}{S(t)}\right) \]
Bu oranlar, iç mikroşebeke ticaretiyle karşılanamayan miktarın ana şebekeden alınmasını veya ana şebekeye satılmasını belirlemektedir.
Enerji ticareti formüllerinde hangi belirsizlikler bulunmaktadır?
Çalışmada net güç şu biçimde yazılmıştır:
\[ P_{net,i}(t)=P_{load,i}(t)-P_{PV,i}(t)+a_i^{*}(t) \]
Ancak ai* daha önce dört bileşenli bir eylem vektörü olarak tanımlanırken Pnet,i skaler güç olarak kullanılmaktadır. Şarj, deşarj, alış ve satış bileşenlerinin net güce hangi işaretlerle eklendiği bu denklemde açıkça gösterilmemiştir.
Ayrıca toplam arz ve toplam talep için verilen 26 ve 27 numaralı formüller, pozitif açıklarla negatif fazlaları ayrı ayrı seçen koşullu toplamları açık biçimde içermemektedir. Bu nedenle işlem modelinin kod düzeyinde nasıl uygulandığı yalnızca yazılı denklemlerden eksiksiz olarak yeniden üretilemeyebilir.
Siber-fiziksel kararlılık nasıl ele alınmıştır?
Çalışma sistemi iki geri beslemeli alt sisteme ayırmaktadır:
- Siber katman: Küresel model, yerel politika ağları ve asenkron federatif güncellemeler.
- Fiziksel katman: Batarya, fotovoltaik sistem, yük ve enerji alışverişinden oluşan mikroşebeke dinamiği.
Siber katmandaki parametre hatası:
\[ e_{\theta}(k)=\|\theta(k)-\theta^{*}\| \]
olarak tanımlanmış ve şu eşitsizlikle sınırlandırılmıştır:
\[ e_{\theta}(k+1)\leq\gamma_c e_{\theta}(k)+\delta_c e_x(k) \]
γc siber katmanın kendi hatasını azaltma oranını, δc fiziksel katmandaki sapmaların öğrenme sistemine etkisini gösterir.
Fiziksel durum hatası için benzer biçimde:
\[ e_x(k+1)\leq\gamma_p e_x(k)+\delta_p e_{\theta}(k) \]
eşitsizliği verilmiştir. γp fiziksel sistemin kendi sapmasını azaltma yeteneğini, δp politika hatasının fiziksel sisteme aktarımını temsil eder.
İki alt sistemin birlikte kararlı kalması için önerilen küçük kazanç koşulu şöyledir:
\[ \delta_c\delta_p<(1-\gamma_c)(1-\gamma_p) \]
Bu koşul, siber ve fiziksel katmanlar arasındaki karşılıklı hata aktarımının iki katmanın kendi kendini sönümleme kapasitesinden küçük olması gerektiğini ifade eder.
Teorik yakınsama ispatı koşulsuz mudur?
Hayır. İspat, bir dizi varsayıma bağlıdır. Ek A’da politika operatörünün parametrelere göre Lipschitz katsayısının α<1 olduğu, yani daralma özelliği gösterdiği varsayılmıştır. Genel bir sinir ağının bu özelliği mimariden bağımsız olarak otomatik biçimde sağladığı söylenemez.
Ek B’de fiziksel mikroşebeke için uygun bir giriş-durum kararlılığı Lyapunov fonksiyonunun var olduğu kabul edilmiştir. Bu fonksiyonun simülasyondaki bütün mikroşebekeler için ayrı ayrı sayısal olarak doğrulandığı gösterilmemiştir.
Dolayısıyla çalışma, belirtilen daralma, giriş-durum kararlılığı ve küçük kazanç koşulları sağlandığında kapalı çevrim hata dinamiğinin kararlı olacağını göstermektedir. Bu teorik sonuç, bütün sinir ağı parametreleri ve bütün gerçek mikroşebeke koşulları için koşulsuz kararlılık garantisi olarak yorumlanmamalıdır.
Simülasyon verileri nasıl oluşturulmuştur?
Yük profilleri için ABD’deki TMY3 konumlarına ait ticari ve konut tipi saatlik bina yük profilleri kullanılmıştır. Araştırmacılar Los Angeles International Airport bölgesindeki ticari ve diğer bina profillerini seçmiştir.
Hava durumu için Los Angeles Intl AP 722950 istasyonunun tipik meteorolojik yıl verileri kullanılmıştır. Fotovoltaik paneller güneye dönük ve 30 derece eğimli kabul edilmiştir. Global yatay ışınım, doğrudan normal ışınım ve yayılı yatay ışınım değerlerinden panel düzlemi ışınımı pvlib-python ile hesaplanmış, ardından fotovoltaik güç üretimi modellenmiştir.
Bir kilovatlık standart fotovoltaik sistemin yıllık simüle edilen üretimi 1.788,22 kWh olarak bildirilmiştir. Yıllık üretim grafiği, yaz aylarında daha yüksek ve kış döneminde daha düşük günlük üretimle mevsimsel değişimi göstermektedir.
Enerji depolama bina öz tüketimini nasıl değiştirmiştir?
Orta büyüklükteki ofis binası örneğinde enerji depolama olmadan:
- Enerji öz yeterlilik oranı yüzde 43,9’dur.
- Fotovoltaik öz tüketim oranı yüzde 78,2’dir.
200 kWh enerji depolama sistemi eklendiğinde:
- Enerji öz yeterlilik oranı yüzde 50,2’ye yükselmiştir.
- Fotovoltaik öz tüketim oranı yüzde 89,5’e yükselmiştir.
Bu sonuçlar SPA-AFRL algoritmasının karşılaştırmalı başarısından önce oluşturulan fiziksel simülasyon başlangıç koşullarına aittir. Gerçek bir binada ölçülmüş depolama performansı olarak yorumlanmamalıdır.
Simülasyondaki altı mikroşebeke ajanı nelerdir?
| Ajan | Bina türü | Yük eğrisinin özelliği | PV değeri | ESS kapasitesi |
|---|---|---|---|---|
| Ajan 1 | Orta katlı apartman | Gündüz düşük, 18.00-22.00 arasında akşam zirvesi | 150 kWh olarak verilmiştir | 600 kWh |
| Ajan 2 | Orta büyüklükte ofis | 09.00-18.00 arasında tek ticari yük zirvesi, hafta sonu çok düşük | 250 kWh olarak verilmiştir | 200 kWh |
| Ajan 3 | Hastane | Günün 24 saati yüksek enerji tüketimi | 400 kWh olarak verilmiştir | 1.500 kWh |
| Ajan 4 | Depo | Düşük enerji tüketimi | 1.000 kWh olarak verilmiştir | 400 kWh |
| Ajan 5 | Süpermarket | Yüksek taban yükü | 500 kWh olarak verilmiştir | 500 kWh |
| Ajan 6 | Ortaokul | 08.00-17.00 arasında yükselen okul yükü | 800 kWh olarak verilmiştir | 1.000 kWh |
Tablodaki fotovoltaik sütunu “PV (kWh)” biçiminde verilmiştir. Bunun kurulu fotovoltaik güç, enerji kapasitesi veya ölçeklendirilmiş üretim değerlerinden hangisini temsil ettiği açıkça tanımlanmamıştır. Fotovoltaik kurulu güç normalde kW, üretilen enerji ise kWh birimiyle ifade edildiğinden kaynakta birim belirsizliği bulunmaktadır.
Elektrik tarifesi nasıl ayarlanmıştır?
Ana şebekeden elektrik alış fiyatı saat dilimine göre şu şekilde belirlenmiştir:
| Saat aralığı | Şebekeden alış fiyatı |
|---|---|
| 00.00-08.00 | 0,12 ABD doları/kWh |
| 08.00-16.00 | 0,20 ABD doları/kWh |
| 16.00-21.00 | 0,35 ABD doları/kWh |
| 21.00-24.00 | 0,20 ABD doları/kWh |
Şebekeye satış fiyatı sabit 0,08 ABD doları/kWh olarak ayarlanmıştır. Bu tarife araştırmacıların simülasyon varsayımıdır ve Los Angeles’taki belirli bir güncel ticari tarifenin eksiksiz temsil edildiği gösterilmemiştir.
İletişim gecikmeleri nasıl simüle edilmiştir?
Normal düğümlerin bayatlık değeri Poisson dağılımı ve ortalama 1 ile, yüksek gecikmeli düğümler ise Poisson dağılımı ve ortalama 10 ile modellenmiştir:
\[ \tau_i\sim Poisson(1) \]
\[ \tau_i\sim Poisson(10) \]
Bayatlık azalma katsayısı ana deneylerde λ=0,15 olarak seçilmiştir.
Yakınsama grafiği ne göstermektedir?
Kümülatif ödül-zaman grafiğinde SPA-AFRL en yüksek ve en kararlı eğriyi üretmektedir. Grafikten yaklaşık olarak SPA-AFRL’nin 60-80 dakika içinde 2.450-2.500 kümülatif ödül düzeyine ulaştığı görülmektedir.
Diğer yöntemlerin davranışları şöyledir:
- Local-RL: Başlangıçta hızlı yükselmiş, ancak yaklaşık 1.500 ödül çevresinde erken plato yapmıştır.
- Sync-FedAvg: Daha yavaş fakat düzenli yükselmiş ve 120 dakika sonunda yaklaşık 1.950 düzeyine ulaşmıştır.
- AFRL w/o wi: Yaklaşık 2.000-2.100 düzeyinde dalgalı bir seyir göstermiştir.
- SPA-AFRL: Daha hızlı yakınsamış ve yaklaşık 2.500 ile en yüksek son ödülü sağlamıştır.
Grafikten okunan değerler yaklaşık değerlerdir; tablo halinde kesin son ortalama, standart sapma veya çoklu deney güven aralığı verilmemiştir.
Batarya güvenlik sınırları korunmuş mudur?
72 saatlik keşif evresi grafiğinde güvenli SOC aralığı yüzde 10 ile yüzde 90 arasında gösterilmiştir. SPA-AFRL eğrisi güvenlik sınırlarının üzerinde ilerleyerek alt ve üst sınırları takip etmektedir.
Local-DDPG, Sync-FedAvg ve özellikle bayatlık ağırlığı bulunmayan AFRL varyantında bazı zamanlarda SOC değerleri yüzde 10’un altına veya yüzde 90’ın üzerine çıkmaktadır. Çalışma bunu, yalnızca ödül cezasına dayanan güvenliğin gecikmeli tepki vermesi ve eski model güncellemelerinin politikayı bozmasıyla açıklamaktadır.
Şekil 6’nın alt yazısı yanlışlıkla “kümülatif ödülün duvar saati zamanına göre öğrenme eğrileri” olarak yazılmıştır. Görsel gerçekte 72 saatlik batarya SOC yörüngesini ve güvenlik sınırlarını göstermektedir.
Ekonomik dağıtım sonuçları nelerdir?
15 Temmuz için orta büyüklükteki ofis ajanında karşılaştırılan net maliyetler şöyledir:
| Yöntem | 24 saatlik net maliyet | Çalışmadaki yorum |
|---|---|---|
| SPA-AFRL | -3,10 ABD doları | 3,10 ABD doları net gelir; güneş fazlasını depolayıp yüksek fiyatlı saatte kullanmıştır. |
| Sync-FedAvg | 15,12 ABD doları | Bataryayı daha erken boşalttığı için yüksek fiyatlı dönemde avantajı azalmıştır. |
| Local-RL | 15,52 ABD doları | Enerjiyi daha erken sattığı için pahalı talep döneminde şebekeye bağımlı kalmıştır. |
| AFRL w/o wi | 30,49 ABD doları | Gecikmiş güncellemelerin etkisiyle en yüksek maliyeti üretmiştir. |
SPA-AFRL, güneş üretiminin yüksek olduğu saatlerde fazla enerjiyi bataryaya yönlendirmiş ve elektrik alış fiyatının 0,35 ABD doları/kWh olduğu zirve dönemde bataryadan deşarj yapmıştır. Ancak bu tek gün, tek ajan ve simüle edilmiş tarife üzerinden elde edilen bir örnektir. Uzun dönemli ekonomik performans, batarya yaşlanması, kayıplar ve gerçek piyasa ücretleri değerlendirilmemiştir.
Bayatlık katsayısı hangi değerde en iyi sonucu vermiştir?
Bayatlık katsayısı duyarlılık grafiği, çok küçük ve çok büyük λ değerlerinin performansı düşürdüğünü göstermektedir. Eğri yaklaşık λ=0,15 çevresinde 2.500’ün üzerinde kümülatif ödülle tepe yapmaktadır.
Küçük bir λ, gecikmiş güncellemeleri yeterince cezalandırmadığı için eski parametrelerin küresel modeli bozmasına izin verir. Çok büyük bir λ ise normal haberleşme gecikmelerini bile ağır biçimde cezalandırarak bazı mikroşebeke güncellemelerini neredeyse yok sayar ve model çeşitliliğini azaltır.
Çalışmanın desteklediği sonuçlar nelerdir?
- Bayatlık ağırlığı, simülasyondaki yüksek gecikmeli düğümlerin küresel modele etkisini azaltmıştır.
- Asenkron toplulaştırma, bütün düğümleri bekleyen Sync-FedAvg yönteminden daha hızlı yakınsama göstermiştir.
- Fiziksel güvenlik izdüşümü, simüle edilen batarya SOC değerini yüzde 10-90 aralığında tutmuştur.
- SPA-AFRL, seçilen simülasyon ve tarife koşullarında karşılaştırılan yöntemlerden daha yüksek kümülatif ödül elde etmiştir.
- Örnek 24 saatlik ofis senaryosunda SPA-AFRL’nin net maliyeti -3,10 ABD doları olarak hesaplanmıştır.
- Bayatlık azalma katsayısının çok düşük veya çok yüksek seçilmesi performansı azaltmıştır.
Çalışma neyi kanıtlamamaktadır?
- SPA-AFRL gerçek bir mikroşebekede veya fiziksel batarya donanımında test edilmemiştir.
- Simülasyondaki ekonomik sonuçlar uzun dönemli ticari kârlılık kanıtı değildir.
- Ham veri paylaşılmaması tek başına eksiksiz gizlilik veya saldırılara karşı güvenlik garantisi sağlamaz.
- Model güncellemelerinden bilgi sızması, kötü niyetli istemci, model zehirleme veya haberleşme saldırıları incelenmemiştir.
- Güvenlik izdüşümü yalnızca modele tanımlanan fiziksel sınırları korur; bilinmeyen arızaları veya yanlış tanımlanmış sınırları önleyemez.
- Küçük kazanç ispatı, genel olarak bütün sinir ağı ve mikroşebeke yapılarına koşulsuz kararlılık garantisi vermez.
- Sonuçlar Türkiye elektrik sistemi, tarifeleri veya dağıtım mevzuatı için doğrulanmamıştır.
- Fotovoltaik ve yük tahmin hatalarının ekonomik performans üzerindeki ayrıntılı etkisi ayrı bir deneyle gösterilmemiştir.
Çalışmanın güçlü yönleri nelerdir?
- İletişim gecikmesi ve fiziksel güvenlik aynı siber-fiziksel çerçevede ele alınmıştır.
- Güvenlik yalnız ödül cezasına bırakılmamış, uygulanmadan önce eylem izdüşümü kullanılmıştır.
- SPA-AFRL; bağımsız öğrenme, senkron FedAvg ve bayatlık cezası bulunmayan asenkron yöntemle karşılaştırılmıştır.
- Yakınsama, fiziksel sınır, ekonomik dağıtım ve parametre duyarlılığı ayrı deneylerle incelenmiştir.
- Teorik yaklaşım operatör teorisi, giriş-durum kararlılığı ve küçük kazanç koşuluyla ilişkilendirilmiştir.
- Altı farklı bina yük profiliyle heterojen mikroşebeke yapısı oluşturulmuştur.
Çalışmanın temel sınırlılıkları nelerdir?
- Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
- Deneyler gerçek saha yerine simülasyona dayanmaktadır.
- Yazar adları ve kurum bilgileri yüklenen belgenin ilk sayfasında görünmemektedir.
- Teorik yakınsama, politika ağının daralma özelliği ve fiziksel sistemin ISS varsayımına bağlıdır.
- Bayatlığın tanımında ana denklem ile Algorithm 1 arasında işaret tutarsızlığı vardır.
- Net enerji ve toplam arz-talep denklemlerinde boyut ve işaret tanımları tam açık değildir.
- PV kapasitesi sütununun kWh birimiyle verilmesi teknik olarak belirsizlik oluşturmaktadır.
- Sonuç grafiklerinde çoklu rastgele başlangıç, güven aralığı ve istatistiksel anlamlılık değerleri verilmemiştir.
- Batarya eskimesi, çevrim maliyeti ve kapasite kaybı ekonomik modele katılmamıştır.
- Federatif öğrenmenin gizlilik saldırıları veya kötü niyetli istemcilere dayanıklılığı test edilmemiştir.
- Çalışma yalnızca belirli Los Angeles bina ve hava koşullarına göre modellenmiştir.
Çalışmanın Yöntemi ve Bulguları
Deney düzeninin teknik özeti
| Deney unsuru | Kullanılan değer veya yöntem |
|---|---|
| Mikroşebeke sayısı | 6 yerel ajan |
| Bina türleri | Apartman, ofis, hastane, depo, süpermarket ve ortaokul |
| Yük verisi | ABD TMY3 konumları için ticari ve konut tipi saatlik yük profilleri |
| Hava durumu | Los Angeles Intl AP 722950 TMY3 istasyonu |
| PV yönelimi | Güneye dönük, 30 derece eğim |
| PV hesaplama | GHI, DNI ve DHI verileriyle pvlib-python |
| Yerel öğrenme | Actor-Critic pekiştirmeli öğrenme |
| Toplulaştırma | Bayatlık ağırlıklı asenkron Krasnosel’skii-Mann güncellemesi |
| Güvenlik | Kapalı dışbükey fiziksel uygunluk kümesine izdüşüm |
| Güvenli SOC aralığı | %10-%90 |
| Normal düğüm gecikmesi | Poisson ortalaması 1 |
| Yüksek gecikmeli düğüm | Poisson ortalaması 10 |
| Bayatlık katsayısı | λ=0,15 |
Sinir ağı ve eğitim hiperparametreleri
| Parametre | Sembol | Değer |
|---|---|---|
| Actor öğrenme oranı | αθ | 1 × 10-4 |
| Critic öğrenme oranı | αφ | 3 × 10-4 |
| İndirim katsayısı | γ | 0,95 |
| Mini parti büyüklüğü | B | 256 |
| KM gevşetme parametresi | β | 0,8 |
| Yerel eğitim dönemi | E | 10 |
Karşılaştırılan yöntemler
- Local-RL: Federatif toplulaştırma olmadan bağımsız yerel pekiştirmeli öğrenme.
- Sync-FedAvg: Bütün istemcileri bekleyen geleneksel senkron federatif ortalama.
- AFRL w/o wi: Bayatlık cezası kullanmadan gelen güncellemeleri doğrudan birleştiren asenkron yöntem.
- SPA-AFRL: Bayatlık ağırlığı ve fiziksel güvenlik izdüşümü kullanan önerilen yöntem.
SPA-AFRL algoritmasının teknik akışı
- Merkezî sunucu küresel politika parametrelerini ve küresel saati başlatır.
- Her yerel ajan güncel küresel modeli indirir ve indirme zaman damgasını kaydeder.
- Tahmin operatörü gelecek PV ve yük değerlerini üretir.
- Politika operatörü ham enerji yönetimi eylemini hesaplar.
- Güvenlik operatörü ham eylemi fiziksel uygunluk kümesine yansıtır.
- Güvenli eylem mikroşebeke simülasyonunda uygulanır.
- Ödül ve sonraki durum yerel deney havuzuna kaydedilir.
- Critic ağı zamansal fark hatasıyla, Actor ağı ekonomik getiri ve güvenlik cezasıyla güncellenir.
- Yerel model değişimi ve eski küresel modelin zaman damgası sunucuya asenkron olarak gönderilir.
- Sunucu gecikmeyi hesaplar, üstel bayatlık ağırlığını uygular ve küresel modeli günceller.
Ana bulguların özeti
| Değerlendirme alanı | SPA-AFRL sonucu | Yorum sınırı |
|---|---|---|
| Yakınsama | Grafikte yaklaşık 2.500 kümülatif ödülle en yüksek sonuç | Kesin çoklu deney istatistiği verilmemiştir. |
| Fiziksel güvenlik | SOC yüzde 10-90 güvenlik sınırlarında tutulmuştur. | Simüle edilmiş batarya dinamiğidir. |
| Ekonomik dağıtım | Örnek gün için -3,10 ABD doları net maliyet | Tek gün, tek ajan ve varsayımsal tarife koşuludur. |
| Bayatlık duyarlılığı | En yüksek ödül yaklaşık λ=0,15 çevresinde | Farklı ağ ve veri koşullarında optimum değişebilir. |
| Teorik kararlılık | Küçük kazanç koşulu altında hata dinamiği kararlı | Daralma ve ISS varsayımlarına bağlı koşullu sonuçtur. |
Gerçek uygulamaya geçiş için gerekli doğrulamalar
- Gerçek mikroşebeke veya donanım döngüde test düzeneğinde doğrulama
- Batarya hücre sıcaklığı, yaşlanma ve çevrim maliyetinin modele eklenmesi
- Yanlış PV ve yük tahminlerinin güvenlik ve ekonomi üzerindeki etkisinin ölçülmesi
- Gerçek haberleşme ağında gecikme, paket kaybı ve bağlantı kopmasının denenmesi
- Kötü niyetli istemci ve model zehirleme saldırılarına karşı dayanıklılık
- Federatif güncellemelerden bilgi sızıntısına karşı gizlilik analizi
- Yerel elektrik piyasası ve dağıtım sistemi kurallarıyla uyarlama
- Uzun dönemli, çok mevsimli ve çoklu rastgele başlangıçlı deneyler
Kaynak ve Yöntem Notu
- Çalışmanın tam özgün adı: SPA-AFRL: Staleness-and Physics-Aware Asynchronous Federated Reinforcement Learning for Microgrid Energy Management
- Yazarlar: Hexiao Li, Jaafar Gaber, Salah Laghrouche
- Yazar sıralaması: Hexiao Li birinci, Jaafar Gaber ikinci, Salah Laghrouche üçüncü yazardır.
- Eş birinci yazar: Eş katkı veya eş birinci yazarlık bilgisi doğrulanamamıştır.
- Sorumlu yazar: SSRN kaydında Hexiao Li iletişim yazarıdır.
- Kurumlar: SSRN kaydında Jaafar Gaber için University of Burgundy Franche-Comté belirtilmiştir. Hexiao Li ve Salah Laghrouche’un kurumları SSRN kaydında verilmemiştir. Yüklenen sürümde yazar ve kurum satırları görünmemektedir.
- DOI:10.2139/ssrn.7192454
- Dergi: Belirli bir hakemli dergi veya kabul edilmiş yayın bilgisi doğrulanamamıştır.
- Yayın platformu: SSRN
- Belgedeki yayın açıklaması: “Preprint submitted to Elsevier”
- Yayın yılı: 2026
- SSRN tarihi: 27 Temmuz 2026
- Kaynak türü: Modelleme, teorik analiz ve simülasyon içeren preprint araştırma çalışması
- Hakemlik durumu: Bu çalışma hakem değerlendirmesinden geçmemiştir.
- Resmî kaynak bağlantısı:SSRN resmî çalışma sayfası
Bu Türkçe makale, yüklenen çalışmanın tüm metni, matematiksel modeli, Algorithm 1 akışı, şekilleri, tabloları, simülasyon grafikleri ve A-C eklerindeki teorik türetmeleri incelenerek hazırlanmıştır. Bilimsel içerik yalnızca incelenen çalışmaya dayanmaktadır. Dış kaynak kontrolü yalnızca yazar listesi, yazar sırası, iletişim yazarı, DOI, tarih ve resmî yayın platformunun bibliyografik doğrulanması amacıyla kullanılmıştır.
Bu çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; sonuçları bu sınırlılık dikkate alınarak okunmalıdır. Bulgular gerçek mikroşebeke saha uygulaması değil, Los Angeles bölgesi verileri ve araştırmacıların belirlediği teknik-ekonomik varsayımlarla oluşturulan bir simülasyondur.
Çalışmanın teorik kararlılık sonucu; politika operatörünün daralma özelliği, fiziksel mikroşebeke dinamiğinin giriş-durum kararlılığı, güvenlik izdüşümünün dışbükey uygulanabilir küme üzerinde çalışması ve küçük kazanç eşitsizliğinin sağlanması koşullarına bağlıdır. Bu varsayımların herhangi biri gerçek sistemde karşılanmazsa sunulan ispat tek başına kararlılık garantisi oluşturmaz.
Kaynakta ayrıca bayatlık zamanının işaretinde, net güç denkleminde, toplam arz-talep ifadelerinde, fotovoltaik kapasite biriminde ve Şekil 6 alt yazısında açıklık veya tutarlılık sorunları bulunmaktadır. Bu noktalar sessizce düzeltilmemiş, çalışmanın yeniden üretilebilirliğini etkileyebilecek kaynak sınırlılıkları olarak belirtilmiştir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir