Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / 5G D2D şəbəkələrində resurs bölgüsü: qismən kanal bilgisi altında iyerarxik dərin möhkəmləndirməli öyrənmə
Kompüter Elmləri

5G D2D şəbəkələrində resurs bölgüsü: qismən kanal bilgisi altında iyerarxik dərin möhkəmləndirməli öyrənmə

Bu tədqiqat 5G mobil şəbəkələrində yaxın cihazların baza stansiyasından keçmədən birbaşa rabitə qurmasını təmin edən cihazdan-cihaza kommunikasiya üçün kanal və ötürmə gücü bölgüsünü araşdırmışdır.

02/08/2026  Veri Anla 51 baxış
5G D2D şəbəkələrində resurs bölgüsü: qismən kanal bilgisi altında iyerarxik dərin möhkəmləndirməli öyrənmə

Bu tədqiqat, 5G mobil şəbəkəlarında yakın cihazların baza stansiyasına uğramadan doğrudan haberleşmesini sşəbəkəlayan cihazdan-cihaza rabitə üçün kanal və ötürmə gücü tahsisini incelemiştir. Tədqiqatçılar, tam kanal vəziyyəti bilgisinin bulunmadığı koşullarda resurs bloku seçimini Double DQN, sürekli güc kontrolünü ise əkiz tənqidçili aktor–tənqidçi yapısıyla realleştiren iki katmanlı bir hiyerarşik dərin möhkəmləndirməli öyrənmə çərçivəsi önermiştir. Simülasyonda təklif edilən üsul 108,562 Mbps toplam vəri sürətina, 0,971 Jain ədalət indeksine və 1,542 ortalama mükafate ulaşmıştır. Bununla belə sistem formulyasiyau ilə istifadəçi sayıları arasında əhəmiyyətli bir resurs bölgüsü tutarsızlığı bulunmakta; qismən kanal bilgisi modelinin parametreleri və farklı hata düzeylerine karşı dayanıklılık nəticələrı açıklanmamaktadır.

Önerilən yanaşmasın temel fikri, ayrık kanal seçimi ilə sürekli güc kontrolünü aynı büyük hərəkət uzayında çözmek yerine iki keçidlı karar katmanına ayırmaktır. Üst düzey denetleyici her D2D cütü üçün hansı mobil resurs blokunun yeniden kullanılacşəbəkəını belirler. Alt düzey denetleyici ise seçilən resurs blokunda kullanılacak ötürmə gücünü ayarlar. Ödül fonksiyonu toplam vəri sürətinı və istifadəçilar arasındaki ədaləti artırmayı, müdaxilə, güc və xidmət keyfiyyəti ihlallerini azaltmayı amaçlamaktadır.

Türkiyə baxımından qiymətləndirmə: Yaklaşım; Türkiyədə xüsusi 5G şəbəkəları, şəbəkəıllı fabriklar, yoğun IoT sistemleri, araçtan araca rabitə, kampüs şəbəkəları və fəlakət haberleşmesi üzerine çalışan tədqiqat ekipleri açısından uyarlanabilir bir mənbə yönetimi örneğidir. Ancaq real tətbiq öncesinde Türkiyədə kullanılacak frekanslar, baza stansiyası yoğunluğu, hareketlilik, bina yapısı, müdaxilə seviyesi və kanal kestirim hatalarıyla çok merkezli simulyasiyalar yapılmalıdır. Donanım döngülü deneyler, real radyo test platformları, gecikmə və enerji ölçümleri ilə farklı operator şəbəkəlarında xarici doğrulama da gereklidir. Bu tədqiqatdan Türkiyədəki canlı mobil şəbəkəlarda aynı vəri sürəti artışının elde ediləceği və ya üsulun doğrudan kullanıma hazır olduğu sonucu çıkarılamaz.

Cihazdan-cihaza rabitə nədir?

Cihazdan-cihaza rabitə, birbirine yakın iki istifadəçi cihazının vəriyi doğrudan aktarmasına olanak tanır. Böylece vərinin her vəziyyətda baza stansiyasına gidip yeniden hedef cihaza ilətilmesi gerekmez. D2D keçidları mobil istifadəçilar üçün ayrılmış radyo mənbəlarını yeniden kullanarak spektrum vərimliliğini yükseltebilir, baza stansiyasındaki trafik yükünü azaltabilir və rabitə gecikməsini düşürebilir.

Bu kazanç, D2D vəricisinin mobil istifadəçiya və ya baza stansiyasına müdaxilə oluşturabilmesi nə üçüniyle ücretsiz değildir. Aynı resurs blokunu kullanan keçidların kanalı və ötürmə gücü birlikte seçilmelidir. Aşırı güc istifadəsi bir D2D cütünin vəri sürətinı yükseltirken başka istifadəçiların sinyal kalitesini düşürebilir.

Kısmi kanal vəziyyəti bilgisi nə üçün əhəmiyyətlidir?

Kanal vəziyyət bilgisi, vərici ilə alıcı arasındaki radyo keçidsının o andaki kalitesini temsil eder. Tam kanal bilgisinin elde edilmesi; istifadəçi hareketliliği, kestirim hataları, geri bildirim gecikməsi və sinyalleşme yükü nə üçüniyle real şəbəkəlarda güctür. Kaynak tahsis sistemi bu səbəbdən real kanalın kendisi yerine gürültü və ya gecikmə içeren bir kestirimle karar vərmek zorunda kalabilir.

Tədqiqatda doğrudan D2D kanalları və müdaxilə kanalları tam değerleriyle değil, kestirilmiş değerleriyle vəziyyət uzayına aktarılmıştır. Simülasyon açıklamasında qismən kanal bilgisinin Gauss gürültüsü və zamansal korelasyon kullanılarak üretildiği belirtilmektedir. Ancaq gürültü varyansı, korelasyon katsayısı və kanal kestirim doğruluğu vərilməmişdir. Bu çatışmayanlik, deney koşullarının yeniden üretilmesini və modelin farklı qeyri-müəyyənlik düzeylerinde karşılaştırılmasını gücleştirmektedir.

Sistem modeli necə kurulmuştur?

Araştırma tək hücreli bir şəbəkə modeli kullanmıştır. Baz istasyonu, mobil istifadəçi ekipmanlarına və D2D çiftlerine hizmet vərmektedir. Her mobil istifadəçiya bir ortogonal resurs bloku ayrılmış, D2D çiftlerinin bu blokları yeniden kullanmasına izin vərilmiştir.

Tədqiqatnın 4. sayfasındaki sistem şeması beş temel keçid türünü göstərir:

  • Hücresel istifadəçidan baza stansiyasına yararlı yukarı keçid,
  • D2D vəricisinden baza stansiyasına oluşan çapraz katman müdaxiləi,
  • Hücresel istifadəçidan D2D alıcısına oluşan çapraz katman müdaxiləi,
  • D2D vəriciləri arasında oluşan eş katmanlı müdaxilə,
  • D2D vəricisi ilə kendi alıcısı arasındaki doğrudan keçid.

D2D cütü i üçün sinyal-müdaxilə-artı-gürültü oranı tədqiqatda şu biçimde modellenmiştir:

\[ \gamma_i^{D} = \frac{p_i h_{i,i}} {\sum_{j \neq i} p_j h_{j,i} + p_{c_i}^{C} h_{c_i,i} + \sigma^2} \]

Pay, D2D vəricisinden kendi alıcısına ulaşan yararlı sinyal gücünü temsil eder. Paydada diğer D2D vəricilərinden gelen eş katmanlı müdaxilə, aynı resurs blokunu kullanan mobil istifadəçinın müdaxiləi və termal səs-küy bulunmaktadır.

Hücresel istifadəçi k üçün baza stansiyasındaki SINR ise şu şekilde vərilmiştir:

\[ \gamma_k^{C} = \frac{p_k^{C} h_{k,B}} {\sum_{i:c_i=k} p_i h_{i,B}+\sigma^2} \]

D2D keçidlarının mobil kaynşəbəkəı yeniden kullanması, baza stansiyasındaki mobil sinyale müdaxilə eklemektedir. Bu nə üçünle mobil istifadəçiların SINR değerinin belirlenen asgari eşiğin üzərində tutulması bir xidmət keyfiyyəti kısıtı olarak tanımlanmıştır.

Veri sürətı necə hesaplanmıştır?

Tədqiqatçılar D2D və mobil keçidların ulaşılabilir vəri sürətlarını Shannon kapasite ifadesiyle hesaplamıştır:

\[ R_i^{D}=B\log_2(1+\gamma_i^{D}) \]

\[ R_k^{C}=B\log_2(1+\gamma_k^{C}) \]

Burada B kanal bant genişliği, R vəri sürəti və γ ilgili keçidnın SINR değeridir. Toplam D2D vəri sürəti bütün D2D çiftlerinin sürətlarının toplamıdır:

\[ R_{\mathrm{sum}}^{D}=\sum_{i=1}^{N_d}R_i^{D} \]

Kullanıcılar arasındaki ədalət necə ölçülmüşdür?

Yalnızca toplam vəri sürətinı en üst düzeye çıkarmak, iyi kanal koşullarına sahip istifadəçilara sürekli mənbə vərilip diğerlerinin geride bırakılmasına yol açabilir. Tədqiqat bu səbəbdən Jain ədalət indeksini kullanmıştır:

\[ J = \frac{\left(\sum_i R_i^{D}\right)^2} {N_d\sum_i\left(R_i^{D}\right)^2} \]

İndeks 0 ilə 1 arasında değer alır. Değerin 1’e yaklaşması D2D istifadəçilarının vəri sürətlarının daha dengeli dşəbəkəıldığını gösterir. Ancaq yüksek Jain indeksi tək başına bütün istifadəçiların yeterli hizmet aldığı anlamına gelmez; düşük ama birbirine yakın vəri sürətları da yüksek ədalət değeri üretebilir.

Kaynak tahsisi hansı optimizasyon hedefiyle tanımlanmıştır?

Tədqiqatçılar toplam vəri sürəti, ədalət və enerji vərimliliğini artıran; güc istifadəsi ilə SINR ihlallerini cezalandıran çok amaçlı bir problem tanımlamıştır:

\[ \max_{\mathbf{c},\mathbf{p}} \alpha \bar{R}+\beta J+\eta E-\Phi_P-\Phi_S \]

Bu amaç; D2D və mobil ilətim güclerinin sınırlar üçünde tutulması, her D2D cütüne resurs bloku atanması, SINR eşiklerinin korunması və ədalət indeksinin belirlenen alt sınırın üzərində tutulması koşullarıyla birlikte ele alınmıştır.

Formülasyondaki resurs bloku sorunu nədir?

Tədqiqatnın C3 kısıtı her D2D cütünin mobil mənbə kümesinden bir blok seçmesini gerektirmektedir. C4 kısıtı ise bir mobil resurs blokunu en fazla bir D2D cütünin kullanabiləceğini belirtmektedir:

\[ \sum_{i:c_i=k}1\leq 1 \]

Simülasyon tablosunda 75 mobil istifadəçi və 110 D2D cütü bulunmaktadır. Her mobil istifadəçi yalnızca bir resurs blokuna sahipse 75 blok mevcuttur. Her D2D cütü bir blok seçmek zorunda və her blok en fazla bir çift tarafından kullanılabiliyorsa 110 çiftin 75 bloğa atanması mümkün değildir.

Ağ yoğunluğu deneylerinde de 25 mobil istifadəçiya karşı 40 D2D cütü, 50’ye karşı 75, 75’e karşı 110, 100’e karşı 150 və 125’e karşı 200 çift istifadə edilmişdir. Bütün yapılandırmalarda D2D cütü sayısı resurs bloku sayısından fazladır. Modelin realte birden fazla D2D cütünin aynı bloğu kullanmasına izin vərdiği, bazı çiftleri hizmet dışında bıraktığı və ya C4 kısıtının yanlış yazıldığı açıklığa kavuşturulmamıştır.

Bundan əlavə C4 realten uygulanıyorsa aynı resurs blokunda iki D2D cütü bulunmayacşəbəkəı üçün D2D SINR denklemindeki D2D–D2D eş katmanlı müdaxilə toplamının necə ortaya çıktığı qeyri-müəyyəndir. Bu iç uyğunsuzluq, nəticələrın yorumlanmasında en əhəmiyyətli məhdudiyyətlardan biridir.

Problem nə üçün hiyerarşik olarak ayrılmıştır?

Kanal seçimi ayrık, güc kontrolü ise sürekli bir karardır. Her iki kararı tək bir düz hərəkət uzayında birleştirmek, istifadəçi sayısı arttıkça çok büyük və karmaşık bir karar problemi oluşturur. Tədqiqat bu səbəbdən görevi iki katmana ayırmıştır:

  1. Üst katman: Double DQN ilə resurs bloku və ya kanal seçimi.
  2. Alt katman: Aktör–tənqidçi şəbəkəı ilə sürekli ötürmə gücü belirleme.

6. sayfadaki mimari şema üst katmanda giriş vəziyyətunun DQN şəbəkəına aktarıldığını, her resurs bloku üçün Q değerleri üretildiğini və epsilon-açgözlü seçimle bir blok belirlendiğini göstərir. Alt katmanda aktor şəbəkəı sürekli bir güc değeri üretmekte, tənqidçi şəbəkəları ise vəziyyət–hərəkət çiftinin beklenen getirisini değerlendirmektedir.

Double DQN nə üçün istifadə edilmişdir?

Standart DQN, bir hərəkəti seçerken və aynı hərəkətin değerini hesaplarken aynı şəbəkədan yararlandığı üçün Q değerlerini olduğundan yüksek tahmin edebilir. Double DQN, hərəkət seçimini çevrim içi şəbəkəla, değer değerlendirmesini hedef şəbəkəla yaparak bu yanlılığı azaltmayı amaçlar:

\[ y=r+\gamma Q\left( s', \arg\max_{a'}Q(s',a';\theta); \theta^{-} \right) \]

Burada θ çevrim içi şəbəkəın, θ− hedef şəbəkəın parametrelerini; γ ise gelecektəki mükafatlerin şəbəkəırlığını belirleyen iskonto katsayısını ifade eder.

Güç kontrolü necə yapılmıştır?

Aktör şəbəkəı 0 ilə 1 arasında bir uy çıktısı üretmektedir. Bu çıktı güc sınırına şu eşlemeyle çevrilmişdir:

\[ p_y=(0{,}05+0{,}95u_y)P_{\max} \]

Bu eşleme təlim sırasında sıfır güc seçilmesini engeller və en düşük gücü azami gücün %5’i olarak belirler. Ancaq optimizasyon kısıtlarında gücün sıfır olmasına izin vərildiği üçün matematiksel model ilə tətbiq arasında küçük bir fark oluşmaktadır.

Alt katmanda iki tənqidçi şəbəkəı istifadə edilmişdir:

\[ y=r+\gamma\min \left(Q_1(s',a'),Q_2(s',a')\right) \]

İki Q değerinden düşük olanının kullanılması, değerlerin aşırı tahmin edilmesini azaltmayı amaçlar. Geciktirilmiş politika güncellemesi və hedef hərəkət yumuşatma gibi TD3 esintili təkniklerin kullanıldığı belirtilmiştir. Buna karşın şəbəkə katmanları, gizli boyutlar, aktivasyon fonksiyonları, hedef güncelleme katsayısı və keşif gürültüsü gibi ayrıntılar vərilməmişdir.

Merkezî təlim və dşəbəkəıtık yürütme nə məna daşıyır?

Tədqiqat merkezî təlim–dşəbəkəıtık yürütme yanaşmasını benimsemektedir. Eğitim sırasında küresel şəbəkə bilgilərine erişildiği, real yürütme sırasında ise her D2D istifadəçisının yerel gözlemine göre karar vərdiği belirtilmiştir.

D2D ajanı y üçün yerel vəziyyət; kestirilmiş doğrudan kanal kazancı, gözlenen müdaxilə, önceki güc və önceki kanalın kodlanmış gösteriminden oluşmaktadır:

\[ s_y^{\mathrm{local}}= \left[ \hat{g}_y^{(d)}, \hat{I}_y, p_y^{\mathrm{prev}}, e(c_y^{\mathrm{prev}}) \right] \]

Ancaq kaç bşəbəkəımsız ajanın bulunduğu, şəbəkə parametrelerinin istifadəçilar arasında paylaşılıp paylaşılmadığı, merkezî tənqidçiin hansı küresel bilgiyi aldığı və eşzamanlı kararların necə koordine edildiği ayrıntılı biçimde açıqlanmamışdır.

Ödül fonksiyonu neyi dengelemektedir?

Temel mükafat ifadesi toplam vəri sürətinı və ədaləti artırırken kısıt ihlallerini cezalandırmaktadır:

\[ r_t=\alpha R_{\mathrm{sum}}+\beta J-\lambda\cdot\mathrm{Penalty} \]

Ceza teriminin SINR ihlallerini, mobil istifadəçilara vərilən aşırı müdaxiləi və fazla güc istehlakıni kapsadığı belirtilmiştir. SINR ihlali üçün ayrıca şu ifade vərilmiştir:

\[ \Phi_S=\sum_{i=1}^{N_d} \max(0,\gamma_{\min}-\mathrm{SINR}_i) \]

Ödül çəki əmsalları olan α, β və λ üçün istifadə olunan ədədi değerler açıklanmamaktadır. Bu değerler vəri sürəti ilə ədalət arasında hansı tercihin yapıldığını doğrudan etkilədiğinden yeniden üretiləbilirlik açısından əhəmiyyətlidir.

Tədqiqat PPO kullanıyor mu?

Giriş bölümünde “PPO tarzı politika optimizasyonu” ifadesi bulunmaktadır. Ancaq üsul bölümünde PPO’nun olasılık oranı, kırpılmış vəkil amaç fonksiyonu və ya avantaj kestirimi tanımlanmamıştır. Açıklanan real mimari Double DQN ilə TD3 benzeri əkiz tənqidçili aktor–tənqidçi biləşimidir. Bu nə üçünle tədqiqatyı PPO tabanlı bir sistem olarak tanımlamak doğru değildir.

Deney düzeni necədır?

Simülasyonlar Python və PyTorch kullanılarak NVIDIA A100 GPU bulunan bir bilgisayarda yürütülmüştür. Kanal modeli Rayleigh sönümlənməsine dayanmakta, qismən kanal bilgisi ise zamansal korelasyonlu Gauss gürültüsüyle temsil edilmektedir.

ParametreTədqiqatda vərilən değer
Hücre yarıçapı500 metre
Hücresel istifadəçi sayısı75
D2D cütü sayısı110
Eğitim bölümü200 episode
Her bölümdeki adım40
Mini yığın ölçüsü64
Double DQN öyrənmə sürəti1 × 10−4
Aktör öyrənmə sürəti1 × 10−4
Eleştirmen öyrənmə sürəti2 × 10−4
Rastgele toxumlar0, 1 və 2
İşlemciIntel Xeon w7-2575X
Bellek128 GB
GPUNVIDIA A100, 40 GB
YazılımPyTorch 2.7.1, CUDA 12.5, cuDNN 9.3, Python 3.13.7

Karşılaştırma üsulleri klasik Q-learning, DQN və kanal kazancına göre resurs bölgüsü yapan RACG sezgisel üsuludir. Daha yakın mimariye sahip PPO, DDPG, TD3, düz hibrit aktor–tənqidçi və ya modern çok-etmenli DRL temel çizgiləri bulunmamaktadır.

Ana nəticələr nelerdir?

YöntemToplam vəri sürəti (Mbps)Jain ədalət indeksiOrtalama mükafat
Q-Learning84,9320,9691,368
DQN85,1930,9681,359
RACG84,7400,9681,347
Önerilən HDRL108,5620,9711,542

Önerilən üsul, tədqiqatdaki DQN temel çizgisine göre toplam vəri sürətinı yaklaşık %27,4, ortalama mükafatü yaklaşık %13,5 artırmıştır. Adalet indeksindeki mutlak fark yalnızca 0,003’tür. Q-learning ilə karşılaştırıldığında vəri sürəti artışı yaklaşık %27,8, RACG ilə karşılaştırıldığında yaklaşık %28,1’dir.

Bu değerler istifadə olunan simulyasiya üçünde belirgin bir toplam vəri sürəti farkı göstərir. Ancaq ədalət baxımından bütün üsuller zaten 0,968 ilə 0,971 arasındaki dar aralıkta bulunmaktadır. Buna görə HDRL’nin temel ədədi kazanımı ədalətten çok toplam vəri sürətindadır.

Yakınsama grafikleri ne göstərir?

8. sayfadaki toplam vəri sürəti grafiğinde bütün üsuller təlimin başında yaklaşık 85 Mbps düzeyindedir. HDRL eğrisi 40–60. bölümler arasında sürətla yükselerek yaklaşık 108–109 Mbps düzeyine ulaşmakta, diğer üsuller ise 85 Mbps çevresinde kalmaktadır.

Adalet grafiğinde HDRL’nin təlim sırasında geçici bir düşüş yaşadığı, ardından 0,971 çevresine toparlandığı görülmektedir. Ödül grafiğinde de yaklaşık 40. bölümden sonra belirgin bir sıçrama və 1,55 çevresinde kararlı seyir bulunmaktadır.

Grafik başlıqlarında ortalama və standart sapma gösterildiği belirtilse de standart sapmalar tablo hâlinde vərilməmişdir. Yalnızca üç təsadüfi toxum kullanılması, xüsusiyyətle yüksek değişkenlik gösteren möhkəmləndirməli öyrənmə deneylerinde sınırlı bir təkrar sayısıdır.

Ağ yoğunluğu arttığında ne olmuştur?

9. sayfadaki deneylerde mobil istifadəçi və D2D cütü sayıları sırasıyla şu yapılandırmalarda artırılmıştır:

  • 25 mobil istifadəçi və 40 D2D cütü,
  • 50 mobil istifadəçi və 75 D2D cütü,
  • 75 mobil istifadəçi və 110 D2D cütü,
  • 100 mobil istifadəçi və 150 D2D cütü,
  • 125 mobil istifadəçi və 200 D2D cütü.

Toplam vəri sürəti bütün üsullerde istifadəçi sayısıyla yükselmiş, HDRL grafikte en yüksek eğriyi üretmiştir. HDRL yaklaşık 40 Mbps’den 200 Mbps’ye yükselirken en yakın temel çizgi yoğun yapılandırmada yaklaşık 155 Mbps’ye ulaşmıştır.

Adalet eğrisinde HDRL bütün sıxlıqlarda yaklaşık 0,973–0,975 aralığında kalmaktadır. Ortalama mükafat eğrisinde HDRL yaklaşık 1,54–1,57 aralığını korurken temel çizgilərin mükafatleri sıxlıq arttıkça düşmektedir. Bununla belə resurs bloku kısıtının bu istifadəçi sayılarıyla necə uygulandığı açıklanmadığından miqyaslana bilmə sonucunun matematiksel modelle uyumu qeyri-müəyyəndir.

Öğrenme oranı nəticələrı necə etkiləmiştir?

10. sayfadaki ilk grafik grubu 10−5, 5×10−5, 10−4 və 5×10−4 öyrənmə oranlarını müqayisəktadır. Daha yüksek öyrənmə oranları toplam vəri sürəti və mükafat baxımından daha sürətli yakınsama göstərmişdir. En düşük öyrənmə sürəti daha yavaş ilərlemiş və 200 bölüm sonunda daha düşük performansta kalmıştır.

Adalet değerleri təlim sırasında dalgalanmış, bazı ayarlarda geçici düşüşler görülmüş, fakat eğrilər çoğunlukla 0,96’nın üzərində toparlanmıştır. Tədqiqat farklı öyrənmə oranlarının nəticələrını grafikle sunmakta, ancak her oran üçün son performans değerlerini və varyansları tablo hâlinde vərmemektedir.

Hangi optimallaşdırıcı daha iyi nəticə vərmiştir?

Adam, AdamW, RMSProp və SGD optimallaşdırıcıleri müqayisə edilmişdir. Adam, AdamW və RMSProp toplam vəri sürətinda SGD’den biraz daha sürətli yakınsamıştır. SGD mükafat və ədalət eğrilərinde daha yüksek dalgalanma göstərmişdir.

Grafiklere göre uyarlamalı optimallaşdırıcıler benzer son vəri sürətlarına ulaşmaktadır. Bu nə üçünle nəticə, tək bir optimallaşdırıcıün açık üstünlüğünden çok SGD’nin bu deneyde daha kararsız kaldığını göstərir.

Veri sürətı–ədalət dengesi ne göstərir?

10. sayfadaki son grafik toplam vəri sürəti ilə Jain ədalət indeksini aynı düzlemde müqayisəktadır. HDRL yaklaşık 109 Mbps və 0,972 ədalət ilə sşəbəkə üst bölgede yer alırken temel çizgilər yaklaşık 85–86 Mbps aralığında toplanmıştır.

Bu görünüm, HDRL’nin istifadə olunan deneyde toplam vəri sürətinı artırırken ədalət değerini koruduğunu göstərir. Ancaq tək noktalı özet grafik, farklı mükafat çəki əmsalları altında oluşabiləcek real Pareto eğrisini göstermemektedir. Veri sürətı və ədalət arasındaki tercihlerin daha güclü değerlendiriləbilmesi üçün farklı α və β değerleriyle deney yapılması gerekir.

Tədqiqatnın destəklediği nəticələr nelerdir?

  • Ayrık kanal seçimi ilə sürekli güc kontrolü hiyerarşik iki denetleyiciye ayrılabilir.
  • Double DQN və əkiz tənqidçili aktor–tənqidçi birleşimi, istifadə olunan simulyasiyada Q-learning, DQN və RACG’den daha yüksek toplam vəri sürəti üretmiştir.
  • Önerilən üsul, vəri sürəti artarken Jain ədalət indeksini yaklaşık aynı yüksek düzeyde tutmuştur.
  • Ağ yoğunluğu arttığında HDRL eğriləri istifadə olunan temel çizgilərin üzərində kalmıştır.
  • Öğrenme oranı və optimallaşdırıcı seçimi yakınsama sürətını və təlim kararlılığını etkiləmiştir.

Tədqiqat neyi göstermemektedir?

  • Yöntemin real bir 5G baza stansiyası və ya fiziksel D2D cihazları üzərində çalıştığını göstermemektedir.
  • Gecikme, paket itkisi, etibarlılıq, sinyalleşme yükü və ya real enerji istehlakı ölçülməmişdir.
  • Modelin farklı CSI hata büyüklüklerinde dayanıklı olduğunu sistematik biçimde göstermemektedir.
  • HDRL’nin çşəbəkədaş PPO, TD3, DDPG və ya çok-etmenli üsullerden üstün olduğunu sübut etmir.
  • Dşəbəkəıtık yürütmenin haberleşme maliyetini, karar gecikməsini və ya güvənliğini değerlendirmemektedir.
  • Türkiyədəki operator şəbəkəlarında aynı nəticələrın elde ediləceğini göstermemektedir.
  • Formülasyondaki resurs bloku tutarsızlığı çözülmeden bildirilən ölçeklenebilirliğin fiziksel olarak uygulanabilir olduğunu sübut etmir.

Tədqiqatnın Yöntemi və Bulguları

Yöntem akışının özeti

  1. Tek hücreli D2D destəkli şəbəkə ortamı oluşturulmuştur.
  2. Hücresel və D2D istifadəçiları 500 metrelik hücre üçüne təsadüfi yerleştirilmiştir.
  3. Rayleigh sönümlənməsi kullanılarak kanal kazançları üretilmiştir.
  4. Kanal kestirimlerine zamansal korelasyonlu Gauss gürültüsü eklenerek kısmi CSI oluşturulmuştur.
  5. Durum vəktörüne kestirilmiş kanallar, önceki kanal və önceki güc bilgiləri aktarılmıştır.
  6. Double DQN üst katmanı resurs blokunu seçmiştir.
  7. Aktör şəbəkəı seçilən blok üçün ötürmə gücü üretmiştir.
  8. SINR, vəri sürəti, ədalət və ceza değerleri hesaplanmıştır.
  9. Geçişler deneyim təkrarı belleğine kaydedilmiştir.
  10. Double DQN, aktor, iki tənqidçi və hedef şəbəkəlar güncellenmiştir.
  11. 200 bölüm sonunda nəticələr temel üsullerle müqayisə edilmişdir.

Yöntem ayrıntılarının tamlık değerlendirmesi

BiləşenTədqiqatda açıklanan bilgiEksik və ya qeyri-müəyyən bilgi
Kanal modeliRayleigh sönümlənməsiYol kaybı modeli, gölgeleme, taşıyıcı frekans və bant genişliği
Kısmi CSIGauss gürültüsü və zamansal korelasyonGürültü varyansı və korelasyon katsayısı
Üst denetleyiciDouble DQNAğ katmanları, keşif takvimi və hedef güncelleme sıklığı
Alt denetleyiciAktör–tənqidçi, əkiz tənqidçi, geciktirilmiş güncellemeAğ mimarisi, hərəkət gürültüsü və yumuşak güncelleme katsayısı
Deneyim təkrarıTekrar belleği istifadəsiBellek kapasitesi və önceliklendirme üsulu
ÖdülVeri sürətı, ədalət və ceza biləşenleriAğırlık katsayılarının ədədi değerleri
Güç modeliAzami gücün %5–100 aralığıAzami gücün ədədi değeri
Hizmet kalitesiAsgari SINR kısıtlarıAsgari SINR eşiklerinin değerleri
Tekrar sayısıÜç təsadüfi toxumSayısal standart sapma və güvən aralıkları
Yeniden üretiləbilirlikYazılım və aparat sürümleriKaynak kodu və simulyasiya vəri faylları

Sayısal kazanımların bşəbəkəlamı

108,562 Mbps değeri real bir sahə ölçümü değil, tanımlanan simulyasiya ortamındaki toplam D2D vəri sürətidır. Yüzde 27–28 civarındaki artış yalnızca seçilən üç temel çizgiye, aynı kanal modeline və tədqiqatda istifadə olunan mükafat ayarlarına göre geçerlidir.

Adalet indeksindeki artış ədədi olarak küçüktür. HDRL’nin 0,971 değeri DQN və RACG’nin 0,968 değerinden 0,003, Q-learning’in 0,969 değerinden 0,002 yüksektir. Bu nə üçünle “adil resurs bölgüsü korunmuştur” ifadesi destəklenirken “ədalətte büyük iyiləşme” ifadesi destəklenmemektedir.

Sonuçların güvənilirliğini artırmak üçün gereken deneyler

  • Kaynak bloğu kısıtları və istifadəçi sayılarının matematiksel olarak tutarlı hâle getirilmesi,
  • Farklı kanal kestirim hata varyansları və geri bildirim gecikməleriyle CSI dayanıklılık taraması,
  • PPO, TD3, DDPG, düz hibrit aktor–tənqidçi və çok-etmenli DRL müqayisəları,
  • Hiyerarşi, əkiz tənqidçi, ədalət mükafatü və CTDE biləşenleri üçün ablasyon deneyleri,
  • En az beş və ya on təsadüfi toxumla güvən aralıkları və istatistiksel müqayisəlar,
  • Gecikme, enerji istehlakı, paket itkisi, QoS ihlal oranı və hesablama süresi ölçümleri,
  • Farklı hücre yarıçapları, hareketlilik sürətları və kanal modelleriyle dış simulyasiya doğrulaması,
  • Kaynak kodunun, yapılandırma fayllarının və təsadüfi toxumların yayımlanması,
  • Yazılım tanımlı radyo və ya aparat döngülü test platformunda doğrulama.

Kaynak və Yöntem Notu

Tədqiqatnın tam özgün adı: Hierarchical Deep Reinforcement Learning for Scalable Resource Allocation in D2D Communication under Partial Channel State Information in 5G Networks

Yazarlar: Rohit Singh Thakur və Pavan Kumar Mishra

Yazar sıralaması: Rohit Singh Thakur, Pavan Kumar Mishra

Eş katkı bilgisi: Tədqiqatda eşit katkı və ya eş birinci müəlliflık beyanı bulunmamaktadır.

Sorumlu müəllif: Rohit Singh Thakur. Görünür tədqiqatda yıldız işaretiyle, SSRN kaydında “Contact Author” olarak gösterilmiştir.

Kurum: Department of Information Technology, National Institute of Technology Raipur, India

DOI:10.2139/ssrn.6990038

Dergi: Tədqiqat bir dergide yayımlanmamıştır.

Özgün dergi nəşrevi: Bulunmamaktadır.

Yayın platformu: SSRN

Yüklenme tarihi: 24 Haziran 2026

Yayın yılı: 2026

Kaynak türü: Simülasyon temelli deneysel kablosuz haberleşme və dərin möhkəmləndirməli öyrənmə preprinti

Hakemlik vəziyyətu: Tədqiqat resenziyadan keçməmişdir. Sayfaların altında da “Preprint not peer reviewed” uyarısı bulunmaktadır.

Resmî keçid:SSRN tədqiqat sayfası

SSRN kayıt sayfasında ilk müəllifın adı “Rohit Singh Singh Thakur” biçiminde yinelenmiştir. Görünür tədqiqat kapşəbəkəında və e-posta satırında “Rohit Singh Thakur” adı kullanılmaktadır. Bu məqaləde görünür tədqiqatdaki ad esas alınmıştır.

Bu Türkçe makale, yüklenen 12 sayfalık tədqiqatnın metni, denklemleri, tabloları, alqoritmsı və 11 şekli incelenerek hazırlanmıştır. Bilimsel nəticələr yalnızca tədqiqatda bildirilən simulyasiyalara dayanmaktadır. Dış mənbəlar başlıq, müəllif, qurum, DOI, platform, tarih və hakemlik vəziyyətunun bibliyografik doğrulanması amacıyla istifadə edilmişdir.

Tədqiqatnın nəticələrı; resurs bloku kısıtları ilə istifadəçi sayıları arasındaki uyumsuzluk, kısmi CSI parametrelerinin çatışmayanliği, sınırlı temel çizgilər, üç təsadüfi toxum, yayımlanmamış mənbə kodu və sahə doğrulamasının bulunmaması diqqəte alınarak okunmalıdır. Bu tədqiqat real bir 5G şebekesinde operasyonel başarı və ya ticari kullanıma hazır bir çözüm sübut etmir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy