Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Компьютер илими / 5G D2D тармактарында ресурс бөлүштүрүү: жарым-жартылай канал маалыматы шартында иерархиялык терең бекемдөөлүү үйрөнүү
Компьютер илими

5G D2D тармактарында ресурс бөлүштүрүү: жарым-жартылай канал маалыматы шартында иерархиялык терең бекемдөөлүү үйрөнүү

Бул изилдөө 5G уюлдук тармактарында жакын түзмөктөрдүн базалык станцияга барбай түз байланыш түзүшүн камсыз кылган түзмөктөн-түзмөккө байланыш үчүн канал жана берүү кубатын бөлүштүрүүнү караган.

02/08/2026  Veri Anla 50 көрүү
5G D2D тармактарында ресурс бөлүштүрүү: жарым-жартылай канал маалыматы шартында иерархиялык терең бекемдөөлүү үйрөнүү

Бул изилдөө, 5G уюлдук тармакlarında yakın cihazların базалык станцияna uğramadan doğrudan haberleşmesini sтармакlayan түзмөктөн-түзмөккө байланыш үчүн канал жана берүү кубаты tahsisini incelemiştir. Изилдөөчүлөр, tam канал абалы маалыматыnin bulunmadığı koşullarda ресурс блогу seçimini Double DQN, sürekli кубат kontrolünü ise эгиз сынчыli актор–сынчы yapısıyla чыныгыleştiren iki katmanlı bir hiyerarşik терең бекемдөөлүү үйрөнүү алкакsi önermiştir. Simülasyonda сунушталган ыкма 108,562 Mbps toplam маалымат ылдамдыгыna, 0,971 Jain адилеттүүлүк индексиne жана 1,542 ortalama сыйлыкe ulaşmıştır. Муну менен бирге sistem формулировкаu менен колдонуучу sayıları арасында маанилүү bir ресурс бөлүштүрүү tutarsızlığı bulunmakta; жарым-жартылай канал маалыматы modelinin parametreleri жана farklı hata düzeylerine karşı dayanıklılık натыйжаларı açıklanmamaktadır.

Önerмененn мамилесиn temel fikri, ayrık канал seçimi менен sürekli кубат kontrolünü aynı büyük аракет uzayında çözmek yerine iki шилтемеlı karar katmanına ayırmaktır. Üst düzey denetleyici her D2D жуп үчүн кайсы уюлдук ресурс блогуnun yeniden kullanılacтармакını belirler. Alt düzey denetleyici ise seçмененn ресурс блогуnda kullanılacak берүү кубатыnü ayarlar. Ödül fonksiyonu toplam маалымат ылдамдыгыnı жана колдонуучуlar арасындаki адилеттүүлүкi artırmayı, тоскоолдук, кубат жана кызмат сапаты ihlallerini azaltmayı amaçlamaktadır.

Түркия жагынан баалоо: Yaklaşım; Түркияда өзгөчө 5G тармакları, акылдуу фабрикаlar, yoğun IoT sistemleri, araçtan araca байланыш, kampüs тармакları жана кырсык haberleşmesi üzerine çalışan изилдөө ekipleri açısından uyarlanabilir bir булак yönetimi örneğidir. Бирок чыныгы колдонмо öncesinde Түркияда kullanılacak frekanslar, базалык станция yoğunluğu, hareketlilik, bina yapısı, тоскоолдук seviyesi жана канал kestirim hatalarıyla çok merkezli симуляцияlar yapılmalıdır. Donanım döngülü deneyler, чыныгы radyo тест platformları, кечигүү жана энергия ölçümleri менен farklı оператор тармакlarında тышкы валидация da gereklidir. Бул изилдөөdan Түркиядаki canlı mobil тармакlarda aynı маалымат ылдамдыгы artışının elde eтилeceği же ыкмасыn doğrudan kullanıma hazır olduğu sonucu çıkarılamaz.

Түзмөктөн-түзмөккө байланыш эмне?

Түзмөктөн-түзмөккө байланыш, birbirine yakın iki колдонуучу cihazının маалыматyi doğrudan aktarmasına olanak tanır. Böylece маалыматnin her абалda базалык станцияna gidip yeniden hedef cihaza мененtilmesi gerekmez. D2D шилтемеları уюлдук колдонуучуlar үчүн ayrılmış radyo булакlarını yeniden kullanarak spektrum маалыматmliliğini yükseltebilir, базалык станцияndaki trafik yükünü azaltabilir жана байланыш кечигүүsini düşürebilir.

Bu kazanç, D2D маалыматcisinin уюлдук колдонуучуya же базалык станцияna тоскоолдук oluşturabilmesi эмне үчүнiyle ücretsiz değildir. Aynı ресурс блогуnu kullanan шилтемеların каналı жана берүү кубаты birlikte seçilmelidir. Aşırı кубат колдонулушу bir D2D жупnin маалымат ылдамдыгыnı yükseltirken başka колдонуучуların sinyal kalitesini düşürebilir.

Kısmi канал абалы маалыматы эмне үчүн маанилүү?

Kanal абал bilgisi, маалыматci менен alıcı арасындаki radyo шилтемеsının o andaki kalitesini temsil eder. Tam канал bilgisinin elde eтилmesi; колдонуучу hareketliliği, kestirim hataları, geri bildirim кечигүүsi жана sinyalleşme yükü эмне үчүнiyle чыныгы тармакlarda кубатtür. Kaynak tahsis sistemi ошондуктан чыныгы каналın kendisi yerine gürültü же кечигүү içeren bir kestirimle karar жанаrmek zorunda kalabilir.

Изилдөөda doğrudan D2D каналları жана тоскоолдук каналları tam değerleriyle değil, kestirilmiş değerleriyle абал uzayına aktarılmıştır. Simülasyon açıklamasında жарым-жартылай канал маалыматыnin Gauss gürültüsü жана zamansal korelasyon kullanılarak üretildiği belirtilmektedir. Бирок gürültü varyansı, korelasyon katsayısı жана канал kestirim doğruluğu берилген эмес. Bu жетишпегенlik, deney koşullarının yeniden üretilmesini жана modelin farklı анык эмесlik düzeylerinde karşılaştırılmasını кубатleştirmektedir.

Sistem modeli кантип kurulmuştur?

Araştırma бир hücreli bir тармак modeli kullanmıştır. Baz istasyonu, уюлдук колдонуучу ekipmanlarına жана D2D çiftlerine hizmet жанаrmektedir. Her уюлдук колдонуучуya bir ortogonal ресурс блогу ayrılmış, D2D çiftlerinin bu blokları yeniden kullanmasına izin маалыматlmiştir.

Изилдөөnın 4. sayfasındaki sistem şeması beş temel шилтеме türünü көрсөтөт:

  • Hücresel колдонуучуdan базалык станцияna yararlı yukarı шилтеме,
  • D2D маалыматcisinden базалык станцияna oluşan çapraz katman тоскоолдукi,
  • Hücresel колдонуучуdan D2D alıcısına oluşan çapraz katman тоскоолдукi,
  • D2D маалыматcмененri арасында oluşan eş katmanlı тоскоолдук,
  • D2D маалыматcisi менен kendi alıcısı арасындаki doğrudan шилтеме.

D2D жуп i үчүн sinyal-тоскоолдук-artı-gürültü oranı изилдөөda şu biçimde modellenmiştir:

\[ \gamma_i^{D} = \frac{p_i h_{i,i}} {\sum_{j \neq i} p_j h_{j,i} + p_{c_i}^{C} h_{c_i,i} + \sigma^2} \]

Pay, D2D маалыматcisinden kendi alıcısına ulaşan yararlı sinyal gücünü temsil eder. Paydada diğer D2D маалыматcмененrinden gelen eş katmanlı тоскоолдук, aynı ресурс блогуnu kullanan уюлдук колдонуучуnın тоскоолдукi жана жылуулук ызы-чуу bulunmaktadır.

Hücresel колдонуучу k үчүн базалык станцияndaki SINR ise şu şekilde маалыматlmiştir:

\[ \gamma_k^{C} = \frac{p_k^{C} h_{k,B}} {\sum_{i:c_i=k} p_i h_{i,B}+\sigma^2} \]

D2D шилтемеlarının уюлдук kaynтармакı yeniden kullanması, базалык станцияndaki уюлдук sinyale тоскоолдук eklemektedir. Bu эмне үчүнle уюлдук колдонуучуların SINR değerinin belirlenen asgari eşiğin үстүндө tutulması bir кызмат сапаты kısıtı olarak tanımlanmıştır.

Veri ылдамдыкı кантип hesaplanmıştır?

Изилдөөчүлөр D2D жана уюлдук шилтемеların ulaşılabilir маалымат ылдамдыкlarını Shannon kapasite ifadesiyle hesaplamıştır:

\[ R_i^{D}=B\log_2(1+\gamma_i^{D}) \]

\[ R_k^{C}=B\log_2(1+\gamma_k^{C}) \]

Burada B канал bant genişliği, R маалымат ылдамдыгы жана γ ilgili шилтемеnın SINR değeridir. Toplam D2D маалымат ылдамдыгы bütün D2D çiftlerinin ылдамдыкlarının toplamıdır:

\[ R_{\mathrm{sum}}^{D}=\sum_{i=1}^{N_d}R_i^{D} \]

Kullanıcılar арасындаki адилеттүүлүк кантип өлчөнгөн?

Yalnızca toplam маалымат ылдамдыгыnı en üst düzeye çıkarmak, iyi канал koşullarına sahip колдонуучуlara sürekli булак маалыматlip diğerlerinin geride bırakılmasına yol açabilir. Изилдөө ошондуктан Jain адилеттүүлүк индексиni kullanmıştır:

\[ J = \frac{\left(\sum_i R_i^{D}\right)^2} {N_d\sum_i\left(R_i^{D}\right)^2} \]

İndeks 0 менен 1 арасында değer alır. Değerin 1’e yaklaşması D2D колдонуучуlarının маалымат ылдамдыкlarının daha dengeli dтармакıldığını gösterir. Бирок yüksek Jain indeksi бир başına bütün колдонуучуların yeterli hizmet aldığı anlamına gelmez; düşük ama birbirine yakın маалымат ылдамдыкları da yüksek адилеттүүлүк değeri üretebilir.

Kaynak tahsisi кайсы optimizasyon hedefiyle tanımlanmıştır?

Изилдөөчүлөр toplam маалымат ылдамдыгы, адилеттүүлүк жана энергия маалыматmliliğini artıran; кубат колдонулушу менен SINR ihlallerini cezalandıran çok amaçlı bir problem tanımlamıştır:

\[ \max_{\mathbf{c},\mathbf{p}} \alpha \bar{R}+\beta J+\eta E-\Phi_P-\Phi_S \]

Bu amaç; D2D жана уюлдук мененtim кубатlerinin sınırlar үчүнde tutulması, her D2D жупne ресурс блогу atanması, SINR eşiklerinin korunması жана адилеттүүлүк indeksinin belirlenen alt sınırın үстүндө tutulması koşullarıyla birlikte ele alınmıştır.

Formülasyondaki ресурс блогу sorunu эмне?

Изилдөөnın C3 kısıtı her D2D жупnin уюлдук булак kümesinden bir blok seçmesini gerektirmektedir. C4 kısıtı ise bir уюлдук ресурс блогуnu en fazla bir D2D жупnin kullanabмененceğini belirtmektedir:

\[ \sum_{i:c_i=k}1\leq 1 \]

Simülasyon tablosunda 75 уюлдук колдонуучу жана 110 D2D жуп bulunmaktadır. Her уюлдук колдонуучу yalnızca bir ресурс блогуna sahipse 75 blok mevcuttur. Her D2D жуп bir blok seçmek zorunda жана her blok en fazla bir çift tarafından kullanılabiliyorsa 110 çiftin 75 bloğa atanması mümkün değildir.

Ağ yoğunluğu deneylerinde de 25 уюлдук колдонуучуya karşı 40 D2D жуп, 50’ye karşı 75, 75’e karşı 110, 100’e karşı 150 жана 125’e karşı 200 çift колдонулган. Bütün yapılandırmalarda D2D жуп sayısı ресурс блогу sayısından fazladır. Modelin чыныгыte birden fazla D2D жупnin aynı bloğu kullanmasına izin жанаrdiği, bazı çiftleri hizmet dışında bıraktığı же C4 kısıtının yanlış yazıldığı açıklığa kavuşturulmamıştır.

Мындан тышкары C4 чыныгыten uygulanıyorsa aynı ресурс блогуnda iki D2D жуп bulunmayacтармакı үчүн D2D SINR denklemindeki D2D–D2D eş katmanlı тоскоолдук toplamının кантип ortaya çıktığı анык эмесdir. Bu iç ыраатсыздык, натыйжаларın yorumlanmasında en маанилүү чектөөlardan biridir.

Problem эмне үчүн hiyerarşik olarak ayrılmıştır?

Kanal seçimi ayrık, кубат kontrolü ise sürekli bir karardır. Her iki kararı бир bir düz аракет uzayında birleştirmek, колдонуучу sayısı arttıkça çok büyük жана karmaşık bir karar problemi oluşturur. Изилдөө ошондуктан görevi iki katmana ayırmıştır:

  1. Üst katman: Double DQN менен ресурс блогу же канал seçimi.
  2. Alt katman: Aktör–сынчы тармакı менен sürekli берүү кубаты belirleme.

6. sayfadaki mimari şema üst katmanda giriş абалunun DQN тармакına aktarıldığını, her ресурс блогу үчүн Q değerleri üretildiğini жана epsilon-açgözlü seçimle bir blok belirlendiğini көрсөтөт. Alt katmanda актор тармакı sürekli bir кубат değeri üretmekte, сынчы тармакları ise абал–аракет çiftinin beklenen getirisini değerlendirmektedir.

Double DQN эмне үчүн колдонулган?

Standart DQN, bir аракетi seçerken жана aynı аракетin değerini hesaplarken aynı тармакdan yararlandığı үчүн Q değerlerini olduğundan yüksek tahmin edebilir. Double DQN, аракет seçimini çevrim içi тармакla, değer değerlendirmesini hedef тармакla yaparak bu yanlılığı azaltmayı amaçlar:

\[ y=r+\gamma Q\left( s', \arg\max_{a'}Q(s',a';\theta); \theta^{-} \right) \]

Burada θ çevrim içi тармакın, θ− hedef тармакın parametrelerini; γ ise gelecekбирi сыйлыкlerin тармакırlığını belirleyen iskonto katsayısını ifade eder.

Güç kontrolü кантип yapılmıştır?

Aktör тармакı 0 менен 1 арасында bir uy çıktısı üretmektedir. Bu çıktı кубат sınırına şu eşlemeyle айландырылган:

\[ p_y=(0{,}05+0{,}95u_y)P_{\max} \]

Bu eşleme окутуу sırasında sıfır кубат seçilmesini engeller жана en düşük gücü azami gücün %5’i olarak belirler. Бирок optimizasyon kısıtlarında gücün sıfır olmasına izin маалыматldiği үчүн matematiksel model менен ишке ашыруу арасында küçük bir fark oluşmaktadır.

Alt katmanda iki сынчы тармакı колдонулган:

\[ y=r+\gamma\min \left(Q_1(s',a'),Q_2(s',a')\right) \]

İki Q değerinden düşük olanının kullanılması, değerlerin aşırı tahmin eтилmesini azaltmayı amaçlar. Geciktirilmiş politika güncellemesi жана hedef аракет yumuşatma gibi TD3 esintili бирniklerin kullanıldığı belirtilmiştir. Buna karşın тармак katmanları, gizli boyutlar, aktivasyon fonksiyonları, hedef güncelleme katsayısı жана keşif gürültüsü gibi ayrıntılar берилген эмес.

Merkezî окутуу жана dтармакıtık yürütme эмне маанини билдирет?

Изилдөө merkezî окутуу–dтармакıtık yürütme мамилесиnı benimsemektedir. Eğitim sırasında küresel тармак bilgмененrine erişildiği, чыныгы yürütme sırasında ise her D2D колдонуучуsının yerel gözlemine göre karar жанаrdiği belirtilmiştir.

D2D ajanı y үчүн yerel абал; kestirilmiş doğrudan канал kazancı, gözlenen тоскоолдук, önceki кубат жана önceki каналın kodlanmış gösteriminden oluşmaktadır:

\[ s_y^{\mathrm{local}}= \left[ \hat{g}_y^{(d)}, \hat{I}_y, p_y^{\mathrm{prev}}, e(c_y^{\mathrm{prev}}) \right] \]

Бирок kaç bтармакımsız ajanın bulunduğu, тармак parametrelerinin колдонуучуlar арасында paylaşılıp paylaşılmadığı, merkezî сынчыin кайсы küresel bilgiyi aldığı жана eşzamanlı kararların кантип koordine eтилdiği ayrıntılı biçimde түшүндүрүлгөн эмес.

Ödül fonksiyonu neyi dengelemektedir?

Temel сыйлык ifadesi toplam маалымат ылдамдыгыnı жана адилеттүүлүкi artırırken kısıt ihlallerini cezalandırmaktadır:

\[ r_t=\alpha R_{\mathrm{sum}}+\beta J-\lambda\cdot\mathrm{Penalty} \]

Ceza teriminin SINR ihlallerini, уюлдук колдонуучуlara маалыматlen aşırı тоскоолдукi жана fazla кубат керектөөni kapsadığı belirtilmiştir. SINR ihlali үчүн ayrıca şu ifade маалыматlmiştir:

\[ \Phi_S=\sum_{i=1}^{N_d} \max(0,\gamma_{\min}-\mathrm{SINR}_i) \]

Ödül салмактары olan α, β жана λ үчүн колдонулган сандык değerler açıklanmamaktadır. Bu değerler маалымат ылдамдыгы менен адилеттүүлүк арасында кайсы tercihin yapıldığını doğrudan etkмененdiğinden yeniden üretмененbilirlik açısından маанилүү.

Изилдөө PPO kullanıyor mu?

Giriş bölümünde “PPO tarzı politika optimizasyonu” ifadesi bulunmaktadır. Бирок ыкма bölümünde PPO’nun olasılık oranı, kırpılmış жанаkil amaç fonksiyonu же avantaj kestirimi tanımlanmamıştır. Açıklanan чыныгы mimari Double DQN менен TD3 benzeri эгиз сынчыli актор–сынчы bмененşimidir. Bu эмне үчүнle изилдөөyı PPO tabanlı bir sistem olarak tanımlamak doğru değildir.

Deney düzeni кантипdır?

Simülasyonlar Python жана PyTorch kullanılarak NVIDIA A100 GPU bulunan bir bilgisayarda yürütülmüştür. Kanal modeli Rayleigh өчүүsine dayanmakta, жарым-жартылай канал маалыматы ise zamansal korelasyonlu Gauss gürültüsüyle temsil eтилmektedir.

ParametreИзилдөөda маалыматlen değer
Hücre yarıçapı500 metre
Hücresel колдонуучу sayısı75
D2D жуп sayısı110
Eğitim bölümü200 episode
Her bölümdeki adım40
Mini yığın өлчөмү64
Double DQN үйрөнүү ылдамдыгы1 × 10−4
Aktör үйрөнүү ылдамдыгы1 × 10−4
Eleştirmen үйрөнүү ылдамдыгы2 × 10−4
Rastgele урукlar0, 1 жана 2
İşlemciIntel Xeon w7-2575X
Bellek128 GB
GPUNVIDIA A100, 40 GB
YazılımPyTorch 2.7.1, CUDA 12.5, cuDNN 9.3, Python 3.13.7

Karşılaştırma ыкмаleri klasik Q-learning, DQN жана канал kazancına göre ресурс бөлүштүрүү yapan RACG sezgisel ыкмасыdir. Daha yakın mimariye sahip PPO, DDPG, TD3, düz hibrit актор–сынчы же modern çok-etmenli DRL temel çizgмененri bulunmamaktadır.

Ana натыйжалар nelerdir?

YöntemToplam маалымат ылдамдыгы (Mbps)Jain адилеттүүлүк индексиOrtalama сыйлык
Q-Learning84,9320,9691,368
DQN85,1930,9681,359
RACG84,7400,9681,347
Önerмененn HDRL108,5620,9711,542

Önerмененn ыкма, изилдөөdaki DQN temel çizgisine göre toplam маалымат ылдамдыгыnı yaklaşık %27,4, ortalama сыйлыкü yaklaşık %13,5 artırmıştır. Adalet indeksindeki mutlak fark yalnızca 0,003’tür. Q-learning менен karşılaştırıldığında маалымат ылдамдыгы artışı yaklaşık %27,8, RACG менен karşılaştırıldığında yaklaşık %28,1’dir.

Bu değerler колдонулган симуляция үчүнde belirgin bir toplam маалымат ылдамдыгы farkı көрсөтөт. Бирок адилеттүүлүк жагынан bütün ыкмаler zaten 0,968 менен 0,971 арасындаki dar aralıkta bulunmaktadır. Демек HDRL’nin temel сандык kazanımı адилеттүүлүкten çok toplam маалымат ылдамдыгыndadır.

Yakınsama grafikleri ne көрсөтөт?

8. sayfadaki toplam маалымат ылдамдыгы grafiğinde bütün ыкмаler окутууin başında yaklaşık 85 Mbps düzeyindedir. HDRL eğrisi 40–60. bölümler арасында ылдамдыкla yükselerek yaklaşık 108–109 Mbps düzeyine ulaşmakta, diğer ыкмаler ise 85 Mbps çevresinde kalmaktadır.

Adalet grafiğinde HDRL’nin окутуу sırasında geçici bir düşüş yaşadığı, ardından 0,971 çevresine toparlandığı görülmektedir. Ödül grafiğinde de yaklaşık 40. bölümden sonra belirgin bir sıçrama жана 1,55 çevresinde kararlı seyir bulunmaktadır.

Grafik аталышlarında ortalama жана standart sapma gösterildiği belirtilse de standart sapmalar tablo hâlinde берилген эмес. Yalnızca üç кокус урук kullanılması, белгиle yüksek değişkenlik gösteren бекемдөөлүү үйрөнүү deneylerinde sınırlı bir бирrar sayısıdır.

Ağ yoğunluğu arttığında ne olmuştur?

9. sayfadaki deneylerde уюлдук колдонуучу жана D2D жуп sayıları sırasıyla şu yapılandırmalarda artırılmıştır:

  • 25 уюлдук колдонуучу жана 40 D2D жуп,
  • 50 уюлдук колдонуучу жана 75 D2D жуп,
  • 75 уюлдук колдонуучу жана 110 D2D жуп,
  • 100 уюлдук колдонуучу жана 150 D2D жуп,
  • 125 уюлдук колдонуучу жана 200 D2D жуп.

Toplam маалымат ылдамдыгы bütün ыкмаlerde колдонуучу sayısıyla yükselmiş, HDRL grafikte en yüksek eğriyi üretmiştir. HDRL yaklaşık 40 Mbps’den 200 Mbps’ye yükselirken en yakın temel çizgi yoğun yapılandırmada yaklaşık 155 Mbps’ye ulaşmıştır.

Adalet eğrisinde HDRL bütün тыгыздыкlarda yaklaşık 0,973–0,975 aralığında kalmaktadır. Ortalama сыйлык eğrisinde HDRL yaklaşık 1,54–1,57 aralığını korurken temel çizgмененrin сыйлыкleri тыгыздык arttıkça düşmektedir. Муну менен бирге ресурс блогу kısıtının bu колдонуучу sayılarıyla кантип uygulandığı açıklanmadığından масштабдалуу sonucunun matematiksel modelle uyumu анык эмесdir.

Öğrenme oranı натыйжаларı кантип etkмененmiştir?

10. sayfadaki ilk grafik grubu 10−5, 5×10−5, 10−4 жана 5×10−4 үйрөнүү oranlarını салыштырууktadır. Daha yüksek үйрөнүү oranları toplam маалымат ылдамдыгы жана сыйлык жагынан daha ылдам yakınsama көрсөткөн. En düşük үйрөнүү ылдамдыгы daha жай мененrlemiş жана 200 bölüm sonunda daha düşük performansta kalmıştır.

Adalet değerleri окутуу sırasında dalgalanmış, bazı ayarlarda geçici düşüşler görülmüş, fakat eğrмененr çoğunlukla 0,96’nın үстүндө toparlanmıştır. Изилдөө farklı үйрөнүү oranlarının натыйжаларını grafikle sunmakta, ancak her oran үчүн son performans değerlerini жана varyansları tablo hâlinde жанаrmemektedir.

Hangi оптимизатор daha iyi натыйжа жанаrmiştir?

Adam, AdamW, RMSProp жана SGD оптимизаторleri салыштырылган. Adam, AdamW жана RMSProp toplam маалымат ылдамдыгыnda SGD’den biraz daha ылдам yakınsamıştır. SGD сыйлык жана адилеттүүлүк eğrмененrinde daha yüksek dalgalanma көрсөткөн.

Grafiklere göre uyarlamalı оптимизаторler benzer son маалымат ылдамдыкlarına ulaşmaktadır. Bu эмне үчүнle натыйжа, бир bir оптимизаторün açık üstünlüğünden çok SGD’nin bu deneyde daha kararsız kaldığını көрсөтөт.

Veri ылдамдыкı–адилеттүүлүк dengesi ne көрсөтөт?

10. sayfadaki son grafik toplam маалымат ылдамдыгы менен Jain адилеттүүлүк индексиni aynı düzlemde салыштырууktadır. HDRL yaklaşık 109 Mbps жана 0,972 адилеттүүлүк менен sтармак üst bölgede yer alırken temel çizgмененr yaklaşık 85–86 Mbps aralığında toplanmıştır.

Bu görünüm, HDRL’nin колдонулган deneyde toplam маалымат ылдамдыгыnı artırırken адилеттүүлүк değerini koruduğunu көрсөтөт. Бирок бир noktalı özet grafik, farklı сыйлык салмактары шартында oluşabмененcek чыныгы Pareto eğrisini göstermemektedir. Veri ылдамдыкı жана адилеттүүлүк арасындаki tercihlerin daha кубатlü değerlendirмененbilmesi үчүн farklı α жана β değerleriyle deney yapılması gerekir.

Изилдөөnın desбирlediği натыйжалар nelerdir?

  • Ayrık канал seçimi менен sürekli кубат kontrolü hiyerarşik iki denetleyiciye ayrılabilir.
  • Double DQN жана эгиз сынчыli актор–сынчы birleşimi, колдонулган симуляцияda Q-learning, DQN жана RACG’den daha yüksek toplam маалымат ылдамдыгы üretmiştir.
  • Önerмененn ыкма, маалымат ылдамдыгы artarken Jain адилеттүүлүк индексиni yaklaşık aynı yüksek düzeyde tutmuştur.
  • Ağ yoğunluğu arttığında HDRL eğrмененri колдонулган temel çizgмененrin үстүндө kalmıştır.
  • Öğrenme oranı жана оптимизатор seçimi yakınsama ылдамдыкını жана окутуу kararlılığını etkмененmiştir.

Изилдөө neyi göstermemektedir?

  • Yöntemin чыныгы bir 5G базалык станция же fiziksel D2D cihazları үстүндө çalıştığını göstermemektedir.
  • Gecikme, пакет жоготуусу, ишенимдүүлүк, sinyalleşme yükü же чыныгы энергия керектөө өлчөнгөн эмес.
  • Modelin farklı CSI hata büyüklüklerinde dayanıklı olduğunu sistematik biçimde göstermemektedir.
  • HDRL’nin çтармакdaş PPO, TD3, DDPG же çok-etmenli ыкмаlerden üstün olduğunu далилдебейт.
  • Dтармакıtık yürütmenin haberleşme maliyetini, karar кечигүүsini же güжанаnliğini değerlendirmemektedir.
  • Түркиядаki оператор тармакlarında aynı натыйжаларın elde eтилeceğini göstermemektedir.
  • Formülasyondaki ресурс блогу tutarsızlığı çözülmeden bildirмененn ölçeklenebilirliğin fiziksel olarak uygulanabilir olduğunu далилдебейт.

Изилдөөnın Yöntemi жана Bulguları

Yöntem akışının özeti

  1. Tek hücreli D2D desбирli тармак ortamı oluşturulmuştur.
  2. Hücresel жана D2D колдонуучуları 500 metrelik hücre үчүнe кокус yerleştirilmiştir.
  3. Rayleigh өчүүsi kullanılarak канал kazançları üretilmiştir.
  4. Kanal kestirimlerine zamansal korelasyonlu Gauss gürültüsü eklenerek kısmi CSI oluşturulmuştur.
  5. Durum жанаktörüne kestirilmiş каналlar, önceki канал жана önceki кубат bilgмененri aktarılmıştır.
  6. Double DQN üst katmanı ресурс блогуnu seçmiştir.
  7. Aktör тармакı seçмененn blok үчүн берүү кубаты üretmiştir.
  8. SINR, маалымат ылдамдыгы, адилеттүүлүк жана ceza değerleri hesaplanmıştır.
  9. Geçişler deneyim бирrarı belleğine kaydeтилmiştir.
  10. Double DQN, актор, iki сынчы жана hedef тармакlar güncellenmiştir.
  11. 200 bölüm sonunda натыйжалар temel ыкмаlerle салыштырылган.

Yöntem ayrıntılarının tamlık değerlendirmesi

BмененşenИзилдөөda açıklanan bilgiEksik же анык эмес bilgi
Kanal modeliRayleigh өчүүsiYol kaybı modeli, gölgeleme, taşıyıcı frekans жана bant genişliği
Kısmi CSIGauss gürültüsü жана zamansal korelasyonGürültü varyansı жана korelasyon katsayısı
Üst denetleyiciDouble DQNAğ katmanları, keşif takvimi жана hedef güncelleme sıklığı
Alt denetleyiciAktör–сынчы, эгиз сынчы, geciktirilmiş güncellemeAğ mimarisi, аракет gürültüsü жана yumuşak güncelleme katsayısı
Deneyim бирrarıTekrar belleği колдонулушуBellek kapasitesi жана önceliklendirme ыкмасы
ÖdülVeri ылдамдыкı, адилеттүүлүк жана ceza bмененşenleriAğırlık katsayılarının сандык değerleri
Güç modeliAzami gücün %5–100 aralığıAzami gücün сандык değeri
Hizmet kalitesiAsgari SINR kısıtlarıAsgari SINR eşiklerinin değerleri
Tekrar sayısıÜç кокус урукSayısal standart sapma жана güжанаn aralıkları
Yeniden üretмененbilirlikYazılım жана аппараттык жабдык sürümleriKaynak kodu жана симуляция маалымат файлları

Sayısal kazanımların bтармакlamı

108,562 Mbps değeri чыныгы bir талаа ölçümü değil, tanımlanan симуляция ortamındaki toplam D2D маалымат ылдамдыгыdır. Yüzde 27–28 civarındaki artış yalnızca seçмененn üç temel çizgiye, aynı канал modeline жана изилдөөda колдонулган сыйлык ayarlarına göre geçerlidir.

Adalet indeksindeki artış сандык olarak küçüktür. HDRL’nin 0,971 değeri DQN жана RACG’nin 0,968 değerinden 0,003, Q-learning’in 0,969 değerinden 0,002 yüksektir. Bu эмне үчүнle “aтил ресурс бөлүштүрүү korunmuştur” ifadesi desбирlenirken “адилеттүүлүкte büyük iyмененşme” ifadesi desбирlenmemektedir.

Sonuçların güжанаnilirliğini artırmak үчүн gereken deneyler

  • Kaynak bloğu kısıtları жана колдонуучу sayılarının matematiksel olarak tutarlı hâle getirilmesi,
  • Farklı канал kestirim hata varyansları жана geri bildirim кечигүүleriyle CSI dayanıklılık taraması,
  • PPO, TD3, DDPG, düz hibrit актор–сынчы жана çok-etmenli DRL салыштырууları,
  • Hiyerarşi, эгиз сынчы, адилеттүүлүк сыйлыкü жана CTDE bмененşenleri үчүн ablasyon deneyleri,
  • En az beş же on кокус урукla güжанаn aralıkları жана istatistiksel салыштырууlar,
  • Gecikme, энергия керектөө, пакет жоготуусу, QoS ihlal oranı жана эсептөө süresi ölçümleri,
  • Farklı hücre yarıçapları, hareketlilik ылдамдыкları жана канал modelleriyle dış симуляция валидацияsı,
  • Kaynak kodunun, yapılandırma файлlarının жана кокус урукların yayımlanması,
  • Yazılım tanımlı radyo же аппараттык жабдык döngülü тест platformunda валидация.

Kaynak жана Yöntem Notu

Изилдөөnın tam özgün adı: Hierarchical Deep Reinforcement Learning for Scalable Resource Allocation in D2D Communication under Partial Channel State Information in 5G Networks

Yazarlar: Rohit Singh Thakur жана Pavan Kumar Mishra

Yazar sıralaması: Rohit Singh Thakur, Pavan Kumar Mishra

Eş katkı bilgisi: Изилдөөda eşit katkı же eş birinci авторlık beyanı bulunmamaktadır.

Sorumlu автор: Rohit Singh Thakur. Görünür изилдөөda yıldız işaretiyle, SSRN kaydında “Contact Author” olarak gösterilmiştir.

Kurum: Department of Information Technology, National Institute of Technology Raipur, India

DOI:10.2139/ssrn.6990038

Dergi: Изилдөө bir dergide yayımlanmamıştır.

Özgün dergi жарыялооevi: Bulunmamaktadır.

Yayın platformu: SSRN

Yüklenme tarihi: 24 Haziran 2026

Yayın yılı: 2026

Kaynak türü: Simülasyon temelli deneysel kablosuz haberleşme жана терең бекемдөөлүү үйрөнүү preprinti

Hakemlik абалu: Изилдөө рецензиядан өткөн эмес. Sayfaların шартында da “Preprint not peer reviewed” uyarısı bulunmaktadır.

Resmî шилтеме:SSRN изилдөө sayfası

SSRN kayıt sayfasında ilk авторın adı “Rohit Singh Singh Thakur” biçiminde yinelenmiştir. Görünür изилдөө kapтармакında жана e-posta satırında “Rohit Singh Thakur” adı kullanılmaktadır. Бул макалаde görünür изилдөөdaki ad esas alınmıştır.

Bu Түркçe makale, yüklenen 12 sayfalık изилдөөnın metni, denklemleri, tabloları, алгоритмsı жана 11 şekli incelenerek hazırlanmıştır. Bilimsel натыйжалар yalnızca изилдөөda bildirмененn симуляцияlara dayanmaktadır. Dış булакlar аталыш, автор, мекеме, DOI, platform, tarih жана hakemlik абалunun bibliyografik doğrulanması amacıyla колдонулган.

Изилдөөnın натыйжаларı; ресурс блогу kısıtları менен колдонуучу sayıları арасындаki uyumsuzluk, kısmi CSI parametrelerinin жетишпегенliği, sınırlı temel çizgмененr, üç кокус урук, yayımlanmamış булак kodu жана талаа валидацияsının bulunmaması көңүл бурууe alınarak okunmalıdır. Бул изилдөө чыныгы bir 5G şebekesinde operasyonel başarı же ticari kullanıma hazır bir çözüm далилдебейт.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты