Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / Bir Neçə Qərarverici Natamam Məlumatla Necə Daha Ağıllı Qərar Verə Bilər?
Kompüter Elmləri

Bir Neçə Qərarverici Natamam Məlumatla Necə Daha Ağıllı Qərar Verə Bilər?

Tədqiqatçılar hər qərarvericinin bütün keçmiş məlumatı daşımaq əvəzinə informasiyanı üç hissəyə sıxlaşdıra biləcəyini göstərirlər: özəl inamı, hamının ortaq inamı və qısa özəl məlumatı. Bu yanaşma mərkəzləşdirilməmiş qismən müşahidə olunan qərar problemləri üçün yeni dinamik proqramlaşdırma tənlikləri və ayırma prinsipi təqdim edir.

02/06/2026  Veri Anla 50 baxış
Bir Neçə Qərarverici Natamam Məlumatla Necə Daha Ağıllı Qərar Verə Bilər?

Hər Kəs Eyni Anda Eyni Şeyi Bilməyə Bilər

Gündəlik həyatda bir çox sistem tək qərarverici tərəfindən idarə olunmur. Bir neçə insan, sensor, robot, idarəetmə mərkəzi və ya proqram agenti eyni sistem üzrə qərar verə bilər.

Məsələn:

Bir robot komandası eyni anbarda işləyə bilər.
Bir enerji şəbəkəsində müxtəlif idarəetmə mərkəzləri fərqli bölgələri izləyə bilər.
Avtonom nəqliyyat vasitələri parkında hər avtomobil öz sensor məlumatlarını görür, lakin digər avtomobillərin məlumatını gecikmə ilə alır.
Müdafiə, rabitə və ya fəlakət monitorinq şəbəkəsində müxtəlif müşahidə nöqtələri fərqli məlumatlara malik ola bilər.

Bu cür sistemlərdə ən böyük problem budur:

Heç bir qərarverici sistemin hamısını görmür.

Bir agent öz ölçmələrini dərhal bilir, lakin digər agentlərin gördüyü məlumatları daha sonra öyrənə bilər. Bəzi məlumatlar ortaq olur, bəziləri isə özəl qalır. Bu halda yaxşı qərar vermək yalnız “mən nə gördüm?” sualından deyil, “digərləri nə bilir, nəyi hələ bilmir, nəyi gecikmə ilə öyrənəcək?” sualından da asılıdır.

Bu məqalənin araşdırdığı əsas problem məhz budur.

POMDP Nə Deməkdir?

Məqalənin əsas anlayışlarından biri POMDP-dir. Açılışı Partially Observable Markov Decision Process-dir. Azərbaycan dilində bunu “qismən müşahidə olunan Markov qərar prosesi” kimi ifadə etmək olar.

Sadələşdirsək:

Sistemin real vəziyyəti var, lakin qərarverici bu vəziyyəti tam görə bilmir. Bunun əvəzinə səs-küylü və ya natamam müşahidələr alır. Qərarverici bu müşahidələr əsasında sistemin hansı vəziyyətdə ola biləcəyinə dair inam formalaşdırır və buna uyğun hərəkət seçir.

Tək qərarvericili POMDP-də bu artıq çətindir. Lakin bu məqalədə problem daha da mürəkkəbləşir: Bir neçə qərarverici var və hər biri fərqli məlumata malikdir.

Buna görə mövzu “mərkəzləşdirilməmiş POMDP” halına gəlir.

Gecikmiş Məlumat Paylaşımı Nə Deməkdir?

Məqalədə T-addım gecikməli məlumat paylaşımı araşdırılır. Bunun mənası budur:

Bir qərarverici öz yeni müşahidəsini dərhal bilir. Lakin digər qərarvericilər bu məlumatı yalnız T zaman addımından sonra öyrənirlər.

Məsələn, T = 2 olduqda, bir agentin indi gördüyü məlumat digərləri üçün iki addımdan sonra ortaq məlumata çevrilir.

Bu halda hər agentin məlumatı iki hissəyə ayrılır:

Özəl məlumat: Agentin hazırda bildiyi, lakin digərlərinin hələ bilmədiyi məlumat.
Ortaq məlumat: Gecikmə müddəti başa çatdığı üçün artıq bütün agentlərin bildiyi məlumat.

Bu fərq vacibdir. Çünki qərarverici həm öz yeni məlumatından, həm də hamının bildiyi ortaq keçmişdən istifadə edərək qərar verir.

Məqalədəki Əsas Məlumat Düsturu Nəyi İzah Edir?

Məqalədəki məlumat quruluşunu sadə şəkildə belə oxumaq olar:

Ik,t = Λk,t ∪ Δt(K)

Bu düsturda:

Ik,t, k nömrəli agentin t anındakı ümumi məlumatıdır.
Λk,t, həmin agentin özəl məlumatıdır.
Δt(K), bütün agentlərin ortaq paylaşdığı gecikmiş məlumatdır.

Gündəlik dillə:

Bir agentin qərarı = özəl məlumatı + hamının bildiyi ortaq məlumat əsasında qurulur.

Bu, sadə görünə bilər, lakin çoxagentli qərar problemlərində kritik fərqdir. Çünki hansı məlumatın özəl, hansının ortaq olduğunu bilmədən düzgün qərar modeli qurmaq mümkün deyil.

Qərar Strategiyası Nə Deməkdir?

Məqalədə digər əsas ifadə budur:

Uk,t = γk,t(Ik,t)

Bu düsturun sadə mənası:

Agentin hərəkəti həmin anda malik olduğu məlumata əsasən seçilir.

Burada:

Uk,t, k nömrəli agentin t anındakı hərəkətidir.
γk,t, agentin qərar strategiyasıdır.
Ik,t, agentin həmin andakı məlumat quruluşudur.

Yəni agent təsadüfi qərar vermir; əlindəki məlumata uyğun strategiya tətbiq edir.

Lakin problem budur: Zaman keçdikcə məlumat tarixi böyüyür. Agent bütün keçmişi olduğu kimi daşımalı olsa, problem sürətlə hesablanmaz hala gələr. Buna görə məlumatın sıxlaşdırılması lazımdır.

Məlumatın Sıxlaşdırılması Niyə Vacibdir?

Bir qərarvericinin bütün keçmiş müşahidələri, keçmiş hərəkətləri və digər agentlərdən gecikmə ilə gələn bütün məlumatları saxladığını düşünək. Zaman artdıqca bu məlumat yığını böyüyür.

Bu, iki baxımdan problemdir:

Birincisi, qərarın hesablanması çətinləşir.
İkincisi, strategiyanın tərifi böyüyən keçmişdən asılı hala gəlir.

Klassik POMDP nəzəriyyəsində bu problem “inam vəziyyəti” ilə həll olunur. Qərarverici bütün keçmişi saxlamaq əvəzinə, sistemin hansı vəziyyətdə ola biləcəyinə dair ehtimal paylanmasını saxlayır.

Bu məqalə də oxşar fikri mərkəzləşdirilməmiş sistemlərə daşımağa çalışır. Lakin burada tək bir inam kifayət etmir. Çünki hər agentin fərqli özəl məlumatı və ortaq məlumatı var.

Tədqiqatın Əsas Fikri: Üçhissəli Məlumat Vəziyyəti

Məqalənin ən mühüm nəticəsi budur ki, hər agent gecikmiş məlumat quruluşunu üç hissəyə sıxlaşdıra bilər.

1. Özəl posterior paylanma
Agentin öz məlumatına əsasən sistemin real vəziyyəti və digər agentlərin görmədiyi özəl məlumatlar haqqında formalaşdırdığı ehtimal inamıdır.

Sadə dillə:
“Mənim gördüklərimə əsasən sistem və digər agentlərin özəl tərəfləri haqqında nəyə inanıram?”

2. Ortaq posterior paylanma
Bütün agentlərin ortaq məlumatına əsasən sistem haqqında formalaşan ortaq ehtimal inamıdır.

Sadə dillə:
“Hamının bildiyi ortaq keçmişə əsasən sistem haqqında ortaq təxminimiz nədir?”

3. Agentin qısa özəl məlumat komponenti
Agentin hələ də yalnız özündə olan aktual özəl məlumat hissəsidir.

Sadə dillə:
“Hazırda yalnız mənim bildiyim, lakin hamının hələ öyrənmədiyi qısa məlumat nədir?”

Bu üçlü quruluş agentlərə sonsuz böyüyən keçmişə baxmadan qərar verməyə imkan verə biləcək nəzəri sıxlaşdırma təqdim edir.

“Özəl İnam” ilə “Ortaq İnam” Arasındakı Fərq Nədir?

Bu məqaləni anlamağın ən vacib yollarından biri özəl inamla ortaq inam arasındakı fərqi başa düşməkdir.

Anbarda işləyən iki robot düşünək.

Robot A qarşısında maneə görüb. Robot B hələ bunu bilmir. Lakin hər ikisi bir neçə saniyə əvvəl paylaşılmış xəritə məlumatını bilir.

Bu halda:

Ortaq inam hər iki robotun bildiyi köhnə xəritə və əvvəlki müşahidələrdən ibarətdir.
Robot A-nın özəl inamı öz yeni maneə müşahidəsini də ehtiva edir.
Robot B-nin özəl inamı isə özünün gördüyü başqa şeyləri əhatə edir.

Robot A qərar verərkən həm ortaq xəritədən, həm də öz yeni məlumatından istifadə edir. Lakin Robot B-nin hələ nəyi bilmədiyini də nəzərə almaq lazım gələ bilər.

Məqalənin təklif etdiyi çərçivə bu cür mürəkkəb məlumat asimmetriyalarını riyazi şəkildə idarə etməyə çalışır.

Dinamik Proqramlaşdırma Niyə İstifadə Olunur?

Dinamik proqramlaşdırma böyük qərar problemlərini zaman addımlarına bölərək həll etməyə yarayan üsuldur. Bugünkü qərar gələcəkdə mümkün xərclərə və ya qazanclara təsir edir. Buna görə qərar problemi geriyə doğru və ya addım-addım təhlil edilir.

Klassik təkagentli POMDP-də dinamik proqramlaşdırma inam vəziyyəti üzərindən aparıla bilər. Bu çox vacibdir, çünki agent bütün keçmişi deyil, yalnız aktual inam vəziyyətini istifadə edərək qərar verir.

Bu məqalənin töhfəsi mərkəzləşdirilməmiş və gecikmiş məlumat paylaşımı olan sistemlərdə də oxşar dinamik proqramlaşdırma quruluşu yaratmağa çalışmasıdır.

Lakin klassik yanaşmadan fərqi var: Tək ortaq dəyər funksiyası əvəzinə, hər agent üçün ayrıca xərc-davam funksiyaları və ayrıca DP tənlikləri istifadə olunur.

Niyə Tək DP Tənliyi Kifayət Etməyə Bilər?

Əvvəlki bəzi tədqiqatlar bütün agentlər üçün ortaq məlumata əsaslanan tək dinamik proqramlaşdırma tənliyindən istifadə etməyə çalışıb.

Bu yanaşma bəzi xüsusi hallarda işləyə bilər. Lakin məqaləyə görə, xüsusilə daha uzun gecikməli paylaşım şəraitində bu tək tənliyin mühüm məhdudiyyətləri var.

Çünki tək ortaq məlumat tənliyi hər agentin özəl məlumatını və özəl inamını kifayət qədər təmsil etməyə bilər. Bundan əlavə, bəzi əvvəlki yanaşmalarda optimallaşdırma birbaşa hərəkət məkanı əvəzinə strategiya məkanı üzərində aparılır. Bu da problemi daha ağır edir.

Bu məqalə fərqli yol təklif edir:

Hər agent üçün öz məlumat quruluşundan asılı ayrıca dinamik proqramlaşdırma tənliyi qurmaq.

Beləliklə, hər agent öz hərəkət məkanı üzərində optimallaşdırma aparır. Bu, klassik POMDP dinamik proqramlaşdırmasına daha çox bənzəyən quruluş yaradır.

Decentralized Team Equilibrium Nə Deməkdir?

Məqalənin mühüm anlayışlarından biri “decentralized sequential team equilibrium”dur. Bunu sadə şəkildə “mərkəzləşdirilməmiş ardıcıl komanda tarazlığı” kimi ifadə etmək olar.

Buradakı fikir budur:

Bir neçə agent var. Hamısı ortaq komanda məqsədini yaxşılaşdırmağa çalışır. Lakin hər biri öz məlumatına əsasən qərar verir.

Bir agentin strategiyası qiymətləndirilərkən digər agentlərin strategiyaları sabit saxlanılır. Sonra həmin agentin öz strategiyasını yaxşılaşdırıb-yaxşılaşdıra bilməyəcəyinə baxılır.

Bu, oyun nəzəriyyəsindəki Nash tarazlığı fikrinə bənzəyir. Lakin vacib fərq budur: Burada agentlərin ayrı maraqları deyil, ortaq komanda xərci və ya komanda məqsədi var.

Yəni sistemin məqsədi “hər kəs öz qazancını maksimumlaşdırsın” deyil, “hər agent öz məlumat məhdudiyyəti daxilində ortaq komanda məqsədi üçün ən yaxşı cavabı versin” yanaşmasıdır.

Ayırma Prinsipi Nə Deməkdir?

Məqalədə “separation principle”, yəni ayırma prinsipi mühüm nəticə kimi nəzərdən keçirilir.

Klassik idarəetmə nəzəriyyəsində ayırma prinsipi təxminən belə deyir:

Əvvəlcə sistemin vəziyyətini qiymətləndir.
Sonra bu qiymətləndirməyə əsasən idarəetmə qərarı ver.

Yəni qiymətləndirmə ilə idarəetmə konseptual baxımdan ayrıla bilər.

Bu məqalə mərkəzləşdirilməmiş və gecikmiş məlumat paylaşımı olan sistemlərdə bunun daha ümumi versiyasını təqdim etməyə çalışır.

Hər agent əvvəlcə özəl və ortaq məlumat vəziyyətlərini yeniləyir. Sonra qərarını bu sıxlaşdırılmış məlumat vəziyyətləri üzərindən verir.

Bu, aşağıdakı səbəbə görə vacibdir:

Agentin qərar vermək üçün bütün xam keçmişi daşımasına ehtiyac yoxdur. Qiymətləndirilmiş məlumat vəziyyətləri kifayət edən statistika kimi istifadə oluna bilər.

Düsturlar Bizə Nə Öyrədir?

Məqalədəki düsturlar çox texniki görünsə də oxucu üçün üç əsas fikir daşıyır.

Birincisi: Hər agentin məlumatı özəl və ortaq komponentlərə ayrılır.
Bu, gecikmiş paylaşımın riyazi qarşılığıdır.

İkincisi: Hər agentin hərəkəti öz məlumat vəziyyətindən asılıdır.
Yəni qərar strategiyası agentin bildiyi məlumatla məhdudlaşır.

Üçüncüsü: Özəl və ortaq posterior paylanmalar Markov tipli şəkildə yenilənə bilər.
Bu, keçmişin hamısını daşımaq əvəzinə aktual inam vəziyyəti ilə irəliləməyi mümkün edir.

Buna görə düsturlar yalnız abstrakt simvollar deyil. Əsas məqsəd böyüyən məlumat tarixini daha kiçik və qərar vermək üçün kifayət edən hissələrə endirməkdir.

Tədqiqat Nə Deyir?

Tədqiqatın əsas mesajı budur:

Mərkəzləşdirilməmiş, qismən müşahidə olunan və gecikmiş məlumat paylaşımı olan qərar sistemlərində hər agent qərar üçün lazım olan məlumatı üçhissəli quruluşa sıxlaşdıra bilər.

Bu üç hissə:

  • özəl posterior paylanma,
  • ortaq posterior paylanma,
  • qısa özəl məlumat komponenti.

Tədqiqatçılar həmçinin bu məlumat vəziyyətləri ilə yeni dinamik proqramlaşdırma tənliklərinin qurula biləcəyini və həmin tənliklərin klassik mərkəzləşdirilmiş POMDP dinamik proqramlaşdırmasındakı bəzi əsas xüsusiyyətləri qoruduğunu irəli sürürlər.

Bu xüsusiyyətlərdən biri optimallaşdırmanın strategiya məkanında deyil, hərəkət məkanında aparılmasıdır. Bu nəzəri baxımdan vacibdir, çünki strategiya məkanı daha böyük və mürəkkəbdir.

Digər mühüm məqam məlumat vəziyyətlərinin Markov tipli yenilənə bilməsidir. Bu da zamanla böyüyən məlumat tarixi əvəzinə daha idarəolunan qərar dəyişənlərindən istifadə etməyin mümkün olduğunu göstərir.

Bu Niyə Vacibdir?

Bu tədqiqat nəzəri görünsə də müasir texnologiyalarla güclü əlaqələri var.

Çünki bir çox müasir sistem mərkəzləşdirilməmişdir:

Robot komandaları birlikdə işləyir.
Avtonom nəqliyyat vasitələri parkları məlumat paylaşır.
Enerji şəbəkələri regional idarəetmə mərkəzləri ilə idarə olunur.
Paylanmış sensor şəbəkələri ətraf mühit, fəlakət və ya təhlükəsizlik monitorinqi aparır.
Çoxagentli süni intellekt sistemləri ortaq tapşırıqlarda qərar verir.

Bu sistemlərdə hər kəs hər şeyi eyni anda bilmir. Məlumat natamam, gecikmiş və ya yalnız yerli ola bilər. Buna görə qərarvermə nəzəriyyəsi yalnız mərkəzləşdirilmiş sistemlər üçün deyil, məlumat asimmetriyası olan paylanmış sistemlər üçün də inkişaf etdirilməlidir.

Məqalənin əhəmiyyəti bu çətin problemi daha sistemli hala gətirən riyazi çərçivə təqdim etməsidir.

Diqqət Edilməli Məqamlar

Bu tədqiqat birbaşa hazır proqram təminatı, robot idarəetmə alqoritmi və ya sənaye tətbiqi deyil. Əsas töhfəsi nəzəri və riyazi səviyyədədir.

Birincisi, tədqiqat preprintdir. Onun rəyçi qiymətləndirməsindən keçdiyi fərz edilməməlidir.

İkincisi, məqalə ümumi dinamik proqramlaşdırma tənlikləri və məlumat vəziyyəti quruluşları təqdim edir. Bunların böyük real sistemlərdə hesablama baxımından nə qədər səmərəli tətbiq olunacağı ayrıca tədqiqat mövzusudur.

Üçüncüsü, mərkəzləşdirilməmiş POMDP problemləri onsuz da çox çətin problem sinifləridir. Məlumat sıxlaşdırma quruluşu nəzəri baxımdan mühüm olsa da, praktik alqoritmlər üçün əlavə təxmini həll üsulları tələb oluna bilər.

Dördüncüsü, tədqiqat komanda tarazlığı və şəxs-şəxs optimallıq yanaşması üzərindən irəliləyir. Bu, hər şəraitdə tam qlobal komanda optimallığı zəmanəti demək olmaya bilər; əlavə şərtlər tələb oluna bilər.

Beşincisi, real robototexnika, enerji, müdafiə, maliyyə şəbəkəsi və ya trafik sistemlərinə tətbiqdən əvvəl model fərziyyələri, məlumat gecikmələri, rabitə xətaları və təhlükəsizlik sərhədləri ayrıca araşdırılmalıdır.

Nəticə

Bu tədqiqat çoxagentli və mərkəzləşdirilməmiş qərar sistemlərində mühüm suala cavab axtarır:

Agent bütün keçmişi daşımadan natamam və gecikmiş məlumatla necə qərar verə bilər?

Məqalənin təklif etdiyi cavab məlumatı üç əsas hissəyə sıxlaşdırmaqdır: agentin özəl inamı, hamının ortaq inamı və agentin qısa özəl məlumatı.

Bu çərçivə gecikmiş məlumat paylaşımı olan POMDP problemləri üçün yeni dinamik proqramlaşdırma tənlikləri və ayırma prinsipi təqdim edir. Tədqiqat birbaşa praktik tətbiq iddiası daşımasa da, gələcəyin robot komandaları, paylanmış sensor şəbəkələri və çoxagentli süni intellekt sistemləri üçün mühüm nəzəri istiqamət göstərir.

Bu yazının ən sadə mesajı budur:

Paylanmış sistemlərdə yaxşı qərar vermək hər şeyi bilməkdən deyil; kimin nəyi bildiyini düzgün xülasə etməkdən keçə bilər.

Mənbə və Metod Qeydi

Bu məzmun Charalambos D. Charalambous, Umarbek Guvercin və Seddik Djouadi tərəfindən hazırlanmış “Private & Common Information States in Decentralized Team Equilibrium via Dynamic Programming for POMDPs with Delayed Sharing” adlı akademik tədqiqatdan istifadə edilərək Verianla redaksiya formatında orijinal şəkildə hazırlanıb.

Tədqiqat arXiv-də yayımlanmış preprint xarakterlidir. Məzmun məlumatlandırma və təhsil məqsədi daşıyır. İdarəetmə sistemləri, robototexnika, kritik infrastruktur, müdafiə texnologiyaları, maliyyə sistemləri və ya peşəkar mühəndislik tətbiqləri üzrə texniki məsləhətin yerini tutmur.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy