Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Идоракунӣ / Илмҳои иҷтимоӣ / Маркетинг / Оптимизатсияи Истеҳсол ва Нархгузории Фоидамеҳвар бо Proximal Policy Optimization дар Корхонаҳои Истеҳсолӣ
Илми компютер

Оптимизатсияи Истеҳсол ва Нархгузории Фоидамеҳвар бо Proximal Policy Optimization дар Корхонаҳои Истеҳсолӣ

Истеҳсолкунанда имрӯз бояд чанд адад маҳсулот истеҳсол кунад ва онро бо кадом нарх фурӯшад? Агар талабот, хароҷоти ашёи хом ва ҳаҷми захираҳо пайваста тағйир ёбанд, ин ду қарорро наметавон аз ҳам мустақил қабул кард.

17/08/2026  Veri Anla 25 боздид
Оптимизатсияи Истеҳсол ва Нархгузории Фоидамеҳвар бо Proximal Policy Optimization дар Корхонаҳои Истеҳсолӣ

Истеҳсолкунанда имрӯз бояд чанд адад маҳсулот истеҳсол кунад ва онро бо кадом нарх фурӯшад? Агар талабот, хароҷоти ашёи хом ва ҳаҷми захираҳо пайваста тағйир ёбанд, ин ду қарорро наметавон аз ҳам мустақил қабул кард. Ин таҳқиқот низоми омӯзиши тақвиятиро пешниҳод мекунад, ки метавонад ҳаҷми истеҳсол ва нархи фурӯшро ҳамзамон танзим кунад ва ҳадафаш афзоиши фоидаи дарозмуддат бо маҳдуд нигоҳ доштани хавфи захираҳо мебошад. Низоме, ки муҳаққиқон онро PPO-P³OS номидаанд, аз алгоритми Proximal Policy Optimization (PPO) истифода мебарад. Агенти зеҳни сунъӣ дар ҳар қадами қарор хароҷоти истеҳсол, талаботи бозор, сатҳи мавҷудаи захира ва нархи маҳсулотро мушоҳида мекунад; сипас барои нархи нав ва ҳаҷми истеҳсол қарорҳои дорои қиматҳои пайваста мебарорад.

Модел масъалаи истеҳсол ва нархгузориро ҳамчун Раванди Қароргирии Марков (MDP) муайян мекунад. Функсияи мукофот дар ҳоле ки барои афзоиши маржаи маҳсулоти фурӯхташуда талош мекунад, номувозинатии байни талабот ва истеҳсол/захираро бо ҷазои квадратӣ коҳиш медиҳад. Дар симулятсияҳое, ки бо омезиши додаҳои воқеӣ ва синтетикӣ, ки гуфта мешавад тақрибан аз 36.000 намуна иборатанд, гузаронида шудаанд, PPO-P³OS бо Q-Learning, Deep Q-Network (DQN) ва Advantage Actor-Critic (A2C) муқоиса мешавад. Мувофиқи Ҷадвали 1, фоидаи миёна барои PPO-P³OS 62,2×10³ USD, барои A2C 55,1×10³ USD, барои DQN 52,3×10³ USD ва барои Q-Learning 48,6×10³ USD гузориш шудааст.

Бо вуҷуди ин, таҳқиқот ҳамчун низоми зиндаи қароргирӣ дар корхонаи воқеии истеҳсолӣ тасдиқ нашудааст. Қисми воқеии маҷмӯи додаҳо ба сабтҳои ERP ва MES аз як истеҳсолкунандаи миёнаҳаҷми молҳои истеъмолӣ дар солҳои 2021–2023 такя мекунад, дар ҳоле ки маҷмӯи умумии додаҳо бо додаҳои симулятсионии синтетикӣ васеъ карда шудааст. Азбаски таносуби додаҳои воқеӣ ва синтетикӣ ва усули тавлиди додаҳои синтетикӣ ба қадри кофӣ муфассал шарҳ дода нашудаанд, натиҷаҳо бояд ҳамчун муваффақияти симулятсия/benchmark арзёбӣ шаванд; аз онҳо бевосита хулоса кардан мумкин нест, ки дар заводҳои воқеӣ ҳамон афзоиши фоида ба даст хоҳад омад.

Чаро ҳаҷми истеҳсол ва нарх бояд якҷоя баррасӣ шаванд?

Дар корхонаи истеҳсолӣ нарх танҳо қарори мустақили бахши маркетинг ва ҳаҷми истеҳсол танҳо қарори мустақили завод нест. Нарх ба талабот таъсир мерасонад; талабот эҳтиёҷи истеҳсолиро тағйир медиҳад; ҳаҷми истеҳсол ба захира ва хароҷот таъсир мекунад; бо тағйири хароҷот сатҳи қобили қабули нарх низ дубора тағйир меёбад.

Масалан, вақте талабот аз интизорӣ паст аст, баланд нигоҳ доштани истеҳсол метавонад ба ҷамъшавии захираҳо оварда расонад. Агар хароҷоти истеҳсол боло равад, вале нархи фурӯш тағйир наёбад, маржаи фоида барои ҳар воҳид метавонад кам шавад. Агар нарх аз ҳад зиёд баланд карда шавад, талабот метавонад паст гардад. Агар нарх аз ҳад паст нигоҳ дошта шавад, ҳатто бо афзоиши ҳаҷми фурӯш ҳам даромаднокӣ метавонад зарар бинад.

Нуқтаи оғози таҳқиқот ин аст, ки робитаи байни ин тағйирёбандаҳо хаттӣ ва собит нест. Аз ин рӯ, муҳаққиқон ба ҷойи равиши статикӣ, ки танҳо дар як лаҳза оптимуми математикӣ меҷӯяд, аз агенти омӯзиши тақвиятӣ истифода мекунанд, ки аз муҳит бозхӯрд гирифта, бо гузашти вақт сиёсатро меомӯзад.

PPO-P³OS чист?

PPO-P³OS ихтисораи ибораи Profit-Oriented Production and Pricing Optimization System мебошад, ки дар таҳқиқот истифода шудааст. Низом алгоритми Proximal Policy Optimization-ро ба масъалаи иқтисоди истеҳсол мутобиқ мекунад.

Дар Расми 1 модел бо чор блоки асосӣ нишон дода шудааст:

  • Ҳолат (State): хароҷоти истеҳсол, сатҳи захира, талаботи бозор ва нархи ҷорӣ,
  • Сиёсати PPO: сиёсати омӯхташудае, ки ҳолати ҷориро арзёбӣ карда қарор мебарорад,
  • Амал (Action): нархи танзимшуда ва ҳаҷми истеҳсол,
  • Мукофот (Reward): бозхӯрде, ки фоида ва хавфи захираро якҷоя арзёбӣ мекунад.

Агент аз мукофотҳои гирифтааш меомӯзад ва ба таркибҳои нарх–истеҳсоле равона мешавад, ки дар дарозмуддат мукофоти умумии бештар медиҳанд.

Дар фазои ҳолат кадом маълумот ҳаст?

Дар қадами t-уми вақт, вектори ҳолат дар таҳқиқот чунин таъриф мешавад:

\[ s_t=[C_t,D_t,I_t,P_t] \]

Дар ин ҷо:

  • Ct: хароҷоти истеҳсол барои як воҳид,
  • Dt: талаботи бозор,
  • It: сатҳи мавҷудаи захира,
  • Pt: нархи ҷории маҳсулот.

Ин чор тағйирёбанда барои агент хулосаи муҳити иқтисодии ҳамон лаҳзаро ташкил медиҳанд.

Зеҳни сунъӣ кадом қарорҳоро қабул мекунад?

Вектори амал:

\[ a_t=[p_t,q_t] \]

мебошад. Дар манбаъ pt танзими нархро, qt бошад танзими истеҳсолро ифода мекунад.

Фарқи муҳими техникӣ ин аст, ки қарорҳо мисли DQN маҷбур нестанд танҳо яке аз чанд варианти пешакӣ муайяншударо интихоб кунанд. Азбаски PPO метавонад дар фазоҳои амалии пайваста кор кунад, нарх ва ҳаҷми истеҳсолро ҳамчун тағйирёбандаҳои пайваста модел карда метавонад.

Функсияи мукофоти модел чиро оптимизатсия мекунад?

Дар таҳқиқот мукофот чунин таъриф шудааст:

\[ r_t=(p_t-C_t)\cdot \min(q_t,D_t)-\lambda(I_t+q_t-D_t)^2 \]

Ҳади аввал даромади иқтисодии аз фурӯш бадастомадаро ифода мекунад. min(qt,Dt) сохтори содашудаеро ифода мекунад, ки дар он миқдори қобили фурӯш бо хурдтари истеҳсол ва талабот маҳдуд мешавад.

Ҳади дуюм:

\[ \lambda(I_t+q_t-D_t)^2 \]

номувозинатии захираро ҷазо медиҳад. λ ҳар қадар калон шавад, агент нисбат ба номувозинатии захира ҳассостар мешавад.

Бо сабаби ҷазои квадратӣ, ҳар қадар фарқи байни талабот ва захираи мавҷуда плюс истеҳсол зиёд шавад, ҷазо босуръат меафзояд. Ҳамин тавр, низом ба ҷойи танҳо баланд кардани маржаи кӯтоҳмуддати фурӯш, идоракунии захираро низ ба функсияи мукофот дохил мекунад.

Ҳадафи дарозмуддат чист?

Ҳадафи агенти PPO ҳадди аксар кардани мукофоти умумии дисконтшуда аст:

\[ J(\theta)=E_t\left[\sum_{t=0}^{T}\gamma^t r_t\right] \]

Дар ин ҷо γ коэффисиенти дисконт аст. Дар таҷрибаҳо γ = 0,99 истифода шудааст. Ин қимати баланд нишон медиҳад, ки модел тавре танзим шудааст, ки на танҳо қарори навбатӣ, балки натиҷаҳои иқтисодии баъдиро низ муҳим ҳисоб кунад.

Чаро PPO интихоб шуд?

PPO алгоритми градиенти сиёсат аст. Ҳадафи асосӣ устувортар кардани омӯзиш тавассути пешгирӣ аз тағйироти аз ҳад калон дар сиёсат дар ҳар қадами омӯзиш мебошад.

Функсияи ҳадафи буридашудаи PPO, ки дар таҳқиқот истифода шудааст:

\[ L^{CLIP}(\theta) = E_t \left[ \min \left( r_t(\theta)\hat{A}_t, \operatorname{clip}(r_t(\theta),1-\epsilon,1+\epsilon)\hat{A}_t \right) \right] \]

чунин дода шудааст.

Таносуби эҳтимолият дар ин ҷо:

\[ r_t(\theta)= \frac{\pi_\theta(a_t|s_t)} {\pi_{\theta_{old}}(a_t|s_t)} \]

зичии эҳтимолияти сиёсати нав ва сиёсати кӯҳнаро барои як амали яксон муқоиса мекунад. ε = 0,2 параметри буриш барои пешгирӣ аз аз ҳад калон шудани навсозӣ кӯмак мекунад.

Generalized Advantage Estimation чӣ кор мекунад?

Модел барои баҳодиҳии арзиши бартарӣ аз Generalized Advantage Estimation (GAE) истифода мебарад. Дар манбаъ:

\[ \hat A_t= \delta_t+ (\gamma\lambda)\delta_{t+1} +\ldots+ (\gamma\lambda)^{T-t+1}\delta_{T-1} \]

ва:

\[ \delta_t=r_t+\gamma V(s_{t+1})-V(s_t) \]

ифодаҳо оварда шудаанд.

Дар таҷрибаҳо барои GAE λ = 0,95 интихоб шудааст. Ҳадаф эҷоди тавозуни мувофиқ байни ғараз ва вариатсия дар баҳодиҳии бартарӣ мебошад.

Actor ва Critic чӣ кор мекунанд?

PPO-P³OS аз ду ҷузъи шабакаи нейронӣ иборат аст.

Actor, сиёсатеро ифода мекунад, ки аз ҳолати ҷорӣ қарорҳои нарх ва истеҳсолро мебарорад. Амалҳои пайваста тавассути тақсимоти Гаусс модел карда мешаванд.

Critic бошад функсияи арзишеро меомӯзад, ки мукофоти интизоршавандаро аз ҳолати муайян ба баъд арзёбӣ мекунад.

Дар насби таҷрибавӣ гуфта мешавад, ки ду қабати пинҳонӣ аз 256 ва 128 нейрон иборатанд ва фаъолсозии ReLU истифода шудааст. Дар бахши усул шабакаҳо ҳамчунин ҳамчун “се қабати пурра пайваст” тавсиф мешаванд; манбаъ ба таври возеҳ намегӯяд, ки қабати баромадро ҳисоб мекунад ё не.

Модел чӣ гуна омӯзонида шуд?

ПараметрҚимате, ки дар манбаъ дода шудааст
НармафзорPyTorch 2.2
Эпизоди омӯзиш1000
Қадами вақт дар як эпизод200
Қабатҳои пинҳонӣ256 ва 128 нейрон
ФаъолсозӣReLU
Суръати омӯзиш3 × 10−4
Коэффисиенти дисконт γ0,99
Таносуби PPO clip ε0,2
Андозаи batch128
GAE λ0,95
Шумораи такрори таҷриба5

Ҳамчун сахтафзор протсессори Intel Core i9-13900K, 64 GB RAM ва NVIDIA RTX 4090 GPU истифода шудааст.

Оё маҷмӯи додаҳо воқеан додаҳои заводӣ аст?

Қисман. Таҳқиқот маҷмӯи додаҳоро ҳамчун омезиши додаҳои воқеии корхона ва додаҳои синтетикии симулятсионӣ тавсиф мекунад.

Гуфта мешавад, ки ҷузъи додаҳои воқеӣ аз сабтҳои ERP ва Manufacturing Execution System (MES)-и як корхонаи миёнаҳаҷми истеҳсоли молҳои истеъмолӣ дар солҳои 2021–2023 гирифта шудааст.

Аммо номи ширкат, кишвари ҷойгиршавӣ, ҷузъиёти маҳсулот ва ҳиссаи сабтҳои воқеӣ дар байни 36.000 намунаи умумӣ дода нашудаанд. Бо вуҷуди тақрибан се соли додаҳои воқеӣ, навишта шудааст, ки маҷмӯи умумии додаҳо тақрибан аз 36.000 намуна иборат буда, ҳар намуна “вазъи амалиётии якрӯза”-ро ифода мекунад. Аз ин рӯ, миқёс ва усули васеъкунии синтетикии маҷмӯи додаҳо барои такрористеҳсоли натиҷаҳо муҳим, вале нокифоя шарҳдодашуда аст.

Дар додаҳо кадом тағйирёбандаҳо ҳастанд?

Муҳаққиқон 12 хусусияти миқдорӣ ва ду хусусияти категориявиро гузориш медиҳанд.

Тағйирёбандаҳои истеҳсол:

  • ҳаҷми истеҳсоли рӯзона,
  • сатҳи истифодаи мошин,
  • дастрасии ашёи хом.

Тағйирёбандаҳои бозор:

  • талаботи бозор,
  • нархи миёнаи рақибон,
  • индекси мавсимият.

Тағйирёбандаҳои хароҷот:

  • хароҷоти истеҳсол барои як воҳид,
  • хароҷоти энергия,
  • хароҷоти логистика.

Тағйирёбандаҳои даромаднокӣ:

  • нархи воқеии фурӯш,
  • фоидаи рӯзона,
  • сатҳи захира.

Тағйирёбандаҳои категориявӣ навъи маҳсулот ва минтақаи бозор мебошанд. Гуфта мешавад, ки хусусиятҳо бо усули миқёспардозии min–max нормализатсия шудаанд.

Қабати таҳлили тиҷоратӣ чӣ илова мекунад?

Таҳқиқот на танҳо тавлиди амал аз ҷониби сиёсати PPO, балки тафсири қарорҳои омӯхташуда бо мафҳумҳои иқтисодӣ, аз ҷумла чандирии талабот ва хароҷоти маржиналиро низ ҳадаф мегузорад.

Аммо дар манбаъ барои ин қабати “business analytics” ҷадвали ҷудогонаи тасдиқ, метрикаи шарҳпазирӣ ё омӯзиши корбарон бо менеҷерон дода нашудааст. Аз ин рӯ, бахши дастгирии қарорҳои шарҳпазир яке аз ҳадафҳои тарроҳии модел аст; он модули ҷудогонае нест, ки ба таври таҷрибавӣ муфассал арзёбӣ шуда бошад.

Муҳимтарин натиҷаи рақамии мақола чист?

Ҷадвали 1 чор усулро муқоиса мекунад:

МоделФоидаи миёна (×10³ USD)Вариатсияи фоида (%)Хавфи захира (%)Талафоти ниҳоӣАрзёбии наздикшавӣ
Q-Learning48,612,510,70,61Миёна
DQN52,39,89,30,47Миёна
A2C55,17,08,50,36Устувор
PPO-P³OS62,26,07,10,23Хеле устувор

Verianla Live: Муқоисаи фоидаи миёна дар моделҳои истеҳсол ва нархгузорӣ

Қиматҳои хоми фоидаи миёна, ки дар Ҷадвали 1-и мақола гузориш шудаанд, нишон дода мешаванд. Азбаски дар муқоисаҳои фоизии манбаъ номувофиқии хатти базавӣ вуҷуд дорад, визуализатсия танҳо ба қиматҳои хоми мустақиман гузоришшуда такя мекунад.

МоделФоидаи миёна (×10³ USD)Манбаъ
Q-Learning48,6Ҷадвали 1
DQN52,3Ҷадвали 1
A2C55,1Ҷадвали 1
PPO-P³OS62,2Ҷадвали 1
 

Verianla Live: График дар браузер аз ҷадвали намоёни додаҳои илмӣ сохта мешавад. Қиматҳо ба таҷрибаи симулятсия/benchmark-и манбаъ тааллуқ доранд; онҳо натиҷаҳои молиявии тасдиқшудаи заводи воқеӣ бо PPO нестанд.

Афзоиши %12,8-и фоида маҳз нисбат ба чӣ аст?

Дар матни худи мақола дар ин ҷо номувофиқӣ ҳаст.

Ҳангоми истифодаи Ҷадвали 1 фарқи фоида байни PPO-P³OS ва рақиби қавитарин A2C чунин аст:

\[ \frac{62.2-55.1}{55.1}\times100 \approx 12.9\% \]

мебошад. Ин ба ибораи бахши натиҷаҳо — “нисбат ба беҳтарин baseline A2C тақрибан %12,8” — мувофиқат мекунад.

Аммо агар DQN ҳамчун база гирифта шавад:

\[ \frac{62.2-52.3}{52.3}\times100 \approx 18.9\% \]

ба даст меояд.

Аз ин рӯ, дар хулоса ва бахши натиҷаҳо пешниҳоди %12,8 нисбат ба DQN бо Ҷадвали 1 мувофиқат намекунад.

Оё дар хавфи захира ҳам ҳамин мушкил ҳаст?

Бале. Хавфи захираи A2C %8,5 ва PPO-P³OS %7,1 аст:

\[ \frac{8.5-7.1}{8.5}\times100 \approx 16.5\% \]

Ин қимат бо иддаои %16,4-и мақола мувофиқ аст ва нишон медиҳад, ки хатти базавӣ A2C мебошад.

Агар қимати %9,3-и DQN истифода шавад, коҳиши PPO-P³OS тақрибан %23,7 мешавад. Пас %16,4 муқоисаи DQN нест.

Вазъ бо талафоти ниҳоӣ чӣ гуна аст?

Талафоти ниҳоии DQN 0,47 ва PPO-P³OS 0,23 аст. Аз қиматҳои хоми ҷадвал:

\[ \frac{0.47-0.23}{0.47}\times100 \approx 51.1\% \]

коҳиш ҳисоб карда мешавад. Ин қимат ба коҳиши тақрибан %50,9-и талафоти ниҳоӣ дар мақола наздик аст ва ин дафъа бармеояд, ки муқоиса воқеан бо DQN анҷом шудааст.

Аз ин рӯ, манбаъ дар як ҷумлаи хулосавӣ барои нишондиҳандаҳои гуногуни самаранокӣ хатҳои базавии гуногунро омехта кардааст.

Расми 2 ба мо чӣ нишон медиҳад?

Дар Расми 2 ду каҷи омӯзиш ҳаст. Дар графики аввал фоидаи миёна аз тақрибан 50×10³ USD оғоз шуда, дар чандсад эпизоди аввал босуръат меафзояд ва бо наздик шудан ба эпизоди 1000 тақрибан дар атрофи 62×10³ USD ба плато мерасад.

Дар графики дуюм талафоти омӯзиш аз тақрибан 1,05 пайваста коҳиш ёфта, дар эпизоди 1000 ба тақрибан 0,22–0,23 мерасад.

Ин ду каҷ нишон медиҳанд, ки раванди омӯзиши модел дар муҳити додашудаи омӯзиш устувор шудааст. Аммо коҳиши талафоти омӯзиш ва афзоиши фоидаи симулятсионӣ худ аз худ исбот намекунад, ки модел дар корхонаҳои воқеии истеҳсолӣ ҳамон натиҷаи иқтисодиро хоҳад дод.

Оё PPO-P³OS воқеан сиёсати “оптималӣ”-ро ёфт?

Таҳқиқот мегӯяд, ки модел сиёсати “optimal” ё “near-optimal”-ро омӯхтааст. Бо вуҷуди ин, дар таҷрибаҳо таҳлили optimality-gap пешниҳод нашудааст, ки дар он оптимуми воқеии глобалии математикӣ маълум бошад ва натиҷаи PPO бо он муқоиса шавад.

Аз ин рӯ, натиҷаҳоро бо эҳтиёт чунин тавсиф кардан бехатартар аст: сиёсати омӯхташудае, ки дар муҳити симулятсионии баррасишуда нисбат ба усулҳои baseline-и санҷидашуда самаранокии баландтари гузоришшударо таъмин кардааст.

Таҳқиқот чиро дастгирӣ мекунад?

  • Нарх ва ҳаҷми истеҳсолро метавон дар доираи як масъалаи ягонаи назорати пайваста якҷоя модел кард.
  • PPO дар муҳити симулятсионии ин таҳқиқот нисбат ба Q-Learning, DQN ва A2C фоидаи миёнаи баландтари гузоришшударо ба даст овардааст.
  • PPO-P³OS дар байни моделҳои муқоисашудаи Ҷадвали 1 пасттарин вариатсияи фоида ва хавфи захираро дорад.
  • Дар давоми 1000 эпизоди омӯзиш каҷи фоида боло рафта ва каҷи талафот поён рафтааст.
  • Илова кардани номувозинатии захира ҳамчун ҷазо ба функсияи мукофот имкон медиҳад, ки на танҳо маржаи кӯтоҳмуддат, балки тавозуни амалиётӣ низ ҳадаф қарор гирад.
  • Танзими якҷояи нарх ва ҳаҷми истеҳсол дар фазоҳои амалии пайваста метавонад барои PPO соҳаи табиии татбиқ бошад.

Таҳқиқот чиро исбот намекунад?

  • Исбот намекунад, ки PPO-P³OS дар корхонаи воқеии истеҳсолӣ %12,8 фоидаи бештар медиҳад.
  • Модел дар амалиёти заводӣ дар вақти воқеӣ ба таври зинда ҷорӣ нашудааст.
  • Ҳамаи 36.000 намуна мушоҳидаи воқеии завод нестанд.
  • Нишон дода нашудааст, ки додаҳои синтетикӣ тағйироти воқеии бозорро пурра намояндагӣ мекунанд.
  • Барои фарқиятҳои иқтисодии байни моделҳо фосилаи эътимод ё санҷиши аҳамияти оморӣ дода нашудааст.
  • Нишон дода нашудааст, ки сиёсати PPO ба оптимуми глобалии математикӣ расидааст.
  • Исбот нашудааст, ки ҷузъи додаҳои воқеӣ аз як корхона ба ҳамаи бахшҳои истеҳсолӣ умумӣ карда шавад.
  • Қабати таҳлили тиҷоратӣ бо омӯзиши корбарӣ ё саҳроӣ санҷида нашудааст, ки сифати қарорҳои воқеии менеҷеронро баланд мекунад.

Усул ва Натиҷаҳои Таҳқиқот

Сохтори додаҳои таҷрибавӣ

Ҷузъи додаҳои воқеии таҳқиқот аз сабтҳои ERP ва MES-и як корхонаи миёнаҳаҷми истеҳсолӣ дар бахши молҳои истеъмолӣ барои солҳои 2021–2023 гирифта шудааст. Гуфта мешавад, ки ба онҳо додаҳои синтетикии симулятсионӣ илова карда шуда, маҷмӯи додаҳои тақрибан 36.000 намуна сохта шудааст.

Муаллифон ҳар намунаро ҳамчун вазъи амалиётии якрӯза таъриф мекунанд. Аммо алоҳида дода нашудани шумораи намунаҳои воқеӣ/синтетикӣ ва тавсифи нокифояи раванди тавлиди додаҳои синтетикӣ яке аз маҳдудиятҳои асосии такрористеҳсолпазирии таҳқиқот аст.

Алгоритмҳои муқоисашуда

PPO-P³OS бо се baseline муқоиса шудааст:

  • Q-Learning,
  • Deep Q-Network (DQN),
  • Advantage Actor-Critic (A2C).

Меъёрҳои арзёбӣ фоидаи миёна, вариатсияи фоида, хавфи захира, талафоти ниҳоӣ ва устувории наздикшавӣ мебошанд.

Натиҷаҳои хоми таҷрибавӣ

МеъёрQ-LearningDQNA2CPPO-P³OS
Фоидаи миёна (×10³ USD)48,652,355,162,2
Вариатсияи фоида (%)12,59,87,06,0
Хавфи захира (%)10,79,38,57,1
Талафоти ниҳоӣ0,610,470,360,23

Ҷадвали хом нишон медиҳад, ки PPO-P³OS дар ҳамаи чор меъёр нисбат ба моделҳои baseline-и муқоисашуда қиматҳои рақамии беҳтар додааст.

Маълумоти нокифоя барои такрористеҳсолпазирӣ

Гарчанде таҳқиқот гиперпараметрҳои омӯзишро нисбатан муфассал медиҳад, барои пурра бозтавлид кардани таҷриба баъзе маълумоти муҳим намерасад:

  • ҳаҷми дақиқи маҷмӯи додаҳои воқеӣ,
  • шумораи намунаҳои синтетикӣ,
  • муодилаҳо ё тақсимоти тавлиди додаҳои синтетикӣ,
  • контексти муфассали корхона ва бозор,
  • усули тақсимоти train/validation/test,
  • тухмҳои тасодуфӣ,
  • гиперпараметрҳои муфассали алгоритмҳои baseline,
  • инҳирофи стандартӣ ё фосилаи эътимод барои панҷ такрор,
  • коди манбаъ ё маҷмӯи кушодаи додаҳои таҷрибавӣ.

Аз ин рӯ, бозтавлиди натиҷаҳо аз ҷониби гурӯҳи мустақил дар ҳамон шароит бо маълумоти дар манбаъ додашуда маҳдуд мемонад.

Мушкилоти якпорчагии истинодҳо

Дар бахши адабиёти мақола баъзе мувофиқатҳои матн–манбаъ мушкилнок менамоянд. Дар муқаддима [1] барои дастгирии татбиқи хулосабарории сабабӣ дар асоси омӯзиши мошинӣ истифода шудааст; аммо [1] дар рӯйхати адабиёт таҳқиқоти соли 2012 оид ба максимизатсияи фоидаи омехтаи маҳсулот бо барномарезии хаттӣ мебошад.

Дар Бахши 2.1 ба таҳқиқоти пешгӯии талабот ба қисмҳои эҳтиётӣ дар асоси регрессия, ANN ва SVR, ки гуфта мешавад “Aktepe et al.” анҷом додаанд, истиноди [5] дода шудааст. Аммо [5] дар рӯйхати адабиёт кори arXiv-и Zhuang ва ҳамкорон бо номи “Behavior Proximal Policy Optimization” аст.

Ин ҳолат натиҷаҳои асосии таҷрибавии PPO-ро худкор беэътибор намекунад; аммо нишон медиҳад, ки баъзе изҳороти дастгирии бахши адабиёт набояд бе санҷиши манбаъ такрор шаванд.

Барои гузариш ба татбиқи саноатӣ чӣ лозим аст?

Барои интиқоли ин равиш ба корхонаи воқеии истеҳсолӣ, ғайр аз муваффақияти симулятсия, тасдиқи иловагӣ лозим аст. Ҳадди ақал иқтидори воқеии истеҳсол, вайроншавии мошинҳо, муҳлатҳои таҳвил, муҳлати нигоҳдории маҳсулот, ҳадди ақали фармоиш, маҳдудиятҳои баст, муҳлатҳои таъминот, чандирии нарх, вокунишҳои рақобатии нарх ва фурӯши аздастрафта бояд эҳтимол ба модел ворид карда шаванд.

Илова бар ин, дар низоме, ки зеҳни сунъӣ нархро мустақиман муайян мекунад, бояд ҳудудҳои идоракунӣ, қоидаҳои нархи ҳадди ақал–ҳадди аксар, тасдиқи инсон, қабатҳои амниятӣ ва сиёсатҳои бозгашт дар шароити ғайричашмдошти бозор мавҷуд бошанд. Инҳо дар таҳқиқоти манбаъ ба таври таҷрибавӣ санҷида нашудаанд.

Аз нуқтаи назари Туркия чӣ гуна бояд арзёбӣ шавад?

Манбаъ додаҳои завод ё бозор аз Туркия надорад. Аз ин рӯ, қиматҳои фоида ва самаранокии захираи таҳқиқотро мустақиман ба корхонаҳои истеҳсолии Туркия интиқол додан мумкин нест.

Бо вуҷуди ин, равиш метавонад барои таҳқиқоти пилотӣ дар корхонаҳои истеҳсолии Туркия, ки ERP, MES, хароҷоти истеҳсол, захира, талабот ва таърихи нархро якҷоя нигоҳ медоранд, чорчӯбаи таҳқиқотӣ пешниҳод кунад. Дар татбиқи маҳаллӣ модел бояд бо иқтидор, хароҷот, фармоиш, қурби асъор, энергия ва динамикаи занҷири таъминоти худи ширкат аз нав омӯзонида шуда, пеш аз амалиёти воқеӣ дар режими соя тасдиқ карда шавад.

Ёддошти Манбаъ ва Усул

Номи пурраи таҳқиқоти аслӣ: Profit-Oriented Production and Pricing Optimization for Manufacturing Enterprises Using Proximal Policy Optimization

Муаллифон: Pingmei Fan, Hanwu Li, Mengdie Hu.

Тартиби муаллифон: Тартиби манбаи аслӣ бетағйир нигоҳ дошта шудааст.

Муаллифи масъул: Pingmei Fan.

Ҳаммуаллифи аввал/саҳми баробар: Дар манбаъ изҳорот дар бораи ҳаммуаллифи аввал ё саҳми баробар вуҷуд надорад.

Муассиса 1: Guangxi Vocational Normal University, Nanning, Guangxi, China.

Муассиса 2: Amazon.com Services LLC, Bellevue, Washington, USA.

Муассиса 3: Systems Engineering, University of Pennsylvania, Philadelphia, Pennsylvania, USA.

Навъи манбаъ: Таҳқиқоти ҳисоббарорӣ/моделсозӣ ва симулятсионӣ дар асоси омӯзиши тақвиятӣ.

Маҷалла: Economics and Management Innovation.

Ҷилд / шумора: Vol. 3, No. 2 (2026).

Саҳифаҳо: 8–17.

DOI: 10.71222/zsm3tb33

Санаи ирсол: 1 январи 2026.

Санаи бозбинӣ: 25 феврали 2026.

Санаи қабул: 12 марти 2026.

Санаи нашр: 18 марти 2026.

Пайванди расмии мақола: https://doi.org/10.71222/zsm3tb33

Ҳолати рецензия/нашр: Саҳифаи ношири Economics and Management Innovation маҷалларо рецензияшаванда ва дорои раванди рецензияи дуҷонибаи нобино тавсиф мекунад; сиёсати муаллифии GBP мегӯяд, ки барои корҳои нашршуда ҳадди ақал ду гузориши мустақили рецензент пешбинӣ мешавад. Гузоришҳои рецензияи сатҳи мақола дар ҷараёни ин баррасӣ ба таври оммавӣ тасдиқ нашудаанд.

Литсензия: Дар PDF-и манбаъ гуфта мешавад, ки кор барои нашри эҳтимолии дастрасии кушода таҳти литсензияи Creative Commons Attribution пешниҳод шудааст. Сиёсати умумии ҷории нашри GBP мегӯяд, ки мақолаҳои нашршуда таҳти CC BY 4.0 мебошанд.

Маблағгузорӣ: Дар матни мақолаи баррасишуда изҳороти ҷудогонаи маблағгузории махсуси ин таҳқиқот вуҷуд надорад.

Дастрасии додаҳо: Дар мақолаи баррасишуда Data Availability Statement-и ҷудогона вуҷуд надорад. Ҳувияти додаҳои воқеии корхона ифшо нашудааст ва барои маҷмӯи додаҳо пайванди репозитории кушода дода нашудааст.

Бархӯрди манфиатҳо: Дар мақолаи баррасишуда изҳороти ҷудогонаи бархӯрди манфиатҳои махсуси таҳқиқот аз ҷониби муаллифон вуҷуд надорад.

Кумитаи этика: Дар матни баррасишуда изҳороти кумитаи этикаи махсуси ин таҳқиқот вуҷуд надорад.

CRediT/саҳми муаллифон: Дар манбаъ бахши ҷудогонаи CRediT ё саҳми муаллифон вуҷуд надорад.

Фарогирии додаҳо: Мақола маҷмӯи додаҳои тақрибан 36.000 намунагиро гузориш медиҳад, ки додаҳои воқеии корхона бо додаҳои синтетикии симулятсионӣ якҷоя шудаанд. Ҷузъи воқеӣ аз сабтҳои ERP ва MES-и истеҳсолкунандаи миёнаҳаҷми молҳои истеъмолӣ дар солҳои 2021–2023 гирифта шудааст. Миқдори ҷудогонаи намунаҳои воқеӣ ва синтетикӣ ошкор нашудааст.

Маҳдудияти асосии методологӣ: Таҳқиқот ҷойгиркунии вақти воқеӣ дар завод нест. Натиҷаҳо самаранокии benchmark мебошанд, ки дар муҳити таҷрибавии сохташуда ба даст омадаанд. Азбаски тавлиди додаҳои синтетикӣ, усули тақсимоти додаҳо, гиперпараметрҳои baseline ва ченакҳои номуайянии байни такрорҳо ба қадри кофӣ муфассал гузориш нашудаанд, такрористеҳсолпазирии мустақил маҳдуд аст.

Номувофиқии самаранокӣ дар дохили манбаъ: Мувофиқи Ҷадвали 1, фоидаи миёнаи 62,2×10³ USD-и PPO-P³OS аз қимати 55,1×10³ USD-и A2C тақрибан %12,9 баландтар аст ва хавфи захира аз %8,5-и A2C то %7,1 дар PPO-P³OS коҳиш ёфта, тақрибан %16,5 кам мешавад. Агар DQN база гирифта шавад, ҳамин фарқҳо мутаносибан тақрибан %18,9 ва %23,7 мебошанд. Бо вуҷуди ин, дар хулоса ва бахши натиҷаҳо афзоиши %12,8-и фоида ва коҳиши %16,4-и захира ҳамроҳ бо DQN зикр мешаванд. Коҳиши тақрибан %50,9-и талафоти ниҳоӣ бошад ба муқоисаи DQN мувофиқ аст. Дар ин матни Verianla қиматҳои хоми ҷадвал асос гирифта шудаанд.

Ёддошти истилоҳот: Дар хулоса ва бахши натиҷаҳои манбаъ афзоиши самаранокӣ “cumulative profit” номида мешавад, дар ҳоле ки меъёри истифодашуда дар Ҷадвали 1 ва Расми 2 “Average Profit” аст. Ин ду ифода баробар ҳисобида нашудаанд.

Ёддошти якпорчагии адабиёт: Баъзе истинодҳои дохилиматнии мақола бо рӯйхати адабиёт мувофиқат намекунанд. Махсусан, байни таҳқиқоте, ки манбаъҳои [1] ва [5] дар матн ба онҳо пайваст шудаанд, ва корҳое, ки дар рӯйхати адабиёт оварда шудаанд, номувофиқии ошкори мавзӯъ/муаллиф вуҷуд дорад.

Маҳдудияти мундариҷаи илмӣ: Сохтори модел, муодилаҳо, хусусиятҳои додаҳо, гиперпараметрҳо, каҷҳои омӯзиш ва натиҷаҳои самаранокии ин мақолаи Verianla ба таҳқиқоти аслӣ асос ёфтаанд. Манбаъҳои беруна танҳо барои тасдиқи ҳувияти библиографӣ, DOI, маҷалла ва сиёсати рецензия/литсензияи ношир истифода шудаанд.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо