Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Илми компютер / Чаҳорчӯбаи Гибридии Фаҳмондашавандаи Зеҳни Сунъӣ барои Credit Scoring-и Нуқтаи Фурӯш дар Вақти Воқеӣ
Илми компютер

Чаҳорчӯбаи Гибридии Фаҳмондашавандаи Зеҳни Сунъӣ барои Credit Scoring-и Нуқтаи Фурӯш дар Вақти Воқеӣ

Ин таҳқиқот аз ин андеша оғоз мекунад, ки барои қарзҳои нуқтаи фурӯш, ки дар кассаи мағоза бояд дар давоми чанд сад миллисония қарор оид ба қарз қабул шавад, як модели ягонаи зеҳни сунъӣ наметавонад дар ҳама шароит кофӣ бошад.

19/08/2026  Veri Anla 33 боздид
Чаҳорчӯбаи Гибридии Фаҳмондашавандаи Зеҳни Сунъӣ барои Credit Scoring-и Нуқтаи Фурӯш дар Вақти Воқеӣ

Ин таҳқиқот аз ин андеша оғоз мекунад, ки барои қарзҳои нуқтаи фурӯш, ки дар кассаи мағоза бояд дар давоми чанд сад миллисония қарор оид ба қарз қабул шавад, як модели ягонаи зеҳни сунъӣ наметавонад дар ҳама шароит кофӣ бошад. Муҳаққиқон ба ҷойи ин меъмории гибридиро таҳия мекунанд, ки ду ниёзи гуногуни амалиётиро ҷудо месозад: дар канали вақти воқеӣ — scorecard-ҳои фаҳмондашаванда ва камтаъхири Weight of Evidence–Logistic Regression; дар канали шабонаи batch бошад — ensemble-и калибршуда аз LightGBM, CatBoost ва шабакаи нейронии сеқабата, ки метавонад аз маълумоти ғанитари муштарӣ истифода барад.

Таҳқиқот дар асоси 806.537 сабти таҳлилӣ аз портфели истеҳсолии як бонки бузурги дараҷаи дуюм дар Қазоқистон гузаронида шудааст. Тағйирёбандаи ҳадаф NPL91_EVER мебошад, ки нишон медиҳад оё қарз дар давоми умри мушоҳидашудаи худ ҳадди ақал як маротиба ба таъхири 90 ё бештар рӯз дучор шудааст ё не. Сатҳи default дар намунаи таҳлилӣ %10,22 мебошад.

Барои муштариёни мавҷуда модели вақти воқеии LR-Old дар маҷмӯи test:

\[ AUROC=0{,}8475,\qquad KS=0{,}5555,\qquad Gini=0{,}6950 \]

ба натиҷа расид. Ens-Off ensemble, ки маҷмӯи васеътари маълумоти offline-ро истифода мебарад, дар ҳамон когорти муштариёни мавҷуда:

\[ AUROC=0{,}9178,\qquad KS=0{,}6825,\qquad Gini=0{,}8356 \]

арзишҳоро дод. Ҳамин тариқ, арзиши test Gini тақрибан 0,141 нуқтаи мутлақ афзуд. Барои муштариёни нав арзиши test AUROC-и модели LR-New 0,8348 гузориш шудааст.

Аммо ин натиҷаҳо барои кишварҳо ё бонкҳои дигар кафолати омодаи муваффақият нестанд. Ҳамаи маълумоти таҳқиқот аз як муассиса гирифта шудаанд; маҷмӯаҳои train, test ва validation аз ҳамон портфели 2023–2024 ба таври тасодуфӣ ташкил шудаанд. Санҷиши воқеии out-of-time ва validation-и беруна дар портфели дуюм ҳанӯз анҷом дода нашудааст.

Чаро credit scoring дар нуқтаи фурӯш масъалаи дигар аст?

Қарзи POS маънои онро дорад, ки муштарӣ ҳангоми харидани мол дар мағоза дар ҳамон амалиёт барои қарзи истеъмолии хурд ё миёна муроҷиат мекунад. Дар ин сенария модели хавфи қарзӣ на танҳо бояд дақиқии баланди пешгӯӣ дошта бошад; қарор оид ба қарз бояд он қадар зуд қабул шавад, ки муштариро дар касса мунтазир нагузорад.

Дар таҳқиқоти манбаъ ҳудуди амалиётӣ тақрибан:

\[ <300\ \mathrm{ms} \]

ҳамчун сатҳи хидматрасонии XML round-trip муайян шудааст.

Ҳамзамон гуфта мешавад, ки аз муштарӣ дар касса гирифтани маълумоти аз ҳад зиёд метавонад conversion-и фурӯшро коҳиш диҳад, бинобар ин payload-и вақти воқеӣ хеле маҳдуд нигоҳ дошта мешавад.

Ин ду талаб дар хавфи қарзӣ як зиддияти классикии муҳандисиро ба вуҷуд меоранд:

Хусусиятҳои бештар одатан метавонанд қудрати пешгӯии баландтар диҳанд; аммо ҳамаи ин хусусиятҳо дар лаҳзаи қарор дастрас ё ба қадри кофӣ зуд гирифташаванда набошанд.

Меъмории dual-track чӣ маъно дорад?

Таҳқиқот ба ҷойи маҷбур кардани як модели ягона барои ҳалли ин зиддият, онро ба ду канал ҷудо мекунад.

КаналМоделҲадафи асосӣЗамонбандии дар манбаъ додашуда
OnlineWOE–Logistic RegressionҚарори қарзии фаҳмондашаванда ва камтаъхир дар кассаВақти воқеӣ; ҳадафи XML round-trip <300 ms
OfflineLightGBM + CatBoost + шабакаи нейронӣ stacked ensembleҚудрати баландтари ҷудокунии синфҳо ва PD-и калибршуда бо маълумоти васеътари муштарӣBatch-и шабона

Дар ҳоле ки канали online мустақиман ба қарори қарзӣ хизмат мекунад, баромади модели offline ба анбори customer-360 ва қабати маълумоти хавфи IFRS 9 бознависӣ мешавад.

Номувофиқии дохилиманбаъӣ дар шумораи хусусиятҳои online

Дар ин нуқта мақола дар дохили худ комилан мувофиқ нест. Бахши 3.5 ва Шакли 1 roster-и online-ро:

9 майдони application XML + 4 майдони bureau-и пешакӣ нигоҳдошташуда

нишон медиҳанд.

Баръакс, Ҷадвали 2, Шакли 2 ва таърифи модел LR-Old ва LR-New-ро:

моделҳои 9-хусусиятӣ

гузориш мекунанд.

Манбаъ равшан намекунад, ки 4 майдони bureau ба муҳаррики қарор фиристода шуда, аз дохили нӯҳ хусусияти ниҳоӣ интихоб мешаванд ё воқеан 13 вуруд истифода мешаванд. Аз ин рӯ ҳангоми татбиқи дубораи модел feature roster-и истеҳсолӣ бояд бо муаллифон тасдиқ карда шавад.

Маҷмӯи маълумот чӣ гуна сохта шуд?

Манбаъ дар оғоз мегӯяд, ки:

\[ N=926.000 \]

шартномаи қарзи POS вуҷуд дошт.

Пас аз хориҷ кардани:

\[ 119.463 \]

сабте, ки аз тарафи муштарӣ бекор карда шуда, рафтори пардохти онҳо мушоҳида намешуд:

\[ N=806.537 \]

намунаи таҳлилӣ боқӣ монд.

Тақсимоти синфҳо:

\[ 89{,}78\%\ \text{non-default}, \qquad 10{,}22\%\ \text{default} \]

дода шудааст.

Default чӣ гуна муайян карда шуд?

Тағйирёбандаи вобаста:

\[ y_i=NPL91\_EVER_i \]

таъриф мешавад.

Агар шартнома дар давоми муҳлати мушоҳидашудаи худ дар ягон вақт ҳадди ақал:

\[ 90\ \text{gün} \]

ба таъхир афтад:

\[ y_i=1 \]

нишон дода мешавад.

Ин сохтор нишон медиҳад, ки модел на маблағи пайвастаи пардохт, балки рух додан ё надодани ҳодисаи муайяншудаи default-ро пешгӯӣ мекунад ва классификатори бинарӣ мебошад.

Оё тамоми олами дархостҳо намояндагӣ мешавад?

Манбаъ дар баъзе бахшҳо маълумотро “contracts” ва дар баъзе бахшҳо “loan applications” меномад. Шарҳ дода намешавад, ки дархостҳои радшуда, ки рафтори минбаъдаи пардохти онҳо мушоҳида намешавад, ба маҷмӯи таҳлилӣ дохил шудаанд ё не.

Ҳамчунин ягон усули марбут ба reject inference, ки дар хавфи қарзии классикӣ истифода мешавад, нишон дода нашудааст.

Аз ин рӯ аз манбаъ дақиқ муайян кардан имкон надорад, ки 806.537 сабт тамоми олами дархостҳои қарзи POS-ро намояндагӣ мекунад ё асосан шартномаҳои дорои натиҷаи пардохти мушоҳидашавандаро. Ин фарқ барои интиқолпазирии модел ба популятсияи нави дархосткунандагон муҳим аст.

Чаро муштариёни мавҷуда ва нав ҷудо карда мешаванд?

Портфел ба:

\[ N_{\mathrm{old}}=455.827 \]

муштарии мавҷуда ва:

\[ N_{\mathrm{new}}=350.710 \]

муштарии нав ҷудо шудааст.

Сабаб он аст, ки барои шахсоне, ки пештар бо бонк муносибат доштанд, хусусиятҳои таърихӣ мисли ҳаракати пасандоз, рафтори транзаксионӣ ё ҷараёни дохилии нақдӣ вуҷуд дошта метавонанд; барои муштариёни нав бошад, ҳамон маҷмӯи сигналҳо дастрас набошад.

Оилаҳои хусусиятҳо кадомҳоянд?

Аз 148 тағйирёбандаи номзади ибтидоӣ пас аз филтркунӣ 101 тағйирёбанда нигоҳ дошта шудааст. Манбаъ бинобар махфияти бонкӣ номи воқеии сутунҳои истеҳсолиро ошкор намекунад ва танҳо оилаҳои семантикиро медиҳад.

Оилаи хусусиятШумора пас аз филтрМазмуни умумӣ
fcb_31Хусусиятҳои бюрои қарзӣ
app_9Майдонҳои application XML
prod_4Таксономияи маҳсулоти қарзӣ
trans_18Намунаҳои транзаксия/хароҷот
depo_11Динамикаи бақияи пасандоз
bank_13Хусусиятҳои воридшавии нақди дохилии бонк
geo_6Хусусиятҳои хавфи геомаконии вобаста ба суроға
behav_9Рафтори сессияи рақамӣ

Интихоби хусусиятҳо чӣ гуна анҷом дода шуд?

Се остонаи асосӣ татбиқ шуд:

\[ IV\geq0{,}10 \]

\[ missingness\leq80\% \]

\[ |\rho|\leq0{,}70 \]

Аз ҷуфтҳои тағйирёбандаҳои дорои коррелятсияи баланд, хусусияте хориҷ шуд, ки Information Value-и пасттар дошт.

Оё арзишҳои баланди Information Value метавонистанд leakage бошанд?

Азбаски баъзе тағйирёбандаҳои бюрои қарзӣ ба:

\[ IV>0{,}50 \]

расида буданд, назорати иловагии leakage гузаронида шуд.

Манбаъ панҷ санҷишро гузориш мекунад: хусусият танҳо маълумоти то вақти дархост мавҷудбударо истифода барад, аз ҷиҳати семантикӣ маълумоти post-default надошта бошад, шакли WOE аз ҷиҳати иқтисодӣ қобили қабул бошад, AUROC-и якхусусиятӣ ғайриоддӣ баланд набошад ва PSI дар байни давраҳои вақт устувор бошад.

Univariate AUROC-и пурқувваттарин хусусияти ягонаи bureau 0,781 гузориш шудааст. Таҳқиқот бар асоси ин натиҷаҳо IV-и баландро на leakage, балки сигнали қавии шиддати дархостҳои бюрои қарзӣ медонад.

Чаро WOE барои модели вақти воқеӣ интихоб шуд?

Weight of Evidence ҳар тағйирёбандаро мувофиқи сатҳҳои хавф ба bin-ҳо ҷудо карда, нисбати байни тақсимоти default ва non-default-ро логарифмӣ ифода мекунад:

\[ WOE_k= \ln \left( \frac{ P(x\in B_k\mid y=1) }{ P(x\in B_k\mid y=0) } \right). \]

Дар ин ҷо \(B_k\) bin-и \(k\)-уми тағйирёбанда, \(y=1\) синфи default ва \(y=0\) синфи non-default-ро нишон медиҳад.

Қобилияти умумии ҷудокунии як хусусият бо Information Value ҷамъбаст мешавад:

\[ IV(x)= \sum_{k=1}^{K} (\hat p_{1,k}-\hat p_{0,k})WOE_k. \]

Табдили WOE махсусан дар хавфи қарзӣ барои ба шакли муназзам, монотонӣ ва қобили баррасии инсон овардани scorecard истифода мешавад.

Скори вақти воқеӣ чӣ гуна тавлид мешавад?

Пас аз табдили WOE logistic regression бо L2 regularization татбиқ мешавад. Манбаъ скори истеҳсолиро чунин муайян мекунад:

\[ score(x) = Offset - Factor\cdot \langle\beta,WOE(x)\rangle \]

ба ин шакл муайян мекунад.

Дар ин ҷо:

\[ Factor=\frac{PDO}{\ln2} \]

ва:

\[ PDO=20 \]

интихоб шудааст.

PDO параметри классикии миқёсбандии credit scoring аст, ки нишон медиҳад ҳангоми ду баробар шудани default odds скор чанд нуқта тағйир меёбад.

Offline ensemble чӣ гуна сохта шуд?

Модели Ens-Off аз се омӯзандаи асосии гуногун истифода мекунад:

  • LightGBM,
  • CatBoost,
  • шабакаи нейронии пурра пайваст бо се блоки пинҳонӣ.

Эҳтимолҳои out-of-fold-и ҳар модел, ки дар ҷараёни stratified five-fold cross-validation тавлид шудаанд, ба logistic-regression meta-learner дода мешаванд:

\[ \hat p_i^{stack} = \sigma \left( \alpha_0 + \alpha_1\hat p_i^{LGBM} + \alpha_2\hat p_i^{CB} + \alpha_3\hat p_i^{NN} \right). \]

Дар ин ҷо:

\[ \sigma(z)=\frac{1}{1+e^{-z}} \]

функсияи logistic sigmoid мебошад.

Сипас isotonic regression танҳо ба ҳамин stacked score-и муттаҳидшуда татбиқ мешавад:

\[ \hat p_i^{cal} = g_{\mathrm{iso}} ( \hat p_i^{stack} ). \]

Яъне LightGBM, CatBoost ва шабакаи нейронӣ алоҳида калибр нашудаанд; аввал stack шуда, баъд баромади муттаҳидшуда калибр шудааст.

Меъмории шабакаи нейронӣ чӣ гуна аст?

Сохтори асосии шабакаи нейронии манбаъ:

\[ 72 \rightarrow 256 \rightarrow 128 \rightarrow 64 \rightarrow 1 \]

мебошад.

ReLU activation, batch normalisation ва:

\[ dropout=0{,}30 \]

истифода шудаанд.

Дар байни блоки дуюм ва сеюми пинҳонӣ як self-attention head илова шуда, ҳадаф моделсозии ҳамтаъсирии хусусиятҳои tabular буд.

Ҷустуҷӯи гиперпараметрҳо чӣ гуна гузаронида шуд?

Барои LightGBM, CatBoost ва шабакаи нейронӣ Optuna Tree-Structured Parzen Estimator истифода шуда, барои ҳар кадом алоҳида:

\[ 30 \]

озмоиш гузаронида шудааст.

Ҳадафи оптимизатсия AUROC-и stratified five-fold cross-validation мебошад.

Вақтҳои тахминии tuning, ки дар манбаъ дода шудаанд:

МоделВақт барои 30 озмоиши Optuna
LightGBM42 дақиқа
CatBoost78 дақиқа
Шабакаи нейронӣ96 дақиқа

Арзиши умумии tuning тақрибан 3,6 GPU-соат гузориш шудааст. Таҷҳизот NVIDIA T4 16 GB GPU, 16 vCPU ва 64 GB RAM мебошад.

Чаро random split маҳдудияти муҳим аст?

Ҳар сегменти муштарӣ:

\[ 70\%/20\%/10\% \]

ба шакли train/test/validation бо stratified random sampling ҷудо шудааст.

Ин усул hold-out-и мустақилро аз ҳамон давраи тавлиди маълумот ташкил мекунад, вале интиқолпазириро ба давраи иқтисодии оянда намесанҷад.

Дар бахши кори ояндаи худи таҳқиқот гуфта мешавад, ки аз originations-и Q2–Q4 2024 когорти воқеии out-of-time истифода хоҳад шуд. Бинобар ин натиҷаи ҳозираи validation набояд ҳамчун validation-и беруна ё замонӣ тафсир шавад.

Чаро калибрсозӣ дар хавфи қарзӣ муҳим аст?

AUROC танҳо то чӣ андоза дуруст тартиб додани муштариёни хуб ва бадро месанҷад. Дар амалияи бонкӣ бошад сатҳи мутлақи:

\[ PD=P(\mathrm{default}) \]

низ муҳим аст.

Зеро манбаъ мегӯяд, ки PD дар IFRS 9 expected credit loss, risk-based pricing ва қарорҳои credit cut-off истифода мешавад.

Хатои калибрсозӣ бо Brier score чен карда мешавад:

\[ Brier= \frac{1}{N} \sum_{i=1}^{N} (\hat p_i-y_i)^2. \]

Brier-и пасттар нишон медиҳад, ки эҳтимолҳои пешгӯишуда ба натиҷаҳои воқеӣ наздиктаранд.

Номувофиқии ҷиддии дохилиманбаъӣ дар Brier score

Матни тавсифии таҳқиқот мегӯяд, ки пас аз isotonic calibration Brier score тақрибан:

%18 коҳиш ёфтааст

.

Аммо арзишҳои чопшуда дар Шакли 5:

\[ Brier_{\mathrm{raw}}=0{,}1918 \]

ва:

\[ Brier_{\mathrm{iso}}=0{,}0726 \]

мебошанд.

Фарқи мутлақи байни ин ду рақам:

\[ 0{,}1192 \]

аст ва коҳиши нисбӣ тақрибан:

\[ 62{,}1\% \]

мебошад.

Пас ибораи “%18” ва арзишҳои Brier дар шакл ҳамзамон дуруст буда наметавонанд. Аз манбаъ муайян кардан мумкин нест, ки кадом тараф хатои навишт ё ҳисоб дорад.

Оё калибрсозии online scorecard-ҳо нишон дода шудааст?

Манбаъ мегӯяд, ки ду scorecard-и WOE–Logistic Regression “аз рӯи тарҳ хуб калибр шудаанд” ва ба ислоҳи иловагӣ ниёз надоранд.

Аммо муодили reliability curve ва муқоисаи Brier, ки барои offline ensemble оварда шудааст, барои LR-Old ва LR-New дода нашудааст.

Аз ин рӯ сифати калибрсозии моделҳои online дар манбаъ бо далели таҷрибавии ҳамон қадар муфассал, ки барои ensemble пешниҳод шудааст, нишон дода нашудааст.

Устувории модел чӣ гуна чен карда шуд?

Population Stability Index:

\[ PSI = \sum_{k=1}^{B} (p_k^{ref}-p_k^{obs}) \ln \left( \frac{p_k^{ref}}{p_k^{obs}} \right) \]

ҳисоб карда шудааст.

Манбаъ:

\[ PSI<0{,}10 \]

ро устувор, 0,10–0,25-ро сатҳи таваҷҷуҳ ва зиёда аз 0,25-ро сатҳи амал мешуморад.

Арзишҳои Train–test score PSI:

МоделTrain–test PSI
LR-Old0,014
Ens-Off0,021
LR-New0,012

Барои Ens-Off train–validation PSI 0,018 дода шудааст.

Баландтарин арзишҳои feature PSI

Ду feature-level PSI-и баландтарин:

\[ app\_feature3=0{,}064 \]

ва:

\[ trans\_feature1=0{,}057 \]

гузориш шудаанд.

Ҳар ду арзиш аз остонаи attention 0,10, ки манбаъ истифода мебарад, поёнтаранд.

Аммо дар тамғаҳои тағйирёбандаи Шакли 6 app_feature3 ду маротиба дида мешавад. Аз матни манбаъ муайян кардани он, ки ин такрор ба кадом тағйирёбандаи воқеӣ мувофиқ аст, имкон надорад.

Таҳлили score-band чӣ нишон медиҳад?

Маҷмӯи test-и Ens-Off мувофиқи тартиби хавф ба даҳ гурӯҳи баробар ҷудо шудааст.

Банди хавфСатҳи мушоҳидашудаи default (%)Defaulter-и ҷамъшудаи дастгиршуда (%)Тамғаи сиёсат дар манбаъ
1 — хавфноктарин34,231,0Decline
221,550,5Decline
315,064,1Manual review
411,174,2Manual review
58,982,2Approve
67,088,6Approve
75,593,6Approve
84,297,4Approve
93,099,1Approve / pre-approved
10 — бехатартарин1,7100,0Approve / pre-approved

Гурӯҳи аввалини %10-и хавфноктарин танҳо худаш %31-и ҳамаи defaulter-ҳоро дар бар мегирад ва ду гурӯҳи аввал %50,5-ро дар бар мегиранд.

Дар сатҳи қабули %60 чӣ мешавад?

Дар acceptance-rate sensitivity таҳлили манбаъ, дар нуқтае ки %60-и ҳамаи дархостҳо қабул мешаванд, bad-rate-и муштариёни қабулшуда:

\[ 5{,}6\% \]

барои Ens-Off ва:

\[ 8{,}0\% \]

барои LR-Old гузориш шудааст.

Фарқ:

\[ 2{,}4\ \text{yüzde puanı} = 240\ \text{baz puan} \]

мебошад.

Ин натиҷа натиҷаи ретроспективии модел аст, ки нишон медиҳад модели ғанитари offline метавонад дар ҳамон сатҳи қабул гурӯҳи камхавфтар интихоб кунад. Он набояд ҳамчун коҳиши воқеии зарари қарзӣ ё афзоиши сабабии фоида тафсир шавад.

Шарҳи SHAP чӣ гуна ба қарори истеҳсолӣ табдил дода мешавад?

Дар рейтинги global SHAP барои Ens-Off оилаи шиддати бюрои қарзӣ пешсаф аст. Коррелятсияи Spearman байни рейтинги IV ва рейтинги миёнаи мутлақи SHAP:

\[ \rho=0{,}86, \qquad p<0{,}001 \]

гузориш шудааст.

Дар сатҳи истеҳсолӣ барои ҳар дархост саҳмҳои SHAP тартиб дода мешаванд ва чор омили манфии пурқувват ба reason code-ҳои барои инсон хондашаванда табдил меёбанд.

Дар мисоли беноми манбаъ омилҳои асосии манфии як дархости радшуда:

ОмилСаҳми SHAP — log-oddsReason code
Шиддати баланди дархостҳои бюрои қарзӣ дар давраи наздик+0,78R-01
Нисбати баланди қарзи дархостшуда / даромад+0,54R-04
Bureau delinquency дар давраи наздик+0,39R-02
Бақияи пасти пасандоз дар давраи наздик+0,21R-07

Арзишҳои мусбати SHAP дар ин ҷо омилҳоеро нишон медиҳанд, ки default log-odds-и моделро зиёд мекунанд.

Fairness audit чиро месанҷад?

Таҳқиқот се меҳвари демографиро истифода кардааст:

  • зан / мард,
  • гурӯҳҳои синнии 18–30, 31–45, 46–60 ва 60+,
  • иқомати шаҳрӣ / деҳотӣ.

Арзишҳои AUROC дар ҳамаи гурӯҳҳо:

\[ 0{,}913-0{,}922 \]

мебошанд.

Фарқҳои максималии мутлақ, ки манбаъ гузориш мекунад:

Метрикаи fairnessФарқи максималии мутлақи гурӯҳӣ (нуқтаи фоизӣ)
Demographic parity1,2
TPR gap1,4
FPR gap0,6
PPV gap1,3

Ин натиҷаҳо нишон медиҳанд, ки дар когорти test-и таҳқиқшуда байни буришҳои демографии номбаршуда фарқҳои хурд гузориш шудаанд.

Аммо андозаи намунаҳои гурӯҳӣ ва интервалҳои эътимоди ин фарқҳо дода нашудаанд. Ҳамчунин дар бораи хусусиятҳои демографии таҳқиқнашуда хулоса баровардан мумкин нест.

Масъалаи самт дар муодилаи fairness

Мақола барои demographic parity:

\[ \Delta DP_g = P(\hat y=1\mid G=g) - P(\hat y=1) \]

ифодаро медиҳад ва онро ҳамчун фарқи approval-rate шарҳ медиҳад.

Аммо дар ҳамон бахш:

\[ TPR_g=P(\hat y=1\mid y=1,G=g) \]

ҳамчун дуруст рад кардани true defaulter-ҳо,

\[ FPR_g=P(\hat y=1\mid y=0,G=g) \]

ҳамчун нодуруст рад кардани дархостҳои солим тафсир мешавад.

Агар дар ин таърифҳо \(\hat y=1\) ба қарори “хавфнок/радшуда” мувофиқ бошад, \(P(\hat y=1)\) дар формулаи аввал аз ҷиҳати математикӣ approval rate не, балки predicted-positive/decline rate мешавад. Манбаъ ин фарқи аломат ва кодгузории қарорро шарҳ намедиҳад.

Оё сегментатсияи KMeans ба модел дохил аст?

Не. Таҳлили KMeans, ки дар муштариёни мавҷуда гузаронида шудааст, танҳо ҳамчун қабати тафсири идоракунӣ истифода шудааст.

Сатҳи default дар чор cluster тақрибан аз %4,1 то %21,6 фарқ мекунад. Профили камхавфтарин ҳамчун фаъолиятҳои пасти bureau ва воридшавии баланди пул; профили хавфноктарин ҳамчун фаъолиятҳои баланди bureau ва воридшавии пасти пул таъриф шудааст.

Муаллифон махсусан мегӯянд, ки cluster label-ҳоро дар се модели қарзӣ ҳамчун predictor истифода накардаанд.

Ҳамчунин, азбаски cluster stability bootstrap analysis гузаронида нашудааст, таҳқиқот ин сегментатсияро на ҳамчун модели қарор, балки ҳамчун чаҳорчӯбаи машваратии идоракунӣ маҳдуд мекунад.

Меъмории MLOps чӣ гуна аст?

Дар меъмории истеҳсолӣ model artefact-ҳо бо MLflow ва Git tag-ҳо version мешаванд.

Сохтори monitoring-и манбаъ:

  • ҳисобҳои моҳонаи performance/устуворӣ,
  • champion–challenger governance review ҳар се моҳ,
  • retraining trigger ҳангоми feature PSI > 0,25,
  • retraining trigger ҳангоми зиёда аз %10 паст шудани KS performance нисбат ба development level

тавсиф мешавад.

Ин барои Туркия чӣ маъно дорад?

Таҳқиқот маълумоти ягон бонки Туркияро дар бар намегирад ва дар қонунгузории қарзӣ ё рафтори муштарии Туркия тасдиқ нашудааст.

Бо вуҷуди ин, меъмории техникӣ барои Туркия аз ҷиҳати консептуалӣ маъно дорад: ҷудо кардани scorecard-и фаҳмондашавандаи online, ки бо маълумоти маҳдуд ва камтаъхири дар лаҳзаи қарор дастрас кор мекунад, аз модели шабона ё background risk, ки маълумоти васеътари муштариро истифода мебарад, як равиши умумии муҳандисӣ аст, ки вақти дастрасии маълумотро аз мураккабии модел ҷудо мекунад.

Дар татбиқи Туркия WOE bin-ҳо, сохтори бюрои қарзӣ, рафтори даромад/қарз, таърифи default, гурӯҳҳои fairness, model governance ва талаботи ҳуқуқӣ бояд аз сифр бо маълумот ва қоидаҳои маҳаллӣ тасдиқ шаванд. Натиҷаҳои AUROC ё Gini дар Қазоқистонро мустақиман ба портфели Туркия интиқол додан мумкин нест.

Натиҷаҳое, ки таҳқиқот дастгирӣ мекунад

  • Дар ҳамон когорти test-и муштариёни мавҷуда offline ensemble-и 72-хусусиятӣ AUROC, KS ва Gini-и баландтар аз scorecard-и LR-Old, ки 9-хусусиятӣ гузориш шудааст, додааст.
  • Моделҳои online WOE-LR барои муштариёни мавҷуда ва нав дар test-и манбаъ мутаносибан тақрибан 0,847 ва 0,835 AUROC додаанд.
  • Test AUROC-и offline ensemble тақрибан 0,918 ва Gini-и он тақрибан 0,836 мебошад.
  • Дар модели offline маълумоти бюрои қарзӣ, ҷараёни нақдии дохилии бонк, пасандоз ва транзаксия predictive signal-и муҳим доранд.
  • Таҳлили score-band нишон медиҳад, ки хавфи default аз банди хавфноктарин ба банди бехатартарин мунтазам коҳиш меёбад.
  • Дар буришҳои демографии таҳқиқшуда манбаъ fairness gap-ҳои хурд гузориш мекунад.
  • Саҳмҳои SHAP ҳамчун хати шарҳдиҳӣ тарҳрезӣ шудаанд, ки дар сатҳи истеҳсолӣ ба reason code табдил меёбанд.
  • Таҳқиқот равиши end-to-end MLOps-ро бо monitoring, model registry ва retraining trigger тавсиф мекунад.

Натиҷаҳое, ки таҳқиқот дастгирӣ ё исбот намекунад

  • Исбот нашудааст, ки модел дар бонкҳо, кишварҳо ё давраҳои иқтисодии дигар ҳамин performance-ро нишон медиҳад.
  • External validation-и воқеии out-of-time ё дар муассисаи дуюм анҷом нашудааст.
  • Random hold-out validation санҷиши устуворӣ ба тағйири режими иқтисодӣ нест.
  • Fairness audit исбот намекунад, ки дар ҳамаи гурӯҳҳои демографии имконпазир табъиз вуҷуд надорад.
  • Истифодаи SHAP худ ба худ сертификати мутобиқати пурра ба қонунгузорӣ нест.
  • Фарқи 240 baz point-и bad-rate дар сатҳи қабули %60 коҳиши воқеии зарари молиявӣ нест.
  • Сегментҳои KMeans causal risk segment-ҳои тасдиқшуда барои қарори қарзӣ нестанд.
  • Таҳқиқот дар давраи recession ё macroeconomic stress санҷида нашудааст.
  • Азбаски дар манбаъ дар бораи rejected applicants ва reject inference маълумоти кофӣ нест, қобилияти модел барои намояндагии тамоми олами дархостҳо муайян карда намешавад.
  • Беҳбудии %18 дар калибрсозии Brier score бо арзишҳои 0,1918 → 0,0726 дар Шакли 5 аз ҷиҳати математикӣ мувофиқ нест.

Усул ва Натиҷаҳои Таҳқиқот

Популятсияи таҳлилӣ

МарҳилаШумораи сабтҳо
Сабтҳои ибтидоии қарзи POS926.000
Сабтҳои аз тарафи муштарӣ бекор ва хориҷшуда119.463
Намунаи ниҳоии таҳлилӣ806.537
Муштариёни мавҷуда455.827
Муштариёни нав350.710

Сохтори модел ва сегмент

МоделСегментАлгоритмШумораи хусусиятҳои дар манбаъ додашудаКанал
LR-OldМуштарии мавҷудаWOE + L2 Logistic Regression9Вақти воқеӣ
Ens-OffМуштарии мавҷудаLightGBM + CatBoost + NN + logistic stacking + isotonic calibration72Batch-и шабона
LR-NewМуштарии навWOE + L2 Logistic Regression9Вақти воқеӣ

Қайди манбаъ: Азбаски Бахши 3.5 ва Шакли 1 барои online roster чор хусусияти иловагии bureau-ро низ нишон медиҳанд, online feature count дар дохили манбаъ комилан мувофиқ нест.

Андозаҳои train/test/validation

Сегмент/моделTrainTestValidation
Муштарии мавҷуда — LR319.07891.21145.538
Муштарии мавҷуда — Ensemble319.07891.21145.538
Муштарии нав — LR245.49770.17735.036

Натиҷаҳои асосии discrimination

МоделTrain AUROCTest AUROCValidation AUROCTest KSTest Gini
LR-Old0,84720,8475Гузориш нашудааст0,55550,6950
Ens-Off0,93270,91780,91710,68250,8356
LR-New0,83450,8348Гузориш нашудааст0,53100,6696

Train AUROC-и Ens-Off аз 0,9327 ба 0,9178 дар test коҳиш меёбад. Validation AUROC-и 0,9171 нишон медиҳад, ки hold-out performance дар ҳамон равзанаи маълумоти тасодуфӣ ҷудошуда ба натиҷаи test наздик аст; ин далели transportability-и замонӣ ё институтсионалӣ нест.

Verianla Live: Модели кредитии online ва offline дар ҳамон когорти муштариёни мавҷуда

Муқоисаи зер танҳо моделҳои LR-Old ва Ens-Off-ро дар ҳамон маҷмӯи test-и муштариёни мавҷуда дар бар мегирад. Ҳар се метрика дар миқёси 0–1 мебошанд ва арзиши баландтар ба ҷудокунии қавитари синфҳо мувофиқ аст.

МоделTest AUROCTest KSTest Gini
LR-Old — scorecard-и вақти воқеӣ0.84750.55550.6950
Ens-Off — offline ensemble0.91780.68250.8356
 

Verianla Live: Арзишҳо натиҷаҳои test-и муштариёни мавҷуда аз Ҷадвали 6-и таҳқиқот мебошанд. Азбаски муқоиса дар ҳамон когорт анҷом шудааст, модели LR-New барои муштариёни нав ба ин визуализатсия дохил нашудааст.

Паёми асосии муқоисаи Verianla Live ин аст, ки offline ensemble дар ҳамон популятсияи test-и муштариёни мавҷуда дар ҳар се метрикаи discrimination аз scorecard-и вақти воқеӣ арзишҳои баландтар медиҳад. Бадали ин — feature roster-и васеътар, модели мураккабтар, инфрасохтори ҷудогонаи inference ва истифодаи batch-и шабона ба ҷойи вақти воқеӣ мебошад.

Муқоисаи baseline дар ҳамон когорт

МоделAUROCGini
Як fcb_feature1 Logistic Regression0,7810,562
Vanilla LR — бе WOE0,8210,642
Standalone LightGBM0,9100,820
LR-Old0,8470,695
Ens-Off0,9180,836

Ин ҷадвал махсусан нишон медиҳад, ки фарқи байни ensemble ва standalone LightGBM аз фарқи байни online LR ва ensemble хеле хурдтар аст. AUROC-и Ens-Off аз standalone LightGBM 0,008 баландтар аст.

Оилаҳои predictor-и аз ҳама иттилоотнок

Баландтарин арзишҳои Information Value асосан дар хусусиятҳои бюрои қарзӣ дида мешаванд.

ХусусиятТавсифи умумӣIV — муштарии мавҷудаIV — муштарии нав
fcb_feature2Шиддати бадтарини bureau delinquency0,7300,660
fcb_feature3Васеии муносибатҳои фаъоли қарзии bureau0,7250,295
fcb_feature1Шиддати дархостҳои bureau дар давраи наздик0,7150,640
app_feature1Даромади эъломшуда0,6400,450
app_feature2Маблағи дархостшуда / нисбати даромад0,6350,555

Натиҷаи operating point

Барои Ens-Off остонаи Youden-optimal тақрибан:

\[ \hat p^\star=0{,}456 \]

дода шудааст.

Дар ин нуқта:

\[ Sensitivity=0{,}716 \]

ва:

\[ Specificity=0{,}881 \]

гузориш шудааст.

Test confusion matrix:

 Predicted 0Predicted 1
Actual 072.1459.745
Actual 12.6476.674

Натиҷаи калибрсозӣ ва гузоришдиҳии мушкил

Баромади Ens-OffBrier score дар Шакли 5
Stacked meta-learner пеш аз Isotonic0,1918
Production PD пас аз Isotonic0,0726

Арзишҳои шакл ба коҳиши нисбии тақрибан %62,1 мувофиқанд. Бо вуҷуди ин, хулоса, натиҷаҳо ва бахши ниҳоӣ коҳиши тақрибан %18-ро гузориш мекунанд. Бинобар ин, самти калибрсозӣ равшан беҳбудиро нишон медиҳад, аммо андозаи беҳбудиро дар матни манбаъ бо як фоизи боэътимод гузориш кардан мумкин нест.

Натиҷаҳои fairness

ГурӯҳAUROCΔDP (нуқта)ΔTPR (нуқта)ΔFPR (нуқта)ΔPPV (нуқта)
Зан0,916+0,3+0,4+0,2−0,5
Мард0,920−0,2−0,3−0,1+0,4
18–300,913−1,2−1,4−0,6−1,3
31–450,919+0,1+0,2+0,1+0,2
46–600,922+0,5+0,6+0,3+0,7
60+0,917+0,8+0,9+0,4+0,9
Шаҳрӣ0,919+0,2+0,3+0,1+0,3
Деҳотӣ0,914−0,9−1,1−0,5−1,0

Бузургтарин фарқи мутлақ фарқи TPR-и −1,4 нуқта дар гурӯҳи 18–30 сола аст. Аммо азбаски барои ин ҷадвал интервали эътимод ё арзишҳои \(n\) барои ҳар гурӯҳ дода нашудаанд, номуайянии натиҷаҳо ба таври миқдорӣ нишон дода намешавад.

Оё Decision Curve Analysis гузориш шудааст?

DCA дар байни ҷузъҳои арзёбии pipeline дар Шакли 2 номбар шудааст. Бо вуҷуди ин, дар бахшҳои натиҷаҳо ягон натиҷа ё графики Decision Curve Analysis вуҷуд надорад.

Дар бахши кори оянда гуфта мешавад, ки DCA баъдтар мутобиқ ба остонаҳои сиёсӣ пешниҳод хоҳад шуд. Аз ин рӯ мақолаи ҳозира DCA-ро ҳамчун таҳлили анҷомшуда дастгирӣ намекунад.

Мантиқи истеҳсол ва омӯзиши дубора

Давраи амалиётии пешниҳодшудаи манбаъ:

model registry → monitoring-и моҳона → governance review-и семоҳа → омӯзиши дубора ҳангоми вайрон шудани threshold

мебошад.

Ду шарти асосии retraining:

\[ PSI_{\mathrm{feature}}>0{,}25 \]

ё:

\[ KS\ \text{düşüşü}>10\% \]

мебошанд.

Саҳми асосии муҳандисии таҳқиқот

Саҳми мақола таҳияи алгоритми нави gradient-boosting, усули нави SHAP ё техникаи нави calibration нест. Муаллифон онро равшан ҳамчун “real-world implementation study” ҷой медиҳанд.

Даъвои навоварӣ асосан ба муттаҳид кардани ҷузъҳои зерин дар як сохтори амалиётӣ такя мекунад:

feature availability → ҷудокунии канал → WOE-LR → ensemble → isotonic calibration → SHAP reason codes → fairness audit → PSI/KS monitoring → champion–challenger governance.

Маҳдудиятҳои муҳимтарин

  • Маълумоти танҳо як муассисаи молиявӣ истифода шудааст.
  • Random split истифода шудааст; out-of-time validation-и воқеӣ анҷом нашудааст.
  • Stress validation дар recession ё режими дигари фоиз/таваррум вуҷуд надорад.
  • IV-и хеле баланд бояд бо гузашти вақт дубора санҷида шавад.
  • Дар decile-и хавфи баландтар isotonic model каме хавфро аз ҳад зиёд арзёбӣ мекунад.
  • Барои сегментатсияи KMeans bootstrap cluster-stability analysis гузаронида нашудааст.
  • Online feature count дар манбаъ мувофиқ нест.
  • Фоизи беҳбудии Brier бо рақамҳои манбаъ мувофиқат намекунад.
  • Дар fairness audit андозаи гурӯҳ ва uncertainty interval дода нашудааст.
  • Вазъи дархостҳои радшуда дар популятсияи таҳлилӣ ва равиши reject inference шарҳ дода намешавад.
  • Сабтҳои хоми қарзӣ бинобар махфияти бонкӣ барои омма дастрас нестанд.

Таҳқиқоти оянда

Манбаъ чор қадами асосии ояндаро муайян мекунад:

  1. out-of-time validation-и воқеӣ дар originations-и Q2–Q4 2024,
  2. decision-curve analysis бо остонаҳои сиёсати бонк,
  3. conformal prediction барои равона кардани ҳолатҳои номуайян ба manual underwriting,
  4. арзёбии transportability дар портфели POS-и бозори дигари рушдёбанда.

Ёддошт оид ба Манбаъ ва Усул

Номи пурраи кори аслӣ: An Explainable Hybrid AI Framework for Real-Time Point-of-Sale Credit Scoring

Муаллифон: Gulnaz Zakariya; Aiman Moldagulova; Nor’ashikin Ali.

Баробари муаллифи аввал/саҳми баробар: Дар манбаъ нишон дода нашудааст.

Муаллифи масъул: Aiman Moldagulova.

Муассисаҳо: Department of Software Engineering, Satbayev University, Almaty, Kazakhstan; Department of Cybersecurity, Information Processing and Storage, Satbayev University, Almaty, Kazakhstan; Department of Information Systems, Universiti Tenaga Nasional, Kajang, Selangor, Malaysia.

Навъи манбаъ: Мақолаи аслии рецензияшуда; таҳқиқоти ретроспективии таҳияи модели хавфи қарзии як-портфелӣ ва internal validation.

Маҷалла: AI.

Ношир: MDPI.

Сабти библиографӣ: AI, 2026, Ҷилди 7, Шумораи 6, Мақолаи 211.

DOI: 10.3390/ai7060211.

Гирифтан / бозбинӣ / қабул / нашр: 11 Май 2026 / 7 Июн 2026 / 8 Июн 2026 / 9 Июн 2026.

Вазъи рецензия: Нашри маҷаллаи рецензияшуда мебошад.

Литсензия: Creative Commons Attribution (CC BY).

Academic Editors: Albert Y.S. Lam; Andy Chun.

Давраи таҳқиқот: 1 Январ 2023–31 Март 2024.

Шумораи сабтҳои ибтидоӣ: 926.000.

Намунаи таҳлилӣ: 806.537.

Сатҳи default: %10,22.

Таърифи default: Ҳадди ақал як маротиба 90 ё бештар рӯз таъхир дар давоми умри мушоҳидашудаи шартнома; NPL91_EVER.

Сегментҳои муштарӣ: 455.827 муштарии мавҷуда ва 350.710 муштарии нав.

Модели асосӣ 1: LR-Old — scorecard-и WOE + L2 Logistic Regression дар вақти воқеӣ барои муштариёни мавҷуда.

Модели асосӣ 2: Ens-Off — LightGBM + CatBoost + neural network-и сеқабата stacked ensemble ва isotonic calibration барои муштариёни мавҷуда.

Модели асосӣ 3: LR-New — scorecard-и WOE + L2 Logistic Regression дар вақти воқеӣ барои муштариёни нав.

Интихоби модел/tuning: Stratified five-fold cross-validation ва Optuna TPE; 30 озмоиш барои ҳар ensemble base learner.

Test AUROC: LR-Old 0,8475; Ens-Off 0,9178; LR-New 0,8348.

Test Gini: LR-Old 0,6950; Ens-Off 0,8356; LR-New 0,6696.

Test KS: LR-Old 0,5555; Ens-Off 0,6825; LR-New 0,5310.

Ens-Off validation AUROC: 0,9171. Ин validation random hold-out аз ҳамон давраи таҳқиқот аст; external ё out-of-time validation нест.

Explainability: TreeSHAP барои LightGBM ва CatBoost, KernelSHAP барои neural component; саҳмҳои пурқувваттарини манфии record-level ба adverse-action reason code табдил дода мешаванд.

Fairness: Фарқҳои demographic parity, TPR, FPR ва PPV барои ҷинс, гурӯҳи синнӣ ва иқомати шаҳрӣ/деҳотӣ таҳқиқ шудаанд.

Monitoring: PSI, KS ва bad-rate; monitoring-и моҳона ва арзёбии governance-и семоҳа.

Маблағгузорӣ: Таҳқиқот хабар медиҳад, ки маблағгузории беруна нагирифтааст.

Кумитаи ахлоқ: Ҳамчун татбиқнашаванда нишон дода шудааст. Манбаъ мегӯяд, ки маълумоти беидентификатсияшуда ва дохилии бонк истифода шудааст ва таҳқиқоти инсон-субъект анҷом дода нашудааст.

Розигии огоҳона: Ҳамчун татбиқнашаванда гузориш шудааст.

Дастрасии маълумот: Маълумоти хом дар сатҳи қарз бинобар махфияти бонкӣ барои омма дастрас нест. Манбаъ мегӯяд, ки aggregate statistics-и анонимӣ, луғати сатҳи feature-family, таърифҳои WOE bin, коэффициентҳои ду production scorecard ва figure-generation code метавонанд бо дархости оқилона ва созишномаи истифодаи маълумот аз муаллифи масъул дархост шаванд.

Саҳми муаллифон: Консептуализатсия G.Z. ва A.M.; методология, software, formal analysis, таҳқиқот, data curation, лоиҳаи аввал ва visualization G.Z.; validation ҳамаи муаллифон; resources ва project management A.M.; supervision A.M. ва N.A.; review/editing A.M. ва N.A.

Бархӯрди манфиатҳо: Муаллифон бархӯрди манфиатҳоро гузориш накардаанд. Гуфта мешавад, ки муассисаи молиявии шарик дар интихоби усул, меъёрҳои арзёбӣ, навиштани мақола ё қарори нашр нақш надошт.

Қайдҳои муҳим аз нигоҳи садоқат ба манбаъ

Калибрсозӣ: “Тақрибан %18 коҳиши Brier” дар матн бо рақамҳои 0,1918 → 0,0726 дар Шакли 5 мувофиқат намекунад. Verianla яке аз ин ду маълумотро аз номи манбаъ ислоҳ намекунад.

Online model roster: Шакли 1 ва Бахши 3.5 барои роҳи online 9 application + 4 bureau майдонро нишон медиҳанд, дар ҳоле ки Ҷадвали 2 ва хулосаҳои модел 9 хусусият гузориш мекунанд. Production input count-и ниҳоӣ дар манбаъ равшан нест.

Validation: Истилоҳи “Validation” маънои random hold-out дорад; validation-и воқеии out-of-time ҳамчун кори оянда гузошта шудааст.

DCA: Гарчанде DCA дар pipeline-и Шакли 2 номбар шудааст, дар бахши натиҷаи ҷорӣ DCA вуҷуд надорад ва ҳамчун кори оянда пешниҳод мешавад.

Fairness: Байни самти синфи мусбат дар формулаи demographic-parity ва шарҳи “approval rate” номуайянии терминологӣ/математикӣ вуҷуд дорад.

Популятсияи маълумот: Таҳқиқот истилоҳҳои “contracts” ва “loan applications”-ро навбат ба навбат истифода мебарад; популятсияи rejected-applicant ва раванди reject inference шарҳ дода нашудааст.

Ҳудуди тафсири илмӣ

Ин таҳқиқот меъмории хавфи қарзии ба истеҳсол нигаронидашударо, ки дар портфели воқеии бонк таҳия шудааст, гузориш мекунад; аммо performance-и гузоришшуда ба як муассиса ва як кишвар маҳдуд аст.

Арзишҳое мисли AUROC 0,918 ё Gini 0,836 наметавонанд ҳамчун performance-и интизоршаванда дар муштариёни бонки дигар истифода шаванд. Ҳангоми тағйир ёфтани фарогирии бюрои қарзӣ, рафтори муштарӣ, тарҳи маҳсулот, режими иқтисодӣ ва feature availability performance-и модел низ метавонад тағйир ёбад.

Натиҷаҳои fairness танҳо гурӯҳҳои демографии таҳқиқшуда ва маҷмӯи test-и таҳқиқшударо дар бар мегиранд. Gap-ҳои хурд сертификати универсалии “модели одилона” аз нуқтаи назари ҳуқуқӣ ё ахлоқӣ нестанд.

Ба ҳамин монанд, системаи SHAP reason code механизми муҳандисиест, ки explainability-ро дастгирӣ мекунад; он худ ба худ исбот намекунад, ки ҳамаи талаботи model governance ё regulatory compliance иҷро шудаанд.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо