
Bu tədqiqat mağaza kassasında bir neçə yüz millisaniyə ərzində kredit qərarı verilməsi tələb olunan satış nöqtəsi kreditləri üçün tək bir süni intellekt modelinin hər şəraitdə kifayət etməyə biləcəyi fikrindən çıxış edir. Tədqiqatçılar bunun əvəzinə iki fərqli əməliyyat ehtiyacını ayıran hibrid arxitektura hazırlayırlar: real vaxt kanalında izaholunan və aşağı gecikməli Weight of Evidence–Logistic Regression skor kartları; gecəlik batch kanalında isə daha zəngin müştəri məlumatlarından istifadə edə bilən LightGBM, CatBoost və üçqatlı neyron şəbəkədən ibarət kalibrlənmiş ensemble.
Tədqiqat Qazaxıstandakı tək bir böyük ikinci-səviyyəli bankın istehsal portfelindən əldə edilmiş 806.537 analitik qeyd üzərində aparılmışdır. Hədəf dəyişən, kreditin müşahidə olunan ömrü ərzində ən azı bir dəfə 90 və ya daha çox gün gecikməyə düşüb-düşmədiyini göstərən NPL91_EVER dəyişənidir. Analitik nümunədə default nisbəti %10,22-dir.
Mövcud müştərilər üçün real vaxt LR-Old modeli test dəstində:
\[ AUROC=0{,}8475,\qquad KS=0{,}5555,\qquad Gini=0{,}6950 \]
nəticəsinə çatmışdır. Daha geniş offline məlumat dəstindən istifadə edən Ens-Off ensemble-ı eyni mövcud-müştəri kohortunda:
\[ AUROC=0{,}9178,\qquad KS=0{,}6825,\qquad Gini=0{,}8356 \]
dəyərlərini vermişdir. Beləliklə, test Gini dəyəri təxminən 0,141 mütləq bənd yüksəlmişdir. Yeni müştərilər üçün istifadə olunan LR-New modelinin test AUROC dəyəri isə 0,8348 olaraq bildirilmişdir.
Lakin bu nəticələr fərqli ölkələr və ya banklar üçün hazır uğur zəmanəti deyil. Tədqiqatın bütün məlumatları tək bir qurumdan gəlir; train, test və validation dəstləri eyni 2023–2024 portfelindən təsadüfi şəkildə yaradılmışdır. Həqiqi zamanxarici doğrulama və ikinci bir portfel üzərində xarici doğrulama hələ aparılmamışdır.
Satış nöqtəsində kredit skorlama niyə fərqli problemdir?
POS krediti, müştərinin mağazada məhsul alarkən eyni əməliyyat çərçivəsində kiçik və ya orta həcmli istehlak kreditinə müraciət etməsi deməkdir. Bu ssenaridə kredit riski modeli yalnız yüksək proqnoz dəqiqliyinə malik olmalı deyil; kredit qərarı müştərini kassada gözlətməyəcək qədər sürətlə verilməlidir.
Mənbə tədqiqatda əməliyyat sərhədi təxminən:
\[ <300\ \mathrm{ms} \]
XML round-trip xidmət səviyyəsi kimi müəyyən edilir.
Eyni zamanda kassada müştəridən həddindən artıq məlumat istənməsinin satış konversiyasını azalda biləcəyi üçün real vaxt payload-ının son dərəcə məhdud saxlandığı bildirilir.
Bu iki tələb kredit riskində klassik mühəndislik ziddiyyəti yaradır:
Daha çox xüsusiyyət adətən daha yüksək proqnoz gücü verə bilər; lakin bu xüsusiyyətlərin hamısı qərar anında əlçatan və ya kifayət qədər sürətli olmaya bilər.
Dual-track arxitektura nə deməkdir?
Tədqiqat bu ziddiyyəti tək modeli məcbur etməklə həll etmək əvəzinə iki kanala ayırır.
| Kanal | Model | Əsas məqsəd | Mənbədə verilən zamanlama |
|---|---|---|---|
| Online | WOE–Logistic Regression | Kassada izaholunan, aşağı gecikməli kredit qərarı | Real vaxt; XML round-trip hədəfi <300 ms |
| Offline | LightGBM + CatBoost + neyron şəbəkə stacked ensemble | Daha geniş müştəri məlumatı ilə daha yüksək ayırdetmə gücü və kalibrlənmiş PD | Gecəlik batch |
Online kanal birbaşa kredit qərarına xidmət etdiyi halda, offline modelin çıxışı müştəri-360 anbarına və IFRS 9 risk məlumat qatına geri yazılır.
Online xüsusiyyət sayında mənbədaxili uyğunsuzluq
Məqalənin bu nöqtədə öz daxilində tam uyğun olmadığı görünür. Bölmə 3.5 və Şəkil 1 online roster-i:
9 application XML sahəsi + 4 əvvəlcədən saxlanmış bureau sahəsi
kimi göstərir.
Bunun əksinə olaraq Cədvəl 2, Şəkil 2 və model tərifi LR-Old ilə LR-New-i:
9 xüsusiyyətli modellər
kimi bildirir.
Mənbə 4 bureau sahəsinin qərar mühərrikinə göndərilib yekun doqquz xüsusiyyət daxilində seçilib-seçilmədiyini və ya həqiqətən 13 girişdən istifadə olunub-olunmadığını açıq şəkildə uzlaşdırmır. Buna görə model yenidən tətbiq edilərkən istehsal feature roster-i müəlliflərlə dəqiqləşdirilməlidir.
Məlumat dəsti necə yaradıldı?
Mənbə başlanğıcda:
\[ N=926.000 \]
POS kredit müqaviləsi olduğunu bildirir.
Müştəri tərəfindən ləğv edilən və geri ödəmə davranışı müşahidə oluna bilməyən:
\[ 119.463 \]
qeyd çıxarıldıqdan sonra:
\[ N=806.537 \]
analitik nümunə qalmışdır.
Sinif paylanması:
\[ 89{,}78\%\ \text{non-default}, \qquad 10{,}22\%\ \text{default} \]
kimi verilmişdir.
Default necə müəyyən edildi?
Asılı dəyişən:
\[ y_i=NPL91\_EVER_i \]
kimi müəyyən edilir.
Müqavilə müşahidə olunan müddəti ərzində hər hansı bir vaxt ən azı:
\[ 90\ \text{gün} \]
gecikməyə düşmüşsə:
\[ y_i=1 \]
kimi işarələnir.
Bu quruluş modelin davamlı ödəniş məbləğini deyil, müəyyən edilmiş default hadisəsinin baş verib-vermədiyini proqnozlaşdıran ikili təsnifatçı olduğunu göstərir.
Bütün müraciət kainatı təmsil olunurmu?
Mənbə bəzi bölmələrdə məlumatı “contracts”, bəzi bölmələrdə isə “loan applications” adlandırır. Rədd edilmiş və buna görə gələcək geri ödəmə davranışı müşahidə oluna bilməyən müraciətlərin analitik məlumat dəstinə daxil edilib-edilmədiyi açıqlanmır.
Həmçinin klassik kredit riskində istifadə olunan reject inference yanaşmasına dair üsul göstərilməmişdir.
Buna görə 806.537 qeydin bütün POS kredit müraciəti kainatını, yoxsa əsasən müşahidə edilə bilən geri ödəmə performansına malik müqavilələri təmsil etdiyi mənbədən dəqiqləşdirilə bilmir. Bu fərq modelin yeni müraciət populyasiyasına ötürülə bilməsi baxımından vacibdir.
Mövcud və yeni müştərilər niyə ayrılır?
Portfel:
\[ N_{\mathrm{old}}=455.827 \]
mövcud müştəri və:
\[ N_{\mathrm{new}}=350.710 \]
yeni müştəri olmaqla iki seqmentə ayrılmışdır.
Səbəb odur ki, bankla əvvəldən əlaqəsi olan şəxslər üçün depozit hərəkətləri, əməliyyat davranışları və ya qurumdaxili pul axını kimi keçmiş xüsusiyyətlər mövcud ola bilər; yeni müştərilərdə isə eyni siqnal dəsti mövcud olmaya bilər.
Xüsusiyyət ailələri hansılardır?
İlkin 148 namizəd dəyişəndən filtrləmədən sonra 101 dəyişən saxlanılmışdır. Mənbə bank məxfiliyi səbəbindən real istehsal sütun adlarını açıqlamır, yalnız semantik ailələri verir.
| Xüsusiyyət ailəsi | Filtrdən sonrakı say | Ümumi məzmun |
|---|---|---|
fcb_ | 31 | Kredit bürosu xüsusiyyətləri |
app_ | 9 | Müraciət XML sahələri |
prod_ | 4 | Kredit məhsulu taksonomiyası |
trans_ | 18 | Əməliyyat/xərcləmə nümunələri |
depo_ | 11 | Depozit balansı dinamikası |
bank_ | 13 | Bankdaxili pul daxilolma xüsusiyyətləri |
geo_ | 6 | Ünvan əsaslı coğrafi-məkan risk xüsusiyyətləri |
behav_ | 9 | Rəqəmsal sessiya davranışı |
Xüsusiyyət seçimi necə aparıldı?
Üç əsas hədd tətbiq edilmişdir:
\[ IV\geq0{,}10 \]
\[ missingness\leq80\% \]
\[ |\rho|\leq0{,}70 \]
Yüksək korrelyasiyalı dəyişən cütlərindən daha aşağı Information Value dəyərinə malik xüsusiyyət çıxarılmışdır.
Yüksək Information Value dəyərləri leakage ola bilərdimi?
Tədqiqatda bəzi kredit bürosu dəyişənlərinin:
\[ IV>0{,}50 \]
dəyərinə çatması səbəbindən əlavə leakage yoxlaması aparılmışdır.
Mənbə beş yoxlama bildirir: xüsusiyyətin yalnız müraciət anınadək mövcud məlumatdan istifadə etməsi, semantik baxımdan post-default məlumat daşımaması, WOE formasının iqtisadi cəhətdən məntiqli olması, tək xüsusiyyətli AUROC-nun qeyri-adi yüksək olmaması və zaman dilimləri arasında PSI sabitliyi.
Ən güclü tək bureau xüsusiyyətinin univariate AUROC dəyəri 0,781 olaraq bildirilmişdir. Tədqiqat bu nəticələrə əsaslanaraq yüksək IV dəyərlərini leakage deyil, kredit bürosu sorğu intensivliyinin güclü siqnalı kimi şərh edir.
WOE niyə real vaxt modeli üçün seçildi?
Weight of Evidence yanaşması hər dəyişəni risk səviyyələrinə görə bin-lərə ayıraraq default və non-default paylanmaları arasındakı nisbəti loqarifmik şəkildə ifadə edir:
\[ WOE_k= \ln \left( \frac{ P(x\in B_k\mid y=1) }{ P(x\in B_k\mid y=0) } \right). \]
Burada \(B_k\), dəyişənin \(k\)-cı bin-ini; \(y=1\) default sinfini, \(y=0\) isə non-default sinfini göstərir.
Bir xüsusiyyətin ümumi ayırdetmə qabiliyyəti Information Value ilə xülasə olunur:
\[ IV(x)= \sum_{k=1}^{K} (\hat p_{1,k}-\hat p_{0,k})WOE_k. \]
WOE çevrilməsi xüsusilə kredit riskində skor kartını nizamlı, monoton və insan tərəfindən yoxlanıla bilən etmək məqsədilə istifadə olunur.
Real vaxt skoru necə yaradılır?
WOE çevrilməsindən sonra L2 nizamlama ilə logistic regression tətbiq edilir. Mənbə istehsal skorunu:
\[ score(x) = Offset - Factor\cdot \langle\beta,WOE(x)\rangle \]
kimi müəyyən edir.
Burada:
\[ Factor=\frac{PDO}{\ln2} \]
və:
\[ PDO=20 \]
seçilmişdir.
PDO, default odds ikiqat artdıqda skorun neçə bal dəyişəcəyini ifadə edən klassik kredit skorlama miqyaslama parametridir.
Offline ensemble necə quruldu?
Ens-Off modeli üç fərqli əsas öyrənicidən istifadə edir:
- LightGBM,
- CatBoost,
- üç gizli bloklu tam əlaqəli neyron şəbəkə.
Hər modelin beşqatlı stratified cross-validation zamanı yaratdığı out-of-fold ehtimalları logistic-regression meta-learner-a verilir:
\[ \hat p_i^{stack} = \sigma \left( \alpha_0 + \alpha_1\hat p_i^{LGBM} + \alpha_2\hat p_i^{CB} + \alpha_3\hat p_i^{NN} \right). \]
Buradakı:
\[ \sigma(z)=\frac{1}{1+e^{-z}} \]
logistic sigmoid funksiyasıdır.
Daha sonra yalnız bu birləşik stacked score üzərinə isotonic regression tətbiq edilir:
\[ \hat p_i^{cal} = g_{\mathrm{iso}} ( \hat p_i^{stack} ). \]
Yəni LightGBM, CatBoost və neyron şəbəkə ayrı-ayrılıqda kalibrlənməyib; əvvəl stack edilib, sonra birləşik çıxış kalibrlənib.
Neyron şəbəkə arxitekturası nədir?
Mənbənin əsas neyron şəbəkə quruluşu:
\[ 72 \rightarrow 256 \rightarrow 128 \rightarrow 64 \rightarrow 1 \]
şəklindədir.
ReLU aktivləşdirmələri, batch normalisation və:
\[ dropout=0{,}30 \]
istifadə olunmuşdur.
İkinci və üçüncü gizli blok arasına bir self-attention head əlavə edilərək tabular xüsusiyyətlər arasındakı qarşılıqlı təsirlərin modelləşdirilməsi məqsəd qoyulmuşdur.
Hiperparametr axtarışı necə aparıldı?
LightGBM, CatBoost və neyron şəbəkə üçün Optuna Tree-Structured Parzen Estimator istifadə edilərək ayrı-ayrılıqda:
\[ 30 \]
sınaq aparılmışdır.
Optimallaşdırma hədəfi beşqatlı stratified cross-validation AUROC-sudur.
Mənbədə verilən təxmini tuning müddətləri:
| Model | 30 Optuna sınağı üçün müddət |
|---|---|
| LightGBM | 42 dəqiqə |
| CatBoost | 78 dəqiqə |
| Neyron şəbəkə | 96 dəqiqə |
Ümumi tuning xərci təxminən 3,6 GPU-saat kimi bildirilmişdir. Avadanlıq NVIDIA T4 16 GB GPU, 16 vCPU və 64 GB RAM-dır.
Random split niyə mühüm məhdudiyyətdir?
Hər müştəri seqmenti:
\[ 70\%/20\%/10\% \]
train/test/validation formasında stratified random sampling ilə bölünmüşdür.
Bu üsul eyni məlumat istehsalı dövründən müstəqil saxlanmış hold-out nümunələri yaradır; lakin gələcək iqtisadi dövrə ötürülə bilməni test etmir.
Tədqiqatın öz gələcək iş bölməsində Q2–Q4 2024 originasiyalarından həqiqi out-of-time cohort istifadə ediləcəyi bildirilir. Buna görə mövcud validation nəticəsi xarici və ya zaman üzrə doğrulama kimi şərh edilməməlidir.
Kalibrləmə niyə kredit riskində kritikdir?
AUROC yalnız yaxşı və pis müştərilərin nə qədər düzgün sıralandığını ölçür. Bank tətbiqində isə modelin yaratdığı:
\[ PD=P(\mathrm{default}) \]
dəyərinin mütləq səviyyəsi də vacibdir.
Çünki mənbədə PD-nin IFRS 9 gözlənilən kredit zərəri, risk əsaslı qiymətləmə və kredit cut-off qərarlarında istifadə edildiyi bildirilir.
Kalibrləmə xətası Brier skoru ilə ölçülür:
\[ Brier= \frac{1}{N} \sum_{i=1}^{N} (\hat p_i-y_i)^2. \]
Daha aşağı Brier dəyəri proqnozlaşdırılan ehtimalların gerçəkləşən nəticələrə daha yaxın olduğunu göstərir.
Brier skorunda ciddi mənbədaxili uyğunsuzluq
Tədqiqatın nəqli mətni isotonic calibration-dan sonra Brier skorunun təxminən:
%18 azaldığını
bildirir.
Lakin Şəkil 5-də çap olunan dəyərlər:
\[ Brier_{\mathrm{raw}}=0{,}1918 \]
və:
\[ Brier_{\mathrm{iso}}=0{,}0726 \]
şəklindədir.
Bu iki rəqəm arasındakı mütləq fərq:
\[ 0{,}1192 \]
olub nisbi azalma təxminən:
\[ 62{,}1\% \]
səviyyəsindədir.
Beləliklə, “%18” ifadəsi ilə şəkildəki Brier dəyərləri eyni anda doğru ola bilməz. Mənbədən hansı tərəfin yazı və ya hesablama xətası daşıdığı müəyyən edilə bilmir.
Online scorecard-ların kalibrlənməsi göstərildimi?
Mənbə iki WOE–Logistic Regression skor kartının “dizayn etibarilə yaxşı kalibrləndiyini” və əlavə düzəlişə ehtiyac duymadığını bildirir.
Lakin offline ensemble üçün təqdim edilən reliability curve və Brier müqayisəsinin ekvivalenti LR-Old və LR-New üçün verilməmişdir.
Buna görə online modellərin kalibrləmə keyfiyyəti mənbədə ensemble qədər ətraflı empirik sübutla göstərilmir.
Model sabitliyi necə ölçüldü?
Population Stability Index:
\[ PSI = \sum_{k=1}^{B} (p_k^{ref}-p_k^{obs}) \ln \left( \frac{p_k^{ref}}{p_k^{obs}} \right) \]
ilə hesablanmışdır.
Mənbə:
\[ PSI<0{,}10 \]
dəyərini sabit, 0,10–0,25 aralığını diqqət, 0,25 üzərini isə tədbir səviyyəsi kimi istifadə edir.
Train–test score PSI dəyərləri:
| Model | Train–test PSI |
|---|---|
| LR-Old | 0,014 |
| Ens-Off | 0,021 |
| LR-New | 0,012 |
Ens-Off üçün train–validation PSI 0,018 kimi verilmişdir.
Ən yüksək feature PSI dəyərləri
Ən yüksək iki feature-level PSI:
\[ app\_feature3=0{,}064 \]
və:
\[ trans\_feature1=0{,}057 \]
kimi bildirilmişdir.
Hər iki dəyər mənbənin istifadə etdiyi 0,10 attention həddinin altındadır.
Lakin Şəkil 6-nın dəyişən etiketlərində app_feature3 iki dəfə görünür. Bu təkrarın hansı həqiqi dəyişənə uyğun gəldiyi mənbə mətnindən müəyyən edilə bilmir.
Score-band təhlili nə göstərir?
Ens-Off test dəsti risk sırasına görə on bərabər qrupa ayrılmışdır.
| Risk bandı | Müşahidə olunan default nisbəti (%) | Kumulyativ tutulmuş defaulter (%) | Mənbə siyasət etiketi |
|---|---|---|---|
| 1 — ən riskli | 34,2 | 31,0 | Decline |
| 2 | 21,5 | 50,5 | Decline |
| 3 | 15,0 | 64,1 | Manual review |
| 4 | 11,1 | 74,2 | Manual review |
| 5 | 8,9 | 82,2 | Approve |
| 6 | 7,0 | 88,6 | Approve |
| 7 | 5,5 | 93,6 | Approve |
| 8 | 4,2 | 97,4 | Approve |
| 9 | 3,0 | 99,1 | Approve / pre-approved |
| 10 — ən təhlükəsiz | 1,7 | 100,0 | Approve / pre-approved |
Ən riskli ilk %10-luq qrup təkbaşına bütün defaulter-lərin %31-ni, ilk iki qrup isə %50,5-ni ehtiva edir.
%60 qəbul nisbətində nə baş verir?
Mənbənin acceptance-rate sensitivity təhlilində ümumi müraciətlərin %60-nın qəbul edildiyi nöqtədə qəbul olunan müştərilərin bad-rate-i:
\[ 5{,}6\% \]
Ens-Off üçün və:
\[ 8{,}0\% \]
LR-Old üçün bildirilmişdir.
Aradakı fərq:
\[ 2{,}4\ \text{yüzde puanı} = 240\ \text{baz puan} \]
olur.
Bu nəticə daha zəngin offline modelin eyni qəbul nisbətində daha aşağı riskli qrup seçə bildiyini göstərən retrospektiv model nəticəsidir. Həqiqətən baş vermiş kredit zərəri və ya səbəbli mənfəət artımı kimi şərh edilməməlidir.
SHAP izahı istehsal qərarına necə çevrilir?
Ens-Off üçün qlobal SHAP sıralamasında kredit bürosu intensivliyi ailəsi önə çıxır. IV sırası ilə orta mütləq SHAP sırası arasındakı Spearman korrelyasiyası:
\[ \rho=0{,}86, \qquad p<0{,}001 \]
kimi bildirilmişdir.
İstehsal səviyyəsində isə hər müraciət üçün SHAP töhfələri sıralanır və ən güclü mənfi dörd amil insan tərəfindən oxuna bilən reason code-lara çevrilir.
Mənbənin anonim nümunəsində rədd edilmiş bir müraciətin əsas mənfi amilləri:
| Sürücü | SHAP töhfəsi — log-odds | Reason code |
|---|---|---|
| Yüksək yaxın dövr kredit bürosu sorğu intensivliyi | +0,78 | R-01 |
| Yüksək tələb olunan kredit / gəlir nisbəti | +0,54 | R-04 |
| Yaxın dövr bureau delinquency | +0,39 | R-02 |
| Aşağı yaxın dövr depozit balansı | +0,21 | R-07 |
Müsbət SHAP dəyərləri burada modelin default log-odds-unu artıran amilləri təmsil edir.
Fairness audit nəyi ölçür?
Tədqiqat üç demoqrafik oxdan istifadə etmişdir:
- qadın / kişi,
- 18–30, 31–45, 46–60 və 60+ yaş qrupları,
- şəhər / kənd yaşayış yeri.
Bütün qruplardakı AUROC dəyərləri:
\[ 0{,}913-0{,}922 \]
aralığındadır.
Mənbənin bildirdiyi maksimum mütləq fərqlər:
| Fairness metriyi | Maksimum mütləq qrup fərqi (faiz bəndi) |
|---|---|
| Demographic parity | 1,2 |
| TPR gap | 1,4 |
| FPR gap | 0,6 |
| PPV gap | 1,3 |
Bu nəticələr araşdırılan test kohortunda göstərilən demoqrafik dilimlər arasında kiçik fərqlərin bildirildiyini göstərir.
Lakin qrup nümunə ölçüləri və bu fərqlərin etibar intervalları verilməmişdir. Həmçinin araşdırılmayan demoqrafik xüsusiyyətlər barədə nəticə çıxarıla bilməz.
Fairness tənliyində istiqamət problemi
Məqalə demographic parity üçün:
\[ \Delta DP_g = P(\hat y=1\mid G=g) - P(\hat y=1) \]
ifadəsini verir və bunu approval-rate fərqi kimi açıqlayır.
Bununla yanaşı eyni bölmədə:
\[ TPR_g=P(\hat y=1\mid y=1,G=g) \]
həqiqi defaulter-lərin düzgün şəkildə ələnməsi,
\[ FPR_g=P(\hat y=1\mid y=0,G=g) \]
isə sağlam müraciətlərin yanlış rədd edilməsi kimi şərh olunur.
Bu təriflərdə \(\hat y=1\) “riskli/rədd edilən” qərara uyğundursa ilk formuladakı \(P(\hat y=1)\) riyazi olaraq approval rate deyil, predicted-positive/decline rate olur. Mənbə bu işarə və qərar kodlama fərqini izah etmir.
KMeans seqmentasiyası modelə daxildirmi?
Xeyr. Mövcud müştərilər üzərində aparılan KMeans təhlili yalnız idarəetmə şərh qatı kimi istifadə edilmişdir.
Dörd klasterin default nisbətləri təxminən %4,1 ilə %21,6 arasında dəyişir. Ən aşağı risk profili aşağı bureau aktivliyi və yüksək pul daxilolması; ən yüksək risk profili yüksək bureau aktivliyi və aşağı pul daxilolması kimi müəyyən edilmişdir.
Müəlliflər cluster etiketlərini üç kredit modelində predictor kimi istifadə etmədiklərini xüsusi olaraq bildirirlər.
Həmçinin cluster stability bootstrap təhlili aparılmadığı üçün tədqiqat bu seqmentasiyanı qərar modeli deyil, məsləhət xarakterli idarəetmə çərçivəsi ilə məhdudlaşdırır.
MLOps arxitekturası necədir?
İstehsal arxitekturasında model artefact-ları MLflow və Git teqləri ilə versiyalaşdırılır.
Mənbənin monitorinq quruluşu:
- aylıq performans/sabitlik hesablamaları,
- üç aylıq champion–challenger governance review,
- feature PSI > 0,25 olduqda retraining trigger,
- KS performansı development səviyyəsinə görə %10-dan çox düşdükdə retraining trigger
şəklində təsvir edilir.
Türkiyə baxımından nə ifadə edir?
Tədqiqat Türkiyədəki bir bankın məlumatlarını ehtiva etmir və Türkiyədəki kredit qanunvericiliyi və ya müştəri davranışı üzərində doğrulanmamışdır.
Bununla yanaşı texniki arxitektura Türkiyə baxımından konseptual olaraq mənalıdır: qərar anında əlçatan məhdud və aşağı gecikməli məlumatlarla işləyən izaholunan online skor kartı ilə daha geniş müştəri məlumatından istifadə edən gecəlik və ya arxa-plan risk modelinin ayrılması, məlumat əlçatanlığı müddəti ilə model mürəkkəbliyini bir-birindən ayıran ümumi mühəndislik yanaşmasıdır.
Türkiyədə bir tətbiqdə WOE bin-ləri, kredit bürosu quruluşu, gəlir/borc davranışı, default tərifi, fairness qrupları, model idarəçiliyi və hüquqi tələblər yerli məlumat və qaydalarla sıfırdan doğrulanmalıdır. Qazaxıstandakı AUROC və ya Gini nəticələri Türkiyə portfelinə birbaşa daşına bilməz.
Tədqiqatın dəstəklədiyi nəticələr
- Eyni mövcud-müştəri test kohortunda 72 xüsusiyyətli offline ensemble, 9 xüsusiyyətli olaraq bildirilən LR-Old skor kartından daha yüksək AUROC, KS və Gini yaratmışdır.
- Mövcud və yeni müştərilər üçün istifadə olunan online WOE-LR modelləri mənbə test dəstində müvafiq olaraq təxminən 0,847 və 0,835 AUROC vermişdir.
- Offline ensemble test AUROC-su təxminən 0,918 və Gini-si təxminən 0,836-dır.
- Offline modeldə kredit bürosu, bankdaxili pul axını, depozit və əməliyyat məlumatları mühüm predictive signal daşıyır.
- Score-band təhlili default riskinin ən riskli banddan ən təhlükəsiz banda doğru müntəzəm azaldığını göstərir.
- Araşdırılan demoqrafik dilimlərdə mənbə tərəfindən kiçik fairness gap dəyərləri bildirilmişdir.
- SHAP töhfələri istehsal səviyyəsində reason code-lara çevrilən izah xətti kimi hazırlanmışdır.
- Tədqiqat monitoring, model registry və retraining trigger-larını əhatə edən ucdan-uca MLOps yanaşmasını təsvir edir.
Tədqiqatın dəstəkləmədiyi və ya sübut etmədiyi nəticələr
- Modelin başqa banklarda, ölkələrdə və ya iqtisadi dövrlərdə eyni performansı göstərəcəyi sübut edilməmişdir.
- Həqiqi out-of-time və ya ikinci qurum üzərində external validation aparılmamışdır.
- Random hold-out validation iqtisadi rejim dəyişikliyinə qarşı dayanıqlılıq testi deyil.
- Fairness audit bütün mümkün demoqrafik qruplarda ayrı-seçkiliyin olmadığını sübut etmir.
- SHAP istifadə edilməsi təkbaşına qanunvericiliyə tam uyğunluq sertifikatı demək deyil.
- %60 qəbul nisbətindəki 240 baz bəndlik bad-rate fərqi reallaşmış maliyyə zərərinin azalması deyil.
- KMeans seqmentləri kredit qərarında doğrulanmış causal risk seqmentləri deyil.
- Tədqiqat recession və ya makroiqtisadi stress dövründə sınaqdan keçirilməmişdir.
- Mənbədə rejected applicants və reject inference barədə kifayət qədər məlumat olmadığı üçün modelin bütün müraciət kainatını təmsil etmə qabiliyyəti dəqiqləşdirilə bilmir.
- Brier skorundakı %18 kalibrləmə yaxşılaşması, Şəkil 5-də verilən 0,1918 → 0,0726 dəyərləri ilə riyazi olaraq uyğun gəlmir.
Tədqiqatın Metodu və Nəticələri
Analitik populyasiya
| Mərhələ | Qeyd sayı |
|---|---|
| İlkin POS kredit qeydləri | 926.000 |
| Müştəri tərəfindən ləğv edilən və çıxarılan qeydlər | 119.463 |
| Yekun analitik nümunə | 806.537 |
| Mövcud müştərilər | 455.827 |
| Yeni müştərilər | 350.710 |
Model və seqment quruluşu
| Model | Seqment | Alqoritm | Mənbədə verilən xüsusiyyət sayı | Kanal |
|---|---|---|---|---|
| LR-Old | Mövcud müştəri | WOE + L2 Logistic Regression | 9 | Real vaxt |
| Ens-Off | Mövcud müştəri | LightGBM + CatBoost + NN + logistic stacking + isotonic calibration | 72 | Gecəlik batch |
| LR-New | Yeni müştəri | WOE + L2 Logistic Regression | 9 | Real vaxt |
Mənbə qeydi: Bölmə 3.5 və Şəkil 1 online roster üçün əlavə dörd bureau xüsusiyyəti göstərdiyindən online feature count mənbə daxilində tam uyğun deyil.
Train/test/validation ölçüləri
| Seqment/model | Train | Test | Validation |
|---|---|---|---|
| Mövcud müştəri — LR | 319.078 | 91.211 | 45.538 |
| Mövcud müştəri — Ensemble | 319.078 | 91.211 | 45.538 |
| Yeni müştəri — LR | 245.497 | 70.177 | 35.036 |
Əsas discrimination nəticələri
| Model | Train AUROC | Test AUROC | Validation AUROC | Test KS | Test Gini |
|---|---|---|---|---|---|
| LR-Old | 0,8472 | 0,8475 | Bildirilməyib | 0,5555 | 0,6950 |
| Ens-Off | 0,9327 | 0,9178 | 0,9171 | 0,6825 | 0,8356 |
| LR-New | 0,8345 | 0,8348 | Bildirilməyib | 0,5310 | 0,6696 |
Ens-Off-un train AUROC-su 0,9327-dən testdə 0,9178-ə düşür. Validation AUROC-sunun 0,9171 olması eyni təsadüfi bölünmüş məlumat pəncərəsi daxilində hold-out performansının test nəticəsinə yaxın olduğunu göstərir; bu nəticə zaman və ya qurum üzrə transportability sübutu deyil.
Verianla Live: Eyni mövcud-müştəri kohortunda online və offline kredit modeli
Aşağıdakı müqayisə yalnız eyni mövcud-müştəri test dəstindəki LR-Old və Ens-Off modellərini əhatə edir. Hər üç metrik 0–1 miqyasındadır və daha yüksək dəyər daha güclü sinif ayrımına uyğundur.
| Model | Test AUROC | Test KS | Test Gini |
|---|---|---|---|
| LR-Old — real vaxt skor kartı | 0.8475 | 0.5555 | 0.6950 |
| Ens-Off — offline ensemble | 0.9178 | 0.6825 | 0.8356 |
Verianla Live: Dəyərlər tədqiqatın Cədvəl 6-sındakı mövcud-müştəri test nəticələridir. Müqayisə eyni kohort üzərində aparıldığı üçün yeni-müştəri LR-New modeli bu vizuallaşdırmaya daxil edilməmişdir.
Verianla Live müqayisəsinin əsas mesajı odur ki, offline ensemble eyni mövcud-müştəri test populyasiyasında hər üç discrimination metrikində də real vaxt skor kartından daha yüksək dəyər yaradır. Bunun əvəzi daha geniş feature roster, daha mürəkkəb model, ayrıca inference infrastrukturu və real vaxt əvəzinə gecəlik batch kanalının istifadəsidir.
Eyni kohortdakı baseline müqayisəsi
| Model | AUROC | Gini |
|---|---|---|
| Tək fcb_feature1 Logistic Regression | 0,781 | 0,562 |
| Vanilla LR — WOE yoxdur | 0,821 | 0,642 |
| Standalone LightGBM | 0,910 | 0,820 |
| LR-Old | 0,847 | 0,695 |
| Ens-Off | 0,918 | 0,836 |
Bu cədvəl xüsusilə ensemble ilə standalone LightGBM arasındakı fərqin, online LR ilə ensemble arasındakı fərqdən xeyli kiçik olduğunu göstərir. Ens-Off-un AUROC-su standalone LightGBM-dən 0,008 yüksəkdir.
Ən informativ predictor ailələri
Ən yüksək Information Value dəyərləri əsasən kredit bürosu xüsusiyyətlərində görünür.
| Xüsusiyyət | Ümumi açıqlama | IV — mövcud müştəri | IV — yeni müştəri |
|---|---|---|---|
| fcb_feature2 | Ən pis bureau delinquency şiddəti | 0,730 | 0,660 |
| fcb_feature3 | Aktiv bureau kredit münasibətlərinin genişliyi | 0,725 | 0,295 |
| fcb_feature1 | Yaxın dövr bureau sorğu intensivliyi | 0,715 | 0,640 |
| app_feature1 | Bəyan edilmiş gəlir | 0,640 | 0,450 |
| app_feature2 | Tələb olunan məbləğ / gəlir nisbəti | 0,635 | 0,555 |
Operating point nəticəsi
Ens-Off üçün Youden-optimal hədd təxminən:
\[ \hat p^\star=0{,}456 \]
kimi verilmişdir.
Bu nöqtədə:
\[ Sensitivity=0{,}716 \]
və:
\[ Specificity=0{,}881 \]
bildirilir.
Test confusion matrix:
| Predicted 0 | Predicted 1 | |
|---|---|---|
| Actual 0 | 72.145 | 9.745 |
| Actual 1 | 2.647 | 6.674 |
Kalibrləmə nəticəsi və problemli hesabat
| Ens-Off çıxışı | Şəkil 5-dəki Brier skoru |
|---|---|
| Isotonic-dən əvvəl stacked meta-learner | 0,1918 |
| Isotonic-dən sonra production PD | 0,0726 |
Şəkildə verilən dəyərlər təxminən %62,1 nisbi azalmaya uyğundur. Buna baxmayaraq xülasə, nəticələr və yekun bölmə təxminən %18 azalma bildirir. Buna görə kalibrləmənin istiqaməti açıq şəkildə yaxşılaşma göstərsə də, yaxşılaşmanın böyüklüyü mənbə mətnində etibarlı şəkildə tək faizlə bildirilə bilmir.
Fairness nəticələri
| Qrup | AUROC | ΔDP (bənd) | ΔTPR (bənd) | ΔFPR (bənd) | ΔPPV (bənd) |
|---|---|---|---|---|---|
| Qadın | 0,916 | +0,3 | +0,4 | +0,2 | −0,5 |
| Kişi | 0,920 | −0,2 | −0,3 | −0,1 | +0,4 |
| 18–30 | 0,913 | −1,2 | −1,4 | −0,6 | −1,3 |
| 31–45 | 0,919 | +0,1 | +0,2 | +0,1 | +0,2 |
| 46–60 | 0,922 | +0,5 | +0,6 | +0,3 | +0,7 |
| 60+ | 0,917 | +0,8 | +0,9 | +0,4 | +0,9 |
| Şəhər | 0,919 | +0,2 | +0,3 | +0,1 | +0,3 |
| Kənd | 0,914 | −0,9 | −1,1 | −0,5 | −1,0 |
Ən böyük mütləq fərq 18–30 yaş qrupundakı −1,4 bəndlik TPR fərqidir. Lakin bu cədvəlin etibar intervalı və ya qrup üzrə \(n\) dəyərləri verilmədiyindən nəticələrin qeyri-müəyyənliyi kəmiyyətcə göstərilmir.
Decision Curve Analysis bildirildimi?
Şəkil 2-dəki pipeline qiymətləndirmə komponentləri arasında DCA da sadalanır. Buna baxmayaraq nəticə bölmələrində Decision Curve Analysis nəticəsi və ya qrafiki yoxdur.
Tədqiqatın gələcək iş bölməsində DCA-nın daha sonra siyasət hədlərinə uyğun şəkildə təqdim ediləcəyi bildirilir. Buna görə mövcud məqalə DCA-nı tamamlanmış analiz kimi dəstəkləmir.
İstehsal və yenidən təlim məntiqi
Mənbənin təklif etdiyi əməliyyat dövrü:
model registry → aylıq monitoring → üç aylıq governance review → threshold pozulduqda yenidən təlim
şəklindədir.
Retraining üçün bildirilən iki əsas şərt:
\[ PSI_{\mathrm{feature}}>0{,}25 \]
və ya:
\[ KS\ \text{düşüşü}>10\% \]
olmasıdır.
Tədqiqatın əsas mühəndislik töhfəsi
Məqalənin töhfəsi yeni gradient-boosting alqoritmi, yeni SHAP üsulu və ya yeni calibration texnikası hazırlamaq deyil. Müəlliflər bunu açıq şəkildə “real-world implementation study” kimi mövqeləndirirlər.
Orijinallıq iddiası əsasən bu komponentlərin tək əməliyyat strukturunda birləşdirilməsinə əsaslanır:
feature availability → kanal ayrımı → WOE-LR → ensemble → isotonic calibration → SHAP reason codes → fairness audit → PSI/KS monitoring → champion–challenger governance.
Ən mühüm məhdudiyyətlər
- Tək maliyyə qurumunun məlumatları istifadə edilmişdir.
- Random split istifadə edilmiş; həqiqi out-of-time validation aparılmamışdır.
- İqtisadi durğunluq və ya fərqli faiz/inflyasiya rejimində stress validation yoxdur.
- Çox yüksək IV dəyərləri zaman ərzində yenidən araşdırılmalıdır.
- Ən yüksək risk decile-ında isotonic modelin yüngül risk həddən artıq qiymətləndirməsi davam edir.
- KMeans seqmentasiyası üçün bootstrap cluster-stability təhlili aparılmamışdır.
- Online feature count mənbə daxilində uyğun deyil.
- Brier yaxşılaşmasının faiz dəyəri mənbədəki rəqəmlərlə uyğun gəlmir.
- Fairness audit-də qrup ölçüsü və uncertainty intervalları verilməmişdir.
- Rədd edilmiş müraciətlərin analitik populyasiyadakı statusu və reject inference yanaşması açıqlanmır.
- Xam kredit qeydləri bank məxfiliyi səbəbindən ictimaiyyətə açıq deyil.
Gələcək tədqiqatlar
Mənbə dörd əsas növbəti addımı müəyyən edir:
- 2024 Q2–Q4 originasiyaları üzərində həqiqi out-of-time validation,
- bank siyasət hədləri ilə decision-curve analysis,
- qeyri-müəyyən halları manual underwriting-ə yönləndirmək üçün conformal prediction,
- başqa bir inkişaf etməkdə olan bazarın POS portfelində transportability qiymətləndirilməsi.
Mənbə və Metod Qeydi
Tam orijinal iş adı: An Explainable Hybrid AI Framework for Real-Time Point-of-Sale Credit Scoring
Müəlliflər: Gulnaz Zakariya; Aiman Moldagulova; Nor’ashikin Ali.
Bərabər birinci/bərabər töhfə: Mənbədə göstərilməyib.
Məsul müəllif: Aiman Moldagulova.
Qurumlar: Department of Software Engineering, Satbayev University, Almaty, Kazakhstan; Department of Cybersecurity, Information Processing and Storage, Satbayev University, Almaty, Kazakhstan; Department of Information Systems, Universiti Tenaga Nasional, Kajang, Selangor, Malaysia.
Mənbə növü: Rəyli orijinal tədqiqat məqaləsi; retrospektiv tək-portfel kredit riski modelinin hazırlanması və internal validation tədqiqatı.
Jurnal: AI.
Nəşriyyat: MDPI.
Biblioqrafik qeyd: AI, 2026, Cild 7, Sayı 6, Məqalə 211.
DOI: 10.3390/ai7060211.
Qəbul / reviziya / qəbul edilmə / nəşr: 11 May 2026 / 7 İyun 2026 / 8 İyun 2026 / 9 İyun 2026.
Rəyçilik vəziyyəti: Rəyli jurnal nəşridir.
Lisenziya: Creative Commons Attribution (CC BY).
Academic Editors: Albert Y.S. Lam; Andy Chun.
Tədqiqat dövrü: 1 Yanvar 2023–31 Mart 2024.
İlkin qeyd sayı: 926.000.
Analitik nümunə: 806.537.
Default nisbəti: %10,22.
Default tərifi: Müşahidə olunan müqavilə ömrü ərzində ən azı bir dəfə 90 və ya daha çox gün gecikmə; NPL91_EVER.
Müştəri seqmentləri: 455.827 mövcud müştəri və 350.710 yeni müştəri.
Əsas model 1: LR-Old — mövcud müştərilər üçün WOE + L2 Logistic Regression real vaxt skor kartı.
Əsas model 2: Ens-Off — mövcud müştərilər üçün LightGBM + CatBoost + üçqatlı neural network stacked ensemble və isotonic calibration.
Əsas model 3: LR-New — yeni müştərilər üçün WOE + L2 Logistic Regression real vaxt skor kartı.
Model seçimi/tuning: Stratified five-fold cross-validation və Optuna TPE; hər ensemble base learner üçün 30 sınaq.
Test AUROC: LR-Old 0,8475; Ens-Off 0,9178; LR-New 0,8348.
Test Gini: LR-Old 0,6950; Ens-Off 0,8356; LR-New 0,6696.
Test KS: LR-Old 0,5555; Ens-Off 0,6825; LR-New 0,5310.
Ens-Off validation AUROC: 0,9171. Bu validation eyni tədqiqat dövründən random hold-out-dur; external və ya out-of-time validation deyil.
Explainability: LightGBM və CatBoost üçün TreeSHAP, neural component üçün KernelSHAP; record-level ən güclü mənfi töhfələr adverse-action reason code-lara çevrilir.
Fairness: Cins, yaş qrupu və şəhər/kənd yaşayışı üçün demographic parity, TPR, FPR və PPV fərqləri araşdırılmışdır.
Monitoring: PSI, KS və bad-rate; aylıq monitorinq, üç aylıq governance qiymətləndirilməsi.
Maliyyələşmə: Tədqiqat xarici maliyyələşmə almadığını bildirir.
Etik komitə: Tətbiq edilə bilməz kimi göstərilmişdir. Mənbə şəxsiyyətsizləşdirilmiş və qurumdaxili bank məlumatlarından istifadə edildiyini, insan-subyekt tədqiqatı aparılmadığını bildirir.
Məlumatlandırılmış razılıq: Tətbiq edilə bilməz kimi bildirilmişdir.
Məlumatların əlçatanlığı: Xam kredit səviyyəli məlumat bank məxfiliyi səbəbindən ictimaiyyətə açıq deyil. Mənbə anonim aggregate statistikaların, feature-family səviyyəli lüğətin, WOE bin təriflərinin, iki production scorecard əmsalının və figure-generation kodunun məqbul tələb və məlumat istifadəsi müqaviləsi əsasında məsul müəllifdən istənə biləcəyini bildirir.
Müəllif töhfələri: Konseptuallaşdırma G.Z. və A.M.; metodologiya, proqram təminatı, formal təhlil, tədqiqat, məlumat kurasiyası, ilk qaralama və vizuallaşdırma G.Z.; doğrulama bütün müəlliflər; resurslar və layihə idarəetməsi A.M.; rəhbərlik A.M. və N.A.; nəzərdən keçirmə/redaktə A.M. və N.A.
Maraq toqquşması: Müəlliflər maraq toqquşması bildirməmişdir. Tərəfdaş maliyyə qurumunun metod seçimi, qiymətləndirmə meyarları, məqalənin yazılması və ya nəşr qərarında rol oynamadığı bildirilir.
Mənbəyə sədaqət baxımından kritik qeydlər
Kalibrləmə: Mətndəki “təxminən %18 Brier azalması” ilə Şəkil 5-dəki 0,1918 → 0,0726 rəqəmləri uyğun gəlmir. Verianla bu iki məlumatdan birini mənbə adından düzəltmir.
Online model roster-i: Şəkil 1 və Bölmə 3.5 online yol üçün 9 application + 4 bureau sahəsi göstərdiyi halda Cədvəl 2 və model xülasələri 9 xüsusiyyət bildirir. Yekun production input count mənbədə aydın deyil.
Validation: “Validation” termini random hold-out mənasındadır; həqiqi zamanxarici doğrulama gələcək iş kimi saxlanılmışdır.
DCA: Şəkil 2 pipeline-ında DCA sadalansa da, mövcud nəticə bölməsində DCA yoxdur və gələcək iş kimi təklif edilir.
Fairness: Demographic-parity formulunun müsbət sinif istiqaməti ilə “approval rate” izahı arasında terminoloji/riyazi qeyri-müəyyənlik vardır.
Məlumat populyasiyası: Tədqiqat “contracts” və “loan applications” ifadələrini növbəli istifadə edir; rejected-applicant populyasiyası və reject inference prosesi izah edilmir.
Elmi şərh sərhədi
Bu tədqiqat real bank portfelində hazırlanmış istehsal yönümlü kredit riski arxitekturasını bildirir; lakin bildirilən performans tək qurum və tək ölkə kontekstinə aiddir.
AUROC 0,918 və ya Gini 0,836 kimi dəyərlər başqa bankın müştəri bazasında gözlənilən performans kimi istifadə edilə bilməz. Kredit bürosunun əhatəsi, müştəri davranışı, məhsul dizaynı, iqtisadi rejim və feature availability dəyişdikdə model performansı da dəyişə bilər.
Fairness nəticələri yalnız araşdırılan demoqrafik qrupları və araşdırılan test dəstini əhatə edir. Kiçik gap dəyərləri hüquqi və ya etik baxımdan universal “ədalətli model” sertifikatı deyil.
Eyni şəkildə SHAP reason code sistemi izaholunanlığı dəstəkləyən mühəndislik mexanizmidir; təkbaşına bütün model idarəçiliyi və ya tənzimləyici uyğunluq tələblərinin ödənildiyini sübut etmir.

Şərh yazın
E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib