Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Компьютер илими / Акчаны Адалдоого Каршы Күрөштөгү Божомолдоочу Аналитика: Жогорку Жыштыктагы Соода Кыянаттыктарын жана Финансылык Кылмыштын Эрте Эскертүү Белгилерин Аныктоо
Компьютер илими

Акчаны Адалдоого Каршы Күрөштөгү Божомолдоочу Аналитика: Жогорку Жыштыктагы Соода Кыянаттыктарын жана Финансылык Кылмыштын Эрте Эскертүү Белгилерин Аныктоо

Бул изилдөө жогорку жыштыктагы соода (HFT) чөйрөлөрүндө пайда болушу мүмкүн болгон шектүү бүтүм үлгүлөрүн божомолдоочу аналитика жана машиналык үйрөнүү аркылуу аныктоого багытталган anti-money laundering (AML) алкагын сунуштайт.

18/09/2026  Veri Anla 91 көрүү
Акчаны Адалдоого Каршы Күрөштөгү Божомолдоочу Аналитика: Жогорку Жыштыктагы Соода Кыянаттыктарын жана Финансылык Кылмыштын Эрте Эскертүү Белгилерин Аныктоо

Бул изилдөө жогорку жыштыктагы соода (HFT) чөйрөлөрүндө пайда болушу мүмкүн болгон шектүү бүтүм үлгүлөрүн божомолдоочу аналитика жана машиналык үйрөнүү аркылуу аныктоого багытталган anti-money laundering (AML) алкагын сунуштайт. Random forest сыяктуу көзөмөлдөнгөн үйрөнүү ыкмалары менен autoencoder негизиндеги аномалияны аныктоо салыштырылган изилдөөдө; бүтүм ылдамдыгы, бүтүм жыштыгы, bid-ask spread, эсептин түрү жана убакыт белгисинин топтолушу сыяктуу өзгөчөлүктөр финансылык кылмыш үчүн эрте эскертүү сигналдары катары моделденет.

Изилдөөдө колдонулган маалыматтар чыныгы биржа иликтөө жазууларынан турбайт. Изилдөөчү Январь 2017–Декабрь 2018 мезгилин чагылдыргандай кылып 1 миллион бүтүмдөн турган гипотетикалык, бирок реалисттик деп кабыл алынган синтетикалык глобалдык акциялар HFT маалымат топтомун түзгөн. Бүтүмдөрдүн %2'si layering же spoofing сыяктуу үлгүлөргө ылайык шектүү деп белгиленип, 200.000 бүтүм окутуу үчүн колдонулган, калган 800.000 бүтүм валидация жана тест топтомдоруна тең бөлүнгөн.

Булакта random forest модели %85 accuracy, %80 precision, %78 recall жана %79 F1-score көрсөткүчүнө жетсе, autoencoder модели тиешелүүлүгүнө жараша %78, %75, %70 жана %72 маанилерине жетет. Random forest моделинде өзгөрмөнүн эң жогорку маанилүүлүгү 0,35 менен trade velocity, башкача айтканда секундасына бүтүмдүн интенсивдүүлүгүнө берилген.

Бул көрсөткүчтөр чыныгы AML операциясында тастыкталган деген тыянак чыгарууга болбойт. Синтетикалык маалымат чыныгы базарлардагы жетишпеген маалыматтар, туура эмес белгилөөлөр, ар башка базар режимдери, буйруктарды жокко чыгаруу, venue fragmentation жана кылмыштуу жүрүм-турумдун атайылап өзгөрүшү сыяктуу көйгөйлөрдү толук чагылдырбашы мүмкүн. Изилдөө да бул чектөөнү ачык моюнга алат.

Жогорку жыштыктагы соода AML жагынан эмне үчүн изилденет?

Жогорку жыштыктагы соода өтө кыска убакыт аралыгында автоматтык түрдө көп сандагы буйрук жана бүтүм жарата алат. Бул ылдамдык жана көлөм салттуу туруктуу босоголуу AML системалары үчүн олуттуу маалымат иштетүү көйгөйүн жаратат. Кадимки HFT стратегиясы да секундалардын же миллисекундалардын ичинде миңдеген билдирүүлөрдү жарата алгандыктан, бүтүмдөрдүн санына гана негизделген жөнөкөй эрежелер көп сандагы жалган эскертүүлөрдү жаратышы мүмкүн.

Изилдөөнүн негизги мамилеси туруктуу AML эрежелеринин ордуна маалыматтын ичиндеги көп өзгөрмөлүү үлгүлөрдү үйрөнгөн моделдерди колдонуу болуп саналат. Ошентип, бир гана “бүтүм санынын босогосунун” ордуна бүтүмдүн интенсивдүүлүгү, жыштыгы, spread жүрүм-туруму, эсептин түрү жана убакыт боюнча топтолуу чогуу бааланат.

Божомолдоочу Аналитика Салттуу AML Эрежелеринен Кантип Айырмаланат?

Эрежеге негизделген AML системалары алдын ала аныкталган босоголор жана сценарийлер аркылуу эскертүү чыгарса, божомолдоочу аналитика өткөн же синтетикалык түрдө белгиленген үлгүлөрдөн статистикалык байланыштарды үйрөнөт. Көзөмөлдөнгөн модель белгилүү шектүү үлгүлөрдү классификациялоого аракет кылса, көзөмөлдөнбөгөн модель мурда белгиленбеген өзгөчө жүрүм-турумдарды аномалия катары белгилей алат.

Ошондуктан изилдөө эки башка мамилени салыштырат:

МодельҮйрөнүү түрүИзилдөөдөгү ролу
Random ForestКөзөмөлдөнгөн үйрөнүүБелгиленген нормалдуу жана шектүү бүтүмдөрдү классификациялоо
AutoencoderКөзөмөлдөнбөгөн / аномалияга негизделген мамилеНормалдуу үлгүдөн четтөөлөрдү аныктоо

Random forest белгилүү жана белгиленген үлгүлөрдө жогорку натыйжа көрсөтөт. Autoencoder болсо жалпы натыйжасы төмөнүрөөк болгонуна карабастан, мурда аныкталбаган аномалияларды кармоого мүмкүндүк берген толуктоочу механизм катары талкууланат.

Синтетикалык маалымат кантип түзүлөт?

Булак глобалдык акциялар базарын чагылдырган 1 миллион HFT бүтүмүн түзөт. Маалымат түзүмү NASDAQ сыяктуу коомчулукка ачык базар маалыматтарынан, SEC жөнгө салуучу отчетторунан жана FATF типологияларынан шыктануу менен иштелип чыккан. Ар түрдүүлүктү камсыз кылуу максатында Monte Carlo негизиндеги синтетикалык маалымат түзүү жөнүндө айтылат.

Ар бир бүтүмдө колдонулган негизги өзгөрмөлөр төмөнкүлөр:

  • бүтүм көлөмү,
  • бүтүм жыштыгы,
  • bid-ask spread,
  • эсептин түрү,
  • timestamp,
  • туунду trade velocity,
  • убакыт боюнча топтолууга байланышкан көрсөткүчтөр.

Булакта бүтүмдөрдүн болжол менен %2'si layering же spoofing сыяктуу шектүү үлгүлөрдү камтыгандай белгиленгени айтылат.

Синтетикалык Маалымат Эмне Үчүн Маанилүү Чектөө?

Синтетикалык маалымат модель иштеп чыгуу жана көзөмөлдөнгөн салыштырууларды жүргүзүү үчүн пайдалуу; бирок чыныгы базардагы жүрүм-турумдардын бардык татаалдыгын камтыбайт. Чыныгы HFT маалыматтарында жетишпеген жазуулар, venue routing, market-maker жүрүм-туруму, буйруктарды жокко чыгаруу, ар кандай ликвиддүүлүк режимдери, жаңылык окуялары, эсептер арасындагы байланыштар жана туура эмес же толук эмес AML белгилери болушу мүмкүн.

Ошондуктан изилдөөдөгү %85 accuracy мааниси чыныгы финансылык мекеменин жандуу AML системасында күтүлүүчү натыйжа катары колдонулбашы керек. Бул сан изилдөөчү түзгөн синтетикалык маалымат жана белгилөө алкагынын ичинде random forest моделинин тесттик натыйжасы болуп саналат.

Үлгү алуу жана маалыматты бөлүү

Изилдөөдө окутуу үчүн stratified sampling колдонулат. Жалпы 1 миллион бүтүмдүн ичинен 200.000 бүтүм моделди окутуу үчүн тандалат. Катмарлоо эсептин түрүнө жана бүтүм көлөмүнө жараша жүргүзүлөт.

Калган 800.000 бүтүм экиге тең бөлүнүп:

  • 400.000 валидация байкоосу,
  • 400.000 тест байкоосу

катары колдонулат.

Изилдөөчү кайталануучулук үчүн random seed мааниси 42 болуп бекитилгенин билдирет.

Колдонулган эсептөө куралдары

Көзөмөлдөнгөн моделдер үчүн scikit-learn, autoencoder колдонмосу үчүн TensorFlow жана чоң көлөмдөгү маалыматтарды иштетүү үчүн Apache Spark колдонулганы айтылат. Моделдин натыйжасы accuracy, precision, recall жана F1-score аркылуу бааланат.

Бул куралдардын колдонулганы эле моделдин реалдуу убакыттагы өндүрүш чөйрөсүнө даяр экенин билдирбейт. Реалдуу убакыт HFT көзөмөлү кечигүү, throughput, маалымат бүтүндүгү, model drift'i жана түшүндүрмөлүүлүк сыяктуу кошумча талаптарды камтыйт.

Изилдөөнүн Ыкмасы жана Жыйынтыктары

Random forest жана autoencoder натыйжасы

МодельAccuracyPrecisionRecallF1-Score
Random Forest0,850,800,780,79
Autoencoder0,780,750,700,72

Булактын 1-таблицасындагы жыйынтыктарда random forest бардык төрт натыйжа өлчөмү боюнча autoencoderдан жогору турат. Accuracy айырмасы 7 пайыздык пункт, recall айырмасы 8 пайыздык пункт жана F1 айырмасы 7 пайыздык пункт.

Бул жерде accuracy жалгыз жетиштүү баалоо өлчөмү эмес. Маалымат топтомунун болгону %2'si шектүү деп белгиленгени айтылат; ошондуктан олуттуу класстык тең салмаксыздык бар AML маселесинде precision, recall, F1 жана класс боюнча ката бөлүштүрүү өзгөчө маанилүү.

AML Моделиндеги Эң Маанилүү Эрте Эскертүү Көрсөткүчтөрү Кайсылар?

Random forest моделинин булакта берилген feature importance маанилери төмөнкүдөй:

ӨзгөчөлүкImportance
Trade Velocity0,35
Transaction Frequency0,25
Bid-Ask Spread0,20
Account Type0,15
Timestamp Clustering0,05

Моделдин эң күчтүү өзгөчөлүгү trade velocity катары берилген. Бул өзгөрмө белгилүү бир убакыт бирдигинде болгон бүтүмдөрдүн интенсивдүүлүгүн билдирет. Андан кийин transaction frequency жана bid-ask spread келет.

Feature importance мааниси өзгөрмө өзү кылмыштын себеби экенин же белгилүү бир бүтүм ылдамдыгы автоматтык түрдө шектүү деп эсептелиши керектигин билдирбейт. Random forest маанилүүлүк өлчөмдөрү моделдин ичиндеги божомолго кошкон салымды көрсөтөт жана өзгөрмөлөрдүн ортосунда корреляция бар болгондо экономикалык чечмелөөлөр этият жүргүзүлүшү керек.

Моделди окутуу учурундагы тактык

Булактын Figure 1 графигинде random forest моделинин accuracy мааниси беш окутуу итерациясында болжол менен %75тен %85ке көтөрүлөт. Autoencoder болсо болжол менен %70тен %78ге чыгат.

Бул сүрөт random forest моделинин берилген синтетикалык сценарийде тезирээк жана жогорку натыйжа деңгээлине жеткенин көрсөтөт. Бирок “training iteration” түшүнүгү алгоритмдик жактан кантип түзүлгөнү булакта кеңири түшүндүрүлгөн эмес; ошондуктан графикти классикалык epoch-based learning curve менен бирдей деп эсептөөгө болбойт.

Жалган позитивдер жөнүндө эмне айтылат?

Жыйынтык бөлүмүндө сунушталган мамиле салттуу rule-based системаларга салыштырмалуу жалган позитивдерди %25 азайтканы айтылат. Бирок бул жыйынтык үчүн өзүнчө таблица, confusion matrix же түз эксперименттик салыштыруу булакта көрсөтүлгөн эмес.

Ошондуктан %25 саны изилдөөнүн жыйынтык бөлүмүндөгү автордук билдирүү катары берилиши мүмкүн; ал өз алдынча кайра эсептелген же кеңири эксперименттик таблица менен тастыкталган жыйынтык катары көрсөтүлбөшү керек.

Реалдуу убакыттагы аныктоо мөөнөтү

Булак жыйынтык бөлүмүндө detection delayди %40 азайтууга болорун да билдирет. Бирок ошол эле абзац бул жыйынтыкты Wang жана анын кесиптештеринин мурунку жыйынтыктары менен байланыштырат жана азыркы изилдөөдө буга байланыштуу өз алдынча кечигүү benchmark таблицасы берилбейт.

Ошондуктан %40 кечигүүнү азайтуу мааниси да азыркы синтетикалык эксперименттин түз өлчөнгөн негизги жыйынтыктарынын бири катары бааланбашы керек.

Layering жана Spoofing Акчаны Адалдоо менен Бир Эле Нерсеби?

Жок. Layering жана spoofing адатта буйруктар китебине адаштыруучу буйруктар менен таасир берүү же базар катышуучуларын туура эмес баа/ликвиддүүлүк сигналдары менен багыттоо менен байланышкан базарды манипуляциялоо жүрүм-турумдары болуп саналат. Акчаны адалдоо болсо кылмыштуу кирешенин булагын жана ээлигин жашыруу процесси.

Булак бул жүрүм-турумдарды кеңири “financial crime” жана AML эрте эскертүү алкагында чогуу карайт. Бирок spoofing же layering эскертүүсү өзүнчө money laundering далили эмес. AML системасында мындай жүрүм-турумдар эсептер арасындагы каражат агымы, beneficial ownership, кардар профили жана башка бүтүм контексттери менен бирге гана бааланышы керек.

Көзөмөлдөнгөн жана көзөмөлдөнбөгөн моделдерди чогуу колдонууга болобу?

Изилдөөнүн талкуу бөлүмүндө гибриддик система сунушталат. Random forest мурда белгиленген белгилүү үлгүлөрдө жогорку классификация натыйжасын бере алса, autoencoder мурда кездешпеген аномалдуу жүрүм-турумдарды аныктоо үчүн колдонулушу мүмкүн.

Сунушталган жалпы архитектураны төмөнкүдөй элестетүүгө болот:

Жандуу бүтүм агымы → өзгөчөлүктөрдү чыгаруу → аномалияны сканерлөө → supervised risk упайы → AML аналитигинин кароосу

Бирок булак бул гибриддик системаны эксперименттик түрдө түзүп, өзүнчө натыйжа метрикалары менен сынабайт. Ошондуктан гибриддик мамиле изилдөөнүн келечекке багытталган сунушу болуп саналат.

Түшүндүрмөлүүлүк көйгөйү

AML чечимдери жөнгө салуучулар жана комплаенс топтору үчүн түшүндүрүлө турган болушу керек. Random forest сыяктуу моделдер жөнөкөй босого негизиндеги эрежелерге караганда татаалыраак чечим байланыштарын түзүшү мүмкүн.

Булак келечекте SHAP сыяктуу түшүндүрүлүүчү жасалма интеллект ыкмаларын колдонууну сунуштайт. Ошентип, эскертүүгө кайсы бүтүм өзгөчөлүктөрү канчалык таасир эткени аналитиктерге көрсөтүлүшү мүмкүн.

Изилдөө колдогон жыйынтыктар

  • Синтетикалык HFT маалымат топтомунда random forest, autoencoderга караганда жогорку accuracy, precision, recall жана F1-score көрсөткүчтөрүнө жеткен.
  • Random forest accuracy мааниси 0,85 деп берилген.
  • Trade velocity random forest моделинде 0,35 менен эң жогорку feature importance маанисине ээ.
  • Transaction frequency жана bid-ask spread кийинки эң маанилүү өзгөрмөлөр болуп саналат.
  • Көзөмөлдөнбөгөн аномалияны аныктоо белгиленбеген үлгүлөр үчүн толуктоочу мамиле катары талкууланат.
  • Реалдуу убакыт AML көзөмөлүндө чоң маалымат инфраструктурасы жана жогорку ылдамдыкта өзгөчөлүктөрдү чыгаруу маанилүү экени айтылат.

Изилдөө колдобогон жыйынтыктар

  • %85 accuracy чыныгы дүйнөдөгү HFT AML системаларында тастыкталган ийгилик көрсөткүчү эмес.
  • Изилдөө чыныгы бир миллион биржа бүтүмүн колдонбойт; маалымат синтетикалык.
  • Ар бир жогорку trade velocity мааниси акчаны адалдоонун көрсөткүчү эмес.
  • Layering же spoofing аныкталышы өзүнчө акчаны адалдоону аныктоо дегенди билдирбейт.
  • Булакта чыныгы жандуу-биржа latency benchmark'ы берилген эмес.
  • %25 false-positive азайышы жана %40 detection-delay азайышы кеңири эксперименттик таблица менен өз алдынча көрсөтүлгөн эмес.
  • Жыйынтыктарды крипто, туунду, FX же башка базарларга түз жалпылоого болбойт; маалымат дизайны акциялар HFT чөйрөсүнө багытталган.

Методологиялык чектөөлөр

Биринчи чектөө: Маалымат синтетикалык. Синтетикалык бүтүмдөр изилдөөчүнүн божомолдорун чагылдыргандыктан, модель ошол эле божомолдорду үйрөнүшү жана чыныгы базарда натыйжа төмөндөшү мүмкүн.

Экинчи чектөө: Шектүү белгилер мурунку AML иликтөөлөрүнөн шыктануу менен түзүлгөн деп кабыл алынганы менен, чыныгы белгиленген иликтөө маалыматтары колдонулган эмес.

Үчүнчү чектөө: Маалымат топтомундагы болгону %2 шектүү класс олуттуу class imbalance жаратат. Ошого карабастан булак ROC-AUC, PR-AUC, confusion matrix же class-weight таасирлерин билдирбейт.

Төртүнчү чектөө: HFT менен базар манипуляциясы жана money laundering түшүнүктөрү айрым бөлүмдөрдө бири-бирине абдан жакын колдонулат. Бул жүрүм-турумдар укуктук жана операциялык AML жагынан ар башка иликтөө түрлөрүн талап кылышы мүмкүн.

Бешинчи чектөө: Реалдуу убакыт колдонмосунун эсептөө инфраструктурасы Apache Spark аркылуу талкууланганы менен, end-to-end кечигүү, throughput жана peak-load тести берилбейт.

Алтынчы чектөө: Булактар тизмесиндеги айрым жазуулардын адабият бөлүмүндөгү шилтемелер менен толук дал келбеши жана айрым библиографиялык жазуулардын дата/тема жагынан кошумча көңүл бурууну талап кылышы макаладагы тышкы адабиятка байланышкан дооматтарды өзүнчө текшерүүнү зарыл кылат.

Булак жана Ыкма Жөнүндө Эскертүү

Түп нуска аталышы: Predictive Analytics in Anti-Money Laundering for Detecting High-Frequency Trading Abuses and Identifying Early Warning Signs of Financial Crime

Автор: Bharat Bhanushali.

PDFдеги аффилиация: BNP Paribas, Vice President, Jersey City, New Jersey, USA.

Басылма: International Journal of Research in Electronics and Computer Engineering (IJRECE).

Том / Сан: Vol. 7, Issue 1.

Мезгил: January–March 2019.

ISSN: 2393-9028 (Print), 2348-2281 (Online).

Беттер: 1273–1279.

Изилдөө түрү: Синтетикалык маалыматтагы машиналык үйрөнүүгө негизделген AML/HFT ыкма изилдөөсү.

Маалымат: 1 миллион синтетикалык HFT бүтүмү; Январь 2017–Декабрь 2018 мезгилин чагылдыргандай түзүлгөн.

Шектүү бүтүмдөрдүн үлүшү: %2.

Окутуу: 200.000 бүтүм.

Валидация: Болжол менен 400.000 бүтүм.

Тест: Болжол менен 400.000 бүтүм.

Негизги моделдер: Random forest жана autoencoder.

Программалоо / эсептөө: scikit-learn, TensorFlow жана Apache Spark.

Random seed: 42.

Негизги натыйжа: Random forest accuracy 0,85; precision 0,80; recall 0,78; F1 0,79. Autoencoder accuracy 0,78; precision 0,75; recall 0,70; F1 0,72.

Эң маанилүү feature: Trade Velocity — 0,35 importance.

Маалыматтын жеткиликтүүлүгү: Макала код жана синтетикалык маалымат шаблондору суроо боюнча берилиши мүмкүн экенин билдирет.

Автордук укук / лицензия: Каралган PDFде ачык Creative Commons же башка кайра колдонуу лицензиясы көрсөтүлгөн эмес. Ошондуктан булактагы таблица жана графиктерди түз кайра колдонууга уруксат бар деп эсептелбеши керек.

Негизги чечмелөө чеги: Жыйынтыктар синтетикалык маалыматта алынган жана чыныгы базардагы AML натыйжалуулугу катары жалпыланбашы керек.

Библиографиялык сапат эскертүүсү: Булактар тизмесинде адабият бөлүмүндөгү айрым шилтемелерге дал келбеген же тема/дата жагынан өзүнчө текшерүүнү талап кылган жазуулар бар. Ошондуктан Verianla тексти тышкы булактардын тууралыгын ырастабайт, PDFдин өзүнүн ыкмасын жана жыйынтыктарын гана баяндайт.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты