Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi za Jamii / Uchumi wa Kifedha / Uchanganuzi wa Ukwasi wa Biashara ya Masafa ya Juu kwa Ujifunzaji wa Mashine: Uainishaji wa Mwelekeo wa Bei wa Kila Dakika
Uchumi wa Kifedha

Uchanganuzi wa Ukwasi wa Biashara ya Masafa ya Juu kwa Ujifunzaji wa Mashine: Uainishaji wa Mwelekeo wa Bei wa Kila Dakika

Utafiti huu unachunguza uainishaji wa mwelekeo wa mwendo wa bei wa kila dakika kuwa “Up” au “Down” kwa kutumia vipimo vya ukwasi vilivyotokana na data za kifedha za masafa ya juu.

16/09/2026  Veri Anla Imetazamwa mara 87
Uchanganuzi wa Ukwasi wa Biashara ya Masafa ya Juu kwa Ujifunzaji wa Mashine: Uainishaji wa Mwelekeo wa Bei wa Kila Dakika

Utafiti huu unachunguza uainishaji wa mwelekeo wa mwendo wa bei wa kila dakika kuwa “Up” au “Down” kwa kutumia vipimo vya ukwasi vilivyotokana na data za kifedha za masafa ya juu. Mfumo wa utabiri wa utafiti ni mbinu ya ujifunzaji wa mashine inayotumia vigezo vya ukwasi vilivyoundwa kwa kiwango cha dakika kutoka data za Trade and Quote (TAQ) ndani ya Refinitiv Tick History kama viingizo kwa viainishaji vya Logistic Regression (LR), Support Vector Machine (SVM) na Random Forest (RF). Data zimewekewa kikomo katika muda wa 11:00-16:00, zimebadilishwa kuwa sampuli za dakika 1, na chanzo kinaeleza kuwa takribani uchunguzi 300 kwa siku ulipatikana kwa kila ticker. Usahihi ulioripotiwa kwa kutumia vipengele vyote ni %62,75 kwa LR, %62,79 kwa SVM na %60,78 kwa RF; kwa mchanganyiko wa vipengele vilivyochaguliwa ni %54,90, %50,98 na %62,74 mtawalia. Hata hivyo, kwa kuwa chanzo kina baadhi ya kutolingana kwa ndani kati ya jedwali, matriki ya mkanganyiko na maandishi ya matokeo, si sahihi kutoa hukumu moja isiyo na masharti kuhusu ubora wa modeli.

Katika maelezo ya waandishi kuhusu umuhimu wa vipengele, Liquidity Ratio, Flow Ratio na Turnover zinajitokeza miongoni mwa vipimo vya ukwasi vyenye athari kubwa zaidi. Utafiti unasema kuwa utabiri wa mwelekeo katika kipindi kifupi unaweza kunufaika na vipimo vingi vya ukwasi; hata hivyo, kwa sababu utambulisho wa hisa zilizotumika, kipindi cha tarehe, ukubwa wa jumla wa sampuli, uwiano wa madarasa, kernel ya SVM, hyperparameter za Random Forest, algoriti ya uteuzi wa vipengele na kanuni ya kina ya kuweka lebo lengwa hazijaripotiwa, uwezo wa kurudia matokeo na kuyajumlisha kwa masoko tofauti ni mdogo.

Tatizo la utafiti: kuchukulia ukwasi kama ishara yenye vipimo vingi badala ya namba moja

Ukwasi wa soko la fedha ni sifa ya soko yenye vipimo vingi inayohusiana na uwezo wa mali kununuliwa na kuuzwa huku gharama za muamala na athari kwa bei zikiwa zimewekewa kikomo. Badala ya kupunguza ukwasi kuwa spread moja au kiashirio kimoja cha depth, utafiti wa chanzo unategemea tathmini ya pamoja ya vipimo vinavyotokana na sifa tofauti za soko kama tightness, depth, resiliency na trading dynamics. Swali kuu la utafiti ni kama viashirio hivi vingi vya ukwasi vinatoa viingizo vyenye maana kwa ajili ya kuainisha mwelekeo wa bei katika vipindi vifupi vya muda.

Utafiti unategemea tafiti za awali kuhusu upangaji wa ukwasi katika makundi na matukio adimu ili kuelekea kuelewa hatari ya ukwasi katika data za masafa ya juu na kuunda modeli za utabiri wa mienendo ya bei. Sehemu ya mapitio ya maandiko inajadili athari za mishtuko ya uchumi mkuu au kisiasa kama Brexit kwa ukwasi, utambuzi wa matukio adimu kwa kutumia vitendaji vya Zonoid depth, upangaji wa ukwasi katika makundi kwenye data za masafa ya juu, na mifano ya uchanganuzi wa ukwasi wenye vipimo vingi. Mfumo huu wa maandiko haumaanishi kuwa utafiti ulijaribu moja kwa moja tukio jipya la kijiografia na kisiasa; umetumiwa tu kuhalalisha kwamba ukwasi ni sifa ya soko inayohisi mishtuko ya nje na isiyo ya kipimo kimoja.

Vipimo vya Ukwasi Vinatumikaje Katika Utabiri wa Mwelekeo wa Bei?

Katika utafiti, vipimo vya ukwasi vinatumika kama vigezo huru vinavyotokana na data za TAQ kwa kila kipindi cha dakika 1; vigezo hivi hupewa modeli za Logistic Regression, SVM na Random Forest ili mwelekeo wa mwendo wa bei uainishwe katika darasa la “Up” au “Down”. Chanzo hukusanya rekodi ya kwanza ya trade ndani ya dakika na rekodi zote za quote katika dakika hiyo; hukokotoa wastani wa bei za bid na ask za nukuu pamoja na ukubwa wa nukuu, kisha hubadilisha viashirio vya ukwasi vinavyotokana navyo kuwa viingizo vya uainishaji.

Mtiririko wa data

HatuaOperesheni iliyoripotiwa katika chanzoMaana ya kisayansi
Chanzo cha dataRefinitiv Tick History; TAQ na LOB katika ajenda ya utafitiRekodi za soko za masafa ya juu katika kiwango cha muamala na nukuu
Kichujio cha mudaKila siku 11:00-16:00Uchambuzi unawekewa kikomo katika sehemu maalum ya siku
Azimio la mudaDakika 1Takribani vipindi 300 vya muda kwa siku kwa kila ticker
Data za ndani ya dakikaTrade ya kwanza na rekodi zote za quote katika dakika hiyoRekodi za msingi kwa mwelekeo wa bei na vipimo vya ukwasi
Muhtasari wa nukuuWastani wa bid, ask na ukubwa husikaVigezo wakilishi vya nukuu katika kiwango cha dakika
LengoMwelekeo wa mwendo wa bei: Up / DownTatizo la uainishaji wa binary
Mgawanyo wa data%70 mafunzo, %15 uthibitishaji, %15 jaribioKutenganisha ujenzi wa modeli, uteuzi na tathmini ya mwisho

Vigezo vya ukwasi vilivyotumika

Chanzo kinaorodhesha vigezo huru vinavyopewa modeli katika makundi manne makuu. Hata hivyo, fomula za kihisabati za vipimo hivi, madirisha ya ukokotoaji au maelezo ya normalization hayajatolewa katika chanzo. Kwa hiyo, maelezo yafuatayo yanafafanua nafasi ya vipimo katika utafiti; fomula mahususi ambazo hazipo kwenye chanzo hazijaundwa upya.

Vipimo vilivyoorodheshwa katika chanzoKazi yake katika utafitiJe, chanzo kina fomula?
Turnover, Market Depth, Log Depth, Dollar DepthViingizo vinavyohusiana na shughuli za biashara na kina cha maagizo/nukuuHapana
Aina za Spread, Effective Spread, Relative SpreadViingizo vinavyowakilisha tightness kati ya bei za kununua na kuuza pamoja na kipimo cha gharama za muamalaHapana
Quote Slope, Log Quote Slope, Adjusted Log Quote SlopeViingizo vinavyofupisha uhusiano wa bei na kiasi katika muundo wa nukuuHapana
Composite Liquidity, Liquidity Ratio 1 (Amivest), Flow Ratio, Order Ratio, Illiquidity (Amihud)Viingizo vinavyowakilisha mtiririko wa biashara, athari ya bei na vipimo vilivyounganishwa vya ukwasiHapana

Tofauti Kati ya “Vipengele Vyote” na “Mchanganyiko wa Vipengele” Ni Nini?

Sharti la “Vipengele Vyote” linamaanisha kuwa vipimo vyote vilivyopo vya ukwasi vilivyoorodheshwa katika chanzo vinatumika pamoja katika modeli; sharti la “Mchanganyiko wa Vipengele” linamaanisha kutumia seti ndogo zaidi ya vipimo vya ukwasi vinavyotarajiwa kupunguza kosa la uainishaji. Chanzo kinaeleza lengo la uteuzi wa seti ndogo, lakini hakiripoti kwa kina katika maandishi ni algoriti gani ya uteuzi wa vipengele iliyotumika, utafutaji ulifanywaje, au orodha ya mwisho ya vigezo vilivyochaguliwa kwa kila modeli.

Kwa nini viainishaji vitatu vinajaribiwa pamoja?

Logistic Regression ni kiainishaji cha msingi kinachotegemea muundo wa uamuzi wa mstari, SVM ni mbinu inayotafuta mpaka wa uamuzi unaotenganisha madarasa, na Random Forest ni kiainishaji cha ensemble kinachoundwa na muunganiko wa miti mingi ya uamuzi. Maelezo haya si matokeo ya utafiti; ni ufafanuzi wa kielimu unaolenga kusaidia kuelewa kazi ya familia hizi za modeli. Kwa kuwa hyperparameter za kina za modeli hizi hazijatolewa katika chanzo, haijulikani ni kernel gani, thamani gani ya regularization, idadi gani ya miti, kina cha juu kiasi gani au uzani gani wa darasa ulitumika.

Matriki ya mkanganyiko inasomwaje?

Chanzo kinafafanua kisanduku cha juu kushoto cha matriki ya mkanganyiko kuwa mienendo ya “Up” iliyotabiriwa kwa usahihi, na kisanduku cha chini kulia kuwa mienendo ya “Down” iliyotabiriwa kwa usahihi. Visanduku vya juu kulia na chini kushoto ni uainishaji usio sahihi. Chanzo pia kinafafanua usahihi kama asilimia ya utabiri sahihi kuhusu mwelekeo wa bei.

Maelezo ya dhana ya Verianla: Ufafanuzi huu wa chanzo unaweza kuonyeshwa kwa kiwango cha kawaida kwa uhusiano ufuatao: \(\mathrm{Accuracy}=\frac{N_{\mathrm{correct}}}{N_{\mathrm{total}}}\times 100\). Mlinganyo huu haukutolewa kama fomula tofauti katika makala ya chanzo; umetumiwa tu kufanya ufafanuzi wa usahihi ulioandikwa katika chanzo uonekane kihisabati na kutathmini ulinganifu wa ndani wa jedwali.

Mbinu na Matokeo ya Utafiti

Mpangilio wa maendeleo ya modeli

Modeli zote tatu hufunzwa kwanza kwa vigezo vyote huru. Kisha chanzo kinaeleza kuwa uteuzi wa seti ndogo ya vipengele unaolenga kupunguza kosa la uainishaji ulifanywa. Data hugawanywa kuwa %70 mafunzo, %15 uthibitishaji na %15 jaribio. Mgawanyo huu ni mpangilio wa msingi wa ujifunzaji wa mashine unaolenga kuzuia uteuzi wa kipengele au modeli kutegemea moja kwa moja seti ya jaribio; hata hivyo, chanzo hakielezi kama mgawanyo ulifanywa kwa mpangilio wa wakati au kwa nasibu. Katika data za kifedha za masafa ya juu, maelezo haya ni muhimu kwa sababu hatari ya kuvuja kwa data kwa mpangilio wa wakati inaweza kubadilisha tafsiri ya utendaji wa modeli.

Matriki za mkanganyiko na usahihi ulioripotiwa katika chanzo

ModeliMatriki ya mkanganyiko ya vipengele vyoteAccuracy_AFMatriki ya mkanganyiko ya mchanganyiko wa vipengeleAccuracy_FC
LOG / LR[[25, 4], [4, 7]]%62,75[[28, 1], [22, 0]]%54,90
SVM[[28, 1], [18, 4]]%62,79[[16, 13], [12, 10]]%50,98
RF[[22, 7], [13, 9]]%60,78[[27, 2], [17, 5]]%62,74

Katika Matokeo ya Chanzo, Usahihi wa Juu Zaidi Unaonekana Katika Modeli Gani?

Kulingana na takwimu zilizoripotiwa katika jedwali la chanzo, thamani moja ya juu zaidi ya usahihi ni %62,79 kwa SVM inayotumia vipengele vyote; matokeo ya mchanganyiko wa vipengele kwa Random Forest ni %62,74. Hata hivyo, katika sehemu ya matokeo waandishi wanasema kuwa Random Forest ilizidi modeli nyingine na kutoa usahihi wa juu zaidi. Kwa kuwa kauli hizi mbili haziendani kikamilifu ndani ya chanzo kimoja, makala ya Verianla huhifadhi wazi kutolingana huku kwa bibliografia na namba badala ya kuthibitisha moja kwa moja ubora wa modeli.

Ukaguzi wa ulinganifu wa ndani wa chanzo

Sehemu ya ukaguziHali inayoonekana katika chanzoMpaka wa tafsiri
LR, vipengele vyoteIngawa matriki ya mkanganyiko ni [[25, 4], [4, 7]], usahihi wa jedwali umetolewa kuwa %62,75.Ikiwa visanduku vya matriki vitatafsiriwa moja kwa moja kama idadi ya sahihi/isiyo sahihi, 32/40 = %80 hupatikana. Kwa hiyo kuna kutolingana kubwa kwa ndani kati ya matriki na asilimia iliyoripotiwa; Verianla haisahihishi thamani hiyo.
SVM, vipengele vyoteMatriki [[28, 1], [18, 4]], usahihi %62,79.Kutoka kwenye matriki 32/51 ni takribani %62,75; kuna tofauti ndogo na asilimia ya chanzo.
RF, vipengele vyote na seti ndogoHuongezeka kutoka %60,78 hadi %62,74.Ujumlishaji wa chanzo kwamba “baseline models ziko juu kuliko tuned models” hautumiki kwa RF; kwa LR na SVM, matokeo ya seti ndogo hupungua.
Ubora wa modeliMaandishi ya matokeo yanasema RF ilitoa usahihi wa juu zaidi; jedwali linaonyesha thamani ya juu zaidi iliyoripotiwa kuwa %62,79 kwa SVM.Matokeo ya ziada yanayotokana na mchoro yanaweza kueleza hili, lakini kwa kuwa kurasa husika za michoro katika PDF iliyopakiwa zina maandishi ya kuelekeza tu kwenye PNG za nje, uwezekano huu hauwezi kuthibitishwa.

Matokeo ya umuhimu wa vipengele

Chanzo kinaeleza kwamba Liquidity Ratio, Flow Ratio na Turnover zilijitokeza mara kwa mara katika uchanganuzi wa umuhimu wa vipengele. Hili ni tokeo la umuhimu wa ndani ya modeli linalodokeza kuwa katika maamuzi ya mwelekeo modeli haikutoa uzito kwa viashirio vya aina ya spread pekee, bali pia kwa vigezo vinavyohusiana na mtiririko wa biashara na shughuli za biashara. Hata hivyo, coefficients kamili au alama za umuhimu za vigezo hivi vitatu hazijatolewa katika jedwali la maandishi la chanzo; kwa hiyo Verianla haitengenezi kiwango cha umuhimu cha namba.

Vigezo vyote au seti iliyopunguzwa ya vipengele?

Kwa LR na SVM, usahihi ulioripotiwa katika chanzo ni wa juu zaidi wakati vigezo vyote vya ukwasi vinatumika: LR hushuka kutoka %62,75 hadi %54,90, na SVM kutoka %62,79 hadi %50,98. Kwa RF, kinyume chake, mchanganyiko wa vipengele vilivyochaguliwa huongezeka kutoka %60,78 hadi %62,74. Kwa hiyo, ingawa maelezo ya chanzo kwamba “seti pana ya vipengele hutoa matokeo bora” yanaungwa mkono na modeli mbili, matokeo ya RF ni ubaguzi kwa ujumlishaji huu. Tafsiri salama ya utafiti ni kwamba athari ya kupunguza vipengele inaonekana kutegemea familia ya modeli na kwamba mpangilio mmoja wa majaribio uliowasilishwa katika chanzo hautoshi kutoa hitimisho la mwelekeo mmoja kwa modeli zote.

Je, Matokeo Haya Yanaweza Kujumlishwa Kwa Hisa na Hali Tofauti za Soko?

Utafiti wa chanzo hauonyeshi uwezo huo wa ujumlishaji. Waandishi wanapendekeza wazi kuwa tafiti za baadaye zijaribu kama mifumo inayofanana ya usahihi na umuhimu wa vipengele itaendelea katika seti za data za hisa tofauti; zaidi ya hayo, kwa kuwa maandishi ya sasa hayatoi kwa kina orodha ya ticker zilizotumika, kipindi cha tarehe, tawala za soko na ukubwa wa jumla wa sampuli, matokeo yanapaswa kutathminiwa tu ndani ya data na mpangilio wa majaribio ulioripotiwa.

Matokeo yanayoungwa mkono na utafiti

  • Vipimo vya ukwasi vinavyotokana na TAQ viliweza kutumika kuainisha mwelekeo wa bei wa kila dakika katika mpangilio wa jaribio uliowekwa katika chanzo.
  • Thamani za usahihi zilizoripotiwa katika chanzo ziko takribani kati ya %50,98 na %62,79.
  • Kwa LR na SVM, vipengele vyote vilitoa usahihi ulioripotiwa wa juu kuliko mchanganyiko wa vipengele vilivyochaguliwa.
  • Kwa RF, mchanganyiko wa vipengele vilivyochaguliwa ulitoa usahihi ulioripotiwa wa juu kuliko sharti la vipengele vyote.
  • Kulingana na maelezo ya waandishi kuhusu umuhimu wa vipengele, Liquidity Ratio, Flow Ratio na Turnover ni viingizo vinavyojitokeza.

Matokeo ambayo utafiti hauungi mkono

  • Hauonyeshi kuwa modeli hizi zinaunda mkakati wa biashara hai wenye faida; gharama za muamala, slippage, athari ya soko na uchanganuzi wa mapato halisi havijawasilishwa.
  • Haithibitishi kuwa vipimo vya ukwasi husababisha mienendo ya bei kwa njia ya kisababishi; utafiti ni mfumo wa uainishaji wa utabiri.
  • Hauonyeshi kwamba usahihi huohuo utapatikana kwa hisa, masoko ya hisa, vipindi au tawala za mgogoro tofauti.
  • Haujaribu mafanikio ya latency, ufikiaji wa data, kasi ya biashara au uimara wa kiutendaji katika mazingira ya uzalishaji wa wakati halisi.
  • Kwa sababu ya hyperparameter na maelezo ya mgawanyo wa data ambayo hayajaripotiwa katika chanzo, hauhakikishi kuwa matokeo yanaweza kurudiwa kwa namna ile ile kwa kujitegemea.

Taarifa zinazokosekana kwa mtazamo wa uwezo wa kurudia utafiti

TaarifaHali katika chanzoKwa nini ni muhimu?
Orodha ya ticker/hisaHaijaripotiwaKutathmini athari ya uchaguzi wa mali kwenye matokeo
Kipindi cha tarehe na tawala ya sokoHaijaripotiwaKwa ujumlishaji wa muda na utegemezi wa tawala
Ukubwa wa jumla wa sampuliHaijaripotiwaKuelewa uaminifu wa takwimu wa matokeo ya jaribio
Ufafanuzi kamili wa kihisabati wa lebo ya Up/DownHaujaelezwa kwa kinaKujenga upya upeo wa utabiri na mantiki ya kuweka lebo
Fomula za vipengeleHazijaripotiwaKukokotoa vigezo vya ukwasi kwa namna ile ile
Algoriti ya uteuzi wa vipengeleHaijaripotiwaKurudia sharti la “Feature Combination”
Hyperparameter za LR/SVM/RFHazijaripotiwaKurudia tabia na utendaji wa modeli
Scaling, standardization na kushughulikia data inayokosekanaHazijaripotiwaKuthibitisha usindikaji wa viingizo, hasa kwa SVM na LR
Asili ya muda/nasibu ya mgawanyoHaijaripotiwaKutathmini hatari ya kuvuja kwa data ya muda
Kutokuwa na uhakika wa takwimu / confidence intervalHaijaripotiwaKutathmini kama tofauti ndogo za usahihi zina maana au la

Maelezo ya Chanzo na Mbinu

Kichwa kamili cha asili: High-Frequency Trading Liquidity Analysis | Application of Machine Learning Classification

Waandishi: Sid Bhatia, Sidharth Peri, Sam Friedman, Michelle Malen.

Taasisi: Stevens Institute of Technology. Katika toleo lililopakiwa, taasisi imetajwa katika kiwango cha hati, lakini hakuna ulinganishaji tofauti wa affiliation kwa kila mwandishi uliotolewa.

Tarehe ya hati: 5 Agosti 2024. Tarehe ya kuwasilisha arXiv: 19 Agosti 2024.

Jukwaa na darasa: arXiv, q-fin.TR — Trading and Market Microstructure. Kitambulisho cha arXiv: 2408.10016v1. arXiv/DataCite DOI: 10.48550/arXiv.2408.10016.

Aina ya chanzo na hali ya mapitio ya kitaalamu: Hati iliyopakiwa ni toleo la arXiv preprint. Rekodi rasmi ya arXiv haitoi taarifa ya jarida, juzuu, toleo au uchapishaji uliopitiwa na wataalamu kwa toleo hili; kwa hiyo maandishi ya Verianla hayawasilishi utafiti huu kama makala ya jarida iliyopitiwa na wataalamu.

Leseni: Rekodi ya arXiv inaonyesha leseni ya CC BY 4.0. Katika matumizi tena, marejeo yanayofaa, kiungo cha leseni na kutaja ikiwa mabadiliko yalifanywa vinahitajika.

Data na mbinu: Utafiti unategemea data za TAQ ndani ya Refinitiv Tick History; data za Limit Order Book pia zinatajwa katika ajenda ya utafiti. Uchambuzi umewekewa muda wa 11:00-16:00 na azimio la dakika 1. Modeli ni LR, SVM na RF; mgawanyo wa data ni %70/%15/%15.

Corresponding author, ufadhili, mgongano wa maslahi, upatikanaji wa data na michango ya CRediT: Havijaripotiwa wazi katika chanzo kilichopakiwa.

Michoro: Kurasa za 6-13 za PDF iliyopakiwa zina maandishi ya kuelekeza kwenye picha za PNG zenye majina all-feat-log, all-feat-rf, all-feat-svm, feat-combo-log, feat-combo-rf, feat-combo-svm, feature-import-mdi na svm-feature-impor; picha zenyewe hazijapachikwa katika nakala hii ya PDF. Kwa hiyo coefficients kamili za umuhimu wa vipengele au jiometri za michoro ambazo hazikutolewa kama maandishi katika chanzo hazijabuniwa na Verianla.

Mpaka mkuu wa kimbinu: Utafiti ni jaribio la uainishaji wa mwelekeo wa bei; hautoi ushahidi wa moja kwa moja kuhusu faida ya biashara hai, usababishi, ujumlishaji kwa masoko mengine au utendaji katika mazingira ya uzalishaji.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy