Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Илми компютер / EarnHFT: Омӯзиши Тақвиятии Иерархии Самаранок барои Савдои Басомади Баланд дар Бозорҳои Криптовалюта
Илми компютер

EarnHFT: Омӯзиши Тақвиятии Иерархии Самаранок барои Савдои Басомади Баланд дар Бозорҳои Криптовалюта

EarnHFT низоми сесатҳии омӯзиши тақвиятии иерархӣ мебошад, ки барои ҳалли ду мушкили асосии агентҳои омӯзиши тақвиятӣ, ки дар бозорҳои крипто дар сатҳи сония савдо мекунанд, таҳия шудааст.

16/09/2026  Veri Anla 99 боздид
EarnHFT: Омӯзиши Тақвиятии Иерархии Самаранок барои Савдои Басомади Баланд дар Бозорҳои Криптовалюта

EarnHFT, низоми сесатҳии омӯзиши тақвиятии иерархӣ мебошад, ки барои ҳалли ду мушкили асосии агентҳои омӯзиши тақвиятӣ, ки дар бозорҳои крипто бо басомади баланд ва дар сатҳи сония савдо мекунанд, таҳия шудааст. Мушкили аввал он аст, ки траекторияҳои омӯзиш дар савдои басомади баланд фавқулода дароз мешаванд. Дар мисоли таҳқиқот танҳо 12 рӯзи маълумоти сониягӣ тақрибан 1.036.800 қадами қарор тавлид мекунад; дар миқёси моҳона ин рақам метавонад ба миллионҳо қадам расад. Мушкили дуюм ин аст, ки ба сабаби зуд тағйир ёфтани режимҳои бозори крипто, стратегияе, ки як агент омӯхтааст, метавонад дар шароити дигари бозор ноком шавад.

EarnHFT ин мушкилотро на бо омӯзонидани як agent-и ягона ва умумии trading, балки бо ҷудо кардани вазифаҳо ба миқёсҳои гуногуни вақт ҳал мекунад. Агентҳои сатҳи поёнӣ дар сатҳи сония қарорҳои воқеии харидуфурӯш ва мавқеи ҳадафро муайян мекунанд, дар ҳоле ки router-и сатҳи болоӣ дар сатҳи дақиқа агенти сатҳи поёниро интихоб мекунад, ки ба рафтори макрои ҷории бозор мувофиқ аст. Ба ин тартиб, система ҳаракатҳои микроии бозорро дар сатҳи сония коркард карда, тағйири трендро дар сатҳи дақиқа арзёбӣ мекунад.

Дар марҳилаи аввал, Q-teacher, ки бо истифода аз маълумоти нархҳои оянда тавассути барномасозии динамикӣ ҳисоб мешавад, ба агенти сатҳи поёнии DDQN на танҳо таҷрибаи озмоишу хатои худ, балки маълумоти ҳисобшудаи optimal action-value-и ҳаракатҳои алтернативӣ дар ҳамон ҳолатро низ медиҳад. Дар марҳилаи дуюм садҳо агент омӯзонида мешаванд, ки бояд дар рафторҳои гуногуни bull, bear, pullback, sideways ва rally тахассус пайдо кунанд; танҳо як қисми хурди онҳо, ки дар режимҳои гуногуни бозор бештар фоидаовар мебошанд, ба ҳавзи стратегияҳо ворид карда мешаванд. Дар марҳилаи сеюм router-и сатҳи дақиқавии DDQN яке аз ин агентҳоро интихоб мекунад ва агенти интихобшуда дар давоми як дақиқаи баъдӣ ҳар сония мавқеи ҳадаф тавлид мекунад.

Дар таҷрибаҳои симулятсионӣ бо маҷмуаҳои маълумоти BTC/TUSD, BTC/USDT, ETH/USDT ва GALA/USDT, EarnHFT дар ҳамаи чор бозор дар давраи test баландтарин total return-ро ба даст овардааст. Total return мутаносибан тақрибан %0,99, %0,72, %4,52 ва %19,41 гузориш шудааст. Бо вуҷуди ин, усул дар ҳамаи нишондиҳандаҳои risk беҳтарин нест; муаллифон ошкоро қайд мекунанд, ки EarnHFT аз сабаби сохтори profit-oriented Q-teacher trader-и нисбатан хашмгин аст ва дар баъзе маҷмуаҳои маълумот иҷрои risk дар сатҳи миёна мемонад.

Чаро омӯзиши тақвиятии оддӣ барои HFT душворӣ мекашад?

Дар омӯзиши тақвиятӣ агент ҳолати ҷориро мушоҳида карда, як амалро интихоб мекунад ва дар асоси подоше, ки аз натиҷаи он амал мегирад, сиёсати худро беҳтар менамояд. Дар масъалаҳои trading-и рӯзона ё соатӣ як траекторияи омӯзиш метавонад нисбатан кӯтоҳ бошад. Аммо дар савдои басомади баланд, агар ҳамон модел ҳар сония як қарор қабул кунад, масъала аз миллионҳо қадамҳои пайдарпай иборат мешавад.

Мисоли дар таҳқиқот овардашуда:

\[ 60\ \text{saniye/dakika} \times 60\ \text{dakika/saat} \times 24\ \text{saat/gün} \times 12\ \text{gün} = 1.036.800\ \text{adım} \]

Ин гуна horizon-и хеле дароз омӯхтани таъсири дарозмуддати рафторҳои мусбат ва манфиро барои агенти RL душвор мекунад ва барои омӯзиш таҷрибаи хеле бештар талаб менамояд.

Мушкили дуюм ҳолати non-stationary market dynamics мебошад. Дар бозори крипто як ҳаракати микроии нарх метавонад дар режимҳои гуногуни макроии бозор маънои гуногун дошта бошад. Масалан, коҳиши кӯтоҳмуддати нарх дар бозори рӯ ба боло метавонад pullback-и муваққатӣ бошад, дар ҳоле ки ҳамин гуна ҳаракат дар бозори рӯ ба поён метавонад ба идомаи коҳиши калонтар табдил ёбад. Аз ин рӯ, як сиёсати ягона на ҳамеша метавонад дар ҳамаи режимҳои бозор як хел муваффақ бошад.

Чаро EarnHFT сохтори иерархиро истифода мебарад?

EarnHFT маълумоти бозорро ба ду миқёси гуногуни вақт ҷудо мекунад. MDP-и сатҳи поёнӣ ҳаракатҳои микроии бозор ва execution-и савдоро дар сатҳи сония модел мекунад. MDP-и сатҳи болоӣ бошад трендҳои бозорро, ки дар миқёси дақиқа сусттар тағйир меёбанд, ва кадом стратегияҳои trading бояд истифода шаванд, модел мекунад.

Агенти сатҳи поёнӣ ҳар сония мавқеи ҳадаф тавлид мекунад, дар ҳоле ки router-и сатҳи болоӣ ҳар дақиқа як агенти сатҳи поёниро интихоб мекунад. Ба ин тартиб, қарорҳои “ҳоло чанд coin нигоҳ дошта шавад?” ва “дар ин режими бозор кадом trader истифода шавад?” аз ҳам ҷудо карда мешаванд.

Ҳолати сатҳи поёнӣ кадом маълумотро дар бар мегирад?

State-и сатҳи поёнӣ аз ду ҷузъи асосӣ иборат аст. Якум 54 хусусияти техникӣмебошад, ки аз маълумоти сониягии бозор гирифта мешаванд; дуюм мавқеи ҷориест, ки агент нигоҳ медорад. Хусусиятҳои техникӣ аз маълумоти OHLC дар rolling window-и 60-сониягӣ ва snapshot-ҳои Limit Order Book гирифта мешаванд.

Action бевосита нишони “buy” ё “sell” нест. Агент аз action pool-и маҳдуди пешакӣ муайяншуда як мавқеи ҳадаф интихоб мекунад. Агар мавқеи ҷорӣ аз мавқеи ҳадаф фарқ кунад, миқдори фарқият бо market order фавран харида ё фурӯхта мешавад.

Ҳолати сатҳи болоӣ ва action чист?

State-и сатҳи болоӣ аз rolling OHLC window-и 60-дақиқаӣ гирифташудаи 19 хусусияти макро ва мавқеи ҷориро дар бар мегирад. Action дар ин ҷо бевосита мавқеъ нест, балки интихоби яке аз агентҳои RL-и сатҳи поёнӣ аз ҳавзи стратегияҳо мебошад.

Агенте, ки router интихоб мекунад, як дақиқа кор карда, дар сатҳи сония мавқеи ҳадаф тавлид мекунад. Reward-и router тағйири net-value мебошад, ки дар ин як дақиқа аз ҷониби агенти интихобшудаи сатҳи поёнӣ ба вуҷуд омадааст.

Чаро Limit Order Book муҳим аст?

Симулятсияи EarnHFT фарз намекунад, ки савдо танҳо бо нархи басташавӣ анҷом мешавад. Он аз bid ва ask нархҳо дар Limit Order Book ва миқдорҳои дастрас дар ин сатҳҳо истифода мекунад. Агар market order-и калон аз ликвидият дар сатҳи аввалини нарх зиёд бошад, фармоиш ба сатҳҳои навбатии нарх мегузарад.

Сохторе, ки манбаъ барои шарҳи хароҷоти market-order истифода мекунад:

\[ E_t(M)= \sum_i \left( p_t^i \times \min(q_t^i,R_{i-1}) \right)(1+\sigma) \]

Дар ин ҷо \(p_t^i\) нархи сатҳи дахлдори order-book, \(q_t^i\) миқдор дар он сатҳ, \(R_{i-1}\) миқдори боқимондаи фармоиш пас аз сатҳҳои қаблӣ ва \(\sigma\) таносуби commission-fee-ро ифода мекунад.

Натиҷаи муҳим он аст, ки ҳатто агар комиссия сифр бошад ҳам, trading ройгон нест. Азбаски market order ҳангоми харид тарафи ask ва ҳангоми фурӯш тарафи bid-ро истифода мекунад, bid–ask spread худ ба худ хароҷоти муомиларо ба вуҷуд меорад.

Марҳилаи I: Q-teacher чӣ гуна кор мекунад?

Агенти оддии RL тавассути озмоиш меомӯзад, ки кадом амал хуб аст. EarnHFT аз фарзияе истифода мекунад, ки дар муҳити симулятсияшуда силсилаи нархҳо аз амалҳои агент таъсир намегирад. Азбаски нархҳои оянда ҳангоми омӯзиш маълуманд, optimal action-value барои ҳар як комбинатсияи вақт–мавқеъ–action метавонад тавассути барномасозии динамикӣ ба қафо ҳисоб карда шавад.

Ин Q-table ҳангоми trading истифода намешавад; ҳангоми омӯзиш ҳамчун сигнали омӯзгор хизмат мекунад.

Ба хатои оддии temporal-difference-и DDQN, Kullback–Leibler divergence байни тақсимоти action-value-и шабака ва тақсимоти optimal action-value илова карда мешавад:

\[ L(\theta_i) = L_{td} + \alpha KL \left( Q_t(\chi,p,\cdot;\theta_i) \parallel Q^{*}(\chi,p,\cdot) \right) \]

Ҷузъи TD:

\[ L_{td} = \left( r+ \gamma \max Q_t(\chi',a,\cdot;\theta'_i) - Q_t(\chi,p,a;\theta_i) \right)^2 \]

Ҳадаф ин аст, ки агент на танҳо натиҷаи action-и интихобкардааш, балки арзишҳои нисбии action-ҳои дигарро дар ҳамон ҳолат низ омӯзад. Дар манбаъ \(\alpha\) ҳамчун коэффисиенте истифода мешавад, ки бо пешрафти омӯзиш кам мешавад.

Optimal Actor чӣ илова мекунад?

Танҳо истифодаи Q-teacher кофӣ ҳисоб нашудааст. Вақте ки агент аз сиёсати оптималӣ дур мешавад, мавқеи он тағйир меёбад ва сигнали омӯзгор низ метавонад дигар шавад. Барои кам кардани ин мушкил EarnHFT манбаи дуюми таҷрибаро месозад.

Як гурӯҳи таҷриба аз ҷониби агент бо сиёсати оддии \(\epsilon\)-greedy тавлид мешавад, гурӯҳи дигар бошад аз ҷониби optimal actor тавлид мешавад, ки бевосита action-и максималиро дар \(Q^*\) интихоб мекунад. Ҳамин тавр replay buffer ҳам гузаришҳои ҳангоми exploration бадастомадаро ва ҳам гузаришҳои тавлидкардаи сиёсати оптималии ҳисобшударо дар бар мегирад.

Марҳилаи II: Чаро ба ҷои як агент садҳо агент омӯзонида мешаванд?

Яке аз гипотезаҳои асосии таҳқиқот ин аст, ки сиёсати хуб барои bull market метавонад барои bear market ба ҳамон дараҷа хуб набошад. Аз ин рӯ, маълумоти омӯзишӣ ба бахшҳое ҷудо карда мешавад, ки трендҳои гуногуни бозорро намояндагӣ мекунанд ва агентҳо ин бахшҳоро бо эҳтимолҳои гуногун мебинанд.

Маҷмуаи маълумот аз бахшҳои multivariate time series иборат аст, ки беш аз се миллион қадами вақт доранд. Барои ҳар агент параметри афзалият \(\beta\) тағйир дода мешавад. Вазни sampling-и market segment-ҳое, ки buy-and-hold return-и баланд ё паст доранд, бо ин параметр тағйир дода мешавад, то агентҳое ба вуҷуд оварда шаванд, ки дар режимҳои гуногуни бозор тахассус ёбанд.

Сегментҳои бозор чӣ гуна тамғагузорӣ мешаванд?

Манбаъ аввал садои басомади баландро бо low-pass filtering кам мекунад. Сипас аз тағйироти маҳаллии самт дар каҷи price/net-value сегментҳо месозад. Агар фарқи slope ва шабоҳати Dynamic Time Warping байни сегментҳои ҳамсоя ба қадри кофӣ хурд бошад, онҳо муттаҳид мешаванд.

Сипас бо истифода аз quantile-и нишебии buy-and-hold return сегментҳо ба синфҳои гуногуни trend тақсим карда мешаванд. Панҷ категорияе, ки дар тасвирҳои таҳқиқот истифода шудаанд:

  • Bear,
  • Pullback,
  • Sideways,
  • Rally,
  • Bull.

Барои ҳар trend ва мавқеи ибтидоӣ агентҳое интихоб мешаванд, ки дар маълумоти validation баландтарин profitability-и миёнаро медиҳанд. Бо ин роҳ ҳамаи садҳо номзад ба router action space дохил намешаванд; танҳо як ҳавзи хурд ва гуногуни стратегияҳо нигоҳ дошта мешавад.

Чанд агент омӯзонида шуд?

Дар таҳқиқот барои параметри sampling-preference \(\beta\) қиматҳои \(-90\), \(-10\), \(30\) ва \(100\) истифода шудаанд. Ҳар қимат 50 epoch иҷро шуда, дар маҷмӯъ 200 агенти сатҳи поёнӣ тавлид шудааст.

Марҳилаи III: Router чӣ кор мекунад?

Router агенти сатҳи болоӣ бар асоси DDQN мебошад. Ҳар дақиқа ҳолати макроии ҷории бозорро месанҷад ва аз agent pool як trader интихоб мекунад.

Қароргирии router дар сатҳи дақиқа ба ҷои сония дарозии high-level trajectory-ро:

\[ 1-\frac{1}{60} = 0.9833 \]

бо ҳамин таносуб, яъне ба гуфтаи манбаъ тақрибан %98,33 кам мекунад.

Азбаски router танҳо агентҳоеро арзёбӣ мекунад, ки мавқеи ибтидоии онҳо бо мавқеи ҷорӣ мувофиқ аст, action space боз ҳам хурдтар мешавад. Муаллифон дар марҳилаи high-level аз Q-teacher истифода накардаанд; зеро траектория аллакай хеле кӯтоҳ шуда буд ва ҳисоб кардани optimal action-value барои интихоби агент мураккабтар мешавад, онҳо DDQN-и оддиро самараноктар донистаанд.

Оё router воқеан вобаста ба режими бозор гуногун рафтор мекунад?

Дар манбаъ тақсимоти интихоби router дар чор маҷмуаи test омӯхта шудааст. Дар BTC/TUSD ва BTC/USDT, ки volatility пасттар аст, интихобҳои router дар чанд market-state agent мутамарказ шудаанд, дар ҳоле ки дар бозорҳои тағйирёбандатар ба монанди ETH ва GALA интихобҳо байни панҷ режими бозор мутавозинтар паҳн шудаанд.

Масалан, дар test-и GALA тақрибан %67,6 интихобҳо ба агенти Bull рост омадаанд. Дар BTC/USDT тақрибан %64,8 Sideways ва %32,6 Rally интихоб шудааст. Дар ETH ҳиссаи агенти Pullback тақрибан %43,9 мебошад. Ин қиматҳо нишон медиҳанд, ки router дар ҳамаи бозорҳо як агенти поёниро истифода намекунад.

Усул ва Натиҷаҳо

Маҷмуаҳои маълумот

Trading PairДинамикаи бозор, ки дар манбаъ оварда шудаастШумораи сонияҳоДавра
BTC/TUSDSideways4.057.14030 Март 2023 – 15 Май 2023
BTC/USDTSideways3.884.4001 Сентябр 2022 – 15 Октябр 2022
ETH/USDTBear3.970.8001 Май 2022 – 15 Июн 2022
GALA/USDTBull3.970.7401 Июл 2022 – 15 Август 2022

Дар ҳар маҷмуаи маълумот 9 рӯзи охир барои test, 9 рӯзи пеш аз он барои validation ва маълумоти кӯҳнатар барои training истифода шудааст. Ин ҷудокунии хронологӣ барои пешгирӣ аз истифодаи мустақими маълумоти ояндаи test дар марҳилаи омӯзиш анҷом дода шудааст.

Давраҳои validation ва test яксон набуданд

Таҳқиқот махсусан байни трендҳои validation ва test фарқиятҳои назаррас эҷод кардааст. Дар test set-и BTC/TUSD як bear trend-и равшан пайдо шудааст, ки дар validation вуҷуд надошт. Дар ETH/USDT фарқият боз ҳам калонтар аст: дар давраи validation trend боло мерафт, вале дар давраи test манбаъ тақрибан %30 коҳишро гузориш мекунад.

Ин ҳолат барои нишон додани он истифода шудааст, ки EarnHFT на танҳо дар бозорҳои монанд ба давраи омӯзиш, балки ҳангоми тағйири market regime низ санҷида шудааст.

Усулҳои муқоисашуда

EarnHFT бо чор RL ва ду rule-based baseline муқоиса шудааст: PPO, DRA, DQN, CDQNRP, MACD ва Imbalance Volume (IV). Ба ин тартиб policy-based RL, value-based RL ва усулҳои классикии бар асоси нишондиҳандаҳои бозор дар як таҷриба арзёбӣ шудаанд.

Меъёрҳои арзёбӣ

Шаш нишондиҳандаи молиявӣ истифода шудааст: Total Return (TR), Annual Sharpe Ratio (ASR), Annual Calmar Ratio (ACR), Annual Sortino Ratio (ASoR), Annual Volatility (AVOL) ва Maximum Drawdown (MDD).

Total Return:

\[ TR=\frac{V_t-V_1}{V_1} \]

Annual Sharpe Ratio:

\[ SR= \frac{E[ret]}{\sigma[ret]} \sqrt{m} \]

Calmar Ratio:

\[ CR= \frac{E[ret]}{MDD} \times m \]

Sortino Ratio ба ҷои volatility-и умумӣ танҳо downside deviation-и return-ҳои манфиро ҳамчун ченаки risk истифода мекунад.

Натиҷаҳои асосии иҷро

БозорTR (%)ASRACRASoRAVOL (%)MDD (%)
BTC/USDT0,721,2210,770,9327,083,07
BTC/TUSD0,991,347,761,0132,405,61
ETH/USDT4,522,9214,301,7867,9213,89
GALA/USDT19,419,7779,087,7974,949,26

EarnHFT дар ҳамаи чор маҷмуаи маълумот аз рӯи Total Return баландтарин натиҷаро ба даст овардааст. Манбаъ ҳамчунин мегӯяд, ки дар се аз чор маҷмуаи маълумот EarnHFT аз рӯи меъёрҳои risk-adjusted profit беҳтарин иҷроишро нишон додааст.

BTC/TUSD истисно мебошад. Дар ин маҷмуа баъзе метрикаҳои risk-adjusted-и DQN аз EarnHFT баландтаранд; масалан, барои DQN ASR 4,21 ва ACR 27,94 аст, дар ҳоле ки барои EarnHFT ҳамин қиматҳо 1,34 ва 7,76 мебошанд. Аз ин рӯ, бартарии система дар фоида маънои бартарии мутлақ дар ҳамаи меъёрҳоро надорад.

Намунаи амалиёти ETH

Дар Шакли 2-и манбаъ намунае нишон дода шудааст, ки мавқеи кушодаи EarnHFT дар ETH тақрибан пас аз 30 сония дубора баста мешавад. Ҳаракати нарх, ки дар миқёси дақиқа метавонад pullback-и хурд ба назар расад, аз ҷониби агенти сатҳи сония ҳамчун имкони кӯтоҳмуддати trading истифода мешавад.

Ин мисол ба таври визуалӣ нишон медиҳад, ки чаро система ду миқёси вақтро ҷудо мекунад: router контексти васеътари бозорро интихоб мекунад, дар ҳоле ки агенти сатҳи поёнӣ ба ҳаракатҳои хурдтари нарх дар ҳамон дақиқа ҷавоб медиҳад.

Оё Q-teacher воқеан омӯзишро тезонд?

Дар таҷрибаи ablation таъсири Optimal Value Supervisor (OS) ва Optimal Actor (OA) алоҳида омӯхта шуд.

Дар маҷмуаи GALA DDQN-и оддӣ тақрибан дар 30.720 қадам наздик шуд, дар ҳоле ки сохтори танҳо бо OS дар 4.608 қадам наздик шуд. Ин, ба гуфтаи манбаъ, тақрибан %15 қадамҳои омӯзишӣ мебошад. Converged reward sum дар ҳамин муқоиса аз -0,01 ба 2,89 боло рафт.

Вақте OS ва OA якҷоя истифода шуданд, GALA reward sum ба 4,43 расид, аммо convergence step 78.848 шуд. Ин нишон медиҳад, ки optimal actor метавонад фоидаро зиёд кунад, вале ҳамзамон қадамҳои бештари омӯзишро талаб намояд.

Дар ETH танҳо OS convergence step-ро нисбат ба baseline кам накард; ҳарду дар сатҳи 30.720 қадам буданд. Бо вуҷуди ин reward sum аз тақрибан -29,6 ба 4,87 боло рафт. Ҳангоми истифодаи ҳарду ҷузъ манбаъ 12,32 reward sum гузориш мекунад.

Чаро EarnHFT дар баъзе нишондиҳандаҳои risk заифтар аст?

Тибқи шарҳи худи муаллифон, Q-teacher ва optimal actor махсусан таҷрибаҳои фоидаоварро таълим медиҳанд. Азбаски ҷазои risk бо ҳамон вазн ба optimal supervision ворид нашудааст, EarnHFT метавонад рафтори trading-и хашмгинтар нишон диҳад.

Аз ин рӯ, натиҷаҳо набояд ҳамчун “profit-и баландтар = risk-и пасттар” тафсир шаванд. Масалан, дар GALA EarnHFT бо %19,41 total return баландтарин натиҷаро медиҳад, аммо annual volatility %74,94 аст ва моделҳои алтернативӣ бо volatility-и пасттар мавҷуданд.

Инфрасохтори омӯзиш

Таҷрибаҳо дар NVIDIA RTX 4090 GPU гузаронида шудаанд. Манбаъ мегӯяд, ки ҳамаи таҷрибаҳо дар чор маҷмуаи маълумот тақрибан 10 соат давом кардаанд. Андозаи replay buffer-и EarnHFT \(10^6\), mini-batch size 512, learning rate \(5\times10^{-4}\), коэффисиенти Q-teacher \(\alpha=128\) ва коэффисиенти soft-update \(\tau=0.005\) дода шудаанд.

Фарқияти дохилии манбаъ дар сатҳи комиссия

Дар қисми асосии таҷриба барои BTC/TUSD сатҳи комиссия 0 ва барои дигар маҷмуаҳо %0,02 навишта шудааст. Аммо parameter table дар Замимаи D.3 барои BTC/TUSD 0 ва барои BTC/USDT, ETH/USDT ва GALA/USDT %0,015 медиҳад.

Манбаъ шарҳ намедиҳад, ки ин ду қимат ба таҷрибаҳои гуногун, давраҳои гуногун ё хатои навишт тааллуқ доранд. Аз ин рӯ, матни Verianla яке аз онҳоро ҳамчун “қимати дуруст” интихоб намекунад.

Наздикшавии назариявӣ

Дар Замимаи C.2 муаллифон як ҳосилаи математикӣ пешниҳод мекунанд, то нишон диҳанд, ки оператори Q-learning, ки бо Q-teacher supervisor тағйир дода шудааст, дар MDP-и ниҳоӣ ба функсияи optimal action-value \(Q^*\) наздик мешавад.

Равиш аввал кӯшиш мекунад нишон диҳад, ки \(Q^*\) fixed point-и оператори муайяншуда аст, сипас нишон медиҳад, ки оператор дар зери sup-norm contraction мебошад. Ин натиҷа аргументи назариявии таҳқиқот аст ва бояд ҷудо аз натиҷаҳои таҷрибавӣ арзёбӣ шавад.

Натиҷаҳое, ки таҳқиқот дастгирӣ мекунад

Манбаъ нишон медиҳад, ки интихоби ҳавзи агентҳои сатҳи поёнӣ, ки дар режимҳои гуногуни бозор тахассус доранд, тавассути router-и сатҳи дақиқа метавонад дар маҷмуаҳои криптои санҷидашуда нисбат ба baseline-ҳои як-агентӣ ё rule-based total return-и баландтар диҳад. Таҷрибаҳои ablation дастгирӣ мекунанд, ки Q-teacher махсусан дар баъзе маҷмуаҳо самаранокии омӯзиш ва converged reward-ро беҳтар мекунад.

Натиҷаҳое, ки таҳқиқот дастгирӣ намекунад

Натиҷаҳо нишон намедиҳанд, ки EarnHFT дар exchange-и воқеӣ бо пули зинда ҳамин даромадро таъмин мекунад. Таҳқиқот дар муҳити симулятсия анҷом шудааст. Market impact, order latency-и воқеӣ, exchange queue priority, packet loss, API throttling, co-location, вокуниши системаҳои рақиби HFT ва ҳамаи номуайяниҳои execution-и бозори зинда дар муҳити таҷриба пурра модел нашудаанд.

Илова бар ин, муваффақият дар чор trading pair-и интихобшуда ба ҳамаи дороиҳои крипто, саҳмияҳо, фьючерсҳо ё сохторҳои дигари market-microstructure ба таври худкор умумӣ карда намешавад.

Ёддошти Манбаъ ва Усул

Кори аслӣ: EarnHFT: Efficient Hierarchical Reinforcement Learning for High Frequency Trading.

Муаллифон: Molei Qin, Shuo Sun, Wentao Zhang, Haochong Xia, Xinrun Wang ва Bo An.

Муассиса: Nanyang Technological University, Singapore.

Саҳми баробар: PDF-и манбаъ Molei Qin ва Shuo Sun-ро ҳамчун муаллифони саҳми баробар нишон медиҳад.

arXiv: 2309.12891v1 [q-fin.TR].

Санаи arXiv: 22 Сентябр 2023.

Ибораи нашр дар манбаъ: Copyright © 2024, Association for the Advancement of Artificial Intelligence (AAAI). Азбаски берун аз PDF-и манбаъ санҷиши библиографӣ анҷом нашудааст, ҳолати peer review/нашр аз ин бештар тафсир нашудааст.

Навъи усул: hierarchical reinforcement learning-и сесатҳӣ барои high frequency crypto trading; Q-teacher бар асоси барномасозии динамикӣ; DDQN; agent pool-и тахассусёфта дар трендҳои гуногуни бозор; dynamic strategy router дар сатҳи дақиқа.

Миқёси вақти сатҳи поёнӣ: 1 сония.

Миқёси вақти сатҳи болоӣ: 1 дақиқа.

Market representation-и сатҳи поёнӣ: Аз rolling OHLC + LOB window-и 60-сониягӣ 54 хусусият ва мавқеи ҷорӣ.

Market representation-и сатҳи болоӣ: Аз rolling OHLC window-и 60-дақиқаӣ 19 хусусият ва мавқеи ҷорӣ.

Шумораи агентҳои сатҳи поёнии омӯзонида: 200.

Параметрҳои trend preference: \(\beta\in\{-90,-10,30,100\}\), ҳар кадом 50 epoch.

GPU: NVIDIA RTX 4090.

Давомнокии умумии таҷрибаҳо: Манбаъ тақрибан 10 соат гузориш мекунад.

Маҷмуаҳои маълумот: Маълумоти сониягии бозори BTC/TUSD, BTC/USDT, ETH/USDT ва GALA/USDT.

Ҷудокунии validation/test: 9 рӯзи охир test, 9 рӯзи пеш аз он validation, боқимондаи давраи пешина training.

Муқоисаҳо: PPO, DRA, DQN, CDQNRP, MACD ва Imbalance Volume.

Меъёрҳои молиявӣ: Total Return, Annual Sharpe Ratio, Annual Calmar Ratio, Annual Sortino Ratio, Annual Volatility ва Maximum Drawdown.

Натиҷаи асосии таҷрибавӣ: EarnHFT дар ҳамаи чор маҷмуаи test баландтарин Total Return ва дар се маҷмуа қавитарин натиҷаҳои risk-adjusted profit-ро гузориш мекунад.

Маҳдудияти risk: Муаллифон қайд мекунанд, ки усул бинобар Q-teacher ва optimal actor profit-oriented ва нисбатан хашмгин аст ва дар баъзе нишондиҳандаҳои risk танҳо иҷрои сатҳи миёна дорад.

Номувофиқии дохилии манбаъ 1: Сатҳи комиссияи %0,02 дар матни асосӣ бо сатҳи Замимаи D.3, яъне %0,015, мувофиқат намекунад.

Номувофиқии дохилии манбаъ 2: Ҷадвали маҷмуаи маълумот ETH/USDT-ро Bear тасниф мекунад, аммо дар як қисми шарҳи ablation барои ETH ибораи “market is bull” истифода шудааст. Қисмҳои дигари ҳамин таҳқиқот давраи test-и ETH-ро ҳамчун бозори коҳишёбанда тавсиф мекунанд.

Маҳдудияти асосӣ: Таҷрибаҳо дар муҳити trading simulation бо дақиқии баланд гузаронида шудаанд; иҷрои end-to-end real-money trading дар системаи зиндаи истеҳсолии HFT санҷида нашудааст.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо