
Utafiti huu unachunguza jinsi mawakala wa LLM wanaweza kutumika katika ugunduzi wa sababu katika masoko ya sarafu za dijiti. Badala ya kuruhusu wakala kubadilisha msimbo, mgawanyo wa data, au sheria za tathmini bila mipaka, watafiti wanamweka chini ya itifaki thabiti. Kwa hivyo, wakala anaunda dhana, anapendekeza fomula ya ishara, na kujifunza kutokana na matokeo ya awali; lakini injini inayofanya majaribio inafanya kazi kulingana na sheria zisizobadilika.
Katika utafiti, ugunduzi wa sababu haufafanuliwi kama tatizo la utabiri wa mara moja, bali kama tatizo la utafutaji wa dhana kwa mtiririko. Wakala anasoma watahiniwa waliojaribiwa hapo awali, vipimo vilivyopimwa na maoni; kisha anapendekeza dhana mpya za sababu zinazoweza kuthibitishwa kuwa si kweli. Dhana hizi haziandikwi kama msimbo huru wa Python, bali kwa kutumia DSL ya sababu yenye mipaka. Kwa njia hii, majaribio yote yaliyofaulu na yaliyoshindwa yanakuwa na uwezo wa kukaguliwa.
Mojawapo ya matokeo makuu yaliyoripotiwa na makala ni kwamba, sababu zilizochaguliwa kwa data ya mafunzo ya 2020-2022 pekee zilitoa faida ya mwaka ya 44.55% na uwiano wa Sharpe wa 1.55 baada ya gharama ya muamala ya upande mmoja ya pointi 5 za msingi katika kipindi safi cha nje ya sampuli cha 2024-2026. Hata hivyo, kwa kuwa matokeo yanajikita zaidi katika tokeni ndogo na zenye ukwasi mdogo, kikomo cha uwezo ni jambo muhimu la kuzingatia.
1. Kichwa
Mawakala wa LLM wanaweza kuwa zana zenye nguvu katika utafiti wa kifedha. Wanaweza kusoma matokeo ya awali, kupendekeza dhana mpya, kuandika fomula za ishara, na kubadilisha mwelekeo kulingana na maoni. Lakini unyumbufu huu unabeba hatari kubwa ya kimbinu: Ikiwa wakala anaweza kubadilisha mgawanyo wa data, vipengele, msimbo, na sheria ya tathmini kwa wakati mmoja, matokeo yanayoonekana mazuri yanaweza kuwa zao la utafutaji usiodhibitiwa badala ya ugunduzi wa kweli.
Hatari hii inazidi kuwa kubwa katika utafiti wa sababu za kifedha. Kwa sababu maelfu ya ishara zinazowezekana zinaweza kujaribiwa. Ishara nyingi zinaweza kuonekana zimefaulu kwa bahati mbaya katika data zilizopita. Ikiwa majaribio yaliyoshindwa hayataandikwa au kipindi cha nje ya sampuli hakitengwi kikweli, mchakato wa utafiti unaweza kugeuka kuwa tatizo la "kutafuta hadi kupata matokeo yanayoonekana mazuri".
Tatizo kuu ambalo makala inajaribu kutatua ni hili: Huku tukinufaika na uwezo wa wakala wa LLM wa kuunda dhana za ubunifu, tunawezaje kufanya mchakato wa utafiti uweze kukaguliwa, kurudiwa, na kustahimili zaidi dhidi ya uchimbaji wa data?
2. Muhtasari mfupi
Utafiti unamweka wakala wa LLM kama mtafiti huru anayetumia namba; lakini mtafiti huyu anafanya kazi chini ya sheria kali. Jukumu la wakala ni kuunda dhana na kuamua mwelekeo wa utafutaji. Jukumu la injini ya majaribio ni kukokotoa ishara, kupima vipimo, kutumia milango ya uteuzi, kuzingatia gharama za miamala, na kurekodi matokeo.
Tofauti hii ipo katikati ya makala: Wakala anafikiri, injini inapima. Wakala hawezi kubadilisha sheria ya tathmini. Migawanyo ya data, gharama za miamala, mipangilio ya kwingineko, na vizingiti vya uteuzi vimesuluhishwa mapema.
Mbinu hufanya kazi hivi:
1. Njia ya jaribio inasomwa: Wakala anasoma sababu za watahiniwa zilizojaribiwa hapo awali, vipimo, maamuzi ya kukubali au kukataa na maoni.
2. Watahiniwa wapya wanapendekezwa: Wakala anaunda watahiniwa wa sababu kulingana na tofauti za kimitambo na dhana mpya za kiuchumi.
3. Watahiniwa wanatafsiriwa kwenye DSL: Kila dhana inabadilishwa kuwa fomula yenye mipaka inayoendana na vigezo vya soko vinavyolingana na nukta-wakati.
4. Injini bainifu inajaribu: Sababu hutathminiwa katika kipindi thabiti cha mafunzo. Vipimo kama vile IC, tIC, Sharpe ya muda mrefu/mfupi na ufikiaji (coverage) hukokotolewa.
5. Mlango wa uteuzi unatumiwa: Watahiniwa wanaopita tu vizingiti vya IC na tIC vilivyoainishwa mapema ndio huingizwa kwenye hifadhi ya kushikilia (hold pool).
6. Wakala anatoa maoni: Masomo yanapatikana kutokana na dhana zilizofaulu na zilizoshindwa. Wakala anaamua mwelekeo mpya wa utafutaji.
7. Jaribio la mwisho la kwingineko linafanywa: Sababu nzuri zilizochaguliwa huunganishwa kwa kutumia ridge regression na kujaribiwa kando katika mafunzo, uthibitishaji, na vipindi safi vya nje ya sampuli.
3. Maelezo ya kina
Fomula kwenye PDF zinaonyesha jinsi ugunduzi wa sababu umewekwa kama tatizo linaloendana na nukta-wakati, linaloweza kukaguliwa, na linaloweza kujaribiwa nje ya sampuli.
1. Vakta ya kipengele cha nukta-wakati kwa kila rasilimali
Hapa \(x_{i,t}\) ni vekta ya kipengele inayozingatiwa kwa rasilimali \(i\) kwenye tarehe \(t\). Vekta hii inajumuisha tu bei, kiasi, thamani ya soko, na vigezo vilivyotolewa vya zamani vinavyojulikana kwenye \(t\) au kabla. Jambo hili ni muhimu; kwa sababu taarifa za wakati ujao hazipaswi kutumiwa.
2. Lengo la faida ya mbele
Fomula hii inaonyesha kuwa ishara inazalishwa kwenye tarehe \(t\), bei ya kuingia ni \(t+1\), na bei ya kutoka ni \(t+2\). Kuongezwa kwa ucheleweshaji wa utekelezaji (execution lag) wa siku moja kunatumika kupunguza dhana isiyo halisi ya muamala kutoka kwa bei ya kufunga ya siku hiyo hiyo.
3. Ufafanuzi wa sababu kama kazi ya alama
Sababu inabadilisha vekta ya kipengele cha rasilimali kuwa alama. \(s_{i,t}\) ni alama ya mtambuka (cross-sectional) inayotumika kupanga rasilimali kwenye tarehe hiyo hiyo. Hapa \(\theta\) si kigezo cha kawaida cha mtandao wa neva; ni fomula ya mfano ya sababu.
4. Hali ya utafiti ya wakala
\(h_k\) inawakilisha hali ya utafiti anayoiona wakala katika marudio ya \(k\). \(C\) inaonyesha watahiniwa wa awali, \(M\) inaonyesha vipimo vya watahiniwa hawa, na \(E\) inaonyesha maoni na maamuzi katika lugha asilia. Muundo huu unamwezesha wakala kujifunza kutokana na mafanikio na kushindwa kwa wakati uliopita.
5. Mapendekezo mapya ya watahiniwa ya wakala
Fomula hii inaonyesha kuwa wakala anapendekeza watahiniwa wa sababu nyingi katika kila mzunguko. Kila mtahiniwa; anajumuisha dhana, uhalali wa kiuchumi, aina ya mtahiniwa, na fomula ya sababu inayoweza kutekelezwa.
6. Maoni yaliyopimwa ya mtahiniwa
Seti hii ya vipimo inaonyesha jinsi sababu ya mtahiniwa inatathminiwa. \(IC\) ni wastani wa mgawo wa taarifa kati ya alama ya sababu na faida inayofuata. \(t_{IC}\) inaonyesha umuhimu wake wa kitakwimu; \(Sharpe_{LS}\) inaonyesha utendakazi wa kwingineko ya muda mrefu/mfupi; na \(coverage\) inaonyesha ni uchunguzi wangapi wa rasilimali-tarehe sababu iliweza kutoa alama.
7. Mlango wa uteuzi
Ili sababu ichaguliwe, lazima ipite vizingiti vya \(IC\) na \(t_{IC}\) vilivyoamuliwa mapema. Vizingiti hivi havibadilishwi kulingana na matakwa ya wakala wakati wa utafutaji. Hiki ni kimojawapo cha vituo muhimu vya udhibiti kinachopunguza hatari ya uchimbaji wa data.
8. Seti ya sababu zilizochaguliwa
Mwishoni mwa utafutaji, lengo si kuzalisha ishara moja pekee, bali seti ya sababu zinazoweza kukaguliwa na zinazowakilisha taratibu tofauti.
9. Kuunganisha sababu na Ridge
Sababu zilizochaguliwa huunganishwa na modeli ya mstari iliyopangwa katika hatua ya mwisho. Modeli hii hutoshelezwa (fitted) katika kipindi cha mafunzo pekee. Lengo ni kuzuia mkao wa kupita kiasi (overfitting) huku ikibadilisha ishara za sababu tofauti kuwa alama moja ya mchanganyiko.
10. Mfano wa fomula ya sababu
Fomula hii kwenye PDF inaonekana kuwa na hitilafu kidogo katika utoaji wa maandishi; imerekebishwa kama hapo juu kwa kusoma kutoka kwenye muktadha. Fomula ni mfano wa fomula ya sababu inayojaribu kuweka rasilimali zenye thamani ndogo ya soko, zinazoonyesha tabia ya masafa ya juu, lakini zenye mshtuko mdogo wa kiasi cha hivi karibuni kwenye kiwango cha juu. Hapa \(rank_t\), inafanya upangaji wa mtambuka kati ya rasilimali kwenye tarehe hiyo hiyo.
11. Mgawo wa taarifa wa kila siku
Fomula hii inaonyesha uwiano wa Pearson kati ya alama za sababu kwenye tarehe fulani na faida inayofuata. Ikiwa rasilimali zenye alama za juu za sababu kwa kweli zinatoa faida kubwa zaidi, \(IC_t\) inakuwa chanya.
4. Mbinu na matokeo ya utafiti
Mpangilio wa ulinganisho wa Agentic AI: Mpangilio katika sehemu ya kwanza ya makala unafupisha tofauti kati ya AI ya jadi na agentic AI. Wakati mifumo ya jadi inafanya kazi na sheria thabiti zaidi, mifumo inayotegemea wakala inafanya kazi na mzunguko wa kutoa hoja zinazolenga lengo, kujifunza kutoka kwa maoni, na mzunguko wa kufanya maamuzi wa mara kwa mara. Katika utafiti huu, unyumbufu huu umewekewa mipaka na itifaki thabiti ya tathmini.
Muundo wa sababu wa DSL: Sehemu ya mbinu kwenye makala inaeleza kuwa sababu za watahiniwa haziandikwi kwa msimbo huru, bali kwa DSL yenye mipaka. DSL hii inasaidia shughuli zinazoweza kukaguliwa kama vile cheo cha mtambuka, z-alama, ucheleweshaji (lag), wastani wa kukunja (rolling mean), mkengeuko wa kawaida wa kukunja, utoaji, mabadiliko ya asilimia, logariti, thamani kamili, na mchanganyiko wa mstari.
Michoro ya kwingineko kwenye ukurasa wa 6: Taswira ya kwingineko ya fungu la tano (quintile) inaonyesha kuwa katika kwingineko zilizopangwa na ishara mseto, vikundi vya juu vinafanya vyema kuliko vikundi vya chini. Mviringo wa muda mrefu/mfupi kwenye ukurasa huo huo unaonyesha kuwa muundo unaoweka rasilimali zenye alama za juu kuwa za muda mrefu na rasilimali zenye alama za chini kuwa za muda mfupi unajitenga chanya katika kipindi hicho.
Jedwali la sababu moja: Miongoni mwa sababu bora zaidi za pekee ni vipengele vya mtaji mdogo (smallcap), kiasi kidogo, masafa ya juu, tetemeko la chini, na kasi. Hii inaonyesha kuwa wakala, wakati wa mchakato wa utafutaji, alielekea kwenye tokeni ndogo, zenye ukwasi mdogo, na zinazoonyesha mienendo/tabia fulani ya masafa.
Jedwali la unyeti wa ada: Kadiri gharama ya muamala inavyoongezeka, utendakazi unapungua; hata hivyo, jedwali linaripoti kuwa mkakati unaweza kubaki chanya chini ya dhana fulani za gharama. Sehemu hii inakumbusha kwamba kuangalia tu faida ghafi inaweza kupotosha.
5. Maelezo ya chanzo na mbinu
Data za kila siku za sarafu za dijiti kutoka CoinMarketCap zinatumika katika utafiti. Seti ya data inaenea kutoka Januari 2020 hadi Desemba 2025. Vigezo vya msingi kama vile bei, kiasi, na thamani ya soko hutumika. Rasilimali zenye historia ya muamala isiyotosheleza au ukwasi mdogo huchujwa.
Kipengele cha muda ni muhimu katika muundo wa jaribio. Kipindi cha 2020-2022 kinatengwa kama mafunzo, 2023 kama uthibitishaji, na baada ya 2024 kama kipindi safi cha nje ya sampuli. Muundo huu unalenga kumzuia wakala kuchanganya ishara zinazoonekana vizuri hapo zamani moja kwa moja na utendakazi wa baadaye.
Wakala anapendekeza watahiniwa wa sababu katika raundi tano za utafutaji. Watahiniwa hawa hujaribu taratibu za soko kama vile ukubwa, tetemeko, masafa ya biashara, ukwasi, mabadiliko ya kiasi, na kasi. Sababu zilizofaulu huwekwa kwenye hifadhi ya kushikilia; sababu zilizoshindwa haziachwi nje ya rekodi, bali hutumika kama ushahidi mbaya kwa maamuzi ya utafutaji yajayo.
Katika hatua ya mwisho, sababu zilizochaguliwa huunganishwa na ridge regression. Kwingineko huanzishwa kwa mantiki ya fungu la tano: Rasilimali zenye alama za juu zaidi hutengwa kwenye kundi la juu, na rasilimali zenye alama za chini zaidi hutengwa kwenye kundi la chini. Kwingineko ya muda mrefu/mfupi huchukulia kikundi cha juu kama nafasi ya muda mrefu na kundi la chini kama nafasi fupi. Utafiti pia unasisitiza kuwa miundo yenye uzito sawa na ile yenye uzito wa thamani ya soko hufanya kazi tofauti.
6. Lebo za meta
Kulingana na matokeo yaliyoripotiwa na makala, mchakato wa utafutaji wa wakala unagundua familia ya sababu inayoangazia tokeni zenye thamani ndogo ya soko, ukwasi mdogo, tabia fulani ya masafa, na kipengele cha mwelekeo mzuri. Miongoni mwa sababu bora zaidi za pekee ni vijenzi vya "mtaji mdogo", "kiasi kidogo", "masafa ya juu", "tetemeko la chini", na kasi.
Katika jedwali la sababu moja, viwango vya juu zaidi vya Pure OOS Sharpe vinaripotiwa karibu na +2. Kwa mfano, sababu ya "h1 smallcap lowvol logret vol" inoorodheshwa na thamani ya +2.412 Pure OOS Sharpe, na sababu ya "h5 smallcap low volume range20" inoorodheshwa na thamani ya +2.410 Pure OOS Sharpe.
Katika utendakazi wa kwingineko ya ishara mseto, faida ya mwaka kwa mkakati wa muda mrefu/mfupi inaripotiwa kama 0.445, tetemeko la mwaka 0.287, uwiano wa Sharpe 1.551, mshuko wa juu zaidi -0.236, na Calmar 1.886. Hii inaonyesha kuwa utendakazi fulani uliorekebishwa kulingana na hatari unazingatiwa hata nje ya kipindi cha mafunzo.
Hata hivyo, makala ina onyo muhimu: Matokeo yenye uzito wa thamani ya soko yanabaki dhaifu. Hili linapendekeza kuwa chanzo cha alfa kilichopatikana kinazingatia zaidi tokeni ndogo na huenda kina uwezo mdogo. Kwa hivyo, matokeo hayapaswi kufasiriwa kama mkakati mkubwa wa kitaasisi usio na msuguano na rahisi kutekelezeka.
Kwa Nini Hili Ni Muhimu?
Utafiti huu unatoa mfano muhimu wa jinsi mawakala wa LLM wanaweza kutumika kwa usalama na kuweza kukaguliwa zaidi katika AI ya kifedha. Nguvu ya wakala ni uwezo wa kuunda dhana na kubadilisha mwelekeo wa utafiti. Upande wake dhaifu ni hatari ya kulegeza sheria inapoachwa huru, kutoa uvujaji wa data bila kukusudia, au kutosheleza kupita kiasi kwenye data zilizopita.
Makala yanatenganisha mambo haya mawili: Wakala anaunda wazo la utafiti, lakini hawezi kubadilisha itifaki. Kwa njia hii, dhana zilizoshindwa zinarekodiwa sawa na sababu zilizofaulu. Mbinu hii inatoa mfumo wa kimatendo ambao unaweza kupunguza hatari ya "kuonyesha matokeo mazuri tu" katika utafiti wa kifedha.
Masoko ya sarafu za dijiti ni uwanja unaofaa wa kujaribia kwa utafiti wa aina hii. Hii ni kwa sababu historia ya kuorodheshwa kwa rasilimali ni tofauti, usambazaji wa ukwasi ni mkali, maslahi ya kukisia yanabadilika haraka, na data ya kawaida ya uchambuzi wa kimsingi ni ndogo. Kwa hivyo, mchanganyiko wa ishara za miundo midogo kama vile bei, kiasi, thamani ya soko, tetemeko, na kasi hupata umuhimu kwa upande wa utafiti.
Mambo ya Kuzingatia
1. Utafiti huu sio ushauri wa uwekezaji. Faida na viwango vya Sharpe vilivyoripotiwa ni matokeo ya itifaki ya utafiti wa majaribio. Katika matumizi halisi ya soko, ukwasi, kina cha kitabu cha kuagiza, kuenea (spread), kuteleza, kodi, udhibiti na hatari za uendeshaji zinaweza kutoa matokeo tofauti.
2. Athari ya tokeni ndogo inaweza kusababisha tatizo la uwezo. Makala inasema kwamba chanzo cha alfa kinajikita kwenye rasilimali ndogo. Katika tokeni ndogo na zenye ukwasi mdogo, gharama ya muamala na athari ya soko inaweza kuongezeka kwa kasi.
3. Wakala wa LLM ni hatari bila itifaki sahihi. Ikiwa wakala anaweza kubadilisha mgawanyo wa data, vizingiti, au msimbo kwa uhuru, matokeo yanaweza kuwa zao la utafutaji usiodhibitiwa na mkao wa kupita kiasi (overfitting).
4. Rekodi ya dhana zilizoshindwa ni muhimu. Kuripoti tu matokeo yaliyofaulu ni kupotosha. Moja ya nguvu za utafiti huu ni kwamba unaruhusu watahiniwa walioshindwa kubaki wakikaguliwa ndani ya njia ya kuambatisha pekee (append-only trace).
5. Utendakazi wa zamani sio hakikisho la utendakazi wa siku zijazo. Taratibu zinaweza kubadilika haraka katika masoko ya sarafu za dijiti. Sababu zinazofanya kazi katika kipindi kimoja zinaweza kudhoofika au kutoweka kabisa katika kipindi kinachofuata.
6. Taarifa za kimaadili zinaweza kuwa hazitoshi. Ingawa makala inasema kuwa hakuna tatizo la kimaadili, matumizi ya mawakala wa kifedha katika masoko halisi yanaweza kuhitaji mijadala mipana zaidi ya kimaadili kwa upande wa tabia za wawekezaji na athari za soko.
Dokezo la eneo la hatari: Somo linahusu ugunduzi wa sababu na utendaji wa kwingineko katika masoko ya sarafu za dijiti. Makala hii sio ushauri wa uwekezaji. Matokeo yaliyofafanuliwa hapa; hayapaswi kuzingatiwa kama pendekezo la kununua, kuuza, kushikilia, au kuanzisha mkakati wa kiotomatiki wa rasilimali yoyote ya sarafu ya dijiti.
Tathmini ya jumla: Utafiti unachunguza jinsi mawakala wa muundo mkubwa wa lugha wanaweza kutumika katika utafiti wa kifedha. Hata hivyo, wazo kuu la makala sio "Mruhusu LLM kuandika mkakati kwa uhuru". Kinyume chake, wakati wakala wa LLM anaruhusiwa kuunda dhana, hatua muhimu kama vile kugawa data, kupima sababu, kutumia kizingiti cha uteuzi, kuzingatia gharama ya muamala, na tathmini ya nje ya sampuli zinadhibitiwa na injini bainifu.
Hitimisho
Utafiti huu unaonyesha kwamba mawakala wa LLM hawapaswi kuachwa huru kabisa katika utafiti wa kifedha; badala yake, wanaweza kutumika kama mfumo wa kutafuta dhana uliofungwa kwa itifaki thabiti ya majaribio. Wakala anachukua upande wa ubunifu na mzunguko wa utafiti unaojirudia, ilhali injini bainifu inadhibiti mgawanyo wa data, kipimo, mlango wa uteuzi, na jaribio la kwingineko.
Katika majaribio yaliyofanywa kwenye masoko ya sarafu za dijiti, wakala anagundua familia ya sababu inayoangazia tokeni zenye thamani ndogo ya soko, ukwasi mdogo, tabia ya masafa ya juu, na vipengele vya mwelekeo chanya. Utendakazi muhimu unaripotiwa katika kwingineko ya muda mrefu/mfupi yenye uzito sawa katika kipindi cha nje ya sampuli. Hata hivyo, kiwango cha uwezo na msongamano wa tokeni ndogo huhitaji usomaji wa uangalifu wa matokeo.
Ujumbe mkuu kwa msomaji wa Verianla ni huu: Katika AI ya kifedha, kile ambacho kina thamani sio tu matokeo mazuri ya utabiri. Jambo muhimu zaidi ni; jinsi dhana inavyotolewa, inavyojaribiwa, iwapo majaribio yaliyoshindwa yanarekodiwa au la, na ikiwa matokeo yanajaribiwa kikweli katika kipindi kisichoonekana.
Dokezo kuhusu Chanzo na Mbinu
Makala hii ni maudhui asili ya uhariri wa Kituruki yaliyotayarishwa kulingana na PDF ya kitaaluma inayoitwa "From Hypotheses to Factors: Constrained LLM Agents in Cryptocurrency Markets". Maandishi si tafsiri ya moja kwa moja; tatizo, mbinu, fomula, muundo wa majaribio, matokeo, na vikwazo katika utafiti vimefafanuliwa kwa kurahisishwa.

Acha maoni
Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *