
Sehemu kubwa ya fimbo mahiri za kuongozea inaweza kutambua kikwazo kilicho mbele kwa kutumia sensa za ultrasonic, ToF, LiDAR, kamera na mifumo mingine ya utambuzi; hata hivyo, kutabiri mtembea kwa miguu au gari linalosonga litaelekea wapi baada ya muda mfupi ni tatizo tofauti. Mapitio haya ya kiusimulizi yanachunguza uwezo wa modeli za LSTM, zinazojulikana kama mitandao ya long short-term memory, kujifunza mifumo ya muda ya mwendo wa vizuizi vinavyosonga na hivyo kubadilisha fimbo mahiri kutoka mifumo inayoweza tu “kutambua kikwazo” kuwa vifaa saidizi vinavyoweza “kutabiri hatari inayokaribia”.
Mapitio yanalinganisha LSTM na GRU, TCN, Transformer nyepesi, RNN inayosaidiwa na attention, mifumo mseto ya Kalman filter-RNN, modeli za grafu na mbinu za TinyML. Kwa tathmini ya waandishi, faida kuu ya LSTM ni uwezo wake wa kuunda modeli za utegemezi wa muda mrefu katika mwendo wa watembea kwa miguu, kuwepo kwa aina nyingi maalumu kwa kazi, na ukweli kwamba baadhi ya modeli za LSTM zimewahi kuendeshwa kwa uhalisia kwenye microcontroller za daraja la ARM Cortex-M. Hata hivyo, ubora huu si ushahidi wa utendaji wa jumla; modeli zimejaribiwa kwenye kazi tofauti, vifaa tofauti na Dataset tofauti.
Chanzo kinachunguza familia tano kuu za kupunguza uzito wa LSTM ili kuzipeleka kwenye vifaa vya nishati ndogo: kurahisisha usanifu, low-rank decomposition, structured compression/pruning, quantization na knowledge distillation. Katika mojawapo ya mifano iliyowasilishwa, modeli ya DeepConv LSTM iliyowekewa full integer quantization ilipungua kutoka 513 KB hadi 136,5 KB, ikatumia 29,1 KB SRAM na kuonyesha muda wa inference wa 21 ms kwenye ARM Cortex-M4. Hata hivyo, kipimo hiki hakikufanywa kwa utabiri wa nia ya mtembea kwa miguu wala kwenye fimbo mahiri halisi, bali katika kazi ya utambuzi wa shughuli za binadamu.
Hitimisho muhimu zaidi la mapitio ni kwamba, ingawa mbinu ya utabiri hai inayotegemea LSTM ina matumaini ya kiufundi, bado hakuna mfumo uliothibitishwa kutoka mwanzo hadi mwisho kwenye fimbo mahiri halisi. Baadhi ya tafiti zilizopo hutoa ushahidi wa utabiri wa trajectory kwenye roboti zinazotembea, baadhi kuhusu utambuzi wa vizuizi kwenye fimbo zinazotegemea STM32, na nyingine kuhusu uwezekano wa kuendesha LSTM kwenye MCU kwa kazi nyingine. Kuunganisha vipengele hivi kwenye kifaa kimoja halisi, kuvijaribu na watumiaji wenye ulemavu wa kuona, na kupima uaminifu wake katika mazingira ya maisha ya kila siku ni hitaji kuu la utafiti wa baadaye.
Kwa mtazamo wa Türkiye: Utafiti unaweza kutoa mfumo wa R&D unaoweza kutumika kwa vyuo vikuu na timu za teknolojia nchini Türkiye katika maeneo ya vifaa saidizi vya nishati ndogo vinavyotegemea STM32, wearable electronics, teknolojia za miji inayofikika na navigesheni inayosaidiwa na akili bandia. Chanzo pia kinataja WeWALK Smart Cane 2 yenye makao Istanbul kama mojawapo ya mifano ya kibiashara; hata hivyo, waandishi wanasisitiza kwamba taarifa za utendaji kuhusu bidhaa za kibiashara zinatokana na nyaraka za watengenezaji na hazijathibitishwa na tafiti huru zilizopitia peer review. Kwa kuwa utafiti hauna jaribio la eneo nchini Türkiye linalotumia utabiri wa nia ya mtembea kwa miguu unaotegemea LSTM, data halisi ya eneo inahitaji kukusanywa kando kwa mpangilio wa vijia vya ndani, msongamano wa watembea kwa miguu, tabia za trafiki, hali ya hewa, desturi za watumiaji na mahitaji ya ufikivu.
Je, kinachokosekana kwenye fimbo mahiri ni sensa bora tu?
Sehemu ya kuanzia ya utafiti ni tofauti kati ya fimbo mahiri kutambua mazingira na kutabiri mustakabali wa mwendo katika mazingira hayo. Sensa ya ultrasonic au mfumo wa ToF unaweza kupima kikwazo kiko mbali kiasi gani; kamera inaweza kuainisha mtembea kwa miguu au gari; LiDAR inaweza kutoa jiometri ya mazingira. Lakini ili kuelewa kama mtu anayesonga atabadilisha mwelekeo na kuingia mbele ya mtumiaji wa fimbo, mwendo katika hatua za muda zinazofuatana lazima utathminiwe kwa pamoja.
Kwa sababu hii, sehemu kubwa ya mifumo iliyopo iliyochunguzwa katika mapitio inaainishwa kama suluhisho zinazotambua “hali ya sasa”. Mifumo inayotumia Jetson Nano na RGB-D/LiDAR inaweza kufanya utambuzi wa kuona wa kiwango cha juu na SLAM, huku suluhisho za nishati ndogo zinazotegemea STM32 zikiweza kutoa onyo la mtetemo kwa haraka kulingana na kizingiti cha umbali. Usanifu wa edge-cloud pia huwezesha utambuzi wa vitu na uhamishaji wa data kwa mbali. Hata hivyo, katika mifumo ya kawaida iliyochunguzwa na waandishi, kutokuwepo kwa modeli halisi ya muda ya mwendo kama LSTM ndani ya mnyororo wa maamuzi huunda pengo la pamoja.
Usanifu wa jumla uliopendekezwa unafanyaje kazi?
Usanifu wa dhana uliounganishwa katika Kielelezo 1–3 cha utafiti umegawanywa katika tabaka tatu kuu: utambuzi, uamuzi na mrejesho. Tabaka la utambuzi hukusanya data kutoka vyanzo kama sensa za ultrasonic, ToF, LiDAR, kamera ya RGB-D na IMU. Data hupitishwa kwenye fusion ya sensa nyingi na kubadilishwa kuwa dirisha la muda. Katika tabaka la uamuzi, LSTM iliyopunguzwa uzito inalenga kutabiri mwendo wa baadaye au nia ya mtembea kwa miguu kutokana na taarifa za awali za nafasi, kasi, umbali na mabadiliko. Katika hatua ya mwisho, kiwango cha hatari hubadilishwa kuwa sauti, mtetemo au aina nyingine ya mrejesho kwa mtumiaji.
Verianla Live: Mnyororo wa uchakataji wa fimbo mahiri unaotegemea utabiri
Mchakato huu ni muhtasari wa Kiswahili wa usanifu wa dhana uliowasilishwa katika Kielelezo 1–3 cha mapitio. Unapaswa kusomwa kama usanifu wa mfumo uliopendekezwa na utafiti, si kama matokeo ya kutoka mwanzo hadi mwisho yaliyopimwa kwenye prototype ya uzalishaji.
| Hatua | Kazi | Mifano iliyotajwa katika utafiti | Hali ya kisayansi |
|---|---|---|---|
| 1. Utambuzi wa mazingira | Kukusanya taarifa za kikwazo, umbali, kina na hali ya mwendo wa mtumiaji | Ultrasonic, ToF, 2D LiDAR, kamera ya RGB-D, IMU | Teknolojia zinazotumiwa katika mifumo iliyopo ya fimbo mahiri |
| 2. Fusion ya sensa na mfululizo wa muda | Kubadilisha vipimo vinavyofuatana kuwa mfululizo wa ingizo wa muda | Fusion ya 10–30 Hz na dirisha la muda la N=10–30 vinaonyeshwa katika Kielelezo 1 | Usanifu wa dhana wa mapitio |
| 3. Utabiri wa LSTM nyepesi | Kutoa taarifa za trajectory/nia ya baadaye kutokana na mabadiliko ya nafasi, kasi na umbali | Milango ya kusahau, ingizo na kutoka pamoja na kumbukumbu ya seli | Mbinu imeungwa mkono kwenye kazi na majukwaa mengine; haijathibitishwa kutoka mwanzo hadi mwisho kwenye fimbo mahiri halisi |
| 4. Tathmini ya hatari | Kubadilisha mwendo uliotabiriwa kuwa uwezekano wa mgongano au kiwango cha hatari | Madarasa ya salama, onyo na hatari | Kielelezo 2 kinawasilisha moduli ya dhana ya hatari |
| 5. Mrejesho kwa mtumiaji | Kuwasilisha taarifa ya hatari kwa mtumiaji ili kusababisha mwitikio | TTS ya sauti, mtetemo wenye viwango na kiashirio cha kuona cha mwelekeo | Mbinu za sauti/mtetemo hutumiwa katika mifumo iliyopo |
| 6. Mzunguko uliofungwa | Kutathmini mazingira upya kwa mwitikio wa mtumiaji na vipimo vipya vya sensa | Kukusanya data mpya baada ya kupunguza mwendo, kubadili mwelekeo au kusimama | Usanifu wa mzunguko uliofungwa katika Kielelezo 3 |
Verianla Live: Taswira hutengenezwa kutoka kwenye jedwali la mchakato wa kisayansi linaloonekana hapo juu. Jedwali linahifadhiwa kama scientific source-of-truth inayoweza kusomeka na mashine.
Kwa nini LSTM hutumiwa kwa mifululizo ya muda?
Katika mitandao ya kawaida ya recurrent neural network, kupungua au kuongezeka kwa gradients wakati wa backpropagation kwenye mifululizo mirefu kunaweza kufanya kujifunza taarifa za hatua za muda zilizo mbali kuwa vigumu. Tofauti kuu ya LSTM ni kwamba hali ya seli pamoja na milango ya kusahau, kuingiza na kutoa hudhibiti mtiririko wa taarifa kwa utaratibu.
Katika utafiti, forward pass ya kawaida ya LSTM inaelezwa kwa milinganyo ifuatayo:
\[ f_t=\sigma(W_f[h_{t-1},x_t]+b_f) \]
\[ i_t=\sigma(W_i[h_{t-1},x_t]+b_i) \]
\[ \tilde{c}_t=\tanh(W_c[h_{t-1},x_t]+b_c) \]
\[ c_t=f_t\odot c_{t-1}+i_t\odot\tilde{c}_t \]
\[ o_t=\sigma(W_o[h_{t-1},x_t]+b_o) \]
\[ h_t=o_t\odot\tanh(c_t) \]
Hapa \(x_t\) inawakilisha ingizo katika hatua ya sasa ya muda, \(h_{t-1}\) hali iliyofichwa iliyotangulia, \(c_t\) hali ya seli, \(f_t\) lango la kusahau, \(i_t\) lango la ingizo na \(o_t\) lango la kutoka. Muundo huu huwezesha kujenga modeli inayozingatia si tu nafasi ya mtembea kwa miguu katika picha moja, bali pia muundo wa mwendo unaofuatana.
Utabiri wa trajectory na utabiri wa nia ya mtembea kwa miguu si kazi moja
Mapitio yanatenganisha kazi hizi mbili. Utabiri wa trajectory ni tatizo la regression linalotegemea kutabiri kuratibu za anga zinazoendelea za mtembea kwa miguu katika hatua za muda zinazofuata kwa kutumia nafasi za awali. Utabiri wa nia ya kuvuka ni tatizo la uainishaji linalolenga, kwa mfano, kubaini kama mtembea kwa miguu atavuka barabara au la.
Kwa fimbo mahiri, aina hizi mbili za taarifa zinaweza kukamilishana: modeli ya nia huainisha maana ya mwendo, huku modeli ya trajectory ikitabiri mwendo unaweza kuendelea kimwili katika mwelekeo gani. Hata hivyo, mapitio hayaonyeshi kwamba kazi hizi mbili zimethibitishwa pamoja kwenye fimbo halisi.
Nafasi ya LSTM ikilinganishwa na modeli nyingine za mfululizo wa muda
Waandishi hawawasilishi LSTM kama suluhisho pekee linalowezekana. GRU hutoa muundo wa recurrent wenye parameters chache, TCN ina faida ya uchakataji sambamba, familia ya Transformer ina uwezo wa kuunda modeli za uhusiano wa umbali mrefu kupitia attention mechanism, na modeli za grafu zina uwezo wa kuwakilisha mwingiliano wa watembea kwa miguu katika mazingira yenye msongamano.
Tathmini kuu ya mapitio kwa upande wa LSTM ni kuwepo kwa tabaka tatu za ushahidi kwa wakati mmoja: mfumo wa utafiti wa miaka mingi katika utabiri wa trajectory, aina nyingi za LSTM maalumu kwa kazi na baadhi ya vipimo vya inference vilivyoripotiwa kutoka kwenye vifaa halisi vya daraja la microcontroller. Hata hivyo, lazima ikumbukwe kwamba ushahidi huu unatoka kwenye kazi na Dataset tofauti; matokeo ya jedwali hayawezi kutafsiriwa moja kwa moja kuwa “LSTM ni bora kuliko modeli nyingine zote”.
Social LSTM na modeli zilizoboreshwa hutoa nini?
LSTM ya kawaida inaweza kujifunza mwendo wa awali wa mtembea kwa miguu mmoja. Katika mbinu ya Social LSTM, hali zilizofichwa za watembea kwa miguu walio karibu huongezwa kwenye modeli kupitia social pooling mechanism ili kujaribu kuwakilisha jinsi watu wanavyoathiriana katika mwendo. SR-LSTM huboresha uwakilishi wa uhusiano wa anga. Katika mfano ulioboreshwa wa Social LSTM uliowasilishwa katika mapitio, kwa kutumia dynamic occupancy field loss, kupungua kwa %31 kwa kiwango cha migongano, %5 kwa average displacement error na %6 kwa final displacement error kumeripotiwa ikilinganishwa na baseline katika viwango tofauti vya msongamano.
Takwimu hizi hazitoki kwenye majaribio yaliyofanywa kwenye fimbo mahiri, bali zimenukuliwa kutoka utafiti husika wa trajectory ya watembea kwa miguu uliopitiwa katika mapitio. Kwa hiyo zinaonyesha uwezo wa kimetodolojia wa familia ya LSTM; hazionyeshi kwamba fimbo itaongeza usalama wa mtumiaji kwa asilimia hizo hizo.
Kwa nini mipaka ya vifaa vya fimbo mahiri ni muhimu?
Katika aina ya matumizi inayolengwa na mapitio, usahihi wa modeli pekee hautoshi. Kifaa kinapaswa kubebeka, kufanya kazi kwa betri kwa saa nyingi na kutoa utabiri bila kuchelewa wakati kikwazo kinakaribia. Utafiti unajadili malengo ya kawaida kama muda wa kufanya kazi zaidi ya saa nane, takriban 50–150 ms za muda wa jumla wa mwitikio wa mfumo na mipaka ya Flash/SRAM ya mamia ya kilobyte kwenye vifaa vya daraja la STM32.
Majukwaa kama Jetson Nano au Jetson Xavier NX yanaweza kuendesha modeli zenye nguvu za picha, lakini matumizi yake ya nishati katika kiwango cha watt yanaweza kuathiri bajeti ya betri na uzito wa kifaa kinachovaliwa. MCU za daraja la STM32 zinaweza kufanya kazi kwa nishati ndogo zaidi, lakini kuendesha LSTM kubwa na modeli za picha kwa wakati mmoja kwenye kifaa kimoja kunahitaji compression kubwa na usanifu makini wa mfumo.
LSTM inapunguzwaje ukubwa?
Mapitio yanajadili mbinu tano kuu.
- Kurarahisisha usanifu: Miundo kama Slim LSTM hupunguza idadi ya parameters kwa kupunguza weight matrices za milango. Chanzo kinataja mfano wa LSTM_C6 ambamo idadi ya parameters ilipungua kutoka takriban 53.200 hadi 3.400, yaani kupungua kwa zaidi ya %93.
- Low-rank decomposition: Mbinu za SVD, PCA, MPO na tensor-ring hujaribu kuwakilisha matrices kubwa kwa takriban kwa kutumia vipengele vidogo.
- Structured compression: C-LSTM huunda muundo wa hesabu wa kawaida kwa block-circulant matrices na hulenga hasa kuongeza kasi kwa FFT kwenye FPGA.
- Quantization: Kuhifadhi weights na activations kwa usahihi mdogo kama INT8 hupunguza ukubwa wa modeli na mzigo wa hesabu.
- Knowledge distillation: Tabia iliyojifunzwa na teacher model kubwa huhamishwa kwenda student model ndogo.
Kwa nini mfano wa INT8 quantization ni muhimu?
Kwa upande wa uwezekano wa kutumia MCU, mojawapo ya mifano ya wazi zaidi katika mapitio ni utafiti wa vifaa wa DeepConv LSTM uliofanywa kwa kazi nyingine. Baada ya full integer quantization, ukubwa wa modeli ulipungua kutoka 513 KB hadi 136,5 KB, ikatumia 29,1 KB SRAM, na muda wa inference wa 21 ms pamoja na usahihi wa takriban %97 uliripotiwa kwenye ARM Cortex-M4.
Verianla Live: Thamani za ukubwa wa modeli kutoka kwenye rejea hiyo hiyo pekee ndizo zimelinganishwa. Thamani za usahihi, latency au matumizi ya nishati kutoka kazi tofauti hazijachanganywa kwenye grafu hii.
Kupungua kutoka 513 KB hadi 136,5 KB kunalingana na kupungua kwa ukubwa kwa takriban %73–74. Hata hivyo, wakati wa quantization, usahihi pia ulipungua katika chanzo kutoka %98,24 hadi takriban %97. Muhimu zaidi, kazi ya modeli hii ni utambuzi wa shughuli za binadamu. Kwa hiyo, matokeo hayawezi kujumlishwa kuwa “LSTM hufanya kazi kwa 21 ms kwenye fimbo mahiri”; yanatoa tu rejea ya vifaa kwamba LSTM iliyocompressiwa inaweza kuendeshwa kwenye daraja la MCU linalofanana.
Kwa nini tatizo la Dataset linafanya mpito kwenda bidhaa halisi kuwa mgumu?
Mojawapo ya mapengo muhimu ambayo mapitio yanaangazia ni kwamba Dataset zilizopo za utabiri wa watembea kwa miguu hazijakusanywa kutoka mtazamo halisi wa fimbo mahiri. Kamera ya gari huwa takriban thabiti na katika nafasi ya juu zaidi, ilhali kamera iliyowekwa kwenye fimbo huwa chini zaidi, hutikisika wakati wa kutembea na inaweza kukumbwa na occlusion zaidi kutokana na vizuizi vilivyo karibu na ardhi.
| Dataset | Kazi kuu | Kiwango kilichotolewa katika utafiti | Tofauti kuu na fimbo mahiri |
|---|---|---|---|
| JAAD | Nia ya mtembea kwa miguu kuvuka | Video clips 346; chanzo kinatoa takriban saa 240 | Kamera iliyowekwa kwenye gari, juu zaidi na thabiti zaidi |
| PIE | Utabiri wa nia na trajectory | Zaidi ya saa 6, frames 909.480, sampuli 1.842 za watembea kwa miguu | Mtazamo wa gari na jukwaa thabiti |
| PedSynth | Nia ya kuvuka/kutovuka | Clips 947, saa 5 dakika 26 | Mazingira synthetic yanayotegemea CARLA na mtazamo wa gari |
| ETH/UCY | Trajectory ya watembea kwa miguu | Takriban trajectories 1.500 katika matukio matano | Mtazamo wa juu; hakuna ego-motion ya fimbo |
| BDD100K | Utambuzi wa autonomous driving | Video 100.000 | Kamera ya gari, nafasi ya sensa ya juu na thabiti zaidi |
| MS COCO | Utambuzi wa vitu | Picha tuli 330.000 | Hakuna taarifa ya mwendo wa muda |
Tofauti hii inaonyesha kwamba kwa fimbo mahiri halisi, si tu data zaidi zinazohitajika bali pia data kutoka mtazamo sahihi. Kwa hiyo waandishi wanabainisha ukusanyaji wa kimfumo wa picha za ulimwengu halisi katika kimo cha fimbo, lebo za nia ya watembea kwa miguu na data inayowakilisha mwendo wa jukwaa kama mojawapo ya vipaumbele vya baadaye.
Kuepuka vizuizi kwa njia hai kunaweza kufikiriwaje?
Katika tafiti za roboti zinazotembea zilizorejelewa katika mapitio, LSTM hutumiwa kutabiri nafasi ya baadaye kutoka mwendo wa awali; uwezekano uliotabiriwa wa mgongano kisha hupelekwa kwenye utaratibu wa maamuzi wa roboti. Hivyo mfumo unaweza kuzingatia mgongano unaowezekana mapema badala ya kusubiri hadi kikwazo kiwe karibu sana.
Hali inayolingana kwenye fimbo mahiri ni tofauti. Roboti hudhibiti motor yake yenyewe, lakini katika hali nyingi fimbo haitekelezi uamuzi yenyewe; humwonya mtumiaji kwa mtetemo au sauti. Kwa hiyo, si usahihi wa utabiri pekee bali pia uelewekevu wa onyo, muda wake, mzigo wa kiakili kwa mtumiaji na kiwango cha false alarms lazima viwe sehemu ya utendaji halisi wa mfumo.
LSTM inaweza kutumikaje katika uwekaji wa nafasi?
Mapitio pia yanachunguza tafiti zinazotumia LSTM kusaidia makadirio ya nafasi wakati GPS/GNSS inapokatika kwa kutumia mifumo ya muda katika data ya IMU. Katika mfano mmoja uliorejelewa, mfumo wa CNN-LSTM pedestrian dead-reckoning uliripoti takriban 0,52 m RMSE, huku katika baadhi ya tafiti za GPS/INS LSTM ikitoa makosa madogo ya nafasi kuliko mbinu za jadi wakati GNSS imekatika.
Gharama ya hesabu na usanidi wa sensa za mifumo hii unaweza kutofautiana na bajeti ya rasilimali ya fimbo mahiri halisi. Kwa hiyo, matokeo ya uwekaji wa nafasi hayapaswi kuhamishwa moja kwa moja kama utendaji wa fimbo.
Kwa nini cloud, V2X na 5G zinajadiliwa?
Sensa za ndani pekee za fimbo mahiri haziwezi kujua taarifa kama gari linalokaribia kutoka nje ya uwanja wa kuona au awamu ya taa za barabarani. Mapitio yanajadili kwamba muunganisho unaotegemea IoT, V2X na 5G unaweza kukamilisha taarifa hizi za mazingira zinazokosekana. Katika usanifu wa kinadharia, kifaa cha nishati ndogo hufanya utabiri wa msingi ndani ya kifaa, huku modeli tata zaidi zikiweza kuendeshwa kwenye edge-cloud; matukio muhimu yanaweza kupelekwa kwenye mifumo ya ufuatiliaji wa mbali na weights mpya za modeli kusambazwa kwa kifaa kupitia OTA.
Hata hivyo, utafiti haujathibitisha kwa majaribio muunganisho wa LSTM + V2X + 5G + fimbo mahiri halisi. Kukatika kwa coverage ya mtandao, latency, matumizi ya nishati na faragha lazima yatatuliwe kando katika matumizi halisi.
Kwa nini faragha na usalama wa mtumiaji si tatizo la algorithm pekee?
Kamera za RGB au RGB-D zinaweza pia kurekodi watu wengine katika maeneo ya umma. Kwa hiyo, mapitio yanasisitiza umuhimu wa mbinu kama uchakataji ndani ya kifaa kadiri iwezekanavyo na data minimization. Pia yanasisitiza kwamba majaribio ya ulimwengu halisi na watumiaji wenye ulemavu wa kuona yanapaswa kufanywa chini ya idhini ya maadili na informed consent.
Katika teknolojia saidizi kama fimbo mahiri, utabiri wa false negative unaweza kukosa hatari inayowezekana, huku maonyo mengi ya false positive yakimchosha mtumiaji na kupunguza imani katika mfumo. Mapitio yanaripoti kwamba bado hakuna utafiti wa fimbo unaotegemea LSTM kutoka mwanzo hadi mwisho ambao umepima uwiano huu na watumiaji halisi.
Mbinu na Matokeo ya Utafiti
Mbinu ya chanzo
Utafiti huu si utafiti wa majaribio unaofundisha modeli mpya ya LSTM au kupima prototype mpya ya fimbo mahiri. Waandishi wanautaja wazi kama mapitio ya kiusimulizi. Lengo ni kuunganisha utabiri wa trajectory na nia ya mtembea kwa miguu unaotegemea LSTM, mbinu za modeli nyepesi na mahitaji ya vifaa vya fimbo mahiri ndani ya mfumo mmoja wa kazi-vifaa-algorithm.
Utafutaji wa fasihi unajumuisha IEEE Xplore, Web of Science, Scopus, PubMed na CNKI. Kipindi cha utafutaji kimewekwa kuwa Januari 1997–Juni 2026. Tarehe ya kuanza inategemea kuchapishwa kwa kazi msingi ya LSTM mwaka 1997. Maneno ya utafutaji yaliyotumika yanajumuisha “LSTM”, “long short-term memory”, “pedestrian trajectory”, “intention prediction”, “guide stick” na “smart cane”.
Mbinu ya ujumuishaji inalenga familia tatu kuu za utafiti: utabiri wa trajectory/nia ya watembea kwa miguu kwa LSTM, tafiti za model compression na edge deployment, na mifumo ya fimbo mahiri/navigesheni kwa watu wenye ulemavu wa kuona. Tafiti za majarida na mikutano zilizopitia peer review zilipewa kipaumbele; baadhi ya preprint na ripoti za kiufundi zenye mchango wa wazi wa kiufundi pia zilijumuishwa katika usanisi wa fasihi.
Utafiti si systematic review inayotegemea PRISMA. Haijatajwa ni rekodi ngapi zilipatikana, ngapi zilitolewa, kwa sababu gani zilitolewa, wala ubora wa kimetodolojia wa tafiti ulitathminiwa kwa chombo gani cha kawaida. Kwa hiyo, matokeo yanapaswa kuonekana si kama meta-analytic effect size, bali kama usanisi wa kiufundi ulioundwa na waandishi kutoka kwenye fasihi.
Maswali ya utafiti
| Swali la utafiti | Mada inayoshughulikiwa na mapitio |
|---|---|
| RQ1 | Mbinu za utabiri wa trajectory na nia ya watembea kwa miguu zinazotegemea LSTM, sifa za utendaji na hali zinazoweza kutumika |
| RQ2 | Mbinu za kupunguza uzito wa LSTM kwa majukwaa ya edge yenye rasilimali ndogo; compression, usahihi na uwezekano wa vifaa |
| RQ3 | Vikwazo vya kiufundi na mahitaji ya utafiti wa baadaye katika kuunganisha utabiri wa LSTM kwenye fimbo mahiri halisi |
Mbinu tano za kupunguza uzito zinazosisitizwa na mapitio
| Mbinu | Wazo kuu | Matokeo yaliyosisitizwa katika chanzo | Kikomo kikuu |
|---|---|---|---|
| Slim LSTM | Kupunguza parameters katika miundo ya milango | Katika mfano wa LSTM_C6 takriban 53.200 → 3.400 parameters; kupungua kwa zaidi ya %93 | Inahitaji retraining; hakuna jaribio la moja kwa moja la fimbo kwenye MCU lililoripotiwa |
| SVD / low-rank | Kuwakilisha kwa takriban weight matrices kubwa kwa vipengele vya low-rank | Maandishi na jedwali la muhtasari wa chanzo yana maelezo tofauti kuhusu %45 | Dhana ya linear low-rank inaweza kusababisha kupungua kwa usahihi katika compression kubwa |
| C-LSTM | Block-circulant matrices na structured computation inayotegemea FFT | Katika hifadhi O(k²) → O(k), katika hesabu O(k²) → O(k log k) | Utegemezi mkubwa kwa FPGA na hardware-software co-design |
| INT8 quantization | Kupunguza usahihi wa weight/activation | Katika mfano wa MCU uliotolewa 513 KB → 136,5 KB; 29,1 KB SRAM; 21 ms | Matokeo ni ya kazi ya utambuzi wa shughuli za binadamu; hayajathibitishwa moja kwa moja kwenye fimbo mahiri |
| Knowledge distillation | Kuhamisha maarifa kutoka teacher model kubwa kwenda student model ndogo | Tafiti mbalimbali za mfululizo wa muda zinaripoti kwamba utendaji wa student model unaweza kuhifadhiwa | Mafunzo ya teacher model ni ghali na matokeo hutegemea usanifu wa student |
Sensa na majukwaa yaliyotathminiwa kwa fimbo mahiri
| Kipengele | Uwezo wa mfano uliotolewa katika utafiti | Jukumu kwa LSTM |
|---|---|---|
| Sensa ya ultrasonic | Mifano ya kipimo cha umbali katika takriban 2–450 cm | Mfululizo wa muda wa umbali |
| ToF | Kipimo sahihi zaidi cha masafa ya kati hadi takriban 4 m | Ingizo la kasi ya kikwazo kinachokaribia/mabadiliko ya muda |
| 2D LiDAR | Uchunguzi wa mazingira wa 360° na SLAM | Uzalishaji wa nafasi na trajectory ya mwendo |
| Kamera ya RGB-D | Darasa la kitu na taarifa ya kina | Utambulisho wa mtembea kwa miguu/gari na sifa za mwendo |
| IMU | Accelerometer, gyroscope na kwenye baadhi ya mifumo magnetometer | Kusaidia mwendo wa fimbo yenyewe na makadirio ya nafasi |
| MCU ya daraja la STM32 | Nishati ndogo na Flash/SRAM iliyopunguzwa | Mojawapo ya majukwaa lengwa ya edge kwa LSTM nyepesi |
| Raspberry Pi / Jetson | Uwezo mkubwa zaidi wa hesabu, matumizi makubwa zaidi ya nishati | Utambuzi wa picha na inference ya modeli tata zaidi |
| FPGA | Uwezekano wa kuongeza kasi maalumu na latency ndogo | Uongezaji kasi wa LSTM unaolenga vifaa kama C-LSTM na FINN-GL |
Matokeo muhimu zaidi
Matokeo ya kwanza: Ingawa tafiti nyingi za kawaida za fimbo mahiri zinafanikiwa katika kutambua mazingira, tabaka halisi la utabiri wa muda linalounda modeli ya tabia ya baadaye ya vizuizi vinavyosonga halijaenea sana.
Matokeo ya pili: LSTM ina mfumo wa ki-algorithm uliokomaa katika tafiti za trajectory za watembea kwa miguu na magari. Social LSTM, SR-LSTM, variants zinazotegemea attention na multimodal models zinaonyesha kwamba muktadha wa kijamii na mazingira unaweza kuongezwa kwenye mfumo zaidi ya trajectory ya mtu mmoja.
Matokeo ya tatu: Uwezo wa kuendesha LSTM kwenye microcontroller si wa kinadharia pekee. Jaribio la ARM Cortex-M4 lililorejelewa katika mapitio linaonyesha kwamba INT8 DeepConv LSTM ya 136,5 KB iliweza kufanya inference kwa 21 ms. Hata hivyo, jaribio hili si kazi ya utabiri wa watembea kwa miguu wala fimbo mahiri.
Matokeo ya nne: Mbinu kama kurahisisha usanifu, low-rank decomposition, structured compression, quantization na knowledge distillation zinaweza kupunguza mahitaji ya rasilimali ya LSTM. Kwa kuwa matokeo ya mbinu hizi yanatoka kwenye Dataset na vifaa tofauti, haiwezekani kuyaweka katika mpangilio wa ubora wa jumla.
Matokeo ya tano: Dataset zilizopo haziwakilishi kikamilifu mtazamo halisi wa fimbo. Picha kutoka kwenye magari au kutoka juu hutofautiana sana na kimo cha chini cha kamera, kutikisika, occlusion na ego-motion ya mtumiaji wakati wa kutumia fimbo.
Matokeo ya sita na muhimu zaidi: Katika fasihi iliyochunguzwa hakuna utafiti unaounganisha utabiri wa watembea kwa miguu unaotegemea LSTM, vifaa halisi vya fimbo mahiri, utambuzi wa sensa nyingi, upangaji wa kiwango cha hatari na mrejesho wa mtumiaji katika mfumo mmoja na kuuthibitisha kutoka mwanzo hadi mwisho na watumiaji wenye ulemavu wa kuona.
Vikwazo vya utafiti wenyewe
Waandishi wanasema mapitio yamewekewa mipaka ya machapisho ya Kiingereza na Kichina, vipimo vya utendaji katika tafiti tofauti vinatoka kwenye Dataset na vifaa tofauti, hakuna benchmark ya kawaida ya fimbo mahiri-LSTM, na kwa hiyo quantitative meta-analysis haikufanywa. Sehemu kubwa ya ulinganisho kati ya mbinu si head-to-head tests zilizofanywa moja kwa moja katika hali zilezile za majaribio, bali ni usanisi wa kimaelezo wa matokeo yaliyoripotiwa katika fasihi.
Mambo katika chanzo yanayohitaji umakini
Vizingiti vya hatari: Mfumo wa umbali wenye viwango vinne katika maandishi haulingani moja kwa moja na uwasilishaji wa hatari wenye vizingiti viwili katika Kielelezo 2. Kwa hiyo, hakuna “kiwango kimoja sahihi cha hatari cha fimbo ya LSTM” kilichoundwa hapa.
Kauli ya SVD compression: Maandishi yana kauli kwamba parameters za modeli zimepungua kwa %45 na kwamba ukubwa wa modeli umepunguzwa hadi %45 ya ukubwa wa awali, huku Jedwali la muhtasari 4 likitumia kauli ya “%45 volume reduction”. Kwa kuwa kupungua hadi %45 ya ukubwa wa awali kunamaanisha kupungua kwa %55, kauli hizi katika chanzo si sawa kihisabati.
Kikomo cha kazi cha ushahidi wa MCU: Matokeo ya 21 ms, 136,5 KB na %97 kwa DeepConv LSTM hayakupatikana kwenye fimbo mahiri au Dataset ya trajectory ya watembea kwa miguu. Kwa hiyo yanapaswa kutumiwa tu kama rejea isiyo ya moja kwa moja ya uwezekano wa vifaa.
Bidhaa za kibiashara: Bidhaa kama WeWALK Smart Cane 2 na Glide zinajadiliwa katika utafiti kama mifano; waandishi wanaeleza wazi kwamba baadhi ya taarifa zao za sifa na utendaji zinatoka kwenye nyaraka za watengenezaji/marketing material na hazina uthibitisho huru uliopitia peer review.
Maelezo ya Chanzo na Mbinu
Jina kamili la utafiti asili: A Survey of LSTM Pedestrian Intention Prediction and Lightweight Methods for Intelligent Guide Sticks
Waandishi: Yijia Cai; Fang Jing; Huafeng Qu; Yuxi Xie; Shafrida Sahrani.
Mpangilio wa waandishi: Umehifadhiwa kama ulivyo kwenye chanzo.
Waandishi wa mawasiliano: Fang Jing na Huafeng Qu.
Taasisi: School of Information and Intelligent Engineering, Yunnan College of Business Management, Kunming, China; Institute of Visual Informatics, Universiti Kebangsaan Malaysia, Bangi, Selangor, Malaysia.
Aina ya chanzo: Makala ya mapitio ya kiusimulizi iliyopitia peer review. Utafiti unaeleza wazi katika sehemu ya mbinu kwamba si systematic review inayotegemea PRISMA.
Jarida: Future Internet.
Mchapishaji: MDPI, Basel, Switzerland.
Juzuu / toleo / namba ya makala: 18 / 7 / 362.
DOI: 10.3390/fi18070362
Tarehe ya kupokelewa: 8 Juni 2026.
Tarehe ya marekebisho: 11 Julai 2026.
Tarehe ya kukubaliwa: 13 Julai 2026.
Tarehe ya kuchapishwa: 15 Julai 2026.
Hali ya peer review: Future Internet ni jarida la kisayansi linalopitia peer review na chanzo hiki ni makala ya mapitio iliyochapishwa.
Leseni: Creative Commons Attribution (CC BY).
Kiungo rasmi cha uchapishaji:https://doi.org/10.3390/fi18070362
Upeo wa utafutaji wa fasihi: IEEE Xplore, Web of Science, Scopus, PubMed na CNKI; Januari 1997–Juni 2026. Utafiti umewekewa mipaka ya fasihi ya Kiingereza na Kichina. Pamoja na machapisho yaliyopitia peer review, baadhi ya preprint na ripoti za kiufundi zilizochukuliwa kuwa na mchango wa wazi wa kiufundi pia zilijumuishwa katika mapitio.
Uzalishaji wa data mpya: Hakuna data mpya iliyoundwa au kuchambuliwa katika utafiti; matokeo yanategemea usanisi wa fasihi iliyopo.
Ufadhili: Utafiti ulifadhiliwa na Yunnan College of Business Management Scientific Research Foundation chini ya “Design of Intelligent Guide Stick System Based on ESP32 Chip”, Mradi No. 2026XK23.
Mgongano wa maslahi: Waandishi hawakuripoti mgongano wa maslahi.
Michango ya waandishi: Mfumo wa dhana na mbinu ya utafiti Yijia Cai; msaada wa rasilimali Huafeng Qu; marekebisho Yuxi Xie, Huafeng Qu na Shafrida Sahrani; uelekezaji na usimamizi wa mradi Fang Jing. Rasimu ya kwanza iliandaliwa na Yijia Cai.
Kikomo cha tafsiri ya kisayansi: Chanzo hiki hakionyeshi kwamba utabiri wa nia ya mtembea kwa miguu unaotegemea LSTM umethibitishwa kwa mafanikio kwenye fimbo mahiri halisi. Hitimisho linatokana na tathmini ya pamoja ya modeli za utabiri wa watembea kwa miguu katika tafiti tofauti, majaribio ya roboti zinazotembea, mifumo ya uwekaji wa nafasi, usanifu wa sensa za fimbo mahiri na tafiti tofauti za deployment ya LSTM kwenye MCU. “Uwezekano wa kutumia” hapa haumaanishi uthibitisho wa moja kwa moja wa bidhaa, bali uwezo wa kiufundi uliotokana na fasihi.
Kikomo cha Dataset: Vyanzo vikuu vya data vilivyo wazi kama JAAD, PIE, PedSynth, ETH/UCY, BDD100K na MS COCO haviwakilishi moja kwa moja mtazamo wa chini, wa kushikiliwa kwa mkono na unaotikiswa wa fimbo mahiri. Utafiti unaona hali hii kama mojawapo ya vikwazo vikuu vya data katika mpito kwenda ulimwengu halisi.
Maelezo ya ulinganifu wa ndani wa chanzo: Katika uainishaji wa umbali wa hatari, kuna uwasilishaji tofauti wa vizingiti kati ya maandishi na Kielelezo 2. Pia katika kauli ya asilimia ya SVD compression, maandishi makuu na jedwali la muhtasari hayatumii ufafanuzi uleule wa kihisabati. Tofauti hizi hazijasahihishwa kimya kimya katika maandishi ya Verianla.
Maelezo ya Verianla Live: Taswira ya mchakato katika makala imetokana na usanifu wa sensa, mfululizo wa muda, LSTM, hatari na mrejesho katika Kielelezo 1–3 cha utafiti chanzo. Ulinganisho wa namba wa ukubwa wa modeli umewekewa mipaka ya thamani za 513 KB na 136,5 KB za mfano huo huo wa INT8 DeepConv LSTM uliorejelewa katika mapitio chanzo. Thamani za utendaji kutoka tafiti tofauti zenye vitengo na kazi tofauti hazijaunganishwa katika grafu moja.

Acha maoni
Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *