Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Sayansi ya Kompyuta / Utambuzi wa Shughuli Zisizo za Kawaida za Binadamu katika Video za Ufuatiliaji kwa Ujifunzaji wa Kina Unaosaidiwa na ANFIS
Sayansi ya Kompyuta

Utambuzi wa Shughuli Zisizo za Kawaida za Binadamu katika Video za Ufuatiliaji kwa Ujifunzaji wa Kina Unaosaidiwa na ANFIS

Utafiti huu unapendekeza usanifu mseto unaounganisha YOLOv8, ResNet50, mtandao wa kumbukumbu ya muda mrefu na mfupi wa pande mbili, pamoja na mfumo wa uamuzi wa neuro-fuzzy unaojibadilisha ili kutambua kiotomatiki shughuli zisizo za kawaida za binadamu katika video za ufuatiliaji.

02/08/2026  Veri Anla Imetazamwa mara 36
Utambuzi wa Shughuli Zisizo za Kawaida za Binadamu katika Video za Ufuatiliaji kwa Ujifunzaji wa Kina Unaosaidiwa na ANFIS

Utafiti huu unapendekeza usanifu mseto unaounganisha YOLOv8, ResNet50, mtandao wa kumbukumbu ya muda mrefu na mfupi wa pande mbili, pamoja na mfumo wa uamuzi wa neuro-fuzzy unaojibadilisha ili kutambua kiotomatiki shughuli zisizo za kawaida za binadamu katika video za ufuatiliaji. Muundo ulitathminiwa kwenye mkusanyiko wa data wa AVENUE unaoelezwa kuwa na video 16 za mafunzo na video 21 za majaribio; watafiti waliripoti usahihi wa asilimia 98, precision ya asilimia 97,6, recall ya asilimia 97,2, alama ya F1 ya asilimia 97,4, ROC-AUC ya 0,99 na kiwango cha tahadhari za uongo cha asilimia 2,1. Hata hivyo, utafiti huu ni preprint ambayo haijapitia mapitio ya rika; kutokana na mapungufu katika itifaki ya majaribio na kutokulingana kati ya viashirio vya utendaji vilivyoripotiwa na confusion matrix, matokeo yanapaswa kutathminiwa kama ushahidi wa awali.

Katika mfumo uliopendekezwa, YOLOv8 hutambua watu katika kila fremu ya video na kuwaweka ndani ya visanduku vya mipaka, ResNet50 hutoa sifa za anga kama mkao wa mwili wa mtu na muktadha wa mandhari, mtandao wa kumbukumbu ya muda mrefu na mfupi wa pande mbili huchanganua mabadiliko ya sifa hizi kwa muda, na mfumo wa neuro-fuzzy unaojibadilisha hutathmini kwa pamoja kasi ya mwendo, muda wa shughuli, mabadiliko ya mwelekeo na alama za kujiamini za mitandao ili kuainisha shughuli kuwa ya kawaida, ya kutiliwa shaka au isiyo ya kawaida. Wazo kuu la mbinu hii ni kusimamia kutokuwa na uhakika kati ya tabia zinazofanana, kama kutembea kwa kasi, kukimbia, kusubiri na kubadili mwelekeo kwa namna isiyo ya kawaida, kwa kutumia viwango vinavyopishana vya uanachama wa fuzzy badala ya kizingiti kimoja kigumu.

Tathmini kwa mtazamo wa Uturuki: Usanifu huu unatoa mfumo wa mbinu unaoweza kubadilishwa kwa matumizi ya utafiti wa kamera mahiri katika vituo vya usafiri vya manispaa, kampasi za vyuo vikuu, vituo, maeneo ya hospitali, viwanja vya shule na mitambo ya viwandani nchini Uturuki. Hata hivyo, kwa matumizi hayo, mikusanyiko ya data ya ndani inayowakilisha pembe za kamera, hali za mwanga, msongamano wa watu na mifumo ya kawaida ya mwendo nchini Uturuki inapaswa kuundwa; madarasa ya kawaida, ya kutiliwa shaka na yasiyo ya kawaida yanapaswa kuwekewa lebo kwa vigezo vilivyo wazi; na katika majaribio huru, tahadhari za uongo, matukio yaliyokosekana, ucheleweshaji na kasi ya uchakataji wa wakati halisi zinapaswa kupimwa. Kutokana na utafiti huu haiwezi kuhitimishwa moja kwa moja kwamba kutakuwa na mafanikio ya matumizi ya eneo halisi nchini Uturuki, utiifu wa kisheria, utendaji wa wakati halisi, utendaji sawa katika makundi mbalimbali ya kijamii au kiwango cha tahadhari za uongo cha asilimia 2,1.

Swali kuu la utafiti ni lipi?

Swali kuu la utafiti ni kama kuunganisha mwonekano wa anga wa mienendo ya binadamu katika video za ufuatiliaji, maendeleo yake kwa muda na mipaka isiyo wazi ya tabia ndani ya muundo mmoja kunaweza kuboresha utambuzi wa shughuli zisizo za kawaida. Watafiti wanasisitiza hasa kwamba hakuna mipaka mikali kati ya kutembea kawaida na mwendo wa haraka, kusubiri kwa muda mfupi na kuzurura kwa kutiliwa shaka, au kubadili mwelekeo kwa kawaida na mwendo usio na mpangilio.

Utafiti unalenga kujibu swali hili kwa usanifu wa vipengele vinne: YOLOv8 hutambua watu, ResNet50 hutoa sifa za picha, Bi-LSTM hujifunza mifumo ya mwendo katika fremu zinazofuatana, na ANFIS hutathmini kutokuwa na uhakika kwa kutumia kanuni za fuzzy ili kutoa uainishaji wa mwisho.

Kwa nini utafiti huu ni muhimu?

Kwa kuwa kamera za ufuatiliaji hutengeneza idadi kubwa ya mitiririko ya video inayotokea kwa wakati mmoja, ufuatiliaji usiokatizwa wa picha zote na binadamu una hatari ya kupungua kwa umakini, uchovu na kukosa matukio muhimu. Watafiti wanachukulia utambuzi wa kiotomatiki wa matukio kama mapigano, kukimbia katika eneo lililokatazwa, kuzurura kwa muda mrefu, kurusha vitu, kusonga kinyume cha mwelekeo na mifumo isiyo ya kawaida ya mwendo kuwa mojawapo ya matatizo msingi ya mifumo mahiri ya ufuatiliaji.

Mbinu za jadi zinaweza kutegemea optical flow, njia ya mwendo, histogramu ya gradienti zilizoelekezwa na sifa nyingine zilizobuniwa kwa mikono. Kwa mujibu wa utafiti, mbinu hizi zinaweza kuwa na ugumu wa kujumlisha chini ya mabadiliko ya mwanga, msongamano, kufunikana, pembe tofauti za kamera na mandharinyuma inayosonga. Ingawa miundo ya deep learning inaweza kujifunza sifa kutoka kwenye picha, haiwezi kila wakati kusimamia kwa uwazi kutokuwa na uhakika kati ya tabia zinazofanana. Pengo ambalo muundo uliopendekezwa unalenga kushughulikia ni kuunganisha utoaji madhubuti wa sifa za kuona na za muda na utaratibu wa uamuzi wa neuro-fuzzy katika mnyororo mmoja wa uchakataji.

Usanifu uliopendekezwa unafanyaje kazi?

1. Kuandaa fremu za video

Video ya ingizo hugawanywa kwanza kuwa fremu za picha zinazofuatana:

\[ V = \{F_1, F_2, F_3, \ldots, F_n\} \]

Hapa V inawakilisha video ya ingizo, huku F_i ikiwakilisha fremu ya nambari i iliyotolewa kutoka kwenye video. Idadi ya fremu ni kiasi kisicho na kipimo. Maelezo ya mbinu ya utafiti yanaeleza kwamba fremu hubadilishwa kuwa pikseli 224 × 224 kwa ajili ya ingizo la ResNet50. Kwa upande mwingine, mchoro wa jumla wa usanifu unaonyesha ubadilishaji wa ukubwa hadi 640 × 640. Haijaelezwa wazi kama hizi ni saizi tofauti kwa YOLOv8 na ResNet50.

Thamani za pikseli huhamishwa katika masafa ya 0 hadi 1:

\[ X_{\mathrm{norm}} = \frac{X}{255} \]

X inawakilisha ukubwa wa awali wa pikseli kati ya 0 na 255; Xnorm inawakilisha thamani iliyosawazishwa isiyo na kipimo. Mabadiliko haya yanalenga kuifanya mitandao ifanye kazi kwa uwiano zaidi na viwango tofauti vya thamani za pikseli.

Inaelezwa kuwa kichujio cha Gaussian kilitumika kupunguza kelele ya kihisi na mwanga:

\[ G(x,y)=\frac{1}{2\pi\sigma^2}\exp\left(-\frac{x^2+y^2}{2\sigma^2}\right) \]

Katika fomula hii, x na y zinaonyesha nafasi ikilinganishwa na pikseli ya katikati, σ upana wa usambazaji wa kichujio, na G(x,y) uzito katika nafasi husika. Ingawa nafasi zinatarajiwa kutathminiwa kwa vitengo vya pikseli, ukubwa wa kernel na thamani ya σ iliyotumika haikuripotiwa. Mchoro wa jumla pia unaonyesha shughuli za kuongeza data kama mzunguko na uhamishaji, lakini viwango na vigezo vyake havijaelezwa.

2. Utambuzi wa binadamu kwa YOLOv8

YOLOv8 huonyesha maeneo inayotambua kuwa na binadamu katika kila fremu kwa lebo ya darasa, alama ya kujiamini na kisanduku cha mipaka:

[ B = (x,y,w,h) ]

Hapa x na y zinaonyesha nafasi ya kisanduku, w upana na h urefu. Haijaelezwa kama viwianishi vinahifadhiwa kwa pikseli au katika muundo uliosawazishwa. Eneo la mtu hukatwa na kupelekwa kwa ResNet50, huku alama ya kujiamini ya YOLOv8 baadaye ikawa mojawapo ya ingizo zinazotumiwa katika safu ya uamuzi ya ANFIS.

Lengo la hatua hii ni kuifanya modeli izingatie maeneo yenye watu badala ya kuchambua mandhari yote kwa uzito sawa. Hata hivyo, utafiti hauripoti ni toleo gani la uzani wa YOLOv8 lililotumiwa, kama lilifanyiwa mafunzo upya, kizingiti cha kujiamini wala utendaji wa utambuzi wa binadamu kama kipimo tofauti.

3. Utoaji wa sifa za anga kwa ResNet50

Maeneo ya binadamu yaliyotambuliwa na YOLOv8 hupewa ResNet50, mtandao wa neva wenye safu 50 na miunganisho ya mabaki. Uhusiano wa msingi wa residual learning unaonyeshwa kama ifuatavyo:

[ y = F(x,W) + x ]

x inawakilisha ramani ya sifa za ingizo, F(x,W) mabadiliko ya mabaki yanayopatikana kwa vigezo vya W vinavyojifunza, na y ramani ya sifa za pato. Kuongeza moja kwa moja taarifa ya ingizo kwenye matokeo ya mabadiliko hurahisisha uhamishaji wa taarifa kupitia safu za mitandao ya kina.

Inaelezwa kuwa baada ya global average pooling, vekta ya sifa yenye vipengele 2048 hutengenezwa kwa kila eneo la binadamu:

\[ f = [f_1,f_2,f_3,\ldots,f_{2048}] \]

Vekta hii inalenga kuwakilisha mifumo iliyojifunzwa kutoka kwenye picha kama mkao wa binadamu, umbo la mwili, mwingiliano na vitu vya karibu na muktadha wa mandhari. Vipengele havina vitengo vya kimwili vya mtu mmoja mmoja; ni sifa za nambari zilizojifunzwa na mtandao.

4. Uundaji wa mfano wa mwendo kwa muda kwa Bi-LSTM

Fremu moja inaweza isiwe ya kutosha kueleza peke yake kama mtu anakimbia, amebadili mwelekeo ghafla au amekaa katika eneo moja kwa muda mrefu. Kwa hiyo, vekta zenye vipimo 2048 zinazotokana na fremu zinazofuatana hupelekwa kama mfululizo wa muda katika mtandao wa kumbukumbu ya muda mrefu na mfupi wa pande mbili.

Utafiti unatoa uhusiano uliorahisishwa ufuatao kwa hali fiche katika hatua ya muda:

\[ h_t = f(Wx_t + Uh_{t-1} + b) \]

xt inawakilisha vekta ya ingizo katika wakati t, ht-1 hali fiche iliyotangulia, W na U matriki za uzani zinazojifunza, b neno la bias na f mabadiliko yasiyo ya mstari. Uwakilishi huu haujumuishi milinganyo yote ya milango ya ingizo, kusahau na pato katika muundo kamili wa LSTM; unaonyesha tu kwa muhtasari usasishaji wa jumla wa hali ya muda.

Hali za mwelekeo wa mbele na nyuma huunganishwa kama ifuatavyo:

\[ H_t = [\overrightarrow{h_t};\overleftarrow{h_t}] \]

Katika uwakilishi huu, nukta mkato inaonyesha kuunganishwa kwa sifa za pande mbili. Kwa hivyo, modeli hutumia si historia ya fremu pekee, bali pia fremu zinazofuata katika kipande cha video kinachochunguzwa. Sifa hii inaweza kuwa muhimu kwa uchambuzi wa video wa nje ya wakati halisi; hata hivyo, hitaji la fremu zijazo linaweza kuathiri ucheleweshaji wa tahadhari ya wakati halisi. Utafiti haukupima ucheleweshaji huu.

5. Uamuzi unaotegemea kutokuwa na uhakika kwa ANFIS

Mfumo wa uamuzi wa neuro-fuzzy unaojibadilisha huunganisha uwezo wa mitandao ya neva kujifunza kutoka kwenye data na kazi za uanachama za fuzzy pamoja na kanuni za “ikiwa-basi”. Ingizo tano zinazotolewa kwa ANFIS katika utafiti ni:

  • Kasi ya mwendo,
  • Muda wa shughuli,
  • Mabadiliko ya mwelekeo wa mwendo,
  • Alama ya kujiamini ya utambuzi wa binadamu kutoka YOLOv8,
  • Uwezekano wa shughuli isiyo ya kawaida kutoka Bi-LSTM.

Kasi ya mwendo inaelezwa kwa makundi ya kiisimu kama polepole, wastani na haraka. Kwa kuwa mwendo mmoja unaweza kuwa mwanachama wa viwango tofauti vya makundi “wastani” na “haraka” kwa wakati mmoja, lengo ni kupata mpito laini zaidi badala ya uamuzi kubadilika ghafla kwenye kizingiti kigumu. Katika mifano ya kanuni, kasi kubwa pamoja na mabadiliko yasiyo na mpangilio ya mwelekeo hutathminiwa kuwa isiyo ya kawaida, kasi ndogo pamoja na njia laini kuwa ya kawaida, na kasi ya wastani pamoja na shughuli ya muda mrefu kuwa ya kutiliwa shaka.

Matokeo ya kanuni zinazofanya kazi huunganishwa na alama moja ya anomalia hutolewa kwa kutumia njia ya centroid defuzzification. Utafiti unaeleza kwamba alama hubadilishwa kuwa madarasa ya kawaida, ya kutiliwa shaka na yasiyo ya kawaida. Hata hivyo, mipaka ya nambari ya kazi zote za uanachama, msingi kamili wa kanuni, namna kanuni zilivyojifunzwa na vigezo vya mafunzo ya ANFIS havijatolewa.

Mkusanyiko wa data una sifa gani?

Utafiti unaripoti kutumia mkusanyiko wa data wa AVENUE unaojumuisha picha za ufuatiliaji za kampasi ya nje. Inaelezwa kuwa mkusanyiko huo una matukio kama kukimbia, kurusha kitu, kusonga katika mwelekeo usio wa kawaida na kuzurura kwa muda mrefu; fremu zisizo za kawaida ziliwekewa alama kwa mkono na kutumiwa kama marejeo ya kweli ya majaribio.

Sifa ya mkusanyiko wa dataThamani iliyoripotiwa katika utafiti
Idadi ya video za mafunzo16
Idadi ya video za majaribio21
Azimio la picha640 × 360 pikseli
Kasi ya fremu25 fremu/sekunde
Mazingira ya kurekodiUfuatiliaji wa kampasi ya nje
Aina ya uwekaji leboMarejeo ya kweli katika kiwango cha fremu

Inaelezwa kuwa matukio yasiyo ya kawaida huunda sehemu ndogo tu ya video na yanaweza kufanana kimuonekano na shughuli za kawaida. Hata hivyo, haijaelezwa jinsi madarasa matatu ya kawaida, ya kutiliwa shaka na yasiyo ya kawaida yalivyotokana na lebo za AVENUE.

Vielelezo na grafu zinaonyesha nini?

Mchoro wa jumla wa usanifu

Kielelezo 1 kinaonyesha mtiririko mzima wa data kuanzia mkusanyiko wa data, uchakataji wa awali, utambuzi wa binadamu kwa YOLOv8, utoaji wa sifa kwa ResNet50, uundaji wa mfano wa muda kwa Bi-LSTM, uamuzi kwa ANFIS hadi pato la kawaida-kutiliwa shaka-isiyo ya kawaida. Mchoro pia unaonyesha usahihi, precision, recall, alama ya F1, ROC-AUC na kiwango cha tahadhari za uongo kama vipimo vya tathmini.

Faida ya mchoro ni kwamba unatenganisha wazi majukumu ya moduli. Hata hivyo, mchoro unaonyesha seti za mafunzo na majaribio kama “kawaida na isiyo ya kawaida,” ilhali maandishi yanataja madarasa matatu ya pato. Chanzo cha lebo ya darasa la kutiliwa shaka hakijaelezwa.

Grafu ya usahihi na hasara ya mafunzo

Katika Kielelezo 2, usahihi wa mafunzo unaongezeka katika vipindi 10 kutoka takriban 0,70 hadi 0,98, huku hasara ya mafunzo ikipungua kutoka takriban 0,90 hadi 0,12. Grafu hii inaonyesha kuwa modeli inazidi kuendana vizuri na data ya mafunzo. Hata hivyo, ni mikondo ya mafunzo pekee iliyotolewa; kwa kuwa usahihi wa uthibitishaji na hasara ya uthibitishaji havijaonyeshwa, haiwezekani kubaini kutokana na grafu hii kama kuna overfitting.

Kazi za uanachama wa kasi

Katika Kielelezo 3, mhimili mlalo unaonyesha kasi ya mwendo kati ya 0-10, na mhimili wima unaonyesha kiwango cha uanachama wa fuzzy kati ya 0-1. Kundi la polepole lina uanachama wa juu zaidi karibu na 0 na hushuka hadi sifuri karibu na 5. Kundi la wastani lina umbo la pembetatu takriban kati ya 3 na 7 na hufikia uanachama wa juu karibu na 5. Kundi la haraka huanza karibu na 5 na hufikia uanachama wa juu zaidi katika 10. Kitengo cha kimwili cha mhimili wa kasi na kama mipaka hii ilitokana na data au ilichaguliwa na mtaalamu havijaelezwa.

Grafu iliyopewa jina “kazi ya uanachama wa muda”

Ingawa kichwa cha Kielelezo 4 kinaelezea kazi ya uanachama inayohusiana na muda wa shughuli, picha ni grafu ya nguzo ya alama ya hatari inayoonyesha thamani ya 20 kwa kawaida, 40 kwa kutiliwa shaka na takriban 84 kwa isiyo ya kawaida. Grafu haina mhimili wa muda, makundi ya uanachama ya muda mfupi-wastani-mrefu wala mikondo ya uanachama inayopishana. Kwa hiyo kuna kutokulingana wazi kati ya kichwa cha kielelezo na maudhui ya kuona.

Grafu ya alama ya anomalia

Katika Kielelezo 5, katika fremu 20 alama ya anomalia inaonekana kuongezeka kwa mpangilio kutoka takriban 15 hadi 96, huku mstari wa kizingiti cha isiyo ya kawaida ukiwa katika kiwango cha 70. Alama hufikia takriban kiwango cha kizingiti katika fremu ya 14 na hupanda juu ya kizingiti katika fremu zinazofuata. Watafiti wanahusisha ongezeko hili na kukimbia ghafla, mabadiliko makali ya mwelekeo na mwendo usio wa kawaida.

Hata hivyo, grafu haionyeshi fremu halisi ya video, alama za kuanza na kumalizika kwa tukio, lebo za marejeo ya kweli au mifano tofauti ya video za kawaida na zisizo za kawaida. Haijaelezwa pia jinsi alama ya anomalia ilivyopimwa katika masafa ya 0-100 wala jinsi kizingiti cha 70 kilivyochaguliwa.

Confusion matrix

Confusion matrix katika Kielelezo 6 ina safu mbili na nguzo mbili. Thamani za seli ni 4, 1, 0 na 5. Hivyo, kati ya sampuli 10, 9 zinaonekana kuainishwa kwa usahihi kwenye diagonal kuu na 1 kuainishwa vibaya. Usahihi unaoonyeshwa moja kwa moja na matrix hii ni asilimia 90:

\[ \mathrm{Doğruluk} = \frac{4+5}{4+1+0+5} = \frac{9}{10} = 0{,}90 \]

Matokeo haya hayalingani na usahihi wa asilimia 98 ulioripotiwa katika maandishi. Aidha, ingawa pato la modeli linafafanuliwa kuwa na madarasa matatu: kawaida, kutiliwa shaka na isiyo ya kawaida, confusion matrix inaonyesha madarasa mawili pekee. Kwenye mihimili, lebo 0 na 1 zimetumika badala ya majina ya madarasa.

Ulinganisho na mbinu zilizopo

Katika Kielelezo 7 na Jedwali 2, usahihi wa asilimia 87 umeripotiwa kwa CNN, asilimia 90 kwa CNN-LSTM, asilimia 92 kwa ConvLSTM, asilimia 94 kwa muunganiko wa YOLO na Bi-LSTM, na asilimia 98 kwa modeli iliyopendekezwa. Watafiti wanahusisha ongezeko hilo na matumizi ya pamoja ya ujanibishaji wa binadamu, utoaji wa sifa za anga, uundaji wa mfano wa muda na uamuzi wa fuzzy.

Hata hivyo, haijaelezwa kama miundo iliyolinganishwa ilitekelezwa upya kwa mgawanyo sawa wa mafunzo na majaribio, kama thamani zilichukuliwa kutoka machapisho ya awali, vigezo vya miundo vilikuwa vipi na majaribio yalirudiwa mara ngapi. Kwa hiyo tofauti za asilimia haziwezi kutathminiwa kama ulinganisho uliothibitishwa chini ya masharti sawa.

Grafu ya jumla ya utendaji

Katika Kielelezo 8, usahihi unaonyeshwa kuwa asilimia 98, precision asilimia 97,6, recall asilimia 97,2, alama ya F1 asilimia 97,4, ROC-AUC asilimia 99 na kiwango cha tahadhari za uongo asilimia 2,1. Katika sehemu moja ya maandishi ROC-AUC imeandikwa kama “0,99%”, ilhali katika sehemu ya matokeo imetolewa kama 0,99. Kwa ROC-AUC, uwakilishi wenye maana ya kihisabati unaweza kuwa 0,99 au asilimia 99; hata hivyo, maonyesho tofauti ndani ya utafiti hayapaswi kubadilishwa kimya kimya kuwa thamani moja.

Utafiti unaunga mkono matokeo gani?

  • Watafiti wamefafanua usanifu wa moduli unaounganisha utambuzi wa binadamu, utoaji wa sifa za picha, uchambuzi wa mfululizo wa muda na uamuzi wa fuzzy.
  • Usanifu umeundwa kutathminiwa kwenye mkusanyiko wa data wa AVENUE.
  • Imeonyeshwa kwamba kasi ya mwendo, muda wa shughuli, mabadiliko ya mwelekeo na alama za kujiamini za mitandao zinaweza kutumiwa kama ingizo za ANFIS.
  • Utafiti unaweka mbele wazo la kushughulikia kutokuwa na uhakika kati ya mienendo inayofanana kwa uanachama wa fuzzy badala ya vizingiti visivyobadilika.
  • Watafiti wanaripoti usahihi wa juu na kiwango cha chini cha tahadhari za uongo.

Utafiti hauthibitishi nini?

  • Utafiti hauthibitishi kuwa modeli itafanya kazi kwa usahihi wa asilimia 98 katika mifumo halisi ya ufuatiliaji wa mijini.
  • Confusion matrix iliyowasilishwa haithibitishi usahihi wa asilimia 98 ulioripotiwa.
  • Hakuna uchambuzi wa uondoaji au ablation wa vipengele unaoonyesha ni kiasi gani ANFIS peke yake imechangia katika ongezeko la utendaji.
  • Haijaonyeshwa kuwa modeli itajumlisha katika nchi tofauti, pembe tofauti za kamera, hali za usiku au msongamano mkubwa wa watu.
  • Kasi ya utendaji wa wakati halisi, fremu/sekunde, ucheleweshaji, matumizi ya kumbukumbu na utendaji kwenye vifaa vya edge havijapimwa.
  • Haijaelezwa ni lebo zipi za marejeo ya kweli zilizotumiwa kuunda darasa la “kutiliwa shaka.”
  • Athari za tahadhari za uongo za modeli kwa wafanyakazi wa usalama, watu wanaofuatiliwa au michakato ya maamuzi hazijatathminiwa.
  • Matokeo hayajarudiwa na kundi huru la watafiti na hayajapitia mapitio ya rika.

Nguvu za utafiti ni zipi?

Nguvu kuu ya utafiti ni kwamba unawasilisha utambuzi wa shughuli zisizo za kawaida kama mnyororo wa uchakataji ambao majukumu yamegawanywa katika moduli zilizo wazi badala ya classifier moja ya kisanduku cheusi. YOLOv8 huzingatia eneo la binadamu, ResNet50 huwakilisha maudhui ya picha, Bi-LSTM huchanganua uhusiano wa muda na ANFIS hushughulikia kutokuwa na uhakika katika uamuzi wa mwisho. Muundo huu unaweza kutoa mfumo wa utafiti unaofaa kwa majaribio ya kina zaidi ya baadaye ambapo kila kipengele kinaweza kujaribiwa kivyake.

Matumizi ya mkusanyiko wa data wa ufuatiliaji wenye lebo kama AVENUE na ujumuishaji wa vipimo mbalimbali kama precision, recall, alama ya F1, ROC-AUC na kiwango cha tahadhari za uongo pamoja na usahihi pia ni sifa chanya za utafiti katika kiwango cha malengo. Aidha, kazi ya uanachama wa kasi hufanya mantiki ya uainishaji wa fuzzy kueleweka zaidi kwa njia ya kuona.

Mapungufu makuu na matatizo ya ulinganifu wa ndani ni yapi?

  • Utafiti ni preprint ambayo haijapitia mapitio ya rika.
  • Katika faili iliyopakiwa, maudhui ya kurasa 15 za kwanza yamerudiwa kwa kiasi kikubwa katika kurasa 15 za pili.
  • Ingawa pato la madarasa matatu linaelezwa, confusion matrix ya madarasa mawili imetolewa.
  • Thamani katika confusion matrix zinaonyesha usahihi wa asilimia 90, huku usahihi wa jumla wa asilimia 98 ukiwa umeripotiwa.
  • Usahihi wa mafunzo umeonyeshwa, lakini mikondo tofauti ya uthibitishaji na majaribio haijaonyeshwa.
  • Haijaelezwa kwa kina jinsi sampuli za mafunzo, uthibitishaji na majaribio zilivyogawanywa.
  • Urefu wa mfululizo wa Bi-LSTM, idadi ya safu, idadi ya vitengo fiche, algorithm ya optimizer, kiwango cha kujifunza na ukubwa wa batch havijaripotiwa.
  • Toleo la YOLOv8, kizingiti cha kujiamini, njia ya mafunzo upya na vipimo vya utambuzi wa binadamu havijatolewa.
  • Msingi wa kanuni wa ANFIS, kazi zote za uanachama, njia ya kujifunza na kipindi cha mafunzo havijaelezwa.
  • Kichwa cha Kielelezo 4 hakilingani na grafu inayoonyeshwa.
  • Thamani ya ROC-AUC imeonyeshwa kwa njia zisizolingana kama 0,99, asilimia 99 na asilimia 0,99.
  • Haijaonyeshwa kuwa mbinu za kulinganisha zilitekelezwa chini ya masharti sawa ya majaribio.
  • Hakuna confidence interval, standard deviation, idadi ya marudio au uchambuzi wa umuhimu wa kitakwimu uliowasilishwa.
  • Hakuna kipimo cha ucheleweshaji au fremu/sekunde kinachounga mkono dai la utendaji wa wakati halisi.
  • Kodi ya modeli, uzani uliofunzwa na usanidi wa kina wa majaribio unaohitajika kwa uzalishaji upya haupo katika utafiti.

Ina maana gani kwa mtazamo wa zamani, sasa na siku zijazo?

Hapo awali, uchambuzi wa video za ufuatiliaji ulitegemea kwa kiasi kikubwa optical flow, njia za mwendo na maelezo ya mwendo yaliyoundwa kwa mikono. Mbinu iliyopendekezwa inawakilisha mpito kutoka mkondo huo kwenda kwenye mitandao ya kina inayojifunza sifa kiotomatiki na mifumo ya neuro-fuzzy inayojaribu kuonyesha kutokuwa na uhakika kwa uwazi.

Mchango wake wa sasa ni kutoa usanifu wa dhana na wa utekelezaji unaoonyesha namna vipengele tofauti vya akili bandia vinavyoweza kuunganishwa kwa mpangilio fulani. Hata hivyo, kutoweza kuthibitisha thamani za juu za utendaji kwa namna zilivyoripotiwa kwa sasa kunafanya thamani ya utafiti huu ibaki katika kiwango cha prototipu ya utafiti inayohitaji kupimwa tena, badala ya suluhisho lililokamilika kwa matumizi ya eneo halisi.

Katika siku zijazo, usanifu huu unapaswa kutathminiwa kwenye mikusanyiko mingi ya data, mazingira tofauti ya kamera na seti huru za majaribio; mchango wa ANFIS unapaswa kupimwa kwa majaribio ya kuondoa vipengele; inapaswa kuelezwa jinsi kazi za uanachama zinavyojifunzwa kutoka kwenye data na ucheleweshaji wa wakati halisi unapaswa kuripotiwa. Watafiti pia wanapendekeza edge computing, uundaji wa mfano wa muda unaotegemea transformer na tathmini katika mikusanyiko tofauti ya data za ufuatiliaji kama kazi ya baadaye.

Mbinu na Matokeo ya Utafiti

Muhtasari wa kiufundi wa mbinu

Hatua ya uchakatajiMbinu iliyotumikaJukumu lililoelezwa katika utafitiMaelezo yaliyokosekana au yasiyo wazi
Maandalizi ya videoUtoaji wa fremu, kubadilisha ukubwa, kusawazisha, kichujio cha GaussianKurekebisha ubora wa picha na kupunguza mzigo wa hesabuHaijawa wazi saizi za 224 × 224 na 640 × 640 zilitumika katika hatua zipi; vigezo vya kichujio havijatolewa.
Utambuzi wa binadamuYOLOv8Kutambua watu, kutengeneza kisanduku cha mipaka na alama ya kujiaminiToleo la modeli, vizingiti na utendaji wa utambuzi havijaripotiwa.
Utoaji wa sifa za angaResNet50 iliyofunzwa awaliKutengeneza vekta ya sifa za picha yenye vipimo 2048Haijaelezwa kama safu zilifungwa na namna fine-tuning ilivyofanywa.
Uundaji wa mfano wa mudaBi-LSTMKujifunza mabadiliko ya mwendo katika fremu zinazofuatana kwa pande mbiliUrefu wa mfululizo, idadi ya safu na idadi ya vitengo fiche havijatolewa.
UamuziANFISKuainisha mienendo yenye utata kuwa ya kawaida, ya kutiliwa shaka au isiyo ya kawaidaMsingi kamili wa kanuni na vigezo vya uanachama havijaelezwa.

Ingizo za ANFIS na tafsiri zake

Ingizo la ANFISTaarifa inayowakilishwaMaelezo katika utafitiKitengo au skeli
Kasi ya mwendoJinsi mtu anavyosonga kwa kasiImeundwa kwa makundi ya fuzzy ya polepole, wastani na haraka.Haijatajwa.
Muda wa shughuliMuda ambao mwendo au kusubiri huendeleaHuchangia kufanya kuzurura kwa muda mrefu kuainishwe kuwa kwa kutiliwa shaka.Haijatajwa.
Mabadiliko ya mwelekeoKama njia ya mwendo ni yenye mpangilio au isiyo na mpangilioMabadiliko makali na yasiyo na mpangilio yanaweza kuimarisha uamuzi wa isiyo ya kawaida.Haijatajwa.
Alama ya kujiamini ya YOLOv8Kujiamini kwamba eneo lililotambuliwa lina binadamuLengo ni kuhamisha kutokuwa na uhakika wa utambuzi kwenda kwenye uamuzi wa mwisho.Uwezekano au alama ya kujiamini; skeli halisi haijatajwa.
Uwezekano wa shughuli wa Bi-LSTMTathmini ya mtandao wa muda kuhusu mwendo usio wa kawaidaHuwezesha ANFIS kuunganisha pato la deep learning na kanuni za fuzzy.Alama ya uwezekano; mbinu ya urekebishaji haijatajwa.

Vipimo vya utendaji

Vipimo kuu vya uainishaji vinavyotumiwa katika mchoro wa jumla wa usanifu vimetolewa kama ifuatavyo:

\[ \mathrm{Doğruluk} = \frac{TP+TN}{TP+TN+FP+FN} \]

\[ \mathrm{Kesinlik} = \frac{TP}{TP+FP} \]

\[ \mathrm{Duyarlılık} = \frac{TP}{TP+FN} \]

\[ F1 = 2 \times \frac{\mathrm{Kesinlik}\times\mathrm{Duyarlılık}}{\mathrm{Kesinlik}+\mathrm{Duyarlılık}} \]

\[ \mathrm{Yanlış\ Alarm\ Oranı} = \frac{FP}{FP+TN} \]

Hapa TP inaonyesha idadi ya true positive, TN true negative, FP false positive na FN false negative. ROC-AUC kwa upande mwingine hufupisha uwezo wa kutenganisha kati ya viwango vya true positive na false positive katika vizingiti tofauti vya uamuzi.

Matokeo yaliyoripotiwa na watafiti

Kipimo cha utendajiThamani iliyoripotiwaKikomo cha tafsiri
Usahihi98%Thamani za confusion matrix ya madarasa mawili zinaonyesha usahihi wa 90%.
Precision97,6%Haijaonyeshwa ni sampuli zipi za majaribio zilizotumika kuhesabu thamani hii.
Recall97,2%Matokeo kwa kila darasa na idadi za sampuli havijatolewa.
Alama ya F197,4%Thamani tofauti kwa madarasa ya kawaida, ya kutiliwa shaka na yasiyo ya kawaida hazijawasilishwa.
ROC-AUCImeonyeshwa kama 0,99 au 99%Katika sehemu moja ya maandishi imeandikwa kimakosa kama 0,99%.
Kiwango cha tahadhari za uongo2,1%Haijaunganishwa na confusion matrix na idadi ya sampuli za majaribio.
Hasara ya mwisho ya mafunzoTakriban 0,12Hasara ya uthibitishaji haijaonyeshwa.

Matokeo ya ulinganisho wa usahihi

ModeliUsahihi ulioripotiwa katika utafiti
CNN ya jadi87%
CNN-LSTM90%
ConvLSTM92%
YOLO + Bi-LSTM94%
YOLOv8 + ResNet50 + Bi-LSTM + ANFIS98%

Jedwali linaonyesha kwamba watafiti waliwasilisha modeli iliyopendekezwa kama mbinu yenye usahihi wa juu zaidi. Hata hivyo, kwa kuwa haijaelezwa kama mgawanyo huo huo wa data, bajeti hiyo hiyo ya mafunzo na itifaki hiyo hiyo ya tathmini zilitumika kwa mbinu zote, ulinganisho huu si ushahidi uliothibitishwa wa ubora.

Mazingira ya vifaa na programu

KipengeleTaarifa iliyoripotiwa katika utafiti
KichakatajiIntel Core i7; modeli kamili haijatajwa.
Kumbukumbu16 GB RAM
Kichakataji cha pichaNVIDIA GPU; modeli na uwezo wa kumbukumbu havijatajwa.
Lugha ya programuPython 3.11
Mazingira ya deep learningTensorFlow
Uchakataji wa videoOpenCV
Utambuzi wa binadamuYOLOv8
Uamuzi wa fuzzyInaelezwa kuwa Scikit-fuzzy ilitumika.

Utafiti unaeleza kwamba vifaa vilitosha kwa mafunzo na majaribio; hata hivyo, hauripoti thamani za utendaji kama muda wa mafunzo, ucheleweshaji wa inference, idadi ya fremu zinazochakatwa kwa sekunde na matumizi ya GPU.

Dokezo la Chanzo na Mbinu

Sehemu ya utambulisho wa chanzoTaarifa iliyothibitishwa
Jina kamili la asili la utafitiANFIS-Enhanced Deep Learning Framework for Abnormal Human Activity Detection in Surveillance Videos
Waandishi na mpangilio wao1. Shweta S. Patil; 2. U.L. Bombale
Mwandishi mwenza wa kwanzaHakuna taarifa ya mchango sawa au uandishi mwenza wa kwanza.
Mwandishi wa mawasilianoKatika rekodi ya SSRN, Shweta Patil anaonyeshwa kama “Contact Author”. Katika maandishi yaliyopakiwa pia anwani za barua pepe za waandishi wote wawili zimetolewa, lakini hakuna alama tofauti ya mwandishi anayewajibika iliyotumiwa.
Taasisi ya Shweta S. PatilDepartment of Technology, Shivaji University, Kolhapur; Department of Mechatronics Engineering, Kasegaon Education Society’s Rajarambapu Institute of Technology, Shivaji University’ye bağlı, Sakharale, Maharashtra, Hindistan
Taasisi ya U.L. BombaleDepartment of Technology, Shivaji University, Kolhapur, Maharashtra, Hindistan
DOI10.2139/ssrn.7002147
JaridaHakuna jina la jarida lililopitia mapitio ya rika.
MchapishajiHakuna mchapishaji wa jarida lililopitia mapitio ya rika. Taarifa ya mchapishaji wa jarida la asili haiwezi kuthibitishwa kupitia toleo hili.
Jukwaa la uchapishajiSSRN
Mwaka wa uchapishaji2026
Tarehe ya kupakiwa kwenye SSRN26 Juni 2026
Aina ya chanzoPreprint inayodai kuwasilisha uundaji wa modeli ya deep learning na neuro-fuzzy pamoja na tathmini ya utendaji
Hali ya mapitio ya rikaHaijapitia mapitio ya rika.
Chanzo rasmiUkurasa rasmi wa utafiti wa SSRN

Utafiti huu ni preprint ambayo haijapitia mapitio ya rika; matokeo yake yanapaswa kusomwa kwa kuzingatia kikomo hiki. Taarifa ya DOI haikuchapishwa kwenye ukurasa wa kichwa wa maandishi yaliyopakiwa; ilithibitishwa kupitia ukurasa rasmi wa rekodi ya SSRN. DOI inatambulisha rekodi ya utafiti wa SSRN zaidi kuliko makala ya jarida lililopitia mapitio ya rika.

Maudhui ya kisayansi ya makala hii ya Verianla yameandaliwa kwa kutegemea tu utafiti uliopakiwa. Vyanzo vya nje vilitumika tu kuthibitisha taarifa za utambulisho wa kibibliografia kama mpangilio wa waandishi, mwandishi wa mawasiliano, DOI, jukwaa na tarehe ya kupakiwa. Hakuna matokeo ya kisayansi, jaribio la ziada au matokeo ya utendaji yasiyopatikana katika utafiti uliopakiwa yaliyoongezwa kwenye makala.

Mapungufu makuu ya kimetodolojia ya utafiti ni kutokulingana kati ya maelezo ya modeli ya madarasa matatu na confusion matrix ya madarasa mawili, confusion matrix kuonyesha usahihi wa asilimia 90 huku usahihi wa asilimia 98 ukiripotiwa, kutofafanuliwa kwa itifaki ya uthibitishaji, kutotolewa kwa kanuni na vigezo vya uanachama wa ANFIS, kutokuwa wazi kwa masharti ya ulinganisho na kukosekana kwa vipimo vya utendaji wa wakati halisi. Katika faili ya kurasa 30 iliyopakiwa, maudhui ya kisayansi yanaonekana mara mbili.

Utafiti hautoi ushahidi wa matumizi halisi ya eneo, kutegemewa kwa muda mrefu, dhamana ya usalama au uwezo wa kutumiwa moja kwa moja nchini Uturuki. Thamani za utendaji zilizoripotiwa zinahitaji kuthibitishwa kwenye mikusanyiko huru ya data kwa itifaki wazi za majaribio na kodi inayoweza kuzalishwa upya.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy