Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Uhandisi / Utambuzi wa Moto na Moshi wa Viwandani kwa Umbali Mrefu kwa Udistilishaji wa Prototipu Unaosaidiwa na Taswira-Lugha
Sayansi ya Kompyuta

Utambuzi wa Moto na Moshi wa Viwandani kwa Umbali Mrefu kwa Udistilishaji wa Prototipu Unaosaidiwa na Taswira-Lugha

Utafiti huu unaendeleza mbinu ya udistilishaji wa maarifa inayolenga kutambua kwa wakati halisi mioto midogo ya mbali na mawingu ya moshi yenye kontrasti ndogo katika maeneo makubwa ya viwanda kama visafishaji mafuta, majengo ya petrokemikali, maeneo ya matangi na mitambo ya umeme.

04/08/2026  Veri Anla Imetazamwa mara 61
Utambuzi wa Moto na Moshi wa Viwandani kwa Umbali Mrefu kwa Udistilishaji wa Prototipu Unaosaidiwa na Taswira-Lugha

Utafiti huu unaendeleza mbinu ya udistilishaji wa maarifa inayolenga kutambua kwa wakati halisi mioto midogo ya mbali na mawingu ya moshi yenye kontrasti ndogo katika maeneo makubwa ya viwanda kama visafishaji mafuta, majengo ya petrokemikali, maeneo ya matangi na mitambo ya umeme. Katika kamera za usalama za umbali mrefu, maeneo hatari mara nyingi huchukua pikseli chache tu; taa za usiku, taa za mbele za magari, uangavu unaoakisiwa na nyuso za metali, mng’ao wa sakafu yenye unyevunyevu na matawi ya miti yaliyoangazwa vinaweza kuchanganywa na moto au moshi. Kwa sababu hii, vigunduzi vyepesi vya vitu vinaweza kukosa malengo dhaifu na pia kutoa kengele nyingi za uongo.

Ili kutatua tatizo hili, watafiti wanapendekeza mfumo wa udistilishaji ambao, badala ya kunakili moja kwa moja na kwa wingi maarifa ya modeli ya mwalimu yenye uwezo mkubwa, huwakilisha maeneo ya malengo yanayoaminika na mifumo ya viwandani inayopotosha kama prototipu tofauti. Utabiri wa moto, moshi mwepesi na moshi mzito kutoka kwa modeli ya mwalimu huunda ramani za uwezekano wa malengo; utabiri wa taa za barabarani, uangavu mkali unaoakisiwa na matawi ya miti yenye mwanga huunda ramani za uwezekano wa vichanganyaji. Modeli iliyogandishwa ya CLIP ya taswira-lugha pamoja na tokeni endelevu za prompt zinazojifunza hutathmini upya ramani hizi kwa upande wa semantiki, kuimarisha maeneo yanayolingana na dhana halisi za hatari huku zikikandamiza maeneo yanayopotosha yanayotokana na vyanzo vya mwanga.

Ramani za uwezekano zilizoboreshwa hutumiwa kutoa prototipu za malengo na vichanganyaji kutoka kwa modeli ya mwalimu na kuchagua tokeni za anga zenye thamani ya kufundishia kutoka kwa sifa za modeli ya mwanafunzi. Kitendaji cha hasara kinachoitwa Mask-Guided Multi-Scale Contrastive Alignment kinalenga kufanya modeli nyepesi ya mwanafunzi ijifunze mifumo halisi ya moto na moshi na kutofautisha maeneo yanayopotosha ambayo yanaonekana kufanana. CLIP, modeli ya mwalimu, tokeni za prompt na benki ya prototipu hutumika wakati wa mafunzo pekee; katika matumizi ya uwanjani hufanya kazi kigunduzi cha mwanafunzi chenye vigezo milioni 8,4 pekee.

Kulingana na matokeo kwenye seti mseto ya Fire&Smoke yenye picha 11.023, mbinu iliongeza wastani wa AP wa modeli ya YOLO26-small kutoka 51,5 hadi 63,8 na kupunguza kiwango kilichoripotiwa cha kengele za uongo kutoka %14,7 hadi %3,4. Katika seti ndogo ya fremu 625 za usiku, wastani wa AP uliongezeka kutoka 47,8 hadi 59,6 huku kiwango cha kengele za uongo kikishuka kutoka %22,6 hadi %4,6. Hata hivyo, karibu nusu ya seti ya data ina picha binafsi za viwandani, njia kamili ya kukokotoa kiwango cha kengele za uongo haijaelezwa, na hakuna benchmark ya uwanjani iliyotolewa kwenye kifaa halisi cha edge kilichopachikwa.

Maana yake kwa Uturuki

Mbinu inaweza kubadilishwa kwa mifumo ya tahadhari ya mapema katika visafishaji mafuta, viwanda vya petrokemikali na kemikali, maeneo ya kuhifadhi gesi asilia, bandari, mitambo ya nishati ya joto, maeneo ya nishati ya jua na upepo, migodi, mipaka ya msitu-viwanda na kampasi kubwa za uzalishaji nchini Uturuki. Hasa katika zamu za usiku, floodlight, taa za onyo, taa za mbele za magari, vifaa vya metali vinavyong’aa na uangavu unaoakisiwa baada ya mvua vinaweza kuunda taswira zinazofanana na moto katika mifumo ya kawaida inayotegemea kamera. Mbinu ya utafiti ya kuunda modeli tofauti kwa prototipu za malengo na vichanganyaji inatoa nadharia ya kihandisi inayohusiana moja kwa moja na hali hizo za mazingira.

Kabla ya kutekelezwa nchini Uturuki, mfumo unapaswa kufunzwa upya na kuthibitishwa kwa picha za ndani zilizokusanywa kutoka aina tofauti za mitambo, urefu tofauti wa kamera, lenzi, hali ya hewa, misimu na maeneo ya kijiografia. Ukungu, mvuke, gesi za chimney, cheche za kulehemu, flare stack, mng’ao wa michakato yenye joto na taa za magari yanayosonga zinapaswa kutathminiwa kama madarasa tofauti ya vichanganyaji. Utendaji wa kengele haupaswi kupimwa kwa AP kwa picha pekee; unapaswa kupimwa pia kwa muda wa kugundua tukio, kengele za uongo kwa saa, idadi ya matukio yaliyokosekana, uthabiti wa kengele kwenye video endelevu na mzigo wa kuingilia kati wa waendeshaji.

Utafiti huu hauthibitishi moja kwa moja kwamba mbinu itagundua moto mapema zaidi katika mitambo halisi nchini Uturuki au kupunguza vifo na hasara ya mali. Matokeo yanaunga mkono mafanikio ya ugunduzi unaotegemea picha; hayajatathmini utendaji wa usalama uliounganishwa na kamera ya joto, kigunduzi cha mwali, kihisi cha moshi, kihisi cha gesi na mfumo wa kengele wa kituo.

Tatizo kuu la utafiti ni lipi?

Kamera za usalama za viwandani kwa kawaida huwekwa kwenye nguzo ndefu, paa au minara ili kufuatilia maeneo makubwa. Mpangilio huu huruhusu eneo kubwa kuonekana kwa kamera moja, lakini pia husababisha malengo ya moto na moshi kubaki madogo sana kwenye picha. Moshi wa mbali mara nyingi huwa na kontrasti ndogo dhidi ya anga, mawingu, ukungu au gesi za chimney. Mioto midogo pia inaweza kupotea kwa urahisi karibu na floodlight, taa za magari, taa za onyo na uangavu unaoakisiwa na metali.

Vigunduzi vyepesi vya vitu vya hatua moja hupendelewa kwenye vifaa vya edge kwa sababu ya ucheleweshaji mdogo na matumizi machache ya rasilimali za vifaa. Hata hivyo, modeli ndogo zina uwezo mdogo wa uwakilishi. Kuhamisha maarifa kutoka kwa modeli kubwa ya mwalimu kwenda kwa modeli nyepesi ya mwanafunzi kunaweza kupunguza pengo hili; lakini iwapo majibu ya makosa ya modeli ya mwalimu yatahamishwa moja kwa moja, mwanafunzi anaweza kujifunza makosa yale yale.

Dai kuu la utafiti ni hili: katika udistilishaji wa moto na moshi wa viwandani, kutofautisha tu kati ya “eneo lenye uhakika mkubwa” na “mandharinyuma” hakutoshi. Hasi ngumu zinazotokana na mwanga lazima ziundwe tofauti na mandharinyuma ya kawaida. Kwa sababu hii, mfumo unatenganisha aina tatu za sampuli za anga:

  • Maeneo chanya ya hatari: Moshi mwepesi, moshi mzito na moto.
  • Maeneo yaliyopangwa ya vichanganyaji: Taa za barabarani, uangavu mkali unaoakisiwa na matawi ya miti yenye mwanga.
  • Mandharinyuma ya mazingira: Maeneo mengine yasiyofafanuliwa kama lengo au kichanganyaji maalum.

Kwa nini mwongozo wa taswira-lugha umetumiwa?

Mchoro 1 katika ukurasa wa 3 wa utafiti unaonyesha wingu la moshi wa mbali katika eneo la viwanda la usiku kama eneo chanya jekundu, na taa angavu ya barabarani kama eneo hasi la buluu. Eneo la moshi limehusishwa na dhana ya maandishi kama “moshi mweupe mwembamba”, na eneo la taa na dhana kama “taa ya barabarani ya rangi ya machungwa; si moto wala moshi”. Mchoro unaeleza wazo kwamba hata maeneo haya mawili yaonekane kufanana kwa mwangaza wa picha, yana tofauti ya maana.

Sifa za picha ni nyeti kwa mwanga, pembe ya kamera, kontrasti na kelele. Uwakilishi wa maandishi unaweza kusimba kwa uthabiti zaidi dhana za kiwango cha juu kama “moto”, “moshi”, “taa” au “uangavu unaoakisiwa”. Hata hivyo, modeli ya CLIP ya matumizi ya jumla inaweza isiwe imezoea moja kwa moja hali maalum za picha katika maeneo ya petrokemikali. Ili kupunguza pengo hili la kikoa, watafiti hutumia tokeni endelevu za prompt zinazojifunza badala ya sentensi zisizobadilika.

Usanifu wa jumla wa mwalimu–mwanafunzi

Mchoro 2 katika ukurasa wa 4 unaonyesha utendaji wa kiwango cha juu wa mbinu. Fremu za kamera ni ingizo la mafunzo kwa modeli yenye nguvu ya mwalimu na modeli nyepesi ya mwanafunzi. Modeli ya mwalimu hubadilisha mifumo ya moto, moshi na mwanga unaopotosha kuwa prototipu kupitia piramidi yake ya sifa na moduli ya semantiki. Prototipu hizi huongoza mafunzo ya modeli ya mwanafunzi.

Katika hatua ya deployment, modeli ya mwalimu, sehemu ya CLIP na benki ya prototipu huondolewa. Fremu za kamera hupitia tu backbone, neck na detection head ya mwanafunzi. Kwa hivyo mfumo wa udistilishaji huongeza gharama ya mafunzo lakini hauongezi modeli mpya ya taswira-lugha kwenye usanifu wa uwanjani.

Njia ya kina ya udistilishaji katika Mchoro 3

Mchoro 3 katika ukurasa wa 6 hugawanya mbinu nzima katika hatua zifuatazo:

  1. Visanduku vya utabiri vya kigunduzi cha mwalimu hubadilishwa kuwa P-map za lengo na kichanganyaji zinazotegemea darasa.
  2. Sifa za ndani katika piramidi ya sifa za mwalimu huonyeshwa kwenye nafasi ya semantiki ya CLIP yenye vipimo 512.
  3. Prototipu za maandishi zilizojifunzwa mapema hukokotoa ukaribu wa semantiki kwa dhana za lengo na kichanganyaji.
  4. Thamani hizi za ukaribu huimarisha au hukandamiza P-map zinazotegemea ugunduzi.
  5. Prototipu za lengo na kichanganyaji hutolewa kwa kutumia ramani zilizoboreshwa.
  6. Prototipu huhifadhiwa katika foleni tofauti kwa kila kiwango cha piramidi ya sifa.
  7. Tokeni chanya, za kichanganyaji na za mandharinyuma huchaguliwa kutoka sifa za mwanafunzi.
  8. Hasara ya MMCA hujaribu kusawazisha tokeni za mwanafunzi na prototipu za mwalimu katika nafasi ya pamoja.

P-map za awali zinaundwaje?

Ramani mbili za anga huundwa kwa kila kiwango cha piramidi ya sifa za modeli ya mwalimu:

\[ P_{\mathrm{target}}^{\ell}\in\mathbb{R}^{1\times H_\ell\times W_\ell} \]

\[ P_{\mathrm{confuse}}^{\ell}\in\mathbb{R}^{1\times H_\ell\times W_\ell} \]

\(\ell\) inaonyesha kiwango cha piramidi ya sifa; \(H_\ell\) na \(W_\ell\) zinaonyesha vipimo vya anga vya kiwango hicho. Utabiri wa mwalimu uliowekewa lebo ya moshi mwepesi, moshi mzito au moto huongezwa kwenye ramani ya lengo; utabiri uliowekewa lebo ya taa, uangavu unaoakisiwa au mti wenye mwanga huongezwa kwenye ramani ya kichanganyaji.

Seli ya katikati ya kisanduku cha utabiri hupata uzito kamili, na seli jirani hupata uzito wa sehemu. Baada ya utabiri wote kwenye picha kujumlishwa, ramani hugawanywa kwa thamani yake ya juu ili kuifanya seli kubwa zaidi kuwa 1.

Mbinu hii hupunguza tofauti ya skeli ya alama za uhakika kamili katika picha tofauti. Hata hivyo, hata katika picha ambayo utabiri wote una uhakika mdogo, jibu dhaifu lenye kiwango cha juu zaidi linaweza bado kusawazishwa hadi 1. Utafiti haujapima kwa jaribio tofauti la calibration ya uhakika kiwango ambacho hatua ya marekebisho ya semantiki hupunguza hatari hii.

Pre-alignment kwa tokeni endelevu za prompt

Tokeni nne za muktadha zinazojifunza hutumiwa kwa kila moja ya makundi ya lengo na kichanganyaji:

\[ Q_{\mathrm{tar}},Q_{\mathrm{conf}}\in\mathbb{R}^{N\times D_{\mathrm{word}}},\qquad N=4 \]

Embedding ya jina la kundi \(e_m\) huunganishwa na tokeni zinazofaa za muktadha ili kuunda mfuatano wa maandishi:

\[ X_m=[Q_{\mathrm{tar/conf}}\parallel e_m] \]

Mfuatano huu hupitishwa kwenye encoder ya maandishi ya CLIP yenye uzito uliogandishwa na kubadilishwa kuwa prototipu ya maandishi iliyosawazishwa:

\[ t_m=\mathrm{Norm}(G(X_m)) \]

Utafiti unasema kwamba CLIP ViT-B/16 ilitumika na kwamba nafasi ya pamoja ya semantiki ilikuwa na vipimo 512. Viwango vya piramidi ya sifa za mwalimu vyenye idadi tofauti za channels huhamishwa kwenye nafasi ileile ya vipimo 512 kwa MLP ya tabaka mbili:

\[ h^\ell(f)=W_2^\ell\,\mathrm{GeLU}(W_1^\ell f+b_1^\ell)+b_2^\ell \]

Sifa za mwalimu ndani ya visanduku vya lebo halisi hufanyiwa pooling kwa RoIAlign na kubadilishwa kuwa prototipu za kuona. Ulinganifu wa prototipu za kuona na za maandishi huwekwa sawa kwa hasara ya multimodal InfoNCE:

\[ \mathcal{L}_{\mathrm{pre}}= -\frac{1}{K}\sum_{k=1}^{K} \log \frac{ \sum_{m=1}^{M}y_{k,m}\exp(\langle v_k,t_m\rangle/\tau_{\mathrm{clip}}) }{ \sum_{j=1}^{M}\exp(\langle v_k,t_j\rangle/\tau_{\mathrm{clip}}) } \]

\(v_k\) inaonyesha prototipu ya kuona iliyotolewa kutoka kwa sifa za mwalimu; \(t_m\) prototipu ya maandishi iliyojifunza; \(y_{k,m}\) ulinganifu sahihi wa semantiki; na \(\tau_{\mathrm{clip}}\) kigezo cha joto.

Mchoro 4 katika ukurasa wa 8 unaonyesha mchakato wa pre-alignment wa matawi mawili kutoka visanduku vya lebo halisi kwenda sifa za FPN za mwalimu, RoIAlign, MLP ya tabaka mbili, prototipu za kuona na prompt za maandishi zinazojifunza. Backbone ya mwalimu na encoder ya maandishi ya CLIP hugandishwa, huku MLP ya projection na tokeni endelevu za prompt zikisasishwa.

Marekebisho ya semantiki ya P-map

Baada ya pre-alignment, tokeni za prompt zilizojifunza hugandishwa. Kila nafasi ya anga ya sifa za mwalimu huonyeshwa kwenye nafasi ya semantiki:

\[ z_{x,y}^{\ell}=\mathrm{Norm}\left(h^\ell(f_{x,y}^{\ell})\right) \]

Ukaribu wa sifa ya ndani kwa dhana ya lengo au dhana ya kichanganyaji hukokotolewa kwa tofauti ifuatayo:

\[ s^\ell(x,y)= \langle z_{x,y}^{\ell},t_{\mathrm{tar}}\rangle - \langle z_{x,y}^{\ell},t_{\mathrm{conf}}\rangle \]

Thamani chanya inaonyesha ukaribu na semantiki ya lengo, na thamani hasi ukaribu na semantiki ya kichanganyaji. Alama ya semantiki inapozidi kizingiti fulani \(\theta\), neno la marekebisho lililokatwa huundwa:

\[ \Delta^\ell(x,y)= \gamma\,\mathrm{clip}(s^\ell(x,y),-1,1) \mathbb{I}(|s^\ell(x,y)|\geq\theta) \]

P-map ya lengo husasishwa kama ifuatavyo:

\[ \widehat{P}_{\mathrm{target}}^\ell= \mathrm{Norm}_{\max} \left( \max(0,P_{\mathrm{target}}^\ell+\Delta^\ell) \right) \]

Maeneo yanayolingana kisemantiki na moto au moshi huimarishwa; maeneo yanayokaribiana na dhana za taa au uangavu unaoakisiwa hudhoofishwa. Maandishi yanaeleza kwamba marekebisho yanayofanana yanaweza kutumika kwenye ramani ya kichanganyaji, lakini hayatoi tofauti mlinganyo kamili wa kusasisha \(\widehat{P}_{\mathrm{confuse}}^\ell\) inayotumiwa katika sehemu inayofuata.

Benki ya prototipu inaundwaje?

Ramani ya lengo iliyoboreshwa hutumiwa kukokotoa ni channels zipi za sifa za mwalimu zina majibu makubwa zaidi katika maeneo ya hatari. Uzito wa channels husawazishwa kwa softmax. Katika kila kiwango cha piramidi ya sifa, maeneo ya ndani yenye majibu ya juu zaidi huchaguliwa na vekta za prototipu hutengenezwa kwa channel-weighted pooling.

Prototipu huhifadhiwa katika makundi mawili:

  • Prototipu za lengo: Sifa za mwalimu zenye majibu makubwa zinazohusiana na moto na moshi.
  • Prototipu za kichanganyaji: Sifa zinazohusiana na taa, uangavu unaoakisiwa, miundo angavu au hasi ngumu zinazofanana.

Foleni tofauti zenye uwezo maalum hutumiwa kwa kila kiwango cha sifa. Foleni inapojazwa, prototipu ya zamani zaidi huondolewa. Katika mpangilio wa chaguo-msingi, prototipu 32 huhifadhiwa kwa foleni ya lengo na ya kichanganyaji katika kila kiwango.

Iwapo foleni ziko tupu, vekta za nasibu zilizosawazishwa hurudishwa kama prototipu za muda. Ulinzi huu huruhusu programu kuendelea kufanya kazi; hata hivyo, haijaripotiwa mara ngapi prototipu za nasibu huingia kwenye mafunzo au ni kelele kiasi gani zinaongeza kwenye kitendaji cha hasara.

Uchaguzi wa tokeni za mwanafunzi

Nukta za anga katika piramidi ya sifa za mwanafunzi huchukuliwa sampuli kulingana na usambazaji mitatu:

\[ p^\ell_{\tau}(y,x)= \begin{cases} \dfrac{\widehat{P}^\ell_{\mathrm{target}}(y,x)} {\sum_{y',x'}\widehat{P}^\ell_{\mathrm{target}}(y',x')+\epsilon}, & \tau=\mathrm{pos}\\[8pt] \dfrac{\widehat{P}^\ell_{\mathrm{confuse}}(y,x)} {\sum_{y',x'}\widehat{P}^\ell_{\mathrm{confuse}}(y',x')+\epsilon}, & \tau=\mathrm{neg}\\[8pt] \dfrac{1-\widehat{P}^\ell_{\mathrm{target}}(y,x)} {\sum_{y',x'}(1-\widehat{P}^\ell_{\mathrm{target}}(y',x'))+\epsilon}, & \tau=\mathrm{neg\_bg} \end{cases} \]

Usambazaji chanya hulenga maeneo halisi ya hatari, usambazaji hasi hulenga vichanganyaji maalum, na usambazaji wa mandharinyuma hulenga maeneo mengine yenye uwezekano mdogo wa kuwa lengo. Kwa chaguo-msingi, tokeni 32 chanya na 64 hasi huchaguliwa kwa kila kiwango; %60 ya hasi hutoka kwenye ramani ya kichanganyaji.

Sifa iliyochaguliwa ya mwanafunzi huhamishwa kwenye nafasi ya pamoja ya vipimo 512 kwa kichwa cha mstari maalum kwa kiwango:

\[ z=\mathrm{Norm}(W_s^\ell h_{\ell,y,x}) \]

Mask-Guided Multi-Scale Contrastive Alignment

MMCA hukokotoa matriksi ya ufanano kati ya tokeni za mwanafunzi \(Z\) na prototipu za mwalimu \(P\):

\[ S=\frac{1}{\tau}ZP^\top \]

Kwa kutumia vekta \(c\) inayoashiria prototipu za kichanganyaji, bias huongezwa kwenye ufanano:

\[ \widetilde{S}=S+\mathbf{1}c^\top\log(\eta_{\mathrm{conf}}) \]

Thamani ya chaguo-msingi ya \(\eta_{\mathrm{conf}}\) ni 1,5. Maandishi yanaeleza kwamba operesheni hii hugeuza prototipu za kichanganyaji kuwa hasi ngumu zilizopangwa na humsukuma mwanafunzi mbali nazo. Hata hivyo, hakuna matriksi tofauti ya lebo za malengo iliyotolewa kwa tokeni chanya, za kichanganyaji na za mandharinyuma. Kuchagua prototipu yenye ufanano wa juu zaidi kama lengo la kila tokeni kunahitaji ufafanuzi wa wazi zaidi wa ni upande gani hasa tokeni hasi zinaoptimizwa kuelekea.

Hasara ya kila tokeni hukokotolewa kupitia prototipu iliyo karibu zaidi katika kiwango hicho hicho cha piramidi ya sifa:

\[ \ell_i= -\left(\widetilde{S}_{i,j_i^*}-m_i\right) + \log\sum_{j=1}^{N_p} \exp(\widetilde{S}_{ij}-m_i) \]

Uzito wa uhakika wa anga huchukuliwa kutoka P-map ya lengo kwa sampuli chanya, kutoka P-map ya kichanganyaji kwa sampuli za kichanganyaji, na kutoka ukamilishaji wa uwezekano wa lengo kwa mandharinyuma. Hasara ya jumla imefafanuliwa kama:

\[ \mathcal{L}_{\mathrm{MMCA}}= \frac{\sum_i w_i\ell_i}{\sum_i w_i+\epsilon} \]

Gradient hupitishwa kwa sifa za mwanafunzi na vichwa vya projection vya mwanafunzi pekee; vekta za mwalimu katika benki ya prototipu hutumiwa zikiwa zimegandishwa.

Seti ya data iliundwaje?

Seti mseto ya Industrial Fire&Smoke ya utafiti ina jumla ya picha 11.023 zilizo na lebo:

Chanzo cha dataIdadi ya pichaSifa ya chanzo
Picha binafsi za viwandani5.340Maeneo 12 ya visafishaji vya petrokemikali na maeneo ya matangi ya kemikali
Seti wazi ya data ya DFS5.683Picha za jumla za moto na moshi
Jumla11.023Seti mseto ya data ya viwandani na maeneo ya wazi

Picha binafsi zilikusanywa kwa kamera zisizohama za 1080p za umbali mrefu na fremu moja ilichukuliwa kila sekunde tano ili kupunguza marudio ya muda. Eneo la moshi unaoonekana au mwali lilipokuwa kubwa kuliko pikseli 5 × 5, liliwekewa lebo kwa bounding box inayobana kwa karibu.

Madarasa ya malengo ni moshi mwepesi, moshi mzito na moto. Madarasa ya vichanganyaji yanayotumiwa na mwalimu ni taa za barabarani, uangavu mkali unaoakisiwa na matawi ya miti yaliyoangazwa.

Sehemu ya dataIdadi ya pichaUwiano wa takriban
Mafunzo8.819%80
Uthibitishaji1.102%10
Jaribio1.102%10
Seti ndogo ya SmokeFire–Night625Fremu za 19.00–05.00 kutoka seti ya jaribio

Mchoro 5 katika ukurasa wa 11 unaonyesha mifano ya moshi wa chimney, nguzo ya moshi wa mbali, mwali wazi, floodlight, taa ya gari na uangavu unaoakisiwa, iliyopigwa mchana na usiku. Picha zinaonyesha kwamba seti ya data ina ukubwa tofauti wa malengo na hali tofauti za mwanga. Hata hivyo, idadi ya picha na visanduku kwa kila darasa, usambazaji kwa kila kamera, mgawanyo kwa msingi wa kituo na makubaliano kati ya wawekaji lebo hayajaripotiwa.

Tathmini ya PASCAL VOC

Ili kutathmini kama mbinu ni mahususi kwa seti ya data ya viwandani pekee, usanidi wa PASCAL VOC wenye takriban picha 5.000 za mafunzo na 5.000 za uthibitishaji ulitumika. Makala inaeleza kwamba ililenga kategoria zilizo karibu kimwonekano; hata hivyo, orodha kamili ya madarasa yaliyochaguliwa, mbinu ya sampling na jinsi ulinganishaji wa “person/rider” ulivyoundwa havijaelezwa.

Mbinu na Matokeo ya Utafiti

Mpangilio wa modeli na mafunzo

Kipengele cha mbinuMpangilio uliotumiwa katika utafiti
Mwalimu wa chaguo-msingiYOLO26-large
Mwanafunzi wa chaguo-msingiYOLO26-small
Wanafunzi mbadalaYOLOv10-small, YOLOv8-small na RetinaNet-MNv2
Ukubwa wa picha640 × 640 pikseli
Viwango vya udistilishajiFPN P3–P5
Encoder ya taswira-lughaCLIP ViT-B/16 iliyogandishwa
Nafasi ya semantikiVipimo 512
Tokeni endelevu za prompt4
Uwezo wa prototipu32 kwa kila kiwango na kila foleni
Tokeni chanya za mwanafunzi32 kwa kila kiwango
Tokeni hasi za mwanafunzi64 kwa kila kiwango
Uwiano wa sampuli za kichanganyaji0,6
Bias ya kichanganyaji\(\eta_{\mathrm{conf}}=1,5\)
UboreshajiSGD; momentum 0,9; weight decay \(5\times10^{-4}\)
Kasi ya mwanzo ya kujifunza\(1\times10^{-3}\), cosine decay
Kipindi cha warm-up5 epoch
Muda wa mafunzo200 epoch
Ukubwa wa batch8
AugmentationHorizontal flip, mabadiliko ya HSV, Mosaic na MixUp
Vifaa vya mafunzoGPU mbili za RTX A6000 na automatic mixed precision

Matokeo ya PASCAL VOC

MbinumAP@0,5mAP@[0,5:0,95]VigezoUcheleweshaji
Mwalimu YOLO26-large83,658,9milioni 31,86,4 ms
Mwanafunzi YOLO26-small75,149,0milioni 8,42,3 ms
FGD78,051,6milioni 8,42,4 ms
PKD78,452,0milioni 8,42,4 ms
GID78,251,9milioni 8,42,5 ms
CrossKD78,752,4milioni 8,42,5 ms
UET79,152,8milioni 8,42,5 ms
Mbinu inayopendekezwa80,454,2milioni 8,42,5 ms

Mbinu inayopendekezwa iliongeza mAP@0,5 kwa pointi 5,3 na mAP@[0,5:0,95] yenye masharti magumu zaidi kwa pointi 5,2 ikilinganishwa na mwanafunzi ghafi. Matokeo haya yanaunga mkono kwamba mbinu inaweza kuwa na manufaa si katika kategoria za moto na moshi pekee bali pia katika jukumu la jumla la ugunduzi wa vitu. Hata hivyo, kwa kuwa ufafanuzi kamili wa seti ndogo ya VOC haujatolewa, ni vigumu kurudia jaribio kwa usahihi uleule.

Matokeo makuu ya Industrial Fire&Smoke

MbinuAP ya moshi mwepesiAP ya moshi mzitoAP ya motoWastani wa APKengele ya uongoVigezoUcheleweshaji
Mwalimu YOLO26-large66,868,565,767,0%2,9milioni 31,86,4 ms
Mwanafunzi YOLO26-small51,253,849,651,5%14,7milioni 8,42,3 ms
FGD56,758,455,256,8%8,8milioni 8,42,4 ms
PKD57,459,155,957,5%8,0milioni 8,42,4 ms
GID57,859,556,357,9%7,7milioni 8,42,5 ms
CrossKD58,160,256,758,3%7,4milioni 8,42,5 ms
UET58,760,957,459,0%6,8milioni 8,42,5 ms
TCSN-YOLO62,463,657,561,2%8,6milioni 8,93,1 ms
Mbinu inayopendekezwa63,865,162,463,8%3,4milioni 8,42,5 ms

Mbinu inayopendekezwa iliongeza wastani wa AP kwa pointi 12,3 na kupunguza kiwango cha kengele za uongo kwa pointi za asilimia 11,3 ikilinganishwa na mwanafunzi ghafi wa YOLO26-small. Inakaribia wastani wa AP wa mwalimu wa 67,0 huku ikipunguza idadi ya vigezo kutoka milioni 31,8 hadi milioni 8,4.

Ingawa AP ya moto kwenye mstari wa SSmokeDet imeonyeshwa kwa dash, wastani wa AP wa 61,2 umetolewa. Wastani huu hauwezi kukokotolewa tena kutokana na thamani za moshi mwepesi na moshi mzito zilizotolewa. Kwa hiyo, mstari huu unapaswa kusomwa kwa tahadhari katika upangaji wa mbinu.

Ujumla katika familia tofauti za vigunduzi

Modeli ya mwanafunziWastani ghafi wa APWastani wa AP baada ya udistilishajiKengele ghafi ya uongoKengele ya uongo baada ya udistilishaji
YOLOv10-small48,961,5%16,4%3,8
YOLOv8-small47,660,7%17,2%4,2
YOLO26-small51,563,8%14,7%3,4
RetinaNet-MNv246,158,4%18,0%5,6

Katika usanifu wote wanne wa mwanafunzi, wastani wa AP uliongezeka kwa takriban pointi 12–13 na kiwango cha kengele za uongo kilipungua kwa kiasi kikubwa. Matokeo haya yanaunga mkono kwamba mbinu haitegemei toleo maalum tu la YOLO. Hata hivyo, matokeo ya kila usanifu yalipatikana kwenye seti moja ya data na kwenye kifaa kimoja cha kuchelewesha ambacho hakijaelezwa.

Matokeo katika matukio ya usiku

MbinuAP ya moshi mwepesiAP ya motoAP ya moshi mzitoWastani wa APKengele ya uongoUcheleweshaji
Mwalimu YOLO26-large62,464,761,963,0%4,16,4 ms
Mwanafunzi YOLO26-small47,349,247,047,8%22,62,3 ms
UET55,056,254,555,2%9,42,5 ms
TCSN-YOLO57,255,056,656,9%8,23,1 ms
Mbinu inayopendekezwa59,460,858,759,6%4,62,5 ms

Katika seti ndogo ya usiku, wastani wa AP uliongezeka kwa pointi 11,8 na kiwango cha kengele za uongo kilipungua kwa pointi za asilimia 18. Mchoro 7 katika ukurasa wa 15 unaonyesha kwamba modeli ya msingi huunda activation ya uongo katika eneo la taa angavu, huku mbinu inayopendekezwa ikikandamiza eneo hilo na kuelekeza umakini kwenye lengo halisi.

Ramani za activation

Mchoro 6 katika ukurasa wa 14 unalinganisha picha ya jaribio ya moshi mwepesi, moto na moshi mzito na ramani za joto za FGD, PKD, GID, CrossKD na mbinu inayopendekezwa. Katika mbinu inayopendekezwa, maeneo yenye activation ya moto yanaonekana membamba na yenye msongamano zaidi juu ya lengo, huku miundo angavu ya jirani ikipata mwitikio mdogo.

Picha hizi zinaendana na utaratibu wa kazi wa mbinu; lakini hazionyeshi kama mifano iliyochaguliwa inawakilisha seti nzima ya jaribio. Matokeo ya kiasi ya ramani za joto yameungwa mkono na uchambuzi wa DSR uliofanywa kwenye idadi ndogo ya maeneo yaliyoelezewa.

Uchambuzi wa kiasi wa uboreshaji wa semantiki

Katika maeneo 80 yaliyoelezewa ya kuvutia kutoka seti ndogo ya SmokeFire–Night, wastani wa activation wa P-map kabla na baada ya uboreshaji ulipimwa:

\[ V_{\mathrm{avg}}(R)= \frac{1}{N}\sum_{(x,y)\in R}P(x,y) \]

Uwiano wa Kukandamiza Vichanganyaji:

\[ \mathrm{DSR}(R)= \frac{V_{\mathrm{avg}}^{\mathrm{refined}}(R)} {V_{\mathrm{avg}}^{\mathrm{orig}}(R)} \]

EneoWastani wa mwanzoWastani ulioboreshwaDSR
Moshi halisi0,8820,8650,98 — umehifadhiwa
Moto halisi0,9150,9080,99 — umehifadhiwa
Taa za barabarani0,7640,1420,18 — zimekandamizwa
Uangavu unaoakisiwa0,6280,1150,18 — umekandamizwa

Mchoro 8 katika ukurasa wa 16 unaonyesha kwamba kabla ya pre-alignment, prototipu za lengo na kichanganyaji zilichanganyika katika nafasi ya pamoja, huku baada yake makundi mawili yakitengana. Katika mifano ya P-map ya mchoro huohuo, moshi halisi na mwali huhifadhiwa huku taa na uangavu unaoakisiwa na maji vikidhoofishwa.

Uchambuzi huu unaunga mkono kwamba utaratibu unafanya kazi kama ulivyokusudiwa. Hata hivyo, haijaelezwa maeneo 80 yalichaguliwa kutoka picha zipi na kwa mbinu gani ya sampling, ikiwa wakadiriaji walikuwa blinded au la, na vipindi vya kutokuwa na uhakika.

Matokeo ya kuondoa vipengele

Aina ya modeliP-map ya semantikiPre-alignmentPrototipu ya kichanganyajiWastani wa AP
Mwanafunzi bila udistilishajiHapanaHapanaHapana51,5
Udistilishaji wa prototipu bila semantikiHapanaHapanaNdiyo59,8
P-map ya semantiki bila pre-alignmentNdiyoHapanaNdiyo61,6
Mbinu ya semantiki bila prototipu ya kichanganyajiNdiyoNdiyoHapana61,9
Mbinu kamiliNdiyoNdiyoNdiyo63,8

Udistilishaji wa prototipu pekee uliongeza pointi 8,3 kwa mwanafunzi. Uboreshaji wa P-map kwa semantiki ya maandishi yasiyobadilika ulipeleka matokeo hadi 61,6, na matumizi ya pamoja ya pre-alignment ya prompt endelevu pamoja na prototipu za kichanganyaji yalipeleka hadi 63,8. Matokeo haya yanaonyesha kwamba ongezeko la utendaji halitokani na kipengele kimoja, bali kutoka muunganiko wa uhamishaji wa prototipu uliopangwa na utenganishaji wa semantiki.

Uchambuzi wa uwiano na bias wa MMCA

Uwiano wa sampuli za kichanganyaji\(\eta_{\mathrm{conf}}\)Wastani wa AP
0,31,562,4
0,61,563,8
0,91,563,0
0,61,062,7
0,62,562,2

Kutumia sampuli chache za kichanganyaji kulidhoofisha ujifunzaji wa hasi ngumu, huku kuongeza uwiano hadi 0,9 kukipunguza mchango wa prototipu za lengo. Vivyo hivyo, kuongeza bias ya kichanganyaji kupita kiasi kulipunguza utendaji. Uwiano bora ulioripotiwa ni uwiano wa sampuli 0,6 na kigezo cha bias 1,5.

Uwezo wa prototipu, tokeni na prompt

KigezoMpangilioWastani wa AP
Prototipu kwa kila kiwango1662,3
Prototipu kwa kila kiwango32 — chaguo-msingi63,8
Prototipu kwa kila kiwango6464,0
Tokeni chanya1663,0
Tokeni chanya32 — chaguo-msingi63,8
Tokeni chanya6463,9
Tokeni endelevu za prompt263,1
Tokeni endelevu za prompt4 — chaguo-msingi63,8
Tokeni endelevu za prompt863,7

Prototipu 64 zilizalisha wastani wa juu zaidi wa AP wa 64,0; watafiti walichagua prototipu 32 kama chaguo-msingi kwa sababu ya usawa wa utendaji na uwezo. Hata hivyo, tofauti ya kumbukumbu, muda wa mafunzo au nishati kati ya prototipu 32 na 64 haijaripotiwa.

Nguvu za utafiti

  • Kutenganisha wazi malengo halisi na hasi ngumu zinazotokana na mwanga katika ugunduzi wa moto wa viwandani.
  • Kuchuja kwanza kisemantiki majibu ya juu lakini yasiyo sahihi ya mwalimu badala ya kuyahamisha moja kwa moja kwa mwanafunzi.
  • Kutumia modeli ya taswira-lugha wakati wa mafunzo pekee na kuweka modeli ya uwanjani kuwa nyepesi.
  • Kuhifadhi prototipu za malengo na vichanganyaji tofauti kulingana na viwango vya piramidi ya sifa.
  • Kutoa tathmini tofauti kwenye PASCAL VOC, jaribio kuu la Fire&Smoke na seti ndogo ya usiku.
  • Kuonyesha mwelekeo uleule wa utendaji katika familia za YOLOv8, YOLOv10, YOLO26 na RetinaNet.
  • Kuripoti kiwango cha kengele za uongo pamoja na vipimo vya usahihi.
  • Kufanya uchambuzi wa kuondoa vipengele, uwezo wa prototipu, uwiano wa sampuli na urefu wa prompt.
  • Kutangaza wazi vizuizi vya kushiriki picha binafsi na matumizi ya akili bandia zalishi.

Mapungufu makuu

  • Utafiti haujapitiwa na wenzao.
  • Kutokushirikiwa kwa picha binafsi za viwandani kunazuia urudufu kamili.
  • Mgawanyo wa data kwa msingi wa kituo, kamera na mfuatano wa muda haujaelezwa.
  • Idadi ya picha na visanduku kwa kila darasa haijatolewa.
  • Idadi ya wawekaji lebo, udhibiti wa ubora na makubaliano kati ya waangalizi hayajaripotiwa.
  • Kizingiti cha IoU cha thamani za AP za Fire&Smoke hakiko wazi.
  • Fomula na kitengo cha tathmini cha kiwango cha kengele za uongo hakijatajwa.
  • Matokeo yametolewa kama thamani za kuendesha mara moja; mkengeuko sanifu na kipindi cha kujiamini havijatolewa.
  • Kwa jaribio la ucheleweshaji, vifaa, batch, precision, mazingira ya programu na itifaki ya warm-up havijatajwa.
  • Hakuna jaribio halisi lililofanywa kwenye Jetson, FPGA, NPU au kompyuta ya viwandani ya edge.
  • Uendelevu wa video, kuunganisha kengele kwa muda na utendaji katika kiwango cha tukio havijachunguzwa.
  • Vichanganyaji vya ziada vya viwandani kama ukungu, mvuke wa maji, mwanga wa kulehemu, uzalishaji wa chimney na flare stack havijatathminiwa kama madarasa tofauti.
  • Ulinganishaji kamili wa mafunzo kati ya muundo wa matokeo wa madarasa sita wa mwalimu na matokeo ya madarasa matatu ya usalama ya mwanafunzi haujaelezwa kikamilifu.
  • Mlinganyo wa kusasisha kisemantiki P-map ya kichanganyaji haupo.
  • Haiko wazi vya kutosha kihisabati ni prototipu zipi MMCA huzivuta karibu au kuzisukuma mbali kwa sampuli hasi na za mandharinyuma.
  • Athari ya vekta za nasibu zinazotumika foleni ya prototipu inapokuwa tupu haijapimwa.
  • Kusawazisha P-map kwa thamani ya juu ya kila picha huondoa uhakika kamili wa mwalimu.
  • Wastani wa AP uliotolewa kwa SSmokeDet hauwezi kukokotolewa upya kutokana na thamani za madarasa kwenye jedwali.
  • Makala ina maandishi ya template na alama za marejeo ambazo hazijakamilika.

Matokeo yanayoungwa mkono na utafiti

  • Katika majaribio yaliyodhibitiwa, udistilishaji wa prototipu unaoongozwa na semantiki ulizalisha AP ya juu kuliko kigunduzi chepesi ghafi.
  • Katika seti ndogo ya usiku ya utafiti, activation zinazotokana na taa na uangavu unaoakisiwa zilipunguzwa kwa kiasi kikubwa.
  • Kuunda modeli tofauti kwa prototipu za malengo na vichanganyaji kulitoa wastani wa AP wa juu kuliko toleo lisilo na prototipu za kichanganyaji.
  • Tokeni endelevu za prompt zilitoa matokeo bora kuliko prompt za jumla zisizobadilika za CLIP.
  • Mbinu ilionyesha mwelekeo unaofanana wa utendaji katika familia tofauti za wanafunzi wa YOLO na RetinaNet.
  • Kwa kuwa moduli za udistilishaji zinaweza kuondolewa wakati wa inference, idadi ya vigezo vya mwanafunzi ilibaki milioni 8,4.

Matokeo ambayo utafiti haujathibitisha

  • Haijaonyeshwa kwamba mfumo hugundua moto halisi mapema kuliko mifumo ya sasa ya usalama.
  • Uwezo wa mbinu kujumlisha kwa mitambo yote ya petrokemikali, hali zote za hewa na aina zote za kamera haujathibitishwa.
  • Maana ya kiutendaji ya kupungua kwa kengele za uongo kwa saa, zamu au kamera haijaonyeshwa.
  • Haijathibitishwa kwamba modeli hufanya kazi kwa thamani za millisecond zilizoripotiwa kwenye kifaa halisi kilichopachikwa.
  • Utendaji wa usalama uliounganishwa na vihisi vya joto, infrared, gesi au moshi wa pointi haujapimwa.
  • Haijaonyeshwa kwamba matokeo ya seti binafsi ya data yamerudiwa na kundi huru la watafiti.
  • Haijaonyeshwa kwamba modeli hufanya kipimo cha kuaminika cha kimwili cha aina ya moshi, ukubwa wa moto au kiwango cha hatari.
  • Tathmini ya picha moja haithibitishi tabia thabiti ya kengele kwenye video endelevu.
  • Matokeo ya modeli hayajathibitishwa kama kengele ya moto iliyoidhinishwa au kama uamuzi wa kuzima kiotomatiki unaohusiana na usalama.

Maelezo ya Chanzo na Mbinu

Jina kamili la asili la utafiti: Semantic-Guided Prototype Distillation with Vision-Language Refinement for Long-Range Industrial Fire and Smoke Detection

Waandishi: Yang Zhang; Yijun Wan; Yuan Xu; Mingqing Zhang; Yanlin He; Wei Ke; Hao Sheng.

Mpangilio wa waandishi: Yang Zhang ni wa kwanza, Yijun Wan wa pili, Yuan Xu wa tatu, Mingqing Zhang wa nne, Yanlin He wa tano, Wei Ke wa sita na Hao Sheng wa saba.

Mwandishi mwenza wa kwanza: Hakuna tamko la mchango sawa au uandishi mwenza wa kwanza katika toleo lililochunguzwa.

Mwandishi anayewajibika: Rekodi rasmi ya SSRN inaonyesha Yang Zhang kama mwandishi wa mawasiliano. Kwenye ukurasa wa waandishi wa makala iliyochunguzwa, hakuna nyota au tanbihi tofauti inayomtaja mwandishi anayewajibika.

Waandishi na taasisi:

  • Yang Zhang — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, China.
  • Yijun Wan — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, China.
  • Yuan Xu — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, China.
  • Mingqing Zhang — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, China.
  • Yanlin He — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, China.
  • Wei Ke — Macao Polytechnic University, Macao, China.
  • Hao Sheng — School of Computer Science and Engineering, Beihang University, Beijing, China.

Anwani ya mawasiliano: Toleo lililochunguzwa linatoa anwani yang_zh@mail.buct.edu.cn kwa Yang Zhang.

ORCID: Taarifa za ORCID hazipo katika toleo lililochunguzwa.

DOI:10.2139/ssrn.7192544

Jarida: Hakuna jina la jarida lililopitiwa na wenzao katika toleo lililochunguzwa.

Mchapishaji: Hakuna taarifa ya mwisho ya mchapishaji iliyothibitishwa. SSRN ni jukwaa la kurekodi na kusambaza preprint ya utafiti.

Jukwaa la uchapishaji: SSRN.

Tarehe ya rekodi ya SSRN: 27 Julai 2026.

Mwaka wa uchapishaji: 2026.

Aina ya chanzo: Preprint ya utafiti wa majaribio wa akili bandia unaojumuisha udistilishaji wa maarifa, pre-alignment ya taswira-lugha, seti binafsi na wazi za picha na ulinganisho wa vigunduzi mbalimbali vya vitu.

Hali ya mapitio: Utafiti haujapitiwa na wenzao. Hali hii imeelezwa wazi kwenye ukurasa wa kichwa na katika kurasa zote za makala.

Chanzo rasmi:Rekodi rasmi ya utafiti ya SSRN.

Msimbo wa chanzo: Watafiti wanaeleza kwamba utekelezaji umeshirikiwa katika hazina ya utafiti isiyomtambulisha mwandishi. Toleo la faili zote na majaribio katika hazina halikuendeshwa na kuthibitishwa tofauti katika tathmini hii.

Upatikanaji wa data: Seti wazi ya DFS imeelezwa kuwa inapatikana kutoka chanzo chake cha asili. Picha binafsi zilizopatikana kutoka visafishaji vya petrokemikali na maeneo ya matangi haziko wazi kwa umma kwa sababu za usalama wa viwandani, faragha na usiri. Taarifa za ziada zinaweza kuombwa kutoka kwa mwandishi anayewajibika chini ya masharti ya matumizi ya data.

Ufadhili: Hakuna tamko tofauti la ufadhili katika toleo lililochunguzwa.

Mgongano wa maslahi: Waandishi wametangaza kwamba hakuna maslahi ya kifedha yanayojulikana au mahusiano binafsi ambayo yanaweza kuathiri utafiti.

Maadili na faragha: Hakuna jaribio la binadamu au wanyama lililoripotiwa. Imeelezwa kwamba picha binafsi za viwandani hazishirikiwi kwa sababu za faragha na usalama; njia ya kutokutambulisha data binafsi inayoweza kuwepo kwenye picha za kamera au mbinu ya mapitio ya kimaadili haijaelezwa kwa kina.

Tamko la akili bandia zalishi: Watafiti wameeleza kwamba walitumia ChatGPT kwa kusahihisha lugha, mpangilio wa makala, uumbizaji wa LaTeX na uboreshaji wa kiuhariri; hawakuitumia kuzalisha data za majaribio, kufunza modeli au kutoa hitimisho la kisayansi. Waandishi wameeleza kwamba walipitia maudhui yote na wanabeba wajibu wa mwisho.

Maelezo haya ya Kiswahili yameandaliwa baada ya kuchunguza taarifa za kichwa na waandishi, maandishi makuu, milinganyo 13, majedwali manane, michoro minane, mifano ya seti ya data, ramani za activation, majaribio ya kuondoa vipengele, matokeo, matamko ya upatikanaji wa data na marejeo katika faili ya kurasa 20 iliyopakiwa. Hakuna matokeo mapya ya majaribio kutoka nje ya utafiti yaliyoingizwa kwenye maudhui ya kisayansi. Vyanzo vya nje vilitumika tu kwa uthibitishaji wa kibibliografia wa kichwa, mpangilio wa waandishi, mwandishi wa mawasiliano, DOI, tarehe ya rekodi na taarifa za taasisi.

Matokeo ya utafiti yanaunga mkono kwamba udistilishaji wa prototipu unaoongozwa na semantiki unaweza kuboresha ugunduzi wa malengo madogo na yenye kontrasti ndogo ya moto na moshi katika seti ya data iliyochunguzwa na kupunguza majibu ya uongo yanayotokana na mwanga. Hata hivyo, kwa sababu data binafsi hazishirikiwi, kuna mapungufu ya kuripoti katika vipimo vya kengele za uongo na AP, kutokuwa na uhakika wa kitakwimu hakujatolewa na hakuna jaribio la uwanjani kwenye kifaa halisi cha edge, mbinu bado haipaswi kutathminiwa kama mfumo wa tahadhari ya mapema wa viwandani uliothibitishwa kwa kujitegemea.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy