Utafiti wa kitaaluma, lugha inayoeleweka

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Septemba 2026, Jumapili
VERİANLAUchapishaji huru wa sayansi
Fungua au funga menyu
...
Home / Sayansi Tumizi / Sayansi ya Kompyuta / Uchambuzi na Uwekaji Alama Kiotomatiki wa Vipengele vya Kianatomia katika Michoro ya Jaribio la Draw-a-Person kwa Utambuzi na Uainishaji wa Lebo Nyingi Unaotegemea ResNet
Sayansi ya Kompyuta

Uchambuzi na Uwekaji Alama Kiotomatiki wa Vipengele vya Kianatomia katika Michoro ya Jaribio la Draw-a-Person kwa Utambuzi na Uainishaji wa Lebo Nyingi Unaotegemea ResNet

Utafiti huu unapendekeza mfumo mseto unaochanganya ujifunzaji wa kina na kanuni wazi za kijiometri ili kuchanganua kiotomatiki michoro ya umbo la binadamu inayotengenezwa na watoto katika jaribio la Draw-a-Person (DAP; Chora Mtu).

19/08/2026  Veri Anla Imetazamwa mara 59
Uchambuzi na Uwekaji Alama Kiotomatiki wa Vipengele vya Kianatomia katika Michoro ya Jaribio la Draw-a-Person kwa Utambuzi na Uainishaji wa Lebo Nyingi Unaotegemea ResNet

Utafiti huu unapendekeza mfumo mseto unaochanganya ujifunzaji wa kina na kanuni wazi za kijiometri ili kuchanganua kiotomatiki michoro ya umbo la binadamu inayotengenezwa na watoto katika jaribio la Draw-a-Person (DAP; Chora Mtu). Katika usanifu mkuu, modeli ya ResNet-50 iliyofunzwa awali kwenye ImageNet hutabiri vipengele 10 vya kuona vya kianatomia katika michoro: kichwa, macho, nywele, mikono, miguu, mdomo, pua, masikio, shingo na kiwiliwili. Vipengele sita vya kijiometri/heuristic vinavyotathmini uwiano wa kiwiliwili, kiashirio cha mabega, uwakilishi wa viungo pande mbili, muunganisho wa kiungo–kiwiliwili, eneo sahihi la muunganisho na mwendelezo wa shingo huongezwa, na hivyo kutengeneza jumla ya vipengele 16 vya binary.

Jumla ya michoro 948 ya mkono ilitumika katika utafiti. Kulingana na maelezo ya kina ya mgawanyo wa data, picha 663 zilitengwa kwa mafunzo, picha 142 kwa validation na picha 143 kwa jaribio huru. Accuracy iliyoripotiwa katika five-fold cross-validation ilitofautiana kati ya %90,05 na %91,64, ikiwa na wastani wa %91,01. Hata hivyo, utendaji ulitofautiana sana kutoka kipengele kimoja hadi kingine: kwa vipengele vinavyoonekana wazi kama kichwa, macho, mikono, miguu, mdomo na kiwiliwili, thamani za F1 zilifikia takriban 0,98–1,00, ilhali maelezo madogo zaidi au yanayochorwa kwa namna tofauti kama masikio na shingo yalikuwa magumu zaidi.

Katika test set huru ya michoro 143, correlation kati ya mfumo wa kiotomatiki na jumla ya alama za DAP zilizotolewa na binadamu iliripotiwa kuwa r=0,93 (p<0,001), na katika takriban %87 ya michoro tofauti kati ya alama ya kiotomatiki na alama ya rejea ilibaki ndani ya ±1 pointi. Hata hivyo, matokeo haya hayamaanishi kwamba mfumo unaweza kufanya utambuzi wa kisaikolojia au kuchukua nafasi ya tathmini ya mtaalamu. Utafiti ulitathmini tu utambuzi wa kiotomatiki wa vipengele 16 maalumu vya mchoro na kuunda alama rahisi ya jumla kutoka navyo. Aidha, baadhi ya kutokulingana ndani ya chanzo kuhusu mgawanyo wa data, ukubwa wa output na jedwali za utendaji kunahitaji matokeo yatafsiriwe kwa tahadhari.

Kipengele kikuuMuundo ulioripotiwa katika utafiti wa chanzoKikomo cha tafsiri
Dataset yoteMichoro 948 ya watotoNamba 948 si test set huru; katika mbinu ya kina ni dataset yote.
Mgawanyo wa kina wa data663 mafunzo + 142 validation + 143 testHailingani na kauli ya “5-fold kwa picha 948” katika sehemu nyingine ya makala.
Kipengele cha msingi wa CNN10Kulingana na maelezo ya usanifu mkuu, hivi ni outputs za ResNet.
Kipengele cha kijiometri/heuristic6Hutengenezwa kwa kanuni kutoka jiometri ya bounding-box.
Jumla ya vipengele16Alama kati ya 0–16 hutengenezwa kwa jumla rahisi.
Wastani wa accuracy wa five-fold CV%91,01Kwa sababu data ni multi-label na imbalanced, accuracy peke yake si kipimo cha kutosha cha utendaji.
Wastani wa F1 wa mfumo wa mwisho Jedwali 80,8996Utendaji hutofautiana sana kati ya vipengele.
Correlation ya alama otomatiki–rejear=0,93; p<0,001Correlation si clinical equivalence wala usahihi wa utambuzi wa kisaikolojia.

Utafiti unajaribu kutatua tatizo gani?

Jaribio la Draw-a-Person hutegemea kupewa alama kwa vipengele maalumu vya kimuundo na kianatomia kutoka katika mchoro wa umbo la binadamu. Hoja ya kuanzia ya utafiti wa chanzo ni kwamba kukagua vipengele hivi kwa mkono huchukua muda na tofauti za tafsiri zinaweza kujitokeza kati ya tathmini.

Badala ya kuliacha tatizo lote kwa modeli ya AI ya “black box”, watafiti waliunganisha mbinu mbili tofauti. Miundo ya kianatomia inayopaswa kuonekana moja kwa moja kwenye picha hutathminiwa na CNN inayotegemea ResNet-50, huku mahusiano ya nafasi na kijiometri kati ya sehemu yakihesabiwa kwa kanuni wazi.

Kwa hiyo mfumo haujaribu kujibu tu swali “je, kuna mguu katika mchoro huu?”, bali pia maswali yaliyopangwa zaidi, kwa mfano kama viungo vimeunganishwa na kiwiliwili au kama urefu wa kiwiliwili ni mkubwa kuliko upana wake.

Vipengele 10 vya CNN ni vipi?

Sehemu ya kuona inayotegemea ResNet hutabiri kama vipengele kumi vifuatavyo vya kianatomia vipo au havipo katika mchoro:

  • masikio,
  • macho,
  • nywele,
  • mikono,
  • kichwa,
  • miguu,
  • mdomo,
  • shingo,
  • pua,
  • kiwiliwili.

Kila kipengele kinaweza kupewa lebo ya ipo/haipo bila kutegemea vingine. Kwa hiyo tatizo si classical single-class image classification, bali ni tatizo la multi-label classification.

Kanuni sita za kijiometri zinatathmini nini?

Vipengele sita vinavyoongezwa kando ya CNN huhesabiwa kutokana na coordinates za sehemu zilizochorwa na mahusiano ya bounding-box:

Kipengele cha kijiometriKanuni kuu iliyotumiwa katika chanzo
Urefu wa kiwiliwili kuwa mkubwa kuliko upanaNi positive ikiwa urefu wa bounding-box ya kiwiliwili ni mkubwa kuliko upana wake.
Mabega kuonyeshwaNi positive ikiwa upana wa kiwiliwili ni zaidi ya mara 1,2 ya upana wa shingo.
Uwakilishi wa viungo pande mbiliNafasi za bounding-box za mkono/mguu pande mbili za mstari wa kati wa kiwiliwili hutathminiwa.
Muunganisho wa kiungo–kiwiliwiliOverlap kati ya bounding box za kiungo na kiwiliwili hukaguliwa kulingana na threshold ya IoU.
Maeneo sahihi ya kuunganisha viungoKuunganishwa kwa mikono katika sehemu ya juu na miguu katika sehemu ya chini ya kiwiliwili hutathminiwa kwa thresholds za nafasi.
Mwendelezo wa contour ya shingoSharti la ±2 pixels hutumiwa kati ya ukingo wa chini wa box ya shingo na ukingo wa juu wa kiwiliwili.

Utafiti wa chanzo unasema thresholds za kijiometri zilirekebishwa kwa grid search kwenye validation data. Threshold ya IoU iliyochaguliwa kwa muunganisho wa kiungo–kiwiliwili ni 0,01; uwiano wa eneo la muunganisho wa juu ni 0,3 na uwiano wa eneo la chini ni 0,5.

Verianla Live: Jinsi mchoro mmoja unavyogeuka kuwa alama ya DAP ya kiotomatiki

Mtiririko huu unafupisha usanifu mseto ulioelezwa katika Kielelezo 1 cha utafiti wa chanzo.

HatuaMchakato katika utafiti wa chanzo
1. InputMchoro wa umbo la binadamu wa DAP uliotengenezwa na mtoto huingizwa kwenye mfumo.
2. Image preprocessingPicha hubadilishwa kuwa RGB na kupimwa upya hadi 224 × 224 pixels.
3. ResNet-50 feature extractionBackbone iliyofunzwa awali kwenye ImageNet na kufungwa hutengeneza visual feature vector yenye ukubwa wa 2048.
4. CNN anatomical predictionPredictions 10 hutengenezwa kwa kichwa, macho, nywele, mikono, miguu, mdomo, pua, masikio, shingo na kiwiliwili.
5. ThresholdingSigmoid probabilities hubadilishwa kuwa binary ipo/haipo outputs kwa thresholds zilizochaguliwa.
6. Geometric analysisVipengele sita vya structural/heuristic huhesabiwa kutoka mahusiano ya bounding-box.
7. CombiningVipengele 10 vya CNN na vipengele 6 vya kijiometri huunganishwa katika feature vector ya vipengele 16.
8. ScoringVipengele positive vya binary hujumlishwa ili kutengeneza alama ya DAP ya kiotomatiki kati ya 0–16.
 

Mtiririko unaeleza usanifu wa utafiti; haumaanishi kwamba alama 16 peke yake zinatosha kwa utambuzi wa kisaikolojia au uamuzi wa kliniki.

“Umri” katika dataset unamaanisha nini?

Katika dataset, michoro 948 imegawanywa katika makundi manane na makundi hayo yamepewa lebo kutoka 4 hadi 11. Hata hivyo, utafiti wa chanzo unaeleza wazi kwamba haya ni mental-age groups yaliyowekwa kwa tathmini ya kitaalamu bila kutegemea umri halisi wa wanafunzi.

Tofauti hii ni muhimu hasa wakati wa kutafsiri grafu za F1 kulingana na umri ndani ya utafiti. Kwa mfano, kuongezeka kwa F1 ya utambuzi wa mdomo kutoka 0,30 katika kundi 4 hadi 0,95 katika kundi 11 si matokeo ya longitudinal developmental study inayofuatilia watoto wale wale wanapokua. Hizi ni performance za modeli kwenye makundi ya michoro yaliyowekwa mapema katika mental-age categories tofauti.

Ni vipengele gani vilikuwa rahisi na vipi vigumu?

Katika five-fold cross-validation, F1 scores za juu zilipatikana kwa vipengele vinavyoonekana wazi kama kichwa, mkono, mguu, macho, mdomo na kiwiliwili. Katika Jedwali 5 la chanzo, wastani wa F1 kwa macho, mkono, kichwa, mguu na kiwiliwili uliripotiwa kuwa takriban 0,99; mdomo 0,98.

Kinyume chake, wastani wa F1 kwa pua ni 0,84, kwa nywele 0,87 na kwa shingo 0,75. Kushindwa kwa wazi zaidi ni masikio: Jedwali 5 la chanzo linatoa wastani wa F1 wa masikio wa 0,09 ± 0,06 tu.

Tathmini ya kuona ya utafiti pia inahusisha hili na ukweli kwamba maelezo madogo au yaliyochorwa kwa mtindo hutofautiana sana kutoka mchoro mmoja hadi mwingine. Watoto wengine hawachori masikio kabisa, huku wengine wakiyawakilisha kwa maumbo madogo sana au yasiyo wazi.

Kwa nini accuracy ya jumla iliyo juu haitoshi peke yake?

Utafiti unahusu tatizo la multi-label lenye class imbalance kubwa. Waandishi wa chanzo pia wanaeleza kwamba kwa sababu hii precision, recall na F1 zinaweza kuwa informative zaidi kuliko accuracy.

Jambo hili linaonekana wazi hasa katika independent test. Katika Jedwali 10, idadi ya true negative (TN) ni sifuri kwa vipengele vyote kumi vya kuona vilivyotathminiwa na CNN. Kwa mfano, kwa masikio TP=57, FP=86, TN=0 na FN=0 zimeripotiwa. Katika mgawanyo huu, modeli imesema “masikio yapo” kwa michoro yote 143 ya test. Recall kwa hivyo ni 1,00, lakini precision ni 57/143 ≈ 0,399 tu na F1 ni takriban 0,57.

Vivyo hivyo, kwa kichwa, kwa kuwa michoro yote 143 ni positive, TP=143, FP=TN=FN=0. Katika test subgroup kama hii, haiwezi kupimwa kama modeli inaweza kukataa kwa usahihi mchoro ambao kichwa hakipo. Kwa hiyo baadhi ya thamani za 0,99–1,00 hazipaswi kutafsiriwa kama “modeli ni karibu perfect katika hali zote”.

Ilikubaliana kwa kiasi gani na alama za wataalamu?

Katika test set ya michoro 143, Pearson correlation kati ya jumla ya alama ya DAP ya kiotomatiki na ground-truth score iliyotolewa na binadamu iliripotiwa kuwa r=0,93 na p<0,001. Katika Kielelezo 8 cha chanzo, sehemu kubwa ya points zimekusanyika karibu na mstari bora wa \(y=x\).

Kulingana na distribution ya error katika Kielelezo 9, katika takriban %87 ya michoro tofauti kati ya alama ya kiotomatiki na alama ya rejea iko ndani ya ±1 pointi. Tofauti kubwa kuliko pointi mbili zimeripotiwa kuwa nadra.

Matokeo haya yanaunga mkono kuwepo kwa uhusiano mkubwa kati ya alama ya kiotomatiki na alama ya rejea. Hata hivyo, correlation si test kamili ya agreement kati ya methods na peke yake haithibitishi kwamba mfumo unaweza kubadilishana nafasi na mtaalamu katika tathmini ya kisaikolojia.

Matokeo yanayoungwa mkono na utafiti

  • ResNet-based visual analysis na geometric rules zinaweza kuunganishwa katika automatic DAP workflow moja.
  • Miundo ya kianatomia iliyo wazi ilitambuliwa kwa uaminifu zaidi kuliko maelezo madogo.
  • Masikio na shingo ni miongoni mwa vipengele vigumu zaidi vya CNN katika utafiti.
  • Correlation kubwa imeripotiwa kati ya automatic 0–16 score na human reference score katika utafiti wa chanzo.
  • Kuhesabu geometric relationships kwa explicit rules hufanya baadhi ya maamuzi ya mfumo yafuatilike zaidi.
  • Independent test performance si sawa kwa vipengele vyote.

Matokeo ambayo utafiti haujathibitisha

  • Haijathibitishwa kwamba mfumo unaweza kutambua akili, hali ya kisaikolojia au hali ya psychiatric ya mtoto peke yake.
  • Haijaonyeshwa kwamba automatic score inaweza kuchukua nafasi ya expert psychologist assessment kwa usalama.
  • Haijathibitishwa kwamba modeli itatoa performance ileile kwa watoto kutoka tamaduni tofauti.
  • Makundi ya data yenye lebo 4–11 si chronological age cohorts; kwa hiyo matokeo si direct age-related developmental curve.
  • Haijaonyeshwa kwamba simple 0–16 total score inawakilisha kikamilifu weighting na clinical interpretation logic yote ya original Goodenough–Harris system.
  • High correlation haimaanishi clinical equivalence au diagnostic validity.

Mbinu na Matokeo ya Utafiti

Maandalizi ya data

Dataset ya chanzo ina michoro 948 ya mkono. Maeneo kumi makuu ya kianatomia yaliwekewa bounding box labels kwa mkono kwa kutumia DigitalSreeni image annotation tool, na annotations zikahifadhiwa katika muundo wa mtindo wa COCO.

Picha zilibadilishwa kuwa RGB format na kurekebishwa kuwa 224 × 224 pixels ili zilingane na input ya ResNet-50. Wakati wa training, data augmentation ilitumika kwa horizontal flip yenye probability ya %50 na kubadilisha brightness/contrast kwa ±%20.

Mgawanyo uliotumiwa katika sehemu ya kina ya maandalizi ya data ni huu:

Sehemu ya dataIdadi ya michoroUwiano katika data yoteMatumizi
Mafunzo663%70Kujifunza parameters za modeli
Validation142%15Threshold na method settings
Test143%15Final, unseen evaluation
Jumla948%100Dataset yote

Mgawanyo huu hailingani na kauli ya “separate hold-out test set ya michoro 948” katika abstract ya makala. Kwa kuwa detailed methods na test tables zinaunga mkono independent test set ya michoro 143, hapa 948 imewasilishwa kama dataset yote na 143 kama hold-out test size.

Usanifu wa ResNet-50

Kulingana na maelezo ya msingi ya usanifu, ResNet-50 backbone iliyofunzwa awali kwenye ImageNet ilitumika kama fixed feature extractor na convolution layers ziligandishwa. Kwa mchoro wa RGB wa 224 × 224:

\[ x \in \mathbb{R}^{3\times224\times224} \]

Backbone hutengeneza feature vector ya vipimo 2048 katika global average pooling output:

\[ f_{\mathrm{ResNet}}(x)\in\mathbb{R}^{2048} \]

Katika maelezo ya basic architecture, linear layer mpya humapishwa kwenye vipengele 10 vya kuona vya kianatomia:

\[ z_{\mathrm{CNN}}=Wf_{\mathrm{ResNet}}(x)+b \]

\[ W\in\mathbb{R}^{10\times2048},\qquad b\in\mathbb{R}^{10} \]

Kila logit hubadilishwa kuwa probability kwa sigmoid:

\[ \hat{y}_i=\sigma(z_i)=\frac{1}{1+e^{-z_i}} \]

Kisha outputs 10 za CNN huunganishwa na vipengele sita vya geometric/heuristic:

\[ y_{\mathrm{final}}=[y_{\mathrm{CNN}},y_{\mathrm{heuristic}}]\in\mathbb{R}^{16} \]

Hata hivyo, katika Sehemu 4.2 ya utafiti wa chanzo imeandikwa kwamba classification layer humap feature vector ya vipimo 2048 moja kwa moja kwenye target features 16. Kauli hii hailingani na architecture ya “10 CNN + 6 heuristic” katika Kielelezo 1 na Sehemu 4.1 na 4.3. Kwa hiyo, katika maandishi ya Verianla muundo wa 10+6 unaorudiwa kwenye kielelezo na sehemu nyingi umetumika kama basic architecture, na kauli inayokinzana ya 16-CNN imerekodiwa kama source-internal inconsistency.

Loss function na class imbalance

Kwa multi-label classification, BCEWithLogitsLoss ilitumika, na pos_weight ikaongezwa ili rare positive features ziwe na uzito mkubwa zaidi wakati wa training.

Katika chanzo, feature weight inaelezwa kwa uwiano huu:

\[ w_i=\frac{negatives_i}{positives_i} \]

Kwa hiyo, katika vipengele vinavyotokea mara chache, misclassification ya positive example ina training cost kubwa zaidi.

Hata hivyo, katika sehemu ya loss function imeandikwa kwamba output ya \(N=16\) imejumuishwa moja kwa moja katika CNN loss. Hili pia halilingani kikamilifu na main architecture inayosema vipengele sita vya heuristic huhesabiwa nje ya CNN.

Mipangilio ya mafunzo

Parameter ya mafunzoThamani iliyoripotiwa katika chanzo
BackboneResNet-50 iliyofunzwa awali kwenye ImageNet
Backbone trainingConvolution layers zimegandishwa
OptimizerAdam
Learning rate1 × 10−4
Epoch10
Gradient clippingMaximum norm 1,0
LossWeighted BCEWithLogitsLoss
Image size224 × 224 pixels

Matokeo ya cross-validation

Katika Sehemu 4.6 ya makala, baada ya test set ya picha 143 kutengwa, picha 805 zilizobaki zinasemekana kutumika katika five-fold cross-validation. Katika kila iteration takriban picha 644 zilitumika kwa training na picha 161 kwa validation.

FoldAccuracy (%)
Fold 191,64
Fold 291,12
Fold 391,28
Fold 490,94
Fold 590,05
Wastani91,01

Kinyume chake, katika Sehemu 4.7 imeandikwa kwamba “complete dataset” ya michoro 948 iligawanywa katika five folds. Kauli hii inapingana na protocol ya awali inayosema picha 143 ziliwekwa kando kabisa. Chanzo hakipatani maelezo haya mawili.

F1 kwa kipengele katika five-fold cross-validation

KipengeleWastani F1SEM
Sikio0,090,06
Jicho0,990,00
Nywele0,870,01
Mkono0,990,00
Kichwa0,990,00
Mguu0,990,00
Mdomo0,980,01
Shingo0,750,04
Pua0,840,01
Kiwiliwili0,990,00
Urefu wa kiwiliwili > upana1,000,00
Mabega yameonyeshwa1,000,00
Viungo ni vya pande mbili1,000,00
Viungo vimeunganishwa na kiwiliwili1,000,00
Sehemu sahihi za kuunganisha viungo1,000,00
Contour ya shingo inaendelea na kichwa/kiwiliwili1,000,00

Ni jambo la kuzingatia kwamba vipengele vyote sita vya heuristic vinapata F1=1,00 katika cross-validation. Sehemu ya methods inaeleza kwamba labels za cross-validation zilitengenezwa kwa heuristic rules hizo hizo. Kwa hiyo, kutathmini rule dhidi ya label iliyotengenezwa na rule yenyewe si independent validation. Kwa kweli, katika hold-out set ya michoro 143, vipengele hivi sita vilipowekewa labels na independent experienced raters, baadhi ya heuristic performances zilishuka kwa kiasi kikubwa.

Final feature performance katika independent test ya michoro 143

Verianla Live: F1 kwa kipengele katika hold-out test

Thamani zimechukuliwa kutoka automatic detection and scoring evaluation ya michoro 143 katika Jedwali 8 la chanzo. Kwa sababu class prevalences zinatofautiana, clinical importance ya vipengele haipaswi kulinganishwa kwa kuangalia F1 pekee.

KipengeleF1 score
Sikio0,5700
Jicho0,9965
Nywele0,8651
Mkono0,9858
Kichwa1,0000
Mguu0,9930
Mdomo0,9894
Shingo0,7881
Pua0,8514
Kiwiliwili0,9858
Urefu wa kiwiliwili > upana1,0000
Mabega yameonyeshwa0,9765
Viungo ni vya pande mbili1,0000
Viungo vimeunganishwa na kiwiliwili0,4762
Sehemu sahihi za kuunganisha viungo0,9163
Contour ya shingo inaendelea na kichwa/kiwiliwili1,0000
 

Katika jedwali hili, wastani wa accuracy 0,8780, precision 0,8929, recall 0,9458 na F1 0,8996 umeripotiwa. Hasa, kushuka kwa F1 ya heuristic feature “viungo vimeunganishwa na kiwiliwili” hadi 0,4762 kunaonyesha kwamba thamani ya 1,00 katika cross-validation haikudumu dhidi ya independent reference label.

Kwa nini jedwali mbili za performance ndani ya chanzo zinahitaji kusomwa kwa uangalifu?

Jedwali 7 la chanzo linatoa wastani wa accuracy=0,9175, precision=0,8869, recall=0,9375 na F1=0,905 kwa vipengele 16. Jedwali 8 linalofuata la automatic detection/scoring linatoa accuracy=0,8780, precision=0,8929, recall=0,9458 na F1=0,8996.

Matokeo ya chanzoAccuracyPrecisionRecallF1
Jedwali 70,91750,88690,93750,9050
Jedwali 80,87800,89290,94580,8996

Maandishi ya makala hayatai hatua hizi mbili za evaluation kwa namna inayolingana kikamilifu. Aidha, katika maelezo ya baadaye ya Jedwali 9 inaonekana table numbers zimesogea kwa nafasi moja. Kwa hiyo kutoa namba moja isiyo na context kama “accuracy ya mfumo ni %91,78” kungekuwa misleading kisayansi.

Mabadiliko makubwa katika matokeo ya sikio

Katika Jedwali 7 la chanzo, ear detection imepewa accuracy=0,63, precision=0,14, recall=0,01 na F1=0,07. Katika Jedwali 8, kwa sikio accuracy na precision ni 0,3986, recall 1,0000 na F1=0,5700.

Jedwali 9 linaeleza mabadiliko haya kama improvement baada ya “heuristic refinement”. Hata hivyo, kati ya vipengele sita vya heuristic vilivyoainishwa na utafiti hakuna rule inayorekebisha ear detection; heuristics zinahusu torso ratio, shoulder, bilateral limb, limb connection, connection region na neck continuity. Kwa hiyo sababu ya kiufundi ya mabadiliko ya ear F1 kutoka 0,07 → 0,57 haiwezi kubainishwa kwa kuaminika kutoka katika maandishi ya chanzo.

Confusion matrix inaonyesha nini?

Katika test ya michoro 143, confusion matrix ya vipengele kumi vya kuona pia inatoa tahadhari muhimu:

Kipengele cha kuonaTPFPTNFN
Sikio578600
Jicho142100
Nywele1093400
Mkono139400
Kichwa143000
Mguu141200
Mdomo140300
Shingo935000
Pua1063700
Kiwiliwili139400

Namba hizi zinaonyesha kwamba kwa vipengele vyote kumi vya kuona FN=0 na TN=0. Kwa hiyo uwezo wa modeli kutambua kwa usahihi kwamba visual feature “haipo” haujapimwa katika test table hii. Baadhi ya high recall na F1 scores zinaathiriwa na prevalence na prediction structure hii.

Alama ya kiotomatiki inahesabiwaje?

Katika formula ya chanzo, vipengele 16 vya binary hujumlishwa moja kwa moja:

\[ S=\sum_{i=1}^{16}f_i \]

Hapa \(f_i=1\) inaonyesha kipengele kipo, na \(f_i=0\) inaonyesha hakipo. Kwa hiyo jumla ya alama hutofautiana kati ya 0 na 16.

Katika sehemu ya baadaye ya matokeo ya chanzo, sehemu moja inasema outputs 16 za binary zinachukuliwa kwa “averaging”; aya hiyo hiyo mara moja baada yake inasema score ya 0–16 inatengenezwa. Kwa kuwa scale ya 0–16 na equation iliyotolewa zinaunga mkono summation, maandishi ya Verianla yametumia jumla iliyo kwenye formula.

Mapungufu makuu ya kimetodolojia ya utafiti

  • Dataset yote ina michoro 948 tu na hakuna independent cross-cultural validation iliyofanywa.
  • “Mental age” groups zilizotumika katika chanzo si chronological age.
  • Kuna strong class imbalance katika small anatomical features.
  • Katika hold-out confusion matrix, TN=0 kwa vipengele vyote kumi vya CNN.
  • Kwa vipengele sita vya heuristic, cross-validation labels zilitengenezwa kutoka kwenye rules, kwa hiyo perfect CV scores si independent validation.
  • Heuristic thresholds zilirekebishwa empirically kulingana na dataset hii na huenda zisitoe accuracy ileile katika drawing styles nyingine.
  • Vipengele 16 vinapata weight sawa katika total score; waandishi wa chanzo wanakubali kwamba hii huenda isiwakilishe kikamilifu real DAP scoring system.
  • Kuna source-internal inconsistency kuhusu kama cross-validation ilifanywa kwenye michoro 805 au 948.
  • Kuna inconsistency katika methods text kuhusu kama ResNet classification layer inatoa outputs 10 au 16.
  • Chanzo kinasema threshold tuning ilifanywa kwa validation data, lakini baadaye kinasema cross-validation haikutumika kwa hyperparameter tuning.
  • Performance stages na table references kati ya Jedwali 7, Jedwali 8 na Jedwali 9 hazilingani kikamilifu.
  • Psychological au clinical diagnostic validity ya automatic score haijajaribiwa independently katika utafiti huu.

Maelezo ya Chanzo na Mbinu

Kichwa kamili cha asili cha utafitiAutomated Anatomical Feature Analysis and Scoring for Draw-a-Person Test Drawings via ResNet-Based Multi-Label Detection and Classification
WaandishiAsma Abdullah Alwadai; Emad Sami Jaha
Mpangilio wa waandishi1. Asma Abdullah Alwadai; 2. Emad Sami Jaha
Mchango sawa / mwandishi wa kwanza sawaHakuna taarifa ya equal contribution iliyotajwa katika utafiti wa chanzo.
Mwandishi anayewajibikaAsma Abdullah Alwadai
TaasisiDepartment of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University, Jeddah 21589, Saudi Arabia
Aina ya chanzoMakala ya utafiti wa experimental AI / computer vision.
Hali ya peer reviewNi makala iliyochapishwa katika peer-reviewed journal; si preprint.
JaridaAI
MchapishajiMDPI
Volume / issue / article2026, 7(4), 130
DOI10.3390/ai7040130
Tarehe ya kupokelewa4 Machi 2026
Tarehe ya marekebisho26 Machi 2026
Tarehe ya kukubaliwa28 Machi 2026
Tarehe ya kuchapishwa2 Aprili 2026
Kiungo rasmihttps://doi.org/10.3390/ai7040130
LeseniCreative Commons Attribution (CC BY).

Ufadhili na msaada wa taasisi

Katika funding statement ya makala imeelezwa kwamba utafiti haukupokea external funding. Katika acknowledgements, hata hivyo, imeandikwa kwamba mradi uliungwa mkono na KAU Endowment (WAQF) ndani ya King Abdulaziz University, na shukrani zimetolewa kwa WAQF na Deanship of Scientific Research kwa technical na financial support. Taarifa hizi mbili zikichunguzwa pamoja, kazi haitangazi “external funding” lakini inataja internal institutional support.

Maadili na chanzo cha data

Imeelezwa kwamba ethics committee review haikuhitajika kwa sababu utafiti ulitumia public na fully anonymized dataset na haukuhusisha new participant/data collection. Kwa sababu hiyo informed consent haikutumika.

Dataset ya chanzo ilichukuliwa kutoka public Kaggle repository yenye jina “Draw-a-Person Hand-Drawn Sketches by Children”, na tarehe ya access katika makala imetolewa kuwa 30 Novemba 2025.

Michango ya waandishi

Conceptualization na methodology zilifanywa na Asma Abdullah Alwadai pamoja na Emad Sami Jaha. Software, validation, investigation, data curation, first draft na visualization zilifanywa hasa na Asma Abdullah Alwadai. Supervision na funding acquisition zilichukuliwa na Emad Sami Jaha; waandishi wote wawili walichangia review na editing ya makala.

Mgongano wa maslahi

Waandishi walitangaza kwamba hakuna conflict of interest.

Muhtasari wa rekodi ya kutokulingana ndani ya chanzo

  • Abstract inasema michoro 948 ni separate hold-out test set; detailed methods zinaonyesha 948 ni dataset yote na 143 ni test set.
  • Sehemu moja inaeleza cross-validation kwenye michoro 805, nyingine kwenye michoro yote 948.
  • Main architecture inaonyesha outputs 10 CNN + 6 heuristic, ilhali subsection moja inaeleza ResNet classifier yenye outputs 16.
  • Katika loss function section pia kutajwa kwa features 16 kwa CNN hakulingani na architecture ya 10+6.
  • Maandishi yanaripoti %91,78 macro accuracy, wakati wastani wa Jedwali 7 ni %91,75 na final average ya Jedwali 8 ni %87,80.
  • Ear F1 ni 0,07 katika evaluation moja na 0,57 katika nyingine, na chanzo hakielezi vya kutosha mechanism ya mabadiliko hayo.
  • Ingawa Jedwali 9 linahusisha mabadiliko ya sikio na heuristic refinement, hakuna hata moja ya heuristic rules sita iliyoelekezwa kwa sikio.
  • Katika results text, sehemu moja inasema score ni “average”, lakini formula na scale ya 0–16 zinaonyesha features zinajumlishwa.
  • Katika cross-validation heuristic features zote zinapata F1=1,00, lakini katika independent expert-labeled test F1 ya limb–torso connection inashuka hadi 0,4762.

Kwa hiyo hitimisho thabiti zaidi la utafiti si kwamba “AI sasa inaweza kufanya psychological assessment kutoka michoro ya watoto kiotomatiki na kikamilifu”. Hitimisho finyu zaidi linaloungwa mkono na chanzo ni kwamba kuunganisha ResNet-based visual feature detection na explicit geometric rules kunaweza kuunda automatic na interpretable prototype scoring system kwa vipengele 16 maalumu vya michoro ya DAP. Hasa, kabla ya mfumo huo kujumlishwa kama clinical au psychological decision mechanism, changamoto za small anatomical details, class imbalance, inconsistencies katika evaluation protocol na ukosefu wa external validation zinahitaji kutatuliwa; generalization hiyo haiungwi mkono na chanzo katika hali ya sasa.


Shiriki:

Maoni huchapishwa baada ya kukaguliwa.Maoni yako yatapitia mchakato wa idhini na yataonekana yakikubaliwa.

Acha maoni

Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *

Your experience on this site will be improved by allowing cookies Cookie Policy