Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / ResNet Əsaslı Çoxetiketli Aşkarlama və Təsnifat ilə Draw-a-Person Testi Rəsmlərində Avtomatik Anatomik Xüsusiyyət Analizi və Qiymətləndirmə
Kompüter Elmləri

ResNet Əsaslı Çoxetiketli Aşkarlama və Təsnifat ilə Draw-a-Person Testi Rəsmlərində Avtomatik Anatomik Xüsusiyyət Analizi və Qiymətləndirmə

Bu tədqiqat uşaqların Draw-a-Person (DAP; İnsan Çək) testi çərçivəsində yaratdığı insan fiquru rəsmlərini avtomatik təhlil etmək üçün dərin öyrənmə ilə açıq həndəsi qaydaları birləşdirən hibrid sistem təklif edir.

19/08/2026  Veri Anla 63 baxış
ResNet Əsaslı Çoxetiketli Aşkarlama və Təsnifat ilə Draw-a-Person Testi Rəsmlərində Avtomatik Anatomik Xüsusiyyət Analizi və Qiymətləndirmə

Bu tədqiqat uşaqların Draw-a-Person (DAP; İnsan Çək) testi çərçivəsində yaratdığı insan fiquru rəsmlərini avtomatik təhlil etmək üçün dərin öyrənmə ilə açıq həndəsi qaydaları birləşdirən hibrid sistem təklif edir. Əsas arxitekturada ImageNet üzərində əvvəlcədən öyrədilmiş ResNet-50 modeli rəsmlərdə baş, göz, saç, əl, ayaq, ağız, burun, qulaq, boyun və gövdə olmaqla 10 vizual anatomik xüsusiyyəti proqnozlaşdırır. Bunlara gövdə nisbəti, çiyin göstəricisi, ikitərəfli ətraf təsviri, ətraf–gövdə bağlantısı, düzgün bağlantı bölgəsi və boyun davamlılığını qiymətləndirən altı həndəsi/sezgisel xüsusiyyət əlavə edilərək ümumilikdə 16 ikili xüsusiyyət yaradılır.

Tədqiqatda ümumilikdə 948 əl rəsmi istifadə edilmişdir. Ətraflı məlumat bölgüsü izahına görə 663 görüntü təlim, 142 görüntü doğrulama və 143 görüntü müstəqil test üçün ayrılmışdır. Beş qatlı çarpaz doğrulamada bildirilən dəqiqlik %90,05 ilə %91,64 arasında dəyişmiş və orta hesabla %91,01 olmuşdur. Bununla belə performans xüsusiyyətdən xüsusiyyətə ciddi şəkildə dəyişmişdir: baş, göz, əl, ayaq, ağız və gövdə kimi aydın komponentlərdə F1 dəyərləri təxminən 0,98–1,00 səviyyəsinə çatdığı halda, qulaq və boyun kimi daha kiçik və ya dəyişkən çəkilən detalları aşkar etmək xeyli çətin olmuşdur.

Müstəqil 143 rəsmlik test dəstində avtomatik sistemin insan tərəfindən təyin edilmiş ümumi DAP balları ilə korrelyasiyası r=0,93 (p<0,001) kimi bildirilmiş və rəsmlərin təxminən %87-də avtomatik bal ilə istinad balı arasındakı fərq ±1 bal daxilində qalmışdır. Lakin bu nəticələr sistemin psixoloji diaqnoz qoya bildiyini və ya ekspert qiymətləndirməsini əvəz edə bildiyini göstərmir. Tədqiqat yalnız müəyyən edilmiş 16 rəsm xüsusiyyətinin avtomatik aşkarlanmasını və bunlardan sadə ümumi bal yaradılmasını qiymətləndirmişdir. Bundan əlavə, mənbədə məlumat bölgüsü, çıxış ölçüsü və performans cədvəlləri ilə bağlı bəzi uyğunsuzluqlar nəticələrin ehtiyatla şərh olunmasını tələb edir.

Əsas elementMənbə tədqiqatında bildirilən quruluşŞərh sərhədi
Ümumi məlumat dəsti948 uşaq rəsmi948 sayı müstəqil test dəsti deyil; ətraflı metodda ümumi məlumat dəstidir.
Ətraflı məlumat bölgüsü663 təlim + 142 doğrulama + 143 testMəqalənin başqa hissəsindəki “948 görüntü ilə 5-fold” ifadəsi ilə uyğun gəlmir.
CNN əsaslı xüsusiyyət10Əsas arxitektura izahına görə ResNet çıxışlarıdır.
Həndəsi/sezgisel xüsusiyyət6Bounding-box həndəsindən qaydalarla yaradılır.
Ümumi xüsusiyyət16Sadə toplama ilə 0–16 arasında bal yaradılır.
Beş qatlı CV orta dəqiqliyi%91,01Çoxetiketli və balanssız məlumat səbəbindən dəqiqlik təkbaşına kifayət edən performans ölçüsü deyil.
Yekun sistem Cədvəl 8 orta F10,8996Xüsusiyyətlər arasında performans xeyli dəyişir.
Avtomatik–istinad bal korrelyasiyasır=0,93; p<0,001Korrelyasiya klinik ekvivalentlik və ya psixoloji diaqnoz dəqiqliyi deyil.

Tədqiqat hansı problemi həll etməyə çalışır?

Draw-a-Person testi şəxsin insan fiquru çəkməsinə əsaslanaraq müəyyən formal və anatomik xüsusiyyətlərin qiymətləndirilməsinə söykənir. Mənbə tədqiqatının çıxış nöqtəsi bu xüsusiyyətlərin əl ilə yoxlanmasının vaxt aparması və qiymətləndirmələr arasında şərh fərqlərinin yarana bilməsidir.

Tədqiqatçılar problemi tamamilə “qara qutu” süni intellekt modelinə buraxmaq əvəzinə iki ayrı yanaşmanı birləşdirmişlər. Görüntüdə birbaşa görünməsi tələb olunan anatomik strukturlar ResNet-50 əsaslı CNN tərəfindən qiymətləndirilir, hissələr arasındakı mövqesel və həndəsi münasibətlər isə açıq qaydalarla hesablanır.

Beləliklə, sistem yalnız “bu rəsmdə ayaq varmı?” sualını deyil; məsələn, ətrafların gövdəyə bağlanıb-bağlanmadığı və ya gövdənin hündürlüyünün enindən böyük olub-olmadığı kimi daha strukturlaşdırılmış sualları da cavablandırmağa çalışır.

10 CNN xüsusiyyəti hansılardır?

ResNet əsaslı vizual hissə rəsmdə aşağıdakı on anatomik komponentin olub-olmadığını proqnozlaşdırır:

  • qulaqlar,
  • gözlər,
  • saç,
  • əllər,
  • baş,
  • ayaqlar,
  • ağız,
  • boyun,
  • burun,
  • gövdə.

Hər xüsusiyyət digərlərindən müstəqil şəkildə var/yox etiketi ala bilər. Buna görə problem klassik tək sinifli görüntü təsnifatı deyil, çoxetiketli təsnifat problemidir.

Altı həndəsi qayda nəyi qiymətləndirir?

CNN-in yanına əlavə olunan altı xüsusiyyət çəkilmiş hissələrin koordinatları və bounding-box münasibətlərindən hesablanır:

Həndəsi xüsusiyyətMənbədə istifadə edilən əsas qayda
Gövdənin uzunluğunun enindən böyük olmasıGövdə bounding-box hündürlüyü enindən böyükdürsə müsbət.
Çiyinlərin göstərilməsiGövdə eni boyun eninin 1,2 qatından böyükdürsə müsbət.
Ətrafların ikitərəfli təsviriGövdə orta xəttinin iki tərəfindəki əl/ayaq bounding-box mövqeləri qiymətləndirilir.
Ətraf–gövdə bağlantısıƏtraf və gövdə bounding box-ları arasındakı üst-üstə düşmə IoU həddinə görə yoxlanılır.
Düzgün ətraf bağlantı bölgələriƏllərin gövdənin yuxarı, ayaqların aşağı bölgələrinə bağlanması məkan hədləri ilə qiymətləndirilir.
Boyun konturunun davamlılığıBoyun qutusunun alt kənarı ilə gövdənin üst kənarı arasında ±2 piksel şərti istifadə olunur.

Mənbə tədqiqatında həndəsi hədlərin doğrulama məlumatı üzərində grid search ilə tənzimləndiyi bildirilir. Ətraf–gövdə bağlantısı üçün seçilən IoU həddi 0,01; yuxarı bağlantı bölgəsi nisbəti 0,3 və aşağı bölgə nisbəti 0,5-dir.

Verianla Live: Bir rəsmin avtomatik DAP balına çevrilməsi

Bu axın mənbə tədqiqatının Şəkil 1-də təsvir olunan hibrid arxitekturasını xülasə edir.

MərhələMənbə tədqiqatındakı əməliyyat
1. GirişUşaq tərəfindən yaradılmış DAP insan fiquru rəsmi sistemə daxil edilir.
2. Görüntünün ilkin işlənməsiGörüntü RGB-yə çevrilir və 224 × 224 pikselə miqyaslanır.
3. ResNet-50 xüsusiyyət çıxarışıImageNet əvvəlcədən öyrədilmiş və dondurulmuş backbone 2048 ölçülü vizual xüsusiyyət vektoru yaradır.
4. CNN anatomik proqnozuBaş, göz, saç, əl, ayaq, ağız, burun, qulaq, boyun və gövdə üçün 10 proqnoz yaradılır.
5. HədləməSigmoid ehtimalları seçilmiş hədlərlə ikili var/yox çıxışına çevrilir.
6. Həndəsi analizBounding-box münasibətlərindən altı struktur/sezgisel xüsusiyyət hesablanır.
7. Birləşdirmə10 CNN xüsusiyyəti və 6 həndəsi xüsusiyyət 16 elementli xüsusiyyət vektorunda birləşdirilir.
8. QiymətləndirməMüsbət ikili xüsusiyyətlər toplanaraq 0–16 aralığında avtomatik DAP balı yaradılır.
 

Axın tədqiqat arxitekturasını izah edir; 16 balın psixoloji diaqnoz və ya klinik qərar üçün təkbaşına kifayət etdiyi mənasına gəlmir.

Məlumat dəstində “yaş” nə deməkdir?

Məlumat dəstindəki 948 rəsm səkkiz qrupa ayrılmış və qruplar 4 ilə 11 arasında etiketlənmişdir. Lakin mənbə tədqiqatı açıq şəkildə bunların şagirdlərin həqiqi yaşlarından asılı olmayaraq peşəkar qiymətləndirmə ilə təyin edilmiş mental-age qrupları olduğunu bildirir.

Bu fərq xüsusilə tədqiqat daxilində yaşa görə F1 qrafiklərini şərh edərkən vacibdir. Məsələn, ağız aşkarlama F1-nin qrup 4-də 0,30-dan qrup 11-də 0,95-ə yüksəlməsi eyni uşaqların yaşlandıqca izlənildiyi longitudinal inkişaf tədqiqatının nəticəsi deyil. Bunlar əvvəlcədən müxtəlif mental-age kateqoriyalarına təyin edilmiş rəsm qrupları üzərində model performanslarıdır.

Hansı xüsusiyyətlər asan, hansılar çətin tapıldı?

Beş qatlı çarpaz doğrulamada baş, əl, ayaq, göz, ağız və gövdə kimi aydın anatomik komponentlərdə yüksək F1 balları əldə edilmişdir. Mənbə Cədvəl 5-də göz, əl, baş, ayaq və gövdənin orta F1 dəyərləri təxminən 0,99; ağız isə 0,98 kimi bildirilmişdir.

Bunun əksinə, burun üçün orta F1 0,84, saç üçün 0,87 və boyun üçün 0,75-dir. Ən nəzərəçarpan uğursuzluq qulaqdır: mənbə Cədvəl 5 orta qulaq F1 dəyərini yalnız 0,09 ± 0,06 kimi verir.

Tədqiqatın vizual qiymətləndirilməsi də bunu kiçik və ya stilizə olunmuş detalların rəsmdən rəsmə çox dəyişməsi ilə əlaqələndirir. Bəzi uşaqlar qulağı ümumiyyətlə çəkmədiyi halda, bəziləri onu çox kiçik və ya qeyri-müəyyən formalarda göstərir.

Yüksək ümumi dəqiqlik niyə təkbaşına kifayət deyil?

Tədqiqat çoxetiketli və güclü sinif balanssızlıqları olan problemlə məşğuldur. Mənbə müəllifləri də buna görə accuracy əvəzinə precision, recall və F1-in daha informativ ola biləcəyini qeyd edirlər.

Bu məqam müstəqil testdə xüsusilə aydındır. Cədvəl 10-da CNN tərəfindən qiymətləndirilən on vizual xüsusiyyətin hamısında həqiqi mənfi (TN) sayı sıfırdır. Məsələn, qulaq üçün TP=57, FP=86, TN=0 və FN=0 bildirilmişdir. Bu bölgüdə model testdəki 143 rəsmin hamısı üçün “qulaq var” demişdir. Beləliklə recall 1,00 olduğu halda precision yalnız 57/143 ≈ 0,399 və F1 təxminən 0,57-dir.

Eyni şəkildə baş üçün 143 rəsmin hamısı müsbət olduğuna görə TP=143, FP=TN=FN=0-dır. Belə test altqrupunda modelin başın olmadığı bir rəsmi düzgün rədd edib-etmədiyi ölçülə bilməz. Buna görə 0,99–1,00 səviyyəsindəki bəzi dəyərlər “model hər şəraitdə demək olar ki, qüsursuzdur” kimi şərh edilməməlidir.

Ekspert balları ilə nə qədər uyğun gəldi?

143 rəsmlik test dəstində avtomatik ümumi DAP balı ilə insan tərəfindən təyin edilmiş ground-truth bal arasında Pearson korrelyasiyası r=0,93 və p<0,001 kimi bildirilmişdir. Mənbə Şəkil 8-də nöqtələrin mühüm hissəsi ideal \(y=x\) xəttinin ətrafında toplanır.

Şəkil 9-dakı xəta bölgüsünə görə rəsmlərin təxminən %87-də avtomatik bal ilə istinad balı arasındakı fərq ±1 bal sərhədindədir. İki baldan böyük fərqlərin nadir olduğu bildirilir.

Bu nəticələr avtomatik bal ilə istinad balı arasında güclü əlaqə olduğunu dəstəkləyir. Lakin korrelyasiya metodlararası tam uyğunluq testi deyil və sistemin psixoloji qiymətləndirmə baxımından ekspertlə əvəz edilə biləcəyini təkbaşına sübut etmir.

Tədqiqatın dəstəklədiyi nəticələr

  • ResNet əsaslı vizual analiz ilə həndəsi qaydalar vahid avtomatik DAP iş axınında birləşdirilə bilər.
  • Aydın anatomik strukturlar kiçik detallara nisbətən daha etibarlı şəkildə aşkarlanmışdır.
  • Qulaq və boyun tədqiqatdakı ən çətin CNN xüsusiyyətləri arasındadır.
  • Avtomatik 0–16 bal ilə mənbə tədqiqatındakı insan istinad balı arasında güclü korrelyasiya bildirilmişdir.
  • Həndəsi münasibətlərin açıq qaydalarla hesablanması sistemin müəyyən qərarlarını daha izləniləbilən edir.
  • Müstəqil test performansı bütün xüsusiyyətlər üçün eyni deyil.

Tədqiqatın sübut etmədiyi nəticələr

  • Sistemin uşağın zəka, psixi və ya psixiatrik vəziyyətini təkbaşına diaqnoz edə bildiyi sübut olunmayıb.
  • Avtomatik balın ekspert psixoloq qiymətləndirməsini təhlükəsiz şəkildə əvəz edə bildiyi göstərilməyib.
  • Modelin müxtəlif mədəniyyətlərdən olan uşaqlarda eyni performansı göstərəcəyi sübut edilməyib.
  • 4–11 olaraq etiketlənən məlumat qrupları xronoloji yaş kohortları deyil; buna görə nəticələr birbaşa yaşa bağlı inkişaf əyrisi deyil.
  • 0–16 sadə ümumi balın orijinal Goodenough–Harris sisteminin bütün çəkiləndirmə və klinik şərh məntiqini bir-bir təmsil etdiyi göstərilməyib.
  • Yüksək korrelyasiya klinik ekvivalentlik və ya diaqnostik etibarlılıq demək deyil.

Tədqiqatın Metodu və Nəticələri

Məlumatın hazırlanması

Mənbə məlumat dəsti 948 əl rəsmindən ibarətdir. On əsas anatomik bölgə DigitalSreeni görüntü anotasiya aləti ilə bounding box şəklində əl ilə etiketlənmiş və anotasiya məlumatları COCO tipli strukturda saxlanılmışdır.

Görüntülər RGB formatına çevrilmiş və ResNet-50 girişinə uyğun olaraq 224 × 224 piksel ölçüsünə dəyişdirilmişdir. Təlim zamanı görüntülərin %50 ehtimalla üfüqi çevrilməsi və parlaqlıq/kontrastın ±%20 dəyişdirilməsi ilə məlumat artırma tətbiq olunmuşdur.

Ətraflı məlumat hazırlama bölməsində istifadə olunan bölgü belədir:

Məlumat bölməsiRəsm sayıÜmumi məlumatdakı payıİstifadə
Təlim663%70Model parametrlərinin öyrənilməsi
Doğrulama142%15Hədd və metod parametrləri
Test143%15Yekun, görülməmiş qiymətləndirmə
Ümumi948%100Bütün məlumat dəsti

Bu bölgü məqalə xülasəsindəki “948 rəsmlik ayrıca hold-out test seti” ifadəsi ilə uyğun gəlmir. Ətraflı metod və test cədvəlləri 143 rəsmlik müstəqil test dəstini dəstəklədiyinə görə burada 948 ümumi məlumat dəsti, 143 isə hold-out test ölçüsü kimi verilmişdir.

ResNet-50 arxitekturası

Əsas arxitektura təsvirinə görə ImageNet üzərində əvvəlcədən öyrədilmiş ResNet-50 backbone sabit xüsusiyyət çıxarıcı kimi istifadə edilmiş və convolution qatları dondurulmuşdur. 224 × 224 RGB rəsm üçün:

\[ x \in \mathbb{R}^{3\times224\times224} \]

Backbone global average pooling çıxışında 2048 ölçülü xüsusiyyət vektoru yaradır:

\[ f_{\mathrm{ResNet}}(x)\in\mathbb{R}^{2048} \]

Əsas arxitektura izahında yeni xətti qat 10 anatomik vizual xüsusiyyətə xəritələnir:

\[ z_{\mathrm{CNN}}=Wf_{\mathrm{ResNet}}(x)+b \]

\[ W\in\mathbb{R}^{10\times2048},\qquad b\in\mathbb{R}^{10} \]

Hər logit sigmoid ilə ehtimala çevrilir:

\[ \hat{y}_i=\sigma(z_i)=\frac{1}{1+e^{-z_i}} \]

Daha sonra 10 CNN çıxışı altı həndəsi/sezgisel xüsusiyyət ilə birləşdirilir:

\[ y_{\mathrm{final}}=[y_{\mathrm{CNN}},y_{\mathrm{heuristic}}]\in\mathbb{R}^{16} \]

Mənbə tədqiqatının 4.2 bölməsində isə təsnifat qatının 2048 ölçülü xüsusiyyət vektorunu birbaşa 16 hədəf xüsusiyyətə xəritələdiyi yazılır. Bu ifadə məqalənin Şəkil 1-i, 4.1 və 4.3 bölmələrindəki “10 CNN + 6 heuristic” arxitekturası ilə uyğun gəlmir. Buna görə Verianla mətnində əsas arxitektura kimi şəkil və əksər hallarda təkrarlanan 10+6 quruluşu əsas götürülmüş, ziddiyyətli 16-CNN ifadəsi mənbədaxili uyğunsuzluq kimi qeyd edilmişdir.

İtki funksiyası və sinif balanssızlığı

Tədqiqatda çoxetiketli təsnifat üçün BCEWithLogitsLoss istifadə edilmiş və nadir müsbət xüsusiyyətlərin təlim zamanı daha çox çəki daşıması üçün pos_weight tətbiq olunmuşdur.

Mənbədə xüsusiyyət çəkisi aşağıdakı nisbətlə izah olunur:

\[ w_i=\frac{negatives_i}{positives_i} \]

Beləliklə, az rast gəlinən xüsusiyyətlərdə müsbət nümunənin yanlış təsnif edilməsi daha yüksək təlim xərci yaradır.

Bununla belə, itki funksiyası bölməsində \(N=16\) çıxışın birbaşa CNN itkisinə daxil edildiyi yazılmışdır. Bu da altı heuristic xüsusiyyətin CNN xaricində hesablandığını deyən əsas arxitektura ilə tam uyğunlaşmır.

Təlim parametrləri

Təlim parametriMənbədə bildirilən dəyər
BackboneImageNet əvvəlcədən öyrədilmiş ResNet-50
Backbone təlimiConvolution qatları dondurulmuş
OptimizerAdam
Öyrənmə sürəti1 × 10−4
Epoch10
Gradient clippingMaksimum norm 1,0
İtkiÇəkili BCEWithLogitsLoss
Görüntü ölçüsü224 × 224 piksel

Çarpaz doğrulama nəticəsi

Məqalənin 4.6 bölməsində 143 görüntülük test dəsti ayrıldıqdan sonra qalan 805 görüntünün beş qatlı çarpaz doğrulamada istifadə edildiyi bildirilir. Hər iterasiyada təxminən 644 görüntü təlim və 161 görüntü doğrulama üçün istifadə olunmuşdur.

FoldDəqiqlik (%)
Fold 191,64
Fold 291,12
Fold 391,28
Fold 490,94
Fold 590,05
Orta91,01

Bunun əksinə, 4.7 bölməsində “complete dataset” kimi 948 rəsmin beş fold-a bölündüyü yazılmışdır. Bu ifadə 143 görüntünün tamamilə ayrıca saxlandığını deyən əvvəlki protokolla ziddiyyət təşkil edir. Mənbə bu iki izahı uzlaşdırmır.

Beş qatlı çarpaz doğrulamada xüsusiyyət üzrə F1

XüsusiyyətOrta F1SEM
Qulaq0,090,06
Göz0,990,00
Saç0,870,01
Əl0,990,00
Baş0,990,00
Ayaq0,990,00
Ağız0,980,01
Boyun0,750,04
Burun0,840,01
Gövdə0,990,00
Gövdə uzunluğu > en1,000,00
Çiyin göstərilib1,000,00
Ətraflar ikiölçülü1,000,00
Ətraflar gövdəyə bağlıdır1,000,00
Düzgün ətraf bağlantı nöqtələri1,000,00
Boyun konturu baş/gövdə ilə davamlıdır1,000,00

Altı heuristic xüsusiyyətin çarpaz doğrulamada tam F1=1,00 verməsi diqqətəlayiqdir. Metod bölməsi çarpaz doğrulama etiketlərinin bu heuristic qaydalarla yaradıldığını bildirir. Buna görə bir qaydanın öz yaratdığı etiketə qarşı qiymətləndirilməsi müstəqil doğrulama sayılmır. Həqiqətən, 143 rəsmlik hold-out dəstində bu altı xüsusiyyət müstəqil təcrübəli qiymətləndiricilər tərəfindən etiketləndikdə bəzi heuristic performanslar nəzərəçarpacaq dərəcədə aşağı düşür.

143 rəsmlik müstəqil testdə yekun xüsusiyyət performansı

Verianla Live: Hold-out testdə xüsusiyyət üzrə F1

Dəyərlər mənbə Cədvəl 8-dəki 143 rəsmlik avtomatik aşkarlama və qiymətləndirmə analizindən götürülmüşdür. Sinif prevalensiyaları fərqli olduğuna görə yalnız F1-ə baxaraq xüsusiyyətlərin klinik əhəmiyyəti müqayisə edilməməlidir.

XüsusiyyətF1 balı
Qulaq0,5700
Göz0,9965
Saç0,8651
Əl0,9858
Baş1,0000
Ayaq0,9930
Ağız0,9894
Boyun0,7881
Burun0,8514
Gövdə0,9858
Gövdə uzunluğu > en1,0000
Çiyin göstərilib0,9765
Ətraflar ikiölçülü1,0000
Ətraflar gövdəyə bağlıdır0,4762
Düzgün ətraf bağlantı nöqtələri0,9163
Boyun konturu baş/gövdə ilə davamlıdır1,0000
 

Bu cədvəldə orta accuracy 0,8780, precision 0,8929, recall 0,9458 və F1 0,8996 kimi bildirilmişdir. Xüsusilə “ətraflar gövdəyə bağlıdır” heuristic xüsusiyyətinin F1 dəyərinin 0,4762-yə düşməsi çarpaz doğrulamadakı 1,00 dəyərinin müstəqil istinad etiketi qarşısında qorunmadığını göstərir.

Mənbə daxilindəki iki performans cədvəli niyə diqqətlə oxunmalıdır?

Mənbə Cədvəl 7, 16 xüsusiyyət üçün orta accuracy=0,9175, precision=0,8869, recall=0,9375 və F1=0,905 verir. Növbəti avtomatik aşkarlama/qiymətləndirmə Cədvəl 8 isə accuracy=0,8780, precision=0,8929, recall=0,9458 və F1=0,8996 verir.

Mənbə nəticəsiAccuracyPrecisionRecallF1
Cədvəl 70,91750,88690,93750,9050
Cədvəl 80,87800,89290,94580,8996

Məqalə mətni bu iki qiymətləndirmə mərhələsini tam ardıcıl şəkildə adlandırmır. Bundan əlavə, daha sonrakı Cədvəl 9 izahında cədvəl nömrələrinin bir sıra sürüşdüyü görünür. Buna görə “sistemin dəqiqliyi %91,78-dir” kimi tək və kontekstsiz rəqəm vermək elmi baxımdan yanıltıcı olar.

Qulaq nəticəsindəki böyük dəyişiklik

Mənbə Cədvəl 7-də qulaq aşkarlanması accuracy=0,63, precision=0,14, recall=0,01 və F1=0,07 kimi verilir. Cədvəl 8-də isə qulaq üçün accuracy və precision 0,3986, recall 1,0000 və F1=0,5700-dır.

Cədvəl 9 bu dəyişimi “heuristic refinement” sonrasında yaxşılaşma kimi şərh edir. Lakin tədqiqat tərəfindən müəyyən edilən altı heuristic xüsusiyyət arasında qulaq aşkarlanmasını düzəldən qayda yoxdur; heuristics gövdə nisbəti, çiyin, ikitərəfli ətraf, ətraf bağlantısı, bağlantı bölgəsi və boyun davamlılığıdır. Buna görə qulaq F1-indəki 0,07 → 0,57 dəyişimin texniki səbəbi mənbə mətnindən etibarlı şəkildə müəyyən edilə bilmir.

Qarışıqlıq matrisi nə göstərir?

143 rəsmlik testdə on vizual xüsusiyyətin qarışıqlıq matrisi ayrıca mühüm xəbərdarlıq verir:

Vizual xüsusiyyətTPFPTNFN
Qulaq578600
Göz142100
Saç1093400
Əl139400
Baş143000
Ayaq141200
Ağız140300
Boyun935000
Burun1063700
Gövdə139400

Bu rəqəmlər on vizual xüsusiyyətin hamısında FN=0 və TN=0 olduğunu göstərir. Buna görə modelin bu test cədvəlində vizual xüsusiyyətləri “yox” kimi düzgün aşkarlama qabiliyyəti ölçülmür. Bəzi yüksək recall və F1 balları bu prevalensiya və proqnoz quruluşundan təsirlənir.

Avtomatik bal necə hesablanır?

Mənbə formulunda 16 ikili xüsusiyyət birbaşa toplanır:

\[ S=\sum_{i=1}^{16}f_i \]

Burada \(f_i=1\) xüsusiyyətin olduğunu, \(f_i=0\) olmadığını göstərir. Beləliklə, ümumi bal 0 ilə 16 arasında dəyişir.

Mənbənin daha sonrakı nəticə mətnində bir yerdə 16 ikili çıxışın “averaging”, yəni ortalamasının alındığı yazılmışdır; eyni paraqraf dərhal ardınca 0–16 bal yaradıldığını bildirir. 0–16 şkalası və verilən tənlik toplamanı dəstəklədiyi üçün Verianla mətnində formulda göstərilən cəm istifadə edilmişdir.

Tədqiqatın əsas metodoloji məhdudiyyətləri

  • Ümumi məlumat dəsti cəmi 948 rəsmdir və mədəniyyətlərarası müstəqil doğrulama aparılmayıb.
  • Mənbədə istifadə olunan “mental age” qrupları xronoloji yaş deyil.
  • Kiçik anatomik xüsusiyyətlərdə güclü sinif balanssızlığı var.
  • Hold-out qarışıqlıq matrisində on CNN xüsusiyyətinin hamısında TN=0-dır.
  • Altı heuristic xüsusiyyət üçün çarpaz doğrulama etiketlərinin qaydalardan yaradılması qüsursuz CV ballarının müstəqil doğrulama olmadığı mənasına gəlir.
  • Heuristic hədlər məlumat dəstinə görə empirik tənzimlənmişdir və başqa rəsm üslublarında eyni dəqiqliyi verməyə bilər.
  • 16 xüsusiyyət ümumi balda bərabər çəki alır; mənbə müəllifləri bunun real DAP qiymətləndirmə sistemini tam təmsil etməyə biləcəyini qəbul edir.
  • Çarpaz doğrulamanın 805, yoxsa 948 rəsmdə aparıldığı barədə mənbədaxili uyğunsuzluq var.
  • ResNet təsnifat qatının 10, yoxsa 16 çıxış verdiyi barədə metod mətnində uyğunsuzluq var.
  • Mənbədə doğrulama məlumatı ilə hədd tənzimləməsi aparıldığı qeyd olunduğu halda, daha sonra çarpaz doğrulamanın hiperparametr tənzimləməsi üçün istifadə edilmədiyi bildirilir.
  • Cədvəl 7, Cədvəl 8 və Cədvəl 9 arasındakı performans mərhələləri və cədvəl istinadları tam ardıcıl deyil.
  • Avtomatik balın psixoloji və ya klinik diaqnostik etibarlılığı bu tədqiqatda müstəqil olaraq sınaqdan keçirilməyib.

Mənbə və Metod Qeydi

Tam orijinal tədqiqat adıAutomated Anatomical Feature Analysis and Scoring for Draw-a-Person Test Drawings via ResNet-Based Multi-Label Detection and Classification
MüəlliflərAsma Abdullah Alwadai; Emad Sami Jaha
Müəllif sırası1. Asma Abdullah Alwadai; 2. Emad Sami Jaha
Bərabər töhfə / bərabər birinci müəllifMənbə tədqiqatında bərabər töhfə bəyanı göstərilməyib.
Məsul müəllifAsma Abdullah Alwadai
QurumDepartment of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University, Jeddah 21589, Saudi Arabia
Mənbə növüEksperimental süni intellekt / kompüter görməsi tədqiqat məqaləsi.
Rəyçilik statusuRəyli jurnalda dərc olunmuş məqalədir; preprint deyil.
JurnalAI
NəşriyyatMDPI
Cild / say / məqalə2026, 7(4), 130
DOI10.3390/ai7040130
Qəbul tarixi4 mart 2026
Reviziya tarixi26 mart 2026
Qəbul olunma tarixi28 mart 2026
Nəşr tarixi2 aprel 2026
Rəsmi keçidhttps://doi.org/10.3390/ai7040130
LisenziyaCreative Commons Attribution (CC BY).

Maliyyələşdirmə və institusional dəstək

Məqalənin maliyyələşdirmə bəyanında tədqiqatın xarici maliyyə almadığı bildirilir. Təşəkkür bölməsində isə layihənin King Abdulaziz University daxilindəki KAU Endowment (WAQF) tərəfindən dəstəkləndiyi və WAQF ilə Deanship of Scientific Research-ə texniki və maliyyə dəstəyi üçün təşəkkür edildiyi yazılmışdır. Bu iki ifadə birlikdə qiymətləndirildikdə, tədqiqat “external funding” bildirmir, lakin qurumdaxili dəstək bəyan edir.

Etika və məlumat mənbəyi

Etik komitə qiymətləndirməsinin tədqiqatın ictimaiyyətə açıq və tam anonimləşdirilmiş məlumat dəstindən istifadə etməsi və yeni iştirakçı/məlumat toplama prosesi daxil etməməsi səbəbindən tələb olunmadığı bildirilmişdir. Məlumatlandırılmış razılıq buna görə tətbiq edilə bilməz.

Mənbə məlumat dəsti “Draw-a-Person Hand-Drawn Sketches by Children” adı ilə ictimaiyyətə açıq Kaggle deposundan götürülmüş və məqalədə giriş tarixi 30 noyabr 2025 kimi verilmişdir.

Müəllif töhfələri

Konseptuallaşdırma və metodologiya Asma Abdullah Alwadai ilə Emad Sami Jaha tərəfindən həyata keçirilmişdir. Proqram təminatı, doğrulama, tədqiqat, məlumatın təşkili, ilkin layihə və vizuallaşdırma vəzifələri əsasən Asma Abdullah Alwadai tərəfindən yerinə yetirilmişdir. Nəzarət və maliyyələşdirmənin əldə edilməsi Emad Sami Jaha tərəfindən üstlənilmiş; hər iki müəllif məqalənin nəzərdən keçirilməsi və redaktəsinə töhfə vermişdir.

Maraqların toqquşması

Müəlliflər maraqların toqquşmasının olmadığını bəyan etmişlər.

Mənbədaxili uyğunsuzluqların qeyd xülasəsi

  • Xülasədə 948 rəsmin ayrıca hold-out test dəsti olduğu yazılır; ətraflı metod 948-in ümumi məlumat dəsti, 143-ün isə test dəsti olduğunu göstərir.
  • Bir bölmə çarpaz doğrulamanı 805 rəsmdə, başqa bölmə bütün 948 rəsmdə təsvir edir.
  • Əsas arxitektura 10 CNN + 6 heuristic çıxışı göstərdiyi halda, bir alt bölmə ResNet classifier-ını 16 çıxışlı kimi təsvir edir.
  • İtki funksiyası bölməsində də CNN üçün 16 xüsusiyyət yazılması 10+6 arxitekturası ilə uyğun gəlmir.
  • Mətn %91,78 macro accuracy bildirdiyi halda, Cədvəl 7 ortalaması %91,75, Cədvəl 8 yekun ortalaması %87,80-dir.
  • Qulaq F1 dəyəri bir qiymətləndirmədə 0,07, digərində 0,57-dir və mənbə dəyişimin mexanizmini kifayət qədər izah etmir.
  • Cədvəl 9 qulaqdakı dəyişimi heuristic refinement ilə əlaqələndirsə də, müəyyən edilən altı heuristic qaydanın heç biri qulağa yönəlmir.
  • Nəticə mətnində balın bir yerdə “orta” olduğu yazılsa da, formul və 0–16 şkalası xüsusiyyətlərin toplandığını göstərir.
  • Çarpaz doğrulamada heuristic xüsusiyyətlərin hamısı 1,00 F1 verdiyi halda, müstəqil ekspert etiketli testdə ətraf–gövdə bağlantısı F1=0,4762-yə düşür.

Buna görə tədqiqatın ən möhkəm nəticəsi “süni intellekt artıq uşaq rəsmlərindən psixoloji qiymətləndirməni avtomatik və qüsursuz şəkildə edə bilir” deyil. Mənbənin dəstəklədiyi daha dar nəticə budur: ResNet əsaslı vizual xüsusiyyət aşkarlanmasının açıq həndəsi qaydalarla birləşdirilməsi müəyyən edilmiş 16 DAP rəsm xüsusiyyəti üçün avtomatik və şərh oluna bilən prototip qiymətləndirmə sistemi yarada bilir. Xüsusilə kiçik anatomik detallar, sinif balanssızlığı, qiymətləndirmə protokolundakı uyğunsuzluqlar və xarici doğrulamanın olmaması həll olunmadan sistemin klinik və ya psixoloji qərar mexanizmi kimi ümumiləşdirilməsi dəstəklənmir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy