
Бул изилдөө ар башка камераларда же ар башка убакта тартылган бир эле адамды кайра табууну максат кылган Person Re-Identification (Person Re-ID; адамды кайра идентификациялоо) маселесинде, өзгөчө дененин бир бөлүгү башка адамдар же объекттер тарабынан жабылып калган сүрөттөргө көңүл бурат. Изилдөөчүлөр адамдын бүтүндөй сүрөтүн билдирген бир гана глобалдык өзгөчөлүк векторуна таянуунун ордуна, баш, тулку, колдор жана буттар сыяктуу семантикалык дене аймактарынан келген локалдык маалыматты глобалдык көрүнүш маалыматы менен чогуу колдонгон Dynamic Part-Based Fusion (DPBF) архитектурасын сунушташат. Система эки негизги компоненттен турат: Salient Part Discrimination (SPD) адамды parsing кылуу жана attention карталарынын жардамы менен инсанды айырмалоодо пайдалуураак дене аймактарын баса белгилейт; Adaptive Feature Integration and Contextual Fusion (AFICF) болсо локалдык жана глобалдык өзгөчөлүктөрдүн ортосундагы корреляцияны талдап, кайталанган маалыматты азайтат жана бири-бирин толуктаган өзгөчөлүктөрдү бириктирет.
Модель Market-1501, DukeMTMC-ReID, CUHK03-Labeled, Occluded-Duke, Occluded-ReID жана P-DukeMTMC-ReID болуп эсептелген алты стандарттуу Person Re-ID маалымат топтомунда бааланды. Изилдөөнүн эң көрүнүктүү жыйынтыгы Occluded-ReIDде алынды: DPBF %93,5 Rank-1 жана %91,2 mAP көрсөткүчүнө жетти. Булактагы таблицада эң жакын күчтүү салыштыруу BPB Re-ID үчүн тиешелүүлүгүнө жараша %82,9 жана %75,2 болгондуктан арифметикалык айырмалар 10,6 Rank-1 упайы жана 16,0 mAP упайы болуп саналат. P-DukeMTMC-ReIDде DPBF %93,6 Rank-1 жана %83,6 mAP берген, ал эми Occluded-Dukeта %74,7 Rank-1 жана %60,7 mAP менен BPB Re-IDден бир аз төмөн калган. Ошондуктан модель бардык маалымат топтомдорунда талашсыз эң жакшы ыкма деп айтууга болбойт; анын күчтүү жагы, айрыкча айрым оор жабылуу сценарийлеринде локалдык жана глобалдык өзгөчөлүктөрдү чогуу пайдалана алышы.
Изилдөө дагы бир маанилүү чектөөнү сандык түрдө көрсөтөт. Оор жабылууда айрым жеке дене-бөлүк embedding'дери дээрлик колдонууга жараксыз болуп калышы мүмкүн. Үч жабылууга багытталган benchmarkта p7 деп аталган эң начар embedding'дин Rank-1 көрсөткүчү болжол менен %2–3 деңгээлине чейин түшөт. Ал эми бүтүндүк жана көрүнгөн аймактардан маалымат алып келген p0 өкүлчүлүгү %69,5–92,6 Rank-1 диапазонунда калат. Демек, DPBFнин ийгилиги ар бир дене бөлүгүн ишенимдүү тааный алганынан эмес, көрүнгөн жана бири-бирин толуктаган аймактардан келген маалыматты глобалдык контекст менен бириктирип, бир гана алсыз бөлүккө көз карандылыкты азайтканына байланыштуу.
Person Re-ID так кайсы маселени чечет?
Person Re-ID системасынын милдети бир камерадагы адамды башка камера сүрөтүндө же gallery топтомунун ичинен кайра табуу. Модель query сүрөтүнөн:
“Бул адам galleryдеги кайсы сүрөт менен бир эле инсанга таандык?”
деген суроого жооп табууга аракет кылат.
Бул маселе классикалык сүрөт классификациясынан айырмаланат. Модель болгону “адам барбы?” деген суроого жооп бербейт; көп сандагы окшош көрүнүштүү адамдардын арасынан ошол эле инсанды айырмалоого аракет кылат.
Бул тапшырма өзгөчө төмөнкү шарттарда татаалдашат:
- камера бурчунун өзгөрүшү,
- жарыктын өзгөрүшү,
- адамдын ар башка позада болушу,
- сүрөттүн чечилишинин төмөндөшү,
- окшош кийимчен адамдардын болушу,
- дененин бир бөлүгүнүн башка адам же объект тарабынан жабылышы.
Акыркы жагдай, башкача айтканда occlusion/жабылуу, бул изилдөөнүн негизги мотивациясы.
Эмне үчүн глобалдык өзгөчөлүк гана жетишсиз болушу мүмкүн?
CNN адамдын бүт сүрөтүн бир өзгөчөлүк векторуна кыскара алат. Бул өкүлчүлүк адамдын жалпы кийим түсү, дене көрүнүшү жана силуэти сыяктуу маалыматтарды алып жүрөт. Бирок адамдын маанилүү бөлүгү жабылса, глобалдык өзгөчөлүк вектору көрүнбөгөн же жаңылыштыруучу аймактардын таасирин да камтыйт.
Мисалы, адамдын төмөнкү тулкусу башка объект менен толук жабылса, глобалдык өкүлчүлүк инсанды айырмалоодо чындыгында көрүнгөн үстүңкү тулку, сумка же кийим текстурасы сыяктуу аймактарды жетиштүү күчтүү колдоно албай калышы мүмкүн.
Бөлүккө негизделген Re-ID ыкмаларынын максаты бул маселени чечүү үчүн адам денесин майда семантикалык аймактарга бөлүү.
DPBFнин негизги идеясы кандай?
Сунушталган система:
\[ \text{DPBF} = \text{SPD} + \text{AFICF} + \text{Hybrid Loss} \]
түрүндө каралышы мүмкүн.
SPD кайсы дене аймактары инсанды айырмалоочу маалымат алып жүрөрүн аныктоого аракет кылат.
AFICF ар башка дене бөлүктөрүнөн келген өзгөчөлүктөрдү адамдын бүт сүрөтүнөн алынган глобалдык өзгөчөлүк менен бириктирет.
Hybrid Loss Function болсо инсан классификациясын да, ошол эле адамга таандык embedding'дердин бири-бирине жакындашын жана башка адамдардын алысташын да максат кылат.
Маанилүү илимий айырма бар: изилдөөчүлөр attention, human parsing, PCC, PCA же triplet lossту жаңы ойлоп таптык деп айтпайт. Макаланын салымы бул түзүмдөрдүн occluded Person Re-ID үчүн координацияланган DPBF pipeline ичинде бирге колдонулуу ыкмасы.
Salient Part Discrimination эмне кылат?
SPDнин милдети адам сүрөтүн геометриялык жактан бирдей тилкелерге гана бөлүү эмес, маанилүү дене аймактарына дал келген attention карталарын түзүү.
Моделдин кириш өзгөчөлүк картасы:
\[ F \]
деп көрсөтүлөт. Бул өзгөчөлүк картасы алгач:
\[ 1\times1 \]
convolution катмарынан өткөрүлүп:
\[ F' \]
алынат.
Андан кийин жеңил CNN, global average pooling жана fully connected катмары менен:
\[ K \]
даана attention салмагы чыгарылат.
Алар:
\[ A_1,A_2,\ldots,A_K \]
түрүндө дене бөлүктөрүнө тиешелүү spatial attention карталарына айландырылат.
Grad-CAM бул жерде кандай колдонулат?
Изилдөө алдын ала аныкталган ар бир дене бөлүгү үчүн attention картасын түзүүдө Grad-CAM негизиндеги стратегияны колдонот.
Максат, мисалы:
- баш,
- тулку,
- сол/оң кол,
- сол/оң бут
сыяктуу аймактардын feature map үстүндөгү инсанды айырмалоо үчүн маанилүү активацияларын бөлүү.
Макаланын 6-бетиндеги 1-сүрөттө ошол эле адамдын сүрөтү ар башка семантикалык бөлүктөргө бөлүнүп, ар бир бөлүк үчүн түзүлгөн attention heatmap'дер көрсөтүлгөн. Айрым карталарда үстүңкү тулку же бут аймактары ачык түрдө жогорку активация алганы көрүнөт.
SCHP эмне үчүн системага кошулат?
Адам денесин туруктуу геометриялык тилкелерге гана бөлүү поза өзгөргөндө көйгөй жаратышы мүмкүн. Адам басып же эңкейип жатканда ошол эле координата аймагы ар бир сүрөттө ошол эле анатомиялык түзүлүшкө туура келбеши мүмкүн.
Ошондуктан изилдөө Self-Correction for Human Parsing (SCHP) моделинен алынган human parsing энбелгилерин колдонот.
Баштапкы parsing энбелгиси:
\[ Y_0=P(X) \]
түрүндө берилет.
Андан кийин correction network:
\[ C = \arg\min_C L \left( C(Y_0),Y_{GT} \right) \]
менен оптималдаштырылып, оңдолгон энбелги:
\[ Y_1=C(Y_0) \]
түрүндө алынат.
SPD бул parsing маалыматын attention механизми менен бириктирип, анатомиялык жактан туруктуураак бөлүк өкүлчүлүктөрүн түзүүгө аракет кылат.
Human parsing катасызбы?
Жок. Булак изилдөө муну атайын чектөө катары кабыл алат.
Оор жабылуу же адаттан тыш позада:
- бут жоголуп кетиши мүмкүн,
- кол туура эмес аймакка берилүүсү мүмкүн,
- parsing маскасы толук эмес чыгышы мүмкүн,
- анатомиялык бөлүктүн кичинекей гана бөлүгү көрүнүшү мүмкүн.
Ошондуктан модель attention механизмин parsing энбелгилерин жалгыз колдонууга альтернатива эмес, аларды толуктаган түзүм катары колдонот.
Cross-Part Spatial Feature Modulation Map деген эмне?
Attention карталары түзүлгөндөн кийин аларды жөн гана көрсөтүү жетишсиз. Ар бир attention map негизги өзгөчөлүк картасына колдонулат.
Ар бир дене бөлүгү үчүн:
\[ P_k=A_k\times F \]
element-wise multiplication операциясы колдонулат.
Мунун натыйжасында:
\[ P_1,P_2,\ldots,P_K \]
түрүндөгү бөлүккө-өзгөчө feature карталары алынат.
Андан кийин алар:
\[ P_{\mathrm{concat}} = \operatorname{Concat} (P_1,P_2,\ldots,P_K) \]
аркылуу бириктирилет.
Макаланын 8-бетиндеги 2-сүрөт жана 3-сүрөт бул операцияны так көрсөтөт: feature map бир нече attention map менен көбөйтүлүп, пайда болгон локалдык feature өкүлчүлүктөрү жалпы бөлүккө негизделген representationга өткөрүлөт.
Эмне үчүн локалдык жана глобалдык өзгөчөлүктөр кайра бириктирилет?
Дене бөлүктөрүнө гана таянуу да көйгөй жаратышы мүмкүн.
Мисалы:
- бут толук жабылса, бут embeddingи маанисиз болуп калышы мүмкүн,
- кол өтө кичине көрүнсө, feature ызы-чуу болушу мүмкүн,
- туура эмес parsing бир бөлүктү башка аймакка жылдырышы мүмкүн.
Глобалдык өзгөчөлүк болсо бүт сүрөттүн контекстин сактайт.
DPBF ошондуктан:
local body-part features + global contextual feature
айкалышын колдонот.
AFICF эмне үчүн жөнөкөй concatenation колдонбойт?
Локалдык жана глобалдык feature векторлорун түз эле жанаша кошуу өлчөмдү көбөйтөт. Андан да маанилүү маселе — бирдей маалымат алып жүргөн жогорку корреляциялуу feature'лердин системага бир нече жолу кириши.
AFICF ошондуктан адегенде өзгөчөлүктөрдүн ортосундагы Pearson корреляциясын эсептейт.
\[ r_{XY} = \frac{ \sum_{i=1}^{n} (X_i-\bar X)(Y_i-\bar Y) }{ \sqrt{ \sum_{i=1}^{n}(X_i-\bar X)^2 } \sqrt{ \sum_{i=1}^{n}(Y_i-\bar Y)^2 } } \]
\[ |r_{XY}|\approx1 \]
болгондо эки feature күчтүү сызыктуу байланышта жана мүмкүн болгон кайталанган маалымат алып жүрөт деп эсептелет.
AFICF жогорку корреляциялуу feature топторунда кайталанган компоненттерди азайтууну максат кылат.
PCA эмне үчүн колдонулат?
Pearson корреляциясынан кийин калган feature мейкиндигинде дагы өлчөмдүк кайталоо болушу мүмкүн. Ошондуктан Principal Component Analysis колдонулат.
Өзгөчөлүктөрдүн ортосундагы covariance:
\[ \operatorname{Cov}(X_j,X_k) = \frac{1}{n-1} \sum_{i=1}^{n} (X_{ij}-\bar X_j) (X_{ik}-\bar X_k) \]
менен эсептелет.
Эң жогорку eigenvalueларга туура келген principal component'тер сакталат да, акыркы өкүлчүлүк:
\[ 512 \]
өлчөмдүү компакт embeddingге түшүрүлөт.
DPBFнин training loss'у кантип иштейт?
Модель эки башка максатты чогуу оптималдаштырат.
Биринчи компонент cross-entropy loss:
\[ L_{\mathrm{CE}} = -\sum_{i=1}^{N} Y_i\log\hat Y_i. \]
Бул мүчө моделге глобалдык инсан айырмасын үйрөнүүгө жардам берет.
Экинчи компонент triplet loss:
\[ L_{\mathrm{triplet}} = \max \left( 0, D_{\mathrm{pos}} - D_{\mathrm{neg}} + m \right). \]
Бул жерде:
- \(D_{\mathrm{pos}}\): ошол эле адамга таандык эки embeddingдин аралыгы,
- \(D_{\mathrm{neg}}\): ар башка адамдарга таандык embeddingдердин аралыгы,
- \(m\): margin.
Изилдөөдө margin:
\[ m=0{,}3 \]
деп тандалган.
Акыркы Hybrid Loss:
\[ L_{\mathrm{Hybrid}} = \alpha L_{\mathrm{CE}} + \beta L_{\mathrm{TL}} \]
түрүндө.
Эки негизги loss компоненти бирдей салмакталган.
Модель кантип үйрөтүлгөн?
Изилдөөдө эки backbone колдонулган:
- ResNet-50,
- HRNet-w32.
ResNet-50 үчүн кириш сүрөтү:
\[ 256\times128 \]
пиксел; HRNet-w32 үчүн:
\[ 384\times128 \]
пиксел колдонулган.
Модель Adam optimizer менен үйрөтүлгөн; баштапкы learning rate:
\[ 3{,}5\times10^{-4} \]
деп берилген.
Warm-up баштапкы learning rate:
\[ 3{,}5\times10^{-5} \]
жана weight decay:
\[ 0{,}0005 \]
деп белгиленген.
Learning rate 40- жана 70-epoch'та азайтылган; жалпы training:
\[ 150\ \text{epoch} \]
уланган.
Ар бир инсан үчүн batch ичинде төрт sample колдонулган жана effective batch size маалымат топтому менен GPU шарттарына жараша 16–64 арасында өзгөргөн.
Кайсы маалымат топтомдору колдонулган?
Изилдөө эки benchmark тобун бөлүп карайт.
Бүтүн / стандарттуу Person Re-ID маалымат топтомдору:
- Market-1501,
- DukeMTMC-ReID,
- CUHK03-Labeled.
Жабылууга багытталган маалымат топтомдору:
- Occluded-Duke,
- Occluded-ReID,
- P-DukeMTMC-ReID.
Rank-1 Accuracy эмнени билдирет?
Query сүрөтү үчүн система galleryдеги адамдарды окшоштугу боюнча иреттейт.
Туура инсан тизмеде биринчи орунга чыкса, бул Rank-1 ийгилиги.
Мисалы:
\[ R1=93{,}5\% \]
деген жыйынтык колдонулган benchmark протоколунда queryлердин болжол менен %93,5инде туура инсан биринчи орунда болгонун билдирет.
mAP эмнени өлчөйт?
Mean Average Precision биринчи орунду гана эмес, ошол эле инсанга тиешелүү бардык туура дал келүүлөрдүн ranking тизмесиндеги жайгашуусун да эске алат.
Ошондуктан:
- Rank-1 биринчи жыйынтыкка,
- mAP бүт retrieval тизмесинин сапатына
көбүрөөк сезимтал.
Бүтүн benchmarkтарда жыйынтыктар кандай?
| Маалымат топтому | DPBF Rank-1 (%) | DPBF mAP (%) | Булак таблицадагы орду |
|---|---|---|---|
| Market-1501 | 96,0 | 89,3 | Rank-1 боюнча эң жогорку; mAP боюнча AaP-ReIDден төмөн |
| DukeMTMC-ReID | 92,0 | 82,8 | Rank-1 боюнча эң жогорку; mAP боюнча AaP-ReIDден төмөн |
| CUHK03-Labeled | 89,5 | 82,6 | Эки метрикада тең таблицадагы эң жогорку көрсөткүч |
Бул таблица маанилүү айырманы көрсөтөт. DPBF бардык benchmark жана бардык метрикада эң жогорку көрсөткүчтү берген эмес. Market-1501де AaP-ReIDдин mAP көрсөткүчү %93,9 болсо, DPBF %89,3; DukeMTMC-ReIDде AaP-ReID %88,6 mAP болсо, DPBF %82,8.
Ошондуктан моделдин күчтүү иштешин “бардык ыкмалардан бардык жерде жакшы” деп жалпылоого болбойт.
CUHK03-Labeled жыйынтыгы
DPBF:
\[ R1=89{,}5\%,\qquad mAP=82{,}6\% \]
көрсөткүчтөрүн берет.
R-1 боюнча таблицадагы кийинки эң жогорку көрсөткүч %84,7 болгондуктан айырма:
\[ 89{,}5-84{,}7 = 4{,}8 \]
упай.
mAP боюнча AaP-ReID %82,4 менен DPBFге эң жакын көрсөткүч. Ошондуктан арифметикалык айырма:
\[ 82{,}6-82{,}4 = 0{,}2 \]
упай.
Булак текстте айтылган 1,6 упайлык mAP айырмасы эң жакын көрсөткүч менен эмес, SCSNнин %81,0 mAP көрсөткүчү менен салыштырганда алынат.
Жабылууга багытталган маалымат топтомдорундагы жыйынтыктар
| Маалымат топтому | DPBF Rank-1 (%) | DPBF mAP (%) | Булак таблицадагы эң жакын күчтүү салыштыруу |
|---|---|---|---|
| Occluded-Duke | 74,7 | 60,7 | BPB Re-ID: 75,1 / 62,5 |
| Occluded-ReID | 93,5 | 91,2 | BPB Re-ID: 82,9 / 75,2 |
| P-DukeMTMC-ReID | 93,6 | 83,6 | BPB Re-ID: 93,0 / 83,2 |
Моделдин эң айкын артыкчылыгы Occluded-ReIDде көрүнөт.
Rank-1 айырмасы:
\[ 93{,}5-82{,}9 = 10{,}6 \]
упай;
mAP айырмасы:
\[ 91{,}2-75{,}2 = 16{,}0 \]
упай.
Булак бул айырмаларды пайыздык жакшыртуу деп айтат; бирок таблицадагы көрсөткүчтөрдү түз чыгарып эсептөө булардын пайыздык пункт айырмасы экенин көрсөтөт.
Occluded-Duke эмне үчүн маанилүү каршы мисал?
Occluded-Dukeта DPBF:
\[ 74{,}7/60{,}7 \]
натыйжа бергенде BPB Re-ID:
\[ 75{,}1/62{,}5 \]
берет.
Ошондуктан сунушталган архитектура жабылуу бар бардык маалымат топтомдорунда эң жакшы жыйынтык берет деп айтууга болбойт.
Бөлүктөрдүн саны көбөйгөндө көрсөткүч кандай өзгөрөт?
Market-1501 ablation изилдөөсүндө дене бөлүктөрүнүн үч башка майдалыгы сыналган:
- 3 бөлүк,
- 5 бөлүк,
- 8 бөлүк.
Үч supervision стратегиясынын баарында бөлүктөрдүн санын 3төн 8ге көбөйтүү жогорку көрсөткүч менен байланышкан.
Сегиз бөлүктүү конфигурацияда булакта “semi-supervised” деп аталган Parsing + PAM түзүмү:
\[ R1=96{,}0\%,\qquad mAP=89{,}3\% \]
жыйынтыгына жеткен.
Ошол эле сегиз бөлүктө supervised parsing гана:
\[ 92{,}6/85{,}3 \]
жана PAM негизиндеги unsupervised түзүм гана:
\[ 86{,}7/77{,}8 \]
жыйынтыгын берген.
Бул тажрыйба parsing маалыматын attention механизми менен чогуу колдонуу ушул benchmark жана конфигурацияда PAM гана же parsing гана болгон мамиледен күчтүүрөөк экенин колдойт.
DPBF менен PCBнин бөлүк саны боюнча салыштырылышы
DukeMTMC-ReIDде булак төмөнкү жыйынтыктарды берет:
| Бөлүк саны | DPBF R-1 (%) | DPBF mAP (%) | PCB R-1 (%) | PCB mAP (%) |
|---|---|---|---|---|
| 3 | 87,4 | 80,2 | 76,4 | 58,3 |
| 5 | 90,5 | 82,7 | 82,4 | 67,5 |
| 6 | 91,0 | 83,8 | 82,6 | 68,8 |
Булак бул жыйынтыктарды DPBFнин parsing-guided attention жана correlation-aware integration компоненттеринин чогуу салымына байланыштырат. Бирок таблица SPD жана AFICF компоненттеринин өз-өзүнчө толук изоляцияланган себептик салымын өлчөбөйт.
Өзгөчөлүктөрдү интеграциялоо тажрыйбасында эмне көрүнөт?
Occluded-ReIDдеги өзгөчөлүктөрдү интеграциялоо анализинде global pooled feature, body-part features, Pearson correlation refinement жана PCA компоненттери ар башка комбинацияларда алынып салынган.
Толук HLF конфигурациясында булак:
\[ mAP=73{,}7,\qquad R1=86{,}5 \]
деп берет.
Көбүрөөк feature-integration компоненттери алынып салынган сайын көрсөткүч:
\[ 68{,}7 \rightarrow 62{,}9 \rightarrow 57{,}5 \rightarrow 55{,}2 \]
mAP деңгээлдерине чейин төмөндөйт.
Бул тажрыйба локалдык + глобалдык өзгөчөлүктөрдү жана correlation/PCA refinementти бирге колдонууну колдойт.
Бирок бул таблицадагы акыркы HLF жыйынтыгы менен макаланын негизги Occluded-ReID салыштыруу таблицасындагы:
\[ 93{,}5\ R1,\qquad91{,}2\ mAP \]
көрсөткүчүнүн ортосунда чоң айырма бар. Булак бул эки баалоо конфигурациясы эмне үчүн мынчалык айырмалуу жыйынтык бергенин так протокол менен байланыштырбагандыктан, бул көрсөткүчтөр бир эле тажрыйбанын жыйынтыгы сыяктуу бириктирилбеши керек.
Оор жабылуу кайсы дене аймактарына эң көп таасир этет?
Изилдөөнүн attention heatmap'тери жана бөлүккө негизделген тесттери өзгөчө төмөнкү дене аймактары алсызыраак экенин көрсөтөт.
Булакта p0 эң күчтүү, p7 эң алсыз embedding катары берилген.
| Маалымат топтому | Эң күчтүү embedding | Эң алсыз embedding | Rank-1 айырмасы | mAP айырмасы |
|---|---|---|---|---|
| Occluded-ReID | p0: 91,5 / 84,8 | p7: 2,5 / 6,9 | 89,0 | 77,9 |
| Occluded-Duke | p0: 69,5 / 56,8 | p7: 2,9 / 1,4 | 66,6 | 55,4 |
| P-DukeMTMC-ReID | p0: 92,6 / 81,8 | p7: 2,4 / 1,5 | 90,2 | 80,3 |
Бул жыйынтык DPBFнин маанилүү чектөөсүн ачык көрсөтөт: көрүнбөгөн же дээрлик толугу менен жабылган дене бөлүгүнөн ишенимдүү инсан маалыматын чыгаруу дагы деле өтө кыйын.
Моделдин артыкчылыгы алсыз бөлүктү “оңдоодон” көбүрөөк, башка көрүнгөн аймактар жана глобалдык контекст аркылуу жалпы инсан өкүлчүлүгүн сактап турууга аракет кылышында.
5-сүрөттөгү булак-ичиндеги дал келбестик
Макаланын 5-сүрөт түшүндүрмөсүндө:
- (b) панели Occluded-ReID,
- (c) панели P-DukeMTMC-ReID
деп жазылган.
Бирок жарыяланган сүрөттүн график аталыштарында жогорку график:
p_dukemtmc_reid
жана төмөнкү график:
Market-1501
деп белгиленген.
Ошондуктан график панелдеринин аттары менен figure caption толук дал келбейт. Булак кайсынысын көздөгөнүн божомолдоп унчукпай оңдоонун ордуна бул белгисиздик сакталууга тийиш.
Эсептөө чыгымы кандай?
Булакта үч ыкманын batch processing жана эс тутум көрсөткүчтөрү төмөнкүдөй:
| Модель | Processing Time (s/batch) | Memory Usage (MB) |
|---|---|---|
| PCB + RPP | 129,8272 | 20.250 |
| BPB Re-ID | 122,7825 | 19.018 |
| DPBF | 126,2159 | 21.250 |
DPBF эң аз эс тутум колдонгон же эң тез ыкма эмес. BPB Re-ID төмөнүрөөк processing time жана эс тутум колдонушун көрсөтөт. DPBFнин максаты эсептөө боюнча абсолюттук минимум эмес, жабылууга туруктуулук менен эсептөө чыгымынын ортосунда атаандаштыкка жөндөмдүү тең салмак түзүү.
Модель канча параметр колдонот?
Булакта маалымат топтомуна жараша конфигурациялар үчүн болжол менен:
\[ 39{,}5-41{,}3\ \text{milyon} \]
параметр билдирилген.
FLOP көрсөткүчү болжол менен:
\[ 8{,}0\times10^9 \]
деңгээлинде.
RTX 4090 жана TITAN Xp кайталоолорунда жыйынтыктар туруктуубу?
Market-1501де TITAN Xp иши:
\[ 96{,}08\ R1,\quad89{,}32\ mAP \]
жана RTX 4090 иши:
\[ 95{,}67\ R1,\quad89{,}49\ mAP \]
берген.
DukeMTMC-ReIDде:
\[ 91{,}88/82{,}87 \]
жана:
\[ 92{,}06/82{,}87 \]
жыйынтыктары берилген.
P-DukeMTMC-ReIDде айырма бир аз чоңураак:
\[ 92{,}09/82{,}13 \]
менен:
\[ 93{,}62/83{,}67. \]
Авторлор бул салыштырууну ар башка hardware шарттарында көрсөткүч жалпысынан туруктуу калганынын далили катары беришет.
Бирок “reproducibility” бул жерде башка көз карандысыз изилдөө тобунун репликациясы дегенди билдирбейт; ошол эле изилдөөнүн ичинде ар башка hardwareларда жүргүзүлгөн кошумча training/evaluation иштер.
RTX 4090 баалоо убактысын канчага кыскартат?
Market-1501 evaluation batch time:
\[ 0{,}444\ \text{s} \rightarrow 0{,}126\ \text{s} \]
DukeMTMC-ReID:
\[ 0{,}454 \rightarrow 0{,}130\ \text{s} \]
жана P-DukeMTMC-ReID:
\[ 0{,}410 \rightarrow 0{,}128\ \text{s} \]
деп берилген.
Бул айырма модель алгоритминдеги өзгөрүүдөн эмес, колдонулган GPU архитектураларынын эсептөө кубатынан келип чыгат.
Түркия үчүн изилдөө эмнени билдирет?
Изилдөөдө Түркиядан чогултулган камера маалыматы же Түркияга таандык Person Re-ID benchmark жок. Ошондуктан берилген:
\[ 93{,}5\%, \quad 91{,}2\% \]
сыяктуу жыйынтыктарды Түркиядагы аэропорт, фабрика, кампус же коопсуздук камераларында күтүлүүчү ийгилик көрсөткүчү катары колдонууга болбойт.
Түркияда колдонулуучу система үчүн камеранын чечилиши, камера бийиктиги, элдин тыгыздыгы, кийим окшоштугу, сүрөттү кысуу, түн/күн шарттары жана жабылуу түзүмү сыяктуу факторлор менен өзүнчө жергиликтүү баалоо жүргүзүлүшү керек.
Изилдөө колдогон жыйынтыктар
- SPD жана AFICF координацияланып колдонулган DPBF алты Person Re-ID benchmarkта атаандаштыкка жөндөмдүү жыйынтыктарды чыгарган.
- Occluded-ReIDде булак таблицадагы эң жакын салыштырууга караганда 10,6 Rank-1 упай жана 16,0 mAP упай жогорку жыйынтык берилген.
- P-DukeMTMC-ReIDде DPBF булак таблицадагы эң жогорку Rank-1 жана mAP көрсөткүчтөрүн берген.
- Market-1501 жана DukeMTMC-ReIDде DPBF Rank-1 боюнча таблицадагы эң жогорку жыйынтыкты берет, бирок mAP боюнча эң жакшы ыкма эмес.
- Occluded-Dukeта DPBF булак таблицадагы BPB Re-ID жыйынтыгынан төмөн калган.
- Market-1501 ablationында 8 бөлүктүү Parsing + PAM конфигурациясы 3 жана 5 бөлүктүү альтернативалардан жогору көрсөткүч берген.
- Оор жабылуу төмөнкү дене embeddingдеринде чоң көрсөткүч жоготуусуна алып келген.
- Ар башка GPU чөйрөлөрүндөгү кошумча trainingдер жалпысынан окшош R-1 жана mAP жыйынтыктарын берген.
Изилдөө далилдебеген нерселер
- DPBF бардык Person Re-ID маалымат топтомдорунда бардык учурдагы ыкмалардан жогору экени далилденген эмес.
- Benchmark жыйынтыктары реалдуу шаардык камера тармагында талаа ийгилиги катары текшерилген эмес.
- Бөлүккө негизделген attention оор жабылуунун таасирин толук жойбойт.
- Ар бир дене бөлүгү ишенимдүү инсан маалыматын алып жүрөрү көрсөтүлгөн эмес; p7 жыйынтыктары тескерисин көрсөтөт.
- Baselineдер бирдей код, backbone, input resolution жана training pipeline менен толугу менен кайра иштетилген эмес.
- Булак таблицалардагы көрсөткүч айырмалары үчүн confidence interval же formal significance test берилген эмес.
- DPBF computationally эң жеңил же эң тез Re-ID модель экени көрсөтүлгөн эмес.
- Hardwareлар арасындагы кайталоолор көз карандысыз үчүнчү тарап репликациясы эмес.
Изилдөөнүн Ыкмасы жана Жыйынтыктары
DPBF иштетүү pipeline
Макаладагы Algorithm 1ге ылайык training төмөнкү иретте жүрөт:
- Кириш сүрөтүнөн CNN backbone feature map'тери чыгарылат.
- SPD менен parsing-guided body-part representations түзүлөт.
- Локалдык body-part embedding'дер жана global contextual embedding алынат.
- AFICF менен локалдык жана глобалдык өзгөчөлүктөрдүн байланышы жөнгө салынат.
- Pearson корреляция анализи менен кайталанган feature компоненттери азайтылат.
- PCA менен компакт discriminative embedding түзүлөт.
- Локалдык жана глобалдык өкүлчүлүктөр бириктирилет.
- Модель Hybrid Loss менен оптималдаштырылат.
Inference баскычында болсо:
- query жана gallery сүрөттөрүнөн нормалдаштырылган embedding'дер алынат,
- embedding жуптарынын ортосунда Euclidean distance эсептелет,
- gallery сүрөттөрү аралык боюнча кичинеден чоңго иреттелет,
- инсан дал келүүсү retrieval тизмеси катары кайтарылат.
Архитектура агымынын кыска математикалык жыйынтыгы
Бир сүрөт:
\[ X \]
backbone'га киргенде:
\[ X \rightarrow F \]
өзгөчөлүк картасы түзүлөт.
SPD:
\[ F \rightarrow \{A_1,\ldots,A_K\} \]
attention карталарын түзөт.
Андан кийин:
\[ P_k=A_k\odot F \]
менен ар бир body-part representation түзүлөт.
Алар:
\[ P_{\mathrm{concat}} = [P_1;\ldots;P_K] \]
түрүндө бириктирилет.
AFICF:
\[ (P_{\mathrm{concat}},G) \rightarrow \text{PCC refinement} \rightarrow \text{PCA} \rightarrow E \]
процесси менен акыркы embeddingди чыгарат.
Inference учурунда эки embeddingдин Euclidean аралыгы азайган сайын система сүрөттөр бир эле инсанга таандык болуу ыктымалдыгын rankingде жогору деп эсептейт.
Market-1501 негизги жыйынтыгы
Акыркы DPBF:
\[ 96{,}0\% \ R1 \]
жана:
\[ 89{,}3\% \ mAP \]
берген.
Rank-1 булак таблицада эң жогорку, ал эми mAP боюнча AaP-ReID %93,9 менен жогору.
DukeMTMC-ReID негизги жыйынтыгы
DPBF:
\[ 92{,}0\% \ R1 \]
жана:
\[ 82{,}8\% \ mAP \]
берген.
Rank-1 булак таблицадагы эң жогорку жыйынтык. mAP боюнча AaP-ReID %88,6 менен жогору көрсөткүчкө ээ.
CUHK03-Labeled негизги жыйынтыгы
DPBF:
\[ 89{,}5\% \ R1 \]
жана:
\[ 82{,}6\% \ mAP \]
менен булак таблицадагы эң жогорку эки метриканы берген.
Occluded-ReID негизги жыйынтыгы
DPBFнин эң күчтүү benchmark жыйынтыгы ушул жерде:
\[ 93{,}5\% \ R1, \qquad 91{,}2\% \ mAP. \]
Булак таблицадагы кийинки жогорку R-1 BPB Re-IDдин:
\[ 82{,}9\% \]
көрсөткүчү.
mAP үчүн ошол эле модель:
\[ 75{,}2\% \]
берет.
P-DukeMTMC-ReID жыйынтыгы
DPBF:
\[ 93{,}6\% \ R1, \qquad 83{,}6\% \ mAP \]
жыйынтыгына жеткен.
BPB Re-ID:
\[ 93{,}0/83{,}2 \]
болгондуктан айырмалар тиешелүүлүгүнө жараша 0,6 жана 0,4 упай.
Occluded-Duke жыйынтыгы
DPBF:
\[ 74{,}7/60{,}7 \]
берген.
BPB Re-ID болсо:
\[ 75{,}1/62{,}5 \]
менен эки метрикада тең бир аз жогору натыйжа алган.
Жабылуу анализи эмнени көрсөтөт?
Изилдөөнүн 6-сүрөтүндөгү heatmap'терде жашыл чектер ийгиликтүү feature localization мисалдарын, кызыл чектер болсо алсыз же туура эмес representation'дарды көрсөтөт.
Жеңил жабылууда үстүңкү тулку жана көрүнгөн кийим аймактарындагы attention активациясы сакталышы мүмкүн, ал эми оор жабылууда өзгөчө:
- таман,
- төмөнкү бут,
- толугу менен көрүнбөгөн мүчөлөр
өтө алсыз feature чыгарат.
8-таблица бул визуалдык байкоону сандык түрдө ырастайт.
DPBF оор жабылууну кантип жумшартат?
Булак жыйынтыктарына ылайык чечим жабылган бөлүктөн маалыматты “кайра жаратуу” эмес.
Анын ордуна:
- көрүнгөн дене аймактары өз-өзүнчө көрсөтүлөт,
- күчтүү локалдык өзгөчөлүктөр глобалдык көрүнүш маалыматы менен бириктирилет,
- кайталанган өзгөчөлүктөр PCC/PCA менен азайтылат,
- бир гана локалдык бөлүккө көз карандылык азайтылат.
Ошондуктан DPBFнин негизги артыкчылыгын adaptive local–global compensation деп түшүндүрүүгө болот.
Моделдин практикалык чектөөлөрү
Авторлор жыйынтык бөлүмүндө белгилеген келечектеги иш багыттары:
- оор жабылууда туруктуураак parsing,
- adaptive part weighting,
- occlusion-aware feature reconstruction,
- төмөн чечилиште күчтүүрөөк representation,
- бири-бирине өтө окшош адамдарды айырмалоо,
- transformer негизиндеги global–local interaction.
Бул келечектеги иш сунуштары азыркы DPBF бул көйгөйлөрдү толук чечпегенин да көрсөтөт.
Салыштыруулардын методологиялык чеги
Изилдөө baseline моделдердин көпчүлүк көрсөткүчтөрүн алардын оригинал макалаларынан алган. Ошондуктан моделдердин ортосунда:
- backbone,
- кириш чечилиши,
- augmentation,
- optimizer жөндөөлөрү,
- кошумча training техникалары
толугу менен бирдей эмес.
Авторлор стандарттуу benchmark протоколдору астында жарыяланган жыйынтыктарды гана тандап, салыштыруудагы biasты азайтууга аракет кылышкан.
Ошондуктан таблицалар тармакта жарыяланган көрсөткүч деңгээлдерине салыштыруу берет; бирок бир лабораторияда толук тең шарттарда өткөрүлгөн бирдиктүү benchmark эмес.
Статистикалык маанилүүлүк чеги
Макала Rank-1 жана mAP айырмаларын берет, бирок ар башка моделдердин benchmark айырмалары үчүн:
- confidence interval,
- bootstrap uncertainty,
- paired significance test
бербейт.
Ошондуктан, мисалы, Occluded-ReIDдеги 10,6 жана 16,0 упайлык айырмалар чоң сандык айырмалар; бирок “статистикалык маанилүү артыкчылык” деген сөз formal hypothesis test менен колдоого алынган эмес.
Булак жана Ыкма Эскертүүсү
Толук оригинал иштин аталышы: Strategic Feature Integration for Superior Person Re-ID: A Part-Based Approach
Авторлор: Ghaith Hussein; Jeremy S. Smith; Waleed Al-Nuaimy.
Тең биринчи/тең салым: Булакта тең биринчи автор же тең салым билдирүүсү жок.
Жооптуу автор: Ghaith Hussein.
Мекеме: Department of Electrical Engineering and Electronics, University of Liverpool, Brownlow Hill, Liverpool L69 3GJ, United Kingdom.
Булак түрү: Рецензияланган оригинал изилдөө макаласы; computer vision жана deep-learning негизиндеги Person Re-Identification иши.
Журнал: AI.
Басмакана: MDPI, Basel, Switzerland.
Библиографиялык жазуу: AI, 2026, Том 7, Сан 6, Макала 210.
DOI: 10.3390/ai7060210.
Алынган / ревизия / кабыл алуу / жарыялоо: 30-март 2026 / 1-июнь 2026 / 2-июнь 2026 / 9-июнь 2026.
Рецензия статусу: Рецензияланган журнал жарыясы.
Лицензия: Creative Commons Attribution (CC BY).
Academic Editor: Miguel Angel Cazorla.
Булакта берилген ачкыч сөздөр: Salient Part Discrimination; Adaptive Feature Integration and Contextual Fusion; Person Re-ID; attention mechanism; feature fusion.
Сунушталган модель: Dynamic Part-Based Fusion (DPBF).
Негизги модель компоненти 1: Salient Part Discrimination (SPD).
Негизги модель компоненти 2: Adaptive Feature Integration and Contextual Fusion (AFICF).
Parsing модели: Self-Correction for Human Parsing (SCHP).
Attention мамилеси: Grad-CAM негизиндеги бөлүккө-өзгөчө attention карталары жана Cross-Part Spatial Feature Modulation Map.
Feature redundancy анализи: Pearson Correlation Coefficient.
Өлчөмдү азайтуу: Principal Component Analysis; акыркы компакт representation 512 өлчөм.
Loss: Cross-entropy + triplet loss түзгөн Hybrid Loss Function. Triplet margin 0,3; эки негизги loss бирдей салмакта.
Кошумча бөлүк-supervision loss: Pixel-level cross-entropy weight 0,35.
Backbone'дор: ResNet-50 жана HRNet-w32.
ResNet-50 кириш өлчөмү: 256 × 128 пиксел.
HRNet-w32 кириш өлчөмү: 384 × 128 пиксел.
Optimizer: Adam.
Негизги learning rate: \(3,5\times10^{-4}\).
Warm-up learning rate: \(3,5\times10^{-5}\).
Weight decay: 0,0005.
Training: 150 epoch; learning rate 40- жана 70-epochта азайтылган.
Sampling: RandomIdentitySampler; ар бир инсанга төрт instance.
Batch size: Тажрыйба конфигурациясына жараша 16–64.
Data augmentation: Random cropping, normalization жана random erasing.
Benchmark маалымат топтомдору: Market-1501, DukeMTMC-ReID, CUHK03-Labeled, Occluded-Duke, Occluded-ReID жана P-DukeMTMC-ReID.
Негизги баалоо метрикалары: Rank-1 Accuracy жана mean Average Precision (mAP).
Occluded-ReID акыркы жыйынтыгы: %93,5 Rank-1 жана %91,2 mAP.
P-DukeMTMC-ReID акыркы жыйынтыгы: %93,6 Rank-1 жана %83,6 mAP.
Occluded-Duke акыркы жыйынтыгы: %74,7 Rank-1 жана %60,7 mAP.
Market-1501 акыркы жыйынтыгы: %96,0 Rank-1 жана %89,3 mAP.
DukeMTMC-ReID акыркы жыйынтыгы: %92,0 Rank-1 жана %82,8 mAP.
CUHK03-Labeled акыркы жыйынтыгы: %89,5 Rank-1 жана %82,6 mAP.
Модель татаалдыгы: Колдонулган конфигурацияга жараша болжол менен 39,5–41,3 миллион параметр жана болжол менен 8,0 миллиард FLOP берилген.
Негизги training GPU: NVIDIA GeForce RTX 4090, 24 GB.
Кошумча эксперимент hardware: 2 × NVIDIA GeForce TITAN Xp.
Re-ranking: Булакка ылайык башкача көрсөтүлбөсө салыштырма жыйынтыктарда re-ranking колдонулган эмес.
Каржылоо: Изилдөө тышкы каржылоо алган эмес.
Этика комитети: Жаңы адам катышуучулары же жаңы маалымат чогултуу болбогондуктан жана ачык benchmark маалымат топтомдору гана колдонулгандыктан этикалык баалоо/approval waived деп берилген.
Маалымдалган макулдук: Изилдөөчүлөр жаңы адам маалыматын чогултпагандыктан waived деп берилген; колдонулган сүрөттөр оригинал benchmark провайдерлери мурда жарыялаган маалымат топтомдорунан алынган.
Маалымат жеткиликтүүлүгү: Колдонулган алты benchmark ачык экени айтылган жана маалымат булактары макалада берилген.
Авторлордун салымы: Концептуалдаштыруу G.H.; методология жана программалык камсыздоо G.H.; валидация G.H. жана J.S.S.; формалдык анализ G.H.; изилдөө G.H. жана J.S.S.; биринчи долбоор G.H.; карап чыгуу/редакция J.S.S. жана W.A.-N.; жетекчилик W.A.-N.
Кызыкчылыктардын кагылышы: Авторлор кызыкчылыктардын кагылышын билдиришкен эмес.
Булак ичиндеги дал келбестик жана отчеттук эскертүүлөр
Occluded-ReIDдеги final benchmark 2-таблицада DPBF үчүн %93,5 R-1 жана %91,2 mAP берсе, ошол эле маалымат топтомундагы feature-integration analysis 3-таблицанын HLF сабында %86,5 R-1 жана %73,7 mAP берет. Макала бул айырманы так backbone/protocol түшүндүрмөсү менен байланыштырбайт. Ошондуктан эки көрсөткүч топтому өзүнчө тажрыйба контексттери катары сакталган.
Булак тексттеги Occluded-ReID салыштыруусу “%10,6 R-1 өсүшү жана %16 mAP жакшыртуусу” деп берилген. Таблица көрсөткүчтөрүнөн эсептелген айырмалар 10,6 жана 16,0 пайыздык пункт. Бул Verianla тексти салыштырмалуу пайыздык жакшыртуу маанисин жаратпоо үчүн “упай айырмасы” деген сөздү колдонот.
CUHK03-Labeled үчүн булак баяны эң жакын атаандашка карата 4,8 R-1 жана 1,6 mAP артыкчылыгын айтат. 1-таблица R-1 үчүн 4,8 упайды ырастайт, бирок DPBFнин %82,6 mAP көрсөткүчүнө эң жакын AaP-ReIDдин %82,4 көрсөткүчү; айырма 0,2 упай. 1,6 упай айырма SCSNнин %81,0 көрсөткүчү менен салыштырганда алынат.
5-сүрөттүн түшүндүрмөсүндө (b) Occluded-ReID жана (c) P-DukeMTMC-ReID деп жазылган, бирок жарыяланган сүрөттүн график аталыштарында `p_dukemtmc_reid` жана `Market-1501` деген жазуулар көрүнөт. Бул figure-caption дал келбестигинде кайсы энбелги авторлор көздөгөн акыркы версия экени булакта такталбайт.
Салыштырма жыйынтыктарды түшүндүрүү чеги
Макаланын baseline жыйынтыктары негизинен тиешелүү ыкмалардын оригинал жарыяларынан алынган. Булак муну ачык айтат жана backbone, input resolution, data augmentation, optimization жана auxiliary training техникалары ар башка болушу мүмкүн экенин кабыл алат.
Ошондуктан салыштыруу таблицалары:
“стандарттуу benchmark адабиятындагы жарыяланган жыйынтыктарга карата эмпирикалык позициялоо”
катары окулушу керек.
Бардык ыкмалар бир эле codebase, бир эле seed, бир эле backbone жана бир эле GPU астында кайра иштетилген көзөмөлдөнгөн benchmark катары кабыл алынбашы керек.
Илимий түшүндүрүү чеги
DPBF айрыкча Occluded-ReID жана P-DukeMTMC-ReIDде күчтүү жыйынтыктарды көрсөтөт; бирок Occluded-Dukeта булак таблицадагы эң жакшы система эмес жана бүтүн benchmarkтарда да ар бир mAP метрикасында лидер эмес.
Изилдөөнүн оор жабылуу анализи төмөнкү дене же толугу менен көрүнбөгөн аймактардын feature reliabilityси өтө олуттуу төмөндөй аларын ачык көрсөтөт. Демек система “жабылуудан таасирленбеген адам таануу” чечими эмес.
Мындан тышкары колдонулган метрикалар академиялык retrieval benchmarkтарга тиешелүү. Жыйынтыктар реалдуу камера тармагында инсанды тастыктоо кепилдиги, коопсуздук кепилдиги же талаа колдонмосунда ошол эле тактык деңгээли алынат дегенди билдирбейт.

Пикир калтырыңыз
E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген