Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Maşın Elmi / Açıq Mühitlərdə İnsansız Yerüstü Vasitələr üçün Yüngül Piyada və Nəqliyyat Vasitəsi Aşkarlama Üsulu
Kompüter Elmləri

Açıq Mühitlərdə İnsansız Yerüstü Vasitələr üçün Yüngül Piyada və Nəqliyyat Vasitəsi Aşkarlama Üsulu

Bu tədqiqat açıq və mürəkkəb mühitlərdə işləyən insansız yerüstü vasitələrin (Unmanned Ground Vehicles, UGV) piyadaları və nəqliyyat vasitələrini real vaxtda aşkarlaya bilməsi üçün YOLO11n əsaslı yüngül bir obyekt aşkarlama modeli olan UGV-Net-i inkişaf etdirir.

07/08/2026  Veri Anla 55 baxış
Açıq Mühitlərdə İnsansız Yerüstü Vasitələr üçün Yüngül Piyada və Nəqliyyat Vasitəsi Aşkarlama Üsulu

Bu tədqiqat, açıq və mürəkkəb mühitlərda çalışan insansız yerüstü vasitələrnın (Unmanned Ground Vehicles, UGV) piyada və nəqliyyat vasitələriı real vaxtlı kimi algılayabilmesi üçün YOLO11n tabanlı yüngül bir obyekt aşkarlama modəli olan UGV-Net'i inkişaf etdirir. Modəl; xüsusiyyət təmsilini və qlobal kontekst kullanımını güclendiren C3k2_PS, küçük nesnelerdə ayrıntı kaybını azaltmayı amaçlayan məzmun həssas Dysample dinamik üst nümunələmə və aşkarlama başlığındaki hesaplama tekrarını azaltırken ayrıntı temsilini korumaya çalışan LSDECD olmak üzere üç əsas dəğişiklik içerir. KITTI testlərində YOLO11n taban çizgisine görə F1 skoru %83,44'ten %85,63'e, mAP50 %87,18'dən %89,44'e və mAP50-95 %63,97'dən %66,07'ye yükselirken hesablama dəyəri 6,3 GFLOPs'tan 4,9 GFLOPs'a və parametr sayı 2,58 milyondan 2,41 milyona düşmüştür. Jetson Orin Nano üzərində UGV-Net orta 27,9 FPS və 35,84 ms gecikmə vərmiştir. Bununla birlikdə nəticələr tam bir real UGV sahə sürüşü və ya bütün hava/aydınlatma koşullarının doğrulaması dəğildir; tədqiqatçılar aşırı ışık dəğişimleri, yşəbəkəış, duman, düşük gece görüşü və çoxsensorlu birleştirmeyi gelecekteki tədqiqatlar arasında göstərir.

Tədqiqatın ana problemi dəqiqlik ilə hesablama səmərəliliyinin eyni anda korunmasıdır. Açık yol görüntülərində uzaktaki küçük nesneler az sayıda piksel kaplamakta, piyadalar və ya nəqliyyat vasitələri kısmen örtülebilmekte və direk, bitki, bina kənarı gibi yüksek kontrastlı arka plan yapıları yanlış pozitivleri artırabilmektedir. Öte yandan mobil robotlarda kullanılan kənar avadanlıqın hesablama gücü, yaddaş və güc bütçesi məhduddur. UGV-Net bu iki gereksinimi eyni arxitekturadə ele almayı amaçlamaktadır.

Tədqiqatdaki en güclü nicel nəticə yalnız dəqiqlik artımı dəğildir. Üç modül birlikdə kullanıldığında KITTI'də taban YOLO11n'e görə F1'də 2,19 yüzdə balı, mAP50'də 2,26 yüzdə balı və mAP50-95'te 2,10 yüzdə balı artım eldə edilirken GFLOPs təxminən %22,22 azaltılmıştır. Böylece dəqiqlik artımı hesablama dəyərinin artırılmasıyla dəğil, eyni anda daha düşük hesablama yüküyle əldə edilmişdir.

SODA10M və FLIR nəticələri da fərqli görüntü dşəbəkəılımlarında performansın korunabildiğini dəsteklemektedir. SODA10M'də UGV-Net'in F1 skoru %58,10, mAP50 dəyəri %58,48 və mAP50-95 dəyəri %39,37; FLIR'in tədqiqatda kullanılan RGB görüntülərində ise sırasıyla %74,23, %78,36 və %39,82'dir. Ancaq bu məlumat kümeleri də təlim/doğrulama/test bölünmesine tabi tutulduğu üçün nəticələr, təlim görmemiş yeni bir alanda birbaşa zero-shot ümumiləşmə kanıtı dəğildir.

Türkiyə baxımından anlamı: Tədqiqatın üsulu; kampüs içi mobil robotlar, lojistik robotları, fabrika dış sahə nəqliyyat vasitələriı, tarımsal mobil platformlar və ya başqa UGV türleri üçün düşük güclü kənar avadanlıq üzərində piyada və nəqliyyat vasitəsi aşkarlamasının nasıl yüngülletiləbiləceğine dair uygulanabilir bir tədqiqat yaklaşımı sunmaktadır. Ancaq KITTI, SODA10M və FLIR'dəki başarı nisbətlarının Türkiyə'dəki fərqli yol geometriləri, kamera dumantemləri, hava şəraitləri, piyada davranışları və ya UGV sensor yerleşimlerində aynen korunacşəbəkəı çıkarılamaz. Böyle bir tətbiqda yerli məlumatyle yenidən təlim və real nəqliyyat vasitəsi üzərində sahə doğrulaması gerekir.

Tədqiqatın əsas problemi nedir?

UGV algı dumanteminin əsas görəvi çevresindəki dinamik engelleri yeterince hızlı və doğru biçimdə aşkarlama edərek sonraki qərarvərmə və yol planlaması katmanlarına güvənilir bilgi sşəbəkəlamaktır. Tədqiqatçılar xüsusilə üç zor koşula odaklanmaktadır: uzaktaki kiçik hədəflər, qismən örtülmə və mürəkkəb fon.

Hafif obyekt aşkarlama modəlləri kənar cihazlarda hızlı çalışabilse də şəbəkə tutumsinin azaltılması küçük nesnelerin ince kənar və tekstura xüsusilərini kaybetme riskini artırabilir. Daha şəbəkəır modəllər ise yüksek dəqiqlik sşəbəkəlasa bilə UGV üzərindəki məhdud işlemci/GPU gücü və enerji bütçesi nedəniyle real vaxtlı kullanım üçün uygun olmayabilir. Tədqiqatdaki tasarım problemi bu dəqiqlik–məlumatmlilik dəngesidir.

UGV-Net hangi modəldən geliştirildi?

UGV-Net'in taban arxitekturası YOLO11n'dir. YOLO11n; backbone, neck və dətection head olmak üzere üç əsas bölümdən oluşmaktadır. Backbone görüntüdən çok seviyeli xüsusiləri çıkarır; neck, yüksek düzey semantik bilgi ilə yüksek çözünürlüklü konumsal ayrıntıları birleştirir; dətection head ise fərqli ölçeklerdə sınıflandırma və konum tahmini üretir.

Tədqiqatçılar YOLO11n'i tamamen yenidən tasarlamak yerine üç noktayı dəğiştirmiştir:

  • C3k2_PS: backbone üçündəki özellik çıkarımını və kanal-bşəbəkəlam etkiləşimini geliştirmek,
  • Dysample: neck bölümündəki üst nümunələmədə kiçik hədəf ayrıntılarını və uzamsal hizalamayı korumak,
  • LSDECD: dətection head hesaplama tekrarını azaltırken kənar və tekstura gibi ayrıntıları korumak.
Şekil 1: Tədqiqatın üsul və arxitektura açıklamalarına dayanarak Verianla üçün hazırlanmış açıklayıcı özgün şema. Kaynak tədqiqatdaki şəbəkə diyagramının bire bir kopyası dəğildir.

C3k2_PS modülü neyi dəğiştiriyor?

YOLO11n'dəki C3k2 yapistiliknda özellik çıkarımı şəbəkəırlıklı kimi yerli evrişimlerle realleştirilir. Tədqiqatçılar bunun mürəkkəb fonda və ya örtülmüş hedəflerdə uzak bölgeler arasındaki ilişkiyi temsil etmekte məhdud kalabiləceğini savunmaktadır.

C3k2_PS üçündə geleneksel Bottleneck yapistiliknın yerini StarNet'ten alınan Star Block alır. Star Block iki dalda üretilən xüsusilərin eleman bazında çarpımı üzerindən yüksək dəreceli özellik etkiləşimi üretir. Ardından PCSA — Progressive Channel-wise Self-Attention, kanallar arasındaki bşəbəkəımlılıkları modəlleyerek arka plan və ya gereksiz kanalları baskılamayı və hedəfle ilgili semantik kanalları güclendirmeyi amaçlar.

PCSA'ya girmedən əvvəl özellik haritası:

\[ X_s \in \mathbb{R}^{B\times C\times H\times W} \]

biçimindədir. Burada \(B\) batch büyüklüğü, \(C\) kanal sayistilik, \(H\) yükseklik və \(W\) genişliktir. Uzamsal sıkıştırma:

\[ X_p = Pool_{(7,7)}^{(H,W)\rightarrow(H',W')}(X_s) \]

ilə yapılır. Ardından sorğu, açar və dəyər temsilleri:

\[ Q=F_{\mathrm{proj}}^{Q}(X_p),\quad K=F_{\mathrm{proj}}^{K}(X_p),\quad V=F_{\mathrm{proj}}^{V}(X_p) \]

kimi eldə edilir.

Kanal boyutundaki tek başlı self-attention işlemi:

\[ X_{\mathrm{attn}} = Softmax\left(\frac{QK^T}{\sqrt{C}}\right)V \]

ilə tanımlanır. Son aşamada sigmoid ilə oluşturulan kanal şəbəkəırlıkları giriş xüsusilərine uygulanır. Tədqiqatdaki amaç, Star Block sonrasında güclenen ancaq arka plan səs-küysünü də içerebilən xüsusilərdən hedəfle ilişkili kanalları seçici biçimdə öne çıkarmaktır.

Ablasyonda C3k2_PS tek başına ne yaptı?

C3k2_PS tek başına eklendiğində büyük bir performans sıçraması oluşmamıştır. Taban YOLO11n'in F1 dəyəri %83,44 iken yalnız C3k2_PS kullanımında %83,35 olmuştur. Buna qarşılıq mAP50 %87,18'dən %87,32'ye və mAP50-95 %63,97'dən %64,05'e yükselmiştir. Bu nəticə modülün tek başına məhdud kazanç sşəbəkəladığını, asıl etkinliğin diğer iki modülle birlikdə ortaya çıktığını göstərir.

Tədqiqatda fərqli dikkat mekanizmaları da Star yapistilik üzərində karşılaştırılmıştır. PCSA kullanılan nihai yapı; CA, CBAM, EMA və C2PSA seçeneklerine görə F1, mAP50 və mAP50-95 birlikdə dəyərlendirildiğində ən yüksək nəticələri vərmiştir: %85,63 F1, %89,44 mAP50 və %66,07 mAP50-95.

Dysample nedən kullanıldı?

YOLO11n'in varsayılan üst nümunələmə işlemi nearest-neighbor interpolyasiyaa dayanır. Bu üsul hızlıdır ancaq her konumu içerikten bşəbəkəımsız biçimdə büyüttüğü üçün kiçik hədəf kənarlarında ayrıntı kaybı və çok ölçekli xüsusilərin hizalanmasında xəta oluşabilir.

Dysample, özellik haritasını sabit pikseller kümesi yerine nümunələmə yapılabilən sürekli bir alan gibi ele alır. Düzenli nümunələmə konumuna öğrenilən bir \(\Delta p\) ofseti eklenir:

\[ p' = p + \Delta p \]

Ardından yeni özellik dəyəri komşu örneklerdən:

\[ Y(p) = \sum_{q\in N(p')} w_qX(q) \]

ifadəsiyle yenidən örneklenir. \(N(p')\), yeni nümunələmə konumunun çevresindəki noktaları; \(w_q\) ise interpolyasiya şəbəkəırlıklarını temsil edər.

Böylece şəbəkə, nesne sınırı və ya yerli yapıya görə nümunələmə konumunu dəğiştirebilir. Tədqiqatın ablasyon nəticələrinda üç iyiləştirme arasında tek başına en aydın dəqiqlik katkılarından biri Dysample'dan gelmiştir: yalnız Dysample kullanılan modəldə F1 %84,75, mAP50 %88,29 və mAP50-95 %65,42'ye ulaşmıştır.

LSDECD aşkarlama başlığı nasıl yüngülliyor?

Standart YOLO aşkarlama başlığında fərqli ölçeklerdəki özellik haritaları üçün sınıflandırma və kutu regresyon dalları ayrı işlemler realleştirir. Bu yapı yüksek temsil tutumsi sşəbəkəlasa da benzer konvolüsyonların fərqli ölçeklerdə tekrarlanması hesablama dəyərini artırır.

LSDECD'nin dayandığı LSCD yaklaşımı, bazı konvolüsyon şəbəkəırlıklarını ölçekler arasında paylaşarak bu tekrarı azaltır. Tədqiqatçılar bunun ince ayrıntıların aşırı yumuşamasına yol açabiləceğini belirterek standart yüngül konvolüsyonun yerine Detail Enhancement Convolution (DEConv) eklemiştir.

DEConv; standart konvolüsyon yanıtına merkezi, açısal, yatay və dikey fərq komponentlərini ekler:

\[ Y_{\mathrm{VC}} = Conv(X) \]

\[ Y_{\mathrm{CDC}}(i,j)=X(i,j)-X(i+1,j+1) \]

\[ Y_{\mathrm{ADC}}(i,j)=X(i,j)-X(i+1,j-1) \]

\[ Y_{\mathrm{HDC}}(i,j)=X(i,j)-X(i,j+1) \]

\[ Y_{\mathrm{VDC}}(i,j)=X(i,j)-X(i+1,j) \]

və toplam çıktı:

\[ Y = Y_{\mathrm{VC}} + Y_{\mathrm{CDC}} + Y_{\mathrm{ADC}} + Y_{\mathrm{HDC}} + Y_{\mathrm{VDC}} \]

kimi oluşturulur. Amaç yatay, dikey və çapraz kənar/tekstura fərqlilıklarını daha görünür hâle getirmektir. Tədqiqatda həmçinin bu çok dallı yapıların çıkarım aşamasında eşdəyər tek bir konvolüsyona yenidən parametrize ediləbildiği, dolayistilikyla təlimdəki ayrıntı çıkarımının tədqiqat anında eyni ölçüdə ek dallı hesaplama gerektirmediği belirtilmektedir.

LSDECD tek başına doğruluğu artırdı mı?

Her metrikte dəğil. Yalnız LSDECD eklendiğində GFLOPs 6,3'ten 4,8'e və parametr sayı 2,58 milyondan 2,46 milyona düşmüştür. Buna qarşılıq mAP50 %87,27 ilə tabana yakın kalırken mAP50-95 %63,87'ye yüngülçe geriləmiştir.

Bu nəticə mühüm bir tasarım ayrıntistilikdır: LSDECD'nin əsas rolü tek başına büyük dəqiqlik artımı sşəbəkəlamak dəğil, aşkarlama başlığındaki hesaplama tekrarını azaltmaktır. En yüksek performans C3k2_PS və Dysample ilə birlikdə kullanıldığında ortaya çıkmıştır.

Üç modül birlikdə kullanıldığında ne oldu?

Nihai UGV-Net, üç dəğişikliği birlikdə kullanmaktadır. KITTI ablasyonundaki əsas nəticələr şöyledir:

MetrikYOLO11nUGV-NetKaynakta bildirilən fərq
Precision%90,33%91,80+1,47 yüzdə balı
Recall%78,14%80,95+2,81 yüzdə balı
F1%83,44%85,63+2,19 yüzdə balı
mAP50%87,18%89,44+2,26 yüzdə balı
mAP50-95%63,97%66,07 ± 0,02+2,10 yüzdə balı
GFLOPs6,34,9%22,22 azalma
Parametre2,58 M2,41 MKaynakta təxminən %6,5 azalma
Şekil 2: Kaynak məlumatlar: Xulong Zhang, Hong Jiang, Dong Han, Hai Guo, Xiangfeng Zhang və Kaige Sun (2026), Machines, DOI: 10.3390/machines14050527, Tablo 3. Verianla üçün Türkçeleştirilərek yenidən çizilmiştir. Eksen, kaynakta bildirilən kesin metrik dəyərləri göstermek üzere %50–100 aralığında məlumatlmiştir.

F1, mAP və diğer ölçütler neyi ifadə ediyor?

Precision, modəl tarafından hedəf kimi işaretlenen kutuların ne kadarının real hedəf olduğunu ölçer. Recall ise real hedəflerin ne kadarının aşkarlama ediləbildiğini gösterir. İki dəyərin harmonik ortası olan F1:

\[ F1 = 2\times \frac{Precision\times Recall} {Precision+Recall} \]

ilə hesaplanır.

Bir sınıf üçün Avərage Precision (AP), precision–recall eğrisinin altında kalan alan üzərindən:

\[ AP = \int_{0}^{1} Precision(r)\,dr \]

şeklində tanımlanmıştır. N sınıfın AP dəyərinin ortası:

\[ mAP = \frac{1}{N}\sum_{i=1}^{N}AP_i \]

kimi hesaplanır. mAP50, IoU eşiği 0,50 üçün; mAP50-95 ise fərqli IoU eşiklerində daha sıkı konum doğruluğunu da hesaba katan ölçüttür.

Hangi məlumat kümesi ana təcrübə üçün kullanıldı?

Ana təlim və karşılaştırma məlumat kümesi KITTI'dir. Tədqiqatda KITTI'nin resmî təlim bölümündəki toplam 7481 görüntü əvvəl karıştırılmış və 7:2:1 nisbətinda ayrılmıştır:

BölümGörüntü sayistilik
Eğitim5237
Doğrulama1496
Test748

KITTI'də Car, Van, Truck, Pedəstrian, Person_sitting, Cyclist, Tram və Misc sınıfları kullanılmaktadır. Tədqiqatdaki etiket istatistikleri Car sınıfının açık ara en fazla örneğe sahip olduğunu, Pedəstrian və Van sınıflarının onu izlediğini göstərir.

Bounding-box boyut dşəbəkəılımının düşük normalize genişlik və yükseklik dəyərlərində yoğunlaşması, məlumat kümesindəki çok sayıda hedəfin görüntü üçündə küçük alan kapladığını göstərir. Nesne merkezleri də şəbəkəırlıklı kimi görüntünün orta və alt-orta kısmında, yani aracın iləri görüş alanında toplanmaktadır.

Modəl hangi koşullarda eğitildi?

Eğitim parametresiTədqiqatdaki dəyər
İşletim dumantemiWindows 11
CPUIntel Core Ultra 7-265K
GPUNVIDIA GeForce RTX 5060 Ti, 16 GB
RAM32 GB
Python3.9
PyTorch2.7.0
CUDA12.8
Girdi boyutu640 × 640
Learning rate0,01
OptimizerSGD
Momentum0,937
Batch size32
Epoch300
Weight dəcay0,0005
Thread sayistilik8

Farklı obyekt aşkarlama modəllərine karşı nəticə neydi?

Tədqiqatçılar Faster R-CNN, SSD, RT-DETR, YOLOv5n, YOLOv8n, YOLO11n, YOLOv12n, YOLOv13n, LP-YOLO və PV-YOLO'yu eyni təcrübə düzenində UGV-Net ilə karşılaştırmıştır. KITTI nəticələrinda UGV-Net, raporlanan modəllər arasında F1, mAP50 və mAP50-95 metriklerinin üçünü birlikdə ən yüksək düzeydə vəren modəl olmuştur.

ModəlF1mAP50mAP50-95GFLOPsParametre
YOLOv8n%83,16%86,75%63,768,92,69 M
YOLO11n%83,44%87,18%63,976,32,58 M
YOLOv13n%85,15%88,02%64,896,12,50 M
LP-YOLO%82,79%86,75%62,345,51,88 M
PV-YOLO%80,71%85,66%61,056,31,46 M
UGV-Net%85,63%89,44%66,074,92,41 M

UGV-Net'in en az parametreye sahip modəl olduğu sonucu çıkarılamaz; örneğin PV-YOLO 1,46 M və LP-YOLO 1,88 M parametreye sahiptir. Tədqiqatın UGV-Net üçün gösterdiği avantaj, daha düşük parametreli bütün modəlləri geçmek dəğil, kendi təcrübə düzenində dəqiqlik və hesablama yükü arasında daha iyi bir birlikdə performans sşəbəkəlamasıdır.

Görsel aşkarlama karşılaştırmaları ne gösterdi?

Tədqiqatdaki aşkarlama görsellerində büyük Van gibi aydın nesnelerdə YOLO11n, YOLOv13n və UGV-Net arasında büyük fərq görülmemiştir. Fark xüsusilə uzaktaki küçük Pedəstrian və Cyclist hedəflerində və kısmen örtülü Person_sitting hedəfində ortaya çıkmaktadır.

Bir diğer örnekte YOLO11n və YOLOv13n'in yol kənarındaki ince, yüksek kontrastlı bir direği “Pedəstrian” kimi yanlış sınıflandırdığı; UGV-Net'in eyni bölgedə bu yanlış pozitiv yanıtı üretmediği göstərilmişdir. Bu tekil görseller bütün olası açıq mühitlar üçün xəta nisbəti kanıtı dəğildir, ancaq nicel test nəticələriyla birlikdə modəlin arka plan bastırma davranışını görsel kimi dəsteklemektedir.

Isı haritaları modəlin neye baktığını gösteriyor?

Grad-CAM benzeri istilik xəritəsi karşılaştırmalarında YOLOv8n, YOLO11n və YOLOv13n yanıtlarının büyük nesne yüzeylerine və ya yüksek kontrastlı arka plan bölgelerine daha fazla yayılabildiği görülmektedir. UGV-Net'te yüksek yanıt bölgeleri hedəf gövdəsi və hedəfin yapısal bölgelerində daha yoğun görünmektedir.

Uzak Pedəstrian və Cyclist hedəflerində UGV-Net'in istilik xəritəsi aktivasyonu diğer bazı modəllərdən daha aydın kalmıştır. Direğin yanlış piyada kimi algılandığı örnekte ise UGV-Net'in direk çevresindəki aktivasyonu zayıf, real piyada və uzaktaki nəqliyyat vasitəsi çevresindəki aktivasyonu daha yoğun görünmektedir. Bu görseller performans mekanizmasını tek başına kanıtlamaz; tədqiqatdaki aşkarlama və ablasyon nəticələrinı açıklamaya yönelik nitel dəstek sunar.

SODA10M nəticələri neydi?

ModəlPrecisionRecallF1mAP50mAP50-95
YOLOv8n%66,16%51,02%56,98%57,01%38,27
YOLO11n%67,84%49,79%56,39%56,81%38,38
YOLOv13n%66,51%50,01%55,91%55,68%37,09
UGV-Net%65,84%53,58%58,10%58,48%39,37

SODA10M'də UGV-Net'in precision dəyəri YOLO11n'dən aşşəbəkəı olsa da recall, F1, mAP50 və mAP50-95 daha yüksektir. Dolayistilikyla “bütün metriklerdə ən yüksək” gibi bir ifadə doğru dəğildir. Tədqiqatın ana kazancı kaçırılan hedəfleri azaltan recall artımı ilə genel F1/mAP performansında görülmektedir.

FLIR nəticələri neydi?

FLIR məlumat kümesi RGB və termal görüntülər içerse də bu tədqiqatda yalnız RGB görüntülər təlim və dəyərlendirme üçün istifadə edilmişdir. Dolayistilikyla nəticələr termal görüntü aşkarlama performansı kimi yorumlanmamalıdır.

ModəlPrecisionRecallF1mAP50mAP50-95
YOLOv8n%77,56%69,19%73,01%75,83%38,44
YOLO11n%79,52%67,35%72,82%75,97%39,16
YOLOv13n%77,82%66,32%71,52%74,84%37,89
UGV-Net%78,85%70,29%74,23%78,36%39,82

Burada da UGV-Net ən yüksək precision'a sahip dəğildir; YOLO11n %79,52 precision ilə UGV-Net'in %78,85 dəyərinin üzərindədir. Buna qarşılıq UGV-Net recall, F1, mAP50 və mAP50-95 bcərəyanından daha yüksek nəticə vərmiştir.

“Genelleme” sonucunun sınırı nedir?

Tədqiqat SODA10M və FLIR təcrübələrini generalization/cross-dataset dəyərlendirmesi kimi adlandırmaktadır. Bununla birlikdə üsul bölümündə iki məlumat kümesinin də 7:2:1 nisbətinda təlim, doğrulama və test bölümlerine ayrıldığı açıkça yazmaktadır. Bu nedənle nəticələr, yalnız KITTI üzərində eğitilmiş tek bir modəlin SODA10M və ya FLIR üzərində yenidən təlim olmaksızın dənenmesi şeklindəki zero-shot domain transfer təcrübəi dəğildir.

Daha güvənli elmi yorum, UGV-Net arxitekturasınin üç fərqli məlumat kümesi üzərində ayrı təlim/dəyərlendirme düzenlerində tutarlı avantaj gösterdiği yönündədir. Bu, arxitekturanin məlumat kümesine özel tek bir nəticətan ibaret olmadığını dəstekler; lakin tamamen görülmemiş bir alan üzərindəki aktarım performansını tek başına kanıtlamaz.

Jetson Orin Nano'ya nasıl aktarıldı?

Eğitilmiş PyTorch modəli əvvəl ONNX formatına dışa aktarılmış, ardından Jetson Orin Nano üzərində TensorRT motoruna dönüştürülmüştür. Cihaz üzərindəki çıkarım ayarları:

Dşəbəkəıtım parametresiDeğer
Çıkarım motoruTensorRT
Girdi boyutu640 × 640
Çıkarım hassasiyetiFP16
Batch size1

Vidəo kareleri yenidən boyutlandırılıp normalize edildikten sonra TensorRT motoruna məlumatlmiş və aşkarlama nəticələri cihaz üzərində üretilmiştir.

Jetson Orin Nano'da ne kadar hızlı çalıştı?

ModəlOrtalama FPSGecikmeBellek kullanımıEk güc
YOLOv8n22,3 FPS44,84 ms2,9 GB1,4 W
YOLO11n25,8 FPS38,76 ms3,0 GB1,3 W
UGV-Net27,9 FPS35,84 ms2,9 GB1,2 W

UGV-Net bu üç modəl arasında ən yüksək orta FPS, ən aşşəbəkəı gecikmə və ən aşşəbəkəı raporlanan ek güc dəyərini vərmiştir. Bellek kullanımı YOLOv8n ilə eyni, YOLO11n'dən 0,1 GB daha düşüktür.

Tədqiqatda anlık FPS'nin kare karmaşıklığı, avadanlıq yükü və önyaddaş durumu nedəniyle dəğişebildiği; bu nedənle ana hız ölçütü kimi orta FPS'nin kullanıldığı belirtilmektedir:

\[ FPS_i=\frac{1}{t_i} \]

və bütün vidəo üçün:

\[ FPS_{\mathrm{avg}}=\frac{N}{T} \]

Burada \(t_i\) tek karenin toplam işlem süresi, \(N\) vidəo kare sayistilik və \(T\) bütün karelerin işlenmesi üçün geçen toplam süredir.

Şekil 3: Kaynak məlumatlar: Xulong Zhang, Hong Jiang, Dong Han, Hai Guo, Xiangfeng Zhang və Kaige Sun (2026), Machines, DOI: 10.3390/machines14050527, Tablo 9. Verianla üçün Türkçeleştirilərek yenidən çizilmiştir.

Jetson testi real UGV sahə doğrulaması anlamına geliyor mu?

Hayır. Tədqiqat UGV-Net'in kaynak kistiliktlı bir kənar avadanlıqda real vaxtlı çıkarım yapabildiğini göstərir; ancaq yayımlanan təcrübə, robotun real açıq mühitda otonom sürüş sırasında uzunmüddətli aşkarlama, qərarvərmə, frenleme və ya yol planlaması döngüsünü uçtan uca doğrulayan bir sahə testi dəğildir.

Bu ayrım mühümdir. 27,9 FPS sonucu modəlin Jetson Orin Nano üzərindəki çıkarım hızını dəstekler; UGV'nin real dünya güvənliğinin və ya bütün trafik senaryolarında yeterli tepki süresinin kanıtı dəğildir.

Tədqiqatın güclü tərəfləri nelerdir?

  • Aynı anda dəqiqlik, GFLOPs və parametr sayını dəyərlendiren açık bir yüngüllik–performans analizi yapılmıştır.
  • Üç arxitektura dəğişiklik ayrı və kombinasyonlu ablasyonlarla test edilmiştir.
  • C3k2 varyantları və fərqli dətection head tasarımları həmçinin karşılaştırılmıştır.
  • Ana KITTI karşılaştırmasına ek kimi SODA10M və FLIR üzərində ek məlumat kümesi təcrübələri yapılmıştır.
  • Nicel nəticələrin yanında aşkarlama görselleri və istilik haritalarıyla küçük nesne, örtülme və yanlış pozitiv davranışı incələnmişdir.
  • Modəl yalnız masaüstü GPU'da dəğil, Jetson Orin Nano üzərində TensorRT/FP16 çıkarımla da dənenmiştir.

Tədqiqatın başlıca məhdudiyyətlərı nelerdir?

Birincisi, SODA10M və FLIR təcrübələri məlumat kümelerinin kendi təlim bölümlerini kullanmaktadır. Bu nedənle bunları bütünüyle “görülmemiş məlumat alanına zero-shot ümumiləşmə” kimi yorumlamak doğru olmaz.

İkincisi, FLIR təcrübəində termal kanal kullanılmamıştır; yalnız RGB görüntülər dəyərlendirilmiştir. Bu tədqiqat UGV-Net'in termal aşkarlama performansını göstermemektedir.

Üçüncüsü, Jetson Orin Nano testi kənar avadanlıq performansını doğrular ancaq tam bir sahə UGV təcrübəi dəğildir. Tədqiqatda real UGV'nin uzunmüddətli sürüşü, yol planlaması ilə entegrasyon, təcili dayanma davranışı və ya təhlükəsizlik sertifikasiyası incələnməmişdir.

Dördüncüsü, tədqiqatçılar aşırı aydınlatma dəğişimi, yşəbəkəış, duman və gece aşşəbəkəı görünüş koşullarını mevcut modəl üçün gelecekte geliştirilmesi gereken alanlar kimi açıkça belirtmektedir. Dolayistilikyla mevcut nəticələrin bu koşullarda eyni düzeydə korunacşəbəkəı varsayılamaz.

Beşincisi, tədqiqat görüntü əsaslı aşkarlamaya odaklanmaktadır. LiDAR, radar, termal kamera və ya başqa sensorlarin ortak kullanımı mevcut UGV-Net təcrübələrinin əhatəında dəğildir; çoklu sensor birləşməsi gələcək tədqiqat kimi bırakılmıştır.

Tədqiqatın söylediği nedir?

Tədqiqat, YOLO11n üzerine C3k2_PS, Dysample və LSDECD modüllerinin birlikdə eklenmesinin incelenen məlumat kümeleri və təcrübə koşullarında daha yüksek F1/mAP nəticələri ilə daha düşük hesablama dəyərini eyni modəldə sşəbəkəlayabildiğini; həmçinin bu modəlin Jetson Orin Nano üzərində təxminən 28 FPS seviyesində çalışabildiğini göstərir.

Tədqiqatın söylemediği nedir?

UGV-Net'in bütün açıq mühitlar, bütün hava şəraitləri və ya bütün UGV platformları üçün güvənli və xətasız aşkarlama sşəbəkəladığı gösterilmemiştir. Modəl, real nəqliyyat vasitəsi güvənlik dumantemi sertifikasyonu dəğildir; bütün küçük nesneleri algıladığı və ya yanlış pozitiv üretmediği sonucu çıkarılamaz. SODA10M və FLIR nəticələri da tamamen yenidən təlim gerektirmeyen bir domain-transfer kanıtı dəğildir.

Tədqiqatın Yöntemi və Bulguları

Ağ arxitekturasınin texniki özeti

UGV-Net komponentiTemel texniki işlevHedəflenen problem
C3k2_PSStar Block ilə yüksek dəreceli özellik etkiləşimi və PCSA ilə kanal bşəbəkəımlılıklarının yenidən şəbəkəırlıklandırılmasıKarmaşık arka plan, örtülme, kiçik hədəf xüsusilərinin zayıflaması
DysampleÖğrenilən ofsetlerle məzmun həssas nümunələməÜst nümunələmədə ayrıntı kaybı və uzamsal hizalama xətası
LSDECDÖlçekler arası paylaşımlı konvolüsyon və DEConv ayrıntı güclendirmesiAlgılama başlığında hesaplama tekrarı və ince ayrıntı kaybı

Ablasyon təcrübəinin tamamı

YapıPrecisionRecallF1mAP50mAP50-95GFLOPsParams
YOLO11n%90,33%78,14%83,44%87,18%63,976,32,58 M
C3k2_PS%90,68%77,94%83,35%87,32%64,056,42,52 M
Dysample%87,77%82,35%84,75%88,29%65,426,32,60 M
LSDECD%87,05%81,01%83,76%87,27%63,874,82,46 M
C3k2_PS + Dysample%89,46%80,74%84,65%88,16%65,846,42,53 M
C3k2_PS + LSDECD%87,91%80,66%83,86%88,30%64,164,92,39 M
Dysample + LSDECD%84,68%82,52%83,25%87,87%64,244,82,47 M
C3k2_PS + Dysample + LSDECD%91,80%80,95%85,63%89,44%66,07 ± 0,024,92,41 M

Ablasyon nəticələri modüllerin katkılarının doğrusal biçimdə toplanmadığını göstərir. Örneğin Dysample tek başına recall'ı %82,35'e çıkarırken nihai UGV-Net'in recall'ı %80,95'tir; buna rşəbəkəmen nihai modəl daha yüksek precision, F1 və mAP sşəbəkəlamaktadır. Tədqiqatçılar bunu xüsusiyyət təmsili, çok ölçekli füzyon və yüngül aşkarlama başlığı arasındaki etkiləşimle açıklamaktadır.

Algılama başlığı karşılaştırması

Detection headF1mAP50mAP50-95GFLOPsParametre
Base%84,65%88,16%65,846,42,53 M
Efficient%84,68%87,29%64,665,22,27 M
LSCD%85,37%88,76%64,755,72,37 M
LSDECD%85,63%89,44%66,074,92,41 M

Efficient head ən aşşəbəkəı parametr sayını sşəbəkəlamış ancaq dəqiqlik kaybı oluşturmuştur. LSCD F1 və mAP50'yi yükseltmiş lakin mAP50-95 dəyərində geriləmiştir. LSDECD ise bu təcrübədə həm ən aşşəbəkəı GFLOPs dəyərini həm də ən yüksək üç ana dəqiqlik metriğini birlikdə sşəbəkəlamıştır.

Uç cihaz təcrübəinin texniki sınırı

Jetson Orin Nano nəticələri TensorRT, FP16, 640 × 640 girdi və batch 1 koşullarında əldə edilmişdir. Başka TensorRT sürümleri, güc modları, kamera işleme boru hatları və ya eş zamanlı robotik proqram təminatı yükleri altında eyni FPS'nin korunacşəbəkəı kaynak tədqiqat tarafından test edilmemiştir.

Tablo 9'daki “Additional Power” dəyəri cihazın toplam elektrik tüketimi dəğildir; modəl çalıştırma sırasında raporlanan ek güc ölçütüdür. Bu nedənle 1,2 W dəyəri Jetson Orin Nano dumanteminin toplam güc gereksinimi kimi yorumlanmamalıdır.

Genel nəticə

Tədqiqatın kendi təcrübə düzenində UGV-Net, YOLO11n tabanına görə daha yüksek F1 və mAP nəticələri eldə edərken GFLOPs və parametr sayını azaltmış və Jetson Orin Nano'da daha yüksek orta FPS sşəbəkəlamıştır. Tədqiqatın en mühüm texniki sonucu, küçük və örtülü nesne temsilini güclendirmeye yönelik özellik çıkarımı və dinamik üst nümunələmə dəğişikliklerinin, yüngül bir aşkarlama başlığıyla birlikdə kullanılmasının dəqiqlik–hesaplama dəngesi açistilikndan faydalı olabildiğidir.

Bulguların tətbiq dəyəri xüsusilə düşük hesaplama bütçeli mobil algı dumantemləri açistilikndan mühümdir; ancaq tam UGV operasyon güvənliği üçün real sahə koşulları, kötü hava və düşük ışık, fərqli kamera/sensor dumantemləri və aşkarlama sonrası qərarvərmə zinciri həmçinin doğrulanmalıdır.

Mənbə və Metod Qeydi

Tam özgün tədqiqat adı: A Method for Lightweight Pedəstrian and Vehicle Detection for Unmanned Ground Vehicles in Open Environments

Müəlliflər, kaynak sırasıyla: Xulong Zhang; Hong Jiang; Dong Han; Hai Guo; Xiangfeng Zhang; Kaige Sun.

Eş katkı/bərabər birinci müəllif: Kaynakta bərabər töhfə və ya bərabər birinci müəlliflık bildirimi bulunmamaktadır.

Sorumlu yazar: Hong Jiang.

Kurumlar: School of Mechanical Engineering, Xinjiang University, Urumqi, Çin; Xinjiang Acadəmy of Building Research Co., Ltd., Urumqi, Çin; School of Mechanical Engineering, Zhejiang University, Hangzhou, Çin.

Dergi: Machines.

Yayınevi: MDPI, Basel, Switzerland.

Yayın kimliği: Machines 2026, 14(5), 527.

DOI: 10.3390/machines14050527.

Resmî nəşr bşəbəkəlantistilik:https://doi.org/10.3390/machines14050527

Alınma / revizyon / kabul / nəşr: 24 Mart 2026 / 30 Nisan 2026 / 5 Mayıs 2026 / 8 Mayıs 2026.

Kaynak türü və rəy statusu: Machines jurnalsində yayımlanmış rəyli tədqiqat makalesi.

Lisans: Creativə Commons Attribution (CC BY); telif hakkı © 2026 müəllifləra aittir.

Finansman: Tədqiqat Tianshan Talent Program: Youth Support Talent Project tarafından 2024TSYCQNTJ0020 numaralı dəstekle və China State Construction Engineering Corporation Technology R&D Projects tarafından CSCEC-2025-Z-27 numaralı dəstekle finanse edilmiştir.

Veri erişiləbilirliği: Tədqiqatda kullanılan məlumatlarin məsul müəllifla ilətişime geçilmesi hâlində talep üzerine sşəbəkəlanabiləceği belirtilmektedir.

Çıkar damşması: Xulong Zhang və Hai Guo'nun Xinjiang Acadəmy of Building Research Co., Ltd. bünyesində çalıştığı qeyd edilmişdir. Diğer müəlliflər tədqiqatyı etkiləyebiləcek ticari və ya mali ilişki bulunmadığını beyan etmektedir.

Yazar katkıları: Kavramsallaştırma Xulong Zhang və Hong Jiang; metodoloji və biçimsel analiz Xulong Zhang; proqram təminatı Kaige Sun; doğrulama Xulong Zhang, Hong Jiang və Xiangfeng Zhang; tədqiqat Xulong Zhang və Dong Han; kaynaklar Dong Han; məlumat düzenleme Kaige Sun və Dong Han; ilk taslak Xulong Zhang; inceleme və düzenleme Hong Jiang, Dong Han və Xiangfeng Zhang; görselleştirme Xulong Zhang; danışmanlık Hong Jiang; proje yönetimi və maliyyələşmə edinimi Hai Guo tarafından yürütülmüştür.

Veri kümesi notu: Ana təcrübə KITTI üzərində yapılmıştır. KITTI'nin 7481 görüntülük təlim kümesi 5237 təlim, 1496 doğrulama və 748 test görüntüsü kimi 7:2:1 nisbətinda bölünmüştür. SODA10M və FLIR də 7:2:1 nisbətinda təlim, doğrulama və test bölümlerine ayrılmıştır. FLIR təcrübələrində yalnız RGB görüntülər istifadə edilmişdir.

“Genelleme” yorum sınırı: Kaynak, SODA10M və FLIR təcrübələrini generalization/cross-dataset testləri kimi adlandırmaktadır; ancaq bu məlumat kümelerinin kendi təlim bölümleri kullanıldığından nəticələr zero-shot domain transfer kimi dəyərlendirilmemelidir. Bu Verianla aktarımında kaynak terminolojisi korunmuş, lakin təcrübə düzeninin real əhatəı həmçinin açıklanmıştır.

Uç cihaz doğrulama sınırı: Jetson Orin Nano təcrübəi modəlin TensorRT/FP16 koşullarında kənar cihazda çalıştırılabilirliğini və vidəo çıkarım hızını göstərir. Tədqiqat, UGV'nin real açık sahəda uzunmüddətli otonom sürüş güvənliği, aşkarlama–planlama–kontrol entegrasyonu və ya sertifikasyon düzeyində güvənilirlik doğrulaması dəğildir.

Gelecek tədqiqat sınırları: Tədqiqatçılar aşırı aydınlatma dəğişimleri, yşəbəkəış, duman, düşük gece görüşü və çoklu sensor birləşməsinu gelecekte geliştirilmesi gereken başlıqlar arasında göstərir.

İçeriğin hazırlanma üsulu: Bu Verianla içeriğinin elmi bölümü yüklenen tədqiqatın metnine, tənliklerine, cədvəllarına, şəbəkə arxitekturası şəkillerine, ablasyon təcrübələrine, aşkarlama görsellerine, istilik haritalarına və Jetson Orin Nano nəticələrina dayanmaktadır. Dış kaynaklardan yeni eksperimental nəticə, yeni performans dəyəri və ya ek mekanizma eklenmemiştir. Xarici doğrulama yalnız bibliyoqrafik nəşr kimliğinin kontrolü üçün istifadə edilmişdir. Inline SVG'ler kaynakta raporlanan kesin cədvəl məlumatlarindən yenidən çizilmiş və ya tədqiqatın üsulune dayanarak hazırlanmış açıklayıcı özgün şemalardır.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy