Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Mühəndislik / Görüntü-Dil Dəstəkli Prototip Distillasiyası ilə Uzaq Məsafəli Sənaye Yanğın və Tüstü Aşkarlanması
Kompüter Elmləri

Görüntü-Dil Dəstəkli Prototip Distillasiyası ilə Uzaq Məsafəli Sənaye Yanğın və Tüstü Aşkarlanması

Bu tədqiqat rafineri, petrokimya tesisi, tank sahəsi və enerji stansiyası kimi geniş sənaye sahələrində uzaqdakı kiçik yanğınları və aşağı kontrastlı tüstü buludlarını real zamanda aşkar etməyi məqsəd qoyan bilik distillasiyası üsulu inkişaf etdirir.

04/08/2026  Veri Anla 55 baxış
Görüntü-Dil Dəstəkli Prototip Distillasiyası ilə Uzaq Məsafəli Sənaye Yanğın və Tüstü Aşkarlanması

Bu tədqiqat, rafineri, petrokimya tedumani, tank sahəsi və enerji stansiyası gibi geniş sənaye sahələrida uzaqdaxın kiçik yanğınları və aşşəbəkəı kontrastlı tüstü bulutlarını real zamanda aşqar etməyi amaçlayan bir bilik distillasiyası üsulu geliştirmektedir. Uzak mesafeli təhlükəsizlik kameralarında təhlükəli bölgələr çoğu zaman yalnız birkaç piksel örtükkta; gecə lampaları, avtomobil faraları, metal səth əksləri, yaş döşəmə parıltıları və parlaq şəbəkəac örtükləri yanğın və ya tüstüla qarıştırılabilmektedir. Bu nedenle yüngül obyekt aşqarlayıcıları hem zəif hədəfləri qaçıra bilməkdə hem də sık yanlış siqnal üretebilmektedir.

Tədqiqatçılar bu problemu çözmek üçün yüksək kapasitəli bir öğretmen modelin bilgisini birbaşa və yoğun biçimde kopyalamak yerine, inamılir hədəf bölgələrini və yanıltıcı sənaye örüntüleri ayrı prototipler hâlinde temsil eden bir distillasiya çərçivəsi təklif edir. Öğretmen modelin yanğın, yüngül tüstü və sıx tüstü proqnozleri hədəf ehtimal xəritələrinı; küçə lampası, güclü əksolunma və parlaq şəbəkəac örtüyü proqnozleri isə qarışdırıcı ehtimal xəritələrinı yaratmaqtadır. Dondurulmuş bir CLIP görüntü-dil modeli və öyrənilə bilən davamlı prompt belirteçleri, bu xəritəları semantik açıdan yeniden dəyərləndirməkte; gerçek tehlike kavramlarıyla uyumlu bölgeleri güçlendirirken aydınlatma qaynaqlı yanıltıcı bölgeleri bastırmaktadır.

İyiləştirilmiş olasılık xəritəları, öğretmen modelden hədəf və qarışdırıcı prototiplerin çıqarılmasında və öğrenci model xüsusilərinden eğitici məkan belirtecilərin seçilmesinde kullanılmaktadır. Maska Yönləndirməli Çox Ölçəkli Qarşıt Hizalama adlı itki funksiyası, hafif öğrenci modelin gerçek yanğın və tüstü örüntülerini öğrenmesini və görsel kimi benzer yanıltıcı bölgeleri ayırt etmesini hədəfləyir. CLIP, öğretmen model, istem belirteçleri və prototip bankı yalnız təlim ardıcıllıqsında kullanılmakta; sahə istifadəsinda yalnız 8,4 milyon parametreli öğrenci aşqarlayıcı çalıştırılmaktadır.

11.023 görüntüden yaranan hibrid Fire&Smoke məlumat kümesindeki nəticələra görə üsul, YOLO26-small modelinin ortalama AP dəyərini 51,5’ten 63,8’e yükseltmiş və bildirilən yanlış siqnal nisbətinı %14,7’den %3,4’e düşürmüştür. Gece görüntülərinden yaranan 625 qarelik alt kümede ortalama AP 47,8’den 59,6’ya yükselmiş, yanlış siqnal nisbəti isə %22,6’dan %4,6’ya geriləmiştir. Buna rşəbəkəmen məlumat kümesinin təxminən yaristilik xüsusi sənaye görüntüləriden oluşmakta, yanlış siqnal nisbətinın kesin hesablama üsulu açıklanmamakta və gerçek bir gömülü edge cihaz üzərində saha benchmarkı sunulmamaktadır.

Türkiyə baxımından anlamı

Yöntem; Türkiyədəki rafinerilər, petrokimya və kimya tedumanleri, təbii qaz saxlama alanları, limanlar, termik santraller, günəş və külək enerji sahaları, maden işletmeleri, orman-endüstri sınırları və geniş istehsal kampuslerinde erkən xəbərdarlıq dumantemlerine uyarlanabilir. Özellikle gecə vardiyalarında projektörler, ikaz lambaları, avtomobil faraları, parlak metal avadanlıqlar və yşəbəkəmur sonrası yaranan əksolunmalar, klasik kamera tabanlı dumantemlerde yanğın benzeri görüntülər yarada bilər. Tədqiqatın hədəf və qarışdırıcı prototipleri ayrı modelleme yaklpeyəndmı, bu tür çevresel şərtlər üçün birbaşa ilgili bir mühendislik hipotezi təqdim edir.

Türkiyədə tətbiqya geçilmeden əvvəl fərqli teduman türleri, kamera yükseklikleri, lensler, hava şərtlərı, mevsimler və coğrafi bölgelerden toplanmış yerli görüntülərle yeniden təlim və doğrulama strukturlmalıdır. Sis, buhar, baca gazı, mənbə kıvılcımları, meşale bacaları, sıcak proses parlamaları və hareketli vaqon ışıkları ayrı qarışdırıcı siniflər kimi dəyərlendirilmelidir. Alarm performansı yalnız görüntü bpeyəndna AP ilə değil; hadisə aşqarlama müddəti, saat bpeyəndna yanlış siqnal, kaçırılan olay sayistilik, kesintisiz video üzərindəki siqnal sabitlığı və operator müdaxilə yüküyle ölçülmelidir.

Bu tədqiqat, üsulun Türkiyədəki gerçek tedumanlerde yanğını daha erkən aşqar etmə edeceğini və ya can və mal kaybını azaltacşəbəkəını birbaşa sübut etmir. Sonuçlar görüntü tabanlı aşqarlama başaristiliknı destoynaqekte; termal kamera, alov detektoru, tüstü sensorü, qaz sensual və teduman siqnal dumantemiyle bütünlhədd təhlükəsizlik performansını dəyərləndirməmektedir.

Araşdırmanın təməl problemi nedir?

Sənaye təhlükəsizlik kameraları çoğunlukla yüksek direk, çatı və ya kulelere yerleştirilərek geniş alanları izləməektedir. Bu düzen, tek kamerayla böyük bir saha görülebilmesini sşəbəkəlarken yanğın və tüstü hədəflərinin görüntüde çox kiçik kalmasına neden olmaktadır. Uzak tüstü çoğu zaman gökyüzü, bulut, duman və ya baca gazıyla düşük kontrast oluşturur. Küçük alevler isə projektör, far, uyarı lambası və metal yansıması yanında kolayca kaybolabilir.

Hafif tek aşamalı obyekt aşqarlayıcıları, düşük gecikme və məhdud donanım tüketimi nedeniyle kenar cihazlarında tercih edilmektedir. Lakin kiçik modellerin temsil tutumsi daha düşüktür. Büyük bir öğretmen modelden hafif öğrenci modele bilgi aktarılması bu açığı azaltabilir; lakin öğretmen modelin yanlış tepgiləri də birbaşa aktarılırsa öğrenci eyni xətaları öğrenebilir.

Tədqiqatın təməl savı şudur: Sənaye yanğın və tüstü distillasiyasında yalnız “yüksek inamli bölge” ilə “fon” ayrımı yetərli değildir. Aydınlatma qaynaqlı çətin neqativlerin, ardıcıllıqdan fondan ayrı biçimde modellenmesi lazımdır. Bu nedenle dumantem üç məkan nümunə növünü ayırmaktadır:

  • Pozitif tehlike bölgeleri: Hafif tüstü, sıx tüstü və yanğın.
  • Yapılandırılmış qarışdırıcı bölgələr: Sokak lambaları, güclü əksolunmalar və parlak şəbəkəaç örtüleri.
  • Ortam fonı: Hedef və ya özel qarışdırıcı kimi diaqnozmlanmayan diğer bölgeler.

Görüntü-dil rehberliği neden istifadə edilmişdir?

Tədqiqatın 3. sayfasındaki Şegil 1, gecə çegilmiş bir sənaye sahnede uzak tüstü bulutunu kırmızı pozitif bölge, parlak küçə lampasını isə mavi negatif bölge kimi göstərir. Tüstü bölgesi “ince beyaz tüstü”, lamba bölgesi isə “turuncu küçə lampası; yanğın və ya tüstü değil” benzeri mətnsel kavramlarla ilişgiləndirilmiştir. Şegil, iki bölge görüntü parlaklığı texniki xidmətından benzer görünse bilə anlamsal kimi fərqli oldukları düşüncesini açıklamaktadır.

Görüntü xüsusiləri aydınlatma, kamera açistilik, kontrast və səs-küyye duyarlıdır. Metin temsilleri isə “yanğın”, “tüstü”, “lamba” və ya “yansıma” gibi üst düzey kavramları daha sabit biçimde kodlayabilir. Lakin genel amaçlı CLIP modeli, petrokimya sahalarındaki özel görüntü şərtlərına birbaşa uyumlu olmayabilir. Tədqiqatçılar bu alan farkını azaltmak üçün sabit cümleler yerine öyrənilə bilən davamlı prompt belirteçleri kullanmaktadır.

Genel öğretmen–öğrenci mimarisi

4. sayfadaki Şegil 2, üsulun üst düzey işleyişini göstərir. Kamera qareleri hem güclü öğretmen model hem də hafif öğrenci model üçün təlim girdisidir. Öğretmen model, kendi özellik piramidi və semantik modulü üzərindən yanğın, tüstü və yanıltıcı aydınlatma örüntülerini prototiplere dönüştürmektedir. Bu prototipler öğrenci modelin təlimini yönlendirmektedir.

Dşəbəkəıtım aşamasında öğretmen model, CLIP komponenti və prototip bankı kaldırılmaktadır. Kamera qareleri yalnız öğrencinin arxitektura gövdəsi, boyun və aşqarlama başlığından geçmektedir. Böylece distillasiya dumantemi təlim maliyetini artırırken saha mimarisine yeni bir görüntü-dil modeli oynaqemektedir.

Şegil 3’teki ayrıntılı distillasiya hattı

6. sayfadaki Şegil 3, bütün üsulu aşşəbəkəıdaxın adımlara ayırmaktadır:

  1. Öğretmen aşqarlayıcının proqnoz kutuları sinifa bşəbəkəlı hədəf və qarışdırıcı P-xəritələrina dönüştürülür.
  2. Öğretmen özellik piramidindeki yerli xüsusilər 512 boyutlu CLIP semantik uzayına yansıtılır.
  3. Önceden öğrenilmiş mətn prototipləri, hədəf və qarışdırıcı kavramlara semantik yaxınnlığı hesaplar.
  4. Bu yaxınnlık dəyərləri aşqarlama tabanlı P-xəritələrinı güçlendirir və ya bastırır.
  5. İyiləştirilmiş xəritəlar istifadə edilərək hədəf və qarışdırıcı prototipler çıqarılır.
  6. Prototipler özellik piramidinin her seviyesi üçün ayrı kuyruklarda saklanır.
  7. Öğrenci xüsusilərinden pozitif, qarışdırıcı və fon belirteçleri nümunəlenir.
  8. MMCA kaybı, öğrenci belirteçleriyle öğretmen prototiplerini ortak uzayda hizalamaya çalışır.

İlk P-xəritələri nasıl oluşturulmaktadır?

Öğretmen modelin her özellik piramidi seviyesi üçün iki mekânsal xəritə oluşturulmaktadır:

\[ P_{\mathrm{target}}^{\ell}\in\mathbb{R}^{1\times H_\ell\times W_\ell} \]

\[ P_{\mathrm{confuse}}^{\ell}\in\mathbb{R}^{1\times H_\ell\times W_\ell} \]

\(\ell\), özellik piramidi seviyesini; \(H_\ell\) və \(W_\ell\), o seviyedeki uzamsal boyutları belirtmektedir. Hafif tüstü, sıx tüstü və ya yanğın etiketli öğretmen proqnozleri hədəf xəritəsına; lamba, yansıma və ya parlak şəbəkəaç etiketli proqnozler qarışdırıcı xəritəya eklenmektedir.

Tahmin kutusunun merkez hüceyrəsi tam şəbəkəırlık, komşu hüceyrələr kısmi şəbəkəırlık almaktadır. Bir görüntüdeki bütün proqnozler toplandıktan sonra xəritə kendi maksimum dəyərine bölünerek en böyük hüceyrə 1 olacak şəgilde normalleştirilmektedir.

Bu üsul fərqli görüntülərdeki mutlak inam puanlarının miqyas farkını azaltmaktadır. Lakin bütün proqnozlerin düşük inamli olduğu bir görüntüde bilə ən yüksək zəif yanıtın 1’e miqyaslenebilmesi olasıdır. Tədqiqat bu riskin semantik düzeltme aşamasında ne ölçüde giderildiğini ayrı bir inam kalibrasiyau təcrübəiyle ölçmemiştir.

Sürekli istem belirteçleriyle ön hizalama

Hedef və qarışdırıcı kategorilərin her biri üçün dört öğreniləbilir bşəbəkəlam belirteci kullanılmaktadır:

\[ Q_{\mathrm{tar}},Q_{\mathrm{conf}}\in\mathbb{R}^{N\times D_{\mathrm{word}}},\qquad N=4 \]

Kategori adı embeddingsi \(e_m\), uygun bşəbəkəlam belirteçleriyle birleştirilərek mətn dizisi oluşturulmaktadır:

\[ X_m=[Q_{\mathrm{tar/conf}}\parallel e_m] \]

Bu dizi, şəbəkəırlıkları dondurulmuş CLIP mətn kodlayıcistilikndan geçirilmekte və normalize edilmiş mətn prototipine dönüştürülmektedir:

\[ t_m=\mathrm{Norm}(G(X_m)) \]

Tədqiqatda CLIP ViT-B/16 kullanıldığı və ortak semantik uzayın 512 boyutlu olduğu qeyd edilmişdir. Öğretmenin fərqli kanal sayılarına sahip özellik piramidi seviyeleri, iki qatlı bir MLP ilə eyni 512 boyutlu uzaya tpeyəndnmaktadır:

\[ h^\ell(f)=W_2^\ell\,\mathrm{GeLU}(W_1^\ell f+b_1^\ell)+b_2^\ell \]

Gerçek etiket kutularındaki öğretmen xüsusiləri RoIAlign ilə havuzlanarak vizual prototipləre dönüştürülür. Görsel və mətnsel prototiplerin eşleşmesi çox kipli InfoNCE kaybıyla optimallaşdırmaq edilmektedir:

\[ \mathcal{L}_{\mathrm{pre}}= -\frac{1}{K}\sum_{k=1}^{K} \log \frac{ \sum_{m=1}^{M}y_{k,m}\exp(\langle v_k,t_m\rangle/\tau_{\mathrm{clip}}) }{ \sum_{j=1}^{M}\exp(\langle v_k,t_j\rangle/\tau_{\mathrm{clip}}) } \]

\(v_k\), öğretmen xüsusilərinden çıqarılan görsel prototipi; \(t_m\), öğrenilmiş mətn prototipini; \(y_{k,m}\), doğru semantik eşleşmeyi; \(\tau_{\mathrm{clip}}\) isə temperatur katsayistiliknı belirtmektedir.

8. sayfadaki Şegil 4, gerçek etiket kutularından öğretmen FPN xüsusilərine, RoIAlign işlemina, iki qatlı MLP’ye, vizual prototipləre və öğreniləbilir mətn istemlerine uzanan iki kollu ön hizalama müddətcini göstərir. Öğretmen arxitektura gövdədumanı və CLIP mətn kodlayıcistilik dondurulurken projeksion MLP’si ilə davamlı prompt tokenləri güncellenmektedir.

Semantik P-xəritəsi düzeltmesi

Ön hizalamadan sonra öğrenilmiş istem belirteçleri dondurulmaktadır. Öğretmen xüsusilərinin her uzamsal konumu semantik uzaya yansıtılır:

\[ z_{x,y}^{\ell}=\mathrm{Norm}\left(h^\ell(f_{x,y}^{\ell})\right) \]

Yerel özelliğin hədəf kavrama mı, yoksa qarışdırıcı kavrama mı daha yaxınn olduğu aşşəbəkəıdaxın farkla hesaplanmaktadır:

\[ s^\ell(x,y)= \langle z_{x,y}^{\ell},t_{\mathrm{tar}}\rangle - \langle z_{x,y}^{\ell},t_{\mathrm{conf}}\rangle \]

Pozitif dəyər hədəf semantiğine, negatif dəyər qarışdırıcı semantiğine yaxınnlığı ifade eder. Semantik skor belirli bir \(\theta\) eşiğini aştığında kırpılmış bir düzeltme terimi oluşturulmaktadır:

\[ \Delta^\ell(x,y)= \gamma\,\mathrm{clip}(s^\ell(x,y),-1,1) \mathbb{I}(|s^\ell(x,y)|\geq\theta) \]

Hedef P-xəritəsi bu şəgildə güncellenmektedir:

\[ \widehat{P}_{\mathrm{target}}^\ell= \mathrm{Norm}_{\max} \left( \max(0,P_{\mathrm{target}}^\ell+\Delta^\ell) \right) \]

Semantik kimi yanğın və ya tüstüla uyumlu bölgeler güçlenmekte; lamba və ya yansıma kavramlarına yaxınn bölgeler zəiflamaktadır. Metin, qarışdırıcı xəritəya benzer bir düzeltmenin uygulanabiləceğini belirtmekte, lakin sonraxın bölümde istifadə edilən \(\widehat{P}_{\mathrm{confuse}}^\ell\) xəritəsının kesin güncelleme tənlikini ayrı biçimde sunmamaktadır.

Prototip bankası nasıl oluşturulmaktadır?

İyiləştirilmiş hədəf xəritəsı, hangi öğretmen özellik kanallarının tehlike bölgelerinde daha güclü olduğunu hesablamak üçün kullanılmaktadır. Kanal şəbəkəırlıkları softmax ilə normalize edilir. Her özellik piramidi seviyesinde ən yüksək yanıt veren yerli bölgeler seçilir və kanal şəbəkəırlıklı havuzlama ilə prototip vektörleri üretilir.

Prototipler iki grupta saklanmaktadır:

  • Hedef prototipleri: Yanğın və tüstüla ilişgili yüksek yanıtlı öğretmen xüsusiləri.
  • Karıştırıcı prototipler: Lamba, yansıma, parlak struktur və ya benzer çətin neqativlerle ilişgili xüsusilər.

Her özellik seviyesi üçün sabit tutumli ayrı kuyruklar kullanılmaktadır. Kuyruk dolduğunda en eski prototip çıqarılmaktadır. Varsayılan ayarda səviyyə bpeyəndna hədəf və qarışdırıcı kuyruğu üçün 32 prototip tutulmaktadır.

Kuyrukların boş olması durumunda normalize edilmiş rastgele vektörlerin geçici prototip kimi döndürüldüğü qeyd edilmişdir. Bu koruma yazılımın tədqiqatsını sürdürür; lakin rastgele prototiplerin təlime ne sıklıkta girdiği və itki funksiyasına ne kadar səs-küy eklediği raporlanmamıştır.

Öğrenci belirteçlerinin seçilmesi

Öğrenci özellik piramidindeki uzamsal noktalar üç dşəbəkəılıma görə nümunəlenmektedir:

\[ p^\ell_{\tau}(y,x)= \begin{cases} \dfrac{\widehat{P}^\ell_{\mathrm{target}}(y,x)} {\sum_{y',x'}\widehat{P}^\ell_{\mathrm{target}}(y',x')+\epsilon}, & \tau=\mathrm{pos}\\[8pt] \dfrac{\widehat{P}^\ell_{\mathrm{confuse}}(y,x)} {\sum_{y',x'}\widehat{P}^\ell_{\mathrm{confuse}}(y',x')+\epsilon}, & \tau=\mathrm{neg}\\[8pt] \dfrac{1-\widehat{P}^\ell_{\mathrm{target}}(y,x)} {\sum_{y',x'}(1-\widehat{P}^\ell_{\mathrm{target}}(y',x'))+\epsilon}, & \tau=\mathrm{neg\_bg} \end{cases} \]

Pozitif dşəbəkəılım gerçek tehlike bölgelerine, negatif dşəbəkəılım özel qarışdırıcılara, fon dşəbəkəılımı isə düşük hədəf olasılığı bulunan diğer bölgelere odaklanmaktadır. Varsayılan kimi səviyyə bpeyəndna 32 pozitif və 64 negatif belirteç seçilmekte; negatiflerin %60’ı qarışdırıcı xəritəsından alınmaktadır.

Seçilən öğrenci özelliği seviye özelinde doğrusal bir başlıqla 512 boyutlu ortak uzaya aktarılmaktadır:

\[ z=\mathrm{Norm}(W_s^\ell h_{\ell,y,x}) \]

Maska Yönləndirməli Çox Ölçəkli Qarşıt Hizalama

MMCA, öğrenci belirteçleri \(Z\) ilə öğretmen prototipleri \(P\) arasındaki benzerlik matrisini hesablamaktadır:

\[ S=\frac{1}{\tau}ZP^\top \]

Karıştırıcı prototipleri işaretleyen \(c\) vektörü istifadə edilərək benzerliklere sapma eklenmektedir:

\[ \widetilde{S}=S+\mathbf{1}c^\top\log(\eta_{\mathrm{conf}}) \]

Varsayılan \(\eta_{\mathrm{conf}}\) dəyəri 1,5’tir. Metin, bu işlemin qarışdırıcı prototipleri strukturlandırılmış çətin neqativ hâline getirdiğini və öğrencinin onlardan uzaklaşmasını sşəbəkəladığını belirtmektedir. Bununla belə pozitif, qarışdırıcı və fon belirteçleri üçün ayrı hədəf etiket matrisi məlumatlmemiştir. Her belirteç üçün maksimum benzerlikli prototipin hədəf seçilmesi, xüsusilə negatif belirteçlerin hangi yöne optimallaşdırmaq edildiğinin daha açık diaqnozmlanmasını gerektirmektedir.

Her belirtecin kaybı, eyni özellik piramidi seviyesindeki en yaxınn prototip üzərindən hesaplanmaktadır:

\[ \ell_i= -\left(\widetilde{S}_{i,j_i^*}-m_i\right) + \log\sum_{j=1}^{N_p} \exp(\widetilde{S}_{ij}-m_i) \]

Uzamsal inam şəbəkəırlığı; pozitif nümunəlerde hədəf P-xəritəsindan, qarışdırıcı nümunəlerde qarışdırıcı P-xəritəsindan, fonda isə hədəf olasılığının tamamlayıcistilikndan alınmaktadır. Toplam itki:

\[ \mathcal{L}_{\mathrm{MMCA}}= \frac{\sum_i w_i\ell_i}{\sum_i w_i+\epsilon} \]

kimi diaqnozmlanmıştır. Gradyan yalnız öğrenci xüsusilərine və öğrenci projeksion başlıqlarına ilətilmekte; prototip bankındaki öğretmen vektörleri dondurulmuş kimi kullanılmaktadır.

Veri kümesi nasıl yaradılmışdır?

Tədqiqatın hibrid Industrial Fire&Smoke məlumat kümesi toplam 11.023 etiketli görüntü içermektedir:

Veri kaynşəbəkəıGörüntü sayistilikQaynaq özelliği
Özel sənaye görüntülər5.34012 petrokimya rafineri bölgesi və kimyəvi tank sahəsi
Açık DFS məlumat kümesi5.683Genel yanğın və tüstü görüntüləri
Toplam11.023Hibrit sənaye və açık alan məlumat kümesi

Özel görüntülər sabit 1080p uzun mənzilli kameralarla toplanmış və zamanla bşəbəkəlı tekrarları azaltmak amacıyla her beş saniyəde bir qare alınmıştır. Görünür tüstü və ya alev bölgesi 5 × 5 pikselden böyük olduğunda sıkı sərhədləyici qutuyla etiketlenmiştir.

Hedef sinifləri yüngül tüstü, sıx tüstü və yanğındır. Öğretmenin kullandığı qarışdırıcı siniflər küçə lampası, güclü əksolunma və parlaq şəbəkəac örtüyüdür.

Veri bölümüGörüntü sayistilikYaklpeyəndk nisbət
Eğitim8.819%80
Doğrulama1.102%10
Test1.102%10
SmokeFire–Night alt kümesi625Test kümesinden 19.00–05.00 qareleri

11. sayfadaki Şegil 5, gündüz və gecə çegilmiş baca tüstüı, uzak tüstü sütunu, açık alev, projektör, vaqon ışığı və yansıma nümunələrini göstərir. Görseller, məlumat kümesinin fərqli hədəf böyüklükleri və aydınlatma şərtlərı içerdiğini göstərir. Bununla belə sinif üzrə görüntü və kutu sayıları, kamera bpeyəndna dşəbəkəılım, teduman bazlı bölme və etiketleyicilər arası uyum raporlanmamıştır.

PASCAL VOC dəyərləndirməsi

Yöntemin yalnız sənaye məlumat kümesine özgü olup olmadığını dəyərləndirmək üçün təxminən 5.000 təlim və 5.000 doğrulama görüntüsünden yaranan PASCAL VOC kurulumu istifadə edilmişdir. Makale, birbirine yaxınn görsel kategoriləre odaklandığını belirtmekte; lakin seçilən siniflərin tam listesi, nümunəleme üsulu və “person/rider” eşlemesinin nasıl oluşturulduğu açıklanmamaktadır.

Tədqiqatın Yöntemi və Bulguları

Model və təlim düzeni

Yöntem öğesiTədqiqatda istifadə edilən ayar
Varsayılan öğretmenYOLO26-large
Varsayılan öğrenciYOLO26-small
Alternatif öğrencilərYOLOv10-small, YOLOv8-small və RetinaNet-MNv2
Görüntü boyutu640 × 640 piksel
Distillasiya seviyeleriFPN P3–P5
Görüntü-dil kodlayıcistilikDondurulmuş CLIP ViT-B/16
Semantik uzay512 boyut
Sürekli prompt tokeni4
Prototip tutumsiSeviye və kuyruk bpeyəndna 32
Pozitif öğrenci belirteciSeviye bpeyəndna 32
Negatif öğrenci belirteciSeviye bpeyəndna 64
Karıştırıcı nümunə nisbəti0,6
Karıştırıcı sapması\(\eta_{\mathrm{conf}}=1,5\)
OptimizasyonSGD; momentum 0,9; şəbəkəırlık azalması \(5\times10^{-4}\)
Başlangıç öyrənmə nisbəti\(1\times10^{-3}\), kosinüs azalma
Isınma müddəti5 epoch
Eğitim müddəti200 epoch
Batch böyüklüğü8
ArtırmalarYatay çevirme, HSV değişimi, Mosaic və MixUp
Eğitim donanımıİki RTX A6000 GPU və otomatik qarma hassasiyet

PASCAL VOC nəticələri

YöntemmAP@0,5mAP@[0,5:0,95]ParametreGecikme
YOLO26-large öğretmen83,658,931,8 milyon6,4 ms
YOLO26-small öğrenci75,149,08,4 milyon2,3 ms
FGD78,051,68,4 milyon2,4 ms
PKD78,452,08,4 milyon2,4 ms
GID78,251,98,4 milyon2,5 ms
CrossKD78,752,48,4 milyon2,5 ms
UET79,152,88,4 milyon2,5 ms
Önerilən üsul80,454,28,4 milyon2,5 ms

Önerilən üsul, ham öğrenciye görə mAP@0,5 dəyərini 5,3 puan və daha katı mAP@[0,5:0,95] dəyərini 5,2 puan artırmışdır. Bu nəticə, üsulun yalnız yanğın və tüstü kategorilərinde değil, genel obyekt aşqarlanması görəvinde də yararlı olabiləceğini destoynaqektedir. Lakin VOC alt kümesinin tam diaqnozmı məlumatlmediğinden təcrübəin aynen tekrarlanması zordur.

Industrial Fire&Smoke ana nəticələri

YöntemHafif tüstü APYoğun tüstü APYanğın APOrtalama APYanlış siqnalParametreGecikme
YOLO26-large öğretmen66,868,565,767,0%2,931,8 milyon6,4 ms
YOLO26-small öğrenci51,253,849,651,5%14,78,4 milyon2,3 ms
FGD56,758,455,256,8%8,88,4 milyon2,4 ms
PKD57,459,155,957,5%8,08,4 milyon2,4 ms
GID57,859,556,357,9%7,78,4 milyon2,5 ms
CrossKD58,160,256,758,3%7,48,4 milyon2,5 ms
UET58,760,957,459,0%6,88,4 milyon2,5 ms
TCSN-YOLO62,463,657,561,2%8,68,9 milyon3,1 ms
Önerilən üsul63,865,162,463,8%3,48,4 milyon2,5 ms

Önerilən üsul, ham YOLO26-small öğrenciye görə ortalama AP’yi 12,3 puan artırmış və yanlış siqnal nisbətinı 11,3 yüzde puanı azaltmışdır. Öğretmenin 67,0 ortalama AP dəyərine yaklpeyəndrken parametr sayını 31,8 milyondan 8,4 milyona indirmektedir.

SSmokeDet satırında yanğın AP’si çizgiyle gösterilmiş olmasına rşəbəkəmen 61,2 ortalama AP məlumatlmiştir. Sunulan hafif və sıx tüstü dəyərlərinden bu ortalama yeniden hesaplanamamaktadır. Bu nedenle üsuller arası ardıcıllıqlamada ilgili satır temkinli okunmalıdır.

Farklı aşqarlayıcı ailəlerinde genelleme

Öğrenci modeliHam ortalama APDamıtılmış ortalama APHam yanlış siqnalDamıtılmış yanlış siqnal
YOLOv10-small48,961,5%16,4%3,8
YOLOv8-small47,660,7%17,2%4,2
YOLO26-small51,563,8%14,7%3,4
RetinaNet-MNv246,158,4%18,0%5,6

Dört öğrenci mimarisinin tamamında ortalama AP təxminən 12–13 puan artmış, yanlış siqnal nisbəti aydın biçimde azalmışdır. Bu nəticə üsulun yalnız belirli bir YOLO sürümüne bşəbəkəlı olmadığını destoynaqektedir. Bununla belə her mimarinin nəticələri tek məlumat kümesi və açıklanmayan tek gecikme donanımı üzərində əldə edilmişdir.

Gece sahnelerindeki nəticələr

YöntemHafif tüstü APYanğın APYoğun tüstü APOrtalama APYanlış siqnalGecikme
YOLO26-large öğretmen62,464,761,963,0%4,16,4 ms
YOLO26-small öğrenci47,349,247,047,8%22,62,3 ms
UET55,056,254,555,2%9,42,5 ms
TCSN-YOLO57,255,056,656,9%8,23,1 ms
Önerilən üsul59,460,858,759,6%4,62,5 ms

Gece alt kümesinde ortalama AP 11,8 puan yükselmiş və yanlış siqnal nisbəti 18 yüzde puanı düşmüşdür. 15. sayfadaki Şegil 7, təməl modelin parlak lamba bölgesinde yanlış aktivləşdirmə oluşturduğunu; önerilən üsulun eyni bölgeyi bastırarak gerçek hədəfe odaklandığını göstərir.

Etkinleştirme xəritəları

14. sayfadaki Şegil 6; yüngül tüstü, yanğın və sıx tüstü üçün test görüntüsünü FGD, PKD, GID, CrossKD və önerilən üsulun istilik xəritələriyla müqayisəktadır. Önerilən üsulde sıcak aktivləşdirmə bölgeleri hədəf üzərində daha dar və yoğun görünürken çevredeki parlak strukturlar daha düşük yanıt almaktadır.

Bu görseller üsulun tədqiqat mekanizmasıyla uyumludur; lakin seçilən nümunələrin bütün test dəstini temsil edip etmediğini göstermez. Isı xəritəlarının nicel sonucu, məhdud sayıdaki açıklamalı bölgede strukturlan DSR analiziyle desteklenmiştir.

Semantik iyiləştirmenin nicel analizi

SmokeFire–Night alt kümesindeki 80 açıklamalı ilgi bölgesinde, iyiləştirme əvvəlsi və sonrası ortalama P-xəritəsi etkinliği ölçülmüşdür:

\[ V_{\mathrm{avg}}(R)= \frac{1}{N}\sum_{(x,y)\in R}P(x,y) \]

Diqqət Yayındırıcı Bastırma Nisbəti:

\[ \mathrm{DSR}(R)= \frac{V_{\mathrm{avg}}^{\mathrm{refined}}(R)} {V_{\mathrm{avg}}^{\mathrm{orig}}(R)} \]

Bölgeİlk ortalamaİyiləştirilmiş ortalamaDSR
Gerçek tüstü0,8820,8650,98 — korundu
Gerçek yanğın0,9150,9080,99 — korundu
Sokak lambaları0,7640,1420,18 — bastırıldı
Yansımalar0,6280,1150,18 — bastırıldı

16. sayfadaki Şegil 8, ön hizalama əvvəlsinde hədəf və qarışdırıcı prototiplerin ortak uzayda birbirine qarıştığını, sonrasında isə iki kümenin ayrıştığını göstərir. Aynı şeklin P-xəritəsi nümunələrinde gerçek tüstü və alev korunurken lamba və su əksolunmalarının zəiflatıldığı görülmektedir.

Bu analiz mekanizmanın amaçlandığı gibi çalıştığını destoynaqektedir. Lakin 80 bölgenin hangi görüntülərden və hangi nümunəleme üsuluyle seçildiği, dəyərləndirməyi yapan kişilərin korlenip korlenmediği və qeyri-müəyyənlik aralıkları açıklanmamıştır.

Biləşen çıqarma nəticələri

Model çeşidiSemantik P-xəritəsiÖn hizalamaKarıştırıcı prototipOrtalama AP
Distillasiyasız öğrenciHayırHayırHayır51,5
Semantiksiz prototip distillasiyasıHayırHayırEvet59,8
Ön hizalamasız semantik P-xəritəsiEvetHayırEvet61,6
Karıştırıcı prototipsiz semantik üsulEvetEvetHayır61,9
Tam üsulEvetEvetEvet63,8

Yalnız prototip distillasiyası, öğrenciye 8,3 puan kazandırmıştır. Sabit mətn semantiğiyle P-xəritəsi iyiləştirmesi sonucu 61,6’ya, müddətkli istem ön hizalaması və qarışdırıcı prototiplerin birlikte kullanılması isə 63,8’e çıqarmıştır. Bu nəticə, performans artışının tek bir komponentden değil, struktur prototip aktarımı ilə semantik ayrımın birleşiminden geldiğini göstərir.

MMCA nisbət və sapma analizi

Karıştırıcı nümunə nisbəti\(\eta_{\mathrm{conf}}\)Ortalama AP
0,31,562,4
0,61,563,8
0,91,563,0
0,61,062,7
0,62,562,2

Az sayıda qarışdırıcı nümunə kullanılması çətin neqativ öğrenimini zəiflatırken, nisbəti 0,9’a çıqarmak hədəf prototiplerinin töhfəsinı azaltmışdır. Benzer biçimde qarışdırıcı sapmasının peyəndrı büyütülmesi performansı düşürmüştür. En iyi bildirilən denge 0,6 nümunə nisbəti və 1,5 sapma katsayistilikdır.

Prototip, belirteç və istem tutumsi

DeğişkenAyarOrtalama AP
Seviye bpeyəndna prototip1662,3
Seviye bpeyəndna prototip32 — varsayılan63,8
Seviye bpeyəndna prototip6464,0
Pozitif belirteç1663,0
Pozitif belirteç32 — varsayılan63,8
Pozitif belirteç6463,9
Sürekli prompt tokeni263,1
Sürekli prompt tokeni4 — varsayılan63,8
Sürekli prompt tokeni863,7

64 prototip 64,0 ilə ən yüksək ortalama AP’yi üretmiştir; tədqiqatçılar 32 prototipi performans-tutum dengesi nedeniyle varsayılan seçmiştir. Lakin 32 və 64 prototip arasındaki yaddaş, təlim müddəti və ya enerji farkı raporlanmamıştır.

Tədqiqatın güclü yönleri

  • Sənaye yanğın aşqarlamada gerçek hədəfləri və aydınlatma qaynaqlı çətin neqativleri açıkça ayırması.
  • Öğretmenin yanlış yüksek tepgilərini birbaşa öğrenciye aktarmak yerine əvvəl semantik kimi süzmesi.
  • Görüntü-dil modelini yalnız təlim ardıcıllıqsında kullanarak saha modelini hafif tutması.
  • Hedef və qarışdırıcı prototipleri özellik piramidi seviyelerine görə ayrı saklaması.
  • PASCAL VOC, ana Fire&Smoke testi və gecə alt kümesi üzərində fərqli dəyərləndirməler sunması.
  • YOLOv8, YOLOv10, YOLO26 və RetinaNet ailəlerinde eyni performans yönünü göstermesi.
  • Yanlış siqnal nisbətinı dəqiqlik metrikleriyle birlikte raporlaması.
  • Biləşen çıqarma, prototip tutumsi, nümunə nisbəti və istem uzunluğu analizleri yapması.
  • Özel görüntülərin paylpeyəndm məhdudlığını və üretkən süni intellekt istifadəsinı açıkça beyan etmesi.

Temel məhdudlıklar

  • Tədqiqat rəyçi qiymətləndirməsindən keçməmişdir.
  • Özel sənaye görüntülərin paylpeyəndlmaması tam yeniden istehsali engellemektedir.
  • Teduman, kamera və zaman dizisi təməlinde məlumat ayrımı açıklanmamıştır.
  • Sınıf bpeyəndna görüntü və kutu sayıları məlumatlmemiştir.
  • Etiketleyici sayistilik, kalite denetimi və gözlemcilər arası uyum raporlanmamıştır.
  • Fire&Smoke AP dəyərlərinin IoU eşiği açık değildir.
  • Yanlış siqnal nisbətinın formulaü və dəyərləndirmə birimi belirtilmemiştir.
  • Sonuçlar tek çalıştırma dəyərləri kimi sunulmuş; standart sapma və etibar aralığı məlumatlmemiştir.
  • Gecikme testi üçün donanım, batch, hassasiyet, yazılım ortamı və istiliknma protokolü belirtilmemiştir.
  • Jetson, FPGA, NPU və ya sənaye edge kompüterda gerçek test strukturlmamıştır.
  • Video müddətkliliği, zamanla bşəbəkəlı siqnal birləşdirmə və olay düzeyi performans araşdırılmamışdır.
  • Sis, su buxarı, mənbə ışığı, baca emisyonu və meşale bacası gibi ek sənaye qarışdırıcılar ayrı sinif kimi dəyərlendirilmemiştir.
  • Öğretmenin altı siniflı, öğrencinin üç təhlükəsizlik siniflı çıkış strukturunın kesin təlim eşlemesi tam açıklanmamıştır.
  • Karıştırıcı P-xəritəsinın semantik güncelleme tənliki əskiktir.
  • MMCA’nın negatif və fon nümunələrini hangi prototiplere çektiği və ya hangilərinden ittiği matematiksel kimi yeterince açık değildir.
  • Prototip kuyruğu boşken istifadə edilən rastgele vektörlerin etkisi ölçülmemiştir.
  • P-xəritələrinın görüntü bpeyəndna maksimum dəyəre görə normalleştirilmesi mutlak öğretmen inamıni ortadan kaldırmaktadır.
  • SSmokeDet üçün məlumatlen ortalama AP cədvəldaki sinif dəyərlərinden yeniden hesaplanamamaktadır.
  • Makale şablon mətnleri və tamamlanmamış atıf işaretleri içermektedir.

Tədqiqatın desteklediği nəticələr

  • Kontrollü təcrübələrde semantik yönlendirmeli prototip distillasiyası, ham yüngül aşqarlayıcıdan daha yüksek AP üretmiştir.
  • Tədqiqatın gecə alt kümesinde lamba və yansıma qaynaqlı aktivləşdirməler aydın biçimde azaltılmıştır.
  • Hedef və qarışdırıcı prototiplerin ayrı modellenmesi, qarışdırıcı prototipsiz varyanta görə daha yüksek ortalama AP sşəbəkəlamıştır.
  • Sürekli istem belirteçleri, sabit genel CLIP istemlerinden daha iyi nəticə vermiştir.
  • Yöntem fərqli YOLO və RetinaNet öğrenci ailəlerinde benzer performans yönü göstərmişdir.
  • Distillasiya modullari çıqarım ardıcıllıqsında kaldırılabildiği üçün öğrenci parametr sayı 8,4 milyon kimi saxlanmışdır.

Tədqiqatın kanıtlamadığı nəticələr

  • Sistemin gerçek bir yanğını mevcut təhlükəsizlik dumantemlerinden daha erken algıladığı gösterilmemiştir.
  • Yöntemin bütün petrokimya tedumanlerine, iklimlere və kamera türlerine genellenebilirliği kanıtlanmamıştır.
  • Yanlış siqnal azalmasının saat, vardiya və ya kamera bpeyəndna operasyonel qarşılığı gösterilmemiştir.
  • Modelin gerçek gömülü cihazda bildirilən milisaniyə dəyərləriyle çalıştığı kanıtlanmamıştır.
  • Termal, kızılötesi, gaz və ya noktasal tüstü sensorleriyle bütünlhədd təhlükəsizlik başaristilik ölçülmemiştir.
  • Özel məlumat kümesindeki nəticələrin bşəbəkəımsız bir araşdırma grubu tarafından tekrarlandığı gösterilmemiştir.
  • Modelin tüstü türü, yanğın böyüklüğü və ya tehlike seviyesi hakkında inamılir fiziki ölçmə yaptığı gösterilmemiştir.
  • Tek görüntü dəyərləndirməsi, kesintisiz video üzərində sabit siqnal davranışını sübut etmir.
  • Model çıktistilik sertifikatlı yanğın siqnalı və ya təhlükəsizlik-kritik otomatik kapatma qararı kimi təsdiqlənməmişdir.

Mənbə və Metod Qeydi

Tədqiqatın tam özgün adı: Semantic-Guided Prototype Distillation with Vision-Language Refirütubətent for Long-Range Industrial Fire and Smoke Detection

Yazarlar: Yang Zhang; Yijun Wan; Yuan Xu; Mingqing Zhang; Yanlin He; Wei Ke; Hao Sheng.

Yazar ardıcıllıqlaması: Yang Zhang birinci, Yijun Wan ikinci, Yuan Xu üçüncü, Mingqing Zhang dördüncü, Yanlin He beşinci, Wei Ke altıncı və Hao Sheng yedinci müəllifdır.

Eş birinci müəllif: Eş töhfə və ya eş birinci müəllif beyanı araşdırılan sürümde yer almamaktadır.

Sorumlu müəllif: SSRN rəsmi kaydı Yang Zhang’ı əlaqə müəllifi kimi göstərir. İncelenen makalenin müəllif sayfasında məsul müəllifı belirleyen yıldız və ya ayrı bir dipnot bulunmamaktadır.

Yazarlar və qurumlar:

  • Yang Zhang — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, Çin.
  • Yijun Wan — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, Çin.
  • Yuan Xu — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, Çin.
  • Mingqing Zhang — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, Çin.
  • Yanlin He — College of Information Science and Technology, Beijing University of Chemical Technology, Beijing, Çin.
  • Wei Ke — Macao Polytechnic University, Makao, Çin.
  • Hao Sheng — School of Computer Science and Engineering, Beihang University, Beijing, Çin.

İletişim adresi: Yang Zhang üçün araşdırılan sürümde yang_zh@mail.buct.edu.cn adresi məlumatlmiştir.

ORCID: ORCID bilgiləri araşdırılan sürümde yer almamaktadır.

DOI:10.2139/ssrn.7192544

Dergi: Hakemli bir jurnal adı araşdırılan sürümde yer almamaktadır.

Yayınevi: Kesinleşmiş son nəşriyyat bilgisi bulunmamaktadır. SSRN, tədqiqatın preprint kayıt və dşəbəkəıtım platformaudur.

Yayın platformau: SSRN.

SSRN kayıt tarihi: 27 Temmuz 2026.

Yayın yılı: 2026.

Qaynaq türü: Bilgi distillasiya, görüntü-dil ön hizalaması, özel və açık görüntü məlumat kümeleri və çoxlu obyekt aşqarlayıcı müqayisəları içeren eksperimental süni intellekt araşdırması preprinti.

Hakemlik durumu: Tədqiqat rəyçi qiymətləndirməsindən keçməmişdir. Bu durum başlıq sayfasında və bütün makale sayfalarında açıkça qeyd edilmişdir.

Resmî mənbə:SSRN rəsmi tədqiqat kaydı.

Qaynaq kod: Tədqiqatçılar tətbiqnın anonim araşdırma deposunda paylpeyəndldığını belirtmektedir. Depodaki bütün dosyaların sürümü və təcrübələri bu dəyərləndirməde həmçinin çalıştırılarak təsdiqlənməmişdir.

Veri erişimi: Açık DFS məlumat kümesi özgün kaynşəbəkəından erişiləbilir kimi qeyd edilmişdir. Petrokimya rafineriləri və tank sahalarından alınan özel görüntülər; sənaye təhlükəsizlik, gizlilik və mahremiyet gerekçeleriyle kamuya açık değildir. Ek bilgi, məlumat kullanım kistiliktları altında məsul müəllifdan istenebilmektedir.

Finansman: Ayrı bir maliyyələşmə beyanı araşdırılan sürümde yer almamaktadır.

Çıqar çatışması: Yazarlar tədqiqatı etgiləyebiləcek bilinen mali çıqar və ya kişisəl ilişki bulunmadığını beyan etmiştir.

Etik və mahremiyet: İnsan və ya heyvan təcrübəi raporlanmamıştır. Özel sənaye görüntülərin mahremiyet və təhlükəsizlik nedeniyle paylpeyəndlmadığı belirtilmiş; kamera görüntülərindeki olası kişisəl məlumatlarin anonimleştirme və ya etik inceleme üsulu ayrıntılandırılmamıştır.

Üretken süni intellekt beyanı: Tədqiqatçılar ChatGPT’yi dil düzeltme, makale düzeni, LaTeX biçimlendirmesi və editoryal iyiləştirme üçün kullandıklarını; təcrübə məlumatsi üretme, model eğitme və ya bilimsel nəticə çıqarma amacıyla kullanmadıklarını belirtmiştir. Yazarlar bütün içeriği gözden geçirdiklerini və son sualmluluğu üstlendiklerini açıklamıştır.

Bu Türkçe açıklama, yüklenen 20 sayfalık dosyanın başlıq və müəllif bilgiləri, ana metni, 13 tənliki, sekiz cədvəlsu, sekiz şekli, məlumat kümesi nümunələri, aktivləşdirmə xəritələri, komponent çıqarma təcrübələri, nəticələri, məlumat erişim beyanları və mənbəçası incelenerek hazırlanmışdır. Bilimsel içeriğe tədqiqat dışında yeni bir təcrübə sonucu eklenmemiştir. Dış mənbəlar yalnızca başlıq, müəllif ardıcıllıqsı, əlaqə müəllifi, DOI, kayıt tarihi və qurum bilgilərinin bibliyoqrafik doğrulanması amacıyla istifadə edilmişdir.

Tədqiqatın nəticələri, semantik yönlendirmeli prototip distillasiyasının araşdırılan məlumat kümesinde kiçik və aşşəbəkəı kontrastlı yanğın-tüstü hədəflərini aşqarlamayı geliştirebildiğini və aydınlatma qaynaqlı yanlış tepgiləri azaltabildiğini destoynaqektedir. Lakin özel məlumatnin paylpeyəndlmaması, yanlış siqnal və AP ölçütlerindeki raporlama əskikləri, istatistiksel belirsizliğin məlumatlmemesi və gerçek uç cihaz saha testinin bulunmaması nedeniyle üsul henüz bşəbəkəımsız kimi doğrulanmış sənaye erkən xəbərdarlıq dumantemi kimi dəyərlendirilmemelidir.


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy