
Bu çalışma, gözetim videolarındaki anormal insan etkinliklerini otomatik olarak belirlemek amacıyla YOLOv8, ResNet50, çift yönlü uzun-kısa süreli bellek ağı ve uyarlamalı nöro-bulanık çıkarım sistemini birleştiren hibrit bir mimari önermektedir. Model, 16 eğitim ve 21 test videosu içerdiği belirtilen AVENUE veri kümesi üzerinde değerlendirilmiş; araştırmacılar yüzde 98 doğruluk, yüzde 97,6 kesinlik, yüzde 97,2 duyarlılık, yüzde 97,4 F1 skoru, 0,99 ROC-AUC ve yüzde 2,1 yanlış alarm oranı bildirmiştir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; deney protokolündeki eksikler ve bildirilen performans değerleriyle karışıklık matrisi arasındaki tutarsızlıklar nedeniyle sonuçlar ön bulgu niteliğinde değerlendirilmelidir.
Önerilen sistemde YOLOv8 her video karesindeki insanları bulup sınır kutularıyla yerelleştirmekte, ResNet50 insan duruşu ve sahne bağlamı gibi uzamsal özellikleri çıkarmakta, çift yönlü uzun-kısa süreli bellek ağı bu özelliklerin zaman içindeki değişimini incelemekte ve uyarlamalı nöro-bulanık çıkarım sistemi hareket hızı, etkinlik süresi, yön değişikliği ve ağların güven puanlarını birlikte değerlendirerek etkinliği normal, şüpheli veya anormal olarak sınıflandırmaktadır. Yaklaşımın temel düşüncesi, birbirine benzeyen hızlı yürüme, koşma, bekleme ve olağandışı yön değiştirme gibi davranışlar arasındaki belirsizliği tek bir kesin eşik yerine örtüşen bulanık üyelik dereceleriyle yönetmektir.
Türkiye açısından değerlendirme: Bu mimari, Türkiye’de belediye ulaşım merkezleri, üniversite kampüsleri, istasyonlar, hastane çevreleri, okul yerleşkeleri ve endüstriyel tesislerde araştırma amaçlı akıllı kamera uygulamalarına uyarlanabilecek bir yöntem çerçevesi sunmaktadır. Ancak bunun için Türkiye’deki kamera açılarını, aydınlatma koşullarını, kalabalık yoğunluklarını ve gündelik hareket örüntülerini temsil eden yerel veri kümeleri oluşturulmalı; normal, şüpheli ve anormal sınıflar açık ölçütlerle etiketlenmeli; bağımsız testlerde yanlış alarm, kaçırılan olay, gecikme ve gerçek zamanlı işlem hızı ölçülmelidir. Çalışmadan Türkiye’de saha başarısı, hukuki uygunluk, gerçek zamanlı çalışma, farklı toplumsal gruplarda eşit performans veya yüzde 2,1 düzeyinde yanlış alarm oranı doğrudan çıkarılamaz.
Araştırmanın temel sorusu nedir?
Araştırmanın temel sorusu, gözetim videolarındaki insan hareketlerinin uzamsal görünümünü, zaman içindeki gelişimini ve belirsiz davranış sınırlarını aynı model içinde birleştirmenin anormal etkinlik tespitini geliştirip geliştiremeyeceğidir. Araştırmacılar özellikle normal yürüyüş ile hızlı hareket, kısa süreli bekleme ile şüpheli oyalanma ve olağan yön değişikliği ile düzensiz hareket arasında kesin sınırlar bulunmadığını vurgulamaktadır.
Çalışma bu soruya dört bileşenli bir mimariyle yanıt vermeyi amaçlamaktadır: YOLOv8 insanları tespit etmekte, ResNet50 görüntü özelliklerini çıkarmakta, Bi-LSTM ardışık karelerdeki hareket örüntülerini öğrenmekte ve ANFIS belirsizliği bulanık kurallarla değerlendirerek son sınıflandırmayı üretmektedir.
Çalışma neden önemlidir?
Gözetim kameraları çok sayıda eş zamanlı video akışı oluşturduğu için bütün görüntülerin insanlar tarafından kesintisiz izlenmesi dikkat azalması, yorgunluk ve kritik olayların gözden kaçırılması riskini taşımaktadır. Araştırmacılar kavga, yasak bölgede koşma, uzun süre oyalanma, nesne fırlatma, ters yönde hareket etme ve alışılmadık hareket örüntüleri gibi olayların otomatik olarak belirlenmesini akıllı gözetim sistemlerinin temel problemlerinden biri olarak ele almaktadır.
Geleneksel yöntemler optik akış, hareket yörüngesi, yönlendirilmiş gradyan histogramı ve elle tasarlanmış başka özelliklere dayanabilmektedir. Çalışmaya göre bu yaklaşımlar ışık değişimi, kalabalık, örtüşme, farklı kamera açıları ve hareketli arka plan karşısında genelleme güçlüğü yaşayabilmektedir. Derin öğrenme modelleri görüntüden özellik öğrenebilse de benzer davranışlar arasındaki belirsizliği her zaman açık biçimde yönetememektedir. Önerilen modelin hedeflediği boşluk, güçlü görsel ve zamansal özellik çıkarımını nöro-bulanık karar verme mekanizmasıyla aynı işlem zincirinde birleştirmektir.
Önerilen mimari nasıl çalışmaktadır?
1. Video karelerinin hazırlanması
Giriş videosu önce ardışık görüntü karelerine ayrılmaktadır:
\[ V = \{F_1, F_2, F_3, \ldots, F_n\} \]
Burada V giriş videosunu, F_i ise videodan çıkarılan i numaralı kareyi göstermektedir. Kare sayısı boyutsuz bir adettir. Çalışmanın yöntem metni karelerin ResNet50 girişi için 224 × 224 piksele getirildiğini belirtmektedir. Buna karşılık genel mimari şemasında 640 × 640 yeniden boyutlandırma gösterilmektedir. Bunların YOLOv8 ve ResNet50 için ayrı boyutlar olup olmadığı açık biçimde açıklanmamıştır.
Piksel değerleri 0 ile 1 arasına taşınmaktadır:
\[ X_{\mathrm{norm}} = \frac{X}{255} \]
X, 0 ile 255 arasındaki özgün piksel yoğunluğunu; Xnorm ise boyutsuz normalleştirilmiş değeri ifade etmektedir. Bu dönüşüm, ağın farklı piksel büyüklükleriyle daha dengeli çalışmasını amaçlamaktadır.
Sensör ve aydınlatma gürültüsünü azaltmak için Gauss filtresi kullanıldığı belirtilmektedir:
\[ G(x,y)=\frac{1}{2\pi\sigma^2}\exp\left(-\frac{x^2+y^2}{2\sigma^2}\right) \]
Bu formülde x ve y merkez piksele göre konumu, σ filtrenin yayılım genişliğini, G(x,y) ise ilgili konumdaki ağırlığı göstermektedir. Konumların piksel cinsinden değerlendirilmesi beklenmekle birlikte çalışmada kullanılan çekirdek boyutu ve σ değeri bildirilmemiştir. Genel şema ayrıca döndürme ve çevirme gibi veri artırma işlemlerini göstermekte, fakat bunların oranları ve parametreleri açıklanmamaktadır.
2. YOLOv8 ile insan tespiti
YOLOv8, her karede insan olarak algıladığı bölgeleri bir sınıf etiketi, güven puanı ve sınır kutusuyla göstermektedir:
[ B = (x,y,w,h) ]
Burada x ve y kutunun konumunu, w genişliğini, h yüksekliğini ifade etmektedir. Koordinatların piksel cinsinden mi yoksa normalize edilmiş biçimde mi tutulduğu belirtilmemiştir. İnsan bölgesi kırpılarak ResNet50’ye aktarılmakta, YOLOv8 güven puanı ise daha sonra ANFIS karar katmanında kullanılan girdilerden biri hâline gelmektedir.
Bu aşamanın amacı, bütün sahneyi aynı ağırlıkla incelemek yerine modelin insan bulunan bölgelere odaklanmasını sağlamaktır. Ancak çalışma, YOLOv8’in hangi ağırlık sürümünü kullandığını, yeniden eğitilip eğitilmediğini, güven eşiğini ve insan tespit başarımını ayrı olarak bildirmemektedir.
3. ResNet50 ile uzamsal özellik çıkarımı
YOLOv8 tarafından belirlenen insan bölgeleri, 50 katmanlı artık bağlantılı sinir ağı ResNet50’ye verilmektedir. Artık öğrenmenin temel ilişkisi şu biçimde sunulmaktadır:
[ y = F(x,W) + x ]
x giriş özellik haritasını, F(x,W) öğrenilebilir W parametreleriyle elde edilen artık dönüşümü, y ise çıkış özellik haritasını ifade etmektedir. Giriş bilgisinin dönüşüm sonucuna doğrudan eklenmesi, derin ağlarda bilginin katmanlar boyunca taşınmasını kolaylaştırmaktadır.
Küresel ortalama havuzlama sonrasında her insan bölgesi için 2048 bileşenli bir özellik vektörü oluşturulduğu belirtilmektedir:
\[ f = [f_1,f_2,f_3,\ldots,f_{2048}] \]
Bu vektör; insan duruşu, beden biçimi, çevredeki nesnelerle etkileşim ve sahne bağlamı gibi görüntüden öğrenilmiş örüntüleri temsil etmeyi amaçlamaktadır. Bileşenlerin tek tek fiziksel birimi bulunmaz; bunlar ağ tarafından öğrenilen sayısal özelliklerdir.
4. Bi-LSTM ile zamansal hareket modelleme
Tek bir kare, bir kişinin koştuğunu, aniden yön değiştirdiğini veya uzun süre aynı bölgede kaldığını tek başına açıklamakta yetersiz kalabilir. Bu nedenle ardışık karelerden elde edilen 2048 boyutlu vektörler bir zaman dizisi olarak çift yönlü uzun-kısa süreli bellek ağına aktarılmaktadır.
Çalışmada zaman adımındaki gizli durum için şu basitleştirilmiş ilişki verilmektedir:
\[ h_t = f(Wx_t + Uh_{t-1} + b) \]
xt t anındaki giriş vektörünü, ht-1 önceki gizli durumu, W ve U öğrenilebilir ağırlık matrislerini, b yanlılık terimini ve f doğrusal olmayan dönüşümü göstermektedir. Bu ifade tam LSTM yapısındaki giriş, unutma ve çıkış kapılarının bütün denklemlerini içermemekte; yalnızca zaman durumunun genel güncellenmesini özetlemektedir.
İleri ve geri yöndeki durumlar şu şekilde birleştirilmektedir:
\[ H_t = [\overrightarrow{h_t};\overleftarrow{h_t}] \]
Bu gösterimde noktalı virgül, iki yönün özelliklerinin birleştirildiğini ifade etmektedir. Model böylece bir karenin yalnızca geçmişini değil, izlenen video parçasındaki sonraki kareleri de kullanmaktadır. Bu özellik çevrim dışı video analizi için yararlı olabilir; ancak gelecekteki karelere ihtiyaç duyulması gerçek zamanlı alarm gecikmesini etkileyebilir. Çalışma bu gecikmeyi ölçmemiştir.
5. ANFIS ile belirsizlik temelli karar verme
Uyarlamalı nöro-bulanık çıkarım sistemi, sinir ağlarının veriden öğrenme yeteneğini bulanık mantığın üyelik fonksiyonları ve “eğer-o hâlde” kurallarıyla birleştirmektedir. Çalışmada ANFIS’e aktarılan beş girdi şunlardır:
- Hareket hızı,
- Etkinliğin süresi,
- Hareket yönündeki değişim,
- YOLOv8 insan tespit güven puanı,
- Bi-LSTM anormal etkinlik olasılığı.
Hareket hızı yavaş, orta ve hızlı gibi dilsel kümelerle ifade edilmektedir. Bir hareket aynı anda belirli oranlarda hem “orta” hem de “hızlı” kümelerine ait olabildiği için kararın keskin bir eşikte aniden değişmesi yerine daha yumuşak bir geçiş amaçlanmaktadır. Örnek kurallarda yüksek hızla düzensiz yön değişimi anormal, düşük hızla düzgün yörünge normal, orta hızla uzun süre devam eden etkinlik ise şüpheli olarak değerlendirilmektedir.
Etkin kuralların sonuçları birleştirilmekte ve ağırlık merkezi durulaştırma yöntemiyle tek bir anomali puanı üretilmektedir. Çalışma puanın normal, şüpheli ve anormal sınıflara dönüştürüldüğünü belirtmektedir. Bununla birlikte bütün üyelik fonksiyonlarının sayısal sınırları, eksiksiz kural tabanı, kuralların öğrenilme yöntemi ve ANFIS eğitim parametreleri verilmemiştir.
Veri kümesi hangi özelliklere sahiptir?
Çalışma, açık hava kampüs gözetim görüntülerinden oluşan AVENUE veri kümesini kullandığını bildirmektedir. Veri kümesinde koşma, nesne fırlatma, olağandışı yönde hareket etme ve uzun süre oyalanma gibi olayların bulunduğu; anormal karelerin elle işaretlenerek test için gerçek referans olarak kullanıldığı belirtilmektedir.
| Veri kümesi özelliği | Çalışmada bildirilen değer |
|---|---|
| Eğitim videosu sayısı | 16 |
| Test videosu sayısı | 21 |
| Görüntü çözünürlüğü | 640 × 360 piksel |
| Kare hızı | 25 kare/saniye |
| Çekim ortamı | Açık hava kampüs gözetimi |
| Etiketleme türü | Kare düzeyinde gerçek referans |
Anormal olayların videoların yalnızca küçük bir bölümünü oluşturduğu ve normal etkinliklerle görsel olarak örtüşebildiği belirtilmektedir. Ancak normal, şüpheli ve anormal biçimindeki üç sınıfın AVENUE etiketlerinden nasıl üretildiği açıklanmamıştır.
Şekiller ve grafikler ne göstermektedir?
Genel mimari şeması
Şekil 1, veri kümesinden başlayarak ön işleme, YOLOv8 insan tespiti, ResNet50 özellik çıkarımı, Bi-LSTM zaman modellemesi, ANFIS karar verme ve normal-şüpheli-anormal çıktısına kadar bütün veri akışını göstermektedir. Şemada doğruluk, kesinlik, duyarlılık, F1 skoru, ROC-AUC ve yanlış alarm oranının değerlendirme ölçütleri olduğu da belirtilmektedir.
Şemanın güçlü tarafı modüllerin görevlerini açık biçimde ayırmasıdır. Bununla birlikte şema eğitim ve test kümelerini “normal ve anormal” olarak gösterirken metin üç çıktı sınıfından söz etmektedir. Şüpheli sınıfın etiket kaynağı açıklanmamaktadır.
Eğitim doğruluğu ve kayıp grafiği
Şekil 2’de eğitim doğruluğu 10 dönem boyunca yaklaşık 0,70’ten 0,98’e yükselmekte, eğitim kaybı ise yaklaşık 0,90’dan 0,12’ye düşmektedir. Bu grafik modelin eğitim verisine giderek daha iyi uyduğunu göstermektedir. Ancak yalnızca eğitim eğrileri sunulmuştur; doğrulama doğruluğu ve doğrulama kaybı verilmediği için aşırı öğrenme olup olmadığı bu grafikten belirlenemez.
Hız üyelik fonksiyonları
Şekil 3’te yatay eksen 0-10 arasında hareket hızını, dikey eksen 0-1 arasında bulanık üyelik derecesini göstermektedir. Yavaş kümesi 0 civarında en yüksek üyeliğe sahip olup 5 civarında sıfıra iner. Orta kümesi yaklaşık 3 ile 7 arasında üçgen biçimindedir ve 5 civarında en yüksek üyeliğe ulaşır. Hızlı kümesi 5 civarında başlayıp 10’da en yüksek üyeliğe ulaşır. Hız ekseninin fiziksel birimi ve bu sınırların veriden mi yoksa uzman tercihiyle mi belirlendiği açıklanmamıştır.
“Süre üyelik fonksiyonu” olarak adlandırılan grafik
Şekil 4’ün başlığı etkinlik süresine ait üyelik fonksiyonunu ifade etmesine rağmen görsel, normal için 20, şüpheli için 40 ve anormal için yaklaşık 84 değerlerini gösteren bir risk puanı sütun grafiğidir. Grafik süre ekseni, kısa-orta-uzun üyelik kümeleri veya örtüşen üyelik eğrileri içermemektedir. Bu nedenle şekil başlığıyla görsel içeriği arasında açık bir uyumsuzluk vardır.
Anomali puanı grafiği
Şekil 5’te 20 kare boyunca anomali puanının yaklaşık 15’ten 96’ya doğru düzenli biçimde yükseldiği ve 70 düzeyinde bir anormal eşik çizgisi bulunduğu görülmektedir. Puan yaklaşık 14. karede eşik düzeyine ulaşmakta ve sonraki karelerde eşiğin üzerine çıkmaktadır. Araştırmacılar bu artışı ani koşma, keskin yön değiştirme ve olağandışı hareketlerle ilişkilendirmektedir.
Bununla birlikte grafikte gerçek video karesi, olay başlangıç-bitiş işaretleri, gerçek referans etiketleri veya farklı normal ve anormal video örnekleri gösterilmemektedir. Anomali puanının 0-100 aralığına nasıl ölçeklendiği ve 70 eşiğinin nasıl seçildiği de açıklanmamıştır.
Karışıklık matrisi
Şekil 6’daki karışıklık matrisi iki satır ve iki sütundan oluşmaktadır. Hücre değerleri 4, 1, 0 ve 5’tir. Böylece toplam 10 örneğin 9’u ana köşegen üzerinde doğru, 1’i yanlış sınıflandırılmış görünmektedir. Bu matrisin doğrudan gösterdiği doğruluk yüzde 90’dır:
\[ \mathrm{Doğruluk} = \frac{4+5}{4+1+0+5} = \frac{9}{10} = 0{,}90 \]
Bu sonuç, metinde bildirilen yüzde 98 doğrulukla uyuşmamaktadır. Ayrıca model çıktısı normal, şüpheli ve anormal olmak üzere üç sınıf şeklinde tanımlanırken karışıklık matrisi yalnızca iki sınıf göstermektedir. Eksenlerde sınıf adları yerine 0 ve 1 etiketleri kullanılmıştır.
Mevcut yöntemlerle karşılaştırma
Şekil 7 ve Tablo 2’de CNN için yüzde 87, CNN-LSTM için yüzde 90, ConvLSTM için yüzde 92, YOLO ve Bi-LSTM birleşimi için yüzde 94, önerilen model için yüzde 98 doğruluk bildirilmektedir. Araştırmacılar artışı insan yerelleştirme, uzamsal özellik çıkarma, zamansal modelleme ve bulanık karar vermenin birlikte kullanılmasına bağlamaktadır.
Ancak karşılaştırılan modellerin aynı eğitim-test bölünmesiyle yeniden çalıştırılıp çalıştırılmadığı, değerlerin önceki yayınlardan mı alındığı, modellerin hiperparametreleri ve deneylerin kaç kez tekrarlandığı açıklanmamıştır. Bu nedenle yüzde farkları eş koşullarda yapılmış doğrulanmış bir karşılaştırma olarak değerlendirilemez.
Toplu performans grafiği
Şekil 8’de doğruluk yüzde 98, kesinlik yüzde 97,6, duyarlılık yüzde 97,2, F1 skoru yüzde 97,4, ROC-AUC yüzde 99 ve yanlış alarm oranı yüzde 2,1 olarak gösterilmektedir. Metnin bir bölümünde ROC-AUC “0,99%” biçiminde yazılırken sonuç bölümünde 0,99 olarak verilmektedir. ROC-AUC için matematiksel olarak anlamlı gösterim 0,99 veya yüzde 99 olabilir; ancak çalışma içindeki farklı gösterimler sessizce tek bir değere dönüştürülmemelidir.
Çalışmanın desteklediği sonuçlar nelerdir?
- Araştırmacılar, insan tespiti, görüntü özelliği çıkarımı, zaman dizisi analizi ve bulanık karar vermeyi birleştiren modüler bir mimari tanımlamıştır.
- Mimari, AVENUE veri kümesi üzerinde değerlendirilmek üzere tasarlanmıştır.
- Hareket hızı, etkinlik süresi, yön değişimi ve ağ güven puanlarının ANFIS girdileri olarak kullanılabileceği gösterilmiştir.
- Çalışma, benzer hareketler arasındaki belirsizliği sabit eşikler yerine bulanık üyeliklerle ele alma fikrini ortaya koymaktadır.
- Araştırmacılar yüksek doğruluk ve düşük yanlış alarm oranı bildirmektedir.
Çalışma neyi kanıtlamamaktadır?
- Çalışma, modelin gerçek şehir gözetim sistemlerinde yüzde 98 doğrulukla çalışacağını kanıtlamamaktadır.
- Sunulan karışıklık matrisi, bildirilen yüzde 98 doğruluğu doğrulamamaktadır.
- ANFIS bileşeninin performans artışına tek başına ne kadar katkı sağladığını gösteren bir çıkarım veya bileşen kaldırma analizi sunulmamıştır.
- Modelin farklı ülkelerde, farklı kamera açılarında, gece koşullarında veya yoğun kalabalıklarda genelleneceği gösterilmemiştir.
- Gerçek zamanlı işlem hızı, kare/saniye değeri, gecikme, bellek tüketimi ve uç cihaz performansı ölçülmemiştir.
- “Şüpheli” sınıfının hangi gerçek referans etiketlerinden üretildiği açıklanmamıştır.
- Modelin yanlış alarmlarının güvenlik görevlileri, izlenen kişiler veya karar süreçleri üzerindeki etkisi değerlendirilmemiştir.
- Sonuçlar bağımsız bir araştırma grubu tarafından tekrarlanmamış ve hakem değerlendirmesinden geçmemiştir.
Çalışmanın güçlü yönleri nelerdir?
Çalışmanın başlıca güçlü yönü, anormal etkinlik tespitini tek bir kara kutu sınıflandırıcı yerine görevleri belirgin modüllere ayıran bir işlem zinciri olarak sunmasıdır. YOLOv8 insan bölgesine odaklanmakta, ResNet50 görüntü içeriğini temsil etmekte, Bi-LSTM zaman ilişkisini incelemekte ve ANFIS son karardaki belirsizliği ele almaktadır. Bu yapı, gelecekte yapılacak daha ayrıntılı deneylerde her bileşenin ayrı ayrı sınanmasına uygun bir araştırma çerçevesi sağlayabilir.
AVENUE gibi etiketli bir gözetim veri kümesinin kullanılması ve doğruluk dışında kesinlik, duyarlılık, F1 skoru, ROC-AUC ve yanlış alarm oranı gibi çeşitli ölçütlere yer verilmesi de çalışmanın amaç düzeyindeki olumlu özellikleridir. Ayrıca hız üyelik fonksiyonu, bulanık sınıflandırmanın mantığını görsel olarak anlaşılır kılmaktadır.
Başlıca sınırlılıklar ve iç tutarlılık sorunları nelerdir?
- Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
- Yüklenen dosyada ilk 15 sayfalık içerik ikinci 15 sayfada büyük ölçüde tekrar edilmektedir.
- Üç sınıflı çıktı anlatılmasına rağmen iki sınıflı karışıklık matrisi verilmiştir.
- Karışıklık matrisindeki değerler yüzde 90 doğruluk gösterirken yüzde 98 genel doğruluk bildirilmiştir.
- Eğitim doğruluğu sunulmuş, ayrı doğrulama ve test eğrileri gösterilmemiştir.
- Eğitim, doğrulama ve test örneklerinin nasıl ayrıldığı ayrıntılı olarak açıklanmamıştır.
- Bi-LSTM dizi uzunluğu, katman sayısı, gizli birim sayısı, iyileştirici algoritma, öğrenme oranı ve parti büyüklüğü bildirilmemiştir.
- YOLOv8 sürümü, güven eşiği, yeniden eğitim yöntemi ve insan tespit ölçütleri verilmemiştir.
- ANFIS kural tabanı, bütün üyelik fonksiyonları, öğrenme yöntemi ve eğitim dönemi açıklanmamıştır.
- Şekil 4’ün başlığıyla gösterdiği grafik uyuşmamaktadır.
- ROC-AUC değeri 0,99, yüzde 99 ve yüzde 0,99 biçimlerinde tutarsız gösterilmiştir.
- Karşılaştırma yöntemlerinin eş deney koşullarında çalıştırıldığı gösterilmemiştir.
- Güven aralığı, standart sapma, tekrar sayısı veya istatistiksel anlamlılık analizi sunulmamıştır.
- Gerçek zamanlı çalışma iddiasını destekleyecek gecikme veya kare/saniye ölçümü bulunmamaktadır.
- Model kodu, eğitilmiş ağırlıklar ve yeniden üretim için gerekli ayrıntılı deney yapılandırması çalışmada yer almamaktadır.
Geçmiş, bugün ve gelecek açısından anlamı nedir?
Geçmişte gözetim videosu analizi büyük ölçüde optik akış, yörünge ve elle oluşturulmuş hareket tanımlayıcılarıyla yürütülmekteydi. Önerilen yaklaşım, bu çizgiden otomatik özellik öğrenen derin ağlara ve belirsizliği açıkça modellemeye çalışan nöro-bulanık sistemlere geçişi temsil etmektedir.
Bugünkü katkısı, farklı yapay zekâ bileşenlerinin hangi sırayla bir araya getirilebileceğini gösteren kavramsal ve uygulamalı bir mimari sunmasıdır. Ancak yüksek performans değerlerinin mevcut raporlama biçimiyle doğrulanamaması, çalışmanın güncel değerini tamamlanmış bir saha çözümünden çok yeniden sınanması gereken bir araştırma prototipi düzeyinde tutmaktadır.
Gelecekte bu mimarinin birden fazla veri kümesinde, farklı kamera ortamlarında ve bağımsız test kümelerinde değerlendirilmesi; ANFIS’in katkısının bileşen kaldırma deneyleriyle ölçülmesi; üyelik fonksiyonlarının veriden nasıl öğrenildiğinin açıklanması ve gerçek zamanlı gecikmenin raporlanması gerekmektedir. Araştırmacılar da gelecek çalışma olarak uç bilişim, transformer tabanlı zaman modelleme ve farklı gözetim veri kümeleri üzerinde değerlendirme önermektedir.
Çalışmanın Yöntemi ve Bulguları
Teknik yöntem özeti
| İşlem aşaması | Kullanılan yöntem | Çalışmada belirtilen görev | Eksik veya belirsiz ayrıntı |
|---|---|---|---|
| Video hazırlama | Kare çıkarma, yeniden boyutlandırma, normalleştirme, Gauss filtresi | Görüntü kalitesini düzenlemek ve hesaplama yükünü azaltmak | 224 × 224 ve 640 × 640 boyutlarının hangi aşamalarda kullanıldığı net değildir; filtre parametreleri verilmemiştir. |
| İnsan tespiti | YOLOv8 | İnsanları bulmak, sınır kutusu ve güven puanı üretmek | Model sürümü, eşikler ve tespit başarımı bildirilmemiştir. |
| Uzamsal özellik çıkarımı | Önceden eğitilmiş ResNet50 | 2048 boyutlu görüntü özellik vektörü üretmek | Katmanların dondurulup dondurulmadığı ve ince ayar yöntemi açıklanmamıştır. |
| Zamansal modelleme | Bi-LSTM | Ardışık karelerdeki hareket değişimini iki yönde öğrenmek | Dizi uzunluğu, katman ve gizli birim sayıları verilmemiştir. |
| Karar verme | ANFIS | Belirsiz hareketleri normal, şüpheli veya anormal olarak sınıflandırmak | Tam kural tabanı ve üyelik parametreleri açıklanmamıştır. |
ANFIS girdileri ve yorumları
| ANFIS girdisi | Temsil ettiği bilgi | Çalışmadaki açıklama | Birim veya ölçek |
|---|---|---|---|
| Hareket hızı | Kişinin ne kadar hızlı hareket ettiği | Yavaş, orta ve hızlı bulanık kümeleriyle modellenmiştir. | Belirtilmemiştir. |
| Etkinlik süresi | Hareketin veya beklemenin ne kadar sürdüğü | Uzun süreli oyalanmanın şüpheli kabul edilmesine katkı sağlamaktadır. | Belirtilmemiştir. |
| Yön değişimi | Hareket yörüngesinin düzenli veya düzensiz oluşu | Keskin ve düzensiz değişimler anormal kararını güçlendirebilmektedir. | Belirtilmemiştir. |
| YOLOv8 güven puanı | Algılanan bölgenin insan içerme güveni | Tespit belirsizliğinin son karara aktarılması amaçlanmıştır. | Olasılık veya güven puanı; kesin ölçek belirtilmemiştir. |
| Bi-LSTM etkinlik olasılığı | Zamansal ağın olağandışı hareket değerlendirmesi | ANFIS’in derin öğrenme çıktısını bulanık kurallarla birleştirmesini sağlamaktadır. | Olasılık puanı; kalibrasyon yöntemi belirtilmemiştir. |
Performans ölçütleri
Genel mimari şemasında kullanılan temel sınıflandırma ölçütleri şu biçimde verilmektedir:
\[ \mathrm{Doğruluk} = \frac{TP+TN}{TP+TN+FP+FN} \]
\[ \mathrm{Kesinlik} = \frac{TP}{TP+FP} \]
\[ \mathrm{Duyarlılık} = \frac{TP}{TP+FN} \]
\[ F1 = 2 \times \frac{\mathrm{Kesinlik}\times\mathrm{Duyarlılık}}{\mathrm{Kesinlik}+\mathrm{Duyarlılık}} \]
\[ \mathrm{Yanlış\ Alarm\ Oranı} = \frac{FP}{FP+TN} \]
Burada TP doğru pozitif, TN doğru negatif, FP yanlış pozitif ve FN yanlış negatif sınıflandırma sayısını göstermektedir. ROC-AUC ise farklı karar eşiklerinde doğru pozitif ve yanlış pozitif oranları arasındaki ayırma başarısını özetlemektedir.
Araştırmacıların bildirdiği sonuçlar
| Performans ölçütü | Bildirilen değer | Yorum sınırı |
|---|---|---|
| Doğruluk | %98 | İki sınıflı karışıklık matrisindeki değerler %90 doğruluk göstermektedir. |
| Kesinlik | %97,6 | Hangi test örneklerinden hesaplandığı gösterilmemiştir. |
| Duyarlılık | %97,2 | Sınıf bazında sonuçlar ve örnek sayıları verilmemiştir. |
| F1 skoru | %97,4 | Normal, şüpheli ve anormal sınıflar için ayrı değerler sunulmamıştır. |
| ROC-AUC | 0,99 veya %99 olarak gösterilmiştir | Metnin bir yerinde hatalı biçimde %0,99 yazılmıştır. |
| Yanlış alarm oranı | %2,1 | Karışıklık matrisi ve test örnek sayılarıyla ilişkilendirilmemiştir. |
| Son eğitim kaybı | Yaklaşık 0,12 | Doğrulama kaybı gösterilmemiştir. |
Karşılaştırmalı doğruluk sonuçları
| Model | Çalışmada bildirilen doğruluk |
|---|---|
| Geleneksel CNN | %87 |
| CNN-LSTM | %90 |
| ConvLSTM | %92 |
| YOLO + Bi-LSTM | %94 |
| YOLOv8 + ResNet50 + Bi-LSTM + ANFIS | %98 |
Tablo, araştırmacıların önerilen modeli en yüksek doğruluğa sahip yaklaşım olarak sunduğunu göstermektedir. Bununla birlikte aynı veri bölünmesi, aynı eğitim bütçesi ve aynı değerlendirme protokolünün bütün yöntemlere uygulanıp uygulanmadığı açıklanmadığından karşılaştırma doğrulanmış bir üstünlük kanıtı değildir.
Donanım ve yazılım ortamı
| Bileşen | Çalışmada bildirilen bilgi |
|---|---|
| İşlemci | Intel Core i7; tam model belirtilmemiştir. |
| Bellek | 16 GB RAM |
| Grafik işlemci | NVIDIA GPU; model ve bellek kapasitesi belirtilmemiştir. |
| Programlama dili | Python 3.11 |
| Derin öğrenme altyapısı | TensorFlow |
| Video işleme | OpenCV |
| İnsan tespiti | YOLOv8 |
| Bulanık çıkarım | Scikit-fuzzy kullanıldığı belirtilmiştir. |
Çalışma, donanımın eğitim ve test için yeterli olduğunu belirtmektedir; ancak eğitim süresi, çıkarım gecikmesi, saniyede işlenen kare sayısı ve GPU kullanımı gibi performans değerlerini bildirmemektedir.
Kaynak ve Yöntem Notu
| Kaynak kimliği alanı | Doğrulanan bilgi |
|---|---|
| Çalışmanın tam özgün adı | ANFIS-Enhanced Deep Learning Framework for Abnormal Human Activity Detection in Surveillance Videos |
| Yazarlar ve sıraları | 1. Shweta S. Patil; 2. U.L. Bombale |
| Eş birinci yazar | Eş katkı veya eş birinci yazarlık bilgisi yer almamaktadır. |
| İletişim yazarı | SSRN kaydında Shweta Patil “Contact Author” olarak gösterilmektedir. Yüklenen metinde ayrıca iki yazarın e-posta adresi verilmiş, fakat sorumlu yazar işareti kullanılmamıştır. |
| Shweta S. Patil’in kurumu | Department of Technology, Shivaji University, Kolhapur; Department of Mechatronics Engineering, Kasegaon Education Society’s Rajarambapu Institute of Technology, Shivaji University’ye bağlı, Sakharale, Maharashtra, Hindistan |
| U.L. Bombale’nin kurumu | Department of Technology, Shivaji University, Kolhapur, Maharashtra, Hindistan |
| DOI | 10.2139/ssrn.7002147 |
| Dergi | Hakemli bir dergi adı bulunmamaktadır. |
| Yayınevi | Hakemli dergi yayınevi bulunmamaktadır. Özgün dergi yayınevi bilgisi bu sürüm üzerinden doğrulanamamıştır. |
| Yayın platformu | SSRN |
| Yayın yılı | 2026 |
| SSRN’ye yüklenme tarihi | 26 Haziran 2026 |
| Kaynak türü | Derin öğrenme ve nöro-bulanık model geliştirme ile performans değerlendirmesi sunduğunu bildiren preprint |
| Hakemlik durumu | Hakem değerlendirmesinden geçmemiştir. |
| Resmî kaynak | SSRN resmî çalışma sayfası |
Bu çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; sonuçları bu sınırlılık dikkate alınarak okunmalıdır. DOI bilgisi yüklenen metnin başlık sayfasında basılı değildir; SSRN’nin resmî kayıt sayfası üzerinden doğrulanmıştır. DOI, hakemli bir dergi makalesinden çok SSRN çalışma kaydını tanımlamaktadır.
Bu Verianla makalesinin bilimsel içeriği yalnızca yüklenen çalışmaya dayanarak hazırlanmıştır. Dış kaynaklar yalnızca yazar sırası, iletişim yazarı, DOI, platform ve yükleme tarihi gibi bibliyografik kimlik bilgilerinin doğrulanması için kullanılmıştır. Yüklenen çalışmada bulunmayan bilimsel sonuç, ek deney veya dış performans bulgusu makaleye eklenmemiştir.
Çalışmanın başlıca yöntemsel sınırlılıkları; üç sınıflı model anlatımıyla iki sınıflı karışıklık matrisi arasındaki uyuşmazlık, karışıklık matrisinin yüzde 90 doğruluk göstermesine karşın yüzde 98 doğruluk bildirilmesi, doğrulama protokolünün açıklanmaması, ANFIS kural ve üyelik parametrelerinin verilmemesi, karşılaştırma koşullarının belirsizliği ve gerçek zamanlı performans ölçümlerinin bulunmamasıdır. Yüklenen 30 sayfalık dosyada bilimsel içerik iki kez yer almaktadır.
Çalışma, gerçek saha uygulaması, uzun dönem güvenilirlik, güvenlik garantisi veya Türkiye’de doğrudan kullanılabilirlik kanıtı sunmamaktadır. Bildirilen performans değerlerinin bağımsız veri kümelerinde, açık deney protokolleriyle ve yeniden üretilebilir kodla doğrulanması gerekmektedir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir