Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Bilgisayar Bilimi / ANFIS Destekli Derin Öğrenme ile Gözetim Videolarında Anormal İnsan Etkinliği Tespiti
Bilgisayar Bilimi

ANFIS Destekli Derin Öğrenme ile Gözetim Videolarında Anormal İnsan Etkinliği Tespiti

Bu çalışma, gözetim videolarındaki anormal insan etkinliklerini otomatik olarak belirlemek amacıyla YOLOv8, ResNet50, çift yönlü uzun-kısa süreli bellek ağı ve uyarlamalı nöro-bulanık çıkarım sistemini birleştiren hibrit bir mimari önermektedir.

02/08/2026  Veri Anla 35 görüntüleme
ANFIS Destekli Derin Öğrenme ile Gözetim Videolarında Anormal İnsan Etkinliği Tespiti

Bu çalışma, gözetim videolarındaki anormal insan etkinliklerini otomatik olarak belirlemek amacıyla YOLOv8, ResNet50, çift yönlü uzun-kısa süreli bellek ağı ve uyarlamalı nöro-bulanık çıkarım sistemini birleştiren hibrit bir mimari önermektedir. Model, 16 eğitim ve 21 test videosu içerdiği belirtilen AVENUE veri kümesi üzerinde değerlendirilmiş; araştırmacılar yüzde 98 doğruluk, yüzde 97,6 kesinlik, yüzde 97,2 duyarlılık, yüzde 97,4 F1 skoru, 0,99 ROC-AUC ve yüzde 2,1 yanlış alarm oranı bildirmiştir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; deney protokolündeki eksikler ve bildirilen performans değerleriyle karışıklık matrisi arasındaki tutarsızlıklar nedeniyle sonuçlar ön bulgu niteliğinde değerlendirilmelidir.

Önerilen sistemde YOLOv8 her video karesindeki insanları bulup sınır kutularıyla yerelleştirmekte, ResNet50 insan duruşu ve sahne bağlamı gibi uzamsal özellikleri çıkarmakta, çift yönlü uzun-kısa süreli bellek ağı bu özelliklerin zaman içindeki değişimini incelemekte ve uyarlamalı nöro-bulanık çıkarım sistemi hareket hızı, etkinlik süresi, yön değişikliği ve ağların güven puanlarını birlikte değerlendirerek etkinliği normal, şüpheli veya anormal olarak sınıflandırmaktadır. Yaklaşımın temel düşüncesi, birbirine benzeyen hızlı yürüme, koşma, bekleme ve olağandışı yön değiştirme gibi davranışlar arasındaki belirsizliği tek bir kesin eşik yerine örtüşen bulanık üyelik dereceleriyle yönetmektir.

Türkiye açısından değerlendirme: Bu mimari, Türkiye’de belediye ulaşım merkezleri, üniversite kampüsleri, istasyonlar, hastane çevreleri, okul yerleşkeleri ve endüstriyel tesislerde araştırma amaçlı akıllı kamera uygulamalarına uyarlanabilecek bir yöntem çerçevesi sunmaktadır. Ancak bunun için Türkiye’deki kamera açılarını, aydınlatma koşullarını, kalabalık yoğunluklarını ve gündelik hareket örüntülerini temsil eden yerel veri kümeleri oluşturulmalı; normal, şüpheli ve anormal sınıflar açık ölçütlerle etiketlenmeli; bağımsız testlerde yanlış alarm, kaçırılan olay, gecikme ve gerçek zamanlı işlem hızı ölçülmelidir. Çalışmadan Türkiye’de saha başarısı, hukuki uygunluk, gerçek zamanlı çalışma, farklı toplumsal gruplarda eşit performans veya yüzde 2,1 düzeyinde yanlış alarm oranı doğrudan çıkarılamaz.

Araştırmanın temel sorusu nedir?

Araştırmanın temel sorusu, gözetim videolarındaki insan hareketlerinin uzamsal görünümünü, zaman içindeki gelişimini ve belirsiz davranış sınırlarını aynı model içinde birleştirmenin anormal etkinlik tespitini geliştirip geliştiremeyeceğidir. Araştırmacılar özellikle normal yürüyüş ile hızlı hareket, kısa süreli bekleme ile şüpheli oyalanma ve olağan yön değişikliği ile düzensiz hareket arasında kesin sınırlar bulunmadığını vurgulamaktadır.

Çalışma bu soruya dört bileşenli bir mimariyle yanıt vermeyi amaçlamaktadır: YOLOv8 insanları tespit etmekte, ResNet50 görüntü özelliklerini çıkarmakta, Bi-LSTM ardışık karelerdeki hareket örüntülerini öğrenmekte ve ANFIS belirsizliği bulanık kurallarla değerlendirerek son sınıflandırmayı üretmektedir.

Çalışma neden önemlidir?

Gözetim kameraları çok sayıda eş zamanlı video akışı oluşturduğu için bütün görüntülerin insanlar tarafından kesintisiz izlenmesi dikkat azalması, yorgunluk ve kritik olayların gözden kaçırılması riskini taşımaktadır. Araştırmacılar kavga, yasak bölgede koşma, uzun süre oyalanma, nesne fırlatma, ters yönde hareket etme ve alışılmadık hareket örüntüleri gibi olayların otomatik olarak belirlenmesini akıllı gözetim sistemlerinin temel problemlerinden biri olarak ele almaktadır.

Geleneksel yöntemler optik akış, hareket yörüngesi, yönlendirilmiş gradyan histogramı ve elle tasarlanmış başka özelliklere dayanabilmektedir. Çalışmaya göre bu yaklaşımlar ışık değişimi, kalabalık, örtüşme, farklı kamera açıları ve hareketli arka plan karşısında genelleme güçlüğü yaşayabilmektedir. Derin öğrenme modelleri görüntüden özellik öğrenebilse de benzer davranışlar arasındaki belirsizliği her zaman açık biçimde yönetememektedir. Önerilen modelin hedeflediği boşluk, güçlü görsel ve zamansal özellik çıkarımını nöro-bulanık karar verme mekanizmasıyla aynı işlem zincirinde birleştirmektir.

Önerilen mimari nasıl çalışmaktadır?

1. Video karelerinin hazırlanması

Giriş videosu önce ardışık görüntü karelerine ayrılmaktadır:

\[ V = \{F_1, F_2, F_3, \ldots, F_n\} \]

Burada V giriş videosunu, F_i ise videodan çıkarılan i numaralı kareyi göstermektedir. Kare sayısı boyutsuz bir adettir. Çalışmanın yöntem metni karelerin ResNet50 girişi için 224 × 224 piksele getirildiğini belirtmektedir. Buna karşılık genel mimari şemasında 640 × 640 yeniden boyutlandırma gösterilmektedir. Bunların YOLOv8 ve ResNet50 için ayrı boyutlar olup olmadığı açık biçimde açıklanmamıştır.

Piksel değerleri 0 ile 1 arasına taşınmaktadır:

\[ X_{\mathrm{norm}} = \frac{X}{255} \]

X, 0 ile 255 arasındaki özgün piksel yoğunluğunu; Xnorm ise boyutsuz normalleştirilmiş değeri ifade etmektedir. Bu dönüşüm, ağın farklı piksel büyüklükleriyle daha dengeli çalışmasını amaçlamaktadır.

Sensör ve aydınlatma gürültüsünü azaltmak için Gauss filtresi kullanıldığı belirtilmektedir:

\[ G(x,y)=\frac{1}{2\pi\sigma^2}\exp\left(-\frac{x^2+y^2}{2\sigma^2}\right) \]

Bu formülde x ve y merkez piksele göre konumu, σ filtrenin yayılım genişliğini, G(x,y) ise ilgili konumdaki ağırlığı göstermektedir. Konumların piksel cinsinden değerlendirilmesi beklenmekle birlikte çalışmada kullanılan çekirdek boyutu ve σ değeri bildirilmemiştir. Genel şema ayrıca döndürme ve çevirme gibi veri artırma işlemlerini göstermekte, fakat bunların oranları ve parametreleri açıklanmamaktadır.

2. YOLOv8 ile insan tespiti

YOLOv8, her karede insan olarak algıladığı bölgeleri bir sınıf etiketi, güven puanı ve sınır kutusuyla göstermektedir:

[ B = (x,y,w,h) ]

Burada x ve y kutunun konumunu, w genişliğini, h yüksekliğini ifade etmektedir. Koordinatların piksel cinsinden mi yoksa normalize edilmiş biçimde mi tutulduğu belirtilmemiştir. İnsan bölgesi kırpılarak ResNet50’ye aktarılmakta, YOLOv8 güven puanı ise daha sonra ANFIS karar katmanında kullanılan girdilerden biri hâline gelmektedir.

Bu aşamanın amacı, bütün sahneyi aynı ağırlıkla incelemek yerine modelin insan bulunan bölgelere odaklanmasını sağlamaktır. Ancak çalışma, YOLOv8’in hangi ağırlık sürümünü kullandığını, yeniden eğitilip eğitilmediğini, güven eşiğini ve insan tespit başarımını ayrı olarak bildirmemektedir.

3. ResNet50 ile uzamsal özellik çıkarımı

YOLOv8 tarafından belirlenen insan bölgeleri, 50 katmanlı artık bağlantılı sinir ağı ResNet50’ye verilmektedir. Artık öğrenmenin temel ilişkisi şu biçimde sunulmaktadır:

[ y = F(x,W) + x ]

x giriş özellik haritasını, F(x,W) öğrenilebilir W parametreleriyle elde edilen artık dönüşümü, y ise çıkış özellik haritasını ifade etmektedir. Giriş bilgisinin dönüşüm sonucuna doğrudan eklenmesi, derin ağlarda bilginin katmanlar boyunca taşınmasını kolaylaştırmaktadır.

Küresel ortalama havuzlama sonrasında her insan bölgesi için 2048 bileşenli bir özellik vektörü oluşturulduğu belirtilmektedir:

\[ f = [f_1,f_2,f_3,\ldots,f_{2048}] \]

Bu vektör; insan duruşu, beden biçimi, çevredeki nesnelerle etkileşim ve sahne bağlamı gibi görüntüden öğrenilmiş örüntüleri temsil etmeyi amaçlamaktadır. Bileşenlerin tek tek fiziksel birimi bulunmaz; bunlar ağ tarafından öğrenilen sayısal özelliklerdir.

4. Bi-LSTM ile zamansal hareket modelleme

Tek bir kare, bir kişinin koştuğunu, aniden yön değiştirdiğini veya uzun süre aynı bölgede kaldığını tek başına açıklamakta yetersiz kalabilir. Bu nedenle ardışık karelerden elde edilen 2048 boyutlu vektörler bir zaman dizisi olarak çift yönlü uzun-kısa süreli bellek ağına aktarılmaktadır.

Çalışmada zaman adımındaki gizli durum için şu basitleştirilmiş ilişki verilmektedir:

\[ h_t = f(Wx_t + Uh_{t-1} + b) \]

xt t anındaki giriş vektörünü, ht-1 önceki gizli durumu, W ve U öğrenilebilir ağırlık matrislerini, b yanlılık terimini ve f doğrusal olmayan dönüşümü göstermektedir. Bu ifade tam LSTM yapısındaki giriş, unutma ve çıkış kapılarının bütün denklemlerini içermemekte; yalnızca zaman durumunun genel güncellenmesini özetlemektedir.

İleri ve geri yöndeki durumlar şu şekilde birleştirilmektedir:

\[ H_t = [\overrightarrow{h_t};\overleftarrow{h_t}] \]

Bu gösterimde noktalı virgül, iki yönün özelliklerinin birleştirildiğini ifade etmektedir. Model böylece bir karenin yalnızca geçmişini değil, izlenen video parçasındaki sonraki kareleri de kullanmaktadır. Bu özellik çevrim dışı video analizi için yararlı olabilir; ancak gelecekteki karelere ihtiyaç duyulması gerçek zamanlı alarm gecikmesini etkileyebilir. Çalışma bu gecikmeyi ölçmemiştir.

5. ANFIS ile belirsizlik temelli karar verme

Uyarlamalı nöro-bulanık çıkarım sistemi, sinir ağlarının veriden öğrenme yeteneğini bulanık mantığın üyelik fonksiyonları ve “eğer-o hâlde” kurallarıyla birleştirmektedir. Çalışmada ANFIS’e aktarılan beş girdi şunlardır:

  • Hareket hızı,
  • Etkinliğin süresi,
  • Hareket yönündeki değişim,
  • YOLOv8 insan tespit güven puanı,
  • Bi-LSTM anormal etkinlik olasılığı.

Hareket hızı yavaş, orta ve hızlı gibi dilsel kümelerle ifade edilmektedir. Bir hareket aynı anda belirli oranlarda hem “orta” hem de “hızlı” kümelerine ait olabildiği için kararın keskin bir eşikte aniden değişmesi yerine daha yumuşak bir geçiş amaçlanmaktadır. Örnek kurallarda yüksek hızla düzensiz yön değişimi anormal, düşük hızla düzgün yörünge normal, orta hızla uzun süre devam eden etkinlik ise şüpheli olarak değerlendirilmektedir.

Etkin kuralların sonuçları birleştirilmekte ve ağırlık merkezi durulaştırma yöntemiyle tek bir anomali puanı üretilmektedir. Çalışma puanın normal, şüpheli ve anormal sınıflara dönüştürüldüğünü belirtmektedir. Bununla birlikte bütün üyelik fonksiyonlarının sayısal sınırları, eksiksiz kural tabanı, kuralların öğrenilme yöntemi ve ANFIS eğitim parametreleri verilmemiştir.

Veri kümesi hangi özelliklere sahiptir?

Çalışma, açık hava kampüs gözetim görüntülerinden oluşan AVENUE veri kümesini kullandığını bildirmektedir. Veri kümesinde koşma, nesne fırlatma, olağandışı yönde hareket etme ve uzun süre oyalanma gibi olayların bulunduğu; anormal karelerin elle işaretlenerek test için gerçek referans olarak kullanıldığı belirtilmektedir.

Veri kümesi özelliğiÇalışmada bildirilen değer
Eğitim videosu sayısı16
Test videosu sayısı21
Görüntü çözünürlüğü640 × 360 piksel
Kare hızı25 kare/saniye
Çekim ortamıAçık hava kampüs gözetimi
Etiketleme türüKare düzeyinde gerçek referans

Anormal olayların videoların yalnızca küçük bir bölümünü oluşturduğu ve normal etkinliklerle görsel olarak örtüşebildiği belirtilmektedir. Ancak normal, şüpheli ve anormal biçimindeki üç sınıfın AVENUE etiketlerinden nasıl üretildiği açıklanmamıştır.

Şekiller ve grafikler ne göstermektedir?

Genel mimari şeması

Şekil 1, veri kümesinden başlayarak ön işleme, YOLOv8 insan tespiti, ResNet50 özellik çıkarımı, Bi-LSTM zaman modellemesi, ANFIS karar verme ve normal-şüpheli-anormal çıktısına kadar bütün veri akışını göstermektedir. Şemada doğruluk, kesinlik, duyarlılık, F1 skoru, ROC-AUC ve yanlış alarm oranının değerlendirme ölçütleri olduğu da belirtilmektedir.

Şemanın güçlü tarafı modüllerin görevlerini açık biçimde ayırmasıdır. Bununla birlikte şema eğitim ve test kümelerini “normal ve anormal” olarak gösterirken metin üç çıktı sınıfından söz etmektedir. Şüpheli sınıfın etiket kaynağı açıklanmamaktadır.

Eğitim doğruluğu ve kayıp grafiği

Şekil 2’de eğitim doğruluğu 10 dönem boyunca yaklaşık 0,70’ten 0,98’e yükselmekte, eğitim kaybı ise yaklaşık 0,90’dan 0,12’ye düşmektedir. Bu grafik modelin eğitim verisine giderek daha iyi uyduğunu göstermektedir. Ancak yalnızca eğitim eğrileri sunulmuştur; doğrulama doğruluğu ve doğrulama kaybı verilmediği için aşırı öğrenme olup olmadığı bu grafikten belirlenemez.

Hız üyelik fonksiyonları

Şekil 3’te yatay eksen 0-10 arasında hareket hızını, dikey eksen 0-1 arasında bulanık üyelik derecesini göstermektedir. Yavaş kümesi 0 civarında en yüksek üyeliğe sahip olup 5 civarında sıfıra iner. Orta kümesi yaklaşık 3 ile 7 arasında üçgen biçimindedir ve 5 civarında en yüksek üyeliğe ulaşır. Hızlı kümesi 5 civarında başlayıp 10’da en yüksek üyeliğe ulaşır. Hız ekseninin fiziksel birimi ve bu sınırların veriden mi yoksa uzman tercihiyle mi belirlendiği açıklanmamıştır.

“Süre üyelik fonksiyonu” olarak adlandırılan grafik

Şekil 4’ün başlığı etkinlik süresine ait üyelik fonksiyonunu ifade etmesine rağmen görsel, normal için 20, şüpheli için 40 ve anormal için yaklaşık 84 değerlerini gösteren bir risk puanı sütun grafiğidir. Grafik süre ekseni, kısa-orta-uzun üyelik kümeleri veya örtüşen üyelik eğrileri içermemektedir. Bu nedenle şekil başlığıyla görsel içeriği arasında açık bir uyumsuzluk vardır.

Anomali puanı grafiği

Şekil 5’te 20 kare boyunca anomali puanının yaklaşık 15’ten 96’ya doğru düzenli biçimde yükseldiği ve 70 düzeyinde bir anormal eşik çizgisi bulunduğu görülmektedir. Puan yaklaşık 14. karede eşik düzeyine ulaşmakta ve sonraki karelerde eşiğin üzerine çıkmaktadır. Araştırmacılar bu artışı ani koşma, keskin yön değiştirme ve olağandışı hareketlerle ilişkilendirmektedir.

Bununla birlikte grafikte gerçek video karesi, olay başlangıç-bitiş işaretleri, gerçek referans etiketleri veya farklı normal ve anormal video örnekleri gösterilmemektedir. Anomali puanının 0-100 aralığına nasıl ölçeklendiği ve 70 eşiğinin nasıl seçildiği de açıklanmamıştır.

Karışıklık matrisi

Şekil 6’daki karışıklık matrisi iki satır ve iki sütundan oluşmaktadır. Hücre değerleri 4, 1, 0 ve 5’tir. Böylece toplam 10 örneğin 9’u ana köşegen üzerinde doğru, 1’i yanlış sınıflandırılmış görünmektedir. Bu matrisin doğrudan gösterdiği doğruluk yüzde 90’dır:

\[ \mathrm{Doğruluk} = \frac{4+5}{4+1+0+5} = \frac{9}{10} = 0{,}90 \]

Bu sonuç, metinde bildirilen yüzde 98 doğrulukla uyuşmamaktadır. Ayrıca model çıktısı normal, şüpheli ve anormal olmak üzere üç sınıf şeklinde tanımlanırken karışıklık matrisi yalnızca iki sınıf göstermektedir. Eksenlerde sınıf adları yerine 0 ve 1 etiketleri kullanılmıştır.

Mevcut yöntemlerle karşılaştırma

Şekil 7 ve Tablo 2’de CNN için yüzde 87, CNN-LSTM için yüzde 90, ConvLSTM için yüzde 92, YOLO ve Bi-LSTM birleşimi için yüzde 94, önerilen model için yüzde 98 doğruluk bildirilmektedir. Araştırmacılar artışı insan yerelleştirme, uzamsal özellik çıkarma, zamansal modelleme ve bulanık karar vermenin birlikte kullanılmasına bağlamaktadır.

Ancak karşılaştırılan modellerin aynı eğitim-test bölünmesiyle yeniden çalıştırılıp çalıştırılmadığı, değerlerin önceki yayınlardan mı alındığı, modellerin hiperparametreleri ve deneylerin kaç kez tekrarlandığı açıklanmamıştır. Bu nedenle yüzde farkları eş koşullarda yapılmış doğrulanmış bir karşılaştırma olarak değerlendirilemez.

Toplu performans grafiği

Şekil 8’de doğruluk yüzde 98, kesinlik yüzde 97,6, duyarlılık yüzde 97,2, F1 skoru yüzde 97,4, ROC-AUC yüzde 99 ve yanlış alarm oranı yüzde 2,1 olarak gösterilmektedir. Metnin bir bölümünde ROC-AUC “0,99%” biçiminde yazılırken sonuç bölümünde 0,99 olarak verilmektedir. ROC-AUC için matematiksel olarak anlamlı gösterim 0,99 veya yüzde 99 olabilir; ancak çalışma içindeki farklı gösterimler sessizce tek bir değere dönüştürülmemelidir.

Çalışmanın desteklediği sonuçlar nelerdir?

  • Araştırmacılar, insan tespiti, görüntü özelliği çıkarımı, zaman dizisi analizi ve bulanık karar vermeyi birleştiren modüler bir mimari tanımlamıştır.
  • Mimari, AVENUE veri kümesi üzerinde değerlendirilmek üzere tasarlanmıştır.
  • Hareket hızı, etkinlik süresi, yön değişimi ve ağ güven puanlarının ANFIS girdileri olarak kullanılabileceği gösterilmiştir.
  • Çalışma, benzer hareketler arasındaki belirsizliği sabit eşikler yerine bulanık üyeliklerle ele alma fikrini ortaya koymaktadır.
  • Araştırmacılar yüksek doğruluk ve düşük yanlış alarm oranı bildirmektedir.

Çalışma neyi kanıtlamamaktadır?

  • Çalışma, modelin gerçek şehir gözetim sistemlerinde yüzde 98 doğrulukla çalışacağını kanıtlamamaktadır.
  • Sunulan karışıklık matrisi, bildirilen yüzde 98 doğruluğu doğrulamamaktadır.
  • ANFIS bileşeninin performans artışına tek başına ne kadar katkı sağladığını gösteren bir çıkarım veya bileşen kaldırma analizi sunulmamıştır.
  • Modelin farklı ülkelerde, farklı kamera açılarında, gece koşullarında veya yoğun kalabalıklarda genelleneceği gösterilmemiştir.
  • Gerçek zamanlı işlem hızı, kare/saniye değeri, gecikme, bellek tüketimi ve uç cihaz performansı ölçülmemiştir.
  • “Şüpheli” sınıfının hangi gerçek referans etiketlerinden üretildiği açıklanmamıştır.
  • Modelin yanlış alarmlarının güvenlik görevlileri, izlenen kişiler veya karar süreçleri üzerindeki etkisi değerlendirilmemiştir.
  • Sonuçlar bağımsız bir araştırma grubu tarafından tekrarlanmamış ve hakem değerlendirmesinden geçmemiştir.

Çalışmanın güçlü yönleri nelerdir?

Çalışmanın başlıca güçlü yönü, anormal etkinlik tespitini tek bir kara kutu sınıflandırıcı yerine görevleri belirgin modüllere ayıran bir işlem zinciri olarak sunmasıdır. YOLOv8 insan bölgesine odaklanmakta, ResNet50 görüntü içeriğini temsil etmekte, Bi-LSTM zaman ilişkisini incelemekte ve ANFIS son karardaki belirsizliği ele almaktadır. Bu yapı, gelecekte yapılacak daha ayrıntılı deneylerde her bileşenin ayrı ayrı sınanmasına uygun bir araştırma çerçevesi sağlayabilir.

AVENUE gibi etiketli bir gözetim veri kümesinin kullanılması ve doğruluk dışında kesinlik, duyarlılık, F1 skoru, ROC-AUC ve yanlış alarm oranı gibi çeşitli ölçütlere yer verilmesi de çalışmanın amaç düzeyindeki olumlu özellikleridir. Ayrıca hız üyelik fonksiyonu, bulanık sınıflandırmanın mantığını görsel olarak anlaşılır kılmaktadır.

Başlıca sınırlılıklar ve iç tutarlılık sorunları nelerdir?

  • Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
  • Yüklenen dosyada ilk 15 sayfalık içerik ikinci 15 sayfada büyük ölçüde tekrar edilmektedir.
  • Üç sınıflı çıktı anlatılmasına rağmen iki sınıflı karışıklık matrisi verilmiştir.
  • Karışıklık matrisindeki değerler yüzde 90 doğruluk gösterirken yüzde 98 genel doğruluk bildirilmiştir.
  • Eğitim doğruluğu sunulmuş, ayrı doğrulama ve test eğrileri gösterilmemiştir.
  • Eğitim, doğrulama ve test örneklerinin nasıl ayrıldığı ayrıntılı olarak açıklanmamıştır.
  • Bi-LSTM dizi uzunluğu, katman sayısı, gizli birim sayısı, iyileştirici algoritma, öğrenme oranı ve parti büyüklüğü bildirilmemiştir.
  • YOLOv8 sürümü, güven eşiği, yeniden eğitim yöntemi ve insan tespit ölçütleri verilmemiştir.
  • ANFIS kural tabanı, bütün üyelik fonksiyonları, öğrenme yöntemi ve eğitim dönemi açıklanmamıştır.
  • Şekil 4’ün başlığıyla gösterdiği grafik uyuşmamaktadır.
  • ROC-AUC değeri 0,99, yüzde 99 ve yüzde 0,99 biçimlerinde tutarsız gösterilmiştir.
  • Karşılaştırma yöntemlerinin eş deney koşullarında çalıştırıldığı gösterilmemiştir.
  • Güven aralığı, standart sapma, tekrar sayısı veya istatistiksel anlamlılık analizi sunulmamıştır.
  • Gerçek zamanlı çalışma iddiasını destekleyecek gecikme veya kare/saniye ölçümü bulunmamaktadır.
  • Model kodu, eğitilmiş ağırlıklar ve yeniden üretim için gerekli ayrıntılı deney yapılandırması çalışmada yer almamaktadır.

Geçmiş, bugün ve gelecek açısından anlamı nedir?

Geçmişte gözetim videosu analizi büyük ölçüde optik akış, yörünge ve elle oluşturulmuş hareket tanımlayıcılarıyla yürütülmekteydi. Önerilen yaklaşım, bu çizgiden otomatik özellik öğrenen derin ağlara ve belirsizliği açıkça modellemeye çalışan nöro-bulanık sistemlere geçişi temsil etmektedir.

Bugünkü katkısı, farklı yapay zekâ bileşenlerinin hangi sırayla bir araya getirilebileceğini gösteren kavramsal ve uygulamalı bir mimari sunmasıdır. Ancak yüksek performans değerlerinin mevcut raporlama biçimiyle doğrulanamaması, çalışmanın güncel değerini tamamlanmış bir saha çözümünden çok yeniden sınanması gereken bir araştırma prototipi düzeyinde tutmaktadır.

Gelecekte bu mimarinin birden fazla veri kümesinde, farklı kamera ortamlarında ve bağımsız test kümelerinde değerlendirilmesi; ANFIS’in katkısının bileşen kaldırma deneyleriyle ölçülmesi; üyelik fonksiyonlarının veriden nasıl öğrenildiğinin açıklanması ve gerçek zamanlı gecikmenin raporlanması gerekmektedir. Araştırmacılar da gelecek çalışma olarak uç bilişim, transformer tabanlı zaman modelleme ve farklı gözetim veri kümeleri üzerinde değerlendirme önermektedir.

Çalışmanın Yöntemi ve Bulguları

Teknik yöntem özeti

İşlem aşamasıKullanılan yöntemÇalışmada belirtilen görevEksik veya belirsiz ayrıntı
Video hazırlamaKare çıkarma, yeniden boyutlandırma, normalleştirme, Gauss filtresiGörüntü kalitesini düzenlemek ve hesaplama yükünü azaltmak224 × 224 ve 640 × 640 boyutlarının hangi aşamalarda kullanıldığı net değildir; filtre parametreleri verilmemiştir.
İnsan tespitiYOLOv8İnsanları bulmak, sınır kutusu ve güven puanı üretmekModel sürümü, eşikler ve tespit başarımı bildirilmemiştir.
Uzamsal özellik çıkarımıÖnceden eğitilmiş ResNet502048 boyutlu görüntü özellik vektörü üretmekKatmanların dondurulup dondurulmadığı ve ince ayar yöntemi açıklanmamıştır.
Zamansal modellemeBi-LSTMArdışık karelerdeki hareket değişimini iki yönde öğrenmekDizi uzunluğu, katman ve gizli birim sayıları verilmemiştir.
Karar vermeANFISBelirsiz hareketleri normal, şüpheli veya anormal olarak sınıflandırmakTam kural tabanı ve üyelik parametreleri açıklanmamıştır.

ANFIS girdileri ve yorumları

ANFIS girdisiTemsil ettiği bilgiÇalışmadaki açıklamaBirim veya ölçek
Hareket hızıKişinin ne kadar hızlı hareket ettiğiYavaş, orta ve hızlı bulanık kümeleriyle modellenmiştir.Belirtilmemiştir.
Etkinlik süresiHareketin veya beklemenin ne kadar sürdüğüUzun süreli oyalanmanın şüpheli kabul edilmesine katkı sağlamaktadır.Belirtilmemiştir.
Yön değişimiHareket yörüngesinin düzenli veya düzensiz oluşuKeskin ve düzensiz değişimler anormal kararını güçlendirebilmektedir.Belirtilmemiştir.
YOLOv8 güven puanıAlgılanan bölgenin insan içerme güveniTespit belirsizliğinin son karara aktarılması amaçlanmıştır.Olasılık veya güven puanı; kesin ölçek belirtilmemiştir.
Bi-LSTM etkinlik olasılığıZamansal ağın olağandışı hareket değerlendirmesiANFIS’in derin öğrenme çıktısını bulanık kurallarla birleştirmesini sağlamaktadır.Olasılık puanı; kalibrasyon yöntemi belirtilmemiştir.

Performans ölçütleri

Genel mimari şemasında kullanılan temel sınıflandırma ölçütleri şu biçimde verilmektedir:

\[ \mathrm{Doğruluk} = \frac{TP+TN}{TP+TN+FP+FN} \]

\[ \mathrm{Kesinlik} = \frac{TP}{TP+FP} \]

\[ \mathrm{Duyarlılık} = \frac{TP}{TP+FN} \]

\[ F1 = 2 \times \frac{\mathrm{Kesinlik}\times\mathrm{Duyarlılık}}{\mathrm{Kesinlik}+\mathrm{Duyarlılık}} \]

\[ \mathrm{Yanlış\ Alarm\ Oranı} = \frac{FP}{FP+TN} \]

Burada TP doğru pozitif, TN doğru negatif, FP yanlış pozitif ve FN yanlış negatif sınıflandırma sayısını göstermektedir. ROC-AUC ise farklı karar eşiklerinde doğru pozitif ve yanlış pozitif oranları arasındaki ayırma başarısını özetlemektedir.

Araştırmacıların bildirdiği sonuçlar

Performans ölçütüBildirilen değerYorum sınırı
Doğruluk%98İki sınıflı karışıklık matrisindeki değerler %90 doğruluk göstermektedir.
Kesinlik%97,6Hangi test örneklerinden hesaplandığı gösterilmemiştir.
Duyarlılık%97,2Sınıf bazında sonuçlar ve örnek sayıları verilmemiştir.
F1 skoru%97,4Normal, şüpheli ve anormal sınıflar için ayrı değerler sunulmamıştır.
ROC-AUC0,99 veya %99 olarak gösterilmiştirMetnin bir yerinde hatalı biçimde %0,99 yazılmıştır.
Yanlış alarm oranı%2,1Karışıklık matrisi ve test örnek sayılarıyla ilişkilendirilmemiştir.
Son eğitim kaybıYaklaşık 0,12Doğrulama kaybı gösterilmemiştir.

Karşılaştırmalı doğruluk sonuçları

ModelÇalışmada bildirilen doğruluk
Geleneksel CNN%87
CNN-LSTM%90
ConvLSTM%92
YOLO + Bi-LSTM%94
YOLOv8 + ResNet50 + Bi-LSTM + ANFIS%98

Tablo, araştırmacıların önerilen modeli en yüksek doğruluğa sahip yaklaşım olarak sunduğunu göstermektedir. Bununla birlikte aynı veri bölünmesi, aynı eğitim bütçesi ve aynı değerlendirme protokolünün bütün yöntemlere uygulanıp uygulanmadığı açıklanmadığından karşılaştırma doğrulanmış bir üstünlük kanıtı değildir.

Donanım ve yazılım ortamı

BileşenÇalışmada bildirilen bilgi
İşlemciIntel Core i7; tam model belirtilmemiştir.
Bellek16 GB RAM
Grafik işlemciNVIDIA GPU; model ve bellek kapasitesi belirtilmemiştir.
Programlama diliPython 3.11
Derin öğrenme altyapısıTensorFlow
Video işlemeOpenCV
İnsan tespitiYOLOv8
Bulanık çıkarımScikit-fuzzy kullanıldığı belirtilmiştir.

Çalışma, donanımın eğitim ve test için yeterli olduğunu belirtmektedir; ancak eğitim süresi, çıkarım gecikmesi, saniyede işlenen kare sayısı ve GPU kullanımı gibi performans değerlerini bildirmemektedir.

Kaynak ve Yöntem Notu

Kaynak kimliği alanıDoğrulanan bilgi
Çalışmanın tam özgün adıANFIS-Enhanced Deep Learning Framework for Abnormal Human Activity Detection in Surveillance Videos
Yazarlar ve sıraları1. Shweta S. Patil; 2. U.L. Bombale
Eş birinci yazarEş katkı veya eş birinci yazarlık bilgisi yer almamaktadır.
İletişim yazarıSSRN kaydında Shweta Patil “Contact Author” olarak gösterilmektedir. Yüklenen metinde ayrıca iki yazarın e-posta adresi verilmiş, fakat sorumlu yazar işareti kullanılmamıştır.
Shweta S. Patil’in kurumuDepartment of Technology, Shivaji University, Kolhapur; Department of Mechatronics Engineering, Kasegaon Education Society’s Rajarambapu Institute of Technology, Shivaji University’ye bağlı, Sakharale, Maharashtra, Hindistan
U.L. Bombale’nin kurumuDepartment of Technology, Shivaji University, Kolhapur, Maharashtra, Hindistan
DOI10.2139/ssrn.7002147
DergiHakemli bir dergi adı bulunmamaktadır.
YayıneviHakemli dergi yayınevi bulunmamaktadır. Özgün dergi yayınevi bilgisi bu sürüm üzerinden doğrulanamamıştır.
Yayın platformuSSRN
Yayın yılı2026
SSRN’ye yüklenme tarihi26 Haziran 2026
Kaynak türüDerin öğrenme ve nöro-bulanık model geliştirme ile performans değerlendirmesi sunduğunu bildiren preprint
Hakemlik durumuHakem değerlendirmesinden geçmemiştir.
Resmî kaynakSSRN resmî çalışma sayfası

Bu çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; sonuçları bu sınırlılık dikkate alınarak okunmalıdır. DOI bilgisi yüklenen metnin başlık sayfasında basılı değildir; SSRN’nin resmî kayıt sayfası üzerinden doğrulanmıştır. DOI, hakemli bir dergi makalesinden çok SSRN çalışma kaydını tanımlamaktadır.

Bu Verianla makalesinin bilimsel içeriği yalnızca yüklenen çalışmaya dayanarak hazırlanmıştır. Dış kaynaklar yalnızca yazar sırası, iletişim yazarı, DOI, platform ve yükleme tarihi gibi bibliyografik kimlik bilgilerinin doğrulanması için kullanılmıştır. Yüklenen çalışmada bulunmayan bilimsel sonuç, ek deney veya dış performans bulgusu makaleye eklenmemiştir.

Çalışmanın başlıca yöntemsel sınırlılıkları; üç sınıflı model anlatımıyla iki sınıflı karışıklık matrisi arasındaki uyuşmazlık, karışıklık matrisinin yüzde 90 doğruluk göstermesine karşın yüzde 98 doğruluk bildirilmesi, doğrulama protokolünün açıklanmaması, ANFIS kural ve üyelik parametrelerinin verilmemesi, karşılaştırma koşullarının belirsizliği ve gerçek zamanlı performans ölçümlerinin bulunmamasıdır. Yüklenen 30 sayfalık dosyada bilimsel içerik iki kez yer almaktadır.

Çalışma, gerçek saha uygulaması, uzun dönem güvenilirlik, güvenlik garantisi veya Türkiye’de doğrudan kullanılabilirlik kanıtı sunmamaktadır. Bildirilen performans değerlerinin bağımsız veri kümelerinde, açık deney protokolleriyle ve yeniden üretilebilir kodla doğrulanması gerekmektedir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy