Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Uygulamalı Bilimler / Bilgisayar Bilimi / Kara Para Aklamayla Mücadelede Öngörücü Analitik: Yüksek Frekanslı İşlem Suistimallerinin ve Finansal Suç Erken Uyarı İşaretlerinin Tespiti
Bilgisayar Bilimi

Kara Para Aklamayla Mücadelede Öngörücü Analitik: Yüksek Frekanslı İşlem Suistimallerinin ve Finansal Suç Erken Uyarı İşaretlerinin Tespiti

Bu çalışma, yüksek frekanslı işlem (HFT) ortamlarında ortaya çıkabilecek şüpheli işlem örüntülerini öngörücü analitik ve makine öğrenmesi kullanarak tespit etmeye yönelik bir anti-money laundering (AML) çerçevesi önermektedir.

18/09/2026  Veri Anla 94 görüntüleme
Kara Para Aklamayla Mücadelede Öngörücü Analitik: Yüksek Frekanslı İşlem Suistimallerinin ve Finansal Suç Erken Uyarı İşaretlerinin Tespiti

Bu çalışma, yüksek frekanslı işlem (HFT) ortamlarında ortaya çıkabilecek şüpheli işlem örüntülerini öngörücü analitik ve makine öğrenmesi kullanarak tespit etmeye yönelik bir anti-money laundering (AML) çerçevesi önermektedir. Random forest gibi denetimli öğrenme yöntemleri ile autoencoder tabanlı anomali tespitinin karşılaştırıldığı çalışmada; işlem hızı, işlem frekansı, bid-ask spread, hesap tipi ve zaman damgası kümelenmesi gibi özellikler finansal suç açısından erken uyarı sinyalleri olarak modellenmektedir.

Çalışmada kullanılan veri gerçek borsa soruşturma kayıtlarından oluşmamaktadır. Araştırmacı, Ocak 2017–Aralık 2018 dönemini temsil edecek biçimde 1 milyon işlemlik hipotetik fakat gerçekçi kabul edilen sentetik bir küresel hisse senedi HFT veri seti oluşturmuştur. İşlemlerin %2'si layering veya spoofing benzeri örüntülere göre şüpheli olarak etiketlenmiş, 200.000 işlem eğitim için kullanılmış, kalan 800.000 işlem doğrulama ve test kümelerine eşit olarak ayrılmıştır.

Kaynakta random forest modeli %85 accuracy, %80 precision, %78 recall ve %79 F1-score elde ederken autoencoder modeli sırasıyla %78, %75, %70 ve %72 değerlerine ulaşmaktadır. Random forest modelinde en yüksek değişken önemi 0,35 ile trade velocity yani saniye başına işlem yoğunluğuna verilmiştir.

Bu performans rakamlarının gerçek bir AML operasyonunda doğrulandığı sonucuna varılamaz. Sentetik veri, gerçek piyasalardaki eksik veriler, yanlış etiketler, farklı piyasa rejimleri, emir iptalleri, venue fragmentation ve suç davranışının kasıtlı biçimde değişmesi gibi sorunları tam olarak temsil etmeyebilir. Çalışma da bu sınırlılığı açık biçimde kabul etmektedir.

Yüksek frekanslı işlem AML açısından neden inceleniyor?

Yüksek frekanslı işlem, çok kısa zaman aralıklarında otomatik olarak büyük miktarda emir ve işlem üretebilir. Bu hız ve hacim, geleneksel sabit eşikli AML sistemleri açısından önemli bir veri işleme problemi yaratır. Normal bir HFT stratejisi dahi saniyeler veya milisaniyeler içinde binlerce mesaj üretebildiği için yalnız işlem sayısına dayalı basit kurallar yüksek miktarda yanlış alarm oluşturabilir.

Çalışmanın temel yaklaşımı, sabit AML kuralları yerine veri içerisindeki çok değişkenli örüntüleri öğrenen modeller kullanmaktır. Böylece tek bir “işlem sayısı eşiği” yerine işlem yoğunluğu, frekans, spread davranışı, hesap türü ve zaman içindeki kümelenme birlikte değerlendirilir.

Öngörücü Analitik Geleneksel AML Kurallarından Nasıl Ayrılıyor?

Kural tabanlı AML sistemleri önceden tanımlanmış eşikler ve senaryolar üzerinden alarm üretirken öngörücü analitik, geçmiş veya sentetik olarak etiketlenmiş örüntülerden istatistiksel ilişkiler öğrenir. Denetimli model bilinen şüpheli örüntüleri sınıflandırmaya çalışırken denetimsiz model, daha önce etiketlenmemiş olağandışı davranışları anomali olarak işaretleyebilir.

Çalışma bu nedenle iki farklı yaklaşımı karşılaştırmaktadır:

ModelÖğrenme türüÇalışmadaki rol
Random ForestDenetimli öğrenmeEtiketlenmiş normal ve şüpheli işlemleri sınıflandırma
AutoencoderDenetimsiz / anomali temelli yaklaşımNormal örüntüden sapmaları tespit etme

Random forest bilinen ve etiketlenmiş örüntülerde daha yüksek performans göstermektedir. Autoencoder ise daha düşük genel performansa rağmen daha önce tanımlanmamış anomalilerin yakalanabileceği tamamlayıcı bir mekanizma olarak tartışılmaktadır.

Sentetik veri nasıl oluşturuluyor?

Kaynak, bir küresel hisse senedi piyasasını temsil eden 1 milyon HFT işlemi üretmektedir. Veri yapısı NASDAQ benzeri halka açık piyasa verilerinden, SEC düzenleyici raporlarından ve FATF tipolojilerinden esinlenerek tasarlanmıştır. Çeşitlilik sağlamak amacıyla Monte Carlo tabanlı sentetik veri üretiminden söz edilmektedir.

Her işlemde kullanılan başlıca değişkenler şunlardır:

  • işlem hacmi,
  • işlem frekansı,
  • bid-ask spread,
  • hesap tipi,
  • timestamp,
  • türetilmiş trade velocity,
  • zaman kümelenmesiyle ilişkili göstergeler.

Kaynakta işlemlerin yaklaşık %2'sinin layering veya spoofing benzeri şüpheli örüntüler taşıyacak şekilde etiketlendiği belirtilmektedir.

Sentetik Veri Neden Önemli Bir Sınırlılıktır?

Sentetik veri model geliştirmek ve kontrollü karşılaştırmalar yapmak için yararlıdır; ancak gerçek piyasalardaki davranışların bütün karmaşıklığını içermez. Gerçek HFT verisinde eksik kayıtlar, venue routing, market-maker davranışları, emir iptalleri, farklı likidite rejimleri, haber olayları, hesaplar arası ilişkiler ve yanlış ya da eksik AML etiketleri bulunabilir.

Bu nedenle çalışmadaki %85 accuracy değeri gerçek bir finansal kurumun canlı AML sisteminde beklenen performans olarak kullanılmamalıdır. Bu rakam, araştırmacının kurduğu sentetik veri ve etiketleme çerçevesi içinde random forest modelinin test performansıdır.

Örnekleme ve veri bölme

Çalışmada eğitim için stratified sampling kullanılmaktadır. Toplam 1 milyon işlemden 200.000 işlem model eğitimi için seçilir. Tabakalaştırma hesap türü ve işlem hacmine göre yapılmaktadır.

Kalan 800.000 işlem eşit biçimde iki parçaya ayrılarak:

  • 400.000 doğrulama gözlemi,
  • 400.000 test gözlemi

olarak kullanılmaktadır.

Araştırmacı tekrarlanabilirlik için random seed değerinin 42 olarak sabitlendiğini belirtmektedir.

Kullanılan hesaplama araçları

Denetimli modeller için scikit-learn, autoencoder uygulaması için TensorFlow ve büyük ölçekli veri işleme için Apache Spark kullanıldığı belirtilmektedir. Model performansı accuracy, precision, recall ve F1-score üzerinden değerlendirilmektedir.

Bu araçların kullanılmış olması tek başına modelin gerçek zamanlı üretim ortamına hazır olduğunu göstermez. Gerçek zamanlı HFT gözetimi gecikme, throughput, veri bütünlüğü, model drift'i ve açıklanabilirlik gibi ek gereksinimler taşır.

Çalışmanın Yöntemi ve Bulguları

Random forest ve autoencoder performansı

ModelAccuracyPrecisionRecallF1-Score
Random Forest0,850,800,780,79
Autoencoder0,780,750,700,72

Kaynağın Tablo 1 sonuçlarında random forest bütün dört performans ölçüsünde autoencoder'ın üzerinde yer almaktadır. Accuracy farkı 7 yüzde puanı, recall farkı 8 yüzde puanı ve F1 farkı 7 yüzde puanıdır.

Burada accuracy tek başına yeterli bir değerlendirme ölçüsü değildir. Veri setinin yalnız %2'sinin şüpheli olarak etiketlendiği belirtilmektedir; dolayısıyla ciddi sınıf dengesizliğinin bulunduğu bir AML probleminde precision, recall, F1 ve sınıf bazlı hata dağılımı özellikle önemlidir.

AML Modelinde En Önemli Erken Uyarı Göstergeleri Hangileri?

Random forest modelinin kaynakta raporlanan feature importance değerleri şöyledir:

ÖzellikImportance
Trade Velocity0,35
Transaction Frequency0,25
Bid-Ask Spread0,20
Account Type0,15
Timestamp Clustering0,05

Modelin en güçlü özelliği trade velocity olarak raporlanmıştır. Bu değişken, belirli bir zaman biriminde gerçekleşen işlem yoğunluğunu temsil eder. Ardından transaction frequency ve bid-ask spread gelmektedir.

Feature importance değeri, değişkenin tek başına suçun nedeni olduğunu veya belirli bir işlem hızının otomatik olarak şüpheli sayılması gerektiğini göstermez. Random forest önem ölçütleri model içindeki tahmin katkısını gösterir ve değişkenler arasında korelasyon bulunduğunda ekonomik yorumları dikkatle yapılmalıdır.

Model eğitimi boyunca doğruluk

Kaynağın Figure 1 grafiğinde random forest modelinin accuracy değeri beş eğitim iterasyonunda yaklaşık %75'ten %85'e yükselmektedir. Autoencoder ise yaklaşık %70'ten %78'e çıkmaktadır.

Bu görsel, random forest modelinin verilen sentetik senaryoda daha hızlı ve daha yüksek bir performans seviyesine ulaştığını göstermektedir. Bununla birlikte “training iteration” tanımının algoritmik olarak nasıl oluşturulduğu kaynakta ayrıntılı biçimde açıklanmamaktadır; dolayısıyla grafik klasik bir epoch-based learning curve ile bire bir eşitlenmemelidir.

Yanlış pozitifler hakkında ne raporlanıyor?

Sonuç bölümünde önerilen yaklaşımın geleneksel rule-based sistemlere göre yanlış pozitifleri %25 azalttığı ifade edilmektedir. Ancak bu sonuç için ayrı bir tablo, confusion matrix veya doğrudan deneysel karşılaştırma kaynakta gösterilmemektedir.

Bu nedenle %25 rakamı çalışmanın sonuç bölümündeki bir yazar beyanı olarak aktarılabilir; bağımsız biçimde yeniden hesaplanmış veya ayrıntılı deney tablosuyla doğrulanmış bir bulgu şeklinde sunulmamalıdır.

Gerçek zamanlı tespit süresi

Kaynak sonuç bölümünde detection delay'in %40 azaltılabildiğini de belirtmektedir. Ancak aynı paragraf bu sonucu Wang ve çalışma arkadaşlarının önceki bulgularıyla ilişkilendirmektedir ve mevcut çalışmada buna ait bağımsız bir gecikme benchmark tablosu sunulmamaktadır.

Bu nedenle %40 gecikme azaltma değeri de mevcut sentetik deneyin doğrudan ölçülmüş ana çıktılarından biri olarak değerlendirilmemelidir.

Layering ve Spoofing Kara Para Aklama ile Aynı Şey midir?

Hayır. Layering ve spoofing tipik olarak emir defterinin yanıltıcı emirlerle etkilenmesi veya piyasa katılımcılarının yanlış fiyat/likidite sinyalleriyle yönlendirilmesiyle ilişkili piyasa manipülasyonu davranışlarıdır. Kara para aklama ise suç gelirinin kaynağını ve sahipliğini gizleme sürecidir.

Kaynak bu davranışları daha geniş “financial crime” ve AML erken uyarı çerçevesi içinde birlikte ele almaktadır. Ancak bir spoofing veya layering alarmı tek başına money laundering kanıtı değildir. AML sisteminde bu tür davranışlar ancak hesaplar arası fon akışı, beneficial ownership, müşteri profili ve diğer işlem bağlamlarıyla birlikte değerlendirilmelidir.

Denetimli ve denetimsiz modeller birlikte kullanılabilir mi?

Çalışmanın tartışma bölümünde hibrit bir sistem önerilmektedir. Random forest geçmişte etiketlenmiş bilinen örüntülerde yüksek sınıflandırma performansı sağlayabilirken autoencoder daha önce görülmemiş anormal davranışları tespit etmek için kullanılabilir.

Önerilen genel mimari şu biçimde düşünülebilir:

Canlı işlem akışı → özellik çıkarımı → anomali taraması → supervised risk skoru → AML analist incelemesi

Ancak kaynak bu hibrit sistemi deneysel olarak kurup ayrı performans metrikleriyle sınamamaktadır. Bu nedenle hibrit yaklaşım çalışmanın geleceğe dönük önerisidir.

Açıklanabilirlik problemi

AML kararlarının düzenleyiciler ve uyum ekipleri tarafından açıklanabilir olması gerekir. Random forest gibi modeller, basit eşik tabanlı kurallara göre daha karmaşık karar ilişkileri oluşturabilir.

Kaynak gelecekte SHAP gibi açıklanabilir yapay zekâ yöntemlerinin kullanılmasını önermektedir. Böylece bir alarmın hangi işlem özelliklerinden ne ölçüde etkilendiği analistlere gösterilebilir.

Çalışmanın desteklediği sonuçlar

  • Sentetik HFT veri setinde random forest, autoencoder'dan daha yüksek accuracy, precision, recall ve F1-score elde etmiştir.
  • Random forest accuracy değeri 0,85 olarak raporlanmıştır.
  • Trade velocity, random forest modelinde 0,35 ile en yüksek feature importance değerine sahiptir.
  • Transaction frequency ve bid-ask spread sonraki en önemli değişkenlerdir.
  • Denetimsiz anomali tespiti, etiketlenmemiş örüntüler için tamamlayıcı bir yaklaşım olarak tartışılmaktadır.
  • Gerçek zamanlı AML gözetiminde büyük veri altyapısı ve yüksek hızlı özellik çıkarımının önemli olduğu savunulmaktadır.

Çalışmanın desteklemediği sonuçlar

  • %85 accuracy gerçek dünya HFT AML sistemlerinde doğrulanmış bir başarı oranı değildir.
  • Çalışma gerçek bir milyon borsa işlemini kullanmamaktadır; veri sentetiktir.
  • Her yüksek trade velocity değeri kara para aklama göstergesi değildir.
  • Layering veya spoofing tespiti tek başına kara para aklama tespiti anlamına gelmez.
  • Kaynakta gerçek bir canlı-borsa latency benchmark'ı sunulmamaktadır.
  • %25 false-positive azalması ve %40 detection-delay azalması ayrıntılı deney tablosuyla bağımsız olarak gösterilmemektedir.
  • Sonuçlar kripto, türev, FX veya başka piyasalara doğrudan genellenemez; veri tasarımı hisse senedi HFT ortamına yöneliktir.

Metodolojik sınırlılıklar

Birinci sınırlılık: Veri sentetiktir. Sentetik işlemler araştırmacının varsayımlarını yansıttığı için model aynı varsayımları öğrenebilir ve gerçek piyasada performans düşebilir.

İkinci sınırlılık: Şüpheli etiketler geçmiş AML soruşturmalarından esinlenerek oluşturulmuş kabul edilse de gerçek etiketli soruşturma verisi kullanılmamaktadır.

Üçüncü sınırlılık: Veri setindeki yalnız %2'lik şüpheli sınıf ciddi class imbalance oluşturur. Buna rağmen kaynak ROC-AUC, PR-AUC, confusion matrix veya class-weight etkilerini raporlamamaktadır.

Dördüncü sınırlılık: HFT ile piyasa manipülasyonu ve money laundering kavramları bazı bölümlerde birbirine oldukça yakın kullanılmaktadır. Bu davranışlar hukuken ve operasyonel AML açısından farklı inceleme türleri gerektirebilir.

Beşinci sınırlılık: Gerçek zamanlı uygulamanın hesaplama altyapısı Apache Spark üzerinden tartışılsa da end-to-end gecikme, throughput ve peak-load testi sunulmamaktadır.

Altıncı sınırlılık: Kaynakçadaki bazı kayıtların literatür bölümündeki atıflarla tam eşleşmemesi ve bazı bibliyografik kayıtların tarih/konu açısından dikkat gerektirmesi, makaledeki dış-literatür iddialarının ayrıca doğrulanmasını gerekli kılar.

Kaynak ve Yöntem Notu

Özgün başlık: Predictive Analytics in Anti-Money Laundering for Detecting High-Frequency Trading Abuses and Identifying Early Warning Signs of Financial Crime

Yazar: Bharat Bhanushali.

PDF'deki afiliyasyon: BNP Paribas, Vice President, Jersey City, New Jersey, USA.

Yayın: International Journal of Research in Electronics and Computer Engineering (IJRECE).

Cilt / Sayı: Vol. 7, Issue 1.

Dönem: January–March 2019.

ISSN: 2393-9028 (Print), 2348-2281 (Online).

Sayfalar: 1273–1279.

Çalışma türü: Sentetik veri üzerinde makine öğrenmesi temelli AML/HFT yöntem araştırması.

Veri: 1 milyon sentetik HFT işlemi; Ocak 2017–Aralık 2018 dönemini temsil edecek biçimde oluşturulmuştur.

Şüpheli işlem oranı: %2.

Eğitim: 200.000 işlem.

Doğrulama: Yaklaşık 400.000 işlem.

Test: Yaklaşık 400.000 işlem.

Ana modeller: Random forest ve autoencoder.

Programlama / hesaplama: scikit-learn, TensorFlow ve Apache Spark.

Random seed: 42.

Ana performans: Random forest accuracy 0,85; precision 0,80; recall 0,78; F1 0,79. Autoencoder accuracy 0,78; precision 0,75; recall 0,70; F1 0,72.

En önemli feature: Trade Velocity — 0,35 importance.

Veri erişilebilirliği: Makale, kod ve sentetik veri şablonlarının talep üzerine sağlanabileceğini belirtmektedir.

Telif / lisans: İncelenen PDF'de açık bir Creative Commons veya başka yeniden kullanım lisansı belirtilmemektedir. Bu nedenle kaynak tablo ve grafiklerinin doğrudan yeniden kullanımında izin varsayılmamalıdır.

Temel yorum sınırı: Sonuçlar sentetik veri üzerinde üretilmiştir ve gerçek piyasa AML etkinliği olarak genellenmemelidir.

Bibliyografik kalite notu: Kaynakçada literatür bölümündeki bazı atıflarla uyuşmayan veya konu/tarih açısından ayrıca doğrulanması gereken kayıtlar bulunmaktadır. Bu nedenle Verianla metni dış referansların doğruluğunu onaylamamakta, yalnızca PDF'nin kendi yöntem ve sonuçlarını aktarmaktadır.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy