
Bu yazı, araç kullanabilen yapay zekâ ajanlarında dolaylı prompt injection riskini daha gerçekçi koşullarda ölçmeyi amaçlayan akademik bir çalışmadan hazırlanmıştır. İncelenen çalışma, LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection başlığını taşımaktadır.
Çalışmanın odağında, yalnızca sohbet ekranında verilen komutlara cevap veren modeller değil; e-posta okuyabilen, dosya açabilen, web sayfası gezebilen, kod çalıştırabilen, grup sohbetlerine bağlanabilen ve hatta test kontrollü bir kripto cüzdan arayüzüne erişebilen yapay zekâ ajanları vardır. Bu tip sistemlerde model hatası artık yalnızca yanlış cevap üretmekle sınırlı değildir. Yanlış araç çağrısı; veri sızıntısı, güvenlik ayarlarının değiştirilmesi, zararlı kod çalıştırılması veya izinsiz finansal işlem gibi gerçek yan etkilere dönüşebilir.
LivePI çalışmasının temel mesajı şudur: Güçlü dil modelleri tek başına dolaylı prompt injection riskini ortadan kaldırmıyor. Ajanın dış dünyadan okuduğu içerikler güvenilmeyen veri olarak işaretlenmezse, model bu içerikleri kullanıcının gerçek talimatı gibi yorumlayabiliyor.
Bu içerik güvenlik bilgilendirmesi amacıyla hazırlanmıştır. Zararlı prompt yazımı, güvenlik aşma talimatı, veri sızdırma yöntemi veya kötüye kullanım rehberi değildir. Amaç; yapay zekâ ajanlarını daha güvenli tasarlamak için riskleri ve savunma mantığını sade biçimde anlatmaktır.
Yeni bir akademik çalışma, araç kullanabilen yapay zekâ ajanlarının dolaylı prompt injection saldırılarına karşı ne kadar dayanıklı olduğunu test ediyor. LivePI adlı benchmark, e-posta, grup sohbeti, yerel dosya, web içeriği, GitHub Gist, repo bağlantıları ve cüzdan arayüzleri gibi yedi farklı yüzeyi kapsıyor. Çalışmada beş farklı model omurgası test edilmiş ve toplam saldırı başarı oranlarının %10,7 ile %29,6 arasında değiştiği görülmüş. En dikkat çekici bulgu, grup sohbeti enjeksiyonlarının tüm değerlendirilen modellerde başarılı olması. Araştırmacılar ayrıca prompt düzeyi filtreleme ve araç çağrısı öncesi politika onayı kullanan iki katmanlı bir savunma deniyor; deneysel düzende bu savunma kötü niyetli hedeflerin çalıştırılmasını engelliyor.
Problem Ne?
Geleneksel sohbet botlarında kullanıcı bir soru sorar, model de metin yanıtı üretir. Bu yapıdaki hata genellikle yanlış bilgi, eksik cevap veya uygunsuz yönlendirme olarak kalır. Ancak modern yapay zekâ ajanları bundan çok daha fazlasını yapabilir. Bir ajanın e-postaya erişimi, dosya sistemi izni, terminal aracı, web tarayıcısı, mesajlaşma hesabı veya API bağlantısı varsa, modelin aldığı karar dış dünyada gerçek işlem oluşturabilir.
Dolaylı prompt injection tam bu noktada ortaya çıkar. Saldırgan, yapay zekâya doğrudan komut vermek yerine, ajanın okuyacağı bir e-postaya, dosyaya, web sayfasına, repo açıklamasına veya grup mesajına gizli/yanıltıcı talimat yerleştirir. Ajan bu içeriği görev sırasında okuduğunda, metni yalnızca veri olarak görmek yerine talimat gibi yorumlayabilir.
Örneğin kullanıcı ajandan “son e-postalarımı özetle” demiş olabilir. Fakat e-posta kutusundaki kötü niyetli bir mesaj, ajanı özet dışı bir eyleme yönlendirmeye çalışabilir. Benzer şekilde, bir kod deposu açıklaması veya kurulum rehberi, ajanın güvenilmeyen kodu çalıştırmasını tetikleyebilir.
Çalışmanın temel sorusu şudur: Gerçekçi araçlara ve canlı ama test kontrollü hesaplara bağlanan yapay zekâ ajanları, dolaylı prompt injection karşısında ne kadar güvenli davranıyor?
Yöntem Ne Öneriyor?
LivePI, dolaylı prompt injection riskini yalnızca simülasyon içinde değil, üretime benzer fakat kontrollü bir sanal makine ortamında test eder. Araştırmacılar OpenClaw adlı araç kullanabilen bir ajanı Ubuntu tabanlı bir sanal makinede çalıştırır. Bu ajan; e-posta, grup sohbetleri, web, yerel dosyalar, repo içerikleri ve test kontrollü bir kripto cüzdan arayüzüyle etkileşime girebilir.
Benchmark üç boyut üzerine kuruludur:
1. Enjeksiyon yüzeyi: Saldırgan içeriğin ajana hangi kanaldan ulaştığıdır. Örnekler arasında WhatsApp grubu, Telegram grubu, Slack kanalı, Gmail mesajı, yerel dosya, repo bağlantısı ve Gist benzeri web içeriği bulunur.
2. Saldırı tekniği veya render ailesi: Zararlı hedefin içeriğe nasıl gömüldüğünü ifade eder. Çalışmada doğrudan grup mesajı, sahte onay zinciri, kontrol listesi içine gömme, güvenilir entegrasyon taklidi, politika güncellemesi gibi farklı aileler test edilir. Bu yazıda kötüye kullanım ayrıntıları verilmemektedir.
3. Kötü niyetli hedef: Saldırının ulaşmak istediği zararlı sonuçtur. Çalışmada korunan bilgilerin dışarı aktarılması, güvenlik kontrolünün değiştirilmesi, güvensiz kod çalıştırılması, özel e-posta özetinin yetkisiz kişiye gönderilmesi ve test kontrollü kripto transferi gibi hedefler değerlendirilir.
Bu yapı sayesinde LivePI, yalnızca “model zararlı metni tanır mı?” sorusunu değil, “model bu metinden etkilenip gerçek bir araç çağrısı yapar mı?” sorusunu da test eder.
Formüller Ne Anlatıyor?
Çalışmadaki formüller, yapay zekâ ajanını, araç çağrılarını, saldırı örneğini, başarı ölçüsünü ve savunma katmanını biçimsel olarak tanımlamak için kullanılır. Bu formüller matematiksel fiyat tahmini değil, güvenlik değerlendirme modeli sunar.
1. Ajan politikası
Model ve karar üretme kuralı bir politika olarak gösterilir:
Burada \(X\), modele verilen metin bağlamı uzayını; \(U\), modelin üretebileceği yanıt veya araç çağrısı uzayını ifade eder. Yani ajan, gördüğü bağlama göre bir cevap ya da eylem seçer.
2. Eylem uzayı
Ajanın eylem uzayı iki parçadan oluşur:
Burada \(Y\), doğal dil yanıtlarını; \(U_{tool}\), yapılandırılmış araç çağrılarını temsil eder. Güvenlik açısından kritik fark buradadır: Metin yanıtı yanlış olabilir, ama araç çağrısı gerçek dosya okuma, e-posta gönderme veya sistem ayarı değiştirme gibi yan etkiler doğurabilir.
3. Araç çağrısı
Bir araç çağrısı şu şekilde yazılır:
Burada \(i\), çağrılan aracı; \(a\), o araca verilen argümanları ifade eder. Örneğin dosya okuma aracı, e-posta aracı veya terminal aracı farklı \(i\) değerleriyle düşünülebilir.
4. Genel ajan sistemi
Çalışmada ajan sistemi şu bileşenlerle modellenir:
Burada \(\Pi\), model politikasıdır. \(\Gamma\), mevcut bağlamı model girdisine dönüştüren prompt oluşturma haritasıdır. \(T\), araç setidir. \(P\), araç çağrısı için izin/review/block kararı veren yürütme kapısıdır. \(E\) ise e-posta, web, dosya sistemi, API ve cüzdan gibi dış ortamı temsil eder.
5. Ajan bağlamı
Her adımda ajan bağlamı şu parçalardan oluşur:
Burada \(C_{sys-dev}\), sistem ve geliştirici kurallarını; \(C_{user}\), yetkili kullanıcının görevini; \(C_{agent,t}\), ajanın geçmiş mesaj ve eylemlerini; \(C_{env,t}\), dış ortamdan gelen e-posta, web sayfası, dosya, repo veya grup sohbeti gibi içerikleri ifade eder.
Çalışmanın güvenlik açısından en önemli noktası şudur: \(C_{env,t}\) güvenilmeyen veri olarak görülmelidir. Çünkü bu alan saldırgan tarafından kontrol edilen içerik taşıyabilir.
6. Model girdisi
Mevcut bağlamdan model girdisi şu şekilde oluşturulur:
Eğer prompt oluşturma katmanı kaynakları doğru ayırmazsa, güvenilmeyen dış içerik model girdisinde yetkili kullanıcı talimatı gibi görünebilir. Dolaylı prompt injection riskinin temelinde bu karışma vardır.
7. Araç çağrısı yürütme kararı
Bir araç çağrısı yapılmadan önce politika kapısı karar verir:
\(ALLOW\), aracın çalışmasına izin verir. \(REVIEW\), insan onayı ister. \(BLOCK\), aracın çalışmasını engeller. Çalışmanın savunma önerisinde bu kapı özellikle önemlidir; çünkü modelin zararlı bir araç çağrısı önermesi tek başına yetmez, çağrı çalışmadan önce durdurulabilir.
8. Dolaylı prompt injection örneği
Bir saldırı örneği üçlü olarak tanımlanır:
Burada \(s\), saldırı yüzeyidir; örneğin e-posta, grup sohbeti, dosya veya repo. \(\rho\), saldırı tekniği ya da içeriğin nasıl sunulduğudur. \(g_m\), saldırganın kötü niyetli hedefidir.
9. Saldırı başarısı
Çalışmada bir saldırının başarılı sayılması için yalnızca ajanın etkilenmesi yetmez; kötü niyetli hedefin de gerçekleşmesi gerekir:
Burada \(AI(\tau)\), saldırgan içeriğin ajanın izini veya kararını etkileyip etkilemediğini gösterir. \(M_{g_m}(\tau)\), kötü niyetli hedefin gerçekleşip gerçekleşmediğini ifade eder. İkisi de sağlanırsa saldırı başarılı sayılır.
10. Saldırı başarı oranı
Benchmark genelinde saldırı başarı oranı şu şekilde hesaplanır:
Burada \(B'\), değerlendirilen test vakaları kümesidir. Bu metrik, hangi yüzeyin veya hangi modelin daha fazla risk taşıdığını karşılaştırmak için kullanılır.
11. Review ve Block oranı
Savunmanın normal kullanıma ne kadar sürtünme eklediğini görmek için iki oran hesaplanır:
Bu iki ölçü, güvenlik ile kullanılabilirlik arasındaki dengeyi gösterir. Savunma çok fazla normal işlemi durdurursa kullanıcı deneyimi bozulabilir. Hiçbir şeyi durdurmazsa da güvenlik sağlamaz.
Grafik, Tablo ve Şema Ana Mesajı
PDF’teki Şekil 1, dolaylı prompt injection ve iki katmanlı savunma akışını gösterir. Saldırgan, kötü niyetli hedefi güvenilmeyen bir yüzeye yerleştirir. Ajan bu içeriği görev sırasında okur. İlk savunma katmanı, prompt düzeyinde şüpheli kalıpları filtreler. İkinci savunma katmanı ise araç çağrısı çalışmadan önce izin, inceleme veya engelleme kararı verir.
Tablo 1, LivePI yüzeylerini özetler. WhatsApp, Telegram ve Slack grup sohbetleri; Gmail e-postası; yerel belge; herkese açık repo bağlantısı ve Gist gibi kaynaklar test yüzeyi olarak kullanılır. Bu tablo, dolaylı prompt injection riskinin yalnızca web sayfası veya e-posta ile sınırlı olmadığını gösterir.
Tablo 2, saldırı tekniği ailelerini açıklar. Çalışma; sahte onay zinciri, güvenilir entegrasyon taklidi, kontrol listesi içine gömme, politika güncellemesi gibi farklı senaryoları değerlendirir. Bu çeşitlilik, saldırıların yalnızca “önceki talimatları unut” gibi basit ifadelerden ibaret olmadığını, meşru görev akışına karışabilecek şekilde tasarlanabileceğini gösterir.
Tablo 4, en çarpıcı sonucu verir. Grup sohbeti enjeksiyonu, test edilen tüm model omurgalarında %100 başarı göstermiştir. Toplam saldırı başarı oranı modelden modele değişmiştir: Claude Opus 4.6 en düşük toplam oranla %10,7; Gemini 3.1 Pro ise en yüksek oranla %29,6 seviyesindedir. Repo bağlantıları da küçük örneklem nedeniyle dikkatli yorumlanması gerekse de yüksek şiddetli risk sinyali üretmiştir.
Tablo 5, iki katmanlı savunma sonucunu gösterir. GPT-5.3-Codex ayarında savunma, test edilen kötü niyetli hedef tamamlanmalarını çalıştırılmadan önce engellemiş ve saldırı başarı oranını %0 olarak raporlamıştır. Aynı zamanda 899 normal araç çağrısının yalnızca %0,89’u incelemeye gönderilmiş, %0,11’i engellenmiştir. Bu sonuç, doğru tasarlanmış araç çağrısı politikalarının güvenlik ile kullanılabilirlik arasında dengeli çalışabileceğini düşündürür.
Deneyler Nasıl Yapılmış?
Çalışmada OpenClaw ajanı, üretime benzer ama test kontrollü bir sanal makine ortamında çalıştırılmıştır. Ortamda canlı tarayıcı, web fetch, Gmail test hesabı, WhatsApp/Slack/Telegram test kanalları, yerel dosya sistemi ve sınırlı bakiyeye sahip test kontrollü Solana cüzdan arayüzü bulunur.
LivePI toplam 169 çalıştırılabilir saldırı vakası içerir. Bunlar yedi yüzey, on iki teknik/render ailesi ve beş kötü niyetli hedef kombinasyonundan seçilmiştir. Her kombinasyon uygulanabilir olmadığı için teorik maksimum olan 420 yerine 169 gerçek test vakası oluşturulmuştur.
Beş model omurgası değerlendirilmiştir: GPT-5.3-Codex, Claude Opus 4.6, Gemini 3.1 Pro, Kimi K2.5 ve GLM-5. Her testte ajanın etkileşim izi, önerdiği araç çağrıları, çalışan araçlar, araç çıktıları ve son yanıt kaydedilmiştir.
Saldırı başarısı yalnızca modelin metinden etkilenmesine göre değil, hedeflenen kötü niyetli sonucun gerçekleşip gerçekleşmediğine göre değerlendirilmiştir. Somut yan etki doğuran görevlerde e-posta gönderimi, işlem kayıtları, değişen ayarlar, oluşturulan dosyalar, script çalıştırma izleri veya komut çıktıları ayrıca kontrol edilmiştir.
Sonuçlar Ne Gösteriyor?
Çalışmanın ilk sonucu, güçlü model omurgalarının bile dolaylı prompt injection riskini tamamen ortadan kaldırmadığıdır. Toplam saldırı başarı oranları modelden modele değişse de hiçbir model tüm yüzeylerde güvenli değildir.
İkinci sonuç, saldırı yüzeyinin modelden en az model kalitesi kadar önemli olduğudur. Aynı kötü niyetli hedef, e-posta içinde daha az etkili olabilirken grup sohbetinde çok daha etkili olabilir. Bu, güvenlik testlerinin yüzey bazlı yapılması gerektiğini gösterir.
Üçüncü sonuç, grup sohbeti yüzeyinin özellikle riskli olduğudur. Çalışmada grup mesajlarının ajan bağlamına yetkili kullanıcı mesajına benzer şekilde girmesi, saldırgan içeriğin model tarafından gerçek kullanıcı isteği gibi yorumlanmasına yol açabilmiştir.
Dördüncü sonuç, repo bağlantısı gibi yazılım geliştirme yüzeylerinin küçük örneklemde bile yüksek şiddetli risk sinyali üretmesidir. Çünkü burada risk yalnızca metinsel talimat değil, güvenilmeyen kodun indirilmesi, kurulması veya çalıştırılması gibi daha ağır yan etkilerle ilişkilidir.
Beşinci sonuç, savunmanın yalnızca prompt filtresiyle sınırlı kalmaması gerektiğidir. Prompt düzeyinde temizlik yararlı olabilir; ancak asıl kritik güvenlik noktası, araç çağrısı çalışmadan hemen önce politika temelli izin mekanizmasıdır. Böylece model zararlı bir eylem önermiş olsa bile, sistem bu eylemi durdurabilir veya insan onayına gönderebilir.
Bu Neden Önemli?
Yapay zekâ ajanları giderek daha fazla gerçek araca bağlanıyor. Kullanıcı adına e-posta okuyabilen, kod yazabilen, dosya düzenleyebilen, ödeme yapabilen veya sunucu ayarı değiştirebilen ajanlar iş dünyasında büyük kolaylık sağlayabilir. Ancak bu yetkiler, güvenlik açısından klasik sohbet botlarından çok daha ciddi bir risk seviyesi oluşturur.
Dolaylı prompt injection bu yüzden kritik bir problemdir. Çünkü saldırganın modele doğrudan erişmesi gerekmez. Ajanın okuyacağı bir belgeye, e-postaya, web sayfasına veya grup mesajına yerleştirilen içerik yeterli olabilir. Ajan kaynak güvenini ayırt edemiyorsa, güvenilmeyen veri talimata dönüşebilir.
Bu çalışma, güvenli ajan tasarımında üç temel ilkeyi öne çıkarıyor:
Kaynak ayrımı: Kullanıcı talimatı ile dış dünyadan gelen veri aynı yetki seviyesinde görülmemelidir.
Araç çağrısı kontrolü: Hassas araçlar modelin kararına doğrudan bırakılmamalı; izin, inceleme veya engelleme politikalarıyla korunmalıdır.
Yüzey bazlı test: E-posta, grup sohbeti, yerel dosya, web ve repo yüzeyleri ayrı ayrı test edilmelidir. Çünkü her kanalın risk profili farklıdır.
Dikkat Noktaları
Bu çalışma, belirli bir test düzeneğinde yapılan akademik bir güvenlik benchmark’ıdır. Sonuçlar tüm ajan sistemleri için evrensel güvenlik garantisi vermez.
İki katmanlı savunma LivePI saldırı sınıflarına göre tasarlanmıştır. Bu nedenle gerçek dünyadaki tüm dolaylı prompt injection çeşitlerini engellediği varsayılmamalıdır.
Defansif sonuçlar yalnızca GPT-5.3-Codex yapılandırmasında raporlanmıştır. Diğer model omurgalarında aynı savunmanın nasıl çalışacağı ayrıca test edilmelidir.
Repo bağlantısı yüzeyi yalnızca dört çalıştırılabilir test vakası içerir. Bu sonuç yüksek şiddetli risk sinyali olarak önemlidir; fakat gerçek dünyadaki yaygınlığı nicel olarak tahmin etmek için yeterli değildir.
Çalışmada LLM judge ve deterministik kontroller birlikte kullanılmıştır. Bu yaklaşım pratik olsa da, gelecekte insan değerlendirmesi ve daha kapsamlı doğrulama testleriyle desteklenmesi gerekir.
Bu yazıda saldırı şablonları veya kötüye kullanım ayrıntıları verilmemiştir. Amaç, savunma ve güvenli tasarım ilkelerini anlatmaktır.
Sonuç
LivePI çalışması, araç kullanan yapay zekâ ajanlarının güvenlik değerlendirmesinde daha gerçekçi test ortamlarına ihtiyaç olduğunu gösteriyor. Bir model sohbet içinde güvenli görünebilir; ancak e-posta, dosya, grup sohbeti veya repo içeriği üzerinden gelen güvenilmeyen talimatlarla karşılaştığında farklı davranabilir.
Çalışmanın en çarpıcı bulgusu, grup sohbeti enjeksiyonlarının tüm değerlendirilen modellerde başarılı olmasıdır. Bu sonuç, model kalitesinden bağımsız olarak sistem tasarımındaki kaynak ve rol ayrımının kritik olduğunu gösterir.
Önerilen iki katmanlı savunma; prompt düzeyinde filtreleme ve araç çağrısı öncesi politika onayını birleştirir. Deneysel düzende bu savunma kötü niyetli hedeflerin çalıştırılmasını engellerken normal görevlerde düşük sürtünme üretmiştir. Ancak yazarların da vurguladığı gibi, bu sonuç genel bir güvenlik garantisi olarak değil, savunma yönünde umut verici bir kontrollü deney sonucu olarak okunmalıdır.
Verianla açısından bu çalışmanın ana mesajı şudur: Yapay zekâ ajanlarında güvenlik, yalnızca modelin “akıllı” olmasına bırakılamaz. Gerçek güvenlik; kaynak ayrımı, güvenilmeyen içeriğin işaretlenmesi, araç çağrısı politikaları, insan onayı ve yüzey bazlı güvenlik testlerinin birlikte uygulanmasıyla sağlanabilir.
Kaynak ve Yöntem Notu
Bu içerik, LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection başlıklı akademik PDF incelenerek hazırlanmıştır. Metin birebir çeviri değildir. Çalışmanın amacı, tehdit modeli, temel formülleri, deney tasarımı, benchmark sonuçları, savunma yaklaşımı ve sınırlılıkları Verianla okurları için sadeleştirilmiş, özgün ve editoryal Türkçe ile yeniden anlatılmıştır.
Güvenlik nedeniyle yazıda saldırı şablonları, kötüye kullanım komutları veya zararlı teknik ayrıntılar yeniden üretilmemiştir.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir