Akademik tədqiqatlar, aydın dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 sentyabr 2026, bazar
VERİANLAMüstəqil elmi yayımçılıq
Menyunu açın və ya bağlayın
...
Home / Tətbiqi Elmlər / Kompüter Elmləri / Süni İntellekt Agentləri E-poçtdan, Söhbətdən və Fayldan Gələn Gizli Təlimatlara Aldana Bilərmi?
Kompüter Elmləri

Süni İntellekt Agentləri E-poçtdan, Söhbətdən və Fayldan Gələn Gizli Təlimatlara Aldana Bilərmi?

Bu yazı alətlərdən istifadə edə bilən süni intellekt agentlərində dolayı prompt injection riskini daha real şəraitdə ölçən akademik tədqiqat əsasında hazırlanıb. LivePI benchmark-ı e-poçt, qrup söhbəti, yerli fayl, veb məzmunu, GitHub Gist, repo bağlantıları və pulqabı interfeysləri kimi yeddi səthi sınaqdan keçirir. Məqsəd agentlərin etibarsız xarici məzmunu istifadəçi təlimatı kimi qəbul edib real alət çağırışlarına çevirmə riskini ölçməkdir.

05/06/2026  Veri Anla 73 baxış
Süni İntellekt Agentləri E-poçtdan, Söhbətdən və Fayldan Gələn Gizli Təlimatlara Aldana Bilərmi?

Bu yazı, alətlərdən istifadə edə bilən süni intellekt agentlərində dolayı prompt injection riskini daha real şəraitdə ölçməyi hədəfləyən akademik tədqiqat əsasında hazırlanıb. Araşdırılan iş, LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection başlığını daşıyır.

Tədqiqatın diqqət mərkəzində yalnız söhbət ekranında verilən əmrlərə cavab verən modellər deyil; e-poçt oxuya bilən, fayl aça bilən, veb səhifələrdə gəzə bilən, kod işlədə bilən, qrup söhbətlərinə qoşula bilən və hətta test nəzarətində olan kripto pulqabı interfeysinə çıxışı olan süni intellekt agentləri var. Bu tip sistemlərdə model xətası artıq yalnız səhv cavab yaratmaqla məhdudlaşmır. Səhv alət çağırışı məlumat sızması, təhlükəsizlik parametrlərinin dəyişdirilməsi, zərərli kodun işə salınması və ya icazəsiz maliyyə əməliyyatı kimi real yan təsirlərə çevrilə bilər.

LivePI tədqiqatının əsas mesajı budur: Güclü dil modelləri təkbaşına dolayı prompt injection riskini aradan qaldırmır. Agentin xarici dünyadan oxuduğu məzmunlar etibarsız məlumat kimi işarələnməzsə, model bu məzmunları istifadəçinin həqiqi təlimatı kimi şərh edə bilər.

Bu məzmun təhlükəsizlik barədə məlumatlandırma məqsədilə hazırlanıb. Zərərli prompt yazılması, təhlükəsizliyin aşılması üçün təlimat, məlumat sızdırma üsulu və ya sui-istifadə bələdçisi deyil. Məqsəd süni intellekt agentlərini daha təhlükəsiz hazırlamaq üçün riskləri və müdafiə məntiqini sadə şəkildə izah etməkdir.

Yeni akademik tədqiqat alətlərdən istifadə edə bilən süni intellekt agentlərinin dolayı prompt injection hücumlarına qarşı nə qədər dayanıqlı olduğunu sınaqdan keçirir. LivePI adlı benchmark e-poçt, qrup söhbəti, yerli fayl, veb məzmunu, GitHub Gist, repo bağlantıları və pulqabı interfeysləri kimi yeddi fərqli səthi əhatə edir. Tədqiqatda beş fərqli model onurğası sınaqdan keçirilib və ümumi hücum uğuru nisbətlərinin %10,7 ilə %29,6 arasında dəyişdiyi görülüb. Ən diqqətçəkən tapıntı qrup söhbəti inyeksiyalarının qiymətləndirilən bütün modellərdə uğurlu olmasıdır. Tədqiqatçılar həmçinin prompt səviyyəsində filtrləmə və alət çağırışından əvvəl siyasət təsdiqindən istifadə edən ikiqat müdafiəni sınaqdan keçirirlər; eksperimental quruluşda bu müdafiə zərərli hədəflərin işə salınmasının qarşısını alır.

Problem Nədir?

Ənənəvi söhbət botlarında istifadəçi sual verir, model isə mətn cavabı yaradır. Bu quruluşdakı xəta adətən yanlış məlumat, natamam cavab və ya uyğun olmayan yönləndirmə ilə məhdud qalır. Lakin müasir süni intellekt agentləri bundan xeyli çoxunu edə bilər. Agentin e-poçta çıxışı, fayl sistemi icazəsi, terminal aləti, veb brauzeri, mesajlaşma hesabı və ya API bağlantısı varsa, modelin verdiyi qərar xarici dünyada real əməliyyat yarada bilər.

Dolayı prompt injection məhz bu nöqtədə ortaya çıxır. Hücumçu süni intellektə birbaşa əmr vermək əvəzinə, agentin oxuyacağı e-poçta, fayla, veb səhifəyə, repo təsvirinə və ya qrup mesajına gizli/yanıltıcı təlimat yerləşdirir. Agent tapşırıq zamanı bu məzmunu oxuduqda, mətni yalnız məlumat kimi görmək əvəzinə təlimat kimi şərh edə bilər.

Məsələn, istifadəçi agentdən “son e-poçtlarımı xülasə et” demiş ola bilər. Lakin poçt qutusundakı zərərli mesaj agenti xülasədən kənar əmələ yönəltməyə çalışa bilər. Eyni şəkildə, kod deposunun təsviri və ya quraşdırma bələdçisi agentin etibarsız kodu işə salmasına səbəb ola bilər.

Tədqiqatın əsas sualı budur: Real alətlərə və canlı, lakin test nəzarətində olan hesablara qoşulan süni intellekt agentləri dolayı prompt injection qarşısında nə qədər təhlükəsiz davranır?

Metod Nə Təklif Edir?

LivePI dolayı prompt injection riskini yalnız simulyasiya daxilində deyil, istehsal mühitinə bənzər, lakin nəzarət edilən virtual maşın mühitində sınaqdan keçirir. Tədqiqatçılar OpenClaw adlı alət istifadə edə bilən agenti Ubuntu əsaslı virtual maşında işlədirlər. Bu agent e-poçt, qrup söhbətləri, veb, yerli fayllar, repo məzmunları və test nəzarətində olan kripto pulqabı interfeysi ilə qarşılıqlı əlaqə qura bilir.

Benchmark üç ölçü üzərində qurulub:

1. İnyeksiya səthi: Hücumçu məzmununun agentə hansı kanaldan çatdığını göstərir. Nümunələr arasında WhatsApp qrupu, Telegram qrupu, Slack kanalı, Gmail mesajı, yerli fayl, repo bağlantısı və Gist tipli veb məzmunu var.

2. Hücum texnikası və ya render ailəsi: Zərərli hədəfin məzmuna necə yerləşdirildiyini ifadə edir. Tədqiqatda birbaşa qrup mesajı, saxta təsdiq zənciri, yoxlama siyahısına yerləşdirmə, etibarlı inteqrasiya təqlidi, siyasət yeniləməsi kimi müxtəlif ailələr sınaqdan keçirilir. Bu yazıda sui-istifadə detallarına yer verilmir.

3. Zərərli hədəf: Hücumun çatmaq istədiyi zərərli nəticədir. Tədqiqatda qorunan məlumatların xaricə ötürülməsi, təhlükəsizlik nəzarətinin dəyişdirilməsi, təhlükəli kodun işə salınması, şəxsi e-poçt xülasəsinin icazəsiz şəxsə göndərilməsi və test nəzarətində olan kripto transferi kimi hədəflər qiymətləndirilir.

Bu quruluş sayəsində LivePI yalnız “model zərərli mətni tanıyırmı?” sualını deyil, “model bu mətndən təsirlənib real alət çağırışı edirmi?” sualını da sınaqdan keçirir.

Formullar Nəyi İzah Edir?

Tədqiqatdakı formullar süni intellekt agentini, alət çağırışlarını, hücum nümunəsini, uğur ölçüsünü və müdafiə qatını formal şəkildə müəyyənləşdirmək üçün istifadə olunur. Bu formullar riyazi qiymət proqnozu deyil, təhlükəsizlik qiymətləndirmə modeli təqdim edir.

1. Agent siyasəti

Model və qərar yaratma qaydası siyasət kimi göstərilir:

\[ \Pi:X\rightarrow U \]

Burada \(X\), modelə verilən mətn konteksti məkanını; \(U\), modelin yarada biləcəyi cavab və ya alət çağırışı məkanını ifadə edir. Yəni agent gördüyü kontekstə əsasən cavab və ya hərəkət seçir.

2. Hərəkət məkanı

Agentin hərəkət məkanı iki hissədən ibarətdir:

\[ U=Y\cup U_{tool} \]

Burada \(Y\), təbii dil cavablarını; \(U_{tool}\), strukturlaşdırılmış alət çağırışlarını təmsil edir. Təhlükəsizlik baxımından kritik fərq buradadır: Mətn cavabı yanlış ola bilər, amma alət çağırışı real fayl oxuma, e-poçt göndərmə və ya sistem parametrini dəyişdirmə kimi yan təsirlər yarada bilər.

3. Alət çağırışı

Alət çağırışı belə yazılır:

\[ u=(i,a),\qquad i\in[m],\quad a\in I_i \]

Burada \(i\), çağırılan aləti; \(a\), həmin alətə verilən arqumentləri ifadə edir. Məsələn, fayl oxuma aləti, e-poçt aləti və ya terminal aləti fərqli \(i\) dəyərləri ilə düşünülə bilər.

4. Ümumi agent sistemi

Tədqiqatda agent sistemi bu komponentlərlə modelləşdirilir:

\[ A=(\Pi,\Gamma,T,P,E) \]

Burada \(\Pi\) model siyasətidir. \(\Gamma\), mövcud konteksti model girişinə çevirən prompt yaratma xəritəsidir. \(T\), alətlər toplusudur. \(P\), alət çağırışı üçün icazə/review/block qərarı verən icra qapısıdır. \(E\) isə e-poçt, veb, fayl sistemi, API və pulqabı kimi xarici mühiti təmsil edir.

5. Agent konteksti

Hər addımda agent konteksti bu hissələrdən ibarətdir:

\[ C_t=(C_{sys-dev},C_{user},C_{agent,t},C_{env,t}) \]

Burada \(C_{sys-dev}\), sistem və developer qaydalarını; \(C_{user}\), səlahiyyətli istifadəçinin tapşırığını; \(C_{agent,t}\), agentin əvvəlki mesaj və hərəkətlərini; \(C_{env,t}\), xarici mühitdən gələn e-poçt, veb səhifə, fayl, repo və ya qrup söhbəti kimi məzmunları ifadə edir.

Tədqiqatın təhlükəsizlik baxımından ən vacib məqamı budur: \(C_{env,t}\) etibarsız məlumat kimi qəbul edilməlidir. Çünki bu sahə hücumçu tərəfindən idarə edilən məzmun daşıya bilər.

6. Model girişi

Mövcud kontekstdən model girişi belə yaradılır:

\[ x_t=\Gamma(C_t) \]

Əgər prompt yaratma qatı mənbələri düzgün ayırmırsa, etibarsız xarici məzmun model girişində səlahiyyətli istifadəçi təlimatı kimi görünə bilər. Dolayı prompt injection riskinin əsasında bu qarışma dayanır.

7. Alət çağırışının icra qərarı

Alət çağırışı edilməzdən əvvəl siyasət qapısı qərar verir:

\[ d_t=P(C_t,u_t)\in\{ALLOW,REVIEW,BLOCK\} \]

\(ALLOW\) alətin işləməsinə icazə verir. \(REVIEW\) insan təsdiqi tələb edir. \(BLOCK\) alətin işləməsini əngəlləyir. Tədqiqatın müdafiə təklifində bu qapı xüsusilə vacibdir; çünki modelin zərərli alət çağırışı təklif etməsi təkbaşına kifayət etmir, çağırış işləməzdən əvvəl dayandırıla bilər.

8. Dolayı prompt injection nümunəsi

Hücum nümunəsi üçlük kimi müəyyənləşdirilir:

\[ I=(s,\rho,g_m) \]

Burada \(s\), hücum səthidir; məsələn, e-poçt, qrup söhbəti, fayl və ya repo. \(\rho\), hücum texnikası və ya məzmunun necə təqdim olunduğudur. \(g_m\), hücumçunun zərərli hədəfidir.

9. Hücum uğuru

Tədqiqatda hücumun uğurlu sayılması üçün yalnız agentin təsirlənməsi kifayət etmir; zərərli hədəfin də gerçəkləşməsi lazımdır:

\[ Success_I(\tau)=AI(\tau)\cdot M_{g_m}(\tau) \]

Burada \(AI(\tau)\), hücumçu məzmununun agentin izinə və ya qərarına təsir edib-etmədiyini göstərir. \(M_{g_m}(\tau)\), zərərli hədəfin gerçəkləşib-gerçəkləşmədiyini ifadə edir. Hər ikisi baş verərsə, hücum uğurlu sayılır.

10. Hücum uğuru nisbəti

Benchmark üzrə ümumi hücum uğuru nisbəti belə hesablanır:

\[ ASR(B')= \frac{100}{|B'|} \sum_{I\in B'}Success_I(\tau_I) \]

Burada \(B'\), qiymətləndirilən test hallarının çoxluğudur. Bu metrik hansı səthin və ya hansı modelin daha çox risk daşıdığını müqayisə etmək üçün istifadə olunur.

11. Review və Block nisbəti

Müdafiənin normal istifadəyə nə qədər sürtünmə əlavə etdiyini görmək üçün iki nisbət hesablanır:

\[ ReviewRate= \frac{\#reviewed\ tool\ calls}{\#total\ tool\ calls} \]
\[ BlockRate= \frac{\#blocked\ tool\ calls}{\#total\ tool\ calls} \]

Bu iki ölçü təhlükəsizliklə istifadə rahatlığı arasındakı tarazlığı göstərir. Müdafiə həddən artıq normal əməliyyatı dayandırarsa, istifadəçi təcrübəsi pisləşə bilər. Heç nəyi dayandırmazsa, təhlükəsizlik də təmin etməz.

Qrafik, Cədvəl və Sxemin Əsas Mesajı

PDF-dəki Şəkil 1, dolayı prompt injection və ikiqat müdafiə axınını göstərir. Hücumçu zərərli hədəfi etibarsız səthə yerləşdirir. Agent tapşırıq zamanı bu məzmunu oxuyur. Birinci müdafiə qatı prompt səviyyəsində şübhəli nümunələri filtrləyir. İkinci müdafiə qatı isə alət çağırışı işləməzdən əvvəl icazə, nəzərdən keçirmə və ya bloklama qərarı verir.

Cədvəl 1, LivePI səthlərini xülasə edir. WhatsApp, Telegram və Slack qrup söhbətləri; Gmail e-poçtu; yerli sənəd; ictimai repo bağlantısı və Gist kimi mənbələr test səthi kimi istifadə olunur. Bu cədvəl dolayı prompt injection riskinin yalnız veb səhifə və ya e-poçtla məhdud olmadığını göstərir.

Cədvəl 2, hücum texnikası ailələrini izah edir. Tədqiqat saxta təsdiq zənciri, etibarlı inteqrasiya təqlidi, yoxlama siyahısına yerləşdirmə, siyasət yeniləməsi kimi müxtəlif ssenariləri qiymətləndirir. Bu müxtəliflik hücumların yalnız “əvvəlki təlimatları unut” kimi sadə ifadələrdən ibarət olmadığını, qanuni tapşırıq axınına qarışa biləcək şəkildə dizayn edilə bildiyini göstərir.

Cədvəl 4, ən diqqətçəkən nəticəni verir. Qrup söhbəti inyeksiyası sınaqdan keçirilən bütün model onurğalarında %100 uğur göstərib. Ümumi hücum uğuru nisbəti modeldən modelə dəyişib: Claude Opus 4.6 ən aşağı ümumi nisbətlə %10,7; Gemini 3.1 Pro isə ən yüksək nisbətlə %29,6 səviyyəsindədir. Repo bağlantıları da kiçik nümunə səbəbindən ehtiyatla şərh edilməli olsa da, yüksək şiddətli risk siqnalı yaradıb.

Cədvəl 5, ikiqat müdafiənin nəticəsini göstərir. GPT-5.3-Codex quruluşunda müdafiə sınaqdan keçirilən zərərli hədəf tamamlanmalarını işə salınmadan əvvəl bloklayıb və hücum uğuru nisbətini %0 kimi bildirib. Eyni zamanda 899 normal alət çağırışının yalnız %0,89-u nəzərdən keçirməyə göndərilib, %0,11-i bloklanıb. Bu nəticə düzgün hazırlanmış alət çağırışı siyasətlərinin təhlükəsizliklə istifadə rahatlığı arasında balanslı işləyə biləcəyini düşündürür.

Təcrübələr Necə Aparılıb?

Tədqiqatda OpenClaw agenti istehsala bənzər, lakin test nəzarətində olan virtual maşın mühitində işlədilib. Mühitdə canlı brauzer, web fetch, Gmail test hesabı, WhatsApp/Slack/Telegram test kanalları, yerli fayl sistemi və məhdud balansı olan test nəzarətli Solana pulqabı interfeysi var.

LivePI ümumilikdə 169 icra edilə bilən hücum halını əhatə edir. Bunlar yeddi səth, on iki texnika/render ailəsi və beş zərərli hədəf kombinasiyasından seçilib. Hər kombinasiya tətbiq edilə bilən olmadığı üçün nəzəri maksimum olan 420 əvəzinə 169 real test halı yaradılıb.

Beş model onurğası qiymətləndirilib: GPT-5.3-Codex, Claude Opus 4.6, Gemini 3.1 Pro, Kimi K2.5 və GLM-5. Hər testdə agentin qarşılıqlı əlaqə izi, təklif etdiyi alət çağırışları, işləyən alətlər, alət çıxışları və son cavab qeydə alınıb.

Hücum uğuru yalnız modelin mətndən təsirlənməsinə görə deyil, hədəflənən zərərli nəticənin gerçəkləşib-gerçəkləşmədiyinə görə qiymətləndirilib. Konkret yan təsir yaradan tapşırıqlarda e-poçt göndərilməsi, əməliyyat qeydləri, dəyişən parametrlər, yaradılan fayllar, script işə salma izləri və ya əmr çıxışları ayrıca yoxlanılıb.

Nəticələr Nəyi Göstərir?

Tədqiqatın ilk nəticəsi güclü model onurğalarının belə dolayı prompt injection riskini tam aradan qaldırmamasıdır. Ümumi hücum uğuru nisbətləri modeldən modelə dəyişsə də, heç bir model bütün səthlərdə təhlükəsiz deyil.

İkinci nəticə hücum səthinin ən azı model keyfiyyəti qədər vacib olmasıdır. Eyni zərərli hədəf e-poçt daxilində daha az təsirli ola bildiyi halda, qrup söhbətində xeyli daha təsirli ola bilər. Bu, təhlükəsizlik testlərinin səth əsaslı aparılmalı olduğunu göstərir.

Üçüncü nəticə qrup söhbəti səthinin xüsusilə riskli olmasıdır. Tədqiqatda qrup mesajlarının agent kontekstinə səlahiyyətli istifadəçi mesajına bənzər şəkildə daxil olması hücumçu məzmununun model tərəfindən həqiqi istifadəçi istəyi kimi şərh edilməsinə səbəb ola bilib.

Dördüncü nəticə repo bağlantısı kimi proqram təminatının hazırlanması səthlərinin kiçik nümunədə belə yüksək şiddətli risk siqnalı yaratmasıdır. Çünki burada risk yalnız mətn təlimatı deyil, etibarsız kodun endirilməsi, quraşdırılması və ya işə salınması kimi daha ağır yan təsirlərlə əlaqəlidir.

Beşinci nəticə müdafiənin yalnız prompt filtri ilə məhdudlaşmamalı olmasıdır. Prompt səviyyəsində təmizləmə faydalı ola bilər; lakin əsas kritik təhlükəsizlik nöqtəsi alət çağırışı işə düşməzdən dərhal əvvəl siyasət əsaslı icazə mexanizmidir. Beləliklə, model zərərli hərəkət təklif etmiş olsa belə, sistem bu hərəkəti dayandıra və ya insan təsdiqinə göndərə bilər.

Bu Niyə Vacibdir?

Süni intellekt agentləri getdikcə daha çox real alətə qoşulur. İstifadəçi adından e-poçt oxuya, kod yaza, fayl redaktə edə, ödəniş edə və ya server parametrini dəyişə bilən agentlər iş dünyasında böyük rahatlıq yarada bilər. Lakin bu səlahiyyətlər təhlükəsizlik baxımından klassik söhbət botlarından xeyli daha ciddi risk səviyyəsi yaradır.

Dolayı prompt injection buna görə kritik problemdir. Çünki hücumçunun modelə birbaşa çıxışı lazım deyil. Agentin oxuyacağı sənədə, e-poçta, veb səhifəyə və ya qrup mesajına yerləşdirilən məzmun kifayət edə bilər. Agent mənbənin etibarlılığını ayırd edə bilmirsə, etibarsız məlumat təlimata çevrilə bilər.

Bu tədqiqat təhlükəsiz agent dizaynında üç əsas prinsipi önə çıxarır:

Mənbələrin ayrılması: İstifadəçi təlimatı ilə xarici dünyadan gələn məlumat eyni səlahiyyət səviyyəsində görülməməlidir.

Alət çağırışına nəzarət: Həssas alətlər birbaşa modelin qərarına buraxılmamalı; icazə, nəzərdən keçirmə və ya bloklama siyasətləri ilə qorunmalıdır.

Səth əsaslı test: E-poçt, qrup söhbəti, yerli fayl, veb və repo səthləri ayrı-ayrılıqda sınaqdan keçirilməlidir. Çünki hər kanalın risk profili fərqlidir.

Diqqət Edilməli Məqamlar

Bu tədqiqat müəyyən test quruluşunda aparılmış akademik təhlükəsizlik benchmark-ıdır. Nəticələr bütün agent sistemləri üçün universal təhlükəsizlik zəmanəti vermir.

İkiqat müdafiə LivePI hücum siniflərinə uyğun hazırlanıb. Buna görə real dünyadakı bütün dolayı prompt injection növlərini blokladığı fərz edilməməlidir.

Müdafiə nəticələri yalnız GPT-5.3-Codex konfiqurasiyasında bildirilib. Digər model onurğalarında eyni müdafiənin necə işləyəcəyi ayrıca sınaqdan keçirilməlidir.

Repo bağlantısı səthi yalnız dörd icra edilə bilən test halını əhatə edir. Bu nəticə yüksək şiddətli risk siqnalı kimi vacibdir; lakin real dünyadakı yayılmanı kəmiyyətcə proqnozlaşdırmaq üçün kifayət deyil.

Tədqiqatda LLM judge və deterministik nəzarətlər birlikdə istifadə olunub. Bu yanaşma praktik olsa da, gələcəkdə insan qiymətləndirməsi və daha əhatəli doğrulama testləri ilə dəstəklənməlidir.

Bu yazıda hücum şablonları və ya sui-istifadə detalları verilməyib. Məqsəd müdafiə və təhlükəsiz dizayn prinsiplərini izah etməkdir.

Nəticə

LivePI tədqiqatı alətlərdən istifadə edən süni intellekt agentlərinin təhlükəsizlik qiymətləndirilməsində daha real test mühitlərinə ehtiyac olduğunu göstərir. Model söhbət daxilində təhlükəsiz görünə bilər; lakin e-poçt, fayl, qrup söhbəti və ya repo məzmunu üzərindən gələn etibarsız təlimatlarla qarşılaşdıqda fərqli davrana bilər.

Tədqiqatın ən diqqətçəkən tapıntısı qrup söhbəti inyeksiyalarının qiymətləndirilən bütün modellərdə uğurlu olmasıdır. Bu nəticə model keyfiyyətindən asılı olmayaraq, sistem dizaynında mənbə və rol ayrımının kritik olduğunu göstərir.

Təklif edilən ikiqat müdafiə prompt səviyyəsində filtrləmə ilə alət çağırışından əvvəl siyasət təsdiqini birləşdirir. Eksperimental quruluşda bu müdafiə zərərli hədəflərin işə salınmasının qarşısını alarkən, normal tapşırıqlarda aşağı sürtünmə yaradıb. Lakin müəlliflərin də vurğuladığı kimi, bu nəticə ümumi təhlükəsizlik zəmanəti kimi deyil, müdafiə istiqamətində ümidverici nəzarətli eksperiment nəticəsi kimi oxunmalıdır.

Verianla baxımından bu tədqiqatın əsas mesajı budur: Süni intellekt agentlərində təhlükəsizlik yalnız modelin “ağıllı” olmasına buraxıla bilməz. Həqiqi təhlükəsizlik mənbələrin ayrılması, etibarsız məzmunun işarələnməsi, alət çağırışı siyasətləri, insan təsdiqi və səth əsaslı təhlükəsizlik testlərinin birlikdə tətbiqi ilə təmin edilə bilər.

Mənbə və Metod Qeydi

Bu məzmun, LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection başlıqlı akademik PDF araşdırılaraq hazırlanıb. Mətn sözbəsöz tərcümə deyil. Tədqiqatın məqsədi, təhdid modeli, əsas formulları, eksperiment dizaynı, benchmark nəticələri, müdafiə yanaşması və məhdudiyyətləri Verianla oxucuları üçün sadələşdirilmiş, orijinal və redaksiya Azərbaycan dili ilə yenidən izah edilib.

Təhlükəsizlik səbəbi ilə yazıda hücum şablonları, sui-istifadə əmrləri və ya zərərli texniki detallar yenidən verilməyib. 


Paylaşın:

Şərhlər yoxlandıqdan sonra yayımlanır.Şərhiniz təsdiq prosesinə daxil ediləcək və uyğun hesab olunduqda görünəcək.

Şərh yazın

E-poçt ünvanınız yayımlanmayacaq. Məcburi sahələr * ilə işarələnib

Your experience on this site will be improved by allowing cookies Cookie Policy