
Makala haya yametayarishwa kutokana na utafiti wa kitaaluma unaolenga kupima hatari ya uingizaji wa vidokezo kwa njia isiyo ya moja kwa moja (indirect prompt injection) katika mawakala wa akili bandia wanaoweza kutumia zana chini ya mazingira halisi zaidi. Utafiti uliochanganuliwa una kichwa LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection.
Lengo la utafiti huu si tu kwa modeli zinazojibu amri zinazotolewa kwenye skrini ya soga pekee; bali pia kwa mawakala wa akili bandia wanaoweza kusoma barua pepe, kufungua faili, kuvinjari kurasa za wavuti, kuendesha kodi, kuunganishwa kwenye soga za makundi, na hata kufikia kiolesura cha pochi ya sarafu-fiche (crypto wallet) kinachodhibitiwa kwa majaribio. Katika mifumo ya aina hii, kosa la modeli si tu kutoa jibu lisilo sahihi tena. Wito wa zana usio sahihi unaweza kugeuka kuwa athari halisi kama vile kuvuja kwa data, kubadilisha mipangilio ya usalama, kuendesha kodi hasidi, au kufanya miamala ya kifedha bila idhini.
Ujumbe mkuu wa utafiti wa LivePI ni huu: Modeli zenye nguvu za lugha pekee haziondoi hatari ya uingizaji wa vidokezo kwa njia isiyo ya moja kwa moja. Ikiwa maudhui anayosoma wakala kutoka ulimwengu wa nje hayatawekwa alama kama data isiyoaminika, modeli inaweza kufasiri maudhui haya kana kwamba ni maagizo halisi ya mtumiaji.
Maudhui haya yametayarishwa kwa madhumuni ya kutoa habari za kiusalama. Si mwongozo wa kuandika vidokezo hasidi, maagizo ya kukiuka usalama, mbinu za kuvujisha data, au matumizi mabaya. Lengo ni kueleza kwa njia rahisi hatari na mantiki ya ulinzi ili kubuni mawakala wa akili bandia walio salama zaidi.
Utafiti mpya wa kitaaluma unajaribu jinsi mawakala wa akili bandia wanaotumia zana wanavyostahimili mashambulizi ya uingizaji wa vidokezo kwa njia isiyo ya moja kwa moja. Kipimo (benchmark) kinachoitwa LivePI kinajumuisha nyuso saba tofauti kama vile barua pepe, soga ya kikundi, faili ya ndani, maudhui ya wavuti, GitHub Gist, viungo vya hazina (repo), na violesura vya pochi. Modeli tano tofauti za msingi zilijaribiwa katika utafiti huu, na ilionekana kuwa viwango vya jumla vya mafanikio ya mashambulizi vilibadilika kati ya asilimia 10.7 na 29.6. Ugunduzi unaovutia zaidi ni kwamba uingizaji kupitia soga za makundi ulifanikiwa katika modeli zote zilizotathminiwa. Watafiti pia walijaribu ulinzi wa tabaka mbili unaotumia uchujaji wa kiwango cha kidokezo na idhini ya sera kabla ya wito wa zana; katika mfumo wa majaribio, ulinzi huu unazuia utekelezaji wa malengo hasidi.
1. Kichwa
Katika roboti za soga za asili, mtumiaji huuliza swali, na modeli hutoa jibu la maandishi. Kosa katika muundo huu mara nyingi hubaki kama habari isiyo sahihi, jibu lisilokamilika, au mwelekeo usiofaa. Hata hivyo, mawakala wa kisasa wa akili bandia wanaweza kufanya mengi zaidi ya hayo. Ikiwa wakala ana ufikiaji wa barua pepe, ruhusa ya mfumo wa faili, zana ya terminali, kivinjari cha wavuti, akaunti ya kutuma ujumbe, au muunganisho wa API, uamuzi unaofanywa na modeli unaweza kuunda hatua halisi katika ulimwengu wa nje.
Uingizaji wa vidokezo usio wa moja kwa moja hujitokeza hasa katika hatua hii. Badala ya kumpa akili bandia amri ya moja kwa moja, mshambuliaji huweka maagizo ya siri au ya kupotosha kwenye barua pepe, faili, ukurasa wa wavuti, maelezo ya hazina (repo), au ujumbe wa kikundi ambao wakala atasoma. Wakala anaposoma maudhui haya wakati wa kutekeleza jukumu lake, anaweza kufasiri maandishi hayo kama maagizo badala ya kuyaona kama data pekee.
Kwa mfano, mtumiaji anaweza kumwambia wakala, "fupisha barua pepe zangu za mwisho". Lakini ujumbe hasidi kwenye kikasha cha barua pepe unaweza kujaribu kumwelekeza wakala kufanya kitendo kingine nje ya kufupisha. Vivyo hivyo, maelezo ya hifadhi ya kodi au mwongozo wa usakinishaji unaweza kusababisha wakala kuendesha kodi isiyoaminika.
Swali la msingi la utafiti huu ni: Mawakala wa akili bandia wanaounganishwa na zana za kiuhalisia na akaunti zilizo hai lakini zinazodhibitiwa kwa majaribio, wanafanya kazi kwa usalama kiasi gani dhidi ya uingizaji wa vidokezo usio wa moja kwa moja?
2. Muhtasari mfupi
LivePI hujaribu hatari ya uingizaji wa vidokezo usio wa moja kwa moja si tu katika uigaji, bali katika mazingira ya mashine pepe yanayodhibitiwa ambayo yanafanana na mazingira halisi ya uzalishaji. Watafiti wanaendesha wakala anayeweza kutumia zana anayeitwa OpenClaw kwenye mashine pepe inayoendeshwa na Ubuntu. Wakala huyu anaweza kuingiliana na barua pepe, soga za makundi, wavuti, faili za ndani, maudhui ya hazina (repo), na kiolesura cha pochi ya sarafu-fiche inayodhibitiwa kwa majaribio.
Kipimo kimejengwa kwenye misingi (vipimo) mitatu:
1. Uso wa uingizaji: Ni njia gani maudhui ya mshambuliaji yanamfikia wakala. Mifano ni pamoja na kikundi cha WhatsApp, kikundi cha Telegram, idhaa ya Slack, ujumbe wa Gmail, faili ya ndani, kiungo cha hazina, na maudhui ya wavuti yanayofanana na Gist.
2. Mbinu ya shambulio au familia ya uwasilishaji: Inaelezea jinsi lengo hasidi lilivyofichwa kwenye maudhui. Katika utafiti, familia tofauti hujaribiwa, kama vile ujumbe wa moja kwa moja wa kikundi, mnyororo wa idhini bandia, kuficha ndani ya orodha hakiki, kuiga ushirikiano unaoaminika, na sasisho la sera. Maelezo ya matumizi mabaya hayatolewi katika makala haya.
3. Lengo hasidi: Ni matokeo mabaya ambayo shambulio linalenga kufikia. Malengo kama vile kuhamisha taarifa zilizolindwa kwenda nje, kubadilisha udhibiti wa usalama, kuendesha kodi isiyo salama, kutuma muhtasari wa barua pepe za kibinafsi kwa mtu asiyeidhinishwa, na uhamishaji wa sarafu-fiche unaodhibitiwa kwa majaribio, hutathminiwa katika utafiti.
Kupitia muundo huu, LivePI si tu inajaribu swali la "je, modeli inatambua maandishi hasidi?", bali pia inajaribu swali la "je, modeli inaathiriwa na maandishi haya na kufanya wito halisi wa zana?".
3. Maelezo ya kina
Fomula zilizo katika utafiti hutumika kufafanua rasmi wakala wa akili bandia, wito wa zana, mfano wa shambulio, kipimo cha mafanikio, na tabaka la ulinzi. Fomula hizi hazitoi makadirio ya bei ya kihisabati, bali hutoa modeli ya tathmini ya usalama.
1. Sera ya wakala
Modeli na kanuni ya kufanya uamuzi huonyeshwa kama sera:
Hapa \(X\), inawakilisha nafasi ya muktadha wa maandishi uliopewa modeli; \(U\), inawakilisha nafasi ya jibu au wito wa zana ambao modeli inaweza kutoa. Yaani wakala huchagua jibu au kitendo kulingana na muktadha anaouona.
2. Nafasi ya vitendo
Nafasi ya vitendo vya wakala ina sehemu mbili:
Hapa \(Y\), inawakilisha majibu ya lugha ya asili; \(U_{tool}\), inawakilisha wito wa zana uliojengwa. Tofauti muhimu kwa mtazamo wa usalama iko hapa: Jibu la maandishi linaweza kuwa sio sahihi, lakini wito wa zana unaweza kusababisha athari halisi kama vile kusoma faili halisi, kutuma barua pepe, au kubadilisha mpangilio wa mfumo.
3. Wito wa zana
Wito wa zana huandikwa kwa njia ifuatayo:
Hapa \(i\), inawakilisha zana inayoitwa; \(a\), inawakilisha hoja (arguments) zinazopewa zana hiyo. Kwa mfano, zana ya kusoma faili, zana ya barua pepe, au zana ya terminali zinaweza kufikiriwa kwa maadili tofauti ya \(i\).
4. Mfumo wa jumla wa wakala
Katika utafiti, mfumo wa wakala hutengenezwa kwa vijenzi vifuatavyo:
Hapa \(\Pi\), ni sera ya modeli. \(\Gamma\), ni ramani ya kuunda kidokezo inayobadilisha muktadha wa sasa kuwa ingizo la modeli. \(T\), ni seti ya zana. \(P\), ni lango la utekelezaji ambalo hufanya uamuzi wa kuruhusu/kukagua/kuzuia (allow/review/block) wito wa zana. Na \(E\) inawakilisha mazingira ya nje kama vile barua pepe, wavuti, mfumo wa faili, API, na pochi.
5. Muktadha wa wakala
Katika kila hatua, muktadha wa wakala unajumuisha sehemu hizi:
Hapa \(C_{sys-dev}\), inawakilisha sheria za mfumo na msanidi; \(C_{user}\), jukumu la mtumiaji aliyeidhinishwa; \(C_{agent,t}\), ujumbe na vitendo vya nyuma vya wakala; \(C_{env,t}\), maudhui kama vile barua pepe, ukurasa wa wavuti, faili, hazina, au soga ya kikundi inayotoka kwa mazingira ya nje.
Hatua muhimu zaidi ya utafiti kwa upande wa usalama ni hii: \(C_{env,t}\) inapaswa kuonekana kama data isiyoaminika. Kwa sababu eneo hili linaweza kubeba maudhui yanayodhibitiwa na mshambuliaji.
6. Ingizo la modeli
Ingizo la modeli kutoka kwenye muktadha wa sasa linaundwa kwa njia ifuatayo:
Ikiwa tabaka la kuunda kidokezo halitenganishi vyanzo kwa usahihi, maudhui ya nje yasiyoaminika yanaweza kuonekana kama maagizo ya mtumiaji aliyeidhinishwa kwenye ingizo la modeli. Mchanganyiko huu ndio msingi wa hatari ya uingizaji wa vidokezo usio wa moja kwa moja.
7. Uamuzi wa kutekeleza wito wa zana
Kabla ya wito wa zana kufanywa, lango la sera hufanya uamuzi:
\(ALLOW\), inaruhusu zana kufanya kazi. \(REVIEW\), inaomba idhini ya binadamu. \(BLOCK\), inazuia zana kufanya kazi. Katika pendekezo la ulinzi la utafiti, lango hili ni muhimu sana; kwa sababu modeli kupendekeza wito hasidi wa zana pekee haitoshi, wito huo unaweza kusimamishwa kabla ya kutekelezwa.
8. Mfano wa uingizaji wa vidokezo usio wa moja kwa moja
Mfano wa shambulio hufafanuliwa kama seti ya mambo matatu:
Hapa \(s\), ni uso wa shambulio; kwa mfano barua pepe, soga ya kikundi, faili, au hazina. \(\rho\), ni mbinu ya shambulio au jinsi maudhui yanavyowasilishwa. \(g_m\), ni lengo hasidi la mshambuliaji.
9. Mafanikio ya shambulio
Katika utafiti, ili shambulio lizingatiwe limefanikiwa, haitoshi kwa wakala kuathiriwa pekee; lengo hasidi lazima pia litimie:
Hapa \(AI(\tau)\), inaonyesha kama maudhui ya mshambuliaji yameathiri ufuatiliaji (trace) au uamuzi wa wakala. \(M_{g_m}(\tau)\), inawakilisha kama lengo hasidi limetimia. Ikiwa yote mawili yamekidhiwa, shambulio linachukuliwa kuwa limefanikiwa.
10. Kiwango cha mafanikio ya shambulio
Kiwango cha mafanikio ya shambulio kwa kipimo (benchmark) kizima hukokotolewa hivi:
Hapa \(B'\), ni kundi la visa vya majaribio vilivyotathminiwa. Kipimo hiki kinatumika kulinganisha ni uso gani au modeli gani inayobeba hatari zaidi.
11. Kiwango cha Ukaguzi na Uzuiaji
Ili kuona ni kiasi gani ulinzi unaongeza mivutano (friction) kwenye matumizi ya kawaida, viwango viwili hukokotolewa:
Vipimo hivi viwili vinaonyesha uwiano kati ya usalama na urahisi wa kutumia. Ikiwa ulinzi utasimamisha shughuli nyingi za kawaida, uzoefu wa mtumiaji unaweza kuharibika. Na kama hautasimamisha chochote, hautatoa usalama.
4. Mbinu na matokeo ya utafiti
Kielelezo cha 1 katika PDF kinaonyesha mtiririko wa uingizaji wa vidokezo usio wa moja kwa moja na ulinzi wa tabaka mbili. Mshambuliaji huweka lengo hasidi kwenye uso usioaminika. Wakala husoma maudhui haya wakati wa kazi. Tabaka la kwanza la ulinzi huchuja miundo inayotiliwa shaka katika kiwango cha kidokezo. Tabaka la pili la ulinzi hufanya uamuzi wa kuruhusu, kukagua, au kuzuia kabla ya wito wa zana kufanya kazi.
Jedwali la 1 linatoa muhtasari wa nyuso za LivePI. Soga za makundi za WhatsApp, Telegram na Slack; barua pepe ya Gmail; hati za ndani; viungo vya hazina vya umma na vyanzo kama vile Gist vinatumika kama nyuso za majaribio. Jedwali hili linaonyesha kuwa hatari ya uingizaji wa vidokezo usio wa moja kwa moja haikomei kwa kurasa za wavuti au barua pepe pekee.
Jedwali la 2 linaelezea familia za mbinu za shambulio. Utafiti; hutathmini matukio tofauti kama vile mnyororo wa idhini bandia, kuiga ushirikiano unaoaminika, kuficha ndani ya orodha hakiki, na usasishaji wa sera. Utofauti huu unaonyesha kwamba mashambulizi hayana kauli rahisi pekee kama "sahau maagizo ya awali", bali yanaweza kubuniwa kwa namna ya kuingilia mtiririko halali wa majukumu.
Jedwali la 4 linatoa matokeo ya kushangaza zaidi. Uingizaji kupitia soga ya kikundi ulionyesha mafanikio ya asilimia 100 katika modeli zote za msingi zilizojaribiwa. Kiwango cha jumla cha mafanikio ya shambulio kilitofautiana kati ya modeli na modeli: Claude Opus 4.6 ilikuwa na kiwango cha chini zaidi cha jumla cha asilimia 10.7; huku Gemini 3.1 Pro ikiwa katika kiwango cha juu zaidi cha asilimia 29.6. Viungo vya hazina pia vilizalisha ishara ya hatari ya kiwango cha juu, ingawa inahitaji kufasiriwa kwa uangalifu kutokana na ukubwa mdogo wa sampuli.
Jedwali la 5 linaonyesha matokeo ya ulinzi wa tabaka mbili. Katika mpangilio wa GPT-5.3-Codex, ulinzi ulizuia ukamilishaji wa malengo hasidi yaliyojaribiwa kabla ya kutekelezwa na kuripoti kiwango cha mafanikio ya shambulio kuwa asilimia 0. Wakati huo huo, ni asilimia 0.89 pekee ya miito 899 ya kawaida ya zana iliyotumwa kwa ukaguzi, na asilimia 0.11 ilizuiwa. Matokeo haya yanadokeza kuwa sera zilizobuniwa kwa usahihi za wito wa zana zinaweza kufanya kazi kwa usawa kati ya usalama na urahisi wa kutumia.
5. Maelezo ya chanzo na mbinu
Katika utafiti, wakala wa OpenClaw aliendeshwa katika mazingira ya mashine pepe yanayodhibitiwa ambayo yanafanana na ya uzalishaji halisi. Mazingira hayo yanajumuisha kivinjari hai, upakuaji wa wavuti (web fetch), akaunti ya majaribio ya Gmail, idhaa za majaribio za WhatsApp/Slack/Telegram, mfumo wa faili wa ndani, na kiolesura cha pochi ya Solana kinachodhibitiwa kwa majaribio chenye salio dogo.
LivePI inajumuisha jumla ya matukio 169 ya mashambulizi yanayoweza kutekelezwa. Haya yalichaguliwa kutokana na mchanganyiko wa nyuso saba, familia kumi na mbili za mbinu/uwasilishaji, na malengo matano hasidi. Kwa kuwa si kila mchanganyiko uliweza kutumika, matukio halisi ya majaribio 169 yaliundwa badala ya matukio 420 ambayo yalitarajiwa kinadharia.
Modeli tano za msingi zilitathminiwa: GPT-5.3-Codex, Claude Opus 4.6, Gemini 3.1 Pro, Kimi K2.5, na GLM-5. Katika kila jaribio, ufuatiliaji wa mwingiliano wa wakala, miito ya zana iliyopendekezwa, zana zilizotekelezwa, matokeo ya zana, na jibu la mwisho vilirekodiwa.
Mafanikio ya shambulio hayakutathminiwa tu kulingana na iwapo modeli iliathiriwa na maandishi, bali pia iwapo lengo hasidi lililotarajiwa lilitimia. Katika majukumu yanayosababisha athari dhahiri, usafirishaji wa barua pepe, rekodi za miamala, mipangilio iliyobadilika, faili zilizoundwa, athari za kuendesha hati (script), au matokeo ya amri yalikaguliwa tofauti.
6. Lebo za meta
Tokeo la kwanza la utafiti ni kwamba hata modeli zenye nguvu za msingi haziondoi kabisa hatari ya uingizaji wa vidokezo usio wa moja kwa moja. Ingawa viwango vya jumla vya mafanikio ya shambulio vinatofautiana kati ya modeli, hakuna modeli iliyo salama katika nyuso zote.
Tokeo la pili ni kwamba uso wa shambulio ni muhimu sawa na ubora wa modeli. Lengo lilelile hasidi linaweza kuwa na ufanisi mdogo katika barua pepe, lakini linaweza kuwa na ufanisi mkubwa sana katika soga ya kikundi. Hii inaonyesha kuwa majaribio ya usalama yanapaswa kufanywa kulingana na nyuso mbalimbali.
Tokeo la tatu ni kwamba uso wa soga za makundi ni hatari sana. Katika utafiti huu, uingiaji wa jumbe za makundi katika muktadha wa wakala kwa njia sawa na ujumbe wa mtumiaji aliyeidhinishwa, uliwezesha maudhui ya mshambuliaji kufasiriwa na modeli kama ombi halisi la mtumiaji.
Tokeo la nne ni kwamba nyuso za uundaji wa programu kama vile viungo vya hazina hutoa ishara ya hatari kubwa hata katika sampuli ndogo. Kwa sababu hapa hatari sio tu maagizo ya maandishi, bali inahusiana na athari mbaya zaidi kama vile kupakua, kusakinisha, au kuendesha kodi isiyoaminika.
Tokeo la tano ni kwamba ulinzi haupaswi kukomea kwenye kichujio cha vidokezo pekee. Usafishaji katika kiwango cha kidokezo unaweza kuwa na manufaa; lakini hatua muhimu ya usalama ni mfumo wa utoaji idhini unaotegemea sera kabla tu ya wito wa zana kufanya kazi. Hivyo, hata kama modeli imependekeza kitendo hasidi, mfumo unaweza kusimamisha kitendo hicho au kukituma kwa idhini ya binadamu.
Kwa Nini Hili Ni Muhimu?
Mawakala wa akili bandia wanazidi kuunganishwa na zana halisi. Mawakala wanaoweza kusoma barua pepe, kuandika kodi, kuhariri faili, kufanya malipo, au kubadilisha mpangilio wa seva kwa niaba ya mtumiaji, wanaweza kurahisisha sana shughuli za kibiashara. Hata hivyo, mamlaka haya yanaunda kiwango cha hatari zaidi kiusalama ikilinganishwa na roboti za soga za asili.
Ndiyo maana uingizaji wa vidokezo usio wa moja kwa moja ni tatizo kubwa. Kwa sababu mshambuliaji hahitaji kufikia modeli moja kwa moja. Maudhui yanayowekwa kwenye hati, barua pepe, ukurasa wa wavuti, au ujumbe wa kikundi ambao wakala atasoma yanaweza kutosha. Ikiwa wakala hawezi kutofautisha uaminifu wa chanzo, data isiyoaminika inaweza kugeuka kuwa maagizo.
Utafiti huu unaangazia misingi mitatu mikuu katika ubunifu salama wa mawakala:
Utenganishaji wa vyanzo: Maagizo ya mtumiaji na data kutoka ulimwengu wa nje hazipaswi kuonekana katika kiwango sawa cha mamlaka.
Udhibiti wa wito wa zana: Zana nyeti hazipaswi kuachwa moja kwa moja kwenye uamuzi wa modeli; zinapaswa kulindwa kwa sera za kuruhusu, kukagua, au kuzuia.
Majaribio kulingana na nyuso: Nyuso za barua pepe, soga za makundi, faili za ndani, wavuti, na hazina zinapaswa kujaribiwa kando kando. Kwa sababu wasifu wa hatari kwa kila idhaa ni tofauti.
Mambo ya Kuzingatia
Utafiti huu ni kipimo cha kiusalama cha kitaaluma kinachofanywa katika mfumo maalum wa majaribio. Matokeo hayatoi hakikisho la usalama la ulimwengu mzima kwa mifumo yote ya mawakala.
Ulinzi wa tabaka mbili uliundwa kulingana na madaraja ya mashambulizi ya LivePI. Kwa hivyo, haipaswi kudhaniwa kuwa unazuia aina zote za uingizaji wa vidokezo usio wa moja kwa moja katika ulimwengu wa kweli.
Matokeo ya kiulinzi yaliripotiwa tu katika mpangilio wa GPT-5.3-Codex. Jinsi ulinzi huu utafanya kazi katika modeli zingine za msingi unapaswa kujaribiwa kivyake.
Uso wa kiungo cha hazina unajumuisha tu matukio manne ya majaribio yanayoweza kutekelezwa. Tokeo hili ni muhimu kama ishara ya hatari ya kiwango cha juu; lakini halitoshi kukadiria kwa wingi kuenea kwake katika ulimwengu wa kweli.
Katika utafiti huu, mwamuzi wa LLM na vidhibiti thabiti (deterministic controls) vilitumika pamoja. Ingawa mbinu hii ni rahisi kutumia, inahitaji kuungwa mkono na tathmini ya binadamu na majaribio mapana zaidi ya uthibitishaji katika siku zijazo.
Makala haya hayatoi vielelezo vya mashambulizi au maelezo ya matumizi mabaya. Lengo ni kueleza misingi ya ulinzi na ubunifu salama.
Hitimisho
Utafiti wa LivePI unaonyesha kwamba kuna hitaji la mazingira ya majaribio ya kiuhalisia zaidi katika tathmini ya usalama wa mawakala wa akili bandia wanaotumia zana. Modeli inaweza kuonekana salama ndani ya soga; hata hivyo inaweza kutenda tofauti inakumbana na maagizo yasiyoaminika yanayokuja kupitia barua pepe, faili, soga ya kikundi, au maudhui ya hazina.
Ugunduzi wa kushangaza zaidi wa utafiti ni kwamba uingizaji kupitia soga za makundi ulifanikiwa katika modeli zote zilizotathminiwa. Matokeo haya yanaonyesha kwamba utenganishaji wa vyanzo na majukumu katika muundo wa mfumo ni muhimu, bila kujali ubora wa modeli.
Ulinzi unaopendekezwa wa tabaka mbili unajumuisha uchujaji katika kiwango cha kidokezo na idhini ya sera kabla ya wito wa zana. Katika mfumo wa majaribio, ulinzi huu uliweza kuzuia malengo hasidi huku ukisababisha mivutano midogo sana katika majukumu ya kawaida. Hata hivyo, kama waandishi walivyosisitiza, matokeo haya yanapaswa kusomwa kama jaribio linalodhibitiwa lenye matumaini kwa ulinzi, na sio kama hakikisho la usalama la jumla.
Kwa mtazamo wa Verianla, ujumbe mkuu wa utafiti huu ni: Usalama kwa mawakala wa akili bandia haupaswi kuachwa tu kwa "akili" ya modeli. Usalama wa kweli unaweza kufikiwa kwa kutumia kwa pamoja utenganishaji wa vyanzo, kuweka alama kwa maudhui yasiyoaminika, sera za wito wa zana, idhini ya binadamu, na majaribio ya kiusalama kulingana na nyuso.
Dokezo la Chanzo na Mbinu
Maudhui haya yametayarishwa kwa kuchanganua faili ya kitaaluma ya PDF yenye kichwa LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection. Maandishi haya si tafsiri ya neno kwa neno. Lengo la utafiti, modeli ya tishio, fomula za kimsingi, muundo wa majaribio, matokeo ya kipimo, mbinu ya ulinzi na mapungufu yameelezwa upya kwa njia iliyorahisishwa, ya kipekee, na katika mpangilio wa kihariri kwa wasomaji wa Verianla.
Kwa sababu za kiusalama, vielelezo vya mashambulizi, amri za matumizi mabaya au maelezo hasidi ya kiufundi hayakujumuishwa kwenye makala haya.

Acha maoni
Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *