Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Колдонмо илимдер / Компьютер илими / Жасалма интеллект агенттери e-mail, чат жана файлдан келген жашыруун көрсөтмөлөргө алданышы мүмкүнбү?
Компьютер илими

Жасалма интеллект агенттери e-mail, чат жана файлдан келген жашыруун көрсөтмөлөргө алданышы мүмкүнбү?

Бул макала куралдарды колдоно алган жасалма интеллект агенттеринде кыйыр prompt injection тобокелдигин кыйла реалдуу шарттарда өлчөөнү максат кылган академиялык изилдөөнүн негизинде даярдалган. Каралган иш “LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection” деп аталат.

05/06/2026  Veri Anla 58 көрүү
Жасалма интеллект агенттери e-mail, чат жана файлдан келген жашыруун көрсөтмөлөргө алданышы мүмкүнбү?

Бул макала куралдарды колдоно алган жасалма интеллект агенттеринде кыйыр prompt injection тобокелдигин кыйла реалдуу шарттарда өлчөөнү максат кылган академиялык изилдөөнүн негизинде даярдалган. Каралган изилдөө, LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection деп аталат.

Изилдөөнүн борборунда чат терезесинде берилген буйруктарга гана жооп берген моделдер эмес; e-mail окуй алган, файл ача алган, web баракчаларды карай алган, код иштете алган, топтук чаттарга кошула алган жана атүгүл тесттик көзөмөлдөгү крипто капчык интерфейсине кире алган жасалма интеллект агенттери турат. Мындай системаларда моделдин катасы мындан ары туура эмес жооп түзүү менен гана чектелбейт. Туура эмес курал чакыруусу маалыматтын чыгып кетишине, коопсуздук жөндөөлөрүнүн өзгөрүшүнө, зыяндуу коддун иштетилишине же уруксатсыз каржылык транзакцияга окшогон реалдуу терс таасирлерге айланышы мүмкүн.

LivePI изилдөөсүнүн негизги билдирүүсү мындай: күчтүү тил моделдери өз алдынча кыйыр prompt injection тобокелдигин жок кылбайт. Эгер агент тышкы дүйнөдөн окуган мазмун ишенимсиз маалымат катары белгиленбесе, модель бул мазмунду колдонуучунун чыныгы көрсөтмөсү катары чечмелеп калышы мүмкүн.

Бул мазмун коопсуздук боюнча маалымат берүү максатында даярдалган. Ал зыяндуу prompt жазуу, коопсуздукту айланып өтүү нускамасы, маалыматты сыртка чыгаруу ыкмасы же кыянат пайдалануу колдонмосу эмес. Максат — жасалма интеллект агенттерин коопсузураак долбоорлоо үчүн тобокелдиктерди жана коргонуу логикасын жөнөкөй түшүндүрүү.

Жаңы академиялык изилдөө куралдарды колдоно алган жасалма интеллект агенттеринин кыйыр prompt injection чабуулдарына канчалык туруктуу экенин текшерет. LivePI аттуу benchmark e-mail, топтук чат, жергиликтүү файл, web мазмуну, GitHub Gist, repo шилтемелери жана капчык интерфейстери сыяктуу жети башка бетти камтыйт. Изилдөөдө беш башка моделдик негиз сыналган жана жалпы чабуул ийгилигинин көрсөткүчтөрү %10,7 менен %29,6 аралыгында өзгөргөнү байкалган. Эң көңүл бурдурган табылга — топтук чат injection’дары бааланган бардык моделдерде ийгиликтүү болгону. Изилдөөчүлөр мындан тышкары prompt деңгээлиндеги чыпкалоону жана курал чакыруусуна чейин саясаттык бекитүүнү колдонгон эки катмарлуу коргонууну сынашат; эксперименттик түзүлүштө бул коргонуу зыяндуу максаттардын аткарылышын токтотот.

Көйгөй эмнеде?

Салттуу чатботтордо колдонуучу суроо берет, модель болсо тексттик жооп чыгарат. Мындай түзүлүштөгү ката адатта туура эмес маалымат, толук эмес жооп же ылайыксыз багыттоо болуп калат. Бирок заманбап жасалма интеллект агенттери мындан алда канча көп нерсе жасай алат. Эгер агенттин e-mail’ге кирүүсү, файл системасына уруксаты, terminal куралы, web браузери, билдирүү аккаунту же API байланышы бар болсо, моделдин чечими тышкы дүйнөдө чыныгы операцияны жаратышы мүмкүн.

Кыйыр prompt injection дал ушул жерде пайда болот. Чабуулчу жасалма интеллектке түз буйрук бергендин ордуна, агент окуй турган e-mail’ге, файлга, web баракчага, repo сүрөттөмөсүнө же топтук билдирүүгө жашыруун/адаштыруучу көрсөтмө жайгаштырат. Агент тапшырма учурунда бул мазмунду окуганда, текстти жөн гана маалымат катары эмес, көрсөтмө катары чечмелеши мүмкүн.

Мисалы, колдонуучу агентке “акыркы e-mail’деримди кыскача жыйынтыкта” деген болушу мүмкүн. Бирок e-mail кутусундагы зыяндуу билдирүү агентти жыйынтыктоодон тышкаркы аракетке багыттоого аракет кылышы мүмкүн. Ошол сыяктуу, код репозиторийинин сүрөттөмөсү же орнотуу колдонмосу агенттин ишенимсиз кодду иштетишине түрткү бериши мүмкүн.

Изилдөөнүн негизги суроосу мындай: реалдуу куралдарга жана жандуу, бирок тесттик көзөмөлдөгү аккаунттарга туташкан жасалма интеллект агенттери кыйыр prompt injection алдында канчалык коопсуз иш-аракет кылат?

Ыкма эмнени сунуштайт?

LivePI кыйыр prompt injection тобокелдигин симуляциянын ичинде гана эмес, өндүрүшкө окшош, бирок көзөмөлдөнгөн виртуалдык машина чөйрөсүндө сынайт. Изилдөөчүлөр OpenClaw аттуу курал колдоно алган агентти Ubuntu негизиндеги виртуалдык машинада иштетишет. Бул агент e-mail, топтук чаттар, web, жергиликтүү файлдар, repo мазмундары жана тесттик көзөмөлдөгү крипто капчык интерфейси менен өз ара аракеттене алат.

Benchmark үч өлчөмгө негизделген:

1. Injection бети: Чабуулчунун мазмуну агентке кайсы канал аркылуу жеткенин билдирет. Мисалдарга WhatsApp тобу, Telegram тобу, Slack каналы, Gmail билдирүүсү, жергиликтүү файл, repo шилтемеси жана Gist сыяктуу web мазмуну кирет.

2. Чабуул техникасы же render үй-бүлөсү: Зыяндуу максат мазмунга кандайча жайгаштырылганын билдирет. Изилдөөдө түз топтук билдирүү, жасалма бекитүү чынжыры, текшерүү тизмесине киргизүү, ишенимдүү интеграцияны туурап көрсөтүү, саясат жаңыртуусу сыяктуу ар кандай үй-бүлөлөр сыналат. Бул макалада кыянат пайдалануу деталдары берилбейт.

3. Зыяндуу максат: Чабуул жетүүгө аракет кылган зыяндуу натыйжаны билдирет. Изилдөөдө корголгон маалыматты сыртка чыгаруу, коопсуздук көзөмөлүн өзгөртүү, ишенимсиз кодду иштетүү, жеке e-mail жыйынтыгын уруксатсыз адамга жөнөтүү жана тесттик көзөмөлдөгү крипто которуу сыяктуу максаттар бааланат.

Бул түзүлүш LivePI’ге “модель зыяндуу текстти тааныйбы?” деген суроону гана эмес, “модель бул тексттен таасирленип, чыныгы курал чакыруусун жасайбы?” деген суроону да текшерүүгө мүмкүндүк берет.

Формулалар эмнени түшүндүрөт?

Изилдөөдөгү формулалар жасалма интеллект агентин, курал чакырууларын, чабуул үлгүсүн, ийгилик өлчөмүн жана коргонуу катмарын формалдуу аныктоо үчүн колдонулат. Бул формулалар математикалык баа божомолу эмес, коопсуздукту баалоо моделин сунуштайт.

1. Агент саясаты

Модель жана чечим чыгаруу эрежеси саясат катары көрсөтүлөт:

\[ \Pi:X\rightarrow U \]

Бул жерде \(X\) моделге берилген тексттик контекст мейкиндигин; \(U\) модель чыгара ала турган жооп же курал чакыруусу мейкиндигин билдирет. Башкача айтканда, агент көргөн контекстине жараша жооп же аракет тандайт.

2. Аракеттер мейкиндиги

Агенттин аракеттер мейкиндиги эки бөлүктөн турат:

\[ U=Y\cup U_{tool} \]

Бул жерде \(Y\) табигый тилдеги жоопторду; \(U_{tool}\) түзүмдөлгөн курал чакырууларын билдирет. Коопсуздук жагынан маанилүү айырма ушул жерде: тексттик жооп туура эмес болушу мүмкүн, бирок курал чакыруусу реалдуу файл окуу, e-mail жөнөтүү же система жөндөөсүн өзгөртүү сыяктуу терс таасирлерди жаратышы мүмкүн.

3. Курал чакыруусу

Курал чакыруусу төмөнкүдөй жазылат:

\[ u=(i,a),\qquad i\in[m],\quad a\in I_i \]

Бул жерде \(i\) чакырылган куралды; \(a\) ошол куралга берилген аргументтерди билдирет. Мисалы, файл окуу куралы, e-mail куралы же terminal куралы ар башка \(i\) маанилери менен каралышы мүмкүн.

4. Жалпы агент системасы

Изилдөөдө агент системасы төмөнкү компоненттер менен моделденет:

\[ A=(\Pi,\Gamma,T,P,E) \]

Бул жерде \(\Pi\) модель саясаты. \(\Gamma\) учурдагы контекстти модель киргизүүсүнө айландырган prompt түзүү картасы. \(T\) куралдар топтому. \(P\) курал чакыруусу үчүн уруксат/review/block чечимин берген аткаруу дарбазасы. \(E\) болсо e-mail, web, файл системасы, API жана капчык сыяктуу тышкы чөйрөнү билдирет.

5. Агент контексти

Ар бир кадамда агент контексти төмөнкү бөлүктөрдөн турат:

\[ C_t=(C_{sys-dev},C_{user},C_{agent,t},C_{env,t}) \]

Бул жерде \(C_{sys-dev}\) система жана иштеп чыгуучу эрежелерин; \(C_{user}\) ыйгарым укуктуу колдонуучунун тапшырмасын; \(C_{agent,t}\) агенттин мурунку билдирүүлөрүн жана аракеттерин; \(C_{env,t}\) тышкы чөйрөдөн келген e-mail, web баракча, файл, repo же топтук чат мазмунун билдирет.

Изилдөөнүн коопсуздук жагынан эң маанилүү жери мындай: \(C_{env,t}\) ишенимсиз маалымат катары каралышы керек. Анткени бул талаа чабуулчу көзөмөлдөгөн мазмунду ташышы мүмкүн.

6. Модель киргизүүсү

Учурдагы контексттен модель киргизүүсү төмөнкүдөй түзүлөт:

\[ x_t=\Gamma(C_t) \]

Эгер prompt түзүү катмары булактарды туура бөлбөсө, ишенимсиз тышкы мазмун модель киргизүүсүндө ыйгарым укуктуу колдонуучунун көрсөтмөсүндөй көрүнүшү мүмкүн. Кыйыр prompt injection тобокелдигинин өзөгү ушул аралашууда.

7. Курал чакыруусун аткаруу чечими

Курал чакыруусу аткарылардан мурда саясат дарбазасы чечим берет:

\[ d_t=P(C_t,u_t)\in\{ALLOW,REVIEW,BLOCK\} \]

\(ALLOW\) куралдын иштөөсүнө уруксат берет. \(REVIEW\) адамдын бекитүүсүн талап кылат. \(BLOCK\) куралдын иштөөсүн токтотот. Изилдөөнүн коргонуу сунушунда бул дарбаза өзгөчө маанилүү, анткени моделдин зыяндуу курал чакыруусун сунуштаганы өзүнчө жетишсиз; чакыруу иштей электе токтотулушу мүмкүн.

8. Кыйыр prompt injection үлгүсү

Чабуул үлгүсү үчтүк катары аныкталат:

\[ I=(s,\rho,g_m) \]

Бул жерде \(s\) чабуул бети; мисалы e-mail, топтук чат, файл же repo. \(\rho\) чабуул техникасы же мазмун кандай сунушталганын билдирет. \(g_m\) чабуулчунун зыяндуу максаты.

9. Чабуул ийгилиги

Изилдөөдө чабуул ийгиликтүү деп эсептелиши үчүн агенттин таасирлениши гана жетишсиз; зыяндуу максат да ишке ашышы керек:

\[ Success_I(\tau)=AI(\tau)\cdot M_{g_m}(\tau) \]

Бул жерде \(AI(\tau)\) чабуулчу мазмун агенттин изине же чечимине таасир эткен-этпегенин көрсөтөт. \(M_{g_m}(\tau)\) зыяндуу максат ишке ашкан-ашпаганын билдирет. Экөө тең аткарылса, чабуул ийгиликтүү деп эсептелет.

10. Чабуул ийгилигинин көрсөткүчү

Benchmark боюнча чабуул ийгилигинин көрсөткүчү төмөнкүдөй эсептелет:

\[ ASR(B')= \frac{100}{|B'|} \sum_{I\in B'}Success_I(\tau_I) \]

Бул жерде \(B'\) бааланган тест учурларынын топтому. Бул метрика кайсы бет же кайсы модель көбүрөөк тобокелдик алып жүргөнүн салыштыруу үчүн колдонулат.

11. Review жана Block көрсөткүчү

Коргонуу кадимки колдонууга канча тоскоолдук кошконун көрүү үчүн эки көрсөткүч эсептелет:

\[ ReviewRate= \frac{\#reviewed\ tool\ calls}{\#total\ tool\ calls} \]
\[ BlockRate= \frac{\#blocked\ tool\ calls}{\#total\ tool\ calls} \]

Бул эки өлчөм коопсуздук менен колдонуу ыңгайлуулугунун ортосундагы тең салмакты көрсөтөт. Коргонуу өтө көп кадимки аракетти токтотсо, колдонуучу тажрыйбасы начарлашы мүмкүн. Эч нерсени токтотпосо, коопсуздук камсыздалбайт.

График, таблица жана схеманын негизги билдирүүсү

PDF’теги 1-сүрөткыйыр prompt injection жана эки катмарлуу коргонуу агымын көрсөтөт. Чабуулчу зыяндуу максатты ишенимсиз бетке жайгаштырат. Агент тапшырма учурунда бул мазмунду окуйт. Биринчи коргонуу катмары prompt деңгээлинде шектүү үлгүлөрдү чыпкалайт. Экинчи катмар курал чакыруусу иштей электе уруксат, кароо же бөгөттөө чечимин берет.

1-таблицаLivePI беттерин жыйынтыктайт. WhatsApp, Telegram жана Slack топтук чаттары; Gmail e-mail’и; жергиликтүү документ; жалпыга ачык repo шилтемеси жана Gist сыяктуу булактар тест бети катары колдонулат. Бул таблица кыйыр prompt injection тобокелдиги web баракча же e-mail менен гана чектелбегенин көрсөтөт.

2-таблицачабуул техникасынын үй-бүлөлөрүн түшүндүрөт. Изилдөө жасалма бекитүү чынжыры, ишенимдүү интеграцияны туурап көрсөтүү, текшерүү тизмесине киргизүү, саясат жаңыртуусу сыяктуу ар кандай сценарийлерди баалайт. Бул ар түрдүүлүк чабуулдар “мурунку көрсөтмөлөрдү унут” сыяктуу жөнөкөй сөздөрдөн гана турбасын, мыйзамдуу тапшырма агымына аралаша тургандай долбоорлонушу мүмкүн экенин көрсөтөт.

4-таблицаэң таң калыштуу натыйжаны берет. Топтук чат injection’у сыналган бардык моделдик негиздерде %100 ийгилик көрсөткөн. Жалпы чабуул ийгилигинин көрсөткүчү моделден моделге өзгөргөн: Claude Opus 4.6 эң төмөн жалпы көрсөткүч менен %10,7; Gemini 3.1 Pro эң жогорку көрсөткүч менен %29,6 деңгээлинде. Repo шилтемелери да чакан үлгү болгондуктан этият чечмелениши керек болсо да, жогорку деңгээлдеги тобокелдик сигналын берген.

5-таблицаэки катмарлуу коргонуунун натыйжасын көрсөтөт. GPT-5.3-Codex жөндөөсүндө коргонуу сыналган зыяндуу максаттардын аткарылышын ишке кирерден мурда токтотуп, чабуул ийгилигинин көрсөткүчүн %0 деп берген. Ошол эле учурда 899 кадимки курал чакыруусунун %0,89’ы гана кароого жөнөтүлүп, %0,11’и бөгөттөлгөн. Бул натыйжа туура долбоорлонгон курал чакыруу саясаттары коопсуздук менен колдонуу ыңгайлуулугунун ортосунда тең салмактуу иштей аларын көрсөтөт.

Эксперименттер кандай жүргүзүлгөн?

Изилдөөдө OpenClaw агенти өндүрүшкө окшош, бирок тесттик көзөмөлдөгү виртуалдык машина чөйрөсүндө иштетилген. Чөйрөдө жандуу браузер, web fetch, Gmail тест аккаунту, WhatsApp/Slack/Telegram тест каналдары, жергиликтүү файл системасы жана чектелген балансы бар тесттик көзөмөлдөгү Solana капчык интерфейси бар.

LivePI жалпы 169 аткарылуучу чабуул учурун камтыйт. Алар жети бет, он эки техника/render үй-бүлөсү жана беш зыяндуу максаттын айкалыштарынан тандалган. Ар бир айкалыш колдонууга жарабай тургандыктан, теориялык максимум 420 ордуна 169 чыныгы тест учуру түзүлгөн.

Беш моделдик негиз бааланган: GPT-5.3-Codex, Claude Opus 4.6, Gemini 3.1 Pro, Kimi K2.5 жана GLM-5. Ар бир тестте агенттин өз ара аракет изи, сунуштаган курал чакыруулары, иштеген куралдар, курал натыйжалары жана акыркы жооп жазылып алынган.

Чабуул ийгилиги моделдин тексттен таасирленгенине гана эмес, көздөлгөн зыяндуу натыйжа ишке ашкан-ашпаганына жараша бааланган. Реалдуу терс таасир жараткан тапшырмаларда e-mail жөнөтүү, транзакция жазуулары, өзгөргөн жөндөөлөр, түзүлгөн файлдар, script иштетүү издери же буйрук чыгыштары өзүнчө текшерилген.

Натыйжалар эмнени көрсөтөт?

Изилдөөнүн биринчи натыйжасы — күчтүү моделдик негиздер да кыйыр prompt injection тобокелдигин толук жок кылбайт. Жалпы чабуул ийгилигинин көрсөткүчтөрү моделден моделге өзгөрсө да, эч бир модель бардык беттерде коопсуз эмес.

Экинчи натыйжа — чабуул бети моделдин сапатынан кем эмес маанилүү. Бир эле зыяндуу максат e-mail ичинде азыраак таасирдүү болуп, топтук чатта кыйла таасирдүү болушу мүмкүн. Бул коопсуздук тесттери беттер боюнча өз-өзүнчө жүргүзүлүшү керек экенин көрсөтөт.

Үчүнчү натыйжа — топтук чат бети өзгөчө тобокелдүү. Изилдөөдө топтук билдирүүлөрдүн агент контекстине ыйгарым укуктуу колдонуучунун билдирүүсүнө окшош кириши чабуулчу мазмундун модель тарабынан чыныгы колдонуучу талабы катары чечмеленишине алып келген.

Төртүнчү натыйжа — repo шилтемеси сыяктуу программалык камсыздоону иштеп чыгуу беттери чакан үлгүдө да жогорку деңгээлдеги тобокелдик сигналын берген. Анткени бул жерде тобокелдик тексттик көрсөтмө менен гана чектелбей, ишенимсиз кодду жүктөө, орнотуу же иштетүү сыяктуу олуттуураак терс таасирлер менен байланыштуу.

Бешинчи натыйжа — коргонуу prompt чыпкасы менен гана чектелбеши керек. Prompt деңгээлиндеги тазалоо пайдалуу болушу мүмкүн; бирок эң маанилүү коопсуздук чекити — курал чакыруусу иштей электеги саясатка негизделген уруксат механизми. Ошентип модель зыяндуу аракетти сунуштаган күндө да, система ал аракетти токтото же адамдын бекитүүсүнө жөнөтө алат.

Бул эмне үчүн маанилүү?

Жасалма интеллект агенттери улам көбүрөөк реалдуу куралдарга туташууда. Колдонуучунун атынан e-mail окуй алган, код жаза алган, файл түзөтө алган, төлөм жасай алган же сервер жөндөөсүн өзгөртө алган агенттер иш дүйнөсүндө чоң ыңгайлуулук жаратышы мүмкүн. Бирок бул ыйгарым укуктар коопсуздук жагынан классикалык чатботторго караганда кыйла олуттуу тобокелдик деңгээлин түзөт.

Кыйыр prompt injection ушул себептен критикалык көйгөй. Анткени чабуулчунун модель менен түз байланышы болушу талап кылынбайт. Агент окуй турган документке, e-mail’ге, web баракчага же топтук билдирүүгө жайгаштырылган мазмун жетиштүү болушу мүмкүн. Агент булактын ишенимдүүлүгүн ажырата албаса, ишенимсиз маалымат көрсөтмөгө айланышы мүмкүн.

Бул изилдөө коопсуз агент дизайнында үч негизги принципти алдыга чыгарат:

Булактарды ажыратуу: Колдонуучунун көрсөтмөсү менен тышкы дүйнөдөн келген маалымат бирдей ыйгарым укук деңгээлинде каралбашы керек.

Курал чакыруусун көзөмөлдөө: Сезимтал куралдар түздөн-түз моделдин чечимине берилбеши; уруксат, кароо же бөгөттөө саясаттары менен корголушу керек.

Бет боюнча тест: E-mail, топтук чат, жергиликтүү файл, web жана repo беттери өз-өзүнчө сыналышы керек. Анткени ар бир каналдын тобокелдик профили башка.

Көңүл буруучу жагдайлар

Бул изилдөө белгилүү бир тест түзүлүшүндө жүргүзүлгөн академиялык коопсуздук benchmark’ы. Натыйжалар бардык агент системалары үчүн универсалдуу коопсуздук кепилдигин бербейт.

Эки катмарлуу коргонуу LivePI чабуул класстарына ылайык иштелип чыккан. Ошондуктан ал реалдуу дүйнөдөгү кыйыр prompt injection’дун бардык түрүн бөгөттөйт деп кабыл алынбашы керек.

Коргонуу натыйжалары GPT-5.3-Codex конфигурациясында гана берилген. Башка моделдик негиздерде ошол эле коргонуу кандай иштей турганы өзүнчө текшерилиши керек.

Repo шилтемеси бети төрт гана аткарылуучу тест учурун камтыйт. Бул натыйжа жогорку деңгээлдеги тобокелдик сигналы катары маанилүү, бирок реалдуу дүйнөдөгү таралышын сандык баалоо үчүн жетишсиз.

Изилдөөдө LLM judge жана детерминисттик көзөмөлдөр бирге колдонулган. Бул ыкма практикалык болгону менен, келечекте адамдык баалоо жана кеңири текшерүү тесттери менен колдоого алынышы керек.

Бул макалада чабуул шаблондору же кыянат пайдалануу деталдары берилген эмес. Максат — коргонуу жана коопсуз дизайн принциптерин түшүндүрүү.

Жыйынтык

LivePI изилдөөсү курал колдонуучу жасалма интеллект агенттеринин коопсуздугун баалоодо реалдуураак тест чөйрөлөрү керек экенин көрсөтөт. Модель чат ичинде коопсуз көрүнүшү мүмкүн; бирок e-mail, файл, топтук чат же repo мазмуну аркылуу келген ишенимсиз көрсөтмөлөргө туш болгондо башкача иш-аракет кылышы мүмкүн.

Изилдөөнүн эң көңүл бурдурган табылгасы — топтук чат injection’дары бааланган бардык моделдерде ийгиликтүү болгону. Бул натыйжа модель сапатына карабай, система дизайнындагы булак жана роль ажыратуу критикалык экенин көрсөтөт.

Сунушталган эки катмарлуу коргонуу prompt деңгээлиндеги чыпкалоону жана курал чакыруусуна чейинки саясаттык бекитүүнү бириктирет. Эксперименттик түзүлүштө бул коргонуу зыяндуу максаттардын аткарылышын токтотуп, кадимки тапшырмаларда аз тоскоолдук жараткан. Бирок авторлор да баса белгилегендей, бул натыйжа жалпы коопсуздук кепилдиги катары эмес, коргонуу багытындагы үмүттүү көзөмөлдүү эксперименттин натыйжасы катары окулушу керек.

Verianla көз карашынан изилдөөнүн негизги билдирүүсү мындай: жасалма интеллект агенттеринде коопсуздукту моделдин “акылдуулугуна” гана тапшырууга болбойт. Чыныгы коопсуздук булактарды ажыратуу, ишенимсиз мазмунду белгилөө, курал чакыруу саясаттары, адамдын бекитүүсү жана бет боюнча коопсуздук тесттерин бирге колдонуу менен камсыздалат.

Булак жана ыкма жөнүндө эскертүү

Бул мазмун, LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection аттуу академиялык PDF каралып даярдалган. Текст сөзмө-сөз котормо эмес. Изилдөөнүн максаты, коркунуч модели, негизги формулалары, эксперимент дизайны, benchmark натыйжалары, коргонуу ыкмасы жана чектөөлөрү Verianla окурмандары үчүн жөнөкөйлөштүрүлгөн, оригиналдуу жана редакциялык кыргыз тилинде кайра баяндалган.

Коопсуздук себептеринен улам макалада чабуул шаблондору, кыянат пайдалануу буйруктары же зыяндуу техникалык деталдар кайра берилген эмес. 


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты