Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои амалӣ / Илми компютер / Нишонагузории код бе вайрон кардани он: Филigranкунии код барои муайян кардани коди тавлидшудаи LLM
Илми компютер

Нишонагузории код бе вайрон кардани он: Филigranкунии код барои муайян кардани коди тавлидшудаи LLM

Муҳаққиқон усуле бо номи STONE таҳия карданд, ки ҳадафаш коҳиш додани хатари вайрон шудани синтаксис ё мантиқи иҷрои код ҳангоми ҷойгир кардани филigrani баъдан муайяншаванда дар коди барномавии тавлидкардаи моделҳои бузурги забонӣ мебошад.

12/08/2026  Veri Anla 46 боздид
Нишонагузории код бе вайрон кардани он: Филigranкунии код барои муайян кардани коди тавлидшудаи LLM

Муҳаққиқон усуле бо номи STONE таҳия карданд, ки ҳадафаш коҳиш додани хатари вайрон шудани синтаксис ё мантиқи иҷрои код ҳангоми ҷойгир кардани филigrani баъдан муайяншаванда дар коди барномавии тавлидкардаи моделҳои бузурги забонӣ мебошад. Равиши асосии STONE ин аст, ки ба ҷои татбиқи филigran ба ҳамаи tokenҳо ё танҳо tokenҳои дорои энтропияи баланд, tokenҳои синтаксисие, ки барои кори барнома муҳим шуморида мешаванд, ҳифз карда шаванд.

Нуқтаи оғози таҳқиқот мушоҳидаи ҷолиб аст: фарзияи “тағйир додани tokenҳои дорои энтропияи баланд бехатартар аст” дар коди барномавӣ ҳамеша дуруст нест. Дар таҳлили муқаддамотӣ дар Python муайян шудааст, ки keywords, яъне калимаҳои калидӣ, категорияи дорои баландтарин энтропияи миёнаи token мебошанд. Дар MBPP+ энтропияи миёнаи калимаҳои калидӣ 2,81 буд, дар ҳоле ки дар категорияи “etc”, ки барои филigranкунӣ ҳадаф гирифта шудааст, 1,98 мебошад. Дар HumanEval+ низ калимаҳои калидӣ бо 1,58 баландтарин категория мебошанд; категорияи “etc” 1,11 мебошад.

Ин натиҷа муҳим аст, зеро тағйир додани tokenҳои дорои энтропияи баланд, аз ҷумла def, return, True, False, if ё for, метавонад на танҳо услуби матн, балки синтаксис ё мантиқи барномаро тағйир диҳад. Азбаски усули қаблии SWEET tokenҳои дорои энтропияи баландро ҳадаф мегирифт, муҳаққиқон нишон доданд, ки қисми tokenҳои интихобшуда унсурҳои синтаксисӣ мебошанд. Барои HumanEval+ дар танзими оптималии SWEET тақрибан %12,6 tokenҳои интихобшуда tokenҳои вобаста ба синтаксис мебошанд.

STONE ба ҷои ин ҳадаф дорад панҷ синфи синтаксисӣ — keywords, whitespace, types, delimiters ва operators — ро аз ҳадафи филigran берун гузорад. Сигнали филigran дар фазои tokenҳое сохта мешавад, ки ба ин синфҳо дохил намешаванд. Ҳангоми тавлид номзадҳои token ба рӯйхатҳои сабз ва сурх ҷудо мешаванд; бо зиёд кардани қиматҳои logit-и tokenҳои рӯйхати сабз дар коди тавлидшуда намунаи аз ҷиҳати оморӣ муайяншаванда гузошта мешавад. Дар марҳилаи муайянкунӣ низ танҳо аз рӯи tokenҳои ғайрисинтаксисӣ таносуби tokenҳои сабз ва z-score ҳисоб карда мешавад.

Дар таҷрибаҳои асосии Qwen2.5-Coder-7B-и таҳқиқот STONE дар ҳамаи чор маҷмӯи арзёбӣ баландтарин холи муттаҳидаи STEM-ро дод. Қиматҳои STEM бо вазни баробар барои MBPP+ 0,848, барои HumanEval+ 0,781, барои HumanEvalPack-C++ 0,780 ва барои HumanEvalPack-Java 0,715 гузориш шудаанд.

Аз ҷиҳати дурустии функсионалӣ, қиматҳои correctness-и STONE ба ҳамин тартиб 0,571, 0,587, 0,622 ва 0,445 мебошанд. Муҳаққиқон ҳисоб кардаанд, ки ин қиматҳо нисбат ба SWEET дар чор benchmark ба ҳисоби миёна %7,57 дурустии баландтар медиҳанд. Барои MBPP+ қимати pass@1-и коди бе филigran 0,571 ва қимати STONE низ 0,571 мебошад. Дар HumanEval+ натиҷаи бе филigran 0,595, STONE бошад 0,587 аст.

Дар муваффақияти муайянкунӣ низ STONE дар чор маҷмӯи асосии додаҳо мутаносибан 0,982, 0,777, 0,729 ва 0,721 AUROC ба даст овард. Аммо усул дар меъёри ноаёнӣ дар ҳар benchmark натиҷаи баландтарин надорад. Масалан, дар MBPP+ imperceptibility барои KGW ва EWD 0,994 аст, дар ҳоле ки STONE 0,990 мебошад. Аз ин рӯ, натиҷаи қавии таҳқиқот “STONE дар ҳар меъёр беҳтарин аст” нест, балки он аст, ки байни се ҳадаф иҷрои умумии мутавозинтар пешниҳод мекунад.

Бартарии дигари STONE вақти муайянкунӣ мебошад. Гарчанде вақтҳои илова кардани филigran бо усулҳои муқоисашуда дар як сатҳанд, муҳаққиқон гузориш медиҳанд, ки муайянкунии филigran-и STONE дар сатҳи маҷмӯи додаҳо нисбат ба SWEET ва EWD ба ҳисоби миёна тақрибан %86 тезтар аст. Сабаби асосӣ дар он аст, ки муайянкунии STONE ба ҷои аз нав ҳисоб кардани энтропияи token аз механизми пешакӣ муайяншудаи рӯйхати сабз истифода мебарад.

Усул ба ҳамлаҳо комилан тобовар нест. Дар HumanEval+ қимати муайянкунии STONE ҳангоми набудани ҳамла 0,777, пас аз refactoring-и код 0,664 ва пас аз paraphrase кардани код 0,600 мешавад. Дар MBPP+ қиматҳои мувофиқ 0,982, 0,907 ва 0,824 мебошанд. Бо вуҷуди ин, дар ҳамин таҷрибаҳо STONE нисбат ба SWEET иҷрои баландтари муайянкунӣ нишон додааст.

Арзёбӣ аз нуқтаи назари Туркия: Ин таҳқиқот дар муҳити мушаххаси таҳияи нармафзор, системаи супоришҳои донишгоҳӣ ё хидмати тиҷоратии тавлиди код дар Туркия санҷида нашудааст. Бо вуҷуди ин, барои гурӯҳҳои таҳқиқотӣ ва нармафзории Туркия он метавонад аз ҷиҳати пайгирии манбаи коди тавлидшудаи зеҳни сунъӣ, занҷираи таъминоти нармафзор, тавлиди код дар таълим, сиёсати корпоративии код ва нишонагузории мундариҷаи тавлидкардаи таъминкунандагони модел баррасӣ шавад. Аммо STONE ҳамчун “детектори коди AI” ҳар порчаи кодро ба таври бозгаштӣ ва қатъӣ тасниф намекунад; филigran бояд ҳангоми тавлиди код бо усули дахлдор қасдан ҷойгир карда шуда бошад. Аз ин рӯ, истифодаи усул набояд ҳамчун далели умумиҷаҳонии криминалистӣ бо маънои “ин код ҳатман аз ҷониби зеҳни сунъӣ навишта шудааст” тафсир шавад.

Чаро масъалаи филigranкунии код аз забони табиӣ фарқ мекунад?

Дар филigranкунии забони табиӣ интихоби хурди калимаҳо аксар вақт маъно ё дурустии асосии матнро вайрон намекунад. Дар тавлиди код бошад як аломат ё token метавонад компилятсия ё иҷрои барномаро пурра тағйир диҳад.

Масалан:

  • ҳазфи аломати ду нуқта метавонад хатои синтаксиси Python эҷод кунад,
  • истифодаи - ба ҷои + метавонад ҳисоби барномаро тағйир диҳад,
  • истифодаи False ба ҷои True метавонад ҷараёни идоракуниро баръакс кунад,
  • тағйир додани қавс ё қавси мураббаъ метавонад ба хатои parsing оварда расонад.

Расми 1 дар саҳифаи 1-и таҳқиқот ин мушкилро тавассути функсияи оддии is_even визуалӣ мекунад: муҳаққиқон нишон медиҳанд, ки дар ҳоле ки равиши қаблии филigranкунӣ метавонад tokenҳои синтаксисиро тағйир дода, хатари “syntax error” эҷод кунад, STONE ҳифзи tokenҳои синтаксисиро ҳадаф мегирад.

Чаро энтропияи баланд маънои token-и бехатарро надорад?

Равиши қаблии SWEET ба ин фикр такя мекунад, ки ҷойгир кардани филigran дар нуқтаҳое, ки модели забонӣ ба интихоби token камтар итминон дорад, яъне энтропия баланд аст, сифати натиҷаро камтар вайрон мекунад.

Энтропияи token дар манбаъ бо энтропияи Shannon:

\[ H_t = -\sum_{i=1}^{|V|} P(y_t=v_i\mid y_{

таъриф карда мешавад.

Дар ин ҷо \(V\) modelin kelime dağarcığını, \(y_{

Таҳлили муқаддамотии муҳаққиқон бо Qwen2.5-Coder-7B нишон дод, ки дар Python баъзе категорияҳои аз ҷиҳати синтаксисӣ муҳим ҳамзамон метавонанд энтропияи баланд дошта бошанд.

Категорияи tokenЭнтропияи миёнаи MBPP+Энтропияи миёнаи HumanEval+
Keywords2,811,58
Etc1,981,11
Types1,831,09
Delimiters1,060,78
Whitespace0,930,46
Operators0,930,63

Аз ин рӯ, агар танҳо меъёри “token-и дорои энтропияи баланд” истифода шавад, token-и барои сохтори барнома муҳим низ метавонад ҳадафи филigran гардад.

STONE кадом tokenҳоро синтаксисӣ мешуморад?

STONE барои се забони барномасозӣ панҷ синфи асосии синтаксисиро муайян мекунад:

  • Keywords: калимаҳои калидии захирашудаи забон,
  • Whitespace: фосила, охири сатр ва tab,
  • Types: нишондиҳандаҳои асосии навъ,
  • Delimiters: қавс, ҷудокунанда, аломатҳои пунктуатсионӣ ва дигар аломатҳои сохторӣ,
  • Operators: операторҳои арифметикӣ, мантиқӣ, муқоиса ва таъйин.

Tokenҳое, ки ба ин панҷ гурӯҳ дохил намешаванд, дар таҳқиқот ҳамчун категорияи “etc” арзёбӣ мешаванд ва фазои асосии ҳадафии филigran-и STONE-ро ташкил медиҳанд.

STONE филigranро чӣ гуна илова мекунад?

Дар қадами \(t\)-и тавлид модели забонӣ аввал вектори стандартии logit-ро ҳисоб мекунад:

\[ l_t=f_{LM}(x,y_{

ва аз ин қиматҳо тақсимоти ибтидоии эҳтимолият ба даст меояд:

\[ p_{t,i} = \frac{e^{l_t[i]}} {\sum_{j=1}^{|V|}e^{l_t[j]}} \]

STONE аввал аз ин тақсимот token-и номзадро намуна мегирад. Агар номзад ба маҷмӯи синтаксис дохил набошад, қимати hash-и token-и қаблӣ ҳамчун seed истифода шуда, луғат ба рӯйхатҳои сабзи \(G_t\) ва сурхи \(R_t\) ҷудо мешавад.

Ба logit-ҳои tokenҳои рӯйхати сабз қимати доимии \(\delta\) илова мешавад:

\[ l_t[i]\leftarrow l_t[i]+\delta, \qquad i\in G_t \]

Ин тағйир эҳтимоли тавлиди tokenҳои сабзро зиёд мекунад. Сипас token-и ниҳоӣ аз тақсимоти ислоҳшуда намуна гирифта мешавад.

Verianla Live: Занҷираи ҷойгиркунии филigran-и STONE

Ин раванд хулосаи содакардашудаи илмии мантиқи тавлид ва муайянкунист, ки таҳқиқот дар Алгоритми 1 ва Алгоритми 2 тавсиф мекунад.

МарҳилаАмалҲадаф
1. Тавлиди стандартӣМодели забонӣ мувофиқи контексти ҷорӣ logit ва эҳтимолиятҳои tokenро ҳисоб мекунад.Ба даст овардани тақсимоти муқаррарии тавлиди код.
2. Санҷиши синтаксисToken-и номзади намунашуда бо syntax element set муқоиса мешавад.Пешгирии дахолати филigran дар минтақаҳои аз ҷиҳати синтаксисӣ муҳим.
3. Рӯйхати сабз/сурхБо истифода аз қимати hash-и token-и қаблӣ луғат ба рӯйхатҳои сабз ва сурх ҷудо мешавад.Эҷоди намунаи пинҳонии филigran, ки такроршаванда аст.
4. Ҷобаҷогузории logitБа logit-ҳои tokenҳои рӯйхати сабз δ илова мешавад.Баланд бардоштани эҳтимоли тавлиди tokenҳои сабз.
5. Тавлиди кодToken-и ниҳоӣ аз тақсимоти ислоҳшуда намуна гирифта мешавад.Интиқоли сигнали филigran ба тавлиди код.
6. Муайянкунии филigranШумораи tokenҳои сабз ва z-score дар байни tokenҳои ғайрисинтаксисӣ ҳисоб карда мешавад.Ҷустуҷӯи далели оморӣ барои филigran-и STONE дар код.
 

Verianla Live: Визуализатсия аз ҷадвали намоёни раванди илмии боло сохта мешавад. Ҷадвал ҳамчун source-of-truth-и илмӣ ҳифз мешавад.

Z-score-и муайянкунӣ чӣ гуна ҳисоб мешавад?

STONE ҳангоми муайянкунӣ танҳо tokenҳои ғайрисинтаксисии ҳамчун “etc” қабулшударо мешуморад. Шумораи умумии онҳо \(N^E\) ва шумораи tokenҳои дар рӯйхати сабз буда \(N_G^E\) муайян карда мешавад.

Z-score:

\[ z= \frac{ N_G^E-\gamma N^E }{ \sqrt{\gamma(1-\gamma)N^E} } \]

аст.

Агар қимати ҳисобшуда аз ҳадди пешакӣ муайяншудаи \(z_{threshold}\) боло равад, пайдарпаӣ ҳамчун филigranшуда тасниф мешавад.

Ин механизм танҳо дар кодҳое кор мекунад, ки қоидаи рӯйхатсозии истифодашуда барои сохтани филigran маълум ё бозтавлидшаванда бошад. Он усули умумии “шинохтани коди LLM” нест.

Чаро STEM таҳия шуд?

Муҳаққиқон баҳс мекунанд, ки таҳқиқоти мавҷудаи филigranкунии код ба меъёрҳои гуногун тамаркуз мекунанд ва ин муқоисаи мутавозини усулҳоро душвор месозад. Як система метавонад филigranро хеле осон муайяншаванда кунад, аммо барномаҳои хатодор бисёр тавлид кунад; системаи дигар метавонад кодро ҳифз кунад, аммо сигнали филigran хеле заиф бошад.

Метрикаи STEM, ки ҳамроҳ бо STONE пешниҳод шудааст, се андозаро дар як холи вазндор муттаҳид мекунад:

\[ STEM= \alpha\cdot Correctness+ \beta\cdot Detectability+ \zeta\cdot Imperceptibility \]

ва:

\[ \alpha+\beta+\zeta=1 \]

шарт истифода мешавад.

Correctness чӣ гуна чен мешавад?

Барои дурустии функсионалӣ меъёри pass@k, ки дар таҳқиқоти тавлиди код истифода мешавад, татбиқ мегардад. Ин меъёр эҳтимоли онеро тахмин мекунад, ки аз \(k\) ҳалли тавлидшуда ҳадди ақал яке ҳамаи тестҳоро мегузарад.

Сутунҳои correctness, ки дар таҷрибаҳои асосӣ гузориш шудаанд, арзёбии бар асоси pass@1-ро ифода мекунанд.

Detectability чӣ гуна чен мешавад?

То чӣ андоза z-score-и аз таносуби tokenҳои сабз гирифташуда метавонад дар ҳаддҳои гуногун коди навиштаи инсон ва коди филigranшударо ҷудо кунад, тавассути каҷхати ROC арзёбӣ шуда, натиҷа бо AUROC гузориш шудааст.

Ҳар қадар AUROC баланд бошад, ҷудо кардани ду гурӯҳи код бо омори филigran осонтар мешавад.

Imperceptibility чиро чен мекунад?

Муҳаққиқон тавассути perplexity арзёбӣ мекунанд, ки филigran тақсимоти табиии эҳтимолияти tokenҳои кодро то чӣ андоза тағйир медиҳад.

Imperceptibility:

\[ 1- \frac{ |PPL(C_{wm})-PPL(C)| }{ PPL(C) } \]

таъриф шудааст.

Дар ин ҷо \(C_{wm}\) коди филigranшуда ва \(C\) маҷмӯи коди бе филigran мебошад. Ҳар қадар хол ба 1 наздик шавад, чунин қабул мешавад, ки филigran тағйироти нисбии хурдтар дар тақсимоти token ба вуҷуд овардааст. Ҳангоми тағйироти хеле бузурги тақсимот метрика метавонад қимати манфӣ низ гирад; дар таҷрибаи такрории CodeIP-и таҳқиқот намунаҳои ин мавҷуданд.

Кадом маҷмӯи додаҳо истифода шуданд?

Маҷмӯи додаҳоЗабонШумораи масъалаҳоДарозии миёнаи ҳал (token)
MBPP+Python39940,25
HumanEval+Python164188,28
HumanEvalPack-C++C++164223,10
HumanEvalPack-JavaJava164237,36

Бо кадом усулҳо муқоиса шуд?

Дар муқоисаи асосӣ се усули training-free истифода шуданд:

  • KGW: равиши асосӣ, ки дар ҳар қадами тавлид луғатро ба рӯйхатҳои сабз ва сурх ҷудо карда, tokenҳои сабзро бартарӣ медиҳад,
  • EWD: усуле, ки ҳангоми муайянкунӣ энтропияи tokenро вазн медиҳад,
  • SWEET: усули филigranкунии код, ки ҳадаф дорад филigranро танҳо ба tokenҳои дорои энтропияи баланд ҷойгир кунад.

CodeIP ба гурӯҳи асосии baseline дохил карда нашудааст, зеро он омӯзиши модели иловагии type-prediction-ро талаб мекунад, дар ҳоле ки STONE ва муқоисаҳои асосӣ training-free мебошанд. Муҳаққиқон CodeIP-ро алоҳида дар Замимаи A бозтатбиқ намуда, натиҷаҳояшро гузориш кардаанд.

Модели асосӣ ва танзимоти тавлид кадоманд?

Дар таҷрибаҳои асосӣ Qwen2.5-Coder-7B истифода шудааст. Дар Замимаи B бо Llama-3.1-8B низ таҷриба гузаронида шудааст.

Танзимоти асосии тавлид:

  • top-k = 50,
  • temperature = 1,0,
  • \(\gamma=0,5\),
  • барои MBPP+ \(\delta=1,0\),
  • барои HumanEval+, C++ ва Java \(\delta=0,5\).

Дар арзёбии imperceptibility барои ҳисоб кардани perplexity StarCoder2-7B истифода шудааст. Гуфта мешавад, ки таҷрибаҳо дар GPU-и NVIDIA A6000 гузаронида шудаанд.

Натиҷаҳои асосии STONE кадоманд?

Verianla Live: Холҳои STEM бо вазни баробар

STEM дар ин ҷо бо додани вазни 1/3 ба ҳар яке аз ҷузъҳои correctness, detectability ва imperceptibility ҳисоб шудааст. Қимати баландтар иҷрои умумии мутавозинтарро ифода мекунад.

Маҷмӯи додаҳоKGWEWDSWEETSTONE
MBPP+0,7750,8190,7870,848
HumanEval+0,6940,7630,7540,781
HumanEvalPack-C++0,7300,7500,7350,780
HumanEvalPack-Java0,6420,6750,6310,715
 

Натиҷаи асосӣ: Дар таҷрибаҳои асосии Qwen2.5-Coder-7B STONE дар ҳамаи чор benchmark баландтарин холи STEM бо вазни баробарро додааст.

Verianla Live: Визуализатсия аз ҷадвали намоёни додаҳои илмии боло сохта мешавад. Ҷадвал ҳамчун source-of-truth-и илмӣ ҳифз мешавад.

Натиҷаҳои дурустӣ ба танҳоӣ чӣ гунаанд?

УсулMBPP+HumanEval+C++Java
KGW0,4990,5730,5760,387
EWD0,4990,5730,5760,387
SWEET0,5020,5740,5840,413
STONE0,5710,5870,6220,445

STONE дар ҳамаи чор benchmark-и асосӣ баландтарин қимати correctness-ро ба даст овардааст. Муҳаққиқон фарқи нисбии миёнаро нисбат ба SWEET %7,57 гузориш мекунанд.

Дар муқоиса бо коди бе филigran чӣ мешавад?

Дар Замимаи F таҷрибаҳои коди бе филigran низ дода шудаанд:

УсулMBPP+ pass@1HumanEval+ pass@1
Бе филigran0,5710,595
STONE0,5710,587
SWEET0,5020,574
KGW0,4990,573
EWD0,4990,573

Дар MBPP+ қимати pass@1-и тавлиди STONE-филigranшуда ва бе филigran яксон аст. Дар HumanEval+ бошад коҳиши хурд аз 0,595 ба 0,587 дида мешавад. Аз ин рӯ, гуфтани “STONE ҳеҷ гоҳ дурустро кам намекунад” аз натиҷаҳои манбаъ берун меравад; ибораи дурусттар ин аст, ки дар тестҳои баррасишуда талафи дурустӣ нисбат ба дигар усулҳои филigran камтар буд.

Муваффақияти муайянкунӣ чӣ гуна аст?

УсулMBPP+ AUROCHumanEval+ AUROCC++ AUROCJava AUROC
KGW0,8310,5230,6210,546
EWD0,9650,7300,6810,646
SWEET0,8670,7100,6410,580
STONE0,9820,7770,7290,721

Дар таҷрибаи асосии Qwen2.5-Coder-7B STONE дар ҳамаи чор маҷмӯи додаҳо баландтарин қимати detectability-ро медиҳад.

Дар ноаёнӣ ҳам беҳтарин аст?

Не. Натиҷаҳои imperceptibility:

УсулMBPP+HumanEval+C++Java
KGW0,9940,9860,9930,993
EWD0,9940,9860,9930,993
SWEET0,9920,9780,9790,901
STONE0,9900,9780,9900,979

KGW ва EWD дар ин меъёр қиматҳои каме баландтар доранд. Бартарии иддаошудаи STONE дар ноаёнӣ мутлақ будани ҷои аввал нест; балки дар он аст, ки imperceptibility-ро дар сатҳи баланд нигоҳ дошта, correctness ва detectability-ро ҳамзамон қавӣ мекунад.

Оё натиҷа дар 66 вазни гуногуни STEM тағйир меёбад?

Муҳаққиқон қиматҳои \(\alpha\), \(\beta\) ва \(\zeta\)-ро дар диапазони 0,0–1,0 бо қадами 0,1 тағйир дода, 66 комбинатсияи гуногуни вазн-ро, ки ҷамъашон 1 аст, арзёбӣ карданд.

Фоизи комбинатсияҳое, ки STONE дар онҳо баландтарин холи STEM гирифт:

  • MBPP+: %97,0,
  • HumanEval+: %90,9,
  • HumanEvalPack-C++: %98,5,
  • HumanEvalPack-Java: %95,5.

Ин таҳлил нишон медиҳад, ки натиҷаҳои асосӣ танҳо маҳсули интихоби вазни баробар нестанд. Аммо ин маънои онро надорад, ки ҳамаи комбинатсияҳои пайвастаи вазн, ки ҳар корбар интихоб карда метавонад, санҷида шудаанд; таҳқиқот 66 комбинатсияи зикршударо бо фосилаи 0,1 арзёбӣ кардааст.

STONE чӣ қадар тез аст?

Вақтҳои умумии муайянкунӣ дар сатҳи маҷмӯи додаҳо:

УсулMBPP+ (с)HumanEval+ (с)C++ (с)Java (с)
KGW12,904,198,018,95
EWD100,4334,5156,8559,84
SWEET100,9434,6858,0859,22
STONE13,274,628,489,24

Вақти муайянкунии STONE ба KGW хеле наздик, аммо аз EWD ва SWEET ба таври назаррас камтар аст. Муҳаққиқон мегӯянд, ки сабаб дар он аст, ки EWD ва SWEET ҳангоми муайянкунӣ тақсимоти эҳтимолияти token/энтропияро ҳисоб мекунанд, дар ҳоле ки STONE бо санҷиши рӯйхати сабз кор мекунад.

Вақтҳои илова кардани филigran бошад дар ҳамаи усулҳо дар як дараҷаанд; бартарии бузурги суръати STONE махсусан дар марҳилаи муайянкунӣ аст.

То чӣ андоза ба ҳамлаи refactoring тобовар аст?

Дар HumanEval+:

ШароитSWEETSTONE
Ҳамла нест0,7100,777
Code refactoring0,5390,664
Code paraphrasing0,5630,600

Дар MBPP+:

ШароитSWEETSTONE
Ҳамла нест0,6790,982
Code refactoring0,3590,907
Code paraphrasing0,3850,824

STONE дар ҳар ду навъи ҳамла нисбат ба SWEET-и муқоисашуда иҷрои баландтари муайянкунӣ нишон медиҳад. Аммо коҳиш ёфтани қиматҳо нисбат ба ҳолати бе ҳамла равшан нишон медиҳад, ки филigran метавонад аз тағйирот таъсир гирад.

Чаро paraphrasing ба STONE таъсир мерасонад?

Муҳаққиқон мегӯянд, ки refactoring бисёр ҳудудҳои синтаксисиро нигоҳ медорад ва аз ин рӯ қисми муҳими филigran дар фазои tokenҳои non-syntax метавонад боқӣ монад.

Paraphrasing бошад метавонад минтақаҳои берун аз синтаксис, аз ҷумла номи тағйирёбандаҳо ва ифодаҳоро тағйир диҳад. Азбаски онҳо бевосита бо ҳадафҳои филigran-и STONE ҳампӯш мешаванд, сигнали муайянкунӣ метавонад кам шавад.

Оё STONE бар зидди ҳамлагаре, ки алгоритмро медонад, санҷида шуд?

Не. Ин дар бахши маҳдудиятҳои худи таҳқиқот ошкоро зикр шудааст.

Ҳамлагаре, ки алгоритми STONE-ро медонад, метавонад махсусан tokenҳои ғайрисинтаксисиро ҳадаф гирифта:

  • ҳамаи тағйирёбандаҳоро ба таври низомманд аз нав номгузорӣ кунад,
  • шарҳҳоро ҳазф кунад,
  • табдилдиҳиҳои ҳадафнокеро истифода барад, ки зичии филigran-и STONE-ро коҳиш медиҳанд.

Муҳаққиқон муҳофизатҳои нав бар зидди чунин ҳамлаҳои algorithm-aware-ро ҳамчун самти кори оянда муайян мекунанд.

Чаро code golf ва коди obfuscated метавонад мушкил бошад?

Миқдори филigran, ки STONE метавонад интиқол диҳад, ба зичии tokenҳои ғайрисинтаксисӣ вобаста аст. Дар кодҳои оддии benchmark шумораи кофии tokenҳои ҳадаф мавҷуд аст.

Аммо дар ҳалли хеле кӯтоҳ ва фишурдашудаи “code golf” ё дар коди қасдан obfuscateшуда шумораи ин tokenҳо метавонад кам шавад. Дар чунин ҳолатҳо филigran метавонад хеле тунук шуда, барои муайянкунии боэътимод кофӣ набошад.

Оё натиҷаҳои Llama-3.1-8B ҳамин тамоюлро нишон медиҳанд?

Дар таҷрибаҳои иловагӣ Llama-3.1-8B дар MBPP+ ва HumanEval+ истифода шуд. STONE боз ҳам дар STEM бо вазни баробар баландтарин холҳоро тавлид кард:

  • MBPP+: STONE 0,782,
  • HumanEval+: STONE 0,699.

Бо вуҷуди ин, дар қимати detectability-и HumanEval+ EWD бо 0,755 аз қимати 0,741-и STONE каме баландтар аст. Бо ин вуҷуд, STONE ба шарофати correctness-и баландтар дар холи муттаҳидаи STEM пешсаф мемонад.

Ин натиҷа низ дастгирӣ мекунад, ки даъвои усул “дар ҳар модел ҳар submetrikаро бурдан” нест, балки нигоҳ доштани мувозинати умумӣ мебошад.

Натиҷаҳое, ки таҳқиқот дастгирӣ мекунад

  • Энтропияи баланди token дар коди барнома маънои тағйироти аз ҷиҳати синтаксисӣ бехатарро надорад.
  • Дар таҳлили муқаддамотии Python категорияи keywords дар ду benchmark-и баррасишуда баландтарин энтропияи миёнаро дорад.
  • Дар танзими оптималии HumanEval+ барои SWEET тақрибан %12,6 tokenҳои интихобшуда syntax token мебошанд.
  • STONE равиши тавлид ва муайянкуниеро пешниҳод мекунад, ки tokenҳои синтаксисиро аз ҳадафи филigran ҷудо мекунад.
  • Дар таҷрибаи асосии Qwen2.5-Coder-7B STONE дар чор benchmark баландтарин correctness, detectability ва STEM бо вазни баробарро додааст.
  • Қимати imperceptibility-и STONE баланд мондааст, аммо қимати мутлақ беҳтарини ин submetrika ҳамеша ба STONE тааллуқ надорад.
  • STONE нисбат ба SWEET ба ҳисоби миёна %7,57 correctness-и баландтар додааст.
  • Муайянкунии STONE нисбат ба муайянкунии entropy-асоси EWD ва SWEET ба ҳисоби миёна тақрибан %86 тезтар гузориш шудааст.
  • Дар аксарияти бузурги 66 вазнгузории STEM STONE дар ҷои аввал мондааст.
  • Гарчанде detectability пас аз ҳамлаҳои refactoring ва paraphrasing коҳиш меёбад, дар таҷрибаҳои баррасишуда STONE аз SWEET тобовартар мондааст.

Натиҷаҳое, ки таҳқиқот дастгирӣ намекунад ё ҳанӯз нишон надодааст

  • STONE детектори умумие нест, ки бе филigran муайян кунад ҳар коди номаълум аз ҷониби LLM навишта шудааст.
  • Нишон дода нашудааст, ки филigran ба ҳамаи табдилдиҳиҳои код муқобилат карда, ҳазфнашаванда аст.
  • Тобоварӣ ба ҳамлагарони ҳадафнок, ки алгоритми STONE-ро медонанд, ба таври таҷрибавӣ нишон дода нашудааст.
  • Дар коди obfuscated ё code-golf муайянкунии боэътимод кафолат дода намешавад.
  • Ҳамаи забонҳои барномасозӣ арзёбӣ нашудаанд; таҷрибаҳои асосӣ бо Python, C++ ва Java маҳдуданд.
  • Дар анборҳои воқеии корпоративии нармафзор ё коди истеҳсолии миллионҳо сатр арзёбии саҳроӣ анҷом дода нашудааст.
  • STONE дар ҳамаи submetrika-ҳо ҳамеша натиҷаи баландтаринро намедиҳад.
  • Муайян шудани коди филigranшуда худ аз худ далели шахсияти муаллиф, нияти бад, вайронкунии академӣ ё масъулияти ҳуқуқӣ нест.

Усул ва Натиҷаҳои Таҳқиқот

Саволҳои таҳқиқот

Таҳқиқот ба се саволи асосӣ тамаркуз мекунад:

  1. Оё STONE метавонад дурустии функсионалиро ҳифз кунад?
  2. Оё он метавонад байни correctness, detectability ва imperceptibility иҷрои мутавозине таъмин кунад, ки бо STEM чен мешавад?
  3. Хароҷоти ҳисоббарорӣ аз ҷиҳати ҷойгиркунӣ ва муайянкунии филigran чӣ қадар аст?

Ҳамаи натиҷаҳои асосии Qwen2.5-Coder-7B

DatasetУсулCorrectnessDetectabilityImperceptibilitySTEM
MBPP+KGW0,4990,8310,9940,775
MBPP+EWD0,4990,9650,9940,819
MBPP+SWEET0,5020,8670,9920,787
MBPP+STONE0,5710,9820,9900,848
HumanEval+KGW0,5730,5230,9860,694
HumanEval+EWD0,5730,7300,9860,763
HumanEval+SWEET0,5740,7100,9780,754
HumanEval+STONE0,5870,7770,9780,781
HEP-C++KGW0,5760,6210,9930,730
HEP-C++EWD0,5760,6810,9930,750
HEP-C++SWEET0,5840,6410,9790,735
HEP-C++STONE0,6220,7290,9900,780
HEP-JavaKGW0,3870,5460,9930,642
HEP-JavaEWD0,3870,6460,9930,675
HEP-JavaSWEET0,4130,5800,9010,631
HEP-JavaSTONE0,4450,7210,9790,715

Вақти коркард

DatasetУсулInsertion (с)Detection (с)
MBPP+KGW332012,90
MBPP+EWD3320100,43
MBPP+SWEET3300100,94
MBPP+STONE326613,27
HumanEval+KGW12684,19
HumanEval+EWD126834,51
HumanEval+SWEET127034,68
HumanEval+STONE12774,62
HEP-C++KGW13088,01
HEP-C++EWD130856,85
HEP-C++SWEET145458,08
HEP-C++STONE13008,48
HEP-JavaKGW15068,95
HEP-JavaEWD150659,84
HEP-JavaSWEET148059,22
HEP-JavaSTONE14599,24

Фарогирии syntax-token-и SWEET

Дар Замимаи E омӯхта шудааст, ки бо тағйир ёфтани entropy threshold SWEET чанд token интихоб мекунад ва чӣ қадар аз интихобшудаҳо syntax token мебошанд.

Барои HumanEval+ ҳангоми оптималӣ будани entropy threshold дар 0,9:

  • %28,98 ҳамаи tokenҳои тавлидшуда интихоб шудаанд,
  • %12,60 интихобшудаҳо syntax token мебошанд.

Тақсимоти дар манбаъ додашуда дар дохили ин syntax tokenҳо:

  • delimiters: %49,29,
  • whitespace: %38,17,
  • keywords: %9,44,
  • types: %3,17,
  • operators: %2,78.

Ин фоизҳо ҳамон тавре, ки дар манбаъ барои зеркатегорияҳо гузориш шудаанд, оварда шудаанд; аз сабаби гирдкунӣ ва шакли гузориши категорияҳо интизор нест, ки ҷамъашон дақиқ %100 шавад.

Натиҷаи муқоисаи иловагии CodeIP

Муҳаққиқон CodeIP-ро азбаски training талаб мекунад ба гурӯҳи асосии baseline дохил накардаанд, аммо дар Замимаи A татбиқи расмии онро аз нав иҷро кардаанд.

Қиматҳои detectability-и CodeIP дар диапазони 0,945–0,994 баланд мондаанд, дар ҳоле ки натиҷаҳои correctness барои MBPP+ 0,093, барои HumanEval+ 0,018, барои C++ 0,000 ва барои Java 0,073 будаанд.

Ин таҷриба барои нишон додани он истифода шудааст, ки танҳо муваффақияти баланди муайянкунӣ барои усули мутавозини филigranкунии код кофӣ нест. Бо вуҷуди ин, ин натиҷаҳо ба муҳити бозтавлиди худи муаллифон тааллуқ доранд ва набояд ҳамчун ҳукми умумӣ барои ҳамаи танзимоти эҳтимолӣ ё версияҳои минбаъдаи CodeIP тафсир шаванд.

Маҳдудиятҳои асосии усул

  • Иқтидори филigran ба зичии tokenҳои ғайрисинтаксисӣ вобаста аст.
  • Дар коди code-golf ё obfuscated сигнали кофии филigran метавонад ба вуҷуд наояд.
  • Бар зидди азнавномгузории ҳадафноки token аз ҷониби ҳамлагаре, ки алгоритмро медонад, ҳифзи фарогир нишон дода нашудааст.
  • Таҷрибаҳои robustlik бо ду навъи умумии ҳамла маҳдуданд.
  • Арзёбии асосӣ бо се забони барномасозӣ ва чор benchmark маҳдуд аст.
  • Модели асосӣ Qwen2.5-Coder-7B мебошад; таҳлили модели дуюм танҳо дар бахши иловагӣ дар ду benchmark-и Python гузаронида шудааст.
  • Дар лоиҳаҳои воқеии бузургҳаҷми нармафзор пойдории дарозмуддати филigran зери таҳрирҳои таҳиягари инсонӣ санҷида нашудааст.

Ҷузъиёте, ки дар шарҳи алгоритм бояд ба он диққат дод

Баёни таҳқиқот STONE-ро ҳамчун усуле тавсиф мекунад, ки “филigranро танҳо ба non-syntax tokenҳо ҷойгир мекунад”. Аммо дар псевдокоди чопшудаи Алгоритми 1 фаъол ё ғайрифаъол шудани раванди филigran аз он вобаста муайян мешавад, ки candidate token-и аввал намунашуда дар маҷмӯи syntax ҳаст ё не, сипас token-и ниҳоӣ аз тақсимоти ислоҳшуда дубора намуна гирифта мешавад.

Псевдокод дар ин намунагирии дуюм сатри мустақилеро нишон намедиҳад, ки интихоби token-и ниҳоиро аз маҷмӯи syntax алоҳида манъ кунад. Манбаъ ҳам дар матн шарҳ намедиҳад, ки ин дар коди татбиқ чӣ гуна ҳал шудааст. Аз ин рӯ, дар ин ҷо таърифи муаллифон “syntax-aware/non-syntax targeting” ҳифз шудааст; аз ҷузъиёти псевдокод алгоритми дигар тахмин карда нашудааст.

Ёддошт оид ба Манбаъ ва Усул

Номи пурраи аслии таҳқиқот: Marking Code Without Breaking It: Code Watermarking for Detecting LLM-Generated Code

Муаллифон ва тартиби аслӣ: Jungin Kim; Shinwoo Park; Yo-Sub Han.

Саҳми баробар: Jungin Kim ва Shinwoo Park дар манбаъ ҳамчун муаллифони дорои саҳми баробар нишон дода шудаанд.

Муаллифи масъул: Yo-Sub Han.

Муассиса: Yonsei University, Seoul, Republic of Korea.

Навъи манбаъ ва рецензия: Нашри конференсионии аз рецензия гузашта; Findings of the Association for Computational Linguistics: EACL 2026.

Нашр: Findings of the Association for Computational Linguistics: EACL 2026.

Ношир: Association for Computational Linguistics.

Саҳифаҳо: 3990–4002.

Конференсия: 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco, 24–29 March 2026.

Шиносаи ACL Anthology: 2026.findings-eacl.207

DOI: 10.18653/v1/2026.findings-eacl.207

Пайванди расмии нашр: https://aclanthology.org/2026.findings-eacl.207/

Пайванди DOI: https://doi.org/10.18653/v1/2026.findings-eacl.207

Иҷозатнома: Иҷозатномаи Creative Commons Attribution 4.0 International (CC BY 4.0), ки ACL Anthology барои маводи ACL-и соли 2016 ва баъд аз он нашршуда татбиқ мекунад.

Маблағгузорӣ: Таҳқиқот дастгирии NRF grant RS-2025-00562134 ва AI Graduate School Program RS-2020-II201361-ро, ки аз ҷониби ҳукумати Корея маблағгузорӣ шудааст, гузориш мекунад.

Коди татбиқ: Таҳқиқоти манбаъ нишон медиҳад, ки татбиқи STONE дар https://github.com/inistory/STONE-watermarking дастрас аст.

Модели асосӣ: Qwen2.5-Coder-7B.

Модели иловагӣ: Llama-3.1-8B.

Модели арзёбии perplexity: StarCoder2-7B.

Забонҳои барномасозӣ: Python, C++ ва Java.

Benchmark-ҳо: MBPP+, HumanEval+, HumanEvalPack-C++ ва HumanEvalPack-Java.

Муқоисаҳои асосӣ: KGW, EWD ва SWEET. CodeIP азбаски training талаб мекунад ба гурӯҳи асосии training-free baseline дохил карда нашуда, дар Замимаи A алоҳида бозарзёбӣ шудааст.

Меъёрҳои асосии арзёбӣ: pass@k барои correctness; AUROC бар асоси z-score барои detectability; тағйири perplexity барои imperceptibility; STEM барои арзёбии муттаҳид.

Зерсохтори ҳисоббарорӣ: NVIDIA A6000 GPU.

Таҳлили robustlik: Дар HumanEval+ ва MBPP+ ҳамлаҳои code refactoring ва code paraphrasing бо GPT-4o татбиқ шудаанд.

Ҳадди асосии методологӣ: STONE механизми provenance мебошад, ки танҳо дар натиҷаҳое истифода мешавад, ки филigran ҳангоми тавлид қасдан ҷойгир карда шудааст. Он детектори умумие нест, ки ҳар коди бе филigran, аз ҷониби таъминкунандаи дигар тавлидшуда ё навиштаи инсонро танҳо аз рӯи услубаш боэътимод ҳамчун “LLM-generated” муайян кунад.

Ҳадди ҳамла: Пас аз refactoring ва paraphrasing қимати detectability-и STONE коҳиш меёбад. Тобоварии фарогир ба ҳамлагароне, ки алгоритмро медонанд ва махсусан tokenҳои non-syntax-ро ҳадаф мегиранд, нишон дода нашудааст.

Ҳадди умумисозӣ: Натиҷаҳо ба вазифаҳои тавлиди код дар асоси benchmark такя мекунанд. Барои анборҳои бузурги воқеӣ, таҳрирҳои дарозмуддати инсонӣ, забонҳои гуногуни барномасозӣ ва оилаҳои васеи модел ҳамон нишондиҳандаҳо кафолат дода намешаванд.

Ҳадди муқоиса: STONE дар ҳамаи submetrika-ҳои алоҳида мутлақ беҳтарин нест. Махсусан аз ҷиҳати imperceptibility, KGW ва EWD дар баъзе таҷрибаҳои асосӣ холҳои баландтар додаанд. Натиҷаи асосии таҳқиқот ин аст, ки STONE ҳангоми якҷо арзёбӣ кардани correctness, detectability ва imperceptibility натиҷаҳои баланд ва устувори STEM тавлид мекунад.

Ёддошти алгоритм дар дохили манбаъ: Дар псевдокоди Алгоритми 1 фаъолсозии филigran вобаста ба он муайян мешавад, ки candidate token дар маҷмӯи syntax ҳаст ё не, token-и ниҳоӣ бошад баъд аз тақсимоти ислоҳшуда дубора намуна гирифта мешавад. Гарчанде матн усулро non-syntax-only watermarking тавсиф мекунад, псевдокод барои token-и ниҳоӣ қадами дуюми syntax-blocking-ро ошкоро нишон намедиҳад. Азбаски ин нуқта дар манбаъ алоҳида мувофиқ карда нашудааст, дар шарҳи Verianla ислоҳи тахминӣ анҷом дода нашудааст.

Доираи мазмуни илмӣ: Алгоритмҳо, формулаҳо, қиматҳои benchmark, натиҷаҳои ҳамла, вақтҳои коркард, муқоисаҳои STEM ва маҳдудиятҳо дар ин шарҳи Verianla ба таҳқиқоти манбаъ асос ёфтаанд. Манбаи беруна танҳо барои тасдиқи шиносаи расмии библиографӣ, ҳолати нашри EACL/ACL ва маълумоти иҷозатнома истифода шудааст.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо