Тадқиқоти академӣ, забони фаҳмо

Verianla | Тадқиқоти академӣ ва илм ба забони тоҷикӣ

27 сентябр 2026, якшанбе
VERİANLAНашри мустақили илмӣ
Кушодан ё бастани меню
...
Саҳифаи асосӣ / Илмҳои гуманитарӣ / Забоншиносӣ / Оё зеҳни сунъӣ метавонад мақолаҳои илмиро баррасӣ кунад? Мушкил танҳо ёфтани хато нест, балки фаҳмидани вазни он аст
Забоншиносӣ

Оё зеҳни сунъӣ метавонад мақолаҳои илмиро баррасӣ кунад? Мушкил танҳо ёфтани хато нест, балки фаҳмидани вазни он аст

Моделҳои бузурги забонӣ масъалаҳои методологӣ, гузоришдиҳии нопурра ва номувофиқати эҳтимолиро дар мақолаҳои илмӣ торафт беҳтар муайян мекунанд. Аммо нуктаи калидии таҳқиқот ин аст: агар низоми AI шумораи зиёди мушкилотро номбар кунад, вале натавонад бигӯяд кадомаш воқеан муҳим аст, ба ҷойи кумак ба муҳаррир ё довар танҳо бори нави хондан эҷод мекунад.

06/06/2026  Veri Anla 48 боздид
Оё зеҳни сунъӣ метавонад мақолаҳои илмиро баррасӣ кунад? Мушкил танҳо ёфтани хато нест, балки фаҳмидани вазни он аст

Моделҳои бузурги забонӣ масъалаҳои методологӣ, гузоришдиҳии нопурра ва номувофиқати эҳтимолиро дар мақолаҳои илмӣ торафт беҳтар муайян мекунанд. Аммо нуктаи муҳиме, ки ин таҳқиқот таъкид мекунад, чунин аст: агар низоми зеҳни сунъӣ шумораи зиёди мушкилотро номбар кунад, вале натавонад бигӯяд кадоме воқеан муҳим аст, он ба ҷойи кумак ба муҳаррир ё довар танҳо бори нави хондан ба вуҷуд меорад.

Мафҳуми марказии таҳқиқот “severity calibration”, яъне калибркунии шиддат аст. Мушкил дар ин ҷо фарқ кардани он аст, ки оё хато то ҳадде ҷиддӣ аст, ки натиҷаи асосии мақоларо беэътибор кунад, ё танҳо як маҳдудияти маъмулӣ мебошад. Барои арзёбии илмӣ ин тафовут аҳамияти ҳаётӣ дорад, зеро ҳар нуқсон вазни яксон надорад.

Муаллиф барои ин масъала усули adversarial бо номи “steelman exchange”-ро пешниҳод мекунад. Ду модели ҷудогона аввал мақоларо арзёбӣ карда, ба мушкилот тамғаи шиддат медиҳанд. Сипас ҳар модел бар зидди арзёбии аввалини худ қавитарин далели муқобилро месозад: “Оё ин мушкил воқеан ҳамин қадар ҷиддӣ аст ё мо онро аз ҳад калон нишон додем?” Дар марҳилаи охир як модели arbiter тамоми маводро мебинад ва қарори эҳтиёткортари шиддат қабул мекунад.

Натиҷаи асосӣ чунин аст: якҷо кардани оддии чанд модел метавонад мушкилоти бештар пайдо кунад, аммо калибркунии шиддатро худкор беҳтар намекунад. Баръакс, моделҳое, ки маҷбур мешаванд бар зидди иддаои худ эътирози қавӣ эҷод кунанд, махсусан дар таснифи хатогиҳои дараҷаи “retraction-worthy” эҳтиёткортар ва муфидтар натиҷа медиҳанд.

Мушкил дар чист?

Дар баррасии мақолаҳои илмӣ, истифодаи зеҳни сунъӣ дар назари аввал ваъдаи ҷолиб дорад: он метавонад мақоларо зуд бихонад, мушкилоти методологиро номбар кунад, номувофиқати омориро ишора кунад ва ба доварон кумак расонад. Аммо мушкиле, ки дар амал ба миён меояд, танҳо ёфтани хато нест. Мушкилоти аслӣ ҷудо кардани он аст, ки кадоме аз хатогиҳои ёфтшуда воқеан муҳиманд.

Агар як низом барои як мақола 15 мушкил тавлид кунад, вале танҳо қисми хурди онҳо воқеан критикӣ бошанд, муҳаррири инсонӣ ҳанӯз маҷбур мешавад тамоми рӯйхатро як ба як санҷад. Дар ин ҳолат низом triage, яъне авлавиятгузорӣ накардааст; танҳо рӯйхати серғавғои хониш сохтааст.

Басташавии асосие, ки таҳқиқот баррасӣ мекунад, ҳамин аст: моделҳои бузурги забонӣ метавонанд дар матнҳои илмӣ мушкилоти зиёдеро пайдо кунанд, аммо на ҳамеша боэътимод фарқ мекунанд, ки кадоме “норасоии хурди гузоришдиҳӣ”, кадоме “мушкилоти методологӣ, ки таҷдиди ҷиддиро талаб мекунад” ва кадоме “хатои марговаре, ки натиҷаи асосии мақоларо фурӯ мерезонад” мебошад.

Ин масъала дар нашри илмии дастгиришаванда бо AI боз ҳам муҳимтар мешавад. Бо афзоиши истифодаи AI дар навиштани мақолаҳо, сифати зоҳирии матн метавонад дигар нишондиҳандаи боэътимоди сифат набошад. Он чизе ки муҳаррирон ва доварон ниёз доранд, танҳо низомҳое нестанд, ки мегӯянд “дар ин мақола шояд мушкил бошад”, балки низомҳое ҳастанд, ки ба саволи “ин мушкил то чӣ ҳад ҷиддӣ аст?” ҷавоби беҳтар калибршуда медиҳанд.

Усул чӣ пешниҳод мекунад?

Таҳқиқот меъмории бисёрмарҳилавии арзёбиро бо номи “graduated dissent” пешниҳод мекунад. Ин меъморӣ баррасии мақолаи илмиро на ҳамчун натиҷаи якдафъаинаи як модел, балки ҳамчун раванди идорашавандаи эътироз ва бозарзёбӣ тарҳрезӣ мекунад.

Дар марҳилаи аввал ду prover model-и ҷудогона мақолаи беномшударо мустақилона баррасӣ мекунанд. Ҳар модел мушкилоти худро тавлид карда, онҳоро ба яке аз се синфи шиддат ҷой медиҳад: retraction-worthy, major-revision ё minor. Retraction-worthy маънои хатои вазнинеро дорад, ки натиҷаи марказии мақоларо аз ҷиҳати маълумот дастгиринашаванда мекунад. Major-revision мушкилоти ҷиддиро ифода мекунад, ки метавонад натиҷаҳоро тағйир диҳад, аммо таҳқиқотро ҳатман пурра фурӯ намепошад. Minor бошад, танқиди маъмулиест, ки дар бисёр нашрияҳо дида мешавад ва интизор намеравад натиҷаро тағйир диҳад.

Марҳилаи дуюм қисми аслии таҳқиқот аст. Ҳар модел маҷбур мешавад бар зидди баҳои шиддате, ки худ додааст, қавитарин далелро бисозад. Ин баръакси равиши классикии “модел худро ҳимоя кунад” мебошад. Ба низом гуфта намешавад “чаро ҳақ ҳастӣ?”, балки пурсида мешавад: “чаро ин мушкил метавонад аз он чи фикр кардӣ камтар ҷиддӣ бошад?”

Дар марҳилаи сеюм модели arbiter ворид мешавад. Arbiter арзёбиҳои аввалия, далелҳои муқобил ва рубрикаи шиддатро якҷо мебинад. Ҳадаф кам кардани тамғагузории беасос вазнин ва ҷудо кардани мушкилоти воқеан критикӣ бо эҳтиёти бештар мебошад.

Ин равиш аз якҷо кардани оддии чанд модел фарқ мекунад. Пулинг ё ҳавзкунии чанд модел мушкилоти моделҳои гуногунро якҷо мекунад. Аммо азбаски моделҳо метавонанд аз равандҳои омӯзишӣ ва қолабҳои бозхӯрди инсонӣ шабеҳ бошанд, онҳо метавонанд ҳамон навъи хаторо якҷо бузург кунанд. Steelman exchange моделҳоро маҷбур мекунад бар зидди ҳукми аввалини худ фикр кунанд ва ба ин восита ҳадаф дорад ин ғарази муштаракро қисман бишканад.

Формулаҳо чӣ мегӯянд?

Дар таҳқиқот ҳам натиҷаҳои таҷрибавӣ ва ҳам асосноккунии назариявии иттилоотӣ мавҷуданд. Ғояи асосӣ чунин аст: агар чанд модел як навъи нуқтаҳои кӯрро муштарак дошта бошанд, боз ва боз арзёбӣ кардани як хато далели мустақил эҷод намекунад. Ин метавонад танҳо эътимоди субъективиро баланд кунад, вале дурустии объективиро ба ҳамон дараҷа беҳтар накунад.

Ифодаи аввалини назарияи иттилоотӣ дар таҳқиқот нишон медиҳад, ки иттилое, ки интихобкунанда медиҳад, метавонад бо режимҳои муштараки хатогӣ маҳдуд бошад. Дар ин ҷо \\(G\\) модели тавлидкунанда, \\(S\\) натиҷаи интихобкунанда/арзёбанда ва \\(T\\) нишондиҳандаи дурустиро ифода мекунад. \\(Z\\) режимҳои умумии хатогии муштараки моделҳоро нишон медиҳад.

\[ S \perp T \mid (G,Z) \]

Ин ифода мегӯяд, ки агар \\(G\\) ва режими муштараки хатогӣ \\(Z\\) маълум бошанд, натиҷаи интихобкунанда метавонад дар бораи дурустӣ иттилои иловагии мустақил надошта бошад. Яъне арзёбандаҳое, ки нуқтаи кӯри яксон доранд, ҳатто агар шумораашон зиёд бошад, наметавонанд далели воқеан мустақил тавлид кунанд.

Ҳадди иттилоотии таҳқиқот чунин дода мешавад:

\[ I(T;S\mid G) \leq I(T;Z\mid G) \]

Дар ин ҷо \\(I(\\cdot;\\cdot)\\) mutual information, яъне ченаки иттилои мутақобил дар назарияи иттилоот аст. Паёми асосӣ чунин аст: иттилое, ки арзёбанда дар бораи дурустӣ дода метавонад, метавонад бо иттилое, ки режимҳои муштараки хатогӣ доранд, маҳдуд шавад.

Дар ҳолати махсус, агар режими муштараки хатогӣ \\(Z\\) бо дурустӣ шартан иртибот надошта бошад, чунин натиҷа ба даст меояд:

\[ T \perp Z \mid G \quad \Rightarrow \quad I(T;S\mid G)=0 \]

Ин як ҳушдори сахт, вале муҳим аст: агар намунаи хатогии муштараки моделҳо бо дурустии воқеӣ иртибот надошта бошад, даврҳои иловагии арзёбӣ дар бораи дурустӣ иттилои нави маънодор намедиҳанд.

Ҳадди барои худтанқидкунии такрорӣ ё интихобкунандагони бисёр низ ҳамин мантиқро пайгирӣ мекунад:

\[ I(T;A_{1:k}\mid G) \leq I(T;Z\mid G) \]

Дар ин ҷо \\(A_{1:k}\\) чанд сигнал ё қарори қабулро ифода мекунад. Тафсир чунин аст: дар шароити хатогиҳои ҳамбастагӣ, арзёбии бештар ҳатман маънои далели объективии бештарро надорад.

Ҳолате, ки steelman exchange ҳадаф мегирад, ин аст, ки сигнали қабул воқеан далели мусбат дошта бошад. Дар таҳқиқот ин ғоя бо чунин шарт шарҳ дода мешавад:

\[ \Pr(A=1\mid T=0)\leq 1-\epsilon \quad \text{ve} \quad \Pr(A=1\mid T=1)\geq \delta \]

Агар дар ҳолати нодуруст эҳтимоли қабул паст ва дар ҳолати дуруст эҳтимоли қабул баланд бошад, сигнали қабул дар бораи дурустӣ иттилои мусбат дорад.

Дар ин ҳолат ҳаҷми далеле, ки қабул медиҳад, чунин ифода мешавад:

\[ \log_2\frac{\delta}{1-\epsilon} > 0 \]

Ин формула мефаҳмонад, ки чаро steelman exchange метавонад кор кунад: ҳадаф зиёд кардани шумораи моделҳои сухангӯ нест, балки душвор кардани қабули таснифоти нодурусти вазнин мебошад.

Паёми асосии графикҳо, ҷадвалҳо ва схемаҳо

Паёми асосии ҷадвали натиҷаҳо ин аст, ки усули steelman exchange бештар дар калибркунии шиддат фарқ эҷод мекунад, на дар ёфтани хомии хато. Дар санҷиши SPOT, меъмории steelman ба 36 фоиз pass@1 мерасад. Retraction-worthy precision, яъне ҳиссаи хатоҳои воқеан критикӣ дар синфи вазнинтарин, 11,7 фоиз аст. Ин нисбат аз меъмориҳои алтернативӣ баландтар мебошад ва модел ҳушдорҳои сатҳи олии камтар тавлид мекунад.

Равиши якмоделӣ кашфи маҳдудтар дорад. Як модели дорои рубрика суръати кашфро зиёд мекунад, аммо дар калибркунии шиддат ҳанӯз заиф мемонад. Пулинги чанд модел метавонад баъзе хатоҳоро бештар пайдо кунад, вале дар ҷудо кардани синфи хатои вазнин беҳбудии равшан намедиҳад. Ин бо ҳушдори асосии таҳқиқот мувофиқ аст: зиёд кардани шумораи моделҳо, агар хатогиҳо ҳамбастагӣ дошта бошанд, сифати воқеии ҳукмро худкор боло намебарад.

Санҷиши дуюм бо мақолаҳои бозпасгирифташуда ва мақолаҳои назоратӣ ҷанбаи дигари усулро нишон медиҳад. Steelman exchange ҳамаи 10 хатое, ки боиси бозпасгирӣ шудаанд, пайдо мекунад; дар мақолаҳои назоратӣ бошад, тибқи аудити мустақили модели беруна дар 2 аз 19 назорат таснифи нодурусти вазнин медиҳад. Пулинги чанд модел аз 10 хато 7-тояшро пайдо мекунад ва дар 3 аз 19 назорат таснифи нодурусти вазнин медиҳад. Ин натиҷа нишон медиҳад, ки усули steelman махсусан дар фарқи “хатои вазнин аст ё не?” метавонад мутавозинтар амал кунад.

Муқоисаҳои бо буҷет баробаршуда низ муҳиманд. Ҳангоми истифодаи ҳамон шумораи зангҳои API, танҳо зиёд кардани даврҳои фикрронӣ ё reflection-и бетараф ба андозаи steelman калибркуниро беҳтар намекунад. Яъне натиҷа эҳтимолан на аз он сабаб аст, ки “моделҳои бештар кор карданд”, балки аз он ки моделҳо маҷбур шуданд бар зидди ҳукми аввалини шиддати худ эътирози қавӣ эҷод кунанд.

Схемаи умумии таҳқиқот дар арзёбии мақолаи илмӣ се марҳилаи ҷудоро намоён мекунад: аввал хато ёфт мешавад, баъд дараҷаи аҳамияти хато баҳс мешавад ва дар охир барои инсон тартиби афзалиятноки амалпазир тавлид мешавад. Саҳми асосии таҳқиқот ин аст, ки марҳилаи дуюм, яъне калибркунии шиддат, ҳамчун мушкили мустақил муайян карда мешавад.

Таҷрибаҳо чӣ гуна гузаронида шудаанд?

Дар таҳқиқот чор шарти асосии арзёбӣ муқоиса мешаванд. Шарти аввал арзёбии як модел аст. Шарти дуюм ба як модел рубрикаи равшани шиддат медиҳад. Шарти сеюм мушкилоти чанд моделро якҷо мекунад. Шарти чорум бошад graduated dissent, яъне меъмории adversarial-и чандмоделӣ бо steelman exchange мебошад.

Benchmark-и аввал зермаҷмӯи маҷмӯи маълумоти SPOT мебошад, ки хатогиҳои ошкоршаванда аз рӯйи матнро дар бар мегирад. Мақолаҳое, ки хатоҳои вобаста ба тасвирро талаб мекунанд, хориҷ карда мешаванд ва 50 мақола арзёбӣ мегарданд. Ҳадаф санҷидани он аст, ки низом хатои сабтшударо пайдо мекунад ё не ва онро то чӣ андоза ба синфи дурусти шиддат ҷой медиҳад.

Benchmark-и дуюм бо мақолаҳои бозпасгирифташуда ва мақолаҳои назоратии бозпаснагирифта сохта мешавад. Дар ин маҷмӯъ 10 мақолаи бозпасгирифташуда ва 19 мақолаи назоратӣ мавҷуд аст. Ҳадаф на танҳо ёфтани хатои воқеан вазнин, балки нодуруст тамғагузорӣ накардани мақолаҳои назоратии солим ҳамчун “retraction-worthy” мебошад.

Барои тасдиқ сохтори назорати чандқабата истифода мешавад. Сабтҳои хатои аз ҷониби инсон тасдиқшудаи SPOT, протоколи мутобиқсозии LLM-as-judge, аудити adversarial-и модел, human spot-check ва тасдиқи кӯри инсонӣ якҷо истифода мешаванд. Дар benchmark-и мақолаҳои бозпасгирифташуда бошад, false positive-ҳо бо аудити моделҳои in-family ва out-of-family дубора санҷида мешаванд.

Дар нақшҳои модел аз оилаҳои гуногуни модел истифода мешавад. Ду prover model мустақилона баррасӣ мекунанд; модели arbiter қарори ниҳоиро медиҳад. Ҳадафи таҳқиқот муқоисаи оилаҳои моделҳо нест, балки чен кардани таъсири тарҳҳои гуногуни меъморӣ ба калибркунии шиддат мебошад.

Натиҷаҳо чӣ нишон медиҳанд?

Натиҷаи аввал ин аст, ки дар баррасии мақолаҳои илмӣ танҳо ёфтани хомии хато дигар кофӣ нест. Моделҳои бузурги забонӣ метавонанд мушкилоти зиёдеро ишора кунанд; аммо агар онҳоро авлавиятгузорӣ карда натавонанд, ба ҷойи кам кардани кори довари инсонӣ, онро зиёд мекунанд.

Натиҷаи дуюм ин аст, ки усули steelman exchange дар калибркунии шиддат натиҷаҳои муфидтар медиҳад. Дар санҷиши SPOT баландтарин pass@1 ва retraction-worthy precision-и баландтар дар ҳамин усул дида мешавад. Ҳамзамон камтар будани шумораи ҳушдорҳои сатҳи боло маънои онро дорад, ки довари инсонӣ бо ғавғои камтар рӯ ба рӯ мешавад.

Натиҷаи сеюм маҳдудияти пулинги чанд модел аст. Ҷамъ кардани мушкилот аз чанд модел метавонад суръати кашфро каме баланд кунад; аммо агар ҳамон навъи ғаразҳо ва қолабҳои арзёбӣ муштарак бошанд, таснифи хатои вазнин беҳтар намешавад. Зиёд кардани моделҳо бо тавлиди далели мустақил як чиз нест.

Натиҷаи чорум ин аст, ки худэътирози adversarial вазифаи дигар иҷро мекунад. Вақте модел ба ҷойи ҳимояи мушкили худ қавитарин эътирозро нисбат ба он месозад, қисми таснифоти аз ҳад вазнин хориҷ мешаванд. Ин махсусан дар нашри илмӣ муҳим аст, зеро тамғаи нодурусти “retraction-worthy” барои муҳаққиқ, муҳаррир ва тамоми экосистемаи нашрӣ паёмадҳои ҷиддӣ дорад.

Натиҷаи панҷум ин аст, ки усул ҳоло бо намунаи маҳдуд санҷида шудааст. Ҳарчанд натиҷаҳо умедбахшанд, онҳо бояд дар маҷмӯи маълумоти калонтар, аз соҳаҳои гуногун ва бо хатоҳое, ки ба тасвир/ҷадвал вобастаанд, дубора санҷида шаванд.

Чаро ин муҳим аст?

Дастгирии зеҳни сунъӣ дар нашри илмӣ ногузир афзоиш меёбад. Муҳаррирон, доварон ва гурӯҳҳои тамомияти илмӣ метавонанд ба низомҳое ниёз дошта бошанд, ки шумораи зиёди мақолаҳоро зудтар скан мекунанд. Аммо суръат ба танҳоӣ кофӣ нест. Низоме, ки ҳушдори бардурӯғ медиҳад, эътимоднокӣ намеафзояд; баръакс вақти коршиносони инсонро мегирад.

Ин таҳқиқот нишон медиҳад, ки дар баррасии илмии дастгиришаванда бо AI меъёри асосӣ бояд тағйир ёбад. Саволи “модел хато ёфт?” ба ҳамон андоза, ва дар амал ҳатто бештар, бо саволи “модел тавонист фарқ кунад кадом хато воқеан критикӣ аст?” аҳамият дорад.

Ин фарқ барои экосистемаи академӣ ҳассос аст. Нишон додани як норасоии хурди гузоришдиҳӣ ҳамчун фурӯпошии вазнини методологӣ метавонад зарари ноодилона расонад. Аз тарафи дигар, нишон додани хатое, ки натиҷаҳоро воқеан беэътибор мекунад, ҳамчун “маҳдудияти маъмулӣ” низ метавонад адабиёти илмиро олуда кунад. Аз ин рӯ, калибркунии шиддат бояд дар маркази назорати сифати илмӣ қарор гирад.

Таҳқиқот барои низомҳои бисёрагентаи AI низ дарси умумитар медиҳад. Истифодаи чанд модел ба худӣ худ кафолати эътимоднокӣ нест. Масъалаи асосӣ ин аст, ки моделҳо якдигарро чӣ гуна назорат мекунанд, то чӣ андоза мустақиланд ва дар кадом вазифа маҷбур мешаванд кадом навъи эътирозро тавлид кунанд.

Нуктаҳои муҳими эҳтиёт

Нуктаи аввал андозаи намуна аст. Benchmark-и мақолаҳои бозпасгирифташуда аз 10 мақолаи бозпасгирифташуда ва 19 мақолаи назоратӣ иборат аст. Ин барои усул сигнали аввалияи қавӣ медиҳад, аммо барои умумисозии васеъ кофӣ нест.

Нуктаи дуюм зермаҷмӯи SPOT мебошад. Арзёбӣ танҳо бо хатоҳое анҷом ёфтааст, ки аз рӯйи матн ошкор мешаванд. Хатоҳое, ки график, ҷадвал, тасвир ё файли иловагии маълумотро талаб мекунанд, берун аз доира мондаанд. Қисми муҳими хатогиҳои илмӣ метавонад ба тасвир, файли оморӣ ё ҷузъиёти тарҳи таҷриба вобаста бошад.

Нуктаи сеюм scoring аст. Ҳарчанд таҳқиқот тасдиқи чандқабатаро истифода мебарад, дар баъзе ҳолатҳо миёни аудиторҳои мустақил ихтилоф дида мешавад. Ин хотиррасон мекунад, ки худи арзёбии хатои илмӣ низ метавонад тафсирпазир бошад.

Нуктаи чорум correlation-и моделҳо аст. Steelman exchange ҳадаф дорад қолабҳои умумии хатогиро кам кунад, аммо шабоҳатҳои сатҳи параметрии моделҳои бузургеро, ки дар як экосистемаи маълумот омӯзонида шудаанд, пурра аз байн намебарад. Аз ин рӯ, низом бояд на ба ҷойи довари инсонӣ, балки ҳамчун дастгирии авлавиятгузорӣ баррасӣ шавад.

Нуктаи панҷум хароҷот ва ҷараёни кор аст. Гуфта мешавад, ки pipeline-и пурра барои ҳар мақола тақрибан 1,25 доллар арзиш дорад. Ин хароҷот метавонад паст намояд; аммо дар ҷараёнҳои калони нашрӣ, бо тасдиқи иловагӣ ва назорати инсонӣ, хароҷоти воқеии амалиётӣ бояд ҷудогона ҳисоб карда шавад.

Ниҳоят, ин мӯҳтаво тавсияи этикаи нашр ё қарори редаксионӣ нест. Қарорҳое чун бозпасгирӣ, рад кардан ё фиристодан ба major revision бояд аз ҷониби коршиносони соҳа, муҳаррирон, оморшиносон ва кумитаҳои этикӣ арзёбӣ шаванд.

Хулоса

Ин таҳқиқот ба як нуқтаи гардиши муҳим дар баррасии мақолаҳои илмӣ бо зеҳни сунъӣ ишора мекунад. Масъала дигар танҳо “оё LLM метавонад дар мақола хато пайдо кунад?” нест. Саволи муҳимтар ин аст: оё LLM метавонад фарқ кунад кадоме аз хатоҳои ёфташуда воқеан ҷиддӣ аст?

Усули пешниҳодшудаи steelman exchange моделҳоро маҷбур мекунад бар зидди ҳукми аввалини худ фикр кунанд, то арзёбиҳои аз ҳад вазнин кам шаванд ва хатогиҳои критикӣ ба шакли муфидтар авлавият дода шаванд. Натиҷаҳои таҷрибавӣ нишон медиҳанд, ки ин меъморӣ ҳам дар benchmark-и SPOT ва ҳам дар benchmark-и мақолаҳои бозпасгирифташуда нисбат ба пулинги оддии чанд модел калибркунии беҳтари шиддат дода метавонад.

Аз дидгоҳи Verianla, паёми асосии таҳқиқот равшан аст: арзиши зеҳни сунъӣ дар арзёбии илмӣ на бо шумораи мушкилоте, ки номбар мекунад, балки бо он чен мешавад, ки кадом мушкил воқеан муҳим аст ва то чӣ андоза боэътимод ин фарқро мекунад. Истифодаи чанд модел кофӣ нест; тарзи эътирози моделҳо ба ҳамдигар ва тарзи калибр кардани қарори шиддат аҳамияти ҳалкунанда пайдо мекунад.

Ёддошт оид ба манбаъ ва усул

Ин мӯҳтаво бар асоси таҳқиқоти Andrew Michael Brilliant бо унвони “Steelmanning LLM Review: Severity Calibration Through Adversarial Self-Challenge” омода шудааст. Таҳқиқот калибркунии шиддат дар арзёбии мақолаҳои илмӣ бо LLM, steelman exchange, graduated dissent, пулинги чанд модел ва чаҳорчӯбаи ҳамбастагии хатогиҳо дар назарияи иттилоотро меомӯзад.

Ин мӯҳтаво тарҷумаи калима ба калима нест; ғояи асосии таҳқиқот мутобиқ ба хатти нашрии Verianla содда карда шуда, ба мақолаи аслии редаксионии тоҷикӣ табдил дода шудааст.


Мубодила:

Шарҳҳо пас аз баррасӣ нашр мешаванд.Шарҳи шумо ба раванди тасдиқ фиристода шуда, пас аз пазируфта шудан намоён мегардад.

Шарҳ гузоред

Нишонии почтаи электронии шумо нашр намешавад. Майдонҳои ҳатмӣ бо * нишон дода шудаанд

Иҷозат додан ба кукиҳо таҷрибаи шуморо дар ин сомона беҳтар мекунад. Сиёсати кукиҳо