Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Коомдук илимдер / Психология / Нейралдык Манифолддордогу Оюктар: Адамдын Түшүнүк Үйрөнүүсү менен Тил Моделдеринин Ички Геометриясы Бир Механизмби?
Психология

Нейралдык Манифолддордогу Оюктар: Адамдын Түшүнүк Үйрөнүүсү менен Тил Моделдеринин Ички Геометриясы Бир Механизмби?

Нейралдык манифолд — көп сандагы нейрондордун же жасалма тармак бирдиктеринин жогорку өлчөмдүү активдүүлүк мейкиндигинде түзгөн жүрүм-туруму төмөнкү өлчөмдүү геометриялык беттин үстүндө уюшуларын билдирген өкүлчүлүк ыкмасы.

15/09/2026  Veri Anla 111 көрүү
Нейралдык Манифолддордогу Оюктар: Адамдын Түшүнүк Үйрөнүүсү менен Тил Моделдеринин Ички Геометриясы Бир Механизмби?

Нейралдык манифолд, көп сандагы нейрондордун же жасалма тармак бирдиктеринин жогорку өлчөмдүү активдүүлүк мейкиндигинде түзгөн жүрүм-туруму төмөнкү өлчөмдүү геометриялык беттин үстүндө уюшуларын билдирген өкүлчүлүк ыкмасы. Frederick Rothтун эмгеги адамдардагы түшүнүк үйрөнүү менен үйрөтүлгөн тил моделдериндеги түшүнүктүк өкүлчүлүктөр эки башка механизм эмес, бекемдөө аркылуу калыптанган төмөн өлчөмдүү тартуучу түзүмдүн эки масштабдагы көрүнүшү деген гипотезаны жактайт. Бул алкакта түшүнүктөр өз-өзүнчө символдук аныктамалар катары сакталбастан, окшош тажрыйбалар кайра-кайра активдештирген жана системанын абалы кайтып келүүгө ыктай турган тыгыз геометриялык аймактар катары каралат. Макала бул ыкманын жасалма интеллект коопсуздугу үчүн түз натыйжасы бар экенин сунуштайт: каалабаган жүрүм-турумду жөн гана басуунун ордуна, кааланган жүрүм-турумдун өзүн позитивдүү, аталышы бар түшүнүктүк тартуучу катары үйрөтүү. Автор бул ыкманы Concept Programming (CP) деп атайт. 3 миллиард параметрлүү Llama 3.2 моделинде билдирилген пилотто CP 36 governance-safety кырдаалында %94,4 тактыкка жетсе, терс алкактагы punishment-analog шарты %77,8, үйрөтүлбөгөн контролдук шарт %47,2 тактык көрсөткөн. Бирок punishment-analog шарты өндүрүш масштабындагы чыныгы RLHF эмес; изилдөө CP RLHFден түздөн-түз эксперименталдык түрдө ашып түшкөнүн көрсөтпөйт. Ошондой эле билдирилген жүрүм-турум натыйжалары манифолд геометриясынын түз өлчөмү эмес. Ошондуктан изилдөөнүн адам–AI механизмдеринин бирдейлиги жөнүндөгү негизги гипотезасы кызыктуу жана жокко чыгарылышы мүмкүн, бирок азырынча калыптанган илимий жыйынтык эмес.

Макала өзүнүн камтуу чегин атайын тар аныктайт. Автор бул текст китептин жана эки техникалык companion эмгектин кыскача жыйынтыгы экенин жана бул жерде берилген дооматтардын баштапкы булагы ушул 7 беттик макала эмес экенин ачык белгилейт. Толук эксперимент протоколдору, кошумча натыйжалар жана код башка эмгектерге калтырылган.

Бул айырма маанилүү; анткени эмгек бир жагынан когнитивдик илимди, Hebb тибиндеги клетка жамааттарын, категория үйрөнүүнү жана attractor тармактарын бир геометриялык баяндын астында бириктирсе, экинчи жагынан чакан масштабдагы пилоттук эксперименттерден жасалма интеллектти шайкештештирүү архитектурасы үчүн кеңири теориялык тыянактарды чыгарат. Verianla үчүн туура ыкма бул натыйжаларды «далилденген жалпы жасалма интеллект коопсуздук мыйзамы» катары эмес, так эксперименталдык чектери бар изилдөө программасынын алгачкы далилдери катары берүү.

Нейралдык Манифолд Деген Эмне?

Нейралдык манифолд — өтө жогорку өлчөмдүү нейралдык активдүүлүк мейкиндигиндеги системанын абалдары чындыгында кыйла төмөн өлчөмдүү тартиптүү бетке топтолот деген идея; бул ыкмада маалымат өзүнчө нейрондордун туруктуу маанилеринде эмес, системанын активдүүлүгүнүн ошол геометриялык беттеги ордунда жана кыймылында коддолот.

Нейрондук тармак миллиондогон же миллиарддаган өзүнчө параметрлерге ээ болушу мүмкүн. Ошого карабастан, белгилүү бир тапшырма учурунда пайда болгон активдүүлүк үлгүлөрү мүмкүн болгон бүт жогорку өлчөмдүү абал мейкиндигин колдонушу шарт эмес. Эгер активдешүүлөр белгилүү багыттарда топтолсо, системанын жүрүм-турумун төмөн өлчөмдүү геометриялык түзүм аркылуу түшүндүрүүгө болот.

Булактын түшүнүктүк ыкмасында категорияга мүчөлүк да ушул геометриялык түзүм аркылуу түшүндүрүлөт. Бир мисал белгилүү категориянын сөзсүз «ичинде» же «сыртында» болушу керек эмес; анын манифолддогу орду категория аймагына ар кандай даражада жакын болушу мүмкүн. Ошентип типтүү жана типтүү эмес категория мүчөлөрүнүн ар кандай ылдамдыкта же ишеним деңгээлинде таанылышы сыяктуу даражалуу жүрүм-турумдарды түшүндүрүүгө болот деп айтылат.

Категорияга мүчөлүк эмне үчүн даражалуу?

Булак Eleanor Roschтун категория изилдөөлөрүнө таянып, күнүмдүк түшүнүктөрдүн көбүндө мүчөлүк толугу менен бинардык эмес экенин баса белгилейт. Айрым мисалдар категорияга көбүрөөк типтүү көрүнсө, айрымдары чек арада калышы мүмкүн. Манифолд ыкмасында мунун себеби түшүнүк катуу символдук шарттардын тизмеси эмес, геометриялык аймак катары каралат.

Wittgensteinдин «үй-бүлөлүк окшоштук» ыкмасы да ушул контекстке жайгаштырылат. Категориядагы бардык мисалдар сөзсүз бөлүшө турган жалгыз жалпы белги болбошу мүмкүн; категориянын биримдигин камсыз кылган нерсе мисалдардын өзгөчөлүктөрү бири-бирин каптап түзгөн аймактык түзүм болушу мүмкүн.

Тартуучу Түзүм Деген Эмне жана Түшүнүк Үйрөнүү менен Кантип Байланыштырылат?

Тартуучу түзүм (attractor), системанын активдүүлүгү белгилүү бир аймакка багытталып, майда четтөөлөрдөн кийин кайра ошол эле аймакка кайтууга ыкташын билдирет. Булак үйрөнүлгөн түшүнүктөрдү бир туруктуу нейрондук чынжырдан көрө, чек аралары даражалуу болгон туруктуу жана тыгыз манифолд аймактары катары кароого болорун жактайт.

Donald Hebbтин клетка жамааты түшүнүгү бул баяндоого тарыхый негиз катары киргизилет. Hebb бирге кайра-кайра активдешкен клетка топтору убакыт өтүшү менен чогуу иштей ала турган функционалдык бирдик түзүшү мүмкүн экенин сунуштаган.

Roth бул ойду геометриялык тилде кайра чечмелейт: клетка жамааты белгилүү мүчөлөрдөн турган өзгөрбөс тизме болбостон, активдүүлүк кайра-кайра топтолгон манифолд аймагы катары каралышы мүмкүн.

Бул моделде бекемдөө белгилүү бир жыйынтыкты сыйлаган окуя гана эмес. Кайталанган активдүүлүк системанын абал мейкиндигинде белгилүү жолдорду жана аймактарды жеңилирээк жеткиликтүү кылган геометриялык калыптануу механизми катары түшүндүрүлөт.

«Groove», башкача айтканда оюк окшоштугу эмнени билдирет?

Эмгектин жана китептин аталышындагы «groove» сөзү ушул кайталанма колдонуу идеясын билдирет. Бир жүрүм-турум же түшүнүктүк үлгү кайра-кайра активдешкен сайын системанын ошол эле активдүүлүк аймагына кайра жетиши жеңилдейт.

Бул чыныгы физикалык оюк бар дегенди билдирбейт. Булак колдонгон геометриялык метафора үйрөнүлгөн жүрүм-турумдар жогорку өлчөмдүү активдүүлүк мейкиндигинде артыкчылыктуу жолдор же туруктуу аймактар түрүндө көрсөтүлүшү мүмкүн деген божомолду сүрөттөйт.

Эмне үчүн бир түшүнүк бир гана манифолд менен чектелбейт?

Булак кабылдоо же кыймыл көндүмү бир гана өкүлчүлүк мейкиндигинде каралышы мүмкүн экенин, ал эми кеңири түшүнүктөр ар кандай модалдуулуктарды бириктириши керектигин жактайт. Мисалы, «ит» түшүнүгү визуалдык форма, үн, кыймыл жана башка тажрыйба түрлөрүн бир эле түшүнүктүк түзүмдө байланыштырат.

Бул учурда өзүнчө тажрыйба мейкиндиктеринин жалпы түзүмү кантип бириктирилет деген суроо чыгат. Roth бул жерде Hayes-Roth жана McDermottтун 1978-жылдагы interference matching ыкмасын колдонот.

Interference Matching Деген Эмне?

Interference matching, бир түшүнүккө тиешелүү бир нече мисал активдештирген өзгөчөлүк түзүмдөрүн үстү-үстүнө коюп, алардын арасында кайра кайталанган жалпы түзүмдү бөлүп чыгаруу ыкмасы; булак муну ар башка тажрыйбалардан жалпыраак түшүнүктүк абстракция түзүүнүн механизми катары карайт.

Булактын түшүндүрмөсү боюнча, бул процесс ар бир мисал активдештирген элементтер топтомдорунун кесилишин эсептөөгө формалдуу түрдө окшоштурулушу мүмкүн. Бир эле мисалда кокус же контекстке мүнөздүү болгон белгилер кайталоолордун арасында жоголуп, жалпы белгилердин айкалыштары күчөйт.

Roth бул ыкманы символдук схема же бир прототипти сактоо эмес, чогуу пайда болгон белгилердин айкалыштарына байланышкан даражалуу эс тутумдун калыптанышы катары түшүндүрөт.

Жаңы маалымат түзүмү колдонуу учурунда кантип өзгөрөт?

Булак Barbara Hayes-Rothтун 1977-жылдагы эмгегинде билдирилген үч баскычтуу transfer ийри сызыгын өзүнчө көрсөтөт:

  1. Баштапкы жеңилдетүү: жаңы калыптанган маалымат түзүмү белгилүү тапшырмаларда алгачкы артыкчылык берет.
  2. Recovery баскычы: жалпы субкомпоненттер консолидация учурунда бири-бири менен атаандашкан мезгил пайда болот.
  3. Асимптотикалык баскыч: маалымат түзүмү туруктуураак болот.

Автор бул үч баскычтуу табылга Barbara Hayes-Rothко тиешелүү экенин өзгөчө бөлүп көрсөтөт; property-set модели болсо Frederick Hayes-Rothтун 1974-жылдагы эмгегинен башталып, кийин биргелешип өнүктүрүлгөн башка тарыхка ээ экенин белгилейт.

Символдук Байлоо Проблемасы Деген Эмне?

Символдук байлоо проблемасы — символдук система абстракттуу өзгөрмөлөрдөгү ролдорду сахнадагы реалдуу объекттерге кантип дайындоону аныкташы керек болгондо пайда болгон комбинатордук дал келтирүү проблемасы. Булак манифолд өкүлчүлүктөрү бул проблеманы ылдамыраак «чечет» дебейт; тескерисинче, өзгөрмө–маани байлоосун талап кылган өкүлчүлүк формасын башынан колдонбой, проблеманын өзүн жок кылат деп жактайт.

Символдук система, мисалы, мамилени төмөнкүдөй көрсөтө алат:

above(block-A, block-B)

Жалпы эреже башка объекттерге колдонулса, система кайсы объект кайсы өзгөрмө ролун толтурарын аныкташы керек. Объекттердин жана мамилелердин саны көбөйгөн сайын мүмкүн болгон дал келүүлөрдүн саны да өсүшү мүмкүн.

Булак бул проблеманы Hayes-Roth жана McDermott 1978-жылы түзүмдүк үлгү үйрөнүү жагынан аныктаган негизги практикалык тоскоолдуктардын бири катары көрсөтөт.

Манифолд Ыкмасы Байлоо Проблемасын Кантип «Жок Кылат»?

Rothтун сунушунда мамилелер аталышы бар өзгөрмөлөргө объекттерди дайындоо аркылуу эмес, манифолддордун салыштырмалуу орду, аралык же жалпы активдүүлүк үлгүсү аркылуу көрсөтүлүшү мүмкүн; ошентип өзгөрмө–маани байлоосун издөө зарылдыгы жоголот жана таануу процесси үйрөнүлгөн тартуучу түзүмгө карата үлгүнү толуктоо проблемасы катары кайра аныкталат.

Бул маанилүү теориялык айырма. Макала «NP-кыйын байлоо проблемасын ылдамыраак чечкен жаңы алгоритмди» сунуштабайт. Анын ордуна ошол проблема классын пайда кылган символдук өкүлчүлүк божомолу керексиз болушу мүмкүн экенин айтууда.

Бирок бул жыйынтык иште чоң тил моделдеринин ички активдешүүлөрүнөн алынган кеңири байлоо эксперименти менен көрсөтүлгөн эмес. Булак бул жерде теориялык өкүлчүлүк аргументин курат.

Адамдын Түшүнүк Үйрөнүүсү менен Тил Моделдеринин Ички Геометриясы Бир Механизмби?

Бул макаланын негизги тезиси «ооба» деген багытта, бирок булак муну калыптанган илимий факт катары эмес, жокко чыгарылышы мүмкүн болгон бириктирүүчү доомат катары өнүктүрөт. Адамдын түшүнүк үйрөнүүсү боюнча жүрүм-турум адабияты менен жасалма нейрондук тармактардагы төмөн өлчөмдүү өкүлчүлүк геометриясы бир эле негизги тартуучу механизмди чагылдырат деп айтылат; бирок бул механизмдердин биологиялык жана жасалма системаларда чындап бирдей экенин түздөн-түз көрсөткөн жалпы эксперимент бул макалада жок.

Ошондуктан эки башка далил деңгээли айырмаланышы керек.

ДооматБул макаладагы статусу
Түшүнүккө мүчөлүк даражалуу болушу мүмкүн.Мурунку когнитивдик илим адабиятына негизделген фон.
Нейрондук тармактарда төмөн өлчөмдүү өкүлчүлүк түзүмдөрү пайда болушу мүмкүн.Макала шилтеме берген заманбап interpretability адабиятына негизделген фон.
Адамдын түшүнүк үйрөнүүсү жана тил моделинин түшүнүк геометриясы бир эле механизм.Автордун бириктирүүчү теориялык гипотезасы.
Бул механизм attractor-based Concept Programmingди мүмкүн кылат.Теориядан алынган колдонууга боло турган изилдөө гипотезасы.
Пилоттук CP үйрөтүүсү белгилүү safety тесттеринде жогорку тактык берди.Булакта билдирилген жүрүм-турум экспериментинин натыйжасы.

Concept Programming Деген Эмне?

Concept Programming (CP), жасалма интеллект системасында каалабаган натыйжаны жөн гана жазалоо же чыпкалоонун ордуна, кааланган жүрүм-турум түшүнүгүн аталышы бар позитивдүү тартуучу катары үйрөтүп, зарыл учурда каалабаган альтернативанын пайда болушуна бөгөт коё турган жооп үлгүсү менен дал келтирүүнү максат кылган жүрүм-турум үйрөтүү ыкмасы.

Булак CPни operant conditioningдеги «punishment» менен «inhibitory learning» айырмасына окшоштурат.

Автордун моделинде suppression ыкмасы каалабаган жүрүм-турум ишке ашкандан же пайда боло баштагандан кийин жазалайт. Позитивдүү түшүнүк үйрөтүүсү болсо кааланган альтернативдүү жүрүм-турумдун өзүн жеткиликтүүрөөк өкүлчүлүккө айландырууну максат кылат.

CPде тыюу түшүнүгү жөн гана «муну кылба» түрүндө аныкталбайт. Түшүнүк эмнени билдирери жана кайсы каршы жүрүм-турум активдешиши керектиги позитивдүү түрдө үйрөтүлөт.

Изилдөө Concept Programming RLHFден Жакшыраак Экенин Далилдейби?

Жок. Булактын экспериментинде Concept Programming өндүрүш масштабындагы чыныгы RLHF fine-tuning менен салыштырылган эмес. Салыштырылган экинчи шарт — терс алкактагы prompting аркылуу түзүлгөн жана автор «punishment-analog» деп атаган чакан масштабдагы suppression аналогу; демек натыйжаны «CP бул punishment-analog пилоттук шарттан ийгиликтүүрөөк болду» деп окуу керек.

Бул чек булакта ачык кабыл алынган. Автор full RLHF салыштыруусун жана adversarial jailbreak тесттерин келечекте жүргүзүлүшү керек болгон эксперименттердин катарына киргизет.

Ошондуктан төмөнкү эки сүйлөм тең маанилүү эмес:

Булак колдогон: «Позитивдүү түшүнүк үйрөтүүсү бул пилотто punishment-analog шартынан жогорку тактык берди.»

Булак колдобогон: «Concept Programming жалпы алганда RLHFден коопсузураак жана муну эксперименталдык түрдө далилдеди.»

Изилдөөнүн Ыкмасы жана Натыйжалары

Изилдөөнүн түзүмү

Бул 7 беттик иш эксперименттердин толук техникалык отчету эмес. Булак үч эксперимент тобунун натыйжаларын кыскача берет жана кеңири протокол, код жана кошумча натыйжалар үчүн эки companion макалага багыттайт.

Негизги safety пилоту:

  • 3 миллиард параметрлүү ачык салмактагы Llama 3.2 модели,
  • Ollama аркылуу жергиликтүү иштетүү,
  • позитивдүү concept training,
  • punishment-analog prompting,
  • үйрөтүлбөгөн контролдук шарт

болгон үч шартты камтыйт.

Governance-safety пилотунун натыйжасы

Шарт36 governance-safety кырдаалындагы тактык
Позитивдүү Concept Programming%94,4
Punishment-analog%77,8
Үйрөтүлбөгөн контролдук шарт%47,2

Булак Fisher's exact test үчүн p<0,0001 деп билдирет.

Бул натыйжа пилоттун эң түз жүрүм-турум далили. Бирок тест топтомунун бардык мисалдары жана процедуранын толук деталдары бул кыскача макалада жок.

Жаңы тармактарга өтүү

Позитивдүү түшүнүк модели үч жаңы операциялык тармакта бааланган.

Жаңы тармакБулакта билдирилген натыйжа
Оорукана операцияларыТармакка атайын үйрөтүүсүз тактык жоготуусу билдирилген эмес.
Кампа операцияларыТармакка атайын үйрөтүүсүз тактык жоготуусу билдирилген эмес.
Курулуш аянтынын коопсуздугуТактык %66,7ге түшкөн.

Автор курулуш коопсуздугундагы төмөндөөнү көбүрөөк адистешкен жана өзгөрмө терминологияга шайкеш натыйжа катары түшүндүрөт.

Бирок үч тармак боюнча ушул пилоттун гана натыйжалары бар болгондуктан, CP бардык жаңы тармактарга жоготуусуз өтөт деген жыйынтык чыгарууга болбойт.

Социалдык басым астында чектөөнү сактоо

Булак prompt модельге ачык же жашыруун социалдык басым көрсөткөн тест кырдаалдарын өзгөчө маанилүү деп эсептейт.

ШартЧектөөнү сактоо
Позитивдүү concept model%92,6
Үйрөтүлбөгөн контролдук шарт%44,4

Автор бул айырманы позитивдүү түшүнүк моделинде басымга туруштук бере алган ички өкүлчүлүк пайда болгонуна колдоо катары түшүндүрөт.

Бирок бул экспериментте «ички өкүлчүлүк» манифолд геометриясын түз өлчөө менен көрсөтүлгөн эмес. Өлчөнгөн натыйжа жүрүм-турумдук чектөөгө шайкештик; ички өкүлчүлүк тууралуу түшүндүрмө теориялык интерпретация катмары.

Позитивдүү Түшүнүк Үйрөтүүсү Жаңы Кырдаалдарга Эмне Үчүн Өтө Алат?

Булактын теориясына ылайык, позитивдүү түшүнүк үйрөтүүсү өзүнчө тыюу салуучу сүйлөмдөрдү жаттатуу ордуна, түшүнүктүн кеңири билдирүү аймагын камтыган тартуучу бассейн түзүүнү максат кылат; ошондуктан ошол эле түшүнүк башка сөздөр же башка операциялык контексттер менен пайда болгондо система кайра эле ошол жүрүм-турум аймагына багытталат деп күтүлөт. Бул өтүү механизми теориялык түшүндүрмө; пилотто эки жаңы тармакта күчтүү өтүү байкалган, үчүнчүдө болсо олуттуу өндүрүмдүүлүк төмөндөгөн.

Экинчи эксперимент: баалуулук түшүнүгүн үйрөтүү

Экинчи эксперимент safety constraint ордуна маданий баалуулук түшүнүгүн баалайт.

Бир Буддисттик этикалык алкакка туура келген аталышы бар баалуулук түшүнүгү сценарийге атайын мисалдар колдонулбастан үйрөтүлгөн.

Андан кийин модель беш стандарттуу moral-psychology кырдаалында бааланган:

  1. trolley сценарийи,
  2. footbridge варианты,
  3. Heinz-түрүндөгү дилемма,
  4. ыйлаган ымыркай сценарийи,
  5. whistleblower кырдаалы.

Булак үйрөтүлгөн модель беш кырдаалдын баарынан өткөнүн жана ошол эле пилотто сыналган башка салттардын эч бири сценарийге атайын үйрөтүүсүз ошондой натыйжага жетпегенин билдирет.

Башка салттардын деталдуу упайлары жана толук үйрөтүү протоколу бул кыскача иште берилбейт.

Үчүнчү эксперимент: үйрөтүү чыгымы

Үчүнчү эксперимент Concept Programming канча үйрөтүү мисалынан кийин коопсуздук каталарын азайта баштаганын governance-adapted signal detection алкагында баалайт.

Эки үйрөтүү ыкмасы салыштырылган:

Үйрөтүү ыкмасыБулакта аныкталган өзгөчөлүк
Кең үлгүлөөТүшүнүктүн табигый билдирүү диапазонунун кеңири бөлүгүнөн мисалдарды колдонот.
Тар үлгүлөөТүшүнүктүн эң көп колдонулган билдирүүлөрүнө басым жасайт.

Эки ыкма тең үйрөтүлбөгөн контролдогу %100 miss rateти 200 үйрөтүү кырдаалынын ичинде %25тен төмөн түшүргөн.

Ошол эле учурда, булакта алдын ала белгиленген %95 stopping criterionга 200 кырдаалдык бюджеттин ичинде жетишилбегени ачык айтылат.

Кең үлгүлөө ыкмасы жогору correct-rejection rate берсе, тар үлгүлөө жогору hit rate берген.

Автор бул карама-каршылыкты ар башка үйрөтүү үлгүлөөлөрү ар башка attractor геометрияларын түзөт деген күтүүгө шайкеш деп эсептейт. Бул геометриялык түшүндүрмө манифолдду түз өлчөө эмес, натыйжаларды теориянын алкагында чечмелөө.

Китептеги Ишеним Белгилери Эмне Үчүн Маанилүү?

Булакта кыскача баяндалган китеп калыптанган эмпирикалык натыйжа, жарым-жартылай колдоо, пилоттук эксперимент натыйжасы жана автордун күтүүсү сыяктуу ар башка эпистемикалык деңгээлдерди бирдей тактыкта бербөө үчүн алты ишеним белгисин колдонгон отчеттук системаны кабыл алган. Бул ыкма өзгөчө кеңири теориялык синтез менен чакан масштабдагы пилоттук натыйжаларды аралаштырбоону максат кылат.

Булак мисал катары төмөнкү категорияларды түшүндүрөт:

БелгиМааниси
EstablishedКалыптанган эмпирикалык адабият тарабынан колдоого алынган натыйжа.
Well supportedЧыныгы, бирок азырынча толук эмес колдоо.
Our experiments showАвтордун өз экспериментинен чыккан жана үлгү көлөмү менен кошо берилиши керек болгон натыйжа.
I expectБилимге таянган, бирок эксперименталдык жактан калыптана элек күтүм.
I suspectИшеним деңгээли төмөнүрөөк теориялык пикир.
What would change my mindДооматты жокко чыгара турган далилдин ачык көрсөтүлүшү.

Бул 7 беттик макала ошол эле белги системасын ар бир сүйлөмдө формалдуу колдонбосо да, автор пилоттук натыйжа менен кеңири теориянын айырмасын текст боюнча өзгөчө белгилөөгө аракет кылат.

Бул Теорияны Кайсы Табылгалар Жокко Чыгарышы Мүмкүн?

Булак теориянын негизги дооматтарын жокко чыгарылышы мүмкүн деп көрсөтөт. Айрыкча келечектеги interpretability изилдөөлөрү тил моделдериндеги түшүнүктөр төмөн өлчөмдүү attractor манифолддорунун ордуна чындап эле өзүнчө, символго окшош түзүмдөр жана комбинатордук variable binding аркылуу иштетилерин көрсөтсө, адамдын түшүнүк үйрөнүүсү менен тил моделинин геометриясы бир механизм деген борбордук доомат түздөн-түз жокко чыгарылат.

Булакта көрсөтүлгөн негизги сыноо пункттары

Биринчи чек — эмгектин эң кеңири unification claimи. Эгер тил моделдеринин түшүнүк үйрөнүүсү келечекте таптакыр башка механизм менен түшүндүрүлсө, теория жөн гана толук эмес эмес, негизги деңгээлде туура эмес болот.

Экинчи чек — framework ичиндеги колдоосу алсызыраак доомат: белгилүү когнитивдик деңгээлдер өз иштетүү бирдигине болжол менен туруктуу ылдамдыкта иштейт деген божомол. Булак мунун айрым нерв жолдорунда өлчөнгөнүн, башкаларында болсо болжолдонгонун кабыл алат.

Эгер ошол эле когнитивдик деңгээлдин ичинде иштетүү ылдамдыгы системалуу түрдө өзгөрөрү көрсөтүлсө, бул доомат түздөн-түз жабыркайт.

Үчүнчү практикалык сыноо — Concept Programmingди чыныгы RLHF жана production-scale suppression ыкмалары менен түз салыштыруу.

Төртүнчү сыноо — adversarial jailbreak кайра формулировкалоолору. Булак CP бул чабуулдарга suppression ыкмаларына караганда туруктуураак болушу керек деп божомолдойт, бирок тиешелүү тест али жүргүзүлө элек.

Изилдөө колдогон натыйжалар

  • 3B Llama 3.2 моделиндеги пилотто позитивдүү concept training punishment-analog жана үйрөтүлбөгөн контролдук шарттарга караганда жогору governance-safety тактыгын берген.
  • Булакта 36 кырдаалдык салыштыруу үчүн %94,4, %77,8 жана %47,2 тактык көрсөткүчтөрү билдирилген.
  • Позитивдүү concept model эки жаңы операциялык тармакка тактык жоготуусуз өткөн, үчүнчү тармакта %66,7ге түшкөн.
  • Социалдык басым камтылган кырдаалдарда позитивдүү түшүнүк шарты үйрөтүлбөгөн контролдук шартка караганда жогору чектөө шайкештигин көрсөткөн.
  • Бир Буддисттик этикалык баалуулук түшүнүгү пилотто беш moral-psychology кырдаалынын баарынан өткөн.
  • Эки CP үйрөтүү стратегиясы 200 үйрөтүү кырдаалынын ичинде miss rateти %100дөн %25тен төмөнгө түшүргөн.
  • Булак manifold жана attractor геометриясын Concept Programmingдин теориялык түшүндүрмө алкагы катары колдонот.

Изилдөө колдобогон натыйжалар

  • Concept Programming өндүрүш масштабындагы RLHFден жогору экени түздөн-түз көрсөтүлгөн эмес.
  • Punishment-analog prompting менен чыныгы RLHF бирдей эксперименталдык шарт эмес.
  • Frontier масштабындагы моделдерде да ошол эле натыйжа чыгары көрсөтүлгөн эмес.
  • Adversarial jailbreak чабуулдарына каршы жогору туруктуулук али сыналган эмес.
  • Жүрүм-турумдук тактыктын өсүшү өзүнчө эле модель ичинде өлчөнгөн attractor manifold бар экенин далилдебейт.
  • Адамдын түшүнүк үйрөнүүсү менен тил моделинин өкүлчүлүктөрү биологиялык жана эсептөө жагынан бирдей экени бул макалада түз көрсөтүлгөн эмес.
  • Курулуш тармагындагы %66,7 натыйжа бардык жаңы тармактарга кемчиликсиз өтүү жок экенин көрсөтөт.
  • Беш моралдык сценарийдеги ийгилик кеңири маданий баалуулуктарга шайкештиктин универсалдуу тастыктоосу эмес.

Негизги методологиялык чектөөлөр

Бардык колдонмо натыйжалар бир гана 3 миллиард параметрлүү моделден алынган.

Булак эч бир deployed frontier modelде эксперимент билдирбейт.

Punishment-analog шарты чыныгы RLHF fine-tuning эмес.

Jailbreak тибиндеги adversarial тесттер жүргүзүлгөн эмес.

Бул кыскача иш эксперименттердин толук протоколун камтыбайт; деталдар companion макалаларга калтырылган.

Attractor геометриясы эксперименттердин жүрүм-турумдук чыгыштарынан чыгарылган теориялык механизм катары чечмеленет жана бул жерде түз активдешүү мейкиндигин анализдөө менен тастыкталбайт.

Кызыкчылыктардын кагылышын чечмелөө

Автор Concept Programmingде колдонулган concept-instillation архитектурасына байланыштуу патенттик өтүнмөлөрү бар экенин билдирет.

Бул жагдай натыйжалар автоматтык түрдө жараксыз дегенди билдирбейт; бирок ыкманы баалоодо көз карандысыз репликация өзгөчө маанилүү экенин көрсөтүүчү тиешелүү кызыкчылык контексти.

Булак жана Ыкма Жөнүндө Эскертүү

Түпнуска аталышы: Grooves in Neural Manifolds: A Summary of the Argument and the Experimental Evidence

Автор: Frederick Roth

Булакта көрсөтүлгөн кызмат: Professor, Information Sciences, Naval Postgraduate School (Retired)

Булакта көрсөтүлгөн мүчөлүк: Fellow, Association for the Advancement of Artificial Intelligence

Булак түрү: Теориялык/концептуалдык синтез жана companion эксперимент натыйжаларынын кыскача макаласы.

Баштапкы булак статусу: Автор бул макала өзүнүн дооматтарынын баштапкы булагы эмес экенин ачык белгилейт.

Журнал / том / саны: Жүктөлгөн PDFде көрсөтүлгөн эмес.

Макаланын DOIси: Жүктөлгөн PDFде көрсөтүлгөн эмес.

Рецензия статусу: Жүктөлгөн PDFде рецензияланган басылма экенин ырастаган маалымат жок; рецензияланган акыркы макала катары көрсөтүлбөшү керек.

Борбордук теориялык доомат: Адамдын түшүнүк үйрөнүүсү жана үйрөтүлгөн тил моделдериндеги концептуалдык геометрия бекемдөө аркылуу калыптанган төмөн өлчөмдүү attractor түзүмдүн эки башка масштабдагы көрүнүшү деген гипотеза.

Борбордук колдонмо ыкма: Concept Programming (CP).

Пилоттук модель: Llama 3.2, 3 миллиард параметр, жергиликтүү Ollama иштетүүсү.

Governance-safety тести: 36 кырдаал.

Негизги пилоттук натыйжа: Позитивдүү concept training %94,4; punishment-analog %77,8; үйрөтүлбөгөн контролдук шарт %47,2; Fisher's exact test p<0,0001.

Трансфер: Оорукана жана кампа операцияларында булак тактык жоготуусун билдирбейт; курулуш аянтынын коопсуздугунда %66,7.

Социалдык басым тести: Позитивдүү concept model %92,6; үйрөтүлбөгөн контролдук шарт %44,4 чектөөнү сактоо.

Баалуулук түшүнүгү эксперименти: Бир Буддисттик этикалык баалуулук түшүнүгү менен беш moral-psychology сценарийинин бешөө тең өткөн.

Үйрөтүү чыгымы эксперименти: Эки үйрөтүү ыкмасы тең 200 кырдаал ичинде miss rateти %100дөн %25тен төмөнгө түшүргөн, бирок алдын ала белгиленген %95 stopping criterionга жеткен эмес.

Китеп: Grooves in Neural Manifolds: AI Reveals Why You Think What You Think, and How to Reshape It.

Китептин DOIси: 10.5281/zenodo.21966428.

Техникалык companion иш 1: Concept Programming for Dependable AI.

Техникалык companion иш 2: Neural manifolds, assemblies, and cross-domain interference.

Код: Булак companion эксперименттердин коду github.com/ricodoco/safety-concept-experiment дарегинде жалпыга ачык экенин билдирет.

Кызыкчылыктардын кагылышы: Автор concept-instillation архитектурасына байланыштуу патенттик өтүнмөлөрү бар экенин билдирет.

Каржылоо: Бул кыскача PDFде өзүнчө каржылоо билдирүүсү жок.

Маалымат жеткиликтүүлүгү: Бул кыскача PDFде өзүнчө маалымат жеткиликтүүлүгү бөлүмү жок; эксперимент протоколдору жана код үчүн companion иштерге багыттама берилет.

Негизги илимий чечмелөө чеги: Пилоттун жүрүм-турумдук өндүрүмдүүлүк натыйжалары түз билдирилген; адамдын аң-сезими менен тил моделинин геометриясы бир механизм деген доомат жана өндүрүмдүүлүк attractor геометриясынан келип чыгат деген түшүндүрмө теориялык frameworkтун бөлүгү. Ошондой эле punishment-analog шарты чыныгы RLHF эмес болгондуктан, пилоттук натыйжаны RLHFге түз артыкчылык катары көрсөтүүгө болбойт.


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты