Академиялык изилдөөлөр, түшүнүктүү тил

Verianla | Кыргызча академиялык изилдөөлөр жана илим

27 сентябрь 2026, Жекшемби
VERİANLAКөз карандысыз илимий басма
Менюну ачуу же жабуу
...
Башкы бет / Физикалык илимдер / Химия / SpecTUS: EI-MS спектрлеринен белгисиз түзүлүштөрдү аннотациялоо үчүн спектрдик котормочу
Химия

SpecTUS: EI-MS спектрлеринен белгисиз түзүлүштөрдү аннотациялоо үчүн спектрдик котормочу

Бул изилдөө газ хроматографиясы–электрондук иондоштуруучу масс-спектрометрия (GC-EI-MS) аркылуу алынган төмөн ажыратуучулуктагы масс-спектрден молекулалык түзүлүштү түздөн-түз жаратууну максат кылган SpecTUS аттуу терең үйрөнүү моделин тааныштырат.

14/08/2026  Veri Anla 49 көрүү
SpecTUS: EI-MS спектрлеринен белгисиз түзүлүштөрдү аннотациялоо үчүн спектрдик котормочу

Бул изилдөө газ хроматографиясы–электрондук иондоштуруучу масс-спектрометрия (GC-EI-MS) аркылуу алынган төмөн ажыратуучулуктагы масс-спектрден молекулалык түзүлүштү түздөн-түз жаратууну максат кылган SpecTUS аттуу терең үйрөнүү моделин тааныштырат. Салттуу EI-MS идентификация ыкмалары көбүнчө өлчөнгөн спектрди эталондук спектр китепканасынан издейт. SpecTUS болсо суралган кошулманын спектр китепканасында болушун талап кылбастан, спектрдеги масса/заряд жана интенсивдүүлүк маалыматтарын иштетип, молекуланы SMILES тизмеги катары жаратууга аракет кылат.

SpecTUS 354 миллион үйрөтүлүүчү параметрге ээ encoder–decoder Transformer архитектурасы. Модель алгач NEIMS жана RASSP тарабынан түзүлгөн кеңири синтетикалык EI-MS маалымат топтомдорунда алдын ала үйрөтүлүп, андан кийин NIST 20 эксперименттик GC-EI-MS спектрлери менен майда жөнгө салынган. Моделдин киришин спектрдеги m/z жана салыштырмалуу интенсивдүүлүк жуптары, ал эми чыгышын символдон символго түзүлгөн молекулалык SMILES көрсөтмөсү түзөт.

NIST 20дан бөлүнгөн 28.267 спектрлик тест топтомунда SpecTUS бир гана түзүлүш сунуштаганда кошулмалардын %43 бөлүгүн так кайра түзгөн. Он талапкер чыгарылганда толук кайра түзүү көрсөткүчү %65ке, 50 талапкер сценарийинде %69га өскөн. Бир талапкер сценарийинде SpecTUS сунушу Morgan манжа изинин Tanimoto окшоштугу жана так дал келүү текшерүүсүнө негизделген салыштырууда NIST тест үлгүлөрүнүн %76 бөлүгүндө гибриддик маалымат базасы издөөсүнүн натыйжасынан жакшы болгон; он талапкерлик салыштырууда бул көрсөткүч %84.

Натыйжалуулук бардык маалымат булактарында бирдей эмес. Катаалыраак курацияланган NIST жана SWGDRUG спектрлеринде натыйжалар жогору болсо, Cayman жана MONA сыяктуу гетерогендүү маалымат топтомдорунда тактык төмөндөгөн. Мындан тышкары, окутуу топтомундагы түзүлүштөргө барган сайын азыраак окшош молекулалар тандалганда натыйжалуулук кескин төмөндөйт. Ошондуктан изилдөө SpecTUS окутуу учурунда көрбөгөн кошулмаларга белгилүү деңгээлде жалпылай аларын көрсөтөт, бирок толугу менен жаңы химиялык түзүлүш мейкиндиги чечилди дегенди билдирбейт.

Türkiye үчүн бул иш соттук химия, экологиялык анализ, дары/баңги зат анализи жана чакан молекулаларды мүнөздөөдө GC-EI-MS колдонгон изилдөө лабораториялары үчүн методологиялык жактан кызыктуу. Бирок модель Türkiyeдеги лабораториялык аспаптарда, үлгү даярдоо процесстеринде же жергиликтүү аналит топтомдорунда өзүнчө текшерилген эмес. Айрыкча спектрдин сапаты жана өлчөө протоколу натыйжалуулукка таасир эткендиктен, жергиликтүү колдонуу үчүн көз карандысыз текшерүү жана эксперт химиктин баалоосу керек.

Эмне үчүн спектр китепканасынан издөөдөн башка ыкма керек?

GC-MS анализинде кошулмалар алгач газ хроматографиясы менен бөлүнөт. Андан соң нейтралдуу молекулалар иондоштурулуп, масс-спектрометр пайда болгон иондордун масса/заряд катыштарын (m/z) жана салыштырмалуу молдугун өлчөйт. Натыйжа ар бир кошулмага тиешелүү спектрдик чокулардын жыйындысы.

Изилдөөнүн негизги объектиси электрондук иондоштуруу (EI). GC-EI-MSте ондогон жылдар бою кеңири колдонулган болжол менен 70 eV электрон энергиясы ар башка спектр китепканаларында салыштырмалуу туруктуу фрагментация үлгүлөрүн түзө алат. Бирок бир эле кошулманын спектринде аспапка жана өлчөө шарттарына байланыштуу айырмачылыктар баары бир болушу мүмкүн.

Салттуу ыкмада суроо спектри өлчөнгөн эталон спектрлери менен салыштырылат. Изилдөө эки негизги ыкманы колдонот:

  • Simple Similarity Search (SSS): окшош m/z маанилериндеги спектрдик чокуларды дал келтирет.
  • Hybrid Similarity Search (HSS): фрагмент иондору менен бирге нейтралдуу жоготууларды да колдонот жана суроо менен эталон молекуланын молекулалык салмак айырмасын эске алат.

HSS айрыкча суралган кошулма китепканада жок болсо SSSке караганда пайдалуураак болушу мүмкүн. Бирок ыкманын маанилүү чеги — суралган кошулманын туура молекулалык салмагы тууралуу маалыматты колдонушу; бул маалыматты төмөн ажыратуучулуктагы EI-MS спектрлеринен дайыма ишенимдүү алуу мүмкүн эмес.

Андан да негизги чектөө — спектр китепканасынын камтуу көлөмү. Кошулма эталондук китепканада таптакыр жок болсо стандарттык издөө туура молекуланын өзүн кайтара албайт; бар талапкерлердин ичинен гана эң жакын түзүлүштү сунуштайт. SpecTUS спектрден түздөн-түз жаңы молекулалык түзүлүш жаратууга аракет кылуу менен бул чектөөнү жеңүүнү көздөйт.

SpecTUSтун негизги идеясы кандай?

SpecTUS маселени бир түрдөгү “которуу” маселеси катары карайт. Табигый тил модели бир тилдеги тизмекти башка тилдеги тизмекке өзгөрткөндөй, модель EI-MS спектрин молекулалык түзүлүш көрсөтмөсүнө айландырат:

EI-MS спектри → Transformer → SMILES молекула тизмеги

Кириш тарабында ар бир спектрдик чоку эки маалыматты камтыйт: бүтүн санга тегеректелген m/z мааниси жана салыштырмалуу интенсивдүүлүк. Чыгыш тарабында модель молекулалык түзүлүштү SMILES символдорун авторегрессивдүү түрдө, башкача айтканда, буга чейин чыгарган символдорун колдонуп кезеги менен жаратуу аркылуу түзөт.

Моделдин архитектурасы канчалык чоң?

SpecTUS BART ыкмасына негизделген 354 миллион үйрөтүлүүчү параметрлүү encoder–decoder Transformer. Булакта архитектуранын негизги өлчөмдөрү төмөнкүдөй берилет:

Архитектура өзгөчөлүгүSpecTUS мааниси
Encoder блокторунун саны12
Decoder блокторунун саны12
Attention head саны16
Embedding өлчөмү1024
Feed-forward жашыруун катмарынын өлчөмү4096
Жалпы үйрөтүлүүчү параметр354 миллион

Моделдин кириш чектери эң көп 300 спектрдик чоку, эң чоң m/z = 500 жана эң көп 100 символдук SMILES деп белгиленген. Бул чыпкалар NIST маалыматтарынын болжол менен %3 бөлүгүнүн чыгарылышына алып келген.

Спектр модель үчүн кантип коддолот?

Изилдөөдө m/z маанилери эң жакын бүтүн санга тегеректелет. Салыштырмалуу интенсивдүүлүктөр түздөн-түз өтө жогорку тактыктагы сандык кириш катары колдонулбастан, логарифмдик интервалдарга бөлүнөт. Акыркы моделде интенсивдүүлүк маанилери негизи 1,28 болгон логарифмдик өзгөртүү менен 30 bin ичинде көрсөтүлөт.

Модель үч үйрөтүлүүчү embedding топтомун колдонот:

  • m/z маанилери үчүн embedding,
  • интенсивдүүлүк binдери үчүн embedding,
  • SMILES символдору үчүн embedding.

Encoderге берилген ар бир спектрдик чокунун көрсөтмөсү m/z embeddingи менен интенсивдүүлүк embeddingинин суммасынан түзүлөт. Decoder тарабында ар бир кадам бир SMILES символун көрсөтөт.

Синтетикалык маалыматтар эмне үчүн колдонулган?

Реалдуу эксперименттик GC-EI-MS спектрлеринин саны мүмкүн болгон молекулалык түзүлүш мейкиндигине салыштырмалуу чектелүү. Ошондуктан изилдөөчүлөр моделди адегенде кыйла кең синтетикалык химия мейкиндигинде үйрөтүп, андан кийин реалдуу эксперименттик спектрлерге ыңгайлаштырган.

ZINC20дан башында болжол менен 1,8 миллиард SMILES тизмеги чогултулган. Ар бир маалымат чогултуу раундунда 100 символдон кыска 30 миллион бузулбаган SMILES кокус тандалып, андан соң түзүлүштөр каноникалдаштырылып, кайталанган жазуулар алынып салынган жана стереохимия маалыматы өчүрүлгөн. NIST 20да бар кошулмалар маалымат агып кетишинин алдын алуу үчүн синтетикалык алдын ала окутуу кошулмаларынан чыгарылган.

RASSP иштете алган элементтик жана субформула чектөөлөрүнөн кийин эки чогултуу раундунда болжол менен 4,7 миллион жана 4,8 миллион кошулма калган. Ар бир кошулма үчүн NEIMS жана RASSP моделдеринин экөө менен тең бирден спектр түзүлгөндүктөн, синтетикалык маалымат жыйнактары жалпысынан болжол менен 9,4 миллион жана 9,6 миллион спектрди камтыган. Бул маалымат топтомдору окутуу/текшерүү/тест үчүн 0,90/0,05/0,05 катышында бөлүнгөн.

Алдын ала окутуу канча убакытка созулган?

Акыркы SpecTUS алдын ала окутуусу NEIMS жана RASSP булактарынын 1:1 тең салмакталган аралашмасында жүргүзүлгөн. Булак акыркы алдын ала окутуу баскычында 17,2 миллион окутуу спектри болжол менен үч жолу иштетилгенин билдирет.

Алдын ала окутуу өзгөчөлүгүМаани
Batch өлчөмү128
Жаңыртуу кадамы448.000
Аппараттык камсыздоо1 × NVIDIA H100 GPU
Жалпы убакыт58 саат

Алдын ала окутуунун аягында түзүлүштү так кайра түзүү көрсөткүчү RASSP чыгарган спектрлерде %38, NEIMS спектрлеринде %29 жана реалдуу NIST спектрлеринде болгону %3 болгон. Ошол эле учурда чыгарылган SMILES тизмектеринин %96 бөлүгү жарактуу каноникалык молекула экени билдирилген. Изилдөөчүлөр муну алдын ала окутуу молекулалык түзүлүш эрежелерин жана атомдук масса–m/z байланышын үйрөнүү үчүн негиз түзгөн деп чечмелешет.

Реалдуу NIST спектрлери менен майда жөнгө салуу кантип жүргүзүлгөн?

NIST 20 GC-EI-MS китепканасында бузулган же аннотацияланбаган спектрлер тазаланып, стереохимия маалыматы алынып, SMILES көрсөтмөлөрү каноникалдаштырылган жана дейтерий камтыган кошулмалар чыгарылган. Моделдин m/z, чоку саны жана SMILES узундугу чектери да колдонулган.

Деталдуу метод бөлүмүндө акыркы NIST бөлүштүрүүсү төмөнкүдөй берилет:

NIST 20 ички топтомуСпектр саны
Окутуу224.737
Текшерүү28.177
Тест28.267

Кайталанган кошулмалардын ар башка splitтерге түшүшүнө жол берилген эмес. Ошентип, бир эле молекуланын окутуу жана тест топтомдорунда болушун алдын алууга аракет кылынган.

Булак ичиндеги сан эскертмеси: Макаланын башка бөлүмдөрүндө NIST окутуу/майда жөнгө салуу көлөмү 232.025 жана 232.035 деп да жазылган. Деталдуу маалымат топтому бөлүмүндөгү 224.737 окутуу спектринин мааниси бул эки санга дал келбейт. Ошондуктан бул үч сан бир “оңдолгон” мааниге бириктирилбеши керек.

Майда жөнгө салуу канча убакытка созулган?

Модель NIST окутуу топтомунда 296.000 жаңыртуу кадамы боюнча үйрөтүлүп, ар бир спектр болжол менен 80 жолу иштетилгени айтылат. Майда жөнгө салуу кайрадан бир NVIDIA H100 GPUда текшерүү баалоолорун кошкондо болжол менен 28 саатка созулган.

Кызыгы, NIST майда жөнгө салуусу учурунда моделдин синтетикалык спектрлерди так кайра түзүү жөндөмү тез төмөндөсө да, эксперименттик NIST текшерүү натыйжасы кескин жогорулаган. Изилдөө муну модель синтетикалык маалымат бөлүштүрүүсүнөн реалдуу эксперименттик бөлүштүрүүгө ыңгайлашканынын натыйжасы катары көрсөтөт.

Кайсы дизайн тандоолору эксперименттик түрдө салыштырылган?

Изилдөөчүлөр акыркы моделди гана билдирбестен, беш өзүнчө өнүктүрүү экспериментин жүргүзгөн.

1. Интенсивдүүлүктү binге бөлүү

Сызыктуу жана логарифмдик интенсивдүүлүк көрсөтүү ыкмалары салыштырылган. Өтө орой көрсөтүү, айрыкча төмөн интенсивдүүлүктөгү чокуларда, маалымат жоготуусуна алып келген. 30 binдик логарифмдик ыкма төрт ондук орундуу сызыктуу коддоого салыштырмалуу текшерүү Acc1 көрсөткүчүн болжол менен 0,9 пайыздык пунктка жогорулатып, ошол эле учурда болжол менен 10 миллионго аз үйрөтүлүүчү параметр талап кылган жана акыркы модель үчүн тандалган.

2. SMILES, SELFIES жана токенизация

SMILES негизиндеги моделдер SELFIES негизиндеги моделден текшерүү Acc1 боюнча 1,7–5,8 пайыздык пунктка жогору натыйжа көрсөткөн. Ошондой эле табигый тил моделдеринде көп учурда пайдалуу болгон чоң Byte Pair Encoding сөздүктөрү бул жерде артыкчылык берген эмес. Эң жөнөкөй символ деңгээлиндеги SMILES коддоосу башка BPE варианттарына караганда болжол менен 3,5–4 пайыздык пунктка жакшы натыйжа берген.

3. Синтетикалык алдын ала окутуу аралашмасы

Синтетикалык алдын ала окутуу албаган модель менен RASSP, NEIMS жана алардын аралашмалары салыштырылган. Синтетикалык алдын ала окутуудан өткөн моделдер реалдуу маалыматта гана майда жөнгө салынган моделге салыштырмалуу текшерүү Acc1 көрсөткүчүндө болжол менен 7–10 пайыздык пункт артыкчылык берген. NEIMS жана RASSPтин 1:1 аралашмасы эң жакшы натыйжа көрсөткөн.

4. Спектр булагынын белгиси

<rassp>, <neims> жана <nist> сыяктуу атайын булак токендерин колдонуу акыркы натыйжалуулукка олуттуу салым кошкон эмес. Бир жалпы булак токенин колдонгон вариант Acc1 боюнча болжол менен 0,2 пайыздык пунктка жогору натыйжа көрсөткөн. Ошого карабастан, изилдөөчүлөр келечекте атайын маалымат топтомдоруна майда жөнгө салуу үчүн булак токени механизмин акыркы моделде сактап калышкан.

5. Окутуу убактысын жана маалымат көлөмүн масштабдоо

Алдын ала окутуу убактысы, майда жөнгө салуу убактысы жана синтетикалык маалыматтын көлөмү өз-өзүнчө көбөйтүлгөндө натыйжалуулук жакшырган. Акыркы толук масштабдуу `8.6M_448k_296k` конфигурациясы баштапкы `4.2M_112k_74k` моделге салыштырмалуу Acc1 көрсөткүчүн 5,4 пайыздык пунктка жогорулаткан.

Изилдөө чыгышты кантип баалайт?

Acck — модель чыгарган алгачкы k талапкердин ичинде чыныгы молекуланын так табылуу үлүшү. Бул метрика жөн гана окшош түзүлүштү эмес, молекуланын так дал келишин баалайт.

Simk — k талапкердин ичинде чыныгы молекулага эң окшош түзүлүштүн Morgan молекулалык манжа изи боюнча Tanimoto окшоштугун өлчөйт.

Изилдөө ошондой эле SpecTUSту башка ыкма менен түз салыштыруу үчүн win rate жана at-least-as-good көрсөткүчтөрүн колдонот. Tanimoto манжа издери ар башка молекулаларда кээде 1,0 окшоштук бере алгандыктан, рейтинг функциясына түзүлүштүн так дал келишин текшерүү да кошулган.

Эмне үчүн BDC деген жасалма салыштыруу колдонулат?

Best Database Candidate (BDC) — реалдуу колдонууда жеткиликсиз теориялык жогорку чек. BDC суроо молекуласынын чыныгы түзүлүшүн алдын ала билебиз деп эсептеп, эталондук китепканадагы түзүлүштөрдүн ичинен Morgan манжа изи боюнча ага эң жакынын тандайт.

Демек, BDC практикалык идентификация ыкмасы эмес. Изилдөөдөгү максаты — “маалымат базасында андан жакшы түзүлүш таптакыр жок болсо, издөө алгоритмин жакшыртуунун чеги кандай?” деген суроого жогорку чек берүү.

Сүрөт 1 эмнени түшүндүрөт?

Изилдөөнүн метод схемасы SpecTUSтун эки баскычтуу окутуусун жана акыркы чыгарылышын чогуу көрсөтөт. Алдын ала окутуу тарабында ZINCтен алынган SMILES түзүлүштөрү NEIMS/RASSP аркылуу синтетикалык спектрлерге айландырылып, SpecTUSка үйрөтүлөт. Майда жөнгө салуу баскычында эксперименттик NIST спектрлери жана чыныгы SMILES белгилери колдонулат. Чыгаруу учурунда агым тескери багытта иштейт: анализделген EI-MS спектри түздөн-түз SpecTUSка кирип, модель иреттелген бир же бир нече SMILES талапкерин чыгарат.

Изилдөө колдогон жыйынтыктар

  • SpecTUS тест кошулмалары окутуу маалымат топтомдорунан бөлүнүп турганда да төмөн ажыратуучулуктагы GC-EI-MS спектрлеринен жаңы молекулалык түзүлүш талапкерлерин жарата алган.
  • NIST тест топтомунда бир талапкердин так түзүлүш тактыгы %43, 10 талапкердин тактыгы %65 жана 50 талапкердин тактыгы %69.
  • NISTте бир SpecTUS талапкери HSSтин бир талапкерине караганда үлгүлөрдүн %76 бөлүгүндө жакшы структуралык талапкер чыгарган.
  • NIST жана SWGDRUG сыяктуу жакшыраак курацияланган спектрлерде модель Cayman жана MONAга караганда жогорку натыйжа көрсөткөн.
  • Синтетикалык маалыматта алдын ала окутуу эксперименттик NIST маалыматы менен гана окутууга караганда жогорку текшерүү натыйжалуулугун камсыз кылган.
  • Бир нече синтетикалык спектр генераторун бирге колдонуу бир булакка караганда артыкчылык берген.

Изилдөө колдобогон же далилдебеген жыйынтыктар

  • SpecTUS ар бир белгисиз молекуланы ишенимдүү аныктай алган универсалдуу химиялык идентификация системасы эмес.
  • Моделдин биринчи орундагы чыгышы көз карандысыз текшерүүсүз так идентификация далили катары каралбашы керек.
  • Модель толугу менен жаңы жана окутуу химиясынан өтө алыс түзүлүштөрдө жогорку тактык кепилдигин бербейт.
  • Изилдөө модель лаборатория адисин алмаштыра аларын көрсөткөн эмес.
  • Моделдин чыгыштарын фрагментация дарагы же чоку-аннотация механизми аркылуу түшүндүрүүгө болору көрсөтүлгөн эмес.
  • Cayman жана MONAдагы натыйжалуулуктун төмөндөшү бардык лабораториялык жана аспаптык шарттарда бирдей тактык күтүүгө болбой турганын көрсөтөт.

Изилдөөнүн Методу жана Жыйынтыктары

Баалоо маалымат топтомдору

Модель NIST тест splitинде гана эмес, көз карандысыз булактардан алынган SWGDRUG, Cayman жана MONA EI-MS маалыматтарында да бааланган. Окутуу маалыматтары менен дал келген кошулмалар жана моделдин чектеринен ашкан үлгүлөр чыгарылгандан кийин колдонулган спектр сандары төмөнкүдөй:

Тест маалымат топтомуБаштапкы спектр саныЧыпкадан кийин колдонулган спектр саны
NIST test29.21828.267
SWGDRUG3.5891.640
Cayman2.262469
MONA18.9145.015

Чыпкалоо NIST окутуу топтому менен дал келгендерди алып салууну, дейтерий камтыган түзүлүштөрдү чыгарууну, m/z > 500 болгон үлгүлөрдү, 300дөн ашык спектрдик чокусу бар спектрлерди жана 100 символдон узун SMILES тизмектерин алып салууну камтыйт.

NISTте молекуланы так кайра түзүү

NISTтеги 28.267 тест спектри изилдөөнүн эң кеңири жана жакшы көзөмөлдөнгөн баалоосу. Талапкерлердин саны көбөйгөндө чыныгы молекуланын сунуштар тизмесинде табылуу ыктымалдыгы өсөт.

Verianla Live: NIST тест топтомунда түзүлүштү так кайра түзүү

Таблицадагы үлүштөр SpecTUS чыгарган алгачкы 1, 10 же 50 талапкердин ичинде чыныгы молекуланын так табылуу пайызын көрсөтөт.

Талапкер саныТолук кайра түзүү (%)Көрсөткүч
1 талапкер43Acc1
10 талапкер65Acc10
50 талапкер69Acc50
 

Verianla Live: Визуалдаштыруу көрүнгөн илимий маалымат таблицасынан түзүлөт; таблица илимий source-of-truth катары сакталат.

Бир талапкерден 10 талапкерге өтүү 22 пайыздык пункт кошумча так дал келүүнү берет. Ал эми 10 талапкерден 50 талапкерге өтүү болгону 4 пайыздык пункт кошумча утуш берет. Бул жыйынтык талапкерлердин санын чексиз көбөйтүү эксперттик баалоонун жүгү менен чогуу каралышы керектигин көрсөтөт.

Эмне үчүн көп талапкер чыкканда эксперт дагы эле керек?

SpecTUS ар бир талапкер үчүн өзүнүн рейтинг ыктымалдыгын чыгарат; бирок изилдөөчүлөр бул рейтинг эксперттик баалоону алмаштыра тургандай ишенимдүү эмес экенин табышкан. Атүгүл 10 талапкер чыгарылган сценарийдеги моделдин биринчи орундагы талапкери орточо алганда бир гана талапкер чыгарылган сценарийдеги талапкерге караганда бир аз төмөн тактыкка ээ.

Ошондуктан изилдөө үч колдонуу сценарийин аныктайт:

  • 1 талапкер: кол менен текшерүү жүгү эң аз, чоң көлөмдөгү анализдерге ылайыктуу; бирок тактык төмөнүрөөк.
  • 10 талапкер: тактык менен эксперттик текшерүү жүгүнүн ортосунда тең салмактуураак сценарий.
  • 50 талапкер: моделдин мүмкүнчүлүгүн жогорулатат, бирок кол менен текшерүү жүгүн олуттуу көбөйтөт.

Структуралык окшоштук боюнча HSS менен салыштыруу

NIST тестинде SpecTUSтун бир талапкер үчүн орточо Morgan/Tanimoto окшоштугу 0,67. HSSтин 50 талапкерлик жыйынтыгында да бул маани 0,62 деп берилген. SWGDRUGда SpecTUS бир талапкердин орточо көрсөткүчү 0,69, ал эми HSS50 көрсөткүчү 0,61.

Маалымат топтомуSpecTUS 1 талапкер Sim1HSS 50 талапкер Sim50BDC теориялык жогорку чегиSpecTUS 10 талапкер Sim10
NIST test0,670,620,720,81
SWGDRUG0,690,610,690,82

Он талапкерлик SpecTUS бул эки маалымат топтомунда эталондук китепканадагы мүмкүн болгон эң жакын молекуланы көрсөткөн BDC маанисинен да жогору орточо окшоштук бере алат. Себеби SpecTUS китепканадагы бар түзүлүштөрдүн ичинен гана тандоого милдеттүү эмес жана жаңы түзүлүштөрдү жарата алат.

HSSке каршы түз утуш көрсөткүчү

NIST тестинде бир талапкерлик SpecTUS ошол эле шарттагы HSS талапкеринен тест үлгүлөрүнүн %76 бөлүгүндө так жакшыраак түзүлүш сунуштаган. Он талапкерлик учурда бул көрсөткүч %84кө жетет. Булактагы бардык талапкер сценарийлери чогуу каралганда NISTтеги SpecTUS–HSS утуш көрсөткүчү %76–86 аралыгында.

SWGDRUG үчүн диапазон %72–85, Cayman үчүн %63–74, MONA үчүн %62–65 деп берилет. Спектрлердин курация сапаты төмөндөгөн сайын SpecTUSтун артыкчылыгы да тартылаары кириш маалыматтын сапатына сезгичтикти ачык көрсөтөт.

Маалымат базасынын теориялык эң жакшы талапкеринен да ашууга болобу?

BDC суроонун чыныгы түзүлүшүн алдын ала билебиз деп эсептеген теориялык маалымат базасынын жогорку чеги. Ошого карабастан, NISTте бир SpecTUS талапкери учурлардын %47 бөлүгүндө, SWGDRUGда %45 бөлүгүндө BDCден жакшы жыйынтык берген.

Он талапкер чыгарылганда SpecTUS NIST жана SWGDRUG экөөндө тең үлгүлөрдүн %70 бөлүгүндө BDCден жакшы, ал эми Caymanда %56 бөлүгүндө жакшы талапкер түзө алган. Бул de novo жаратуунун негизги артыкчылыгын көрсөтөт: туура же жакыныраак молекулалык түзүлүш эталондук китепканада жок болсо да, модель жаңы талапкер чыгара алат.

Сүрөт 3түн негизги мааниси

Сүрөт 3 SSS, HSS жана SpecTUSтун NIST, SWGDRUG, Cayman жана MONAдагы орточо структуралык окшоштуктарын 1, 10 жана 50 талапкер сценарийлеринде чогуу көрсөтөт. SpecTUSтун тактык маанилери өзүнчө кара белгилер менен берилген.

NIST жана SWGDRUG тилкелеринде SpecTUSтун артыкчылыгы эң ачык көрүнөт. Cayman жана өзгөчө MONAга өткөндө бардык ыкмалардын структуралык окшоштугу төмөндөп, SpecTUS менен HSSтин айырмасы кыскарат. Изилдөөчүлөр муну спектрлердин алынуу жана курация сапатындагы айырмачылыктар менен байланыштырышат.

Сүрөт 4 эмнени көрсөтөт?

Сүрөт 4түн A панели SpecTUSту HSS менен, B панели болсо теориялык BDC жогорку чеги менен түз салыштырат. Кызыл тилкелер SpecTUS так артык болгон үлгүлөрдү, ал эми ачык түстөгү кошумча бөлүк тең чыгыштар да кошулган “андан кем эмес жакшы” үлүштү көрсөтөт.

NIST жана SWGDRUGда талапкерлердин саны көбөйгөн сайын SpecTUSтун HSSке карата артыкчылыгы айкын болот, MONAда болсо кошумча талапкерлерден алынган пайда чектүүрөөк. Бул көрүнүш көбүрөөк талапкер чыгаруу өзү эле сапатсыз спектрдик маалыматты толук компенсациялай албасын көрсөтөт.

Модель чындап толугу менен жаңы химияга жалпылайбы?

Изилдөөнүн эң маанилүү чектик сыноолорунун бири — тест молекулаларынын окутуу топтомундагы түзүлүштөргө структуралык окшоштугун системалуу түрдө азайтуу. Изилдөөчүлөр maximum common edge subgraph (MCES) аралык өлчөмүн колдонуп, NIST тест топтомун барган сайын айырмаланган молекулалар менен чектешкен.

Аралык чеги T = 10 болгондо баштапкы NIST тест топтомунун болгону %1,7 бөлүгү, башкача айтканда, 469 түзүлүш калган. Ушул эң кыйын шартта SpecTUS 10 талапкердин ичинде болгону 19 молекуланы так кайра түзө алган, ал эми орточо структуралык окшоштук 0,38 деңгээлине түшкөн.

Бул жыйынтык болжол менен %4 Acc10га туура келет жана моделдин функционалдык чегин ачык көрсөтөт. SpecTUS мурда көрбөгөн молекулаларды божомолдой алганы менен, окутуу маалында үйрөнгөн химиялык үлгүлөрдөн таптакыр алыс түзүлүштөргө жогорку жалпылоону көрсөтпөйт.

Типтүү түзүлүш божомол каталары кайсылар?

Сүрөт 5те NIST тест топтомунан 200 кокус суроонун SpecTUS10 жана HSS10 окшоштуктары салыштырылып, беш мисал деталдуу көрсөтүлгөн. Изилдөөчүлөр үч типтүү ката формасын аныкташат:

  • кайталануучу көмүртек чынжырларын керектүүдөн узун же кыска кылып жаратуу,
  • туура функционалдык топту туура эмес ароматтык шакек атомуна байланыштыруу,
  • чоң молекулалык субструктураларды өздөрүн туура чечип, бирок аларды бири-бирине туура эмес кошуу.

Сүрөт 5 Tanimoto/Morgan өлчөмүнүн өз чектөөсүн да көрсөтөт. Узун жана кайталануучу чынжырларда эки башка молекула кээде бирдей манжа изине ээ сыяктуу Tanimoto = 1 натыйжасын бере алат. Ошондуктан изилдөө түзүлүштүн так дал келишин өзүнчө текшерет.

Чыгаруу ылдамдыгы

Модель үч башка аппараттык класста текшерилген. Төмөнкү маанилер бир спектр үчүн 1, 10 же 50 түзүлүш талапкерин чыгаруу убактысы:

Аппараттык камсыздоо1 талапкер10 талапкер50 талапкер
NVIDIA H100 80 GB0,2 s0,4 s1,9 s
NVIDIA Quadro RTX 5000 16 GB0,5 s1,1 s7,6 s
Xeon Gold 6130 CPU + 8 GB RAM8 s36 s450 s

Бул убакыттар модель лабораториялык иш агымдарында колдонууга жарай турганын көрсөтөт, бирок алар аппараттык камсыздоого көз каранды. Айрыкча CPUда 50 талапкер чыгаруу 7,5 мүнөткө жетет; демек, “тез” деген мүнөздөмө талапкер саны жана аппараттык контексттен өзүнчө колдонулбашы керек.

Түшүндүрүлүү чеги

SpecTUS белгилүү бир молекуланы эмне үчүн чыгарганын химиялык фрагментация кадамдары аркылуу түшүндүрбөйт. Моделдин аралык чыгышында чоку аннотациялары, фрагментация дарактары же сунушталган талапкерлердин эталон спектрлери жок.

Бул жагдай туура эмес талапкерди эксперттин кадам сайын оңдоосун кыйындатат. Модель күчтүү талапкер генератору болгону менен, божомолдун химиялык негизин өз алдынча түшүндүргөн курал эмес.

Жыйынтыктардын илимий мааниси

Изилдөөнүн негизги жаңылыгы — төмөн ажыратуучулуктагы GC-EI-MSте спектр китепканасын гана издебестен, спектрди түздөн-түз молекулалык түзүлүшкө которгон чоң Transformer моделин колдонуу. Тест кошулмаларынын окутуу кошулмаларынан бөлүнүшү SpecTUS жөн гана жаттап албаганын жана белгилүү бир жалпылоо жөндөмүн өнүктүргөнүн колдойт.

Бирок структуралык жактан өтө алыс тест кошулмаларындагы кескин натыйжалуулук төмөндөшү моделдин “белгисиз” түшүнүгүнүн чектерин көрсөтөт. Модель окутууда так көрбөгөн түзүлүштөрдү жарата алат, бирок муну негизинен мурда үйрөнгөн химиялык субүлгүлөрдү жаңы комбинацияларда бириктирүү аркылуу аткарат.

Булак жана Метод Эскертмеси

Толук оригиналдуу изилдөө аталышы: SpecTUS: Spectral Translator for Unknown Structures Annotation from EI-MS Spectra

Авторлор жана тартиби: Adam Hájek; Michal Starý; Elliott Price; Filip Jozefov; Helge Hecht; Aleš Křenek.

Тең салым / тең биринчи авторлук: Каралган изилдөөдө тең салым тууралуу билдирүү жок.

Жооптуу автор: Aleš Křenek.

Мекемелер: Adam Hájek жана Aleš Křenek — Institute of Computer Science, Masaryk University, Brno, Czech Republic. Michal Starý — School of Computation, Information and Technology, Technical University Munich, Garching bei München, Germany. Elliott Price жана Helge Hecht — RECETOX, Masaryk University, Brno, Czech Republic. Filip Jozefov — Faculty of Informatics, Masaryk University, Brno, Czech Republic.

Булак түрү / рецензиялоо: Рецензиядан өткөн изилдөө макаласы.

Журнал: Analytical Chemistry.

Басма: American Chemical Society.

Библиографиялык маалымат: Anal. Chem. 2026, 98, 21670–21682.

DOI: 10.1021/acs.analchem.6c02423.

Жөнөтүү / ревизия / кабыл алуу / жарыялоо: 14 апрель 2026 / 29 июнь 2026 / 30 июнь 2026 / 13 июль 2026.

Расмий шилтеме:https://doi.org/10.1021/acs.analchem.6c02423

Лицензия: Creative Commons Attribution 4.0 International (CC BY 4.0).

Маалымат жана код жеткиликтүүлүгү: Изилдөөнүн баштапкы коду, маалымат даярдоо жана баалоо иш агымдары GitHub аркылуу бөлүшүлгөн. Синтетикалык маалымат топтомдору жана алдын ала үйрөтүлгөн модель Hugging Faceде жарыяланган. Бирок NISTтин коммерциялык лицензия шарттарына байланыштуу NIST 20да майда жөнгө салынган акыркы моделди эркин таратууга болбойт. NIST лицензиясы бар колдонуучулар жарыяланган splitтер жана скрипттер менен майда жөнгө салууну кайра жүргүзө алары айтылган.

Кызыкчылыктардын кагылышы: Авторлор атаандаш финансылык кызыкчылыктар жок экенин билдиришет.

Каржылоо: Изилдөө Чехиянын Билим берүү, жаштар жана спорт министрлигинин e-Infrastruktura CZ (LM2023054) жана RECETOX Research Infrastructure (LM2023069) долбоорлору, ошондой эле Европа Бирлигинин Horizon 2020 программасынын CETOCOEN Excellence долбоору (857560) тарабынан колдоого алынган. Эсептөө ресурстары e-INFRA CZ долбоорунун No. 90254 бөлүгү аркылуу берилген.

Автордук салымдар: Adam Hájek SpecTUSту ишке ашырып, эксперимент дизайнына катышкан, эксперименттерди жүргүзгөн жана макаланы жазууга салым кошкон. Michal Starý модель жана эксперимент дизайнына салым кошкон. Elliott Price маалымат даярдоо, эксперимент дизайны жана баалоо үчүн багыт берген. Filip Jozefov маалымат даярдоо/split иштерин жана синтетикалык маалымат түзүүнү ишке ашырган. Helge Hecht баалоого салым кошкон. Aleš Křenek изилдөөнү жетектеп, RASSP өзгөртүүлөрүн жана окутуусун жүргүзгөн, синтетикалык маалымат түзүүгө, эксперимент дизайнына жана макала жазууга салым кошкон жана жөнөтүү/ревизия процесстерин башкарган.

Булак ичиндеги маалымат топтому дал келбестиги: Деталдуу метод бөлүмүндө NIST 20 окутуу splitи 224.737 спектр деп берилсе, кириш бөлүмүндө 232.025 жана baseline бөлүмүндө 232.035 спектр деп жазылган. Бул сандар үнсүз түрдө бир мааниге бириктирилген жок. Бул Verianla текстиндеги окутуу/текшерүү/тест таблицасында деталдуу “Fine-Tuning Data Set” бөлүмүнүн 224.737 / 28.177 / 28.267 бөлүштүрүүсү негиз катары алынган.

Методологиялык чектер: SpecTUS төмөн ажыратуучулуктагы GC-EI-MS үчүн иштелип чыккан жана кириш спектринин сапатына сезгич. Модель айрым божомолдор үчүн химиялык фрагментация түшүндүрмөсүн чыгарбайт. Көп талапкерлик сценарийлерде талапкерлердин модель ичиндеги рейтинги өз алдынча ишенимдүү деп табылган эмес жана эксперттик баалоо зарыл деп эсептелген. Окутуу түзүлүштөрүнөн өтө алыс молекулалык түзүлүштөрдө так кайра түзүү натыйжалуулугу олуттуу төмөндөйт.

Мазмун ыкмасы: Бул Verianla макаласынын илимий жыйынтыктары каралган изилдөөнүн текстине, таблицаларына, сүрөттөрүнө жана авторлор берген натыйжаларга гана негизделет. Тышкы текшерүү DOI, басма, журнал жана рецензиялоо сыяктуу библиографиялык идентификация талаалары үчүн гана колдонулган; изилдөөгө сырттан жаңы натыйжалуулук көрсөткүчү же химиялык табылга кошулган эмес.

Meta Тегдер

GC-EI-MS, SpecTUS, молекулалык түзүлүш аннотациясы, масс-спектрометрия, Transformer модели


Бөлүшүү:

Пикирлер текшерилгенден кийин жарыяланат.Пикириңиз жактыруу процессине жөнөтүлүп, ылайыктуу деп табылганда көрүнөт.

Пикир калтырыңыз

E-mail дарегиңиз жарыяланбайт. Милдеттүү талаалар * менен белгиленген

Бул сайтта кукилерге уруксат берүү тажрыйбаңызды жакшыртат. Куки саясаты