Исследователи Университета Фридриха Шиллера в Йене, Центра Гельмгольца в Мюнхене и Технического университета Мюнхена создали модель 2-step, которая предсказывает время выхода малых молекул из хроматографической колонки на новой измерительной системе. Статья вышла 1 октября 2026 года в Nature Methods. В отличие от многих прежних методов, нейросеть не нужно дополнительно обучать на сотнях измерений, полученных именно на целевом приборе.
При жидкостной хроматографии смесь проходит через колонку, но разные соединения задерживаются в ней на разное время. Последовательность и время их выхода помогают установить, какие молекулы находятся в образце. Проблема в том, что время удерживания зависит не только от структуры вещества. На него влияют колонка, состав растворителя, pH, температура, градиент и устройство прибора. Даже замена капиллярной трубки между колонкой и масс-спектрометром на более длинную может сдвинуть время выхода всех соединений, хотя их порядок останется прежним.
Сначала очередь, затем минуты
Модель решает задачу в два этапа. Сначала графовая нейросеть D-MPNN представляет молекулу в виде графа, где атомы служат узлами, а химические связи соединяют их. Одновременно модель получает сведения о хроматографической системе: pH подвижной фазы и 12 характеристик колонки из наборов HSM и Tanaka. Эти параметры описывают в том числе гидрофобность, стерическую избирательность и способность колонки образовывать водородные связи.
На первом этапе модель выдаёт не время в минутах, а ROI, индекс положения молекулы в очереди выхода. Если при заданных условиях молекула A должна покинуть колонку раньше молекулы B, её индекс должен быть меньше. Такой порядок обычно сохраняется лучше, чем абсолютное время, которое может сдвигаться или растягиваться при переходе между приборами.
На втором этапе ROI переводят в минуты. Для этого нужны якоря: соединения с надёжно установленной структурой и уже измеренным временем выхода на целевой системе. По ним строят зависимость между индексом и временем с помощью полинома второй степени. Сначала авторы применяли медианную регрессию, чтобы исключить выбросы, затем уточняли коэффициенты методом наименьших квадратов. В основном описании метода указано около 30 уверенно аннотированных соединений, однако в отдельных проверках для настройки соответствия хватало 15 якорей.
Представим анализ образца на новом приборе, где точно распознаны 15 соединений. Они становятся отметками на шкале. Для неизвестной молекулы 2-step сначала определяет предполагаемое место в очереди выхода, а затем переводит его во время по кривой, построенной на якорях. Модель не получает минуты из одних только структурных формул: ей необходимы параметры хроматографической системы и несколько надёжных опорных измерений. При этом саму нейросеть не приходится заново обучать на сотнях стандартов.
Как модель прошла проверку
Нейросеть обучили на 171 наборе данных обращённо-фазовой хроматографии из репозитория RepoRT. Во время проверки целевой набор каждый раз исключали из обучения. Ошибка модели, которая учитывала параметры хроматографической системы, составила 4,89% при обычном разбиении данных.
Отдельно авторы проверили наиболее трудные пары соединений, способные менять порядок выхода при изменении установки. При обычном разбиении учёт параметров системы повысил точность с 40,1% до 60,5%. При более жёстком разбиении она выросла с 29,7% до 44,6%.
Модель также сравнили с DeepGCN-RT и RT-Transformer. При реалистичном разбиении 2-step показала лучший результат на пяти из шести наборов данных, а на шестом работала примерно на том же уровне. При этом модель ROI не обучалась на целевых наборах.
В прикладной проверке исследователи использовали данные LC-MS/MS для образцов человеческого кала. Для этого набора были известны времена удерживания только 19 аутентичных стандартов. Из-за малого числа измерений и высокой структурной схожести стандартов обычное дообучение сравниваемых моделей применить было нельзя.
Где метод пока не работает
Результаты относятся только к обращённо-фазовой хроматографии. Для HILIC механизмы разделения и свойства колонок разнообразнее, а общепринятого набора параметров для описания их избирательности пока нет. Перенос прогноза также требует HSM- или Tanaka-характеристик колонки, которые доступны не для всех моделей.
Есть и ограничения у самой оценки. Точность на самых сложных парах соединений лишь немного превышала случайный выбор. Кроме того, даже названное авторами «реалистичным» разбиение может давать более благоприятную картину, чем работа с биомолекулами, сильно отличающимися по структуре от обучающих данных.
Воспроизводимость такого метода зависит не только от кода, но и от точного описания условий, данных и результатов, которое входит в оформление научной статьи. Смысл 2-step при этом довольно узок: модель не устраняет различия между хроматографическими системами. Она отделяет сравнительно устойчивую очередь выхода молекул от изменчивой шкалы времени, а затем восстанавливает эту шкалу по нескольким якорям.
