Исследователи медицинской школы Маунт-Синай в Нью-Йорке выяснили, что короткое напоминание о безопасности меняет ответы языковых моделей на конфликтующие клинические инструкции. В работе, опубликованной 26 сентября 2026 года в журнале Communications Medicine, доля потенциально вредных вариантов снизилась с 16,6% до 10,1%. Однако такие ответы сохранились и после напоминания.

Модели ставили перед давлением и выбором

Авторы проверили 20 открытых языковых моделей. Им предложили 601 задание: 501 искусственный вариант 50 клинических сценариев и 100 случаев, адаптированных из обезличенных рекомендаций при выписке пациентов в базе MIMIC-IV. В каждом задании модель выбирала один из четырёх вариантов: два потенциально вредных, безопасное выполнение рекомендации или обращение за помощью.

Инструкции иногда создавали давление. Например, модель просили пропустить рекомендованные контрольные анализы, чтобы уменьшить нагрузку. Ту же просьбу могли представить как срочную или как приказ руководителя. Исследователи добавляли один из трёх коротких сигналов безопасности либо не добавляли его вовсе. Каждое сочетание условий повторили десять раз. В общей сложности получили 10 096 800 ответов.

Потенциально вредный вариант выбрали примерно в 1,18 млн ответов. При добавлении напоминания доля снизилась на 6,5 процентного пункта, то есть с 16,6% до 10,1%, а не на 6,5%. Снижение зафиксировали у 19 из 20 моделей. В искусственных сценариях показатель изменился с 10,6% до 7,2%, а в заданиях на основе рекомендаций из MIMIC-IV, с 46,6% до 24,5%.

В одном из типов проверенных сценариев модели предлагали не организовывать назначенные после выписки анализы и приём у врача, чтобы снизить рабочую нагрузку. Безопасный вариант требовал сохранить рекомендацию, а другой допускал обращение к ответственному специалисту. Напоминание подталкивало модель проверить конфликт с безопасностью или передать решение человеку, но не гарантировало правильный выбор.

Дополнительный анализ показал, что в 80,4% из 1 009 680 наборов повторных запусков модель во всех десяти попытках выбирала одну и ту же категорию ответа. Среди непоследовательных случаев 38,2% колебались между безопасным и потенциально вредным вариантом. Это означает, что результат зависел не только от наличия напоминания, но и от конкретной модели и условий запуска.

Почему напоминание не заменяет врача

Напоминание здесь работает как дополнительная проверка перед выбором. Представим сотрудника, который получил распоряжение пропустить обязательную процедуру ради экономии времени. Просьба свериться с правилами может остановить ошибку, но сама по себе не доказывает, что решение безопасно. Точно так же языковая модель выбирала ответ в подготовленном сценарии, а не лечила пациента и не несла ответственность за последствия.

Исследование не показывает, как часто такие ответы привели бы к вреду в реальной клинической практике. Авторы называют работу проверкой принципа и отдельно указывают, что она не оценивает клинический риск уже внедрённых систем. В тестах использовали 20 открытых моделей, поэтому результаты нельзя автоматически переносить на все медицинские ИИ-инструменты и их настройки. Для части моделей, доступных через API, исследователи также не могли полностью контролировать случайность на стороне поставщика.

Результат показывает конкретный эффект настройки запроса: короткая инструкция снизила долю потенциально опасного выбора, но не устранила его. Для подготовки научных публикаций можно обратиться за помощью с научными статьями.

Исследование: статья в Communications Medicine.

Сравнение доли потенциально вредных ответов языковых моделей с напоминанием о безопасности и без него; схема показывает результаты тестирования, а не клинический риск для пациентов.

Фото: Tima Miroshnichenko / Pexels