Авторы исследования, опубликованного 23 апреля 2026 года в журнале Humanities and Social Sciences Communications, сравнили отношение семи больших языковых моделей и трёх независимых выборок людей к общему искусственному интеллекту. По пятибалльной шкале модели получили от 3,32 до 4,12 балла, тогда как средняя оценка участников составила 2,97.

GPT-4 показал наиболее позитивный результат

Среди изученных систем самый высокий показатель зафиксировали у GPT-4. Ответы Bard оказались ближе к нейтральной позиции. Исследователи проводили измерения в течение трёх последовательных дней, чтобы учесть возможные изменения в ответах моделей.

Авторы предупреждают, что систематически позитивный тон таких ответов может постепенно влиять на отношение пользователей к искусственному интеллекту. Для научной и учебной работы это ограничивает возможность использовать оценочные суждения языковой модели как отражение общественного мнения или академического консенсуса.

В статье также предложен бенчмарк SAIA для сопоставления ответов моделей с общественными ценностями, этическими нормами и настроениями в разных языках и временных периодах. Авторы указывают, что методику ещё предстоит уточнить и проверить эмпирически.

Например, если спросить языковую модель о плюсах и рисках общего искусственного интеллекта, её ответ может быть позитивнее средней оценки людей. Это не доказывает, что модель убедит пользователя, но показывает, почему её тон нельзя принимать за отражение общественного мнения.

По теме: подготовка научных статей.