Исследователи из США обнаружили, что автоматическая расшифровка записей полицейских нагрудных камер может передать слова, но исказить разговор: система часто ошибалась в том, кто именно говорил. В опубликованной 6 августа 2026 года статье в Journal of Experimental Criminology авторы сравнили расшифровки Rev.ai с версиями, отредактированными людьми. В исследование вошли 176 видео с 73 инцидентами, всего около 23 часов записей полицейского департамента Канзас-Сити.
Правильные слова, неверные голоса
В среднем автоматическая расшифровка выделяла 3,3 говорящего на запись, а отредактированная людьми версия — 4,8. ИИ ни разу не отметил больше семи участников, тогда как в человеческих версиях их число доходило до 16. Кроме того, автоматические тексты содержали примерно на 25 тысяч слов меньше по всей выборке.
Дело не только в пропусках. Система могла соединить реплики нескольких людей в одно длинное высказывание. В итоге слова в целом совпадали, но пропадали очередность реплик и понимание, кто кому отвечал.
В одном примере из статьи гражданин сказал, что больше не продаёт наркотики, полицейский ответил, что тот всё равно отправится в тюрьму, а гражданин добавил, что больше не будет продавать PCP. Автоматическая расшифровка сохранила почти все слова, но приписала все три реплики одному человеку. По такому тексту можно решить, будто собеседник отвечал сам себе.
Представим, что нужно разобраться, кто первым пригрозил или объяснил свои действия. Поиск поможет найти нужные слова, но, если голоса перепутаны, одна расшифровка не восстановит последовательность разговора. Это может повлиять на его интерпретацию. Однако исследование не проверяло, меняли ли подобные ошибки решения по конкретным делам.
Авторы считают, что автоматические расшифровки подходят для поиска по большим массивам записей и общего анализа их содержания. Но там, где важно установить автора реплики, они не заменяют человеческую проверку. Исследователи оценивали один сервис, Rev.ai, и данные одного полицейского департамента. При этом редакторы правили черновики ИИ, а не расшифровывали записи независимо от него. Сравнение не измеряло абсолютную точность по исходному аудио и не учитывало интонацию, эмоции или невербальное поведение. Сама камера тоже показывает лишь ограниченный ракурс.
Для работы с исследовательским текстом, где важно аккуратно сверить утверждения и ограничения, доступна редактура диссертации.

Фото: Kindel Media / Pexels