Исследование провели специалисты Джорджтаунского университета (Georgetown University) и Вашингтонского университета (University of Washington). Ведущим автором стала Маттеа Сим (Mattea Sim). В работе также участвовали Яэль Айгер (Yael Eiger) и Йоши Коно (Yoshi Kohno).
Полная версия работы размещена в репозитории arXiv, а сокращённая версия принята для представления на Девятой конференции AAAI/ACM по искусственному интеллекту, этике и обществу (Ninth AAAI/ACM Conference on AI, Ethics, and Society, AIES), которая пройдет 12–14 октября 2026 года в Мальмё.
Исследователи сначала проверили, насколько точно ИИ описывает видео
Работа состояла из двух частей. Сначала авторы оценили качество видеорезюме, создаваемых большими языковыми моделями (БЯМ) — системами искусственного интеллекта, способными анализировать и генерировать текст.
Исследователи использовали ChatGPT-5.5 и Gemini 2.5 Flash-Lite. Каждой системе пять раз предложили описать каждое из двух 25-секундных анимационных видео. В общей сложности получили 20 резюме.
На видео красный автомобиль подъезжал к перекрестку со знаком «Стоп» или «Уступите дорогу», поворачивал направо и сталкивался с пешеходом. После падения пешеход вставал, водитель выходил из автомобиля, после чего они встречались.
Авторы заранее выделили 19 центральных деталей происходящего и проверяли, насколько хорошо модели их передают.
Ошибки обнаружились во всех 20 резюме. В одном тексте их было не менее семи, а максимальное число достигало 21.
Чаще всего ИИ просто пропускал важную информацию
Самым распространенным типом ошибки оказалось не выдумывание новых фактов, а пропуск существенных деталей.
В среднем модели не упоминали 51,6% центральных элементов события. Особенно показательно, что в 19 из 20 резюме — то есть в 95% случаев — отсутствовала главная деталь: автомобиль столкнулся с пешеходом.
Кроме того, 65% резюме содержали хотя бы одну ошибку в описании центральных событий. В 60% текстов присутствовали добавленные сведения, которых в исходном видео не было.
Модели, например, могли добавлять лишних пешеходов или автомобили, неправильно описывать направление движения либо приписывать участникам события намерения, которые невозможно было определить по видео.
Однако эти показатели нельзя воспринимать как общую частоту ошибок ChatGPT или Gemini. Авторы протестировали всего два коротких видео и получили только 20 резюме, поэтому эта часть исследования скорее демонстрирует возможные типы проблем, чем оценивает надежность современных моделей в целом.
Затем исследователи проверили влияние ошибки на человеческую память
Во второй части работы участвовали взрослые жители США, набранные через онлайн-платформу Prolific. Первую часть эксперимента начали 360 человек. Обе части завершил 331 участник, а после исключения не прошедших проверку внимания в основной анализ вошли данные 328 человек.
Сначала участникам показывали одно из двух анимационных видео с автомобильной аварией. Единственным принципиальным различием между роликами был дорожный знак: «Стоп» или «Уступите дорогу».
Через 24–48 часов участники читали текстовое описание увиденного события.
Их случайным образом распределили по экспериментальным условиям. Одним сообщали, что резюме подготовлено искусственным интеллектом, другим — что его написал профессиональный расшифровщик. На самом деле основой всех текстов служило резюме, созданное ChatGPT.
Кроме того, в одном варианте описание дорожного знака соответствовало исходному видео, а в другом было намеренно изменено исследователями. Таким образом, человек мог увидеть знак «Стоп», но позже прочитать в резюме, что автомобиль подъехал к знаку «Уступите дорогу», или наоборот.
После чтения участникам предлагали вспомнить детали именно первоначального видео.
Ошибочная деталь почти вдвое снизила точность воспоминания
Различие оказалось выраженным. Среди людей, получивших корректное резюме, дорожный знак правильно вспомнили 83,6%. Среди прочитавших вводящее в заблуждение описание правильный ответ дали только 44,8%.
Статистический анализ показал, что различие было значимым.
Речь идет о хорошо известном в психологии «эффекте дезинформации» — явлении, при котором сведения, полученные уже после события, способны изменить последующее воспоминание о первоначальном опыте.
Новое исследование показывает, что таким источником постфактум-дезинформации может стать и текст, созданный искусственным интеллектом.
При этом участники не просто забыли всё видео и полностью полагались на прочитанный текст. Например, 96,6% правильно вспомнили, что происшествие происходило днем, хотя эта информация в резюме не упоминалась. В среднем на 11 второстепенных вопросов участники правильно отвечали в 91,4% случаев.
Предупреждение об искусственном интеллекте не защитило память
Исследователи также проверили, изменится ли эффект, если человек знает, что читает текст искусственного интеллекта.
Значимого различия не обнаружили. Среди участников, получивших ошибочное резюме, ключевую деталь правильно вспомнили 46,3% людей, которым сказали, что текст создан ИИ, и 43,4% тех, кто считал его написанным человеком.
Не обнаружили авторы и статистически значимой связи эффекта с доверием человека к искусственному интеллекту или частотой использования чат-ботов.
Это важное наблюдение, однако его следует трактовать осторожно. Отсутствие статистически значимого взаимодействия не доказывает, что отношение к ИИ никогда не влияет на восприимчивость к ошибочной информации. Результат относится к конкретному эксперименту и выбранной исследователями задаче.
В эксперименте ошибка была внесена намеренно
Есть еще одно существенное уточнение. В экспериментальной части исследования ложная информация о дорожном знаке не была случайной «галлюцинацией» модели.
Исследователи специально контролировали эту деталь, чтобы сравнить две группы в одинаковых условиях. Само резюме первоначально создал ChatGPT, а авторы отобрали один из более качественных вариантов и внесли небольшие изменения, необходимые для стандартизации эксперимента.
Поэтому работа показывает, что недостоверная информация, содержащаяся в ИИ-резюме, способна причинно влиять на последующее воспоминание в данных экспериментальных условиях. Но она не позволяет определить, насколько часто именно спонтанные ошибки реальных систем вызывают подобный эффект у пользователей.
Результаты особенно важны для ситуаций с высокой ценой ошибки
Авторы обращают внимание на системы, которые автоматически создают отчеты или краткие описания больших объемов информации. Потенциально это касается не только новостных материалов и рабочих совещаний, но и медицины, правоохранительной деятельности и других областей, где от человека ожидают проверки созданного ИИ текста.
Обычно предполагается, что специалист останется «человеком в контуре» и заметит ошибку алгоритма. Исследование показывает возможную проблему такого подхода: уже прочитанная неверная информация сама может изменить воспоминание человека о первоначальном материале.
Это особенно существенно, если исходная информация сложна, была просмотрена давно или больше недоступна для непосредственной проверки.
У исследования есть существенные ограничения
Эксперимент нельзя напрямую переносить на реальные записи с полицейских нагрудных камер, медицинские документы или другие сложные ситуации.
Исследователи использовали только два коротких анимационных видео, причем не реальные съемки происшествия. В эксперименте проверяли одну конкретную разновидность дезинформации — неверное указание дорожного знака.
Анализ поведения моделей также был небольшим: две системы, два видео, один стандартизированный запрос и всего 20 созданных резюме.
Все экспериментальные резюме имели общую основу, созданную ChatGPT. Поэтому исследование не сравнивало влияние фактически написанных людьми текстов с независимо сгенерированными ИИ описаниями — участникам лишь сообщали разные сведения об авторстве одного и того же материала.
Наконец, эксперимент проходил онлайн среди англоязычных взрослых жителей США. Неизвестно, насколько точно результаты воспроизведутся в других группах и при работе с реальными профессиональными материалами.
Что означают результаты
Исследование демонстрирует важное взаимодействие двух источников ошибок: искусственный интеллект способен выдавать неточные или неполные сведения, а человеческая память может изменяться под воздействием информации, полученной уже после события.
Поэтому простого требования «пусть человек проверит результат ИИ» в некоторых ситуациях может оказаться недостаточно. Особенно осторожно следует относиться к автоматическим резюме там, где первоначальный материал используется для последующих свидетельств, решений или экспертной оценки.
Это не означает, что любые ИИ-резюме обязательно создают ложные воспоминания. Работа проводилась в контролируемой экспериментальной обстановке и требует подтверждения на более реалистичных материалах.
Связь взаимодействия с искусственным интеллектом и изменения человеческих представлений изучалась и в других работах: ранее МКБ-11 писал, что общение с искусственным интеллектом способно изменить взгляды сторонников теории заговора.
Литература
Sim M., Eiger Y., Kohno T. AI-Enabled Human Memory Manipulation: Misleading AI-Generated Summaries Distort Human Memory. — arXiv, 2026. — arXiv:2609.28820v1. — DOI: 10.48550/arXiv.2609.28820. — arXiv.
Sim M., Eiger Y., Kohno T. AI-Enabled Human Memory Manipulation: Misleading AI-Generated Summaries Distort Human Memory // Proceedings of the Ninth AAAI/ACM Conference on AI, Ethics, and Society. — 2026.
