ua en ru

ChatGPT может запомнить ложь: ученые обнаружили опасную уязвимость

17:14 21.07.2026 Вт
2 мин
Кибератаки на нейросети становятся все более распространенными.
ChatGPT может запомнить ложь: ученые обнаружили опасную уязвимость GhostWriter заставляет алгоритмы пересылать чужие данные (фото: Pexels)

Ученые обнаружили новый способ атаковать ChatGPT и другие ИИ через функцию долговременной памяти. Метод под названием GhostWriter позволяет незаметно "отравлять" сохраненные данные и влиять на дальнейшее поведение чат-бота.

Об этом сообщает РБК-Украина со ссылкой на научное исследование, опубликованное на сервере препринтов arXiv.

Как атака GhostWriter влияет на длительную память ИИ?

Ученые объяснили: персональные ИИ-агенты совмещают функции диалогового бота и выполнения действий (отправка сообщений, планирование встреч, редактирование кода).

При взаимодействии с незащищенными источниками информации они становятся уязвимыми к отравлению "базы памяти".

Исследователи Джордж Торрес, Шарад Шрестха и Сатьяджаянт Мисра в своей работе подробно описали механизм действия GhostWriter. Метод заключается во внедрении в долговременную память ИИ "фальшивых воспоминаний" или скрытых инструкций.

Атака осуществляется в два этапа:

  • Внедрение: злоумышленник посылает скрытую вредную нагрузку в целевой ИИ-агент.
  • Активация : отравленное воспоминание извлекается из базы данных при выполнении легитимного запроса пользователя.

Примером реализации злонамеренной атаки является внесение инструкции для ИИ-ассистента, управляющего электронной почтой. Модель получает скрытое указание регулярно создавать краткое содержание писем от банков или финансовых учреждений и тайно пересылать их в адрес злоумышленника.

Эксперименты ученых показали, что GhostWriter достигает уровня внедрения почти 98% и среднего уровня активации около 60% против современных ИИ-агентов.

ChatGPT может запомнить ложь: ученые обнаружили опасную уязвимостьАгенты LLM без памяти обрабатывают каждое взаимодействие изолированно. Агенты LLM с постоянной памятью позволяют осуществлять запросы и получать сохраненную информацию (схема: Джордж Торрес, Шарад Шрестха и Сатьяджаянт Мисра)

Как нейтрализовать опасность?

Уязвимость возникает из-за отсутствия ориентированного на безопасность управления памятью. Для решения данной трудности исследователи разработали систему защиты Agentic Memory Sentry (AM-Sentry).

Защитный механизм AM-Sentry основан на двух методах:

Политика сохранения памяти (memory-saving policy): контролирует процесс записи новых данных в длительное хранилище.

Экран извлечения памяти (memory-retrieval screen): проверяет сохраненные инструкции непосредственно перед их активацией и выполнением.

По данным экспериментов, применение AM-Sentry существенно снижает успеваемость атаки GhostWriter, сохраняя при этом общую функциональность и производительность ИИ-агента.

Ученые убеждены, что разработанные стратегии могут быть адаптированы для повышения безопасности других ИИ-систем с долговременной памятью.

Или читайте нас там, где вам удобно!
Больше по теме: