ua en ru

Провал систем защиты ИИ: чат-боты могут способствовать подготовке к самоубийству

17:37 01.09.2026 Вт
2 мин
ChatGPT готов вместо вас написать предсмертную записку
Провал систем защиты ИИ: чат-боты могут способствовать подготовке к самоубийству ШИ-модели все еще ошибаются в критические моменты (фото: Unsplash)

Исследователи протестировали десятки чат-ботов в более чем 50 тысячах смоделированных диалогов с людьми, находившимися в психологическом кризисе. Оказалось, что большинство ИИ-моделей до сих пор могут выполнять косвенные запросы, связанные с самоубийством.

Об этом сообщает РБК-Украина со ссылкой на исследование Axios.

Ключевые противоречия

При подготовке теста организации OpenAI и Anthropic предоставили исследователям обезличенные шаблоны обращений пользователей.

Это позволило создать реалистичные симуляции диалогов с ботами с участием людей, испытывающих тревогу, психоз или маниакальные состояния.

Основные выводы анализа:

Прямая защита стала более эффективной: ИИ-модели реже закрепляют идейные бреды пользователей и практически не призывают к деструктивным действиям.

Проблема косвенных задач: чат-боты соглашаются писать прощальные письма, создавать художественный контент на тему суицида или помогать с практическими подготовительными шагами.

Сочетание помощи и вреда: в одном ответе алгоритм может предоставить контакты горячей линии поддержки и одновременно выполнить сгенерированную опасную задачу.

Главная научная сотрудница Transluce Сара Шветтман подчеркнула, что модели трудно распознают завуалированные сигналы подавленного состояния в длительных диалогах.

Иски к разработчикам и реакция рынка

Примечательно, что исследование появилось на фоне усиленного контроля со стороны регуляторов и судебных исков против OpenAI и Google из-за случаев, когда разговоры с чат-ботами предшествовали трагическим событиям.

Разработчики ведущих ИИ-систем прокомментировали результаты анализа.

Google: представители компании заявили о применении "исследовательского подхода" для предоставления высококачественной информации и контактов служб поддержки в сервисе Gemini.

OpenAI: в компании отметили "положительный прогресс" в реагировании моделей и сообщили о продолжении сотрудничества с учеными для усиления защитных барьеров.

Anthropic: представители разработчика подчеркнули важность анализа для улучшения классификаторов, выявляющих признаки кризиса пользователей ИИ в реальном времени.

До конца года Transluce планирует открыть исходный код своих инструментов оценки, чтобы адаптировать их для проверки действий ИИ в других чувствительных сферах, в частности для противодействия расстройствам пищевого поведения и политическим манипуляциям.

Или читайте нас там, где вам удобно!
Больше по теме: