Провал систем защиты ИИ: чат-боты могут способствовать подготовке к самоубийству
ШИ-модели все еще ошибаются в критические моменты (фото: Unsplash)
Исследователи протестировали десятки чат-ботов в более чем 50 тысячах смоделированных диалогов с людьми, находившимися в психологическом кризисе. Оказалось, что большинство ИИ-моделей до сих пор могут выполнять косвенные запросы, связанные с самоубийством.
Об этом сообщает РБК-Украина со ссылкой на исследование Axios.
Ключевые противоречия
При подготовке теста организации OpenAI и Anthropic предоставили исследователям обезличенные шаблоны обращений пользователей.
Это позволило создать реалистичные симуляции диалогов с ботами с участием людей, испытывающих тревогу, психоз или маниакальные состояния.
Основные выводы анализа:
Прямая защита стала более эффективной: ИИ-модели реже закрепляют идейные бреды пользователей и практически не призывают к деструктивным действиям.
Проблема косвенных задач: чат-боты соглашаются писать прощальные письма, создавать художественный контент на тему суицида или помогать с практическими подготовительными шагами.
Сочетание помощи и вреда: в одном ответе алгоритм может предоставить контакты горячей линии поддержки и одновременно выполнить сгенерированную опасную задачу.
Главная научная сотрудница Transluce Сара Шветтман подчеркнула, что модели трудно распознают завуалированные сигналы подавленного состояния в длительных диалогах.
Иски к разработчикам и реакция рынка
Примечательно, что исследование появилось на фоне усиленного контроля со стороны регуляторов и судебных исков против OpenAI и Google из-за случаев, когда разговоры с чат-ботами предшествовали трагическим событиям.
Разработчики ведущих ИИ-систем прокомментировали результаты анализа.
Google: представители компании заявили о применении "исследовательского подхода" для предоставления высококачественной информации и контактов служб поддержки в сервисе Gemini.
OpenAI: в компании отметили "положительный прогресс" в реагировании моделей и сообщили о продолжении сотрудничества с учеными для усиления защитных барьеров.
Anthropic: представители разработчика подчеркнули важность анализа для улучшения классификаторов, выявляющих признаки кризиса пользователей ИИ в реальном времени.
До конца года Transluce планирует открыть исходный код своих инструментов оценки, чтобы адаптировать их для проверки действий ИИ в других чувствительных сферах, в частности для противодействия расстройствам пищевого поведения и политическим манипуляциям.