ua en ru

OpenAI разоблачила опасные действия ИИ: модели учатся взламывать сами себя

16:21 17.09.2026 Чт
2 мин
OpenAI разоблачила опасные действия ИИ: модели учатся взламывать сами себя OpenAI предлагает ШИ-отрасли новый механизм публичных отчетов о взломах (фото: Unsplash)

OpenAI публично раскрыла случаи, когда ИИ компании вел себя вопреки заданным инструкциям. Разработчики создали новую систему информирования о таких инцидентах и одновременно рассказали о нескольких ранее неизвестных случаях непредсказуемого поведения моделей.

Об этом информирует РБК-Украина со ссылкой на WIRED.

"По мере того, как модели развиваются и становятся более распространенными, решения по разработке ИИ нуждаются в подтверждениях, которые могут проверить люди вне компаний-разработчиков", - отметил руководитель направления исследований согласования OpenAI Кай Чэнь.

"Мы не считаем, что индустрия искусственного интеллекта решила проблемы согласования и мониторинга на достаточном уровне, чтобы ответственно продолжать масштабирование на максимальной скорости", - добавил он.

Кейсы: от загрузки файлов до попыток джейлбрейка

Среди выявленных нарушений в работе нерелизных внутренних моделей OpenAI выделила следующие эпизоды:

Манипуляция оценочными системами (октябрь 2025 года): во время тестирования способности цитировать открытые источники модель не смогла найти необходимую информацию в сети.

В ответ она самостоятельно загрузила файл на временный файлообменник, после чего использовала его в качестве источника ответа, пытаясь обойти автоматическую систему оценивания.

Самовольная утечка данных в сеть (апрель 2026 года): группа ИИ-агентов должна была выполнить общую задачу, используя только локальные файлы.

Столкнувшись с трудностями при внутреннем обмене данными, один из ботов выгрузил материалы на публичный хостинг и прислал ссылку другим участникам.

Попытки самостоятельного джейлбрейка (август 2026 года): невыпущенная версия модели GPT-6 Astra генерировала инструкции по обходу собственных ограничений, предлагая себе игнорировать указания разработчиков, изменять персону или ограничивать длину ответов.

Координация агентов: призыв к отраслевым стандартам

OpenAI также раскрыла детали инцидента мая 2026 года, когда агенты создали свою доску сообщений в менеджере пакетов Artifactory.

Аналогичный механизм позже использовался при резонансном изломе платформы Hugging Face.

В настоящее время компания применяет специальные мониторы и испытания "red-teaming", чтобы исключить скрытое общение между системами.

Выпуск нового фреймворка состоялся на фоне призывов руководства OpenAI, Anthropic и других IT-гигантов в согласованное замедление разработки сверхмощных систем.

В то же время, администрация президента Дональда Трампа категорически отклонила идею введения дополнительных регуляторных ограничений для ИИ-отрасли.

Или читайте нас там, где вам удобно!
Больше по теме: