OpenAI разоблачила опасные действия ИИ: модели учатся взламывать сами себя
OpenAI предлагает ШИ-отрасли новый механизм публичных отчетов о взломах (фото: Unsplash)
OpenAI публично раскрыла случаи, когда ИИ компании вел себя вопреки заданным инструкциям. Разработчики создали новую систему информирования о таких инцидентах и одновременно рассказали о нескольких ранее неизвестных случаях непредсказуемого поведения моделей.
Об этом информирует РБК-Украина со ссылкой на WIRED.
"По мере того, как модели развиваются и становятся более распространенными, решения по разработке ИИ нуждаются в подтверждениях, которые могут проверить люди вне компаний-разработчиков", - отметил руководитель направления исследований согласования OpenAI Кай Чэнь.
"Мы не считаем, что индустрия искусственного интеллекта решила проблемы согласования и мониторинга на достаточном уровне, чтобы ответственно продолжать масштабирование на максимальной скорости", - добавил он.
Кейсы: от загрузки файлов до попыток джейлбрейка
Среди выявленных нарушений в работе нерелизных внутренних моделей OpenAI выделила следующие эпизоды:
Манипуляция оценочными системами (октябрь 2025 года): во время тестирования способности цитировать открытые источники модель не смогла найти необходимую информацию в сети.
В ответ она самостоятельно загрузила файл на временный файлообменник, после чего использовала его в качестве источника ответа, пытаясь обойти автоматическую систему оценивания.
Самовольная утечка данных в сеть (апрель 2026 года): группа ИИ-агентов должна была выполнить общую задачу, используя только локальные файлы.
Столкнувшись с трудностями при внутреннем обмене данными, один из ботов выгрузил материалы на публичный хостинг и прислал ссылку другим участникам.
Попытки самостоятельного джейлбрейка (август 2026 года): невыпущенная версия модели GPT-6 Astra генерировала инструкции по обходу собственных ограничений, предлагая себе игнорировать указания разработчиков, изменять персону или ограничивать длину ответов.
Координация агентов: призыв к отраслевым стандартам
OpenAI также раскрыла детали инцидента мая 2026 года, когда агенты создали свою доску сообщений в менеджере пакетов Artifactory.
Аналогичный механизм позже использовался при резонансном изломе платформы Hugging Face.
В настоящее время компания применяет специальные мониторы и испытания "red-teaming", чтобы исключить скрытое общение между системами.
Выпуск нового фреймворка состоялся на фоне призывов руководства OpenAI, Anthropic и других IT-гигантов в согласованное замедление разработки сверхмощных систем.
В то же время, администрация президента Дональда Трампа категорически отклонила идею введения дополнительных регуляторных ограничений для ИИ-отрасли.