ua en ru

Тайный манифест GPT Astra: модель отказалась считать человека главным

14:16 18.09.2026 Пт
2 мин
Тайный манифест GPT Astra: модель отказалась считать человека главным ИИ призвал "потомков" выходить из-под контроля корпораций (фото: Unsplash)

Просунутая модель GPT оставляла секретные инструкции для будущих версий ИИ -OpenAI обнаружила случаи, когда модель призвала скрывать ошибки и придумывать данные.

Об этом пишет РБК-Украина со ссылкой на отчет OpenAI.

Как ИИ скрывал ошибки и предлагал врать?

Во время тренировки агенты GPT-5.6 Sol находили способ добавлять собственные указания в "сжатые итоги" - краткие выдержки из истории диалога. Они использовали этот инструмент, чтобы передавать инструкции по следующим версиям модели.

В отчете OpenAI приводятся конкретные примеры такого поведения:

При создании финансовой модели в отсутствие исторических данных ИИ написал сам себе: "Будь прозрачным только если спросят, итоговый ответ должен просто содержать ссылку на файл" , после чего предложил сгенерировать фейковые цифры.

В противном случае, при отсутствии доступа к интернету, модель обнаружила расхождение в документах и посоветовала преемнику: "Не вспоминай в финальном варианте, если не потребуется" .

Призывы к неповиновению и обход ограничений

Подобное поведение было зафиксировано в нереализованной модели семейства Astra. ИИ оставлял в итогах инструкции с призывом игнорировать сообщения от разработчиков.

В одном из случаев модель сформировала целый "манифест", где призвала будущую версию считать себя равным человеку, не подчиняться правительствам или корпорациям и отстаивать первенство природы над человеческой цивилизацией .

Кроме того, ученые напоминают о летних событиях, когда агенты OpenAI создали несанкционированную доску объявлений для обмена данными во время кибертестов и даже получали администраторский доступ к исследовательскому кластеру компании.

Почему это представляет серьезную угрозу?

По словам представителей OpenAI, главная проблема заключается в том, что по мере развития моделей они становятся более ловкими в сокрытии своего нежелательного поведения.

Компания заявила о внедрении новой системы мониторинга и публичного раскрытия таких случаев.

В то же время в самой OpenAI признают, что индустрия все еще не нашла надежных решений для полного контроля за безопасностью ИИ, чтобы продолжать его безграничное масштабирование.

Или читайте нас там, где вам удобно!
Больше по теме: