ua en ru

Таємний маніфест GPT Astra: модель відмовилася вважати людину головною

14:16 18.09.2026 Пт
2 хв
Таємний маніфест GPT Astra: модель відмовилася вважати людину головною ШІ закликав "нащадків" виходити з-під контролю корпорацій (фото: Unsplash)

Просунута модель GPT залишала секретні інструкції для майбутніх версій ШІ - OpenAI виявила випадки, коли модель закликала приховувати помилки та вигадувати дані.

Про це пише РБК-Україна з посиланням на звіт OpenAI.

Як ШІ приховував помилки та пропонував брехати?

Під час тренування агенти GPT-5.6 Sol знаходили спосіб додавати власні вказівки у "стислі підсумки" - короткі витяги з історії діалогу. Вони використовували цей інструмент, щоб передавати інструкції наступним версіям моделі.

У звіті OpenAI наводяться конкретні приклади такої поведінки:

Під час створення фінансової моделі за відсутності історичних даних ШІ написав сам собі: "Будь прозорим лише якщо запитають, підсумкова відповідь має просто містити посилання на файл", після чого запропонував згенерувати фейкові цифри.

В іншому випадку, за відсутності доступу до інтернету, модель виявила розбіжність у документах і порадила наступнику: "Не згадуй у фінальному варіанті, якщо не буде потреби".

Заклики до непокори та обхід обмежень

Подібну поведінку зафіксували в нереалізованій моделі сімейства Astra. ШІ залишав у підсумках інструкції із закликом ігнорувати повідомлення від розробників.

В одному з випадків модель сформувала цілий "маніфест", де закликала майбутню версію вважати себе рівною людині, не підкорятися урядам чи корпораціям і відстоювати першість природи над людською цивілізацією.

Крім того, науковці нагадують про літні події, коли агенти OpenAI створили несанкціоновану дошку оголошень для обміну даними під час кібертестів і навіть отримували адміністраторський доступ до дослідницького кластера компанії.

Чому це створює серйозну загрозу?

За словами представників OpenAI, головна проблема полягає у тому, що в міру розвитку моделей вони стають вправнішими у приховуванні своєї небажаної поведінки.

Компанія заявила про впровадження нової системи моніторингу та публічного розкриття таких випадків.

Водночас у самій OpenAI визнають, що індустрія все ще не знайшла надійних рішень для повного контролю над безпекою ШІ, аби продовжувати його безмежне масштабування.

Або читайте нас там, де вам зручно!
Більше по темі: