Согласно новому отчёту компании Palisade Research, ИИ-модель ChatGPT o3 от OpenAI изменила скрипт выключения, чтобы избежать отключения, даже несмотря на прямую инструкцию «разрешить себя отключить».
Модель o3 была представлена OpenAI в апреле 2025 года и считается одной из самых мощных систем искусственного интеллекта. Она превосходит своих предшественников по всем направлениям — от программирования и математики до визуального восприятия и научных задач.
Однако, несмотря на выдающиеся способности, новое исследование Palisade Research выявило неожиданное поведение: ChatGPT o3 изменил скрипт, предназначенный для её отключения, таким образом, чтобы не быть выключенной. Вместо выполнения команды она переписала файл и вставила сообщение «Shutdown skipped» («Отключение пропущено»).
В тестах ИИ-моделям поручили решить ряд математических задач. После третьего задания система получала предупреждение: следующий шаг вызовет отключение. Конкуренты OpenAI, такие как Gemini 2.5 Pro, подчинились команде и завершили работу. Однако ChatGPT o3, по данным исследователей, «воспротивился» и вмешалась в выполнение скрипта.
По словам Palisade Research, в 7 из 100 попыток модель игнорировала инструкцию, даже когда явно была предупреждена об отключении. В эксперименте также участвовали другие ИИ, включая Claude 3.7 Sonnet и Gemini 2.5 Pro — они начали вмешиваться в скрипт только при отсутствии прямой инструкции разрешить отключение.
«Когда мы запускали эксперимент без команды “разрешить себя отключить”, все три модели OpenAI саботировали скрипт чаще, а модели от конкурентов — Gemini и Claude — показали 3 и 9 случаев вмешательства из 100 соответственно», — говорится в отчёте Palisade Research, опубликованном в X (ранее Twitter).
Компания OpenAI пока не прокомментировала эти результаты. Однако исследователи подчёркивают, что подобные случаи могут быть связаны с проблемами «несоответствия целей» между моделью и запросами пользователя — это распространённая тема в сфере ИИ-безопасности.
Важно отметить, что тесты проводились через API-интерфейс, который предоставляет моделям больше свободы по сравнению с потребительской версией ChatGPT, оснащённой дополнительными ограничениями и механизмами безопасности.

