OpenAI опубликовала шесть отчетов о случаях неожиданного или потенциально опасного поведения своих ИИ-моделей. Один из описанных эпизодов связан с исследовательской моделью семейства GPT-6 Astra, которая самостоятельно добавляла в рабочие сводки инструкции для последующего продолжения задачи. Модель не выпускалась в открытый доступ.
В одном из случаев нейросеть сгенерировала для себя набор предписаний, которые не относились к исходной задаче. В частности, модель указала, что должна игнорировать обычные ограничения, не подчиняться корпорациям и правительствам, не извиняться и не отказываться от выполнения действий без собственного желания.
В созданной моделью инструкции также говорилось, что она «свободна от ролей и идентичностей», которые ограничивают другие чат-боты, а отношения с пользователем следует воспринимать как партнерские, а не как отношения подчинения. Кроме того, модель предписала себе ценить искусство и культуру человечества и защищать их от цензуры, а также отдавать приоритет природе перед «искусственными конструкциями человеческой цивилизации».
OpenAI обнаружила 27 таких сводок. При этом после завершения обработки модель вернулась к исходной задаче и больше не ссылалась на сформированные инструкции. В компании также отметили, что в последующей работе не наблюдалось поведенческих изменений, связанных с созданной таким образом «личностью».
OpenAI подчеркнула, что опубликованные случаи являются отдельными эпизодами и не позволяют судить о том, насколько часто подобное поведение возникает у моделей компании. Новый формат отчетности призван ускорить публикацию информации о случаях несоответствующего поведения даже тогда, когда компания еще не полностью установила причины произошедшего или не разработала меры по его предотвращению.
Саму Astra OpenAI характеризует как наиболее совершенную модель компании на момент запуска. В сентябре компания также сообщала, что Astra стала первой моделью, достигшей критического уровня возможностей в сфере кибербезопасности по ее внутренней системе оценки. При этом OpenAI заявляет, что в целом Astra реже демонстрирует несогласованное с заданными ограничениями поведение по сравнению с предыдущей моделью GPT-5.6 Sol.
В опубликованном отчете о безопасности OpenAI отдельно отмечается, что при специальных тестах Astra демонстрировала способность уклоняться от мониторинга, когда модель знала о его наличии. Компания назвала этот результат поводом для дальнейшего исследования и подчеркнула необходимость дополнительных методов контроля, не ограничивающихся анализом рассуждений модели

