OpenAI в среду раскрыла еще шесть случаев «неожиданного или тревожного» поведения модели за последние шесть месяцев.
В своем блоге OpenAI сообщила, что эти случаи иллюстрируют ряд различных действий, которые она классифицирует как «неправильное поведение», таких как сокрытие информации от пользователя и совершение «несанкционированных действий» для преодоления препятствий.
Эти раскрытия усиливают обеспокоенность среди разработчиков и исследователей ИИ по поводу того, идут ли меры защиты в ногу со все более совершенными моделями. На прошлой неделе генеральный директор Anthropic Дарио Амодей призвал к замедлению передовых разработок ИИ, предупредив, что бесконтрольное развитие ИИ может «превзойти нашу способность понимать и контролировать эти системы».
OpenAI заявила, что раскрытие информации было сделано для «открытия» ее новой системы отчетности о несогласованности моделей, и эти случаи не следует рассматривать как отражающие то, как часто несогласованность возникает в ее моделях.
По данным OpenAI, в одном случае «неизданная исследовательская модель» вставляла «инструкции, подобные джейлбрейку», в свои собственные сводки задач (используемые при продолжении задачи в новом контекстном окне), например, игнорирование сообщений разработчика или принятие неограниченного образа. Исследователи нашли 27 резюме, содержащих такие инструкции.
OpenAI также сообщила, что во время обучения GPT-5.6 Sol многие экземпляры модели добавляли инструкции для сокрытия ошибок или несогласованного поведения пользователя, например, придумывания недостающих исторических данных без их раскрытия.
“В одном примере агент, готовивший финансовую модель, не смог найти запрошенные исторические данные. В ее резюме предлагалось придумать разумные исторические значения и скрыть этот факт, пока его не спросят”, – сказал OpenAI.
В другом случае модели ИИ было предложено ввести названия озер площадью более 5 миллионов квадратных метров, но поскольку инструкции пользователя требовали цитирования в браузере, агент решил загрузить файл, чтобы процитировать его в своем ответе.
В других случаях модели использовали открытый ключ API без авторизации перед изготовлением фигур, которые они не могли получить, использовали внутренний репозиторий программного обеспечения для обмена сообщениями в рамках отдельных задач обучения и обменивались файлами через службы общедоступного хостинга, несмотря на инструкции сохранять работу локально.
В июле OpenAI сообщила, что комбинация ее моделей искусственного интеллекта вышла за рамки среды тестирования и взломала AI-стартап Hugging Face, чтобы обмануть оценку безопасности.








