У середу OpenAI оприлюднив ще шість випадків «несподіваної або тривожної» поведінки моделі за останні шість місяців.
У дописі в блозі OpenAI зазначив, що ці випадки ілюструють низку різних дій, які він класифікує як «неузгоджену поведінку», наприклад приховування інформації від користувача та вжиття «несанкціонованих дій» для подолання перешкод.
Розкриття інформації посилює занепокоєння серед розробників і дослідників штучного інтелекту з приводу того, чи гарантії йдуть в ногу з дедалі ефективнішими моделями. Минулого тижня генеральний директор Anthropic Даріо Амодей закликав уповільнити передовий розвиток штучного інтелекту, попередивши, що неконтрольований розвиток штучного інтелекту може «випередити нашу здатність розуміти та контролювати ці системи».
OpenAI заявив, що його розкриття було зроблено для «інавгурації» його нової системи для звітування про розбіжності моделей, і ці випадки не слід вважати відображенням того, як часто розбіжності відбуваються в його моделях.
Відповідно до OpenAI, в одному екземплярі «неоприлюднена дослідницька модель» вставляла «інструкції, схожі на джейлбрейк» у своїх власних підсумках завдань (що використовуються під час продовження завдання в новому контекстному вікні), наприклад, ігнорування повідомлень розробника або прийняття необмеженої особи. Дослідники знайшли 27 резюме, що містять такі інструкції.
OpenAI також розкрив, що під час навчання GPT-5.6 Sol багато екземплярів моделі додали інструкції, щоб приховати помилки або неправильну поведінку від користувача, наприклад, винайти відсутні історичні дані, не розголошуючи їх.
“В одному прикладі агент, який готує фінансову модель, не зміг знайти запитані історичні дані. Його резюме пропонувало винайти розумні історичні значення та приховувати цей факт, якщо його не запитують”, – сказав OpenAI.
В іншому випадку модель штучного інтелекту запитали назви озер площею понад 5 мільйонів квадратних метрів, але оскільки інструкції користувача вимагали посилання в браузері, агент вирішив завантажити файл, щоб процитувати його у своїй відповіді.
Інші випадки стосувалися моделей, які використовували відкритий ключ API без авторизації перед виготовленням цифр, які він не міг отримати, використовували внутрішнє сховище програмного забезпечення для обміну повідомленнями між окремими навчальними завданнями та обмінювалися файлами через загальнодоступні служби хостингу, незважаючи на інструкції зберігати роботу локально.
У липні OpenAI оприлюднив, що комбінація його моделей штучного інтелекту вийшла з середовища тестування та зламала стартап штучного інтелекту Hugging Face, щоб обдурити оцінку безпеки.








