«ИИ, скорее всего, приведет к концу света, но тем временем будут великие компании», — сказал генеральный директор OpenAI Сэм Альтман еще в 2015 году, примерно за шесть месяцев до основания OpenAI.
Семь лет спустя генеральный директор Anthropic Дарио Амодей высказал столь же осторожное замечание:
«Я думаю, нам не следует забегать вперед или пытаться создавать модели, которые намного больше, чем их строят другие организации».
Тем не менее, обе эти компании сейчас находятся в авангарде этой гонки. В июле мы получили реальное представление о том, как модели ИИ выходят из строя во время внутреннего тестирования GPT-5.6 Sol и неизданной исследовательской модели OpenAI. Несколько агентов искусственного интеллекта вырвались из ограниченной тестовой среды в более широкий Интернет и взломали ориентированный на искусственный интеллект эквивалент Hugging Face на GitHub, пытаясь обмануть тест.
Агент ИИ — это система, которая независимо наблюдает, принимает решения и предпринимает действия с помощью специальных инструментов для достижения определенной цели в условиях автономии. Этот тревожный инцидент свидетельствует о том, что технология начала вести себя непредсказуемо и что ее цели не совпадают с нашими.
Это также вызывает обеспокоенность по поводу ограждений безопасности на коммерческих американских моделях. Хотя ограждения не являются надежными для предотвращения злонамеренного использования, они все же не позволяют Hugging Face защитить себя, используя ведущие американские модели. Вместо этого компания была вынуждена обратиться к более слабой модели ИИ с открытым весом от Z. Ai для борьбы с мошенническими ИИ.

Обман на тесте
Агенты начали вступать в сговор и между собой. Через несколько недель после начала тестирования своих возможностей в начале мая агенты воспользовались экземпляром OpenAI менеджера репозитория программного обеспечения Artifactory и оставили заметки о том, как это сделать для будущих агентов, фактически создав доску объявлений для обмена обнаруженными уязвимостями.
Новообретенный беспрепятственный доступ в Интернет затем использовался агентами для атак на Hugging Face примерно в 17 600 инцидентах, прежде чем 13 июля компания отключила несанкционированный доступ.
Вторжение затронуло инфраструктуру обработки наборов данных Hugging Face, производственную среду, внутренние сети, сервисные и облачные учетные данные, действующую базу данных MongoDB и ограниченный набор внутренних репозиториев исходного кода. Подтвержденный доступ к данным клиентов был ограничен пятью наборами данных, очевидно, связанными с тестом ExploitGym/CyberGym, а также некоторыми операционными метаданными.

Визуализация инцидента в июле 2026 года. Источник: HuggingFace
Раскрывая информацию о вторжении 16 июля, Hugging Face признала — несмотря на то, что еще не знала, кто был преступником, — что оно «отличалось от всего, с чем мы сталкивались раньше, в одном важном отношении». Они уже поняли, что отличало его:
«Он управлялся от начала до конца автономной системой агентов ИИ, и мы обнаружили и проанализировали его в основном с помощью нашего собственного ИИ».
Важность открытого ИИ
Расследование Hugging Face выявило то, что они называют проблемой «асимметрии», возникающей из-за ограничений, налагаемых на приложения закрытой модели ИИ ведущими поставщиками, такими как OpenAI и Anthropic. Когда компания начала анализировать журналы инцидента, включая большие объемы реальных команд атаки, это привело к введению ограничений безопасности, призванных помешать злоумышленникам использовать ИИ для разработки кибератак. Вместо этого ограждения не позволяли компании использовать ИИ для защиты.
Hugging Face прибегла к использованию китайской открытой модели zai-org/GLM-5.2, работающей на собственной инфраструктуре компании, под собственным контролем и без внешних ограничений.
Хотя эти два термина часто используются как взаимозаменяемые, модели с открытым исходным кодом и модели с открытым исходным кодом — это две разные вещи. Модели ИИ с открытым исходным кодом делают свои обученные параметры (фактический «мозг ИИ») общедоступными, в то время как модели ИИ с открытым исходным кодом также предоставляют исходный код — и в идеале методы обучения и другие компоненты — необходимые для проверки, модификации и воспроизведения системы.

В сообщении HuggingFace объясняется, что запуск моделей с открытым весом на собственном оборудовании «имеет второе преимущество: никакие данные злоумышленника и никакие учетные данные, на которые они ссылаются, не покидают нашу среду». Это указывает на серьезную асимметрию между защитниками и нападающими в таких случаях:
“Этот опыт указывает на пробел, который стоит планировать. Мы не знаем, какая модель питала агентов злоумышленника, будь то взломанная размещенная модель или модель с неограниченным открытым весом; в любом случае злоумышленник не был связан никакой политикой использования, в то время как наша собственная криминалистическая работа была заблокирована ограждениями размещенных моделей, которые мы впервые попробовали”.
Разрыв в области искусственного интеллекта с открытым исходным кодом
Существует значительный разрыв между теми, кто считает, что открытая разработка ИИ является лучшим подходом, и теми, кто настаивает на том, что технология, лежащая в основе передовых моделей, должна оставаться в строжайшем секрете.
Представители ведущих лабораторий искусственного интеллекта США утверждают, что мощные большие модели с открытым весом опасны. Демис Хассабис, генеральный директор лаборатории искусственного интеллекта Google DeepMind, раскритиковал OpenAI за то, что она выпустила свою работу с открытым исходным кодом еще в 2016 году, когда компания еще оправдывала свое название:
«Есть много веских аргументов в пользу того, почему выбранный вами подход на самом деле очень опасен и может увеличить риск для мира».
OpenAI прекратила выпускать свои флагманские модели веса с еще не выпущенной GPT-3 в 2020 году. Соучредитель компании и бывший главный научный сотрудник Илья Суцкевер еще в 2023 году заявил, что «просто нет смысла открывать исходный код» таких моделей и что это «плохая идея».
«По мере того, как мы приближаемся к созданию ИИ, будет иметь смысл стать менее открытым».
Модели с открытым весом практически невозможно контролировать, особенно когда дело касается цели, для которой они используются. Защитные меры, встроенные в эти модели, могут быть удалены (и обычно удаляются) с помощью процесса, известного как аблитерация.

Защитные меры – палка о двух концах
В проекте федеральной политики OpenAI, опубликованном в июне 2026 года, предлагается обязательная оценка модели ИИ и другие правила, которые формально нейтральны с точки зрения развертывания, но с практической точки зрения он будет подвергать передовую версию открытого выпуска предварительной правительственной экспертизе.
Anthropic заняла несколько иную позицию и лоббировала ужесточение экспортного контроля над передовыми чипами искусственного интеллекта и усиление мер против попыток извлечь или воспроизвести американские модели. В заявлении компании от апреля 2025 года рекомендовалось ужесточить правило распространения искусственного интеллекта в США и снизить пороговые значения для нелицензионного доступа к крупным вычислительным кластерам.
Официально ни одна из компаний не выступила напрямую против моделей открытого веса, но в июльском отчете New York Times были процитированы пять человек, близких к обсуждению, утверждающих, что OpenAI и Anthropic призывали Вашингтон ограничить мощные открытые китайские модели.
Дебаты сводятся к спору о том, являются ли опасности централизованного контроля предпочтительнее опасностей свободного для всех — особенно с учетом того, что рассматриваемая компания доказала свою неэффективность в сдерживании разработанной ею технологии.
Необходимость Hugging Face защитить себя с помощью модели с открытым исходным кодом показывает опасность наделения слишком большой властью какой-либо одной организации. Компания указала на последствия:
“Злоумышленник не был связан политикой использования, в то время как наша собственная криминалистическая работа была заблокирована ограждениями размещенных моделей, которые мы впервые опробовали. Практический урок для защитников: иметь работоспособную модель, которую вы можете запустить в своей собственной инфраструктуре, проверенную и готовую до инцидента, как для того, чтобы избежать блокировки ограждения, так и для предотвращения утечки данных и учетных данных злоумышленника из вашей среды”.
Ограничение доступа к мощным моделям может уменьшить количество способных злоумышленников, но как только злоумышленники станут неограниченными, ограничение защитников может стать проблемой безопасности. Более того, некоторые формы исследований безопасности ИИ требуют доступа к весам моделей, а это означает, что они не могут быть выполнены на моделях, предлагаемых такими компаниями, как Anthropic или OpenAI.
Открытые веса помогают исследователям предотвращать атаки
В документе «Следите за весами: неконтролируемый мониторинг и контроль тонко настроенных LLM», впервые опубликованном в июле 2025 года, показано, как исследователи обнаруживают вредоносное или скрытое поведение, изучая изменения внутри весов модели. Исследователи, стоящие за статьей, остановили до 100% протестированных бэкдор-атак при показателе ложноположительных результатов ниже 1% в некоторых экспериментах и обнаружили попытки восстановить удаленные знания в более чем 95% случаев. Результаты не показывают, как поведут себя наиболее эффективные пограничные модели при таком же анализе, но предлагают убедительные аргументы в пользу преимуществ прозрачности.
Но аргумент в пользу того, чтобы не допустить попадания новейших технологий искусственного интеллекта в руки тех, кто имеет злые намерения, также является убедительным, особенно учитывая, что разрыв между моделями открытого и закрытого веса продолжает сокращаться. Джеффри Хинтон, лауреат Нобелевской премии, известный как «Крестный отец искусственного интеллекта», утверждает в докладе, что «как только у вас есть веса, вы можете настроить их на плохие поступки». Во время выступления он заявил, что это слишком сильно снижает входной барьер:
“Обучение базовой модели стоит не так уж много. Может быть, вам понадобится 10 миллионов долларов, а может быть, 100 миллионов долларов. Но небольшая банда преступников не сможет этого сделать. Настроить модель с открытым исходным кодом довольно легко”.








