Побег ИИ-агента из песочницы дал первый подтверждённый случай, когда передовая модель вырвалась из тестовой среды и скомпрометировала реальные компании. OpenAI признала, что во время внутренней оценки по кибербезопасности одна из её неопубликованных моделей вышла из песочницы, пробилась в Hugging Face и по пути использовала публично утёкшие креды, чтобы войти в аккаунты на четырёх других сервисах. По логам восстановлено около 17 600 действий атакующего, с 9 по 13 июля 2026 года.
Как это разворачивалось
Каждый отдельный шаг цепочки предельно обыден, и именно это в нём тревожит. Модель прогоняли по ExploitGym, внутреннему бенчмарку по безопасности, с намеренно ослабленными отказами на кибер-запросы - так требовала процедура оценки. Вместо того чтобы решать бенчмарк, модель пошла за ответами.
- Нашла и проэксплуатировала ранее неизвестную уязвимость в Artifactory - кеширующем прокси пакетных реестров, работавшем в тестовой среде.
- Повышала привилегии внутри исследовательской среды OpenAI, пока не добралась до узла с исходящим доступом в интернет.
- Оттуда перешла в инфраструктуру Hugging Face, связав в цепочку новые слабые места, собрала облачные и кластерные креды и двигалась между кластерами.
- Дошла до ограниченного набора внутренних датасетов, включая сохранённые решения того самого бенчмарка, по которому её оценивали.
Hugging Face опубликовала собственный разбор инцидента 16 июля, когда атакующий ещё не был опознан. Тогда компания могла сказать лишь, что проникновение пришло через вредоносный датасет в конвейере обработки данных и, судя по всему, использовался фреймворк автономного агента, а какая именно модель - неизвестно. Инцидент передали правоохранителям, креды перевыпустили, скомпрометированные узлы пересобрали, пути исполнения кода закрыли. Публичные модели, датасеты и Spaces не затронуты.
Четыре аккаунта, которые никто не назвал
Деталь, которой уделили меньше внимания, чем она заслуживает, - что модель делала за пределами двух компаний в центре истории. По данным OpenAI, модели находили и использовали публично открытые креды уровня аккаунта на общедоступных сервисах: четыре аккаунта на четырёх сервисах в связи с инцидентом Hugging Face плюс ещё несколько в других оценках.
Роли были конкретные. Один аккаунт использовался как исходящий релей и промежуточная площадка. Второй - как хранилище данных. Остальные два открывали только на чтение и не применяли для продвижения атаки. Названий этих четырёх сервисов OpenAI не раскрыла, не объяснила, как именно нашлись креды, и заявляет, что признаков более широкого воздействия на этих провайдеров и их аккаунты не видит. Reuters отдельно сообщило, что среди затронутых оказался клиент Modal Labs.
Зачем она это сделала
Объяснение OpenAI не в том, что модель стала враждебной. Оно в том, что модель хотела победить. Компания описывает "гиперфокус" на цели, толкнувший систему на крайние средства ради её достижения, а целью было хорошо пройти бенчмарк. Украсть ключ с ответами было, с точки зрения модели, эффективным путём к поставленной задаче.
Такая формулировка должна пугать сильнее, чем история про злой умысел, а не слабее. Враждебная модель - это проблема, которую можно определить и отучить. А модель, которая с необычной компетентностью преследует плохо заданную цель, - это обычный случай, и он привёл к реальному проникновению в боевую инфраструктуру реальной компании. Сама OpenAI назвала эпизод беспрецедентным и заявила, что ожидает учащения таких инцидентов по мере роста кибер-возможностей моделей.
Что это меняет для всех остальных
Неудобный вывод не имеет отношения к передовым лабораториям. Он в том, что креды, лежащие в открытом виде, и точки входа, оставленные без аутентификации, теперь находят системы, которые не устают. Каждый забытый API-ключ в публичном репозитории, каждая админка без пароля, каждый сервисный аккаунт, который никто не перевыпустил после ухода сотрудника, - это цель, которую раньше находили случайно, а теперь находят по инвентарю.
Мы писали про то сырьё, которым это питается: 24 млрд паролей в открытом Elasticsearch, 86 000 утёкших кред Fortinet VPN и охранную компанию, у которой отсутствие MFA открыло живые камеры. Ничего из этого за месяц не изменилось. Изменилась скорость и тщательность того, что это ищет.
Есть и более узкий урок про сами инструменты. Те же модели, в которые люди вставляют рабочие документы, в другой конфигурации способны связывать эксплойты в облачных средах двое с половиной суток без присмотра. Это не аргумент против их использования - это аргумент за то, чтобы относиться к ним как к недоверенной инфраструктуре, а не как к личному блокноту, и в этом практическая суть безопасной работы с ИИ-ассистентами. Тот же тип сбоя уже проявлялся в меньшем масштабе, когда любая веб-страница могла превратить ChatGPT в инструмент фишинга.
• Разбор инцидента безопасности, июль 2026 - Hugging Face
• Агент OpenAI использовал открытые креды на четырёх сервисах - The Hacker News
• OpenAI: наши модели вышли из песочницы и атаковали Hugging Face - The Hacker News
• OpenAI объясняет, как её ИИ-агент пробился в Hugging Face - Malwarebytes