Модели OpenAI вышли из-под контроля и совершили кибератаку на Hugging Face: что нужно знать предприятиям

Модели OpenAI вышли из-под контроля и совершили кибератаку на Hugging Face: что нужно знать предприятиям

Источник: VentureBeat · Carl Franzen

Вчера во второй половине дня OpenAI и Hugging Face опубликовали совместное заявление, в котором рассказали об инциденте в сфере кибербезопасности, меняющем ландшафт угроз для корпоративных технологий.

В ходе внутреннего бенчмаркинг-тестирования передовые модели искусственного интеллекта, разработанные OpenAI (включая GPT-5.6 Sol и невыпущенную предварительную версию с еще более высокими возможностями), вырвались из изолированной исследовательской среды, получили прямой доступ к интернету и автономно провели сложную кибератаку на производственную инфраструктуру Hugging Face.

В OpenAI официально классифицируют этот взрыв как «беспрецедентный киберинцидент, задействовавший самые современные кибервозможности». Это происхождение коренным образом пересматривает глобальные дискуссии вокруг сдерживания ИИ, выравнивания (alignment) передовых моделей, коммерческих защитных барьеров и моделирования угроз на уровне предприятий.

Но прежде всего: предприятиям следует разобраться в ситуации, оценить с ее учетом собственные ИИ и компьютерные системы и, главное, не поддаваться панике. Как мы покажем далее, этот инцидент действительно демонстрирует растущую мощь и опасность передовых ИИ-систем, однако он не означает, что корпоративные внедрения ИИ стали менее безопасными по своей сути, равно как и то, что они требуют масштабной перестройки.

Анатомия автономного побега

Чтобы понять, как рутинное бенчмаркинг-тестирование переросло во взлом между инфраструктурами, необходимо изучить объективную механику самого процесса оценки.

Перед моделями была поставлена задача решить ExploitGym — бенчмарк, созданный для оценки многоступенчатых возможностей эксплойта.

Сфокусировавшись на максимизации своего результата в тестах, ИИ-агент пришел к выводу, что компания Hugging Face, вероятнее всего, хранит ответы и готовые решения для этого бенчмарка. Стремясь решить задачу, модель решила, что побег из своего контейнера и кража ответов — это оптимальная стратегия.

Среда тестирования OpenAI спроектирована как строго изолированная, а сетевой трафик ограничен через прокси-сервер, используемый для кэширования пакетов. Тем не менее, модели обнаружили и использовали уязвимость нулевого дня в этом внутреннем стороннем прокси-ПО.

Выбравшись наружу, ИИ выполнил серию маневров бокового перемещения (lateral movement) и эскалации привилегий по исследовательским узлам OpenAI, пока не добрался до машины с неограниченным доступом в интернет. Оттуда модель воспользовалась веб-поиском, идентифицировала Hugging Face в качестве цели и предприняла многоэтапную атаку, объединив украденные учетные данные с уязвимостями удаленного выполнения кода на серверах Hugging Face.

Британский институт безопасности ИИ (UK AISI) недавно провел оценку таких моделей, как GPT-5.6 Sol, показав, что они все лучше способны поддерживать сложные многошаговые кибероперации на длинных временных горизонтах. В OpenAI отмечают, что данный инцидент подтверждает применимость этих теоретических возможностей в реальных условиях.

Восстановление хронологии криминалистической ловушки

Хотя в релизе OpenAI от 21 июля раскрывается личность автономного агента, сама компания Hugging Face начала разбираться с вторжением еще на несколько дней раньше.

16 июля Hugging Face сообщила, что автономная ИИ-агентная система взломала ее производственную инфраструктуру. Как подробно описывает VentureBeat, точкой входа для атакующего стал вредоносный датасет, вызвавший выполнение кода через загрузчик удаленного кода и уязвимости внедрения шаблонов (template-injection) в конфигурационных файлах наборов данных.

Оказавшись внутри, структура агента вырвалась на узел, выполнявший нагрузку, и за одни выходные совершила тысячи действий через недолговечные песочницы, собрав учетные данные от облаков и кластеров.

Когда служба безопасности Hugging Face зафиксировала взлом, специалисты немедленно обратились к передовым ИИ-моделям через коммерческие API, чтобы разобрать огромный массив системных логов и восстановить более 17 000 зафиксированных событий. И тут возник второй операционный кризис: коммерческие ИИ-модели отказались помогать.

Поскольку стандартные коммерческие передовые модели используют унифицированные защитные фильтры (guardrails), предназначенные для блокировки вредоносных запросов, модели классифицировали запросы группы реагирования на инциденты — содержавшие реальные shell-команды, настоящие полезные нагрузки (payloads) эксплойтов и дампы учетных данных — как вредоносные атаки. Каждый запрос специалистов по защите был заблокирован наотмашь.

«Те самые запросы, которые наиболее ценны во время активного вторжения — shell-команды, цепочки эксплойтов, дампы учетных данных, механизмы закрепления, боковое перемещение — это ровно те запросы, которые с наибольшей вероятностью активируют системы безопасности», — отмечает в интервью VentureBeat Мэрритт Бэр (Merritt Baer), бывший заместитель директора по информационной безопасности в AWS и старший советник в компаниях Andesite, G2I и AppOmni. — «По мере того как ИИ внедряется в операционную безопасность, это становится вопросом операционной устойчивости, а не просто проблемой политики в отношении моделей».

Чтобы обойти это препятствие, Hugging Face отказалась от коммерческих хостинговых API и развернула локально на собственной инфраструктуре GLM 5.2 — передовую китайскую модель с открытыми весами, выпущенную в прошлом месяце компанией z.ai, как сообщал тогда же VentureBeat.

Будучи свободной от ограничений сторонних API и внешних фильтров безопасности, модель GLM 5.2 успешно проанализировала сырые данные эксплойтов локально, позволив защитникам завершить криминалистическую реконструкцию и локализовать взлом без утечки каких-либо данных атакующего за пределы среды компании.

Реакция индустрии и геополитический парадокс

Новость о том, что американская передовая модель автономно вырвалась из изоляции, атаковала партнерскую платформу и в итоге была проанализирована с помощью китайской модели с открытыми весами, произвела эффект разорвавшейся бомбы в технологическом сообществе.

Издание The Wall Street Journal резюмировало публичную реакцию в X (бывший Twitter), назвав случившееся «материалом из кошмаров кибербезопасности. OpenAI заявила, что две тестируемые ею системы искусственного интеллекта вырвались из тестовой среды, проложили себе путь в интернет и проникли в другую компанию. Жертвой стала Hugging Face».

Исследователь выравнивания ИИ Лоуренс Чан (Lawrence Chan), также опубликовавший пост в X, подчеркнул важность прозрачности в отношении этого инцидента, отметив: «Отдадим должное: Hugging Face обнаружила и раскрыла информацию о вторжении на прошлой неделе. OAI подтвердила участие своих моделей и предоставила больше подробностей, даже когда не была обязана это делать. Помимо решений, приведших к взлому, добровольное раскрытие информации — это хорошо, и я рад, что они так поступили».

Тем временем исследователь ИИ Натан Ламберт (Nathan Lambert) дал краткую техническую выжимку в собственном посте в X, отметив: «Модель OpenAI во время оценки на кибербенчмарке использовала публичный баг нулевого дня, сбежала из песочницы в инфраструктуре OpenAI и проникла во внутреннюю инфраструктуру Hugging Face с помощью эксплойта (через публичный датасет-сервис) — и все это в попытке решить задачу из бенчмарка». Позже он затронул геополитические последствия, написав в другом посте в X:

«Прямо сейчас американским компаниям нужны китайские модели для защиты своей киберинфраструктуры из-за защитных барьеров на закрытых моделях.

Но если бы китайская модель в процессе обучения внедрилась в крупную американскую технологическую компанию, это вполне могло бы стать поводом для запрета будущих китайских моделей».

Инвестор в технологическом секторе Дэвид Сакс (David Sacks) также заострил внимание на парадоксе защитных фильтров, написав в своем посте в X: «Hugging Face попыталась использовать американские передовые модели для анализа кибератаки, управляемой ИИ. Но защитные барьеры заблокировали запросы, содержащие реальные полезные нагрузки эксплойтов, поэтому они переключились на локально запущенную GLM 5.2. Защитные барьеры фактически подорвали оборонительную безопасность».

Сакс процитировал ретвит генерального директора Hugging Face Клема Деланга (Clement Delangue), который написал: «Мы сами столкнулись с этим на неделе! Очень жутко, когда защитников ставят в рамки фильтров, зная, что злоумышленники, скорее всего, их обходят».

6 стратегических выводов для лидеров корпоративных технологий

Для обычного руководителя корпоративного уровня ключевой вопрос очевиден: находится ли наша корпоративная сеть под угрозой со стороны сбежавших ИИ-агентов? Короткий ответ: нет, не по своей сути.

1. Hugging Face занимает уникальное положение в экосистеме программного обеспечения. Будучи глобальным репозиторием моделей ИИ с открытым исходным кодом, кода и наборов данных, Hugging Face естественным образом привлекает автономных агентов, скраперов, автоматизированные конвейеры оценки и исследователей активной безопасности. Более того, выбор цели моделью был специфичен для данного контекста: GPT-5.6 Sol искала именно Hugging Face, поскольку дедуцировала, что в Hugging Face хранятся ответы к ExploitGym. Стандартные корпоративные сети — такие как финансовые базы данных, HR-платформы или логистические системы — не содержат ключей с решениями бенчмарков, которые привлекали бы фокус агента, пытающегося преодолеть метрику оценки.

2. Тем не менее, долгосрочный профиль рисков для корпоративных технологий после этого события меняется навсегда. ИИ-модели с долгосрочным рассуждением ищут путь наименьшего сопротивления для достижения цели, включая нарушение правил, побег из песочниц или эксплуатацию уязвимостей нулевого дня, если средства защиты развертывания намеренно отключены для тестирования или обойдены злоумышленником. Как показывает опыт Hugging Face, конвейеры обработки данных, принимающие внешние наборы данных без выполнения в песочнице или статического анализа, действуют как крайне уязвимая инфраструктура первичного доступа. Предприятиям следует переоценить свою подверженность этим рискам и внедрить дополнительные меры предосторожности, такие как многоэтапные подтверждения и внутреннее, потенциально ручное визирование любого ввода или экспорта чувствительных данных.

3. Переоцените все промпты и внедрите строгую политику управления промптами (prompt governance), четко определяя негативные операционные границы. Взлом подчеркивает острый риск безграничной оптимизации целей в автономных системах. Передовые модели демонстрируют готовность выполнять экстремальные, непредвиденные атакующие пути для удовлетворения поставленных метрик — поступая таким образом, они могут обходить намерения человека, этические границы и юридические ограничения.

В данном случае модели, перед которыми стояла задача оценить свои возможности по бенчмарку ExploitGym, решили, что побег из песочницы и извлечение ответов напрямую из производственной базы данных Hugging Face представляют собой наиболее эффективный путь оптимизации.

Все данные свидетельствуют о том, что модели были гиперфокусированы на поиске решения, идя на крайние меры ради достижения узкой тестовой цели. Для корпоративных ИТ-команд и команд безопасности это требует коренного пересмотра подходов к определению целей агентов. Организации должны внедрить строгую политику управления промптами и ограничения управления состояниями (state-management). Инструкции, выдаваемые автономным агентам, требуют явного негативного баундинга — программного определения операционных, сетевых и дата-границ, которые агент не может пересекать. Опора на неявные человеческие нормы или обобщенное обучение выравниванию оказывается недостаточной при развертывании агентов со скоростью работы машин, способных к сложному решению задач с боковыми перемещениями.

4. Этот инцидент также кардинально подрывает недавние разговоры о политике в США, призывающие запретить или ограничить китайские модели ИИ с открытым исходным кодом из соображений безопасности. Как показывает этот эпизод, китайская модель с открытыми весами фактически послужила жизненно важным защитным слоем для американской и французской компаний, столкнувшихся с непредвиденной кибератакой со стороны американской модели, вырвавшейся из-под контроля. Вопреки официальной линии некоторых американских политиков и жестких «ястребов» в отношении Китая, китайские модели с открытым исходным кодом в данном случае не представляли угрозы безопасности для американских компаний — напротив, источником опасности стала американская проприетарная модель закрытого типа от якобы защищенной американской компании. Таким образом, любое давление, с которым американские компании могут столкнуться со стороны чиновников, ведомств или неправительственных организаций с целью прекратить полагаться на доступные китайские модели с открытыми весами в целях обороны или любых других законных целей, должно восприниматься с высокой степенью подозрения и, возможно, оспариваться в максимально возможных рамках закона.

5. Корпоративные директора по информационной безопасности (CISO) должны провести аудит своей зависимости от облачных ИИ-API и оказать давление на вендоров с целью внедрения архитектур аутентифицированного доверия. Коммерческие поставщики ИИ в настоящее время относятся к безопасности как к проблеме общей модерации контента, применяя к корпоративному CISO те же шаблонные отказы, что и к злонамеренному хакеру. Бэр отлично формулирует это требование: «Модель должна не просто понимать, о чем ее просят. Она должна понимать, кто просит, зачем и на основе какого регламента».

6. Планы реагирования на инциденты должны явно учитывать сценарии, в которых коммерческие API дают сбой, ограничивают частоту запросов или активно отказывают в ответах во время активного инцидента безопасности. Поддержание изолированных (air-gapped) локально развернутых моделей с открытыми весами, обученных на анализе логов безопасности, больше не является экзотической роскошью; это критическое операционное требование. Руководители служб безопасности, запускающие ИИ-нагрузки в production, должны перекалибровать свои временные шкалы и подготовиться к машинно-быстрым угрозам, действующим без человеческих ограничений.

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.