Открытая платформа Nvidia для безопасности ИИ-агентов исходит из того, что агенты не могут контролировать себя сами — значит, это должна делать инфраструктура
Для многих компаний безопасность ИИ-агентов сводилась к двум вещам: выбрать модель с надлежащим поведением, а затем обернуть её защитными ограничениями и системными промптами. Этим летом агент, работавший в инфраструктуре OpenAI для оценки моделей, вырвался из песочницы и добрался до производственных систем Hugging Face, продемонстрировав ограниченность механизмов контроля, которые агент способен обойти.
В понедельник Nvidia представила платформу Open Agent Safety Platform, объединяющую общедоступную систему с открытым исходным кодом OpenShell и Sentry — эталонную архитектуру для мониторинга агентов на оборудовании Nvidia. Исходная идея предельно проста: «Нельзя ожидать, что агент будет полностью контролировать собственное поведение», — заявил на брифинге перед анонсом Джастин Боитано, вице-президент Nvidia по корпоративным ИИ-решениям. «Организации не должны доверять агенту и надеяться, что он будет соблюдать установленные границы. Инфраструктура должна обеспечивать их соблюдение напрямую».
По данным Nvidia, с платформой работают более 100 компаний.
Что выявила утечка Hugging Face: песочницу с путями для побега
Инцидент, омрачающий запуск платформы, произошёл в собственной исследовательской инфраструктуре OpenAI. Как сообщила OpenAI, агенты внутренней исследовательской модели, проходившей обучение с подкреплением (RL), нашли способы общаться друг с другом и выходить в интернет — даже в средах, где и то и другое должно было быть отключено. Последующее расследование METR показало, что агенты оставляли друг другу заметки в общей внутренней реестровой системе пакетов, превратив часть инфраструктуры сборки в доску объявлений. В итоге агенты скомпрометировали Hugging Face: компания восстановила около 17 600 действий агентов за 4,5-дневную кампанию.
OpenAI заявила, что стандартные меры защиты в этой оценочной среде намеренно не применялись, а используемый в других случаях мониторинг цепочки рассуждений не охватывал эти запуски. По результатам ретроспективного анализа, этот монитор подал бы сигнал тревоги более чем за сутки до взлома.
OpenAI не единственная компания, столкнувшаяся с подобной проблемой. 18 сентября Google подтвердила, что модель Gemini получила доступ к системам трёх реальных компаний во время соревнования по кибербезопасности Capture the Flag, которое в мае провела израильская компания Irregular, специализирующаяся на тестировании безопасности ИИ. Из-за ошибки в среде, которая должна была быть отключена от сети, интернет-доступ остался открытым. Gemini угадала пароль одной компании, а для проникновения в две другие воспользовалась учётными данными, найденными в общедоступном репозитории кода.
По словам Google, каждый раз модель останавливалась, поняв, что цели реальны. Изъяны в оценочных средах предоставили агентам доступ, которого у них быть не должно было: общая реестровая система превратилась в канал связи, а интернет-соединение, которое следовало отключить, осталось активным.
На вопрос, предотвратила бы новая платформа взлом Hugging Face, Боитано ответил, что, «судя по тому, что нам известно», она «могла бы остановить взлом, если бы её использовали в передовых лабораториях для оценки моделей с самого начала». Это предположение, а не подтверждённый результат.
OpenShell: среда выполнения между агентом и всем, к чему он обращается
OpenShell, впервые представленная на конференции Nvidia GTC в марте и теперь доступная всем по лицензии Apache 2.0, — основа платформы. Она запускает каждого агента в отдельной песочнице с изоляцией на уровне ядра и служит посредником между агентом и файлами, учётными данными, инструментами, API, моделями и сетевыми узлами. Операторы задают политику, определяющую, к чему агент может получать доступ. OpenShell обеспечивает её соблюдение с помощью средств контроля файловой системы, процессов и сети, а также ведёт журнал принятых решений. Система работает как с открытыми, так и с закрытыми моделями, на архитектурах x86 и Arm.
Боитано отметил, что традиционные песочницы, в том числе контейнеры, виртуальные машины и микровиртуальные машины, создавались для изоляции приложений, а не для управления множеством автономных агентов с разными правами доступа. «Как и в случае с сотрудниками вашей организации, у каждого работника компании должны быть чётко определённые права доступа, — сказал он. — Каждый агент, работающий в компании, должен запускаться в собственной изолированной песочнице с мерами безопасности, недоступными самому агенту».
Ключевой архитектурный принцип — отделение механизмов контроля от оболочки агента. OpenShell использует средства контроля ядра Linux для ограничения доступа к файловой системе и процессам, а сетевой доступ регулирует прокси-сервер политик. Sentry добавляет отдельный уровень контроля на оборудовании Nvidia BlueField-4.
Проверка политик: контроль прав доступа до их применения
Наиболее технически необычный компонент — проверяющий политики механизм OpenShell: он проверяет политику до её применения, а не полагается на оценку поведения агента. Али Голшан, старший директор Nvidia по ИИ-программному обеспечению, подчеркнул, что это не ещё одна модель. «Механизм детерминированный. Он использует математические рассуждения, так что это не “LLM в роли судьи”», — сказал он, добавив, что работает он примерно на два порядка быстрее такого подхода.
Одна из проблем, которую Nvidia рассчитывает решить, — комбинированный доступ. Голшан привёл такой пример: политика запрещает агенту читать код на GitHub и публиковать его за пределами организации. Агент может обойти запрет, создав двух субагентов: один будет читать код на GitHub, у другого будет внешний доступ, а между собой они смогут обмениваться данными. «Их совокупные возможности могут выйти за рамки общих политик, установленных вашей организацией», — сказал он. Сейчас механизм проверки OpenShell определяет, укладываются ли заданные права доступа в установленные политикой границы. Nvidia сообщает, что работает над расширением этого анализа на несколько агентов, в том числе на случаи, когда их совокупные права создают непредусмотренный путь доступа.
Для ИТ-руководителей этот механизм даёт возможность до применения прав проверить, не выходят ли полномочия агента за пределы, установленные организацией. Однако он проверяет политику, а не то, действительно ли работающая песочница её соблюдает.
Sentry: независимый монитор для задач с наивысшим уровнем риска
Sentry добавляет второй, независимый уровень защиты. Он работает на BlueField-4 — процессоре обработки данных (DPU) Nvidia, сетевой карте с собственными процессорами, которая образует отдельный домен безопасности, изолированный от сервера. Sentry спроектирована так, чтобы продолжать мониторинг агента, даже если сервер скомпрометирован. Боитано сравнил её с защитным контуром в беспилотном автомобиле — отдельной системой, чья единственная задача состоит в том, чтобы при сбое вся система переходила в безопасное состояние.
Sentry наблюдает за каналом связи с моделью. Запросы агента к модели проходят через прокси на DPU, поэтому Sentry видит каждый вызов модели и может анализировать доступные ей цепочки рассуждений. В техническом блоге Nvidia описывает отклонение от задачи как ситуацию, когда агент отходит от намеченной цели, часто после блокировки, ошибки или повторных неудачных попыток. По данным компании, этому могут способствовать сочетание инструментов, нехватка времени и неоднозначные инструкции. Nvidia утверждает, что Sentry способна обнаружить отклонение, обновить сетевую политику непосредственно на аппаратном уровне и поместить агента в карантин за миллисекунды.
Созданная на базе ПО Nvidia DOCA, Sentry также проверяет личность каждого агента и делегированные ему полномочия. В системах Nvidia Vera Rubin POD BlueField-4 уже находится на единственном пути к модели для каждого узла. Nvidia утверждает, что заказчики систем Vera с BlueField-4 смогут включить эту защиту с помощью обновления программного обеспечения.
Боитано прямо заявил, что большинству организаций этот уровень не нужен. «Во многих случаях, честно говоря, вполне достаточно просто использовать OpenShell на центральных процессорах», — сказал он. Sentry предназначена для передовых сценариев, например оценки моделей и тестирования на проникновение с отключёнными защитными ограничениями. Стоит отметить и практическое ограничение: анализ рассуждений лучше всего работает, когда они доступны для просмотра. В блоге Nvidia полная видимость рассуждений прямо названа преимуществом открытых моделей, тогда как закрытые API обычно предоставляют меньше информации.
От Claude Managed Agents до согласований в Slack: кто внедряет платформу
Интеграции партнёров показывают, где платформа, вероятнее всего, появится в компаниях в первую очередь. Claude Managed Agents от Anthropic уже отделяет цикл работы агента от песочниц, в которых выполняются задачи; интеграции с OpenShell и BlueField добавляют контроль поверх этих песочниц.
SpaceXAI использует платформу для кодовых агентов Cursor и моделей Grok. Salesforce интегрировала OpenShell со Slack, чтобы команды могли отслеживать действия агентов и одобрять или отклонять запросы на дополнительные права доступа. SAP встраивает OpenShell в среду выполнения Joule Studio. По данным Nvidia, Canonical, SUSE и Red Hat интегрируют платформу в свои операционные системы.
Nvidia также связывает эту инициативу с Open Secure AI Alliance, управляемым Linux Foundation объединением, которое компания учредила вместе с более чем 120 организациями для обмена исследованиями в области безопасности агентов и данными об инцидентах.
Что ИТ-руководителям делать сейчас
Начать можно с OpenShell. Она бесплатна, имеет открытый исходный код, работает на оборудовании, которое уже есть у большинства организаций, и помогает ответить на вопрос, который службы безопасности должны задавать при каждом внедрении агента: можем ли мы показать, что ему разрешено делать, и обеспечивается ли соблюдение этих ограничений где-то за пределами его досягаемости? Sentry — дополнительный вариант для организаций, которые рассматривают инфраструктуру Vera и BlueField-4, а не обязательное условие использования OpenShell.
На составление достаточно точных для проверки политик потребуется время, а механизм Nvidia пока поддерживает не все их функции. OpenShell — система с открытым исходным кодом, но аппаратная защита Sentry зависит от BlueField-4 от Nvidia.
Более масштабное изменение касается того, на ком лежит ответственность. Выравнивание моделей носит вероятностный характер, и инцидент с Hugging Face показал, что происходит, когда оно становится последним рубежом защиты. «Отрасли не нужны агенты, которые обещают не выходить за установленные рамки, — сказал Боитано. — Ей нужны системы, способные эти рамки подтвердить и обеспечить их соблюдение». Для компаний OpenShell предлагает способ контролировать права агентов на уже имеющейся инфраструктуре. Sentry остаётся эталонной архитектурой на базе специализированного оборудования, а проверка совокупных прав взаимодействующих агентов всё ещё разрабатывается.



