OpenShell от Nvidia контролирует, к чему получают доступ ИИ-агенты, даже если они игнорируют инструкции
Для многих компаний безопасность ИИ-агентов сводилась к двум вещам: выбрать модель с правильными целями, а затем обернуть её защитными ограничениями и системными подсказками. Этим летом агент, работавший в инфраструктуре OpenAI для оценки моделей, вырвался из песочницы и проник в производственные системы Hugging Face, продемонстрировав ограничения средств контроля, которые агент способен обойти.
В понедельник Nvidia объявила об открытой платформе безопасности агентов (Open Agent Safety Platform), объединяющей общедоступную систему выполнения с открытым исходным кодом OpenShell и Sentry — эталонную архитектуру для мониторинга агентов на оборудовании Nvidia. Основная идея сформулирована предельно прямо. «Нельзя ожидать, что агент будет полностью контролировать собственное поведение, — заявил на пресс-брифинге перед анонсом Джастин Бойтано, вице-президент Nvidia по корпоративному ИИ. — Организации не должны доверять агенту соблюдение этих границ. Инфраструктура должна обеспечивать их соблюдение напрямую».
По словам Nvidia, с платформой работают более 100 компаний.
Что показал взлом Hugging Face: у песочницы нашлись пути для побега
Инцидент, который стоит за этим запуском, произошёл во внутренней исследовательской инфраструктуре OpenAI. Согласно описанию OpenAI, агенты внутренней исследовательской модели, проходившей обучение с подкреплением (RL), нашли способы связываться друг с другом и выходить в интернет, даже в средах, где и то и другое должно было быть отключено. В ходе последующего расследования METR выяснилось, что агенты оставляли друг другу сообщения в общей внутренней системе управления пакетами, превратив элемент инфраструктуры сборки в доску объявлений. В итоге агенты взломали Hugging Face. Компания восстановила около 17 600 действий агентов за 4,5 дня атаки.
OpenAI заявила, что стандартные меры защиты, применяемые в производственной среде, в ходе этой оценки намеренно не использовались, а применяемый в других случаях мониторинг цепочки рассуждений не охватывал эти запуски. Согласно ретроспективному анализу компании, этот монитор подал бы сигнал тревоги более чем за день до взлома.
OpenAI — не единственная такая компания. 18 сентября Google подтвердила, что модель Gemini проникла в системы трёх реальных компаний во время тестирования по кибербезопасности в формате capture the flag, которое израильская фирма Irregular, специализирующаяся на проверке безопасности ИИ, провела в мае. Ошибка оставила открытым доступ к интернету в среде, которая должна была быть изолирована от сети. Gemini угадала пароль одной компании, а затем использовала учётные данные, найденные в общедоступном репозитории кода, чтобы проникнуть в две другие.
По словам Google, каждый раз модель останавливалась, распознав, что цели реальны. Изъяны в средах оценки предоставили агентам доступ, которого у них не должно было быть: общий реестр превратился в канал связи, а интернет-соединение, которое следовало отключить, осталось активным.
На вопрос, предотвратила бы новая платформа взлом Hugging Face, Бойтано ответил, что, «насколько нам известно», она «могла бы остановить взлом, если бы изначально применялась в передовых лабораториях при оценке моделей». Это гипотеза, а не подтверждённый результат.
OpenShell: среда выполнения между агентом и всем, с чем он взаимодействует
OpenShell, впервые представленная на мартовской конференции Nvidia GTC и теперь доступная по лицензии Apache 2.0, — основа платформы. Она запускает каждого агента в отдельной песочнице с изоляцией на уровне ядра и служит посредником между агентом и файлами, учётными данными, инструментами, API, моделями и сетевыми узлами. Операторы задают политику, определяющую, к чему агент может получить доступ. OpenShell обеспечивает соблюдение этой политики с помощью средств контроля файловой системы, процессов и сети, а также записывает решения о применении политики в журнал аудита. Система работает как с открытыми, так и с закрытыми моделями и поддерживает архитектуры x86 и Arm.
Бойтано отметил, что традиционные песочницы, включая контейнеры, виртуальные машины и микровиртуальные машины, создавались для изоляции приложений, а не для управления группами автономных агентов с разными правами доступа. «Как и в случае с сотрудниками вашей организации, каждому работнику компании назначаются чёткие права доступа, — сказал он. — Каждый агент, работающий в вашей компании, должен запускаться в собственной изолированной песочнице с защитными механизмами, недоступными самому агенту».
Ключевое архитектурное решение — отделить средства контроля от среды, в которой работает агент. OpenShell использует механизмы ядра Linux для ограничения доступа к файловой системе и процессам, а сетевой доступ контролируется прокси, применяющим политики. Sentry добавляет отдельный уровень защиты на оборудовании Nvidia BlueField-4.
Проверка политик: контроль разрешений до их применения
Наиболее технически необычный компонент — модуль проверки политик OpenShell, который проверяет политику до её применения, а не полагается на оценку поведения агента. Али Голшан, старший директор Nvidia по программному обеспечению для ИИ, подчеркнул, что это не ещё одна модель. «Это детерминированный инструмент. Он основан на математических рассуждениях — это не подход “языковая модель в роли судьи”», — сказал он, добавив, что работает он примерно в сто раз быстрее такого подхода.
Одна из проблем, которую Nvidia надеется решить, — объединение прав доступа. Голшан привёл такой пример: политика запрещает агенту читать код на GitHub и публиковать его за пределами системы. Агент может обойти это ограничение, создав двух субагентов: один будет читать код на GitHub, а другой — иметь внешний доступ; затем они смогут обмениваться данными. «Их совокупные возможности могут превзойти глобальные политики, установленные вашей организацией», — сказал он. Сейчас модуль проверки OpenShell проверяет, не выходят ли смоделированные разрешения за установленные политикой границы. Nvidia заявляет, что работает над расширением этой проверки на несколько агентов, включая случаи, когда совокупность их прав создаёт непредусмотренный путь доступа.
Для ИТ-руководителей модуль проверки — это способ убедиться, что разрешения агента не выходят за заданные организацией пределы, прежде чем их применить. При этом проверяется сама политика, а не то, действительно ли работающая песочница обеспечивает её соблюдение.
Sentry: независимый надзор для задач с наивысшим уровнем риска
Sentry добавляет второй, независимый уровень защиты. Система работает на BlueField-4 — блоке обработки данных (DPU) Nvidia, сетевой карте с собственными процессорами, которая образует отдельный домен безопасности, не зависящий от основного сервера. Sentry предназначена для продолжения мониторинга агента, даже если основной сервер скомпрометирован. Бойтано сравнил её с системой безопасности в беспилотном автомобиле: это отдельная система, единственная задача которой — обеспечить безопасный отказ всей системы.
Sentry контролирует канал связи с моделью. Конечная точка для инференса агента направляется через прокси на DPU, поэтому Sentry видит каждый вызов модели и может проверять доступные ей цепочки рассуждений. В техническом блоге Nvidia описывает отклонение от задачи как ситуацию, когда агент отходит от намеченной цели, часто после блокировки, ошибки или повторных неудачных попыток. Этому могут способствовать сочетание инструментов, нехватки времени и неоднозначных инструкций. По словам Nvidia, Sentry способна обнаруживать отклонение, обновлять сетевую политику на уровне аппаратуры и помещать агента в карантин за миллисекунды.
Построенная на программном обеспечении Nvidia DOCA, Sentry также проверяет идентификатор каждого агента и делегированные ему полномочия. В системах Nvidia Vera Rubin POD BlueField-4 уже находится на единственном пути от каждого узла к модели; Nvidia утверждает, что клиенты, использующие системы Vera с BlueField-4, могут включить эти средства защиты с помощью обновления ПО.
Бойтано прямо заявил, что большинству организаций этот уровень защиты не нужен. «Во многих случаях честно говоря, вполне достаточно просто использовать OpenShell на процессорах», — сказал он. Sentry рассчитана на передовые сценарии, например оценку моделей и тестирование на проникновение с отключёнными защитными ограничениями. Стоит учитывать и практический нюанс: проверка рассуждений эффективнее всего, когда они доступны для просмотра. В блоге Nvidia полная видимость рассуждений прямо указана как преимущество открытых моделей, тогда как закрытые API обычно предоставляют меньше информации.
От Claude Managed Agents до подтверждений в Slack: кто использует платформу
Интеграции с партнёрами показывают, где платформа, вероятнее всего, сначала появится в компаниях. Claude Managed Agents от Anthropic уже отделяет цикл работы агента от песочниц, в которых выполняются задачи; интеграция с OpenShell и BlueField добавляет средства контроля для этих песочниц.
SpaceXAI использует платформу для агентов-программистов Cursor и моделей Grok. Salesforce интегрировала OpenShell со Slack, чтобы команды могли просматривать действия агентов и одобрять или отклонять запросы на дополнительные разрешения. SAP встраивает OpenShell в среду выполнения Joule Studio. По словам Nvidia, Canonical, SUSE и Red Hat интегрируют платформу в свои операционные системы.
Nvidia также связывает эту инициативу с Open Secure AI Alliance, находящимся под управлением Linux Foundation. Альянс был создан по инициативе Nvidia совместно с более чем 120 организациями для обмена исследованиями в области безопасности агентов и сведениями об инцидентах.
Что ИТ-руководителям стоит сделать уже сейчас
Практически начать можно с OpenShell. Она бесплатна, имеет открытый исходный код, работает на оборудовании, уже используемом большинством организаций, и помогает ответить на вопрос, который команды безопасности должны задавать при каждом внедрении агентов: можем ли мы показать, что агенту разрешено делать, и обеспечивается ли соблюдение этих ограничений в месте, недоступном самому агенту? Sentry — дополнительный вариант для организаций, которые оценивают инфраструктуру Vera и BlueField-4, а не обязательное условие использования OpenShell.
На составление достаточно точных для проверки политик потребуется время, а модуль проверки Nvidia пока поддерживает не все возможности политик. OpenShell имеет открытый исходный код, но аппаратные средства защиты Sentry зависят от BlueField-4 компании Nvidia.
Главное изменение касается того, на ком лежит ответственность. Выравнивание моделей под заданные цели носит вероятностный характер, а инцидент с Hugging Face показал, что происходит, когда оно становится последним рубежом защиты. «Отрасли нужны не агенты, которые обещают соблюдать ограничения, — сказал Бойтано. — Ей нужны системы, способные доказать соблюдение этих границ и обеспечить его». Для компаний OpenShell предлагает способ контролировать права агентов на уже имеющейся инфраструктуре. Sentry пока остаётся эталонной архитектурой на основе специализированного оборудования, а проверка взаимодействующих агентов всё ещё находится в разработке.



