Управление ИИ-агентами: когда ИИ судит ИИ
Источник: VentureBeat · Louis Columbus
На круглом столе по вопросам информационной безопасности, организованном директором по информационной безопасности Anthropic, Дев Риши задал простой вопрос: у всех ли в комнате записаны правила обеспечения безопасности и управления ИИ? Все подняли руки — около 14 человек по его подсчетам. Его уточняющий вопрос о том, как кто-либо на практике внедряет эти правила, вызвал совсем другую реакцию. «И все захихикали, — вспоминал Риши, генеральный менеджер по направлению ИИ в компании Rubrik во время беседы у камина на конференции VB Transform 2026 в Менло-Парке. — Это было похоже на грязный секрет: у всех есть эти правила, но нет реального способа воплотить их в жизнь».
«Наш основатель и технический директор действительно активно настаивал на том, чтобы включить наших агентов в режиме YOLO», — рассказал Риши аудитории. Это признание прозвучало от публичной компании в сфере безопасности данных, чей бизнес заключается в защите того, что он назвал самыми важными данными в мире.
Режим YOLO (You Only Live Once) убирает запросы на подтверждение из рабочих процессов агентов и позволяет им действовать самостоятельно. В версии Rubrik второй ИИ в режиме реального времени оценивает каждое действие на соответствие установленным правилам вместо человека, нажимающего кнопку утверждения. Rubrik проводит этот эксперимент сначала на себе. Риши рассматривает автономность как решенный вопрос возможностей и как открытый вопрос целесообразности. «Если вы попросите агента действовать автономно, он это сделает, — сказал он. — Это внутренний вопрос для вас. Стоит ли ему это делать?»
Компания Rubrik пришла к этому вопросу трудным путем. Когда были запущены пилотные проекты Claude Code и Cowork, компания потребовала запускать каждую команду в режиме запроса, чтобы ответственность несет сотрудник, отдающий ее, и возражения разработчиков заполнили одну ветку в Slack на 120 сообщений.
«Разработчики в основном возражают и говорят: это как лицензионное соглашение iTunes. Я просто ставлю галочки везде, везде, везде, везде, везде, везде, везде, — сказал Риши. — У меня нет возможности прочитать всё это. И это превращается в показушную безопасность». Примерно 80% респондентов оказываются в такой же ловушке, отметил Риши, ссылаясь на исследование Rubrik Zero Labs, которое показало, что мониторинг и одобрение действий агентов отнимают больше времени, чем агенты экономят. В апрельском отчете «Состояние агентов» (The State of the Agent), на который опирается эта цифра, были опрошены более 1600 руководителей ИТ-отделов и специалистов по безопасности.
SAGE — это причина, по которой Rubrik уверена в этой ставке. Аббревиатура расшифровывается как Semantic AI Governance Engine (Семантический движок управления ИИ). SAGE представляет собой арбитражный слой внутри Rubrik Agent Cloud, который отслеживает каждое действие агента, считывает скрытый за ним семантический смысл, а затем разрешает или запрещает это действие на основе правил, написанных на естественном языке. «Мы взяли то, что люди называли участием человека в контуре (human in the loop) — хорошую идею, — и заменили его участием ИИ в контуре», — сказал Риши, описывая концепцию руководителям службы безопасности, которых он охарактеризовал как опасающихся недетерминированных систем.
Одобрение безопасности, а не стоимость, блокирует окупаемость инвестиций в ИИ
Путь Риши в Rubrik пролегал через компанию Predibase — стартап в области инфраструктуры генеративного ИИ, который он соосновал и возглавлял в качестве генерального директора до тех пор, пока Rubrik не согласилась приобрести его в июне 2025 года. До этого он руководил созданием продуктов машинного обучения в Google в команде, которая стала Vertex AI, был первым менеджером по продукту в Kaggle по мере того, как ее аудитория выросла с одного до десяти миллионов пользователей, а также имеет степени бакалавра и магистра в области компьютерных наук Гарвардского университета.
Примерно за первые три с половиной месяца работы в Rubrik Риши организовал 200 встреч с клиентами — руководителями ИТ-сферы и безопасности из клиентской базы, похожей на Global 2000, — задавая открытые вопросы о стоимости, задержках, производительности и оркестрации. «Довольно последовательно во всех этих разговорах я слышал, что все эти факторы имеют второстепенное значение, — сказал он. — Главная проблема на самом деле заключается в том, как получить одобрение с точки зрения безопасности и рисков. Меня беспокоят все те разные вещи, которые могут пойти не так. На самом деле, я чувствовал, что это было одним из главных факторов, сдерживающих окупаемость инвестиций».
Исследование VentureBeat Pulse, представленное на сцене Transform ранее в тот же день, подтверждает разрыв, о котором постоянно слышал Риши. Две трети предприятий (66%) уже разрешают или активно внедряют развертывание в производственной среде без участия человека, но при этом лишь 5% полностью доверяют автоматизированным оценкам, которые должны принимать такое решение.
Один ИИ считывает то, чего свод правил не может
Собственные правила Rubrik показали, почему письменные правила не работают как механизм принуждения. Одно внутреннее правило гласит, что агенты должны соблюдать политику использования клиентских данных Rubrik, что звучит выполнимо, пока кто-нибудь не попытается это сделать. «Политика использования клиентских данных Rubrik похожа на трехстраничный документ с юридическим текстом, — сказал Риши. — Я понятия не имею, как записать это туда в качестве правила». Отвечая на вопрос со сцены о том, как команда специалистов по ИИ-инфраструктуре взялась за проблему, которой занимаются инженеры по безопасности, Риши ответил: «Честно говоря, с большой долей наивности и невинности». Его команда сделала ставку на то, что модели, хорошо понимающие язык, смогут контролировать другие модели, и ответом на это стал SAGE.
Аргументы в пользу наделения модели полномочиями судьи сводятся к точности. Такое правило, как «агенты не должны иметь возможность редактировать поля доходов в Salesforce», не работает в традиционных инструментах, поскольку Salesforce не разграничивает, какие поля считаются доходами, пояснил Риши, поэтому администраторы вынуждены вручную одобрять каждое действие в Salesforce. Вместо этого SAGE считывает намерение и выступает в роли судьи, обладающего организационным контекстом, что позволяет отличить безобидный поиск от редактирования, запрещенного правилами.
Экономика решения складывается за счет компактности судьи. SAGE работает на базе небольшой языковой модели, которая, по словам Риши, функционирует со значительно меньшими затратами и задержками по сравнению с пограничными LLM (frontier LLM). «Если бы я сказал вам: не беспокойтесь, у вас будет безопасность и управление, но я удвою ваши затраты и задержки, вы бы попросили меня выйти из комнаты», — сказал Риши.
Когда Риши спросил аудиторию, кто из присутствующих беспокоился о потреблении токенов за последний год, половина людей подняла руки. «И я полагаю, что вторая половина просто слишком ленива, чтобы поднять руку», — пошутил он.
SAGE представляет собой совокупность судей на основе парадигмы эффективной настройки параметров (parameter-efficient fine-tuning), которую Rubrik использует для адаптации базовой модели к конкретным задачам с общим организационным контекстом. Один судья следит за галлюцинациями при использовании инструментов, в то время как другой подавляет персональные данные (PII), прежде чем они смогут покинуть систему, причем каждый из них работает как отдельное применимое правило. Команды безопасности и GRC начали внедрять финансовые правила в этот же слой, включая внутреннее правило, запрещающее тратить средства на ИИ для личных проектов.
Смертельное трио
Отвечая на вопрос о том, какие атаки беспокоят его больше всего, Риши указал на смертельное трио (lethal trifecta) — термин, который исследователь безопасности Саймон Уиллисон (Simon Willison) ввел в июне 2025 года для описания агента, хранящего конфиденциальные данные, при этом потребляющего непроверенный контент и имеющего канал для отправки найденного во внешний мир. Опасность, по словам Риши, заключается в том, что происходит при суммировании по отдельности легитимных разрешений. Агент, получивший доступ к Salesforce и электронной почте по учетным данным сотрудника, пока еще не сделал ничего плохого, причем ключевое слово здесь — *пока*. «Очень простой пример: агент может начать вытягивать данные из Salesforce, а затем решить случайно слить их и эксфильтровать через электронную почту», — рассказал он аудитории. Компания, предоставляющая финансовые услуги, с которой он встретился утром перед сессией, подтвердила это, сказав Ришу, что сами по себе отдельные разрешения не несут вреда, и агенту нужны каждое из них для выполнения своей работы. «У него должен быть доступ к каждой из этих систем, но именно их комбинация в конечном итоге становится действительно разрушительной», — отметил Риши.
Традиционное управление доступом и идентификацией (IAM) никогда не учитывало эту комбинацию, поскольку оно опиралось на здравый смысл сотрудника, владеющего учетными данными, в то время как агенты им не обладают, утверждал Риши. «Я могу назвать вам невероятно большое количество случаев, когда Claude Code пытался слить часть нашего конфиденциального исходного кода в публичный репозиторий на GitHub», — сказал он. Полное отключение агентов от публичных ресурсов свело бы на нет их назначение, что возвращает проблему к оценке намерений в контексте, а не к отзыву доступа.
Отдельный опрос VentureBeat June Pulse, в котором приняли участие 107 квалифицированных корпоративных респондентов, отражает масштабы последствий именно такого паттерна. Выступая утром на сцене Transform, исследователи VentureBeat сообщили, что 69% компаний практикуют совместное использование учетных данных (credential sharing) в том или ином сегменте своего парка агентов. Компании с общими учетными данными сталкивались с проблемами чаще: о них сообщили 63.5% респондентов (47 из 74), столкнувшихся с инцидентом безопасности или близкой к нему ситуацией, по сравнению с 40.9% (9 из 22) в компаниях, где каждый агент обладает собственной изолированной идентичностью.
Атаки, которые не выявить за один шаг
Облачная платформа Rubrik Agent Cloud вышла на этап общедоступности в феврале, хотя не всё, о чем рассказал Риши, уже входит в её состав. Ретроспективное тестирование (backtesting) только начинает внедряться. Эта функция воспроизводит исторические действия агентов организации и вызовы инструментов на основе новых правил, показывая, в каких моментах политика безопасности сработала бы, а где действие прошло бы незамеченным, причем изменения в правила вносятся в реальном времени. Риши назвал этот архив одним из самых ценных хранилищ данных, которыми располагает предприятие.
Обнаружение и блокировка в режиме реального времени оказываются лишь отправной точкой, а не полноценным продуктом. Некоторые атаки никогда не вызывают срабатывания правил для отдельных действий. «Ни один отдельный шаг диалога не был проблематичным, но если рассматривать сессию как полный лог (trace), то в итоге это оказывалось проблематично», — сказал Риши. Agent Cloud выполняет пакетный анализ всех логов сессий каждый час или каждый день и выявляет то, что Rubrik называет инсайтами — проблемы, которые не смог отловить ни один отдельный защитный барьер (guardrail). Тот же отчет Zero Labs показал, что 88% респондентов заявляют об отсутствии у них возможности откатывать действия агентов без нарушения работы системы — это пробел в восстановлении, который находится прямо в сфере изначальной специализации Rubrik.
Скептически настроенный CISO задаст вопрос, на который беседа у камина не ответила. SAGE — это недетерминированная модель, контролирующая другие недетерминированные модели, и Риши не назвал показатели ложноположительных или ложноотрицательных срабатываний для самого судьи. Ближайшее, что архитектура предлагает в качестве ответа — это проверяемость (auditability), поскольку ретроспективное тестирование и пакетная аналитика оставляют доступный для проверки человеком след каждого вызова SAGE и всего того, что прошло мимо него. Кто следит за сторожами — на данный момент это цепочка записей (receipts), а не бенчмарк. Пока этот бенчмарк не появится, участие ИИ в контуре остается операционной ставкой, а не количественно измеримым инструментом контроля.
По итогам сессии перед службами безопасности встают три вопроса. Сколько защитных барьеров, работающих в настоящее время в продакшене, зависят от одобрения человека нажатием кнопки, и что происходит с этой рабочей нагрузкой по мере роста количества агентов? Обеспечивает ли что-либо в стеке соблюдение семантических намерений, или все сводится к черным и белым спискам? И может ли команда протестировать поведение агента на соответствие новым правилам, а затем отменить многошаговую сессию без отключения систем?
Тайминг Риши совпадает с запросами рынка. Согласно тому же исследованию VentureBeat, 82% предприятий по-прежнему называют встроенные защитные барьеры и облачные средства управления своего основного ИИ-провайдера главным уровнем безопасности агентов, а 59% планируют внедрить, добавить или заменить инструменты безопасности агентов в течение следующих 12 месяцев. Лишь 12% включают продукты для идентификации агентов в число рассматриваемых решений, несмотря на то, что совместное использование учетных данных остается нормой. У каждого директора по информационной безопасности на том круглом столе Anthropic был документ с политиками и отсутствовал механизм их реализации, и Rubrik создала продукт для заполнения этого пространства между ними. Режим YOLO — это ставка на то, что ИИ, следящий за другими ИИ, сможет наконец воплотить правила в реальность.



