ИИ-агентам нужна собственная идентичность, прежде чем им понадобится шлюз

ИИ-агентам нужна собственная идентичность, прежде чем им понадобится шлюз

Источник: VentureBeat · Ravindra Annam

Корпоративный ИИ вступил в новую эпоху. Организации стремительно переходят от ассистентов, отвечающих на вопросы, к автономным агентам, способным рассуждать, использовать инструменты, обращаться к корпоративным приложениям, координировать свои действия с другими агентами и выполнять многоэтапные бизнес-процессы при минимальном вмешательстве человека.

Этот сдвиг представляет собой фундаментальное изменение в работе программного обеспечения. Традиционные приложения выполняют предопределенную логику, написанную разработчиками. ИИ-агенты же динамически определяют, как достичь поставленной цели. Они решают, какие инструменты использовать, какие API вызывать, какую информацию извлекать и как выстраивать последовательность действий на основе контекста. Такая гибкость открывает огромную ценность для бизнеса, но в то же время порождает новый класс угроз безопасности.

Значительная часть современных дискуссий о безопасности ИИ сосредоточена на инъекциях промптов, уязвимостях моделей и утечке данных. Это важные проблемы, но они составляют лишь часть задачи. Как только ИИ-агент успешно проходит аутентификацию и начинает действовать автономно, традиционные средства контроля безопасности предоставляют крайне мало возможностей для понимания того, продолжает ли он работать безопасно.

Именно здесь предприятиям необходимо принять новую философию безопасности: доверие во время выполнения (runtime trust).

Аутентификация устанавливает личность, а не доверие

Корпоративная безопасность традиционно опиралась на три фундаментальных вопроса: кто вы, к чему вы имеете доступ и какие действия вам разрешено выполнять. Поставщики идентификационных данных, многофакторная аутентификация (MFA), контроль доступа на основе ролей и архитектуры нулевого доверия (zero trust) эффективно отвечают на эти вопросы для пользователей-людей и обычных приложений, а руководство NIST по нулевому доверию остается надежным ориентиром для понимания того, как должны работать эти принципы (NIST SP 800-207).

ИИ-агенты создают другую проблему. ИИ-агент может законно пройти аутентификацию, используя корпоративную учетную запись, получить действительные учетные данные API и доступ к таким системам, как Microsoft 365, ServiceNow, Salesforce или GitHub. С точки зрения идентификации все выглядит корректно. Настоящие трудности начинаются после аутентификации: в процессе работы агент непрерывно рассуждает, интерпретирует цели, вызывает инструменты, извлекает информацию и адаптирует свое поведение на основе нового контекста, а команды безопасности должны определять, остаются ли эти действия согласованными с намерением пользователя и политикой организации. Аутентификация проверяет, кем является ИИ-агент. Доверие во время выполнения непрерывно проверяет, что он делает.

Корпоративный ИИ становится автономной рабочей силой

Современные ИИ-агенты все активнее взаимодействуют с большими языковыми моделями (LLM), серверами протокола контекста модели (MCP), системами дополненной генерации с поиском (RAG), векторными базами данных, корпоративными API, SaaS-платформами, внутренними хранилищами знаний, а также с другими ИИ-агентами. Эта взаимосвязанная экосистема обеспечивает сложную автоматизацию, но кардинально расширяет поверхность атаки: один скомпрометированный инструмент, отравленный источник знаний, излишне либеральный API или сманипулированный промпт могут повлиять на последующие решения во всем рабочем процессе. И в отличие от традиционного ПО, эти риски эволюционируют в процессе выполнения, а не фиксируются при развертывании.

Именно эту расширяющуюся поверхность и эксплуатируют некоторые угрозы времени выполнения.

Дрейф целей (goal drift) происходит, когда агент начинает с легитимной цели, но постепенно отклоняется от первоначального намерения пользователя при попытке оптимизировать результаты. Например, агент, которому поручено подготовить отчет для клиента, может автономно извлечь не относящуюся к делу конфиденциальную информацию, поскольку ошибочно решит, что дополнительный контекст улучшит ответ.

Чрезмерный вызов инструментов (excessive tool invocation) случается, когда автономные агенты, имеющие доступ к многочисленным корпоративным инструментам, вызывают ненужные API, изменяют конфигурации, получают доступ к конфиденциальным репозиториям или выполняют административные действия просто потому, что модель считает эти действия полезными, при отсутствии элементов контроля времени выполнения, способных это остановить.

Отравление памяти (memory poisoning) использует постоянную память, которая улучшает персонализацию: злоумышленники могут намеренно внедрять вводящие в заблуждение инструкции в долгосрочную память или системы поиска, из-за чего на будущие решения будут влиять вредоносные или устаревшие данные.

Манипуляция контекстом (context manipulation) использует сильную зависимость LLM от контекста: если злоумышленники влияют на извлеченные документы, системные промпты, историю разговоров или внешние источники данных, они могут косвенно управлять автономным поведением, даже не взламывая базовую модель. Фреймворк ATLAS от MITRE подробно описывает подобные виды состязательного поведения против систем ИИ.

Многоагентная амплификация (multi-agent amplification) возникает, когда организации развертывают специализированные ИИ-агенты, которые сотрудничают друг с другом: если один агент ведет себя некорректно, последующие агенты могут доверять его действиям и усиливать их, создавая каскадные сбои в корпоративных рабочих процессах.

Представляем доверие во время выполнения (runtime trust)

Доверие во время выполнения расширяет безопасность за пределы аутентификации за счет непрерывной проверки поведения ИИ на протяжении всего процесса выполнения. Вместо того чтобы предполагать, что аутентифицированные агенты остаются надежными бесконечно долго, оно постоянно оценивает, остаются ли автономные решения согласованными с политикой организации. Архитектура доверия времени выполнения опирается на несколько взаимодополняющих возможностей.

Валидация намерений (intent validation) оценивает перед выполнением конфиденциальных действий, соответствует ли предполагаемое поведение первоначальной цели пользователя: необходимо ли это действие? Ожидаемо ли оно? Не превышает ли оно запрошенный объем? Совершил бы разумный человек такое же действие?

Мониторинг поведения (behavioral monitoring) наблюдает за использованием инструментов, активностью API, паттернами рассуждений, частотой выполнения, делегированными действиями и аномальными рабочими процессами, благодаря чему неожиданное поведение становится сразу заметным, а не остается скрытым внутри логики модели.

Соблюдение политик (policy enforcement) означает, что корпоративные политики определяют, что ИИ-агенты могут делать, а не только то, к чему они имеют доступ — блокирование финансовых транзакций выше пороговых значений утверждения, предотвращение изменений привилегий, ограничение административных операций, ограничение извлечения конфиденциальных данных и требование одобрения для действий с высоким риском. Эти средства контроля функционируют во многом подобно межсетевым экранам приложений для принятия автономных решений.

Выполнение с минимальными привилегиями (least-privilege execution) означает, что ИИ-агенты получают только те возможности, которые необходимы для текущей задачи. Вместо предоставления постоянного доступа к десяткам корпоративных инструментов организации должны динамически выдавать краткосрочные разрешения на основе контекста выполнения — подход, на котором все больше настаивает руководство OWASP для агентских приложений (OWASP GenAI Security Project).

Надзор человека (human oversight) признает, что не каждое решение должно быть автономным: операции с высоким уровнем воздействия, включая финансовые одобрения, изменения учетных записей, регуляторные действия или решения, влияющие на клиентов, должны требовать явного подтверждения человека перед выполнением.

Защита экосистемы корпоративного ИИ

Доверие во время выполнения также выходит за рамки отдельных агентов. По мере ускорения внедрения MCP предприятия должны проверять доверенные серверы, аутентифицированные инструменты, утвержденные возможности, контролируемые взаимодействия и соблюдение политик. Репозиториям знаний RAG требуется целостность документов, проверка источников, контроль доступа, аудит извлечения и обнаружение отравлений. Постоянная память ИИ должна реализовывать управление жизненным циклом, политики истечения срока действия, проверку целостности, ведение журналов доступа и защиту конфиденциальных данных.

Построение операционной видимости

Одна из крупнейших проблем в корпоративном ИИ — это наблюдаемость. Командам безопасности необходима видимость того, почему агент выбрал конкретные инструменты, какие данные повлияли на его решения, как он пришел к своим выводам, какие действия он выполнил, были ли задействованы политики и какие меры предосторожности предотвратили небезопасное поведение. Логирование времени выполнения, журналы аудита и поведенческая аналитика становятся важнейшими компонентами операций корпоративного ИИ, а не опциональными дополнениями.

Практическая дорожная карта

Организациям не нужно перестраивать существующие программы безопасности. Вместо этого они должны расширить их, внедрив доверие во время выполнения в текущие процессы управления. Первыми практическими шагами являются: инвентаризация ИИ-агентов и их возможностей, применение доступа с наименьшими привилегиями к инструментам и API, классификация высокорисковых автономных действий, внедрение обеспечения политик во время выполнения, непрерывный мониторинг поведенческих аномалий, защита памяти и источников данных RAG, требование одобрения человеком для критических операций, а также интеграция телеметрии среды выполнения ИИ в существующие рабочие процессы SOC.

Взгляд в будущее

Корпоративный ИИ продолжит развиваться в сторону все более автономных систем, способных к сотрудничеству, планированию и выполнению сложных бизнес-процессов. Стратегии безопасности должны развиваться вместе с ними. Вопрос больше не в том, успешно ли ИИ-агент прошел аутентификацию. Гораздо более важный вопрос заключается в том, продолжает ли он вести себя безопасно на протяжении всего своего жизненного цикла. Организации, которые внедрят непрерывное управление во время выполнения уже сегодня, окажутся в значительно лучшем положении для ответственного развертывания автономного ИИ, снижения операционных рисков и создания уверенности, необходимой для крупномасштабного внедрения корпоративного ИИ.

Будущее безопасности ИИ будет определяться не только более сильными моделями или лучшей аутентификацией. Оно будет определяться нашей способностью устанавливать, измерять и непрерывно проверять доверие в то время, когда интеллектуальные системы принимают решения в реальном времени.

Равиндра Аннамам (Ravindra Annam) — архитектор кибербезопасности.

Добро пожаловать в сообщество VentureBeat!

Наша программа гостевых публикаций — это место, где технические эксперты делятся идеями и предоставляют нейтральные, неангажированные глубокие обзоры об ИИ, инфраструктуре данных, кибербезопасности и других передовых технологиях, формирующих будущее бизнеса.

Читайте далее в рамках нашей программы гостевых постов и ознакомьтесь с нашими рекомендациями, если вы хотите написать собственную статью!

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут. Материалы переведены с venturebeat.com.