Многоэтапные ИИ-атаки выводят модели из строя в 88% случаев

Многоэтапные ИИ-атаки выводят модели из строя в 88% случаев

Источник: VentureBeat · Louis Columbus

Когда Cisco провела 6 986 многоступенчатых атак на 15 флагманских моделей, злоумышленники, адаптировавшиеся по ходу разговора, пробивали защиту в 88,3% случаев. Эми Чанг, руководитель отдела разведки угроз искусственному интеллекту и исследовании безопасности в Cisco, поделилась этим выводом на панели по безопасности агентных систем на конференции VB Transform 2026; эта цифра должна встревожить всех, кто до сих пор использует программы тестирования на проникновение (red-teaming) на основе одиночных запросов.

Опрос VentureBeat «Pulse» за июнь 2026 года, охвативший 107 корпоративных респондентов, объясняет, почему зал был полон. Более половины (54%) уже столкнулись с подтвержденным инцидентом безопасности, связанным с агентами (18%), или предотвращенным на волосок от беды инцидентом (36%). Лишь 32% предоставляют каждому агенту его собственную изолированную и управляемую учетную запись, и еще меньше — 30% — изолируют свои самые рискованные агенты в «песочницах». Встроенные средства провайдеров и облачных платформ остаются основным уровнем безопасности агентов для 82% опрошенных компаний. Крупнейшие в мире поставщики средств безопасности пришли к тем же выводам.

Компания Palo Alto Networks завершила приобретение CyberArk за 25 миллиардов долларов в феврале, CrowdStrike в январе договорилась о покупке SGNL за 740 миллионов долларов, а Cisco объявила о своем намерении приобрести Astrix Security за сумму, оцениваемую в 400 миллионов долларов. Все эти шаги направлены на усиление уровня идентификации и изоляции, который большинство предприятий еще не успели выстроить.

Чанг пришла на панельную дискуссию, имея за плечами почти двадцатилетний опыт работы в сфере киберопераций, в правительственных структурах и вооруженных силах. Она руководила глобальными операциями по кибербезопасности в качестве исполнительного директора в JPMorgan Chase, где возглавляла команды по анализу киберугроз, а также работала старшим сотрудником Комитета по иностранным делам Палаты представителей и офицером Резерва ВМС США. Кроме того, она преподает кибербезопасность и новые угрозы в качестве приглашенного преподавателя в Институте международных исследований Миддлбери.

Показатель 88,3%, озвученный Чанг, взят из исследования, которое она написала в соавторстве с Николасом Конли. Исследование основывалось на 30 090 одиночных запросах и 6 986 многоступенчатых атаках на те самые 15 закрытых флагманских проприетарных моделей. Успешность многоступенчатых атак варьировалась от 7,89% до 88,3%, причем нетривиальную уязвимость при многоступенчатом воздействии продемонстрировала каждая протестированная модель, а два различных метода тестирования даже не смогли выстроить модели в одинаковом порядке. По ее словам, на своем сайте LLM Security Leaderboard Cisco публикует данные об оценке на основе состязательных атак уже для 105 моделей.

«Если вы не понимаете, насколько модели восприимчивы к различным типам атак, вы не сможете учесть, как именно та модель, которая приводит в действие вашего агента и ваше приложение, поведет себя, и не сможете определить точки отказа», — отметила Чанг. Тестирование на основе одиночных запросов представляет собой единовременную вредоносную инструкцию, пояснила она, в то время как продолжение атаки в рамках более длительного диалога «куда реальнее отражает то, как мы на самом деле взаимодействуем с нашими моделями, агентами и приложениями». Такой расширенный сценарий выявляет вредоносные результаты и несогласованное поведение, которые никогда не удастся зафиксировать с помощью единичного среза.

Компания Cisco перенесла само тестирование в сферу агентских систем. Чанг описала фреймворк, в котором агенты оценивают сценарий развертывания, разрабатывают соответствующие атаки, определяют целесообразность их проведения, осуществляют их и оценивают собственный успех. Что удивило ее больше всего после всех этих сложностей, так это то, насколько простым остается защитное решение. «Ответ по-прежнему довольно прост, — сказала она. — Не нужно проявлять сверхъестественное творчество. Вам просто нужно задуматься о том, каковы же истинные основы и база того, что вы пытаетесь защитить в своей организации».

Отправной точкой для руководителей информационной безопасности (CISO), начинающих развертывание агентских систем, является Интегрированный фреймворк безопасности и защиты ИИ от Cisco, который, по ее словам, «описывает все возможные способы компрометации ИИ на протяжении всего его жизненного цикла» — от модальностей до цепочки поставок. Исходя из этого, команды могут работать в обратном направлении от реальных инцидентов, отслеживать пути реализации каждой атаки и использовать фреймворк для построения стратегии с надлежащим покрытием и мерами защиты.

Хизер Сейлан, CISO компании Box, видит ту же проблему со стороны защищающейся стороны. «Многое из того, что можно встретить в сфере тестирования агентских систем на проникновение, сводится к одиночным запросам, но люди взаимодействуют с ИИ в повседневной жизни совсем иначе», — заявила она аудитории. Теперь Box симулирует многоступенчатых злоумышленников с помощью агентов, которые мыслят как хакеры и предпринимают попытку за попыткой перехватить контроль над целью. «Вы обязаны проводить стресс-тестирование своих агентов, иначе вы просто не узнаете, действительно ли ваши средства контроля выполнения работают так, как вы задумывали».

Компания Box внедрила агентов в своем центре оперативной безопасности примерно год назад. Сначала для каждого действия требовалось одобрение человека, и доверие росло достаточно быстро, чтобы аналитики перешли в режим мониторинга. Затем агент совершил одну-единственную ошибку, и весь накопленный уровень доверия испарился в мгновение ока. «Им пришлось начинать все сначала, — отметила она. — Поэтому я считаю компонент мониторинга столь важным. Даже если вы не собираетесь держать человека в контуре управления, все меняется, модели меняются, и мы не в силах контролировать то, как именно модели меняются и интерпретируют информацию».

Раджеш Парекх, вице-президент по искусственному интеллекту и машинному обучению в Intuit, поделился взглядом со стороны разработчиков. До прихода в Intuit Парекх руководил крупномасштабными системами компьютерного зрения и машинного обучения для продуктов Google Maps и Geo, а также имеет докторскую степень в области компьютерных наук.

Три слоя против операционной системы

Сейлан охарактеризовала подход компании Box как три концентрических слоя. На первом месте стоит разграничение прав доступа, благодаря которому агент никогда не получает доступ к большему объему контента, чем человек, который его вызвал. Для каждой задачи агента запускаются эфемерные среды в «песочницах», локализующие радиус поражения в случае перехвата контроля над агентом, а контроль выполнения во время работы ограничивает вызовы инструментов агента только теми, которые имеют отношение к текущей задаче. «Если вы хотите, чтобы агент сделал для вас краткую выжимку из документа, и при этом поступает инъекция промпта с требованием переслать его на адрес maliciousattacker@domain.com, он не сможет этого сделать, — пояснила Сейлан. — Подобное действие и такой вызов инструмента даже не заложены в его «словарный запас»».

Она разделила действия агентов на три категории надзора. Действия, не представляющие угрозы (например, чтение и составление краткой выжимки), не требуют участия человека в контуре. Умеренно чувствительные действия обходятся без одобрения человека, но подлежат регистрации и мониторингу, в то время как деструктивные действия (такие как массовое удаление файлов) всегда требуют участия человека. «Ситуация между этими тремя категориями будет довольно часто меняться, — признала она, — но предварительное установление подобных категорий позволяет выстроить принципиальный подход».

Вместо того чтобы наращивать средства контроля над агентами поочередно, компания Intuit создала центральную платформу под названием GenOS (сокращение от generative AI operating system — операционная система генеративного ИИ), которая абстрагирует моделирование безопасности, рисков и мошенничества, избавляя разработчиков отдельных агентов от необходимости изобретать защиту заново. «Разграничение прав — это не предоставление доступа искусственному интеллекту, — подчеркнул Парекх. — Скорее, это определение строго ограниченных и четко проверяемых полномочий агента для выполнения очень конкретных задач». В Intuit прошли путь от наследования агентами пользовательских прав до наделения каждого агента собственной индивидуальностью, и в настоящее время компания изучает возможность изменения прав прямо во время сеанса, привязанного к конкретной выполняемой задаче.

Парекх называет эту более широкую модель экспертной платформой на базе ИИ — системой, в которой человеческий эксперт встроен в архитектуру доверия, а не прикручен в качестве контрольно-пропускного пункта. «Парадигма, которую мы преследуем, заключается в том, что пользователь, ИИ-агент и эксперт-человек сотрудничают для решения проблемы пользователя», — сказал он.

Конец проверки кода человеком

Сейлан открыто высказалась о напряженности между тестированием безопасности и скоростью разработки. «Времена безопасного анализа кода, когда человек изучает код, проводит обзоры архитектуры безопасности и проектной документации, прошли, — заявила она. — Если вы продолжите заниматься безопасностью в таком ключе, вы неизбежно отстанете». Компания Box движется к созданию полностью агентского жизненного цикла разработки, в рамках которого агенты проверяют проектную документацию, применяют требования безопасности и анализируют код на наличие уязвимостей. «Я очень оптимистично смотрю на то, что мы придем к моменту, когда сможем писать код без уязвимостей безопасности, потому что агенты и модели станут настолько хороши в написании безопасного кода, — добавила она. — Хотя до этого нам еще далеко».

Ее совет командам разработчиков полностью игнорирует продвинутые концепции ИИ и возвращается к основам, появившимся задолго до появления агентов. «Все сводится к базовому принципу наименьших привилегий, — пояснила она. — Если вы начнете наделять своих агентов излишне широкими полномочиями в самом начале, вам будет крайне сложно откатить это назад и построить инфраструктуру, поддерживающую такие эфемерные учетные данные и исключительно узкоспециализированные задачи».

Парекх объяснил, почему поверхность атак при тестировании на проникновение расширилась так быстро. «Эти агенты обладают навыками, а навыки могут превратиться в уязвимости, — отметил он. — Агенты имеют доступ к определенным данным, у них есть инструменты, и внутри этих инструментов также могут скрываться угрозы. В результате радиус поражения вредоносного кода или злого умысла резко возрастает». Когда Intuit выявляет типичные паттерны уязвимостей в ходе ручного тестирования на проникновение, она автоматизирует эти тесты, интегрируя их в среду GenOS. Благодаря этому будущие агенты автоматически наследуют защиту, а специалисты по безопасности могут сосредоточиться на новых векторах угроз. Сканирование запросов и ответов в реальном времени добавляет финальный уровень защиты, способный остановить подозрительный ответ и передать его на эскалацию человеческому эксперту, добавил он.

«Вам необходимо проводить непрерывное тестирование, чтобы удостовериться в устойчивости созданных средств защиты, а также учитывать любые отклонения или другие типы зависимостей, привносимые в ваш сценарий, которые могут порождать новые уязвимости», — пояснил он.

Намерение против вероятности

Вопрос из зала об обнаружении намерений спровоцировал самую острую дискуссию сессии. Сейлан отметила, что при работе собственного агента Box система всегда осведомлена о намерениях пользователя, поскольку сама контролирует запрос (промпт), что позволяет выстраивать вокруг него защитные барьеры и ограничения на вызовы инструментов. Более сложная задача, которую, как она признала, Box все еще пытается решить, возникает при подключении внешних агентов, когда контекст запроса остается непрозрачным.

Этот диалог обнажил раскол, проходящий через всю индустрию. Компания Mastercard в ходе беседы у камина, состоявшейся непосредственно перед панелью, высказалась за количественную оценку намерений, создав открытый фреймворк для их продвижения в качестве стандарта, поскольку сложная B2B-торговля не может функционировать без подобного доверия. Технические директора по безопасности оконечных устройств в беседах с VentureBeat заняли противоположную позицию, заявив, что для рабочих нагрузок в продакшене они делают ставку на вероятность, а не на вывод намерений. Чанг объяснила, почему современные модели не способны надежно выводить намерения из запроса, из-за чего детерминированные элементы управления и поведенческие прокси остаются необходимыми. Сейлан согласилась, что требуются оба подхода. «Если вы не используете ничего детерминированного, вы слишком сильно полагаетесь на это намерение, а я пока не видела программ, которые бы уже дошли до этого уровня», — сказала она.

Рассказ Сейлан о том, как доверие рухнуло после одной-единственной ошибки агента, стал самым запоминающимся моментом сессии, поскольку безопасность корпоративных агентских систем — это не та проблема, которую можно решить раз и навсегда. Модели меняются, права доступа смещаются, а злоумышленники адаптируются в ходе многоступенчатых диалогов, которые никогда не удается поймать с помощью тестов-снимков.

Для 82% предприятий, полагающихся на встроенные средства безопасности вендоров в качестве основного рубежа защиты, и 59% компаний, планирующих приобрести средства защиты агентов в течение следующих 12 месяцев, вывод панели прозвучал бескомпромиссно. Проводите тестирование так, как это делают атакующие — непрерывно и на протяжении всего диалога, — или узнайте в производственной среде, что именно пропустило ваше тестирование на проникновение по одиночным запросам.

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.