Промпт-инъекции занимают 1-е место по версии OWASP и 12-е в реестре инцидентов. Сама атака невидима для сканирования.

Промпт-инъекции занимают 1-е место по версии OWASP и 12-е в реестре инцидентов. Сама атака невидима для сканирования.

Источник: VentureBeat · Louis Columbus

CISO, который видит низкое количество CVE и снижает приоритет борьбы с промпт-инъекциями (prompt injection), совершенно не понимает сути происходящего. Пrompt-инъекции занимают первое место в рейтинге OWASP Top 10 для приложений на базе LLM уже три года подряд. Однако когда два руководителя этого проекта сопоставили его с 6 639 размеченными реальными инцидентами, угроза оказалась на 12-м месте. Этот спад отражает уровень видимости, а не реальную опасность, поскольку атака происходит там, где сканер уязвимостей ее не видит.

Этот вывод принадлежит Кириакосу «Року» Ламбросу и Стиву Уилсону — двум руководителям проекта OWASP Top 10 для LLM приложений, которые опубликовали его на arXiv 18 августа с соответствующей оговоркой. Данный анализ носит исследовательский характер, не проходил экспертную оценку и не является официальным релизом OWASP; авторы подчеркивают, что он не заменяет официальный список и процедуру его формирования.

Стоящий за этим анализом массив данных весьма внушителен: 7 714 инцидентов безопасности LLM из CVE, рекомендаций по безопасности GitHub, OSV и базы данных вредоносного ПО AIAAIC AI-harm. Из них 6 639 инцидентов были размечены по 20 категориям таксономии, а байесовская модель скорректировала каждый показатель с учетом ошибок классификатора, прежде чем сопоставить рейтинг на основе данных с мнением экспертов.

Сравнение не выявило статистически значимого совпадения между экспертной оценкой и записями о публичных инцидентах. Коэффициент каппа Коэна составляет 0,20 при 90-процентном интервале от минус 0,16 до 0,57. «Интервал пересекает ноль, поэтому мы не можем исключать, что оба рейтинга совпадают лишь случайно, — пишут они. — Честный итог: слабое согласие, а не подтверждение».

Ламброс, соавтор проекта OWASP GenAI Security Project Top 10 для LLM приложений и директор по стандартам ИИ и управлению в Zenity, охарактеризовал этот вывод в письменных ответах VentureBeat с точки зрения доказательной базы. «У нас было два способа измерения одного и того же риска: экспертная оценка и записи о публичных инцидентах, и они противоречат друг другу. Ни один из них не является абсолютной истиной, — сказал Ламброс. — Два свидетеля противоречат друг другу, и мы не можем сказать, кто из них лжет».

Цепочка атак, которую никогда не фиксирует сканер

Этот разрыв носит структурный характер. Промпт-инъекция скрывает инструкции внутри контента, который читает модель — будь то запись в логе, тикет службы поддержки или документ, полученный через механизм поиска (retrieval). Затем агент выполняет вызов инструмента, желательный для злоумышленника, используя вполне легитимные учетные данные. Ничто в этой цепочке не является дефектом продукта, поэтому атака не оставляет после себя CVE, которую мог бы обнаружить сканер.

Защита от таких атак заключается в состязательном тестировании (adversarial testing) развернутой системы и жестких ограничениях на то, к чему агент может получить доступ, чтобы одурманенная модель не смогла навредить критически важным ресурсам. Та же логика говорит в пользу инвестиций в память агентов и границы инструментов MCP уже сейчас, на уровне архитектуры, а не в ожидании вала бюллетеней безопасности, которые всегда будут приходить с запозданием на один цикл.

Первая мера защиты, которую внедрил бы Уилсон

Стив Уилсон, директор по информационной безопасности и продуктам в Exabeam и соруководитель проекта OWASP Top 10 для LLM приложений, в письменных ответах VentureBeat назвал средство контроля, которое он применил бы в первую очередь против именно такой цепочки: когда агент читает полезную нагрузку злоумышленника в файле журнала, воспринимает ее как инструкцию и перезаписывает DNS, используя действительные учетные данные.

«Первое, что я бы сделал, — установил шлюз авторизации вне модели: агент может предложить конкретное изменение DNS, но он не может самостоятельно наделить себя полномочиями на его выполнение, — сказал Уилсон. — Правила безопасности, прописанные внутри промптов, могут формировать поведение модели, но они остаются лишь предложениями для модели, а не обязательными средствами контроля безопасности».

У такого шлюза есть своя цена, и Уилсон говорит об этом прямо. «Компромисс заключается в том, что агент теряет возможность самостоятельно импровизировать нестандартные инфраструктурные изменения с серьезными последствиями, сохраняя при этом автономное расследование и рутинное, ограниченное устранение последствий», — пояснил он.

Почему риск № 1 кажется незначительным в статистике

«Промпт-инъекции — это наиболее изученная атака на LLM, и развернутые системы активно защищаются от нее», — пишут авторы, умещая все расхождение в одно предложение. «Эксперты ставят ее на первое место, потому что поверхность атаки остается огромной, даже когда защита в основном срабатывает; данные же фиксируют те успешные случаи, которые смогли пробиться».

Уилсон наблюдал этот разрыв с обеих сторон. «Данные об инцидентах невероятно ценны, но они по своей сути обращены в прошлое и их notoriously сложно интерпретировать, — отметил он. — Они показывают нам то, что было замечено, распознано, классифицировано и оглашено. Они вовсе не обязательно отражают то, что представляет наибольшую опасность в системах, которые люди строят прямо сейчас».

Он сравнивает промпт-инъекции со «смертью и налогами», а все чаще — с «законом физики для систем на базе LLM», поскольку от одной модели требуют одновременно интерпретировать доверенные инструкции и невыученный (недостоверный) контент.

Совершенствование защиты не решило проблему полностью. «Контроль, который работает в 99% случаев, недостаточен, когда сценарий сбоя дает злоумышленнику значимый доступ. И, честно говоря, я не думаю, что мы находимся на уровне 99%», — заявил Уилсон. «Долгосрочный ответ заключается не в вере в то, что мы сможем полностью и навсегда исключить промпт-инъекции. Он заключается в проектировании систем с допущением, что промпт-инъекции будут происходить, в понимании причин их эффективности и в ограничении того ущерба, который злоумышленник может нанести при их успешном исходе».

Низкое количество бюллетеней безопасности может означать, что защита работает. Но с тем же успехом это может означать, что никто просто не проводил проверки, и общедоступные данные не могут подсказать службе безопасности, какова ситуация на самом деле.

Объемы попыток атак задокументированы. В Глобальном отчете CrowdStrike об угрозах за 2026 год отмечается, что в 2025 году злоумышленники внедряли вредоносные промпты в легитимные инструменты генеративного ИИ в более чем 90 организациях, похищая учетные данные и криптовалюту. Этот материал помещен в раздел под названием «Промпты — это новое вредоносное ПО». Телеметрия демонстрирует давление на поверхность атаки, не доказывая при этом, что именно защитные меры обеспечили 12-е место в рейтинге, однако это в точности та картина, которую предсказывает данный механизм.

Разрыв работает и в другую сторону — причем еще сильнее

Промпт-инъекции — это заголовок в новостях, но дезинформация представляет собой куда более масштабную проблему.

Экспертное голосование отводит дезинформации 13-е место, в то время как статистика инцидентов выводит ее на 2-е место. Авторы статьи называют это «самым большим расхождением между двумя свидетелями» и сообщают, что их показатель согласованности «оценивает вероятность того, что два сигнала расходятся во мнениях, в 99 процентов».

Авторы не идеализируют собственные данные. Говоря о дезинформации, они отмечают, что этот массив «содержит большой объем дипфейков и дезинформации, сгенерированной ИИ» — записей, которые часто «описывают ущерб, причиненный ИИ, а не уязвимость внутри LLM». Авторы называют эту категорию той, по которой споры в отчетах идут ожесточеннее всего, не делая при этом окончательного вывода о том, что эксперты ошиблись.

Где категория «слишком новая для измерения» сталкивается с записями CVE

Две абсолютно новые категории таксономии находятся на самом острие. Персистентное отравление памяти занимает 4-е место по версии экспертов и 16-е по инцидентам, а эксплуатация интерфейса инструментов MCP — 7-е место у экспертов и 16-е по инцидентам, причем интервал инцидентов для каждой из них составляет от 6 до 20, охватывая большую часть таксономии.

Для обеих уязвимостей существуют общедоступные CVE 2026 года. Что касается интерфейсов инструментов MCP, сервер Azure Data Explorer MCP Server содержал уязвимость в виде KQL-инъекции, и в описании CVE указано, что она позволяет «злоумышленнику (или ИИ-агенту с внедренным промптом) выполнять произвольные KQL-запросы к кластеру Azure Data Explorer», получив оценку 8.3 (высокая). Сервер Kong’s Konnect MCP Server содержал косвенную промпт-инъекцию, которая позволяет удаленному злоумышленнику заставить сервер выполнять непреднамеренные API-запросы — именно тот сбой, который значится в категории MCP.

У памяти агентов есть своя история. Инструментальная среда агентов Ruflo предоставила неаутентифицированные конечные точки моста MCP, которые позволяют сетевому злоумышленнику получить командную оболочку, прочитать ключи API провайдера и отравить хранилище обучения, получив оценку 10.0 (Критический).

Эта история настолько скудна и неопределенна, что модель не может поместить ни ту, ни другую уязвимость в пределах 14 позиций рейтинга. Команда, ожидающая появления достаточного объема бюллетеней с рекомендациями для обоснования контроля над памятью агентов или границами инструментов MCP, будет ждать вечно, в то время как CVE продолжают накапливаться в категориях «Критический» и «Высокий».

Ламброс приводит экономические аргументы с точки зрения операционной деятельности. Отравленная память «никак себя не проявляет», сказал он. Это выглядит так, будто агенту по закупкам однажды сказали, что счета от определенного поставщика на сумму менее 50 000 долларов проходят без второй подписи, и поскольку агент помнит это, любое последующее одобрение выглядит как нормальная работа процесса. «Никто не выпускает предупреждений по этому поводу, потому что никто не знает, что это произошло. Нулевой показатель измеряет вашу слепоту, а не вашу безопасность». Аргумент, под которым, по его словам, подпишется финансовый директор — это фактор времени, поскольку память и разрешения на инструменты закладываются в эти системы один раз, на раннем этапе, а все остальное надстраивается поверх них. «Внедрите это сейчас, и это будет погрешность округления. Вернитесь через два года, и вам придется заново перепроектировать и переобучать свои системы».

Авторы сначала указывают на собственные проблемы с измерениями

Экспертная база выглядит слабой. «Экспертный сигнал представляет собой опрос практиков: около 29 респондент оценили каждый кандидатский риск по степени важности», — пишут авторы. Двадцать девять голосов определяют рейтинг, на который приходится три четверти веса опубликованного списка, являющегося точкой сжатия для более чем 25 000 участников сообщества OWASP.

Что касается данных, то классификатор является слабым звеном. Точность «резко различается по пунктам: от 93% (LLM01, LLM03) до 13% (LLM08)», четыре пункта падают ниже 50%, а базовый классификатор «никогда не прогнозирует вариант „вне зоны видимости“ и распределяет каждый инцидент по какой-либо категории, включая примерно 38% эталонного набора (gold set), которые не должны принадлежать ни к одной из них».

Авторы сами называют главный недостаток. Один рецензент изучил все 1200 инцидентов из эталонного набора и отменил консенсус модели по 553 из них. «Один аннотатор не может измерить межэкспертную надежность», — пишут они. «Эталонный набор с единственным автором остается главным ограничением».

Ламброс возлагает вину за низкий коэффициент каппа на саму таксономию. «Эта цифра говорит о наших категориях, а не о наших экспертах», — сказал он. Когда люди, создавшие таксономию, не могут надежно распределить по ней инциденты, утверждает он, «низкий балл по порядку этих категорий — это факт, говорящий о самих категориях».

Более совершенный классификатор не устранит разногласия. Предварительно зарегистрированное соревнование четырех передовых моделей не выявило победителя. Ни одна из них не превзошла сбалансированную точность нижнего предела инцидентов на уровне 0,863, а проверка на основе истинных данных оставила порядок нижнего предела прежним с коэффициентом корреляции Спирмена 0,818. Авторы опубликовали механизм и артефакты на GitHub для всеобщего повторного запуска.

Результат устойчивости протестировал только одну сторону проблемы. Каждая проверка, стоящая за словом «устойчивый» в аннотации, проводится со стороны инцидентов и показывает, что рейтинг, полученный на основе инцидентов, остается неизменным при изменении механизмов маркировки, и ни одна из них не затрагивает опрос 29 экспертов. Совет директоров, услышав слово «устойчивый», будет считать систему проверенной, однако факты подтверждают лишь то, что она стабильна.

Как это отразилось в опубликованном списке

OWASP выпустила рейтинг GenAI LLM Top 10 2026 года 4 августа. Это первое издание, в котором данные об инцидентах были включены в расчет рейтинга: вес мнения практиков составил 75%, а массива данных об инцидентах — 25%. Промпт-инъекции остались на 1-м месте, дезинформация поднялась на две позиции, чрезмерная автономность поднялась с 6-го на 3-е место как пункт, в котором оба сигнала согласуются наиболее четко, неограниченное потребление ресурсов поднялось на четыре позиции до 6-го места, а ненадлежащая обработка выводов опустилась с 5-го на 10-е место, продемонстрировав самое резкое падение.

Уилсон отказывается защищать это смешение с точки зрения чистой математики. «В весовых коэффициентах 75/25 нет ничего магического, — сказал он, — как и в их обратном изменении на 25/75. Ценность этих данных заключалась не в том, что они дали нам математический ответ, а в том, что они изменили характер дискуссии». Пункт о чрезмерной автономности стал тем местом, где эта дискуссия затронула его больнее всего. «Если бы я был директором по информационной безопасности (CISO), оценивающим новое внедрение агентных систем сегодня, я бы начал именно с чрезмерной автономности», — отметил Уилсон.

Ламброс в следующем цикле пошел бы дальше — эту точку зрения он подчеркивает как свою собственную, отличную от позиции рабочей группы. Это смешение присваивает одинаковый вес инцидентов (25%) каждой категории, в то время как точность проверенного вручную классификатора колеблется примерно от девяти из 10 для промпт-инъекций и цепочки поставок до примерно одного из восьми для уязвимостей векторов и эмбеддингов. Четверть веса в первом случае опирается на нечто солидное, утверждает он, а такая же четверть во втором случае строится на шуме. «Соотношение должно отражать то, насколько хорошо мы на самом деле измеряем каждую категорию», — заявил Ламброс.

Почему это актуально именно сейчас

Исследование компании Ivanti State of Cybersecurity 2026 показало, что 87% команд безопасности считают внедрение агентного ИИ приоритетной задачей, а 77% сообщают о готовности в той или иной степени позволить ИИ действовать без проверки человеком. Команды дают добро на автономность агентов в то время, когда экспертный рейтинг возможных проблем с этими агентами не демонстрирует статистически значимого совпадения с историей инцидентов.

Что с этим делать в понедельник

Изменение в поведении носит узкий характер, и в этом заключается вся суть.

  • Используйте OWASP LLM Top 10 как карту покрытия, а не как очередь задач. Позиции в рейтинге основываются на 29 голосах и массиве данных, авторы которого сами называют согласие слабым, поэтому выстраивайте собственный приоритет на основе реальных рисков: доступности в продакшене, данных об уведомлениях об инцидентах и реально протестированных средствах контроля. Ламброс проводит черту финансирования точно так же. «Я бы расставил приоритеты в расходах там, где мнение экспертов и история инцидентов указывают в одном направлении, потому что это два независимых свидетеля, согласных друг с другом, — говорит он. — Если их мнения расходятся, прекратите позволять рейтингу распределять ваши деньги и посмотрите, что делают ваши собственные системы».

  • Логируйте то, что ваши ИИ-системы делают на самом деле, поле за полем. Входной промпт, полученный результат, документы, извлеченные для формирования ответа, вызванные инструменты и переданные им аргументы, а также оценку уверенности модели для каждого ответа. Уверенность — это тот параметр, за который Ламброс готов бороться, потому что большинство руководителей служб безопасности не осознают, что ее можно измерить, и именно здесь кроется поверхность атаки. «Модель, выполняющая зараженную инструкцию, не ведет себя как сломанная. Она ведет себя уверенно, — говорит он. — Уверенность — это то, что ваш мониторинг воспринимает как признак здоровой системы».

  • Перестаньте ожидать, что результаты сканера будут воспроизводить порядок из Топ-10. Результаты сканирования находятся на стороне инцидентов, учитывая то, что было раскрыто, а не то, чего должна опасаться развернутая система, и сравнение классификаторов показывает, что более умная модель не сокращает это расстояние. Тест, который обнаруживает инъекции промптов, — это состязательный тест, проводимый против работающей системы в паре с шлюзом авторизации Уилсона, чтобы изменения, предлагаемые внедренным агентом, никогда не совпадали с теми, которые он может выполнить.

  • Финансируйте категории с редкими инцидентами на основе архитектуры, а не объема инцидентов. Память агентов и границы инструментов MCP занимают 4-е и 7-е места по версии экспертов, при этом интервалы инцидентов охватывают большую часть таксономии, а существующие CVE получают оценки «Высокая» и «Критическая». Кейн МакГладри (Kayne McGladrey), старший член IEEE, консультирующий предприятия по вопросам рисков, прямо высказался о логике финансирования в интервью VentureBeat. «Все, что имеет привкус кибербезопасности, обычно попадает в категорию рисков кибербезопасности, что является полной фикцией, — сказал МакГладри. — Они должны быть сосредоточены на бизнес-рисках, потому что если это не влияет на бизнес, как например финансовые потери, то никто не будет обращать на это внимания, и под это не выделят должного бюджета». Номер в рейтинге, составленном по результатам голосования 29 человек, является более слабым аргументом для бюджета, чем бизнес-система, с которой взаимодействует агент.

  • Позаимствуйте у МакГладри базовый тест для самих ИИ-систем. «Если бы вы не стали выставлять свою базу данных в публичный интернет без средств контроля доступа и идентификации, то почему вы делаете это для своей ИИ-модели?» — отметил он в анализе затрат на утечки данных за 2026 год, опубликованном на CSO Online.

Вопрос для совета директоров на следующей встрече прост. Если наш рейтинг рисков ИИ был составлен на основе голосов 29 человек и массива данных, который противоречит сам себе, то на чем мы на самом деле основываемся, решая, финансирование каких средств контроля утверждать на следующий год?

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут. Материалы переведены с venturebeat.com.