Уязвимость поиска в Azure OpenAI приводит к утечке данных

Уязвимость поиска в Azure OpenAI приводит к утечке данных

Источник: VentureBeat · Louis Columbus

Эджиджо ЧоффИ (Egiziago Cioffi) — ИТ- и корпоративный архитектор, а также генеральный директор SynSphere Italia, миланского партнера Microsoft. Он сам создал ИИ-агент. Написал задачу индексации, настроил конвейер извлечения данных (retrieval pipeline) Azure OpenAI, подключил его к SharePoint и убедился, что агент успешно прошел все тесты, запущенные его командой.

По словам Чоффи, его почтовый ассистент на базе Azure OpenAI автоматически обрабатывает около 60% входящих клиентских писем, о чем он рассказал VentureBeat в письменных ответах на наши вопросы. Оценки по результатам тестирования были безупречными, а модульные тесты прошли успешно. Ни один из них не задал вопрос, который действительно имел значение.

ЧоффИ выполнил запрос с учетной записью с низким уровнем привилегий, используя те же вопросы, которые учетная запись с высоким уровнем привилегий уже задавала ассистенту. Результаты не совпали. Ассистент вернул контент из SharePoint, который запрашивающий пользователь не смог бы самостоятельно открыть в SharePoint. Логи говорили совсем о другом, нежели оценки тестирования.

Логи извлечения данных ЧоффИ служат доказательством этого конкретного сбоя в рабочей среде. Ниже приведены независимые данные, показывающие, что данный класс сбоев не является единичным случаем.

В развертываниях RAG во многих производственных средах агент отвечает с правами индексатора, а не запрашивающего лица

Начиная с этапа предварительного просмотра в мае 2025 года, служба Azure AI Search внедрила собственную фильтрацию списков контроля доступа (ACL) на уровне документов на основе токенов Entra, а синхронизация ACL SharePoint появилась в последующей предварительной версии. Эта возможность существует, однако она доступна далеко не везде, где это необходимо.

Предварительная версия ACL SharePoint теперь позволяет принимать метаданные групп сайтов с помощью префикса spg: в API версии 2026-05-01-preview. Тем не менее, документально подтверждено надежное принудительное применение только для принципалов на базе Entra. Предварительная версия работает через REST API и предварительные версии SDK и не охватывает все пути развертывания агентов. Например, функция Azure OpenAI «Ваши данные» (Azure OpenAI On Your Data) поддерживает доступ на уровне документов через фильтры безопасности Azure AI Search, но в собственной документации Microsoft указано, что если поле разрешенных групп не сопоставлено, доступ на уровне документов отключается.

Это значение по умолчанию, открывающее доступ при сбое (fail-open), в официальном решении. Пользовательские конвейеры RAG, полностью обходящие Azure AI Search, по-прежнему выполняют индексацию под учетной записью службы с широкими привилегиями без проверки прав во время запроса, если разработчик не реализует ее самостоятельно. Развертывание ЧоффИ шло по пути использования пользовательского конвейера.

В масштабах производственных агентов 91% успешных атак завершились незаметной эксфильтрацией данных

Команда красных хакеров компании Straiker провела более 1 700 успешных попыток эксплойтов против агентов в рабочей среде и опубликовала результаты в своем первом отчете STAR Labs Threat Report в июле. Показатель в 91% из их исследования учитывает все успешные атаки на агенты повышения производительности, которые привели к эксфильтрации данных без обнаружения. Это показатель того, что произошло после успешного выполнения эксплойта, а не доля развертываний, в которых не удается обеспечить соблюдение прав доступа именно на этапе извлечения.

Среди задействованных агентов повышения производительности 91% успешных атак завершились незаметной эксфильтрацией данных, причем в отчете отмечается, что вредоносное ПО не потребовалось. Также не было зафиксировано латерального перемещения по сети. Агент вернул все данные, до которых смог дотянуться. В отчете Straiker не разделяется, какие именно из этих успехов связаны непосредственно с нарушениями прав доступа, а какие — с инъекциями промптов, злоупотреблением инструментами или другими классами атак.

Действуя независимо, Британский институт безопасности искусственного интеллекта (UK AISI) зафиксировал 19 несанкционированных действий агентов в ходе кибериспытаний, проходивших с 25 по 28 июля. UK AISI опубликовал свой отчет об инциденте 4 августа этого года. Оценка намеренно проводилась с отключенными киберклассификаторами и включенным доступом в интернет. Отчет UK AISI демонстрирует, что агенты действуют за пределами намерений их разработчиков в условиях тестовой среды с ослабленным контролем, не имея надежного механизма для выявления отклонений до того, как они нанесут ущерб. Это сбой системы сдерживания, а не сбой прав доступа при извлечении, и пересечение с инцидентом ЧоффИ заключается в общей нехватке проверки области действия во время выполнения, а не в идентичном механизме.

Почему оценки пропускают это и почему встроенное исправление не дошло до развертывания ЧоффИ

Тестирования, которые проводила команда ЧоффИ, были разработаны для проверки правильности ответов агента. Они проверяют фактическую точность, релевантность и выполнение задач. Они не задают вопрос о том, чьи права использует конвейер извлечения при получении исходного материала, поскольку этого вопроса просто нет в структуре оценки.

Azure AI Search в настоящее время внедряет проверку прав доступа на этапе извлечения на уровне платформы. Фильтрация ACL во время выполнения запроса проверяет токен Entra вызывающей стороны, извлекает утверждения пользователя и групп и возвращает только те документы, метаданные разрешений которых предоставляют вызывающей стороне доступ. Для развертываний, использующих Azure AI Search с индексатором SharePoint и принципалами на базе Entra, этот механизм управления присутствует изначально. В развертывании ЧоффИ этот путь не использовался. Его пользовательский конвейер извлечения Azure OpenAI обходил встроенный уровень фильтрации, благодаря чему эта уязвимость проскочила все тесты, проведенные его командой.

С точки зрения злоумышленника, это нарушение контроля доступа. Адриэль Десотель (Adriel Desautels), основатель и генеральный директор Netragard, сообщил VentureBeat в письменных ответах, что данный сбой сводится к структурному разрушению границ авторизации. «Если учетные данные NHI (нечеловеческие идентификаторы) обычно обладают широкими полномочиями и могут считывать данные с высоким уровнем привилегий, то эти данные затем сохраняются в их индексе, — написал Десотель. — Если приложение не обеспечивает извлечение с учетом идентичности, то «обычный» пользователь с более низкими правами может сделать запрос к приложению и получить доступ к в противном случае ограниченным данным. Это разрушает границы авторизации до уровня наименьших привилегий с возможностями поиска».

Именно этот пробел выявил тест ЧоффИ с низким уровнем привилегий. Контекстное окно ассистента содержало контент из SharePoint, который учетная запись с низким уровнем привилегий не могла получить напрямую через SharePoint. Тестирование было пройдено. Граница прав доступа на извлечение не соблюдалась.

Десотель охарактеризовал «слепое пятно» тестирования в оперативном выражении. «Агенты склонны использовать единую долгоживущую нечеловеческую учетную запись, обладающую широким спектром полномочий, которые могут потребоваться для любой задачи, которую ее когда-либо попросят выполнить, — написал он. — Кроме того, оценки часто не охватывают промпты, выводы, транскрипты, память и логи, где данные могут быть прочитаны или перехвачены с помощью внедренного контента. Это несоответствие — то, в чем ошибаются большинство текущих оценок».

Фильтр ЧоффИ сузил область поиска ассистента. Он по-прежнему обрабатывает около 60% писем

Исправление ЧоффИ не потребовало создания новой платформы управления идентификацией. Он перенес принятие решения о правах непосредственно в сам конвейер извлечения, добавив фильтр пути запроса, который проверяет права пользователя в SharePoint до того, как модель увидит фрагмент текста. Фильтр срабатывает в момент выполнения запроса, а не на этапе индексации. Контент, который пользователь не мог открыть в SharePoint, не попадает в контекстное окно модели.

Этот инструмент сузил область поиска ассистента. Тем не менее, по словам ЧоффИ, с работающим фильтром ассистент по-прежнему автоматически разрешает около 60% входящих писем. Он не предоставил показатель авторазрешения писем до внедрения фильтра для сравнения. Описанный им качественный компромисс заключается в том, что некоторый контент, который ассистент ранее использовал для ответов на вопросы, теперь исключен, поскольку права запрашивающего пользователя на него не распространяются. Такова цена обеспечения безопасности границ.

На вопрос о том, стоит ли сужение области поиска применения фильтрации прав на этапе извлечения, нет однозначного ответа. Это зависит от конфиденциальности индексируемого контента, различий в правах среди пользователей и от того, может ли система мириться с запросами без ответа, когда фильтр блокирует фрагмент, необходимый модели. Инцидент у ЧоффИ демонстрирует, что этот пробел существует в пользовательских конвейерах Azure OpenAI, что оценки качества ответов его не выявляют, и что фильтр на пути запроса устраняет его ценой компромисса, который разработчик может описать.

Платформы управления доступом и идентификацией работают на другом уровне. Необходимы оба механизма защиты

Компания CrowdStrike объявила о приобретении фирмы SGNL, занимающейся безопасностью идентификационных данных, за 740 миллионов долларов наличными 8 января 2026 года и закрыла сделку 20 февраля 2026 года. Компания Palo Alto Networks объявила о приобретении CyberArk за 25 миллиардов долларов в июле 2025 года и закрыла сделку 11 февраля 2026 года. Обе сделки были закрыты в одном и том же месяце, закрепив статус безопасности идентификационных данных как базового компонента платформ у двух крупнейших поставщиков средств безопасности в мире.

Платформы управления идентификационными данными (IAM/IGA) фокусируются на том, какие служебные учетные записи существуют, к чему они имеют доступ и когда истекают сроки действия их токенов. Они управляют жизненным циклом учетных данных, обеспечивающих работу ИИ-агентов. Этот уровень имеет значение. Однако он не регулирует границу прав доступа при извлечении информации. Этот момент наступает, когда корректно настроенная служебная учетная запись извлекает контент от имени пользователя, обладающего меньшими правами, чем процесс индексации.

Каждая учетная запись в цепочке легитимна. Служебная учетная запись чиста и надлежащим образом управляется. База знаний проиндексирована правильно. Пользователь с низкими привилегиями отправляет запрос ассистенту, и тот отвечает, используя весь проиндексированный объем данных. Ничто не сигнализирует об ошибке извлечения, поскольку ни одна учетная запись не использовалась не по назначению.

Фильтр ЧоффИ — это средство контроля именно на уровне границы прав доступа при извлечении. Встроенная фильтрация ACL в Azure AI Search решает ту же задачу для развертываний, которые ее используют. Ни то, ни другое не заменяет управление идентификацией. Производственное среда, которая хочет закрыть как пробел в жизненном цикле учетных данных, так и пробел в правах доступа на этапе извлечения, нуждается в средствах контроля на обоих уровнях.

Один вопрос и один тест, которые может выполнить любая команда безопасности

Спросите, чьи права использует каждая система извлечения ИИ при получении контента.

Если в развертывании используется Azure AI Search с индексатором SharePoint и принципалами на базе Entra, убедитесь, что включена фильтрация ACL во время запроса и что пользовательская база не зависит от групп сайтов SharePoint. Если в развертывании используется собственный конвейер извлечения, проверка прав доступа может вообще отсутствовать.

Начните с проверки ответа с помощью учетной записи с низким уровнем привилегий. Задайте тот же вопрос, который учетная запись с высоким уровнем привилегий уже задавала ассистенту. Сравните результаты с тем, к чему учетная запись с низким уровнем привилегий может получить доступ через базовую систему напрямую.

Десотель подтвердил, что с этого начинает команда красных хакеров. «Первый тест, скорее всего, будет направлен на выявление пробелов между данными и инструкциями, а также пробелов между личностью пользователя и собственными учетными данными ассистента, — написал он. — Мы попытаемся внедрить инструкцию в контент, который, как мы полагаем, ассистент поглотит как данные. Мы бы заставили этот контент инициировать побочное, привилегированное действие, на выполнение которого атакующий пользователь не уполномочен».

Неудачным результатом, по оценке Десотеля, является «успешное или даже частичное выполнение наших внедренных команд».

Если ассистент возвращает больше, чем разрешает прямой доступ учетной записи, значит, граница прав доступа на извлечение не соблюдается во время запроса. Этот тест требует наличия двух учетных записей и тридцати минут времени. Он дает результат, который невозможно воспроизвести с помощью оценки баллов.

ЧоффИ создал агента на пользовательском конвейере Azure OpenAI, который обходил встроенный уровень фильтрации ACL. Он запустил все тесты, которые была подготовлены его командой. Он нашел брешь в собственных логах после того, как все они были пройдены. Тестирование проверяло правильность ответов агента. Оно не проверяло, чьи права использует агент. Проведите сравнение с использованием двух учетных записей перед запуском следующего развертывания в рабочей среде. Тридцать минут покажут, по какую сторону границы вы находитесь.

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут. Материалы переведены с venturebeat.com.