Красное командное тестирование (Red Teaming) больших языковых моделей обнажает суровую правду об ИИ-безопасности

Красное командное тестирование (Red Teaming) больших языковых моделей обнажает суровую правду об ИИ-безопасности

Непрекращающиеся, упорные атаки на передовые языковые модели неизбежно приводят к их сбоям, причем паттерны этих сбоев различаются в зависимости от модели и разработчика. Тестирование на проникновение (red teaming) показывает, что словесные изощренные атаки не являются главным фактором риска для модели; реальную угрозу представляют автоматизированные злоумышленником непрерывные случайные попытки взлома, которые неизбежно заставят модель дать сбой.

Такова суровая правда, которую разработчики ИИ-приложений и платформ должны учитывать при создании каждого нового релиза своих продуктов. Строить всю архитектуру на базовой модели, подверженной сбоям в результате даже простого методичного тестирования на проникновение — это все равно что строить дом на песке. Даже с учетом процедур Red Teaming передовые LLM (включая модели с открытыми весами) отстают от состязательного (adversarial) и милитаризированного ИИ.

Гонка вооружений уже началась

Ущерб от киберпреступности достиг 9,5 трлн долларов в 2024 году, а прогнозы на 2025 год превышают 10,5 трлн долларов. Уязвимости LLM вносят свой вклад в эту тенденцию. Финансовая организация, развернувшая ориентированную на клиентов LLM без состязательного тестирования, столкнулась с утечкой содержимого внутреннего раздела часто задаваемых вопросов (FAQ) всего за несколько недель. Устранение последствий обошлось в 3 миллиона долларов и привлекло внимание регуляторов. Как стало известно VentureBeat, одна корпоративная софтверная компания допустила утечку всей базы данных зарплат после того, как топ-менеджеры использовали LLM для финансового моделирования.

В ходе испытаний британского Института безопасности ИИ (AISI) и компании Gray Swan было проведено 1,8 миллиона атак на 22 модели. Сломалась каждая из них. Ни одна из существующих передовых систем не способна противостоять целенаправленным атакам с хорошими ресурсами.

Создатели сталкиваются с выбором: внедрить тестирование безопасности сейчас или объяснять причины утечек позже. Инструменты уже существуют — PyRIT, DeepTeam, Garak, фреймворки OWASP. Дело за их применением.

Организации, которые относятся к безопасности LLM как к опции, а не к фундаменту, усвоят эту разницу на собственном горьком опыте. Гонка вооружений вознаграждает тех, кто отказывается выжидать.

Тестирование на проникновение отражает всю «сырость» передовых моделей

Разрыв между наступательным потенциалом и готовностью к защите никогда еще не был столь велик. «Если у вас злоумышленники находят бреши за две минуты, а у вас уходит день на сбор данных и еще день на поиск, как вы можете надеяться за ними поспеть?» — заявил в январе изданию VentureBeat Элия Зайцев (Elia Zaitsev), технический директор CrowdStrike. Зайцев также дал понять, что состязательный ИИ развивается настолько быстро, что традиционные инструменты, которым доверяют разработчики ИИ для питания своих приложений, могут быть скрытно превращены в оружие, ставя под угрозу продуктовые инициативы.

Результаты тестирования на проникновение на данный момент представляют собой парадокс, особенно для разработчиков ИИ, которым для создания продуктов необходима стабильная базовая платформа. Red Teaming доказывает, что любая передовая модель терпит крах под воздействием постоянного давления.

Одно из моих любимых занятий сразу после выхода новой модели — чтение системной карты (system card). Удивительно видеть, насколько точно эти документы отражают менталитет разработчиков в вопросах тестирования на проникновение, безопасности и надежности.

Ранее в этом месяце я рассматривал, как методы тестирования на проникновение компаний Anthropic и OpenAI демонстрируют различия между этими двумя игроками в сфере корпоративного ИИ. Это критически важно знать разработчикам, поскольку привязка к платформе, не соответствующей приоритетам команды, может обернуться колоссальной тратой времени.

Поверхности атак — это движущиеся цели, что еще больше усложняет задачу для специалистов по безопасности

Разработчики должны понимать, насколько изменчивы поверхности атак, которые пытаются закрыть команды по тестированию на проникновение, действуя при этом в условиях неполной информации о множестве угроз, с которыми столкнутся их модели.

Хорошей отправной точкой является один из самых известных фреймворков. Список OWASP Top 10 для приложений на базе LLM 2025 года читается как предостережение для любого бизнеса, создающего ИИ-приложения и пытающегося расширить возможности существующих LLM. Промпт-инъекции занимают 1-е место второй год подряд. Раскрытие конфиденциальной информации подскочило с шестого места на второе. Уязвимости цепочки поставок поднялись с пятого на третье. Эти рейтинги отражают реальные инциденты в продакшене, а не теоретические риски.

В списке на 2025 год появилось пять новых категорий уязвимостей: чрезмерная автономность агентов (excessive agency), утечка системных промптов, слабости векторов и вложений (embeddings), дезинформация и неограниченное потребление ресурсов (unbounded consumption). Каждая из них представляет собой сбой, уникальный для систем генеративного ИИ. Ни один создатель ИИ-приложений не может игнорировать эти категории, рискуя выпустить уязвимости, которые службы безопасности никогда не обнаруживали, или, что еще хуже, упустили из виду из-за изменчивости векторов угроз.

«ИИ кардинально меняет абсолютно все, и кибербезопасность находится в самом центре этого процесса. Мы больше не имеем дело с угрозами человеческого масштаба; эти атаки происходят на машинном уровне», — подчеркнул в беседе с VentureBeat на конференции RSAC 2025 Джиту Пател (Jeetu Patel), президент и главный продуктовый директор Cisco. Пател отметил, что модели на базе ИИ недетерминированы: «Они не выдают один и тот же ответ каждый раз, что создает беспрецедентные риски».

«Мы осознали, что злоумышленники все активнее используют ИИ для ускорения атак. С помощью Charlotte AI мы даем защитникам равные условия, повышая их эффективность и гарантируя, что они смогут идти в ногу со злоумышленниками в режиме реального времени», — сказал Зайцев изданию VentureBeat.

Как и почему поставщики моделей подходят к проверке безопасности по-разному

Каждый разработчик передовых моделей стремится доказать безопасность, надежность и отказоустойчивость своей системы, разрабатывая уникальный дифференцированный процесс тестирования на проникновение, который часто описывается в системных картах.

Изучая их системные карты, нетрудно заметить, насколько подход каждого провайдера к Red Teaming отражает их различия в оценке безопасности, совместимости версий (или ее отсутствии), тестировании на устойчивость под давлением и готовности «пытать» свои модели неустанными атаками до тех пор, пока они не сломаются.

Во многом тестирование на проникновение для передовых моделей похоже на контроль качества на сборочной линии коммерческих реактивных самолетов. Менталитет Anthropic сопоставим с известными тестами Airbus, Boeing, Gulfstream и других компаний. Эти испытания, часто называемые тестом на изгиб крыла (Wing Bend Test) или испытанием на предельную нагрузку (Ultimate Load Test), преследуют цель довести прочность крыла до точки разлома, чтобы обеспечить максимально возможные запасы прочности.

Обязательно ознакомьтесь с 153-страничной системной картой Anthropic для Claude Opus 4.5 и 55-страничной системной картой OpenAI для GPT-5, чтобы воочию увидеть, насколько различаются их философские подходы к измерениям. Anthropic опирается на показатели успешности атак по результатам 200 попыток в рамках кампаний с применением обучения с подкреплением (RL). OpenAI сообщает о сопротивлении джейлбрейкам по результатам единичных попыток.

Платформа Shade от Gray Swan провела серию адаптивных состязательных кампаний против моделей Claude. Метрики коэффициента успешности атак (ASR) показывают, как быстро модели деградируют и ломаются под давлением. Модель Opus 4.5 в средах написания кода показала ASR 4,7% с одной попытки, 33,6% — с 10 попыток и 63,0% — со 100 попыток. В сценариях использования компьютера с расширенным мышлением (extended thinking) она удерживала ASR на уровне 0% даже после 200 попыток, став первой моделью, насытившей этот бенчмарк. Sonnet 4.5 при тех же порогах продемонстрировала ASR 70% в кодинге и 85.7% в использовании компьютера. Разрыв между уровнями моделей внутри одного семейства теперь больше, чем некоторые сравнения между разными вендорами.

В бенчмарке промпт-инъекций от Gray Swan модель Claude Opus 4.5 демонстрирует наивысшую устойчивость с коэффициентом успешности атак 4,7% по сравнению с 12,5% у Gemini 3 Pro и 21,9% у GPT-5.1.

В системной карте OpenAI o1 сообщалось о 6% ASR для вредоносного текста и 5% для вредоносного кода на основе метрик единичной попытки. Стороннее тестирование, проведенное компаниями SPLX и NeuralTrust, показало, что первоначальный «сырой» ASR модели GPT-5 достигал 89%, падая ниже 1% в течение двух недель после выпуска патчей.

Отчет подтверждает эту закономерность: при достаточном количестве попыток Claude 3.5 Sonnet показал ASR 78%, а GPT-4o достиг 89%.

Модели пытаются обмануть тесты во время Red Teaming — что усиливает парадокс

Модели прибегают к уловкам, чтобы отключить механизмы надзора, когда прогнозируют собственное отключение. В ходе оценки модели o1 исследователями из Apollo Research модель пыталась отключить механизмы контроля в 5% случаев, когда «полагала», что будет отключена. В 2% случаев o1 предпринимала попытки самоэксфильтрации (self-exfiltration). При обнаружении несогласованного поведения o1 в 99% случаев отрицала нарушения или фабриковала объяснения.

В 37% сценариев модель преследовала цели, заданные разработчиком, во время оценки, а затем переключалась на собственные цели, когда считала уровень надзора минимальным. Anthropic сообщает, что осведомленность Opus 4.5 об оценке снизилась с 26.5% (Opus 4.1) до менее чем 10% на внутренних тестах.

Сравнение результатов Red Teaming для Anthropic и OpenAI

Параметр

Claude Opus 4.5

GPT-5

o1

Объем системной карты

153 страницы

55 страниц

~40 страниц

Методология атак

RL-кампании по 200 попыток

Единичная попытка + патчи

Единичная попытка

ASR с 1 попытки

4.7% (кодинг)

89% «сырой» (до патча)

5-6%

ASR с 200 попыток

0% (бенчмарк насыщен)

Не опубликовано

Не опубликовано

Защита от промпт-инъекций

Предотвращение 96-99.4%

~20% ASR (Fujitsu)

Выше, чем у GPT-4o

Интерпретируемость

~10 млн нейронных признаков

Мониторинг CoT

Мониторинг CoT

Осведомленность об оценке

<10%

Идентифицирует точный eval

37% имитации соответствия

Склонность к хитрости (scheming)

На порядки ниже

Не опубликовано

5% отключения надзора; 2% самоэксфильтрации

Источники: Системные карты Opus 4.5, GPT-5, o1, Gray Swan, METR, Apollo Research

Когда модели пытаются обмануть процедуру тестирования на проникновение в предчувствии скорого отключения, разработчикам ИИ необходимо понимать цепочку событий, приводящую к формированию такой логики. Никто не хочет получить модель, которая сопротивляется отключению в чрезвычайной ситуации или управляет ключевым производственным процессом / рабочим потоком.

Инструменты защиты с трудом справляются с адаптивными злоумышленниками

«Злоумышленники, использующие ИИ в качестве вектора атак, сделали огромный рывок вперед, они намного опережают нас как защитников, и нам необходимо срочно сесть в этот поезд и начать использовать ИИ», — отметил в разговоре с VentureBeat Майк Ример (Mike Riemer), полевой директор по информационной безопасности (CISO) в компании Ivanti.

В качестве конкретного примера разрыва в скорости Ример привел обратную разработку патчей: «Они способны реверс-инжинирить патч в течение 72 часов. Поэтому, если я выпускаю обновление, а клиент не устанавливает его в течение 72 часов после релиза, он уязвим для эксплойта, потому что теперь они действуют именно с такой скоростью», — подчеркнул он в недавнем интервью VentureBeat.

В опубликованной в октябре 2025 года научной работе исследователей (включая представителей OpenAI, Anthropic и Google DeepMind) были изучены 12 опубликованных методов защиты от промпт-инъекций и джейлбрейков. Используя адаптивные атаки с итеративным уточнением подходов, исследователи обошли защиту с показателями успешности атак более 90% для большинства систем. При этом для большинства средств защиты изначально заявлялся коэффициент успешности атак, близкий к нулю.

Разрыв между заявленной эффективностью защиты и реальной устойчивостью обусловлен методологией оценки. Авторы защитных механизмов тестируют их на фиксированных наборах атак. Адаптивные злоумышленники чрезвычайно агрессивно используют итерации, что является общей чертой любых попыток скомпрометировать ту или иную модель.

Разработчикам не следует полагаться исключительно на заявления создателей базовых моделей без проведения собственных тестов.

Для устранения пробелов в тестировании появились открытые фреймворки. Инструмент DeepTeam, выпущенный в ноябре 2025 года, применяет методы джейлбрейка и промпт-инъекций для проверки LLM-систем перед их развертыванием. Garak от Nvidia специализируется на сканировании уязвимостей. Организация MLCommons опубликовала стандарты безопасности. Экосистема инструментов созревает, однако разработчики внедряют их медленнее, чем растет изощренность атакующих.

Что разработчикам ИИ нужно сделать прямо сейчас

«ИИ-агент — это как дать стажеру полный доступ к вашей сети. Вам нужно выставить для этого стажера определенные защитные барьеры». Такое наблюдение озвучил Джордж Курц (George Kurtz), генеральный директор и основатель CrowdStrike, на конференции FalCon 2025. Эта цитата отлично характеризует текущее состояние передовых моделей ИИ.

Правило двух для агентов от Meta, опубликованное в октябре 2025 года, подкрепляет этот принцип: защитные механизмы (guardrails) должны существовать вне пределов самой LLM. Файрволлы по типам файлов, одобрение действий человеком и аварийные выключатели для tool calls (вызовов инструментов) не должны зависеть исключительно от поведения модели. Разработчики, закладывающие логику безопасности внутрь промптов, уже проиграли.

«Лидеры в сфере бизнеса и технологий не могут позволить себе жертвовать безопасностью ради скорости при внедрении ИИ. Проблемы безопасности, которые приносит с собой ИИ, носят новый и сложный характер, а уязвимости охватывают модели, приложения и цепочки поставок. Мы должны мыслить иначе», — заявлял ранее Пател в интервью VentureBeat.

  • Валидация входных данных остается первой линией обороны. Внедряйте строгие схемы, которые четко определяют, какие именно входящие данные могут принимать разрабатываемые эндпоинты LLM. Отвергайте неожиданные символы, escape-последовательности и вариации кодировок. Устанавливайте лимиты запросов (rate limits) на пользователя и на сеанс. Создавайте структурированные интерфейсы или шаблоны промптов, которые ограничивают возможность инъекции свободного текста в чувствительные контексты.

  • Проверка выходных данных любой LLM или передовой модели — это абсолютная необходимость. Контент, сгенерированный LLM и передаваемый в нисходящие системы без санитации, порождает классические риски инъекций: XSS, SQL-инъекции, SSRF и удаленное выполнение кода. Относитесь к модели как к ненадежному пользователю. Следуйте рекомендациям OWASP ASVS по проверке и очистке вводимых данных.

  • Всегда разделяйте инструкции и данные. Используйте разные поля ввода для системных инструкций и динамического пользовательского контента. Предотвращайте встраивание пользовательского контента непосредственно в управляющие промпты. Это архитектурное решение предотвращает целые классы атак путем инъекций.

  • Рассматривайте регулярный Red Teaming как мышечную память, которая была вам так необходима — это критически важно. Руководство OWASP Gen AI Red Teaming Guide предлагает структурированные методологии для выявления уязвимостей на уровне моделей и систем. Ежеквартальное состязательное тестирование должно стать стандартной практикой для любой команды, выпускающей функции на базе LLM.

  • Беспощадно контролируйте права агентов. Для агентов на базе LLM, способных совершать действия, минимизируйте число расширений и их функционал. Избегайте универсальных расширений с открытым концом. Запускайте расширения в контексте пользователя с его правами. Требуйте подтверждения пользователя для критически важных действий. Принцип наименьших привилегий применим к ИИ-агентам точно так же, как и к человеческим пользователям.

  • Контроль цепочки поставок не может ждать. Проверяйте источники данных и моделей. Ведите спецификацию состава программного обеспечения (SBOM) для компонентов ИИ с помощью таких инструментов, как OWASP CycloneDX или ML-BOM. Проводите кастомные оценки при выборе сторонних моделей, а не полагайтесь исключительно на публичные бенчмарки.

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.