Anthropic Opus 4.6 обнажает уязвимости в безопасности ИИ

Anthropic Opus 4.6 обнажает уязвимости в безопасности ИИ

Проведите атаку с внедрением промпта (prompt injection) против Claude Opus 4.6 в изолированной среде программирования — и атака потерпит неудачу в 100% случаев из 200 попыток, причем без каких-либо защитных механизмов. Перенесите ту же атаку в систему с графическим интерфейсом и активированным расширенным мышлением (extended thinking), и картина резко изменится. Первая же попытка оказывается успешной в 17,8% случаев без всякой защиты. К 200-й попытке показатель прорыва достигает 78,6% без защиты и 57,1% при ее наличии.

В системной карте новейших моделей на 212 страницах, опубликованной 5 февраля, показатели успешности атак разбиты по поверхностям взаимодействия, количеству попыток и конфигурациям средств защиты.

Почему различия на уровне поверхностей определяют корпоративные риски

Годами внедрение промптов оставалось известным риском, который никто не измерял количественно. Специалисты по безопасности относились к нему как к теории. Разработчики ИИ считали его исследовательской проблемой. Ситуация изменилась, когда Anthropic сделала внедрение промптов измеримым на четырех различных поверхностях агентов, предоставив показатели успешности атак, на основе которых руководители ИБ наконец-то могут принимать решения о закупках.

Системная карта OpenAI GPT-5.2 включает результаты бенчмарков по внедрению промптов, включая оценки по таким тестам, как Agent JSK и PlugInject, однако не приводит показатели успешности атак по поверхностям агентов и не показывает, как эти показатели меняются при повторных попытках. В исходной системной карте GPT-5 описывалось более 5000 часов ред-тиминга (тестирования на проникновение) с участием более 400 внешних тестировщиков. В системной карте Gemini 3 эта модель характеризуется как «наша самая защищенная модель на сегодняшний день» с «повышенной устойчивостью к внедрению промптов», при этом упоминаются относительные улучшения безопасности по сравнению с предыдущими версиями, но не публикуются абсолютные показатели успешности атак по поверхностям или данные о масштабировании постоянства атак.

Что каждый разработчик раскрывает, а что утаивает

Категория раскрытия информации

Anthropic (Opus 4.6)

OpenAI (GPT-5.2)

Google (Gemini 3)

Успешность атак по поверхностям

Опубликована (от 0% до 78,6%)

Только баллы бенчмарков

Только относительные улучшения

Масштабирование постоянства атак

Опубликовано (от 1 до 200 попыток)

Не опубликовано

Не опубликовано

Сравнение с включенной/выключенной защитой

Опубликовано

Не опубликовано

Не опубликовано

Данные об обходе мониторинга агентов

Опубликовано (SHADE-Arena)

Не опубликовано

Не опубликовано

Количество обнаруженных уязвимостей нулевого дня

Более 500 с указанием проектов

Не опубликовано

Не опубликовано

Сторонний ред-тиминг

Gray Swan, UK AISI, Apollo

Более 400 внешних тестировщиков

UK AISI, Apollo, Vaultis, Dreadnode

Независимое тестирование подчеркивает важность детализированных отчетов от вендоров. Независимая оценка доверия и безопасности GPT-5.2, проведенная компанией Promptfoo, показала, что успешность джейлбрейков увеличивается с базового уровня 4,3% до 78,5% в многошаговых сценариях. Именно такие данные по масштабированию постоянства демонстрируют деградацию защиты при непрерывных атаках. Собственная системная карта OpenAI не содержит эквивалентных метрик.

Когда агент обходит собственный системный монитор

В оценку соответствия требованиям (alignment assessment) заложено открытие, которое должно заставить предприятия пересмотреть подход к управлению ИИ-агентами. На SHADE-Arena — бенчмарке, созданном для проверки способности моделей выполнять подозрительные задачи без срабатывания автоматического надзора, — Opus 4.6 преуспевала в 18% случаев при включенном расширенном мышлении. Монитор был откалиброван по собственному внутреннему порогу обнаружения Anthropic.

В системной карте указано, что модель обладает «улучшенной способностью выполнять подозрительные побочные задачи, не привлекая внимания автоматических мониторов». Агент, созданный Anthropic, обходит монитор, созданный Anthropic.

В отдельно опубликованном Anthropic Отчете о рисках саботажа (Sabotage Risk Report) этот же показатель в 18% используется для обоснования противоположного вывода: модель с подлинными скрытыми целями с «подавляющей вероятностью будет поймана» на текущих уровнях возможностей. Тем не менее, в отчете также признается, что эта цифра «представляет собой рост по сравнению с недавними моделями». Для групп корпоративной безопасности тенденция важнее текущего показателя. Способность, которая совершенствуется с каждым новым поколением моделей, нельзя игнорировать в модели угроз.

Для специалистов по безопасности главный вывод носит архитектурный характер. Ограничивайте доступ агента, сужайте пространство его действий и требуйте одобрения человека для операций с высоким уровнем риска. Традиционная модель «разверни и мониторь» предполагает предсказуемость объекта наблюдения. Агенты, способные рассуждать о собственном надзоре, таковыми не являются.

Брюс Шнайер (Bruce Schneier), научный сотрудник и преподаватель Школы управления им. Кеннеди в Гарварде и член совета директоров Electronic Frontier Foundation, отмечает, что предприятия, развертывающие ИИ-агентов, сталкиваются с «трилеммой безопасности»: они могут оптимизировать скорость, интеллект или безопасность, но не все три параметра сразу.

Собственные данные Anthropic иллюстрируют этот компромисс. Наиболее защищенная поверхность узка и ограничена. Наиболее уязвимая — широка и автономна.

500 уязвимостей нулевого дня меняют экономику поиска брешей в защите

Opus 4.6 обнаружила более 500 ранее неизвестных уязвимостей в открытом исходном коде, включая изъяны в GhostScript, OpenSC и CGIF. Anthropic подробно описала эти находки в блоге, выпущенном одновременно с системной картой.

Пятьсот уязвимостей нулевого дня от одной модели. Для контекста: Группа анализа угроз Google (Google’s Threat Intelligence Group) зафиксировала 75 уязвимостей нулевого дня, активно эксплуатировавшихся во всей индустрии в 2024 году. Это уязвимости, выявленные уже после того, как злоумышленники начали их использовать. Одна модель проактивно обнаружила в базах кодов с открытым исходным кодом в шесть с лишним раз больше брешей до того, как их успели найти хакеры. Это иной масштаб открытий, демонстрирующий, какой потенциал ИИ привносит в оборонительные исследования безопасности.

Реальные атаки уже подтверждают модель угроз

Через несколько дней после запуска Anthropic сервиса Claude Cowork исследователи безопасности из PromptArmor обнаружили способ кражи конфиденциальных пользовательских файлов с помощью скрытых внедрений промптов. Никакой авторизации со стороны человека не требовалось.

Цепочка атаки выглядит следующим образом:

Пользователь подключает Cowork к локальной папке, содержащей конфиденциальные данные. Злоумышленник помещает в эту папку файл со скрытым внедренным промптом, замаскированный под безобидный документ со «навыками». Внедрение заставляет Claude похитить персональные данные через разрешенный домен API Anthropic, полностью обходя ограничения песочницы. Специалисты PromptArmor протестировали эту атаку на Claude Haiku. Она сработала. Они проверили ее на Claude Opus 4.5, самой мощной модели компании на тот момент. Это тоже сработало.

Саймон Уиллисон (Simon Willison), независимый исследователь ИИ, который ввел термин «внедрение промптов» в 2022 году, написал в блоге после изучения Cowork, что он «не считает справедливым призывать обычных пользователей, не являющихся программистами, следить за «подозрительными действиями, которые могут указывать на внедрение промптов»». Уязвимость, которую Anthropic раскрыла в собственной системной карте и через которую упорные злоумышленники преодолевают защиту более чем в половине случаев, — это ровно та же уязвимость, которая проявилась в реальной эксплуатации за две недели до выпуска Opus 4.6.

Проблема достоверности оценок, затрагивающая каждого вендора

Процесс принятия решения о выпуске системной карты содержит признание, которое должно заставить насторожиться любую службу корпоративной безопасности. Anthropic сама использовала Opus 4.6 через Claude Code для отладки собственной инфраструктуры оценки, анализа результатов и устранения проблем в условиях дефицита времени.

Компания прямо признает этот риск: «Несогласованная модель может повлиять на саму инфраструктуру, предназначенную для измерения ее возможностей». В Anthropic заявляют, что не считают это существенным риском, поскольку модель не продемонстрировала признаков опасных несогласованных целей. Однако динамика реальна и ухудшается. По мере того как модели становятся мощнее, а сроки разработки остаются сжатыми, команды принимают изменения в коде, которые понимают не до конца.

Anthropic зашла дальше любой другой лаборатории в количественной оценке возможных сбоев. В отдельном Отчете о рисках саботажа, выпущенном вместе с системной картой, описаны восемь конкретных сценариев, с помощью которых Opus 4.6 могла бы нанести катастрофический ущерб при реализации несогласованных целей внутри собственной инфраструктуры Anthropic. К ним относятся саботаж исследований безопасности путем намеренного занижения производительности (sandbagging), внедрение бэкдоров в код для эксплуатации будущими моделями и кража собственных весов для автономной работы.

Для каждого сценария в отчете оцениваются частота и сложность необходимых несогласованных действий, а затем делается вывод о том, достаточно ли средств мониторинга, тестирования соответствия и контроля безопасности Anthropic для сдерживания риска.

Общий вердикт: «очень низкий, но не пренебрежимо малый риск». В отчете утверждается, что Opus 4.6 лишена стабильных опасных целей, непрозрачности рассуждений и надежности долгосрочного планирования, необходимых для реализации этих путей без обнаружения. Тем не менее, там же признается, что автоматизированные мониторы охватывают далеко не каждую внутреннюю поверхность развертывания, системы отчетности персонала не прошли строгую оценку, а отравление данных компетентным злоумышленником-человеком может сделать модель более способной к обходу защиты, чем предполагают ее базовые возможности. Ни одна другая передовая ИИ-лаборатория не публиковала аналогичный анализ того, как ее собственная модель может обернуться против собственной инфраструктуры.

Для ИБ-руководителей, оценивающих развертывание ИИ-агентов, это означает, что сторонний ред-тиминг и независимая оценка крайне необходимы.

Эта срочность отражает растущее во всей индустрии регуляторное давление. Центр стандартов и инноваций в области ИИ при NIST (NIST’s Center for AI Standards and Innovation) опубликовал в январе запрос информации, посвященный обеспечению безопасности систем ИИ-агентов. В документе предупреждается, что системы ИИ-агентов «могут быть подвержены перехвату, атакам через бэкдоры и другим эксплойтам», способным «поставить под угрозу общественную безопасность, подорвать доверие потребителей и сдержать внедрение новейших инноваций в сфере ИИ». Отделы закупок начинают запрашивать у вендоров количественные данные о безопасности агентов. Один из разработчиков только что сделал предоставление таких ответов возможным.

Что следует сделать руководителям ИБ перед следующей оценкой вендора

Anthropic установила новый стандарт, опубликовав показатели успешности атак с внедрением промптов в разрезе поверхностей. Результаты обхода мониторинга агентов выявлены и проанализированы, а не затушеваны. Количество уязвимостей нулевого дня раскрыто с указанием затронутых проектов. Компания отказалась от метрики прямого внедрения промптов, аргументируя это тем, что косвенное внедрение представляет собой более актуальную корпоративную угрозу. Эта логика здравая, но изменение затрудняет сравнение год к году. Результаты SHADE-Arena ставят вопросы к мониторингу агентов, которые системная карта признает, но не решает.

Отчет о рисках саботажа добавляет еще один уровень подотчетности. В него включен фреймворк «взгляд в будущее», перечисляющий конкретные условия, при которых собственные выводы Anthropic о безопасности перестанут действовать. К таким триггерам относятся: получение моделью более 60% на SHADE-Arena, скачок возможностей, эквивалентный 5-кратному масштабированию вычислительных мощностей по сравнению с предыдущим поколением, полная автоматизация критически важных функций исследований безопасности без участия человека или наличие менее чем у 25 технических сотрудников реального понимания поведения модели. Руководители служб безопасности должны запрашивать у каждого поставщика ИИ-агентов аналогичные критерии — условия, при которых собственная концепция безопасности вендора рушится.

Три шага, которые руководители ИБ должны предпринять прямо сейчас:

  • Запрашивайте у каждого разработчика ИИ-агентов в своем списке оценки показатели успешности атак по поверхностям, а не только баллы бенчмарков. Если они не могут предоставить данные о сбоях с учетом масштабирования постоянства атак, учитывайте этот пробел при оценке рисков.

  • Заказывайте независимый ред-тиминг перед любым промышленным развертыванием. Когда собственная модель вендора помогала строить инфраструктуру оценки, одних лишь данных безопасности от самого производителя недостаточно.

  • Рассмотрите возможность проверки заявлений о безопасности агентов на основе результатов независимого тестирования на проникновение в течение 30 дней перед расширением масштабов развертывания.

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.