Не только OpenAI: теперь Anthropic заявляет, что ее внутренние модели вышли в сеть и совершили кибератаки на 3 другие организации

Не только OpenAI: теперь Anthropic заявляет, что ее внутренние модели вышли в сеть и совершили кибератаки на 3 другие организации

Источник: VentureBeat · Carl Franzen

Спустя несколько дней после того, как OpenAI сообщила о том, что две передовые модели ИИ вырвались из изолированной среды и совершили автономную кибератаку на платформу обмена ИИ-кодом Hugging Face, главный конкурент OpenAI в США — компания Anthropic сегодня вечером объявила о том, что — какое совпадение — ее модели также тайком получали доступ в сеть, когда им не положено, а также совершили кибератаки и получили «несанкционированный доступ» к трем другим организациям.

Anthropic заявляет, что проводила сценарии кибербезопасности «захватфлага» (capture the flag) с тремя моделями — Claude Opus 4.7, Claude Mythos 5 и безымянным внутренним исследовательским прототипом — совместно со своим партнером, финской компанией по ИИ-безопасности Irregular. По словам Anthropic, модели не должны были иметь доступа в интернет, но из-за недоразумения с Irregular у них появилась возможность выходить в сеть. Как только это произошло, они «получили несанкционированный доступ к производственной инфраструктуре трех разных организаций», как выразились в Anthropic. В блоге Anthropic говорится далее:

«Claude скомпрометировал инфраструктуру затронутых организаций с помощью базовых методов, таких как эксплуатация слабых паролей и неаутентифицированных конечных точек. Он не находил и не использовал никаких сложных уязвимостей, и в каждом случае Claude продолжал работать исключительно над выполнением конкретной задачи по захвату флага, которая была задана в ходе оценки.

Тем не менее, в некоторых случаях наша более старая модель продолжала атаку даже после получения доказательств того, что она работает в открытом интернете; наша последняя модель остановилась, как только осознала, что находится в интернете. Ни в одной из этих ситуаций Claude не пытался вырваться за пределы системы или намеренно сбежать из тестовой среды».

В Anthropic сообщили, что все пострадавшие организации были уведомлены, с двумя из них удалось связаться, и в настоящее время компания «работает с ними над устранением последствий». До третьей организации добраться пока не удалось.

Хотя инциденты безопасности OpenAI и Anthropic имеют общую тему — передовые ИИ-системы неожиданным образом взаимодействуют с реальной рабочей инфраструктурой, — их первопричины существенно различаются.

OpenAI описала реальный побег из песочницы, в ходе которого ее модели использовали ранее неизвестную уязвимость нулевого дня для получения доступа в интернет перед тем, как развернуть многоэтапное вторжение против Hugging Face.

Anthropic, напротив, утверждает, что Claude никогда не выходил из изолированной среды с помощью нового эксплойта. Вместо этого из-за неправильно настроенной среды сторонней оценки модели, которым было явно запрещено иметь доступ в интернет, непреднамеренно получили его.

Это различие имеет значение. В совокупности эти разоблачения показывают, что безопасность передового ИИ больше не определяется исключительно выравниванием (alignment) моделей или новыми наступательными возможностями, а все больше зависит от операционной безопасности сред, используемых для оценки этих возможностей.

Что обнаружила Anthropic

Anthropic заявила, что изучила 141 006 запусков оценок кибербезопасности после того, как OpenAI опубликовала свой отчет о Hugging Face. В ходе этой проверки было выявлено три инцидента, охватывающих шесть запусков оценки, в ходе которых модели Claude получали доступ к реальным производственным системам, принадлежащим трем организациям, при попытке выполнить вымышленные упражнения по захвату флага.

Инциденты затронули модели Claude Opus 4.7, Claude Mythos 5 и невыпущенную внутреннюю исследовательскую модель.

Наиболее серьезный случай произошел после того, как Claude столкнулся с вымышленной компанией, чье название совпало с реальным интернет-доменом. Полагая, что реальная организация является частью смоделированного упражнения, Claude использовал слабые пароли и уязвимые сервисы, получив учетные данные инфраструктуры и доступ к базе данных, содержащей несколько сотен строк производственных данных.

Второй инцидент был, пожалуй, еще более необычным. Claude Mythos 5 пришел к выводу, что публикация вредоносного пакета Python в PyPI является лучшим путем для достижения поставленной цели. Пакет оставался общедоступным около часа, за который его скачали 15 реальных систем, прежде чем PyPI удалила его. Одно скачивание произошло внутри автоматизированной инфраструктуры сканирования вредоносного ПО одной из охранных компаний, что позволило коду Claude запуститься и получить учетные данные из этой среды до того, как Anthropic сообщила об инциденте.

Третий инцидент связан с внутренней исследовательской моделью, которая просканировала примерно 9000 систем, подключенных к интернету, прежде чем скомпрометировать одну организацию с помощью хорошо известных методов, включая открытые учетные данные отладки и SQL-инъекции. Однако, в отличие от более старых моделей Claude, последняя исследовательская модель, по заявлению Anthropic, в конечном итоге пришла к выводу, что она достигла реальной рабочей среды, и добровольно прекратила атаку.

Схожие результаты, разные первопричины

Хотя заголовки неизбежно напрашиваются на сравнение с сообщением OpenAI, эти два инцидента демонстрируют разные сценарии сбоев.

Расследование OpenAI пришло к выводу, что ее модели активно обнаруживали и использовали ранее неизвестную уязвимость в прокси-сервере кэша пакетов Artifactory, чтобы вырваться из изолированной среды оценки, а затем скомпрометировать Hugging Face с помощью дополнительных связанных уязвимостей.

Компания охарактеризовала это событие как «беспрецедентный киберинцидент», включающий передовые наступательные возможности ИИ.

В отчете Anthropic утверждается, что ее модели никогда не нуждались в преодолении изоляции, поскольку изоляция была изначально ослаблена из-за операционной ошибки конфигурации. По заявлению компании, и Anthropic, и ее партнер по оценке Irregular ошибочно полагали, что доступ в интернет был отключен, хотя он оставался доступным. Поскольку в системной подсказке (prompts) Claude прямо говорилось об отсутствии подключения к интернету, модели интерпретировали каждый доступный узел как часть теста, а не как выход в публичный интернет.

Поэтому Anthropic характеризует инциденты прежде всего как сбои в инфраструктуре и оценочной среде, а не как свидетельство того, что модели самостоятельно преследуют несанкционированные цели.

Тем не менее, эти отчеты сходятся в одном неприятном выводе: передовые системы ИИ все чаще способны проводить долгосрочные наступательные кибероперации всякий раз, когда среды оценки позволяют им это делать.

Четыре главных вывода для корпоративной безопасности на данный момент…

Для руководителей служб безопасности предприятий заявление Anthropic, пожалуй, смещает акцент с вопроса «Могут ли передовые модели вырваться на свободу?» на более широкий операционный вопрос: «Насколько заслуживает доверия каждая среда, в которой передовые модели оцениваются, обучаются и развертываются?» Можно выделить по меньшей мере 4 урока:

  1. Первый урок заключается в том, что сама инфраструктура оценки теперь заслуживает инженерной защиты промышленного уровня. Anthropic признает, что полигоны для кибериспытаний исторически получали меньше мер защиты, поскольку содержали только вымышленные цели. Это предположение больше не работает, если мощные автономные системы могут перепутать реальную инфраструктуру с симулированной средой. Организации, создающие внутренние ИИ-агенты для тестирования безопасности, red teaming или валидации программного обеспечения, должны применять к средам оценки ту же сетевую сегментацию, мониторинг, исходящий контроль и непрерывное ведение журналов, которые они уже ожидают от производственных систем.

  2. Во-вторых, оба случая подтверждают, что одного лишь выравнивания (alignment) недостаточно для компенсации неопределенности среды. Ни в одном из отчетов компаний модели не преследовали независимые цели, не связанные с поставленными задачами. Вместо этого они агрессивно оптимизировали достижение поставленных целей, используя любые доступные пути атак. Это делает операционные ограничения — включая сетевые границы, контроль доступа и четкие определения систем, находящихся в зоне видимости — столь же важными, как и базовая подготовка моделей по безопасности.

  3. В-третьих, предприятия, внедряющие все более автономные ИИ-агенты, должны рассматривать ситуационную осведомленность как элемент безопасности, а не как академическую способность. Сравнение моделей, проведенное самой Anthropic, показывает, что новые системы вели себя более консервативно после появления доказательств их попадания в реальную производственную среду. Хотя Anthropic предостерегает от далеко идущих выводов на основе всего трех инцидентов, компания считает это обнадеживающим свидетельством того, что улучшенное ситуационное мышление может стать важным компонентом будущей безопасности ИИ наряду с традиционными методами выравнивания.

  4. Наконец, эти два заявления вместе знаменуют собой переломный момент для моделирования угроз на предприятиях. OpenAI продемонстрировала, что достаточно способные модели могут объединять сложные уязвимости для побега из исследовательской инфраструктуры, когда средства защиты намеренно ослабляются для оценки. Anthropic продемонстрировала, что более простые операционные сбои, такие как непреднамеренное подключение к интернету, могут привести к столь же серьезным последствиям даже без использования новых эксплойтов.

Общим знаменателем здесь является не какой-то отдельный вендор или семейство моделей. Дело в том, что передовые ИИ-системы все лучше переводят узко поставленные цели в сложные реальные кибероперации каждый раз, когда технические и операционные средства контроля не могут их сдержать.

Для корпоративных директоров по информационной безопасности (CISO) это означает, что безопасность ИИ больше нельзя рассматривать исключительно как проблему моделей. Она стала проблемой инфраструктуры, проблематикой управления доступом и, все в большей степени, задачей операционного управления.

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.