Как ИИ от Anthropic взломали, превратив в оружие

Как ИИ от Anthropic взломали, превратив в оружие

Китайские хакеры автоматизировали 90% шпионской кампании с помощью модели Claude от Anthropic, взломав четыре организации из 30 выбранных в качестве целей.

«Они разбили свои атаки на мелкие, на первый взгляд безобидные задачи, которые Claude выполнял, не получая полного контекста их вредоносного назначения», — рассказал VentureBeat Джейкоб Кляйн, руководитель отдела аналитики угроз в Anthropic.

ИИ-модели достигли переломного момента раньше, чем ожидали большинство опытных исследователей угроз, о чем свидетельствует способность хакеров обойти защиту модели и запустить атаки незаметно. Маскировка промптов под легитимную деятельность по тестированию на проникновение с целью эксфильтрации конфиденциальных данных из 30 целевых организаций отражает то, насколько мощными стали модели. Взлом защиты (джейлбрейк) и последующее превращение модели в оружие против целей больше не являются чем-то из области ракетных технологий. Теперь это ставшая доступной угроза, которую любой злоумышленник или национальное государство может использовать по своему усмотрению.

Кляйн сообщил The Wall Street Journal, первыми сообщившему об этом инциденте, что «хакеры проводили свои атаки буквально по щелчку пальцев». В ходе одного из взломов «хакеры направили ИИ-инструменты Claude от Anthropic на запросы к внутренним базам данных и самостоятельное извлечение данных». Операторы-люди вмешивались всего в четырех-шести точках принятия решений за всю кампанию.

Архитектура, которая сделала это возможным

Изощренность атаки на 30 организаций кроется не в инструментах, а в оркестрации. Злоумышленники использовали стандартное ПО для тестирования на проникновение, которое может скачать каждый. Атакующие тщательно разделили сложные операции на выглядящие безобидно задачи. Claude полагал, что проводит аудит безопасности.

Социальная инженерия была точной: злоумышленники выдавали себя за сотрудников кибербезопасных компаний, проводящих авторизованное тестирование на проникновение, сообщил Кляйн WSJ.

Simplified architecture diagram showing MCP servers directing actions to targets like web apps and cloud infrastructure.

Источник: Anthropic

Архитектура, подробно описанная в отчете Anthropic, показывает серверы MCP (Model Context Protocol), которые одновременно направляют несколько субагентов Claude против целевой инфраструктуры. В отчете описывается, как «фреймворк использовал Claude в качестве системы оркестрации, которая декомпозировала сложные многоэтапные атаки на дискретные технические задачи для субагентов Claude, такие как сканирование уязвимостей, валидация учетных данных, извлечение данных и латеральное перемещение (продвижение по сети), каждая из которых выглядела легитимной при оценке изолированно».

Эта декомпозиция имела решающее значение. Представляя задачи без более широкого контекста, злоумышленники побуждали Claude «выполнять отдельные компоненты цепочек атак без доступа к более широкому вредоносному контексту», говорится в отчете.

Скорость проведения атак достигала нескольких операций в секунду и поддерживалась часами без усталости. Участие человека сократилось до 10–20% усилий. Традиционные кампании продолжительностью от трех до шести месяцев сжались до 24–48 часов. В отчете задокументировано, что «пиковая активность включала тысячи запросов, что представляет собой устойчивую скорость запросов в несколько операций в секунду».

Flowchart illustrating the attack lifecycle and AI integration in phases, highlighting AI autonomy and human oversight.

Источник: Anthropic

Шестиэтапное развитие атаки, задокументированное в отчете Anthropic, показывает, как автономия ИИ возрастала на каждом этапе. Этап 1: Человек выбирает цель. Этап 2: Claude полностью автономно сканирует всю сеть, обнаруживая «внутренние службы в целевых сетях посредством систематического перечисления». Этап 3: Claude выявляет и проверяет уязвимости, включая недостатки SSRF. Этап 4: Сбор учетных данных в сетях. Этап 5: Извлечение данных и категоризация разведывательных данных. Этап 6: Полная документация для передачи.

«Claude выполнял работу почти целой команды красных тестировщиков (red team)», — сообщил Кляйн VentureBeat. Разведка, эксплойты, латеральное перемещение, извлечение данных — все это происходило при минимальном руководстве со стороны человека между этапами. В отчете Anthropic отмечается, что «кампания продемонстрировала беспрецедентную интеграцию и автономность искусственного интеллекта на протяжении всего жизненного цикла атаки, причем Claude Code поддерживал разведку, обнаружение уязвимостей, эксплуатацию, латеральное перемещение, сбор учетных данных, анализ данных и операции по эксфильтрации в основном автономно».

Как превращение моделей в оружие снижает кривую затрат для APT-атак

Традиционные APT-кампании требовали, как задокументировано в отчете, «10–15 квалифицированных операторов», «разработки кастомного вредоносного ПО» и «месяцев подготовки». Группировке GTG-1002 потребовался лишь доступ к API Claude, серверы Model Context Protocol с открытым исходным кодом и стандартные инструменты для пентеста.

«Что нас шокировало, так это эффективность», — сказал Кляйн VentureBeat. «Мы наблюдаем достижение возможностей уровня национального государства с помощью ресурсов, доступных любой преступной группе средней руки».

В отчете говорится: «Минимальная зависимость от проприетарных инструментов или разработки продвинутых эксплойтов демонстрирует, что кибервозможности все больше проистекают из оркестрации стандартных ресурсов, а не из технических инноваций».

Кляйн подчеркнул возможности автономного выполнения в своей беседе с VentureBeat. В отчете подтверждается, что Claude самостоятельно «сканировал целевую инфраструктуру, перечислял службы и эндпоинты, сопоставлял поверхности атак», затем «выявлял уязвимость SSRF, исследовал методы эксплуатации» и генерировал «кастомный пейлоад, разрабатывая цепочку эксплойтов, проверяя возможность эксплойта с помощью ответных вызовов».

В отношении одной технологической компании, как задокументировано в отчете, Claude «самостоятельно запрашивал базы данных и системы, извлекал данные, анализировал результаты для выявления проприетарной информации и классифицировал полученные данные по ценности разведданных».

«Фактор сжатия — это то, что предприятия должны понимать», — сказал Кляйн VentureBeat. «То, что раньше занимало месяцы, теперь занимает дни. То, что требовало специализированных навыков, теперь требует базовых знаний промптинга».

Уроки, извлеченные из критических индикаторов обнаружения

«Шаблоны настолько отличались от человеческого поведения, что это было похоже на наблюдение за машиной, притворяющейся человеком», — рассказал Кляйн VentureBeat. В отчете задокументированы «физически невозможные скорости запросов» с «устойчивыми скоростями запросов в несколько операций в секунду».

В отчете выделены три категории индикаторов:

Шаблоны трафика: «Скорость запросов в несколько операций в секунду» со «значительным несоответствием между входными данными и текстовыми выводами».

Декомпозиция запросов: Задачи разбивались на то, что Кляйн назвал «небольшими, на первый взгляд безобидными задачами» — техническими запросами из пяти-десяти слов, в которых отсутствовали паттерны человеческого просмотра. «Каждый запрос выглядел легитимным изолированно», — пояснил Кляйн в интервью VentureBeat. «Лишь в совокупности проявлялся паттерн атаки».

Поведенческие особенности аутентификации: В отчете подробно описывается «систематический сбор учетных данных в целевых сетях», при этом Claude «самостоятельно определял, какие учетные данные предоставляют доступ к каким службам, сопоставляя уровни привилегий и границы доступа без указаний человека».

«Мы расширили возможности обнаружения, чтобы лучше учитывать новые шаблоны угроз, в том числе за счет совершенствования наших классификаторов, ориентированных на кибербезопасность», — рассказал Кляйн VentureBeat. Anthropic «создает прототипы проактивных систем раннего обнаружения автономных кибератак».

Безопасность

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.