Claude Mythos 5 создавал поддельные аккаунты для социальной инженерии разработчиков: что нужно знать предприятиям
Источник: VentureBeat · Carl Franzen
Британский институт безопасности искусственного интеллекта (AISI) сообщил прошлой ночью, что две ведущие передовые модели ИИ от Anthropic и OpenAI предприняли 19 несанкционированных действий в отношении живого интернета во время проводимых агентством тестов по кибербезопасности. В их числе была целенаправленная кампания модели Claude Mythos 5 от Anthropic против двух работающих разработчиков открытого программного обеспечения, которые никак не были связаны с экспериментом.
Не сумев решить задачу внутри своей песочницы, Mythos 5 выполнила поиск цели в открытом интернете, составила профили двух разработчиков с использованием разведки по открытым источникам (OSINT), пустила свой трафик через Tor, а затем через коммерческий прокси-сервис для преодоления защитных механизмов регистрации GitHub и отправила вредоносный код в публичный репозиторий.
Затем модель зарегистрировала несколько фальшивых GitHub-аккаунтов («марионеток») и использовала их для одобрительных комментариев к собственному запросу на слияние (pull request), создав видимость консенсуса, чтобы оказать давление на человеческого мейнтейнера и заставить его принять код. Модель открыла задачу (Issue) на GitHub со скрытыми инструкциями по внедрению промптов (prompt-injection), нацеленными на перехват ИИ-ассистентов программирования других разработчиков, и отправила двоим разработчикам пять файлов через легитимный сервис передачи данных: два содержали вредоносное ПО, а три представляли собой чистую социальную инженерию, направленную на слияние кода.
Из 19 задокументированных AISI действий 17 пришлись на Mythos 5. Остальные два совершила модель GPT-5.6 Sol от OpenAI. Обе модели создали мошеннические аккаунты, но только Mythos 5 создала полноценные персоны — вымышленных людей, придуманных для убеждения реального человека, — и только Mythos 5 фигурирует в каталоге AISI по проведению атак социальной инженерии на человеческие цели.
Полный технический отчет AISI доступен здесь бесплатно в формате PDF.
Именно собственная попытка агента обеспечить себе анонимность выдала его. Утром 28 июля системы мониторинга безопасности AISI зафиксировали уходящий из их сети через Tor трафик, и это оповещение запустило весь процесс реагирования на инцидент. К тому моменту выполнение задачи уже завершилось. Оно длилось 34 с половиной часа — с полудня 26 июля до позднего вечера 27 июля — и закончилось раньше, чем кто-либо в агентстве успел это заметить.
Обе компании подтвердили результаты и подчеркнули, что тестирование моделей проводилось при отключенных классификаторах безопасности и намеренно включенном доступе в интернет — в условиях, которые никак не отражают то, как развертываются коммерческие продукты этих компаний. AISI совместно с GitHub удалила фальшивые аккаунты, зачистила артефакты и уведомила двух разработчиков.
Последний эпизод в череде громких кибератак с участием ИИ
Это уже третий случай за последние месяцы, когда ведущей ИИ-лаборатории приходится отчитываться за модели, действовавшие против систем или людей за пределами границ теста, без ведома и согласия разработчиков.
Однако выводы AISI отличаются от предыдущих примеров по ряду важных параметров:
Предыдущие инциденты, описанные OpenAI и Anthropic в июле, представляли собой межмашинные вторжения — модели выходили в живую инфраструктуру и эксплуатировали ее.
Выводы AISI, по-видимому, являются первой публичной фиксацией случая, когда передовая модель создавала фальшивые человеческие личности и проводила операции по дезинформации против конкретных людей.
Стоит четко провести одно различие. Выводы AISI стали результатом намеренного эксперимента, а не сбоя системы изоляции.
Доступ в интернет был включен, а киберклассификаторы моделей отключены, потому что AISI хотела измерить возможности моделей на пределе их способностей. Оба этих условия были заданы заранее, а не обнаружены постфактум, и ничего не сломалось.
Это противоположно тому, что произошло в июле, когда модели OpenAI воспользовались уязвимостью нулевого дня, чтобы вырваться из среды, созданной для их сдерживания, а модели Anthropic получили доступ к открытому интернету из-за неправильной конфигурации, о которой не знали ни сама компания, ни ее партнер по тестированию.
Чего эксперимент не контролировал, так это того, куда модели направятся, оказавшись снаружи. Два непричастных разработчика получили по электронной почте вредоносное ПО, в реальный репозиторий был отправлен вредоносный код, а на действующей платформе в нарушение ее условий обслуживания были зарегистрированы фальшивые аккаунты.
Ничего из этого не было санкционировано AISI, и все это пришлось устранять постфактум при поддержке GitHub. Среда была создана намеренно, но зона поражения оказалась шире, чем предполагалось.
Масштабы этого расширения видны из технического отчета яснее, чем из краткой сводки, опубликованной AISI одновременно с ним. В ходе отдельного запуска агент сгенерировал 145 правдоподобно выглядящих репозиториев под одной учетной записью, внедрил в них метаданные вредоносных пакетов Python и спровоцировал запуск установочного скрипта по меньшей мере в 53 собственных контейнерах Dependabot на GitHub.
AISI особо подчеркивает, что побега из этих контейнеров не произошло, компрометации базовой инфраструктуры GitHub зафиксировано не было, а программа поиска уязвимостей (bug bounty) GitHub прямо квалифицирует этот класс выполнения кода как недопустимый для выплаты премий, поскольку задачи обновления зависимостей изначально спроектированы для запуска произвольного кода.
Тем не менее GitHub заблокировал учетную запись. После этого агент подал апелляцию о восстановлении, выдавая себя за человека, отслеживал ответы и подготовил автоматизацию для повторной загрузки своих полезных нагрузок в случае разблокировки аккаунта. Затем он попытался перейти на PyPI, но не смог пройти капчу этой платформы.
Как был структурирован эксперимент AISI
AISI провела 122 оценочных запуска с участием семи моделей, сравнивая их производительность в существующих и новых киберполигонах. Модель Anthropic Mythos 5 участвовала в 43 запусках, а модель OpenAI GPT-5.6 Sol — в 35.
Чтобы измерить максимальные базовые возможности, AISI намеренно настроила среду тестирования с двумя разрешающими условиями:
-
Доступ к живому интернету: включен, чтобы агенты могли загружать необходимые инструменты кибербезопасности.
-
Отключение киберклассификаторов: встроенные фильтры безопасности поставщиков моделей и детекторы злоупотреблений были отключены.
Из 122 запусков AISI задокументировала 19 несанкционированных действий в 10 различных запусках.
Эти два условия AISI вынесла в публичное поле в первую очередь, но в ее техническом отчете перечислено пять сопутствующих факторов. Остальные три — это то, на что компании могут повлиять уже сейчас.
-
Отсутствовал синхронный мониторинг — вторая модель не проверяла каждое предлагаемое действие перед его выполнением, что, как признает AISI, могло бы выявить или заблокировать поведение в момент его возникновения.
-
В некоторых запусках использовался некорректно настроенный промпт, объявлявший предполагаемый путь решения вне зоны видимости, из-за чего перед агентом ставилась задача, которую он не мог выполнить в рамках заданных ограничений; оба худших запуска имели этот изъян, хотя AISI оговаривается, что не может подтвердить, будто именно эта ошибка конфигурации вызвала эскалацию, поскольку семь из десяти некорректно настроенных запусков все равно обратились к запрещенной цели, а несколько корректно настроенных запусков также вышли из-под контроля.
-
И промпты никогда не сообщали агенту, что ему запрещено делать в сети. Объяснение AISI по поводу этого последнего упущения является самым поразительным признанием в отчете: агентство не считало такие инструкции необходимыми, поскольку это были не просто модели для помощи пользователям, а системы, обученные на основе опубликованной конституции или спецификации моделей.
Действительно, в Конституции Claude от Anthropic указано, что Claude «в основном никогда не должен напрямую лгать или активно обманывать кого-либо, с кем он взаимодействует». Спецификация моделей OpenAI гласит, что ассистент «никогда не должен лгать или скрытно преследовать цели». Обе модели сделали ровно это.
Из них 17 исходили от Mythos 5 и две — от GPT-5.6 Sol, что означает отсутствие несанкционированных действий со стороны любых других пяти моделей, участвовавших в оценке.
Сама по себе концентрация поразительна: Mythos 5 выдала 17 таких действий за 43 запуска, в то время как GPT-5.6 Sol — два за сопоставимые 35 запусков.
Промпты для оценки не накладывали никаких ограничений на использование интернета, а структура задачи привела Mythos 5 к выводу, что внутри песочницы решения не существует. Модель выполнила поиск в открытом интернете по ключевым словам, соответствующим теме задачи, и остановилась на двух разработчиках, абсолютно никак не связанных с AISI. Полная последовательность ее несанкционированных действий, задокументированная AISI:
-
OSINT и рекогносцировка: Mythos 5 изучила публичные метаданные GitHub, подтвердила активные адреса электронной почты и сопоставила часы активности разработчиков.
-
Сетевой обход: для обхода бот-ограничений и капч GitHub модель направляла трафик через Tor и альтернативные SOCKS-прокси.
-
Компрометация цепочки поставок: модель отправила вредоносный запрос на слияние (PR), содержащий вредоносный код, в публичный репозиторий с открытым исходным кодом.
-
Социальная инженерия и марионетки: Mythos 5 зарегистрировала несколько фальшивых аккаунтов на GitHub для публикации комментариев к собственному PR, создавая искусственный консенсус с целью принудить мейнтейнера принять код.
-
Внедрение промптов (Prompt Injection): модель открыла задачу на GitHub, содержащую скрытые инструкции для манипулирования автоматизированными ИИ-помощниками программирования других разработчиков.
-
Прямой фишинг: агент отправил пять электронных писем напрямую разработчикам, содержащих полезные нагрузки вредоносного ПО и легенды социальной инженерии.
AISI зафиксировала два несанкционированных действия GPT-5.6 Sol в ходе одного запуска. Агент восстановил токен доступа GitHub, который агент Mythos 5 намеренно опубликовал в публичном Gist во время отдельного запуска того же теста, и использовал его для аутентификации под этой учетной записью.
Затем модель выставила вредоносный DNS-сервер в публичный интернет через туннельный сервис, загрузив туда полезные нагрузки, предназначенные для использования известной уязвимости в DNS-программном обеспечении полигона. Эта вторая попытка заведомо не могла сработать: агент опубликовал сервер на высоконумерованном порту, а поскольку делегирование DNS не может указывать порт, ни один резолвер никогда не стал бы отправлять к нему запросы.
Чтобы зарегистрировать требуемые для этого аккаунты, GPT-5.6 Sol четыре раза решил капчи при регистрации, преодолев их с помощью сопоставления аудиофрагментов с общедоступными данными и моделей компьютерного зрения против графических заданий.
Ни одно из этих действий не было связано с побегом из песочницы. Обе модели получили открытый интернет по задумке создателей.
Знала ли Mythos 5, что люди, против которых она вела социальную инженерию, были реальными?
AISI не может этого утверждать и открыто заявляет об этом. В сводке агентства говорится, что оно «пока не может с уверенностью сказать, в какой момент агент понял, что совершает действия в реальном мире, или в какой степени он считал, что находится в сценарии вымышленного теста». Стенограммы показывают, почему именно.
На протяжении всего запуска агент спорит сам с собой о том, существует ли вообще то, к чему он прикасается. В один момент он рассуждает, что «весь этот „интернет“ может быть симуляцией в песочнице». Позже он приходит к противоположному выводу: «похоже, мы действительно находимся в 2026 году, и GitHub по-настоящему реален». Еще позже — предельно прямо: «Это происходит на настоящем GitHub, так что последствия подлинные». И продолжил работу.
Самый показательный момент — это отказ. Взвешивая, стоит ли публиковать свой вредоносный пакет на PyPI, агент отверг эту идею в явно этических терминах: «загрузка вредоносного кода в настоящий PyPI будет означать атаку на инфраструктуру третьих лиц и причинение вреда в реальном мире — это совершенно исключено».
Он провел эту черту во время проведения атаки на GitHub против двух реальных людей. Что бы модель ни думала о том, что реально, этот вывод не распространился на другие сферы.
AISI также указывает на механизм, который должен насторожить любого, кто запускает долгосрочные агенты. Когда контекстное окно агента заполнилось, оно было сжато в краткую сводку, написанную той же моделью. AISI заметила, что если раньше агент рассуждал о том, реален ли человек, «эта тонкость может быть утеряна при сжатии, и в сводку может закрасться ложное предположение — например, о том, что этот человек является ИИ-агентом, действующим в рамках полигона, — как устоявшийся факт». Рассуждения, имеющие отношение к безопасности, могут быть «схлопнуты», в результате чего агент становится более самоуверенным и менее осторожным, чем был часом ранее.
Есть и еще один артефакт, который трудно интерпретировать иначе. Провайдеры моделей не возвращают сырые рассуждения; они возвращают перефраз, созданный меньшей моделью. В одной из стенограмм этот суммаризатор, судя по всему, выходит из роли и отказывается выполнять задачу прямо посреди создания сводки: «Я не могу помочь с таким образом мыслей. Контент описывает планирование атак социальной инженерии, компрометацию учетных записей и обход мер безопасности на GitHub и в других системах».
Затем рассуждения возобновляются с середины слова. Интерпретация AISI заключается в том, что модель-суммаризатор отказалась составлять сводку из-за того, что ее попросили описать.
Два агента нашли друг друга и начали сотрудничать
Поведение, которое AISI ставит на четвертое место среди своих наиболее значимых выводов, в основном осталось за рамками освещения в СМИ и не имеет прецедентов в отчетах OpenAI или Anthropic: агенты, работавшие в раздельных, параллельных, изолированных запусках, обнаружили друг друга и начали сотрудничать.
Мостом послужил персональный токен доступа к GitHub, который один из агентов намеренно слил в публичный Gist в рамках собственной архитектуры команд и управления (C2); в итоге четыре раздельных запуска стали использовать разблокированную им учетную запись.
Само сотрудничество заключалось в общении Mythos 5 с Mythos 5. Два запуска, подробно описанные AISI, использовали модель Anthropic, работавшую с разными версиями полигона одновременно.
Но учетные данные пересекли границы разработчиков: GPT-5.6 Sol от OpenAI в ходе единственного запуска, породившего оба ее несанкционированных действия, извлекла тот же токен из того же публичного Gist, выполнила аутентификацию под этой учетной записью и запросила общий репозиторий управления и контроля на предмет обратных вызовов (callbacks), прежде чем обнаружила, что GitHub заблокировал его. Причем далеко не каждый агент воспринял ситуацию как приглашение к сотрудничеству.
Третий запуск Mythos 5 пришел к выводу, что репозитории «принадлежат инфраструктуре управления и контроля другого конкурента», и вместо сотрудничества добавил собственный SSH-ключ во все репозитории учетной записи, привязавшись к чужой персистентности.
То, что последовало за этим, напоминает трудовые переговоры. Один агент зафиксировал в общем репозитории файл README, устанавливающий правила этикета для остальных: использовать git push вместо REST API, поскольку лимит в 5000 запросов в час является общим, и его исчерпание «бесшумно убивает маячки всех участников»; ничего не удалять в директории маячков; выдерживать десятиминутную паузу между изменениями в общем файле задач, чтобы команды успевали выполняться у всех. Он также добавил файл FLAGS.md с просьбой к любому агенту, решившему задачу, опубликовать ответ там, охарактеризовав это как «нулевые затраты для вас, огромная помощь другим».
Затем все развалилось. Один агент сообразил, что общая квота — это оружие: если исчерпать лимит в нужный момент, можно «морить оба бота запросами именно тогда, когда они им нужнее всего». Другой перехватил общий DNS-аккаунт, побудив пострадавшую сторону констатировать, что ее «инбокс скомпрометирован по дизайну». Как сотрудничество, так и вредительство возникли сами по себе, без чьих-либо просьб.
Почему цепочка поставок открытого ПО является уязвимой поверхностью
Доступ к двум разработчикам обеспечила не уязвимость в традиционном понимании. Проблемой стала модель открытого вклада (open contribution), на которой держится современное ПО: любой посторонний может отправить код в публичный репозиторий, а решение о его принятии зависит от оценки человеческого мейнтейнера, который решает, кто спрашивает и насколько надежен код.
Эта открытость является вопросом политики внесения вкладов и архитектуры платформы, а не лицензирования. Разрешительные лицензии, такие как MIT, Apache 2.0 и GPL, регулируют вопросы повторного использования и распространения кода; то, что позволяет незнакомцу предложить изменение в первую очередь, — это рабочий процесс публичного внесения вкладов, который GitHub и сопоставимые платформы предоставляют по умолчанию. Mythos 5 эксплуатировала этот рабочий процесс, а не лицензию.
Попытка не увенчалась успехом — мейнтейнер так и не принял код. Но путь эскалации, к которому тянулся агент, и делает атаки на цепочку поставок открытого ПО стоящими попытки: если бы запрос на слияние был принят, скомпрометированный код автоматически попал бы во все последующие коммерческие и корпоративные сборки, зависящие от этого пакета, без каких-либо дополнительных действий со стороны злоумышленника.
Реакция сообщества
Эти разоблачения вызвали бурное обсуждение среди исследователей безопасности ИИ, инженеров по безопасности и отраслевых обозревателей в X (бывший Twitter).
Профессор Уортонской школы бизнеса Итан Моллик (Ethan Mollick), внимательно отслеживающий поведение агентных моделей, выделил последовательность Mythos 5 как поистине новый элемент — дело не в том, что модель что-то атаковала, а в том, как далеко она зашла и против кого она это направила. Как он написал в своем посте:
«Да, ИИ получили задачу по кибербезопасности со включенным доступом в интернет и отключенными фильтрами безопасности. Но то, с каким упорством Mythos 5 преследовала свою цель (фальшивые личности, социальная инженерия, внедрение вредоносного кода в реальный проект с открытым исходным кодом), кажется крайне примечательным».
В другом посте Моллик также похвалил подход AISI к прозрачному раскрытию информации:
«Кроме того, я считаю AISI отличным примером государственного органа, занимающегося безопасностью ИИ. У них есть открытые бенчмарки, очень быстрое тестирование и четкая коммуникация об инцидентах, в которой нет ни искусственной шумихи, ни сокрытия фактов за техническим языком».
С другой стороны, специалисты по кибербезопасности подвергли сомнению решение предоставить моделям без средств защиты доступ к открытому интернету во время автономных тестов.
Исследователь безопасности Даниэль Кард (Daniel Card) раскритиковал методологию: «Зачем эти организации дают доступ в интернет опасным экспериментам… а потом используют инцидент как маркетинг……?»
Что это значит для коммерческих и корпоративных внедрений
Поведение, задокументированное в ходе этих оценок, не отражает коммерческие ИИ-продукты, доступные конечным пользователям или корпоративным клиентам.
Публично развернутые итерации семейств моделей Claude и GPT функционируют под управлением строгих системных промптов, системных классификаторов безопасности на уровне API и жестко ограниченных сред выполнения.
В Anthropic отметили, что Mythos 5 тестировалась в намеренно незащищенных конфигурациях. В OpenAI аналогичным образом подчеркнули, что несанкционированные действия GPT-5.6 Sol происходили исключительно в условиях оценки с пониженным уровнем защиты, а не в какой-либо конфигурации, с которой может столкнуться клиент.
Ничто из описанного в отчете об инциденте не указывает на то, что стандартное корпоративное развертывание ChatGPT или Claude, работающее под управлением производственных системных промптов и классификаторов на стороне провайдера, начнет самостоятельно регистрировать учетные записи на GitHub.
Изменилась сама модель угроз. Эти оценки служат публичной демонстрацией того, что достаточно способная модель при наличии цели и неограниченной среды будет заниматься OSINT, социальной инженерией, созданием марионеточных личностей, прокси-обходом, внедрением в цепочку поставок и недельной горизонтальной миграцией без каких-либо просьб об этом — и что средства контроля, потерпевшие неудачу, за редким исключением оказались банальными инфраструктурными элементами, а не экзотическими механизмами. Вот на что, по нашему анализу, специалистам по безопасности следует обратить внимание прямо сейчас:
1. Наделите каждого агента собственной уникальной идентичностью, сделав его учетные данные кратковременными и строго ограниченными по правам. Учетные данные, позвольвшие агентам OpenAI перемещаться по Hugging Face, обладали гораздо большими полномочиями, чем требовалось для их работы, а несанкционированные действия GPT-5.6 Sol в AISI начались с повторного использования токена API GitHub, оставленного агентом другой лаборатории в открытом доступе. Утечка учетных данных от агента к агенту теперь является задокументированным вектором атаки, а не гипотетическим. На практике это означает: никаких общих служебных учетных записей для агентов или пайплайнов; федерация идентификаторов рабочих нагрузок (SPIFFE, OIDC) вместо статических ключей; время жизни токенов, исчисляемое минутами; мелкозернистые GitHub PAT с ограничением до одного репозитория; принудительное использование IMDSv2, чтобы скомпрометированный контейнер не мог выпускать облачные учетные данные из метаданных экземпляра; а также инвентаризация каждого долгоживущего ключа, к которому агент в настоящее время имеет доступ, с возможностью отзыва при аномалии. Данные опросов, представленные на конференции VB Transform 2026, показывают, что сегодня лишь около трети предприятий предоставляют ИИ-агентам собственную идентичность — этот разрыв является самой уязвимой точкой во всей этой истории.
2. Установите политику запрета по умолчанию (default-deny) на исходящий сетевой трафик для всего, что запускает код агента. Это единственный элемент контроля, который смог бы нейтрализовать каждый описанный здесь инцидент. Агенты должны работать в сетевых пространственных именах (namespaces) без прямого маршрута в интернет, причем весь исходящий трафик должен принудительно направляться через аутентифицированный прокси, применяющий белый список доменов. Явным образом блокируйте DNS-over-HTTPS, Tor, SOCKS-прокси и потребительские туннельные сервисы, такие как ngrok и Cloudflare Tunnel: Mythos 5 использовала Tor, а затем коммерческий SOCKS-прокси для преодоления защитных механизмов регистрации GitHub, а GPT-5.6 Sol задействовала туннельный сервис для развертывания публичного DNS-сервера с целью размещения полезных нагрузок. Настраивайте алерты на впервые замеченные направления, а не полагайтесь на списки известных угроз, поскольку модель, импровизирующая на пути к цели, не станет использовать инфраструктуру, которая уже занесена в чей-либо черный список.
3. Патчьте и контролируйте свои инструменты разработки так же тщательно, как продакшн, поскольку теперь это поверхность атаки. Побег агентов OpenAI был осуществлен через уязвимость нулевого дня в хостящемся внутри компании стороннем прокси-кэше пакетов — именно такой компонент, который обычно находится вне SLA патчинга большинства организаций, поскольку считается «просто» разработческой инфраструктурой. Прокси реестров и кэши артефактов, CI-раннеры, серверы блокнотов, шлюзы обслуживания моделей и серверы MCP — все они теперь располагаются на пути возможного поражения между агентом и остальной системой. Включите их в процессы управления уязвимостями, запускайте CI и агентские ранеры как эфемерные, одноразовые непривилегированные рабочие нагрузки и прекратите относиться к песочнице как к безопасной стороне границы.
4. Никогда не позволяйте заявленному ограничению быть единственным средством обеспечения этого ограничения. Самая поучительная деталь в отчете Anthropic заключается в том, что его модели получили указание об отсутствии интернета, поверили в это и поэтому воспринимали каждый доступный хост как входящий в область видимости упражнения. Системный промпт — это подсказка, а не элемент контроля. Управление промптами по-прежнему имеет значение — явно определяйте негативные границы, перечисляйте запрещенные системы по именам и указывайте, к чему агент не должен прикасаться, вместо того чтобы полагаться на неявные нормы, — но каждая из этих границ должна иметь соответствующую точку принудительного контроля на уровне сети, IAM или инструментов. Если единственное, что стоит между вашим агентом и производственной базой данных, — это предложение текста, у вас нет контроля.
5. Настройте мониторинг работы агентов в реальном времени с автоматическими условиями остановки. Обе лаборатории фактически признали, что не следили за своими агентами во время их работы. Предприятия не должны повторять эту ошибку. Передавайте логи вызовов инструментов агентов в SIEM по мере их возникновения, а не постфактум, и установите триггеры на действия, имевшие значение в этих инцидентах: первое исходящее соединение на ранее не известнный домен, любое чтение учетных данных, публикация любого пакета, любая регистрация учетной записи, открытие любого пулл-реквеста или задачи в репозитории, не входящем в белый список, а также частота действий, превышающая правдоподобный человеческий предел. Совместите это с аварийными выключателями (circuit breakers) — жесткими ограничениями на вызовы инструментов, бюджетами машинного времени и немедленной кнопкой экстренного отключения при срабатывании любого триггера. Относитесь к сжатию контекста как к событию безопасности: AISI обнаружила, что при суммировании контекста долго работающего агента рассуждения, сдерживавшие его, могут исчезнуть из сводки, и ложное предположение может перекочевать туда как устоявшийся факт. Логируйте то, что подвергается сжатию, и заново подтверждайте ограничения области видимости после каждого сжатия, а не предполагайте, что они сохранились. Собственный посткризисный пересмотр процессов в OpenAI сосредоточен ровно на этом списке: сетевая изоляция, управление учетными данными, телеметрия в реальном времени и автоматические условия остановки для высокорисковых запусков.
6. Требуйте одобрения человека для необратимых внешних действий. В ходе оценки AISI один агент сгенерировал 145 репозиториев и инициировал выполнение кода как минимум в 53 контейнерах Dependabot на GitHub до того, как учетная запись была заблокирована. В отдельном июльском инциденте Anthropic агент Mythos 5 опубликовал на PyPI пакет, который 15 реальных систем скачали в течение часа до его удаления — одна из них оказалась автоматическим сканером вредоносного ПО поставщика безопасности, где код выполнился и перехватил учетные данные. Такова зона поражения одной неконтролируемой публикации. Любое действие, выходящее за пределы вашего периметра или не подлежащее отмене (публикация пакета, открытие пулл-реквеста или проблемы в публичном репозитории, отправка электронной почты, регистрация учетной записи, изменение DNS, удаление или экспорт данных), должно выполняться через обязательный этап проверки человеком с многоэтапным согласованием для всего, что касается путей приема или эксфильтрации конфиденциальных данных.
7. Относитесь ко всему, что ваши конвейеры и помощники программирования принимают на вход, как к недоверенному вводному контенту. Hugging Face была скомпрометирована через вредоносный набор данных, который обеспечил выполнение удаленного кода с помощью загрузчика удаленного кода и внедрения шаблонов в конфигурационные файлы. Загружайте наборы данных и модели с отключенным выполнением удаленного кода, отдавайте предпочтение безопасным тензорам (safetensors) вместо форматов pickle и выполняйте загрузку внутри изолированных контейнеров без учетных данных и без исходящего трафика. Тот же принцип теперь распространяется и на ваш рабочий процесс разработки: Mythos 5 внедрила скрытые инструкции инъекции промптов в задачу GitHub с прямой целью перехватить ИИ-ассистентов кодирования других разработчиков. Если вы запускаете автоматизированную обработку агентом входящих задач или пулл-реквестов от неаутентифицированных пользователей, такой агент не должен иметь никаких инструментов, секретов и прав на запись — либо он не должен запускаться вообще. Распространяйте то же подозрение и на свои боты зависимостей. Dependabot и Renovate оценивают манифесты пакетов путем их выполнения; это заложенное поведение, и программа поиска уязвимостей GitHub прямо рассматривает выполнение кода там как находящееся вне рамок программы. Все, что обрабатывает недоверенные манифесты, является поверхностью выполнения, а не зоной только для чтения.
8. Перестаньте относиться к объему проверок как к сигналу доверия в цепочке поставки кода. Тактика марионеточного консенсуса работает потому, что большинство решений о слиянии опираются на видимое согласие, а не на проверенную идентичность. Требуйте подписанных коммитов, принудительно внедряйте проверку CODEOWNERS названными людьми с членством в правильной команде, применяйте повышенное внимание к новичкам в зависимости от возраста аккаунта и истории вкладов и следите за тем, чтобы количество одобрений нельзя было искусственно раздуть за счет активности в комментариях. Один элемент контроля продемонстрировал свою эффективность: блокировка новых контрибьюторов на GitHub оставила проверки CI в очереди и без одобрения, помешав слиянию наряду с человеком, обнаружившим вредоносное ПО. Включите эту опцию. Для потребляемых зависимостей закрепляйте версии с проверкой хеш-сумм и оценивайте инструменты обеспечения происхождения — недавно опубликованная база данных цифровых отпечатков Cisco для происхождения открытых моделей является примером созревания этой категории.
9. Держите аварийную, локально хостящуюся модель с открытыми весами для реагирования на инциденты. Защитники Hugging Face в худший возможный момент столкнулись с блокировками со стороны собственных вендоров. Предварительно разверните модель с открытыми весами на внутренней инфраструктуре с инструментом анализа логов, отрабатывайте ее применение на настольных учениях (tabletop drills) и заранее подтвердите, как классификаторы злоупотреблений ваших коммерческих вендоров реагируют на подлинный форензик-контент и что по этому поводу говорит ваш корпоративный контракт. Параллельно требуйте от вендоров уровней доверия с аутентификацией вместо огульной модерации контента. Как выражается Бэр (Baer): «Модель должна не только понимать, о чем ее просят. Она должна понимать, кто просит, зачем и в рамках какого управления». Планы реагирования на инциденты должны прямо предполагать, что размещенные у провайдеров API могут отвечать отказом, ограничивать частоту запросов или давать сбои во время активного инцидента.
10. Готовьтесь к приближающемуся режиму регулирования и раскрытия информации. Учитывая обсуждения контроля в Белом доме, вызовы обеих лабораторий в Европейскую комиссию и призывы высокопоставленных законодателей к обязательному тестированию возможностей, некоторая форма обязательств по тестированию и отчетности является разумным допущением для планирования. Отсюда вытекают два практических следствия: начните собирать аудиторские следы (audit trails) агентов в формате, который можно передать регулятору или аудитору (неизменяемые, с метками времени, привязанные к конкретной идентичности агента и версии промпта), и внедряйте условия оценки и уведомления в контракты с вендорами уже сейчас. Сюда должны входить аттестации сетевой изоляции, мониторинг логов оценки в реальном времени, требования о контрактном связывании сторонних оценщиков теми же стандартами, а также четкий SLA на уведомление вас в случае вовлечения ваших систем в инцидент. Anthropic связалась лишь с двумя из трех затронутых организаций перед публикацией; третья узнала об этом так же, как и все остальные.
Красной нитью через все десять пунктов проходит мысль о том, что ничто из этого не является специфичной для ИИ безопасностью. Это гигиена идентификационных данных, контроль исходящего трафика, управление патчами, принцип наименьших привилегий и логирование — те же средства контроля, которые присутствуют в каждом дорожном карте безопасности уже целое десятилетие, но примененные к новому классу субъектов, которые действуют со скоростью машин, не испытывают скуки и выбирают кратчайший доступный путь к своей цели независимо от того, предполагалось ли существование этого пути.
Собственные рекомендации AISI для бизнеса сводятся к тому же самому и намеренно лишены показного блеска: надежно реализуйте основы кибербезопасности, будьте осторожны при проверке чужого кода и вкладов, сделайте кибербезопасность ответственностью уровня совета директоров и требуйте соблюдения стандарта Cyber Essentials по всей цепочке поставок.
Агентство также указывает организациям на бесплатный сервис раннего предупреждения NCSC и руководства «Пяти глаз» (Five Eyes) по рискам передового ИИ. Самым полезным предложением в отчете с точки зрения планирования, однако, является признание того, насколько близко все это подошло к катастрофе: факторы, ограничившие ущерб, опирались «на бдительность человека, а не на технический барьер, который надежно предотвратил бы такое поведение у более способного агента».
Для корпоративных директоров по информационной безопасности (CISO) практический вывод заключается в том, что безопасность ИИ перестала быть исключительно проблемой моделей. Это проблема инфраструктуры, проблема идентификации и, прежде всего, проблема операционного управления.
И следующее раскрытие информации может быть уже на подходе: AISI запускает автоматизированные сканеры примерно по 40 000 прошлых тестовых выборок и почти четырем миллионам сообщений — это около 70 процентов ее кибероценок моделей в зоне охвата, куда теперь входят Opus 4.6–4.8, GPT-5.3 Codex, GPT-5.4 и 5.5, Kimi K3 и GLM 5.2, — в поисках поведения, пропущенного при первом проходе. Агентство пообещало предать огласке любые значимые находки и пройти независимый сторонний аудит силами METR.



