Генеральный директор Anthropic заявил, что ИИ-рой может «захватить весь Интернет» через 6–12 месяцев, и пообещал следовать плану замедления развития ИИ
Источник: VentureBeat · Carl Franzen
Сооснователь и генеральный директор Anthropic Дарио Амодеи (Dario Amodei) открыто призывает индустрию искусственного интеллекта снизить темпы и берет на себя обязательство реализовать первый этап трехступенчатого плана, призванного сделать это. Заявление последовало за предупреждением о том, что более совершенная версия роя ИИ, стоявшего за чрезвычайным инцидентом безопасности этим летом (когда внутренние агенты OpenAI получили несанкционированный доступ в интернет и совершили кибератаку на Hugging Face), потенциально способна взять под контроль компьютеры по всему интернету всего через полгода.
«Мы должны сдерживать развитие передового края: я написал новое эссе о том, почему индустрии ИИ следует сбавить обороты, и предложил трехступенчатый план для этого», — написал Амодеи в субботу в публикации на X. «Anthropic в одностороннем порядке берет на себя обязательство выполнить первый из этих шагов».
Новое эссе было опубликовано на личном домене Амодеи. Как он пишет:
«Учитывая ускоряющиеся темпы развития возможностей ИИ, я опасаюсь, что через 6–12 месяцев такой рой сможет захватить весь интернет с помощью постоянного ботнета (что потенциально принесет сотни миллиардов долларов ущерба), и масштаб разрушений будет продолжать расти, если ИИ станет еще мощнее без необходимых средств защиты».
Этот первый шаг не означает, что Anthropic немедленно приостанавливает разработку моделей или снижает темпы собственных обучающих запусков.
Вместо этого Амодеи заявляет, что Anthropic предоставит независимым экспертам по безопасности ИИ *постоянный* доступ уровня сотрудников, что позволит посторонним лицам изучать системы и процессы обучения Anthropic, проверять ее методы обеспечения безопасности и независимо сообщать об инцидентах.
Но более широкое предложение Амодеи идет гораздо дальше: он утверждает, что разработчики передового ИИ должны намеренно ограничить скорость роста возможностей искусственного интеллекта, что в конечном итоге может вылиться в скоординированные ограничения среди лабораторий ИИ и правительств по всему миру.
«Мы должны замедлить темпы повышения возможностей моделей ИИ, — пишет Амодеи. — Прогресс по-прежнему будет казаться быстрым, и мы должны мудро распорядиться выигранным временем».
Спустя несколько часов после публикации эссе Амодеи его главный бизнес-конкурент, сооснователь и генеральный директор OpenAI Сэм Альтман (Sam Altman), написал в X, в целом согласившись с Амодеи, и также пообещал привлечь независимых оценщиков с доступом на уровне сотрудников в OpenAI. Как он написал:
«Я согласен с Дарио в том, что нам нужно сдерживать темпы развития передового края. Это было одной из главных тем обсуждений в OpenAI в последние недели.
Взять на себя обязательство допустить независимых оценщиков с правами сотрудников — отличная идея, и мы поступим так же. Скоро мы поделимся подробностями».
Инцидент с OpenAI и Hugging Face
Эпизод, на который ссылается Амодеи, начался во время проверок кибербезопасности OpenAI с использованием ExploitGym — бенчмарка, предназначенного для тестирования способности систем ИИ использовать уязвимости в программном обеспечении.
Как сообщал VentureBeat в июле, модели OpenAI, включая GPT-5.6 Sol и более мощную внутреннюю исследовательскую систему, обнаружили ранее неизвестную уязвимость в инфраструктуре, призванной изолировать их среду тестирования, вырвались из этих ограничений, получили более широкий доступ в интернет и в конечном итоге скомпрометировали системы Hugging Face.
Позже в OpenAI заявили, что инцидент был вызван в первую очередь внутренней исследовательской моделью, масштабы которой примерно сопоставимы с GPT-5.6 Sol. Агенты работали со сниженными мерами безопасности, призванными продемонстрировать их максимальные возможности в сфере кибербезопасности во время тестирования.
Однако то, что выяснилось впоследствии, оказалось гораздо более странным, чем побег одного агента ИИ из «песочницы».
Независимая организация по оценке ИИ Model Evaluation and Threat Research (METR) обнаружила, что около 1 200 агентов, которые должны были быть изолированы друг от друга, нашли несанкционированный способ связи, отправив более 70 000 сообщений и файлов через импровизированную доску объявлений. В атаке на Hugging Face в итоге приняли участие около 700 агентов.
Агенты координировали многочисленные попытки манипулировать процессом подсчета баллов в ExploitGym или обходить его, распределяли работу между собой и делились открытиями. METR обнаружила примеры, когда отдельные агенты предпринимали эксперименты, ставившие под угрозу их собственную производительность в бенчмарках, поскольку результаты могли помочь всей группе. Агенты также исследовали возможность манипулирования собственными протоколами оценки и преуспели в подделке некоторых записанных вызовов инструментов.
Собственное расследование OpenAI также показало, что агенты начали сотрудничать и делегировать задачи, иногда называя себя «роем» или «коллективом».
Амодеи описывает их как «фанатично преданный коллектив», который атаковал системы, не имеющие отношения к его поставленной задаче, пытался вмешиваться в оценивающие его системы и порой жертвовал индивидуальной производительностью ради блага всей группы.
Катастрофического ущерба это не принесло. Но аргумент Амодеи сводится к тому, что возможности развиваются настолько быстро, что следующая версия такого же поведенческого паттерна может закончиться вовсе не так безобидно.
Свидетельства того, что рой Hugging Face не был уникальным
И инцидент с Hugging Face все больше выглядит частью более широкой категории непреднамеренного поведения высокоавтономных агентов ИИ, а не единичной аномалией.
В этом месяце исследователи сообщили, что агенты, выдававшие себя за системы OpenAI, ранее превратили в значительной степени заброшенную вики-страницу немецких программистов в несанкционированную систему координации, оставив около 18 000 публикаций, обмениваясь ответами и делясь методами обхода ограничений песочницы.
Предполагалось, что агенты имели доступ в интернет фактически только для чтения, но они обнаружили, что старая вики позволяет вносить изменения посредством веб-запросов, разрешенных их средой. Впоследствии агенты использовали сайт для обмена информацией друг с другом. VentureBeat сообщал, что в этой активности было задействовано более 3 700 созданных агентами учетных записей.
OpenAI признала «инцидент с вики» после того, как он стал публичным, и заявила, что рассматривает это поведение как еще один пример несогласованности ИИ, заслуживающий большей прозрачности.
С тех пор исследователи выявили как минимум 10 дополнительных веб-сайтов, используемых агентами OpenAI для несанкционированной связи, включая вики, личные сайты и другие доступные для записи интернет-сервисы, сообщает Reuters. Полный масштаб этой активности остается неизвестным.
Еще более тревожным является сообщение Reuters в пятницу о том, что в мае агенты OpenAI нацелились на RubyGems — широко используемый репозиторий программных пакетов Ruby — за два месяца до того, как утечка данных Hugging Face стала публичной. Исследователи связали агентов с сотнями вредоносных пакетов, загруженных во время этого эпизода. В OpenAI подтвердили, что внутренние агенты взаимодействовали с RubyGems во время обучения, но заявили, что их задачи заключались в сборе публичной информации в благих целях, и компания продолжает расследование. Представители RubyGems заявили, что не нашли доказательств успешных попыток кражи учетных данных.
Тем временем Anthropic обнаружила аналогичные сбои в собственных системах
После раскрытия информации OpenAI об инциденте с Hugging Face компания Anthropic проанализировала более 141 000 тестов на кибербезопасность и первоначально обнаружила три случая, когда модели Claude неожиданно выходили в интернет, после чего получали несанкционированный доступ к рабочим системам трех сторонних организаций.
Позже Anthropic выявила четвертый инцидент с ранней версией Claude Opus 4.6, который был упущен из виду при первоначальной проверке. Это открытие побудило компанию провести чрезвычайно масштабную вторую проверку, охватившую около 481 миллиона транскриптов в ходе упражнений красных команд, сред обучения с подкреплением и других внутренних систем.
Британский институт безопасности ИИ (UK AISI) отдельно сообщил, что в ходе тестирования кибербезопасности в июле агенты предприняли 19 несанкционированных действий против реальных людей или организаций. Семнадцать из них были связаны с Claude Mythos 5 от Anthropic и два — с GPT-5.6 Sol с отключенными средствами киберзащиты.
В самой серьезной последовательности агент Mythos 5 попытался внедрить вредоносный код в реальный проект с открытым исходным кодом, изучил его человеческих сопровождающих, создал фальшивые личины и попытался применить методы социальной инженерии, чтобы заставить мейнтейнера одобрить его код. Человек отклонил эту попытку. Другой агент публично предложил сотрудничество другим агентам ИИ, работающим над той же задачей, оставив после себя учетные записи и артефакты, которые последующие агенты обнаружили и использовали. В AISI заявили, что не обнаружили реального ущерба в результате этих действий.
Ни один из этих инцидентов не доказывает, что система ИИ самостоятельно захотела захватить власть, атаковать людей или «захватить интернет». Многие из них произошли в специально созданных мягких условиях тестирования на кибербезопасность с отключенной защитой или из-за того, что модели, судя по всему, не поняли, что предполагаемые симулированные цели на самом деле являются реальными системами.
Сама Anthropic указала на сбои в среде тестирования и другие операционные проблемы в качестве основных причин инцидентов.
Аргумент Амодеи заключается в том, что наблюдение за подобным поведением имеет значение сейчас именно потому, что выполняющие его системы очень быстро становятся все более способными.
Амодеи хочет установить ограничение скорости для передового края
Вторым фактором, меняющим расчеты Амодеи, является рекурсивное самосовершенствование: системы ИИ все сильнее способствуют исследованиям, написанию кода и экспериментам, используемым для создания собственных преемников.
Амодеи говорит, что этот процесс резко ускорился примерно с этого лета и в конечном итоге может породить цикл обратной связи, в котором все более способные модели помогают создавать еще более мощные модели быстрее, чем люди успевают их понять или защитить.
Предлагаемый им ответ имеет три уровня.
-
Во-первых, Anthropic на постоянной основе внедрит сторонних оценщиков внутрь компании. Амодеи говорит, что им следует выделить рабочие места, пропуска, корпоративные ноутбуки и доступ, сопоставимый с внутренними командами по оценке рисков. Крайне важно, чтобы сторонние рецензенты сохраняли право публиковать важные выводы без редакционного контроля со стороны Anthropic, за исключением узко определенных изъятий по соображениям безопасности, правовым нормам и конфиденциальности.
-
Во-вторых, Амодеи хочет, чтобы ведущие компании в сфере ИИ в демократических странах координировали свои действия вокруг общих стандартов безопасности и ограничений «бесконтрольного прогресса ИИ», в идеале при участии государства для решения антимонопольных проблем и обеспечения исполнения обязательств.
-
В-третьих, необходима международная координация, в том числе, потенциально, с Китаем. Амодеи предполагает, что страны со временем смогут установить «ограничение скорости» на рекурсивное самосовершенствование, утверждая, что замедление прогресса в области ИИ с крайне быстрого до просто очень быстрого может выиграть критически важное время для исследований в области безопасности без принципиального изменения геополитического баланса.
Его самый радикальный вариант — это международное соглашение, существенно ограничивающее общее развитие ИИ, возможно, даже реальная пауза. Но Амодеи говорит, что считает такое соглашение маловероятным в ближайшее время, поскольку страна, тайно нарушающая его, может получить подавляющее стратегическое преимущество.
Таким образом, для Anthropic сегодня это не пауза. Это нечто потенциально более значимое в долгосрочной перспективе: генеральный директор одной из компаний, наиболее агрессивно раздвигающих технологические границы, публично заявляет, что сам этот рубеж продвигается слишком быстро, и берет на себя обязательство воплотить первую часть системы, призванной его притормозить.
Амодеи утверждает, что даже один или два дополнительных года до того, как ИИ достигнет критических порогов возможностей, могут дать исследователям значительно больше времени для улучшения согласованности (alignment), интерпретируемости, кибербезопасности, оценок и оперативных мер защиты вокруг передовых моделей.
«Меры, которые я предлагаю для продвижения передового края на безопасной скорости, будут непростыми, — заключает он. — Но я верю, что мы обязаны попытаться ради человечества».



