Стоимость проверки кода ИИ от Anthropic составляет 20 долларов
Компания Anthropic в понедельник представила Code Review — многоагентную систему анализа кода, встроенную в Claude Code, которая задействует команды ИИ-агентов для тщательной проверки каждого пулл-реквеста (pull request) на наличие багов, которые рецензенты-люди регулярно упускают из виду. Эта функция, доступная сейчас в рамках исследовательского превью для клиентов тарифных планов Team и Enterprise, появляется в, пожалуй, самый судьбоносный день в истории компании: Anthropic одновременно подала иски против администрации Трампа из-за внесения компании в черный список Пентагона, в то время как Microsoft объявила о новом партнерстве, интегрирующем Claude в свою платформу Microsoft 365 Copilot.
Совмещение крупного запуска продукта, федеральной судебной тяжбы и знаковой дистрибьюторской сделки с крупнейшей в мире софтверной компанией отражает колоссальное напряжение, определяющее нынешнее положение Anthropic. Базирующаяся в Сан-Франциско ИИ-лаборатория одновременно пытается развивать бизнес инструментов для разработчиков, который приближается к годовой выручке в 2,5 миллиарда долларов, защищаться от беспрецедентного правительственного решения о признании ее угрозой национальной безопасности, а также расширять свое коммерческое присутствие через те самые облачные платформы, которые сейчас справляются с последствиями ситуации.
Code Review — это самая амбициозная ставка Anthropic на то, что инженерные организации будут готовы платить значительно больше — от 15 до 25 долларов за один обзор — за обеспечение качества кода с помощью ИИ, в котором тщательность ставится выше скорости. Это также сигнализирует о более широком стратегическом развороте: компания не просто создает модели, она выстраивает вокруг них бескомпромиссные рабочие процессы для разработчиков.
Как команда ИИ-агентов проверяет ваши пулл-реквесты
Code Review работает иначе, чем легковесные инструменты проверки кода, к которым привыкли большинство разработчиков. Когда разработчик открывает пулл-реквест, система задействует множество ИИ-агентов, работающих параллельно. Эти агенты независимо друг от друга ищут баги, затем перепроверяют выводы друг друга для фильтрации ложных срабатываний и, наконец, ранжируют оставшиеся проблемы по степени критичности. Результат отображается в виде единого общего комментария к PR наряду с инлайн-аннотациями для конкретных ошибок.
Anthropic спроектировала систему так, чтобы она динамически масштабировалась в зависимости от сложности изменений. Крупные или запутанные пулл-реквесты получают больше агентов и более глубокий анализ; незначительные изменения проходят более поверхностную проверку. По заявлению компании, среднее время проверки составляет около 20 минут — это намного медленнее, чем практически мгновенная обратная связь от таких инструментов, как встроенная проверка кода в GitHub Copilot, но сделано это намеренно.
«Мы создали Code Review на основе отзывов клиентов и внутренних данных», — сообщил представитель Anthropic изданию VentureBeat. — В ходе тестирования мы выяснили, что система предоставляет ценные отзывы и помогает находить баги, которые мы в противном случае могли бы пропустить. Разработчики и инженерные группы используют самые разные инструменты, и мы учитываем эту реальность. Цель состоит в том, чтобы предоставить командам эффективный вариант на каждом этапе процесса разработки».
Система выросла из собственной инженерной практики Anthropic, где, по заявлению компании, объем вывода кода на одного инженера вырос на 200% за последний год. Такой всплеск генерации кода с помощью ИИ породил узкое место на этапе проверки, о котором, по словам компании, теперь еженедельно сообщают клиенты. До появления Code Review лишь 16% внутренних PR в Anthropic получали содержательные комментарии с рецензиями. Этот показатель подскочил до 54%.
Что особенно важно, Code Review не одобряет пулл-реквесты. Это решение остается за рецензентами-люди. Вместо этого система функционирует как усилитель возможностей, выявляя проблемы, чтобы рецензенты-люди могли сосредоточиться на архитектурных решениях и более масштабных задачах, а не на поиске багов строка за строкой.
Почему в Anthropic считают 20 долларов за ревью выгодной сделкой
Ценообразование вызовет немедленные вопросы. При стоимости от 15 до 25 долларов за ревью, которая рассчитывается на основе использования токенов и масштабируется в зависимости от размера PR, Code Review существенно дороже альтернатив. GitHub Copilot предлагает проверку кода изначально в рамках существующей подписки, а стартапы вроде CodeRabbit работают по значительно более низким ценам. Собственное более базовое средство проверки кода от Anthropic в виде GitHub Action (которое остается открытым исходным кодом) само по себе является более легким и дешевым вариантом.
Anthropic представляет эти затраты не как расход на производительность, а как страховой продукт. «Для команд, выпускающих софт в продакшн, стоимость пропущенного бага несопоставима с 20 долларами за ревью», — заявил представитель компании изданию VentureBeat. — Один инцидент в продакшене — откат системы, хотфикс, экстренный вызов дежурного инженера — может обойтись по часам работы инженеров дороже, чем месяц использования Code Review. Code Review — это страховой продукт для обеспечения качества кода, а не инструмент производительности для более быстрого штамповки PR».
Такая подача является осознанной и показательной. Вместо того чтобы конкурировать по скорости или цене — параметрам, в которых у легких инструментов есть преимущество, — Anthropic позиционирует Code Review как инструмент глубокого анализа, ориентированный на технических лидеров, управляющих рисками в продакшене. Негласный аргумент заключается в том, что реальное сравнение затрат идет не между Code Review и CodeRabbit, а между Code Review и полной стоимостью сбоя в продакшене, включая рабочее время инженеров, ущерб для клиентов и репутационный урон.
Оправдается ли этот аргумент, будет зависеть от данных. Anthropic пока не опубликовала внешние бенчмарки, сравнивающие показатели обнаружения багов в Code Review с конкурентами, а представитель компании не предоставил конкретных цифр по количеству обнаруженных багов на один доллар или сэкономленным часам работы разработчиков при прямом вопросе. Для технических лидеров, оценивающих инструмент, этот пробел в общедоступных сравнительных данных может замедлить внедрение, даже если теоретический довод об окупаемости выглядит убедительно.
Что показывают внутренние цифры — и чего они не раскрывают
Данные внутреннего использования Anthropic дают первое представление о характеристиках производительности системы. На крупных пулл-реквестах с более чем 1 000 измененных строк замечания выдаются в 84% случаев, в среднем получается 7,5 проблем на одно ревью. На небольших PR объемом менее 50 строк этот показатель падает до 31% при среднем значении 0,5 проблемы. Компания сообщает, что менее 1% результатов проверок помечаются инженерами как неверные.
Этот показатель менее 1% относится к числу тех метрик, которые требуют тщательной интерпретации. На вопрос о том, как именно определяется статус «помечено как неверное», представитель Anthropic пояснил, что это означает «ситуацию, когда инженер активно закрывает комментарий без исправления кода. Мы продолжим следить за отзывами и вовлеченностью пользователей, пока Code Review находится в режиме исследовательского превью».
Методология имеет значение. Это метрика несогласия на основе добровольного выбора — инженер должен совершить осознанное действие по отклонению найденной проблемы. На практике разработчики, находящиеся под давлением дедлайнов, могут просто игнорировать нерелевантные замечания, а не отмечать их явно как ошибочные, из-за чего ложные срабатывания остаются неучтенными. В Anthropic неявно признали это ограничение, отметив, что система находится в стадии исследовательского превью и компания продолжит отслеживать данные об активности. Компания пока не проводила и не публиковала контролируемую оценку, сравнивающую результаты работы агентов с эталонными данными, созданными экспертами-людьми.
Тем не менее, анекдотические свидетельства поразительны. В Anthropic описали случай, когда однострочное изменение в продакшн-сервисе — тип диффа, который обычно получает беглый одобрительный отзыв, — было отмечено Code Review как критическое, поскольку оно сломало бы аутентификацию для этого сервиса. В другом примере с программным обеспечением с открытым исходным кодом TrueNAS система Code Review в ходе рефакторинга шифрования ZFS обнаружила предварительно существовавший баг в соседнем коде: несоответствие типов, которое молча уничтожало кэш ключей шифрования при каждой синхронизации. Это именно те категории багов — скрытые проблемы в затронутом, но не измененном коде и тонкие поведенческие изменения, прячущиеся в небольших диффах, — которые рецензенты-люди статистически пропускают чаще всего.
Иск против Пентагона бросает тень на корпоративный ИИ
Запуск Code Review происходит не в вакууме. В тот же день Anthropic подала два иска — один в Окружной суд США Северного округа Калифорнии, а второй в Апелляционный суд округа Колумбия, — оспаривая решение администрации Трампа внести компанию в список рисков цепочки поставок для национальной безопасности (обозначение, исторически применявшееся к иностранным противникам).
Юридическое противостояние проистекает из провала контрактных переговоров между Anthropic и Пентагоном. Как сообщал CNN, Министерство обороны хотело получить неограниченный доступ к Claude для «<всех законных целей>», в то время как Anthropic настаивала на двух красных линиях: ее ИИ не должен использоваться для полностью автономных вооружений или массовой внутренней слежки. Когда переговоры зашли в тупик к установленному Пентагоном дедлайну 27 февраля, президент Трамп приказал всем федеральным ведомствам прекратить использование технологий Anthropic, а министр обороны Пит Хегсет со своей стороны официально присвоил компании статус риска для цепочки поставок.
Согласно данным CNBC, в исковом заявлении утверждается, что эти действия являются «беспрецедентными и незаконными» и «наносят Anthropic непоправимый ущерб»: компания заявляет, что контракты уже отменяются, а «сотни миллионов долларов» краткосрочной выручки находятся под угрозой.
«Обращение за судебной защитой не меняет нашей давней приверженности использованию ИИ для защиты нашей национальной безопасности, — заявил представитель Anthropic изданию VentureBeat, — но это необходимый шаг для защиты нашего бизнеса, наших клиентов и наших партнеров. Мы продолжим идти по любому пути к урегулированию, включая диалог с правительством».
Для корпоративных покупателей, оценивающих Code Review и другие инструменты на базе Claude, судебный иск порождает новую категорию рисков, связанных с поставщиками. Статус риска цепочки поставок затрагивает не только правительственные контракты Anthropic — как сообщал CNBC, он требует от оборонных подрядчиков подтверждения того, что они не используют Claude в своей работе, связанной с Пентагоном. Это создает эффект заморозки, который может распространиться далеко за пределы оборонного сектора, даже несмотря на ускорение коммерческих успехов компании.
Microsoft, Google и Amazon обозначают границы коммерческой доступности Claude
Реакция рынка на кризис с Пентагоном оказалась весьма двойственной. В то время как правительство предприняло шаги по изоляции Anthropic, три крупнейших облачных партнера компании повели себя прямо противоположным образом.
В понедельник Microsoft объявила об интеграции Claude в Microsoft 365 Copilot в рамках нового продукта под названием Copilot Cowork, разработанного в тесном сотрудничестве с Anthropic. Как сообщал Yahoo Finance, этот сервис позволяет корпоративным пользователям выполнять такие задачи, как создание презентаций, выгрузка данных в таблицы Excel и координация встреч — те самые возможности агентской производительности, из-за которых акции SaaS-компаний вроде Salesforce, ServiceNow и Intuit пошли вниз, когда Anthropic впервые представила свой продукт Cowork 30 января.
Выбор времени не случаен. Как сообщал на прошлой неделе TechCrunch, компании Microsoft, Google и Amazon Web Services подтвердили, что Claude по-прежнему доступен их клиентам для задач, не связанных с обороной. Юридический отдел Microsoft отдельно пришел к выводу, что «продукты Anthropic, включая Claude, могут оставаться доступными для наших клиентов — за исключением Министерства войны — через такие платформы, как M365, GitHub и Microsoft’s AI Foundry».
Тот факт, что три мощнейшие технологические компании мира публично подтвердили свою приверженность распространению моделей Anthropic в день, когда сама компания подала иск против федерального правительства, говорит корпоративным клиентам о многом: как рынок оценивает как техническую ценность Claude, так и юридическую несостоятельность статуса угрозы цепочки поставок.
Безопасность данных и то, что нужно знать корпоративным покупателям дальше
Для организаций, рассматривающих возможность внедрения Code Review, вопрос обработки данных стоит особенно остро. Системе для выполнения анализа неизбежно требуется принимать проприетарный исходный код. Представитель Anthropic прямо ответил на это: «Anthropic не обучает модели на данных наших клиентов. Отчасти именно поэтому клиенты из жестко регулируемых отраслей, от Novo Nordisk до Intuit, доверяют нам безопасное и эффективное развертывание ИИ».
На вопрос о конкретных политиках хранения данных или сертификатах соответствия представитель компании вдаваться в подробности не стал, однако упоминание клиентов из фармацевтической и финансовой сфер намекает на то, что компания уже прошла проверки безопасности, которых требуют эти отрасли.
Администраторам доступно несколько элементов управления для контроля расходов и масштаба применения: ежемесячные лимиты расходов для всей организации, включение на уровне репозиториев и аналитическая панель для отслеживания проверенных PR, показателей принятия ревью и общих затрат. После включения проверки запускаются автоматически для новых пулл-реквестов без необходимости настройки со стороны разработчиков.
Подтвержденная Anthropic цифра выручки — годовой темп поступлений от Claude Code на уровне 2,5 млрд долларов по состоянию на 12 февраля — подчеркивает, сколь быстро инструменты для разработчиков стали существенной статьей доходов компании. Представитель компании сослался на недавний раунд финансирования Серии G для дополнительного контекста, но не стал уточнять, какую долю в общей выручке компании сейчас занимает Claude Code.
Проверка кода (Code Review) теперь доступна в рамках исследовательского превью для пользователей планов Claude Code Team и Enterprise. Сможет ли этот инструмент оправдать свою премиальную стоимость на рынке, и без того переполненном более дешевыми альтернативами, будет зависеть от того, удастся ли Anthropic превратить единичные случаи обнаружения багов и внутренние показатели использования в те строгие, внешне подтвержденные доказательства, которые необходимы техническим руководителям, распоряжающимся производственными бюджетами — и всё это в условиях правовой и политической среды, с которой индустрия ИИ еще никогда не сталкивалась.



