Google представляет Gemini 4 Argon и возвращает себе лидерство в бенчмарках, опережая OpenAI и Anthropic, — но пока с ограниченным доступом

Google представляет Gemini 4 Argon и возвращает себе лидерство в бенчмарках, опережая OpenAI и Anthropic, — но пока с ограниченным доступом

Сегодня Google объявила о выпуске Gemini 4 Argon — новой передовой модели ИИ, которая, по словам компании, опережает конкурирующие системы по нескольким важным для бизнеса бенчмаркам, включая долгосрочную разработку ПО, устранение уязвимостей в кибербезопасности, автоматизацию бизнес-процессов и интеллектуальную работу с экономическими данными.

Модель пока недоступна широкому кругу пользователей. Google сообщает, что начинает предоставлять доступ к Argon группе доверенных специалистов по киберзащите в рамках программы Fairwind, о которой компания объявила в начале этого месяца. Кроме того, до более широкого запуска модель участвует в добровольной программе правительства США по предоставлению доступа к моделям до их выпуска.

Как говорится в эмбарго́рованной публикации в блоге Google, с которой ознакомилось издание VentureBeat, более широкий доступ для разработчиков, компаний и обычных пользователей планируется открыть «как можно скорее» — сначала для платных клиентов API и подписчиков Google AI Ultra.

Для корпоративных заказчиков это объявление важно не столько как запуск чат-бота, сколько как сигнал о том, что Google пытается вернуть себе позиции в сфере передового ИИ после нескольких месяцев давления со стороны OpenAI и Anthropic.

Компания позиционирует Argon в трех областях, на которые предприятия уже тратят средства: разработка ПО, профессиональная интеллектуальная работа и кибербезопасность.

Результаты бенчмарков: Argon лидирует или делит первое место в большинстве категорий, но не во всех

Google Gemini 4 Argon benchmark comparison table

Сравнительная таблица результатов бенчмарков Google Gemini 4 Argon. Источник: Google

Google не утверждает, что Gemini 4 Argon выигрывает по всем бенчмаркам. Однако в таблице результатов, опубликованной в эмбарго́ванных материалах компании, Argon показывает наивысший результат или делит первое место в большем числе категорий, чем GPT-6 Astra или Claude Opus 5.5.

В 18 опубликованных Google бенчмарках Argon лидирует единолично в 12 случаях и делит первое место в одном. GPT-6 Astra лидирует единолично в трех случаях и делит первое место с Argon в одном. Claude Opus 5.5 лидирует единолично в двух. Таким образом, по общему числу побед или первых мест в сравнении Google Argon оказывается ведущей передовой моделью, хотя результаты показывают, что конкуренция по-прежнему высока, а OpenAI и Anthropic сохраняют преимущество в нескольких важных технических категориях.

Наибольший отрыв Argon демонстрирует в корпоративных сценариях и задачах с длинным контекстом. В Harvey’s Legal Agent Benchmark модель набирает 19,6% — значительно больше, чем GPT-6 Astra с 5,4% и Claude Opus 5.5 с 3,8%. Это одна из самых убедительных побед модели в отдельной категории. В AutomationBench — бенчмарке Zapier для сквозного выполнения бизнес-задач — Argon набирает 51,3% против 42,5% у Claude Opus 5.5 и 41,4% у GPT-6 Astra. В более продолжительном тесте GraphWalks, оценивающем обход графов в контекстах большего объема, результат Argon составляет 84,2% против 71,8% у GPT-6 Astra и 66,8% у Claude Opus 5.5.

Модель также заметно опережает конкурентов в финансах, программировании и мультимодальном понимании. В Vals Finance Agent v2 результат Argon составляет 65,4% — выше, чем 58,6% у Claude Opus 5.5 и 53,5% у GPT-6 Astra. В DeepSWE v1.1, который оценивает выполнение реальных долгосрочных задач по разработке ПО, Argon набирает 77,9% против 74,2% у Claude Opus 5.5 и 74,1% у GPT-6 Astra. В бенчмарке понимания длинных видео LVBench Argon показывает 91,7%, опережая GPT-6 Astra с 87,5% и Claude Opus 5.5 с 83,7%.

Эти победы подтверждают более широкое заявление Google о том, что Argon особенно силен в тех сценариях, которые предприятия, вероятно, будут оценивать в первую очередь: юридическом и финансовом анализе, программировании, автоматизации бизнеса, рассуждениях с длинным контекстом, мультимодальном понимании и киберзащите. Кроме того, Argon делит первое место с GPT-6 Astra в CWE-bench v1: обе модели набирают 68% в бенчмарке устранения уязвимостей, тогда как Claude Opus 5.5 получает 67%.

Однако таблица результатов также показывает, в каких областях конкуренция остается открытой. Наибольшее отставание Argon от GPT-6 Astra наблюдается в FrontierSWE v2 и Terminal-Bench Science 0.1. В обоих случаях преимущество Astra составляет 10,5 процентного пункта: 65,5% против 55,0% в FrontierSWE v2 и 68,1% против 57,6% в Terminal-Bench Science 0.1. Самое крупное преимущество Claude Opus 5.5 над Argon зафиксировано в Terminal-bench 4.0: Opus набирает 66,4% против 57,4% у Argon, то есть опережает его на 9 процентных пунктов. Opus также лидирует в PostTrainBench с результатом 49,3% против 45,3% у Argon.

Итоговый вывод сложнее, чем просто «лучшая модель по всем параметрам». Судя по опубликованному Google сравнению, Argon охватывает наибольшее число категорий с высшими результатами среди трех передовых моделей. При этом GPT-6 Astra сохраняет преимущество в нескольких задачах по разработке ПО, научным задачам в терминале и работе с компьютером, а Claude Opus 5.5 — в работе терминальных агентов и постобучении. Для корпоративных заказчиков это означает, что выбор модели по-прежнему зависит от конкретных задач, даже если теперь у Google есть наиболее весомый аргумент в пользу лидерства Argon по общему числу побед в бенчмарках.

Для разработчиков и ИТ-директоров практический вывод состоит в том, что Argon не обязательно побеждать по всем параметрам, чтобы изменить расстановку сил. Лидируя или деля первое место в 13 из 18 опубликованных категорий, модель дает Google наибольшее число высших результатов в этом сравнении. Но отставание в FrontierSWE v2, Terminal-Bench Science 0.1 и Terminal-bench 4.0 показывает, что у OpenAI и Anthropic по-прежнему есть отдельные области технического превосходства. Гонка передовых моделей остается напряженной, но теперь Google может заявить о лидерстве Argon по широте охвата.

Argon также повышает потолок объема генерируемых данных у Google. Компания заявляет, что модель поддерживает отраслевой максимум в 1 миллион выходных токенов — против прежнего ограничения в 64 000 токенов. Это важное отличие для агентной разработки ПО, аудита, миграции и юридической проверки: ценность модели в таких задачах часто зависит от того, как долго она может выполнять цепочку действий, прежде чем передать управление человеку.

Google уже активно использует Argon внутри компании

По словам компании, тысячи сотрудников Google уже применяют Argon для специализированных задач программирования, углубленных исследований и написания текстов.

Google приводит несколько внутренних примеров: Argon помог исследователям в области квантовых вычислений оптимизировать ресурсы пространства-времени для узких мест в подпрограммах и, как сообщается, за несколько минут превзошел опубликованный базовый результат на 40%; агенты Argon проанализировали телеметрию профилирования всего парка систем и выявили возможности оптимизации памяти, которые после внедрения, как ожидается, позволят высвободить более 300 TiB в центрах обработки данных Google; общий объем экономии оценивается в 500 TiB — 1 PiB. Кроме того, агенты Argon используются для переноса кодовых баз C/C++ на Rust, в том числе основных библиотек и ядра Zircon операционной системы Fuchsia.

Самый наглядный пример из инженерной практики — libgav1, видеодекодер Google с открытым исходным кодом.

Согласно публикации в блоге Google, агенты Argon взяли уже существующий порт на Rust и заменили 32 000 строк SIMD-кода: они проводили эксперименты с профилированием, анализировали вывод компилятора и создавали безопасный код на Rust, который компилятор мог автоматически векторизовать. По словам Google, получившийся безопасный для памяти декодер работает в 2,7 раза быстрее порта на Rust, сохраняя при этом идентичный вывод видео.

Второе ключевое направление — кибербезопасность. Google утверждает, что Argon способен автономно находить, проверять и устранять критические уязвимости в ПО. Для доверенных специалистов по киберзащите и собственных внутренних команд Google выпустит Argon без ограничений, связанных с кибербезопасностью, чтобы эти пользователи могли получить доступ ко всем возможностям модели по защите систем.

По словам компании, Wiz уже использует Argon в рамках инициативы Scan for Good, направленной на защиту критически важной общественной инфраструктуры. Модель выявила критическую уязвимость, из-за которой конфиденциальная личная информация могла стать доступна в медицинском ПО, используемом больницами по всему миру.

Google сопровождает запуск модели для киберзащиты сообщениями о безопасности. До широкого запуска компания планирует усилить защиту от злоупотреблений в сфере кибербезопасности и CBRN, атак с косвенной инъекцией промптов, рассогласования модели и небезопасной среды для агентов.

В представленном в публикации бенчмарке Gray Swan для атак с косвенной инъекцией промптов Gemini 4 Argon показывает долю успешных атак 0,7% против 1,0% у Claude Opus 5.5 и Claude Fable 5.1, 8,5% у GPT-6 Astra, 27,0% у GPT-6 Sol, 31,5% у GLM 5.3 и 51,8% у Grok 4.8.

Цена и доступность: привлекательные стартовые цены, но доступ ограничен

Google подкрепляет заявления о результатах Argon в бенчмарках привлекательными стартовыми ценами на API. На момент запуска модель будет стоить 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов, а входные токены из кэша будут продаваться со скидкой 95% от цены входных токенов. Таким образом, стартовая цена входных токенов из кэша для Argon составит 0,10 доллара за миллион токенов.

После стартового периода цена Argon, по словам Google, вырастет до 4 долларов за миллион входных токенов и 20 долларов за миллион выходных токенов.

Если после стартового периода сохранится та же скидка 95% на входные токены из кэша, их цена вырастет до 0,20 доллара за миллион токенов.

Такая ценовая политика позволяет Google предложить два разных аргумента в конкурентной борьбе. В стартовый период Argon будет стоить в пять раз дешевле GPT-6 Astra, цена API которой, согласно странице с тарифами OpenAI, составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов. Это также вдвое дешевле Claude Opus 5.5, которую Anthropic предлагает по цене 4 доллара за миллион входных токенов и 20 долларов за миллион выходных токенов.

После стартового периода стандартная цена Argon сравняется с базовыми тарифами API Claude Opus 5.5 — 4 доллара за миллион входных токенов и 20 долларов за миллион выходных — и при этом останется ниже тарифов GPT-6 Astra: 10 долларов за входные и 50 долларов за выходные токены. Anthropic также указывает цену чтения данных из кэша для Claude Opus 5.5 в размере 0,20 доллара за миллион токенов, а записи в кэш — 5 долларов за миллион токенов. Согласно опубликованным тарифам, заявленная Google скидка 95% на входные токены из кэша сделает Argon дешевле в стартовый период и сопоставимым по цене после его окончания.

Ограничение заключается в доступе. Argon не запускают сразу как модель для разработчиков, доступную всем желающим. Google сообщает, что сначала предоставит доступ доверенным специалистам по киберзащите в рамках программы Fairwind, пока компания участвует в добровольной программе правительства США по предоставлению доступа к моделям до их выпуска. Более широкий доступ для разработчиков, компаний и обычных пользователей планируется открыть сначала для платных клиентов API и подписчиков Google AI Ultra.

Google позиционирует Argon и как лидера по широте результатов в бенчмарках, и — по крайней мере в стартовый период — как более дешевую передовую модель, чем GPT-6 Astra от OpenAI и Claude Opus 5.5 от Anthropic.

На практике большинству клиентов все равно придется дождаться более широкого доступа к API, прежде чем они смогут проверить, помогают ли преимущества Argon в бенчмарках снизить производственные затраты на реальные задачи программирования, юридического и финансового анализа, а также кибербезопасности.

Удалось ли Google наверстать отставание после нескольких месяцев позади конкурентов?

Время объявления имеет значение. Google испытывала давление: компании нужно было показать, что она способна конкурировать в верхнем сегменте рынка моделей, а не только за счет каналов распространения, инфраструктуры и более дешевых моделей Flash. На прошлой неделе The Verge сообщил⁠, что новый руководитель DeepMind в Google Корай Кавукчуоглу заявил: Gemini 4 проходит доработку и может выйти задолго до конца года. В публикации отмечалось, что после серии Gemini 3 в ноябре 2025 года Google не выпускала новых флагманских моделей, тогда как OpenAI и Anthropic продвинулись вперед с GPT-6 и более новыми моделями Claude.

Этому отставанию предшествовали месяцы пристального внимания общественности. В июле Reuters сообщил⁠, что инвесторов Alphabet беспокоят задержка выпуска Gemini 3.5 Pro, рост расходов на инфраструктуру ИИ и уход сотрудников из команд, занимающихся искусственным интеллектом. В августе Axios сообщил⁠ о масштабных кадровых перестановках в руководстве ИИ-направления: Демис Хассабис покинул пост генерального директора Google DeepMind, чтобы стать председателем совета директоров и главным научным сотрудником Alphabet; Джефф Дин ушел с должности главного научного сотрудника, чтобы вместе с другими исследователями ИИ создать компанию; Кавукчуоглу занял высшую должность в DeepMind и стал подчиняться Сундару Пичаи. Axios назвал эти изменения крупнейшей перестановкой в руководстве ИИ-направления Google со времен потрясений в OpenAI в 2023 году, отметив при этом, что Google не связывала их с задержками выпуска моделей.

В публикациях других изданий также говорилось о более глубоких противоречиях. MarketWatch сообщил⁠, что на ИИ-подразделение Google повлияли потеря специалистов, задержки с выпуском моделей и внутренние разногласия по поводу приоритетов — научных исследований, передовых возможностей или коммерческих продуктов. Поэтому Argon выходит на рынок не просто как новая модель, но и как ответ на мнение о том, что у Google сильная команда исследователей ИИ, однако темпы выпуска передовых продуктов замедлились.

По крайней мере на бумаге Argon дает Google более убедительный ответ на эту критику. Модель лидирует или делит первое место с конкурентами в нескольких бенчмарках, которые напрямую связаны с внедрением ИИ в компаниях: DeepSWE для долгосрочного программирования, CWE-bench для устранения уязвимостей, Vals Index для интеллектуальной работы высокой ценности, AutomationBench для выполнения бизнес-задач и Gray Swan IPI для устойчивости к инъекции промптов. Кроме того, Google использует особую стратегию запуска: сначала предоставляет Argon специалистам по киберзащите, одновременно завершая работу над безопасностью и прохождение правительственной программы предварительного доступа.

Вопрос корпоративного внедрения

Теперь предстоит проверить, удастся ли коммерциализировать модель. Компании захотят узнать цены и ограничения на число запросов к Argon, условия управления данными, способы развертывания и порядок интеграции с Gemini API, Vertex AI, Google Cloud, Workspace и инструментами для разработчиков. У Google есть серьезные преимущества благодаря широкой дистрибуции, но они будут иметь значение, только если результаты Argon в бенчмарках подтвердятся надежной работой в производственной среде.

Пока Gemini 4 Argon — самая ясная за последние месяцы попытка Google вернуться в обсуждение передовых моделей на условиях, важных для бизнеса: речь идет не столько о характере потребительского чат-бота, сколько о том, способен ли ИИ-агент безопасно переписывать код, проверять системы, анализировать данные в регулируемых отраслях и защищать ПО до того, как уязвимостями воспользуются злоумышленники.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.