Gemini 3.5 Flash от Google снижает затраты на ИИ вдвое

Gemini 3.5 Flash от Google снижает затраты на ИИ вдвое

Во вторник на своей ежегодной конференции разработчиков I/O компания Google представила Gemini 3.5 Flash — новую модель искусственного интеллекта, которая, по заявлению компании, разрушает казавшийся незыблемым закон индустрии ИИ: самые умные модели обязательно должны быть самыми медленными и дорогими в работе.

Эта модель оказалась в центре целого ряда масштабных анонсов — от видеогенерирующей «модели мира» под названием Gemini Omni до круглосуточного персонального ИИ-агента Gemini Spark. Однако именно 3.5 Flash несет в себе наиболее прямые последствия для бизнеса, вкладывающего миллиарды долларов в инфраструктуру искусственного интеллекта. Генеральный директор Google Сундар Пичаи сообщил журналистам на пресс-конференции в понедельник, что компании, обрабатывающие около одного триллиона токенов в день на Google Cloud, смогут сэкономить более 1 миллиарда долларов ежегодно, переведя 80 процентов своих рабочих нагрузок на сочетание Flash и других передовых моделей.

«Вы, наверное, слышали от других ИТ-директоров истории о том, что компании уже исчерпывают свои годовые бюджеты на токены, а на дворе только май», — отметил Пичаи, представив новую модель не просто как техническое достижение, но как финансовое спасение для организаций, борющихся с выходящими из-под контроля затратами на развертывание ИИ в больших масштабах.

Это заявление, если оно подтвердится на практике, станет одним из самых значительных изменений в экономике корпоративного ИИ с момента появления больших языковых моделей в сфере корпоративных вычислений.

Почему предприятиям приходилось выбирать между качеством и скоростью ИИ

Последние три года организации, внедряющие генеративный ИИ, сталкивались с болезненным компромиссом. Самые способные модели — те, которые умеют решать сложные многоэтапные задачи, писать надежный код и анализировать плотные финансовые документы — как правило, оказываются крупными, медленными и дорогими в запросах. Более быстрые и дешевые модели жертвуют точностью. Директорам по информационным технологиям приходилось заниматься своеобразным портфельным управлением в сфере ИИ: направлять простые запросы легким моделям и резервировать тяжелые механизмы рассуждений для критически важных задач. Это сложная, хрупкая система, которая создает дополнительную инженерную нагрузку и часто обеспечивает непоследовательный пользовательский опыт.

Gemini 3.5 Flash бьет непосредственно по этому компромиссу. Согласно внутренним тестам Google и независимому анализу от Artificial Analysis, модель превосходит собственный флагман Google Gemini 3.1 Pro — модель, которую компания позиционировала как вершину своей линейки всего четыре-пять месяцев назад — практически по каждому основному бенчмарку. Она набирает 76,2% в Terminal-Bench 2.1, достигает 1656 баллов Эло в GDPval-AA, показывает 83,6% в MCP Atlas и лидирует в мультимодальном понимании с результатом 84,2% в CharXiv Reasoning.

И все это достигается при генерации токенов на выходе со скоростью, в четыре раза превышающей показатели сопоставимых передовых моделей конкурентов. Корай Кавукчуоглу (Koray Kavukcuoglu), технический директор Google DeepMind и главный ИИ-архитектор Google, сообщил журналистам, что команда пошла еще дальше: «Мы разработали еще более оптимизированную версию Flash — не просто в четыре, а фактически в 12 раз быстрее при том же качестве». Этот турбо-вариант доступен со вторника на платформе Antigravity — собственной платформе агентской разработки от Google.

Пичаи охарактеризовал разрыв в производительности прямо: «3.5 Flash лучше, чем 3.1 Pro, которая вышла всего четыре месяца назад, и обладает примерно, я бы сказал, 90% производительности передовых моделей, работая при этом в 4 раза быстрее, в Antigravity — возможно, в 12 раз быстрее, а стоит примерно от одной трети до половины прежней цены».

Попав в то, что Artificial Analysis называет «правым верхним квадрантом» своего индекса интеллекта по отношению к скорости (и став единственной моделью, которой это удалось), Flash занимает позицию, недоступную сейчас ни одному из конкурентов.

Математика триллиона токенов, стоящая за заявлением Google об экономии в 1 миллиард долларов

Чтобы понять, почему Flash так важна для корпоративных покупателей, необходимо разобраться в экономике токенов — фундаментальных единицах данных, которые обрабатывают ИИ-модели. Каждый ответ чат-бота техподдержки, каждый юридический документ, обобщенный ИИ, каждая строка кода, написанная агентом, потребляют токены. И при ценах на передовые модели эти токены быстро складываются в огромные суммы.

Google заявляет, что API ее моделей теперь обрабатывают около 19 миллиардов токенов в минуту. На всех собственных платформах Google — в Поиске, приложении Gemini, Workspace и других — компания обрабатывает более 3,2 квадриллиона токенов в месяц, и эта цифра выросла в семь раз только за последний год. Два года назад на конференции I/O 2024 этот показатель составлял 9,7 триллиона в месяц.

Взрывной рост потребления токенов уникален не только для Google. Компании в самых разных отраслях обнаруживают, что по мере роста возможностей их ИИ-систем они сжигают все больше токенов. Агентские рабочие процессы — когда ИИ автономно выполняет многоэтапные задачи, вызывает инструменты, пишет и запускает код, а также итеративно улучшает собственные результаты — требуют особенно много токенов. Один сеанс агентского написания кода может потреблять на порядки больше токенов, чем простой вопрос-ответ.

Именно здесь преимущество Flash в стоимости становится ключевым фактором. Модель обеспечивает то, что Google описывает как возможности фронтирного уровня по цене менее чем вдвое, а в некоторых случаях почти втрое ниже стоимости сопоставимых передовых моделей. Для гипотетического предприятия, обрабатывающего один триллион токенов в день на Google Cloud (масштаб, которого, по словам Пичаи, крупнейшие клиенты уже достигают), экономия от перевода 80% рабочих нагрузок на гибрид из Flash и передовых моделей превысит 1 миллиард долларов в год.

Это не погрешность округления. Это показатель того рода, который меняет решения о закупках, ускоряет сроки развертывания и коренным образом меняет расчет рентабельности инвестиций для ИИ-инициатив, к которым советы директоров все чаще относятся с нетерпением.

Как инженеры Google создали маховик данных, который конкуренты не смогут легко скопировать

Пожалуй, самой стратегически важной деталью из тех, что Google озвучила во вторник, стали не результаты тестов или ценовые показатели. Это был график, демонстрирующий внутреннее потребление токенов самой компании на Antigravity 2.0 — обновленной платформе агентской разработки.

В марте 2026 года разработчики Google обрабатывали примерно полтриллиона токенов в день внутри Antigravity. К моменту пресс-конференции на I/O в середине мая эта цифра превысила три триллиона — шестикратный рост примерно за десять недель, причем использование удваивалось «буквально каждые несколько недель», по словам Пичаи.

Такое внутреннее использование создает то, что исследователи ИИ называют маховиком данных: чем больше собственные инженеры Google используют 3.5 Flash для создания продуктов, тем больше реальных данных команда модели собирает о том, где модель преуспевает, а где дает сбои. Эти данные возвращаются в процесс улучшения модели, что делает ее более полезной, что стимулирует рост использования, что генерирует новые данные. Это цикл с положительной обратной связью, и его не так-то просто воспроизвести с той же скоростью или точностью конкурирующим ИИ-лабораториям, которые полагаются в основном на активность внешних разработчиков и синтетические тесты.

«Этот масштаб создает мощную петлю обратной связи, и именно это позволило нам продолжать улучшать серию моделей 3.5», — сказал Пичаи.

Отвечая на вопросы во время сессии Q&A о конкурентной борьбе — особенно в свете недавних успехов конкурирующих лабораторий — Пичаи признал, что ландшафт очень «динамичный» и «быстро меняющийся», но выразил уверенность в широте возможностей Google. Он добавил, что фокус компании в серии 3.5 был сосредоточен на том, чтобы «интеллект модели, использование инструментов, следование инструкциям, сценарии использования на длительных дистанциях и де-токенизация агентов работали отлично».

Кавукчуоглу подчеркнул агентскую направленность, отметив, что 3.5 Flash «теперь может справляться с многочасовыми автономными сеансами» и «может самостоятельно выполнять сложные пайплайны написания кода или полностью управлять итеративными исследовательскими проектами». Команда, по его словам, даже протестировала модель, поручив агентам создать работающую операционную систему с нуля.

Antigravity 2.0 превращает редактор кода Google в командный центр агентов

Появление 3.5 Flash тесно связано с запуском Antigravity 2.0 — масштабного расширения платформы агентской разработки, которую Google впервые представила шесть месяцев назад. То, что начиналось как среда для написания кода, превратилось в полноценную платформу для разработки и управления командами автономных ИИ-агентов, и, по заявлению компании, миллионы разработчиков уже создают на ее базе свои продукты.

Antigravity 2.0 поставляется в виде нового автономного настольного приложения, которое служит центральным хабом для одновременной оркестровки нескольких агентов. Google привела пример запуска одного агента для написания кода веб-сайта, второго для генерации брендинга и третьего для планирования архитектуры продукта — все параллельно, все управляется из единого интерфейса. Для разработчиков, предпочитающих рабочие процессы через командную строку, предусмотрен Antigravity CLI. А для создателей программных интеграций новый SDK Antigravity предоставляет прямой доступ к тому же каркасу агентов, который обеспечивает работу собственных продуктов Google.

Совместная разработка 3.5 Flash и Antigravity 2.0 не случайна. «Мы разрабатывали 3.5 Flash совместно с Google Antigravity, нашей платформой агентской разработки», — сказал Кавукчуоглу. Эта тесная интеграция означает, что сильные стороны Flash — скорость, использование инструментов, рассуждения в условиях длинного контекста и генерация кода — специально настроены на те типы нагрузок, которые разработчики выполняют внутри платформы.

Google также запускает управляемых агентов (Managed Agents) в Gemini API, позволяя разработчикам запускать агента с помощью одного вызова API, который рассуждает, использует инструменты и выполняет код в изолированной среде Linux. Кроме того, был представлен CodeMender — ИИ-агент безопасности, который использует продвинутые способности рассуждения Gemini для автоматического поиска и исправления критических уязвимостей в коде. Кавукчуоглу охарактеризовал эту функцию как жизненно необходимую по мере того, как агентские системы пишут все большую часть мирового кода.

Инфраструктурные инвестиции Google в 190 миллиардов долларов и собственный кремний для более дешевого ИИ

Модели и платформы опираются на колоссальные инфраструктурные инвестиции, о которых Пичаи рассказал во время брифинга: в 2026 году Google ожидает капитальные затраты на уровне примерно от 180 до 190 миллиардов долларов — примерно в шесть раз больше 31 миллиарда, потраченных компанией в 2022 году, всего четыре года назад.

Ключевым компонентом этих расходов являются собственные полупроводниковые решения компании. Недавно компания представила свое восьмое поколение тензорных процессоров (TPU), впервые применив двухчиповую архитектуру со специализированными проектами для обучения (TPU 8o) и инференса (TPU 8i). Google заявляет, что теперь может распределять процесс обучения моделей по нескольким центрам обработки данных с помощью системы Pathways, масштабируя ее до более чем одного миллиона TPU по всему миру. По словам компании, эта установка образует крупнейший тренировочный кластер в мире.

«Это означает возможность обучать более крупные и мощные модели за недели, а не за месяцы», — сказал Пичаи. Инфраструктурное преимущество имеет колоссальное значение для экономики Flash. Собственный кремний, оптимизированный для инференса, означает, что Google может запускать Flash с меньшей стоимостью за токен по сравнению с конкурентами, полагающимися на универсальные графические процессоры, и эта экономия — хотя бы частично — транслируется на клиентов.

Показатель капитальных затрат также сигнализирует о стратегической позиции Google в долгосрочной перспективе. В то время как некоторые инвесторы начали нервничать из-за астрономических сумм, которые облачные провайдеры тратят на инфраструктуру ИИ, Google преподносит эти расходы как защитный ров вокруг своего бизнеса. Чем больше инфраструктуры компания строит, тем дешевле она может выполнять инференс, тем привлекательнее становятся ее модели и тем больше пользователей она привлекает для улучшения следующего поколения. Это та же логика маховика, распространенная со сферы программного обеспечения вплоть до кремниевых чипов.

Gemini Omni, Spark и потребительские продукты, которые теперь работают на Flash в огромных масштабах

Хотя в новостях о Flash доминирует тема корпоративной экономии, Google также предприняла масштабные шаги на потребительском фронте, задействовав модель в продуктах, охватывающих миллиарды людей. Flash теперь является моделью по умолчанию для приложения Gemini, число активных пользователей которого превысило 900 миллионов в месяц (более чем вдвое по сравнению с 400 миллионами год назад), а также для ИИ-режима в Поиске Google, преодолевшего отметку в один миллиард пользователей в месяц за первый год работы.

Google представила Gemini Spark — круглосуточного персонального ИИ-агента, который работает на выделенных виртуальных машинах в Google Cloud и функционирует в фоновом режиме, даже когда устройство пользователя выключено. Работая на базе 3.5 Flash с полным набором инструментов Antigravity, Spark интегрируется с Gmail, Docs, Sheets и Slides. Джош Вудвард (Josh Woodward), руководящий Google Labs и приложением Gemini, ярко описал этот опыт: «Когда вы используете его, возникает ощущение, будто вы просто бросаете дела через плечо, а Spark подхватывает их и доводит до конца». В вопросах безопасности Spark требует явного одобрения пользователя перед выполнением ответственных действий. Google также анонсировала Протокол платежей для агентов (Agent Payments Protocol), который позволяет пользователям устанавливать строгие ограничения — одобренные бренды, лимиты расходов, конкретных продавцов — прежде чем агент сможет тратить деньги от их имени. Вудвард сравнил этот подход с «выдачей подростку его первой дебетовой карты: вокруг этого существуют определенные лимиты и ограничения».

Наряду с Flash компания Google представила Gemini Omni — модель, способную генерировать любые результаты на основе любых входных данных, начиная с видео. Кавукчуоглу провел четкую границу с существующей моделью Veo от Google: «Veo — это модель типа «текст-видео». Omni — это полноценная многомодельная модель как на входе, так и на выходе». Весь контент, созданный с помощью Omni, содержит водяной знак SynthID от Google, и компания объявила, что OpenAI, Kakao и ElevenLabs также внедряют SynthID.

Компания также впервые за более чем 25 лет переосмыслила поисковую строку, представила информационных агентов, которые круглосуточно отслеживают сеть по заданным пользователем условиям, и запустила Universal Cart — универсальную корзину для покупок на базе ИИ от разных продавцов, встроенную в Google Wallet. Лиз Рид (Liz Reid), возглавляющая направление Поиска Google, назвала новую поисковую строку «самым значительным обновлением нашей культовой строки со времени ее появления».

Что шестимесячный цикл релизов моделей Google означает для кривой затрат на корпоративный ИИ

Google дала понять, что 3.5 Flash — это лишь первый акт серии 3.5. Gemini 3.5 Pro в настоящее время проходит внутреннее тестирование и станет доступна всем в следующем месяце. Кавукчуоглу отметил, что компания придерживается примерно шестимесячного цикла крупных обновлений моделей (Gemini 3 в ноябре, 3.5 в мае) и рассчитывает сохранить этот ритм в будущем.

Когда журналист The New York Times спросил, как именно Google определяет, заслуживает ли релиз полноценного цифрового скандачка или приращения на полшага, Кавукчуоглу ответил, что нумерация отражает масштабы исследовательского прогресса: «Определяющим фактором для обновления нумерации является тот прогресс, который мы видим в наших исследованиях, то, как он отражается в моделях и какое влияние они оказывают».

Для корпоративных покупателей такой цикл несет в себе важный подтекст: кривая соотношения цены и производительности не просто улучшается — она улучшается по предсказуемому графику. Модель, которая превосходит предыдущий флагман при трети затрат каждые шесть месяцев, кардинально меняет горизонт планирования для инвестиций в ИИ. Это означает, что бюджеты на токены, которые компании тратят сегодня, к концу года могут показаться скромными.

Анонсы Google приходятся на момент ожесточенной конкуренции. OpenAI, Anthropic, Meta и множество более мелких лабораторий наперегонки создают модели, балансирующие между функциональностью и стоимостью. Microsoft активно интегрирует модели OpenAI в Azure и Copilot. Однако Google обладает структурным преимуществом, которое легко упустить из виду: дистрибуцией. Имея 13 продуктов, каждый из которых обслуживает более миллиарда пользователей (пять из них превышают три миллиарда), Google может развернуть Flash для аудитории, с которой не сравнится ни одна специализированная ИИ-лаборатория. Каждое улучшение немедленно приносит пользу Поиску, Gmail, Docs, Maps и YouTube. А данные об использовании, поступающие от этих миллиардов взаимодействий, питают тот самый маховик, который делает следующую модель еще лучше.

Вопрос теперь в том, выживет ли показатель экономии в 1 миллиард долларов — эффектный прогноз, основанный на определенном сочетании рабочих нагрузок — при столкновении с суровой реальностью корпоративных внедрений ИИ, где устаревшие системы, требования комплаенса и организационная инерция способны сгладить даже самые убедительные кривые затрат. Но если судить по собственному внутреннему использованию Google — три триллиона токенов в день и рост с удвоением каждые несколько недель без признаков замедления — компания не просто делает ставку. Она сама является игроком, задействуя собственных инженеров, на собственной инфраструктуре, в масштабах, которые еще не пробовал ни один клиент. В войнах за стоимость ИИ самым убедительным аргументом может оказаться простой факт: мы сделали это первыми.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.