Gemini 3 Flash выходит на рынок со сниженными затратами и задержками — мощное сочетание для предприятий

Gemini 3 Flash выходит на рынок со сниженными затратами и задержками — мощное сочетание для предприятий

Предприятия теперь могут задействовать возможности большой языковой модели, которая по своим характеристикам близка к передовой Google Gemini 3 Pro, но обходится значительно дешевле и работает быстрее благодаря недавно выпущенной Gemini 3 Flash.

Эта модель пополнила линейку флагманских решений, куда входят Gemini 3 Pro, Gemini 3 Deep Think и Gemini Agent, о выпуске которых было объявлено в прошлом месяце.

Gemini 3 Flash, которая теперь доступна в Gemini Enterprise, Google Antigravity, Gemini CLI, AI Studio и в режиме предварительного просмотра в Vertex AI, обрабатывает информацию практически в реальном времени и помогает создавать быстрые и отзывчивые агентные приложения. 

Компания отметила в своем блоге, что Gemini 3 Flash «развивает линейку моделей, которые уже полюбились разработчикам и предприятиям, и оптимизирована для высокочастотных рабочих процессов, требующих высокой скорости без ущерба для качества.

Кроме того, эта модель используется по умолчанию в режиме ИИ в Поиске Google и в приложении Gemini. 

Тулси Доши (Tulsee Doshi), старший директор по управлению продуктами команды Gemini, в отдельной публикации в блоге заявила, что модель «демонстрирует: скорость и масштабируемость не обязательно должны достигаться в ущерб интеллекту».

«Gemini 3 Flash создана для итеративной разработки и предлагает возможности написания кода уровня Pro от Gemini 3 с низким уровнем задержки — она способна рассуждать и быстро решать задачи в условиях высокочастотных рабочих процессов, — отметила Доши. — Она представляет собой идеальный баланс для агентского программирования, готовых к производственному использованию систем и интерактивных приложений с быстрой реакцией».

Раннее внедрение модели специализированными компаниями подтверждает ее надежность в критически важных областях. Компания Harvey, представляющая собой ИИ-платформу для юридических фирм, сообщила о росте показателей рассуждения на 7% по результатам внутреннего теста «BigLaw Bench», в то время как Resemble AI выяснила, что Gemini 3 Flash способна обрабатывать сложные криминалистические данные для обнаружения дипфейков в 4 раза быстрее, чем Gemini 2.5 Pro. Речь идет не просто о приросте скорости: открываются возможности для рабочих процессов «почти в реальном времени», которые раньше были невыполнимы.

Больше эффективности при меньших затратах

Разработчики корпоративного ИИ стали острее осознавать финансовую сторону использования моделей искусственного интеллекта, особенно пытаясь убедить руководство выделить больший бюджет на агентские рабочие процессы, функционирующие на базе дорогостоящих моделей. Организации начали переходить на меньшие по размеру или дистиллированные модели, делая упор на открытые решения или другие методы исследований и промптинг-инжиниринга для контроля раздувающихся затрат на ИИ.

Главное ценностное предложение Gemini 3 Flash для предприятий заключается в том, что она предлагает тот же уровень продвинутых мультимодальных возможностей (например, сложный видеоанализ и извлечение данных), что и ее более крупные аналоги из семейства Gemini, но при этом работает гораздо быстрее и стоит дешевле. 

Хотя внутренние материалы Google указывают на трехкратное увеличение скорости по сравнению с серией 2.5 Pro, данные независимой аналитической фирмы Artificial Analysis добавляют важный контекст.

В ходе предварительного тестирования, проведенного этой организацией, предварительная версия Gemini 3 Flash продемонстрировала чистую пропускную способность на уровне 218 выходных токенов в секунду. Это на 22% медленнее предыдущей версии Gemini 2.5 Flash без функции рассуждения (non-reasoning), однако она все еще значительно опережает конкурентов, включая GPT-5.1 high от OpenAI (125 токенов/с) и DeepSeek V3.2 с поддержкой рассуждений (30 токенов/с).

Что особенно примечательно, специалисты Artificial Analysis присудили Gemini 3 Flash звание нового лидера в своем бенчмарке знаний AA-Omniscience, где модель показала самую высокую точность среди всех протестированных на сегодняшний день решений. Однако за этот интеллект приходится платить «налог на рассуждения»: при обработке сложных индексов модель расходует более чем в два раза больше токенов по сравнению с серией 2.5 Flash.

Эта высокая плотность токенов компенсируется агрессивной ценовой политикой Google: при доступе через Gemini API стоимость Gemini 3 Flash составляет $0,50 за 1 миллион входных токенов (по сравнению с $1,25 за 1 млн для Gemini 2.5 Pro) и $3 за 1 миллион выходных токенов (по сравнению с $10 за 1 млн для Gemini 2.5 Pro). Это позволяет Gemini 3 Flash претендовать на звание самой экономичной модели в своей весовой категории по уровню интеллекта, несмотря на то, что она является одной из самых «разговорчивых» моделей с точки зрения чистого объема токенов. Вот как она выглядит на фоне конкурирующих языковых моделей:

Модель

Входные (за 1 млн)

Выходные (за 1 млн)

Общая стоимость

Источник

Qwen 3 Turbo

$0.05

$0.20

$0.25

Alibaba Cloud

Grok 4.1 Fast (с рассуждениями)

$0.20

$0.50

$0.70

xAI

Grok 4.1 Fast (без рассуждений)

$0.20

$0.50

$0.70

xAI

deepseek-chat (V3.2-Exp)

$0.28

$0.42

$0.70

DeepSeek

deepseek-reasoner (V3.2-Exp)

$0.28

$0.42

$0.70

DeepSeek

Qwen 3 Plus

$0.40

$1.20

$1.60

Alibaba Cloud

ERNIE 5.0

$0.85

$3.40

$4.25

Qianfan

Gemini 3 Flash Preview

$0.50

$3.00

$3.50

Google

Claude Haiku 4.5

$1.00

$5.00

$6.00

Anthropic

Qwen-Max

$1.60

$6.40

$8.00

Alibaba Cloud

Gemini 3 Pro (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.2

$1.75

$14.00

$15.75

OpenAI

Claude Sonnet 4.5

$3.00

$15.00

$18.00

Anthropic

Gemini 3 Pro (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 4.5

$5.00

$25.00

$30.00

Anthropic

GPT-5.2 Pro

$21.00

$168.00

$189.00

OpenAI

Дополнительные способы экономии

Однако корпоративные разработчики и пользователи могут сократить расходы еще сильнее за счет устранения задержек, свойственных большинству крупных моделей, которые увеличивают расход токенов. В Google заявили, что модель «способна модулировать глубину своих размышлений», задействуя больше ресурсов на рассуждения и, соответственно, большее количество токенов для сложных задач по сравнению с простыми запросами. В компании отметили, что Gemini 3 Flash использует на 30% меньше токенов, чем Gemini 2.5 Pro. 

Чтобы сбалансировать эти новые возможности рассуждения со строгими корпоративными требованиями к задержкам, Google представила параметр «Thinking Level» (Уровень рассуждения). Разработчики могут переключаться между значениями «Low» (Низкий) для минимизации затрат и задержек при выполнении простых задач в чате и «High» (Высокий) для максимизации глубины рассуждений при извлечении сложных данных. Такой детализированный контроль позволяет командам создавать «приложения с переменной скоростью», которые расходуют дорогостоящие «токены размышлений» только тогда, когда задача действительно требует уровня эксперта с докторской степенью

Экономический эффект выходит далеко за рамки простых цен на токены. Благодаря стандартной поддержке кэширования контекста (Context Caching), предприятия, обрабатывающие массивы статических данных (например, целые юридические библиотеки или репозитории кодовой базы), могут рассчитывать на 90-процентное сокращение расходов при выполнении повторяющихся запросов. В сочетании с 50-процентной скидкой в Batch API общая стоимость владения агентом на базе Gemini снижается значительно ниже порога конкурирующих передовых моделей

«Gemini 3 Flash обеспечивает исключительную производительность в решении задач программирования и агентских задач в сочетании с более низкой ценой, позволяя командам внедрять сложные механизмы рассуждений в высокоинтенсивные процессы без ущерба для эффективности», — отметили в Google. 

Предлагая модель с сильными мультимодальными возможностями по более доступной цене, Google доказывает, что предприятиям, стремящимся контролировать свои расходы на ИИ, следует выбирать именно ее модели, особенно Gemini 3 Flash. 

Высокие результаты в бенчмарках 

Но как Gemini 3 Flash выглядит на фоне других моделей с точки зрения производительности? 

По словам Доши, модель набрала 78% в бенчмарке SWE-Bench Verified для тестирования агентов-программистов, превзойдя как предыдущее семейство Gemini 2.5, так и более новую Gemini 3 Pro!

Gemini 3 Flash benchmark graph

Источник: Google

Для бизнеса это означает, что масштабные задачи по обслуживанию программного обеспечения и исправлению ошибок теперь можно переложить на модель, которая работает быстрее и стоит дешевле предыдущих флагманских решений, и при этом качество кода не снижается.

Модель также показала высокие результаты в других бенчмарках, набрав 81.2% в тесте MMMU Pro, что сопоставимо с Gemini 3 Pro. 

В то время как большинство моделей типа Flash явно оптимизированы под короткие и быстрые задачи (например, генерацию кода), в Google утверждают, что производительность Gemini 3 Flash «в рассуждениях, использовании инструментов и мультимодальных возможностях идеально подходит для разработчиков, стремящихся выполнять более сложный видеоанализ, извлечение данных и визуальные ответы на вопросы. Это позволяет создавать более интеллектуальные приложения — такие как внутриигровые ассистенты или инструменты для A/B-тестирования, — требующие как быстрых ответов, так и глубоких рассуждений».

Первые впечатления ранних пользователей

На данный момент первые пользователи остались весьма впечатлены моделью, особенно ее показателями в бенчмарках. 

Что это значит для использования ИИ на уровне предприятий

Поскольку Gemini 3 Flash теперь выступает в качестве базового движка в Поиске Google и приложении Gemini, мы наблюдаем «флешификацию» передового интеллекта. Сделав рассуждения уровня Pro новым стандартом, Google расставляет ловушку для более медлительных конкурентов.

Интеграция в такие платформы, как Google Antigravity, говорит о том, что Google продает не просто модель — компания продает инфраструктуру для автономного предприятия.

Поскольку разработчики сразу же получают трехкратное ускорение и 90-скидку на кэширование контекста, стратегия «сначала Gemini» превращается в крайне убедительный финансовый аргумент. В стремительной гонке за доминирование в сфере ИИ модель Gemini 3 Flash вполне может стать тем решением, которое наконец превратит «вайб-кодинг» из экспериментального увлечения в готовую к производству реальность.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.