Модель Gemini 3.6 Flash от Google сокращает расходы токенов для ИИ-агентов на величину до 65% при выполнении долгосрочных инженерных задач, а на подходе — версия 3.5 Pro

Модель Gemini 3.6 Flash от Google сокращает расходы токенов для ИИ-агентов на величину до 65% при выполнении долгосрочных инженерных задач, а на подходе — версия 3.5 Pro

Источник: VentureBeat · Carl Franzen

Подразделение Google DeepMind выпустило сегодня три новые проприетарные модели ИИ, которые, по его заявлению, являются одними из самых эффективных с точки зрения использования токенов: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber.

Цель этих моделей — сделать агентов ИИ более быстрыми, умными и экономичными при масштабировании. Google установила цену на Gemini 3.6 Flash в размере $1,50 за один миллион входных токенов и $7,50 за один миллион выходных токенов через свой интерфейс программирования приложений (API), в то время как Gemini 3.5 Flash-Lite стоит поразительно дешево — $0,30/$2,50 за миллион токенов (вход/выход).

По сравнению с $1,50/$9,00 за 1 млн токенов для Gemini 3.5 Flash и $2/$12 для Gemini 3.1 Pro Preview, экономия весьма значительна. Тем не менее, модель предыдущего поколения Google Gemini 3.1 Flash-Lite по-прежнему остается «самой рентабельной» моделью поискового гиганта со стоимостью $0,25/$1,50 за 1 млн токенов. Однако она в 2 раза медленнее новой, более дорогой Gemini 3.5 Flash-Lite, что дает предприятиям, для которых важна скорость, большую отдачу от вложенных средств.

Сравнительная таблица цен на API пограничных моделей ИИ от VB (краткий список на конец июля 2026 года)

Модель

Вход ($/1M)

Выход ($/1M)

Итого ($/1M)

Источник

MiMo-V2.5 Flash

$0.10

$0.30

$0.40

Xiaomi

deepseek-v4-flash

$0.14

$0.28

$0.42

DeepSeek

deepseek-v4-pro

$0.435

$0.87

$1.305

DeepSeek

MiniMax-M3

$0.30

$1.20

$1.50

MiniMax

LongCat-2.0 — ограниченная по времени акция

$0.30

$1.20

$1.50

LongCat

Gemini 3.1 Flash-Lite

$0.25

$1.50

$1.75

Google

Qwen3.7-Plus

$0.40

$1.60

$2.00

Alibaba Cloud

MiMo-V2.5

$0.40

$2.00

$2.40

Xiaomi

Gemini 3.5 Flash-Lite

$0.30

$2.50

$2.80

Google

LongCat-2.0 — стандарт

$0.75

$2.95

$3.70

LongCat

MiMo-V2.5 Pro (≤256K)

$1.00

$3.00

$4.00

Xiaomi

GLM-5.2

$1.40

$4.40

$5.80

Z.ai

GPT-5.6 Luna

$1.00

$6.00

$7.00

OpenAI

Grok 4.5

$2.00

$6.00

$8.00

xAI

MiMo-V2.5 Pro (>256K)

$2.00

$6.00

$8.00

Xiaomi

Gemini 3.6 Flash

$1.50

$7.50

$9.00

Google

Qwen3.7-Max

$2.50

$7.50

$10.00

Alibaba Cloud

Gemini 3.5 Flash

$1.50

$9.00

$10.50

Google

Gemini 3.1 Pro Preview (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.6 Terra

$2.50

$15.00

$17.50

OpenAI

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Kimi K3

$3.00

$15.00

$18.00

Moonshot AI

Gemini 3.1 Pro Preview (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 4.8

$5.00

$25.00

$30.00

Anthropic

GPT-5.5

$5.00

$30.00

$35.00

OpenAI

GPT-5.5 Instant (chat-latest)

$5.00

$30.00

$35.00

OpenAI

Sakana Fugu Ultra (≤272K)

$5.00

$30.00

$35.00

Sakana AI

GPT-5.6 Sol

$5.00

$30.00

$35.00

OpenAI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

Цена для специализированной модели Gemini 3.5 Flash Cyber пока не объявлена; как следует из ее названия, она предназначена для исследователей в области кибербезопасности и специалистов Red Team для устранения уязвимостей.

Хотя цены находятся в нижне-среднем диапазоне среди всех основных моделей ИИ по всему миру, тот факт, что Google разработала их так, чтобы они в целом использовали меньше токенов, также должен снизить затраты для предприятий сверх того, что показывает базовая цена (поскольку в любом случае вы будете платить за меньшее общее количество токенов).

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite доступны сразу через Gemini API в Google AI Studio и Android Studio, а также в потребительском приложении Gemini и в Поиске Google. Согласно отдельной записи в блоге Google, Gemini 3.5 Flash Cyber «скоро станет доступна исключительно для правительств и доверенных партнеров через CodeMender» — CodeMender является проприетарным агентом Google для исправления ошибок в коде ИИ, выпущенным в прошлом году.

Как и предыдущие модели Gemini, все они являются проприетарными и «с закрытым исходным кодом», поэтому их можно получить только через официальный API Google и его партнеров, в отличие от лицензий с открытым исходным кодом, таких как MIT или Apache 2.0.

Одно бросающееся в глаза упущение, отмеченное разработчиками на X и в социальных сетях: где же более крупная, мощная флагманская модель Gemini 3.5 Pro, о выпуске которой этим летом ранее намекала Google? В конце концов, Gemini 3.1 Pro, предыдущий флагман, дебютировал еще в феврале 2026 года, а конкуренты OpenAI и Anthropic с тех пор выпустили несколько новых поколений флагманских обновлений, значительно превосходящих разработки Google.

Технический сотрудник Google Логан Килпатрик ответил на подобный запрос в X, написав: «Gemini 3.5 Pro в настоящее время проходит тестирование с партнерами, и мы планируем сделать ее широко доступной, как только она будет готова».

Релиз Google сигнализирует о том, что ближайшее будущее ИИ заключается в агентных возможностях — системах, которые работают автономно в течение длительных периодов времени.

Если ранние большие языковые модели похожи на массивные, прожорливые товарные поезда, способные перевозить невероятные грузы с огромными затратами, то новая серия Flash представляет собой парк маневренных, сверхэффективных гибридных фургонов для доставки.

Прирост эффективности в виде сокращения токенов на 17–65% для достижения высоких результатов в сторонних бенчмарках

«Под капотом» Gemini 3.6 Flash достигает значительного прироста эффективности. Модель сокращает использование выходных токенов на 17% по сравнению со своим предшественником, Gemini 3.5 Flash, согласно индексу Artificial Analysis Index, поддерживаемому независимой сторонней группой по бенчмаркингу ИИ с тем же названием.

В специфических бенчмарках долгосрочной программной инженерии, таких как DeepSWE, которые измеряют, насколько хорошо агенты выполняют многоэтапные инженерные задачи с нуля, экономия токенов достигает 65%.

Это сокращение означает, что модели требуется меньше шагов рассуждения и вызовов инструментов для выполнения точно такого же многоэтапного рабочего процесса. Подумайте об эффективности токенов как об экономии топлива в автомобиле.

Когда модель ИИ выбирает извилистый путь для решения проблемы, она сжигает больше вычислительного топлива, увеличивая конечные затраты для разработчика. За счет оптимизации своей внутренней логики Gemini 3.6 Flash находит правильный ответ быстрее и дешевле.

Хотя в материалах Google не уточняются конкретные архитектурные или алгоритмические изменения, использованные для достижения такой эффективности токенов, отмечается, что модель «тратит меньше шагов на рассуждения и вызовы инструментов для выполнения многоэтапных рабочих процессов» и демонстрирует меньшую «многословность».

Официальные карточки моделей, выпущенные Google, показывают, что как Gemini 3.6 Flash, так и Gemini 3.5 Flash-Lite оснащены входным контекстным окном на 1 миллион токенов и максимальным лимитом вывода в 64 000 токенов, причем обе модели имеют общую дату отсечения знаний — март 2026 года.

Достойная производительность в бенчмарках при низких затратах

Технологические улучшения распространяются и на конкретные возможности. Gemini 3.6 Flash набирает 49% в бенчмарке DeepSWE, что является заметным ростом по сравнению с 37%, достигнутыми версией 3.5.

Она также повышает производительность в области инженерии машинного обучения, набирая 63.9% на MLE-Bench по сравнению с 49.7% ранее. Кроме того, Google интегрирует использование компьютера в качестве встроенного клиентского инструмента через Gemini API и Gemini Enterprise, что отражает показатель OSWorld-Verified на уровне 83.0% по сравнению с предыдущими 78.4%.

Google Gemini 3.6 Flash performance on DeepSWE and Artificial Analysis Intelligence Index

Источник: Google

Модель также с большей эффективностью справляется с интеллектуальной работой, превосходя своего предшественника в таких бенчмарках, как GDPval-AA v2, подняв показатель с 1349 до 1421 балла.

Для обеспечения безопасности на фоне этих улучшений возможностей Google развертывает усовершенствованные средства защиты Frontier Safety. Эти меры защищают модель от взлома (jailbreak) и снижают риски в областях химических, биологических, радиологических и ядерных технологий, а также кибератак.

Инженерная команда обучает модель минимизировать отказы при ее полезном использовании, находя необходимый баланс между строгой безопасностью и практической пользой.

Модели для недорогого написания кода, агентных сценариев и кибербезопасности — соответственно

Google разделила свои новые предложения на три отдельных продукта, адаптированных под различные операционные потребности.

Gemini 3.6 Flash служит тяжелой рабочей лошадкой этой троицы. Она справляется со сложным кодированием, сложной интеллектуальной работой и мультимодальной обработкой с повышенной точностью. Корпоративные клиенты используют ее для таких ресурсоемких задач, как сложный разбор документов, запутанный анализ графиков и данных, а также составление объемных отчетов.

Модель выполняет сложные миграции кода с использованием фреймворков мультиагентной оркестровки с меньшей задержкой и более высоким качеством, чем предыдущие итерации. Кроме того, 3.6 Flash помогает в разработке экстракторов текстур для 3D-рабочих процессов с использованием интерфейсов canvas.

Gemini 3.5 Flash-Lite нацелена на среды, где высокая пропускная способность и минимальная задержка имеют решающее значение. Google определяет ее как самую быструю модель в серии 3.5.

По данным Artificial Analysis, модель обрабатывает 350 выходных токенов в секунду, что делает ее чрезвычайно эффективной для агентного поиска и задач обработки огромных массивов документов. Artificial Analysis отмечает, что это примерно в два раза быстрее, чем у модели предыдущего поколения Gemini 3.1 Flash-Lite.

Разработчики могут настроить 3.5 Flash-Lite так, чтобы она отдавала приоритет выполнению с низким уровнем задержки для задач с высоким объемом с использованием минимального уровня рассуждений, или же задействовала более высокие уровни рассуждений для обработки сложных многоэтапных подзадач агентов.

Несмотря на обозначение «lite», она превосходит стандартную Gemini 3 Flash по нескольким ключевым оценкам агентных возможностей и кодирования, включая SWE-Bench Pro, где она набирает 54.2% по сравнению с 49.6%, и OSWorld-Verified с результатом 74.0% против 65.1%.

Gemini 3.5 Flash-Lite vs. Gemini 3 Flash performance on two benchmarks

Производительность Gemini 3.5 Flash-Lite и Gemini 3 Flash в двух бенчмарках. Источник: Google

Модель извлекает характеристики продуктов из массивных наборов данных, генерирует концепты интерактивного веб-дизайна и беспрепятственно масштабирует перевод чеков.

Третий продукт, Gemini 3.5 Flash Cyber, представляет собой узкоспециализированное решение. Google доработала эту модель специально для поиска и устранения уязвимостей кибербезопасности. Она интегрируется напрямую с агентом Google CodeMender.

На практике несколько агентов 3.5 Flash Cyber работают одновременно для создания единого всеобъемлющего отчета об уязвимостях, достигая конкурентоспособной производительности на передовом рубеже в бенчмарке CyberGym и даже приближаясь к разрекламированной модели Mythos от Anthropic.

Gemini 3.5 Flash Cyber performance on CyberGym compared to other leading AI models

Производительность Gemini 3.5 Flash Cyber в CyberGym по сравнению с другими ведущими моделями ИИ. Источник: Google

Google не указала точную стоимость в цифровом выражении для 3.5 Flash Cyber, заявив лишь, что она доработана «по более низкой цене за токен, чем более крупные модели».

Только коммерческое лицензирование

Лицензионная структура для новых моделей Gemini имеет далеко идущие последствия для разработчиков и корпоративных пользователей. Google развертывает Gemini 3.6 Flash и 3.5 Flash-Lite в рамках коммерческой проприетарной модели API. В отличие от программного обеспечения с открытым исходным кодом, регулируемого такими лицензиями, как MIT License или GNU General Public License, разработчики не получают доступа к базовым весам модели, обучающим данным или исходному коду.

Лицензия MIT или GPL дает пользователям свободу скачивать кодовую базу, изменять внутреннюю архитектуру, самостоятельно размещать развертывание и независимо распространять программную инфраструктуру. Напротив, подход с использованием API от Google означает, что разработчики по сути арендуют доступ к интеллекту на строго повременной основе. Каждый промпт и сгенерированный ответ проходят через управляемые серверы Google, влекущие за собой расходы на основе строгой ценовой структуры: $1,50 за миллион входных токенов для 3.6 Flash.

Эта коммерческая привязка ограничивает гибкость развертывания. Предприятия не могут полностью изолировать модели (air-gap) на собственном локальном защищенном оборудовании без заключения специализированных высокоуровневых корпоративных соглашений с Google Cloud. Разработчики остаются связанными политиками допустимого использования Google, произвольными ограничениями скорости и сетевыми требованиями, что создает постоянную зависимость от бесперебойности инфраструктуры и условий обслуживания Google.

Лицензирование Gemini 3.5 Flash Cyber оказывается еще более ограничительным. Признавая двойной характер ИИ для кибербезопасности — который злоумышленники могут использовать в качестве оружия так же легко, как защитники для латания дыр в системах, — Google пока делает модель доступной только в рамках пилотной программы с ограниченным доступом, следуя тенденции, заложенной моделью Mythos от Anthropic с ее программой Project Glasswing и продолженной OpenAI с ее поэтапным развертыванием GPT-5.6.

В данном случае Google делает 3.5 Flash Cyber доступной исключительно для правительств и доверенных партнеров. Этот строгий контроль предотвращает открытый доступ, ставя системную безопасность выше широких инноваций разработчиков.

Взгляд в будущее

Google DeepMind продолжает быстро итерировать свои разработки, но пробел в линейке продуктов остается очевидным. Хотя серия Flash превосходит всех по скорости и экономичности, индустрия с нетерпением ждет развертывания Gemini 3.5 Pro, чтобы оценить абсолютные возможности Google на переднем крае.

В то же время компания подтверждает, что предварительное обучение для Gemini 4 уже началось.

До тех пор, пока не появится следующий крупный флагманский релиз, разработчикам придется оптимизировать свои системы, используя высокоэффективную, но целенаправленно ограниченную архитектуру Flash.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.