Модель Gemini 3.7 Flash от Google ориентирована на программирование и агентов с 50-процентной скидкой на старте

Модель Gemini 3.7 Flash от Google ориентирована на программирование и агентов с 50-процентной скидкой на старте

Источник: VentureBeat · Carl Franzen

Google представляет Gemini 3.7 Flash — новую версию своей основной рабочей модели ИИ, в которой упор сделан на написание кода, агентские рабочие процессы и интеллектуальный труд, а цены на API при этом временно снижены вдвое.

Этот релиз выходит всего через три недели после выпуска Gemini 3.6 Flash — необычайно короткий срок, который Google объясняет отзывами разработчиков и алгоритмическими улучшениями.

Для корпоративных разработчиков еще более важным фактором может стать сочетание прироста производительности с более низкими затратами на инференс: до конца 2026 года стоимость Gemini 3.7 Flash составляет $0,75 за миллион токенов на входе и $3,75 за миллион токенов на выходе.

Google Gemini 3.7 Flash pricing chart

График цен на Google Gemini 3.7 Flash. Источник: Google

С 1 января 2027 года цены вырастут до $1,50 за миллион входных токенов и $7,50 за миллион выходных токенов. Это означает, что текущая скидка носит временный характер, однако она дает командам, развертывающим высокопроизводительный код и бизнес-агенты, несколько месяцев на оценку того, приведет ли заявленное Google сокращение числа повторных попыток и объема ручного контроля к снижению общих операционных расходов.

Запуск также подчеркивает быстрое обновление линейки Flash со стороны Google, в то время как ее следующая флагманская модель Pro по-прежнему отсутствует. Как сообщает Reuters, компания Google не назвала дату релиза Gemini 3.5 Pro в четверг, несмотря на то, что ранее сообщалось о прохождении моделью партнерского тестирования. В Axios также отметили, что 3.7 Flash выходит раньше ожидаемого релиза Pro.

Трехнедельное обновление, сфокусированное на решении реальных задач

Google описывает Gemini 3.7 Flash как свою «самую интеллектуальную на сегодняшний день рабочую модель для написания кода и агентов». Компания заявляет, что модель лучше адаптируется при возникновении препятствий, точнее проясняет намерения при необходимости и более строго следует инструкциям.

Эти улучшения важны не только для результатов бенчмарков. В корпоративном кодирующем агенте модель, которая делает меньше ненужных изменений, эффективнее восстанавливается после ошибок и надежнее выполняет многоэтапные планы, способна сократить количество вмешательств человека, необходимых для завершения задачи. Тот же принцип применим и к бизнес-агентам, работающим с документами и приложениями, где некорректный вызов инструмента или неверно истолкованная инструкция могут сорвать полезный рабочий процесс.

По заявлению Google, 3.7 Flash «мыслит более усердно», уделяя больше усилий многоэтапаному планированию и вызовам инструментов. Заявленная цель — более дисциплинированное выполнение задач с меньшим количеством повторов и меньшей необходимостью ручного надзора.

Это представляет собой интересный эволюционный шаг по сравнению с Gemini 3.6 Flash. В документации для разработчиков Google описывала версию 3.6 как решение, сокращающее количество шагов рассуждения, диалоговых ходов и вызовов инструментов по сравнению с предыдущими моделями, одновременно пытаясь ограничить зацикливание циклов выполнения. В версии 3.7 акцент смещается на выделение достаточных усилий для планирования при одновременном повышении качества выполнения — что потенциально является более полезной оптимизацией, чем просто минимизация количества шагов, совершаемых агентом.

В публикации, сопровождающей релиз, подразделение Google DeepMind отметило, что Gemini 3.7 Flash демонстрирует успехи в отладке и устранении неполадок, генерирует более функциональные веб-макеты и приложения с меньшим количеством промптов, а также улучшает логику рассуждений и точность в реальных бизнес-процессах.

Успехи в программировании значительны, но не универсальны

Бенчмарки Google демонстрируют большой скачок поколений в нескольких тестах по разработке программного обеспечения.

В тесте FrontierCode 1.1 Main, который измеряет качество производственного кода, Gemini 3.7 Flash набирает 43,6%, по сравнению с 34,4% у Gemini 3.6 Flash. Это также немного превосходит показатели Claude Sonnet 5 (42,7%) и GPT-5.6 Terra (41,3%), о которых сообщает Google.

В DeepSWE v1.1, тесте по разработке программного обеспечения на долгосрочную перспективу, модель 3.7 Flash достигает 65,3% по сравнению с 49,0% у предшественницы. GPT-5.6 Terra остается впереди с результатом 69,6% в таблице Google.

Веб-разработка демонстрирует еще один заметный прирост. Gemini 3.7 Flash получает показатель Elo 1588 на Code Arena против 1538 у 3.6 Flash, 1541 у Claude Sonnet 5 и 1523 у GPT-5.6 Terra. По словам Google, новая модель способна создавать более функциональные макеты и полноценные приложения с меньшим количеством подсказок, при этом более точно следуя эталонным скриншотам, изображениям и дизайн-системам.

Общая таблица бенчмарков выглядит более неоднозначно, что важно для предприятий, оценивающих модель под конкретные рабочие нагрузки, а не ищущих единую «лучшую» модель.

Gemini 3.7 Flash набирает 85,8% в Terminal-bench 2.1 по сравнению с 87,4% у GPT-5.6 Terra. Terra также лидирует в сравнениях Google в Terminal-bench 3.0 и OSWorld-2.0. Claude Sonnet 5 лидирует в мультимодальных задачах для настольных ПК и операционных систем Agent’s Last Exam с показателем успешности 33,3% против 26,3% у Gemini 3.7 Flash.

Иными словами, собственные результаты Google не показывают, что 3.7 Flash повсеместно вытесняет более дорогих конкурентов. Вместо этого они указывают на модель, которая стала значительно более конкурентоспособной в написании кода и агентских задачах, занимая при этом более низкую ценовую категорию.

Корпоративные рабочие процессы могут стать более важным тестом

Достижения выходят за рамки разработки программного обеспечения.

Comparison table of AI models, highlighting Gemini 3.7 Flash's performance and pricing against competitors like Claude Sonnet 5.

Полная таблица сравнения бенчмарков Gemini 3.7. Источник: Google

В AutomationBench, который Google описывает как инструмент для измерения автоматизации бизнес-процессов предприятий, Gemini 3.7 Flash набирает 30,4%, что значительно выше 17,0% у 3.6 Flash. В таблице Google указаны показатели Claude Sonnet 5 на уровне 10,7% и GPT-5.6 Terra на уровне 23,6%.

Модель также достигает 34,0% в GDP.PDF, тесте на понимание сложных PDF-документов, по сравнению с 22,0% у 3.6 Flash, 28,0% у Claude Sonnet 5 и 24,7% у GPT-5.6 Terra.

Эта комбинация актуальна для корпоративных агентов, поскольку многие практические сценарии развертывания требуют большего, чем просто генерация текста или кода. Агенту может потребоваться интерпретировать длинный отчет, выявить релевантную информацию, решить, какой инструмент задействовать, обновить другую систему и подготовить документ для рецензента-человека. Надежность всей этой цепочки может иметь больший вес, чем производительность в изолированном бенчмарке рассуждений.

Google претворяет этот тезис в жизнь с помощью Gemini Spark. Подписчики Google AI Pro и Ultra могут использовать 3.7 Flash в Spark, персональном ИИ-агенте компании. По заявлению Google, обновление улучшает качество работы Spark с информацией и инструментами в приложениях Google Workspace, включая рабочие процессы по консолидации файлов, составлению черновиков писем и обновлению документов о статусе задач.

Для предприятий модель 3.7 Flash также доступна через платформу Gemini Enterprise Agent Platform и приложение Gemini Enterprise.

Цена становится частью конкурентной борьбы между моделями

Вводные цены на Gemini 3.7 Flash представляют собой заметную заявку на внедрение модели в корпоративные рабочие процессы.

До 31 декабря разработчики платят $0,75 за миллион входных токенов и $3,75 за миллион выходных токенов. Кэширование контекста в период вводных цен обойдется в $0,075 за миллион токенов. Google заявляет, что 1 января 2027 года стандартные цены удвоятся и составят $1,50 за входные токены и $7,50 за выходные, а стоимость кэширования контекста вырастет до $0,15.

Для сравнения, стандартные цены на API для Gemini 3.6 Flash составляют $1,50 за миллион входных токенов и $7,50 за миллион выходных токенов. В таблице бенчмарков Google для Claude Sonnet 5 указаны цены в $2 и $10 соответственно, а для GPT-5.6 Terra — $2 и $12.

Экономика становится более очевидной для автономных агентов, поскольку один запрос пользователя может породить длинную цепочку вызовов модели, токенов рассуждения и взаимодействий с инструментами. Модель, которая стоит дешевле в расчете на один токен, но требует значительно большего числа повторных попыток, в конечном итоге может оказаться не дешевле.

И наоборот, сочетание более низких вводных цен на токены и заявленных улучшений в точности с первого раза может существенно изменить стоимость запуска высокопроизводительных агентов для написания кода или обработки документов, если эти преимущества сохранятся в продакшене.

Это именно тот показатель, который корпоративным командам в конечном итоге придется протестировать: не цену за миллион токенов изолированно, а стоимость успешно завершенной задачи.

Перестановки в сфере ИИ от Google повышают ставки для Gemini

Gemini 3.7 Flash выходит на фоне широких дискуссий о том, теряет ли Google позиции на передовой рубеже ИИ. Компания так и не выпустила Gemini 3.5 Pro, несмотря на заявления в мае о том, что флагманская модель появится уже в следующем месяце.

К июлю в Google заявили, что модель все еще находится на стадии партнерского тестирования и станет широко доступна по готовности; опубликованное в четверг заявление не содержало никаких новых сроков. Таким образом, последней выпущенной моделью общего назначения серии Pro остается Gemini 3.1 Pro, представленная в феврале.

В июле агентство Reuters сообщило, что запуск Gemini 3.5 Pro был отложен после того, как модель не оправдала внутренних ожиданий компании, особенно в области программирования, даже несмотря на то, что Google приступила к обучению своей самой амбициозной модели на сегодняшний день — Gemini 4.

Эта задержка совпала с серьезной перестройкой руководства Google в сфере ИИ, о которой было объявлено на прошлой неделе.

Сооснователь Google DeepMind и лауреат Нобелевской премии Демис Хассабис сложил с себя полномочия по ежедневному руководству знаменитым ИИ-подразделением DeepMind, став его председателем и одновременно заняв пост главного научного сотрудника Alphabet.

Между тем, бывший технический директор DeepMind Корай Кавукчуоглу теперь возглавляет это подразделение в качестве старшего вице-президента, подчиняясь напрямую генеральному директору Сундару Пичаю.

Кавукчуоглу контролирует разработку моделей Gemini, передовые исследования, приложение Gemini и команды разработчиков, фактически объединяя всю цепочку Gemini под руководством топ-менеджера, более ориентированного на создание продуктов.

Главный научный сотрудник Джефф Дин, соруководитель проекта Gemini Ориол Виньалс, Куок Ле и Санджай Гхемават покинули компанию, чтобы основать стартап в сфере исследований Discovery Loop.

Эти увольнения последовали за переходом соруководителя Gemini Ноама Шазеера в OpenAI и уходом ученого Лауреата Нобелевской премии по проекту AlphaFold Джона Джампера в Anthropic. Агентство Reuters сообщило, что внутренние разногласия, ограниченность вычислительных ресурсов и бюрократия в Google способствовали замедлению релизов и слабости в написании кода.

Внешние интерпретации варьируются от организационного оздоровления до более фундаментального отступления.

Издание SemiAnalysis утверждало, что Google все больше уделяет приоритетное внимание высокодоходному бизнесу по поставке облачной инфраструктуры для ИИ-компаний (включая конкурентов Gemini), а не удержанию собственных моделей на абсолютном передовом крае. В том же анализе утверждалось, что Google фактически отменила модель 3.5 Pro, хотя компания не подтвердила это и продолжает называть модель отложенной.

The Verge предложило более взвешенную оценку: кадровые потери и задержки моделей серьезны, но Google сохраняет колоссальные преимущества благодаря Поиску, Workspace, Android, облачным сервисам, кастомным чипам ИИ и потребительской дистрибуции. По данным Google, ежемесячная аудитория приложения Gemini превысила 950 миллионов пользователей, что обеспечивает компании охват, не зависящий исключительно от обладания моделью с наивысшим баллом.

Текущие бенчмарки аналогичным образом рисуют картину компании, которая отстает от общих лидеров, но при этом остается прочно конкурентоспособной. Artificial Analysis помещает Claude Opus 5 на 63-е место в своем общем Индексе интеллекта моделей, в то время как Google сообщает о показателе 56 для Gemini 3.7 Flash — это улучшение по сравнению с 52 для 3.6 Flash, но еще не возврат на вершины рейтингов.

Ранние результаты оценки человеческих предпочтений на платформе Arena выглядят более благоприятными: модель 3.7 Flash предварительно занимает девятое место в общем зачете и восьмое в категории веб-разработки.

Сложившаяся картина говорит не о том, что Google отказалась от продвинутого ИИ, а о том, что она научилась эффективнее выпускать быстрые версии Flash, испытывая при этом трудности с созданием премиального флагмана, необходимого для возвращения широкого лидерства. Модель Gemini 4 теперь послужит самым надежным индикатором того, поможет ли реорганизация руководства устранить этот разрыв в реализации.

Уже доступно в стеке разработчиков Google

Разработчики могут получить доступ к Gemini 3.7 Flash через API Gemini в Google AI Studio и Android Studio, а также в среде Google Antigravity. Предприятия могут развернуть ее с помощью платформы Gemini Enterprise Agent Platform и приложения Gemini Enterprise, а пользователи с подпиской Google AI Pro или Ultra могут получить доступ к модели через Spark в поддерживаемых странах.

По заявлению компании, Google также выпускает обновленные средства защиты, охватывающие химические, биологические, радиологические и ядерные риски, а также предотвращающие злоупотребления в сфере кибератак.

Необычайно быстрый переход от Gemini 3.6 Flash к 3.7 Flash указывает на такой цикл разработки моделей, при котором алгоритмические улучшения могут попадать в готовые продукты без ожидания появления нового флагманского поколения. Издание Ars Technica также отметило трехнедельный интервал между двумя релизами, в то время как Google утверждает, что методы, лежащие в основе обновления, лягут в основу будущих моделей.

Для разработчиков этот ускоренный темп создает собственную операционную проблему. Модели могут быстро совершенствоваться, но производственным командам все равно приходится тестировать новые релизы на собственных репозиториях, промптах, схемах инструментов и сценариях сбоев перед изменением развертывания.

Gemini 3.7 Flash дает таким командам особенно веский стимул для проведения этой оценки. Собственные показатели Google демонстрируют значительные улучшения в продакшн-кодинге, веб-разработке, понимании документов и автоматизации рабочих процессов, не претендуя при этом на лидерство абсолютно во всем. Установив вводную цену, Google фактически делает ставку на то, что разработчики оценят модель, которая достаточно конкурентоспособна по сравнению с более дорогими системами и при этом достаточно дешева для многократного запуска внутри агентов.

Сохранится ли это преимущество после возвращения к полным ценам в январе, будет зависеть не столько от позиций в таблицах лидеров, сколько от того, насколько надежно 3.7 Flash справляется с реальной работой.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.