Gemini 2.5 Flash Lite от Google увеличивает скорость на 40%

Gemini 2.5 Flash Lite от Google увеличивает скорость на 40%

Google продолжает совершенствовать семейство своих больших языковых моделей (LLM) Gemini и их аудиоответвление Gemini Live даже в периоды между крупными номерными релизами.

В качестве подтверждения на этой неделе компания объявила об обновлениях Gemini 2.5 Flash и 2.5 Flash Lite — своих LLM, разработанных для обеспечения скорости и эффективности, а также API для Gemini Live, своей модели генерации голосового ИИ для корпоративных задач, таких как звонки в службу поддержки.

По данным независимой аналитической фирмы третьего уровня Artificial Analysis, Gemini 2.5 Flash Lite теперь является «самой быстрой проприетарной моделью, которую мы тестировали на сайте Artificial Analysis», со скоростью 887 выходных токенов в секунду — это на 40% больше, чем у предыдущей версии модели, что превосходит скорость в несколько сотен токенов в секунду у GPT-5 и Grok 4 Fast!

Она все еще уступает новой открытой модели K2 Think от MBZUAI и G42 AI с ее впечатляющими 2000 выходных токенов в секунду, но при этом работает невероятно быстро.

Токены — это числовые представления строк слов и предложений, которые использует LLM, ее родной «язык», а количество токенов, выдаваемых в секунду, является хорошим индикатором того, насколько быстро модель может передавать информацию пользователям.

«Flash долгое время была нашей самой популярной моделью и вывела Gemini на передовую полтора года назад; просто поразительно видеть, как прогресс продолжается без остановки», — заявил Логан Килпатрик (Logan Kilpatrick), руководитель по продуктам для Google’s AI Studio и Gemini, в своем посте в социальной сети X.

Новые версии теперь доступны через Google AI Studio и Vertex AI.

Вот что изменилось во всех трех моделях и что это значит для разработчиков, создающих на их основе ИИ-приложения:

Улучшения производительности и возможностей

Google Gemini 2.5 Flash and Flash Lite benchmarks

Тестирование Google Gemini 2.5 Flash и Flash Lite. Источник: Google

Обе модели, Gemini 2.5 Flash и Flash-Lite, получили заметные улучшения качества вывода и экономической эффективности, особенно в отношении использования токенов и скорости ответа.

Gemini 2.5 Flash демонстрирует улучшения в агентных рассуждениях (agentic reasoning) и использовании инструментов — возможностях, критически важных для обработки многошаговых и более автономных рабочих процессов.

По данным Google, эта версия набрала 54% в бенчмарке SWE-Bench Verified по сравнению с 48.9% в предыдущем релизе.

Модель также демонстрирует повышенную экономичность за счет генерации более качественных результатов с использованием меньшего количества токенов, что приводит к снижению задержек и затрат.

Gemini 2.5 Flash-Lite, в свою очередь, сосредоточена на снижении многословности, улучшении соблюдения инструкций и укреплении своих мультимодальных возможностей.

Эти обновления привели к сокращению выходных токенов на 50% по сравнению с предыдущей версией, что значительно снижает стоимость развертывания в высокопроизводительных приложениях.

Кроме того, в нее добавлены улучшенные возможности понимания изображений, качества перевода и транскрипции аудио.

Независимое тестирование, проведенное Artificial Analysis, подтверждает эти достижения. Модель Gemini 2.5 Flash Preview 09-2025 набрала 54 балла в режиме рассуждений и 47 в режиме без рассуждений в Индексе интеллекта Artificial Analysis (Artificial Analysis Intelligence Index), что на 3 и 8 пунктов больше по сравнению с предыдущим стабильным релизом соответственно.

Flash-Lite Preview 09-2025 продемонстрировала еще более значительные улучшения: 48 баллов (режим рассуждений) и 42 балла (режим без рассуждений), что означает прирост на 8 и 12 пунктов.

Как отмечалось выше, Flash-Lite также примерно на 40% быстрее своего релиза от июля 2025 года.

Обновленные модели доступны через новые псевдонимы — gemini-flash-latest и gemini-flash-lite-latest, которые позволяют разработчикам интегрировать самые свежие версии без необходимости вручную обновлять имена строк моделей. Google подчеркивает, что эти превью-версии не предназначены для замены текущих стабильных версий, а призваны помочь в формировании будущих релизов посредством тестирования и сбора отзывов.

Результаты тестирования и внешняя верификация

Сторонние оценки дополнительно подтверждают технический прогресс обновленных моделей. По данным другой сторонней фирмы по оценке LLM, Vals AI, Gemini 2.5 Flash продемонстрировала одни из самых больших улучшений в таких тестах, как TerminalBench (+5%), GPQA (+17.2%) и проприетарном бенчмарке CorpFin (+4.4%).

Модель также заняла третье место из 38 в бенчмарке MMMU и шестое из 20 в SWE-Bench, сохранив при этом стоимость, составляющую примерно половину стоимости моделей с аналогичной производительностью.

Хотя Flash и Flash-Lite показывают схожие результаты в большинстве публичных бенчмарков, Vals AI отмечает, что Flash превосходит Flash-Lite примерно на 10% в закрытых юридических и финансовых тестах, таких как CaseLaw, TaxEval и MortgageTax.

Эти результаты предполагают, что, несмотря на колоссальный прирост скорости Flash Lite, обычная версия 2.5 Flash может оставаться более подходящей для более сложных задач на рассуждение и корпоративных приложений.

Ичао «Пик» Цзи (Yichao «Peak» Ji), соучредитель и главный научный сотрудник компании по созданию автономных ИИ-агентов Manus, сообщил о повышении производительности на 15% во внутренних долгосрочных агентных бенчмарках, согласно записи в блоге Google, посвященной анонсу обновлений.

Он отметил, что экономичность новой модели Flash позволяет осуществлять масштабирование на уровнях, которые ранее были непрактичны для их рабочей нагрузки.

Цены и доступ

Ценообразование на обновленные модели соответствует ориентированной на ценность стратегии Google:

Разработчики могут получить доступ к этим моделям, используя новые псевдонимы (gemini-flash-latest, gemini-flash-lite-latest) в Vertex и Google AI Studio, которые всегда указывают на последние предварительные версии.

Google также подтвердила, что будет заблаговременно предупреждать пользователей (как минимум за две недели) о любых обновлениях или прекращении поддержки моделей, стоящих за этими псевдонимами.

Для пользователей, которые ставят во главу угла стабильность, а не ранний доступ к функциям, Google рекомендует продолжать использовать существующие стабильные версии: gemini-2.5-flash и gemini-2.5-flash-lite.

Расширенные возможности API Gemini Live

Наряду с обновлениями Flash и Flash-Lite, Google также представила обновление для Gemini Live — своей модели реального времени с приоритетом аудио, разработанной для голосовых приложений.

Новая версия включает в себя встроенные аудиовозможности и улучшения как в надежности вызова функций, так и в обработке естественного диалога.

Live API теперь позволяет разработчикам создавать более отзывчивых голосовых агентов, способных более плавно взаимодействовать с пользователями в динамичных реальных условиях. Улучшения сосредоточены в двух ключевых областях:

Более надежный вызов функций (function calling): Модель теперь значительно точнее определяет нужную функцию для вызова, знает, когда вызывать функцию не следует, и соблюдает схемы инструментов.

Внутреннее тестирование показало, что показатели успешности вызовов функций удвоились в сценариях с одним вызовом и выросли в 1.5 раза в многофункциональных контекстах, включающих от пяти до десяти активных вызовов. Эти улучшения особенно важны для голосовых сценариев использования, где повторный вызов неудачных функций в реальном времени невозможен.

Более естественные аудиовзаимодействия: Модель теперь способна более плавно справляться с прерываниями, фоновой болтовней и естественными паузами. Она может сделать паузу, когда пользователь на мгновение отвлекается, и возобновить работу без потери контекста. Благодаря этому беседы кажутся более человечными и менее хрупкими.

Google сообщает о значительном снижении числа неверных прерываний со стороны пользователей и лучшей обработке фоновых разговоров в своих внутренних тестах.

В рамках практического развертывания платформа семейного менеджмента на базе ИИ Ava использовала Live API для создания голосового агента, который выполняет роль цифрового операционного директора домохозяйства.

По словам технического директора Ava Джо Аличаты (Joe Alicata) в публикации Google AI Studio в X, улучшения новой модели в обработке зашумленных входных данных и обеспечении надежных вызовов функций ускорили разработку и внедрение.

На следующей неделе Google планирует еще больше расширить функционал Live API, внедрив возможности «размышления» (thinking), аналогичные тем, что доступны в моделях Gemini Flash and Pro.

Это позволит разработчикам устанавливать бюджет на размышления, давая модели дополнительное время на обработку более сложных запросов перед ответом. Во время этой задержки модель предоставит текстовую сводку своего хода мысли.

Разработчики могут начать использовать обновленную модель Gemini Live уже сегодня через предварительную версию с именем gemini-2.5-flash-native-audio-preview-09-2025. Она поддерживает ввод аудио в реальном времени и возвращает аудиоответы без необходимости дополнительной настройки.

Дальнейшее движение в сторону ИИ для разработчиков

Последние обновления Google в семействе моделей Gemini отражают более широкую стратегию: повышение производительности и удобства использования посредством целевых обновлений, основанных на отзывах разработчиков.

Благодаря расширенным возможностям, экономичной производительности и более быстрому отклику, Gemini Flash и Flash-Lite теперь предлагают разработчикам большую гибкость и запас производительности для широкого спектра приложений.

Независимо от того, используются ли они в системах агентных рассуждений, голосовых ассистентах реального времени или высокопроизводительных клиентских приложениях, новые предварительные версии знаменуют собой еще один шаг в общей дорожной карте Gemini от Google, причем в предстоящие месяцы запланированы новые обновления.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.