Google представляет Gemini 3, заявляя о лидерстве в бенчмарках по математике, науке, мультимодальности и агентному ИИ
После более чем месяца слухов и лихорадочных спекуляций — включая ставки на Polymarket относительно даты релиза — компания Google сегодня представила Gemini 3, свое новейшее семейство передовых проприетарных моделей и самый масштабный релиз компании в сфере искусственного интеллекта с момента дебюта линейки Gemini в 2023 году.
Эти модели являются проприетарными (с закрытым исходным кодом) и доступны исключительно через продукты Google, платформы для разработчиков и платные API, включая Google AI Studio, Vertex AI, интерфейс командной строки (CLI) Gemini для разработчиков, а также сторонние интеграции в широкой экосистеме сред разработки (IDE).
Gemini 3 выходит в виде полноценного портфолио:
-
Gemini 3 Pro: флагманская передовая модель;
-
Gemini 3 Deep Think: расширенный режим рассуждений;
-
модели генеративных интерфейсов, обеспечивающие работу функций Visual Layout (Визуальный макет) и Dynamic View (Динамический вид);
-
Gemini Agent для выполнения многоэтапных задач;
-
движок Gemini 3, встроенный в Google Antigravity, новую среду разработки компании, ориентированную на агентов.
«Это лучшая модель в мире с безумным отрывом!» — написал научный сотрудник Google DeepMind И Тай (Yi Tay) в X.
Действительно, независимая организация по бенчмаркингу и анализу ИИ Artificial Analysis уже короновала Gemini 3 Pro как «нового лидера в области ИИ» в глобальном масштабе: модель набрала рекордные 73 балла в индексе организации, подняв Google с 9-го места в общем зачете, которое занимала предыдущая модель Gemini 2.5 Pro (у нее было 60 баллов позади моделей от OpenAI, Moonshot AI, xAI, Anthropic и MiniMax). Как написала Artificial Analysis в X: «Впервые компания Google обладает самой интеллектуальной моделью».
Индекс интеллекта Artificial Analysis за конец ноября 2025 года. Источник: Artificial Analysis
Другой независимый сайт с таблицами лидеров, LMArena, сообщил, что Gemini 3 Pro заняла первое место в мире по всем своим основным оценочным направлениям, включая текстовые рассуждения, работу с визуальными данными, программирование и веб-разработку.
В публичном посте аккаунт @arena в X отметил, что модель превзошла даже только что выпущенный (несколько часов назад) Grok-4.1, а также Claude 4.5 и системы класса GPT-5 в таких категориях, как математика, запросы большого объема, творческое письмо и ряд профессиональных бенчмарков.
В посте также подчеркивался масштаб преимуществ по сравнению с Gemini 2.5 Pro, включая скачок на 50 пунктов по текстовому рейтингу Эло, увеличение на 70 пунктов в работе с визуальными данными и рост на 280 пунктов в задачах веб-разработки.
Хотя эти результаты отражают голосование реального сообщества и остаются предварительными, они сигнализируют о необычайно широком улучшении производительности в тех областях, где предыдущие модели Gemini отставали от конкурентов.
Что это значит для Google в жесткой гонке ИИ
Этот запуск представляет собой один из самых масштабных и тщательно скоординированных релизов моделей от Google.
Gemini 3 выпускается одновременно в Google Search, приложении Gemini, Google AI Studio, Vertex AI и целом ряде инструментов для разработчиков.
Руководители подчеркнули, что эта интеграция отражает контроль Google над аппаратным обеспечением на базе тензорных процессоров (TPU — собственных чипов компании, конкурирующих с графическими процессорами Nvidia), инфраструктурой дата-центров и потребительскими продуктами.
По данным компании, приложение Gemini в настоящее время насчитывает более 650 миллионов активных пользователей в месяц, более 13 миллионов разработчиков создают продукты с помощью инструментов ИИ от Google, а более 2 миллиардов пользователей ежемесячно взаимодействуют с функциями AI Overviews в Поиске на базе Gemini.
В центре релиза находится сдвиг в сторону агентного ИИ — систем, которые планируют, действуют, навигаруют по интерфейсам и координируют инструменты, а не просто генерируют текст.
Gemini 3 разработана для перевода высокоуровневых инструкций в многоэтапные рабочие процессы на различных устройствах и в приложениях, обладая способностью генерировать функциональные интерфейсы, запускать инструменты и управлять сложными задачами.
Значительный прирост производительности по сравнению с Gemini 2.5 Pro
Gemini 3 Pro демонстрирует огромный прирост производительности по сравнению с Gemini 2.5 Pro в области рассуждений, математики, мультимодальности, использования инструментов, программирования и долгосрочного планирования. Данные бенчмарков от Google показывают существенные улучшения во многих категориях.
Gemini 3 Pro дебютировала на вершине таблицы лидеров LMArena по текстовым рассуждениям, набрав предварительный рейтинг Эло 1501 на основе предварительного голосования сообщества. Это первая языковая модель (LLM), преодолевшая отметку в 1500 баллов.
График рейтинга Эло Google Gemini 3. Источник: Google
Это ставит ее выше недавно анонсированной модели Grok-4.1-thinking от xAI (1484) и Grok-4.1 (1465), обе из которых были представлены всего несколькими часами ранее, а также выше Gemini 2.5 Pro (1451) и недавних релизов Claude Sonnet и Opus.
Хотя LMArena охватывает только производительность текстовых рассуждений, а результаты помечены как предварительные, этот рейтинг позиционирует Gemini 3 Pro как самую сильную из публично оцениваемых моделей по данному бенчмарку на день ее запуска — хотя и не обязательно как лидера в мире по всем модальностям, задачам или наборам тестов.
Диаграмма бенчмарков Google Gemini 3. Источник: Google
В математических и научных рассуждениях Gemini 3 Pro набрала 95% в AIME 2025 без использования инструментов и 100% с выполнением кода, по сравнению с 88% у ее предшественницы.
В тесте GPQA Diamond показатель вырос до 91.9% с 86.4%. Модель также продемонстрировала крупный скачок в MathArena Apex, достигнув 23.4% против 0.5% у Gemini 2.5 Pro, и показала 31.1% в ARC-AGI-2 по сравнению с 4.9% ранее.
ARC-AGI-2 — это вторая версия корпуса абстракции и рассуждений (ARC), бенчмарка, представленного исследователем ИИ Франсуа Шолле для измерения генерализации, а не запоминания.
В отличие от типичных оценок с выбором ответа или на основе датасетов, ARC-AGI-2 предлагает моделям крошечные головоломки на основе сетки, которые требуют поиска и применения абстрактных правил.
Каждая задача содержит несколько примеров ввода-вывода, и модель должна сделать вывод о лежащем в основе преобразовании и применить его к новому тестовому случаю. Проблемы охватывают визуальное распознавание образов, манипулирование символами, трансформацию объектов, пространственные рассуждения и индукцию правил — все это призвано проверить возможности рассуждений, не зависящие от знакомства с обучающей выборкой.
Новый вариант ARC-AGI-2 намеренно сконструирован так, чтобы быть выходящим за рамки распределения и устойчивым к запоминанию, что делает его одним из самых сложных бенчмарков для больших языковых моделей. Его задачи спроектированы так, чтобы подвергнуть стресс-тестированию способность модели выводить ранее не встречавшееся правило исключительно из примеров, что служит прокси для ранних форм обобщенного решения проблем.
Диаграмма результатов Google Gemini 3 Pro и Deep Think в бенчмарк-тесте ARC-AGI 2. Источник: Google
Удивительно, но версия Gemini 3 «Deep Think», созданная для того, чтобы тратить больше времени на решение проблем и использовать более глубокие рассуждения, набрала 45.1%, что представляет собой существенный скачок по сравнению с предыдущими передовыми моделями, которые обычно набирают от середины десятков до низких двадцатых процентов. Это также намного превышает показатель Gemini 3 Pro в 31.1% и является на порядок превосходящим улучшением по сравнению со старыми релизами Gemini.
Эти результаты показывают, что архитектура Deep Think особенно эффективна при генерации, проверке и пересмотре многоэтапных гипотез — именно тех способностях, для измерения которых создан ARC-AGI-2.
Мультимодальная производительность выросла по всем направлениям. Gemini 3 Pro набрала 81% в MMMU-Pro против 68% ранее и 87.6% в Video-MMMU по сравнению с 83.6%. Ее результат в ScreenSpot-Pro, ключевом бенчмарке для агентного использования компьютера, вырос с 11.4% до 72.7%. Понимание документов и рассуждения по графикам также улучшились.
Производительность в программировании и использовании инструментов показала столь же значительный прирост. Показатель модели в LiveCodeBench Pro достиг 2 439 против 1 775 ранее. На Terminal-Bench 2.0 она достигла 54.2% по сравнению с 32.6%. SWE-Bench Verified, измеряющий агентное программирование через структурированные исправления, вырос с 59.6% до 76.2%. Модель также набрала 85.4% в t2-bench по сравнению с 54.9%.
Бенчмарки длинного контекста и планирования указывают на более стабильное многоэтапное поведение. Gemini 3 достигла 77% на MRCR v2 при контексте 128 тыс. токенов (против 58%) и 26.3% при 1 миллионе токенов (против 16.4%). Ее балл в Vending-Bench 2 достиг $5 478.16 по сравнению с $573.64 у Gemini 2.5 Pro, что отражает более высокую согласованность в ходе долгосрочных процессов принятия решений.
Показатели понимания языка улучшились в SimpleQA Verified (72.1% против 54.5%), MMLU (91.8% против 89.5%) и наборе бенчмарков FACTS (70.5% против 63.4%), обеспечивая более надежную работу на основе фактов в регулируемых секторах.
Генеративные интерфейсы выводят Gemini за рамки текста
Gemini 3 представляет новый класс генеративных возможностей интерфейса в ориентированном на потребителя режиме AI Mode в Поиске Google и для разработчиков через Google AI Studio.
Visual Layout создает структурированные страницы в стиле журналов с изображениями, диаграммами и модулями, адаптированными под запрос.
Dynamic View генерирует функциональные компоненты интерфейса, такие как калькуляторы, симуляции, галереи и интерактивные графики.
Эти возможности станут доступны с сегодняшнего дня по всему миру в режиме AI Mode в Поиске Google, позволяя моделям выдавать информацию в визуальных, интерактивных форматах помимо статичного текста.
Разработчики могут воспроизводить аналогичные элементы пользовательского интерфейса через Google AI Studio и Gemini API, однако полноценные потребительские типы интерфейсов недоступны в качестве прямых выводов API; вместо этого разработчики получают базовый код или схему для самостоятельного рендеринга этих компонентов. Брендированные форматы Visual Layout и Dynamic View поэтому специфичны для Поска и не предоставляются в виде автономных функций API.
Google заявляет, что модель анализирует намерения пользователя для создания макета, наиболее подходящего для задачи. На практике это включает в себя все: от автоматического построения диаграмм для научных концепций до генерации пользовательских компонентов интерфейса, реагирующих на ввод данных пользователем.
Google провела пресс-конференцию за день до анонса Gemini 3, чтобы рассказать журналистам о семействе моделей, предполагаемых вариантах их использования и отличиях от предыдущих релизов Gemini. Конференцию вели несколько руководителей Google и DeepMind, которые продемонстрировали возможности модели и охарактеризовали Gemini 3 как шаг к более надежным, многоэтапным агентным системам, способным работать в рамках экосистемы Google.
В ходе брифинга спикеры подчеркнули, что Gemini 3 создана для обеспечения более стабильных долгосрочных рассуждений, лучшего использования инструментов и более плавных циклов планирования по сравнению с Gemini 2.5 Pro.
Один из докладчиков отметил, что модель извлекает выгоду из архитектуры, позволяющей ей генерировать и оценивать несколько гипотез параллельно, что повышает надежность при ответе на сложные с математической точки зрения вопросы и решении сложных процедурных задач.
Другой спикер пояснил, что улучшенные пространственные рассуждения Gemini 3 обеспечивают более надежное взаимодействие с элементами интерфейса, что поддерживает агентные рабочие процессы на разных экранах и в приложениях.
Докладчики подчеркнули рост внедрения решений корпоративными клиентами, отметив высокий спрос на мультимодальный анализ, структурированные рассуждения по документам и инструменты агентного программирования. Они заявили, что производительность Gemini 3 в мультимодальных и научных бенчмарках отражает стремление Google к обоснованным, проверяемым рассуждениям. Также обсуждались процессы безопасности и улучшения Gemini, включая снижение поддакивания (сикoфантства), более сильную устойчивость к инъекциям промптов и более структурированный конвейер оценки, руководствующийся Фондом безопасности передовых разработок Google, представленным еще в 2024 году.
Часть звонка была посвящена опыту разработчиков. Google рассказала об обновлениях своей AI Studio и API, которые позволяют разработчикам контролировать глубину рассуждений («thinking depth»), настраивать «разрешение» модели и комбинировать новые инструменты заземления (grounding) с контекстом URL и Поиска.
Демонстрации показали, как Gemini 3 генерирует интерфейсы приложений, управляет последовательностями инструментов и отлаживает код в Antigravity, иллюстрируя сдвиг модели в сторону агентной работы, а не одношаговой генерации.
На конференции Gemini 3 была представлена как комплексное обновление в области рассуждений, планирования, мультимодального понимания и рабочих процессов разработчиков, а Google охарактеризовала эти достижения как фундамент для своего следующего поколения продуктов и корпоративных сервисов на базе агентов.
Gemini Agent представляет автоматизацию многоэтапных рабочих процессов
Gemini Agent знаменует собой попытку Google выйти за рамки разговорного помощника в сторону операционного ИИ. Система координирует многоэтапные задачи в таких инструментах, как Gmail, Calendar, Canvas и живой просмотр веб-страниц. Она проверяет папки «Входящие», составляет черновики ответов, готовит планы, производит сортировку информации и рассуждает о сложных рабочих процессах, требуя при этом одобрения пользователя перед выполнением конфиденциальных действий.
На вчерашней пресс-конференции с журналистами накануне релиза Google сообщила, что агент разработан для обработки многошагового планирования и последовательностей использования инструментов с такой степенью последовательности, которая была невозможна в предыдущих поколениях.
Сначала он внедряется для подписчиков Google AI Ultra в приложении Gemini.
Google Antigravity и интеграция цепочки инструментов для разработчиков
Antigravity — это новая среда разработки Google, ориентированная на агентов и созданная на базе Gemini 3. Разработчики сотрудничают с агентами через редактор, терминал и браузер. Система координирует полностековые задачи, включая генерацию кода, прототипирование пользовательского интерфейса, отладку, выполнение в реальном времени и создание отчетов.
В более широкой экосистеме разработчиков Google AI Studio теперь включает режим Build (Сборка), который автоматически подключает правильные модели и API для ускорения создания приложений на базе ИИ. Поддержка аннотаций позволяет разработчикам прикреплять промпты к элементам пользовательского интерфейса для более быстрой итерации. Улучшения пространственного восприятия позволяют агентам интерпретировать движения мыши, аннотации на экране и макеты с несколькими окнами для более эффективного управления компьютерными интерфейсами.
Разработчики также получают новые элементы управления рассуждениями с помощью параметров «уровень мышления» (thinking level) и «разрешение модели» (model resolution) в Gemini API, а также более строгую валидацию подписей мыслей для многошаговой согласованности. Размещенный на сервере инструмент bash поддерживает безопасную генерацию многоязычного кода и прототипирование. Заземление с помощью Поиска Google и контекста URL теперь можно комбинировать для извлечения структурированной информации для последующих задач.
Влияние на корпоративный сектор и внедрение
Корпоративные команды получают возможности мультимодального понимания, автономного написания кода и долгосрочного планирования, необходимые для производственных сценариев использования. Новая модель объединяет анализ документов, аудио, видео, рабочих процессов и логов. Улучшения в пространственном и визуальном мышлении поддерживают робототехнику, автономные системы и сценарии, требующие навигации по экранам и приложениям. Понимание видео с высокой частотой кадров помогает разработчикам обнаруживать события в быстро меняющейся среде.
Возможности Gemini 3 по структурированному пониманию документов поддерживают юридическую экспертизу, обработку сложных форм и регулируемые рабочие процессы. Способность модели генерировать функциональные интерфейсы и прототипы с минимальным количеством подсказок сокращает циклы разработки. Кроме того, повышение надежности системы, стабильности вызова инструментов и удержания контекста делают многоэтапное планирование жизнеспособным для таких операций, как финансовое прогнозирование, автоматизация поддержки клиентов, моделирование цепочек поставок и предиктивное обслуживание.
Цены для разработчиков и API
Google раскрыла первоначальные цены на API для Gemini 3 Pro.
В режиме предварительного просмотра модель стоит 2 доллара за миллион входных токенов и 12 долларов за миллион выходных токенов для запросов объемом до 200 000 токенов в Google AI Studio и Vertex AI. Для запросов, требующих более 200 000 токенов, цена на входные данные удваивается до 2 долларов за 1 млн токенов, а на выходные данные возрастает до 18 долларов за 1 млн токенов.
По сравнению с ценами на API других передовых моделей ИИ от конкурирующих лабораторий, Gemini 3 находится в средне-высоком ценовом диапазоне, что может повлиять на ее внедрение, поскольку более дешевые и открытые китайские модели (с либеральной лицензией) все чаще находят применение у американских стартапов. Вот как она выглядит на их фоне:
|
Модель |
Вход (/1M токенов) |
Выход (/1M токенов) |
Общая стоимость |
Источник |
|
ERNIE 4.5 Turbo |
$0.11 |
$0.45 |
$0.56 |
|
|
ERNIE 5.0 |
$0.85 |
$3.40 |
$4.25 |
|
|
Qwen3 (Coder ex.) |
$0.85 |
$3.40 |
$4.25 |
|
|
GPT-5.1 |
$1.25 |
$10.00 |
$11.25 |
|
|
Gemini 2.5 Pro (≤200K) |
$1.25 |
$10.00 |
$11.25 |
|
|
Gemini 3 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
Gemini 2.5 Pro (>200K) |
$2.50 |
$15.00 |
$17.50 |
|
|
Gemini 3 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Grok 4 (0709) |
$3.00 |
$15.00 |
$18.00 |
|
|
Claude Opus 4.1 |
$15.00 |
$75.00 |
$90.00 |
Gemini 3 Pro также доступна бесплатно с ограничениями скорости в Google AI Studio для экспериментов.
Компания пока не объявила цены на Gemini 3 Deep Think, расширенные контекстные окна, генеративные интерфейсы или вызов инструментов.
Предприятиям, планирующим развертывание в больших масштабах, эти детали понадобятся для оценки эксплуатационных расходов.
Улучшения мультимодального, визуального и пространственного мышления
Усовершенствования Gemini 3 в области встраиваемого и пространственного мышления поддерживают указание и прогнозирование траекторий, выполнение задач и сложный анализ экранов. Эти возможности распространяются на настольные и мобильные среды, позволяя агентам интерпретировать элементы экрана, реагировать на контекст на экране и открывать новые формы автоматизации работы за компьютером.
Модель также обеспечивает улучшенный анализ видео с высокой частотой кадров для изучения динамичных сцен, а также долговременный отзыв контекста видео для синтеза повествования на основе часов видеозаписей. Примеры от Google показывают, что модель генерирует полноценные интерактивные демо-приложения непосредственно по текстовым запросам, иллюстрируя глубину мультимодальной и агентной интеграции.
Вайб-кодинг и агентная генерация кода
Gemini 3 развивает концепцию Google «вайб-кодинга» (vibe coding), где естественный язык выступает в роли основного синтаксиса. Модель способна переводить высокоуровневые идеи в полноценные приложения с помощью всего одного запроса, управляя многоэтапным планированием, генерацией кода и визуальным дизайном. Корпоративные партнеры, такие как Figma, JetBrains, Cursor, Replit и Cline, сообщают о более точном следовании инструкциям, более стабильной работе агентов и более качественной манипуляции кодом в условиях длинного контекста по сравнению с предыдущими моделями.
Слухи и толки
В недели, предшествовавшие анонсу, платформа X стала центром спекуляций вокруг Gemini 3.
Известные аккаунты, такие как @slow_developer, предполагали, что внутренние сборки значительно опережают Gemini 2.5 Pro и, вероятно, превосходят показатели конкурентов в области рассуждений и использования инструментов. Другие, включая @synthwavedd и @VraserX, отмечали неоднородное поведение в ранних чекпоинтах, но признавали преимущество Google в отношении оборудования TPU и обучающих данных.
Вирусные ролики от пользователей вроде @lepadphone и @StijnSmits демонстрировали, как модель генерирует веб-сайты, анимацию и макеты пользовательского интерфейса на основе единых запросов, что усиливало ажиотаж.
Предиктивные рынки на Polymarket подогревали спекуляции. Крупные игроки («киты») резко подняли коэффициенты на релиз в середине ноября, вызвав бурные споры об инсайдерской активности. Временный спад во время глобального сбоя Cloudflare стал поводом для шуток и конспирологии, после чего коэффициенты снова пошли вверх.
Ключевой момент настал, когда пользователи, в том числе @cheatyyyy, поделились тем, что выглядело как таблица бенчмарков внутренней карты модели для Gemini 3 Pro.
Изображение стремительно разошлось по сети, а комментаторы вроде @deedydas и @kimmonismus утверждали, что цифры свидетельствуют о существенном отрыве.
Когда Google опубликовала официальные бенчмарки, они точь-в-точь совпали с утечкой, подтвердив подлинность документа.
К дню запуска энтузиазм достиг пика. Короткий пост «Geminiii» от Сундара Пичаи привлек огромное внимание, а первые тестировщики быстро поделились реальными примерами того, как Gemini 3 создает интерфейсы, полноценные приложения и сложный визуальный дизайн.
Хотя возникли некоторые опасения по поводу цен и эффективности, преобладающие настроения описывали запуск как поворотный момент для Google и демонстрацию ее полнофункциональных возможностей в сфере искусственного интеллекта.
Безопасность и оценка
Google заявляет, что Gemini 3 — ее самая безопасная модель на сегодняшний день, отличающаяся сниженной склонностью к угодничеству, повышенной устойчивостью к инъекциям промптов и лучшей защитой от ненадлежащего использования. Компания сотрудничала с внешними группами, включая Apollo и Vaultis, и провела оценку с использованием своей структуры Frontier Safety Framework.
Развертывание в продуктах Google
Gemini 3 доступна в режиме Google Search AI, приложении Gemini, Google AI Studio, Vertex AI, Gemini CLI и на новой платформе разработки на базе агентов от Google — Antigravity. Google заявляет, что в дальнейшем появятся и другие варианты Gemini 3.
Gemini 3 представляет собой крупнейший шаг вперед для Google в области рассуждений, мультимодальности, корпоративной надежности и агентных возможностей. Прирост производительности модели по сравнению с Gemini 2.5 Pro весьма существенен в математическом анализе, зрении, программировании и планировании. Генеративные интерфейсы, Gemini Agent и Antigravity демонстрируют переход к системам, которые не просто отвечают на запросы, но планируют задачи, строят интерфейсы и координируют инструменты.
В сочетании с необычайно интенсивным циклом шумихи и утечек этот запуск знаменует собой важный момент в ландшафте ИИ, поскольку Google активно расширяет свое присутствие как в сфере потребительских, так и корпоративных рабочих процессов на базе искусственного интеллекта.



