Google DeepMind представляет агента Gemini 2.5
Некоторые из крупнейших разработчиков моделей для работы с большими языковыми моделями (LLM) стремятся выйти за рамки мультимодальных чат-ботов, превращая свои модели в «агенты», которые действительно могут совершать больше действий от имени пользователя на веб-сайтах. Вспомните агент ChatGPT от OpenAI (ранее известный как «Operator») и функцию Computer Use от Anthropic, выпущенные за последние два года.
Теперь к этой гонке присоединяется и Google. Сегодня исследовательская лаборатория DeepMind, принадлежащая технологическому гиганту, представила новую, доработанную и специально обученную версию своей мощной языковой модели Gemini 2.5 Pro, получившую название «Gemini 2.5 Pro Computer Use». Она способна использовать виртуальный браузер для серфинга в сети от вашего имени, извлекать информацию, заполнять формы и даже совершать действия на веб-сайтах — и всё это на основе простого текстового запроса пользователя.
«Это пока ранний этап, но способность модели взаимодействовать с интернетом — например, прокручивать страницы, заполнять формы и переходить по выпадающим спискам — это важный шаг вперед в создании универсальных агентов», — заявил генеральный директор Google Сундар Пичаи (Sundar Pichai) в своем более длинном заявлении в социальной сети X.
Однако модель недоступна потребителям напрямую от Google.
Вместо этого Google заключила партнерство с компанией Browserbase, основанной бывшим инженером Twilio Полом Клейном (Paul Klein) в начале 2024 года, которая предлагает виртуальные «безголовые» (headless) веб-браузеры специально для использования ИИ-агентами и приложениями. («Безголовый» браузер — это браузер, которому не требуется графический пользовательский интерфейс или GUI для навигации по сайтам, хотя в данном случае и в некоторых других Browserbase отображает графическое представление для пользователя).
Пользователи могут протестировать новую модель Gemini 2.5 Computer Use напрямую на сайте Browserbase здесь и даже сравнить ее лицом к лицу со старыми конкурирующими предложениями от OpenAI и Anthropic в новой «Browser Arena», запущенной стартапом (хотя одновременно с Gemini можно выбрать только одну дополнительную модель).
Для разработчиков ИИ она выпускается в виде исходной, хотя и проприетарной LLM через Gemini API в Google AI Studio для быстрого прототипирования, а также через средство выбора моделей и платформу создания приложений Vertex AI в Google Cloud.
Новое предложение опирается на возможности Gemini 2.5 Pro, выпущенной в марте 2025 года, но с тех пор неоднократно и существенно обновлявшейся. Основной упор в ней сделан на предоставление ИИ-агентам возможности осуществлять прямые взаимодействия с пользовательскими интерфейсами, включая браузеры и мобильные приложения.
В целом, судя по всему, Gemini 2.5 Computer Use разработана для того, чтобы позволить разработчикам создавать агентов, способных автономно выполнять задачи, управляемые интерфейсом — такие как клики, ввод текста, прокрутка, заполнение форм и навигация за экранами входа в систему.
Вместо того чтобы полагаться исключительно на API или структурированные входные данные, эта модель позволяет ИИ-системам взаимодействовать с программным обеспечением визуально и функционально, подобно тому, как это делает человек.
Краткие практические тесты пользователей
В ходе моих кратких и ненаучных первоначальных тестов на сайте Browserbase модель Gemini 2.5 Computer Use успешно перешла на официальный сайт Тейлор Свифт в соответствии с инструкцией и предоставила мне краткую сводку того, что продается или рекламируется в верхней части страницы — специальное издание ее новейшего альбома «The Life of A Showgirl».
В другом тесте я попросил Gemini 2.5 Computer Use поискать на Amazon высоко оцененные и получившие хорошие отзывы солнечные светильники, которые можно было бы установить на заднем дворе. Я с удовольствием наблюдал, как модель всего за несколько секунд успешно справилась с капчей Google Search, предназначенной для отсеивания нелюдей («Выберите все квадратики с мотоциклом»).
Тем не менее, пройдя этот этап, она зависла и не смогла завершить задачу, несмотря на выдачу сообщения о том, что «задача выполнена».
Здесь также стоит отметить, что в то время как агент ChatGPT от OpenAI и Claude от Anthropic могут создавать и редактировать локальные файлы от имени пользователя (например, презентации PowerPoint, электронные таблицы или текстовые документы), Gemini 2.5 Computer Use в настоящее время не предоставляет прямой доступ к файловой системе или возможности создания файлов.
Вместо этого она предназначена для управления и навигации по веб-интерфейсам и мобильным интерфейсам с помощью таких действий, как клики, ввод текста и прокрутка. Ее вывод ограничивается предлагаемыми действиями в пользовательском интерфейсе или текстовыми отходами в стиле чат-бота; любые структурированные данные, такие как документ или файл, должны обрабатываться разработчиком отдельно, часто с помощью пользовательского кода или сторонних интеграций.
Тесты производительности (бенчмарки)
По заявлению Google, модель Gemini 2.5 Computer Use продемонстрировала лидирующие результаты в многочисленных тестах на управление интерфейсом, особенно в сравнении с другими крупными ИИ-системами, включая Claude Sonnet и агентские модели OpenAI.
Оценки проводились через Browserbase и в ходе собственного тестирования Google.
Некоторые ключевые результаты:
-
Online-Mind2Web (Browserbase): 65,7% для Gemini 2.5 против 61,0% (Claude Sonnet 4) и 44,3% (OpenAI Agent)
-
WebVoyager (Browserbase): 79,9% для Gemini 2.5 против 69,4% (Claude Sonnet 4) и 61,0% (OpenAI Agent)
-
AndroidWorld (DeepMind): 69,7% для Gemini 2.5 против 62,1% (Claude Sonnet 4); модель OpenAI не удалось измерить из-за отсутствия доступа
-
OSWorld: в настоящее время не поддерживается Gemini 2.5; результат главного конкурента составил 61,4%
График производительности Gemini 2.5 Pro Computer Use в сравнении с конкурентами. Источник: Google DeepMind
Помимо высокой точности, Google сообщает, что модель работает с меньшей задержкой, чем другие решения для управления браузером, что является ключевым фактором в рабочих сценариях вроде автоматизации UI и тестирования.
Как это работает
Агенты на базе модели Computer Use функционируют в рамках цикла взаимодействия. Они получают:
Модель анализирует эти входные данные и выдает рекомендуемое действие интерфейса, например, нажатие кнопки или ввод текста в поле.
При необходимости она может запросить у конечного пользователя подтверждение для более рискованных задач, таких как совершение покупки.
После выполнения действия состояние интерфейса обновляется, и модели отправляется новый скриншот. Цикл продолжается до тех пор, пока задача не будет выполнена или остановлена из-за ошибки или решения по безопасности.
Модель использует специальный инструмент под названием computer_use и может быть интегрирована в пользовательские среды с помощью таких инструментов, как Playwright, или через демо-песочницу Browserbase.
Сценарии использования и внедрение
По данным Google, команды как внутри компании, так и за ее пределами уже начали использовать модель в нескольких областях:
-
Команда платформы платежей Google сообщает, что Gemini 2.5 Computer Use успешно восстанавливает более 60% неудачных запусков тестов, устраняя крупный источник инженерных неэффективностей.
-
Autotab, сторонняя платформа ИИ-агентов, заявила, что модель превзошла другие в сложных задачах синтаксического анализа данных, повысив производительность до 18% в самых сложных тестах.
-
Poke.com, провайдер проактивных ИИ-ассистентов, отметил, что модель Gemini часто работает на 50% быстрее конкурирующих решений при взаимодействии с интерфейсом.
Модель также используется в собственных усилиях Google по разработке продуктов, включая Project Mariner, Firebase Testing Agent и AI Mode в Поиске.
Меры безопасности
Поскольку эта модель напрямую управляет программными интерфейсами, Google уделяет особое внимание многоуровневому подходу к безопасности:
-
Служба безопасности на каждом этапе (per-step safety service) проверяет каждое предлагаемое действие перед его выполнением.
-
Разработчики могут определять инструкции системного уровня для блокировки или запроса подтверждения определенных действий.
-
Модель включает встроенные средства защиты во избежание действий, которые могут скомпрометировать безопасность или нарушить правила использования Google.
Например, если модель сталкивается с CAPTCHA, она генерирует действие для нажатия на флажок, но помечает его как требующее подтверждения пользователя, гарантируя, что система не продолжит работу без контроля человека.
Технические возможности
Модель поддерживает широкий спектр встроенных действий интерфейса, таких как:
-
click_at,type_text_at,scroll_document,drag_and_dropи многое другое -
Функции, определяемые пользователем, могут быть добавлены для расширения ее возможностей на мобильные или пользовательские среды
-
Координаты экрана нормализуются (шкала 0–1000) и переводятся обратно в размеры пикселей во время выполнения
Она принимает в качестве входных данных изображения и текст и выдает текстовые ответы или вызовы функций для выполнения задач. Рекомендуемое разрешение экрана для достижения оптимальных результатов составляет 1440×900, хотя она может работать и с другими размерами.
Цены на API остались практически такими же, как у Gemini 2.5 Pro
Ценообразование для Gemini 2.5 Computer Use тесно связано со стандартной моделью Gemini 2.5 Pro. Обе используют одинаковую структуру тарификации за токен: входные токен-промпты оцениваются в $1,25 за миллион токенов для запросов объемом менее 200 000 токенов и в $2,50 за миллион токенов для более длинных запросов.
Выходные токены разделены аналогичным образом: $10,00 за миллион для небольших ответов и $15,00 для более крупных.
Модели расходятся в доступности и дополнительных функциях.
Gemini 2.5 Pro включает бесплатный тарифный план, который позволяет разработчикам использовать модель бесплатно, без публично объявленного явного лимита токенов, хотя использование может регулироваться ограничениями скорости или квот в зависимости от платформы (например, Google AI Studio).
Этот бесплатный доступ включает как входные, так и выходные токены. Как только разработчики превышают выделенную квоту или переходят на платный тариф, применяется стандартная цена за токен.
В отличие от этого, Gemini 2.5 Computer Use доступна исключительно по платному тарифу. В настоящее время для этой модели нет бесплатного доступа, и все использование влечет за собой оплату в зависимости от токенов с самого начала.
Что касается функций, Gemini 2.5 Pro поддерживает дополнительные возможности, такие как кэширование контекста (от $0,31 за миллион токенов) и заземление с помощью Google Search (бесплатно до 1 500 запросов в день, затем $35 за каждые 1 000 дополнительных запросов). В настоящее время для Computer Use они недоступны.
Еще одно отличие заключается в обработке данных: выходные данные модели Computer Use не используются для улучшения продуктов Google на платном тарифе, в то время как бесплатное использование Gemini 2.5 Pro способствует улучшению модели, если явно не указан отказ от этого.
В целом, разработчики могут рассчитывать на схожие расходы на основе токенов для обеих моделей, но им следует учитывать доступ к тарифам, включенные возможности и политики использования данных при принятии решения о том, какая модель лучше всего соответствует их потребностям.



