Google выпускает компактную периферийную модель FunctionGemma, способную управлять мобильными устройствами
В то время как Gemini 3 продолжает производить фурор, Google не собирается сбавлять обороты в выпуске новых моделей.
Вчера компания выпустила FunctionGemma — специализированную ИИ-модель с 270 миллионами параметров, созданную для решения одной из самых устойчивых проблем современной разработки приложений: надежности на периферийных устройствах.
В отличие от универсальных чат-ботов, FunctionGemma разработана для одной важнейшей задачи — преобразования пользовательских команд на естественном языке в структурированный код, который приложения и устройства могут напрямую выполнять, и все это без подключения к облаку.
Этот релиз знаменует собой значительный стратегический поворот для Google DeepMind и команды Google AI Developers. В то время как индустрия продолжает погоню за триллионными масштабами в облаке, FunctionGemma делает ставку на «малые языковые модели» (SLM), работающие локально на телефонах, в браузерах и на IoT-устройствах.
Для инженеров по искусственному интеллекту и корпоративных разработчиков эта модель предлагает новый архитектурный примитив: ориентированный на конфиденциальность «маршрутизатор», способный обрабатывать сложную логику на устройстве с пренебрежимо малой задержкой.
FunctionGemma доступна для скачивания на платформах Hugging Face и Kaggle. Вы также можете протестировать модель в действии, скачав приложение Google AI Edge Gallery в Google Play Store.
Скачок производительности
По своей сути FunctionGemma устраняет «разрыв в исполнении» в генеративном искусственном интеллекте. Стандартные большие языковые модели (LLM) отлично справляются с поддержанием беседы, но часто испытывают трудности с надежным вызовом программных действий — особенно на устройствах с ограниченными ресурсами.
Согласно внутреннему тестированию Google «Mobile Actions», обычная малая модель демонстрирует низкую надежность, достигая лишь 58% базовой точности в задачах вызова функций. Однако после дообучения (fine-tuning) под эту конкретную задачу точность FunctionGemma подскочила до 85%, что позволило создать специализированную модель, способную демонстрировать уровень успешности моделей, превосходящих ее по размеру во много раз.
График, показывающий производительность FunctionGemma до и после дообучения. Источник: Google
Модель позволяет обрабатывать не только простые переключатели вкл./выкл.; она может разбирать сложные аргументы, например, определять конкретные координаты сетки для управления игровой механикой или детальную логику.
Релиз включает в себя нечто большее, чем просто веса модели. Google предоставляет разработчикам полноценный «рецепт», в том числе:
-
Модель: трансформер с 270 миллионами параметров, обученный на 6 триллионах токенов.
-
Данные для обучения: набор данных «Mobile Actions», помогающий разработчикам обучать собственные агенты.
-
Поддержка экосистемы: совместимость с библиотеками Hugging Face Transformers, Keras, Unsloth и NVIDIA NeMo.
Омар Сансевиеро (Omar Sanseviero), руководитель направления взаимодействия с разработчиками в Google DeepMind, подчеркнул универсальность релиза в X (бывший Twitter), отметив, что модель «создана специально для ваших задач» и может работать «на вашем телефоне, в браузере или на других устройствах».
Такой подход с приоритетом локальной обработки дает три явных преимущества:
-
Конфиденциальность: личные данные (например, записи в календаре или контакты) никогда не покидают устройство.
-
Задержка: действия происходят мгновенно, без ожидания ответа от сервера. Небольшой размер означает высокую скорость обработки входных данных, особенно при доступе к таким ускорителям, как графические (GPU) и нейроморфные (NPU) процессоры.
-
Стоимость: разработчики не платят комиссию за API на каждый токен при простых взаимодействиях.
Для разработчиков ИИ: новый паттерн для производственных рабочих процессов
Для корпоративных разработчиков и системных архитекторов FunctionGemma знаменует собой переход от монолитных систем искусственного интеллекта к составным (compound) системам. Вместо того чтобы перенаправлять каждый незначительный запрос пользователя в массивную, дорогую облачную модель вроде GPT-4 или Gemini 1.5 Pro, разработчики теперь могут развернуть FunctionGemma в качестве интеллектуального «регулировщика трафика» на периферии.
Вот как разработчики ИИ должны концептуально подходить к использованию FunctionGemma в продакшене:
1. Архитектура «регулировщика трафика»: В рабочей среде FunctionGemma может служить первой линией обороны. Она находится на устройстве пользователя, мгновенно обрабатывая распространенные высокочастотные команды (навигация, управление медиафайлами, базовый ввод данных). Если запрос требует глубокого рассуждения или знаний о мире, модель может распознать эту необходимость и перенаправить запрос в более крупную облачную модель. Такой гибридный подход кардинально снижает затраты на облачный вывод и задержки. Это позволяет реализовывать такие сценарии, как маршрутизация запросов к соответствующим субагентам.
2. Детерминированная надежность вместо творческого хаоса: Предприятия редко нуждаются в том, чтобы их банковские приложения или календари проявляли «творческий подход». Им требуется точность. Скачок до 85% точности подтверждает, что специализация превосходит размер. Дообучение этой небольшой модели на доменных данных (например, на проприетарных корпоративных API) создает высоконадежный инструмент с предсказуемым поведением — обязательное требование для развертывания в продакшене.
3. Соответствие требованиям конфиденциальности: В таких секторах, как здравоохранение, финансы или безопасные корпоративные операции, отправка данных в облако часто представляет собой риск с точки зрения соблюдения нормативных требований. Поскольку FunctionGemma достаточно эффективна для работы на устройстве (совместима с NVIDIA Jetson, мобильными процессорами и браузерными Transformers.js), конфиденциальные данные, такие как личная информация (PII) или проприетарные команды, никогда не покидают локальную сеть.
Лицензирование: условно-открытая система с ограничениями
FunctionGemma выпускается на условиях пользовательской лицензии Google на Gemma (Gemma Terms of Use). Для корпоративных и коммерческих разработчиков это принципиальное отличие от стандартных открытых лицензий, таких как MIT или Apache 2.0.
Хотя Google описывает Gemma как «открытую модель», она не является строго «открытым исходным кодом» (Open Source) по определению организации Open Source Initiative (OSI).
Лицензия разрешает бесплатное коммерческое использование, распространение и модификацию, но включает в себя конкретные ограничения на использование (Usage Restrictions). Разработчикам запрещено использовать модель для запрещенной деятельности (например, для генерации языка вражды или вредоносного ПО), при этом Google оставляет за собой право обновлять эти условия.
Для подавляющего большинства стартапов и разработчиков эта лицензия достаточно мягкая для создания коммерческих продуктов. Тем не менее командам, создающим технологии двойного назначения или нуждающимся в строгой свободе copyleft, следует внимательно изучить специальные пункты, касающиеся «вредного использования» (Harmful Use) и указания авторства.
Исправление: В этой статье Омар Сансевиеро ошибочно был указан как руководитель отдела разработки в Hugging Face (его предыдущая должность). Информация была обновлена в соответствии с его текущей ролью в Google DeepMind. Приносим извинения за допущенную ошибку.



