Запуск Interactions API от Google DeepMind

Запуск Interactions API от Google DeepMind

Последние два года фундаментальной единицей разработки в области генеративного ИИ был «запрос на генерацию» (completion).

Вы отправляете текстовый запрос модели, она присылает текст в ответ, и сеанс связи завершается. Если вы хотите продолжить разговор, вам приходится снова отправлять модели всю историю диалога. Эта «несохраняющая состояние» (stateless) архитектура, воплощенная в классическом эндпоинте Google generateContent, идеально подходила для простых чат-ботов. Но по мере того, как разработчики переходят к автономным агентам, которые используют инструменты, поддерживают сложную историю и «мыслят» на протяжении долгого времени, эта модель без сохранения состояния становится серьезным узким местом.

На прошлой неделе компания Google DeepMind наконец устранила этот пробел в инфраструктуре, объявив о публичном бета-запуске Interactions API (/interactions).

Хотя OpenAI начала этот сдвиг еще в марте 2025 года, представив Responses API, появление разработки от Google свидетельствует о ее стремлении развивать передовые технологии. Interactions API — это не просто инструмент управления состоянием; это единый интерфейс, призванный воспринимать языковые модели (LLM) не столько как генераторы текста, сколько как удаленные операционные системы.

Модель «удаленных вычислений»

Главная инновация Interactions API заключается в использовании серверного состояния по умолчанию.

Раньше разработчику, создававшему сложного агента, приходилось вручную управлять растущим JSON-списком каждого хода «пользователя» и «модели», отправляя мегабайты истории туда и обратно с каждым запросом. С новым API разработчики просто передают previous_interaction_id. Инфраструктура Google сохраняет историю разговоров, результаты работы инструментов и «мыслительные» процессы на своей стороне.

«Модели превращаются в системы и со временем могут даже стать самими агентами», — написали Али Чевик (Ali Çevik) и Филипп Шмид (Philipp Schmid) из DeepMind в официальном блоге компании, посвященном новой парадигме. — «Попытка втиснуть эти возможности в generateContent привела бы к созданию избыточно сложного и хрупкого API».

Такой подход обеспечивает фоновое выполнение (Background Execution), что является критически важной функцией для эпохи агентов. Сложные рабочие процессы — например, часовой поиск в интернете для синтеза отчета — часто вызывают тайм-ауты HTTP в стандартных API. Interactions API позволяет разработчикам запустить агента с помощью background=true,, отключиться и опросить систему о результатах позже. Фактически он превращает API в очередь задач для искусственного интеллекта.

Встроенная «глубокая аналитика» (Deep Research) и поддержка MCP

Google использует эту новую инфраструктуру для запуска своего первого встроенного агента: Gemini Deep Research.

Этот агент, доступный через тот же эндпоинт /interactions, способен выполнять «долгосрочные исследовательские задачи». В отличие от стандартной модели, которая предсказывает следующий токен на основе вашего запроса, агент Deep Research выполняет цикл поисков, чтения и синтеза данных.

Что особенно важно, Google также поддерживает открытую экосистему, добавляя встроенную поддержку Протокола контекста модели (Model Context Protocol, MCP). Это позволяет моделям Gemini напрямую вызывать внешние инструменты, размещенные на удаленных серверах (например, службы погоды или базы данных), избавляя разработчика от необходимости писать собственный связующий код для синтаксического анализа вызовов инструментов.

Ландшафт: Google присоединяется к OpenAI в эру «сохранения состояния»

Можно сказать, что Google догоняет конкурентов, но делает это со своим собственным философским подходом. OpenAI отказалась от работы без сохранения состояния девять месяцев назад, запустив Responses API в марте 2025 года.

Хотя оба технологических гиганта решают проблему раздувания контекста, их решения расходятся в вопросах прозрачности:

OpenAI (подход сжатия): Responses API от OpenAI представил функцию компактизации (Compaction) — инструмент, который сокращает историю разговоров, заменяя результаты работы инструментов и цепочки рассуждений непрозрачными «зашифрованными элементами сжатия». Это повышает эффективность использования токенов, но создает «черный ящик», в котором прошлые рассуждения модели скрыты от разработчика.

Google (хостинговый подход): Interactions API от Google сохраняет всю историю доступной и компонуемой. Модель данных позволяет разработчикам «отлаживать, манипулировать, передавать в потоковом режиме и анализировать чередующиеся сообщения». Здесь приоритетом является проверяемость, а не сжатие.

Поддерживаемые модели и доступность

Interactions API в настоящее время находится в стадии публичного бета-тестирования (документация доступна здесь) и сразу же доступен через Google AI Studio. Он поддерживает весь спектр новейших моделей Google, гарантируя, что разработчики смогут подобрать размер модели под свою конкретную агентную задачу:

  • Gemini 3.0: предварительная версия Gemini 3 Pro (Gemini 3 Pro Preview).

  • Gemini 2.5: Flash, Flash-lite и Pro.

  • Агенты: предварительная версия Deep Research (deep-research-pro-preview-12-2025).

С коммерческой точки зрения API интегрирован в существующую ценовую структуру Google: вы платите стандартные тарифы за входные и выходные токены в зависимости от выбранной модели. Тем не менее ценность предложения меняется с новыми правилами хранения данных. Поскольку этот API сохраняет состояние (stateful), Google должна хранить историю ваших взаимодействий, чтобы обеспечивать такие функции, как неявное кэширование и извлечение контекста.

Доступ к этому хранилищу определяется вашим тарифным планом. Разработчики на бесплатном тарифе (Free Tier) ограничены политикой хранения данных в течение 1 дня, чего достаточно для поверхностного тестирования, но недостаточно для долгосрочной памяти агента.

Разработчики на платном тарифе (Paid Tier) получают 55-дневный срок хранения данных. Этот расширенный период нужен не только для аудита; он эффективно снижает общую стоимость владения (TCO) за счет максимального увеличения количества попаданий в кэш. Сохраняя историю «горячей» на сервере почти два месяца, вы избегаете затрат на повторную обработку огромных контекстных окон для постоянных пользователей, что делает платный тариф значительно более выгодным для агентов промышленного уровня.

Примечание: поскольку это бета-релиз, Google предупреждает, что функции и схемы могут претерпевать изменения, нарушающие обратную совместимость.

«Вы взаимодействуете с системой»

Сэм Виттевейн (Sam Witteveen), эксперт по машинному обучению от Google и генеральный директор Red Dragon AI, считает этот релиз необходимым этапом эволюции стека разработчика.

«Если мы оглянемся назад… вся идея сводилась к простому вводу и выводу текста», — отметил Виттевейн в техническом разборе релиза на YouTube. — «Но теперь… вы взаимодействуете с системой. Системой, которая может использовать несколько моделей, выполнять многократные циклы вызовов, применять инструменты и выполнять код на бэкенде».

Виттевейн подчеркнул немедленную экономическую выгоду этой архитектуры: неявное кэширование (Implicit Caching). Поскольку история разговоров хранится на серверах Google, с разработчиков не взимается плата за многократную повторную загрузку одного и того же контекста. «Вам не нужно платить так много за токены, которые вы вызываете», — пояснил он.

Тем не менее релиз не лишен шероховатостей. Виттевейн раскритиковал текущую реализацию системы цитирования агента Deep Research. Хотя агент и указывает источники, возвращаемые URL-адреса часто завернуты во внутренние перенаправления Google/Vertex AI, а не представляют собой прямые рабочие ссылки.

«Моя главная претензия заключается в том, что… если я сохраню эти URL-адреса и попытаюсь использовать их в другой сессии, они не будут работать», — предупредил Виттевейн. — «Если я хочу сделать для кого-то отчет с цитатами, я хочу, чтобы люди могли кликать по ссылкам прямо из PDF-файла… Использование чего-то вроде medium.com в качестве цитаты [без прямой ссылки] — это не очень хорошо».

Что это значит для вашей команды

Для ведущих инженеров по ИИ (Lead AI Engineers), сосредоточенных на быстром развертывании и тонкой настройке моделей, этот релиз предлагает прямое архитектурное решение постоянной проблемы «тайм-аутов»: фоновое выполнение (Background Execution).

Вместо создания сложных асинхронных обработчиков или управления отдельными очередями задач для долгоиграющих цепочек рассуждений теперь вы можете переложить эту сложность непосредственно на Google. Однако это удобство влечет за собой стратегический компромисс.

Хотя новый агент Deep Research позволяет быстро развертывать сложные исследовательские возможности, он работает как «черный ящик» по сравнению с созданными на заказ пайплайнами LangChain или LangGraph. Инженерам стоит поэкспериментировать с функцией «медленного мышления» с помощью параметра background=true, чтобы оценить, перевешивает ли скорость реализации потерю детального контроля над исследовательским циклом.

Старшие инженеры, управляющие оркестрацией ИИ и бюджетами, обнаружат, что переход на серверное состояние через previous_interaction_id открывает возможности для неявного кэширования, что является серьезным преимуществом как для затрат, так и для показателей задержки.

Ссылаясь на историю, хранящуюся на серверах Google, вы автоматически избегаете расходов на токены при повторной загрузке массивных контекстных окон, что напрямую решает проблемы с бюджетом при сохранении высокой производительности.

Сложность здесь кроется в цепочке поставок: интеграция Remote MCP (Model Context Protocol) означает, что ваши агенты подключаются напрямую к внешним инструментам, что требует от вас тщательной проверки безопасности и аутентификации этих удаленных служб. Самое время провести аудит текущих затрат токенов на повторную отправку истории разговоров: если они высоки, приоритетный переход на Interactions API с сохранением состояния может обеспечить существенную экономию.

Для старших инженеров по данным (Senior Data Engineers) Interactions API предлагает более надежную модель данных, чем простые текстовые логи. Структурированная схема позволяет отлаживать сложные истории и производить по ним логические вычисления, повышая общую целостность данных в ваших пайплайнах. Тем не менее вы должны сохранять бдительность в отношении качества данных, особенно в связи с проблемой цитирования, поднятой экспертом Сэмом Виттевейном.

Агент Deep Research в настоящее время возвращает «завернутые» URL-адреса, которые могут истечь или перестать работать, а не прямые ссылки на источники. Если ваши пайплайны опираются на парсинг или архивирование этих источников, вам может потребоваться этап очистки для извлечения пригодных к использованию URL-адресов. Вам также следует протестировать возможности структурированного вывода (response_format), чтобы узнать, смогут ли они заменить хрупкий регулярный анализ (regex) в ваших текущих ETL-пайплайнах.

Наконец, для директоров по информационной безопасности перенос состояния на централизованные серверы Google выглядит противоречиво. Это может повысить безопасность, избавив клиентские устройства от хранения ключей API и истории разговоров, но в то же время создает новый риск нарушения суверенитета данных. Ключевым моментом здесь являются правила хранения данных Google: если бесплатный тариф сохраняет данные всего один день, то платный — хранит историю взаимодействия 55 дней.

Это контрастирует с корпоративными опциями «нулевого хранения данных» (Zero Data Retention, ZDR) от OpenAI. Вы должны убедиться, что хранение конфиденциальной истории разговоров в течение почти двух месяцев не противоречит внутренним регламентам вашей организации. Если это нарушает вашу политику, вы должны настроить вызовы с помощью store=false, хотя это отключит функции сохранения состояния и связанные с ними преимущества в стоимости, которые делают этот новый API столь ценным.

Инфраструктура

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.