API Responses от OpenAI повышает эффективность искусственного интеллекта
В то время как ChatGPT продолжает устанавливать новые рекорды по посещаемости, миллионы корпоративных клиентов также полагаются на прикладные программные интерфейсы (API) его создателя — OpenAI, чтобы создавать собственные уникальные чат-боты и агентские продукты на базе линейки генеративных ИИ-моделей (больших языковых моделей или LLM) компании.
Ранее OpenAI запустила Completions API в 2020 году, Chat Completions API в 2023 году, а также Assistants API в конце 2023 года. Эти инструменты позволили разработчикам подключать свои сторонние приложения и бизнес-ПО к языковым моделям OpenAI и взаимодействовать с ними так же, как обычные пользователи общаются с ChatGPT — а также множеством других способов, недоступных пользователям ChatGPT (например, создавать специализированных агентов, которые соответствуют тону бренда компании, ее стилю и автоматически используют ее документы).
Однако в марте 2025 года OpenAI представила новый Responses API, который, по ее заявлению, к 2026 году должен заменить Assistants API. Новый интерфейс включил в себя множество новых функций, использующих новейшие «рассуждающие» модели и возможности компании, которым требуется время на размышления и анализ ответов перед их выдачей пользователям — это сделано для повышения точности и снижения количества нежелательных галлюцинаций.
Как сообщало тогда издание VentureBeat, целью было обеспечение поиска информации и взаимодействия в реальном времени, что позволяло разработчикам использовать несколько встроенных веб-инструментов или возможностей в рамках одного вызова API (включая веб-поиск, поиск по файлам и использование компьютера), а также упростить создание приложений, требующих многоэтапных рассуждений.
Тем не менее, многие разработчики до сих пор дезинформированы насчет Responses API и из-за этого избегают его использования, считает Прашант Митал (Prashant Mital), руководитель направления прикладного искусственного интеллекта в OpenAI.
Как он написал в ветке на X поздно прошлым вечером: «вокруг Responses API от OpenAI по-прежнему слишком много путаницы. отчасти это наша вина: мы не всегда четко объясняли, зачем мы его создали, как им пользоваться и почему это важно», после чего опубликовал серию постов в X, направленных на развенчание «мифов», которые существуют у некоторых разработчиков.
В своем объяснении Митал постарался прояснить, чем Responses отличается от Completions, почему он обеспечивает преимущества в производительности и как его можно использовать даже в условиях более строгих технических требований, таких как политика нулевого хранения данных (Zero Data Retention, ZDR).
Что предоставляет Responses API
Один из основателей стартапа рассказал Миталу, что их команда не стала переходить на новый API, так как «нам нужен детальный контроль над нашими агентскими процессами — мы сами управляем формированием контекста и оптимизацией кэширования промптов». Митал ответил: «реальность такова, что все это возможно с Responses!»
Далее он перечислил несколько «мифов» об API. Миф первый: «с помощью Responses невозможно делать некоторые вещи».
Его ответ: «нет. Responses — это надмножество Completions. Все, что вы можете делать с Completions, вы можете делать и с Responses, плюс многое другое. Например, вы можете управлять состоянием разговора вручную (как в Completions) ИЛИ позволить API управлять состоянием за вас».
Миф второй заключался в том, что Responses якобы всегда сохраняет состояние и поэтому не может использоваться в строгих сценариях, где клиент (или его конечные пользователи/партнеры) должен соблюдать политику нулевого хранения данных (ZDR). В таких конфигурациях компания или разработчик требуют, чтобы никакие пользовательские данные не сохранялись и не удерживались на серверах провайдера после обработки запроса.
Это важно для таких отраслей, как финансы, здравоохранение или государственный сектор, где нормативные акты или внутренние правила предписывают строгий контроль за обработкой данных. В таких условиях каждое взаимодействие должно быть бессостояниевым (stateless), что означает: вся история разговоров, цепочки рассуждений и управление другим контекстом происходят исключительно на стороне клиента, и провайдер API ничего не сохраняет.
Митал возразил: «неверно. Вы можете запускать Responses в режиме stateless. Просто попросите его вернуть зашифрованные элементы рассуждений и продолжайте обрабатывать состояние на стороне клиента».
Преимущества в производительности и стоимости
Митал также указал на то, что он назвал самым серьезным заблуждением: «миф №3: интеллект модели одинаков независимо от того, используете ли вы Completions или Responses. Снова неверно».
Он пояснил: «Responses был создан для мыслящих моделей, которые вызывают инструменты в рамках своей цепочки рассуждений (CoT). Responses позволяет сохранять цепочку CoT между вызовами модели при агентской работе с инструментами — в результате получается более интеллектуальная модель и гораздо более высокая эффективность кэширования; мы наблюдали скачок коэффициента кэширования с 40% до 80% на некоторых нагрузках».
Митал охарактеризовал это недопонимание как «возможно, самое вопиющее», предупредив, что «разработчики не осознают, сколько производительности они упускают. Я понимаю, это сложно, потому что вы используете LiteLLM или какую-то собственную обертку, созданную вокруг chat completions или чего-то еще, но расстановка приоритетов в пользу перехода крайне важна, если вы хотите, чтобы GPT-5 демонстрировала максимальную производительность в ваших агентах».
Ресурсы для разработчиков
Для разработчиков, оценивающих возможность перехода, Митал указал на практическую документацию OpenAI. Он поделился ссылкой: «вот наша поваренная книга (cookbook) по вызову функций с помощью Responses: https://cookbook.openai.com/examples/o-series/o3o4-mini_prompting_guide».
Он также подытожил основную мысль в одном из постов:
-
«responses = completions ++»
-
«работает в бессостояниевых (stateless) средах и условиях ZDR»
-
«создан для мыслящих моделей»
-
«открывает возможности более высокого интеллекта и максимизирует использование кэша в агентских циклах»
Взгляд в будущее
Для команд, продолжающих строить решения на базе Completions, разъяснения Митала могут стать поворотным моментом. «Если вы все еще используете chat completions, — написал он, — подумайте о переходе прямо сейчас — скорее всего, вы упускаете производительность и экономию средств».
Responses API — это не просто альтернатива, а эволюция, разработанная для тех типов рабочих нагрузок, которые появились по мере того, как ИИ-системы берут на себя более сложные задачи рассуждения. Разработчики, взвешивающие необходимость миграции, могут обнаружить, что потенциал роста эффективности делает этот выбор очевидным.
