Голосовые модели OpenAI получили возможности рассуждения класса GPT-5
Гочевые агенты обходились дорого в заупуске и были сложны в оркестрации не потому, что модели не справляются с диалогом, а потому, что ограничения контекста заставляли компании внедрять сброс сессий, сжатие состояний и уровни восстановления в каждый развертываемый проект. Три новые голосовые модели от OpenAI призваны снизить эти накладные расходы и изменить подход инженеров к интеграции голоса в более крупный стек агентов.
GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper интегрируют аудио в реальном времени в стек управления моделями в качестве дискретных примитивов оркестрации, разделяя разговорные рассуждения, перевод и транскрипцию на специализированные компоненты, а не объединяя их в единый голосовой продукт.
Компания сообщила в своем блоге, что Realtime-2 — это ее первая голосовая модель «с возможностями рассуждения класса GPT-5», способная справляться со сложными запросами и поддерживать естественный ход разговора. Realtime-Translate понимает более 70 языков и переводит их на 13 других со скоростью речи говорящего, а Realtime-Whisper — это новая модель транскрипции речи в текст.
Эти три функции больше не находятся в рамках одного стека или модели. Технически GPT-Realtime-2 могла бы справляться с транскрипцией, но OpenAI распределяет отдельные задачи по специализированным моделям: Realtime-Translate для многоязычной речи и Realtime-Whisper для транскрипции. Предприятия могут назначать каждую задачу соответствующей модели, вместо того чтобы пропускать все через единую всеобъемлющую голосовую систему.
Новые модели от OpenAI конкурируют с моделями Voxtral от Mistral, которые также разделяют транскрипцию и ориентированы на корпоративные сценарии использования.
Что следует предпринять компаниям
Все больше предприятий видят ценность голосовых агентов, поскольку люди все привычнее общаются с ИИ-агентами, а также из-за богатства данных, получаемых в ходе голосовых взаимодействий с клиентами.
Организациям, оценивающим эти модели, необходимо будет продумать свою архитектуру оркестрации, а не только качество самих моделей — в частности, способен ли их стек распределять отдельные голосовые задачи по специализированным моделям и управлять состоянием в рамках контекстного окна на 128 тыс. токенов.



