Голосовые модели OpenAI получили возможности рассуждения класса GPT-5

Голосовые модели OpenAI получили возможности рассуждения класса GPT-5

Гочевые агенты обходились дорого в заупуске и были сложны в оркестрации не потому, что модели не справляются с диалогом, а потому, что ограничения контекста заставляли компании внедрять сброс сессий, сжатие состояний и уровни восстановления в каждый развертываемый проект. Три новые голосовые модели от OpenAI призваны снизить эти накладные расходы и изменить подход инженеров к интеграции голоса в более крупный стек агентов.

GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper интегрируют аудио в реальном времени в стек управления моделями в качестве дискретных примитивов оркестрации, разделяя разговорные рассуждения, перевод и транскрипцию на специализированные компоненты, а не объединяя их в единый голосовой продукт.

Компания сообщила в своем блоге, что Realtime-2 — это ее первая голосовая модель «с возможностями рассуждения класса GPT-5», способная справляться со сложными запросами и поддерживать естественный ход разговора. Realtime-Translate понимает более 70 языков и переводит их на 13 других со скоростью речи говорящего, а Realtime-Whisper — это новая модель транскрипции речи в текст.

Эти три функции больше не находятся в рамках одного стека или модели. Технически GPT-Realtime-2 могла бы справляться с транскрипцией, но OpenAI распределяет отдельные задачи по специализированным моделям: Realtime-Translate для многоязычной речи и Realtime-Whisper для транскрипции. Предприятия могут назначать каждую задачу соответствующей модели, вместо того чтобы пропускать все через единую всеобъемлющую голосовую систему.

Новые модели от OpenAI конкурируют с моделями Voxtral от Mistral, которые также разделяют транскрипцию и ориентированы на корпоративные сценарии использования.  

Что следует предпринять компаниям

Все больше предприятий видят ценность голосовых агентов, поскольку люди все привычнее общаются с ИИ-агентами, а также из-за богатства данных, получаемых в ходе голосовых взаимодействий с клиентами.

Организациям, оценивающим эти модели, необходимо будет продумать свою архитектуру оркестрации, а не только качество самих моделей — в частности, способен ли их стек распределять отдельные голосовые задачи по специализированным моделям и управлять состоянием в рамках контекстного окна на 128 тыс. токенов.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.