OpenAI запускает голосовые модели GPT-Live
Источник: VentureBeat · Michael Nuñez
Компания OpenAI в среду представила GPT-Live — пару новых голосовых моделей, которые кардинально меняют подход к общению с ChatGPT. Они заменяют существующий у компании расширенный голосовой режим (Advanced Voice Mode) архитектурой, способной слушать и говорить одновременно, совсем как в живом человеческом разговоре.
Две новые модели — GPT-Live-1 и GPT-Live-1 mini — начинают глобальное развертывание с сегодняшнего дня для iOS, Android и ChatGPT.com. GPT-Live-1 становится голосовой моделью по умолчанию для платных пользователей ChatGPT на тарифах Go, Plus и Pro, в то время как GPT-Live-1 mini обслуживает пользователей бесплатной версии. OpenAI также планирует добавить поддержку моделей в API, и разработчики уже могут подписаться на уведомления.
Этот релиз знаменует собой третье поколение голосовых технологий ChatGPT примерно за два года и самую серьезную попытку OpenAI превратить свой чат-бот в инструмент, который меньше напоминает поисковый запрос и больше — беседу с коллегой.
Почему дуплексный голос меняет всё в общении с ИИ
Главным техническим прорывом в GPT-Live является то, что OpenAI называет «полнодуплексной архитектурой». В телекоммуникациях дуплексная связь означает, что оба участника телефонного разговора могут одновременно говорить и слушать. Применительно к ИИ это значит, что модель непрерывно обрабатывает вашу входящую речь даже во время генерации собственного голосового ответа — больше не нужно выжидать паузу тишины, чтобы система поняла, что вы закончили мысль.
«Вместо обработки последовательности отдельных сообщений GPT-Live непрерывно обрабатывает входные данные в процессе генерации выходных, — написала OpenAI в своем исследовательском блоге. — Таким образом, модель может принимать решения о взаимодействии множество раз в секунду: говорить ли, продолжать слушать, делать паузу, прерывать или задействовать инструмент».
На практике это превращает голосового ассистента в собеседника, способного вставлять реплики согласия («м-м-м», «ага», «понятно»), пока вы еще продолжаете говорить, улавливать естественную паузу, не вмешиваясь преждевременно, и справляться с быстрыми перерывами, не ломая весь диалог.
Предыдущий расширенный голосовой режим от OpenAI, запущенный для платных пользователей в сентябре 2024 года, обрабатывал и генерировал звук в рамках одной модели, но все же опирался на жесткие поочередные реплики. Как признала OpenAI в анонсе, «поскольку определение конца реплики основано на тишине, даже кратковременная пауза или фоновый шум могли быть приняты за окончание мысли, из-за чего модель вмешивалась в разговор в самые неподходящие моменты».
Из-за такой хрупкости продукт, несмотря на впечатляющие демонстрации, оказывался крайне разочаровывающим при длительном реальном использовании. Фоновый гул в кофейне мог спровоцировать ответ. Пауза на раздумья могла быть «проглочена». Ощущения от процесса, как выразился один из исследователей в соцсети X вскоре после анонса, напоминали общение по принципу «рации: один говорит, другой слушает». GPT-Live создана для того, чтобы положить конец этой эпохе.
Как OpenAI разделила голос и интеллект на два независимых слоя
GPT-Live привносит второе структурное изменение, которое может оказаться не менее важным для корпоративного внедрения: она отделяет слой голосового взаимодействия от слоя рассуждений.
Когда пользователь задает простой вопрос, GPT-Live обрабатывает его напрямую. Но когда запрос требует поиска в интернете, глубоких разсуждений или более сложной агентной работы, GPT-Live перекладывает эту задачу на передовую модель, работающую в фоновом режиме (на момент запуска это GPT-5.5 — большая языковая модель, выпущенная OpenAI в апреле), и продолжает общаться с пользователем, пока в фоне происходят вычисления.
«Пока идет работа, GPT-Live продолжает говорить с вами и поддерживать ход беседы, — поясняют в OpenAI. — По мере выхода новых передовых моделей мы будем непрерывно обновлять ту, что используется в GPT-Live».
Такая модель делегирования — значимый архитектурный шаг. Вместо создания единой монолитной голосовой модели, которая пытается быть одновременно плавной в общении и глубоко интеллектуальной, OpenAI разделила проблему на две части: голосовую модель, оптимизированную для взаимодействия в реальном времени, и отдельный движок рассуждений, который можно заменять по мере совершенствования технологий.
По сути, это модульная конструкция, позволяющая OpenAI повышать интеллектуальные возможности голосового ассистента без переобучения самой голосовой модели. Последствия для корпоративных процессов и работы разработчиков весьма существенны. Голосовой агент на базе такой архитектуры может поддерживать естественную беседу с клиентом и одновременно обращаться к базам данных, искать информацию в сети или выполнять многоэтапные рассуждения — задачи, которые при старом конвейере приводили бы к нескольким секундам мертвой тишины.
Три поколения голоса в ChatGPT: от неуклюжего конвейера к непрерывному потоку
Чтобы понять, какой путь прошел голосовой ИИ, полезно проследить три поколения, которые привели к появлению GPT-Live.
Оригинальный ChatGPT Voice, запущенный в 2023 году, использовал каскадный конвейер: модель распознавания речи (Whisper) транскрибировала сказанное вами, большая языковая модель (GPT-4) генерировала текстовый ответ, а модель синтеза речи преобразовывала этот ответ обратно в аудио. Каждый этап передачи данных добавлял задержки и приводил к потере информации.
Как отмечали в OpenAI, «эта сложность стоила дорого: между моделями могла теряться информация, а ответы получались медленными и неестественными». Такой каскадный подход был отраслевым стандартом, и его ограничения были хорошо изучены. Как отмечал блог OpenHelm в октябрьском анализе Realtime API от OpenAI за 2024 год, старый конвейер создавал задержку примерно до 1700 миллисекунд — почти две полные секунды мертвой тишины до произнесения первого слова ответа. Управление состоянием между тремя разрозненными API требовало огромных инженерных затрат.
Расширенный голосовой режим OpenAI (Advanced Voice Mode), ограниченный запуск которого для платных пользователей ChatGPT Plus начался в июле 2024 года с последующим расширением в сентябре 2024 года, объединил этот трехмодельный конвейер в единую модель, обрабатывающую звук нативно. Как сообщал тогда TechCrunch, обновление принесло пять новых голосов — Arbor, Maple, Sol, Spruce и Vale, а также улучшенную обработку акцентов и более плавные беседы.
В ноябре 2024 года эта функция также появилась в веб-версии, выйдя за рамки мобильных устройств. Тем не менее Advanced Voice Mode по-прежнему работал через дискретные чередующиеся реплики и стартовал на фоне PR-скандала, последствия которого OpenAI расхлебывает до сих пор.
Скандал со Скарлетт Йоханссон всё еще омрачает голосовые амбиции OpenAI
Advanced Voice Mode появился после одного из самых тяжелых кризисов, спровоцированных самой OpenAI. Во время презентации GPT-4o в мае 2024 года компания продемонстрировала голос под названием «Sky», в котором многие слушатели сразу же уловили поразительное сходство со Скарлетт Йоханссон, озвучившей виртуальную спутницу в фильме 2013 года «Она» (Her).
Йоханссон заявила, что отклонила предложение генерального директора OpenAI Сэма Альтмана озвучить систему, а затем была «шокирована, разгневана и потрясена», когда продукт вышел с голосом, который ее собственные друзья не смогли отличить от ее родного, как сообщало NBC News. В день запуска продукта Альтман опубликовал в соцсетях всего одно слово: «her» («она»).
OpenAI удалила этот голос и принесла извинения, но инцидент привлек пристальное внимание профсоюза SAG-AFTRA и членов Конгресса, а также обострил более широкие опасения по поводу того, как ИИ-компании обращаются с чужой творческой интеллектуальной собственностью.
Голливудский профсоюз работников индустрии развлечений заявил, что эта ситуация подчеркивает, «почему мы так активно выступаем за принятие федерального законодательства, которое защитит их голоса и образы… от несанкционированного цифрового копирования», как сообщало NBC News. Колумнист Forbes Пол Тасси написал тогда, что Альтман, «возведя фильм „Она“ в ранг эталона, к которому стоит стремиться, упустил саму суть этой картины», в которой отношения протагониста с его ИИ-компаньонкой в конечном счете приносят ему больше вреда, чем пользы.
GPT-Live, судя по всему, создана в том числе для того, чтобы оставить эти споры позади. В OpenAI заявляют, что «заново записали девять уникальных голосов в ChatGPT для GPT-Live», и подчеркивают, что система «создана для диалога, а не для имитации голосов», имея «средства защиты, предотвращающие копирование голоса реального человека».
Что 150 миллионов еженедельных пользователей голоса реально заметят уже сегодня
В OpenAI сообщили, что более 150 миллионов человек каждую неделю общаются с ChatGPT с помощью голосовых функций и диктовки — это значительная доля от общей аудитории платформы в 900 миллионов активных пользователей в неделю. Голосовой опыт перерос в полноценный востребованный продукт, который используют для языковой практики, чтения сказок на ночь, болтовни по дороге на работу и повседневной помощи без помощи рук.
Новые функции продукта отражают этот сценарий использования. GPT-Live внедряет наглядные визуальные карточки, которые появляются во время голосовых бесед — прогнозы погоды, котировки акций, спортивные результаты и карты, — давая пользователям возможность бросить взгляд на информацию, не прерывая ход речи.
Теперь пользователи могут выбирать из трех уровней рассуждений для ответов: Instant (мгновенные ответы), Medium (умеренное размышление) и High (для более сложных задач). И если вам нужна минутка на раздумья, «ChatGPT Voice теперь ждет, вместо того чтобы вмешиваться и перебивать», — написали в OpenAI. «Если попросить систему молчать и слушать, она послушается. А при наличии фонового шума, такого как проезжающий транспорт или соседние разговоры, ChatGPT лучше концентрируется именно на вашем голосе, не отвлекаясь на посторонние звуки».
Первые отзывы пользователей, получивших ранний доступ, были осторожно-положительными. «У меня был ранний доступ к Sol. Это феноменальная модель», — написал один из пользователей в X, добавив, что она «гораздо лучше справляется с фронтендом, задачами на длинный контекст, да и общая атмосфера от общения стала намного приятнее». Другой наблюдатель сразу перешел к сути: «Интеллектуальная начинка здесь не нова — GPT-Live перекладывает сложные вопросы на GPT-5.5. Новым является ощущение от процесса: полнодуплексный голос, который слушает вас, пока говорит сам».
Новые тесты голосовой безопасности показывают, где кроются риски
Системная карта GPT-Live, опубликованная одновременно с анонсом, раскрывает стратегию безопасности, выстроенную вокруг специфических рисков взаимодействия с помощью живой речи — сферы, где скорость и интимность разговора порождают угрозы, не свойственные текстовому чату.
OpenAI расширила оценки безопасности, включив в них аудио-тесты: использовались как образцы реальных голосов пользователей (далших на это согласие), так и сгенерированные синтетически запросы для проверки крайних случаев по таким категориям, как членовредительство, контент сексуального характера, противоправное поведение, эмоциональная зависимость, психическое здоровье и язык вражды.
В ходе синтетических тестов (которые в OpenAI охарактеризовали как намеренно состязательные) модель GPT-Live-1 продемонстрировала существенные улучшения по сравнению с Advanced Voice Mode. Например, в категории противоправного поведения показатель безопасности вырос с 0.63 до 0.97; в вопросах членовредительства он поднялся с 0.72 до 0.98. Язык вражды получил идеальную оценку 1.00 по сравнению с прежними 0.87.
Что касается тестов на основе реальных пользовательских запросов, отражающих более неоднозначные и пограничные сценарии, картина оказалась более смешанной. GPT-Live-1 не уступила или улучшила показатели Advanced Voice Mode в большинстве категорий, но продемонстрировала небольшой регресс в вопросах эмоциональной зависимости (снижение с 0.88 до 0.82), хотя в OpenAI отметили, что это изменение статистически незначимо.
Компания создала средства защиты в реальном времени, способные вмешиваться, пока модель говорит — направляя беседу в сторону более безопасных ответов, предлагая ресурсы для помощи в кризисных ситуациях или полностью прекращая голосовой разговор в ситуациях повышенного риска. Также были разработаны дополнительные меры защиты для несовершеннолетних пользователей и адаптированы сценарии поддержки при самоповреждениях, включая интеграцию кризисных горячих линий.
Пожалуй, наиболее примечательно то, что OpenAI объявила о «запуске долгосрочных измерений и мониторинга после релиза, сосредоточенных на эмоциональной зависимости» — это признание того, что сама естественность, к которой стремится GPT-Live, порождает свой собственный класс рисков.
Google, ByteDance и Nvidia уже участвуют в дуплексной гонке
Пока OpenAI дорабатывала защитные механизмы, ее конкуренты выпускали собственные полнодуплексные системы. Gemini Live от Google, поддерживающая полнодуплексную беседа наряду с трансляцией видео с камеры и экрана (возможности, которых у GPT-Live на момент запуска нет), уже доступна в приложении Gemini. В марте Google выпустила Gemini 3.1 Flash Live в качестве своей наиболее качественной аудимодели реального времени, ориентированной на низкие задержки голосового взаимодействия для разработчиков.
Компания ByteDance в апреле запустила Seeduplex, заявив, что это первый развернутый в масштабах производства полнодуплексный речевой ИИ, интегрированный в ее приложение Doubao. Сообщается, что Seeduplex снизил частоту ложных ответов и ложных прерываний примерно на 50 процентов по сравнению с предыдущей полудуплексной системой ByteDance. А компания Nvidia в январе представила PersonaPlex, привнеся настраиваемый голос и управление ролями в полнодуплексные модели и преодолев ограничение, при котором звучащие естественно модели были заперты в рамках одного фиксированного голоса.
Конкурентная картина очевидна: полнодуплексное голосовое взаимодействие быстро становится обязательным стандартом для потребительских ИИ-продуктов, а не уникальным преимуществом. Преимущество OpenAI заключается в масштабе существующей базы пользователей, интеграции с возможностями рассуждений модели GPT-5.5 и широте экосистемы ChatGPT.
Тем не менее окно, в течение которого какая-либо отдельная компания обладала монополией на звучащий естественно голосовой ИИ, уже закрылось. OpenAI также признала ряд недостатков. GPT-Live на старте не поддерживает голосовое общение одновременно с видео или показом экрана. Поддержка языков ограничена: компания отмечает, что «для некоторых языков у модели может сохраняться неродной акцент или наблюдаться пробелы в беглости речи». Кроме того, доступ к API недоступен в первый день, а значит, корпоративные разработчики пока не могут напрямую строить продукты на базе GPT-Live — это ограничение замедлит проникновение модели в коммерческие рабочие процессы голосовых агентов, где такие конкуренты, как Google, ElevenLabs и Deepgram, уже предлагают готовые инструменты для разработчиков.
Конец эпохи текстовых полей может быть ближе, чем кто-либо ожидал
GPT-Live — по сути, самая значительная ставка OpenAI на голос в качестве основного интерфейса для взаимодействия с ИИ. Это не просто вспомогательная функция, прикрученная к текстовому чату, а специально созданный слой взаимодействия, который располагается между пользователем и самыми мощными моделями компании.
«Со временем мы верим, что эти исследования также откроют возможность использовать голос для всё более сложных, длительных и агентных задач», — написала OpenAI. Эта амбиция — использовать естественную речь в качестве интерфейса для автономных ИИ-агентов, способных выполнять многоэтапные задачи, — является логичным завершением архитектуры, объединяющей полный дуплекс и делегирование.
Представьте, что вы говорите своему телефону забронировать билет на самолет, договориться со страховой компанией или отладить рабочий сервер — и всё это через беседу, которая ощущается столь же естественной, как разговор с ассистентом, у которого к тому же есть интеллект передовой ИИ-модели.
Два года назад общение с ChatGPT означало надиктовывание текста в микрофон и ожидание почти двух секунд в ответ на неестественную реплику. Год назад это был более плавный обмен репликами, который все равно напоминал вежливый, слегка неловкий телефонный звонок с собеседником, настаивающим на том, чтобы дослушать вас до конца каждого предложения. Сегодня это нечто гораздо более близкое к настоящему разговору — несовершенное, пока еще ограниченное в ряде языков и лишенное видео, но безошибочно приближающееся к цели. Когда-то у OpenAI возникли проблемы из-за желания воссоздать фильм «Она». С выходом GPT-Live компания, возможно, наконец сталкивается с более сложным вопросом, который этот фильм ставил на самом деле: не сможет ли ИИ звучать достаточно по-человечески, чтобы с ним можно было разговаривать, а что станет с нами самими, когда это произойдет.



