Агентное программирование становится полностью голосовым: OpenAI переносит полнодуплексное голосовое управление GPT-Live в Codex и ChatGPT на ПК
Источник: VentureBeat · Carl Franzen
Спустя две недели после презентации своей более естественной голосовой ИИ-модели GPT-Live с поддержкой полнодуплексного режима (возможностью слушать и говорить одновременно), компания OpenAI переносит ее непосредственно в рабочие процессы разработчиков.
Компания объявила, что теперь GPT-Live является основой настольного приложения ChatGPT для macOS и Windows, напрямую интегрируясь с такими агентными системами, как Codex и ChatGPT Work (которые представляют собой отдельные интерфейсы, доступные в десктопном приложении ChatGPT).
Когда OpenAI первоначально запустила GPT-Live 8 июля 2026 года, она представила непрерывную аудиомодель, способную одновременно слушать и говорить, что исключило необходимость жесткого поочередного обмена репликами и переложило задачи сложного логического вывода на фоновые модели, такие как GPT-5.5.
Сегодняшний релиз расширяет этот разговорный уровень до технических задач, позволяя инженерам-программистам управлять многопоточными процессами кодирования, проверять запросы на слияние (pull requests) и выполнять отладку приложений с помощью естественных голосовых команд.
Таким образом, это может открыть новую эру «бесконтактной» (hands-free) разработки программного обеспечения и даже живых совместных сессий кодирования в одном помещении для более чем 10 миллионов активных пользователей в неделю, использующих Codex и ChatGPT Work. Codex, разумеется, так называется линейка моделей и инструментов OpenAI, ориентированных на программирование, которые в текущем году компания расширила до более универсальной платформы производительности. Представитель OpenAI сообщил VentureBeat, что это первый случай голосовой активации
OpenAI опубликовала промо-видео, на котором ее сотрудники, инженер по развитию разработчиков Codex Джейсон Лю (Jason Liu) и технический специалист Codex Гиннесс Чен (Guinness Chen), общаются с одной и той же сессией настольного приложения ChatGPT, находясь в одной комнате, причем каждый из них отдает разные инструкции и ведет диалог с одной и той же моделью.
Новые возможности
В основе этой интеграции лежит отделение уровня реального времени голосового общения от базовых механизмов выполнения.
Пока GPT-Live поддерживает живую беседу, вставляя естественные словесные подтверждения вроде «понял» без прерывания пользователя, она передает тяжелые вычислительные нагрузки фоновым моделям рассуждений.
В macOS настольное приложение включает функции «Appshots» и контекста экрана, позволяя ChatGPT Voice анализировать переднее окно наряду с локальными файлами, структурой кодовой базы и активными плагинами.
Такая архитектура создает динамику парного программирования, при которой разработчики обсуждают проблемы голосом, в то время как агенты выполняют задачи в асинхронном режиме.
Вместо того чтобы вручную останавливать сеансы кодирования для ввода подробных инструкций или переключения между окнами, разработчики управляют системой без помощи рук.
Полнодуплексный движок динамически решает, когда говорить, делать паузу или вызывать инструменты, сохраняя состояние диалога даже тогда, когда фоновые агенты обрабатывают сложные изменения кода.
Управление кодированием и сложной сборкой с помощью одного лишь голоса
Главная операционная возможность в этом обновлении связана с выполнением многозадачности в средах Codex и ChatGPT Work.
Инженеры-программисты могут инициировать несколько одновременных потоков задач с помощью одной голосовой подсказки. Например, разработчик, готовящийся к выпуску функции, может поручить системе одновременно исследовать открытую ошибку аутентификации, проверить ожидающий запроса на слияние миграции API и сгенерировать недостающие модульные тесты (unit tests).
Настольное приложение координирует эти действия в различных контекстах, отслеживая проблемы через обсуждения в Slack, репозитории GitHub и локальные кодовые базы.
Разработчики также могут словесно преобразовывать дизайн-макеты в рабочий код, распределяя задачи по интерфейсной (frontend), серверной (backend) и тестовой частям.
Благодаря поддержке проектов с несколькими папками (сборка 26.715) и удаленному выполнению через iOS, инженеры могут проверять ход выполнения задач, отвечать на запросы агентов и перенаправлять активные задания без переключения между приложениями или управления отдельными процессами строка за строкой.
Проприетарная лицензия
Релиз с поддержкой голосового управления от OpenAI работает по проприетарной коммерческой корпоративной модели. Доступ ограничен платными подписчиками тарифных планов Plus, Pro, Business, Enterprise и Education.
Для индивидуальных разработчиков и корпоративных инженерных отделов эта коммерческая структура означает, что веса моделей, конвейеры голосовой обработки и архитектуры состояния агентов остаются полностью закрытыми.
Организации не могут изменять базовые системы или размещать их самостоятельно. Кроме того, задачи, инициированные через ChatGPT Voice, расходуют стандартные квоты использования непосредственно из существующих лимитов тарифных планов Codex и ChatGPT Work, при этом действия, инициированные голосом, обрабатываются точно так же, как и стандартные агентные рабочие нагрузки.
Реакция сообщества
Сообщества разработчиков сразу отметили последствия внедрения непрерывного полнодуплексного голосового управления в автономные рабочие процессы программирования.
Комментируя анонс выпуска сборки 26.715, в котором подробно описывается интеграция голоса и поддержка проектов с несколькими папками, журналист AI Insider @ChrisGPT написал в X: «Сегодня OpenAI выпустит голос и удаленное управление для codex! На один шаг ближе к персональному OИИ (AGI)».
Ранние технические отзывы подчеркивают всеобщий энтузиазм по поводу управления сложными агентными задачами без помощи рук, особенно при отходе от рабочей станции или удаленном управлении конвейерами сборки.



