GPT-5.3-Codex от OpenAI лидирует в гонке ИИ-систем для программирования
OpenAI в среду выпустила GPT-5.3-Codex, которую компания называет своим самым способным ИИ-агентом для написания кода на сегодняшний день. Анонс был приурочен ровно к тому моменту, когда Anthropic представила обновление своего флагманского модельного ряда — Claude Opus 4.6. Синхронизированные запуски стали первым залпом в том, что наблюдатели отрасли называют войнами ИИ-кодеров — ожесточенной борьбой за захват рынка корпоративной разработки программного обеспечения.
Двойные анонсы прозвучали на фоне и без того жаркой недели в отношениях двух гигантов искусственного интеллекта, которые также должны выпустить конкурирующие рекламные ролики к Суперкубку в воскресенье, а их руководители публично обмениваются колкостями по поводу бизнес-моделей, доступа и корпоративной этики.
«Мне нравится создавать с помощью этой модели; кажется, что это гораздо больший шаг вперед, чем показывают бенчмарки», — написал генеральный директор OpenAI Сэм Альтман на X спустя несколько минут после запуска. Позже он добавил: «Было удивительно наблюдать за тем, насколько быстрее мы смогли выпустить 5.3-Codex, используя саму 5.3-Codex, и это определенно знак того, что нас ждет в будущем».
Это утверждение — о том, что модель помогла создать саму себя — является важной вехой в разработке ИИ. Согласно заявлению OpenAI, команда Codex использовала ранние версии GPT-5.3-Codex для отладки собственных прогонов обучения, управления инфраструктурой развертывания, а также для анализа результатов тестов и оценок. Компания описывает её как «нашу первую модель, которая сыграла ключевую роль в создании самой себя».
Новая модель для написания кода от OpenAI демонстрирует рекордные результаты в бенчмарках, опережая Claude от Anthropic на двузначные проценты
Новая модель показывает значительный прирост производительности по нескольким отраслевым бенчмаркам. GPT-5.3-Codex набирает 57% в SWE-Bench Pro — строгом тесте для оценки реальной разработки программного обеспечения, который охватывает четыре языка программирования и проверяет устойчивые к загрязнению данных задачи, имеющие промышленное значение. Она набирает 77,3% в Terminal-Bench 2.0, измеряющем навыки работы с терминалом, которые необходимы для ИИ-агентов, и 64% в OSWorld — агентском бенчмарке использования компьютера, где модели должны выполнять задачи продуктивности в визуальных средах рабочего стола.
Результат Terminal-Bench 2.0 особенно поразителен. Согласно данным о производительности, опубликованным в среду, GPT-5.3-Codex набрала 77,3% по сравнению с 64,0% у GPT-5.2-Codex и 62,2% у базовой модели GPT-5.2 — скачок на 13 процентных пунктов за одно поколение. Один из пользователей X отметил, что этот результат «просто уничтожил» Opus 4.6 от Anthropic, которая, как сообщается, набрала 65,4% в том же бенчмарке.
OpenAI также утверждает, что модель достигает этих результатов с драматически улучшенной эффективностью: она тратит менее половины токенов своего предшественника на аналогичные задачи, а скорость инференса на один токен возросла более чем на 25%.
«Примечательно, что GPT-5.3-Codex делает это с меньшим количеством токенов, чем любая предыдущая модель, позволяя пользователям просто создавать больше», — заявила компания в своем анонсе.
Модель OpenAI GPT-5.3-Codex набрала 77,3 процента в Terminal-Bench 2.0 — это на 13 пунктов больше, чем у предшественника. Один из пользователей назвал этот скачок моментом, который «полностью уничтожил» новейшую модель Anthropic. (Источник: OpenAI)
От помощника по кодингу до оператора ПК: GPT-5.3-Codex нацелена на автоматизацию всего жизненного цикла разработки ПО
Пожалуй, еще более значимым, чем улучшения в бенчмарках, является позиционирование OpenAI GPT-5.3-Codex как модели, которая выходит за рамки чистого программирования. Компания прямо заявляет, что «Codex превращается из агента, который может писать и проверять код, в агента, способного делать практически все, что разработчики и профессионалы могут делать за компьютером».
Этот расширенный набор возможностей включает отладку, развертывание, мониторинг, составление требований к продукту, редактирование текстов, проведение пользовательских исследований, создание презентаций и анализ данных в приложениях электронных таблиц. Модель демонстрирует высокие результаты в GDPVal — оценке OpenAI, запущенной в 2025 году, которая измеряет производительность при выполнении четко определенных интеллектуальных рабочих задач в 44 профессиях.
Это расширение сигнализирует о стремлении OpenAI захватить не только рынок инструментов для разработчиков, но и более широкое пространство программного обеспечения для корпоративной производительности — рынок, который включает в себя таких устоявшихся игроков, как Microsoft, Salesforce и ServiceNow, стремящихся встроить ИИ-агентов в свои платформы.
GPT-5.3-Codex почти удвоила результат своего предшественника в OSWorld — бенчмарке, измеряющем производительность ИИ в реальных задачах офисной продуктивности, таких как редактирование электронных таблиц и создание презентаций. (Источник: OpenAI)
Первая модель кибербезопасности «высокого уровня» от OpenAI стимулирует новые протоколы безопасности и создание фонда защиты в размере 10 млн долларов
Поворот в сторону универсальных вычислений влечет за собой новые соображения безопасности. В примечательном раскрытии информации OpenAI сообщила, что GPT-5.3-Codex является первой моделью, которую она классифицирует как модель «высокого уровня» (High capability) для задач, связанных с кибербезопасностью, в рамках своей структуры готовности (Preparedness Framework), и первой, которая была напрямую обучена выявлению уязвимостей в ПО.
«Хотя у нас нет окончательных доказательств того, что она может полностью автоматизировать кибератаки, мы применяем меры предосторожности и развертываем наш самый комплексный стек безопасности для кибербезопасности на сегодняшний день», — заявила компания. Смягчающие меры включают обучение безопасности двойного назначения, автоматизированный мониторинг, доверенный доступ к расширенным возможностям и конвейеры принудительного исполнения с использованием аналитики угроз.
Альтман подчеркнул это событие в X: «Это наша первая модель, которая достигла уровня «высокий» в сфере кибербезопасности в соответствии с нашей структурой готовности. Мы запускаем пилотное тестирование структуры доверенного доступа (Trusted Access) и выделяем 10 миллионов долларов в виде кредитов API для ускорения киберзащиты».
Компания также расширяет частную бета-версию Aardvark — своего агента для исследовании безопасности — и сотрудничает с мейнтейнерами открытого исходного кода для предоставления бесплатного сканирования кодовых баз широко используемых проектов. OpenAI привела Next.js в качестве примера, когда исследователь безопасности использовал Codex для обнаружения уязвимостей, раскрытых на прошлой неделе.
Противостояние на Суперкубке: Сэм Альтман называет рекламную кампанию Anthropic «явно нечестной», поскольку соперничество принимает личный характер
Однако объявление о кибербезопасности было омрачено все более личным характером соперничества между OpenAI и Anthropic. Выбор времени для релиза в среду невозможно понять без контекста усиления конкуренции OpenAI с Anthropic — стартапом, ориентированным на безопасность ИИ, который был основан в 2021 году бывшими исследователями OpenAI, включая Дарио и Даниэлу Амодей (Dario and Daniela Amodei).
Обе компании запланировали крупные анонсы продуктов на 10 часов утра по тихоокеанскому времени. Anthropic представила Claude Opus 4.6, которую она описывает как свою «самую умную модель», которая «планирует более тщательно, дольше удерживает агентские задачи, надежно работает в масштабных кодовых базах и исправляет собственные ошибки».
Синхронное по времени объявление последовало за неделей эскалации напряженности. Anthropic объявила, что покажет рекламные ролики во время Суперкубка, высмеивающие недавнее решение OpenAI начать тестирование рекламы в ChatGPT для бесплатных пользователей.
Альтман отреагировал с необычной прямотой, назвав рекламу «смешной», но «явно нечестной» в пространном посте в X.
«Мы, очевидно, никогда бы не стали показывать рекламу так, как это изображает Anthropic. Мы не глупы и знаем, что наши пользователи отвергли бы это», — написал Альтман. «Полагаю, в духе новояза Anthropic использовать вводящую в заблуждение рекламу для критики теоретической вводящей в заблуждение рекламы, которой не существует, но реклама на Суперкубке — это не то место, где я бы этого ожидал».
Он пошел дальше, охарактеризовав Anthropic как «авторитарную компанию», которая «хочет контролировать то, что люди делают с помощью ИИ».
«Anthropic продает дорогой продукт богатым людям», — написал Альтман. «Больше жителей Техаса используют ChatGPT бесплатно, чем общее число людей, использующих Claude в США, так что у нас совершенно другая проблема, чем у них».
Корпоративные расходы на ИИ превышают прогнозы, а доля рынка OpenAI сталкивается с давлением со стороны Anthropic и Google
Публичные словесные перепалки маскируют смертельно серьезную деловую конкуренцию. Соперничество разворачивается на фоне взрывного внедрения корпоративного ИИ, где обе компании борются за позиции на стремительно расширяющемся рынке.
Согласно данным опроса Andreessen Horowitz, опубликованным на этой неделе, корпоративные расходы на большие языковые модели значительно превзошли даже самые оптимистичные прогнозы. Средние корпоративные расходы на языковые модели достигли $7 млн в 2025 году, что на 180% выше фактических расходов 2024 года в размере $2,5 млн и на 56% выше того, что предприятия прогнозировали на 2025 год всего годом ранее. Ожидается, что в 2026 году расходы достигнут $11,6 млн на одно предприятие, что означает дальнейший рост на 65%.
Корпоративные расходы на модели ИИ в среднем выросли до $7 млн в 2025 году — на 180 процентов больше, чем годом ранее, и существенно выше прогнозов самих компаний. (Источник: данные опроса a16z)
Данные a16z раскрывают меняющуюся динамику рынка, которая помогает объяснить накал конкуренции. OpenAI сохраняет за собой наибольшую среднюю долю в корпоративном бюджете на ИИ, но эта доля сокращается — с 62% в 2024 году до прогнозируемых 53% в 2026 году. Доля Anthropic, тем временем, выросла с 14% до прогнозируемых 18% за тот же период, а Google демонстрирует аналогичные успехи.
Паттерны корпоративного внедрения рисуют более сложную картину. Хотя OpenAI лидирует по общему объему использования, только 46% опрошенных клиентов OpenAI используют ее самые мощные модели в продакшене по сравнению с 75% у Anthropic и 76% у Google. Если включить среды тестирования, то 89% клиентов Anthropic тестируют или используют самые мощные модели компании — это самый высокий показатель среди основных провайдеров.
В сфере разработки программного обеспечения в частности — одного из основных вариантов использования ИИ-кодеров обеих компаний — опрос a16z показывает, что OpenAI владеет примерно 35% рынка, в то время как Anthropic занимает значительную и растущую долю оставшейся части.
Обе ИИ-лаборатории стремятся стать предпочтительной корпоративной операционной системой, выходя за рамки моделей в сторону полностековых платформ
Эта рыночная динамика объясняет, почему обе компании позиционируют себя как платформы, а не просто поставщиков моделей. В среду OpenAI также запустила Frontier — новую платформу, призванную служить комплексным центром для бизнеса, внедряющего ряд ИИ-инструментов (включая разработанные третьими лицами), которые могут бесперебойно работать вместе.
«Мы можем стать предпочтительным партнером по ИИ-трансформации для бизнеса. Возможности роста доходов от такой платформы безграничны», — заявила журналистам на этой неделе Фиджи Симо (Fidji Simo), генеральный директор по приложениям в OpenAI.
Это произошло вслед за запуском в понедельник десктопного приложения Codex для macOS, которое, по заявлению OpenAI, уже преодолело отметку в 500 000 загрузок. Приложение позволяет пользователям одновременно управлять несколькими ИИ-агентами для кодинга — способность, которая становится все более важной по мере того, как предприятия развертывают агентов для выполнения сложных и долгосрочных задач.
OpenAI по-прежнему удерживает наибольшую долю корпоративных расходов на ИИ, но ее отрыв сокращается — с 62 процентов в 2024 году до прогнозируемых 53 процентов в 2026 году. (Источник: данные опроса a16z)
Триллионные обязательства по вычислениям и оценки в $350 млрд раскрывают масштабные финансовые ставки, стоящие за гонкой ИИ-кодеров
Амбиции платформ требуют экстраординарного капитала. Синхронные запуски подчеркивают ошеломляющие финансовые требования передовой разработки ИИ: обе компании сжигают миллиарды, стремясь закрепить за собой доминирование на рынке.
В настоящее время Anthropic ведет переговоры о раунде финансирования, который может привлечь более $20 млрд при оценке не менее чем в $350 млрд, сообщает Bloomberg, и одновременно планирует выкуп акций у сотрудников (tender offer) по этой оценке.
Тем временем OpenAI сообщила, что задолжала своим инвесторам финансовые обязательства на сумму более $1 триллиона — включая Oracle, Microsoft и Nvidia, которые по сути авансируют затраты на вычисления в ожидании будущей прибыли.
GPT-5.3-Codex была «создана специально для систем NVIDIA GB200 NVL72, обучена и развернута на них», согласно заявлению OpenAI, что является отсылкой к новейшей ИИ-суперкомпьютерной архитектуре поколения Blackwell от Nvidia.
Финансовое давление добавляет срочности корпоративным стратегиям обеих компаний. В отличие от устоявшихся технологических гигантов с диверсифицированными потоками доходов, и Anthropic, и OpenAI должны доказать, что они способны генерировать достаточный доход от ИИ-продуктов, чтобы оправдать свои экстраординарные оценки и затраты на инфраструктуру.
OpenAI обещает больше функций Codex в ближайшие недели, так как 500 000 пользователей скачали новое десктопное приложение
Заглядывая в будущее, OpenAI сообщает, что GPT-5.3-Codex доступна немедленно для платных пользователей ChatGPT на всех интерфейсах Codex: в десктопном приложении, интерфейсе командной строки, расширениях для IDE и веб-интерфейсе. Ожидается, что вскоре появится и доступ к API.
Модель включает новую функцию интерактивности: пользователи могут выбирать между «прагматичной» и «дружелюбной» личностями — кастомизация, к которой, как предполагает Альтман, пользователи относятся неравнодушно. Что более существенно, модель предоставляет частые отчеты о прогрессе во время выполнения задач, позволяя пользователям взаимодействовать в реальном времени, задавать вопросы, обсуждать подходы и направлять процесс к решениям без потери контекста.
«Вместо того чтобы ждать финального результата, вы можете взаимодействовать в реальном времени», — заявили в OpenAI. «GPT-5.3-Codex проговаривает то, что она делает, реагирует на обратную связь и держит вас в курсе от начала и до конца».
Компания обещает расширить возможности в ближайшие недели, а Альтман заявляет: «Я верю, что Codex победит».
Свой ответ Anthropic он завершил философским заявлением, которое четко обозначает характер конкуренции: «Это время принадлежит созидателям, а не тем, кто хочет их контролировать».
Отзовется ли это послание у корпоративных клиентов, которые, согласно данным a16z, называют доверие, безопасность и комплаенс своими главными заботами, еще предстоит увидеть. Очевидно одно: войны ИИ-кодеров начались всерьез, и ни одна из компаний не намерена уступать позиции.



