OpenAI выпускает GPT-5.4 со встроенным режимом работы за компьютером и финансовыми плагинами для Excel и Sheets

OpenAI выпускает GPT-5.4 со встроенным режимом работы за компьютером и финансовыми плагинами для Excel и Sheets

Обновления в сфере ИИ не сбавляют обороты. Буквально через два дня после того, как OpenAI выпустила новую базовую ИИ-модель для ChatGPT под названием GPT-5.3 Instant, компания представила следующее, еще более масштабное обновление: GPT-5.4.

На самом деле GPT-5.4 выпускается в двух вариантах: GPT-5.4 Thinking и GPT-5.4 Pro, причем последняя разработана для решения самых сложных задач.

Обе версии будут доступны в платном интерфейсе программирования приложений (API) и среде разработки Codex от OpenAI, в то время как GPT-5.4 Thinking будет доступна всем платящим подписчикам ChatGPT (Plus — тариф за $20 в месяц и выше), а Pro будет зарезервирована для пользователей тарифов ChatGPT Pro ($200 в месяц) и Enterprise.

По словам представителя OpenAI, пользователи бесплатной версии ChatGPT также смогут опробовать GPT-5.4, но только в тех случаях, когда их запросы будут автоматически перенаправляться на эту модель.

Главными новостями этого релиза являются эффективность — в OpenAI сообщают, что GPT-5.4 использует значительно меньше токенов (на 47% меньше в некоторых задачах) по сравнению с предшественниками — и, пожалуй, даже более впечатляющая особенность: новый «родной» режим управления компьютером (Computer Use), доступный через API и Codex, который позволяет GPT-5.4 управлять компьютером пользователя подобно человеку и работать в различных приложениях.

Компания также выпускает новый набор интеграций с ChatGPT, позволяющий внедрять GPT-5.4 непосредственно в ячейки и электронные таблицы Microsoft Excel, а вскоре — и Google Sheets. Это обеспечит детальный анализ и автоматическое выполнение задач, что должно ускорить работу на уровне предприятий, но может еще больше усилить опасения по поводу сокращения «белых воротничков» на фоне аналогичных предложений от Claude компании Anthropic и ее нового приложения Cowork.

В OpenAI заявляют, что GPT-5.4 поддерживает контекст объемом до 1 миллиона токенов в API и Codex, позволяя агентам планировать, выполнять и проверять задачи на больших временных интервалах. Однако после превышения отметки в 272 000 входных токенов стоимость за каждый миллион токенов удваивается.

«Родное» управление компьютером: шаг к автономным рабочим процессам

Наиболее значимой возможностью, которую подчеркивает OpenAI, является то, что GPT-5.4 — это первая модель общего назначения, выпущенная со встроенными передовыми функциями управления компьютером в Codex и API. Это позволяет агентам работать с компьютером и выполнять многошаговые рабочие процессы в различных приложениях.

По заявлению OpenAI, модель способна как писать код для управления компьютером через такие библиотеки, как Playwright, так и отдавать команды мыши и клавиатуры в ответ на скриншоты. OpenAI также заявляет о качественном скачке в возможностях веб-серфинга агентов.

Результаты бенчмарков приводятся в качестве доказательства того, что это не просто обертка над пользовательским интерфейсом.

В тесте BrowseComp, который измеряет способность ИИ-агентов целенаправленно просматривать веб-страницы в поисках труднодоступной информации, OpenAI сообщает об улучшении показателей GPT-5.4 на 17% в абсолютном выражении по сравнению с GPT-5.2, а версия GPT-5.4 Pro достигла результата в 89.3%, что описывается как новый уровень технологического развития.

В тесте OSWorld-Verified, оценивающем навигацию по рабочему столу с использованием скриншотов, а также действий клавиатуры и мыши, OpenAI заявляет о 75.0% успешности для GPT-5.4 по сравнению с 47.3% у GPT-5.2, отмечая при этом показатель производительности человека на уровне 72.4%.

В тесте WebArena-Verified модель GPT-5.4 достигает 67.3% успешности при использовании как DOM-ориентированного взаимодействия, так и взаимодействия на основе скриншотов (против 65.4% у GPT-5.2). В тесте Online-Mind2Web OpenAI сообщает о 92.8% успешности при использовании исключительно наблюдений на основе скриншотов.

OpenAI также связывает функции управления компьютером с улучшениями в области работы со зрением и документами. В тесте MMMU-Pro модель GPT-5.4 достигает 81.2% успешности без использования инструментов (по сравнению с 79.5% у GPT-5.2), причем в OpenAI утверждают, что этот результат достигается с использованием лишь доли «токенов размышления» (thinking tokens).

В тесте OmniDocBench средняя погрешность GPT-5.4 составляет 0.109 по сравнению с 0.140 у GPT-5.2. В публикации также описывается расширенная поддержка высококачественных входных изображений, включая «оригинальный» уровень детализации до 10.24 млн пикселей.

OpenAI позиционирует GPT-5.4 как инструмент, созданный для более длительных многошаговых рабочих процессов — работы, которая все больше напоминает агента, сохраняющего состояние на протяжении множества действий, а не чат-бота, отвечающего на разовые запросы.

Поиск инструментов и улучшенная оркестровка инструментов

Поскольку экосистемы инструментов становятся все больше, в OpenAI утверждают, что наивный подход — добавление каждого определения инструмента прямо в промпт — создает издержки для каждого запроса: в виде стоимости, задержки и засорения контекста.

GPT-5.4 представляет поиск инструментов (tool search) в API в качестве структурного решения. Вместо получения всех определений инструментов заранее модель получает легкий список инструментов вместе с возможностью поиска и извлекает полные описания инструментов только тогда, когда они действительно необходимы.

OpenAI иллюстрирует выигрыш в эффективности на конкретном примере: на 250 задачах из бенчмарка Scale MCP Atlas при задействовании 36 серверов MCP конфигурация с поиском инструментов сократила общее использование токенов на 47%, сохранив ту же точность, что и конфигурация с прямым предоставлением всех функций MCP в контексте.

Упомянутые 47% относятся конкретно к настройке поиска инструментов в данном тестировании, а не являются общим утверждением о том, что GPT-5.4 использует на 47% меньше токенов для задач любого типа.

Улучшения для разработчиков и рабочих процессов программирования

Главный плюс для разработчиков заключается в том, что GPT-5.4 объединяет сильные стороны программирования GPT-5.3-Codex с более мощными возможностями работы с инструментами и компьютером, которые важны, когда задачи не ограничиваются одним шагом.

GPT-5.4 не уступает или превосходит GPT-5.3-Codex в SWE-Bench Pro, обеспечивая при этом более низкую задержку при любых усилиях на рассуждение.

В Codex также появляются элементы управления рабочим процессом. В OpenAI заявляют, что режим /fast обеспечивает до 1.5 раз более высокую производительность для поддерживаемых моделей, включая GPT-5.4, описывая это как ту же модель и тот же уровень интеллекта, «просто работающие быстрее».

Кроме того, компания объявляет о выпуске экспериментального навыка для Codex — «Playwright (Interactive)», призванного продемонстрировать совместную работу программирования и управления компьютером: визуальную отладку веб-приложений и приложений Electron, а также тестирование программы прямо в процессе ее создания.

OpenAI для Microsoft Excel и Google Sheets

Одновременно с GPT-5.4 компания OpenAI анонсирует набор защищенных ИИ-продуктов в составе ChatGPT, созданных для предприятий и финансовых институтов и работающих на базе GPT-5.4, что обеспечивает расширенные возможности финансового анализа и моделирования в Excel.

Центральным элементом является ChatGPT для Excel и Google Sheets (скоро появится) — решение, которое OpenAI описывает как встроенный прямо в таблицы ChatGPT для создания, анализа и обновления сложных финансовых моделей с использованием формул и структур, на которые уже полагаются рабочие команды.

Пакет также включает новые интеграции приложений с ChatGPT, призванные объединить рыночные, корпоративные и внутренние данные в единый рабочий процесс. Среди них названы FactSet, MSCI, Third Bridge и Moody’s.

Кроме того, в нем представлены многоразовые «навыки» (Skills) для регулярных финансовых задач, таких как предварительный просмотр отчетов о прибылях, анализ сопоставимых компаний, дисконтирование денежных потоков (DCF-анализ) и составление инвестиционных меморандумов.

OpenAI подкрепляет финансовое направление заявлением о результатах внутреннего бенчмарка: производительность модели выросла с 43.7% у GPT-5 до 88.0% у GPT-5.4 Thinking на внутреннем бенчмарке инвестиционного банкинга OpenAI.

Оценка производительности ИИ по сравнению с профессиональной деятельностью

OpenAI опирается на бенчмарки, призванные имитировать реальные результаты офисной работы, а не просто решение головоломок. В тесте GDPval, оценивающем «четко определенную интеллектуальную работу» в рамках 44 профессий, OpenAI сообщает, что GPT-5.4 соответствует уровню отраслевых профессионалов или превосходит его в 83.0% сравнений (по сравнению с 71.0% у GPT-5.2).

Компания также подчеркивает специфические улучшения в тех типах артефактов, которые обычно выявляют слабые места моделей: структурированных таблицах, формулах, повествовательной связности и качестве дизайна.

Во внутреннем бенчмарке задач по моделированию в электронных таблицах, смоделированном по образцу работы младшего аналитика инвестиционного банка, GPT-5.4 набирает в среднем 87.5% против 68.4% у GPT-5.2.

А в наборе тестовых промптов для оценки презентаций, по данным OpenAI, человеческие эксперты отдавали предпочтение презентациям GPT-5.4 в 68.0% случаев по сравнению с GPT-5.2, ссылаясь на лучшую эстетику, большее визуальное разнообразие и более эффективное использование генерации изображений.

Повышение надежности и сокращение галлюцинаций

OpenAI характеризует GPT-5.4 как свою самую фактологически точную модель и связывает это утверждение с практическим набором данных: обезличенными промптами, в которых пользователи ранее отмечали фактические ошибки. На этом наборе OpenAI сообщает, что отдельные утверждения GPT-5.4 на 33% реже оказываются ложными, а полные ответы содержат ошибки на 18% реже по сравнению с GPT-5.2.

В заявлениях, предоставленных VentureBeat компанией OpenAI и приписываемых ранним тестерам GPT-5.4, Дэниел Свецкий (Daniel Swiecki) из Walleye Capital отмечает, что во внутренних финансовых и Excel-оценках GPT-5.4 повысила точность на 30 процентных пунктов, что он связывает с расширенной автоматизацией обновления моделей и сценарного анализа.

Брендан Фуди (Brendan Foody), генеральный директор Mercor, называет GPT-5.4 лучшей моделью, которую тестировала компания, и говорит, что сейчас она занимает первое место в бенчмарке APEX-Agents от Mercor для сферы профессиональных услуг, уделяя особое внимание долгосрочным результатам работы, таким как слайд-шоу, финансовые модели и юридический анализ.

Цены и доступность

В API, по данным OpenAI, GPT-5.4 Thinking доступна как gpt-5.4, а GPT-5.4 Pro — как gpt-5.4-pro. Цены установлены следующие:

  • GPT-5.4: $2.50 / 1 млн входных токенов; $15 / 1 млн выходных токенов

  • GPT-5.4 Pro: $30 / 1 млн входных токенов; $180 / 1 млн выходных токенов

  • Batch + Flex: половина стоимости; Приоритетная обработка: двойной тариф

Это делает GPT-5.4 одной из самых дорогих моделей для запуска через API на фоне всего рынка, как видно из таблицы ниже.

Модель

Входные данные

Выходные данные

Общая стоимость

Источник

Qwen 3 Turbo

$0.05

$0.20

$0.25

Alibaba Cloud

Qwen3.5-Flash

$0.10

$0.40

$0.50

Alibaba Cloud

deepseek-chat (V3.2-Exp)

$0.28

$0.42

$0.70

DeepSeek

deepseek-reasoner (V3.2-Exp)

$0.28

$0.42

$0.70

DeepSeek

Grok 4.1 Fast (с рассуждениями)

$0.20

$0.50

$0.70

xAI

Grok 4.1 Fast (без рассуждений)

$0.20

$0.50

$0.70

xAI

MiniMax M2.5

$0.15

$1.20

$1.35

MiniMax

Gemini 3.1 Flash-Lite

$0.25

$1.50

$1.75

Google

MiniMax M2.5-Lightning

$0.30

$2.40

$2.70

MiniMax

Gemini 3 Flash Preview

$0.50

$3.00

$3.50

Google

Kimi-k2.5

$0.60

$3.00

$3.60

Moonshot

GLM-5

$1.00

$3.20

$4.20

Z.ai

ERNIE 5.0

$0.85

$3.40

$4.25

Baidu

Claude Haiku 4.5

$1.00

$5.00

$6.00

Anthropic

Qwen3-Max (2026-01-23)

$1.20

$6.00

$7.20

Alibaba Cloud

Gemini 3 Pro (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.2

$1.75

$14.00

$15.75

OpenAI

Claude Sonnet 4.6

$3.00

$15.00

$18.00

Anthropic

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Gemini 3 Pro (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 4.6

$5.00

$25.00

$30.00

Anthropic

GPT-5.2 Pro

$21.00

$168.00

$189.00

OpenAI

GPT-5.4 Pro

$30.00

$180.00

$210.00

OpenAI

Еще одно важное примечание: для GPT-5.4 запросы, превышающие 272 000 входных токенов, тарифицируются по двойной ставке, что отражает возможность отправки промптов большего размера, чем поддерживали предыдущие модели.

В Codex компрессия по умолчанию настроена на 272 тыс. токенов, а повышенная цена для длинного контекста применяется только тогда, когда объем ввода превышает 272 тыс. Это означает, что разработчики могут продолжать отправлять промпты в пределах этого размера без срабатывания повышенного тарифа, но могут задействовать более крупные промпты, увеличив лимит компрессии — и тарифицироваться будут только эти увеличенные запросы.

Представитель OpenAI сообщил, что максимальный объем вывода в API составляет 128 000 токенов, как и у предыдущих моделей.

Наконец, объясняя более высокую базовую стоимость GPT-5.4, представитель компании сослался на три фактора: возросшие возможности при решении сложных задач (включая программирование, использование компьютера, глубокие исследования, расширенную генерацию документов и применение инструментов), серьезные улучшения в исследованиях в рамках дорожной карты OpenAI, а также более эффективный процесс рассуждения, использующий меньше токенов для сопоставимых задач. Он добавил, что в OpenAI считают, что GPT-5.4 остается ниже сопоставимых передовых моделей по стоимости даже с учетом повышения.

Более масштабный сдвиг

Судя по релизу и последующим разъяснениям, GPT-5.4 позиционируется как модель, призванная выйти за рамки «генерации ответов» и перейти к устойчивым профессиональным рабочим процессам — тем, которые требуют оркестровки инструментов, взаимодействия с компьютером, длинного контекста и результатов, похожих на те артефакты, которыми люди действительно пользуются на работе.

Акцент OpenAI на эффективности токенов, поиске инструментов, нативном управлении компьютером и снижении количества фактических ошибок, отмечаемых пользователями, указывает на одно направление: сделать агентские системы более жизнеспособными в продакшене за счет снижения стоимости повторных попыток — будь то повторный ввод промпта человеком, вызов другого инструмента агентом или перезапуск рабочего процесса из-за того, что первая попытка оказалась неудачной.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.