OpenAI выпускает GPT-5.4 со встроенным режимом работы за компьютером и финансовыми плагинами для Excel и Sheets
Обновления в сфере ИИ не сбавляют обороты. Буквально через два дня после того, как OpenAI выпустила новую базовую ИИ-модель для ChatGPT под названием GPT-5.3 Instant, компания представила следующее, еще более масштабное обновление: GPT-5.4.
На самом деле GPT-5.4 выпускается в двух вариантах: GPT-5.4 Thinking и GPT-5.4 Pro, причем последняя разработана для решения самых сложных задач.
Обе версии будут доступны в платном интерфейсе программирования приложений (API) и среде разработки Codex от OpenAI, в то время как GPT-5.4 Thinking будет доступна всем платящим подписчикам ChatGPT (Plus — тариф за $20 в месяц и выше), а Pro будет зарезервирована для пользователей тарифов ChatGPT Pro ($200 в месяц) и Enterprise.
По словам представителя OpenAI, пользователи бесплатной версии ChatGPT также смогут опробовать GPT-5.4, но только в тех случаях, когда их запросы будут автоматически перенаправляться на эту модель.
Главными новостями этого релиза являются эффективность — в OpenAI сообщают, что GPT-5.4 использует значительно меньше токенов (на 47% меньше в некоторых задачах) по сравнению с предшественниками — и, пожалуй, даже более впечатляющая особенность: новый «родной» режим управления компьютером (Computer Use), доступный через API и Codex, который позволяет GPT-5.4 управлять компьютером пользователя подобно человеку и работать в различных приложениях.
Компания также выпускает новый набор интеграций с ChatGPT, позволяющий внедрять GPT-5.4 непосредственно в ячейки и электронные таблицы Microsoft Excel, а вскоре — и Google Sheets. Это обеспечит детальный анализ и автоматическое выполнение задач, что должно ускорить работу на уровне предприятий, но может еще больше усилить опасения по поводу сокращения «белых воротничков» на фоне аналогичных предложений от Claude компании Anthropic и ее нового приложения Cowork.
В OpenAI заявляют, что GPT-5.4 поддерживает контекст объемом до 1 миллиона токенов в API и Codex, позволяя агентам планировать, выполнять и проверять задачи на больших временных интервалах. Однако после превышения отметки в 272 000 входных токенов стоимость за каждый миллион токенов удваивается.
«Родное» управление компьютером: шаг к автономным рабочим процессам
Наиболее значимой возможностью, которую подчеркивает OpenAI, является то, что GPT-5.4 — это первая модель общего назначения, выпущенная со встроенными передовыми функциями управления компьютером в Codex и API. Это позволяет агентам работать с компьютером и выполнять многошаговые рабочие процессы в различных приложениях.
По заявлению OpenAI, модель способна как писать код для управления компьютером через такие библиотеки, как Playwright, так и отдавать команды мыши и клавиатуры в ответ на скриншоты. OpenAI также заявляет о качественном скачке в возможностях веб-серфинга агентов.
Результаты бенчмарков приводятся в качестве доказательства того, что это не просто обертка над пользовательским интерфейсом.
В тесте BrowseComp, который измеряет способность ИИ-агентов целенаправленно просматривать веб-страницы в поисках труднодоступной информации, OpenAI сообщает об улучшении показателей GPT-5.4 на 17% в абсолютном выражении по сравнению с GPT-5.2, а версия GPT-5.4 Pro достигла результата в 89.3%, что описывается как новый уровень технологического развития.
В тесте OSWorld-Verified, оценивающем навигацию по рабочему столу с использованием скриншотов, а также действий клавиатуры и мыши, OpenAI заявляет о 75.0% успешности для GPT-5.4 по сравнению с 47.3% у GPT-5.2, отмечая при этом показатель производительности человека на уровне 72.4%.
В тесте WebArena-Verified модель GPT-5.4 достигает 67.3% успешности при использовании как DOM-ориентированного взаимодействия, так и взаимодействия на основе скриншотов (против 65.4% у GPT-5.2). В тесте Online-Mind2Web OpenAI сообщает о 92.8% успешности при использовании исключительно наблюдений на основе скриншотов.
OpenAI также связывает функции управления компьютером с улучшениями в области работы со зрением и документами. В тесте MMMU-Pro модель GPT-5.4 достигает 81.2% успешности без использования инструментов (по сравнению с 79.5% у GPT-5.2), причем в OpenAI утверждают, что этот результат достигается с использованием лишь доли «токенов размышления» (thinking tokens).
В тесте OmniDocBench средняя погрешность GPT-5.4 составляет 0.109 по сравнению с 0.140 у GPT-5.2. В публикации также описывается расширенная поддержка высококачественных входных изображений, включая «оригинальный» уровень детализации до 10.24 млн пикселей.
OpenAI позиционирует GPT-5.4 как инструмент, созданный для более длительных многошаговых рабочих процессов — работы, которая все больше напоминает агента, сохраняющего состояние на протяжении множества действий, а не чат-бота, отвечающего на разовые запросы.
Поиск инструментов и улучшенная оркестровка инструментов
Поскольку экосистемы инструментов становятся все больше, в OpenAI утверждают, что наивный подход — добавление каждого определения инструмента прямо в промпт — создает издержки для каждого запроса: в виде стоимости, задержки и засорения контекста.
GPT-5.4 представляет поиск инструментов (tool search) в API в качестве структурного решения. Вместо получения всех определений инструментов заранее модель получает легкий список инструментов вместе с возможностью поиска и извлекает полные описания инструментов только тогда, когда они действительно необходимы.
OpenAI иллюстрирует выигрыш в эффективности на конкретном примере: на 250 задачах из бенчмарка Scale MCP Atlas при задействовании 36 серверов MCP конфигурация с поиском инструментов сократила общее использование токенов на 47%, сохранив ту же точность, что и конфигурация с прямым предоставлением всех функций MCP в контексте.
Упомянутые 47% относятся конкретно к настройке поиска инструментов в данном тестировании, а не являются общим утверждением о том, что GPT-5.4 использует на 47% меньше токенов для задач любого типа.
Улучшения для разработчиков и рабочих процессов программирования
Главный плюс для разработчиков заключается в том, что GPT-5.4 объединяет сильные стороны программирования GPT-5.3-Codex с более мощными возможностями работы с инструментами и компьютером, которые важны, когда задачи не ограничиваются одним шагом.
GPT-5.4 не уступает или превосходит GPT-5.3-Codex в SWE-Bench Pro, обеспечивая при этом более низкую задержку при любых усилиях на рассуждение.
В Codex также появляются элементы управления рабочим процессом. В OpenAI заявляют, что режим /fast обеспечивает до 1.5 раз более высокую производительность для поддерживаемых моделей, включая GPT-5.4, описывая это как ту же модель и тот же уровень интеллекта, «просто работающие быстрее».
Кроме того, компания объявляет о выпуске экспериментального навыка для Codex — «Playwright (Interactive)», призванного продемонстрировать совместную работу программирования и управления компьютером: визуальную отладку веб-приложений и приложений Electron, а также тестирование программы прямо в процессе ее создания.
OpenAI для Microsoft Excel и Google Sheets
Одновременно с GPT-5.4 компания OpenAI анонсирует набор защищенных ИИ-продуктов в составе ChatGPT, созданных для предприятий и финансовых институтов и работающих на базе GPT-5.4, что обеспечивает расширенные возможности финансового анализа и моделирования в Excel.
Центральным элементом является ChatGPT для Excel и Google Sheets (скоро появится) — решение, которое OpenAI описывает как встроенный прямо в таблицы ChatGPT для создания, анализа и обновления сложных финансовых моделей с использованием формул и структур, на которые уже полагаются рабочие команды.
Пакет также включает новые интеграции приложений с ChatGPT, призванные объединить рыночные, корпоративные и внутренние данные в единый рабочий процесс. Среди них названы FactSet, MSCI, Third Bridge и Moody’s.
Кроме того, в нем представлены многоразовые «навыки» (Skills) для регулярных финансовых задач, таких как предварительный просмотр отчетов о прибылях, анализ сопоставимых компаний, дисконтирование денежных потоков (DCF-анализ) и составление инвестиционных меморандумов.
OpenAI подкрепляет финансовое направление заявлением о результатах внутреннего бенчмарка: производительность модели выросла с 43.7% у GPT-5 до 88.0% у GPT-5.4 Thinking на внутреннем бенчмарке инвестиционного банкинга OpenAI.
Оценка производительности ИИ по сравнению с профессиональной деятельностью
OpenAI опирается на бенчмарки, призванные имитировать реальные результаты офисной работы, а не просто решение головоломок. В тесте GDPval, оценивающем «четко определенную интеллектуальную работу» в рамках 44 профессий, OpenAI сообщает, что GPT-5.4 соответствует уровню отраслевых профессионалов или превосходит его в 83.0% сравнений (по сравнению с 71.0% у GPT-5.2).
Компания также подчеркивает специфические улучшения в тех типах артефактов, которые обычно выявляют слабые места моделей: структурированных таблицах, формулах, повествовательной связности и качестве дизайна.
Во внутреннем бенчмарке задач по моделированию в электронных таблицах, смоделированном по образцу работы младшего аналитика инвестиционного банка, GPT-5.4 набирает в среднем 87.5% против 68.4% у GPT-5.2.
А в наборе тестовых промптов для оценки презентаций, по данным OpenAI, человеческие эксперты отдавали предпочтение презентациям GPT-5.4 в 68.0% случаев по сравнению с GPT-5.2, ссылаясь на лучшую эстетику, большее визуальное разнообразие и более эффективное использование генерации изображений.
Повышение надежности и сокращение галлюцинаций
OpenAI характеризует GPT-5.4 как свою самую фактологически точную модель и связывает это утверждение с практическим набором данных: обезличенными промптами, в которых пользователи ранее отмечали фактические ошибки. На этом наборе OpenAI сообщает, что отдельные утверждения GPT-5.4 на 33% реже оказываются ложными, а полные ответы содержат ошибки на 18% реже по сравнению с GPT-5.2.
В заявлениях, предоставленных VentureBeat компанией OpenAI и приписываемых ранним тестерам GPT-5.4, Дэниел Свецкий (Daniel Swiecki) из Walleye Capital отмечает, что во внутренних финансовых и Excel-оценках GPT-5.4 повысила точность на 30 процентных пунктов, что он связывает с расширенной автоматизацией обновления моделей и сценарного анализа.
Брендан Фуди (Brendan Foody), генеральный директор Mercor, называет GPT-5.4 лучшей моделью, которую тестировала компания, и говорит, что сейчас она занимает первое место в бенчмарке APEX-Agents от Mercor для сферы профессиональных услуг, уделяя особое внимание долгосрочным результатам работы, таким как слайд-шоу, финансовые модели и юридический анализ.
Цены и доступность
В API, по данным OpenAI, GPT-5.4 Thinking доступна как gpt-5.4, а GPT-5.4 Pro — как gpt-5.4-pro. Цены установлены следующие:
-
GPT-5.4: $2.50 / 1 млн входных токенов; $15 / 1 млн выходных токенов
-
GPT-5.4 Pro: $30 / 1 млн входных токенов; $180 / 1 млн выходных токенов
-
Batch + Flex: половина стоимости; Приоритетная обработка: двойной тариф
Это делает GPT-5.4 одной из самых дорогих моделей для запуска через API на фоне всего рынка, как видно из таблицы ниже.
|
Модель |
Входные данные |
Выходные данные |
Общая стоимость |
Источник |
|
Qwen 3 Turbo |
$0.05 |
$0.20 |
$0.25 |
|
|
Qwen3.5-Flash |
$0.10 |
$0.40 |
$0.50 |
|
|
deepseek-chat (V3.2-Exp) |
$0.28 |
$0.42 |
$0.70 |
|
|
deepseek-reasoner (V3.2-Exp) |
$0.28 |
$0.42 |
$0.70 |
|
|
Grok 4.1 Fast (с рассуждениями) |
$0.20 |
$0.50 |
$0.70 |
|
|
Grok 4.1 Fast (без рассуждений) |
$0.20 |
$0.50 |
$0.70 |
|
|
MiniMax M2.5 |
$0.15 |
$1.20 |
$1.35 |
|
|
Gemini 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiniMax M2.5-Lightning |
$0.30 |
$2.40 |
$2.70 |
|
|
Gemini 3 Flash Preview |
$0.50 |
$3.00 |
$3.50 |
|
|
Kimi-k2.5 |
$0.60 |
$3.00 |
$3.60 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
ERNIE 5.0 |
$0.85 |
$3.40 |
$4.25 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Qwen3-Max (2026-01-23) |
$1.20 |
$6.00 |
$7.20 |
|
|
Gemini 3 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.2 |
$1.75 |
$14.00 |
$15.75 |
|
|
Claude Sonnet 4.6 |
$3.00 |
$15.00 |
$18.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Gemini 3 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Claude Opus 4.6 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.2 Pro |
$21.00 |
$168.00 |
$189.00 |
|
|
GPT-5.4 Pro |
$30.00 |
$180.00 |
$210.00 |
Еще одно важное примечание: для GPT-5.4 запросы, превышающие 272 000 входных токенов, тарифицируются по двойной ставке, что отражает возможность отправки промптов большего размера, чем поддерживали предыдущие модели.
В Codex компрессия по умолчанию настроена на 272 тыс. токенов, а повышенная цена для длинного контекста применяется только тогда, когда объем ввода превышает 272 тыс. Это означает, что разработчики могут продолжать отправлять промпты в пределах этого размера без срабатывания повышенного тарифа, но могут задействовать более крупные промпты, увеличив лимит компрессии — и тарифицироваться будут только эти увеличенные запросы.
Представитель OpenAI сообщил, что максимальный объем вывода в API составляет 128 000 токенов, как и у предыдущих моделей.
Наконец, объясняя более высокую базовую стоимость GPT-5.4, представитель компании сослался на три фактора: возросшие возможности при решении сложных задач (включая программирование, использование компьютера, глубокие исследования, расширенную генерацию документов и применение инструментов), серьезные улучшения в исследованиях в рамках дорожной карты OpenAI, а также более эффективный процесс рассуждения, использующий меньше токенов для сопоставимых задач. Он добавил, что в OpenAI считают, что GPT-5.4 остается ниже сопоставимых передовых моделей по стоимости даже с учетом повышения.
Более масштабный сдвиг
Судя по релизу и последующим разъяснениям, GPT-5.4 позиционируется как модель, призванная выйти за рамки «генерации ответов» и перейти к устойчивым профессиональным рабочим процессам — тем, которые требуют оркестровки инструментов, взаимодействия с компьютером, длинного контекста и результатов, похожих на те артефакты, которыми люди действительно пользуются на работе.
Акцент OpenAI на эффективности токенов, поиске инструментов, нативном управлении компьютером и снижении количества фактических ошибок, отмечаемых пользователями, указывает на одно направление: сделать агентские системы более жизнеспособными в продакшене за счет снижения стоимости повторных попыток — будь то повторный ввод промпта человеком, вызов другого инструмента агентом или перезапуск рабочего процесса из-за того, что первая попытка оказалась неудачной.



