Представляем OpenAI ChatGPT Images 2.0: многоязычный текст, полноценные инфографики, слайды, карты и даже манга — всё работает практически безупречно

Представляем OpenAI ChatGPT Images 2.0: многоязычный текст, полноценные инфографики, слайды, карты и даже манга — всё работает практически безупречно

Источник: VentureBeat · Carl Franzen

Прошло всего несколько месяцев с тех пор, как OpenAI выпустила свое последнее крупное обновление для генерации изображений с помощью искусственного интеллекта в ChatGPT и через свой программный интерфейс приложения (API) — а именно новую модель генерации изображений под названием GPT-Image-1.5, вышедшую в декабре 2025 года, которая обеспечила улучшенное следование инструкциям, а также более качественную передачу цветов и освещения.

Теперь, после нескольких недель тестирования, компания, положившая начало буму генеративного ИИ, представляет гораздо более масштабное и впечатляющее обновление: ChatGPT Images 2.0. Модель уже не слишком секретно тестировалась в течение нескольких недель на LM Arena AI — сторонней платформе, которую используют OpenAI и другие ведущие разработчики ИИ-моделей для сбора предварительных отзывов, под кодовым названием «duct tape» («изолента»).

За это время модель уже успела поразить первых пользователей своей способностью генерировать длинные блоки текста или отдельные текстовые панели в рамках одного изображения, безумно реалистичным созданием пользовательских интерфейсов и скриншотов с популярных сайтов и платформ, воспроизведением реально существующих людей (таких как сооснователь и генеральный директор OpenAI Сэм Альтман), а также возможностью проводить веб-исследования и внедрять полученные результаты прямо в изображение.

Сегодня обновление официально запускается для пользователей ChatGPT на всех тарифных планах. Компания OpenAI подтвердила, что оно также способно создавать планы этажей, сетки и наборы из множества небольших изображений, модели персонажей с разных ракурсов, а также применять практически все эти функции к изображениям, загружаемым пользователями.

OpenAI ChatGPT Images 2.0 character sheet example.

Пример листа персонажей OpenAI ChatGPT Images 2.0. Источник: OpenAI

Это обновление, включающее новую модель gpt-image-2 для пользователей API и набор функций «размышления» (Thinking) для подписчиков ChatGPT, представляет собой фундаментальный сдвиг в том, как компания рассматривает визуальные медиа. Как говорится в официальных примечаниях к релизу: «Изображения — это язык, а не украшение. Хорошее изображение делает то же самое, что и хорошее предложение: оно выбирает, упорядочивает и раскрывает».

OpenAI не предоставила нам бенчмарки для ChatGPT Images 2.0 заранее, но, судя по всем увиденным мной результатам, можно с уверенностью сказать, что модель работает на уровне «современного технологического пика» (state-of-the-art).

Этот шаг предпринимается на фоне растущей конкуренции в сфере моделей для генерации изображений, особенно после выхода в феврале 2026 года модели генерации изображений Google Nano Banana 2 (также известной как Gemini 3 Pro Image или Gemini 3.1 Pro Image), которая также предложила плотный текст, «вшитый» в изображения, аналогично ChatGPT Images 2.0. Однако, судя по моему краткому тестированию, неформальному использованию и наблюдениям за результатами других пользователей, точность последней при воспроизведении пользовательских интерфейсов, скриншотов и пакетов из нескольких изображений, судя по всему, превосходит возможности даже новейшей модели Google.

Представители и исследователи OpenAI вновь подтвердили приверженность компании принципам безопасности и маркировки генерируемых изображений метаданными на фоне участившихся сообщений — в том числе недавней публикации в The New York Times — об использовании персонажей, созданных пользователями с помощью ИИ (AI UGC), в качестве основы для реалистичных видеороликов. Последние массово публикуются в социальных сетях в рамках кампаний по политическому влиянию, включая демонстрацию поддержки исторически непопулярного президента США Дональда Трампа армией вымышленных людей, выдающих себя за «настоящих американцев».

Когда журналисты VentureBeat на закрытом пресс-брифинге напрямую задали вопрос об этой истории и потенциале GPT Images 2.0 для использования в дезинформационных кампаниях или рекламных/влиятельных кампаниях, Адель Ли (Adele Li), руководитель направления продуктов OpenAI по ChatGPT Images, ответила:

«Мы относимся к безопасности и защищенности невероятно серьезно. Это касается всего, что связано с политическим или предвыборным вмешательством. И хотя другие платформы и компании могут не обладать такими средствами защиты, ChatGPT ими обладает, и мы относимся к мониторингу и защите наших пользователей, а также к влиянию создаваемых нами фотографий невероятно серьезно… За последние пару лет на рынке генерации изображений появилось гораздо больше новых игроков с иными стандартами и философией, чем у ChatGPT, но мы сохраняли стойкость во всем этом и очень гордимся выпуском этой модели с точки зрения ее продвинутых возможностей, реализованных безопасным и защищенным образом».

OpenAI также подтвердила, что выводит из эксплуатации GPT-Image-1.5 в качестве модели по умолчанию во всей своей экосистеме, хотя она останется доступной через API для поддержки старых версий. Этот переход свидетельствует об уверенности OpenAI в том, что модель версии 2.0 является превосходящей заменой как для повседневных, так и для высококлассных творческих задач.

Эпоха рассуждений в генерации изображений с помощью ИИ

Наиболее значительным техническим достижением в Images 2.0 стала интеграция возможностей рассуждения из «O-серии» OpenAI.

Исторически модели для генерации изображений работали как «черные ящики»: вы отправляете промпт, и генерируется один результат. Images 2.0 представляет «агентский» подход.

Когда пользователь выбирает модель с функцией «размышления» (Thinking) в ChatGPT, система больше не просто «рисует» — она исследует, планирует и обдумывает структуру изображения до того, как будет отрисован первый пиксель.

В ходе живого пресс-брифинга Ли продемонстрировала этот процесс рассуждения, загрузив сложный файл PowerPoint, касающийся стратегий разработки внутренних продуктов.

Вместо того чтобы просто создать похожую картинку, модель синтезировала основные данные документа, определила правильные логотипы и создала профессиональный постер, сохранивший специфические стилистические особенности исходного файла.

В ходе моего краткого тестирования — мне предоставили доступ прошлым вечером, и я протестировал модель на нескольких генерациях сегодня утром — ChatGPT Images 2.0 оказалась первой моделью для работы с изображениями от OpenAI (и одной из двух вообще, наряду с Nano Banana 2), которая способна правдоподобно и точно воспроизвести карту распространения империй ацтеков, майя и инков в период их расцвета вместе с полностью читаемой легендой, что делает ее полезной для образовательных целей или внутреннего обучения вопросам глобальных знаний и географии.

ChatGPT Images 2.0 example map of Aztec, Maya and Inca empires' territories

Источник: VentureBeat, создано с помощью ChatGPT Images 2.0

Эта способность к рассуждениям также позволяет модели осуществлять поиск в интернете в режиме реального времени для обеспечения визуальной точности при освещении текущих событий или отображении специфических технических артефактов.

Этому способствует значительно более актуальная дата отсечения знаний — декабрь 2025 года, что является серьезным скачком по сравнению с предыдущими версиями, испытывавшими трудности с современным контекстом.

По словам руководителя исследований Боюаня Чена (Boyuan Chen), базовая архитектура была «переработана с нуля». Хотя Чен отказался подтвердить, использует ли модель традиционную диффузию или авторегрессионный метод, он охарактеризовал ее как «универсальную модель» или «GPT для изображений», способную обрабатывать изменения перспективы в 3D-стиле и сложные пространственные рассуждения с помощью простых текстовых запросов.

Точность, многоязычная поддержка и эффект «вау»

Опыт взаимодействия с Images 2.0 определяется тремя ключевыми столпами: типографика, языковое разнообразие и последовательная стабильность.

Одним из самых устойчивых признаков («маркеров») созданных искусственным интеллектом изображений всегда была неспособность воспроизводить читаемый текст. OpenAI утверждает, что Images 2.0 знаменует собой «качественный скачок» в этом направлении. Теперь модель способна создавать удобочитаемую типографику даже в сложных композициях, таких как научные диаграммы, меню или инфографика.

Взгляд на предоставленный образец «обложки журнала» (Open Scifi) иллюстрирует эту точность: каждый заголовок, номер выпуска и даже дата «Снять с продажи до» на штрихкоде воспроизводятся с четким, профессиональным выравниванием, которое отражает макеты, разработанные человеком.

A sample magazine cover created with ChatGPT Images 2.0

Пример обложки журнала, созданной с помощью ChatGPT Images 2.0. Источник: OpenAI

Эта возможность распространяется и на режим «размышлений» (Thinking), в котором модель способна даже генерировать трехстраничные учебные материалы — в комплекте с тестами — сохраняя при этом единую логику изложения.

Компания OpenAI также устранила давнюю западную предвзятость в изображениях, создаваемых ИИ. Images 2.0 описывается как «полиглотная» модель со значительными улучшениями в отрисовке нелатинских алфавитов. В частности, теперь модель поддерживает высококачественную генерацию текста на японском, корейском, китайском, хинди и бенгали.

На предоставленной диаграмме «Глобальный язык», объясняющей круговорот воды в природе, модель успешно отображает сложные корейские символы (хангыль) в рамках учебного макета.

OpenAI ChatGPT Images 2.0 sample diagram

Пример диаграммы OpenAI ChatGPT Images 2.0, демонстрирующий многоязычные возможности. Источник: OpenAI

Текст не просто переведен; он «отрисован корректно, но на языке, который течет связно», гарантируя, что подписи и пояснения воспринимаются как органичная часть дизайна.

Для авторов, работающих над раскадровками или рекламными кампаниями, самой впечатляющей новой функцией стала возможность генерировать до восьми различных изображений по одному запросу. Что особенно важно, эти изображения сохраняют «непрерывность персонажей и объектов» во всей серии.

Ли отметила, что это решает проблему «громоздкого» рабочего процесса, при котором раньше пользователям приходилось отправлять промпты для каждого изображения по отдельности и вручную стыковать их вместе. Эта функция позволяет создавать целые серии манги, детские книги или семейство графических материалов для соцсетей, разделяющих одну и ту же визуальную ДНК.

Лицензирование и доступность

Стратегия развертывания от OpenAI отражает четкий курс на профессиональное и корпоративное внедрение. Хотя базовая модель доступна всем пользователям, включая участников бесплатного тарифа, расширенные возможности «Thinking» и «Pro» зарезервированы за платными тарифами.

  • Бесплатные пользователи: имеют доступ к базовой модели ImageGen 2.0 для стандартных задач.

  • Пользователи Plus и Pro: могут использовать возможности «Thinking», включая применение инструментов, веб-поиск и генерацию нескольких изображений.

  • Пользователи Pro: получают дополнительный доступ к моделям «ImageGen Pro» для более продвинутой генерации изображений.

  • Разработчики API: могут интегрировать gpt-image-2, которая поддерживает разрешение до 4K (в настоящее время находится в бета-версии) и гибкие соотношения сторон — от широкого 3:1 до вертикального 1:3.

Цены на API выглядят следующим образом (они повторяют предшествующую модель GPT-Image-1.5, но при этом экономят 2 доллара со стороны генерации вывода):

Изображение
8,00 долл. за входящие данные (ввод)
2,00 долл. за кэшированные входящие данные
30,00 долл. за исходящие данные (вывод)

Текст
5,00 долл. за входящие данные (ввод)
1,25 долл. за кэшированные входящие данные
10,00 долл. за исходящие данные (вывод)

На данный момент совершенно очевидно, что OpenAI описывает три практических уровня доступа, даже если компания пока не опубликовала точную матрицу по тарифам.

Базовым уровнем является ChatGPT Images 2.0, которая, согласно блогу OpenAI, доступна всем пользователям ChatGPT и Codex и включает ключевые улучшения модели: лучшее следование инструкциям, более качественный рендеринг текста, успехи в многоязычности, расширенные соотношения сторон и более отполированные результаты, пригодные для коммерческого использования.

Выше находится уровень «размышлений» (thinking), который в релизе определен более конкретно: при выборе модели с размышлениями система может потратить больше времени, использовать веб, проанализировать загруженные материалы, продумать макет перед генерацией и создать несколько различных изображений одновременно, включая до восьми согласованных результатов с сохранением преемственности.

В ходе брифинга Ли также охарактеризовала «thinking» и «Pro» как «прокачанные» версии базовой модели с поддержкой инструментов, отметив, что эти продвинутые режимы работают медленнее, а не быстрее, поскольку выполняют больше рассуждений и поиска «под капотом». Неясной остается точная граница функционала между Thinking и Pro.

Материалы указывают, что пользователи Pro получают доступ к более продвинутой генерации изображений, однако в них не уточняется, означает ли это более высокое качество, повышенные лимиты, более высокое разрешение, большее количество вариантов на выходе или какое-то иное преимущество, отличающееся от самого режима размышлений.

Для корпоративных пользователей самым безопасным подходом к различиям будет воспринимать их не как три совершенно отдельных продукта, а как спектр: от быстрой генерации по умолчанию до более медленной, более агентской, более структурированной генерации.

Если команде нужны быстрые творческие наброски, маркетинговые концепции, простая графика или повседневная правка изображений, базовой модели Images 2.0 вполне достаточно в качестве стандарта.

Если задача связана с фактической точностью, трансформацией внутренних документов в поясняющие материалы, созданием наборов из нескольких изображений или поддержанием согласованности в серии ассистов, гораздо более важным различием является наличие у организации доступа к выводу с поддержкой режима размышлений.

До тех пор, пока OpenAI не представит более четкое разделение между Pro и Thinking, корпоративным покупателям следует рассматривать «thinking» как значимое функциональное обновление, а «Pro» — как потенциально более высокий уровень доступа, точные дополнительные преимущества которого требуют уточнения перед закупкой или планированием рабочих процессов.

Стандарты безопасности

По словам представителей OpenAI, ChatGPT Images 2.0 предлагает «многоуровневый стек» протоколов безопасности, который включает в себя:

  1. Происхождение (Provenance): соблюдение отраслевых стандартов нанесения водяных знаков, чтобы изображения, созданные ИИ, можно было идентифицировать.

  2. Защитные механизмы модели: использование передовых моделей восприятия для фильтрации вредоносного или оскорбительного контента как для взрослых, так и для детей.

  3. Активный мониторинг: обеспечение соблюдения пользовательских правил посредством системы репортов в реальном времени.

Ли подчеркнула, что, хотя их философия заключается в «максимизации творческого потенциала пользователей», они поддерживают строгую политику против вмешательства в выборы.

Что это значит для корпоративных пользователей

Переход от Images 1.5 к 2.0 — это нечто большее, чем просто увеличение разрешения. Интегрируя рассуждения, OpenAI пытается решить «проблему разрыва намерений» (intent gap), которая преследовала ИИ-арт с момента его зарождения.

Когда вы просите ИИ создать «инфографику о спросе и предложении», вы ищете не просто картинку, а логичную структуру информации.

Образец «Дизайна интерьера» (концепция мебели в стиле джапанди) подчеркивает этот системный подход к мышлению. Модель не просто сгенерировала комнату — она создала согласованный план этажа, цветовую палитру, список материалов и «вдохновляющие» снимки, которые объединены единой эстетикой.

Это и есть то, что OpenAI называет переходом от «инструмента» к «визуальной системе». Однако эта возросшая мощность сопровождается компромиссом в скорости.

Для профессионального пользователя это, вероятно, оправданный обмен: ожидание дополнительной минуты ради «готового к производству ассиста» все равно значительно быстрее часов, необходимых для ручного дизайна.

По мере развертывания ChatGPT Images 2.0 она знаменует собой начало эпохи, когда ИИ не просто помогает создавать искусство, но и решает «экономически ценные творческие задачи».

Пока еще предстоит увидеть, сможет ли модель полностью заменить осознанность и замысел человеческого дизайнера, но с разрешением 2K, многоязычной беглостью и способностью «думать» перед тем, как действовать, OpenAI определенно сократила это расстояние.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.