OpenAI повышает точность работы с изображениями в ChatGPT
OpenAI сделала свои инструменты генерации изображений более точными и стабильными в рамках последнего обновления ChatGPT Images, поскольку все больше предприятий и брендов используют генерацию изображений с помощью ИИ для помощи в визуализации дизайна.
Эти обновления станут доступны всем пользователям ChatGPT и через API под названием GPT Image 1.5. Компания заявила, что в их основе лежит модель GPT 5.2, которую многие первые пользователи сочли мощным обновлением для корпоративных задач.
«Для многих первое знакомство с ChatGPT связано с превращением текстового запроса в картинку», — отметила Фиджи Симо (Fidji Simo), генеральный директор по приложениям OpenAI, в публикации на Substack. — «Это волшебный способ увидеть, на что способна эта технология, но интерфейс чата изначально не был для этого предназначен. Создание и редактирование изображений — это особая задача, которая заслуживает пространства, созданного для работы с визуальным контентом».
Удобные для бизнеса обновления: точное редактирование и следование инструкциям
Одно из главных обновлений ChatGPT Images — это более целенаправленное редактирование, даже если изображение создается на платформе чата, а не через API. Модели генерации изображений, такие как ChatGPT Images, Google Nano Banana и Stable Diffusion, предлагают корректировку созданных ИИ картинок на основе текстовых запросов, позволяя пользователю указывать конкретные части фотографии для изменения. Однако эти функции иногда работают нестабильно.
В OpenAI заявили, что благодаря обновлению модель лучше следует пожеланиям пользователя, «сохраняя при этом такие элементы, как освещение, композиция и внешность людей, неизменными во всех входных данных, результатах и последующих правках».
Пользователи могут давать модели указания на выполнение большинства типов редактирования изображений, таких как добавление или удаление элементов, объединение, смешивание и транспонирование.
По словам OpenAI, эта модель «более надежно следует инструкциям», чем предыдущие версии. Она также способна качественнее отрисовывать текст и генерировать реальные, легко читаемые буквы, даже если они расположены плотно или имеют мелкий размер. OpenAI обновила модель, чтобы создавать более четкие и детализированные лица на фотографиях с большим количеством людей.
«Эти преобразования работают как для простых, так и для более сложных концепций, и их легко опробовать с помощью готовых стилей и идей в новой функции ChatGPT Images — никаких текстовых запросов писать не требуется», — заявляют в OpenAI.
Битва генераторов изображений
Обновление модели изображений от OpenAI вышло вслед за широко расхваленной моделью Nano Banana Pro от Google, которая заслужила похвалу в сообществе разработчиков.
Компания вынуждена конкурировать с другими постоянно развивающимися и совершенствующимися моделями генерации изображений, которые стремятся привлечь корпоративных пользователей. И Google — далеко не единственный соперник OpenAI. В августе компания Alibaba объявила, что Qwen-Image способна отображать читаемый текст как на китайском, так и на английском языках. А Black Forest Labs выпустила Flux.2, которая также представляет собой надежную модель генерации изображений с открытым исходным кодом.



