OpenAI повышает точность работы с изображениями в ChatGPT

OpenAI повышает точность работы с изображениями в ChatGPT

OpenAI сделала свои инструменты генерации изображений более точными и стабильными в рамках последнего обновления ChatGPT Images, поскольку все больше предприятий и брендов используют генерацию изображений с помощью ИИ для помощи в визуализации дизайна.

Эти обновления станут доступны всем пользователям ChatGPT и через API под названием GPT Image 1.5. Компания заявила, что в их основе лежит модель GPT 5.2, которую многие первые пользователи сочли мощным обновлением для корпоративных задач.

«Для многих первое знакомство с ChatGPT связано с превращением текстового запроса в картинку», — отметила Фиджи Симо (Fidji Simo), генеральный директор по приложениям OpenAI, в публикации на Substack. — «Это волшебный способ увидеть, на что способна эта технология, но интерфейс чата изначально не был для этого предназначен. Создание и редактирование изображений — это особая задача, которая заслуживает пространства, созданного для работы с визуальным контентом».

Удобные для бизнеса обновления: точное редактирование и следование инструкциям

Одно из главных обновлений ChatGPT Images — это более целенаправленное редактирование, даже если изображение создается на платформе чата, а не через API. Модели генерации изображений, такие как ChatGPT Images, Google Nano Banana и Stable Diffusion, предлагают корректировку созданных ИИ картинок на основе текстовых запросов, позволяя пользователю указывать конкретные части фотографии для изменения. Однако эти функции иногда работают нестабильно.

В OpenAI заявили, что благодаря обновлению модель лучше следует пожеланиям пользователя, «сохраняя при этом такие элементы, как освещение, композиция и внешность людей, неизменными во всех входных данных, результатах и последующих правках».

Пользователи могут давать модели указания на выполнение большинства типов редактирования изображений, таких как добавление или удаление элементов, объединение, смешивание и транспонирование.

По словам OpenAI, эта модель «более надежно следует инструкциям», чем предыдущие версии. Она также способна качественнее отрисовывать текст и генерировать реальные, легко читаемые буквы, даже если они расположены плотно или имеют мелкий размер. OpenAI обновила модель, чтобы создавать более четкие и детализированные лица на фотографиях с большим количеством людей.

«Эти преобразования работают как для простых, так и для более сложных концепций, и их легко опробовать с помощью готовых стилей и идей в новой функции ChatGPT Images — никаких текстовых запросов писать не требуется», — заявляют в OpenAI.

Битва генераторов изображений

Обновление модели изображений от OpenAI вышло вслед за широко расхваленной моделью Nano Banana Pro от Google, которая заслужила похвалу в сообществе разработчиков.

Компания вынуждена конкурировать с другими постоянно развивающимися и совершенствующимися моделями генерации изображений, которые стремятся привлечь корпоративных пользователей. И Google — далеко не единственный соперник OpenAI. В августе компания Alibaba объявила, что Qwen-Image способна отображать читаемый текст как на китайском, так и на английском языках. А Black Forest Labs выпустила Flux.2, которая также представляет собой надежную модель генерации изображений с открытым исходным кодом.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.