MAI-Image-2-Efficient от Microsoft снижает затраты на 41%
Источник: VentureBeat · Michael Nuñez
Компания Microsoft выпустила сегодня модель MAI-Image-2-Efficient — более доступную и высокоскоростную версию своей флагманской модели «текст-в-изображение», которая, по заявлению компании, обеспечивает качество промышленного уровня почти за полцены. Этот релиз, сразу же ставший доступным в Microsoft Foundry и MAI Playground без листа ожидания, знаменует собой самый быстрый запуск от внутренней команды специалистов Microsoft по искусственному интеллекту и является самым четким сигналом того, что Редмонд серьезно настроен на создание самодостаточной инфраструктуры ИИ, не зависящей от OpenAI.
Новая модель стоит 5 долларов за миллион токенов текстового ввода и 19,50 доллара за миллион токенов генерации изображений, что представляет собой снижение примерно на 41% по сравнению с ценами на MAI-Image-2, составлявшими 5 и 33 доллара соответственно для тех же категорий. В Microsoft заявляют, что модель работает на 22% быстрее своего флагманского аналога и достигает в 4 раза большей эффективности пропускной способности на один графический процессор при измерении на оборудовании NVIDIA H100 с разрешением 1024×1024. Компания также утверждает, что она превосходит конкурирующие модели других гиперскейлеров — в частности, называя Gemini 3.1 Flash, Gemini 3.1 Flash Image и Gemini 3 Pro Image от Google — в среднем на 40% по тестам задержки p50.
По сообщению Microsoft, модель также внедряется в Copilot и Bing, а в дальнейшем появится и на других платформах.
Стратегия Microsoft с двумя моделями заимствует принципы из учебника по ценообразованию в сфере ИИ
Microsoft позиционирует MAI-Image-2-Efficient и свою флагманскую модель MAI-Image-2 как взаимодополняющие инструменты, а не замену друг другу — это многоуровневая пара, призванная охватить весь спектр корпоративных потребностей в генерации изображений.
MAI-Image-2-Efficient ориентирована на высокоинтенсивные и чувствительные к затратам производственные рабочие нагрузки: предметную фотосъемку, маркетинговые креативы, макеты пользовательских интерфейсов, конвейеры фирменных ассетов и интерактивные приложения в реальном времени. По данным Microsoft, она аккуратно работает с короткими текстами внутри изображений (такими как заголовки и подписи) и создана для работы в условиях жестких ограничений по задержке и бюджету в средах пакетной обработки. MAI-Image-2 тем временем остается точным инструментом компании — моделью, к которой обращаются, когда техническое задание требует максимальной фотореалистичной детализации, сложной стилизации (например, аниме или иллюстрации) или более длинной и сложной типографики внутри изображения. Microsoft фактически говорит корпоративным клиентам: используйте эффективную модель для сборочной линии, а флагманскую — для витрины.
Этот подход отражает стратегии ценообразования, которые доказали свою эффективность в индустрии ИИ — линейка моделей GPT от OpenAI, семейство Haiku-Sonnet-Opus от Anthropic, разделение на Flash и Pro от Google — но применяется непосредственно к генерации изображений, то есть в области, где экономика затрат на одно изображение может стать решающим фактором для масштабного внедрения в производство.
Как Microsoft выпустила оптимизированную для производства модель изображений менее чем за месяц
Скорость этого релиза заслуживает внимания. Сама MAI-Image-2 дебютировала в MAI Playground только 19 марта, как ранее сообщал VentureBeat, а более широкая доступность через Microsoft Foundry появилась 2 апреля вместе с двумя другими новыми базовыми моделями: MAI-Transcribe-1 (модель распознавания речи с поддержкой 25 языков) и MAI-Voice-1 (модель генерации аудио). Меньше чем через месяц Microsoft выпустила оптимизированный производственный вариант.
Такой темп говорит о том, что команда MAI Superintelligence — исследовательская группа под руководством Мустафы Сулеймана, генерального директора Microsoft AI, созданная в ноябре 2025 года — работает скорее как стартап, выпускающий итеративные продукты, чем как традиционная корпоративная исследовательская лаборатория, публикующая научные работы. Когда Сулейман написал в своем блоге от 2 апреля, что команда занимается «созданием гуманистического ИИ» с акцентом на «оптимизацию способов общения людей и обучение для практического использования», он, судя по всему, имел в виду это буквально: модели не просто выходят в релиз, они выпускаются достаточно быстро, чтобы иметь собственные дорожные карты продуктов.
Первые отзывы о MAI-Image-2 оказались на редкость положительными. В своем практическом обзоре издание Decrypt сообщило, что модель уже заняла 3-е место в рейтинге Arena.ai по генерации изображений, уступая лишь Google и OpenAI. Рецензент Decrypt отметил, что фотореализм модели является «настоящим достоинством», а рендеринг текста — «законным преимуществом», которое «справилось со сложной типографикой гораздо стабильнее, чем мы ожидали». В обзоре также отмечалось, что в некоторых прямых сравнениях MAI-Image-2 превосходила GPT-Image от OpenAI по качеству изображений и текстовому рендерингу, несмотря на то, что в таблице лидеров находилась ниже нее — наблюдение, которое подчеркивает, что рейтинги бенчмарков не всегда отражают реальную пользу в повседневных задачах.
Тем не менее, оригинальная модель поставлялась со значительными ограничениями, на которые указал Decrypt: 30-секундный кулдаун между генерациями, дневной лимит в 15 изображений в родном интерфейсе, вывод только в соотношении сторон 1:1, отсутствие возможностей преобразования изображений в изображения, а также агрессивная фильтрация контента, которая блокировала даже безобидные творческие запросы. Унаследовала ли MAI-Image-2-Efficient какие-либо из этих ограничений или смягчила их, в сегодняшнем анонсе не уточняется, и корпоративные клиенты, получающие доступ к модели через Foundry API, скорее всего, столкнутся с иными ограничениями, чем пользователи игровой площадки.
Внутри трещащих по швам отношений Microsoft и OpenAI, которые сделали появление собственных моделей неизбежным
Сегодняшний запуск нельзя рассматривать изолированно. Он происходит в момент, когда отношения между Microsoft и OpenAI — некогда определяющим партнерством эпохи генеративного ИИ — явно трещат по швам.
Буквально вчера CNBC сообщила, что недавно назначенный директор по доходам OpenAI Денис Дрессер (Denise Dresser) направила внутреннюю служебную записку сотрудникам, в которой прямо заявила, что партнерство с Microsoft «также ограничило наши возможности удовлетворять потребности предприятий там, где они находятся». В меморандуме, как сообщается, превозносился новый альянс OpenAI с Amazon Web Services и платформой Bedrock как ключевой драйвер роста, а спрос со стороны новых клиентов описывался как «поистине ошеломляющий» с момента объявления о партнерстве в конце февраля. Microsoft добавила OpenAI в список своих конкурентов в своем годовом отчете в середине 2024 года. OpenAI тем временем диверсифицировала свою облачную инфраструктуру за счет CoreWeave, Google и Oracle, снизив свою зависимость от Microsoft Azure.
Семейство моделей MAI является наиболее осязаемым проявлением этого стратегического размежевания со стороны Microsoft. Когда Microsoft может генерировать изображения промышленного качества с помощью собственной модели по цене 19,50 доллара за миллион токенов вывода, расчеты в отношении дальнейшего лицензирования моделей изображений OpenAI — и выплаты OpenAI доли от получаемой выручки — кардинально меняются. Каждая модель MAI, достигающая производственного качества, представляет собой статью расходов, которую Microsoft потенциально может убрать с баланса OpenAI и перенести на свой собственный.
Организационная инфраструктура для поддержки этого сдвига уже создана. 17 марта, как следует из сообщений, опубликованных в официальном блоге Microsoft, генеральный директор Сатья Наделла объявил о масштабной реорганизации, которая объединила усилия компании в области потребительского и коммерческого Copilot под началом единой руководящей команды, а Джейкоб Андреу (Jacob Andreou) был повышен до должности исполнительного вице-президента по Copilot с прямым подчинением Наделле. Что особенно важно, реорганизация также перефокусировала роль Сулеймана. Как написал Наделла в своем обращении к сотрудникам, компания «удваивает усилия в нашей миссии по созданию суперинтеллекта, обладая талантами и вычислительными мощностями для создания моделей, оказывающих реальное продуктовое влияние с точки зрения метрик оценки (evals), снижения себестоимости проданных товаров (COGS), а также продвижения рубежей технологий». Эта фраза — «снижение COGS» — является корпоративным жаргоном для снижения себестоимости продукции, и она прямо указывает на экономическую мотивацию, стоящую за такими моделями, как MAI-Image-2-Efficient. Каждый доллар, который Microsoft экономит, используя собственные модели вместо лицензирования у партнеров, идет прямо в валовую прибыль.
Почему дешевая и быстрая генерация изображений — это секретный ингредиент для будущего агентного ИИ от Microsoft
Есть еще один аспект, который делает сегодняшний релиз стратегически важным, и он, возможно, является самым главным: рост числа ИИ-агентов.
TechCrunch сообщил вчера, что Microsoft тестирует способы интеграции функций, подобных OpenClaw, в Microsoft 365 Copilot, двигаясь к созданию постоянно работающего агента, способного выполнять многоэтапные задачи в течение длительного времени. Компания также запустила Copilot Cowork (агент, выполняющий действия в приложениях Microsoft 365), Copilot Tasks (агент для выполнения многоэтапных задач личной продуктивности) и Agent 365 (упоминавшийся в марте в меморандуме Наделлы о реорганизации). Ожидается, что Microsoft продемонстрирует эти агентные возможности на своей конференции Build в июне.
В мире агентов, где системы ИИ не просто отвечают на вопросы, а автономно выполняют сложные рабочие процессы, генерация изображений становится примитивом, к которому агенты обращаются программно, а не самостоятельным продуктом, с которым пользователи взаимодействуют вручную. Корпоративному агенту, создающему маркетинговую кампанию, может потребоваться сгенерировать десятки изображений продуктов, создать ассеты для социальных сетей, подготовить графику для презентаций и доработать концепции дизайна — и все это без вмешательства человека на каждом этапе. Экономика такого рабочего процесса полностью определяется ценообразованием за токен и задержкой, что как раз и оптимизирует MAI-Image-2-Efficient. Если видение Microsoft в отношении Copilot предполагает наличие агентов, которые генерируют изображения в качестве рутинной подзадачи в рамках более крупных рабочих процессов, этим агентам требуется генерация изображений, достаточно быстрая, чтобы не создавать узких мест, и достаточно дешевая, чтобы не разрушать прогнозы затрат при вызове тысячи раз в день. Улучшение эффективности в 4 раза и снижение цены на 41% — это не просто красивые маркетинговые цифры, это архитектурные требования для агентного будущего, на которое Microsoft ставит все свое будущее.
Что Microsoft все еще не объяснила по поводу своей новой модели изображений
Ряд важных вопросов остаются без ответа в сегодняшнем анонсе. Microsoft не раскрыла, решает ли MAI-Image-2-Efficient проблемы с ограничениями соотношения сторон и агрессивной фильтрацией контента, на которые рецензенты указывали в оригинальной модели. Компания также не уточнила, связаны ли компромиссы между качеством и скоростью с заметным ухудшением результатов при сложных запросах — в анонсе термины «качество промышленного уровня» и «флагманское качество» используются как взаимозаменяемые, однако модели дистилляции любого рода обычно предполагают определенные уступки в качестве.
Сноски в пресс-релизе также раскрывают узкие условия, в которых тестировались заявления о бенчмарках: показатели эффективности измерялись на NVIDIA H100 при разрешении 1024×1024 с «оптимизированными размерами батчей и согласованными целевыми показателями задержки», а сравнение задержек с моделями Google проводилось по медиане (p50), а не по процентилям p95 или p99, которые отражали бы худшие сценарии производительности. Корпоративные клиенты, запускающие разнообразные рабочие процессы с разным уровнем параллелизма, могут получить другие результаты. MAI Playground в настоящее время доступна только в отдельных регионах, включая США, а доступность в ЕС указана как «скоро появится». Интеграция с Copilot находится в процессе реализации, но еще не завершена. А корпоративный API через Foundry, хотя и запущен, все еще находится на стадии раннего развертывания.
Но траектория движения безошибочна. Меньше чем за пять месяцев с момента объявления о создании команды MAI Superintelligence компания Microsoft выпустила флагманскую модель изображений, три дополнительные базовые модели, а теперь и оптимизированную по затратам производственную версию — и все это на фоне реорганизации всей структуры Copilot, урегулирования трений в отношениях со своим важнейшим партнером по ИИ и заложения фундамента для функций агентного ИИ, которые могут переосмыслить корпоративную продуктивность. Достаточно ли все это быстро, чтобы догнать импульс Anthropic, сдержать дрейф OpenAI в сторону Amazon и оправдать целевую цену акций в 600 долларов — это многомиллиардный вопрос. Но для компании, которая первые два года эпохи генеративного ИИ в основном перепродавала чужие технологии, Microsoft сейчас делает то, чего не делала в сфере ИИ уже очень давно: выпускает собственную работу, по собственному графику, по собственной цене — и бросает вызов рынку, требуя поспевать за ней.



