Модели ИИ от Microsoft сокращают расходы на GPU на 89%

Модели ИИ от Microsoft сокращают расходы на GPU на 89%

Источник: VentureBeat · Michael Nuñez

Microsoft AI в среду выпустила в публичный предпросмотр две новые собственные модели — MAI-Image-2.5-Pro, свой самый высококачественный генератор изображений на сегодняшний день, и MAI-Voice-2-Flash, речевую модель, созданную для корпоративных рабочих нагрузок с высоким объемом данных, а также опубликовала производственные данные, которые представляют собой самый серьезный аргумент компании в пользу того, что она способна обеспечивать работу собственных продуктов без опоры на передовые модели OpenAI.

Объявление, сделанное командой Superintelligence в Microsoft AI, прозвучало примерно через год после того, как компания взяла на себя обязательство разрабатывать специализированные модели внутри организации, и сопровождается необычным уровнем конкретики относительно того, где именно эти модели запущены сейчас: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot и Azure. Сигнал корпоративным покупателям — и, неявно, OpenAI — заключается в том, что собственные модели Microsoft больше не являются исследовательскими проектами. Это производственная инфраструктура, обслуживающая миллионы пользователей.

«Каждое из этих усовершенствований — шаг к одной и той же цели: продукты Microsoft на базе моделей Microsoft», — написала компания в своем блоге, посвященном анонсу.

Как MAI-Image-2.5-Pro и MAI-Voice-2-Flash занимают противоположные концы кривой затрат на ИИ

Два новых релиза занимают противоположные концы того, что Microsoft называет кривой «качество — скорость — стоимость», и такое позиционирование является осознанным. MAI-Image-2.5-Pro ориентирована на премиальный сегмент: ключевые изображения (hero images), детальное редактирование и точный рендеринг текста внутри изображений (последнее долгое время было печально известным слабым местом моделей генерации картинок). Microsoft оценила модель в $5 за миллион токенов текстового ввода, $8 за миллион токенов ввода изображений и $106 за миллион токенов вывода изображений. Базовая модель MAI-Image-2.5 недавно заняла 2-е место по редактированию изображений на Arena — общественной таблице лидеров, ставшей де-факто табло для генеративных медиа.

Креативная индустрия, похоже, обращает на это внимание. Роб Рейлли (Rob Reilly), глобальный креативный директор рекламного гиганта WPP, назвал модель Pro «серьезным шагом вперед для инструментов GenMedia» в заявлении, включенном в пресс-релиз Microsoft, добавив, что «Microsoft прочно утвердилась среди лидеров в сфере генеративного ИИ».

MAI-Voice-2-Flash движется в противоположном направлении. Впервые представленная на конференции Build от Microsoft, версия Flash работает в два раза быстрее MAI-Voice-2 и стоит на 32% дешевле — $15 за миллион символов. Она разработана для непрестижного, но огромного рынка голосовых систем с высоким объемом вызовов: кол-центров, голосовых агентов и речевых приложений реального времени, где задержка и стоимость одного звонка важнее маргинального прироста выразительности. Вместе эти две модели отражают стратегию создания семейств моделей, а не единого флагмана, поскольку, как выразилась компания, творческой студии, стремящейся к максимальной точности, требуются совершенно не те вещи, что службе поддержки клиентов, обрабатывающей миллионы звонков в день.

Производственные метрики Microsoft демонстрируют снижение затрат на графические процессоры собственными моделями до 89%

Запуск моделей, возможно, менее новостной повод, чем привязанные к ним метрики внедрения от Microsoft — цифры, которые выглядят как систематическое обоснование отказа от сторонних передовых моделей во всем портфеле продуктов. 

Bing Image Creator теперь полностью работает на MAI-Image-2.5 от начала и до конца, что знаменует собой первый случай, когда потребительский инструмент для работы с изображениями полностью создан собственными силами. В PowerPoint, по данным Microsoft, MAI-Image-2.5 снижает затраты на GPU на величину до 84% по сравнению с GPT-Image-2 — моделью генерации изображений от OpenAI. В OneDrive, где MAI-Image-2.5 теперь является стандартом для ключевых сценариев редактирования изображений, компания сообщает об увеличении показателей сохранения (save rates) на 26%, снижении задержки P95 примерно на 25% и повышении эффективности в 2,5 раза при средних нагрузках в производственной среде.

Что касается голосовых технологий, то MAI-Voice-2-Flash теперь обеспечивает работу Dynamics 365 Contact Center — платформы, используемой такими клиентами, как T-Mobile и EasyJet, где Microsoft заявляет о сокращении расходов на GPU до 89%. Модель также интегрирована в Azure Voice Live для разработчиков, создающих речевые агенты.

Пожалуй, наиболее важное внедрение произошло в сфере здравоохранения. Dragon Copilot от Microsoft, используемый 170 000 медицинских работников и обработавший 28 миллионов посещений пациентов в прошлом квартале, теперь работает на MAI-Transcribe-1.5 для реализации многоязычных рабочих процессов на 58 языках. Microsoft утверждает, что внутренние оценки показывают относительное снижение частоты ошибок транскрипции и определения языка на 50% для большинства языков — весомое достижение в сфере, где ошибки распознавания речи могут напрямую перекочевывать в клинические записи.

Внутри стратегии «наращивания высоты», позволяющей небольшим моделям превосходить GPT-5.6 в Excel

В сопутствующей публикации, вышедшей в тот же день, Microsoft подробно описала методологию, лежащую в основе этих результатов, — то, что она называет своим «механизмом наращивания высоты» (hill-climbing machine), представляющим собой интегрированный маховик данных, моделей и окружающего их продуктового «обвязочного» слоя (harness).

Самый наглядный пример — MAI-Code-1-Flash, облегченная модель для написания кода, запущенная в GitHub Copilot в июне. Microsoft заявляет, что модель достигает примерно на 10% более высокого процента принятия кода (code accept rate), чем GPT-5.4 Mini и Claude Haiku 4.5 в VS Code, используя при этом на 10% меньше медианных токенов. Удержание разработчиков демонстрирует похожую картину: пользователи возвращались на протяжении нескольких дней на 6% чаще по сравнению с GPT-5.4 Mini и на 11% чаще по сравнению с Claude Haiku 4.5.

Затем Microsoft сделала кое-что более интересное. Компания взяла контрольную точку MAI-Code-1-Flash и дополнительно обучила ее в среде обучения с подкреплением в Excel, обучив кодинг-модель инструментам и рабочим процессам работы со знаниями в электронных таблицах. Результатом, согласно отзывам пользователей в продакшене, стала модель, не уступающая GPT-5.6 в выполнении самых распространенных задач в Excel, и при этом достаточно компактная, чтобы работать на более старых графических процессорах Nvidia H100 и даже A100, не требуя ускорителей последнего поколения.

Эта аппаратная деталь заслуживает особого акцента. Каждая крупная компания, занимающаяся искусственным интеллектом, борется за распределение передовых чипов, и модель, которая обеспечивает качество, близкое к передовому, на кремнии двухлетней давности, кардинально меняет экономику развертывания. Это также высвобождает новейшее железо — включая запущенный кластер GB200 от Microsoft — для обучения, а не для инференса.

Манифест Сатьи Наделлы «Диффузия рубежа» перекраивает отношения с OpenAI

Генеральный директор Microsoft Сатья Наделла охарактеризовал эти анонсы в пространном посте на X под названием «Диффузия и контроль рубежа» (Frontier Diffusion & Control), который во многом служит стратегическим манифестом. «Теперь мы можем брать насыщенные передовые возможности и доставлять их в масштабе и с меньшими затратами через модели, оптимизированные для продуктов с высокой интенсивностью использования, продолжая при этом использовать передовые модели для решения передовых задач», — написал Наделла, добавив, что Microsoft «начинает направлять трафик по нашим собственным поверхностям в MAI всякий раз, когда наши модели соответствуют передовым альтернативам или превосходят их».

В переводе с языка топ-менеджмента: возможности, бывшие передовыми год назад, теперь стали базовым стандартом, и Microsoft считает, что может тиражировать их дешевле для конкретных, повторяющихся задач, которые доминируют в реальном использовании продуктов. Зачем платить по высшему разряду за передовую модель, если пользователю нужно всего лишь переформатировать столбец в электронной таблице?

Наделла особо отметил, что «передовые модели от OpenAI и Anthropic являются частью системы оркестрации наряду с MAI», но также сформулировал четкий принцип независимости моделей, утверждая, что оценки компании «должны продолжать восхождение, даже если какая-либо конкретная модель была удалена».

Сохранение обвязки, памяти, контекста и навыков вне модели, утверждал он, — это то, что дает Microsoft контроль. Подтекст трудно не заметить. В апреле агентство Reuters сообщило, что эксклюзивная лицензия Microsoft на технологии OpenAI была переведена в неэксклюзивный формат, а издание The Information сообщило в сентябре прошлого года, что Microsoft начала внедрять модели Anthropic в некоторые продукты. Срединный анонс завершает треугольник: Microsoft выступает в роли оркестратора, модели ее партнеров служат взаимозаменяемыми компонентами, а собственные модели поглощают все большую долю рутинного трафика.

Разработчики приветствуют более дешевые специализированные модели, в то время как скептики ставят под сомнение послужной список Microsoft

Реакция в сети отразила как привлекательность стратегии, так и скептицизм по ее поводу. «Мне нравится, когда люди используют маленькие модели для нишевых задач», — написал один из пользователей X, @mavihsk, комментируя пост Наделлы. «Зачем мне использовать всезнающую модель только для того, чтобы изменить поле в Excel?» Другой пользователь, @nabu_lines, четко сформулировал суть: «и стоимость, и производительность улучшаются, когда вы перестаете злоупотреблять самой большой моделью».

Другие скептически отнеслись к практическим результатам Microsoft. «Microsoft хуже всех справляется с учетом отзывов пользователей», — написал дизайнер @designedbyabin, утверждая, что компания «проиграет гонку в сфере ИИ, потому что неоднократно не понимала потребности пользователей». А пользователь @tokenoverflow предложил более сухую критику идеи независимости моделей: «я хочу, чтобы он продолжал карабкаться вверх после удаления Microsoft».

Скептики высказывают справедливое замечание. Собственные метрики Microsoft — показатели принятия кода, сохранения и экономии GPU — основаны на внутренних оценках компании, а не на независимых бенчмарках, причем компания сама выбирает, какие сравнения публиковать.

Но логика стратегии не зависит от какой-то одной цифры. Сформулированная Наделла мысль о том, что программное обеспечение теперь имеет «реальные предельные издержки впервые в истории», объясняет, почему Microsoft так одержима токенами, графическими процессорами и затратами на инференс: когда функции ИИ срабатывают при каждом нажатии клавиши в портфеле продуктов с миллиардом пользователей, сокращение расходов на GPU на 84% — это не оптимизация. Это грань между жизнеспособным бизнесом и финансовой дырой.

Почему Microsoft превращает свой внутренний ИИ-плейбук в продукт Azure

Заключительная часть стратегии заключается в том, что Microsoft продает сам технологический подход, а не только модели. Наделла прямо позиционировал подход с «наращиванием высоты» как «шаблон для любой другой ИИ-нативной, SaaS- или корпоративной компании», и Microsoft упаковывает этот набор инструментов через Foundry и так называемый Frontier Tuning, позволяя предприятиям обучать специализированные модели на основе собственных проприетарных оценок и сред обучения с подкреплением. Это превращает внутреннее упражнение Microsoft по сокращению затрат в продукт Azure и дает корпоративным клиентам повод запускать свои ИИ-нагрузки в облаке Microsoft, даже если сами модели поступают из других источников.

Акцент компании на моделях, обученных «на чистых, отслеживаемых данных корпоративного уровня, без дистилляции из сторонних моделей», служит тем же коммерческим целям. В условиях растущего внимания индустрии к происхождению обучающих данных Microsoft делает ставку на то, что корпоративные покупатели — и суды — будут интересоваться тем, откуда берутся возможности моделей. Microsoft заявляет, что теперь распространяет подход с наращиванием высоты на Copilot Chat, Outlook и PowerPoint, и обе новые модели доступны в публичном предпросмотре через Microsoft Foundry и MAI Playground. «Все это не конечная точка, — пишет компания. — Мы только начинаем».

Семь лет назад Microsoft вложила более 13 миллиардов долларов в то, что OpenAI построит будущее искусственного интеллекта. Срединный анонс предполагает, что с тех пор компания усвоила более дешевый урок: будущее ИИ может принадлежать тому, кто создает передовой край технологий, но прибыль достается тому, кто делает их обыденностью.

Инфраструктура

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.