Microsoft представляет ИИ-модели для конкуренции с OpenAI

Microsoft представляет ИИ-модели для конкуренции с OpenAI

Microsoft в четверг представила три новые фундаментальные модели ИИ, разработанные полностью собственными силами: передовую систему распознавания речи, движок генерации голоса и улучшенный инструмент для создания изображений. Это стало самым весомым на сегодняшний день доказательством того, что софтверный гигант с капитализацией в $3 триллиона намерен напрямую конкурировать с OpenAI, Google и другими ведущими лабораториями в области разработки моделей, а не только их дистрибуции.

Эта троица моделей — MAI-Transcribe-1, MAI-Voice-1 и MAI-Image-2 — доступна незамедлительно через Microsoft Foundry и новый MAI Playground. Они охватывают три наиболее коммерчески ценные модальности в корпоративном ИИ: преобразование речи в текст, генерацию реалистичного человеческого голоса и создание изображений. Вместе они представляют собой первый залп от команды по суперинтеллекту Microsoft, которую Сулейман сформировал всего шесть месяцев назад для достижения того, что он называет «автономией в сфере ИИ».

«Я очень рад, что теперь у нас вышли первые модели, которые являются лучшими в мире для транскрибации», — рассказал Сулейман в интервью VentureBeat накануне публичного анонса. — «Мало того, мы способны поставлять модель, используя вдвое меньше графических процессоров (GPU) по сравнению с передовыми аналогами конкурентов».

Этот анонс происходит в крайне сложный для Microsoft момент. Акции компании только что закрыли худший квартал со времен финансового кризиса 2008 года, поскольку инвесторы все настойчивее требуют доказательств того, что сотни миллиардов долларов, вложенные в инфраструктуру ИИ, трансформируются в выручку. Эти модели — с агрессивной ценовой политикой и позиционированием, направленным на снижение собственных расходов Microsoft на продажу товаров (COGS) — стали первым ответом Сулеймана на это давление.

Новая модель транскрибации от Microsoft заявляет о лучшей в своем классе точности на 25 языках

MAI-Transcribe-1 — главная новость релиза. Модель распознавания речи достигает наименьшего среднего уровня ошибок в словах (WER) на бенчмарке FLEURS (стандартном в отрасли многоязычном тесте) по 25 ведущим языкам по версии использования продуктов Microsoft, показывая в среднем 3,8% WER. Согласно бенчмаркам Microsoft, она превосходит Whisper-large-v3 от OpenAI на всех 25 языках, Gemini 3.1 Flash от Google на 22 из 25, а также Scribe v2 от ElevenLabs и GPT-Transcribe от OpenAI — каждую из них на 15 из 25 языков.

В модели используется текстовый декодер на базе трансформера с двунаправленным аудиокодером. Она принимает файлы MP3, WAV и FLAC размером до 200 МБ, и в Microsoft заявляют, что ее скорость пакетной транскрибации в 2,5 раза выше, чем у существующего предложения Microsoft Azure Fast. Диаризация, контекстное смешивание (biasing) и потоковая передача указаны в статусе «скоро появится». Microsoft уже тестирует MAI-Transcribe-1 внутри голосового режима Copilot и Microsoft Teams для транскрибации бесед — деталь, которая подчеркивает, как быстро компания намерена заменить сторонние или старые внутренние модели собственными.

Наряду с ней MAI-Voice-1 представляет собой модель преобразования текста в речь от Microsoft, способную генерировать 60 секунд естественно звучащего аудио всего за одну секунду. Модель сохраняет идентичность спикера в контенте большой продолжительности и теперь поддерживает создание кастомных голосов всего по нескольким секундам аудио через Microsoft Foundry. Microsoft установила цену на уровне $22 за 1 миллион символов. MAI-Image-2 тем временем дебютировала как семейство моделей из топ-3 в <рейтинге Arena.ai и теперь обеспечивает как минимум в 2 раза более высокую скорость генерации на платформах Foundry и Copilot по сравнению со своим предшественником. Microsoft внедряет ее в Bing и PowerPoint, установив цены в $5 за 1 миллион токенов для текстового ввода и $33 за 1 миллион токенов для вывода изображений. WPP, один из крупнейших в мире рекламных холдингов, входит в число первых корпоративных партнеров, внедряющих MAI-Image-2 в больших масштабах.

Переговоры по контракту с OpenAI, которые сделали возможными амбиции Microsoft в сфере создания моделей

Чтобы понять, почему эти модели так важны, необходимо осознать тектонический сдвиг в контрактах, который сделал их возможными. До октября 2025 года Microsoft была контрактно ограничена в возможности независимого создания искусственного общего интеллекта (AGI). Первоначальное соглашение с OpenAI, подписанное в 2019 году, предоставляло Microsoft лицензию на модели OpenAI в обмен на создание облачной инфраструктуры, необходимой OpenAI. Но когда OpenAI попыталась расширить свои вычислительные мощности за пределы Microsoft, заключив сделки с SoftBank и другими игроками, Microsoft провела реструктуризацию. Как пояснил Сулейман в декабрьском интервью 2025 года изданию Bloomberg, пересмотренное соглашение означало, что «вплоть до нескольких недель назад Microsoft по контракту не разрешалось независимо преследовать цели искусственного общего интеллекта или суперинтеллекта». Новые условия освободили руки Microsoft для создания собственных передовых моделей с сохранением лицензионных прав на все, что OpenAI строит вплоть до 2032 года.

Сулейман описал эту динамику VentureBeat в характерной для него прямой манере. «В сентябре прошлого года мы пересмотрели контракт с OpenAI, и это позволило нам независимо заняться разработкой нашего собственного суперинтеллекта», — сказал он. — «С тех пор мы занимаемся организацией вычислительных мощностей, сбором команды и покупкой необходимых нам данных».

Он поспешил подчеркнуть, что партнерство с OpenAI остается в силе. «Ничего в партнерстве с OpenAI не меняется. Мы будем сотрудничать с ними как минимум до 2032 года, а надеемся, что и гораздо дольше», — отметил Сулейман. — «Они были для нас феноменальным партнером». Он также подчеркнул, что Microsoft предоставляет доступ к Claude от Anthropic через свой API Foundry, позиционируя компанию как «платформу платформ». Но подтекст не вызывает сомнений: Microsoft создает возможность стоять на собственных ногах. В марте, как первым сообщил Business Insider, Сулейман написал во внутренней служебной записке, что его цель — «сконцентрировать всю свою энергию на наших усилиях в области суперинтеллекта и иметь возможность поставлять модели мирового класса для Microsoft в течение следующих 5 лет». CNBC сообщила, что эти структурные изменения освободили Сулеймана от повседневных обязанностей по продукту Copilot — руководство объединенным потребительским и коммерческим направлением Copilot в качестве исполнительного вице-президента взял на себя бывший топ-менеджер Snap Джейкоб Андреу (Jacob Andreou).

Как команды численностью менее 10 инженеров создали модели, соперничающие с лучшими разработками Бигтеха

Пожалуй, самая поразительная деталь, которой Сулейман поделился с VentureBeat — это насколько малы команды, стоящие за этими моделями. «Аудиомодель была создана 10 людьми, и подавляющее большинство прироста скорости, эффективности и точности достигается за счет архитектуры модели и использованных нами данных», — заявил Сулейман. — «Моя философия всегда заключалась в том, что нам нужно меньше людей, обладающих большими полномочиями. Поэтому у нас действует чрезвычайно плоская структура». Он добавил: «Наша команда по изображениям в равной степени состоит менее чем из 10 человек. Так что все это касается инноваций в области моделей и данных, которые обеспечили производительность на уровне передовых мировых стандартов».

Это важно по двум причинам. Во-первых, это бросает вызов преобладающему в отрасли нарративу о том, что для разработки передового ИИ требуются тысячи исследователей и миллиардные затраты на персонал. Meta, напротив, придерживается стратегии, которую Сулейман охарактеризовал в своем интервью Bloomberg как «наем большого числа отдельных специалистов вместо формирования слаженной команды», включая зарплатные пакеты для ведущих исследователей на уровне $100–200 млн. Во-вторых, небольшие команды, выдающие результаты на уровне передовых достижений, кардинально улучшают экономику. Если Microsoft может создать лучшую в своем классе транскрибацию силами 10 инженеров и на половине пулов графических процессоров конкурентов, структура маржинальности ее ИИ-бизнеса выглядит принципиально иначе, чем у компаний, сжигающих огромные средства ради аналогичных бенчмарков.

Философия компактных команд также перекликается с более широкими взглядами Сулеймана на то, как ИИ уже меняет саму работу по созданию ИИ. На вопрос VentureBeat о том, как работает его собственная команда, Сулейман описал обстановку, которая больше напоминает торговый зал стартапа, чем традиционный инженерный отдел Microsoft. «Там есть группы людей вокруг круглых столов, не традиционных письменных столов, за ноутбуками вместо больших экранов», — рассказал он. — «Они по сути занимаются вайб-кодингом (vibe coding) плечом к плечу весь день, с утра до ночи, в комнатах на 50 или 60 человек».

Почему идея Сулеймана об «инклюзивном ИИ» нацелена прямо на корпоративных покупателей

Сулейман последовательно выстраивает философский бренд вокруг ИИ-инициатив Microsoft, который он называет «гуманистическим ИИ» (humanist AI) — этот термин ярко прозвучал в написанном им к запуску посте в блоге и получил развитие в нашем интервью. «Я думаю, что мотивация гуманистического суперинтеллекта заключается в создании чего-то, что действительно служит человечеству», — сказал он VentureBeat. — «Люди останутся у руля на вершине пищевой цепочки, и эти системы всегда будут согласованы с человеческими интересами».

Это позиционирование служит множеству целей. Оно отличает Microsoft от более ориентированной на ускорение риторики, исходящей от OpenAI и Meta. Оно находит отклик у корпоративных покупателей, которым необходимы гарантии управления, комплаенса и безопасности перед развертыванием ИИ в регулируемых отраслях. Кроме того, это обеспечивает стратегическую подстраховку: если в более широкой экосистеме ИИ что-то пойдет не так, Microsoft сможет указать на свою заявленную приверженность принципу контроля со стороны человека. В своем декабрьском интервью Bloomberg Сулейман пошел еще дальше, назвав сдерживание и выравнивание (alignment) «красными линиями» и заявив, что никто не должен выпускать инструмент суперинтеллекта до тех пор, пока не появится уверенность в том, что «им можно управлять».

Сулейман также подчеркнул происхождение данных (data provenance) в качестве конкурентного преимущества, описав разговор с генеральным директором Сатьей Надедлой о разработке «чистой линейки моделей, где данные исключительно чисты». Он провел негласный контраст с разработками с открытым исходным кодом, отметив, что «многие модели с открытым исходным кодом обучались на данных, скажем так, ненадлежащими способами. И с этим потенциально связаны проблемы безопасности». Для корпоративных клиентов, оценивающих поставщиков ИИ на фоне гущи судебных исков по авторским правам по всей отрасли, это весомый коммерческий аргумент: если Microsoft сможет убедительно доказать, что ее обучающие данные были получены через должным образом лицензированные каналы, это снизит юридические и репутационные риски развертывания таких моделей в продакшене.

Агрессивная ценовая политика Microsoft оказывает давление на Amazon, Google и экосистему ИИ-стартапов

Сегодняшний запуск ставит Microsoft на три фронта конкуренции одновременно. MAI-Transcribe-1 напрямую нацелена на задачи транскрибации, в которых модели Whisper от OpenAI доминировали в сообществе открытого кода, причем Microsoft заявляет о превосходящей точности по всем 25 протестированным языкам. Результаты FLEURS также показывают ее победу над Gemini 3.1 Flash Lite от Google по 22 из 25 языков — это прямой вызов на фоне того, как Google агрессивно продвигает Gemini во всем своем пакете продуктов. А способность MAI-Voice-1 клонировать голоса по секундам аудио и генерировать речь в 60 раз быстрее реального времени ставит ее в один ряд с конкурентами вроде ElevenLabs, Resemble AI и растущей экосистемой голосовых ИИ-стартапов. При этом дистрибуционный бонус Microsoft — любой разработчик Foundry теперь может получить доступ к этим возможностям через тот же API, который они используют для GPT-4 и Claude — выступает в роли мощного барьера (moove/moat).

Сулейман уверенно охарактеризовал конкурентную позицию: «Теперь мы входим в топ-3 лабораторий сразу под OpenAI и Gemini», — заявил он VentureBeat. Ценовая стратегия — MAI-Voice-1 по $22 за миллион символов, MAI-Image-2 по $5 за миллион входных токенов — отражает осознанное решение конкурировать по стоимости. «Мы устанавливаем цены так, чтобы они были лучшими среди всех гиперскейлеров. То есть самыми дешевыми среди всех доступных гиперскейлеров, включая Amazon и, очевидно, Google», — сказал Сулейман. — «И это вполне осознанное решение».

Это имеет стратегический смысл для Microsoft, которая может распределить затраты на разработку моделей по своей огромной инсталлированной базе корпоративных клиентов. Но это также поднимает вопрос, который инвесторы задают со все возрастающей срочностью: когда расходы на ИИ начнут приносить отдачу? Акции Microsoft упали примерно на 17% с начала года (по данным CNBC), что укладывается в рамки более масштабной распродажи акций софтверных компаний. Создавая модели, работающие на половине пулов графических процессоров конкурентов, Microsoft сокращает собственные инфраструктурные издержки на внутренние продукты (Teams, Copilot, Bing, PowerPoint), одновременно предлагая разработчикам цены, призванные демпинговать остальной рынок. В своей мартовской записке Сулейман писал, что его модели «позволят нам обеспечить эффективность затрат (COGS), необходимую для обслуживания ИИ-нагрузок в огромных масштабах, требуемых в ближайшие годы». Эти три модели — первая осязаемая реализация данного обещания.

Сулейман заявляет о скором появлении передовой большой языковой модели: Microsoft планирует быть «полностью независимой»

Сулейман дал понять, что транскрибация, голос и генерация изображений — это лишь начало. На вопрос о том, собирается ли Microsoft создать большую языковую модель для прямой конкуренции с GPT на передовом уровне, он ответил недвусмысленно: «Мы абсолютно точно собираемся поставлять передовые модели по всем модальностям. Наша миссия заключается в том, чтобы гарантировать: если это когда-либо понадобится Microsoft, мы сможем обеспечить передовой уровень с наилучшей эффективностью, по самой дешевой цене и оставаться при этом полностью независимыми».

Он описал многолетнюю дорожную карту по «настройке кластеров графических процессоров в надлежащем масштабе», отметив, что команда по суперинтеллекту была официально создана только в октябре 2025 года. Сулейман общался с VentureBeat из Майами, где вся команда собралась на одну из своих регулярных недельных очных сессий. Он рассказал, что Надедла прилетал на эту встречу, чтобы изложить «дорожную карту всего, чего нам нужно достичь для нашей миссии по самообеспечению ИИ в течение следующих 2, 3, 4 лет, и все связанные с этим планы по вычислительным мощностям».

Создание конкурентоспособной передовой LLM, конечно, представляет собой совершенно иной порядок сложности, требований к данным и вычислительных затрат по сравнению с тем, что Microsoft продемонстрировала в четверг. Представленные сегодня модели специализированы — они обрабатывают аудио и изображения, а не общие рассуждения и генерацию текста, которые лежат в основе таких продуктов, как ChatGPT или базовая аналитика Copilot. У Сулеймана есть организационный мандат, публичная поддержка Надедлы и контрактная свобода. Чего у него пока нет, так это послужного списка в Microsoft по решению самой сложной проблемы в области ИИ.

Но подумайте о том, что у него есть: три модели, которые являются лучшими в своем классе или близки к этому в соответствующих областях, созданные командами меньшего размера, чем большинство стартапов на посевной стадии, работающие на половине стандартных для индустрии ресурсов GPU и оцененные ниже каждого крупного облачного конкурента. Два года назад Сулейман предложил в MIT Technology Review то, что он назвал «Современным тестом Тьюринга» — проверку не на то, сможет ли ИИ одурачить человека в разговоре, а на то, сможет ли он выйти в реальный мир и решать настоящие экономические задачи под минимальным надзором. В четверг его собственные модели сделали шаг навстречу этому видению. Вопрос теперь в том, сможет ли команда суперинтеллекта Microsoft повторить этот фокус в масштабе, который действительно имеет значение — и сможет ли она сделать это до того, как у рынка иссякнет терпение.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.