MAI-Transcribe-2 от Microsoft AI превосходит OpenAI, Google и ElevenLabs по цене и скорости

MAI-Transcribe-2 от Microsoft AI превосходит OpenAI, Google и ElevenLabs по цене и скорости

Источник: VentureBeat · Michael Nuñez

Подразделение Microsoft AI в четверг выпустило MAI-Transcribe-2 — модель распознавания речи, которая, по заявлению компании, работает быстрее, точнее и стоит дешевле любого аналога, предлагаемого сейчас компаниями OpenAI, Google или ElevenLabs. При этом стоимость использования новинки составляет всего 10 центов за час аудио.

Эта цифра заставляет сделать паузу. Всего пять месяцев назад, когда Microsoft AI представила первую модель в этой линейке, ее стоимость составляла 0,36 доллара в час. Установленная в четверг цена для ранних пользователей ниже примерно на 72%. Для крупного банка или телекоммуникационной компании, обрабатывающей 100 000 часов аудиозаписей контакт-центра в год (что является скромным объемом), расходы сокращаются с 36 000 до 10 000 долларов. При таком уровне цен расшифровка перестает быть статьей расходов, из-за которой кто-то спорит.

Этот релиз стал частью реализации стратегии Microsoft, которая еще два года назад казалась неправдоподобной: компания создает собственные пограничные (frontier) модели по одной модальности за раз, а затем постепенно интегрирует их в продукты, ранее работавшие на технологиях OpenAI. Распознавание речи — это та сфера, где данный план продвинулся быстрее всего, и MAI-Transcribe-2 на данный момент является его самым убедительным доказательством. Она также дает представление о том, как самая дорогая компания мира в сфере ПО намерена конкурировать на рынке ИИ, не завися от партнера, на развитие которого она потратила 13 миллиардов долларов.

Что делает MAI-Transcribe-2 и почему этот набор функций важен для корпоративных клиентов

Модель распознает речь на 60 языках по сравнению с 43 в июньской версии MAI-Transcribe-1.5 и 25 в оригинальном апрельском релизе. Она работает на базе Microsoft Foundry (маркетплейса моделей компании для разработчиков) и в среде тестирования MAI Playground. В Microsoft заявляют, что создавали модель для работы с «грязным» аудио, которое генерируют реальные предприятия (фоновый шум, низкокачественные записи, накладывающаяся речь), а не для идеальных студийных условий.

Важнее количества языков то, что Microsoft включила в базовый продукт. Функция диаризации спикеров определяет, кто именно что сказал на многоканальной записи, что превращает сплошную стену текста в пригодную для работы стенограмму встречи. Временные метки на уровне слов привязывают точное время к каждому слову, что упрощает поиск, редактирование и синхронизацию с видео. Функция подсказки ключевых слов (keyword biasing) позволяет разработчикам передавать модели список наименований лекарств, кодов продуктов или имен сотрудников, чтобы она перестала искажать отраслевой жаргон. Автоматическое определение языка избавляет пользователей от необходимости указывать язык заранее.

Две функции выделяются своей спецификой. Настраиваемый стиль вывода включает режим verbatim («дословно»), сохраняющий каждый «э-э», фальстарт и заикание для юридических и комплаенс-отделов, а также чистый режим (clean), удаляющий слова-паразиты для создания читаемых субтитров и заметок. Функция переключения кодов (code switching) обрабатывает разговоры, в которых язык меняется прямо посреди предложения; в Microsoft отдельно упоминают хинглиш и спанглиш — дань уважения рынкам Индии и испаноязычного населения США, где во время одного звонка в службу поддержки язык может переключаться дюжину раз. Исторически специализированные поставщики брали дополнительную плату за каждую из этих возможностей. Microsoft включает их все всего за десять центов.

Как интерпретировать заявления Microsoft о результатах тестов FLEURS и Artificial Analysis

Microsoft делает три заявления о производительности, каждое из которых опирается на разные метрики, и техническим специалистам стоит понимать, что именно они отражают, а что упускают из виду.

Первое заявление заключается в том, что MAI-Transcribe-2 занимает первое место в бенчмарке FLEURS по 60 языкам со средним уровнем ошибки распознавания слов (WER) 5,2%. FLEURS — это <лонча>набор тестов, опубликованный исследователями Googleлонча> в 2022 году и созданный на основе чтения носителями языка примерно 2 000 предложений на каждом из 102 языков (около 12 часов речи на язык). Это стандартный эталон для многоязычного распознавания речи, поскольку он позволяет сравнить показатели модели для суахили и шведского на идентичном контенте. Уровень ошибки в словах (WER) просто подсчитывает замены, вставки и удаления по сравнению с эталонным текстом человека; показатель 5,2% означает, что примерно одно слово из 20 распознано неверно. Однако FLEURS — это чтение подготовленного текста, а не живой разговор, к тому же средний показатель Microsoft вырос по сравнению с 3,7%, заявленными для MAI-Transcribe-1.5 в июне. Это почти наверняка отражает расширение охвата, а не ухудшение качества (усреднение по 60 языкам вместо 43 означает добавление малоресурсных языков, с которыми испытывают трудности все модели), однако покупателям стоит запрашивать детальную разбивку по каждому языку.

Второе заявление гласит, что модель занимает второе место в рейтинге ошибок распознавания слов от Artificial Analysis и определяет границу эффективности (парето-фронтир) этой компании по соотношению точности и задержки. Artificial Analysis — это независимая тестовая площадка, которая оценивает модели через их публичные API, измеряя реальный опыт пользователя. Ее индекс объединяет смоделированные разговоры агентов, выступления в Европейском парламенте и телефонные конференции корпораций с акцентом на английскую деловую речь. В июне эта организация присудила MAI-Transcribe-1.5 третье место с показателем WER 2,4% (после Fun-Realtime-ASR-preview от Alibaba и Scribe v2 от ElevenLabs), назвав ее при этом самой быстрой моделью в топ-10. Подъем на второе место говорит о том, что Microsoft обошла ElevenLabs. «Парето-фронтир» — это термин, на который следует обратить внимание разработчикам: он означает, что ни один конкурент не превосходит модель по точности, не проигрывая в скорости, и ни один не превосходит ее по скорости без потери точности.

Третье заявление касается чистой скорости: по оценкам Artificial Analysis, новинка в 10 раз быстрее GPT-Transcribe от OpenAI, в 7 раз быстрее Scribe v2 от ElevenLabs и в 5 раз быстрее Gemini 3.5 Transcribe от Google. При пакетной транскрипции скорость важна не столько из-за ожидания пользователя, сколько из-за пропускной способности, определяющей стоимость. Модели, работающей со скоростью, в 300 раз превышающей реальное время, требуется лишь малая доля тех часов работы GPU, которые нужны для модели с 30-кратным превышением. Именно эта эффективность позволяет Microsoft устанавливать цену в десять центов и, предположительно, оставаться в прибыли.

Три речевых модели за пять месяцев: изнанка стремительного темпа релизов Microsoft AI

Главная скрытая история здесь — это темп. 2 апреля вышла MAI-Transcribe-1 с поддержкой 25 языков по цене 0,36 доллара за час. 2 июня появилась MAI-Transcribe-1.5 с 43 языками, возможностью задания ключевых слов и третьим местом в рейтинге Artificial Analysis. Сегодня состоялся релиз MAI-Transcribe-2, поддерживающей 60 языков, диаризацию, таймстампы, переключение кодов, занявшей второе место в рейтинге, с ценой всего 0,10 доллара.

Три релиза за пять месяцев, каждый из которых расширяет языковую базу примерно на 40% и добавляет функции, которые конкуренты удерживают в премиальных тарифах. Такой темп характерен для команды, которая определилась со стабильной архитектурой и теперь наращивает объемы данных и масштабы — это фаза, на которой речевые модели обычно совершенствуются быстро и предсказуемо. Это также темп компании, которая намерена сделать транскрипцию массовым дешевым товаром (коммодитизировать ее) раньше остальных.

Организационную основу этой скорости Мустафа Сулейман (Mustafa Suleyman), генеральный директор Microsoft AI, описал в апреле в интервью The Verge. Он приписал заслугу создания первой модели «небольшой, сфокусированной команде из 10 человек», которая была «освобождена от любой бюрократии», в то время как более крупная сопутствующая группа занималась управлением поставщиками и сбором данных.

Он также рассказал The Verge, что модель работала «на половине затрат GPU по сравнению с другими передовыми моделями», назвав это «огромной экономией средств» для Microsoft. Издание The Verge отметило, что Meta, Amazon, Google и Anthropic также экспериментировали с подобными плоскими структурами. Линейка систем транскрипции от Microsoft — это самое масштабное наглядное испытание того, дает ли такой подход коммерческие результаты вместо научных публикаций.

Почему Microsoft создает собственные ИИ-модели вопреки инвестициям в OpenAI в размере $13 млрд

Microsoft инвестировала более 13 миллиардов долларов в OpenAI и интегрировала модели OpenAI во все свои продукты — от Azure и Office до Copilot. Практически в течение последних четырех лет главный вопрос в отношении любой модели собственной разработки Microsoft звучал так: зачем утруждаться? За последний год ответ стал более четким, и начинается он с независимости.

Когда в марте 2024 года Microsoft наняла Сулеймана из Inflection AI вместе с большей частью команды стартапа, генеральный директор Salesforce Марк Бениофф (Marc Benioff) расценил это как декларацию о намерениях. «Microsoft создает собственный ИИ, и я не думаю, что в будущем они будут использовать OpenAI. У них будут свои собственные передовые модели, — заявил Бениофф CNBC в январе 2025 года. — Вот почему они наняли Мустафу Сулеймана». У Бениоффа были и свои мотивы — Salesforce конкурирует с Microsoft и инвестирует в Anthropic, но события в целом подтвердили его правоту.

В октябре 2025 года Microsoft и OpenAI реструктурировали свое партнерство, заключив сделку, которая, судя по собственному заявлению Microsoft, впервые позволила ей «самостоятельно преследовать цели AGI (общего искусственного интеллекта) в одиночку или в партнерстве с третьими лицами». Сулейман сообщил изданию The Verge, что это пересмотр условий «разблокировал возможности Microsoft по поиску супер интеллекта», и уже через несколько недель компания объявила о создании команды MAI Superintelligence. В апреле 2026 года компании снова внесли поправки в сделку, положив конец эксклюзивному доступу Microsoft к технологиям OpenAI и удалив положения о распределении доходов, согласно тогдашним отчетам. Каждая правка ослабляла связи, и за каждой из них следовало появление новых моделей MAI.

Как собственные модели Microsoft снижают затраты в Teams, Word и Excel

Вторая часть ответа кроется в маржинальности. Каждый запрос, который Microsoft перенаправляет на модель OpenAI, влечет за собой расходы. Каждый запрос, отправляемый на собственную модель на собственных GPU, обходится дешевле. В июле агентство Bloomberg сообщило, что Microsoft начала использовать модели MAI для обработки части пользовательских запросов в Word и Excel — продуктах, которые ранее рекламировались как работающие на технологиях OpenAI и Anthropic. Издание TechCrunch охарактеризовало этот сдвиг как часть общего тренда в отрасли на сокращение расходов на ИИ, к которому якобы присоединились Amazon, Uber, Meta и Accenture.

Транскрипция стала естественной первой целью для такой замены, поскольку задача имеет четкие рамки, а метрики объективны. Microsoft владеет сервисом Teams, генерирующим огромные объемы аудиозаписей встреч. Ей принадлежит компания Nuance, чей бизнес по ведению клинической документации основан на распознавании речи. Корпорация контролирует речевые службы Azure, которыми уже пользуются тысячи предприятий. Каждая из этих рабочих нагрузок является кандидатом на перевод на MAI-Transcribe-2, и каждый переведенный час означает, что Microsoft больше никому не платит за это.

Сулейман неоднократно открыто заявлял, что в этом и заключается суть. Суперінтеллект, заявил он в апреле изданию The Verge, «на самом деле заключается в том, способны ли эти модели приносить реальную пользу миллионам предприятий, которые полагаются на нас в вопросах предоставления языковых моделей мирового класса». Что бы ни думали о применении термина «суперінтеллект» к API транскрипции, коммерческая логика проста: создать функционал один раз, внедрить его в дюжину продуктов и перестать выписывать чеки партнеру, который все больше превращается в конкурента.

MAI-Transcribe-2 против OpenAI, Google и ElevenLabs: конкурентная картина

В релизе Microsoft упоминает четырех конкурентов: GPT-Transcribe от OpenAI, Gemini 3.5 Transcribe от Google, более старую модель Whisper V3-Large от OpenAI и Scribe v2 от ElevenLabs. При этом не упоминаются такие специализированные игроки, как Deepgram, AssemblyAI, Speechmatics или Rev, которые продают решения для транскрипции корпоративным клиентам уже целое десятилетие. Microsoft позиционирует себя в противостоянии с передовыми лабораториями (frontier labs), а не с традиционными игроками.

Такое позиционирование отчасти является маркетингом, а отчасти правдой. Передовые лаборатории рассматривали речь как второстепенную функцию более широких платформ и назначали соответствующую цену, поэтому специализированная модель, которая превосходит их по скорости в 5–10 раз и не уступает в точности, является подлинным дифференциатором. Однако сильнее всего ценовое давление ощутят как раз профильные специалисты. По цене 0,10 доллара за час Microsoft предлагает расценки на уровне или ниже тех, по которым многие из них продают крупнооптовые корпоративные контракты, причем в базовый тариф уже включены диаризация, таймстампы и 60 языков. Единственным оставшимся защитным барьером (moat) узких специалистов остается глубина предметной области — медицинская лексика, юридическое оформление, специфические отраслевые интеграции, — однако функция ключевых слов от Microsoft нацелена как раз на эту область.

Единственный конкурент, превосходство над которым по точности Microsoft демонстративно не заявляет — это Alibaba, модели которой в течение большей части 2026 года занимали лидирующие строчки в независимых рейтингах. В июле TechCrunch сообщал, что некоторые американские компании начали рассматривать китайские модели в качестве более дешевой альтернативы, несмотря на вопросы безопасности. Предложение Microsoft таким покупателям неявно, но недвусмысленно: сопоставимая точность, более быстрый инференс, более низкая цена и поставщик, которому ваш комплаенс-отдел уже доверяет.

Вопросы, которые стоит задать техническим директорам перед сменой поставщика решений для транскрипции

Несмотря на обилие конкретных бенчмарков, релиз оставляет открытыми несколько практических вопросов. Первый касается сроков: Microsoft называет 0,10 доллара за час «вводным предложением», не указывая дату окончания акции или стандартную ставку, и любому, кто строит финансовую модель, следует зафиксировать оба показателя письменно. Второй касается потоковой передачи (streaming). В пресс-релизе упор делается на пакетную обработку и длинные аудиозаписи, но ничего не говорится о транскрипции в реальном времени, которая необходима голосовым агентам и живым субтитрам. Artificial Analysis ведет отдельную таблицу потоковых лидеров, и молчание Microsoft по этому поводу весьма примечательно.

Третий пункт — точность для отдельных языков. Средний показатель 5,2% по 60 языкам может означать 3% для основных языков и 12% для малоресурсных, поэтому клиентам с особыми требованиями следует протестировать нужные языки напрямую. Четвертый — качество диаризации. Уровень ошибки в словах (WER) не измеряет качество распределения реплик по спикерам; стенограмма может иметь практически нулевой WER и при этом приписывать каждое второе предложение не тому человеку. В релизе не приводятся показатели ошибки диаризации или аналогичные метрики.

Пятый вопрос — обработка данных. Корпоративная транскрипция затрагивает медицинские карты, адвокатскую тайну и финансовую отчетность, однако в пресс-релизе ничего не говорится о локализации данных, сроках их хранения и о том, используются ли загруженные в Foundry аудиозаписи для дальнейшего обучения моделей. Апрельские анонсы Microsoft описывали обучающие данные как смесь кураторских записей людей, зашумленных аудио от подрядчиков и «огромных объемов данных из открытого интернета», как писало издание The Verge. Это описание должно вызвать у регулируемых отраслей закономерные вопросы. Ни один из этих пробелов не является необычным для анонса продукта, но именно такие нюансы отделяют победу в бенчмарке от реального развертывания в продакшене.

Что стратегия Microsoft в области речевых моделей говорит о ее более масштабных амбициях в сфере ИИ

Если отойти от деталей распознавания речи, прослеживается закономерность, которая выходит далеко за рамки транскрипции. Подразделение ИИ от Microsoft теперь выпускает модели для работы с изображениями, голосом, текстом, кодом, рассуждениями и кибербезопасностью. На конференции Build в июне компания представила семь новых моделей MAI в рамках одного выступления. Каждая следует единому сценарию: нацелиться на четко определенную модальность, агрессивно оптимизировать затраты на инференс, установить цены ниже уровня передовых лабораторий, распространять через Foundry и незаметно внедрять модель в собственные продукты Microsoft.

Это не попытка создать единую универсальную модель, которая превзойдет GPT или Gemini во всем. Это попытка сформировать портфель специализированных моделей, который в совокупности позволит Microsoft обслуживать большую часть своих корпоративных задач, не платя никому на стороне, и продавать излишки мощностей остальным по ценам, с которыми не могут тягаться узкие специалисты. Транскрипция оказалась первой модальностью, где этот подход полностью созрел, но примечания к релизу MAI-Transcribe-2 читаются меньше как презентация продукта и больше как готовый шаблон.

Сулейман уже два года говорит о «гуманистическом суперинтеллекте» и ИИ-ассистентах, которые «подотчетны людям и находятся на их стороне». Формулировки звучат возвышенно, но за ними стоит простой расчет электронной таблицы. Пять месяцев назад Microsoft брала 36 центов за перевод часа речи в текст. В четверг компания запросила десять центов, добавила шесть функций, которые конкуренты продают отдельно, и заняла первое место в стандартном многоязычном бенчмарке индустрии. Корпорация, которая потратила 13 миллиардов долларов на то, чтобы узнать реальную стоимость передового ИИ, решила, что лучше владеть заводом, чем арендовать чужую продукцию — а теперь она продает эту продукцию дешевле стоимости аренды.

Модель MAI-Transcribe-2 доступна уже сейчас через Microsoft Foundry и MAI Playground.

Инфраструктура

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут. Материалы переведены с venturebeat.com.