Mistral AI представила модели Voxtral Transcribe 2
Mistral AI, парижский стартап, позиционирующий себя как европейский ответ OpenAI, выпустил в среду пару моделей распознавания речи, которые, по заявлению компании, способны транскрибировать аудио быстрее, точнее и значительно дешевле, чем любые другие аналоги на рынке, и при этом работают прямо на смартфоне или ноутбуке.
Этот анонс стал очередным этапом в нарастающей конкурентной борьбе в сфере голосового ИИ — технологии, которую корпоративные клиенты считают необходимой для самых разных задач, от автоматизированного обслуживания клиентов до синхронного перевода. Но в отличие от предложений от американских технологических гигантов, новые модели Mistral Voxtral Transcribe 2 созданы для обработки конфиденциальных аудиоданных без их передачи на удаленные серверы. Эта функция может стать решающей для компаний из регулируемых отраслей, таких как здравоохранение, финансы и оборона.
«Вам бы хотелось, чтобы ваш голос и его расшифровка оставались там же, где находитесь вы, то есть вы хотите, чтобы это происходило на устройстве — на ноутбуке, телефоне или умных часах», — отметил Пьер Сток (Pierre Stock), вице-президент Mistral по операциям в области науки, в интервью VentureBeat. «Мы делаем это возможным, поскольку модель имеет размер всего 4 миллиарда параметров. Она достаточно мала, чтобы поместиться практически где угодно».
Mistral разделяет свою новую технологию голосового ИИ на пакетную обработку и приложения реального времени
Mistral выпустила две различные модели в рамках линейки Voxtral Transcribe 2, каждая из которых оптимизирована под свои сценарии использования.
-
Voxtral Mini Transcribe V2 выполняет пакетную транскрипцию, обрабатывая предварительно записанные аудиофайлы целиком. Компания заявляет, что модель обеспечивает самую низкую частоту ошибок распознавания слов среди всех сервисов транскрипции и доступна через API по цене $0,003 за минуту, что примерно в пять раз дешевле основных конкурентов. Модель поддерживает 13 языков, включая английский, китайский (мандаринский), японский, арабский, хинди и несколько европейских языков.
-
Voxtral Realtime, как следует из названия, обрабатывает живой звук с задержкой, которую можно настроить до 200 миллисекунд — в мгновение ока. В Mistral утверждают, что это прорыв для приложений, где даже двухсекундная задержка неприемлема: субтитры в реальном времени, голосовые ассистенты и дополнение службы поддержки в режиме реального времени.
Модель для работы в реальном времени поставляется под открытой лицензией Apache 2.0. Это означает, что разработчики могут загрузить веса модели с Hugging Face, модифицировать их и развернуть без выплаты лицензионных сборов Mistral. Для компаний, которые предпочитают не развертывать собственную инфраструктуру, стоимость доступа через API составляет $0,006 за минуту.
Сток отметил, что Mistral рассчитывает на то, что сообщество разработчиков с открытым исходным кодом расширит возможности применения модели. «Сообщество open-source проявляет большую изобретательность, когда дело касается приложений», — сказал он. «Нам не терпится увидеть, что они сделают».
Почему локальная обработка ИИ на устройстве важна для компаний, работающих с конфиденциальными данными
Решение разработать модели, достаточно компактные для локального запуска, отражает понимание того, куда движется корпоративный рынок. По мере того как компании интегрируют ИИ в еще более чувствительные рабочие процессы — расшифровку медицинских консультаций, финансовых консультационных звонков, юридических показаний — вопрос о том, куда передаются эти данные, становится определяющим фактором.
Сток нарисовал яркую картину этой проблемы во время своего интервью. Существующие приложения для ведения заметок с аудиовозможностями, пояснил он, часто захватывают фоновый шум нежелательным образом: «Они могут уловить слова музыки на заднем плане. Могут подслушать другой разговор. Могут выдать галлюцинацию из-за фонового шума».
Mistral вложила значительные средства в кураторство обучающих данных и архитектуру моделей для решения этих проблем. «Все это — мы потратили много времени на отладку данных и метода обучения модели, чтобы сделать ее более устойчивой», — рассказал Сток.
Компания также добавила специфичные для бизнеса функции, внедрение которых у американских конкурентов происходило медленнее. Контекстное смещение (context biasing) позволяет клиентам загружать список специализированной терминологии — медицинского жаргона, проприетарных наименований продуктов, отраслевых аббревиатур, — и модель будет автоматически отдавать предпочтение этим терминам при расшифровке неоднозначного звука. В отличие от дообучения (fine-tuning), требующего повторного обучения модели, контекстное смещение работает через простой параметр API.
«Вам нужен лишь текстовый список», — пояснил Сток. «После этого модель автоматически сместит транскрипцию в сторону этих аббревиатур или странных слов. И это работает с нулевым количеством примеров (zero-shot), без необходимости переобучения и каких-либо сложных манипуляций».
От производственных цехов до кол-центров: Mistral нацеливается на шумные промышленные среды
Сток описал два сценария, которые иллюстрируют то, как в Mistral видят развертывание этой технологии.
Первый связан с промышленным аудитом. Представьте себе техников, идущих по производственному предприятию и осматривающих тяжелое оборудование, выкрикивая свои замечания на фоне грохота заводского шума. «В итоге представьте себе идеальные заметки с временными метками, определяющие, кто что сказал — то есть диаризацию, — и все это с высокой степенью надежности», — говорит Сток. Задача заключается в том, чтобы справиться с тем, что он назвал «странным техническим языком, который никто не способен правильно написать, кроме этих людей».
Второй сценарий ориентирован на работу службы поддержки. Когда клиент звонит в кол-центр, Voxtral Realtime может расшифровывать беседу в реальном времени, передавая текст во внутренние системы, которые поднимают соответствующие записи о клиенте еще до того, как тот успеет объяснить проблему.
«Статус появится у оператора на экране до того, как клиент закончит предложение и прекратит жаловаться», — пояснил Сток. «Это означает, что вы можете просто взаимодействовать и сказать: «Хорошо, я вижу статус. Позвольте мне исправить адрес и отправить груз повторно»».
По его оценкам, это могло бы сократить типичные взаимодействия со службой поддержки с множества переспросов до всего двух шагов: клиент объясняет проблему, а оператор сразу же ее решает.
Синхронный перевод между языками может появиться к концу 2026 года
Несмотря на весь фокус на транскрипции, Сток дал понять, что в Mistral рассматривают эти модели как базовую технологию для более амбициозной цели: естественного синхронного перевода речи в речь.
«Возможно, конечным целевым приложением и тем, для чего модель закладывает основу, является живой перевод», — сказал он. «Я говорю по-французски, вы говорите по-английски. Ключевым моментом является минимальная задержка, потому что иначе не возникает эмпатии. Ваша мимика не должна расходиться с тем, что вы сказали секунду назад».
Эта цель ставит Mistral в прямую конкуренцию с Apple и Google, которые также стремятся решить эту задачу. Последняя модель перевода от Google работает с двухсекундной задержкой — в десять раз медленнее, чем заявлено для Voxtral Realtime от Mistral.
Mistral позиционирует себя как альтернативу с приоритетом конфиденциальности для корпоративных клиентов
Mistral занимает необычное положение на ландшафте ИИ. Основанная в 2023 году выходцами из Meta и Google DeepMind, компания привлекла более $2 миллиардов инвестиций, а ее текущая оценка составляет примерно $13,6 миллиарда. Тем не менее она работает с долей вычислительных ресурсов американских гиперскейлеров и построила свою стратегию на эффективности, а не на грубой силе.
«Выпускаемые нами модели — корпоративного уровня, передовые в отрасли, эффективные (в частности, с точки зрения затрат), могут быть встроены на периферию (edge), обеспечивают конфиденциальность, контроль, прозрачность», — отметил Сток.
Такой подход нашел особый отклик у европейских клиентов, опасающихся зависимости от американских технологий. В январе Министерство вооруженных сил Франции подписало рамочное соглашение, предоставляющее вооруженным силам страны доступ к моделям ИИ от Mistral — сделку, которая прямо требует развертывания на инфраструктуре под французским контролем.
Конфиденциальность данных остается одним из главных препятствий на пути внедрения голосового ИИ на предприятиях. Для компаний в чувствительных отраслях (финансы, производство, здравоохранение, страхование) отправка аудиоданных на внешние облачные серверы часто является недопустимым вариантом. Информация должна оставаться либо на самом устройстве, либо в пределах собственной инфраструктуры компании.
Mistral сталкивается с жесткой конкуренцией со стороны OpenAI, Google и набирающего силу Китая
Рынок транскрипции стал крайне конкурентным. Модель Whisper от OpenAI фактически стала отраслевым стандартом, доступным как через API, так и в виде загружаемых весов с открытым исходным кодом. Google, Amazon и Microsoft предлагают речевые сервисы корпоративного уровня. Специализированные игроки вроде Assembly AI и Deepgram построили крупный бизнес на обслуживании разработчиков, которым требуется надежная и масштабируемая транскрипция.
Mistral заявляет, что ее новые модели превосходят все эти аналоги по бенчмаркам точности и при этом выигрывают в цене. «Мы лучше их по бенчмаркам», — сказал Сток. Независимая проверка этих заявлений займет время, однако компания указывает на результаты в FLEURS — широко используемом многоязычном речевом бенчмарке, где модели Voxtral демонстрируют уровень частоты ошибок, сопоставимый с альтернативами от OpenAI и Google или превосходящий их.
Пожалуй, еще более показательно то, что генеральный директор Mistral Артур Менш (Arthur Mensch) предупредил об угрозе для американских ИИ-компаний со стороны неожиданного соперника. Выступая на Всемирном экономическом форуме в Давосе в прошлом месяце, Менш назвал представление о том, будто китайский ИИ отстает от западного, «сказкой».
«Возможности китайских технологий с открытым исходным кодом вызывают стресс у генеральных директоров в США», — заявил он.
Французский стартап делает ставку на то, что доверие определит победителя в корпоративном голосовом ИИ
Сток предсказал, что 2026 год станет «годом заметок» — моментом, когда ИИ-транскрипция станет настолько надежной, что пользователи доверятся ей полностью.
«Вам необходимо доверять модели, и модель принципиально не должна совершать никаких ошибок, иначе вы просто потеряете доверие к продукту и перестанете им пользоваться», — сказал он. «Порог здесь чрезвычайно высок».
Смогла ли Mistral преодолеть этот рубеж, еще предстоит увидеть. Корпоративные клиенты станут главными судьями, а они склонны действовать медленно, проверяя заявления на практике, прежде чем выделять бюджеты и внедрять новые технологии в рабочие процессы. Аудиопесочница в Mistral Studio, где разработчики могут протестировать Voxtral Transcribe 2 на собственных файлах, заработала сегодня.
Тем не менее, более широкий тезис Стока заслуживает внимания. На рынке, где американские гиганты соревнуются, вливая миллиарды долларов в создание все более крупных моделей, Mistral делает другую ставку: в эпоху ИИ меньший и локальный масштаб может победить больший и удаленный. Для руководителей, которые ежедневно беспокоятся о суверенитете данных, соблюдении нормативных требований и привязке к поставщику, этот подход может оказаться более убедительным, чем любые бенчмарки.
Гонка за лидерство в корпоративном голосовом ИИ больше не сводится лишь к тому, кто создаст самую мощную модель. Теперь речь идет о том, какую модель вы готовы подпустить к себе и позволить ей слушать.



