Meta возвращается к искусственному интеллекту с открытым исходным кодом, представив модель транскрипции Omnilingual ASR, поддерживающую более 1600 языков

Meta возвращается к искусственному интеллекту с открытым исходным кодом, представив модель транскрипции Omnilingual ASR, поддерживающую более 1600 языков

Компания Meta только что выпустила новую многоязычную систему автоматического распознавания речи (ASR), поддерживающую более 1 600 языков, что значительно превосходит модель с открытым исходным кодом Whisper от OpenAI, поддерживающую всего 99 языков.

Архитектура системы также позволяет разработчикам расширять эту поддержку на тысячи других языков. Благодаря функции обучения в контексте без предварительного обучения на новых данных (zero-shot in-context learning), пользователи могут предоставить несколько парных примеров аудио и текста на новом языке во время вывода, что позволяет модели распознавать дополнительные высказывания на этом языке без какой-либо переподготовки.

На практике это расширяет потенциальный охват до более чем 5 400 языков — практически до каждого разговорного языка с известной письменностью.

Это знаменует переход от статических возможностей моделей к гибкой структуре, которую сообщества могут адаптировать самостоятельно. Таким образом, хотя 1 600 языков отражают официальный охват при обучении, большая цифра представляет способность Omnilingual ASR к обобщению по требованию, делая ее самой расширяемой системой распознавания речи из всех выпущенных на сегодняшний день.

И самое главное: она выпущена с открытым исходным кодом под простой лицензией Apache 2.0 — а не под ограничительной квазиоткрытой лицензией Llama, как предыдущие релизы компании, которые ограничивали использование крупными предприятиями, если те не платили лицензионные сборы. Это означает, что исследователи и разработчики могут свободно брать ее и внедрять немедленно, бесплатно и без ограничений даже в коммерческих и корпоративных проектах!

Выпущенный 10 ноября на сайте Meta и в Github, а также с демо-пространством на Hugging Face и техническим описанием, пакет Omnilingual ASR от Meta включает семейство моделей распознавания речи, многоязычную модель аудиопредставления с 7 миллиардами параметров и массивный речевой корпус, охватывающий более 350 ранее обделенных вниманием языков.

Все ресурсы предоставляются бесплатно по открытым лицензиям, а модели поддерживают транскрипцию речи в текст «из коробки».

«Предоставляя эти модели и набор данных в открытый доступ, мы стремимся разрушить языковые барьеры, расширить цифровой доступ и расширить возможности сообществ по всему миру», — написала Meta на своем аккаунте @AIatMeta в X.

Разработано для транскрипции речи в текст

По своей сути Omnilingual ASR — это система преобразования речи в текст.

Модели обучены преобразовывать устную речь в письменный текст, поддерживая такие приложения, как голосовые помощники, инструменты транскрипции, субтитры, оцифровка устных архивов и функции специальной возможности для малоресурсных языков.

В отличие от предыдущих моделей ASR, требовавших обширных размеченных обучающих данных, Omnilingual ASR включает вариант zero-shot.

Эта версия может транскрибировать языки, с которыми она никогда раньше не сталкивалась, используя всего несколько парных примеров аудио и соответствующего текста.

Это кардинально снижает порог добавления новых или находящихся под угрозой исчезновения языков, устраняя необходимость в больших корпусах данных или переподготовке.

Семейство моделей и технический дизайн

Пакет Omnilingual ASR включает в себя несколько семейств моделей, обученных на более чем 4,3 миллионах часов аудио на более чем 1 600 языках:

  • Модели wav2vec 2.0 для самоконтролируемого обучения представлению речи (от 300 млн до 7 млрд параметров)

  • Модели ASR на базе CTC для эффективного контролируемого распознавания речи

  • Модели LLM-ASR, объединяющие речевой энкодер с текстовым декодером на базе Transformer для современного распознавания речи

  • Модель LLM-ZeroShot ASR, обеспечивающая адаптацию к ранее неизученным языкам во время вывода

Все модели имеют архитектуру «энкодер-декодер»: необработанное аудио преобразуется в независимое от языка представление, а затем декодируется в письменный текст.

Почему масштаб имеет значение

Хотя Whisper и аналогичные модели продвинули возможности ASR для глобальных языков, они уступают в области бесконечного разнообразия человеческих языков (long tail). Whisper поддерживает 99 языков. Система Meta:

  • напрямую поддерживает более 1 600 языков;

  • способна обобщать до более чем 5 400 языков с помощью обучения в контексте;

  • достигает уровня ошибок по символам (CER) менее 10% для 78% поддерживаемых языков.

Среди поддерживаемых языков более 500 никогда ранее не охватывались ни одной моделью ASR, согласно исследовательскому документу Meta.

Это расширение открывает новые возможности для сообществ, чьи языки часто исключаются из цифровых инструментов.

Ниже представлен переработанный и расширенный раздел с предысторией, объединяющий более широкий контекст стратегии Meta в области ИИ на 2025 год, кадровые перестановки и прием Llama 4, дополненный цитатами в тексте и ссылками:

Предыстория: масштабная перестройка ИИ-направления в Meta и восстановление после Llama 4

Выход Omnilingual ASR происходит в ключевой момент для ИИ-стратегии Meta, последовавший за годом организационных потрясений, кадровых перетрубаций и неравномерного выпуска продуктов.

Omnilingual ASR — это первый крупный релиз модели с открытым исходным кодом после развертывания Llama 4, новейшей большой языковой модели Meta, которая дебютировала в апреле 2025 года и встретила смешанные и в конечном счете слабые отзывы, показав незначительное внедрение в корпоративном секторе по сравнению с китайскими конкурентами среди моделей с открытым исходным кодом.

Эта неудача побудила основателя и генерального директора Meta Марка Цукерберга назначить Александра Ванга, соучредителя и бывшего гендиректора поставщика ИИ-данных Scale AI, главным директором по искусственному интеллекту, и начать масштабную и дорогостоящую кампанию по найму, которая шокировала ИИ- и бизнес-сообщества ошеломляющими бонусами за подписание контракта для ведущих ИИ-исследователей.

Напротив, Omnilingual ASR представляет собой стратегический и репутационный перезапуск. Он возвращает Meta в сферу, где компания исторически лидировала — многоязычный ИИ, — и предлагает по-настоящему расширяемый, ориентированный на сообщество стек с минимальными барьерами для входа.

Поддержка системой более 1 600 языков и возможность расширения еще на 5 000+ с помощью обучения в контексте без предварительного обучения подтверждают инженерный авторитет Meta в области языковых технологий.

Важно отметить, что это достигается за счет бесплатного релиза под разрешающей лицензией Apache 2.0 с прозрачными источниками наборов данных и воспроизводимыми протоколами обучения.

Этот сдвиг согласуется с более широкими темами в стратегии Meta на 2025 год. Компания переориентировала свой нарратив вокруг концепции «персонального суперинтеллекта», инвестируя значительные средства в инфраструктуру (включая сентябрьский выпуск пользовательских ИИ-ускорителей и стеков выводов на базе архитектуры Arm) источник и при этом оттесняя метавселенную на второй план в пользу базовых возможностей искусственного интеллекта. Возвращение к публичным обучающим данным в Европе после регуляторной паузы также подчеркивает ее намерение конкурировать на глобальном уровне, несмотря на пристальное внимание к вопросам конфиденциальности источник.

Таким образом, Omnilingual ASR — это больше, чем просто релиз модели. Это расчетливый шаг по восстановлению контроля над новостной повесткой: переход от фрагментированного развертывания Llama 4 к высокоэффективному вкладу на основе исследований, который согласуется с долгосрочной платформенной стратегией Meta в области ИИ.

Сбор данных, ориентированный на сообщества

Для достижения такого масштаба Meta объединила усилия с исследователями и общественными организациями в Африке, Азии и других регионах для создания Omnilingual ASR Corpus — набора данных объемом 3 350 часов, охватывающего 348 малоресурсных языков. В качестве авторов выступали оплачиваемые местные дикторы, а записи собирались в сотрудничестве с такими группами, как:

  • African Next Voices: консорциум при поддержке Фонда Гейтса, включающий Университет Масено (Кения), Университет Претории и Data Science Nigeria;

  • Common Voice Фонда Mozilla, поддерживаемый через Фонд открытой многоязычной речи (Open Multilingual Speech Fund);

  • Lanfrica / NaijaVoices, создавшие данные для 11 африканских языков, включая игала, серер и урхобо.

Сбор данных был сосредоточен на естественной, неподготовленной речи. Подсказки разрабатывались так, чтобы быть культурно релевантными и открытыми, например: «Что лучше: иметь несколько близких друзей или много случайных знакомых? Почему?». В транскрипциях использовались устоявшиеся системы письменности, а контроль качества был встроен на каждом этапе.

Производительность и требования к оборудованию

Самая большая модель в пакете, omniASR_LLM_7B, требует около 17 ГБ видеопамяти графического процессора для вывода, что делает ее пригодной для развертывания на высокопроизводительном оборудовании. Более мелкие модели (300M–1B) могут работать на устройствах с меньшей мощностью и обеспечивают скорость распознавания в реальном времени.

Тесты производительности показывают надежные результаты даже в малоресурсных сценариях:

  • CER <10% для 95% высокоресурсных и среднересурсных языков;

  • CER <10% для 36% малоресурсных языков;

  • устойчивость в зашумленных условиях и на новых доменах, особенно при тонкой настройке (fine-tuning).

Система zero-shot, omniASR_LLM_7B_ZS, может транскрибировать новые языки с минимальной настройкой. Пользователи предоставляют несколько примеров пар аудио-текст, и модель генерирует транскрипции для новых высказываний на том же языке.

Открытый доступ и инструменты разработчика

Все модели и набор данных лицензированы на условиях разрешающих лицензий:

Установка поддерживается через PyPI и uv:

pip install omnilingual-asr

Meta также предоставляет:

  • интеграцию с набором данных HuggingFace;

  • готовые конвейеры вывода (inference pipelines);

  • обусловливание кодом языка для повышения точности.

Разработчики могут просмотреть полный список поддерживаемых языков с помощью API:

from omnilingual_asr.models.wav2vec2_llama.lang_ids import supported_langs

print(len(supported_langs))
print(supported_langs)

Более широкие последствия

Omnilingual ASR переосмысляет языковой охват в ASR от фиксированного списка до расширяемой структуры. Она обеспечивает:

  • включение малопредставленных языков под руководством сообщества;

  • цифровой доступ для устных языков и языков, находящихся под угрозой исчезновения;

  • исследования речевых технологий в лингвистически разнообразных контекстах.

Что особенно важно, Meta подчеркивает этические соображения на протяжении всего процесса, выступая за участие с открытым исходным кодом и сотрудничество с сообществами носителей языка.

«Ни одна модель не способна заранее предусмотреть и включить все языки мира, — говорится в документе по Omnilingual ASR, — но Omnilingual ASR дает сообществам возможность расширить распознавание с помощью собственных данных».

Доступ к инструментам

Все ресурсы теперь доступны по адресу:

Что это значит для предприятий

Для корпоративных разработчиков, особенно работающих на многоязычных или международных рынках, Omnilingual ASR значительно снижает барьер для развертывания систем преобразования речи в текст среди более широкого круга клиентов и географических регионов.

Вместо того чтобы полагаться на коммерческие API ASR, поддерживающие лишь ограниченный набор ресурсоемких языков, команды теперь могут интегрировать конвейер с открытым исходным кодом, который «из коробки» охватывает более 1 600 языков с возможностью расширения еще на тысячи за счет обучения без предварительного обучения на новых данных.

Эта гибкость особенно ценна для предприятий, работающих в таких секторах, как голосовая поддержка клиентов, услуги транскрипции, обеспечение доступности, образование или гражданские технологии, где охват местных языков может быть конкурентной или регуляторной необходимостью. Поскольку модели выпущены по разрешающей лицензии Apache 2.0, компании могут настраивать, развертывать или интегрировать их в проприетарные системы без ограничительных условий.

Это также представляет собой сдвиг в ландшафте ASR — от централизованных предложений, закрытых в облаке, к инфраструктуре, расширяемой силами сообщества. Делая многоязычное распознавание речи более доступным, настраиваемым и рентабельным, Omnilingual ASR открывает дверь для нового поколения корпоративных речевых приложений, построенных вокруг лингвистической инклюзии, а не лингвистических ограничений.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.