Модель распознавания речи Transcribe ASR от Cohere лидирует по точности
У предприятий, создающих рабочие процессы с голосовым управлением, был ограниченный выбор для транскрипции промышленного уровня: закрытые API с рисками резидентности данных либо открытые модели, в которых точность приносилась в жертву развертываемости. Новая модель распознавания речи (ASR) с открытыми весами от Cohere под названием Transcribe создана для того, чтобы успешно конкурировать по всем четырем ключевым критериям: точность с учетом контекста, задержка, управляемость и стоимость.
Cohere заявляет, что Transcribe превосходит текущих лидеров по точности, и, в отличие от закрытых API, она может работать на собственной инфраструктуре организации.
Модель Transcribe, доступная через API или в хранилище моделей Cohere Model Vault под названием cohere-transcribe-03-2026, имеет 2 миллиарда параметров и распространяется под лицензией Apache-2.0. Компания сообщила, что средняя частота ошибок в словах (WER) у Transcribe составляет всего 5,42%, благодаря чему она допускает меньше ошибок, чем аналогичные модели.
Модель обучена на 14 языках: английском, французском, немецком, итальянском, испанском, греческом, голландском, польском, португальском, китайском, японском, корейском, вьетнамском и арабском. Компания не уточнила, на каком именно диалекте китайского языка была обучена модель.
В Cohere отметили, что обучали модель «с особым упором на минимизацию WER при сохранении полной готовности к промышленной эксплуатации». По словам представителей компании, в результате получилась модель, которую предприятия могут напрямую подключать к голосовой автоматизации, конвейерам транскрипции и рабочим процессам голосового поиска.
Автономная транскрипция для производственных конвейеров
До недавнего времени корпоративная транскрипция была связана с компромиссами: закрытые API обеспечивали точность, но привязывали данные к платформе; открытые модели предоставляли контроль, но отставали по производительности. В отличие от Whisper, которая запускалась как исследовательская модель под лицензией MIT, Transcribe доступна для коммерческого использования сразу после релиза и может работать на собственной локальной GPU-инфраструктуре организации. Первые пользователи отметили, что подход с открытыми весами, готовый к коммерческому использованию, имеет большое значение для корпоративных развертываний.
Организации могут развернуть Transcribe на собственных локальных серверах, поскольку, по заявлению Cohere, модель имеет более управляемые требования к ресурсам для инференса на локальных графических процессорах. Компания пояснила, что этого удалось добиться благодаря тому, что модель «раздвигает границы Парето, обеспечивая передовую точность (низкий показатель WER) при сохранении лучшей в своем классе пропускной способности (высокий показатель RTFx) среди моделей с количеством параметров более 1B».
Как Transcribe выглядит на фоне конкурентов
Transcribe превзошла признанных лидеров в области речевых моделей, включая Whisper от OpenAI, которая лежит в основе голосовой функции ChatGPT, и ElevenLabs, используемую многими крупными ритейл-брендами. В настоящее время она возглавляет рейтинг ASR на платформе Hugging Face, лидируя со средней частотой ошибок в словах 5,42% и опережая Whisper Large v3 (7,44%), ElevenLabs Scribe v2 (5,83%) и Qwen3-ASR-1.7B (5,76%).
Судя по результатам тестирования на других наборах данных от Hugging Face, Transcribe также показала себя с лучшей стороны. На датасете AMI, предназначенном для оценки понимания встреч и анализа диалогов, Transcribe набрала 8,15%. На датасете Voxpopuli, который тестирует понимание различных акцентов, модель получила 5,87%, уступив лишь Zoom Scribe.
Первые пользователи назвали главными достоинствами точность и возможность локального развертывания — особенно те команды, которые ранее передавали аудиоданные через внешние API и теперь стремятся перенести эту рабочую нагрузку внутрь компании.
Для инженерных команд, создающих RAG-пайплайны или агентские воркфлоу с аудиовходами, Transcribe предлагает путь к транскрипции промышленного уровня без рисков для резидентности данных и задержек, свойственных закрытым API.



