Scale AI запускает Voice Showdown — первый реальный бенчмарк для речевого ИИ, и результаты оказываются отрезвляющими для некоторых ведущих моделей
Голосовой ИИ развивается быстрее, чем инструменты, используемые для его оценки. Каждая крупная лаборатория искусственного интеллекта — OpenAI, Google DeepMind, Anthropic, xAI — спешит выпустить языковые модели, способные вести естественный разговор в реальном времени.
Но бенчмарки, используемые для оценки этих моделей, по-прежнему в значительной степени основаны на синтетической речи, промптах исключительно на английском языке и заскриптованных тестовых наборах, которые имеют мало общего с тем, как люди разговаривают в реальной жизни.
Scale AI, стартап по разметке больших объемов данных, основатель которого в прошлом году был переманен компанией Meta для руководства своей Лабораторией суперинтеллекта, продолжает уверенно развиваться и берется за эту проблему напрямую: сегодня компания запускает Voice Showdown — первую, по ее заявлению, глобальную арену на основе пользовательских предпочтений, созданную для бенчмаркинга голосового ИИ через призму реального человеческого общения.
Этот продукт предлагает пользователям уникальную стратегическую ценность: бесплатный доступ к ведущим мировым передовым моделям. Через платформу Scale ChatLab пользователи могут взаимодействовать с высокоуровневыми моделями, которые обычно требуют оформления нескольких подписок стоимостью 20 долларов в месяц, абсолютно бесплатно. В обмен пользователи участвуют в периодических слепых «баталиях» один на один, выбирая, какая из двух анонимизированных ведущих голосовых моделей обеспечивает лучший пользовательский опыт. Это позволяет собирать данные для самого аутентичного в отрасли лидерборда голосовых ИИ-моделей на основе человеческих предпочтений.
«Голосовой ИИ — это действительно самое быстро развивающееся направление в искусственном интеллекте на данный момент», — сказала Джани Гу, продакт-менеджер проекта Showdown в Scale AI. «Но методы оценки голосовых моделей не успевают за этим прогрессом».
Результаты, полученные на основе тысяч спонтанных голосовых разговоров более чем на 60 языках, выявили пробелы в возможностях, которые последовательно упускали из виду другие бенчмарки.
Как работает Voice Showdown от Scale
Voice Showdown создан на базе ChatLab — агностичной к моделям чат-платформы от Scale, где пользователи могут свободно и бесплатно общаться с любой выбранной передовой ИИ-моделью в рамках одного приложения. Платформа была доступна глобальному сообществу Scale, насчитывающему более 500 000 аннотаторов, из которых примерно 300 000 отправили хотя бы один промпт. Сегодня Scale открывает доступ к платформе по общедоступному списку ожидания.
Механизм оценки поразительно прост: пока пользователь ведет естественный голосовой разговор с моделью, система время от времени — менее чем в 5% всех голосовых запросов — предлагает слепое сравнение лицом к лицу. Один и тот же промпт отправляется второй, анонимной модели, и пользователь выбирает, какой ответ ему нравится больше.
Такая архитектура решает три проблемы, от которых страдают существующие голосовые бенчмарки.
Во-первых, каждый промпт исходит от живого человека — с акцентами, фоновым шумом, недоговоренными фразами и словами-паразитами, а не представляет собой синтезированный аудиофайл, сгенерированный из текста.
Во-вторых, платформа охватывает более 60 языков на 6 континентах, причем более трети батчей происходит на неанглийских языках, включая испанский, арабский, японский, португальский, хинди и французский.
В-третьих, поскольку баталии происходят в рамках реальных повседневных разговоров пользователей, 81% промптов носят разговорный или открытый характер — это вопросы, не имеющие единственного правильного ответа. Это исключает автоматическую оценку и делает человеческие предпочтения единственным надежным ориентиром.
В настоящее время в Voice Showdown работают два режима оценки: Dictate (пользователи говорят, модели отвечают текстом) и Speech-to-Speech или S2S (речь-в-речь: пользователи говорят, модели отвечают голосом). Третий режим — Full Duplex (полный дуплекс), фиксирующий разговор в реальном времени с возможностью перебивать собеседника, находится в разработке.
Голосование с согласованными стимулами
Одна детаь дизайна отличает Voice Showdown от Chatbot Arena (Arena), текстового бенчмарка, на который он больше всего похож. Критики отмечают, что в Arena пользователи порой оставляют поверхностные голоса, не будучи особо заинтересованными в исходе. Voice Showdown решает эту проблему напрямую: после того как пользователь отдает голос за предпочитаемую модель, приложение переключает его на эту модель до конца беседы. Если вы проголосовали за GPT-4o Audio вместо Gemini, теперь вы разговариваете с GPT-4o Audio. Такое согласование последствий с предпочтениями препятствует случайному или нечестному голосованию.
Система также контролирует факторы смещения, которые могли бы исказить сравнение: ответы обеих моделей начинают передаваться одновременно (устраняя предвзятость по скорости), гендер голоса подбирается одинаковым для обоих вариантов (устраняя предвзятость к полу), а во время голосования ни одна из моделей не называется по имени.
Новый лидерборд голосового ИИ, на который должен обратить внимание каждый корпоративный лидер
Voice Showdown запускается с 11 передовыми моделями, оцененными по 52 парам «модель-голос» по состоянию на 18 марта 2026 года. Не все модели поддерживают оба режима оценки: лидерборд Dictate включает 8 моделей, а S2S — 6.
Лидерборд Dictate (Речь на входе, текст на выходе)
В этом режиме пользователи отправляют голосовой запрос и оценивают два параллельных текстовых ответа. Вот базовые баллы:
-
Gemini 3 Pro (1073)
-
Gemini 3 Flash (1068)
-
GPT-4o Audio (1019)
-
Qwen 3 Omni (1000)
-
Voxtral Small (925)
-
Gemma 3n (918)
-
GPT Realtime (875)
-
Phi-4 Multimodal (729)
Примечание: Gemini 3 Pro и Gemini 3 Flash делят первое место по статистическим показателям.
Лидерборд Speech-to-Speech (S2S)
В этом режиме пользователи говорят с моделью и оценивают два конкурирующих аудиоответа. Также базовые показатели:
-
Gemini 2.5 Flash Audio (1060)
-
GPT-4o Audio (1059)
-
Grok Voice (1024)
-
Qwen 3 Omni (1000)
-
GPT Realtime (962)
-
GPT Realtime 1.5 (920)
Примечание: Gemini 2.5 Flash Audio и GPT-4o Audio делят первое место в базовых оценках со статистической точки зрения.
В рейтинге Dictate лидируют модели Gemini 3 Pro и Gemini 3 Flash от Google, которые со статистической точки зрения делят 1-е место с рейтингом Эло около 1043–1044 после контроля стиля.
GPT-4o Audio уверенно занимает третье место. Модели с открытыми весами, включая Gemma3n, Voxtral Small и Phi-4 Multimodal, существенно отстают.
В рейтинге Speech-to-Speech (S2S) борьба на вершине идет более плотно: Gemini 2.5 Flash Audio и GPT-4o Audio делят первое место по результатам базовых оценок.
После поправки на длину ответа и форматирование — факторы, которые могут завышать воспринимаемое качество, — GPT-4o Audio вырывается вперед (Эло 1102 против 1075 у Gemini 2.5 Flash Audio).
Grok Voice поднимается на второе место с показателем 1093 с учетом поправок на стиль, что намекает на то, что его первоначальное 3-е место занижает реальное качество работы модели.
Qwen 3 Omni, модель с открытыми весами от команды Qwen компании Alibaba, показывает себя лучше в плане чистых предпочтений, чем можно было бы судить по ее популярности, занимая четвертое место в обоих режимах и опережая несколько более громких имен.
«Когда люди приходят, они выбирают известные бренды», — отмечает Гу. «Но когда дело доходит до предпочтений, менее известные модели, такие как Qwen, фактически вырываются вперед».
Сюрпризы, выявленные данными о реальных предпочтениях
Помимо рейтингов, истинная ценность Voice Showdown заключается в диагностике сбоев — и она рисует более сложную картину голосового ИИ, чем демонстрирует большинство лидербордов.
Проблема мультиязычности оказалась хуже, чем вы думаете
Надежность языка — наиболее яркий фактор, отличающий модели друг от друга. В режиме Dictate модели Gemini 3 лидируют практически на всех тестируемых языках.
В S2S победитель во многом зависит от того, на каком языке ведется диалог: GPT-4o Audio лидирует в арабском и турецком; Gemini 2.5 Flash Audio сильнее всего во французском; Grok Voice конкурентоспособен в японском и португальском.
Но еще более тревожным открытием является то, насколько часто некоторые модели вообще перестают отвечать на языке пользователя.
GPT Realtime 1.5 — новая модель голосового общения в реальном времени от OpenAI — примерно в 20% случаев отвечает на английском языке на запросы, сделанные не на английском, даже для таких распространенных и официально поддерживаемых языков, как хинди, испанский и турецкий.
Ее предшественница, GPT Realtime, ошибается примерно вдвое реже (~10%). У Gemini 2.5 Flash Audio и GPT-4o Audio этот показатель составляет около ~7%.
Это явление работает в обе стороны: некоторые модели переносят неанглоязычный контекст из предыдущей части разговора в англоязычный диалог или просто не расслышивают промпт и генерируют совершенно неуместный ответ на неправильном языке.
Реплики пользователей с платформы прямо фиксируют это разочарование: «Я сказал, что у меня сегодня интервью с Quest Management, и вместо ответа она выдала информацию о „Риск-менеджменте“ (Risk Management)».
«GPT Realtime 1.5 сочла, что я говорю бессвязно, и порекомендовала обратиться за психологической помощью, в то время как Qwen 3 Omni правильно определил, что я говорю на одном из местных языков Нигерии».
Причина, по которой существующие бенчмарки упускают это из виду: они созданы на базе синтетической речи, оптимизированной под чистые акустические условия, и редко поддерживают многоязычность. Реальные спикеры в реальной обстановке — с фоновым шумом, короткими фразами и региональными акцентами — разрушают понимание речи способами, которые лабораторные условия предсказать не могут.
Выбор голоса — это больше, чем просто эстетика
Voice Showdown оценивает модели не только на уровне самой модели, но и на уровне конкретного голоса — и разброс внутри каталога голосов одной модели поражает.
Для одной безымянной модели в исследовании лучший голос побеждал на 30 процентных пунктов чаще, чем худший голос той же базовой модели. Оба голоса разделяют одну и ту же логику и бэкенд генерации. Разница заключается исключительно в аудиопрезентации.
Наиболее эффективные голоса обычно выигрывают или проигрывают за счет понимания аудио и полноты контента — того, правильно ли модель вас услышала и дала ли полный ответ. Но качество речи остается решающим фактором на уровне выбора голоса, особенно когда модели в остальном сопоставимы. «Голос напрямую влияет на то, как пользователи оценивают взаимодействие», — говорит Гу.
Модели деградируют в ходе разговора
Большинство бенчмарков тестируют один диалоговый шаг (turn). Voice Showdown проверяет, как модели держатся на протяжении продолжительных разговоров, и результаты выглядят не лучшим образом.
На 1-м шаге качество контента составляет причину 23% сбоев модели. К 11-му шагу и далее оно становится основной причиной сбоев — уже 43%. У большинства моделей доля побед снижается по мере удлинения разговора, так как им становится трудно сохранять связность в течение нескольких реплик.
Варианты GPT Realtime являются исключением, демонстрируя незначительное улучшение на более поздних этапах — что согласуется с их известными сильными сторонами в контекстах большой длины и задокументированной слабостью на коротких зашумленных высказываниях, преобладающих в начале общения.
Длина промпта демонстрирует схожую закономерность: в коротких промптах (до 10 секунд) преобладают сбои понимания аудио (38%), в то время как длинные промпты (более 40 секунд) смещают основную причину сбоев в сторону качества контента (31%). Короткое аудио дает моделям меньше акустического контекста для разбора; длинные запросы понимаются лучше, но на них сложнее дать качественный ответ.
Почему некоторые модели голосового ИИ проигрывают
После каждого сравнения S2S пользователи отмечают, почему они отдали предпочтение тому или иному ответу, по трем осям: понимание аудио, качество контента и речевой вывод. Характер сбоев существенно различается в зависимости от модели.
Потери Qwen 3 Omni сосредоточены вокруг генерации речи: ее логика конкурентоспособна, но пользователей отталкивает то, как она звучит. Потери GPT Realtime 1.5 обусловлены в основном сбоями понимания аудио (51%), что согласуется с ее склонностью к переключению языков на сложных запросах. Сбои Grok Voice более сбалансированы по всем трем осям, что указывает на отсутствие какого-то одного доминирующего слабого места, но также и на отсутствие особых преимуществ.
Что дальше
Текущий лидерборд охватывает пошаговое взаимодействие: вы говорите, модель отвечает, повторить. Но реальные голосовые разговоры устроены иначе. Люди перебивают, меняют направление мысли на полуслове и говорят одновременно.
Scale заявляет, что оценка в режиме полного дуплекса (Full Duplex), разработанная для фиксации этой динамики в реальном времени через человеческие предпочтения, а не заскриптированные сценарии или автоматизированные метрики, появится в Showdown в ближайшее время. Ни один существующий бенчмарк не фиксирует полнодуплексное взаимодействие с помощью органичных данных о человеческих предпочтениях.
Лидерборд доступен по адресу scale.com/showdown. Публичный лист ожидания для присоединения к ChatLab и голосования по сравнениям открыт уже сегодня; пользователи получают бесплатный доступ к передовым голосовым моделям, включая GPT-4o, Gemini и Grok, в обмен на периодические голоса за предпочитаемые варианты.



