ИИ от Zoom побеждает в тесте Humanity's Last Exam
Zoom Video Communications, компания, получившая широкую известность благодаря обеспечению связи для удаленных сотрудников во время пандемии, объявила на прошлой неделе о достижении рекордного балла в одном из самых сложных тестов для искусственного интеллекта. Это заявление вызвало в технологической индустрии волну удивления, скептицизма и искреннего любопытства.
Компания из Сан-Хосе сообщила, что ее ИИ-система набрала 48,1 процента в тесте Humanity’s Last Exam («Последний экзамен человечества») — бенчмарке, разработанном экспертами со всего мира для того, чтобы поставить в тупик даже самые передовые модели ИИ. Этот результат немного превосходит показатель системы Google Gemini 3 Pro, которой принадлежал предыдущий рекорд в 45,8 процента.
«Zoom добилась нового передового результата в сложном комплексном бенчмарке Humanity’s Last Exam, набрав 48,1%, что представляет собой значительное улучшение на 2,3% по сравнению с предыдущим лучшим результатом (SOTA)», — написал Сюэдун Хуан (Xuedong Huang), технический директор Zoom, в блоге компании.
Это объявление поднимает провокационный вопрос, который уже несколько дней волнует наблюдателей за сферой ИИ: как компания, занимающаяся видеоконференцсвязью и не имеющая публичной истории обучения больших языковых моделей, внезапно обошла Google, OpenAI и Anthropic на бенчмарке, созданном для оценки пределов возможностей машинного интеллекта?
Ответ говорит как о будущем искусственного интеллекта, так и о собственных технических амбициях Zoom. И в зависимости от того, у кого спросить, это либо гениальная демонстрация практической инженерии, либо пустой шаг, присваивающий чужие заслуги.
Как Zoom создала ИИ-регулировщика вместо обучения собственной модели
Zoom не стала обучать собственную большую языковую модель. Вместо этого компания разработала то, что она называет «федеративным подходом к ИИ» — систему, которая направляет запросы нескольким существующим моделям от OpenAI, Google и Anthropic, а затем использует проприетарное программное обеспечение для выбора, объединения и доработки их ответов.
В центре этой системы находится так называемый Z-scorer — механизм, который оценивает ответы различных моделей и выбирает лучший для каждой конкретной задачи. Компания дополняет его стратегией, которую она описывает как «исследование-проверка-федерация» (explore-verify-federate) — агентский рабочий процесс, балансирующий между исследовательскими рассуждениями и верификацией в нескольких ИИ-системах.
«Наш федеративный подход объединяет собственные небольшие языковые модели Zoom с передовыми моделями с открытым и закрытым исходным кодом», — написал Хуан. Эта структура «организует различные модели для генерации, оспаривания и уточнения выводов посредством диалектического сотрудничества».
Проще говоря: Zoom создала сложный пульт управления трафиком для ИИ, а не сам искусственный интеллект.
Это различие имеет огромное значение в индустрии, где право на хвастовство и миллиардные оценки часто зависят от того, кто может похвастаться самой мощной моделью. Крупнейшие лаборатории ИИ тратят сотни миллионов долларов на обучение передовых систем на огромных вычислительных кластерах. Достижение Zoom, напротив, судя по всему, основано на грамотной интеграции уже существующих систем.
Почему мнения исследователей ИИ разделились в вопросе о том, что считать настоящими инновациями
Реакция сообщества специалистов по ИИ была быстрой и резко разделившейся.
Макс Румпф (Max Rumpf), инженер по ИИ, заявляющий, что он обучает передовые языковые модели, опубликовал жесткую критику в социальных сетях. «Zoom объединила вызовы API к Gemini, GPT, Claude и т. д. и немного улучшила показатель в бенчмарке, который не несет никакой ценности для их клиентов, — написал он. — И после этого они заявляют о передовом результате (SOTA)».
Румф не стал отвергать сам технический подход. Использование нескольких моделей для разных задач, по его словам, — это «на самом деле довольно умный ход, и большинство приложений должны так поступать». Он упомянул Sierra, компанию, занимающуюся поддержкой клиентов с помощью ИИ, как пример эффективной реализации стратегии с использованием нескольких моделей.
Его возражение было более конкретным: «Они не обучали модель, но затушевывают этот факт в своем посте. Несправедливость присвоения чужих заслуг глубоко ранит людей».
Однако другие наблюдатели увидели это достижение иначе. Хончэн Чжу (Hongcheng Zhu), разработчик, дал более взвешенную оценку: «Чтобы возглавить рейтинг ИИ-тестов, вам, скорее всего, потребуется федерация моделей, как это сделала Zoom. Аналогия заключается в том, что любой участник Kaggle знает: для победы в конкурсе нужно объединять модели в ансамбли».
Сравнение с Kaggle — соревновательной платформой для специалистов по науке о данных, где объединение нескольких моделей является стандартной практикой среди команд-победителей — представляет подход Zoom как передовую отраслевую практику, а не как ловкость рук. Академические исследования давно доказали, что методы ансамблирования регулярно превосходят отдельные модели.
Тем не менее, эти дебаты обнажили трещину в том, как индустрия понимает прогресс. Райан Прим (Ryan Pream), основатель Exoria AI, высказался скептически: «Zoom просто создают оболочку вокруг чужой большой языковой модели и отчитываются об этом. Это просто шум». Другой комментатор отметил полную неожиданность новости: «То, что приложение для видеоконференций ZOOM разработало модель SOTA, набравшую 48% в HLE, никак не входило в мои планы».
Пожалуй, самая острая критика касалась приоритетов. Румпф утверждал, что Zoom могла бы направить свои ресурсы на проблемы, с которыми реально сталкиваются ее клиенты. «Извлечение информации из стенограмм звонков не «решено» современными большими языковыми моделями, — написал он. — Я полагаю, пользователей Zoom это волнует гораздо больше, чем HLE».
Ветеран Microsoft, поставивший свою репутацию на иной подход к искусственному интеллекту
Если результаты Zoom в бенчмарке казались появившимися из ниоткуда, то ее технический директор — нет.
Сюэдун Хуан перешел в Zoom из Microsoft, где он десятилетиями занимался созданием ИИ-технологий компании. Он основал группу речевых технологий Microsoft в 1993 году и руководил командами, которые добились того, что компания назвала паритетом с человеком в распознавании речи, машинном переводе, понимании естественного языка и компьютерном зрении.
Хуан имеет докторскую степень в области электротехники Эдинбургского университета. Он является избранным членом Национальной инженерной академии США и Американской академии искусств и наук, а также действительным членом (феллоу) как IEEE, так и ACM. Его регалии ставят его в один ряд с самыми выдающимися руководителями в сфере искусственного интеллекта.
Его присутствие в Zoom сигнализирует о том, что ИИ-амбиции компании серьезны, даже если ее методы отличаются от исследовательских лабораторий, доминирующих в заголовках новостей. В своем посте в соцсетях, посвященном результатам бенчмарка, Хуан охарактеризовал это достижение как подтверждение правильности стратегии Zoom: «Мы раскрыли более широкие возможности в исследовании, рассуждении и мультимодельном сотрудничестве, превзойдя пределы производительности любой отдельной модели».
Эта последняя фраза — «превзойдя пределы производительности любой отдельной модели» — пожалуй, самая значимая. Хуан не утверждает, что Zoom создала лучшую модель. Он утверждает, что Zoom создала лучшую систему для использования моделей.
Внутри теста, созданного, чтобы поставить в тупик умнейшие машины мира
Бенчмарк, оказавшийся в центре этого спора, Humanity’s Last Exam, был разработан как исключительно сложный. В отличие от более ранних тестов, которые ИИ-системы научились «обманывать» с помощью сопоставления с образцами, HLE предлагает проблемы, требующие подлинного понимания, многоэтапного мышления и синтеза информации в сложных областях.
Экзамен опирается на вопросы экспертов со всего мира, охватывающие сферы от высшей математики и философии до специализированных научных знаний. 48,1 процента могут показаться скромным результатом для тех, кто привык к школьным шкалам оценивания, но в контексте HLE это представляет собой текущий предел производительности машин.
«Этот бенчмарк был разработан профильными экспертами по всему миру и стал важнейшим критерием для измерения прогресса ИИ на пути к достижению человеческого уровня выполнения сложных интеллектуальных задач», — отмечается в заявлении Zoom.
Улучшение компанией результатов предыдущего рекорда Google на 2,3 процентных пункта может показаться незначительным само по себе. Но в соревновательных бенчмарках, где прирост часто измеряется долями процента, такой скачок привлекает к себе внимание.
Что подход Zoom говорит о будущем корпоративного искусственного интеллекта
Подход Zoom имеет последствия, которые выходят далеко за рамки лидерства в бенчмарках. Компания заявляет о видении корпоративного ИИ, которое принципиально отличается от ориентированных на модели стратегий, преследуемых OpenAI, Anthropic и Google.
Вместо того чтобы ставить все на создание единственной наиболее способной модели, Zoom позиционирует себя как уровень оркестрации — компанию, которая может интегрировать лучшие возможности от нескольких провайдеров и доставлять их через продукты, которые бизнес уже использует каждый день.
Эта стратегия страхует от критической неопределенности на рынке ИИ: никто не знает, какая модель будет лучшей в следующем месяце, не говоря уже о следующем годе. Создавая инфраструктуру, которая позволяет переключаться между провайдерами, Zoom избегает привязки к одному поставщику и теоретически предлагает клиентам лучший из доступных ИИ для любой конкретной задачи.
Анонс OpenAI GPT-5.2 на следующий день подчеркнул эту динамику. В собственных сообщениях OpenAI компания Zoom была названа партнером, который оценил производительность новой модели «в рамках своих ИИ-нагрузок и зафиксировал заметный прирост по всем направлениям». Другими словами, Zoom выступает одновременно и клиентом передовых лабораторий, и конкурентом в их бенчмарках — используя при этом их собственные технологии.
Такое положение дел может оказаться жизнеспособным. У основных поставщиков моделей есть все стимулы широко продавать доступ к API, даже компаниям, которые могут агрегировать их результаты. Более интересный вопрос заключается в том, является ли способность Zoom к оркестрации подлинной интеллектуальной собственностью или просто сложным промпт-инжинирингом, который могут повторить другие.
Настоящая проверка наступит тогда, когда 300 миллионов пользователей Zoom начнут задавать вопросы
Zoom озаглавила раздел своего объявления об отношениях в индустрии «Совместное будущее», и Хуан повсюду выражал слова благодарности. «Будущее ИИ — это сотрудничество, а не конкуренция, — написал он. — Объединяя лучшие инновации со всей индустрии с нашими собственными исследовательскими прорывами, мы создаем решения, которые превосходят сумму своих составляющих».
Такое позиционирование представляет Zoom как благожелательного интегратора, объединяющего лучшие наработки индустрии на благо корпоративных клиентов. Критики видят нечто иное: компанию, которая претендует на престиж ИИ-лаборатории, не проводя фундаментальных исследований, которые этого заслуживают.
Эти дебаты, скорее всего, разрешатся не по таблицам лидеров, а с помощью продуктов. Когда AI Companion 3.0 в ближайшие месяцы станет доступен сотням миллионов пользователей Zoom, они вынесут собственный вердикт — не на основе бенчмарков, о которых они никогда не слышали, а на основе того, действительно ли краткая сводка встречи отразила суть, имеют ли смысл пункты для дальнейших действий и сэкономил ли ИИ им время или потратил его зря.
В конце концов, самое провокационное заявление Zoom заключается, возможно, не в том, что она возглавила бенчмарк. А в том негласном аргументе, что в эпоху искусственного интеллекта лучшая модель — это не та, которую вы создаете, а та, которую вы умеете использовать.



