Hy3 от Tencent превосходит GLM-5.2 при вдвое меньшем размере

Hy3 от Tencent превосходит GLM-5.2 при вдвое меньшем размере

Источник: VentureBeat · Sam Witteveen

Последний год неудобным секретом бума моделей с открытыми весами оставался тот факт, что многие из самых мощных китайских релизов были недоступны значительной части компаний, которые в них больше всего заинтересованы. Лицензионные условия, исключающие Европейский союз, Великобританию и Южную Корею, приводили к тому, что юридические отделы сворачивали развертывание еще до того, как инженеры успевали завершить оценку — и это касалось не только корпораций со штаб-квартирой в этих регионах, но и любых предприятий, обслуживающих трафик в данных зонах. Для ИТ-отделов, взвешивающих плюсы и минусы открытых моделей, этот компромисс предельно очевиден.

Компания Tencent только что устранила это препятствие. Команда Tencent Hunyuan выпустила полную версию Hy3 — модели типа «Смесь экспертов» (MoE) с 295 миллиардами параметров (из них 21 миллиард активных) — и, в отличие от апрельской предварительной версии, предоставила ее по либеральной лицензии Apache 2.0. Реакция сообщества сторонников открытых моделей последовала незамедлительно: исследователи в соцсети X выделили изменение лицензии как главную новость, а в одном популярном посте утверждалось, что если показатели подтвердятся, то Tencent только что стала одним из лидеров открытого исходного кода. Представители Tencent заявляют, что модель будет доступна бесплатно на OpenRouter в течение двух недель

Полученные баллы заслуживают внимательного изучения — и они указывают в разных направлениях. Однако куда более интересной историей является то, на что именно Tencent сделала главную ставку: на показатели надежности и экономику развертывания, ориентированные непосредственно на производственное использование. 

От превью до готового продукта за десять недель при участии 50 внутренних команд

Апрельское превью Hy3 стало первой моделью на базе обновленной инфраструктуры предварительного обучения и обучения с подкреплением от Tencent, выпущенной менее чем через три месяца после февральской перестройки. Главный научный сотрудник по искусственному интеллекту Шунъю Яо (Shunyu Yao) охарактеризовал ранний релиз с открытым исходным кодом как осознанный шаг для сбора отзывов от разработчиков и пользователей перед официальным выходом — и в Tencent утверждают, что всё так и произошло. Согласно карточке модели, после апрельского превью команда собрала отзывы более чем от 50 продуктовых команд, исправила проблемы при выполнении задач и взаимодействии, а также масштабировала свой конвейер постобучения.

Архитектура осталась прежней: 295 млрд общих параметров, 21 млрд активных на один проход вперед за счет маршрутизации top-8 среди 192 экспертов, слой предсказания нескольких токенов (MTP) на 3,8 млрд параметров для спекулятивного декодирования и контекстное окно на 256 тыс. токенов. Изменилось поведение модели. Позиция Tencent заключается в том, что полноценный релиз значительно превосходит модели сопоставимого размера и конкурирует с флагманскими открытыми моделями, у которых в два-5 раз больше параметров.

Такое позиционирование «в два-пять раз» логично для целей данной модели — и оно напрашивается на прямое сравнение с текущим лидером среди открытых весов в сфере написания кода, GLM-5.2.

Слепое тестирование Tencent отдает предпочтение Hy3 перед GLM-5.1, но в кодинге по-прежнему лидирует GLM-5.2

Главная оценка эффективности от Tencent представляет собой слепое исследование с участием людей, а не таблицу лидеров. Утверждая, что общедоступные бенчмарки не отражают полной картины, компания провела слепое тестирование с привлечением 270 экспертов из различных дисциплин, работавших с реальными рабочими процессами. Было собрано 312 валидных сравнений, в которых, по данным Tencent, Hy3 набрала 2,67 балла из 4 против 2,51 у GLM-5.1. При этом наиболее очевидные преимущества наблюдаются в фронтенд-разработке, CI/CD, а также в работе с данными и хранилищами.

Выбор оппонента имеет значение. Компания Zhipu AI выпустила GLM-5.2 в середине июня, и собственное приложение с бенчмарками от Tencent показывает, что GLM-5.2 опережает Hy3 практически по всему набору задач агентского программирования: SWE-bench Verified (84,2 против 78,0), SWE-bench Multilingual (83,0 против 75,8), Terminal-Bench 2.1 (81 против 71,7), а в DeepSWE отрыв еще больше (46,2 против 28,0). Слепое тестирование проводилось на более старой модели; новая же удерживает корону в написании кода.

Лидерство GLM-5.2 в кодинге становится менее удивительным, если сопоставить их размеры: GLM-5.2 — это модель MoE примерно с 744 миллиардами параметров и около 40 миллиардами активных параметров на токен, в то время как у Hy3 общих параметров 295 миллиардов, а активных — 21 миллиард. Tencent выставляет модель, у которой менее половины параметров — и почти вдвое меньше вычислений на токен — по сравнению с конкурентом, которому она уступает.

Реальные победы Hy3 лежат в другой плоскости. В агентском поиске она демонстрирует 84,2 балла на BrowseComp и 91,0 на DeepSearchQA, опережая каждую открытую модель в таблице Tencent и составляя конкуренцию Claude Opus 4.8 и GPT-5.5. Она лидирует среди открытых решений по оркестрации инструментов (79,1 в общедоступном наборе MCP-Atlas), в оценках агентских каркасов, таких как ClawEval, а также в извлечении данных из длинного контекста (73,4 в AA-LCR). В совокупности это приложение рисует образ модели, которая, пожалуй, является лучшим выбором среди открытых весов для рабочих нагрузок агентов, интенсивно использующих поиск и инструменты, хотя разработку кода на уровне репозиториев она уступает GLM-5.2.

Одно предостережение касается как побед, так и поражений: почти все показатели конкурентов в приложении Tencent отмечены как полученные в ходе собственных тестовых прогонов компании. Независимая верификация такими индексами, как Artificial Analysis, на момент публикации еще не проведена.

Фактор надежности: уровень галлюцинаций снизился вдвое

Наиболее интересный для корпоративных покупателей аспект релиза — это набор показателей, которые Tencent предпочла выделить вместо бенчмарков. Карточка модели больше похожа не на анонс из таблицы лидеров, а на отчет о производственной надежности.

Согласно внутренним оценкам на сценариях из реального мира, уровень галлюцинаций Hy3 снизился по сравнению с превью-версией с 12,5% до 5,4%, а доля ошибок из-за нарушения здравого смысла упала с 25,4% до 12,7%. Улучшения объясняются детальной очисткой данных и ограничениями при обучении, выстроенными вокруг четкого поведенческого паттерна: отвечать при наличии подтверждений, указывать на отсутствие доказательств, не смешивать источники и не фабриковать данные. Многошаговое поведение претерпело те же изменения: частота проблем во внутренних тестах с многошаговыми диалогами снизилась с 17,4% до 7,9%, а результат модели в открытом бенчмарке длинных диалогов MRCR подскочил с 42,9% до 75,1%.

Tencent также подчеркивает стабильность работы на разных агентских каркасах, отмечая, что отклонения в SWE-bench составляют всего несколько пунктов независимо от того, запускается ли модель внутри сред в стиле Claude Code, Cline или KiloCode. Это недооцененное свойство: компании редко контролируют, на каком фреймворке стандартизируют работу их команды, и модель, функционирующая лишь в одной среде, несет в себе скрытые затраты на интеграцию. Все это — результаты внутренних измерений самой компании, и к ним следует относиться с тем же скептицизмом, что и к любым тестам от вендоров. Тем не менее, само решение вынести их на передний план говорит о том, кого Tencent видит своим клиентом: это команды, которые уже обожглись на моделях, демонстрирующих отличные результаты на презентациях, но уверенно выдающих вымысел в продакшене.

Математика развертывания: модель с 295 млрд параметров в мире 744 млрд — на кремнии, не попадающем под экспортные ограничения

История с надежностью напрямую связана с экономикой, и именно здесь разрыв в кодинге между Hy3 и GLM-5.2 начинает выглядеть как осознанный компромисс, а не как поражение.

GLM-5.2 — это модель MoE примерно с 744 миллиардами параметров и около 40 миллиардами активных параметров на токен. В формате FP8 одни лишь ее веса занимают около 744 ГБ, из-за чего узел с 8 ускорителями H200 становится практическим минимумом для промышленного обслуживания. Hy3 с ее 295 млрд общих параметров имеет объем в FP8 менее 300 ГБ — это менее половины требуемой памяти, при этом примерно половина активных параметров на токен обеспечивает меньшие вычисления на один запрос. Для организации, выбирающей решение для самостоятельного хостинга, это разница между одним сверхмощным узлом и чем-то гораздо более доступным, с запасом пространства под кэш KV и батчинг.

В руководстве по развертыванию есть и геополитический нюанс, на который стоит обратить внимание: рекомендуемая конфигурация обслуживания от Tencent ориентирована на чипы Nvidia H20-3e — вариант графического процессора H20 с расширенной памятью, разработанный Nvidia специально для соблюдения экспортных ограничений США в отношении Китая. В отличие от GLM-5.2, здесь нет упоминания чипов Huawei или Ascend. Иными словами, модель спроектирована так, чтобы восемь чипов, которые китайские компании могут легально приобрести, с комфортом обслуживали ее на полной точности.

Такой дизайн, продиктованный ограничениями, имеет приятный побочный эффект для всех остальных: модель, которая отлично работает на намеренно ограниченном «железе», будет чувствовать себя еще свободнее на чипах H100, H200 и B200, доступных в западных дата-центрах, при стандартном развертывании через vLLM и SGLang со спекулятивным декодированием MTP.

Если добавить к этому лицензию Apache 2.0 без региональных исключений и ограничений на сферы применения, корпоративное уравнение становится предельно ясным. GLM-5.2 остается выбором для открытых весов, когда производительность кодинга является единственным критерием и доступен бюджет на 8 чипов H200. Hy3 же проявляет себя во всем остальном: в поиске, агентских нагрузках с интенсивным использованием инструментов, приложениях с повышенными требованиями к надежности, а также в организациях, которым нужны возможности околофронтирного уровня без инфраструктуры фронтирного масштаба. Открытым остается вопрос: станут ли западные компании, теперь, когда барьер в виде лицензии снят, всерьез рассматривать модель от Tencent — или следующее обновление Artificial Analysis разрешит спор вокруг бенчмарков до того, как отделы закупок успеют принять решение.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.