Модель Qwen3-Next LLM от Alibaba повышает эффективность

Модель Qwen3-Next LLM от Alibaba повышает эффективность

DeepSeek, кто это?

Когда речь заходит о китайских ИИ-стартапах, команда исследователей искусственного интеллекта Qwen из Alibaba продолжает уверенно двигаться вперед, выпуская мощные, передовые открытые большие языковые языковые модели (LLM), доступные практически всем предприятиям и исследователям по всему миру, которые хотят использовать их, модифицировать или применять в коммерческой деятельности в первозданном виде — и всё это абсолютно бесплатно.

Последней новинкой стал Qwen3-Next — новая пара LLM, представленная исследователями на этой неделе вслед за громким летом релизов множества новых моделей с открытым исходным кодом, которые приближаются по производительности к американским лидерам — OpenAI, Google, Anthropic и другим, но стоят лишь малую долю от их цены и предоставляют гораздо больше контроля и возможностей для предприятий и разработчиков.

Релиз Qwen3-Next включает в себя два варианта после дообучения (post-trained) — Instruct и Thinking, — оба распространяются по либеральной лицензии Apache 2.0, доступны на Hugging Face, а также напрямую через Qwen Chat (конкурента ChatGPT/Claude).

Передовые новые методы машинного обучения

Но Qwen3-Next примечателен по нескольким причинам: он знаменует собой первый отход команды от более ранней архитектуры Qwen3 и представляет собой гибридный дизайн, сочетающий Gated DeltaNet и Gated Attention.

Первый метод можно представить как «быстрого читателя». Вместо того чтобы перечитывать всё слово за словом, он постепенно обновляет свое понимание по мере поступления нового текста. Это делает его гораздо более эффективным при работе с очень длинными фрагментами. В Qwen3-Next около трех четвертей слоев модели используют именно этот ускоренный стиль обработки.

Между тем, второй метод, Gated Attention, выполняет роль «внимательного проверяющего». В нем используется более традиционный подход, который более детально исследует связи между словами. Исследователи Qwen добавили шлюз (gate), который помогает отфильтровывать шум, делая этот процесс более стабильным и точным, особенно при решении сложных задач на логику. Этoт метод используется лишь примерно в четверти слоев, поэтому модель не сильно замедляется в работе.

Благодаря объединению этих двух подходов Qwen3-Next позволяет избежать недостатков крайностей. Если бы модель использовала только быстрый метод, она могла бы упустить важные детали; если бы использовался только внимательный метод, она работала бы слишком медленно на длинных документах. Вместе этот гибрид наделяет модель как скоростью, так и точностью извлечения информации.

Исследователь Qwen Джуньян Лин (объяснил в X), что команда экспериментировала с гибридными моделями и линейным вниманием около года, описав этот процесс как «множество проб и ошибок», и отметив, что шлюз внимания оказался «словно бесплатным бонусом, приносящим пользу».

Разреженная, эффективная и более доступная

Qwen3-Next также продвигает концепцию разреженности (sparsity) еще дальше, активируя всего 3 миллиарда из своих 80 миллиардов параметров на один токен.

Токен — это базовая единица языка для модели: это может быть целое слово, часть слова, число или даже фрагмент кода. Представьте себе это как алфавит, на котором модель «читает» и «пишет».

Параметры, напротив, представляют собой внутренние переключатели и веса модели, которые определяют, как она интерпретирует эти токены и решает, что сказать дальше. Как правило, большее количество параметров означает более мощную модель. Однако разработка Qwen доказывает, что включать их все одновременно необязательно.

Фактически, за счет сокращения количества параметров, необходимых для обработки любого входящего или исходящего токена, Qwen достигает гораздо более высокой эффективности, снижая требования к энергии и вычислительным мощностям (и, соответственно, затраты), необходимые для работы модели.

Лин признал высокие затраты на тестирование таких архитектур, требующих полноценного предварительного обучения и обучения с подкреплением, но подчеркнул, что команда доказала их работоспособность: «Мы проводим эксперименты с гибридными моделями и линейным вниманием уже около года. Мы уверены, что наше решение должно стать стабильным и надежным фундаментом для новой архитектуры моделей с супердлинным контекстом».

Вдобавок к этому модели поддерживают нативное окно контекста в 256 000 токенов, что сопоставимо с OpenAI GPT-5 или 600–800-страничным романом по объему информации, которую можно передать за один сеанс ввода/вывода с пользователем; при этом с помощью методов масштабирования RoPE валидация простирается вплоть до 1 миллиона токенов.

Еще одним отличительным фактором является ценообразование. На Alibaba Cloud тарифы за миллион токенов составляют $0.5/$6 (ввод/вывод) для варианта с рассуждениями и $0.5/$2 — для варианта без рассуждений. Это означает снижение стоимости как минимум на 25% по сравнению с Qwen3-235B, что делает Qwen3-Next не только более эффективным в обучении и работе, но и более дешевым для развертывания в больших масштабах.

Модели уже доступны через Hugging Face, ModelScope, Kaggle и Alibaba Cloud.

Разреженная, но стабильная архитектура «Смесь экспертов» (MoE)

Qwen3-Next использует ультраразреженную структуру MoE, увеличивая количество экспертов до 512 по сравнению со 128 у Qwen3.

Десять маршрутизируемых экспертов плюс один общий эксперт обеспечивают баланс между вычислительной эффективностью и производительностью.

Такая конфигурация неуклонно снижает потери при обучении (training loss), сохраняя при этом стабильные результаты.

Команда особо отмечает ряд корректировок, направленных на повышение стабильности обучения. В Qwen3-Next метод QK-Norm заменен на Zero-Centered RMSNorm, а к весам нормализации применяется затухание весов (weight decay). Маршрутизаторы MoE нормализуются во время инициализации во избежание преждевременного смещения при выборе экспертов. Эти изменения помогают делать как мелкомасштабные эксперименты, так и масштабные тренировочные запуски более надежными.

Еще одной особенностью является нативное многотокеновое прогнозирование (multi-token prediction, MTP), предназначенное для поддержки спекулятивного декодирования с более высокими коэффициентами принятия. Оптимизации для многошагового инференса дополнительно повышают эффективность декодирования в реальных условиях.

Прирост производительности

Базовая модель Qwen3-Next-80B-A3B активирует лишь малую часть своих параметров во время инференса, однако превосходит Qwen3-32B на большинстве бенчмарков.

Подчеркивается эффективность обучения: новая модель была обучена на 15 триллионах токенов (подмножество из 36 триллионов токенов корпуса Qwen3) с использованием менее 10% вычислительных затрат, необходимых для Qwen3-32B.

В инференсе Qwen3-Next демонстрирует значительное увеличение скорости. При длине контекста от 32 000 токенов и выше пропускная способность более чем в 10 раз превышает показатели Qwen3-32B как на этапе подготовки (prefill), так и на этапе декодирования.

В задачах на рассуждение и программирование Qwen3-Next показывает конкурентоспособные или превосходящие результаты. Модель Qwen3-Next-80B-A3B-Thinking превосходит Qwen3-30B-A3B-Thinking и Qwen3-32B-Thinking, а также обходит закрытую модель Gemini-2.5-Flash-Thinking по ряду бенчмарков.

Вариант Instruct приближается по своим возможностям к флагманской модели Qwen3 с 235 миллиардами параметров в сценариях с длинным контекстом, изначально обрабатывая до 256 000 токенов и проходя валидацию до 1 миллиона токенов с использованием методов масштабирования.

Независимые бенчмарки подтверждают достижения Qwen. По данным сторонней компании по оценке ИИ Artificial Analysis, ориентированный на рассуждения вариант Qwen3-Next набирает 54 балла в индексе Artificial Analysis Intelligence Index, что ставит его в один ряд с DeepSeek V3.1 (Reasoning) по уровню интеллекта, но при значительно меньшем количестве активных параметров.

Версия без рассуждений набирает 45 баллов, что находится на одном уровне с такими моделями, как gpt-oss-20B и Llama Nemotron Super 49B v1.5.

В Artificial Analysis также отмечают, что модели являются исключительно текстовыми и не поддерживают мультимодальные возможности. Тем не менее, при 80 миллиардах параметров в точности FP8 они могут поместиться на одном графическом процессоре Nvidia H200 — это большая победа в плане доступности для предприятий и лабораторий, не обладающих массивными вычислительными кластерами.

Доступ для разработчиков и лицензирование

И Qwen3-Next-80B-A3B-Instruct, и Qwen3-Next-80B-A3B-Thinking выпускаются под лицензией Apache 2.0, предоставляющей широкие права на модификацию и коммерческое использование.

Они интегрированы в Hugging Face Transformers и поддерживаются такими фреймворками для инференса, как SGLang и vLLM, каждый из которых обеспечивает поддержку эндпоинтов API, совместимых с OpenAI.

Команда Qwen также подчеркивает интеграцию с Qwen-Agent, что упрощает использование инструментов в приложениях.

Взгляд в будущее

Qwen3-Next знаменует собой поворот в сторону архитектур, разработанных одновременно для эффективности и масштабируемости.

Сокращая количество активных параметров и оптимизируя работу с длинным контекстом, команда Qwen позиционирует этот релиз как практический шаг вперед для разработчиков.

Уже запланирована работа над Qwen3.5, цель которой — развить эту архитектуру для достижения еще более высоких уровней производительности и эффективности.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.