Модель ERNIE-4.5-21B от Baidu демонстрирует превосходные результаты в логических рассуждениях

Модель ERNIE-4.5-21B от Baidu демонстрирует превосходные результаты в логических рассуждениях

Китайский поисковый гигант Baidu представил новое дополнение к своей серии крупномасштабных языковых моделей ERNIE 4.5: ERNIE-4.5-21B-A3B-Thinking. И хотя результаты тестирования модели в бенчмарках остаются ниже показателей ведущих американских разработок, таких как GPT-5 от OpenAI, Google Gemini 2.5 Pro или Claude Opus 4 от Anthropic, она тем не менее осуществляет рассуждения на базе языковой модели с впечатляющей эффективностью (задействуя всего 3 миллиарда из общего числа в 21 миллиард параметров на один токен ввода) и распространяется с открытым исходным кодом, что делает ее удачным выбором для организаций с ограниченным бюджетом или специфическими требованиями к владению и возможности кастомизации.

Параметры — это внутренние настройки, которые определяют поведение модели. Большее их количество обычно указывает на более мощную систему (по слухам, ранняя модель GPT-4 от OpenAI имела 1,8 триллиона параметров — компания эту информацию не подтверждала, но и не опровергала). Однако в последнее время лаборатории искусственного интеллекта всё активнее выжимают высокую производительность из <моделей с меньшим количеством параметров в стремлении снизить издержки как для себя, так и для клиентов, которые могут запускать эти модели.

Модель ERNIE-4.5-21B-A3B-Thinking теперь доступна на Hugging Face под дружественной для бизнеса лицензией Apache 2.0 (которая разрешает коммерческое использование). Она специально оптимизирована для задач продвинутого логического вывода, использования инструментов и работы с расширенным контекстом, что подчеркивает пристальное внимание к вызовам глубокого мышления для корпоративных клиентов и индивидуальных разработчиков.

В частности, по заявлению Baidu, модель Ernie-4.5-21B-A3B-Thinking ориентирована на решение задач повышенной сложности в таких областях, как логическое мышление, математика, наука и генерация кода.

Согласно данным Baidu, модель демонстрирует значительно улучшенную способность к рассуждениям по сравнению с предыдущими легковесными версиями ERNIE 4.5 (описанными в техническом документе по этому семейству моделей здесь), особенно в задачах, требующих логической дедукции, решения математических задач и структурированных академических умозаключений.

Эти улучшения стали результатом доработки после этапа обучения, которая включает в себя контролируемую точную настройку (supervised fine-ining) и обучение с подкреплением, разработанные специально для рабочих нагрузок, связанных с рассуждениями.

В модель также заложена улучшенная поддержка инструментов, включая работу со структурированными вызовами функций (function calling). Это открывает возможности для сценариев использования, где модели должны взаимодействовать с внешними инструментами или API — например, предоставлять прогноз погоды посредством вызова функции с заданными параметрами.

Легковесная модель для ресурсоемких задач

Хотя семейство ERNIE 4.5 включает в себя модели с общим числом параметров до 424 миллиардов, вариант 21B-A3B позиционируется как более доступное решение, обеспечивающее баланс между производительностью и эффективностью использования ресурсов.

На один токен активируется всего 3 миллиарда параметров, что делает эту модель более жизнеспособным кандидатом для организаций с ограниченными вычислительными мощностями.

Длина ее контекста составляет 128 000 токенов, что соответствует показателям флагманских моделей ИИ предыдущего поколения из американских лабораторий (GPT-5 теперь поддерживает до 256 000 или вдвое больше, в то время как Gemini, Qwen и другие лаборатории увеличили длину контекста некоторых моделей до одного миллиона токенов). Контекстное окно определяет объем информации, которым могут обмениваться пользователь и языковая модель за один сеанс ввода/вывода — оно измеряется в токенах, представляющих собой числовое выражение понятий, слов, частей слов и математических формул (по сути, «родной язык» LLM). Больший размер контекста означает возможность передачи большего объема информации. В данном случае это примерно эквивалентно 300-страничной книге.

Несмотря на относительно компактный размер по сравнению с флагманскими моделями линейки ERNIE, эта версия настроена на эффективное выполнение задач, требующих структурированного логического мышления.

Улучшения частично обусловлены этапом пост-тренировки, на котором модель дополнительно дорабатывается с помощью контролируемой тонкой настройки и обучения с подкреплением на наборах данных, ориентированных на логические выводы.

Важно отметить, что Baidu присвоила этому релизу пометку «thinking» (мышление), отделив его от версий без этой функции, которые могут быть ориентированы на более быстрый вывод или выполнение более простых задач.

Вариант с функцией «мышления» рекомендуется использовать в сценариях, где критически важны сложные пошаговые логические умозаключения, такие как решение сложных математических, научных, научно-исследовательских и опытно-конструкторских задач.

Достойные результаты бенчмарков

ERNIE-4.5-21B-A3B-Thinking демонстрирует впечатляющие результаты в ряде задач, требующих серьезных аналитических способностей, в частности получая 89.8 балла в ZebraLogic, 87.77 в BBH (Big-Bench Hard) и 86.5 в WritingBench — это тесты, которые требуют многоступенчатой логической обработки и структурированного мышления.

В тестах HumanEval+ и MBPP, двух широко используемых бенчмарках программирования, модель набирает более 90 и 80 баллов соответственно, что свидетельствует о её надежных возможностях синтеза кода и генерации функций.

ERNIE-4.5-21B-A3B-Thinking

График результатов тестирования, предоставленный Baidu.

В академических математических задачах (AIME2025) и научных тестах с вопросами и ответами (BFCL, MUSR) модель немного уступает Gemini 2.5 Pro, но остается конкурентоспособной.

Она лидирует в WritingBench и IF-Eval (Instruction Following Evaluation), подчеркивая свои сильные стороны в следовании структурированным промптам и генерации осмысленных ответов. Тем не менее, она показывает относительно более низкую производительность в ChineseSimpleQA, набирая 49.06 балла, что говорит об определенном компромиссе между специализацией на глубоких рассуждениях и общими многоязычными возможностями. Эти результаты отражают акцент Baidu на «мыслительных» задачах, где поддержка длинного контекста и архитектура маршрутизации экспертов приносят наибольшую пользу.

Развертывание и совместимость с экосистемой

Модель распространяется по лицензии Apache 2.0, что делает ее абсолютно доступной как для исследований, так и для коммерческого использования. Baidu опубликовала ее на платформах Hugging Face и GitHub с поддержкой развертывания через целый ряд популярных фреймворков:

  • FastDeploy, который поддерживает запуск модели всего на одном графическом процессоре с 80 ГБ памяти (версии 2.2 или выше)

  • vLLM, с находящимися в разработке парсерами, специфичными для логического вывода

  • Transformers 4.54.0+, включая полную поддержку токенизации и рабочих процессов генерации текста

Карточка модели, техническая документация и рекомендации по цитированию находятся в открытом доступе, а компания также предлагает репозиторий на GitHub с наборами инструментов для разработки.

Модель уже интегрирована в AnyCoderприложение с открытым исходным кодом для «вайб-кодинга», созданное руководителем отдела роста ML в Hugging Face Ахсеном Халиком (@_akhaliq в X).

Столь широкая совместимость позволяет исследователям и разработчикам внедрять модель в существующую инфраструктуру искусственного интеллекта без необходимости масштабной адаптации.

Для генерации ответов (инференса) пользователи могут взаимодействовать с моделью через REST API или пайплайны генерации на Python, включая поддержку вызова функций для получения структурированных результатов.

Архитектура и особенности дизайна

Модель ERNIE-4.5-21B-A3B-Thinking построена на архитектуре трансформеров, которая задействует 64 текстовых и 64 визуальных эксперта (по шесть каждого типа активируются на один токен).

Архитектура поддерживает маршрутизацию типа «Мэкспертная смесь» (Mixture-of-Experts) для эффективной специализации наряду со слоями плотного внимания (dense attention), которые облегчают кросс-модальное взаимодействие при использовании в более крупных мультимодальных системах.

Хотя данный конкретный вариант является чисто текстовым, он унаследовал модульную дизайн-концепцию всей системы ERNIE 4.5. Такой подход позволяет командам заменять или удалять модули, связанные с обработкой изображений, для более эффективного развертывания в чисто языковых приложениях.

Как и в случае с другими моделями ERNIE, обучение проводилось с использованием фреймворка глубокого обучения PaddlePaddle, что позволяет применять такие оптимизации, как обучение со смешанной точностью FP8 и квантование, удобное для инференса.

По данным Baidu, модели семейства ERNIE 4.5 способны обеспечивать высокопроизводительный инференс при относительно скромных системных требованиях. Например, самая крупная модель в линейке может достигать до 56 000 входных токенов в секунду (TPS) и 18 000 выходных TPS на узел при использовании четырех графических процессоров по 80 ГБ и 4-битного квантования.

Хотя модель 21B работает в меньших масштабах, она в полной мере использует те же инженерные оптимизации.

Реакция ИИ-сообщества

Судя по моим личным наблюдениям, реакция экспертов по искусственному интеллекту, исследователей и сотрудников сторонних компаний в X на новую модель Ernie 4.5 оказалась в основном положительной.

Пользователь Петри Куиттинен (@KuittinenPetri) отметил, что при наличии всего 3 миллиардов активных параметров она «оптимизирована для быстрого инференса» и создает «конкуренцию для Qwen3-30B-A3B-2507, которая была одной из самых экономичных моделей за всю историю».

Контент-стратег Кнут Егерсберг написал в X, что «она работает быстро: на моем скромном железе получается 90 токенов в секунду для 8-битного формата gguf».

Пользователь Гириш Лелуш (@girish_lelouch) назвал ее «настоящим тяжеловесом для решения сложных задач».

Стратегия открытого релиза

Baidu продолжает придерживаться политики открытого исходного кода в данном релизе, поощряя исследователей и разработчиков к экспериментам, адаптации и созданию надстроек на базе моделей ERNIE 4.5.

Этот шаг следует по стопам многих других ведущих китайских ИИ-лабораторий — от DeepSeek до Moonshot, Z.ai и принадлежащего Alibaba Qwen, которые также продвигают стратегию выпуска мощных моделей под открытыми лицензиями. Разработчики могут свободно брать, использовать, модифицировать и развертывать такие решения в противовес продуктам из США, которые зачастую являются платными и проприетарными (новые модели gpt-oss от OpenAI стали заметной попыткой американского лидера ИИ-индустрии побороться в этой категории, хотя первоначальная реакция на них оказалась неоднозначной).

Этим релизом Baidu позиционирует модель ERNIE-4.5-21B-A3B-Thinking как общедоступную высокопроизводительную языковую модель, нацеленную на исследователей, разработчиков ИИ и предприятия, решающие задачи с интенсивными логическими вычислениями или большой длиной контекста. Модель уже доступна для скачивания и развертывания.

Значение для лиц, принимающих технические решения на уровне предприятий

Появление ERNIE-4.5-21B-A3B-Thinking предлагает передовую альтернативу с открытым исходным кодом для организаций, стремящихся развернуть языковые модели, способные к глубоким рассуждениям и работе с расширенным контекстом.

Для инженеров по искусственному интеллекту, отвечающих за управление жизненным циклом языковых моделей, эта версия ERNIE представляет собой крайне привлекательный вариант, где легковесная архитектура сочетается с высокой производительностью рассуждений. Интеграция инструментов и 128-килобайтное контекстное окно открывают такие возможности, как многошаговые логические цепочки, анализ длинных документов и оркестрация вызовов функций — все это полезно для корпоративных приложений, начиная от автоматизации техподдержки и заканчивая внутренними системами RAG (поисково-дополненной генерации).

С точки зрения оркестрации платформ, совместимость модели с FastDeploy, Transformers и vLLM делает возможным ее интеграцию в существующие пайплайны, особенно в гибридных облачных средах, где критически важны модульное развертывание и тонкое планирование использования GPU. Для организаций, балансирующих между ограниченными инженерными ресурсами и растущими потребностями в развертывании моделей, ERNIE-4.5-21B-A3B-Thinking представляет собой решение, которое технически масштабируется без требования бюджетов флагманского класса.

Руководители отделов работы с данными и инфраструктурой могут найти модульный дизайн весьма выгодным. Архитектура модели поддерживает раздельное развертывание визуальных или текстовых экспертов, что упрощает тонкую настройку или удаление ненужных компонентов в зависимости от специфики корпоративных данных. Это позволяет более эффективно использовать аппаратные ресурсы, что особенно важно при попытке оптимизировать пропускную способность в условиях ограничений по памяти или вычислительной мощности.

Тем не менее, специалисты по безопасности и соблюдению нормативных требований также должны учитывать геополитические реалии. ERNIE-4.5 разработана Baidu — крупной китайской технологической компанией, и хотя модель распространяется по открытой лицензии Apache 2.0, ее развертывание (особенно в продуктивных средах) может вызвать внутренний или внешний скептицизм в некоторых регионах. Для предприятий из США и ЕС, в зависимости от политики организаций или отраслевых норм, могут существовать опасения относительно прозрачности цепочки поставок, скрытых зависимостей, стандартов национальной безопасности или связанных с этим рисков восприятия.

Такое напряжение не делает ERNIE непригодной к использованию, но делает ее применение политически сложным, особенно для компаний, работающих в чувствительных секторах (например, в оборонной промышленности, здравоохранении или финансах), сотрудничающих с государственными ведомствами или подпадающих под действие экспортного контроля.

В конечном счете решение о внедрении ERNIE-4.5-21B-A3B-Thinking не является чисто техническим. Его необходимо взвешивать в контексте гибкости развертывания, требований к производительности и толерантности к геополитическим рискам. Для команд, сосредоточенных на исследованиях, прототипировании или внутренних инструментах с ограниченной зоной риска, эта модель может стать мощным и экономически эффективным вариантом. Для производственных систем, обслуживающих регулируемые или высоконадежные среды, перед внедрением следует проконсультироваться с политиками управления рисками.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.