ИИ-модель ERNIE-4.5 от Baidu бросает вызов конкурентам
Baidu Inc., крупнейшая китайская поисковая система, в понедельник выпустила новую модель искусственного интеллекта. По словам ее разработчиков, новинка превосходит конкурентов от Google и OpenAI по ряду бенчмарков, связанных с обработкой визуальных данных, и при этом расходует лишь малую часть вычислительных ресурсов, обычно требуемых для таких систем.
Модель, получившая название ERNIE-4.5-VL-28B-A3B-Thinking, стала очередным шагом в усиливающейся конкурентной борьбе технологических компаний за создание ИИ-систем, способных понимать изображения, видео и документы наряду с традиционным текстом. Эти возможности становятся все более критически важными для корпоративных приложений — от автоматической обработки документов до промышленного контроля качества.
Главное отличие разработки Baidu — ее высокая эффективность: во время работы модель задействует всего 3 миллиарда параметров, сохраняя при этом общую сложность в 28 миллиардов параметров благодаря сложной архитектуре маршрутизации. Согласно технической документации, выпущенной вместе с моделью, такой подход позволяет ей соответствовать или превосходить показатели гораздо более крупных конкурирующих систем в задачах понимания документов, анализа графиков и визуального рассуждения, потребляя при этом значительно меньше вычислительной мощности и памяти.
«Созданная на базе мощной архитектуры ERNIE-4.5-VL-28B-A3B, недавно обновленная модель ERNIE-4.5-VL-28B-A3B-Thinking совершает значительный качественный скачок в возможностях мультимодального рассуждения», — написала компания Baidu в технической документации на платформе Hugging Face, где была опубликована модель.
В компании сообщили, что модель прошла «обширный этап промежуточного обучения», в ходе которого использовался «обширный и крайне разнообразный массив премиальных данных для визуально-языковых рассуждений», что кардинально повысило ее способность семантически сопоставлять визуальную и текстовую информацию.
Как модель имитирует решение визуальных задач человеком с помощью динамического анализа изображений
Пожалуй, самой отличительной особенностью модели является функция, которую Baidu называет «Мышление с помощью изображений» (Thinking with Images). Она позволяет искусственному интеллекту динамически приближать и отдалять фрагменты изображений для изучения мельчайших деталей, имитируя то, как люди подходят к решению задач визуального характера.
«Модель мыслит как человек, способный свободно приближать и отдалять изображения, чтобы уловить каждую деталь и выявить всю информацию», — говорится в описании модели. В сочетании с такими инструментами, как поиск по изображениям, эта функция, по заявлению Baidu, «резко повышает способность модели обрабатывать мелкие детали и работать с редко используемыми визуальными знаниями».
Этот подход знаменует собой отход от традиционных визуально-языковых моделей, которые обычно обрабатывают изображения с фиксированным разрешением. За счет динамического анализа система теоретически способна справляться со сценариями, требующими как широкого контекста, так и детальной проработки — например, при анализе сложных технических схем или обнаружении тонких дефектов в системе контроля качества на производстве.
Модель также поддерживает то, что Baidu описывает как расширенные возможности «визуального привязывания» (visual grounding) с «более точным сопоставлением и гибким выполнением инструкций, позволяя легко активировать функции привязки в сложных промышленных сценариях». Это открывает потенциальные возможности для применения в робототехнике, автоматизации складов и других сферах, где ИИ должен идентифицировать и находить конкретные объекты в визуальной среде.
Заявления Baidu о производительности вызывают вопросы в ожидании независимого тестирования
Утверждение Baidu о том, что модель превосходит Gemini 2.5 Pro от Google и GPT-5-High от OpenAI в различных бенчмарках понимания документов и графиков, привлекло большое внимание в социальных сетях, хотя независимая проверка этих заявлений еще не проведена.
Компания выпустила модель на условиях мягкой лицензии Apache 2.0, разрешающей ее свободное коммерческое использование. Это стратегическое решение контрастирует с более ограничительными подходами некоторых конкурентов и может ускорить внедрение модели в корпоративном секторе.
«Apache 2.0 — это разумно», — написал один из пользователей X (бывший Twitter) в ответ на анонс Baidu, подчеркнув конкурентное преимущество открытого лицензирования на корпоративном рынке.
Согласно документации Baidu, модель демонстрирует шесть ключевых возможностей, выходящих за рамки традиционной обработки текста. В области визуального рассуждения система способна выполнять то, что Baidu называет «многошаговыми рассуждениями, анализом графиков и причинно-следственным анализом в сложных визуальных задачах», чему способствует «масштабное обучение с подкреплением».
В задачах из области точных наук, технологий, инженерии и математики (STEM) Baidu заявляет, что «благодаря мощным визуальным способностям модель совершает скачок в производительности при решении STEM-задач, таких как разбор задач по фотографиям». Функция визуального привязывания позволяет модели идентифицировать и находить объекты на изображениях с точностью промышленного уровня. Благодаря интеграции инструментов система может вызывать внешние функции, включая поиск по изображениям, для получения информации за пределами обучающей выборки.
Что касается понимания видео, Baidu утверждает, что модель обладает «выдающейся временной чувствительностью и способностью локализации событий, точно определяя изменения контента в различных временных сегментах видео». Наконец, функция «мышления с помощью изображений» обеспечивает динамическое масштабирование, отличающее эту модель от конкурентов.
Анатомия Mixture-of-Experts: архитектура, обеспечивающая эффективную мультимодальную обработку
Под капотом ERNIE-4.5-VL-28B-A3B-Thinking используется архитектура «Смесь экспертов» (Mixture-of-Experts, MoE) — шаблон проектирования, который становится все более популярным для создания эффективных крупномасштабных систем ИИ. Вместо задействования всех 28 миллиардов параметров для каждой задачи, модель использует механизм маршрутизации для выборочной активации только тех 3 миллиардов параметров, которые наиболее релевантны конкретному вводу.
Этот подход дает существенные практические преимущества для корпоративного развертывания. Согласно документации Baidu, модель может работать на одном графическом процессоре с 80 ГБ памяти — оборудовании, которое легко доступно во многих корпоративных дата-центрах. Это делает ее значительно более доступной по сравнению с конкурирующими системами, которым может потребоваться несколько высокопроизводительных ускорителей.
Из технической документации следует, что для реализации возможностей модели Baidu применила несколько передовых методов обучения. Компания использовала «передовые методы мультимодального обучения с подкреплением на проверяемых задачах, интегрируя стратегии GSPO и IcePop для стабилизации обучения MoE в сочетании с динамической выборкой сложности для исключительной эффективности обучения».
В Baidu также отмечают, что в ответ на «высокий спрос со стороны сообщества» компания «значительно улучшила показатели точности привязки (grounding) модели, расширив возможности следования инструкциям».
Новая модель в амбициозной мультимодальной экосистеме ИИ от Baidu
Новый релиз является частью более широкого семейства моделей ERNIE 4.5, представленного компанией в июне 2025 года. Семейство включает 10 различных вариантов, в том числе модели типа Mixture-of-Experts: от флагманской ERNIE-4.5-VL-424B-A47B с 424 миллиардами общих параметров до компактной плотной модели на 0,3 миллиарда параметров.
Согласно техническому отчету Baidu о семействе ERNIE 4.5, модели включают «новую гетерогенную модальную структуру, которая поддерживает совместное использование параметров между модальностями, а также выделение специализированных параметров для каждой отдельной модальности».
Этот архитектурный выбор решает давнюю проблему разработки мультимодального ИИ: обучение систем как на визуальных, так и на текстовых данных без ухудшения производительности одной модальности за счет другой. По утверждению Baidu, такое решение «дает преимущество в виде улучшения мультимодального понимания без ущерба (и даже с повышением) для производительности в задачах, связанных с текстом».
Компания сообщила о достижении 47% утилизации FLOPs модели (MFU) — показателя эффективности обучения — в ходе предварительного обучения своей крупнейшей языковой модели ERNIE 4.5 с использованием собственной среды глубокого обучения PaddlePaddle.
Комплексные инструменты разработчика призваны упростить корпоративное развертывание и интеграцию
Для организаций, планирующих внедрение модели, Baidu выпустила полный набор инструментов разработки через ERNIEKit — комплекс для обучения и сжатия промышленного уровня, как его описывает сама компания.
Модель обеспечивает полную совместимость с популярными открытыми фреймворками, включая Hugging Face Transformers, vLLM (высокопроизводительный движок инференса) и собственный набор инструментов FastDeploy от Baidu. Такая мультиплатформенная поддержка может сыграть решающую роль в корпоративном принятии технологий, позволяя организациям интегрировать модель в существующую инфраструктуру ИИ без масштабной перестройки платформ.
Пример кода, опубликованный Baidu, демонстрирует относительно простой путь реализации. Согласно документации на Hugging Face, используя библиотеку Transformers, разработчики могут загрузить и запустить модель примерно с помощью 30 строк кода на Python.
Для производственных сред, требующих высокой пропускной способности, Baidu предоставляет интеграцию с vLLM со специальной поддержкой возможностей «парсера рассуждений» (reasoning-parser) и «парсера вызовов инструментов» (tool-call-parser) — функций, которые обеспечивают динамическое изучение изображений и интеграцию внешних инструментов, отличающих эту модель от предшественников.
Компания также предлагает FastDeploy — проприетарный инструментарий инференса, который, по заявлениям Baidu, обеспечивает «готовые к продакшену, простые в использовании решения для развертывания на различном «железе» с поддержкой различных схем квантования, способных снизить требования к памяти и повысить скорость инференса.
Почему этот релиз важен для рынка корпоративного ИИ в момент переломного периода
Релиз происходит в ключевой момент для рынка корпоративного ИИ. По мере того как организации переходят от экспериментального развертывания чат-ботов к производственным системам, обрабатывающим документы, анализирующим визуальные данные и автоматизирующим сложные рабочие процессы, спрос на мощные и экономичные визуально-языковые модели значительно вырос.
Ряд корпоративных сценариев использования кажется особенно подходящим для возможностей модели. Обработка документов — извлечение информации из счетов, контрактов и форм — представляет собой огромный рынок, где точное понимание диаграмм и таблиц напрямую ведет к сокращению расходов за счет автоматизации. Контроль качества на производстве, где системы ИИ должны обнаруживать визуальные дефекты, может выиграть от функций привязки модели. Приложения для обслуживания клиентов, обрабатывающие изображения от пользователей, могут задействовать многошаговые визуальные рассуждения.
Эффективность модели может оказаться особенно привлекательной для компаний среднего бизнеса и стартапов, у которых нет бюджетов на ИИ уровня крупных технологических гигантов. Возможность работы на одном графическом процессоре с 80 ГБ памяти (оборудование стоимостью примерно от 10 000 до 30 000 долларов в зависимости от модели) делает систему экономически жизнеспособной для гораздо более широкого круга организаций по сравнению с решениями, требующими многопроцессорных конфигураций стоимостью в сотни тысяч долларов.
«При появлении всех этих новых моделей — где лучше всего их реально развертывать и масштабировать? Доступ к вычислительным мощностям — это все», — написал один из пользователей X в ответ на анонс Baidu, подчеркнув постоянные проблемы с инфраструктурой, с которыми сталкиваются организации, пытающиеся развернуть передовые системы ИИ.
Лицензия Apache 2.0 дополнительно снижает барьеры для внедрения. В отличие от моделей, выпускаемых под более строгими лицензиями, которые могут ограничивать коммерческое использование или требовать разделения доходов, организации могут развертывать ERNIE-4.5-VL-28B-A3B-Thinking в промышленных приложениях без регулярных лицензионных сборов и ограничений на использование.
Конкуренция накаляется: китайский техгигант бросает вызов Google и OpenAI
Релиз Baidu усиливает конкуренцию в сегменте визуально-языковых моделей, где свои мощные системы за последние месяцы представили Google, OpenAI, Anthropic, а также китайские компании, включая Alibaba и ByteDance.
Заявления компании о производительности — если они подтвердятся независимым тестированием — станут значительным достижением. Gemini 2.5 Pro от Google и GPT-5-High от OpenAI — это значительно более крупные модели, за которыми стоят глубокие ресурсы двух самых дорогих технологических компаний мира. Тот факт, что более компактная и открытая модель может соответствовать их уровню или превосходить его в конкретных задачах, свидетельствует о том, что отрасль развивается быстрее, чем ожидали некоторые аналитики.
«Впечатляет, что ERNIE превосходит Gemini 2.5 Pro», — написал один из комментаторов в социальных сетях, выразив удивление по поводу заявленных результатов.
Тем не менее, некоторые наблюдатели призывают с осторожностью относиться к результатам бенчмарков. «Увлекательно наблюдать за эволюцией мультимодальных моделей, особенно с такими функциями, как «Мышление с помощью изображений», — написал пользователь X. — При этом мне любопытно, заключается ли превосходство ERNIE-4.5 над конкурентами вроде Gemini-2.5-Pro и GPT-5-High именно в специфических сценариях использования, таких как понимание документов и графиков, а не в задачах общего компьютерного зрения».
Отраслевые аналитики отмечают, что показатели в бенчмарках часто не отражают поведение систем в реальных условиях в разнообразных сценариях, с которыми сталкиваются компании. Модель, преуспевающая в понимании документов, может испытывать трудности с творческими визуальными задачами или анализом видео в реальном времени. Организации, оценивающие такие системы, как правило, проводят масштабное внутреннее тестирование на репрезентативных рабочих нагрузках, прежде чем принять решение о внедрении в продакшен.
Технические ограничения и требования к инфраструктуре, которые необходимо учитывать компаниям
Несмотря на свои возможности, модель сталкивается с рядом технических проблем, характерных для крупных визуально-языковых систем. Минимальное требование в 80 ГБ видеопамяти, хотя и более доступно по сравнению с некоторыми конкурентами, все же представляет собой значительные инвестиции в инфраструктуру. Организациям, у которых нет готовой GPU-инфраструктуры, придется закупать специализированное «железо» или полагаться на облачные сервисы, что влечет за собой постоянные операционные расходы.
Контекстное окно модели — объем текстовой и визуальной информации, которую она может обрабатывать одновременно — в документации Baidu указано на уровне 128K токенов. Хотя это существенный объем, в некоторых сценариях обработки документов, включающих очень длинные технические руководства или обширный видеоконтент, этого может оказаться недостаточно.
Остаются вопросы и к поведению модели при столкновении с состязательными (adversarial) примерами, данными вне распределения и пограничными случаями (edge cases). Документация Baidu не содержит подробной информации о тестировании на безопасность, снижении предвзятости или режимах сбоев — аспектах, которые становятся все более важными для корпоративных внедрений, где ошибки могут иметь финансовые последствия или угрожать безопасности.
Что нужно оценить техническим директорам помимо цифр из бенчмарков
При оценке модели техническим специалистам стоит учесть несколько факторов реализации, выходящих за рамки чистых метрик производительности.
Хотя архитектура MoE модели эффективна во время инференса, она добавляет сложности при развертывании и оптимизации. Организации должны убедиться, что их инфраструктура способна корректно маршрутизировать входящие данные к соответствующим экспертным подсетям — эта функция поддерживается далеко не на всех платформах развертывания.
Функция «Мышление с помощью изображений», при всей своей инновационности, требует интеграции с инструментами манипулирования изображениями для раскрытия своего полного потенциала. Документация Baidu намекает, что эта возможность работает лучше всего «в сочетании с такими инструментами, как масштабирование и поиск по изображениям», что подразумевает необходимость создания дополнительной инфраструктуры для полноценного использования функции.
Возможности понимания видео, подчеркиваемые в маркетинговых материалах, имеют практические ограничения. Обработка видео требует значительно больше вычислительных ресурсов, чем статические изображения, а в документации не указаны максимальная длина видео или оптимальная частота кадров.
Организациям, рассматривающим внедрение, также следует оценить приверженность Baidu дальнейшей поддержке модели. ИИ с открытым исходным кодом требует постоянного обслуживания, обновлений безопасности и возможной переподготовки по мере изменения распределения данных. Хотя лицензия Apache 2.0 гарантирует сохранение доступности модели, будущие улучшения и поддержка зависят от стратегических приоритетов Baidu.
Реакция сообщества разработчиков: энтузиазм, сбалансированный практичными запросами
Первая реакция со стороны сообщества разработчиков и исследователей ИИ оказалась осторожно оптимистичной. Разработчики запросили версии модели в дополнительных форматах, включая GGUF (формат квантования, популярный для локального запуска) и MNN (фреймворк мобильных нейросетей), что говорит об интересе к запуску системы на устройствах с ограниченными ресурсами.
«Выпустите MNN и GGUF, чтобы я мог запустить ее на своем телефоне», — написал один из разработчиков, подчеркивая спрос на варианты для мобильного развертывания.
Другие разработчики похвалили технический выбор Baidu, запросив дополнительные ресурсы. «Фантастическая модель! Вы использовали наработки из PaddleOCR?» — поинтересовался один из пользователей, имея в виду инструментарий оптического распознавания текста от Baidu с открытым исходным кодом.
Длинное название модели — ERNIE-4.5-VL-28B-A3B-Thinking — вызвало шутливые комментарии. «ERNIE-4.5-VL-28B-A3B-Thinking, пожалуй, самое длинное название модели в истории», — пошутил один из наблюдателей. — Но эй, если вы превосходите Gemini-2.5-Pro всего с 3 млрд активных параметров, вы заслужили право на драматичное имя!»
Baidu планирует продемонстрировать линейку ERNIE в ходе своей ежегодной конференции Baidu World 2025 13 ноября, где компания рассчитывает предоставить дополнительные подробности о разработке модели, валидации ее производительности и дальнейших планах.
Этот релиз знаменует собой стратегический шаг Baidu по закреплению в статусе крупного игрока на мировом рынке инфраструктуры ИИ. Хотя китайские ИИ-компании исторически ориентировались в основном на внутренний рынок, выпуск модели с открытым исходным кодом по мягкой лицензии свидетельствует об амбициях конкурировать на международной арене с западными гигантами.
Для бизнеса данный выпуск добавляет еще один эффективный вариант в быстро расширяющийся список ИИ-моделей. Организации больше не сталкиваются с дилеммой выбора между созданием проприетарных систем и покупкой лицензий на закрытые модели у ограниченного круга вендоров. Распространение качественных альтернатив с открытым исходным кодом, таких как ERNIE-4.5-VL-28B-A3B-Thinking, меняет экономику внедрения ИИ и ускоряет его распространение в самых разных отраслях.
Оправдает ли модель свои обещания по производительности в реальных условиях эксплуатации, еще предстоит выяснить. Но для организаций, ищущих мощные и экономичные инструменты для визуального понимания и рассуждений, одно можно сказать наверняка. Как лаконично подытожил один из разработчиков: «Открытый код плюс коммерческое использование равно восторг. Baidu не шутит».



