Открытые модели Xiaomi MiMo-V2.5 и V2.5-Pro входят в число самых эффективных (и доступных) для агентных задач типа «claw»
Источник: VentureBeat · Carl Franzen
Xiaomi, китайская компания, наиболее известная своими смартфонами и электромобилями, в последнее время поставляет на рынок невероятно доступные и высокопроизводительные большие языковые модели с открытым исходным кодом в области искусственного интеллекта.
Эта тенденция продолжилась сегодня с выпуском Xiaomi MiMo-V2.5 и Xiaomi MiMo-V2.5-Pro, обе из которых доступны на условиях мягкой, дружественной к бизнесу лицензии MIT, что делает их пригодными для использования в продакшене в коммерческих приложениях. Предприятия и индивидуальные/независимые разработчики теперь могут загрузить любую из этих моделей (а также другие варианты с открытым исходным кодом от Xiaomi) напрямую с Hugging Face, изменять их по своему усмотрению и запускать локально или на виртуальных частных серверах.
Самым примечательным свойством этих моделей, помимо лицензирования с открытым исходным кодом, является то, что, согласно опубликованным тестам Xiaomi, они входят в число наиболее эффективных среди доступных для агентских «claw»-задач (задач управления через агентов). То есть для питания таких систем, как OpenClaw, NanoClaw и Hermes Agent, в которых пользователи могут напрямую общаться с ними через сторонние мессенджеры, поручая агентам выполнять задачи от имени человека — например, создавать и публиковать маркетинговый контент, управлять аккаунтами, организовывать электронную почту, составлять расписание и т. д.
Сравнительная диаграмма бенчмарка ClawEval для Xiaomi MiMo-V2.5-Pro и MiMo-V2.5. Источник: Xiaomi
Как показывает диаграмма бенчмарка ClawEval от Xiaomi, и MiMo-V2.5, и особенно версия Pro находятся в левом верхнем углу графика, что указывает на высокую производительность при выполнении протестированных агентских задач с наименьшим количеством токенов. Это позволяет экономить деньги пользователей, особенно в мире, где все больше сервисов, таких как GitHub Copilot от Microsoft, переходят на тарификацию по факту использования (взимая с человека, стоящего за агентами, плату за каждый использованный токен вместо введения ограничений по скорости, как у Anthropic, или предоставления безлимитной подписки «все включено», как у OpenAI).
Фактически, модель Pro лидирует в сегменте открытого исходного кода с показателем успешности 63,8%, потребляя всего около 70 тыс. токенов на траекторию.
Это примерно на 40–60% меньше токенов, чем требуется моделям Anthropic Claude Opus 4.6, Google Gemini 3.1 Pro и OpenAI GPT-5.4 для достижения сопоставимых результатов.
Сочетая массивную архитектуру с 310 миллиардами параметров, высокоэффективный «активный» след и встроенное окно контекста на 1 миллион токенов, Xiaomi MiMo бросает вызов доминированию проприетарных передовых моделей от Google и OpenAI, особенно когда речь заходит о последнем и самом популярном тренде в развертывании корпоративного ИИ — агентских задачах и системах управления вроде OpenClaw.
Двусторонний охват
Xiaomi выпустила две разные версии модели для различных потребностей разработки: MiMo-V2.5 (мультимодальный специалист «Omni») и MiMo-V2.5-Pro (специалист по «агентам»).
В то время как базовая модель обеспечивает нативную мультимодальность, MiMo-V2.5-Pro специально разработана для «долгосрочной когерентности» и сложной разработки программного обеспечения.
В бенчмарке GDPVal-AA (Elo) модель Pro набрала 1581 балл, превзойдя таких конкурентов, как Kimi K2.6 и GLM 5.1.
Сравнительная таблица бенчмарков Xiaomi MiMo-V2.5 Pro. Источник: Xiaomi
Исследователи Xiaomi также опубликовали данные о нескольких высокосложных задачах, выполненных V2.5-Pro автономно:
-
Компилятор SysY на Rust: модель реализовала полный компилятор с нуля (включая лексер, парсер и бэкенд ассемблера RISC-V) за 4,3 часа. Сделав 672 вызова инструментов, модель получила идеальный результат 233/233 балла на скрытых тестовых наборах — задачу, на которую у студента компьютерных специальностей обычно уходит несколько недель.
-
Полнофункциональный видеоредактор: за 11,5 часов и 1868 вызовов инструментов модель создала настольное приложение на 8192 строки кода с многодорожечной шкалой времени и конвейером экспорта.
-
Аналоговая оптимизация EDA: в инженерной задаче уровня аспирантуры модель оптимизировала регулятор FVF-LDO (Flipped-Voltage-Follower) по техпроцессу TSMC 180 нм. Итеративно проходя через цикл симуляции ngspice, модель улучшила такие показатели, как регулирование по линии, в 22 раза по сравнению с первой попыткой.
Эти эксперименты подчеркивают «осведомленность об инфраструктуре» (harness awareness) у V2.5-Pro, при которой модель активно управляет собственной памятью и формирует контекст для поддержания когерентности на протяжении тысяч последовательных вызовов инструментов.
Через API Xiaomi предлагает модели по конкурентоспособным ценам как для внутреннего (китайского), так и для международных рынков (например, США). Для зарубежных разработчиков высокопроизводительная MiMo-V2.5-Pro стоит $1,00 за миллион входных токенов (при промахе кэша) и $3,00 за выходные в пределах контекстных окон до 256 тыс.
Для задач со сверхдлинным контекстом от 256 тыс. до 1 млн токенов стоимость удваивается до $2,00 за входные и $6,00 за выходные токены, хотя возможности кэширования архитектуры обеспечивают значительную экономию, снижая затраты на ввод до $0,20–$0,40 за миллион токенов при попадании в кэш.
На внутреннем рынке эти расценки отражены в юанях: модель Pro стоит от 7,00 юаней за миллион входных токенов для стандартного контекста и достигает 14,00 юаней для расширенного диапазона в 1 млн. Между тем, базовая модель стоит от $0,40 США для зарубежного ввода за миллион токенов и $2,00 за миллион вывода, что ставит ее в число наиболее доступных передовых LLM в мире (см. наш график ниже):
Чтобы еще больше снизить барьер для разработки агентов, Xiaomi сделала запись в кэш бесплатной на ограниченное время для всех моделей, а также полностью отменила плату за весь комплект MiMo-V2.5-TTS, который включает в себя специализированные функции клонирования и дизайна голоса.
Такая ценовая политика явно призвана ускорить переход от простых чат-приложений к постоянным долгосрочным агентам, которые могут работать за долю от стоимости устаревших передовых моделей.
Xiaomi также представила переработанную версию своих тарифных планов под названием «Token Plan», которая теперь доступна на четырех уровнях:
-
Пакет Lite «Starter Pack» предоставляет 720 миллионов кредитов за $63,36 США в год
-
Стандартный уровень предлагает 2,4 миллиарда кредитов за $168,96 в год
-
Уровень Pro предоставляет 8,4 миллиарда кредитов за $528,00 в год (предназначен для корпоративных сценариев использования)
-
Max — нацеленный на энтузиастов интенсивного кодинга — предоставляет 19,2 миллиарда кредитов за $1056,00 в год
Помимо выделенных кредитов, все планы включают льготные тарифы API, 20% скидку на звонки в часы наименьшей нагрузки и поддержку «Day-0» для популярных сред разработки, таких как Cursor, Zed и Claude Code.
Тем не менее, как через API, так и через Token Plan, доступ к моделям Xiaomi из Китая может создавать препятствия или дополнительные риски в области комплаенса и регулирования для корпоративных клиентов из США. Таким образом, лучшим выбором для американских компаний, опасающихся зависимости от китайских технологий, но желающих воспользоваться преимуществами недорогих моделей с открытым исходным кодом, вероятно, станет развертывание собственных виртуальных частных облаков или локальных серверов, загрузка весов моделей и их запуск внутри страны.
Архитектура MoE, но различные режимы обучения для V2.5 и V2.5-Pro
В сердце MiMo-V2.5 лежит архитектура со разреженной смесью экспертов (Sparse Mixture-of-Experts, MoE). Хотя модель может похвастаться общим количеством в 310 миллиардов параметров, в любом конкретном цикле инференса «активными» являются только 15 миллиардов.
Между тем, V2.5-Pro представляет собой модель Mixture-of-Experts с 1,02 триллиона параметров и 42 миллиардами активных параметров.
В любом случае этот дизайн работает во многом подобно специализированной исследовательской больнице: хотя в учреждении сотни врачей (параметров), в палату вызывают только тех конкретных специалистов, которые необходимы для конкретного случая (запроса).
Столь масштабное увеличение объема параметров для версии Pro обеспечивает «нейронную емкость», необходимую для глубоких многоэтапных рассуждений, встречающихся в сложной разработке программного обеспечения и долгосрочных задачах, как если бы в еще более крупной больнице было доступно больше специалистов.
Согласно публикации в блоге Xiaomi, обычная модель V2.5 проходит строгий пятиэтапный эволюционный процесс:
-
Предварительное обучение текста: создание массивной языковой основы на 48 триллионах токенов.
-
Разогрев проектора: согласование собственных аудио- и визуальных энкодеров с языковым ядром.
-
Мультимодальное предварительное обучение: масштабирование на основе высококачественных кросс-модальных данных.
-
Агентское пост-обучение: поэтапное расширение контекстного окна с 32 тыс. до 1 млн токенов.
-
RL и MOPD: использование обучения с подкреплением (RL) и мультимодальной оптимизации предпочтений (MOPD) для улучшения реальных рассуждений и восприятия.
В основе лежит гибридная архитектура внимания со скользящим окном, унаследованная от MiMo-V2-Flash, которая оптимизирует то, как модель «помнит» информацию на больших расстояниях. Эта техническая основа позволяет MiMo-V2.5 видеть, слышать и рассуждать нативно, не полагаясь на внешние инструменты «плагины» для визуальной или слуховой обработки.
Напротив, обучение MiMo-V2.5-Pro отдает приоритет «пространству действий», а не сенсорному восприятию. Вместо сенсорного выравнивания фокус обучения модели Pro смещается на масштабирование вычислительных мощностей после обучения.
Этот процесс призван привить «осведомленность об инфраструктуре», при которой модель специально обучается управлять собственной памятью и контекстом в рамках автономных агентских сред вроде Claude Code или OpenCode.
В то время как базовая модель V2.5 обучена рассуждать в различных модальностях, версия Pro обучена поддерживать когерентность на протяжении более чем тысячи последовательных вызовов инструментов.
Стандартная модель V2.5 балансирует между локальным и глобальным вниманием для поддержания мультимодального восприятия. Однако модель Pro использует увеличенное соотношение гибридного внимания, эволюционируя от соотношения 5:1 у предыдущих поколений к более агрессивному соотношению 7:1.
Это позволяет модели Pro «просматривать» подавляющую часть своего контекста, уделяя при этом высокую плотность внимания тем конкретным 15% данных, которые наиболее релевантны ее текущей цели. Это важнейшая функция для отладки крупных репозиториев или оптимизации схем уровня аспирантуры.
Наконец, хотя обе модели проходят через обучение с подкреплением (RL) и мультимодальную оптимизацию предпочтений (MOPD), цели этих этапов различаются.
Для MiMo-V2.5 этап RL используется для оттачивания восприятия и мультимодальных рассуждений. Для MiMo-V2.5-Pro RL сфокусирован на следовании инструкциям в агентских сценариях, гарантируя, что модель следует тонким требованиям, заложенным глубоко в сверхдлинном контексте, и изящно восстанавливается после ошибок во время автономного выполнения.
Это приводит к «самокорректирующейся» дисциплине модели Pro, что видно по ее способности диагностировать и исправлять регрессии во время 4,3-часовой сборки компилятора SysY.
Полная лицензия MIT идеальна для корпоративных сценариев
Шагом, отличающим ее от многих «открытых» моделей, которые включают ограничительные политики «допустимого использования», Xiaomi выпустила MiMo-V2.5 под лицензией MIT. Лицензия MIT является золотым стандартом разрешительного программного лицензирования. Для разработчиков и предприятий это означает:
-
Разрешение не требуется: компании могут развертывать модель в коммерческих целях без получения явного разрешения от Xiaomi.
-
Продолжение обучения: разработчики могут свободно дорабатывать модель на проприетарных данных и даже выпускать производные веса.
-
Неограниченное коммерческое использование: здесь нет ограничений по выручке или размеру базы пользователей, которые часто сопровождают «общественные» лицензии.
Выбирая MIT вместо пользовательской лицензии на «открытые веса», Xiaomi позиционирует MiMo как фундаментальную инфраструктуру для нового поколения агентов ИИ, фактически приглашая мировое сообщество разработчиков относиться к модели как к общественному благу.
Предыстория Xiaomi: от смартфонов и электромобилей до любимчика китайского ИИ с открытым исходным кодом
Поворот Xiaomi в сторону передовых агентов ИИ является логичным завершением десятилетия создания одного из самых плотных в мире маховиков «аппаратное обеспечение — программное обеспечение».
Основанная в 2010 году как разрушитель рынка смартфонов, эта пекинская компания осуществила рискованный переход в вертикально интегрированного гиганта, определяемого ее стратегией «Человек x Автомобиль x Дом». Эта экосистема теперь включает более 823 миллионов подключаемых умных устройств, объединенных под архитектурой HyperOS.
Выход компании на автомобильный рынок в 2024 году с седаном SU7 и последующим высокопроизводительным внедорожником YU7 послужил доказательством концепции для этой интеграции, позиционируя Xiaomi как прямую конкурентку мировых брендов класса люкс.
Инвестировав 200 миллиардов юаней ($29 млрд США) в фундаментальные исследования и разработки в области чипов и операционных систем, Xiaomi вышла за рамки сборки потребительской электроники; она стала архитектором «пространства действий», используя свой массивный аппаратный след в качестве основной испытательной площадки для агентского интеллекта, найденного в серии MiMo-V2.5.
Поддержка экосистемы
Выпуск встретил немедленную поддержку «Day-0» со стороны более широкой экосистемы ИИ. Команда MiMo объявила, что SGLang и vLLM — два самых популярных высокопроизводительных движка инференса — поддерживали серию V2.5 с момента запуска.
Это стало возможным благодаря партнерству в области аппаратного обеспечения с AWS, AMD, T-HEAD и Enflame, что гарантирует эффективную работу модели на всем — от облачных H100 до отечественных китайских ускорителей.
Фули Луо (Fuli Luo), руководитель проекта в Xiaomi MiMo и бывший ключевой участник команды DeepSeek, подчеркнул философию релиза в X (ранее Twitter):
«Ценность модели измеряется не только рейтингами — она измеряется проблемами, которые она решает. Давайте создавать с MiMo прямо сейчас!»
Чтобы дать старт этому этапу разработки, Луо объявил о выделении гранта в размере 100 триллионов бесплатных токенов для разработчиков и создателей. Этот масштабный стимул призван снизить барьер входа для разработчиков, которые хотят поэкспериментировать с окном контекста в 1 миллион токенов без немедленного финансового риска.
Экономическая перенастройка: открытый исходный код против платных проприетарных систем
Запуск происходит в критический момент для экономики искусственного интеллекта. Переход на тарификацию по факту использования знаменует собой окончательный конец эпохи шведского стола «все включено» для ИИ-сервисов. Эта тенденция подчеркнута сегодняшним анонсом GitHub о том, что его помощник по кодированию на базе ИИ Github Copilot переведет все планы на кредиты на основе потребления токенов.
Поскольку предсказуемость на основе рабочих мест уступает место затратам, управляемым потреблением, премиальные агентские рабочие процессы (которые могут потреблять миллионы токенов за один сеанс рассуждений) становятся все более сложными для планирования бюджетов предприятий.
Настроения пользователей ожидаемо стали циничными: разработчики жалуются, что они «получат меньше, но заплатят ту же цену», поскольку подписки конвертируются в конечные объемы. Такая эволюция ценообразования значительно повышает стратегическую привлекательность серии MiMo. Выпуская продукты под разрешительной лицензией MIT, Xiaomi позволяет организациям обойти растущий «налог на SaaS» и восстановить финансовую предсказуемость посредством частного развертывания.
Что особенно важно, Xiaomi устранила «контекстный налог» для своего API. Окно контекста в 1 миллион токенов теперь тарифицируется по стандартной ставке — 1 токен = 1 кредит для V2.5 и 2 кредита для версии Pro — без дополнительных множителей. Это резко контрастирует с общеотраслевым переходом к лимитам на основе сеансов, позиционируя MiMo как убежище для чувствительных к затратам разработчиков больших объемов.
Анализ для бизнеса
Запуск MiMo-V2.5 — это больше, чем просто выпуск весов; это декларация независимости для сообщества открытого исходного кода.
Соответствуя Claude Sonnet 4.6 в мультимодальной агентской работе и Gemini 3 Pro в понимании видео, Xiaomi доказала, что разрыв между лабораториями «за закрытыми дверями» и открытыми исследованиями фактически устранен.
С лицензией MIT в качестве катализатора и грантом в 100 триллионов токенов в качестве топлива в ближайшие месяцы мы, вероятно, увидим всплеск специализированных агентских приложений, построенных на базе MiMo.
Подтверждая амбициозную траекторию проекта, команда отметила, что они уже обучают следующее поколение, уделяя особое внимание «более глубоким рассуждениям» и «более богатому привязке к реальному миру». На данный момент MiMo-V2.5 является свидетельством мощи разреженных архитектур и разрешительного лицензирования в гонке к функциональному AGI.



