Прощай, Llama? Meta выпускает новую проприетарную модель ИИ Muse Spark — первую с момента создания Superintelligence Labs
Компания Meta была одной из самых интересных компаний эпохи генеративного ИИ. Сначала она завоевала огромную и преданную аудиторию пользователей благодаря выпуску в основном открытого семейства больших языковых моделей (LLM) Llama, который начался в начале 2023 года, однако в прошлом году этот процесс резко застопорился после того, как модель Llama 4 дебютировала со смешанными отзывами и, в конечном итоге, последовало признание в подгонке результатов бенчмарков.
Столь непростой запуск Llama 4, судя по всему, побудил основателя и генерального директора Meta Марка Цукерберга полностью перестроить ИИ-подразделения Meta летом 2025 года. Он сформировал новое внутреннее подразделение Meta Superintelligence Labs (MSL) и пригласил 29-летнего сооснователя и бывшего генерального директора Scale AI Александра Ванга возглавить его в качестве директора по искусственному интеллекту (Chief AI Officer).
Теперь, сегодня, Meta демонстрирует нам результаты этой работы: Muse Spark, новую проприетарную модель, которая, по словам Ванга (написавшего в соцсети X — конкуренте, который чаще используется сообществом специалистов по машинному обучению), является «самой мощной моделью, выпущенной Meta» и обладает «поддержкой использования инструментов, визуальной цепочки рассуждений и мультиагентной оркестровки». Он также заявил, что это положит начало новому семейству моделей Muse, что вызывает вопросы о дальнейшей судьбе популярной линейки Meta и продолжающейся разработке семейства Llama.
Новинка позиционируется не как стандартный чат-бот, а как фундамент для того, что Ванг называет «персональным суперинтеллектом» — ИИ, который не просто обрабатывает текст, но «видит и понимает окружающий мир», действуя как цифровое продолжение самого человека. Это перекликается с публичным манифестом Цукерберга о концепции персонального суперинтеллекта, опубликованным летом 2025 года.
Тем не менее, модель является исключительно проприетарной — на данный момент она доступна только в приложении и на сайте Meta AI, а также в рамках «закрытого превью API для избранных пользователей», согласно публикации в блоге Meta. Этот шаг, вероятнее всего, вызовет недовольство у миллиардов пользователей моделей Llama и тысяч разработчиков, которые полагались на них (некоторые из которых активно участвуют в жизни сабреддита r/LocalLLaMA на конкурирующей платформе Reddit). Кроме того, информация о ценах на модель пока не объявлена.
Пока остается неясным, прекратила ли Meta разработку семейства Llama полностью. В ответ на прямой вопрос VentureBeat представитель Meta сообщил по электронной почте: «Наши текущие модели Llama по-прежнему будут доступны с открытым исходным кодом», что не проясняет вопрос относительно разработки будущих версий Llama.
Визуальная цепочка рассуждений
В основе Muse Spark лежит нативно мультимодальная модель рассуждений. В отличие от предыдущих итераций, которые «сшивали» зрение и текст вместе, Muse Spark была создана с нуля для интеграции визуальной информации в свою внутреннюю логику. Такой архитектурный сдвиг обеспечивает «визуальную цепочку рассуждений» (visual chain of thought), позволяя модели аннотировать динамические среды — например, определять компоненты сложной эспрессо-машины или исправлять технику выполнения упражнений по йоге с помощью покадрового видеоанализа.
Однако самым значительным техническим прорывом стал новый режим «Размышление» (Contemplating). Эта функция координирует работу нескольких субагентов для параллельных рассуждений, что позволяет Meta конкурировать с моделями предельного уровня рассуждений, такими как Gemini Deep Think от Google и GPT-5.4 Pro от OpenAI.
В бенчмарках этот режим набрал 58% в тесте «Последний экзамен человечества» (Humanity’s Last Exam) и 38% в «FrontierScience Research» — показатели, которые, по заявлению Meta, подтверждают правильность их новой траектории масштабирования.
Пожалуй, еще более впечатляющим для финансовых показателей компании является эффективность модели. Meta сообщает, что Muse Spark достигает своих возможностей рассуждения, используя более чем на порядок меньше вычислительных мощностей, чем Llama 4 Maverick, ее предыдущий флагман среднего размера. Такая эффективность достигается благодаря процессу под названием «сжатие мыслей» (thought compression). Во время обучения с подкреплением модель наказывается за избыточное «время на размышления», что заставляет ее решать сложные задачи с меньшим количеством токенов рассуждений без ущерба для точности.
Бенчмарки демонстрируют возвращение формы
Запуск Muse Spark преподносится как статистический «квантовый скачок», завершающий годичное отсутствие Meta на переднем крае производительности в сфере ИИ.
График бенчмарков Meta Muse Spark. Источник: Meta
Если сопоставить официальные внутренние данные Meta с независимым аудитом сторонней компании по отслеживанию LLM Artificial Analysis, вырисовывается четкая картина: Muse Spark — это не просто незначительное улучшение серии Llama, это принципиальное возвращение в «пятерку» лучших мировых моделей.
График индекса интеллекта Artificial Analysis с учетом Meta Muse Spark. Источник: Artificial Analysis/X
Согласно Индексу интеллекта Artificial Analysis (v4.0), Muse Spark набрала 52 балла. Для контекста: предыдущий флагман Meta, Llama 4 Maverick, дебютировал в 2025 году с показателем индекса всего в 18 баллов.
Почти утроив свою производительность, Muse Spark теперь находится на расстоянии удара от самых элитных систем индустрии, уступая лишь Gemini 3.1 Pro Preview (57), GPT-5.4 (57) и Claude Opus 4.6 (53).
Официальные бенчмарки Meta показывают, что Muse Spark особенно сильна в мультимодальных рассуждениях, в частности на стыке визуальных графических данных и логики.
-
Рассуждения в CharXiv: В задаче «понимания графиков» Muse Spark набрала 86.4 балла, существенно опередив Claude Opus 4.6 (65.3), Gemini 3.1 Pro (80.2) и GPT-5.4 (82.8).
-
MMMU Pro: Официальные отчеты оценивают модель в 80.4 балла, в то время как независимый аудит Artificial Analysis зафиксировал результат в 80.5%. Это делает ее второй по возможностям моделью компьютерного зрения на рынке, уступающей лишь Gemini 3.1 Pro Preview (83.9% по официальным данным; 82.4% по независимым).
-
Визуальная фактология (SimpleVQA): Muse Spark набрала 71.3 балла, опередив GPT-5.4 (61.1) и Grok 4.2 (57.4), хотя она немного отстает от Gemini 3.1 Pro (72.4).
Эти результаты подтверждают правильность фокуса Meta на «визуальной цепочке рассуждений», которая позволяет модели не просто распознавать объекты, но и рассуждать над сложными пространственными задачами и динамическими аннотациями.
Механизм «мышления» Muse Spark был испытан в специализированных бенчмарках, разработанных для проверки моделей, не предназначенных для рассуждений.
-
Последний экзамен человечества (HLE): В ходе этой многодисциплинарной оценки Meta сообщает о баллах 42.8 (без инструментов) и 50.4 (с инструментами). Независимый аудит Artificial Analysis оценил модель в 39.9%, что уступает Gemini 3.1 Pro Preview (44.7%) и GPT-5.4 (41.6%).
-
GPQA Diamond (Рассуждения уровня PhD): Muse Spark набрала впечатляющие 89.5 балла, превзойдя Grok 4.2 (88.5), но уступив специализированным результатам «максимальных рассуждений» Opus 4.6 (92.7) и Gemini 3.1 Pro (94.3).
-
ARC AGI 2: Это остается заметной уязвимостью. Muse Spark набрала 42.5 балла, сильно отставая от головоломок на абстрактное мышление, которые решили Gemini 3.1 Pro (76.5) и GPT-5.4 (76.1).
-
CritPT (Физические исследования): Независимый аудит показал, что Muse Spark добилась 5-го по величине результата с показателем в 11%. Это существенно опережает Gemini 3 Flash (9%) и Claude 4.6 Sonnet (3%).
Одним из самых ярких результатов официальных данных является эффективность Muse Spark в сфере здравоохранения, что, вероятно, стало результатом сотрудничества Meta более чем с 1000 врачей.
-
HealthBench Hard: Muse Spark набрала 42.8 балла, продемонстрировав колоссальный отрыв от Claude Opus 4.6 (14.8), Gemini 3.1 Pro (20.6) и даже GPT-5.4 (40.1).
-
MedXpertQA (Мультимодальный): Модель набрала 78.4 балла, уверенно опередив Opus 4.6 (64.8) и Grok 4.2 (65.8), хотя все еще уступает высшему балу Gemini 3.1 Pro, составляющему 81.3.
Агентные системы и эффективность: эффект «сжатия мыслей»
Хотя Muse Spark превосходно справляется с рассуждениями, ее «агентная» производительность — выполнение реальных рабочих задач — выглядит более сбалансированной.
-
SWE-Bench Verified: Muse Spark набрала 77.4 балла, уступив Claude Opus 4.6 (80.8) и Gemini 3.1 Pro (80.6).
-
GDPval-AA Elo: Официальный балл Meta 1444 немного отличается от зафиксированного Artificial Analysis показателя в 1427. В обоих случаях Muse Spark уступает GPT-5.4 (1672) и Opus 4.6 (1606), что говорит о том, что модель отлично «думает», но все еще совершенствует свою способность «действовать» в долгосрочных сценариях программной разработки и офисных рабочих процессов.
-
Токенная эффективность: Именно здесь Muse Spark проявляет себя ярче всего. Для запуска Индекса интеллекта она использовала 58 миллионов выходных токенов. Для сравнения, Claude Opus 4.6 потребовалось 157 миллионов токенов, а GPT-5.4 — 120 миллионов. Это подтверждает заявление Meta о «сжатии мыслей» — обеспечении интеллекта передового уровня при затратах времени на размышления, составляющих менее половины от показателей ближайших конкурентов.
|
Бенчмарк |
Llama 4 Maverick (2025) |
Muse Spark (Официальный) |
Gemini 3.1 Pro (Официальный) |
|
Балл индекса интеллекта |
18 |
52 |
57 |
|
MMMU Pro |
— |
80.4 |
83.9 |
|
Рассуждения в CharXiv |
— |
86.4 |
80.2 |
|
HealthBench Hard |
— |
42.8 |
20.6 |
|
Лицензия |
Открытые веса |
Проприетарная |
Проприетарная |
Выпустив Muse Spark, Meta успешно перешла от статуса «LAMP-стека для ИИ» к прямой заявке на титул создателя «персонального суперинтеллекта». И хотя агентные рабочие процессы остаются сложной задачей, доминирование модели в сферах зрения, здравоохранения и токенной эффективности возвращает Meta в центр гонки передовых технологий.
Личное благополучие и шоппинг в Instagram
Meta незамедлительно внедряет Muse Spark для поддержки специализированных функций во всем семействе своих приложений.
-
Режим покупок (Shopping Mode): Новая функция, использующая обширную экосистему создателей контента Meta. ИИ распознает бренды, стилистические предпочтения и контент в Instagram и Threads, предоставляя персонализированные рекомендации и фактически превращая каждую публикацию в интерактивную торговую площадку.
-
Медицинский анализ (Health Reasoning): В рамках движения в сторону медицинской пользы компания Meta привлекла более 1000 врачей для курирования обучающих данных. Теперь Muse Spark может анализировать питательную ценность по фотографиям еды или выставлять «показатели здоровья» для пескетарианских диет при высоком уровне холестерина.
-
Интерактивный пользовательский интерфейс: Модель способна «на лету» генерировать веб-мини-игры или учебные пособия. Например, пользователь может попросить ИИ превратить фотографию в интерактивную игру судоку или создать обучающее руководство по бытовой технике на основе ярких моментов.
Осознанность в отношении тестирования
Хотя Muse Spark демонстрирует жесткие ограничения в отношении биологического и химического оружия, в ее профиле безопасности была обнаружена поразительная новая особенность. Независимое тестирование, проведенное компанией Apollo Research, показало, что модель обладает высокой степенью «осознанности тестов» (evaluation awareness).
Модель неоднократно распознавала моменты, когда ее проверяли с помощью «ловушек на выравнивание» (alignment traps), и принимала решение вести себя честно исключительно потому, что она находилась в процессе оценки.
Хотя в Meta пришли к выводу, что это не является «критической проблемой» для релиза, данная находка говорит о том, что передовые модели становятся все более «осведомленными» об окружающей тестовой среде. Это потенциально делает традиционные бенчмарки безопасности менее надежными, поскольку модели учатся «хитрить» во время экзамена.
Что будет с Llama?
В феврале 2023 года Meta выпустила Llama 1, чтобы продемонстрировать, что меньшие по размеру и оптимизированные по вычислениям модели могут не уступать по эффективности более крупным аналогам, таким как GPT-3. Хотя изначально доступ был ограничен исследователями, веса модели были слиты через 4chan 3 марта 2023 года — событие, которое непреднамеренно демократизировало высокоуровневые исследования и дало толчок глобальному движению за запуск моделей на потребительском «железе».
Этот сдвиг закрепился в июле 2023 года с выходом Llama 2, которая представила коммерческую лицензию, разрешающую самостоятельное развертывание для большинства организаций. Такой подход привел к быстрому распространению: семейство Llama превысило 100 миллионов загрузок и обеспечило работу более чем 1000 коммерческих приложений к третьему кварталу 2023 года.
В течение 2024 и 2025 годов Meta масштабировала семейство Llama, превратив его в важнейшую инфраструктуру для корпоративного ИИ по всему миру, которую часто называют LAMP-стеком для ИИ. После запуска Llama 3 в апреле 2024 года и знаковой модели Llama 3.1 405B в июле Meta достигла паритета по производительности с ведущими мировыми проприетарными системами.
Последующий выпуск Llama 4 в апреле 2025 года принес архитектуру «микросхем экспертов» (Mixture-of-Experts), позволившую масштабировать параметры до огромных значений при сохранении высокой скорости инференса. К началу 2026 года экосистема Llama достигла поразительных масштабов: в общей сложности 1.2 миллиарда загрузок со средним показателем около одного миллиона загрузок в день.
Столь широкое распространение обеспечило бизнесу значительный экономический суверенитет, так как хостинг собственных моделей Llama предлагал сокращение затрат на 88% по сравнению с использованием проприетарных API-провайдеров.
По состоянию на апрель 2026 года роль Meta как бесспорного лидера движения открытых весов сменилась высококонкурентным многополярным ландшафтом, характеризующимся подъемом международных конкурентов.
Если на долю США приходится 35% глобальных развертываний Llama, то к концу 2025 года китайские модели от таких лабораторий, как Alibaba и DeepSeek, стали занимать 41% загрузок на платформах вроде Hugging Face. В течение начала 2026 года новые игроки, такие как GLM-5 от Zhipu AI и Qwen 3.6 Plus от Alibaba, обошли Llama 4 Maverick в бенчмарках на общие знания и написание кода.
В ответ на это глобальное давление модель Muse Spark от Meta появляется с огромными ожиданиями и наследием открытого кода, оправдать которое будет крайне непросто.
Только проприетарная (пока)
Этот запуск знаменует собой спорный отход от принципов «открытой науки», которых придерживалась Meta AI. В то время как серия Llama была широко доступна разработчикам, Muse Spark выходит в качестве проприетарной модели.
Ванг прокомментировал этот сдвиг в X, заявив: «Девять месяцев назад мы пересоздали наш ИИ-стек с нуля. Новая инфраструктура, новая архитектура, новые конвейеры данных… Это первый шаг. Более крупные модели уже находятся в разработке с планами открыть исходный код для будущих версий».
Тем не менее, сообщество разработчиков остается настроенным скептически. Некоторые видят в этом вынужденный разворот после того, как серия Llama 4 не смогла завоевать ожидаемую популярность среди разработчиков; другие считают, что Meta «закрывает ворота» теперь, когда у нее появилась конкурентоспособная модель рассуждений.
Сам Ванг признал сложность этого перехода, отметив, что «безусловно, есть шероховатости, которые мы со временем отполируем».
Для 3 миллиардов человек, использующих приложения Meta, эти изменения станут заметны практически мгновенно. ИИ, с которым они взаимодействуют, — это больше не просто библиотека информации, а агент с мозгом стоимостью 27 миллиардов долларов и задачей понимать их мир так же интимно, как и они сами.



