Meta вступает в борьбу за ИИ-инструменты для программирования, представив Muse Spark 1.2 и Muse Code с постоянными асинхронными фоновыми агентами

Meta вступает в борьбу за ИИ-инструменты для программирования, представив Muse Spark 1.2 и Muse Code с постоянными асинхронными фоновыми агентами

Источник: VentureBeat · Carl Franzen

Компания Meta сегодня выпустила Muse Code — ИИ-агент для написания кода на базе терминала, который сейчас находится на стадии бета-тестирования, а также Muse Spark 1.2 — специализированное обновление для линейки передовых моделей Muse Spark, ориентированное на программирование. Этот двойной удар выводит компанию на прямой уровень конкуренции с Claude Code от Anthropic, Codex от OpenAI и растущим числом агентских инструментов для разработки, которые стремительно становятся основным средством создания программного обеспечения для многих профессиональных разработчиков.

«Сегодня мы выпускаем Muse Code в режиме беты», — написал соучредитель и генеральный директор Meta Марк Цукерберг в публикации в конкурирующей социальной сети X (под своим давним ником @finkd). — Это агент для программирования через терминал, который берет на себя комплексные задачи по разработке ПО в крупных репозиториях: планирует изменения, пишет код и проверяет результаты».

Этот запуск знаменует собой самый серьезный шаг Meta в категорию, за которой она до сих пор в основном наблюдала со стороны.

В то время как Anthropic и OpenAI превратили свои агенты для программирования в флагманские продукты, а стартапы вроде Cursor построили на базе этого рабочего процесса миллиардные бизнесы, стратегия Meta для разработчиков долгое время строилась вокруг Llama — семейства моделей с открытым весом, которые компания бесплатно раздала общим тиражом более миллиарда загрузок.

Muse Code меняет этот подход во многих отношениях: это полноценный инструмент, устанавливаемый на macOS или Linux одной командой curl, который прошел совместное обучение с лежащей в его основе моделью и, как и стоящие за ним модели Muse Spark, является полностью проприетарным.

Тем не менее, Цукерберг намекнул, что в будущем для Muse Spark или какого-то другого продукта может быть открыт исходный код. В ответе на вопрос в X он написал: «Скоро я смогу рассказать об этом подробнее».

Zuck response to Muse open source question

Скриншот VentureBeat

Разработчики и потенциальные пользователи уже могут установить инструмент в своем Терминале с помощью следующей однострочной команды — однако стоит предупредить: если это вы, то для начала работы потребуется войти под аккаунтом Meta и предварительно указать платежные данные: curl -fsSL https://dev.meta.ai/install.sh | bash

Постоянно работающие фоновые агенты и параллельные рабочие директории (worktrees)

Главная архитектурная ставка Muse Code — это то, что в Meta называют асинхронными фоновыми агентами.

Вместо того чтобы создавать вспомогательных агентов заново для каждой задачи (по паттерну, используемому большинством конкурирующих инструментов), Muse Code поддерживает комплект специализированных фоновых агентов в активном состоянии на протяжении всей сессии.

Согласно публикации в блоге Meta, эти агенты «остаются активными на протяжении каждой сессии, а не порождаются для выполнения отдельных задач, что позволяет избежать избыточного сбора информации», самостоятельно выполняя следующие шаги и принимая решения о том, когда докладывать результаты основному агенту.

Практический результат заключается в снижении задержек и уменьшении необходимости контроля: агент, который уже знаком с репозиторием, не должен изучать его заново каждый раз, когда разработчик просит о чем-то новом.

Когда объем работы становится достаточно большим, Muse Code распределяет задачи между отдельными под-агентами, работающими параллельно — каждый в своей изолированной рабочей директории git worktree, благодаря чему рабочая копия разработчика никогда не затрагивается.

«Во время тестирования мы заставили его построить шесть функций для игры одновременно без каких-либо конфликтов», — написал Цукерберг в X.

Изоляция worktree и параллельные под-агенты встречаются и в конкурирующих инструментах, однако Meta делает упор на комбинацию постоянства и параллелизма как на свое ключевое отличие.

Второй примечательный элемент дизайна — это аудируемость. Каждый вызов модели, запуск инструмента, подтверждение и правка перед выполнением заносятся в локальный журнал событий (event log). Как заявляют в Meta, это единый источник достоверной информации, который делает среду выполнения «точно воспроизводимой и безопасной при перезапуске».

Если Muse Code завис через 20 часов после запуска долгосрочной задачи, он возобновляет работу ровно с того места, где остановился — без потери результатов и необходимости заново вводить подсказки (промпты). Для технических руководителей, которые уже сталкивались с проблемами из-за непрозрачной работы агентов, полный локальный след аудита может оказаться важнейшей функцией при оценке продукта для корпоративного использования.

Muse Code также поставляется со встроенными «навыками», которые покажутся знакомыми пользователям конкурирующих продуктов: /plan превращает задачу в план с обязательным подтверждением, /grill проводит стресс-тест этого плана до тех пор, пока он не станет надежным, а /goal направляет агента к завершению заявленной цели.

Muse Spark 1.2: обучение в паре с собственным инструментом

Под капотом находится Muse Spark 1.2, которую в Meta описывают как ориентированное на программирование обновление для Muse Spark 1.1. В нем «значительно масштабированы вычислительные мощности для обучения на задачах программирования» и расширено разнообразие тренировочных сред, что улучшило генерацию кода, комплексную отладку и понимание кодовой базы при сохранении общих агентских возможностей.

Это обновление бьет точно по самому уязвимому месту семейству Muse. Когда оригинальная модель Muse Spark дебютировала в апреле, она вернула Meta в топ-5 по бенчмаркам передовых рассуждений и работы с визуальными данными, но отставала в оценках агентского программирования, наиболее важных для этого рынка: она набрала 77.4 балла на SWE-Bench Verified против 80.8 у Claude Opus 4.6 и 80.6 у Gemini 3.1 Pro, а также значительно отставала от GPT-5.4 по метрике долгосрочных рабочих задач GDPval.

Четыре месяца спустя специализированная для кода контрольная точка в паре со специально созданным инструментом выглядит как прямой ответ Meta на этот разрыв.

Выделяются две детали обучения. Во-первых, Meta обучала модель совместно с самим Muse Code, используя траектории инструмента с выборкой отклонений (rejection-sampled), а также оптимизации рецептов для целей, сжатия контекста и под-агентов. Это означает, что модель была явно настроена на максимальную эффективность именно внутри этого конкретного инструмента. Это отражает общеотраслевой сдвиг в сторону отказа от раздельного рассмотрения моделей и инструментов.

Во-вторых, Meta использовала цикл самосовершенствования: Muse Spark 1.1 генерировала сложные среды программирования и шаблоны следования инструкциям, после чего оценивала возможные решения на соответствие этим требованиям, создавая масштабируемый обучающий набор данных для своего преемника. В Meta считают, что именно этот цикл сделал версию 1.2 заметно лучше справляющейся со сложными инструкциями.

Meta опубликовала графики бенчмарков, сравнивающие Muse Spark 1.2 с другими моделями для программирования на Terminal-Bench 2.1, DeepSWE 1.1 и внутреннем бенчмарке Meta, перенаправив читателей к отдельному отчету с описанием методологии за подробностями — хотя в тексте анонса сами результаты не рекламируются, что является необычной скромностью для сферы, где конкуренты громко заявляют о победах в таблицах лидеров. Графики объясняют причину: они демонстрируют сильное, но явное второе место.

Meta Spark 1.2 benchmarks

Графики сравнения бенчмарков Meta Spark 1.2. Источник: Марк Цукерберг / Meta

В тесте Terminal-Bench 2.1 модель Muse Spark 1.2, запущенная в Muse Code, набрала 82.9%, обогнав GPT-5.6 Terra от OpenAI с интерфейсом Codex (81.8%) и Grok 4.5 от xAI в Grok Build (81.6%), но уступив Opus 5 от Anthropic при максимальных настройках в Claude Code, который лидирует с показателем 86.7%.

На DeepSWE 1.1 Muse Spark 1.2 показала 59.3%, заняв третье место после Opus 5 (65.0%) и GPT-5.6 Terra (64.8%). Наиболее поразителен собственный внутренний бенчмарк Meta, где результат Muse Spark 1.2 в 70.6% уверенно опережает GPT-5.6 Terra (65.4%) и Gemini 3.6 Flash (63.9%), но все же почти на девять пунктов отстает от 79.4% у Opus 5. Это необычно откровенное признание того, что даже в тесте, разработанном самой Meta, побеждает модель Anthropic. Действительно, Claude занимает первые места во всех трех чартах.

Тем не менее, прогресс между поколениями реален: Muse Spark 1.2 превосходит версию 1.1 на 6.7 пункта в Terminal-Bench и на 6.3 в DeepSWE. Одна деталь скрыта в подписях к графикам: баллы версии 1.1 были записаны в стандартном инструменте mini-swe-agent, в то время как 1.2 работала в Muse Code, поэтому частью этого скачка мы обязаны новому инструменту, а не новой модели.

Самая яркая демонстрация компании — это долгосрочный кейс: Meta задействовала Muse Spark 1.2 для оптимизации ядер графического процессора (GPU), позволив ей выполнять более 1000 вызовов инструментов в течение почти 24 часов на оборудовании NVIDIA Hopper.

Работая на Triton и не имея возможности просто использовать готовые сторонние библиотеки ядер, агент самостоятельно писал, компилировал и профилировал код до тех пор, пока не добился того, что в Meta называют «существенными улучшениями» по сравнению с базовыми реализациями ядер KDA и MLA — включая поистине неочевидные оптимизации, такие как перенос центра симметрии затворенной кумулятивной деградации в среднюю точку чанка.

«Он продолжал находить существенные улучшения далеко за пределами фазы первоначального исследования», — написал Цукерберг. Устойчивое улучшение в ходе 24-часового автономного запуска, если оно подтвердится вне демоверсий Meta, решает одну из самых частых претензий к агентам для программирования: склонность останавливаться в развитии или отклоняться от курса после первоначального всплеска успехов.

Ваши данные в обмен на скидку?

Структура ценообразования может оказаться самой важной и наиболее тщательно изучаемой частью запуска. Meta предлагает Muse Spark 1.2 через свой API моделей Meta в двух тарифах.

Стандартный тариф стоит $1.25 за миллион входных токенов и $4.25 за миллион выходных токенов (кэшированный ввод обойдется в $0.15). При этом Meta берет на себя обязательство не использовать подсказки и завершения на этом тарифе для обучения своих моделей. Здесь нет надбавки за длинный контекст, а лимиты запросов составляют до 3000 запросов и 4 миллиона токенов в минуту на команду. Это средний ценовой диапазон по сравнению с другими ведущими моделями ИИ, доступными через API.

Тариф для участников (Contributor tier) — это то место, где стратегия Meta резко расходится со стратегией конкурентов: $0.10 за миллион входных токенов и $0.20 за миллион выходных токенов (примерно в 12 и 21 раз дешевле стандарта соответственно), а кэшированный ввод стоит почти бесплатно — $0.002. Взамен вы даете прямое разрешение использовать ваши промпты и завершения для обучения будущих моделей Meta. Это самый дешевый вариант на рынке, но расплачиваться приходится своими данными, как описано ниже.

Модель

Вход ($/1M)

Выход ($/1M)

Всего ($/1M)

Источник

Muse Spark 1.2 Contributor

$0.10

$0.20

$0.30

Meta

MiMo-V2.5 Flash

$0.10

$0.30

$0.40

Xiaomi

deepseek-v4-flash

$0.14

$0.28

$0.42

DeepSeek

deepseek-v4-pro

$0.435

$0.87

$1.305

DeepSeek

GPT-5.6 Luna

$0.20

$1.20

$1.40

OpenAI

MiniMax-M3

$0.30

$1.20

$1.50

MiniMax

LongCat-2.0 — лимитированная акция

$0.30

$1.20

$1.50

LongCat

Gemini 3.1 Flash-Lite

$0.25

$1.50

$1.75

Google

MiMo-V2.5

$0.40

$2.00

$2.40

Xiaomi

Gemini 3.5 Flash-Lite

$0.30

$2.50

$2.80

Google

LongCat-2.0 — стандартный

$0.75

$2.95

$3.70

LongCat

MiMo-V2.5 Pro (≤256K)

$1.00

$3.00

$4.00

Xiaomi

Muse Spark 1.1 / 1.2

$1.25

$4.25

$5.50

Meta

GLM-5.2

$1.40

$4.40

$5.80

Z.ai

Grok 4.5

$2.00

$6.00

$8.00

xAI

MiMo-V2.5 Pro (>256K)

$2.00

$6.00

$8.00

Xiaomi

Qwen3.8-Max

$2.00

$6.00

$8.00

QwenCloud

Gemini 3.6 Flash

$1.50

$7.50

$9.00

Google

Gemini 3.5 Flash

$1.50

$9.00

$10.50

Google

Gemini 3.1 Pro Preview (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.6 Terra

$2.00

$12.00

$14.00

OpenAI

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Kimi K3

$3.00

$15.00

$18.00

Moonshot AI

Gemini 3.1 Pro Preview (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 5

$5.00

$25.00

$30.00

Anthropic

GPT-5.5

$5.00

$30.00

$35.00

OpenAI

GPT-5.5 Instant (chat-latest)

$5.00

$30.00

$35.00

OpenAI

Sakana Fugu Ultra (≤272K)

$5.00

$30.00

$35.00

Sakana AI

GPT-5.6 Sol — Стандартный режим

$5.00

$30.00

$35.00

OpenAI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

GPT-5.6 Sol — Быстрый режим

$10.00

$60.00

$70.00

OpenAI

Именно на этот тариф Цукерберг направляет новых пользователей: «Начать работу просто и недорого, — написал он. — Установите Muse Code одной строчкой и можете начинать на нашем тарифе для участников».

В ходе тестирования VentureBeat на Mac mini однострочный установщик сработал как и рекламировалось (загрузка объемом 97 МБ и вход в систему), однако агент остановился, не выполнив никаких задач, выдав сообщение о том, что модели не обнаружены и для «завершения настройки аккаунта требуется оплата».

Другими словами, даже для щедро субсидируемого тарифа для участников требуется привязанный способ оплаты, прежде чем Muse Code начнет выполнять хоть какую-то работу: «недорого» — это верно, но не «бесплатно».

Meta позиционирует тариф для участников как средство снижения порога входа для создания прототипов и экспериментов, «где обучение на ваших данных приемлемо».

Но это также означает, что стандартный путь по умолчанию для Muse Code отправляет код и промпты разработчиков в конвейер обучения Meta — компромисс, от которого предприятиям с проприетарными кодовыми базами придется осознанно отказываться, переходя на стандартные цены.

Тариф для участников также имеет гораздо более жесткие лимиты запросов (60 запросов в минуту против 3000), что является четким сигналом: он рассчитан на одиночных разработчиков и небольшие эксперименты, а не на продакшн-нагрузки.

Такой подход классически характерен для Meta: субсидировать доступ, собирать данные в массовом масштабе и использовать их для сокращения отставания от лидеров. Цукерберг не скрывал своих амбиций, назвав Muse Spark 1.2 «нашим следующим шагом на пути к передовым рубежам, за которым последуют более крупные и мощные модели».

Тем не менее, для разработчиков и компаний, которые хотят или по закону обязаны сохранять конфиденциальность своего кода, этот компромисс может оказаться неприемлемым.

Никаких следов Llama

В сегодняшнем анонсе бросается в глаза полное отсутствие упоминаний об открытом исходном коде — разительное упущение со стороны компании, которая три года позиционировала себя как знаменосца открытого ИИ.

Начиная с дебюта оригинальной LLaMA в феврале 2023 года (весы которой, как известно, в течение нескольких недель утепли на 4chan, непреднамеренно дав толчок движению запуск мощных моделей на потребительском «железе»), через коммерчески пригодную лицензию Llama 2, специализированный для кода Code Llama и модель Llama 3.1 с 405 миллиардами параметров, которую Цукерберг выпустил в июле 2024 года с манифестом под названием «ИИ с открытым исходным кодом — это путь вперед», вся концепция Meta для разработчиков строилась на том, что веса передового класса должны быть бесплатными для скачивания, самостоятельного развертывания и тонкой настройки.

Эта стратегия работала: к началу 2026 года семейство Llama было загружено около 1.2 миллиарда раз со средним показателем около миллиона загрузок в день, а самостоятельное размещение обеспечивало предприятиям снижение затрат, которое VentureBeat ранее оценивал вплоть до 88% по сравнению с провайдерами проприетарных API.

Затем начался спад. Модель Llama 4 дебютировала в апреле 2025 года под знаком неоднозначных отзывов и последующих признаний в том, что результаты ее бенчмарков были сфабрикованы. В то же время китайские конкуренты с открытым весом от DeepSeek, Alibaba и Zhipu AI к концу 2025 года заняли порядка 41% загрузок на Hugging Face, подорвав претензии Llama на лидерство в движении, которое она же и породила. Бурный запуск подстегнул летнюю реорганизацию ИИ-подразделений Meta в Meta Superintelligence Labs (MSL), проведенную Цукербергом в 2025 году, в рамках которой соучредитель Scale AI Александр Ванг был назначен директором по искусственному интеллекту.

Эпоха Llama фактически завершилась 8 апреля этого года, когда лаборатория MSL выпустила оригинальную Muse Spark («самую мощную модель, выпущенную Meta», по словам Ванга) в качестве первой проприетарной модели Meta: доступную только через облако, без возможности скачивания весов и самостоятельного развертывания, изначально ограниченную приложениями Meta и закрытым превью API.

На прямой вопрос о том, продолжится ли разработка Llama, представитель Meta ответил VentureBeat лишь то, что «наши текущие модели Llama по-прежнему будут доступны в качестве открытого кода», демонстративно умолчав о будущих версиях.

Ванг со своей стороны заявил, что более крупные модели уже находятся в разработке «с планами по открытию исходного кода для будущих версий», однако четыре месяца спустя сегодняшний релиз никак не продвигает это обещание: никаких весов, никакой лицензии, а в публикации в блоге и в треде Цукерберга даже не используется слово «открытый» (open).

Этот разворот выглядит еще более резким на фоне того, что конкуренты Meta движутся в противоположном направлении. OpenAI выпустила Codex CLI как проект с открытым исходным кодом под мягкой корпоративной лицензией Apache 2.0, а затем представила модели с открытым весом gpt-oss; инструмент Gemini CLI от Google также распространяется под лицензией Apache и будет бесплатным для большинства разработчиков.

Выпустив Muse Code, Meta оказалась ближе всего к позиции Anthropic (чей Claude Code остается проприетарным), в то время как компания, которая когда-то утверждала, что открытый исходный код — это единственный верный путь, теперь просит разработчиков платить за каждый токен модели, которую они не могут проверить, или субсидировать этот доступ собственными данными.

В этом свете тариф для участников читается как преемник самой стратегии Llama: маховик экосистемы крутится не за счет бесплатных весов в обмен на популярность бренда, а за счет дешевых токенов в обмен на обучающие данные.

Тем не менее, ответ Цукерберга в X на прямой вопрос разработчика ИИ Лаки Фаради («Будет ли Muse Code с открытым исходным кодом?»), в котором он ответил «Скоро я смогу рассказать об этом подробнее», поддерживает надежду на то, что Meta вернется к игре с открытым ИИ.

Почему это важно

Агенты для программирования на базе терминала стали самым быстро растущим направлением в корпоративном ИИ, и до сегодняшнего дня эта категория фактически была соревнованием двух игроков — Anthropic и OpenAI, за которыми следовали Google и толпа стартапов.

Выход Meta приносит принципиально иную архитектуру (постоянные фоновые агенты, локальный журнал событий «только для добавления»), убедительную демонстрацию долгосрочных возможностей и агрессивную ценовую политику.

Открытыми остаются вопросы, на которые не могут ответить графики бенчмарков: действительно ли Muse Spark 1.2 не уступает моделям классов Claude и GPT в работе с реальными репозиториями, доверяют ли разработчики Meta свой код и достаточна ли скидка тарифа для участников, чтобы они перестали задавать вопросы. Muse Code доступен в бета-версии уже сегодня; Muse Spark 1.2 запущен в API моделей Meta с расширенным глобальным доступом.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.