MiniMax анонсирует модель M3 с новым механизмом разреженного внимания и 15,6-кратным ускорением ответа в длинном контексте
Среди множества китайских ИИ-компаний и лабораторий, борющихся за долю рынка и внимание (каламбур намеренный) на мировой арене, компания MiniMax выделяется своим стремлением предоставлять интеллект передового уровня в самых разных модальностях, включая текст, программирование и видео (через линейку моделей Hailuo) — зачастую на условиях гибких, дружественных к бизнесу стандартных открытых лицензий.
Теперь MiniMax снова привлекает внимание разработчиков и продвинутых пользователей ИИ по всему миру, выпустив новый подробный технический отчет о создании своей популярной серии языковых моделей M2 (M2, M2.5 и M2.7). В нем освещаются многочисленные инженерные инновации и оригинальные подходы компании. Одновременно с этим руководство компании намекнуло на совершенно новый подход разреженного внимания (sparse attention) для предстоящей серии моделей MiniMax M3, который, по их заявлению, обеспечивает в 15,6 раза более высокую скорость декодирования (или ответа LLM) при работе с длинными контекстами (в один миллион токенов) за счет использования нестандартной субквадратичной архитектуры. Тем самым MiniMax создала M3, чтобы сделать развертывание ИИ-агентов с ультрадлинным контекстом экономически жизнеспособным.
Отчет по модели M2 заслуживает внимания любого предприятия, работающего с моделями ИИ, и особенно тех, кто стремится самостоятельно дообучать и тренировать собственные решения. В конце концов, модели MiniMax серии M2 на момент релиза нередко занимали лидирующие позиции в мире по производительности среди открытого ИИ.
Хотя впоследствии этот статус отошел к ряду других китайских лабораторий, включая DeepSeek и Xiaomi, новый отчет MiniMax представляет собой руководство, которое предприятия по всему миру могут использовать для повышения производительности ИИ-моделей и агентов.
Как отметила в X Адина Якуп из Hugging Face: «Помимо бенчмарков, они проделали действительно солидную работу над эффективностью MoE и проектированием с упором на агентов. С нетерпением жду, куда M3 двинется дальше!»
Дилемма внимания
В основе базовой технической архитектуры серии M2 лежит разреженная структура трансформера только с декодером типа «сеть экспертов» (Mixture-of-Experts, MoE), которая используется во многих других современных LLM.
Фундаментальная основа включает в себя 229,9 миллиарда параметров в общей сложности, но при этом сохраняет исключительно компактный операционный след, активируя всего 9,8 миллиарда параметров на один токен среди 256 детализированных экспертов.
Однако для оптимизации маршрутизации и предотвращения стандартных проблем с балансировкой нагрузки компания MiniMax внедрила сигмоидальное стробирование в сочетании с обучаемыми смещениями (bias), специфичными для каждого эксперта, что позволило существенно снизить зависимость от ограничивающих вспомогательных потерь.
Самым решительным инженерным решением, задокументированным в статье о M2, стало строгое придерживание полноценного многоголового внимания с вниманием по сгруппированным запросам (Grouped Query Attention, GQA) во всех 62 слоях.
В больших языковых моделях «квадратичное масштабирование» относится к вычислительно затратной особенности стандартных механизмов полного внимания, где каждый токен в последовательности должен математически связываться с каждым другим токеном. Если провести аналогию с реальной жизнью, это похоже на посещение сетевого мероприятия, где вас заставляют вести глубокую беседу абсолютно с каждым человеком в комнате и одновременно следить за всеми остальными текущими разговорами.
Хотя такой подход обеспечивает невероятно глубокий контекст, требуемые вычислительная мощность и объем памяти растут пропорционально квадрату длины входных данных, создавая серьезное аппаратное «узкое место» при попытке моделей обработать сотни тысяч слов.
Проблема субквадратичного масштабирования
«Субквадратичное» масштабирование предполагает архитектурные уловки, предназначенные для обхода этой экспоненциальной вычислительной нагрузки. Вместо сопоставления каждой возможной связи субквадратичные методы — такие как внимание с плавающим окном (Sliding Window Attention) или сжатое линейное внимание — могут анализировать лишь локализованную область близлежащих слов или генерировать сжатую сводку более широкого текста.
Эти эффективные методы радикально снижают требования к аппаратному обеспечению и позволяют моделям обрабатывать массивы документов на высокой скорости, однако исторически они приводили к серьезным компромиссам в точности, из-за чего ИИ нередко упускал «общую картину» или терял нить удаленного контекста.
Эта математическая дилемма определяет архитектурную эволюцию от серии M2 к грядущей серии M3 от MiniMax. В ходе разработки M2 исследователи тщательно тестировали субквадратичные уловки, но обнаружили, что они подрывают способность модели к «многошаговым рассуждениям» (multi-hop reasoning) — ее способность связывать воедино разрозненные подсказки в рамках длинного документа. Это вынудило команду пойти на огромные вычислительные затраты полного квадратичного внимания ради сохранения интеллекта передового уровня.
Действительно, они активно тестировали альтернативные варианты эффективного внимания на этапе предварительного обучения, но намеренно отказались от них. Компания проводила масштабные эксперименты с гибридными конфигурациями, чередуя полное внимание с субквадратичными архитектурами, такими как Lightning Attention или гибридные конфигурации внимания с плавающим окном (SWA).
Эмпирические результаты оказались однозначными: в больших масштабах варианты линейного и оконного внимания демонстрировали серьезные недостатки в рассуждениях.
При оценках на контекстных окнах, превышающих 32 тыс. токенов, варианты SWA работали значительно хуже полного внимания, опускаясь с базового балла 90,0 до 72,0 в сложной задаче извлечения слов RULER 128K.
Субквадратичные конфигурации оказались подвержены ограничениям памяти во время обучения, не имели нативной поддержки кэширования префиксов и не смогли плавно интегрироваться с модулями прогнозирования нескольких токенов (Multi-Token Prediction, MTP), используемыми для спекулятивного декодирования. Полное внимание было признано необходимым для сохранения способности к многошаговым рассуждениям.
Тем не менее, признавая, что физические ограничения оборудования не могут бесконечно поддерживать квадратичное масштабирование, MiniMax проектирует серию M3 на базе новой субквадратичной архитектуры, чтобы наконец обеспечить одновременно высокую скорость обработки и бескомпромиссные возможности рассуждений.
Приближается разреженное внимание MiniMax (MSA) и субквадратичное масштабирование
Предстоящая модель MiniMax-M3 уходит от тяжелых вычислительных ограничений своего предшественника. Как сообщил инженерный коллектив MiniMax под лозунгом «Грядет нечто грандиозное», M3 представляет «разреженное внимание MiniMax» (MiniMax Sparse Attention, MSA).
В отличие от многоголового латентного внимания DeepSeek (MLA), которое сжимает ключи и значения (Keys-Values) в низкоразмерное латентное пространство, MSA работает на стандартной основе GQA, но использует блочный выбор на реальных, несжатых ключах и значениях.
Эли Бакуч из лаборатории инфраструктуры и платформ для обучения ИИ Prime Intellect написал в X, что главные изменения заключаются в «блочном выборе, как в CSA, но само внимание выполняется на реальных KV, а не в [сжатом пространстве]».
Это решает проблемы потери точности и кэширования префиксов, отмеченные в статье о M2. Динамически фильтруя и выбирая последовательности на уровне блоков, MSA совершает архитектурный прорыв: предварительное профилирование оборудования указывает на 9,7-кратное ускорение задержки предварительного заполнения (prefilling) и колоссальное 15,6-кратное ускорение на этапах декодирования при длине последовательности в 1 миллион токенов по сравнению с архитектурой M2 с полным вниманием.
Чтобы понять, почему ускорение на «этапе декодирования» имеет столь важное значение, полезно разобрать, как ИИ фактически читает и записывает информацию. Когда вы взаимодействуете с ИИ, обработка происходит на двух разных этапах: предварительное заполнение (prefilling) и декодирование.
Когда вы даете ИИ промпт — будь то короткое предложение или огромный документ на 1000 страниц — он обрабатывает весь этот массив текста целиком и параллельно, что называется «предварительным заполнением». По сути, модель «прочитывает» вводный текст за один присест, чтобы сформировать первичное понимание и задать контекст.
Чтобы сгенерировать ответ, ИИ должен вступить в «фазу декодирования». Чтобы предсказать первое слово ответа, он смотрит на промпт. Чтобы предсказать второе слово, он должен посмотреть на промпт *плюс* первое слово. Чтобы предсказать сотое слово, он обязан пересчитать контекст промпта *и* предыдущих 99 слов, которые он только что написал. Таким образом, ответ генерировать все сложнее по мере его удлинения, причем концовка требует полного пересмотра всех предыдущих частей.
Для неспециалиста: представьте, что вы читаете плотный юридический бриф (предварительное заполнение), а затем вас заставляют написать итоговый отчёт, причем перед написанием каждого нового слова вы обязаны стремительно перечитывать весь бриф плюс всё, что вы уже написали до этого, чтобы ваше следующее слово имело смысл (декодирование).
Поскольку ИИ вынужден постоянно и многократно оглядываться назад для генерации каждого нового шага вперед, фаза декодирования представляет собой самое серьезное вычислительное «узкое место» при генерации текста. Именно поэтому ИИ-модели часто выводят ответы слово за словом и почему они значительно замещаются по мере удлинения диалогов.
Следовательно, когда в тексте говорится, что новая архитектура обеспечивает колоссальное 15,6-кратное ускорение на этапе декодирования при длине последовательности в 1 миллион токенов, это означает, что модель нашла структурную лазейку для генерации ответа — токен за токеном — почти в 16 раз быстрее. Это напрямую устраняет то самое «узкое место», из-за которого ИИ-чат-боты обычно зависают или начинают заикаться при работе с огромными объемами информации.
Эволюция серии MiniMax M и создание «Forge»
На уровне продуктов MiniMax последовательно превращает свои модели из простых интерфейсов генерации текста в автономных работников.
В серии M2 был впервые применен протокол «чередующегося мышления», при котором модель переключается между планами на естественном языке и явными вызовами инструментов в рамках единой траектории. Вместо того чтобы отбрасывать промежуточные блоки цепочки рассуждений между шагами выполнения, M2 добавляет всю историю размышлений непосредственно в контекст диалога. Такая персистентность планирования предотвращает дрейф состояния, позволяя модели изящно восстанавливаться после программных сбоев и корректировать свои стратегии на основе обратной связи от среды.
Для обучения этих долгосрочных рабочих процессов компания MiniMax создала «Forge» — масштабируемую систему агентно-ориентированного обучения с подкреплением. Forge разделяет исполнение на три независимых модуля: сторону агента (Agent Side), уровень абстракции связующего ПО (Gateway Server и Data Pool) и движки обучения/вывода.
Как пояснил инженер MiniMax Олив Сонг (Olive Song) в подкасте ThursdAI: «Мы поняли, что у такой маленькой модели есть огромный потенциал, если обучать ее с помощью обучения с подкреплением на больших объемах сред и агентов… Но это не самая простая задача», добавив, что именно на такое обучение в среде у команды ушла значительная часть графика разработки. Чтобы сгладить экстремальный разброс длины траекторий, характерный для многошаговых агентных сред, Forge реализует два жизненно важных инженерных решения:
-
Планировщик FIFO с плавающим окном (Windowed FIFO Scheduling): Планировщик обучения, накладывающий скользящее окно на очередь генерации. Он позволяет жадно и с высокой пропускной способностью извлекать завершенные задачи в рамках окна, чтобы предотвратить простои кластера, одновременно строго соблюдая границы FIFO для поддержания распределительной стабильности и предотвращения колебаний градиента.
-
Слияние префиксных деревьев (Prefix Tree Merging): Оптимизация, которая реструктурирует пакетное обучение в древовидные вычисления. Завершения, имеющие одинаковые префиксы диалога, вычисляются ровно один раз в прямом проходе перед ветвлением. Это устраняет избыточные вычисления, обеспечивая до 40-кратного ускорения обучения с нулевой погрешностью аппроксимации.
Эта инфраструктура обучения с подкреплением напрямую породила чекпоинт M2.7, продвинув серию в сторону «саморазвития». Функционируя внутри автоматизированного агентного каркаса, M2.7 выступает в роли независимого инженера по машинному обучению. Модель профилирует собственные активные тренировочные запуски, диагностирует аномалии, читает логи и автоматически модифицирует собственный кодовая базу и конфигурации.
По данным MiniMax, M2.7 успешно справилась с обработкой от 30% до 50% собственного цикла разработки.
В строгом наборе тестов MLE Bench Lite от OpenAI, который проверяет способность к автономным исследованиям в области МО, модель M2.7 достигла показателя медалей в 66,6% в ходе независимых 24-часовых испытаний, фактически сравнявшись с закрытой моделью Gemini 3.1 Pro от Google.
Непрерывный переход от M2 к M2.5, которая, как известно, выполнила 30% внутренних задач и 80% недавно закоммиченного кода в штаб-квартире MiniMax, подчеркивает более масштабное видение.
Как отметила команда MiniMax во время этой фазы развертывания: «мы верим, что M2.5 предоставляет практически безграничные возможности для разработки и работы агентов в экономике».
С появлением технического отчета, закрепляющего успехи поколения M2, и грядущим техническим блогом об архитектуре MSA, компания MiniMax дает понять, что следующий рубеж ИИ заключается именно в преобразовании мини-активационного следа в максимальный интеллект для реального мира.



