Модель Brumby от Manifest AI переосмысляет стоимость ИИ
Когда в 2017 году в ставшей теперь судьбоносной статье Google «Attention Is All You Need» («Внимание — это все, что вам нужно») была представлена архитектура трансформера, она мгновенно стала краеугольным камнем современного искусственного интеллекта.
Каждая крупная языковая модель (LLM) — от серии GPT от OpenAI до Claude от Anthropic, Gemini от Google и Llama от Meta — построена на той или иной вариации своего центрального механизма: внимания (attention) — математической операции, которая позволяет модели просматривать весь свой входной контекст и решать, какая информация имеет наибольшее значение.
Восемь лет спустя тот же механизм, который определил золотой век ИИ, демонстрирует свои пределы. Механизм внимания мощный, но дорогой: его вычислительные затраты и затраты на память масштабируются квадратично с длиной контекста, создавая все более неустойчивое «бутылочное горлышко» как для исследований, так и для индустрии. Поскольку модели стремятся обрабатывать документы, базы кода или потоки видео продолжительностью в часы или дни, внимание становится ахиллесовой пятой архитектуры.
28 октября 2025 года малоизвестный стартап в сфере ИИ Manifest AI представил радикальную альтернативу. Их новая модель, Brumby-14B-Base, представляет собой дообученный вариант Qwen3-14B-Base, одной из ведущих открытых моделей-трансформеров.
Но хотя многие варианты Qwen уже прошли обучение, новинка Brumby-14B-Base примечательна тем, что полностью отказывается от механизма внимания.
Вместо этого Brumby заменяет эти слои новым механизмом под названием Power Retention («Силовое удержание») — рекуррентной, эффективной с точки зрения железа архитектурой, которая сохраняет и обновляет информацию при произвольно длинном контексте без экспоненциального роста памяти, характерного для внимания.
Обученная при заявленной стоимости всего в 4000 долларов, 14-миллиардная модель Brumby демонстрирует производительность на уровне признанных моделей-трансформеров, таких как Qwen3-14B и GLM-4.5-Air, достигая точности, близкой к современному уровню техники (SOTA), в различных бенчмарках на рассуждение и понимание.
От внимания к удержанию: архитектурный сдвиг
Суть инновации Manifest AI заключается в том, что они называют слоем Power Retention (силового удержания).
В традиционном трансформере каждый токен вычисляет набор запросов (Q), ключей (K) и значений (V), а затем выполняет матричную операцию, измеряющую сходство между каждым токеном и всеми остальными — по сути, полное попарное сравнение по всей последовательности.
Именно это придает вниманию гибкость, но также делает его столь затратным: обработка последовательности вдвое большей длины требует примерно в четыре раза больше вычислений и памяти.
Power Retention сохраняет те же входные данные (Q, K, V), но заменяет глобальную операцию сходства обновлением рекуррентного состояния.
Каждый слой поддерживает матрицу памяти S, которая обновляется на каждом шаге времени в соответствии с поступающим ключом, значением и обученным сигналом управления (gating signal).
Этот процесс больше похож на RNN (рекуррентную нейронную сеть), чем на трансформер: вместо повторного вычисления внимания по всему контексту модель непрерывно сжимает прошлую информацию в латентное состояние фиксированного размера.
Это означает, что вычислительная стоимость Power Retention не растет с увеличением длины контекста. Независимо от того, обрабатывает ли модель 1000 или 1 000 000 токенов, стоимость обработки одного токена остается постоянной.
Уже одно это свойство — постоянное время вычислений на один токен — знаменует собой глубокий отход от поведения трансформеров.
В то же время Power Retention сохраняет выразительную силу, которая обеспечила успех внимания. Поскольку рекуррентность включает тензорные степени входных данных (отсюда и название «силовое удержание»), она может представлять зависимости более высокого порядка между прошлыми и настоящими токенами.
В результате получается архитектура, которая теоретически может неопределенно долго сохранять долгосрочные зависимости, оставаясь при этом такой же эффективной, как RNN, и такой же выразительной, как трансформер.
Дообучение, а не создание с нуля
Пожалуй, наиболее поразительным аспектом процесса обучения Brumby-14B является его экономичность. Manifest AI обучала модель всего 60 часов на 32 графических процессорах Nvidia H100 при стоимости около 4000 долларов — это менее 2% от того, что стоило бы обучение обычной модели такого масштаба с нуля.
Тем не менее, поскольку модель опиралась на архитектуру трансформера, можно с уверенностью сказать, что один этот прорыв не положит конец эре ИИ на базе трансформеров.
Как пояснил Джейкоб Бакман (Jacob Buckman), основатель Manifest AI, в электронном письме VentureBeat: «Возможность обучения за 4000 долларов действительно осуществима только при использовании существующей модели-трансформера, — сказал он. — Brumby нельзя было обучить с нуля за такую цену».
Тем не менее Бакман подчеркнул значимость этого результата: «Причина, по которой это важно, заключается в том, что способность опираться на веса предыдущего поколения архитектур моделей является критическим ускорителем для внедрения новой парадигмы моделирования».
Он утверждает, что это демонстрирует, как системы без внимания могут догнать производительность трансформеров при инвестициях, меньших на порядки.
На графиках потерь (loss curves), опубликованных Manifest AI, потери при обучении Brumby быстро сходятся к базовым показателям Qwen3 в течение 3000 шагов обучения, даже несмотря на то, что архитектура существенно отклоняется от своих трансформерных истоков.
Хотя Brumby-14B-Base начинала свой путь как Qwen3-14B-Base, она оставалась идентичной ей недолго. Manifest AI коренным образом изменила архитектуру Qwen3, удалив ее слои внимания — математический движок, определяющий, как модель-трансформер обрабатывает информацию — и заменив их своим новым механизмом «силового удержания». Это изменение перестроило внутренние связи модели, фактически наделив ее новым мозгом при сохранении большей части прежних знаний.
Из-за такой архитектурной замены существующие веса Qwen3 больше не подходили идеально. Они были обучены работать в рамках динамики внимания трансформера, а не новой системы на базе удержания. В результате модель Brumby поначалу «забыла», как эффективно применять некоторые из своих накопленных знаний. Процесс дообучения — около 3000 шагов дополнительного обучения — послужил перекалибровке этих весов, приведя их в соответствие с концепцией силового удержания без необходимости начинать все с нуля.
Полезный способ представить это — вообразить пианиста мирового класса, которому в руки дают гитару. Он уже понимает ритм, гармонию и мелодию, но его руки должны освоить совершенно новые паттерны, чтобы извлекать ту же музыку. Аналогичным образом Brumby пришлось заново учиться использовать свои существующие знания с помощью нового вычислительного инструмента. Те 3000 шагов обучения стали для нее, по сути, экспресс-курсом игры на гитаре.
К концу этой короткой фазы дообучения Brumby восстановила свою полную производительность, достигнув той же точности, что и оригинальная модель Qwen3. Столь быстрое восстановление и делает этот результат столь значимым: оно показывает, что система без внимания может унаследовать и адаптировать возможности модели-трансформера, затратив лишь малую долю времени и средств на обучение.
Графики прогресса бенчмарков демонстрируют аналогичную тенденцию: модель быстро приближается к целевой точности на основных оценочных наборах, таких как GSM8K, HellaSwag и MMLU, всего после нескольких тысяч шагов, сравниваясь с Qwen3 в ряде задач или даже слегка превосходя ее.
Тестирование Brumby
В стандартных оценочных задачах Brumby-14B-Base стабильно демонстрирует производительность на уровне базовых трансформеров сопоставимого масштаба или близкую к нему.
|
Задача |
Brumby-14B |
Qwen3-14B |
GLM-4.5-Air |
Nemotron Nano (12B) |
|
ARC |
0.89 |
0.94 |
0.92 |
0.93 |
|
GSM8K |
0.88 |
0.84 |
0.83 |
0.84 |
|
GSM8K (Platinum) |
0.87 |
0.88 |
0.85 |
0.87 |
|
HellaSwag |
0.77 |
0.81 |
0.85 |
0.82 |
|
MATH |
0.62 |
0.54 |
0.47 |
0.26 |
|
MBPP |
0.57 |
0.75 |
0.73 |
0.71 |
|
MMLU |
0.71 |
0.78 |
0.77 |
0.78 |
|
MMLU (Pro) |
0.36 |
0.55 |
0.51 |
0.53 |
Хотя модель немного отстает от трансформеров в тестах, требующих глубоких знаний (например, MMLU-Pro), она не уступает им или превосходит их в задачах на математические рассуждения и рассуждения на длинном контексте — именно там, где архитектуры внимания склонны давать сбои. Эта закономерность подкрепляет идею о том, что рекуррентные системы или системы на основе удержания могут иметь структурное преимущество при рассуждениях на протяженных временных или логических интервалах.
Эффективность оборудования и производительность инференса
Конструкция силового удержания (Power Retention) от Brumby предлагает еще одно важное преимущество: аппаратную эффективность.
Поскольку обновление состояния включает в себя только локальные матричные операции, инференс может быть реализован с линейной сложностью относительно длины последовательности.
Manifest AI сообщает, что их самые быстрые ядра, разработанные с помощью собственного CUDA-фреймворка Vidrial, могут обеспечить сотенное ускорение по сравнению с вниманием на очень длинных контекстах.
Бакман отметил, что ядра Power Retention на этапе альфа-тестирования «обеспечивают типичную загрузку оборудования на уровне 80–85%, что выше показателей FlashAttention2 (70–75%) или Mamba (50–60%)».
(Mamba — еще одна перспективная «пострансформерная» архитектура, разработанная учеными из Университета Карнеги — Меллона в 2023 году, которая, подобно Power Retention, стремится устранить вычислительное «бутылочное горлышко» внимания. Она заменяет внимание механизмом пространства состояний (state-space), который обрабатывает последовательности линейно — обновляя внутреннее состояние с течением времени, а не сравнивая каждый токен со всеми остальными. Это делает ее гораздо более эффективной для длинных входных данных, хотя в ранних тестах она обычно демонстрирует меньшую аппаратную загрузку, чем Power Retention).
И Power Retention, и Mamba, добавил он, «тратят значительно меньше общих FLOPs, чем FlashAttention2, на длинных контекстах, а также требуют гораздо меньше памяти».
По словам Бакмана, заявленное 100-кратное ускорение достигается за счет этого комбинированного улучшения коэффициента использования и вычислительной эффективности, хотя он отметил, что «мы еще не подвергали ее стресс-тестам на нагрузках производственного масштаба».
Экономика обучения и масштабирования
Пожалуй, ни одна статистика в анонсе Brumby не привлекла столько внимания, как стоимость обучения.
14-миллиардная модель, обученная за 4000 долларов, представляет собой сокращение затрат на разработку базовых моделей на два порядка.
Бакман подтвердил, что низкая стоимость отражает более широкую тенденцию масштабирования. «Вдали от убывающей отдачи мы обнаружили, что простота дообучения возрастает с масштабом», — сказал он. «Количество шагов, необходимых для успешного дообучения модели, уменьшается с ростом числа ее параметров».
Manifest еще не подтвердила стоимость дообучения моделей с 700 миллиардами параметров, но Бакман прогнозирует диапазон в 10 000–20 000 долларов для моделей такого масштаба — что все равно намного ниже бюджетов на обучение трансформеров.
Он также подтвердил, что этот подход может демократизировать крупномасштабные эксперименты, позволив небольшим исследовательским группам или компаниям дообучать или перепрофилировать существующие контрольные точки трансформеров без непомерных затрат на вычисления.
Интеграция и развертывание
По словам Бакмана, преобразование существующего трансформера в модель Power Retention сделано максимально простым.
«Это не представляет труда для любой компании, которая уже занимается дообучением, постортовым обучением или тонкой настройкой открытых моделей, — сказал он. — Просто сделайте `pip install retention`, измените одну строку кода архитектуры и возобновите обучение с того места, где остановились».
Он добавил, что после небольшой затраты GPU-часов модель обычно восстанавливает свою первоначальную производительность — после чего получает преимущества в эффективности от архитектуры без внимания.
«Полученная архитектура обеспечит гораздо более быстрое обучение и инференс на длинном контексте, чем раньше», — отметил Бакман.
Что касается инфраструктуры, Бакман сообщил, что основные ядра Brumby написаны на Triton и совместимы с ускорителями как от NVIDIA, так и от AMD. Специализированные ядра CUDA также доступны через собственный фреймворк команды Vidrial. Интеграция с vLLM и другими движками инференса все еще находится в разработке: «Мы еще не интегрировали Power Retention в движки инференса, но это серьезная текущая инициатива в Manifest».
Говоря о распределенном инференсе, Бакман отверг опасения по поводу нестабильности: «Мы не обнаружили, что эта сложность каким-либо образом усугубляется нашей архитектурой рекуррентного состояния. На самом деле контекстно-параллельное обучение и секционирование GPU для многопользовательского инференса становятся технически значительно более чистыми при использовании нашего подхода».
Миссия и долгосрочное видение
Помимо инженерных деталей, Бакман также рассказал о более широкой миссии Manifest. «Наша миссия — обучить нейронную сеть моделированию всех результатов человеческой деятельности», — сказал он.
Цель команды, пояснил он, заключается в том, чтобы выйти за рамки моделирования «артефактов интеллекта» и перейти к моделированию «интеллектуальных процессов, которые их породили». Этот сдвиг, по его утверждению, требует «фундаментального переосмысления» того, как модели проектируются и обучаются — работы, началом которой является Power Retention.
Выпуск Brumby-14B, по его словам, — это «один шаг вперед в долгом шествии» к архитектурам, способным моделировать мыслительные процессы непрерывно и эффективно.
Общественные дебаты и реакция индустрии
Запуск Brumby-14B вызвал оживленные дискуссии на платформе X (бывший Twitter), где исследователи спорили о подаче анонса Manifest AI.
Некоторые, включая исследователя из Meta Ариэль (@redtachyon), утверждали, что слоган «базовая модель за 4000 долларов» вводил в заблуждение, поскольку обучение заключалось в повторном использовании предобученных весов трансформера, а не в обучении с нуля.
«Они перетасовали веса Qwen, немного дообучили их и назвали это „обучением базовой модели за 4 тысячи долларов“», — написала Ариэль.
Бакман ответил публично, пояснив, что первоначальный твит был частью более длинной ветки, объясняющей подход с дообучением. «Я не пытался ввести кого-то в заблуждение, — написал он. — Я разбил это на отдельные твиты, и теперь все злятся из-за первого».
В последующем электронном письме Бакман занял взвешенную позицию в отношении споры. «Конец эры трансформеров еще не наступил, — повторил он, — но шествие уже началось».
Он также признал, что заявление о 4000 долларах, хотя и технически точное в контексте, привлекло внимание именно потому, что бросило вызов ожиданиям относительно стоимости экспериментов на передовом уровне.
Заключение: трещина в стене трансформера?
Выпуск Brumby-14B-Base — это больше, чем инженерная веха; это доказательство концепции того, что доминирование трансформеров наконец-то может столкнуться с реальной конкуренцией.
Заменив внимание силовым удержанием, Manifest AI продемонстрировала, что паритет производительности с передовыми трансформерами возможен при лишь малой доле вычислительных затрат, а «бутылочное горлышко» длинного контекста может быть преодолено без экзотического оборудования.
Более широкие последствия носят двоякий характер. Во-первых, экономика обучения и обслуживания крупных моделей может резко измениться, снизив барьер входа для независимых исследований и небольших организаций.
Во-вторых, архитектурное разнообразие моделей ИИ может снова возрасти, возобновив теоретические и эмпирические исследования после полувека монокультуры трансформеров.
Как выразился Бакман: «Конец эры трансформеров еще не наступил. Наш релиз — это лишь один шаг вперед в долгом пути к будущему».



