IBM поражает воображение выпуском языковой модели Granite 4 и гибридной архитектурой Mamba/Transformer
Компания IBM сегодня анонсировала выход Granite 4.0 — новейшего поколения собственной линейки моделей с открытым исходным кодом (LLM), разработанных для достижения баланса между высокой производительностью, сниженными требованиями к памяти и экономичностью.
Несмотря на то что «Big Blue» («Голубой гигант» — такое прозвище часто носит компания, основанная в 1911 году и насчитывающая уже 114 лет истории) является одной из старейших действующих технологических компаний США, она уже успела поразить многих специалистов и энтузиастов сферы ИИ новым семейством моделей Granite 4.0. Эти модели обеспечивают высокую производительность в сторонних бенчмарках; имеют мягкую, дружелюбную к бизнесу лицензию (Apache 2.0), которая позволяет разработчикам и предприятиям свободно брать, модифицировать и развертывать модели в собственных коммерческих целях; и, что, пожалуй, наиболее важно, символически возвращают США в число конкурентоспособных игроков на фоне растущего потока высокопроизводительных открытых LLM нового поколения из Китая, создаваемых, в частности, плодотворной командой Qwen компании Alibaba — наряду с OpenAI и их семейством моделей gpt-oss, выпущенным ранее этим летом.
Компания Meta (признана экстремистской организацией и запрещена в РФ), материнская компания Facebook и Instagram, некогда считалась мировым и американским лидером в области открытых LLM благодаря своим моделям Llama. Однако после разочаровывающего релиза семейств моделей Llama 4 в апреле и отсутствия запланированного мощнейшего варианта Llama 4 Behemoth она перешла к другой стратегии: теперь компания сотрудничает со сторонними лабораториями, такими как Midjourney, в сфере ИИ-продуктов и одновременно продолжает формирование собственной дорогостоящей внутренней команды по разработке «суперинтеллекта» в области ИИ.
Неудивительно, что ИИ-инженер Александр Дориа (он же Пьер-Карл Ланглуа) заметил с помощью уморительного мема из фильма «Смертельное оружие», что «IBM снова надевает костюм после провала Llama 4» и что «у нас наконец-то появился свой западный qwen».
Гибридная теория (трансформеры / Mamba)
В основе релиза IBM Granite 4.0 лежит новый гибридный дизайн, объединяющий две совершенно разные архитектуры, или базовые организационные структуры, для рассматриваемых LLM: трансформеры и Mamba.
Трансформеры, представленные в 2017 году Васуани (Vaswani) с соавторами в знаменитой статье Google «Attention Is All You Need», лежат в основе большинства используемых сегодня больших языковых моделей.
В таком подходе каждый токен — по сути, небольшой фрагмент текста, например слово или его часть, — может сопоставляться с каждым другим токеном во входных данных. Именно это сопоставление по принципу «каждый с каждым» наделяет трансформеры мощной способностью улавливать контекст и смысл во всем фрагменте текста.
Обратной стороной является эффективность: поскольку модель должна вычислять взаимосвязи между каждой возможной парой токенов в контекстном окне, требования к вычислениям и памяти стремительно растут по мере увеличения длины входных данных. Такое квадратичное масштабирование делает запуск трансформеров дорогостоящим при обработке очень длинных документов или при высоких объемах данных.
Mamba, напротив, представляет собой более новую архитектуру, разработанную в конце 2023 года исследователями Альбертом Гу (Albert Gu) и Три Дао (Tri Dao) из Университета Карнеги — Меллон и Принстонского университета. Вместо одновременного сравнения каждого токена со всеми остальными она обрабатывает токены по одному, обновляя свое внутреннее состояние по мере прохождения последовательности. Такая конструкция масштабируется лишь линейно относительно длины входных данных, что делает ее гораздо более эффективной при работе с длинными документами или множеством запросов одновременно. Обратная сторона заключается в том, что трансформеры все же демонстрируют лучшие результаты в определенных типах рассуждений и обучении на малом количестве примеров (few-shot learning), где полезно удерживать в памяти множество детальных сравнений токенов между собой.
Это обеспечивает гораздо более высокую эффективность, особенно для длинных документов или многосессионного инференса, хотя трансформеры сохраняют преимущества в некоторых задачах логического вывода и обучения на ограниченном числе примеров.
Но независимо от того, построена ли модель на трансформерах, Mamba или их гибриде, механизм генерации новых слов работает одинаково. На каждом шаге модель не просто выбирает из того, что уже есть в контекстном окне. Вместо этого она использует свои внутренние веса, сформированные в результате обучения на триллионах текстовых примеров, чтобы предсказать наиболее вероятный следующий токен из всего своего словаря. Именно поэтому при запросе «Столица Франции — это…» модель может выдать «Париж», даже если слово «Париж» отсутствовало во входном тексте. Она усвоила из бесчисленных тренировочных примеров, что «Париж» является весьма вероятным продолжением в данном контексте. Иными словами, контекстное окно направляет предсказание, но векторное пространство (эмбеддинг) — выученное моделью представление всех известных ей токенов — предоставляет сами слова, которые она может сгенерировать.
Соединяя слои Mamba-2 с блоками трансформеров, Granite 4.0 стремится предложить лучшее от обоих миров: эффективность Mamba и контекстную точность трансформеров.
Это первый официальный релиз линейки Granite, в котором применяется гибридный подход. Компания IBM представила его предварительную версию в начале 2025 года в виде Granite-4.0-Tiny-Preview, однако Granite 4.0 знаменует собой первое полноценное семейство моделей компании, построенное на комбинации Mamba и трансформеров.
Granite 4.0 позиционируется как готовая к внедрению на предприятиях альтернатива традиционным моделям на базе трансформеров, с особым акцентом на агентские задачи ИИ, такие как следование инструкциям, вызов функций и генерация с дополненным извлечением (RAG). Модели распространяются с открытым исходным кодом под лицензией Apache 2.0, криптографически подписаны для подтверждения подлинности и выделяются как первое семейство открытых языковых моделей, сертифицированное по стандарту ISO 42001, который является международным стандартом управления и прозрачности в сфере ИИ.
Снижение потребности в памяти, расширение доступности
Одной из ключевых особенностей Granite 4.0 является способность существенно снижать потребление памяти графического процессора по сравнению с традиционными большими языковыми моделями.
IBM сообщает, что гибридная архитектура Mamba-transformer способна сократить требования к оперативной памяти более чем на 70% (!!!) в производственных средах, особенно для рабочих нагрузок, связанных с большими контекстами и множеством одновременных сессий.
График производительности и памяти Granite 4.0. Источник: IBM
Бенчмарки, выпущенные одновременно с запуском, наглядно демонстрируют эти улучшения.
Granite-4.0-H-Small, модель типа «состав экспертов» (Mixture-of-Experts) с 32 млрд параметров и 9 млрд активных параметров, поддерживает высокую пропускную способность на одном графическом процессоре NVIDIA H100, продолжая ускоряться даже при нагрузках, которые обычно создают критическую нагрузку на системы, состоящие исключительно из трансформеров.
Такая эффективность напрямую транслируется в снижение затрат на аппаратное обеспечение для предприятий, выполняющих интенсивные задачи инференса.
Для небольших развертываний или инсталляций на периферийных устройствах (edge) Granite 4.0 предлагает два более легких варианта: Granite-4.0-H-Tiny, гибрид с 7 млрд параметров и 1 млрд активных параметров, и Granite-4.0-H-Micro, плотный гибрид с 3 млрд параметров. IBM также выпускает Granite-4.0-Micro — модель с 3 млрд параметров, состоящую исключительно из трансформеров, предназначенную для платформ, которые еще не оптимизированы под архитектуры на базе Mamba.
Тесты производительности
Метрики производительности показывают, что новые модели не только снижают затраты, но и успешно конкурируют с более крупными системами в критически важных для бизнеса задачах.
Согласно бенчмарку IFEval от Stanford HELM, который измеряет, насколько хорошо LLM следуют инструкциям пользователей, модель Granite-4.0-H-Small превосходит практически все модели с открытыми весами по точности следования инструкциям, уступая лишь значительно превосходящей ее по размеру модели Llama 4 Maverick от Meta.
График сравнения LLM Granite 4.0 с другими моделями с открытым исходным кодом в бенчмарке Stanford HELM. Источник: IBM
Модели также демонстрируют отличные результаты в таблице лидеров Berkeley Function Calling Leaderboard v3, где Granite-4.0-H-Small обеспечивает выгодное соотношение между точностью и стоимостью хостингового API. В задачах генерации с дополненным извлечением (RAG) модели Granite 4.0 демонстрируют одни из самых высоких средних показателей точности среди открытых конкурентов.
Примечательно, что в IBM подчеркивают: даже самые маленькие модели Granite 4.0 превосходят Granite 3.3 8B, несмотря на то что составляют менее половины ее размера. Это подчеркивает прирост эффективности, достигнутый как за счет архитектурных изменений, так и благодаря усовершенствованным методам обучения.
Доверие, безопасность и защита
Наряду с технической эффективностью компания IBM делает акцент на вопросах управления и доверия. Granite — первое семейство открытых моделей, получившее сертификат ISO/IEC 42001:2023, что подтверждает соответствие международным стандартам подотчетности в сфере ИИ, конфиденциальности данных и прозрачности.
Компания также заключила партнерское соглашение с HackerOne для запуска программы вознаграждения за найденные уязвимости (bug bounty) для Granite, предлагая до 100 000 долларов за уязвимости, которые могут привести к раскрытию брешей в безопасности или состязательным рискам (adversarial risks). Кроме того, каждая контрольная точка (checkpoint) моделей Granite 4.0 подписана криптографически, что позволяет разработчикам проверять происхождение и целостность перед развертыванием.
IBM предоставляет защиту от судебных исков (indemnification) клиентам, использующим Granite на платформе watsonx.ai, покрывая претензии третьих лиц касательно прав интеллектуальной собственности на контент, созданный с помощью ИИ.
Обучение и дорожная карта
Модели Granite 4.0 обучались на корпусе объемом 22 триллиона токенов, полученном из релевантных для корпоративного сектора наборов данных, включая DataComp-LM, Wikipedia, а также из отфильтрованных подмножеств, предназначенных для поддержки языковых задач, работы с кодом, математики, многоязычных задач и кибербезопасности.
Последующее дообучение разделено на модели, настроенные на следование инструкциям (выпущены сегодня), и варианты с упором на рассуждения («Thinking»), релиз которых ожидается позднее этой осенью.
К концу 2025 года IBM планирует расширить семейство за счет дополнительных моделей, включая Granite 4.0 Medium для более тяжелых корпоративных нагрузок и Granite 4.0 Nano для периферийных вычислений (edge-развертываний).
Широкая доступность на различных платформах
Модели Granite 4.0 доступны сразу на платформах Hugging Face и IBM watsonx.ai, а также распространяются через партнеров, среди которых Dell Technologies, Docker Hub, Kaggle, LM Studio, NVIDIA NIM, Ollama, OPAQUE и Replicate.
В скором времени ожидается поддержка через Amazon SageMaker JumpStart и Microsoft Azure AI Foundry.
Гибридная архитектура поддерживается в основных фреймворках инференса, включая vLLM 0.10.2 и Hugging Face Transformers.
Совместимость также расширена на llama.cpp и MLX, хотя работа по оптимизации продолжается. Модели также можно использовать в Unsloth для тонкой настройки (fine-tuning) и в Continue для создания кастомных ИИ-ассистентов программирования.
Фокус на корпоративный сектор
Предварительное тестирование моделей корпоративными партнерами, включая EY и Lockheed Martin, определило вектор этого запуска.
IBM подчеркивает, что модели адаптированы под реальные потребности бизнеса, такие как поддержка рабочих процессов с несколькими агентами (multi-agent workflows), автоматизация службы поддержки клиентов и крупномасштабные поисковые системы.
Модели Granite 4.0 доступны в версиях Base (базовые) и Instruct (инструктивные), причем варианты Instruct оптимизированы для выполнения корпоративных инструкций. Предстоящая серия «Thinking» будет ориентирована на углубленный логический вывод.
Альтернативные гибридные модели Mamba / Transformer
Помимо IBM, несколько крупных игроков уже разрабатывают альтернативные варианты сочетания архитектур Transformers и Mamba:
|
Модель |
Гибридная стратегия / архитектура |
Ключевые особенности |
|
Чередует блоки Transformer и слои Mamba, используя смесь экспертов (MoE) в некоторых слоях |
Поддерживает длину контекста до 256 тыс. токенов, обеспечивает более высокую пропускную способность и меньшее потребление памяти по сравнению с чистыми трансформерами, сохраняя конкурентоспособные показатели в бенчмарках |
|
|
Заменяет большинство слоев внимания блоками Mamba-2, сохраняя лишь несколько слоев внимания там, где это необходимо |
Демонстрирует до 3 раз более высокую пропускную способность инференса по сравнению с аналогами на базе чистых трансформеров при сопоставимой точности в бенчмарках |
|
|
Оптимизированный для рассуждений гибрид, созданный на базе архитектуры Nemotron |
Заявляет о 6-кратном приросте пропускной способности в задачах на рассуждение при сохранении или превышении показателей точности |
|
|
Доменно-специфичные варианты |
Гибридизированные архитектуры в мультимодальных моделях, такие как замена компонентов декодера на слои Mamba |
Показывает, что гибридный подход выходит за рамки текста и применим в зрительно-языковых приложениях (vision-language) |
Семейство Qwen от Alibaba остается плотной архитектурой исключительно на базе декодера-трансформера (decoder-only Transformer) без слоев Mamba или SSM в своих основных моделях. Тем не менее, экспериментальные ответвления, такие как Vamba-Qwen2-VL-7B, показывают, что создание гибридов на базе Qwen возможно, особенно в зрительно-языковых сценариях. Однако на данный момент сам Qwen не участвует в гибридной волне.
Что выпуск Granite 4.0 означает для бизнеса и чего ждать дальше
Granite 4.0 отражает стратегию IBM по объединению открытого доступа с корпоративным уровнем безопасности, масштабируемости и эффективности. Сосредоточившись на снижении затрат на инференс и укреплении доверия за счет стандартов управления, IBM позиционирует семейство Granite как практичную основу для предприятий, создающих масштабные ИИ-приложения.
Для США этот релиз имеет символическое значение: на фоне того, как Meta отходит от роли лидера в сфере моделей с открытыми весами после неоднозначного приема Llama 4, а семейство Qwen от Alibaba стремительно развивается в Китае, шаг IBM вновь делает американский корпоративный сектор конкурентоспособной силой на рынке общедоступных моделей.
Предоставляя лицензию Apache 2.0 для Granite 4.0, подписывая модели криптографически и сертифицируя их по стандарту ISO 42001, IBM демонстрирует как открытость, так и ответственность в момент, когда доверие, эффективность и доступность выходят на первый план. Это особенно привлекательно для американских и западных организаций, которые могут проявлять интерес к моделям с открытым исходным кодом, но опасаться — обоснованно или нет — продуктов китайского происхождения из-за возможных политических последствий и контрактов с правительством США.
Для специалистов внутри организаций такое позиционирование не является абстрактным. Ведущие ИИ-инженеры, перед которыми стоит задача управления полным жизненным циклом LLM, увидят в меньшем объеме памяти Granite 4.0 способ ускорить развертывание и масштабирование силами небольших команд.
Старшие ИИ-инженеры, выполняющие роль оркестраторов и обязанные балансировать между бюджетными ограничениями и потребностью в эффективности, смогут воспользоваться совместимостью Granite с основными платформами, такими как SageMaker и Hugging Face, для оптимизации конвейеров без привязки к проприетарным экосистемам.
Старшие дата-инженеры, отвечающие за интеграцию ИИ со сложными системами данных, оценят эффективность гибридных моделей при работе с длинными контекстами, что позволяет осуществлять генерацию с дополненным извлечением (RAG) на больших наборах данных с меньшими затратами.
А директорам по ИТ-безопасности, отвечающим за повседневную защиту, программа bug bounty от IBM, криптографические подписи и аккредитация по стандарту ISO предоставляют четкие сигналы соответствия требованиям корпоративного комплаенса.
Нацеливаясь на эти конкретные роли с помощью семейства моделей, которое является эффективным, открытым и адаптированным для корпоративного использования, IBM не просто добивается внедрения, но и формирует уникальный американский ответ на вызов открытого кода со стороны Qwen и других китайских участников. Тем самым Granite 4.0 ставит IBM в центр нового этапа глобальной гонки LLM — этапа, определяемого не только размером и скоростью, но и доверием, экономической эффективностью и готовностью к развертыванию в реальных условиях.
С учетом запланированного на конец года выпуска дополнительных моделей и расширения доступности на ключевых платформах разработки ИИ, Granite 4.0 призван сыграть центральную роль в видении IBM в отношении готового к работе на предприятиях ИИ с открытым исходным кодом.



