BlueField-4 STX от Nvidia повышает производительность ИИ-хранилищ
Источник: VentureBeat · Sean Michael Kerner
Когда агент ИИ теряет контекст посреди задачи из-за того, что традиционные системы хранения не справляются со скоростью инференса, проблема заключается вовсе не в модели, а в хранении данных. На конференции GTC 2026 компания Nvidia представила BlueField-4 STX — модульную эталонную архитектуру, которая встраивает выделенный слой контекстной памяти между графическими процессорами (GPU) и традиционными хранилищами. По заявлению компании, она обеспечивает пятикратное увеличение пропускной способности токенов, четырехкратную энергоэффективность и двукратный рост скорости приема данных по сравнению с обычными СХД на базе CPU.
Узкое место, на которое нацелена STX, — это данные кэша ключей-значений (KV cache). KV-кэш представляет собой сохраненную историю того, что модель уже обработала, — это промежуточные вычисления, которые LLM сохраняет, чтобы не пересчитывать механизм внимания по всему контексту на каждом шаге инференса. Именно он позволяет агенту поддерживать когерентную оперативную память между сессиями, вызовами инструментов и этапами рассуждений. По мере роста контекстных окон и увеличения числа шагов агента этот кэш также увеличивается. Если для возврата на GPU ему приходится проходить через традиционный путь хранения данных, инференс замедляется, а загрузка GPU падает.
STX — это не продукт, который Nvidia продает напрямую. Это эталонная архитектура, которую компания передает своей экосистеме партнеров по хранению данных, чтобы те могли создавать на ее основе ИИ-нативную инфраструктуру.
STX добавляет слой контекстной памяти между GPU и диском
Архитектура построена на базе нового оптимизированного для систем хранения процессора BlueField-4, объединяющего процессор Vera от Nvidia и SuperNIC ConnectX-9. Она работает на базе сетевой архитектуры Spectrum-X Ethernet и программируется с помощью программной платформы Nvidia DOCA.
Первой стоечной реализацией стала платформа контекстной памяти Nvidia CMX. CMX расширяет память GPU высокопроизводительным контекстным слоем, созданным специально для хранения и извлечения данных KV-кэша, которые генерируются большими языковыми моделями во время инференса. Платформа CMX разработана для того, чтобы этот кэш оставался доступным без необходимости совершать лишние обращения к хранилищам общего назначения.
«Традиционные дата-центры предоставляют емкие хранилища общего назначения, но им обычно не хватает оперативности, необходимой для взаимодействия с агентами ИИ, которым приходится работать в рамках множества шагов, инструментов и различных сессий», — отметил Ян Бак, вице-президент Nvidia по гипермасштабируемым и высокопроизводительным вычислениям, в ходе брифинга для прессы и аналитиков.
Отвечая на вопрос издания VentureBeat, Бак подтвердил, что STX также поставляется с программной эталонной платформой в дополнение к аппаратной архитектуре. Nvidia расширяет DOCA, добавляя новый компонент, названный на брифинге DOCA Memo.
«Наши поставщики систем хранения могут использовать возможности программирования процессора BlueField-4 для оптимизации инфраструктуры под задачи агентных ИИ-систем, — сказал Бак. — Помимо эталонной стоечной архитектуры, мы также предоставляем программную эталонную платформу, с помощью которой они смогут внедрять эти инновации и оптимизации для своих клиентов».
Партнеры в сфере хранения данных, строящие решения на базе STX, получают как аппаратный эталонный дизайн, так и программную платформу — программируемую основу для контекстно-оптимизированных хранилищ.
Список партнеров Nvidia охватывает как традиционных лидеров рынка СХД, так и ИИ-нативных облачных провайдеров
Среди производителей систем хранения данных, участвующих в совместной разработке инфраструктуры на базе STX, числятся Cloudian, DDN, Dell Technologies, Everpure, Hitachi Vantara, HPE, IBM, MinIO, NetApp, Nutanix, VAST Data и WEKA. В число производственных партнеров, создающих системы на базе STX, вошли AIC, Supermicro и Quanta Cloud Technology.
Что касается облачного направления и сферы ИИ, то CoreWeave, Crusoe, IREN, Lambda, Mistral AI, Nebius, Oracle Cloud Infrastructure и Vultr уже заявили о внедрении STX для хранения контекстной памяти.
Такое сочетание традиционных тяжеловесов индустрии хранения данных и ИИ-нативных облачных провайдеров — важный сигнал, на который стоит обратить внимание. Nvidia не позиционирует STX как нишевый продукт для гиперскейлеров. Она позиционирует его как эталонный стандарт для любого участника рынка, создающего инфраструктуру хранения для обслуживания агентных нагрузок ИИ — а в ближайшие два-три года к ним будет относиться большинство корпоративных ИИ-развертываний, выполняющих многоэтапный инференс в масштабе предприятия.
Платформы на базе STX станут доступны от партнеров во второй половине 2026 года.
IBM демонстрирует проблемы уровня данных в реальной эксплуатации
IBM занимает двойную позицию в отношении анонса STX. Компания указана в качестве разработчика СХД, участвующего в создании инфраструктуры на базе STX, а Nvidia отдельно подтвердила выбор системы IBM Storage Scale System 6000 — сертифицированной и проверенной на платформах Nvidia DGX — в качестве высокопроизводительной основы хранения для собственной аналитической инфраструктуры на базе GPU.
Кроме того, IBM объявила о расширении сотрудничества с Nvidia на конференции GTC, включая интеграцию с ускорением на GPU между движком watsonx.data Presto SQL от IBM и библиотекой cuDF от Nvidia. Производственный пилотный проект с участием компании Nestlé продемонстрировал на цифрах эффективность такого ускорения: цикл обновления данных в витрине данных Order-to-Cash (от заказа до оплаты), охватывающей 186 стран и 44 таблицы, сократился с 15 минут до трех. IBM сообщила о снижении затрат на 83% и 30-кратном росте соотношения цена/производительность.
Результат Nestlé относится к структурированным аналитическим нагрузкам. Он напрямую не демонстрирует производительность агентного инференса, однако наглядно подкрепляет совместные аргументы IBM и Nvidia: уровень данных сегодня является главным фактором, сдерживающим производительность корпоративного ИИ, а его ускорение с помощью GPU дает ощутимые результаты в реальной работе.
Почему уровень хранения становится важнейшим фактором при планировании инфраструктуры
Появление STX сигнализирует о том, что уровень хранения данных превращается в приоритетный вопрос при планировании корпоративной ИИ-инфраструктуры, а не рассматривается по остаточному принципу после закупки GPU.
Сетевые хранилища общего назначения (NAS) и объектные хранилища изначально не проектировались для обслуживания KV-кэша с требованиями к задержкам на уровне инференса. Системы на базе STX от таких партнеров, как Dell, HPE, NetApp и VAST Data, Nvidia предлагает в качестве практической альтернативы, где программная платформа DOCA обеспечивает уровень программируемости для настройки поведения хранилища под конкретные агентные задачи.
Заявленные показатели производительности — пятикратный рост пропускной способности токенов, четырехкратная энергоэффективность и двукратное увеличение скорости приема данных — получены в сравнении с традиционными архитектурами хранения на базе CPU. Точную базовую конфигурацию для этих сравнений Nvidia не уточнила. Прежде чем эти цифры лягут в основу инфраструктурных решений, эту базовую линию стоит изучить подробнее.
Выход платформ от партнеров ожидается во второй половине 2026 года. Учитывая, что большинство крупных вендоров СХД уже ведут совместную разработку на базе STX, компаниям, планирующим обновление систем хранения для ИИ-инфраструктуры в ближайшие 12 месяцев, следует рассчитывать на появление вариантов на базе STX у своих текущих поставщиков.



