Чипы Nvidia Blackwell снижают затраты на вывод из эксплуатации в 10 раз
Снижение затрат на инференс обычно достигается за счет сочетания аппаратного и программного обеспечения. В новом аналитическом отчете, опубликованном Nvidia в четверг, подробно описывается, как четыре ведущих провайдера инференса сообщают о сокращении стоимости одного токена в 4–10 раз.
Столь драматического снижения затрат удалось добиться благодаря использованию платформы Blackwell от Nvidia в сочетании с открытыми моделями. Данные о промышленном развертывании от компаний Baseten, DeepInfra, Fireworks AI и Together AI демонстрируют значительное улучшение экономической эффективности в сферах здравоохранения, гейминга, агентских чат-бот-систем и обслуживания клиентов, по мере того как предприятия масштабируют ИИ от пилотных проектов до миллионов пользователей.
Сокращение затрат в 4–10 раз, о котором сообщают провайдеры инференса, потребовало объединения оборудования Blackwell с двумя другими элементами: оптимизированными программными стеками и переходом от проприетарных моделей к моделям с открытым исходным кодом, которые теперь не уступают по уровню интеллектуальных возможностей ведущим фронтирным моделям. Согласно анализу, одни только аппаратные улучшения обеспечили двукратный прирост в некоторых развертываниях. Для достижения более масштабного снижения затрат потребовалось внедрение форматов с низкой точностью вычислений, таких как NVFP4, и отказ от закрытых API с премиальными тарифными ставками.
Экономика процесса выглядит парадоксально. Снижение затрат на инференс требует инвестиций в более производительную инфраструктуру, поскольку рост пропускной способности напрямую транслируется в уменьшение стоимости обработки одного токена.
«Производительность — это то, что снижает стоимость инференса, — рассказал Дион Харрис (Dion Harris), старший директор по решениям для высокопроизводительных вычислений (HPC) и гиперскейлеров ИИ в Nvidia, в эксклюзивном интервью VentureBeat. — В сфере инференса мы наблюдаем, как пропускная способность буквально превращается в реальную долларовую ценность и ведет к снижению затрат».
Практическое развертывание демонстрирует снижение затрат в 4–10 раз
В своем блоге Nvidia подробно описала четыре примера развертывания у клиентов, показав, как сочетание инфраструктуры Blackwell, оптимизированных программных стеков и моделей с открытым исходным кодом снижает затраты для различных отраслевых рабочих нагрузок. Эти кейсы охватывают высоконагруженные сценарии, где экономика инференса напрямую определяет жизнеспособность бизнеса.
По данным Nvidia, компания Sully.ai сократила расходы на медицинский ИИ-инференс на 90% (в 10 раз), одновременно улучшив время отклика на 65%, перейдя с проприетарных моделей на модели с открытым исходным кодом, работающие на платформе Baseten на базе Blackwell. Компания вернула врачам более 30 миллионов минут рабочего времени за счет автоматизации медицинского кодирования и ведения заметок, которые раньше требовали ручного ввода данных.
Nvidia также сообщила, что компания Latitude сократила в 4 раза затраты на инференс в своей игровой платформе AI Dungeon, запустив крупные экспертные модели со смешанной структурой (MoE) на инфраструктуре DeepInfra с чипами Blackwell. Стоимость миллиона токенов упала с 20 центов на предыдущей платформе Nvidia Hopper до 10 центов на Blackwell, а после внедрения нативного формата низкой точности NVFP4 от Blackwell — до 5 центов. Само по себе «железо» дало двукратный прирост, но для достижения 4-кратного потребовалось изменить формат точности.
Согласно данным Nvidia, фонд Sentient Foundation добился повышения эффективности затрат на 25–50% для своей платформы агентских чатов благодаря использованию оптимизированного для Blackwell стека инференса Fireworks AI. Платформа управляет сложными многоагентными рабочими процессами и во время вирусного запуска обработала 5,6 миллиона запросов всего за одну неделю, сохранив при этом низкую задержку (латентность).
В Nvidia отметили, что сервис Decagon сократил затраты на один запрос в 6 раз при поддержке голосовых ИИ-ассистентов службы поддержки, запустив свой мультимодельный стек на инфраструктуре Together AI с чипами Blackwell. Время отклика оставалось на уровне менее 400 миллисекунд даже при обработке тысяч токенов на запрос, что критически важно для голосового взаимодействия, где задержки заставляют пользователей вешать трубку или терять доверие.
Технические факторы, обеспечивающие 4–10-кратный прирост эффективности
Разброс показателей сокращения затрат от 4 до 10 раз в различных вариантах развертывания обусловлен сочетанием разных технических оптимизаций, а не только аппаратными различиями. Выделяются три основных фактора: внедрение форматов пониженной точности, выбор архитектуры моделей и интеграция программного стека.
Форматы точности демонстрируют наиболее очевидный эффект. Кейс Latitude наглядно это подтверждает. Переход с архитектуры Hopper на Blackwell обеспечил двукратное снижение затрат за счет аппаратных улучшений. Внедрение NVFP4 — родного формата пониженной точности от Blackwell — удвоило этот результат, доведя общее сокращение до 4 раз. NVFP4 уменьшает количество бит, необходимых для представления весов и активаций модели, позволяя выполнять больше вычислений за один цикл графического процессора без потери точности. Этот формат особенно хорошо работает для MoE-моделей, где для каждого запроса на инференс активируется лишь подмножество модели.
Архитектура моделей имеет значение. MoE-модели, которые активируют различные специализированные субмодели в зависимости от входных данных, получают преимущество от интерфейса NVLink в архитектуре Blackwell, обеспечивающего быструю связь между экспертами. «Обеспечение взаимодействия этих экспертов через интерфейс NVLink позволяет рассуждать очень быстро», — отметил Харрис. Плотные модели, активирующие все параметры для каждого инференса, используют эту архитектуру не столь эффективно.
Интеграция программного стека создает дополнительные преимущества в производительности. По словам Харриса, подход Nvidia к совместному проектированию (co-design), при котором аппаратное обеспечение Blackwell, масштабируемая архитектура NVL72 и такое ПО, как Dynamo и TensorRT-LLM, оптимизируются в комплексе, также играет важную роль. Развертывание компании Baseten для Sully.ai использовало этот интегрированный стек, объединив NVFP4, TensorRT-LLM и Dynamo для достижения 10-кратного снижения затрат. Провайдеры, использующие альтернативные фреймворки вроде vLLM, могут демонстрировать менее впечатляющий прирост.
Характеристики рабочей нагрузки имеют значение. Модели рассуждений (reasoning models) демонстрируют особые преимущества на платформе Blackwell, поскольку они генерируют значительно больше токенов для достижения более точных ответов. Способность платформы эффективно обрабатывать столь протяженные последовательности токенов посредством дезагрегированного обслуживания, при котором предварительное заполнение контекста и генерация токенов обрабатываются раздельно, делает такие рабочие нагрузки рентабельными.
Командам, оценивающим потенциальное сокращение затрат, следует сопоставить профили своих рабочих нагрузок с этими факторами. Задачи с высокой генерацией токенов, использующие экспертные модели (MoE) в сочетании с интегрированным программным стеком Blackwell, приблизятся к 10-кратному диапазону. Меньшие объемы токенов на плотных моделях с использованием альтернативных фреймворков окажутся ближе к 4-кратному показателю.
Что командам следует протестировать перед миграцией
Хотя эти кейсы сосредоточены на развертывании решений Nvidia Blackwell, у предприятий есть и другие пути снижения затрат на инференс. Серия чипов AMD MI300, TPU от Google и специализированные ускорители инференса от Groq и Cerebras предлагают альтернативные архитектуры. Облачные провайдеры также продолжают оптимизировать свои сервисы инференса. Вопрос заключается не в том, является ли Blackwell единственным вариантом, а в том, насколько конкретная комбинация аппаратного, программного обеспечения и моделей отвечает требованиям конкретной рабочей нагрузки.
Предприятиям, рассматривающим инференс на базе Blackwell, следует начать с расчета того, оправдывают ли их рабочие нагрузки изменения в инфраструктуре.
«Предприятиям необходимо исходить из своих рабочих нагрузок, вариантов использования и ресурсных ограничений», — рассказала VentureBeat Шрути Копаркар (Shruti Koparkar), специалист по маркетингу ИИ-продуктов в Nvidia.
Все варианты развертывания, добившиеся 6–10-кратного улучшения, были связаны с высоконагруженными приложениями, чувствительными к задержкам и обрабатывающими миллионы запросов ежемесячно. Командам с меньшими объемами или приложениями, где допустимая задержка превышает одну секунду, следует изучить возможности оптимизации ПО или смены моделей, прежде чем задумываться об обновлении инфраструктуры.
Тестирование важнее спецификаций провайдера. Копаркар подчеркивает, что провайдеры публикуют метрики пропускной способности и задержки, но они отражают идеальные условия.
«Если рабочая нагрузка критически чувствительна к задержкам, им, возможно, стоит протестировать пару провайдеров и посмотреть, кто сможет обеспечить необходимый минимум при минимальных затратах», — отметила она. Командам следует запускать реальные рабочие нагрузки на инфраструктуре нескольких провайдеров Blackwell, чтобы измерить реальную производительность в условиях своих специфических паттернов использования и всплесков трафика, вместо того чтобы полагаться на опубликованные бенчмарки.
Поэтапный подход, использованный компанией Latitude, служит хорошей моделью для оценки. Компания сначала перешла на «железо» Blackwell и зафиксировала двукратный прирост, а затем внедрила формат NVFP4, чтобы достичь 4-кратного общего сокращения. Команды, работающие сейчас на Hopper или другой инфраструктуре, могут проверить, удастся ли им добиться значительной экономии за счет изменения формата точности и программной оптимизации на существующем «железе», прежде чем брать на себя обязательства по полной миграции инфраструктуры. Запуск моделей с открытым исходным кодом на текущей инфраструктуре может обеспечить половину потенциального снижения затрат без новых инвестиций в оборудование.
Выбор провайдера требует понимания различий в программных стеках. Хотя инфраструктуру Blackwell предлагают сразу несколько провайдеров, их программные реализации различаются. Некоторые используют интегрированный стек Nvidia с применением Dynamo и TensorRT-LLM, в то время как другие задействуют такие фреймворки, как vLLM. Харрис признает, что между этими конфигурациями существуют различия в производительности. Командам следует оценивать реальное программное обеспечение каждого провайдера и то, насколько оно соответствует требованиям их рабочих нагрузок, а не исходить из предположения, что все развертывания Blackwell работают абсолютно одинаково.
Экономическое уравнение выходит за рамки стоимости одного токена. Специализированные провайдеры инференса, такие как Baseten, DeepInfra, Fireworks и Together, предлагают оптимизированные варианты развертывания, но требуют управления дополнительными отношениями с поставщиками. Управляемые сервисы (managed services) от AWS, Azure или Google Cloud могут иметь более высокую стоимость за токен, но при этом отличаются меньшей операционной сложностью. Чтобы определить, какой подход обеспечивает лучшую экономику для их конкретной ситуации, командам следует рассчитывать общие затраты с учетом операционных издержек, а не только цены инференса.



