Nutanix повышает эффективность ИИ с помощью комплексного стека
При поддержке Nutanix
По мере того как предприятия переходят от экспериментов с ИИ к развертыванию в производстве, основной статьей расходов становится не обучение базовых моделей, а инфраструктура, необходимая для запуска тысяч параллельных рабочих нагрузок инференса в больших масштабах, где агентированный ИИ выступает в роли катализатора.
Если ранние корпоративные проекты в сфере ИИ включали в себя лишь несколько масштабных запланированных задач обучения, то производственные среды агентированного ИИ требуют постоянной поддержки кратковременных и непредсказуемых запросов, которые потребляют ресурсы графических процессоров (GPU), сети и систем хранения данных таким образом, для работы с которым традиционная инфраструктура никогда не проектировалась. Для лидеров корпоративных технологий этот сдвиг превращает эффективность инфраструктуры в решающий фактор экономики ИИ.
«Каждый сотрудник с ИИ-ассистентом, каждый автоматизированный рабочий процесс, каждый конвейер агентов нуждается в моделях для инференса и генерирует множество токенов, — говорит Аниндо Сенгупта (Anindo Sengupta), вице-президент по продуктам в Nutanix. — Эти запросы на инференс поступают на инфраструктуру GPU, проходят через специализированные сети и извлекают данные из систем хранения, специально созданных для поддержки таких рабочих нагрузок ИИ».
Почему стоимость токена становится ключевым инфраструктурным метриком
За последние два года стоимость инференса в расчете на один токен снизилась примерно на порядок благодаря улучшению эффективности моделей и конкурентной борьбе между облачными провайдерами. Можно было бы ожидать, что корпоративный ИИ становится дешевле. Однако, общие затраты растут, отмечает Сенгупта, указывая на явление, которое экономисты называют парадоксом Джевонса: когда ресурс становится дешевле в использовании, его потребление начинает расти быстрее, чем падает цена.
Таким образом, хотя стоимость одного токена за последние пару лет снизилась почти в 10 раз, уровень потребления вырос более чем в 100 раз. В результате стоимость токена и коэффициент использования GPU становятся главными операционными метриками для корпоративного ИТ наряду с традиционными показателями, такими как время безотказной работы (аптайм) и пропускная способность.
«Стоимость токена по сути отражает совокупную стоимость владения инфраструктурой для обслуживания моделей инференса, — говорит Сенгупта. — А коэффициент использования показывает, получаете ли вы максимальную отдачу от имеющихся у вас ресурсов GPU. Эти метрики будут иметь критическое значение для руководителей корпоративных IT-отделов».
Сложность заключается в огромном количестве переменных. Затраты на токен меняются в зависимости от того, какие модели запускает организация, где выполняются рабочие нагрузки и как структурированы промпты.
«В структуре затрат слишком много переменных, чтобы управлять ими интуитивно, — добавляет Сенгупта. — Их оптимизация — это инженерная задача, которая требует непрерывной настройки».
Рабочие нагрузки агентированного ИИ обнажают пределы возможностей традиционной инфраструктуры
Производственный агентированный ИИ создает профиль рабочей нагрузки, с обработкой которого традиционная корпоративная инфраструктура изначально не справлялась. Классические развертывания в центрах обработки данных ориентированы на предсказуемые нагрузки и долгосрочные циклы планирования. Среды агентированного ИИ генерируют непредсказуемые, высокочастотные всплески коротких запросов на инференс, предъявляют новые требования к сетям и системам хранения данных и меняются быстрее, чем позволяют большинство циклов закупок.
Инфраструктура, поддерживающая агентированный ИИ, также структурно отличается от вычислений на базе CPU. Топология GPU, высокоскоростные интерконнекты, параллельные системы хранения для памяти агентов и KV-кэша, а также сетевые архитектуры, способные обрабатывать разгрузку на DPU (Data Processing Unit), — все это представляет собой новые возможности, требующие новых операционных навыков.
Изолированные (силосные) инфраструктуры только усугубляют эти проблемы. Когда ресурсы GPU, сети и доступ к данным управляются независимо друг от друга, накапливаются неэффективности планирования, падает коэффициент использования, а затраты растут. Организации, использующие фрагментированные стеки, как правило, недоиспользуют дорогостоящие ресурсы GPU и одновременно упираются в узкие места пропускной способности хранилищ и сетей.
Интегрированные стеки и аргументы в пользу полностековой архитектуры
Реакцией со стороны поставщиков инфраструктуры стал переход к тесно интегрированным, проверенным полностековым платформам, разработанным специально для производственных рабочих нагрузок ИИ. Предполагается, что сквозная оптимизация на уровне вычислений, сетей, хранения и программного обеспечения обеспечивает более высокую эффективность использования и меньшую стоимость за токен по сравнению со сборкой компонентов «лучших в своем классе» от разных вендоров.
Решение Nutanix для агентированного ИИ представляет собой один из подходов к решению этой проблемы. Построенное на базе гипервизора Nutanix AHV, платформы Nutanix Enterprise AI и Nutanix Kubernetes Platform, это решение предназначено для управления как традиционным вычислительным слоем, где выполняется оркестрация агентов, так и ускоренным вычислительным слоем, где выполняется инференс. Компания представила усовершенствования для AHV с учетом топологии NVIDIA, которые автоматически оптимизируют распределение GPU, CPU, памяти и DPU между виртуальными машинами, а также перенесла сетевую виртуализацию Nutanix Flow на DPU BlueField, чтобы высвободить циклы GPU и поддерживать пропускную способность без ущерба для безопасности.
Решение поддерживает мгновенное развертывание микросервисов NVIDIA NIM и моделей с открытым исходным кодом, включая Nemotron, а также интегрирует ИИ-шлюз, который управляет доступом к передовым облачным LLM от Anthropic, Google, OpenAI и других компаний. Шлюз также реализует протокол контекста моделей (MCP), позволяя агентам подключаться к корпоративным данным с детализированным контролем доступа. Решение работает на инфраструктуре Cisco, что позволяет организациям развертывать его на уже имеющемся у них оборудовании.
«Интегрируя все компоненты — от гипервизора AHV и виртуализации сетей Flow до платформы Kubernetes, — вы устраняете разрозненность, которая тормозит проекты в сфере ИИ», — поясняет Сенгупта.
Команды платформ и гибкость разработчиков: находим баланс
Один из организационных конфликтов, который обостряется по мере внедрения агентированного ИИ, — это отношения между командами платформ, управляющими общей инфраструктурой, и разработчиками, которые создают и запускают на ее базе агентские приложения. Исторически эти группы работали с разным инструменталем, разными приоритетами и разными временными горизонтами, однако Сенгупта утверждает, что базовая динамика не изменилась, несмотря на развитие технологий.
«Команды платформ продолжат предоставлять каталог ИИ-возможностей по модели самообслуживания, которые также соответствуют потребностям бизнеса и могут быть предложены разработчикам агентированного ИИ, — говорит Сенгупта. — Зрелые ИИ-команды смогут не только эффективно использовать GPU, но и создать операционную модель, обеспечивающую быструю поставку ИИ-инфраструктуры в темпе инноваций, которого ожидают разработчики. Это критически важно для успеха».
Организации, которые наиболее эффективно управляют использованием GPU, как правило, находятся на более продвинутом этапе внедрения ИИ, имеют более устоявшиеся операционные модели и более четкую подотчетность затрат. Для тех компаний, которые находятся в начале этого пути, решения по проектированию инфраструктуры и операционной модели, принимаемые сегодня, определят, смогут ли ИИ-проекты перейти от пилотной стадии к промышленной эксплуатации без того, чтобы затраты и сложность стали ограничивающим фактором.
Операционная модель фабрики ИИ
Формирующейся концепцией для корпоративной ИИ-инфраструктуры становится фабрика ИИ (AI factory) — специализированная среда для создания и запуска рабочих нагрузок ИИ в промышленных масштабах. Проблема заключается в том, что большинству организаций в течение многих лет придется одновременно поддерживать как традиционные, так и ускоренные вычисления, что требует единой операционной модели, охватывающей обе технологические парадигмы без ущерба для гибкости.
Работая на платформе Nutanix под управлением Cisco в составе решений Cisco AI Pods на базе процессоров Intel и оптимизированных под эталонную архитектуру NVIDIA, организации получают готовую к производству полностековую основу. Она позволяет безопасно и эффективно разделять ресурсы фабрик ИИ между тысячами агентов для достижения минимальной стоимости одного токена. Решение устраняет разрыв между командами инфраструктурных и платформенных инженеров, управляющих аппаратным обеспечением, и командами ИИ-инженеров и разработчиков агентированного ИИ, которые создают и запускают соответствующие приложения, делая масштабное использование ИИ действительно доступным.
«Метрики, которые определят, сможет ли организация поддерживать и масштабировать свои инвестиции в ИИ — стоимость токена, коэффициент использования GPU, эффективность планирования, — являются инфраструктурными метриками, — резюмирует Сенгупта. — Успешное управление ими все чаще становится обязательным условием для того, чтобы ИИ был не просто работоспособным, а коммерчески жизнеспособным».
Защитите свою фабрику ИИ и масштабируйте ее — ознакомьтесь с полностековым подходом здесь.
Спонсируемые статьи — это материалы, подготовленные компанией, которая либо оплачивает публикацию, либо имеет деловые отношения с VentureBeat, и они всегда четко маркируются. Для получения дополнительной информации обращайтесь по адресу sales@venturebeat.com.



