Nvidia только что признала, что эра универсальных графических процессоров подходит к концу
Стратегическая лицензионная сделка Nvidia с Groq на сумму 20 миллиардов долларов знаменует собой один из первых четких шагов в битве на четыре фронта за будущее стека искусственного интеллекта. В 2026 году эта борьба станет очевидной для создателей корпоративного ПО.
Для тех технических лиц, принимающих решения, с которыми мы общаемся каждый день — людей, создающих приложения ИИ и управляющие ими конвейеры данных, — эта сделка является сигналом о том, что эпоха универсальных графических процессоров (GPU) как стандартного решения для инференса ИИ подходит к концу.
Мы вступаем в эпоху дезагрегированной архитектуры инференса, в которой сам кремний разделяется на два разных типа, чтобы приспособиться к миру, требующему как огромного контекста, так и мгновенных рассуждений.
Почему инференс раскалывает архитектуру GPU надвое
Чтобы понять, почему генеральный директор Nvidia Дженсен Хуанг (Jensen Huang) потратил треть своих сообщивших о 60 миллиардах долларов наличных средств на лицензионную сделку, нужно взглянуть на экзистенциальные угрозы, нависшие над заявленной 92% рыночной долей его компании.
В конце 2025 года индустрия достигла переломного момента: по данным Deloitte, впервые в истории инференс — этап, на котором обученные модели фактически работают — превзошел обучение по общей выручке дата-центров. В этом новом «инференс-перевороте» метрики изменились. Хотя точность остается базовым требованием, теперь борьба идет за задержку (латентность) и способность поддерживать «состояние» в автономных агентах.
Существует четыре фронта этой борьбы, и каждый из них ведет к одному и тому же выводу: рабочие нагрузки инференса фрагментируются быстрее, чем графические процессоры успевают адаптироваться под общие задачи.
1. Раскол GPU надвое: префилл против декодирования
Гэвин Бейкер (Gavin Baker), инвестор Groq (и поэтому предвзятый, но также необычно хорошо разбирающийся в архитектуре), четко резюмировал главный стимул сделки с Groq: «Инференс дезагрегируется на префилл и декодирование».
Префилл (Prefill) и декодирование (Decode) — это две разные фазы:
-
Фаза префилла: Представьте это как этап «промпта» (запроса) пользователя. Модель должна усвоить огромные объемы данных — будь то кодовая база на 100 000 строк или часовое видео — и вычислить контекстное понимание. Это задача, ограниченная вычислительной мощностью (compute-bound), требующая масштабного матричного умножения, с которым графические процессоры Nvidia исторически справляются превосходно.
-
Фаза генерации (декодирования): Это фактическая «генерация» токен за токеном. Как только промпт усвоен, модель генерирует одно слово (или токен) за раз, возвращая каждое из них обратно в систему для прогнозирования следующего. Это задача, ограниченная пропускной способностью памяти (memory-bandwidth bound). Если данные не могут перемещаться из памяти в процессор достаточно быстро, модель начинает заикаться, насколько бы мощным ни был GPU. (В этом заключалась слабость Nvidia, и именно здесь блестяще проявляют себя специализированный процессор обработки языковых данных (LPU) от Groq и связанная с ним SRAM-память. Подробнее об этом чуть позже).
Nvidia анонсировала предстоящее семейство чипов Vera Rubin, которое разрабатывается специально для работы с этим разделением. Компонент Rubin CPX из этого семейства является назначенной «рабочей лошадкой» для префилла, оптимизированной для огромных контекстных окон в 1 миллион токенов и более. Чтобы сделать этот масштаб доступным по цене, компания отказывается от астрономически дорогой памяти с высокой пропускной способностью (HBM) — текущего золотого стандарта памяти Nvidia, которая располагается прямо рядом с кристалл GPU, — и вместо этого использует 128 ГБ нового типа памяти, GDDR7. Хотя HBM обеспечивает экстремальную скорость (хотя и не такую высокую, как статическая память с произвольным доступом (SRAM) от Groq), ее запасы на GPU ограничены, а стоимость является препятствием для масштабирования; GDDR7 же предоставляет более экономичный способ обработки массивных наборов данных.
Между тем, кремний в «стиле Groq», который Nvidia интегрирует в свою дорожную карту инференса, будет служить высокоскоростным движком «декодирования». Это направлено на нейтрализацию угроз со стороны альтернативных архитектур, таких как TPU от Google, и сохранение доминирования CUDA — программной экосистемы Nvidia, которая служила ее главным защитным рвом на протяжении более десяти лет.
Всего этого оказалось достаточно для инвестора Groq Бейкера, чтобы предсказать: шаг Nvidia по лицензированию Groq приведет к отмене всех остальных специализированных чипов ИИ — за исключением TPU от Google, AI5 от Tesla и Trainium от AWS.
2. Дифференцированная мощь SRAM
В основе технологии Groq лежит память SRAM. В отличие от DRAM, установленной в вашем ПК, или HBM на GPU Nvidia H100, SRAM втравлена непосредственно в логику процессора.
Майкл Стюарт (Michael Stewart), управляющий партнер венчурного фонда Microsoft M12, описывает SRAM как лучшее решение для перемещения данных на короткие расстояния с минимальными затратами энергии. «Энергия, необходимая для перемещения одного бита в SRAM, составляет около 0,1 пикоджоуля или меньше, — сказал Стюарт. — Перемещение между DRAM и процессором обходится примерно в 20–100 раз хуже».
В реализациях 2026 года, где агенты должны рассуждать в реальном времени, SRAM выступает в качестве идеального «блокнота для записей» (scratchpad): высокоскоростного рабочего пространства, где модель может манипулировать символическими операциями и сложными процессами рассуждения без «пустых тактов» пересылки во внешнюю память.
Тем не менее, у SRAM есть существенный недостаток: она физически громоздкая и дорогая в производстве, а значит, ее емкость ограничена по сравнению с DRAM. Именно здесь Вал Берковичи (Val Bercovici), директор по искусственному интеллекту в Weka (еще одной компании, предлагающей память для GPU), видит сегментацию рынка.
Рабочие нагрузки ИИ, дружественные к Groq, где SRAM имеет преимущество, — это те, которые используют небольшие модели с количеством параметров до 8 миллиардов, отметил Берковичи. Тем не менее, это немалый рынок. «Это просто гигантский рыночный сегмент, который не обслуживался Nvidia: периферийный инференс (edge inference), малая задержка, робототехника, голос, устройства Интернета вещей (IoT) — то, что мы хотим запускать на наших телефонах без облака ради удобства, производительности или конфиденциальности», — сказал он.
Эта «золотая середина» в 8B важна потому, что 2025 год ознаменовался взрывом популярности дистилляции моделей, в рамках которой многие корпоративные компании сокращают массивные модели до высокоэффективных уменьшенных версий. Хотя SRAM непрактична для «рубежных» (frontier) моделей с триллионами параметров, она идеально подходит для этих более мелких и быстродействующих моделей.
3. Угроза со стороны Anthropic: рост «переносимого стека»
Пожалуй, самым недооцененным фактором этой сделки является успех Anthropic в создании стека, переносимого между различными ускорителями.
Компания стала пионером в разработке переносимого инженерного подхода для обучения и инференса — по сути, программного уровня, позволяющего ее моделям Claude работать на нескольких семействах ускорителей ИИ, включая графические процессоры Nvidia и Ironwood TPU от Google. До недавнего времени доминирование Nvidia защищалось тем, что запуск высокопроизводительных моделей за пределами стека Nvidia был техническим кошмаром. «Это Anthropic, — сказал мне Берковичи из Weka. — Тот факт, что Anthropic смогла… создать программный стек, способный работать как на TPU, так и на GPU, на мой взгляд, недостаточно оценивается на рынке».
(Раскрытие информации: Weka выступала спонсором мероприятий VentureBeat).
Компания Anthropic недавно обязалась получить доступ к 1 миллиону TPU от Google, что эквивалентно более чем одному гигаватту вычислительной мощности. Такой мультиплатформенный подход гарантирует, что компания не станет заложником ценовой политики или дефицита поставок Nvidia. Поэтому для Nvidia сделка с Groq является в равной степени защитным шагом. Интегрируя сверхбыстрый IP-инференс от Groq, Nvidia гарантирует, что наиболее чувствительные к производительности рабочие нагрузки — такие как запуск небольших моделей или работа в составе агентов реального времени — могут быть размещены в экосистеме CUDA от Nvidia, даже если конкуренты попытаются уйти на Ironwood TPU от Google. CUDA — это специальное программное обеспечение, предоставляемое Nvidia разработчикам для интеграции графических процессоров.
4. Война за «государственность» агентов: Manus и KV-кэш
Тайминг этой сделки с Groq совпадает с приобретением компанией Meta пионера в области агентов Manus всего два дня назад. Значимость Manus отчасти заключалась в ее одержимости сохранением состояния (statefulness).
Если агент не может вспомнить, что он делал 10 шагов назад, он бесполезен для реальных задач, таких как маркетинговые исследования или разработка программного обеспечения. KV-кэш (Key-Value Cache — кэш ключей и значений) — это «кратковременная память», которую языковая модель (LLM) строит во время фазы префилла.
Manus сообщила, что для производственных (production-grade) агентов соотношение входных токенов к выходным может достигать 100:1. Это означает, что на каждое сказанное агентом слово он «думает» и «помнит» еще 100. В такой среде коэффициент попаданий в KV-кэш является важнейшей метрикой для рабочего агента, заявили в Manus. Если этот кэш «вытесняется» из памяти, агент теряет ход мысли, и модель вынуждена сжигать колоссальное количество энергии для повторного вычисления промпта.
SRAM от Groq может служить «блокнотом» для таких агентов — хотя, опять же, в основном для небольших моделей, — поскольку она обеспечивает практически мгновенное извлечение этого состояния. В сочетании с фреймворком Dynamo от Nvidia и KVBM компания Nvidia строит «операционную систему инференса», которая позволяет серверам инференса распределять это состояние по уровням SRAM, DRAM, HBM и другим флеш-решениям, аналогичным продуктам от Weka Берковичи.
Томас Йоргенсен (Thomas Jorgensen), старший директор по технологическому обеспечению в Supermicro, которая специализируется на создании кластеров GPU для крупных корпоративных компаний, говорил мне в сентябре, что вычисления больше не являются главным узким местом для передовых кластеров. Узким местом стала подача данных на графические процессоры, а преодоление этого узкого места требует памяти.
«Теперь весь кластер — это и есть компьютер, — сказал Йоргенсен. — Сетевые технологии становятся внутренней частью этого зверя… кормить зверя данными становится все труднее, потому что пропускная способность между графическими процессорами растет быстрее, чем что-либо еще».
Именно поэтому Nvidia движется в сторону дезагрегированного инференса. Разделяя рабочие нагрузки, корпоративные приложения могут использовать специализированные уровни хранения для подачи данных с производительностью уровня памяти, в то время как специализированный кремний «Groq-inside» обрабатывает высокоскоростную генерацию токенов.
Вердикт на 2026 год
Мы вступаем в эпоху экстремальной специализации. На протяжении десятилетий лидеры рынка могли побеждать, выпуская одну доминирующую универсальную архитектуру — и их слепым пятном часто становилось то, что они игнорировали на периферии. Классическим примером является долгое пренебрежение Intel низким энергопотреблением, рассказал мне Майкл Стюарт, управляющий партнер венчурного фонда Microsoft M12. Nvidia дает понять, что не повторит эту ошибку. «Если даже лидер, даже лев джунглей будет приобретать таланты, будет приобретать технологии — это знак того, что весь рынок просто хочет больше вариантов», — сказал Стюарт.
Техническим лидерам адресован следующий посыл: перестаньте проектировать свой стек так, будто это одна стойка, один ускоритель, одно решение. В 2026 году преимущество получат те команды, которые явно маркируют рабочие нагрузки и направляют их на нужный уровень:
-
префилл-интенсивные против декодер-интенсивных
-
с длинным контекстом против короткого контекста
-
интерактивные против пакетных (batch)
-
маленькие модели против больших моделей
-
ограничения периферии (edge) против допущений дата-центра
Ваша архитектура будет следовать этим меткам. В 2026 году «стратегия в отношении GPU» перестает быть решением о закупках и становится решением о маршрутизации. Победители будут спрашивать не о том, какой чип они купили, а о том, где выполнялся каждый токен и почему.



