Интеграция Groq от Nvidia повышает уровень ИИ-рассуждений

Интеграция Groq от Nvidia повышает уровень ИИ-рассуждений

​Если смотреть на Великую пирамиду из пустыни с расстояния в несколько миль, она кажется идеальной, гладкой геометрией — изящным треугольником, устремленным к звездам. Однако стоит подойти к ее основанию, как иллюзия гладкости исчезает. Перед вами предстают огромные, неровные блоки известняка. Это не склон, это лестница.

​Вспомните об этом в следующий раз, когда услышите, как футурологи говорят об экспоненциальном росте.

​Сооснователь Intel Гордон Мур (автор закона Мура) сделал ставшее знаменитым заявление в 1965 году о том, что количество транзисторов на микросхеме будет удваиваться каждый год. Позже другой топ-менеджер Intel, Дэвид Хаус, скорректировал это утверждение: «вычислительная мощность удваивается каждые 18 месяцев». Какое-то время процессоры Intel были живым воплощением этого закона. По крайней мере, до тех пор, пока рост производительности CPU не выровнялся, подобно известняковому блоку.

​Однако, если отдалиться и взглянуть шире, следующий блок известняка уже был на месте — рост вычислительной мощности просто сместился с процессоров (CPU) в мир графических процессоров (GPU). Дженсен Хуанг, генеральный директор Nvidia, сыграл вдолгую и вышел безусловным победителем, выстраивая свои ступени сначала с помощью видеоигр, затем компьютерного зрения и, наконец, генеративного искусственного интеллекта.

​Иллюзия плавного роста

​Технологический рост полон рывков и плато, и генеративный ИИ — не исключение. Нынешняя волна обусловлена архитектурой трансформеров. Процитируем президента и сооснователя Anthropic Дарио Амодеи: «Экспонента продолжается до тех пор, пока не прекращается. И каждый год мы думали: «Ну, этого просто не может быть, чтобы всё продолжалось по экспоненте», — а затем каждый год это продолжалось».

​Но точно так же, как развитие CPU вышло на плато и лидерство захватили GPU, мы видим признаки того, что рост больших языковых моделей (LLM) вновь меняет парадигму. Например, в конце 2024 года компания DeepSeek удивила мир, обучив модель мирового класса при невероятно скромном бюджете, отчасти благодаря использованию техники MoE (смесь экспертов).

​Помните ли вы, где недавно упоминалась эта техника? В пресс-релизе Nvidia, посвященном чипу Rubin: технология включает в себя «…последние поколения интерконнект-технологии Nvidia NVLink… для ускорения агентного ИИ, продвинутого логического вывода и инференса MoE-моделей масштабного уровня со снижением затрат на токен до 10 раз».

​Дженсен понимает, что достижение столь желанного экспоненциального роста вычислений больше не достигается за счет грубой силы. Иногда необходимо полностью изменить архитектуру, чтобы сделать следующий шаг.

​Кризис задержек: какова роль Groq

​Это долгое введение подводит нас к компании Groq.

​Наибольший прирост возможностей ИИ в сфере логических выводов в 2025 году был обеспечен «вычислениями на этапе инференса» — или, говоря простым языком, «тем, что модели дают больше времени на раздумья». Но время — это деньги. Потребители и бизнес не любят ждать.

​И здесь на сцену выходит Groq с его молниеносным инференсом. Если объединить архитектурную эффективность таких моделей, как DeepSeek, и колоссальную пропускную способность Groq, вы получите передовой интеллект прямо у себя под рукой. Выполняя инференс быстрее, вы можете «передумать» конкурирующие модели, предлагая клиентам «более умную» систему без штрафных задержек.

​От универсального чипа к оптимизации инференса

​Последнее десятилетие GPU был универсальным молотком для любого гвоздя в сфере ИИ. Вы используете H100 для обучения модели; вы используете H100 (или их урезанные версии) для запуска модели. Но по мере того, как модели переходят к мышлению «Системы 2», когда ИИ рассуждает, самокорректируется и итеративно уточняет ответ, вычислительная нагрузка меняется.

​Обучение требует массивной параллельной грубой силы. Инференс, особенно для рассуждающих моделей, требует более быстрой последовательной обработки. Он должен генерировать токены мгновенно, чтобы обеспечивать сложные цепочки мыслей, не заставляя пользователя ждать ответа по несколько минут. Архитектура LPU (Language Processing Unit) от Groq устраняет узкое место пропускной способности памяти, от которого страдают GPU при работе с небольшими батчами, обеспечивая молниеносный инференс.

​Двигатель для следующей волны роста

​Для топ-менеджмента потенциальное слияние таких технологий решает кризис задержки, связанный с «временем на раздумья». Подумайте об ожиданиях от ИИ-агентов: мы хотим, чтобы они автономно бронировали авиабилеты, писали код для целых приложений и изучали юридические прецеденты. Чтобы делать это надежно, модели может потребоваться сгенерировать 10 000 внутренних «токенов размышления», чтобы проверить собственную работу, прежде чем выдать пользователю хотя бы одно слово.

  • На стандартном GPU: 10 000 токенов размышления могут занять от 20 до 40 секунд. Пользователь заскучает и уйдет.

  • На Groq: та же цепочка мыслей происходит менее чем за 2 секунды.

​Если Nvidia интегрирует технологию Groq, они решат проблему «ожидания, пока робот подумает». Они сохранят магию ИИ. Подобно тому, как они перешли от рендеринга пикселей (в играх) к рендерингу интеллекта (в генеративном ИИ), теперь они перейдут к рендерингу рассуждений в реальном времени.

​Более того, это создает грозный программный ров (неприступное преимущество). Самым большим препятствием для Groq всегда был стек программного обеспечения; главным достоянием Nvidia является CUDA. Если Nvidia обернет свою экосистему вокруг аппаратного обеспечения Groq, они фактически выроют столь широкий ров, что конкуренты не смогут его пересечь. Они предложат универсальную платформу: лучшую среду для обучения и наиболее эффективную среду для запуска (Groq/LPU).

Подумайте, что происходит, когда вы соединяете эту сырую мощность инференса с открытой моделью нового поколения (вроде слухов о DeepSeek 4): вы получаете предложение, которое не уступает современным передовым моделям по стоимости, производительности и скорости. Это открывает для Nvidia возможности как для прямого выхода на рынок инференса с собственным облачным сервисом, так и для продолжения поддержки растущего числа экспоненциально развивающихся клиентов.

​Следующий шаг на пирамиде

​Возвращаясь к нашей вводной метафоре: «экспоненциальный» рост ИИ — это не плавная линия сырых FLOP; это лестница преодолеваемых узких мест.

  • Блок 1: Мы не могли вычислять достаточно быстро. Решение: Графический процессор (GPU).

  • Блок 2: Мы не могли обучать достаточно глубоко. Решение: Архитектура трансформеров.

  • Блок 3: Мы не можем «думать» достаточно быстро. Решение: LPU от Groq.

​Дженсен Хуанг никогда не боился каннибализировать собственные линейки продуктов ради владения будущим. Интегрируя и одобряя Groq, Nvidia не просто купила бы более быстрый чип; они бы принесли интеллект нового поколения в массы.

Эндрю Филев, основатель и генеральный директор Zencoder

Добро пожаловать в сообщество VentureBeat!

Наша программа гостевых публикаций — это площадка, где технические эксперты делятся инсайтами и предлагают беспристрастный и глубокий аналитический разбор ИИ, инфраструктуры данных, кибербезопасности и других передовых технологий, формирующих будущее бизнеса.

Читайте далее в рамках нашей программы гостевых постов и ознакомьтесь с нашими руководствами, если вы заинтересованы в публикации собственной статьи!

Инфраструктура

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.