Google Cloud представляет ИИ-чип Ironwood

Google Cloud представляет ИИ-чип Ironwood

Google Cloud представляет свою самую мощную на сегодняшний день инфраструктуру для искусственного интеллекта: седьмое поколение тензорных процессоров (TPU) и расширенный набор вычислительных опций на базе архитектуры Arm. Решения призваны удовлетворить растущий спрос на развертывание моделей ИИ, что, по мнению компании, отражает фундаментальный сдвиг в отрасли: переход от обучения моделей к их обслуживанию миллиардов пользователей.

Анонс, сделанный в четверг, посвящен Ironwood — новейшему специализированному чипу-ускорителю ИИ от Google, который станет общедоступным в ближайшие недели. В качестве яркого подтверждения востребованности технологии компания Anthropic, создатель семейства моделей ИИ Claude, объявила о планах задействовать до одного миллиона таких чипов TPU. Это соглашение оценивается в десятки миллиардов долларов и является одной из крупнейших известных сделок в сфере ИИ-инфраструктуры на сегодняшний день.

Этот шаг подчеркивает усиление конкуренции среди облачных провайдеров за контроль над инфраструктурным слоем, обеспечивающим работу искусственного интеллекта, несмотря на растущие вопросы о том, сможет ли индустрия поддерживать текущие темпы капитальных затрат. Подход Google, заключающийся в создании собственного кремния вместо того, чтобы полагаться исключительно на доминирующие графические процессоры Nvidia, представляет собой долгосрочную ставку на то, что вертикальная интеграция от проектирования чипов до программного обеспечения обеспечит превосходную экономику и производительность.

Почему компании стремятся обслуживать модели ИИ, а не только обучать их

Руководители Google охарактеризовали эти анонсы как наступление «эпохи инференса» — переходного этапа, на котором компании перенаправляют ресурсы с обучения передовых моделей ИИ на их развертывание в производственных приложениях, обслуживающих миллионы или миллиарды запросов ежедневно.

«Современные передовые модели, включая Gemini, Veo и Imagen от Google, а также Claude от Anthropic, проходят обучение и обслуживаются на тензорных процессорах», — заявил Амин Вахдат (Amin Vahdat), вице-президент и генеральный директор подразделения ИИ и инфраструктуры в Google Cloud. «Для многих организаций фокус смещается с обучения этих моделей на обеспечение полезного и отзывчивого взаимодействия с ними».

Этот переход оказывает глубокое влияние на требования к инфраструктуре. Если рабочие нагрузки по обучению часто могут допускать пакетную обработку и более длительное время выполнения, то инференс — процесс непосредственного запуска обученной модели для генерации ответов — требует стабильно низкой задержки, высокой пропускной способности и непрерывной надежности. Чат-бот, который отвечает 30 секунд, или помощник по написанию кода, у которого часто истекает время ожидания запроса, становятся непригодными для использования независимо от возможностей лежащей в их основе модели.

Агентные рабочие процессы, в которых системы ИИ совершают автономные действия, а не просто отвечают на запросы, создают особенно сложные инфраструктурные проблемы, требуя тесной координации между специализированными ускорителями ИИ и вычислениями общего назначения.

Архитектура Ironwood: 9216 чипов, работающих как единый суперкомпьютер

Ironwood — это нечто большее, чем просто поэтапное улучшение шестого поколения TPU от Google. Согласно техническим характеристикам, предоставленным компанией, он обеспечивает более чем четырехкратное увеличение производительности как для рабочих нагрузок обучения, так и для инференса по сравнению со своим предшественником. Эти достижения Google связывает с подходом к совместному проектированию на уровне системы, а не просто с увеличением количества транзисторов.

Самой поразительной особенностью архитектуры является ее масштаб. Один «под» (pod) Ironwood — плотно интегрированный модуль чипов TPU, функционирующий как единый суперкомпьютер, — может объединять до 9216 отдельных чипов с помощью фирменной сети межчиповых соединений Google Inter-Chip Interconnect, работающей на скорости 9,6 терабит в секунду. Чтобы представить эту пропускную способность наглядно, она примерно эквивалентна сканированию всей Библиотеки Конгресса менее чем за две секунды.

Эта массивная коммутационная матрица позволяет 9216 чипам совместно использовать 1,77 петабайта памяти с высокой пропускной способностью (High Bandwidth Memory) — памяти, достаточно быстрой, чтобы не отставать от скорости обработки данных чипами. Это эквивалентно примерно 40 000 рабочих мест в формате Blu-ray фильмов высокой четкости, к которым тысячи процессоров могут получить мгновенный одновременный доступ. «В контексте это означает, что поды Ironwood могут обеспечить в 118 раз большую производительность в формате FP8 ExaFLOPS по сравнению с ближайшим конкурентом», — говорится в технической документации Google.

В системе используется технология оптической коммутации цепей (Optical Circuit Switching), которая действует как «динамическая переконфигурируемая матрица». Когда отдельные компоненты выходят из строя или требуют обслуживания (что неизбежно в таких масштабах), технология OCS автоматически перенаправляет поток данных в обход сбоя за миллисекунды, позволяя рабочим процессам продолжать работу без видимых для пользователя сбоев.

Такое внимание к надежности отражает опыт, извлеченный из развертывания пяти предыдущих поколений TPU. По данным Google, время безотказной работы систем с жидкостным охлаждением в масштабе всего парка устройств поддерживается на уровне примерно 99,999% с 2020 года, что эквивалентно менее чем шести минутам простоя в год.

Мллиардная ставка Anthropic подтверждает стратегию Google в области собственного кремния

Пожалуй, самым значительным внешним подтверждением возможностей Ironwood стало обязательство Anthropic получить доступ к миллиону чипов TPU — ошеломляющая цифра в отрасли, где даже кластеры из 10 000 – 50 000 ускорителей считаются массивными.

«У Anthropic и Google давние партнерские отношения, и это последнее расширение поможет нам продолжать наращивать вычислительные мощности, необходимые для расширения границ ИИ», — заявил Кришна Рао (Krishna Rao), финансовый директор Anthropic, в официальном соглашении о партнерстве. «Наши клиенты — от компаний из списка Fortune 500 до ИИ-стартапов — полагаются на Claude в своей важнейшей работе, и эта расширенная емкость гарантирует, что мы сможем удовлетворить наш экспоненциально растущий спрос».

Согласно отдельному заявлению, Anthropic получит доступ к «мощностям объемом далеко за один гигаватт, которые будут запущены в 2026 году» — этого количества электроэнергии хватило бы для питания небольшого города. Компания особо отметила «соотношение цены, производительности и эффективности» TPU в качестве ключевых факторов принятого решения, а также «существующий опыт обучения и обслуживания своих моделей с помощью TPU».

Отраслевые аналитики подсчитали, что обязательство получить доступ к одному миллиону чипов TPU с сопутствующей инфраструктурой, сетевыми ресурсами, энергоснабжением и охлаждением, вероятно, представляет собой многолетний контракт на десятки миллиардов долларов — одно из крупнейших известных обязательств по облачной инфраструктуре в истории.

Джеймс Брэдбери (James Bradbury), руководитель отдела вычислений в Anthropic, подробнее остановился на вопросе инференса: «Улучшения Ironwood как в производительности инференса, так и в масштабируемости обучения помогут нам эффективно масштабироваться, сохраняя при этом скорость и надежность, которых ожидают наши клиенты».

Процессоры Google Axion нацелены на вычислительные рабочие нагрузки, обеспечивающие работу ИИ

Наряду с Ironwood Google представила расширенные опции для своего семейства процессоров Axion — специализированных процессоров на базе архитектуры Arm для универсальных рабочих нагрузок, которые поддерживают приложения ИИ, но не требуют специализированных ускорителей.

Тип экземпляра N4A, переходящий в стадию превью, предназначен для того, что Google описывает как «микросервисы, контейнеризированные приложения, базы данных с открытым исходным кодом, пакетные задания, анализ данных, среды разработки, эксперименты, подготовку данных и веб-сервисы, которые делают возможными приложения ИИ». Компания утверждает, что N4A обеспечивает соотношение цены и производительности до 2 раз лучше, чем сопоставимые виртуальные машины на базе x86 текущего поколения.

Google также представляет превью C4A metal, своего первого экземпляра Arm на «голом железе» (bare-metal), который предоставляет выделенные физические серверы для специализированных рабочих нагрузок, таких как разработка под Android, автомобильные системы и программное обеспечение со строгими требованиями к лицензированию.

Стратегия Axion отражает растущую уверенность в том, что будущее вычислительной инфраструктуры требует как специализированных ускорителей ИИ, так и высокоэффективных процессоров общего назначения. В то время как TPU справляется с трудоемкой задачей запуска модели ИИ, процессоры класса Axion управляют внедрением данных, предварительной обработкой, логикой приложений, обслуживанием API и бесчисленными другими задачами в современном стеке приложений ИИ.

Ранние результаты клиентов показывают, что этот подход приносит измеримую экономическую выгоду. Компания Vimeo сообщила о «30-процентном улучшении производительности для нашей основной рабочей нагрузки перекодирования по сравнению с сопоставимыми виртуальными машинами x86» во время первоначального тестирования N4A. ZoomInfo зафиксировала «60-процентное улучшение соотношения цены и производительности» для конвейеров обработки данных, работающих на сервисах Java, по словам Сергея Корена (Sergei Koren), главного архитектора инфраструктуры компании.

Программные инструменты превращают сырую производительность кремния в продуктивность разработчиков

Производительность оборудования имеет мало значения, если разработчики не могут легко ее использовать. Google подчеркнула, что Ironwood и Axion интегрированы в то, что компания называет AI Hypercomputer — «интегрированную суперкомпьютерную систему, которая объединяет вычисления, сети, хранилище и программное обеспечение для повышения производительности и эффективности на уровне системы».

Согласно исследованию IDC Business Value Snapshot за октябрь 2025 года, клиенты AI Hypercomputer добились в среднем 353% окупаемости инвестиций за три года, сократили расходы на ИТ на 28% и повысили эффективность ИТ-команд на 55%.

Google объявила о нескольких улучшениях программного обеспечения, призванных максимизировать использование Ironwood. Сервис Google Kubernetes Engine теперь предлагает расширенные возможности обслуживания и учета топологии для кластеров TPU, обеспечивая интеллектуальное планирование и высокоустойчивые развертывания. Разработанный компанией фреймворк MaxText с открытым исходным кодом теперь поддерживает передовые методы обучения, включая контролируемую тонкую настройку (SFT) и генеративную оптимизацию политики подкрепления.

Пожалуй, наиболее важным для производственных развертываний является шлюз инференса (Inference Gateway) от Google, который интеллектуально балансирует нагрузку запросов между серверами моделей для оптимизации ключевых метрик. По данным Google, он может сократить задержку получения первого токена на 96% и снизить затраты на обслуживание на величину до 30% за счет таких методов, как маршрутизация с учетом кэша префиксов.

Шлюз инференса (Inference Gateway) отслеживает ключевые показатели, включая попадания в кэш KV, загрузку графических процессоров или TPU и длину очереди запросов, после чего направляет входящие запросы на оптимальный экземпляр-реплику. Для разговорных приложений ИИ, где несколько запросов могут иметь общий контекст, направление запросов с общими префиксами на один и тот же экземпляр сервера позволяет резко сократить избыточные вычисления.

Скрытая проблема: питание и охлаждение серверов мощностью в один мегаватт на стойку

За этими анонсами стоит серьезнейшая проблема физической инфраструктуры, которую Google затронула на недавнем саммите Open Compute Project EMEA. Компания объявила о внедрении системы питания постоянного тока напряжением +/-400 вольт, способной поддерживать до одного мегаватта на стойку, что в десять раз превышает показатели типичных развертываний.

«Эпоха ИИ требует еще более мощных возможностей энергоснабжения», — объяснили Мадхусудан Айенгар (Madhusudan Iyengar) и Эмбер Хаффман (Amber Huffman), главные инженеры Google, в публикации в блоге за апрель 2025 года. «К 2030 году для машинного обучения потребуется более 500 кВт на ИТ-стойку».

Google сотрудничает с Meta и Microsoft в целях стандартизации электрических и механических интерфейсов для распределения электроэнергии постоянного тока высокого напряжения. Компания выбрала стандарт 400 VDC специально для того, чтобы задействовать цепочку поставок, созданную индустрией электромобилей, «для достижения большей экономии за счет масштаба, более эффективного производства, а также повышения качества и масштабируемости».

Что касается охлаждения, Google объявила, что передаст свою конструкцию блока распределения охлаждения пятого поколения проекту Open Compute Project. За последние семь лет компания развернула жидкостное охлаждение «в масштабе гигаватт более чем в 2000 подов TPU» при доступности на уровне всего парка устройств примерно в 99,999%.

Вода способна переносить примерно в 4000 раз больше тепла на единицу объема, чем воздух при заданном изменении температуры — это критически важно, поскольку отдельные чипы-ускорители ИИ все чаще рассеивают 1000 ватт тепла и более.

Ставка на собственный кремний бросает вызов доминированию Nvidia среди ИИ-ускорителей

Анонсы Google появляются в момент, когда рынок инфраструктуры ИИ достигает переломного момента. Хотя Nvidia сохраняет подавляющее доминирование среди ускорителей ИИ (ее доля рынка оценивается в 80-95%), облачные провайдеры все активнее инвестируют в разработку собственных чипов для дифференциации своих предложений и улучшения экономики единицы продукции.

Amazon Web Services была пионером этого подхода, выпустив процессоры Graviton на базе Arm, а также ИИ-чипы Inferentia и Trainium. Microsoft разработала процессоры Cobalt и, как сообщается, работает над собственными ускорителями ИИ. Теперь Google предлагает самый полный портфель заказного кремния среди основных облачных провайдеров.

Эта стратегия сопряжена с присущими ей трудностями. Разработка заказных чипов требует огромных предварительных инвестиций — зачастую исчисляемых миллиардами долларов. Программная экосистема для специализированных ускорителей отстает от платформы CUDA от Nvidia, которая пользуется преимуществами более чем 15-летнего опыта разработки инструментов. А стремительная эволюция архитектур моделей ИИ создает риск того, что заказной кремний, оптимизированный под современные модели, потеряет актуальность по мере появления новых подходов.

Тем не менее, в Google утверждают, что такой подход дает уникальные преимущества. «Именно так мы создали первый TPU десять лет назад, что, в свою очередь, восемь лет назад позволило изобрести архитектуру Transformer — ту самую, которая лежит в основе современного ИИ», — отметила компания, ссылаясь на эпохальную статью исследователей Google 2017 года «Attention Is All You Need».

Суть аргумента заключается в том, что тесная интеграция — «исследования моделей, разработка программного обеспечения и аппаратного обеспечения под одной крышей» — позволяет проводить оптимизации, невозможные при использовании стандартных компонентов.

Помимо Anthropic, первые отзывы предоставили и другие клиенты. Компания Lightricks, разрабатывающая инструменты на базе генеративного ИИ, сообщила, что раннее тестирование Ironwood «вызывает у нас огромный энтузиазм» в отношении создания «более тонких, точных и высококачественных изображений и видео для наших миллионов клиентов по всему миру», заявил Йоав ХаКоэн (Yoav HaCohen), директор по исследованиям компании.

Анонсы Google поднимают вопросы, которые разрешатся в ближайшие кварталы. Сможет ли индустрия поддерживать текущие расходы на инфраструктуру, учитывая, что крупнейшие компании в сфере ИИ в совокупности выделяют сотни миллиардов долларов? Окажется ли заказной кремний экономически выгоднее графических процессоров Nvidia? Как будут развиваться архитектуры моделей?

На данный момент Google привержена стратегии, которая определяла деятельность компании на протяжении десятилетий: создание специализированной инфраструктуры для реализации приложений, невозможных на стандартном оборудовании, с последующим предоставлением этой инфраструктуры клиентам, которым требуются аналогичные возможности без капитальных вложений.

По мере того как индустрия ИИ переходит из исследовательских лабораторий в производственные среды, обслуживающие миллиарды пользователей, этот инфраструктурный слой — кремний, программное обеспечение, сети, системы питания и охлаждения, обеспечивающие его работу — может оказаться столь же важным, как и сами модели.

И если готовность Anthropic получить доступ к миллиону чипов о чем-то говорит, то ставка Google на заказной кремний, разработанный специально для эпохи инференса, может окупиться как раз в тот момент, когда спрос достигнет своего пика.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.