Новая платформа хранения данных от Weka кеширует 100% предварительно рассчитанных токенов модели, избавляя от необходимости повторять работу

Новая платформа хранения данных от Weka кеширует 100% предварительно рассчитанных токенов модели, избавляя от необходимости повторять работу

Источник: VentureBeat · Sean Michael Kerner

Память графических процессоров (GPU) — это самый дорогой ресурс в сфере промышленного ИИ, и он же заканчивается быстрее всего.

Длинные контекстные окна и многошаговые диалоги заставляют модели ИИ многократно пересчитывать уже обработанную информацию, расходуя память GPU и вычислительную мощность, которые можно было бы направить на обслуживание дополнительных пользователей или генерацию новых ответов.

Почему бы вместо того, чтобы рассматривать память GPU как лимитирующий ресурс, не расширить ее за счет гораздо более дешевых технологий хранения данных?

Weka, например, считает, что дешевая флеш-память способна закрыть этот пробел. Программная платформа NeuralMesh 6 этой компании, выпускаемая одновременно с ее первой линейкой оборудования собственной разработки Wekapod 3, расширяет возможности так называемой дополненной сетки памяти (Augmented Memory Grid) от Weka — подхода, который объединяет флеш-память NAND так, чтобы она работала как память GPU за малую долю от ее стоимости.

Это активный и становящийся все более тесным сегмент рынка. За последние два года Dell, NetApp, Pure Storage и VAST переориентировались на инфраструктуру для ИИ, и Weka позиционирует себя как одного из тех вендоров, которые изначально создавались под этот момент, а не адаптируются под него.

«Сейчас мы видим, что клиенты гонятся за доступностью вычислительных мощностей, и как только они получают новое выделение ресурсов от кого бы то ни было, они хотят сразу же забрать его и запустить работу», — рассказал VentureBeat соучредитель и генеральный директор Weka Лиран Цвибель (Liran Zvibel).

Потенциальная выгода очевидна: более эффективное использование имеющихся инвестиций в GPU, снижение затрат на инференс и более быстрое развертывание новых рабочих нагрузок ИИ без ожидания дополнительных мощностей GPU в течение нескольких месяцев.

Эта технология наиболее актуальна для организаций, которые уже используют ИИ в масштабах предприятия или ожидают быстрого роста нагрузки, в особенности для компаний, создающих внутренние ко-пилоты, агентов клиентской поддержки, ассистентов по разработке программного обеспечения или системы извлечения данных с длинными контекстными окнами. Небольшие развертывания могут получить от этого меньше сиюминутной выгоды по сравнению с организациями, где утилизация GPU уже стала ограничивающим фактором.

Что внутри NeuralMesh 6 от Weka

NeuralMesh 6 добавляет четыре возможности, направленные непосредственно на ликвидацию функционального пробела, из-за которого, по словам Цвибеля, Weka проигрывала сделки в конкурентных оценках.

Композитная и виртуальная многопользовательская среда (multi-tenancy). Композитные кластеры предоставляют основным арендаторам изоляцию на аппаратном уровне, выделенные ЦП, память и хранилище. Виртуальная многопользовательская среда работает через RDMA-фабрику Weka, обеспечивая изоляцию на сетевом уровне с поддержкой более 1000 арендаторов на кластер и подготовкой ресурсов менее чем за 30 минут. В совокупности один кластер, работающий с 50 композитными кластерами, может поддерживать до 50 000 арендаторов.

Унифицированное файловое и объектное хранилище. Большинство систем хранения данных используют два раздельных пути: файловый путь (стандартный способ чтения и записи файлов серверами и приложениями, активно используемый в конвейерах обучения и тонкой настройки) и объектный путь (S3 — формат, который обычно ожидают инференс и облачно-нативные инструменты). Обычно шлюз выполняет трансляцию между ними, что означает, что данные фактически существуют в двух экземплярах. Утверждение Weka заключается в том, что одни и те же физические данные на диске можно напрямую читать через оба пути одновременно — без уровня трансляции и без создания второй копии. Цвибель нацелен конкретно на облака GPU, не связанные с AWS, упоминая Lambda, Nebius, G42 и CoreWeave, обещая производительность примерно на два порядка выше, чем у традиционного S3, и ценовую модель на основе емкости вместо тарифов за количество API-запросов.

Репликация с приоритетом метаданных. Целевые среды становятся доступными для просмотра еще до того, как прибудет полная копия данных, а сами данные подгружаются (гидратируются) только при обращении к ним.

«Раньше им приходилось ждать, пока все это дойдет до другой стороны, а это занимает дни или недели, в крайних случаях — месяц», — сказал Цвибель. «Теперь мы позволяем нашим клиентам получить определенный объем новых GPU и запуститься в течение часа».

AlloyFlash и постоянное сокращение объемов данных (Always-On data reduction). TLC и QLC — это два типа флеш-памяти NAND. TLC работает быстрее и долговечнее, но стоит дороже в расчете на терабайт, в то время как QLC дешевле и вмещает больше данных на чип, но работает медленнее. AlloyFlash объединяет оба типа в рамках одного кластера, автоматически направляя задачи, чувствительные к задержкам, на TLC, в то время как рабочие нагрузки с большими объемами данных выполняются на QLC, что снижает стоимость терабайта без ущерба для производительности задач, требующих высокой скорости. Сокращение данных теперь работает по умолчанию, а не в качестве опции.

Решение проблемы контекста в ИИ

Многопользовательская среда и объектное хранилище решают вопросы повседневной эксплуатации платформы предприятиями и нео-облаками. Более сложная проблема скрывается глубже: по мере роста контекстных окон и многошаговых взаимодействий растет и объем вычислительной мощности GPU, впустую растрачиваемой на пересчет работы, которую модель уже выполнила. Ответом Weka на это стала Augmented Memory Grid — функция NeuralMesh 6, созданная специально для таких задач.

Каждый промпт запускает два этапа. Prefill (предварительное заполнение) вычисляет внимание (attention) — основной механизм обработки входных данных большими языковыми моделями, и это ресурсоемкая вычислительная задача. Decode (декодирование) преобразует эти вычисления в результат и является сравнительно легковесным процессом.

Финансовые затраты тяжелее всего сказываются на сеансах с несколькими шагами (multi-turn), таких как чаты или написание кода, где каждый новый шаг заново запускает этап prefill для всего, что было до него, если только эта работа не была закэширована.

«Если у вас 10 шагов, вы можете выполнить избыточные вычисления 100 раз, потому что пересчитываете их все. Если их 20, вы пересчитаете 400 раз», — отметил Цвибель. «Вы можете установить в разделяемую память в сто раз больше NAND, чем можете себе позволить, и мы сможем кэшировать 100% предварительно вычисленных токенов, так что вам никогда не придется пересчитывать их заново».

Конкурентная позиция Weka

Последние полтора года вендоры систем хранения данных занимались перепозиционированием вокруг искусственного интеллекта, и сегодня отделение реальных возможностей от маркетинговых лозунгов представляет собой серьезную проблему для покупателей.

«Мир систем хранения данных смещает фокус с обслуживания битов для корпоративных нагрузок на управление данными на скоростях ИИ. За последние 18 месяцев мы отчетливо видели это со стороны Dell, NetApp и Pure», — рассказал VentureBeat Стив Макдауэлл (Steve McDowell), главный аналитик NAND Research. «Интересно то, что такие компании, как Weka и VAST, являются истинно “ИИ-нативными” компаниями по работе с данными, которые решали эти проблемы с самого первого дня».

Макдауэлл выделил Augmented Memory Grid в качестве главного технического преимущества Weka.

«Weka по-прежнему обладает самой технически совершенной реализацией KV-кэша на рынке благодаря своей Augmented Memory Grid», — заявил он. «Они рано занялись этой технологией и продолжают внедрять инновации. Это критически важно для инференса ИИ, поскольку обеспечивает уровень эффективности GPU, который, без сомнения, экономит деньги на графических процессорах и памяти. Это ключевой фактор для сегодняшнего рынка, ограниченного в памяти и GPU».

Он также отметил, что недооцененным фактором являются контрактные гарантии Weka в отношении ее заявлений о сокращении объемов данных.

«Что остается немного в тени: Weka подкрепляет свои обещания по сокращению данных деньгами, давая реальные контрактные гарантии», — сказал он.

Совет Макдауэлла покупателям, оценивающим конкурирующие заявления Weka, VAST, Pure и NetApp, был резким: он предложил корпоративным заказчикам внимательно сопоставлять обещания вендоров с тем, что они поставляют на практике.

«Умный покупатель посмотрит на то, как конкурирующие вендоры решают реальные проблемы сегодняшнего дня», — считает Макдауэлл. «Они делают это, общаясь с организациями, выполняющими аналогичные рабочие нагрузки в сопоставимом масштабе. Если вендор не может на это указать, это должно стать тревожным сигналом».

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.