Доставка данных для ИИ преобразует пути хранения

Доставка данных для ИИ преобразует пути хранения

Источник: VentureBeat · VB Staff

При поддержке F5


Корпоративные команды по искусственному интеллекту годами решали вопросы вычислений, бронировали графические процессоры (GPU), договаривались о пропускной способности облаков и тестировали производительность обучения. В основу этой работы заложено предположение, что канал между хранилищем и вычислениями будет успевать за процессами. Однако на практике это предположение все чаще не оправдывается. Реальный трафик порождает всплески задержек, сетевой джиттер и деградацию узлов, которые контрольные тесты уловить не могут. В результате конвейеры отлично показывают себя в лаборатории, но начинают буксовать при развертывании. Растущим ответом на это становится доставка данных для ИТ/ИИ (AI data delivery) — развертывание контроллера доставки приложений (ADC) или платформы доставки приложений и безопасности (ADSP) перед хранилищем в качестве отказоустойчивой и защищенной точки контроля.

«Инфраструктурное обеспечение решает проблему емкости, но не доставки, и именно там теперь кроется узкое место», — говорит Хантер Смит (Hunter Smit), старший менеджер по продуктовому маркетингу в F5. — «Предприятия закупают достаточно GPU и хранилищ, а затем предполагают, что канал между ними будет справляться. Но ИИ-трафик носит скачкообразный, высококонкурентный характер, а его операции чтения хаотичны настолько, к чему обычные сети хранения данных никогда не создавались».

Разрыв между реальностью производства и результатами тестов

Стандартная методология тестирования только усугубляет проблему, считает Пол Пинделл (Paul Pindell), ведущий архитектор решений по технологическим альянсам в F5.

«Тестирование производительности обычно нацелено на демонстрацию наилучшего возможного результата или уровня безопасности, а не самого реалистичного», — говорит он. — «В случае с S3 задержка является известным фактором, снижающим производительность, поэтому осредненное тестирование должно преднамеренно вводить постоянную задержку в канал».

Большинство тестовых сред никогда этого не делают, а значит, цифры производительности, на которые опираются компании при принятии инфраструктурных решений, получены в условиях, которые производственные системы никогда не воспроизведут. Чтобы проверить это предположение, компании F5 и MinIO провели тестирование пропускной способности в условиях деградировавшей сети.

«Больше всего поразило то, как быстро падает пропускная способность S3 при появлении задержки», — отмечает Пинделл. — «Даже небольшая задержка существенно бьет по показателям, а по мере ее роста на дальних расстояниях деградация становится критической».

Тестирование также показало, что задержка имеет гораздо большее значение для падения пропускной способности, чем джиттер, что опровергло первоначальные ожидания команды. Главный вывод для корпоративных архитекторов заключается в том, что развертывание объектного хранилища S3 нельзя проектировать на основе «тепличных» предположений; их нужно строить с учетом реальных сетевых проблем, с которыми придется столкнуться.

Цена хрупких путей передачи данных

«В инфраструктуре ИИ люди естественным образом концентрируются на графических процессорах, поскольку это самый заметный и дорогой ресурс», — говорит Тану Мутреджа (Tanu Mutreja), старший директор по управлению продуктами в F5. — «Но в производственных средах GPU приносят ровно столько пользы, сколько позволяет путь передачи данных, который их питает».

Этот путь проходит через уровни хранения, сетей, баз данных, безопасности и оркестрации, которые часто объединяются из решений множества вендоров. Конечные пользователи не видят этих швов — они ощущают результат работы всей системы целиком.

Когда путь передачи данных деградирует, негативные эффекты накладываются друг на друга. Недоиспользование GPU является самым очевидным и заметным симптомом, однако Мутреджа указала на целый комплекс последствий: падение производительности инференса, снижение качества результатов ИИ, рост расходов на исходящий трафик из-за ненужного дублирования данных, а также увеличение операционной сложности.

«В масштабе эффективность путей передачи данных становится скорее стратегическим рычагом бизнеса, чем технической оптимизацией», — подчеркивает она. — «Когда канал данных спроектирован правильно, GPU работают продуктивно, ИИ-приложения остаются отзывчивыми и надежными, операции масштабируются эффективно, а организации максимизируют окупаемость своих инвестиций в искусственный интеллект».

Рабочие нагрузки ИИ структурно более подвержены таким сбоям, чем традиционные корпоративные приложения. Базы данных, ERP-системы и веб-сервисы сглаживают временные задержки хранилищ за счет кэширования и буферизации. У ИИ-нагрузок, выполняющихся на массивно-параллельных кластерах GPU, нет эквивалентной защиты. Как отметила Мутреджа, даже незначительные всплески задержек или узкие места пропускной способности могут вызвать лавинообразный эффект в крупных кластерах графических процессоров, одновременно подрывая уровень их утилизации, эффективность обучения и пользовательский опыт.

Рассмотрение периферии хранилища как точки контроля

На протяжении десятилетий хранение данных и вычисления рассматривались в корпоративной архитектуре как последовательные этапы: данные сначала сохранялись, а затем анализировались. Мутреджа утверждает, что эта модель больше не отвечает требованиям ИИ.

«Конкурентное преимущество определяется не только объемом данных, но также их актуальностью, происхождением, безопасностью и эффективной доставкой», — говорит она. — «По всей индустрии — от NVIDIA и AWS до поставщиков корпоративных систем хранения — наблюдается движение в сторону внедрения интеллекта непосредственно в инфраструктуру данных, а не надстройки над ней».

Интеграция F5 с MinIO воплощает этот подход на том уровне, где хранилище и вычисления реально взаимодействуют. В рамках платформы F5 ADSP решение BIG-IP располагается на пути передачи данных, непрерывно отслеживая работоспособность распределенных узлов хранения MinIO и перенаправляя запросы только на те из них, которые остаются доступными.

Операционный эффект такого подхода становится очевиден при деградации узлов, что является штатной ситуацией для распределенных кластеров хранения. Без интеллектуальной маршрутизации клиенты, попавшие на проблемный узел, вынуждены повторять запросы и могут снова угодить на другой деградировавший узел, что еще сильнее снижает общую производительность.

«F5 гарантирует, что трафик направляется только на исправные узлы или на наименее загруженные из них, поэтому клиентский трафик S3 всегда обрабатывается наиболее эффективным образом», — поясняет Пинделл.

Управление в распределенных средах

Проблема усложняется с ростом масштабов, когда конвейеры ИИ простираются через множество локаций, облаков или периферийных сред.

«Как только ИИ-конвейер пересекает границы регионов и облаков, вопрос перестает касаться производительности и сводится к контролю», — говорит Смит. — «Вы работаете по разным правилам в каждой юрисдикции, и цифровая суверенность теперь выступает в роли проектного ограничения. Места, где вашим данным разрешено храниться, лица, которым разрешено с ними работать, и границы, которые они не имеют права пересекать, определяют архитектуру задолго до того, как кто-то заговорит о скорости».

Это давление подстегивает заметную тенденцию: компании возвращают ИИ-нагрузки из публичных облаков на инфраструктуру, которой владеют и которую контролируют напрямую. Описанная Смитом архитектура решает эту задачу путем отделения приложений от какого-то одного конкретного хранилища и размещения между ними единой точки контроля, обеспечивающей соблюдение согласованных политик для всех элементов.

«Суверенность, отказоустойчивость и стоимость перестают быть компромиссами, которыми вы управляете по отдельности в каждом регионе», — поясняет он. — «Они становятся возможностью, которой вы управляете как единой системой».

Путь от хранилища к вычислениям как управляемая точка контроля

Чтобы решить эти проблемы, корпоративным командам необходимо перестать воспринимать путь от хранилища к вычислениям как прямое соединение и начать относиться к нему как к управляемой точке контроля, считает Смит. Независимая валидация F5 BIG-IP в развертываниях систем хранения, проведенная лабораторией SecureIQLab, подтвердила, что такой подход обеспечивает отказоустойчивость без ущерба для пропускной способности.

«Интегрируйте полноценный прокси-ADC между этими двумя точками, и трасса станет видимой, программируемой и учитывающей сбои — с маршрутизацией на основе состояния здоровья узлов, контролем качества обслуживания и мерами безопасности, применяемыми «на лету»», — объясняет он. — «Этот единственный шаг превращает доставку данных из предположения в инженерную дисциплину, которая и поддерживает работоспособность GPU в условиях деградации среды».


Спонсорские статьи — это материалы, созданные компанией, которая либо оплачивает публикацию, либо имеет деловые отношения с VentureBeat, и они всегда четко маркируются. Для получения дополнительной информации обращайтесь по адресу sales@venturebeat.com.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.