ИИ-агенты не могут исправить сбои инфраструктуры, которые не способны диагностировать
Представлено Virtana
Сбои инфраструктуры ИИ сложно диагностировать, потому что неисправность в одной системе вызывает симптомы сразу в нескольких других. Когда обучение модели замедляется, на панели мониторинга GPU может отображаться конкуренция за ресурсы, в отчёте о конвейере данных — остановка, а система хранения начинает выдавать предупреждения об ошибках ввода-вывода. При этом каждое предупреждение указывает на своё решение. Команды инфраструктуры видят все сигналы и часами пытаются выяснить, с чего начался сбой, пока дорогостоящие мощности GPU простаивают.
По мере того как компании создают фабрики ИИ, объединяющие GPU, системы хранения, сети, конвейеры данных и гибридные среды, разобраться в причинах становится ещё сложнее: мониторинг большинства фабрик ИИ по-прежнему опирается на отдельный инструмент для каждого направления. Кроме того, согласно опросам Virtana AI Factory Reality Check среди руководителей американских и британских компаний, принимающих решения, 59% компаний в США и 53% компаний в Великобритании не могут автоматически определить первопричину сбоя рабочей нагрузки ИИ во всех доменах инфраструктуры.
«Установив причинно-следственную связь, вы сможете устранить проблему, — говорит Пол Эпплби, президент и генеральный директор Virtana. — Если же установить её не удаётся, вы просто бросаете дротик в стену, пытаясь понять, что произошло и как это исправить».
Из-за масштабов ИИ-сбоев их сложнее отследить
Советы директоров требуют от компаний демонстрировать прогресс в области ИИ за счёт развёрнутой инфраструктуры, поэтому многие сначала строят её, а затем — если вообще доходят до этого — оснащают средствами мониторинга. Устаревшие инструменты, на которые приходится большая часть такого мониторинга, рассчитаны на стабильные, ограниченные системы с предсказуемой топологией сервисов. Но на фабрике ИИ планировщики постоянно перемещают рабочие нагрузки между гибридными средами, а потребление ресурсов нелинейно и резко меняется.
Для оповещений на основе пороговых значений нужна базовая линия нормальной производительности, с которой можно сравнивать текущие показатели. При этом 66% компаний в США эксплуатируют инфраструктуру ИИ без надёжных базовых показателей производительности. Лишь 34% компаний в США и 26% в Великобритании считают производительность рабочих нагрузок ИИ в высокой степени предсказуемой; среди американских организаций с числом сотрудников более 50 000 этот показатель падает до 25%. В итоге компании, эксплуатирующие крупнейшие фабрики ИИ, хуже всех способны предугадать, как те поведут себя дальше.
Чтобы сдерживать расходы на дорогостоящее оборудование для ИИ, многие компании в обеих странах перераспределяют рабочие нагрузки между гибридными средами и консолидируют системы, повышая эффективность использования ресурсов, — и всё это на работающих под нагрузкой системах. Каждое из этих изменений влияет на зависимости и конкуренцию за ресурсы во всём технологическом стеке.
«Без наблюдаемости на уровне системы организации не могут определить, как эти изменения влияют на результаты, затраты или надёжность, — говорит Эпплби. — Они постоянно оптимизируют системы ИИ, которых не понимают в полной мере, и при каждом изменении создают новые риски».
Для поиска первопричины нужна модель всей фабрики ИИ
При анализе первопричин необходимо установить, в какой части распределённой системы возникло оповещение. На фабрике ИИ для этого нужно одновременно проверять GPU, CPU, память, системы хранения, сети, оркестрацию и конвейеры данных.
В Великобритании автоматическое обнаружение сбоев распространено гораздо шире, чем автоматическая диагностика. Семьдесят пять процентов компаний используют автоматические оповещения как первую реакцию на сбой рабочей нагрузки ИИ, тогда как 47% могут автоматически выявить первопричину во всех доменах инфраструктуры. Остальные видят только один домен, вручную сопоставляют сигналы из разных инструментов или на несколько часов либо дней собирают вместе несколько команд. В США 25% компаний начинают реагировать на инцидент с ручного расследования в разрозненных консолях.
«Узкое место в системе хранения снижает производительность конвейера данных, из-за чего останавливается обучение модели и возникает конкуренция за ресурсы GPU, — говорит Эпплби. — Устаревшие инструменты мониторинга регистрируют три отдельных события в трёх разных доменах. Каждое из них технически описано верно, но ни одно не показывает, что произошло на самом деле».
Добавление инструментов мониторинга в каждый домен не устраняет разрозненность этих трёх событий. Фабрикам ИИ нужна единая операционная модель всей системы выполнения ИИ, которая в реальном времени сопоставляет непрерывные высокоточные телеметрические данные из каждого домена, включая оркестрацию и поведение приложений. Эта модель также должна поддерживать актуальную топологию взаимозависимостей рабочих нагрузок, сервисов и инфраструктуры, чтобы можно было отследить причину конкуренции за ресурсы GPU до узкого места в системе хранения. Топология меняется каждый раз, когда планировщик перемещает рабочую нагрузку, поэтому модель необходимо постоянно обновлять.
Руководители компаний в обеих странах поставили на первое место единое представление об ИИ и инфраструктуре, а на второе — анализ первопричин с помощью ИИ без необходимости вручную сопоставлять данные. Эти варианты лидировали во всех группах должностей и категориях выручки. Рынок наблюдаемости уже оценивается в миллиарды долларов, однако дополнительные специализированные инструменты мониторинга не решают выявленные в исследовании проблемы с видимостью и установлением причинно-следственных связей между доменами.
Прежде чем устранять сбои, ИИ-агентам нужно установить причинно-следственную связь
Крупным фабрикам ИИ потребуется автономное устранение сбоев, поскольку пропускная способность и сложность таких сред уже превышают возможности надёжной координации вручную. Лишь 23% британских специалистов по инфраструктуре и обеспечению надёжности сайтов (SRE), ежедневно работающих с нагрузками ИИ, считают их производительность в высокой степени предсказуемой. Прежде чем запускать агентов для работы с такими системами, компаниям необходимо внедрить телеметрию и модель актуальной топологии, объясняет Эпплби.
«Без этой основы ИИ-агенты унаследуют те же слепые зоны, которые ограничивают операторов-людей, и будут усугублять сбои с машинной скоростью, — говорит он. — Агент, действующий без полного контекста системы, не устраняет инциденты быстрее, а создаёт новые».
Virtana реализует этот подход с помощью платформы Agentic Observability. Она поддерживает общую модель всего стека выполнения ИИ в локальных, виртуализированных и общедоступных облачных средах. Автономные агенты в реальном времени сопоставляют данные об использовании GPU, спросе на токены, поведении моделей и производительности базовой инфраструктуры, а каждое выявление первопричины подтверждают доказательствами.
Распределение затрат и журналы аудита опираются на одну и ту же телеметрию
В обеих странах 31% компаний называют более чёткие показатели окупаемости уже сделанных инвестиций в ИИ важнейшим условием для дальнейшего масштабирования.
«Организации, которые не могут измерить использование GPU, стоимость каждой рабочей нагрузки и эффективность на уровне инфраструктуры, не смогут обосновать дальнейшие инвестиции, — говорит Эпплби. — Они могут наблюдать за расходами, но не могут управлять ими».
Руководители и инженеры, отвечающие за инфраструктуру ИИ, также по-разному оценивают способность своих организаций диагностировать сбои. В Великобритании 59% руководителей утверждают, что их организация автоматически определяет первопричину во всех доменах инфраструктуры. Среди инженеров по инфраструктуре и SRE, обрабатывающих оповещения, таких ответов лишь 34% — разрыв оказался больше, чем в опросе в США. ИТ-руководители, за которыми в большинстве британских организаций остаётся последнее слово при принятии решений об инвестициях в ИИ, увереннее всех оценивают возможности диагностики. Это проблема управления: люди, утверждающие бюджеты на ИИ, опираются на оценку готовности к диагностике, с которой не согласны их собственные инженеры.
Британские компании также внедряют ИИ в соответствии с британским GDPR и отраслевыми требованиями в финансовом секторе, здравоохранении и сфере критически важной национальной инфраструктуры. Эти нормы требуют вести журналы аудита и учитывать затраты. Тем не менее 39% британских компаний отодвигают проверки безопасности и соответствия требованиям на второй план по мере роста потребностей фабрик ИИ. По его словам, за пределами США суверенитет станет более значимой темой в области ИИ: страны и граждане будут добиваться контроля над собственным будущим.
«Система, которая доказывает работоспособность фабрики ИИ, — та же система, которая позволяет отчитаться перед регулирующим органом, аудитором или советом директоров, — говорит Эпплби. — Заявление о суверенитете без наблюдаемости ничем нельзя подтвердить».
Фабрики корпоративного ИИ развиты меньше, чем можно судить по объёму инвестиций
В публичном дискурсе компании из списка Global 2000 внедряют ИИ в огромных масштабах, однако большая часть крупнейших инвестиций в инфраструктуру ИИ приходится на гиперскейлеров и облачные платформы, говорит Эпплби.
«Всё это находится на более ранней стадии, чем можно было бы предположить по объёму инвестиций, — говорит он. — Во всём мире немного примеров крупных компаний, которые создали, масштабировали и развернули промышленные ИИ-сервисы и эффективно ими управляют».
Но если компания наращивает мощности, не обеспечив предварительно прозрачность и контроль, она лишь создаёт более масштабную и дорогую версию уже существующих у неё операционных проблем.
«Золотая лихорадка охватила крупнейших поставщиков сервисов, — говорит он. — У крупных компаний всё ещё есть возможность сделать всё правильно».
Спонсируемые статьи — это материалы, созданные компанией, которая оплачивает публикацию или состоит с VentureBeat в деловых отношениях. Такие материалы всегда имеют соответствующую пометку. За дополнительной информацией обращайтесь по адресу sales@venturebeat.com.


