Искусственный интеллект выявляет операционные пробелы в ИТ-системах

Искусственный интеллект выявляет операционные пробелы в ИТ-системах

При поддержке Virtana


Корпоративные ИТ-команды проигрывают борьбу с отказами современных приложений. Проблема заключается вовсе не в нехватке инструментов мониторинга. Дело в том, что инструменты, на которые они полагаются, создавались для эпохи инфраструктуры, которой больше не существует.

ИТ-команды полностью полагались на предположение, что при возникновении неполадок инструменты мониторинга объяснят причину. Это предположение больше не работает. Традиционное моделирование производительности приложений (APM) рассматривает само приложение как границу истины. Оно выявляет медленные транзакции и ошибки, но не доходит до первопричины, оставляя командам пространство для догадок.

Тем временем ИИ многократно усиливает масштаб проблемы, доводя уровень сбоев до показателей, которые устаревшая архитектура мониторинга не способна переварить. Растущие расходы на наблюдаемость делают ситуацию только хуже, а не лучше.

Поскольку рабочие нагрузки ИИ смещают зоны сбоев ниже уровня приложений, разрыв между тем, что могут видеть инструменты мониторинга, и тем, что на самом деле необходимо знать операционным командам, превратился в системный бизнес-риск, который невозможно исправить за счет дальнейшего увеличения инвестиций в текущую модель. Единственный надежный выход — это фундаментальный архитектурный сдвиг: от изолированных инструментов уровня приложений к единой полностековой системе записей, способной автономно сопоставлять сигналы на каждом уровне инфраструктуры.

Исследования обнажают системные операционные пробелы

Новые исследования показывают, что внедрение ИИ обнажает системные операционные пробелы даже быстрее, чем осознает большинство руководящих команд. В отчете Virtana «ИИ ломает управляемые человеком операции» (AI Is Breaking Human-Managed Operations), охватившем более 350 руководителей высшего звена в сфере ИТ и технологий, говорится, что три четверти предприятий сообщают о доле сбоев задач ИИ, превышающей 10%, а треть — о показателях выше 25%. В масштабах предприятия, где непрерывно выполняются миллионы решений на базе ИИ, такие показатели сбоев представляют собой системный риск, а не операционный шум. Исследование также демонстрирует разрыв в восприятии руководства: 59% топ-менеджеров считают свои организации готовыми к операциям масштаба ИИ, однако 62% практиков сообщают о фрагментированных системах и постоянных проблемах с видимостью. Когда лица, принимающие решения, и операционисты придерживаются принципиально разных взглядов на операционную реальность, инвестиции направляются на решение не тех проблем, в то время как настоящие трудности сохраняются: пробелы в видимости, штормы оповещений и системные сбои ИИ, которые никто не может объяснить.

«Данные недвусмысленны, — говорит Эпплби, президент и генеральный директор Virtana. — Хотя уверенность руководства растет, операционная хрупкость растет еще быстрее. Когда три четверти предприятий сообщают о двузначных показателях сбоев задач ИИ, а треть превышает 25%, операционная модель явно устарела. В масштабах предприятия эти показатели трансформируются в тысячи неудачных выполнений в день, что приводит к повторным попыткам, растрате вычислительных ресурсов, каскадным задержкам и эскалации операционных рисков. По мере расширения рабочих нагрузок ИИ и начала автономной работы агентских систем умеренные проценты сбоев перерастают в системную нестабильность».

Почему устаревшее ПО APM не может объяснить современные сбои

Системы APM создавались для дискретных, ограниченных приложений, работающих на предсказуемой инфраструктуре, но этот мир больше не существует. Современные приложения представляют собой распределенные системы из декомпозированных сервисов, охватывающих все предприятие, с кодом, работающим на Kubernetes. Они взаимодействуют с базами данных и общей инфраструктурой, борясь за ресурсы графических процессоров (GPU) и поддерживая рабочие нагрузки ИИ в гибридных средах. Производительность ориентированной на пользователя транзакции определяется не каким-то одним компонентом, а возникает в результате их совместного взаимодействия.

«Критически важные приложения, такие как системы бронирования авиабилетов, системы обработки платежей, системы здравоохранения и экстренные диспетчерские службы, — это больше не просто код, а сложные системы, охватывающие программное обеспечение, сервисы, инфраструктуру и рабочие нагрузки ИИ, — поясняет Эпплби. — При таком масштабе и сложности традиционные системы APM, сфокусированные на коде и операциях с участием только человека, перестают быть надежным способом понимания поведения приложений».

Системы APM ограничены ответами на вопрос «где», а не «почему». Они обнаруживают симптомы под капотом, такие как повышенная задержка, рост частоты ошибок или падение пропускной способности. Но они не могут объяснить, что именно вызывает эти проблемы, поскольку первопричина все чаще кроется ниже уровня приложения — в инфраструктуре, для наблюдения за которой этот инструмент никогда не создавался.

Такие системы упускают первопричины на подприкладном уровне: деградацию хранилища под воздействием давления ввода-вывода от конкурирующих нагрузок, узлы Kubernetes, испытывающие дефицит ресурсов из-за соседних сервисов, и борьбу за GPU со стороны рабочих нагрузок ИИ, которая каскадом поднимается вверх и увеличивает задержку приложений. Инструмент видит уровень приложения, но не способен заглянуть ниже, поэтому он регистрирует симптом и просто останавливается. В результате операционные команды вынуждены вручную сопоставлять причины с помощью фрагментированных инструментов, в то время как таймер инцидента тикает, а бизнес требует эскалации.

Исследование прямо отражает это: 56% практиков называют узкие места в хранилищах и сети своим главным ограничением при работе с ИИ — именно те уровни, для наблюдения за которыми традиционные инструменты APM никогда не предназначались. Это не единичные случаи; это те условия, в которых сегодня функционирует большинство корпоративных сред ИИ.

Увеличение затрат на наблюдаемость приводит к снижению ясности

Интуитивная реакция на проблему мониторинга — добавить еще инструментов мониторинга. Многие предприятия поступили именно так, надстроив новые платформы наблюдаемости, дашборды и системы оповещения поверх существующей инфраструктуры. Но эта ориентированная на инструменты модель никогда не была рассчитана на то, чтобы поспевать за масштабами и сложностью современных корпоративных сред. Результатом стал инвестиционный парадокс: больше расходов, больше дашбордов, больше оповещений — и по-прежнему ни одного надежного ответа при возникновении инцидента.

По словам Gartner, рынок наблюдаемости приблизится к 14,2 миллиарда долларов к 2028 году, однако менее половины ИТ-лидеров уверены, что смогут справляться с работой в масштабе с помощью имеющихся у них инструментов. К сожалению, предприятия внедряют новые инструменты поверх фрагментированных фундаментов данных, не унифицируя базовую модель данных. Это означает, что каждый новый инструмент добавляет новый изолятор (силос), новую логику оповещений и новый дашборд, который не взаимодействует с другими дашбордами, что приводит к еще меньшей видимости и большему количеству шума.

Полностековая наблюдаемость приложений — путь к операциям масштаба ИИ

Учитывая, что примерно каждая четвертая рабочая нагрузка ИИ завершается сбоем, запуск ИИ в масштабе предприятия становится операционно и финансово неустойчивым. Это быстро превращается не просто в ИТ-проблему, а в проблему балансового отчета. Сбои при выполнении, повторные попытки, впустую потраченные вычислительные мощности и каскадные задержки стоят дорого.

Чтобы преодолеть этот разрыв, организациям необходимо изменить подход к архитектуре и наблюдаемости, отказавшись от понимания наблюдаемости как набора специализированных инструментов в пользу единой системы записей. Объем сигналов в современных средах ИИ превышает то, что команды могут обработать в реальном времени, поэтому решением является делегирование корреляции и первичной диагностики автономным системам, которые непрерывно работают на основе единого контекста.

Цель состоит в том, чтобы позволить операторам задавать вопросы на естественном языке, в то время как ИИ-агенты взаимодействуют программным образом посредством структурированных протоколов, при этом и те, и другие анализируют единый операционный контекст. Такие возможности, как созданная на базе ИИ система контекстно-осведомленной наблюдаемости приложений от Virtana, автоматически сопоставляют сигналы в коде, сервисах, инфраструктуре, сетях, хранилищах и рабочих нагрузках ИИ, обеспечивая агентское расследование и выявление первопричин на основе фактических данных без ручной корреляции между разрозненными инструментами. Платформа предоставляет этот операционный контекст через сервер MCP, совместимый с основными ассистентами ИИ, включая ChatGPT, Claude, Gemini и Microsoft Copilot.

«Современные приложения представляют собой распределенные системы, и ограничения производительности часто возникают на уровне инфраструктуры, сети или платформы, для работы с которыми традиционные APM никогда не создавались, — отметил Даг Сайер (Doug Syer), главный инженер по мониторингу ИИ и наблюдаемости в NWN. — Чтобы поддерживать более 6 000 ИТ-директоров в корпоративном и государственном секторах, нам необходима видимость всего стека. Платформа Virtana Application Observability предлагает истинную видимость на системном уровне, сопоставляя сигналы по всему стеку и обеспечивая немедленный переход от симптомов к подтвержденной доказательствами первопричине».

Как надежно масштабировать ИИ в продакшене

Раньше операционной команде, управляющей системой бронирования, которая охватывает локальную инфраструктуру и множество облачных регионов, могло потребоваться несколько часов на разрешение кризисных ситуаций в ситуационном центре при ручном сопоставлении оповещений из фрагментированных инструментов. С полностековой наблюдаемостью команды могут за считанные минуты определить, кроется ли всплеск задержки в коде приложения, перегруженном пути хранения или узле Kubernetes, испытывающем давление ввода-вывода из-за конкурирующей рабочей нагрузки ИИ. Платформа предоставляет этот операционный контекст через сервер MCP, позволяя операторам запрашивать данные по всему стеку на естественном языке, пока автономные системы взаимодействуют программным путем.

Поскольку предприятия достигают переломного модального момента, переходя от пилотных проектов ИИ к полномасштабному продакшну, ставки резко возрастают, а уровень сбоев растет со скоростью, из-за которой этот разрыв невозможно игнорировать. Простое добавление все новых инструментов мониторинга явно не является ключом к надежному масштабированию ИИ в продакшене. Вместо этого требуется платформа наблюдаемости, которая изначально понимает всю систему целиком, а не только находящийся на самом верху слой кода.


Спонсорские статьи — это контент, подготовленный компанией, которая либо платит за публикацию, либо имеет деловые отношения с VentureBeat, и они всегда четко маркируются. Для получения дополнительной информации обращайтесь по адресу sales@venturebeat.com.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.