Elastic Streams преобразует анализ логов
При поддержке Elastic
Логи становятся главным инструментом для поиска ответа на вопрос «почему» при диагностике сетевых инцидентов
Современные ИТ-среды сталкиваются с проблемой данных: их слишком много. Организации, управляющие корпоративной инфраструктурой, все чаще испытывают трудности с обнаружением и диагностикой проблем в реальном времени, оптимизацией производительности, повышением надежности и обеспечением безопасности и соответствия требованиям — и все это в условиях ограниченных бюджетов.
В современной сфере наблюдаемости (observability) существует множество инструментов, предлагающих решение. Большинство из них сводится к тому, что команды DevOps или инженеры по надежности сайтов (SRE) анализируют логи, метрики и трассировки, чтобы выявить закономерности, понять происходящее в сети и диагностировать причины возникновения проблемы или инцидента. Проблема заключается в том, что этот процесс создает информационную перегрузку: один только кластер Kubernetes может генерировать от 30 до 50 гигабайт логов в день, а подозрительные паттерны поведения могут ускользнуть от человеческого глаза.
«В эпоху искусственного интеллекта кажется таким анахронизмом полагаться в наблюдении за инфраструктурой исключительно на людей, — говорит Кен Экснер (Ken Exner), директор по продуктам в Elastic. — Не хочу вас расстраивать, но машины справляются с сопоставлением паттернов лучше людей». Утверждение отражает общую тенденцию.
Отраслевая ориентация на визуализацию симптомов заставляет инженеров вручную искать ответы. Решающий вопрос «почему» скрыт в логах, но из-за огромных объемов неструктурированных данных индустрия склонна использовать их лишь в крайнем случае. Это вынуждает команды идти на дорогостоящие компромиссы: либо тратить бесчисленные часы на создание сложных конвейеров данных, либо отбрасывать ценные данные логов и рисковать критическими пробелами в видимости, либо записывать логи и забывать о них.
Компания Elastic, известная как The Search AI Company, недавно выпустила новую функцию для обеспечения наблюдаемости под названием Streams. Она призвана стать основным сигналом для расследований, превращая шумные логи в паттерны, контекст и смысл.
Streams использует искусственный интеллект для автоматического разделения и синтаксического анализа «сырых» логов с целью извлечения релевантных полей, что значительно снижает усилия SRE по приведению логов в пригодный для работы вид. Streams также автоматически выявляет значимые события, такие как критические ошибки и аномалии, из богатых контекстом логов, предоставляя инженерам ранние предупреждения и четкое понимание рабочих нагрузок, что позволяет быстрее расследовать и решать проблемы. Конечная цель — демонстрация шагов по их устранению.
«Из необработанных, объемных и беспорядочных данных Streams автоматически создает структуру, приводя их в пригодный вид, автоматически предупреждает о проблемах и помогает их устранить, — говорит Экснер. — В этом и заключается магия Streams».
Нарушенный рабочий процесс
Streams переворачивает с ног на голову процесс наблюдаемости, который многие называют неэффективным. Как правило, SRE настраивают метрики, логи и трассировки. Затем они настраивают оповещения и целевые уровни обслуживания (SLO) — часто жестко закодированные правила, показывающие, когда служба или процесс выходят за рамки порогового значения или когда обнаружен определенный паттерн.
При срабатывании оповещения оно указывает на метрику, демонстрирующую аномалию. После этого SRE смотрят на дашборд метрик, где могут визуализировать проблему и сравнить оповещение с другими метриками (например, ЦП с памятью или вводом-выводом), начиная поиск закономерностей.
Затем им может потребоваться изучить трассировку, исследовать восходящие и нисходящие зависимости в приложении, чтобы докопаться до первопричины проблемы. Выяснив источник неполадок, они переходят к логам этой базы данных или службы, чтобы попытаться отладить проблему.
Некоторые компании просто стремятся добавить больше инструментов, когда текущие оказываются неэффективными. Это означает, что SRE вынуждены переключаться между разными инструментами, чтобы контролировать мониторинг и устранение неполадок в своей инфраструктуре и приложениях.
«Вы перепрыгиваете с одного инструмента на другой. Вы полагаетесь на человека, который должен интерпретировать эти данные, визуально оценивать взаимосвязь систем на карте сервисов и графики на дашборде метрик, чтобы выяснить, в чем и где заключается проблема, — говорит Экснер. — Но ИИ автоматизирует этот рабочий процесс».
Благодаря Streams на базе ИИ логи используются не просто реактивно для устранения проблем, но и для проактивной обработки потенциальных неполадок. Они позволяют создавать богатые информацией оповещения, которые помогают командам сразу переходить к решению проблем, предлагая варианты исправления или даже устраняя проблему полностью с последующим автоматическим уведомлением команды о том, что ситуация под контролем.
«Я считаю, что логи — самый богатый источник информации и исходный тип сигналов — начнут управлять значительной частью автоматизации, которую инженер по надежности сайтов обычно выполняет сегодня вручную, — добавляет он. — Человек не должен участвовать в процессах, где ему приходится самостоятельно копаться в данных, пытаясь понять, что происходит, где и в чем проблема, а затем, найдя первопричину, пытаться сообразить, как ее отладить».
Будущее наблюдаемости
Большие языковые модели (LLM) могут сыграть ключевую роль в будущем наблюдаемости. LLM преуспевают в распознавании закономерностей в огромных объемах повторяющихся данных, что очень напоминает логи и телеметрические данные в сложных динамических системах. Современные LLM можно обучать под конкретные ИТ-процессы. Имея инструменты автоматизации, LLM получает информацию и средства, необходимые для устранения ошибок баз данных, проблем с кучей Java (Java heap) и многого другого. Внедрение таких моделей в платформы, обеспечивающие контекст и релевантность, будет иметь решающее значение.
Автоматизированное исправление займет некоторое время, отмечает Экснер, но автоматизированные руководства и сценарии (runbooks и playbooks), создаваемые LLM, станут стандартной практикой в течение ближайших нескольких лет. Другими словами, шаги по устранению неполадок будут определяться языковыми моделями. LLM предложит варианты исправления, а человек проверит и внедрит их, вместо того чтобы вызывать эксперта.
Решение проблемы нехватки квалифицированных кадров
Полный переход на искусственный интеллект в области наблюдаемости поможет решить проблему острой нехватки талантов, необходимых для управления ИТ-инфраструктурой. Найм продвигается медленно, потому что организациям нужны команды с огромным опытом, пониманием потенциальных проблем и путей их быстрого решения. Этот опыт может быть заложен в контекстно-ориентированную LLM, говорит Экснер.
«Мы можем помочь справиться с нехваткой кадров, усилив людей с помощью LLM, которые мгновенно делают их экспертами, — поясняет он. — Я думаю, это значительно упростит превращение начинающих специалистов в экспертов как в области безопасности, так и в области наблюдаемости, и позволит новичкам действовать на уровне профессионалов».
Функция Streams в Elastic Observability уже доступна. Начните работу, прочитав подробнее о Streams.
Спонсорские статьи — это контент, подготовленный компанией, которая либо платит за публикацию, либо имеет деловые отношения с VentureBeat, и они всегда четко маркируются. Для получения дополнительной информации обращайтесь по адресу sales@venturebeat.com.



