ИИ от Chronosphere сокращает затраты на наблюдаемость на 84%
Chronosphere, нью-йоркский стартап в сфере наблюдаемости оцененный в 1,6 миллиарда долларов, объявил в понедельник о запуске функций AI-Guided Troubleshooting (устранения неполадок под руководством ИИ), призванных помочь инженерам диагностировать и устранять сбои промышленного ПО. Эта проблема обострилась по мере того, как инструменты искусственного интеллекта ускоряют написание кода, одновременно усложняя отладку систем.
Новые функции объединяют анализ на базе ИИ с тем, что Chronosphere называет темпоральным графом знаний (Temporal Knowledge Graph) — постоянно обновляемой картой сервисов организации, инфраструктурных зависимостей и изменений в системе с течением времени. Эта технология призвана решить насущную проблему корпоративного программного обеспечения: разработчики пишут код быстрее, чем когда-либо, с помощью ИИ, но устранение неполадок по-прежнему во многом остается ручным, создавая «узкие места» при сбоях приложений.
«Чтобы ИИ был эффективен в вопросах наблюдаемости, ему нужно нечто большее, чем распознавание образов и суммирование», — заявил Мартин Мао (Martin Mao), генеральный директор и соучредитель Chronosphere, в эксклюзивном интервью VentureBeat. «Chronosphere потратила годы на создание фундамента данных и аналитической глубины, необходимых для того, чтобы ИИ действительно помогал инженерам. С помощью нашего темпорального графа знаний и расширенных аналитических возможностей мы даем ИИ понимание, необходимое для того, чтобы сделать наблюдаемость по-настоящему интеллектуальной, а инженерам — уверенность в том, что они могут доверять его подсказкам».
Это объявление прозвучало в момент, когда рынок наблюдаемости — программного обеспечения для мониторинга сложных облачных приложений — сталкивается с растущим давлением с необходимостью оправдать растущие затраты. Согласно собственному исследованию Chronosphere, объемы корпоративных логов выросли на 250% в годовом исчислении, в то время как исследование Массачусетского технологического института (MIT) и Пенсильванского университета показало, что генеративный ИИ спровоцировал увеличение еженедельных коммитов кода на 13,5%, что свидетельствует о возросшей скорости разработки, но также и о большей сложности систем.
ИИ пишет код на 13% быстрее, но отладка упорно остается ручной
Несмотря на достижения в области автоматической генерации кода, отладка сбоев в продакшене остается упрямо ручным процессом. Когда крупный сайт электронной коммерции начинает тормозить во время оформления заказа или банковское приложение перестает обрабатывать транзакции, инженерам приходится просеивать миллионы точек данных — серверные логи, трассировки приложений, инфраструктурные метрики, недавние развертывания кода — для выявления первопричин.
Ответом от Chronosphere стали функции AI-Guided Troubleshooting, построенные на четырех ключевых возможностях: автоматические «предложения» (Suggestions), предлагающие пути расследования на основе данных; темпоральный граф знаний, отображающий взаимосвязи в системе и ее изменения; «блокноты для расследований» (Investigation Notebooks), документирующие каждый шаг устранения неполадок для последующего использования; а также создание запросов на естественном языке.
Мао объяснил суть темпорального графа знаний на практических примерах: «Это живая, учитывающая время модель вашей системы. Она объединяет телеметрию — метрики, трассировки, логи, контекст инфраструктуры, события изменений вроде деплоев и флагов функций, а также человеческий ввод вроде заметок и инструкций — в единую карту с возможностью запросов, которая обновляется по мере эволюции вашей системы».
Мао утверждает, что это кардинально отличается от карт зависимостей сервисов, предлагаемых такими конкурентами, как Datadog, Dynatrace и Splunk. «Он добавляет временной фактор, а не только топологию, — сказал он. — Он отслеживает, как сервисы и зависимости меняются с течением времени, и связывает эти изменения с инцидентами: что изменилось и почему. Многие инструменты полагаются на стандартизированные интеграции; наш граф идет дальше, нормализуя нестандартную телеметрию, чтобы специфичные для приложений сигналы не становились слепой зоной».
Почему Chronosphere демонстрирует свою работу, а не принимает автоматические решения
В отличие от чисто автоматизированных систем, Chronosphere разработала свои ИИ-функции так, чтобы инженеры оставались за рулем — это осознанный выбор, призванный решить проблему, которую Мао называет проблемой «уверенных, но ошибочных рекомендаций», преследующую ранние инструменты наблюдаемости на базе ИИ.
«„Удержание инженеров под контролем“ означает, что ИИ демонстрирует ход своей работы, предлагает следующие шаги и позволяет инженерам проверить их или переопределить — он никогда не принимает решения автоматически за кулисами», — пояснил Мао. «Каждое предложение включает в себя доказательства — тайминги, зависимости, паттерны ошибок — и представление „Почему это было предложено?“, чтобы они могли изучить, что было проверено и отброшено до принятия мер».
Он привел конкретный пример: «Срабатывает предупреждение SLO [целевого уровня обслуживания] для функции оформления заказа (Checkout). Chronosphere мгновенно выводит ранжированное предложение: ошибки, судя по всему, начались в зависимом сервисе платежей (Payment). Инженер может нажать кнопку „Исследовать“ (Investigate), чтобы увидеть графики и логику, и, если все подтвердится, копнуть глубже. По мере того как они переключаются на Payment, система адаптируется, предлагая новые подсказки, ограниченные этим конкретным сервисом — и все это в рамках единого представления, без прыжков между вкладками».
В этом сценарии инженер задает вопрос «что изменилось?», и система подтягивает события изменений. «Наша функция блокнотов делает причинно-следственную цепочку очевидной: обновление флага функций предшествовало исчерпанию памяти подов в Payment; а скачок в Checkout является вторичным симптомом», — сказал Мао. «Они могут принять решение откатить флаг. Весь этот путь — последовавшие подсказки, просмотренные доказательства, выводы — автоматически фиксируется в блокноте для расследований, а результат поступает в темпоральный граф знаний, чтобы подобные будущие инциденты разрешались быстрее».
Как стартап стоимостью 1,6 млрд долларов бросает вызов Datadog, Dynatrace и Splunk
Chronosphere выходит на все более переполненный рынок. Компания Datadog, публичный лидер в области наблюдаемости с рыночной капитализацией более 40 миллиардов долларов, представила собственные функции устранения неполадок на базе ИИ. То же самое сделали Dynatrace и Splunk. Все три компании предлагают комплексные платформы «все в одном», обещающие видимость из единого окна.
Мао охарактеризовал подход Chronosphere на техническом уровне. «Ранний „ИИ для наблюдаемости“ сильно полагался на поиск закономерностей и суммирование, что обычно дает сбой во время реальных инцидентов», — отметил он. «Такие подходы часто останавливаются на корреляции аномалий или выдаче беглых объяснений без более глубокого анализа и причинно-следственных рассуждений, необходимых лидерам в сфере наблюдаемости. Они могут производить впечатление на демонстрациях, но разочаровывают в продакшене — они суммируют сигналы, а не объясняют причину и следствие».
Конкретным техническим пробелом, по его утверждению, является пользовательская телеметрия приложений. «Большинство платформ рассуждают на основе стандартизированных интеграций — Kubernetes, распространенных облачных сервисов, популярных баз данных, — игнорируя самые говорящие подсказки, которые скрываются в пользовательской телеметрии приложений», — сказал Мао. «Имея неполную картину, большие языковые модели начинают „заполнять пробелы“, выдавая уверенные, но неверные рекомендации, которые заводят команды в тупик».
Конкурентное позиционирование Chronosphere получило подтверждение в июле, когда компания Gartner второй год подряд назвала ее лидером в своем «магическом квадрате» Magic Quadrant for Observability Platforms 2025. Компания получила признание как за «полноту видения» (Completeness of Vision), так и за «способность реализации» (Ability to Execute). В декабре 2024 года Chronosphere также разделила самую высокую общую оценку среди признанных вендоров в отчете Gartner Peer Insights «Голос клиента» (Voice of the Customer), набрав 4,7 балла из 5 на основе 70 отзывов.
Тем не менее компания сталкивается с усиливающейся конкуренцией за ключевых клиентов. Аналитики UBS отметили в июле, что OpenAI теперь использует как Datadog, так и Chronosphere одновременно для мониторинга рабочих нагрузок GPU, что говорит о том, что лидер в сфере ИИ оценивает альтернативы. Хотя UBS сохранила рекомендацию «покупать» (buy) в отношении акций Datadog, аналитики предупредили, что растущее использование Chronosphere может оказать давление на ценовую политику Datadog.
Внутри заявлений о снижении затрат на 84% — и что на самом деле должны измерять ИТ-директора
Помимо технических возможностей, Chronosphere выстроила свое рыночное позиционирование на контроле затрат — критическом факторе на фоне стремительного роста расходов на наблюдаемость. Компания утверждает, что ее платформа снижает объемы данных и сопутствующие расходы в среднем на 84%, одновременно сокращая количество критических инцидентов на 75%.
Столкнувшись с просьбой привести конкретные примеры клиентов с реальными цифрами, Мао указал на несколько кейсов. «Robinhood добилась пятикратного улучшения надежности и четырехкратного улучшения среднего времени обнаружения (Mean Time to Detection)», — сказал он. «DoorDash использовала Chronosphere для улучшения управления и стандартизации практик мониторинга. Astronomer добилась сокращения расходов более чем на 85% за счет оптимизации данных при их поступлении (ingest), а Affirm масштабировала свою нагрузку в 10 раз во время мероприятия в Черную пятницу без каких-либо проблем, подчеркнув надежность платформы в экстремальных условиях».
Аргумент стоимости имеет значение, потому что, как отметил Пол Нашаваты (Paul Nashawaty), главный аналитик CUBE Research, когда Chronosphere запустила свой продукт Logs 2.0 в июне: «Организации тонут в данных телеметрии, причем более 70% расходов на наблюдаемость уходит на хранение логов, которые никогда не запрашиваются».
Для ИТ-директоров (CIO), уставших от анонсов с приставкой «на базе ИИ», Мао признал, что скептицизм оправдан. «Способ разобраться в этом — проверить, сокращает ли ИИ время инцидентов, уменьшает ли рутину и создает ли воспроизводимые знания в вашей собственной среде, а не на демонстрации», — посоветовал он. Он порекомендовал ИТ-директорам оценивать три фактора: прозрачность и контроль (показывает ли система свои рассуждения?), охват пользовательской телеметрии (может ли она работать с нестандартизированными данными?) и предотвращение ручного труда (сколько разовых запросов и переключений между инструментами исключается?).
Почему Chronosphere сотрудничает с пятью вендорами вместо того, чтобы создавать всё самостоятельно
Параллельно с анонсом устранения неполадок с помощью ИИ, Chronosphere представила новую партнерскую программу, интегрирующую пять специализированных вендоров для закрытия пробелов в своей платформе: Arize для мониторинга больших языковых моделей, Embrace для мониторинга реальных пользователей (RUM), Polar Signals для непрерывного профилирования, Checkly для синтетического мониторинга и Rootly для управления инцидентами.
Эта стратегия представляет собой осознанную ставку против доминирующих на рынке платформ «все в одном». «Хотя платформа „все в одном“ может быть достаточна для небольших организаций, глобальные предприятия требуют лучшей в своем классе глубины в каждом домене», — сказал Мао. «Именно это побудило нас создать нашу партнерскую программу и инвестировать в бесшовные интеграции с ведущими провайдерами — чтобы наши клиенты могли действовать уверенно и четко на каждом уровне наблюдаемости».
Ноа Смолен (Noah Smolen), руководитель направления партнерств в Arize, отметил, что сотрудничество отвечает конкретным потребностям предприятий. «Имея широкий круг клиентов из списка Fortune 500, мы понимаем высокую планку, необходимую для того, чтобы агентские системы ИИ были готовы к развертыванию и работали без инцидентов, особенно учитывая темпы внедрения ИИ на предприятиях», — сказал Смолен. «Партнерство с Chronosphere приходится как нельзя кстати, когда интегрированный, специально созданный облачно-нативный комплекс наблюдаемости на базе ИИ решает огромную проблему для дальновидных руководителей высшего звена, требующих самого лучшего во всем своем стеке наблюдаемости».
Аналогичным образом, Джей Джей Танг (JJ Tang), генеральный директор и основатель Rootly, подчеркнул преимущества в разрешении инцидентов. «Инциденты препятствуют инновациям и доходам, а сложность заключается в просеивании огромных объемов данных наблюдаемости, мобилизации команд и быстром разрешении проблем», — сказал Танг. «Интеграция Chronosphere с Rootly позволяет инженерам совместно работать с учетом контекста и быстрее решать проблемы в рамках существующих каналов связи, радикально сокращая время до разрешения и в конечном итоге повышая надежность — снижая количество повторных инцидентов Sev0 и Sev1 более чем на 78%».
На вопрос о том, как соотносятся общие затраты, когда клиенты используют несколько партнерских контрактов вместо единой платформы, Мао признал текущую сложность. «В настоящее время общие клиенты обычно поддерживают раздельные контракты, если только они не взаимодействуют через сервисного партнера или системного интегратора», — сказал он. Тем не менее, он возразил, что экономика все еще в пользу компонентного подхода: «Наши объединенные технологии обеспечивают исключительную ценность — в большинстве случаев всего за малую часть цены решения на базе одной платформы. Помимо экономии, клиенты получают более богатый и унифицированный опыт наблюдаемости, который открывает более глубокие инсайты и большую эффективность, особенно для крупномасштабных сред».
Компания планирует со временем оптимизировать этот процесс. «По мере развития программы ISV мы сосредоточены на предоставлении более упорядоченного опыта за счет перехода к единому консолидированному контракту, который упрощает закупки и ускоряет получение результатов», — сказал Мао.
Как два инженера из Uber превратили хэллоуинские сбои в стартап стоимостью в миллиард долларов
Истоки Chronosphere уходят корнями в 2019 год, когда Мао и соучредитель Роб Скиллингтон (Rob Skillington) покинули Uber после создания внутренней платформы наблюдаемости гиганта райдшеринга. В Uber команда Мао столкнулась с кризисом: собственные инструменты компании давали сбой в две самые загруженные ночи — на Хэллоуин и в канун Нового года, — лишая компанию видимости того, могут ли пассажиры заказывать поездки, а водители — находить клиентов.
Решение, созданное ими в Uber, использовало открытый исходный код и в конечном итоге позволило компании работать без сбоев даже во время мероприятий с высокой нагрузкой. Но более широкое понимание рынка пришло на отраслевой конференции в декабре 2018 года, когда ведущие облачные провайдеры сделали ставку на Kubernetes, технологию контейнерной оркестрации от Google.
«Это означало, что большинство архитектур технологий в конечном итоге будут выглядеть как архитектура Uber», — вспоминал Мао в публикации августе 2024 года от Greylock Partners, ведущего инвестора Chronosphere. «А это означало, что у каждой компании, а не только у нескольких крупных технологических компаний и всяких Walmart, будет ровно та же проблема, которую мы решили в Uber».
С тех пор Chronosphere привлекла более 343 миллионов долларов финансирования в ходе нескольких раундов под руководством Greylock, Lux Capital, General Atlantic, Addition и Founders Fund. Компания работает как удаленная организация с офисами в Нью-Йорке, Остине, Бостоне, Сан-Франциско и Сиэтле, насчитывая около 299 сотрудников согласно данным LinkedIn.
В клиентскую базу компании входят DoorDash, Zillow, Snap, Robinhood и Affirm — преимущественно быстро растущие технологические компании, управляющие облачно-нативной инфраструктурой на базе Kubernetes в огромных масштабах.
Что доступно сейчас и чего предприятиям ожидать в 2026 году
Функции AI-Guided Troubleshooting от Chronosphere, включая подсказки (Suggestions) и блокноты для расследований (Investigation Notebooks), в понедельник вышли в режим ограниченной доступности для избранных клиентов. Полноценный общий доступ (general availability) компания планирует в 2026 году. Сервер протокола контекста модели (MCP Server), который позволяет инженерам интегрировать Chronosphere непосредственно во внутренние рабочие процессы ИИ и запрашивать данные наблюдаемости через среды разработки с поддержкой ИИ, доступен немедленно для всех клиентов Chronosphere.
Поэтапное развертывание отражает осторожный подход компании к внедрению ИИ в производственных средах, где ошибки влекут за собой реальные затраты. Собирая отзывы от ранних пользователей перед широким релизом, Chronosphere стремится усовершенствовать свои алгоритмы подсказок и убедиться, что ее предложения действительно ускоряют устранение неполадок, а не просто создают впечатляющие демонстрации.
Однако игра вдолгую простирается за пределы отдельных продуктовых функций. Двойная ставка Chronosphere — на прозрачный ИИ, показывающий свои рассуждения, и на партнерскую экосистему вместо интеграции по принципу «все в одном» — представляет собой фундаментальный тезис о том, как будет развиваться корпоративная наблюдаемость по мере усложнения систем.
Если этот тезис подтвердится, то компанией, которая решит задачу наблюдаемости для эпохи ИИ, станет не та, у которой самый автоматизированный черный ящик. Это будет компания, которая заслуживает доверия инженеров, объясняя то, что она знает, признавая то, чего не знает, и позволяя людям делать окончательный выбор. В индустрии, утопающей в данных и обещаниях «серебряных пуль», Chronosphere ставит на то, что демонстрация проделанной работы по-прежнему имеет значение — даже когда математику делает ИИ.



