Надёжность агентного ИИ и оценка систем: всё меньше компаний готовы разрешать ИИ-агентам вносить изменения в рабочую среду только на основании автоматизированных проверок — сейчас это допускают или планируют 56% против 75% в июле

Надёжность агентного ИИ и оценка систем: всё меньше компаний готовы разрешать ИИ-агентам вносить изменения в рабочую среду только на основании автоматизированных проверок — сейчас это допускают или планируют 56% против 75% в июле

VentureBeat Intelligence опросила респондентов из организаций со штатом от 100 сотрудников в рамках августовского опроса VB Pulse. Мы спрашивали об оценке ИИ-агентов и сбоях в продуктивной среде, о том, могут ли агенты вносить изменения в продуктивную среду без проверки человеком, а также о том, какие платформы оценки используют крупные компании.

Среди августовских респондентов, чьи организации развертывают автономных ИИ-агентов, 56% уже разрешают агентам вносить некоторые изменения в продуктивную среду исключительно на основании результатов автоматической оценки или работают над тем, чтобы это стало возможным. В июле 75% респондентов из этой группы выбрали один из этих двух вариантов ответа. За тот же месяц доля тех, кто ожидает, что человек и впредь будет проверять изменения агентов в продуктивной среде, удвоилась — с 20% до 42%.

Среди тех же августовских респондентов 32% уже разрешают это для отдельных агентов или изменений с низким уровнем риска, а 24% проектируют свои конвейеры так, чтобы разрешить это в течение 12 месяцев.

Автоматизированные оценки позволяют проблемам дойти до клиентов. В этом отчете сбоем, прошедшим оценку, считается случай, когда ИИ-агент или функция на основе большой языковой модели (LLM) прошли внутреннюю оценку, но затем вызвали сбой, затронувший клиентов. Если исключить 5% августовских респондентов, чьи организации не проводят оценку перед развертыванием, 61% сообщили как минимум об одном таком сбое за последние 12 месяцев.

Однако среди организаций, развертывающих автономных агентов, доля респондентов, сообщивших о сбое, прошедшем оценку, и доля тех, кто не сообщил о таких сбоях, практически одинаковы: обе группы с сопоставимой частотой разрешают вносить изменения без проверки или работают над тем, чтобы это стало возможным.

На вопрос о том, какое ограничение сильнее всего снижает доверие к автоматизированной оценке, только 9% респондентов выбрали ответ о доверии к автоматизированной оценке уже сегодня. Остальные назвали какое-либо ограничение. Среди всех респондентов этот ответ выбрали 2% сообщивших о сбое, прошедшем оценку, против 18% тех, кто о таком сбое не сообщал. Среди организаций, развертывающих автономных агентов, разница между респондентами, сообщившими о сбое и не сообщившими о нем, — 3% против 10% — слишком мала, чтобы делать выводы.

Немногие крупные компании, использующие ИИ-агентов, строят мониторинг в реальном времени вокруг проверки правильности ответов агента. Среди респондентов из организаций, развертывающих автономных агентов, только 29% говорят, что их мониторинг в продуктивной среде основан на автоматизированных проверках качества в реальном времени. Для 53% основным подходом является регистрация трассировок или мониторинг через шлюз — и ни один из этих вариантов не подразумевает проверку правильности ответов.

В августе доля респондентов, использующих встроенные инструменты оценки OpenAI, была выше, чем в июле. Среди ответивших на вопрос о платформах 59% августовских респондентов заявили, что их организации используют встроенные средства оценки и трассировки OpenAI Developer Platform, против 31% в июле. В целом 62% августовских респондентов планируют в течение 12 месяцев внедрить новую или дополнительную платформу оценки либо заменить текущую.

Вывод 1. 56% крупных компаний с ИИ-агентами разрешают им вносить изменения в продуктивную среду только на основании автоматических проверок или работают над тем, чтобы это стало возможным; в июле таких было 75%

За месяц доля тех, кто ожидает, что человек и впредь будет проверять изменения агентов в продуктивной среде, удвоилась — с 20% до 42%.

Автоматизированная оценка — это набор тестов, которые оценивают код или системные изменения, внесенные агентом, до их выпуска. Если результаты соответствуют заданным порогам, конвейер может развернуть изменения. Отказ от проверки человеком позволяет быстрее выпускать изменения и освобождает инженеров от рутинных согласований. Но без проверяющего изменения, которые проходят тесты, однако что-то ломают, попадают в продуктивную среду, прежде чем кто-либо их заметит.

Мы спросили респондентов, разрешила бы их организация автономному ИИ-агенту в настоящее время развернуть в продуктивной среде изменение кода или системы исключительно на основании результатов автоматизированной оценки, без проверки с участием человека.

Вывод 1 — 56% крупных компаний с ИИ-агентами разрешают им вносить изменения в продуктивную среду только на основании автоматических проверок или работают над тем, чтобы это стало возможным; в июле таких было 75%

35%

Нет, и в обозримом будущем мы не планируем разрешать полностью автоматизированное развертывание

27%

Да, мы уже разрешаем это для отдельных агентов или изменений с низким уровнем риска

20%

Нет, но мы активно проектируем конвейер, чтобы разрешить это в течение 12 месяцев

16%

Не применимо, мы не развертываем автономных агентов

2%

Не знаю или не уверен(а)

Выборка: 140 респондентов. Можно было выбрать один ответ. Формулировки ответов соответствуют анкете; под «полностью автоматизированным развертыванием» подразумевается внесение ИИ-агентом изменений в код или систему в продуктивной среде без проверки человеком. В приведенных в тексте цифрах не учитываются респонденты, ответившие «не применимо» (выборка: 118).

Вывод 1 — Ответы респондентов из организаций, развертывающих автономных агентов, июль → август

20% → 42%

Ожидают, что человек и впредь будет проверять изменения агентов в продуктивной среде

75% → 56%

Уже разрешают это для агентов или изменений с низким уровнем риска либо работают над тем, чтобы это стало возможным

5% → 3%

Не знаю или не уверен(а)

Выборки: 96 респондентов в июле и 118 в августе, чьи организации развертывают автономных агентов. Можно было выбрать один ответ.

Среди августовских респондентов из организаций, развертывающих автономных агентов, 42% заявили, что их организация ожидает, что человек и впредь будет проверять изменения агентов в продуктивной среде. Среди июльских респондентов из той же группы так ответили 20%. Разница между этими месяцами считается значимой.

Еще 56% августовских респондентов из этой группы уже разрешают вносить изменения без проверки или работают над тем, чтобы это стало возможным. Некоторые уже позволяют агенту вносить изменения без проверки человеком, если речь идет об отдельных агентах или изменениях с низким уровнем риска. Другие активно проектируют конвейеры, чтобы разрешить внесение изменений без проверки в течение 12 месяцев. Оставшиеся 3% не знали ответа.

В июле 75% респондентов из организаций, развертывающих автономных агентов, уже разрешали вносить изменения без проверки или работали над тем, чтобы это стало возможным. Разница между этими месяцами также считается значимой.

Снижение наблюдается и среди лиц, принимающих окончательные решения о закупках в организациях, развертывающих автономных агентов: в июле 88% из них уже разрешали вносить изменения без проверки или работали над этим, против 61% в августе. Среди остальных респондентов этой группы доля изменилась с 63% до 48%; эту разницу нельзя считать значимой. Мы не проверяли, отличается ли изменение среди лиц, принимающих окончательные решения о закупках, от изменения среди остальных респондентов.

Вывод 1 — Уже разрешают это или работают над тем, чтобы это стало возможным, среди респондентов из организаций, развертывающих автономных агентов, июль → август

88% → 61%

Лица, принимающие окончательные решения о закупках

63% → 48%

Все остальные респонденты

В каждой ячейке указаны доля и число респондентов в соответствующей группе за данный месяц. Выборки: лица, принимающие окончательные решения о закупках, — 48 респондентов в июле и 70 в августе; все остальные респонденты — 48 в июле и 48 в августе.

Вывод 2. 61% крупных компаний, проводящих оценку, выпустили агента или функцию на основе LLM, которые прошли проверку, но затем вызвали сбой, затронувший клиентов

Большинство организаций, проводящих оценку перед развертыванием, выпустили агента или функцию на основе LLM, которые прошли проверку, но затем вызвали сбой, затронувший клиентов; у 22% произошло более одного такого сбоя.

Оценка перед развертыванием проверяет агента или функцию на основе LLM по фиксированному набору сценариев до выпуска. Набор тестов охватывает только те случаи, которые кто-то предусмотрел, поэтому функция может пройти все тесты и все же давать сбои при реальных запросах клиентов. Сбой в продуктивной среде приводит к неправильным ответам, на основании которых действуют клиенты, нарушению рабочих процессов, а также затратам времени инженеров на поиск и устранение проблемы.

Мы спросили респондентов, развертывала ли их организация за последние 12 месяцев ИИ-агента или функцию на основе LLM в продуктивной среде, если те прошли внутреннюю оценку, но затем вызвали сбой, затронувший клиентов. В качестве примеров приводились неправильный результат, нарушенный рабочий процесс или инцидент, связанный с качеством.

Вывод 2 — 61% крупных компаний, проводящих оценку, выпустили агента или функцию на основе LLM, которые прошли проверку, но затем вызвали сбой, затронувший клиентов

37%

Да, один раз

21%

Да, более одного раза

5%

Мы не проводим оценку перед развертыванием

1%

Мы не отслеживаем это или не можем сказать

Выборка: 140 респондентов. Можно было выбрать один ответ. В приведенных в тексте цифрах не учитываются респонденты, чьи организации не проводят оценку перед развертыванием (выборка: 133 в августе и 101 в июле).

5% респондентов, ответивших, что их организация не проводит оценку перед развертыванием, не учитываются в приведенных ниже цифрах. Среди остальных респондентов 61% заявили, что их организация выпустила ИИ-агента или функцию на основе LLM, которые прошли оценку, но затем вызвали сбой, затронувший клиентов. Среди тех же респондентов 22% сообщили, что такой сбой происходил более одного раза.

Среди июльских респондентов из той же выборки о как минимум одном таком сбое сообщили 52%. Разница между этими месяцами слишком мала, чтобы делать выводы. Доля сообщивших ровно об одном таком сбое выросла с 27% в июле до 39% в августе; это реальное изменение.

Вопрос касается того, произошел ли в организации хотя бы один такой сбой за год и случился ли он один или несколько раз. У компании, выпустившей 50 агентов, больше возможностей сообщить о сбое, чем у компании, выпустившей два. Поэтому в ответах учитываются организации, столкнувшиеся со сбоем, а не частота сбоев на одного агента.

Вывод 3. Только 29% крупных компаний с ИИ-агентами строят мониторинг в продуктивной среде вокруг проверок в реальном времени, которые оповещают о неправильных ответах агентов

Для 53% респондентов из организаций, развертывающих автономных агентов, основным подходом к мониторингу является регистрация трассировок или отслеживание через шлюз; ни один из этих вариантов не подразумевает проверки правильности ответов.

Мониторинг ИИ-агентов в продуктивной среде может отслеживать два разных аспекта. Мониторинг работоспособности системы, например журналы трассировки и метрики шлюза, показывает, запускался ли агент, насколько быстро он работал и во сколько обошелся. Мониторинг качества проверяет правильность ответов агента и может оповестить команду о снижении качества. По всем системным показателям агент может выглядеть исправным, при этом выдавая клиентам неправильные ответы, а мониторинг работоспособности системы не выявит проблему.

Мы спросили респондентов, как организован текущий мониторинг ИИ-агентов в продуктивной среде: ориентирован ли он на оценку работоспособности системы или качества результатов работы агента. Здесь приводятся ответы респондентов из организаций, развертывающих автономных агентов.

Вывод 3 — Только 29% крупных компаний с ИИ-агентами строят мониторинг в продуктивной среде вокруг проверок в реальном времени, которые оповещают о неправильных ответах агентов

36%

Регистрация трассировок транзакций: инфраструктурные интервалы, число токенов, а также исходные входные и выходные данные для последующей отладки

29%

Проверки качества в реальном времени: автоматизированная оценка или защитные механизмы для текущего трафика, оповещающие о снижении качества

16%

Мониторинг инфраструктуры шлюза: задержки, частота ошибок и затраты на уровне API-шлюза, без проверки правильности результатов

11%

Не знаю или это не моя область

8%

Проверка по мере необходимости: время безотказной работы системы отслеживается, а качество результатов проверяется отдельно в каждом случае

Выборка: 118 респондентов из организаций, развертывающих автономных агентов. Можно было выбрать один ответ. В приведенных в тексте 32% не учитываются респонденты, не знавшие о подходе своей организации (выборка: 105). Данные по всем респондентам приведены в разделе «Методология».

Только 29% респондентов из организаций, развертывающих автономных агентов, назвали основой мониторинга в продуктивной среде автоматизированные проверки качества результатов работы агента в реальном времени. Среди тех, кто знал о подходе своей организации, эта доля составляет 32%.

Вариант с регистрацией трассировок описывался как сбор сведений об инфраструктурной активности, числе токенов, а также исходных входных и выходных данных для последующей отладки. Вариант с отслеживанием через шлюз описывался как мониторинг задержек, частоты ошибок и затрат. Ни в одном из этих вариантов не упоминалась оценка правильности ответов в реальном времени.

Для 53% респондентов из организаций, развертывающих автономных агентов, основным подходом является регистрация трассировок или отслеживание через шлюз. Респонденты могли назвать только один подход, поэтому некоторые из них могут также проводить проверки качества.

Вывод 4. Встроенные инструменты оценки OpenAI используют 59% августовских респондентов против 31% июльских

Встроенные средства оценки и трассировки OpenAI — одновременно самые распространенные и наиболее часто называемые основной платформой.

Платформа оценки запускает агента на тестовых сценариях, оценивает результаты и сохраняет трассировки каждого шага, выполненного агентом. OpenAI встроила оценку и трассировку в свою платформу для разработчиков, а Anthropic предлагает инструменты оценки в своей консоли. Независимые инструменты, такие как Braintrust и Confident AI, работают наряду с ними. Без платформы команды хранят тестовые сценарии и оценки в скриптах, из-за чего результаты сложнее повторять и сравнивать от одного выпуска к другому.

Мы спросили респондентов, какие платформы для обеспечения надежности или оценки агентов использует их организация, а затем — какая из них является основной.

Вывод 4 — Встроенные инструменты оценки OpenAI используют 59% августовских респондентов против 31% июльских

59%

OpenAI Developer Platform (встроенные средства оценки и трассировки)

36%

Confident AI (DeepEval)

23%

Braintrust

16%

Anthropic Claude Console / Workbench (встроенные средства оценки)

13%

LangSmith (LangChain)

12%

Weights & Biases Weave

8%

Promptfoo

8%

Langfuse (с открытым исходным кодом)

7%

Собственные внутренние инструменты

15%

Нет специализированных инструментов для обеспечения надежности или оценки агентов

Выборка: 136 респондентов, ответивших на вопрос. Можно было выбрать несколько ответов, поэтому сумма долей превышает 100%. Платформы, названные менее чем 10 респондентами, не показаны. Выборка для июльских данных в тексте: 106.

Доля респондентов, чьи организации используют встроенные инструменты оценки OpenAI, составила в августе 59% против 31% в июле; это считается реальным изменением. Доля пользователей DeepEval от Confident AI выросла с 27% в июле до 36% в августе; эту разницу нельзя считать значимой.

Вывод 4 — Основная платформа

40%

OpenAI Developer Platform (встроенные средства оценки и трассировки)

15%

Нет специализированных инструментов для обеспечения надежности или оценки агентов

12%

Braintrust

10%

Confident AI (DeepEval)

10%

Anthropic Claude Console / Workbench (встроенные средства оценки)

13%

Другие платформы или собственные внутренние инструменты

Выборка: 136 респондентов, ответивших на вопрос. Можно было выбрать один ответ. Другие платформы: Weights & Biases Weave — 3%, собственные внутренние инструменты — 2%, LangSmith — 2%, Arize / Phoenix — 1%, Langfuse — 1%, Promptfoo — 1%, Datadog — 1%. Выборки пользователей, назвавших основную платформу, для приведенных в тексте долей: 80 — для инструментов OpenAI и 49 — для Confident AI.

Чаще всего в качестве основной платформы респонденты называли встроенные инструменты оценки OpenAI: их выбрали 40% опрошенных, против 12% у Braintrust и 10% у Confident AI и Anthropic Claude Console / Workbench. Среди респондентов, чьи организации используют инструменты OpenAI, 69% назвали их основной платформой. Среди пользователей Confident AI основным решением эту платформу назвали 29%.

Вывод 5. Ни одна инвестиция в надежность не была названа более чем 30% компаний как направление наибольшего роста в следующем году; разница между двумя лидерами слишком мала, чтобы делать выводы

Рабочие процессы с проверкой человеком назвали 30% респондентов, инструменты наблюдаемости в продуктивной среде — 26%, конвейеры автоматизированной оценки — 21%, а 11% сообщили, что бюджет на надежность не увеличивается.

Бюджеты на надежность можно направить на персонал или инструменты. Рабочие процессы с проверкой человеком предполагают оплату труда людей, проверяющих результаты работы агента. Такая проверка выявляет проблемы, которые упускают автоматизированные тесты, но затраты растут с каждым новым агентом и изменением. Инструменты наблюдаемости записывают действия агентов, помогая командам находить проблемы постфактум. Конвейеры автоматизированной оценки проверяют результаты в больших масштабах, но их эффективность зависит от того, насколько тесты соответствуют реальному использованию.

Мы спросили респондентов, какие инвестиции в надежность или оценку будут расти в их организации быстрее всего в следующем году.

Вывод 5 — Ни одна инвестиция в надежность не была названа более чем 30% компаний как направление наибольшего роста в следующем году; разница между двумя лидерами слишком мала, чтобы делать выводы

30%

Рабочие процессы с проверкой человеком

26%

Инструменты наблюдаемости в продуктивной среде

21%

Конвейеры автоматизированной оценки

11%

Оценка безопасности и соответствия политикам

11%

Наш бюджет не увеличивается

Выборка: 140 респондентов. Можно было выбрать один ответ.

На вопрос о том, какие инвестиции в надежность вырастут больше всего в следующем году, 30% респондентов назвали рабочие процессы с проверкой человеком, 26% — инструменты наблюдаемости в продуктивной среде, а 21% — конвейеры автоматизированной оценки. Разница между рабочими процессами с проверкой человеком и инструментами наблюдаемости в продуктивной среде слишком мала, чтобы делать выводы.

В отдельном вопросе 62% респондентов заявили, что их организация планирует в течение 12 месяцев внедрить новую или дополнительную платформу для обеспечения надежности или оценки агентов либо заменить текущую. 35% ожидают сделать это в течение трех месяцев.

Вывод 5 — Планы по внедрению новой или дополнительной платформы либо замене текущей

35%

Да, в течение 3 месяцев

17%

Да, в течение 3–6 месяцев

10%

Да, в течение 6–12 месяцев

38%

Не планируем изменений

Выборка: 140 респондентов. Можно было выбрать один ответ. В вопросе о рассматриваемых платформах, данные по которому приводятся в тексте, можно было выбрать несколько ответов (выборка: 140).

Отвечая на вопрос о платформах, которые они рассматривают, 24% респондентов назвали Confident AI, а 16% — Braintrust.

Вывод 6. Только 9% респондентов выбрали вариант «мы доверяем автоматизированной оценке уже сегодня», а 91% назвали ограничение, снижающее их доверие к автоматизированной оценке агентов

На вопрос о том, какое ограничение сильнее всего снижает доверие к автоматизированной оценке агентов, 9% респондентов выбрали вариант «мы доверяем автоматизированной оценке уже сегодня», а 27% назвали слабое соответствие реальным результатам.

При автоматизированной оценке для проверки результатов работы агента используются скрипты или другая модель ИИ, поэтому команда может проверить гораздо больше случаев, чем люди смогли бы вручную. Оценки полезны только в том случае, если они соответствуют тому, что происходит при взаимодействии с реальными пользователями. Если команда не доверяет автоматизированным оценкам, людям приходится и дальше проверять результаты, что замедляет выпуск и отнимает время проверяющих.

Мы спросили респондентов, какое ограничение сегодня сильнее всего снижает их доверие к автоматизированной оценке агентов. Среди вариантов был ответ «мы доверяем автоматизированной оценке уже сегодня».

Вывод 6 — Только 9% респондентов выбрали вариант «мы доверяем автоматизированной оценке уже сегодня», а 91% назвали ограничение, снижающее их доверие к автоматизированной оценке агентов

27%

Слабое соответствие реальным результатам

24%

Недостаточная объяснимость

16%

Предвзятость или непоследовательность оценки

13%

Утечка данных или проблемы с конфиденциальностью

12%

Недостаточная зрелость инструментов

9%

Мы доверяем автоматизированной оценке уже сегодня

Выборка: 140 респондентов. Можно было выбрать один ответ.

Только 9% респондентов выбрали вариант «мы доверяем автоматизированной оценке уже сегодня». Все остальные назвали одно ограничение, которое сильнее всего снижает их доверие, поэтому их ответы не показывают, насколько они в целом доверяют автоматизированной оценке. Слабое соответствие реальным результатам выбрали 27%, а недостаточную объяснимость — 24%.

Среди всех респондентов вариант «мы доверяем автоматизированной оценке уже сегодня» выбрали 2% тех, кто сообщил о сбое, прошедшем оценку, против 18% не сообщивших о таком сбое. В июле его выбрали 4% сообщивших о сбое и 24% не сообщивших о нем.

Эти группы различаются не только наличием сбоев. Почти все респонденты, сообщившие о сбое, работают в организациях, развертывающих автономных агентов, тогда как 42% группы, не сообщившей о сбоях, работают в организациях, которые таких агентов не развертывают.

Среди респондентов из организаций, развертывающих автономных агентов, этот ответ выбрали 3% сообщивших о сбое и 10% не сообщивших о нем; разница слишком мала, чтобы делать выводы. Среди респондентов, не сообщивших о сбое, этот ответ выбрали 29% работающих в организациях, которые не развертывают агентов, и 10% работающих в тех, которые их развертывают; эта разница также слишком мала, чтобы делать выводы. Поэтому по этим ответам нельзя определить, влияет ли наличие сбоя на выбор респондентами ответа.

Вывод 6 — Выбрали вариант «мы доверяем автоматизированной оценке уже сегодня», по группам, август

2%

Все респонденты, сообщившие о сбое, прошедшем оценку

18%

Все респонденты, не сообщившие о таком сбое

3%

Респонденты из организаций, развертывающих агентов и сообщившие о сбое

10%

Респонденты из организаций, развертывающих агентов и не сообщившие о сбое

29%

Респонденты из организаций, не развертывающих агентов и не сообщившие о сбое

Выборки в порядке следования данных в таблице: 81, 50, 80, 29 и 21 респондент. К организациям, развертывающим агентов, относятся организации респондентов, внедряющие автономных агентов. Выборки за июль: 53 респондента, сообщивших о сбое, и 41 не сообщивший о нем.

Что изменилось со времени июльского опроса Pulse

Вопросы, сравниваемые ниже, были заданы в июле и августе в одинаковой формулировке. Как поясняется в разделе «Методология», для некоторых строк объем выборки меньше.

Что изменилось достаточно существенно, чтобы это отметить

Со времени июльского опроса Pulse — что изменилось достаточно существенно, чтобы это отметить, июль → август

75% → 56%

Среди респондентов из организаций, развертывающих автономных агентов: уже позволяют агенту вносить изменения в продуктивную среду без проверки человеком для отдельных агентов или изменений с низким уровнем риска либо работают над тем, чтобы это стало возможным

Выборки, июль и август: 96 и 118

20% → 42%

Среди респондентов из организаций, развертывающих автономных агентов: ожидают, что человек и впредь будет проверять изменения агентов в продуктивной среде

Выборки, июль и август: 96 и 118

31% → 59%

Используют встроенные инструменты оценки OpenAI Developer Platform

Выборки, июль и август: 106 и 136

27% → 39%

Сообщили ровно об одном сбое, прошедшем оценку; организации, не проводящие оценку перед развертыванием, не учитываются

Выборки, июль и август: 101 и 133

6% → 1%

Ответили «мы не отслеживаем это или не можем сказать» на вопрос о сбоях

Выборки, июль и август: 108 и 140

8% → 1%

Используют Opik (Comet)

Выборки, июль и август: 106 и 136

«Изменилось достаточно существенно, чтобы это отметить» означает, что статистический тест, описанный в разделе «Методология», подтверждает наличие разницы.

Что не изменилось достаточно существенно, чтобы это отметить

Со времени июльского опроса Pulse — что не изменилось достаточно существенно, чтобы это отметить, июль → август

52% → 61%

Хотя бы раз выпустили ИИ-агента или функцию на основе LLM, которые прошли оценку, но затем вызвали сбой, затронувший клиентов; организации, не проводящие оценку перед развертыванием, не учитываются

Выборки, июль и август: 101 и 133

26% → 22%

Столкнулись с таким сбоем более одного раза

Выборки, июль и август: 101 и 133

13% → 9%

Выбрали вариант «мы доверяем автоматизированной оценке уже сегодня»

Выборки, июль и август: 108 и 140

26% → 25%

Назвали проверки качества результатов работы агента в реальном времени своим подходом к мониторингу

Выборки, июль и август: 106 и 140

31% → 30%

Назвали рабочие процессы с проверкой человеком направлением наибольшего роста инвестиций

Выборки, июль и август: 108 и 140

56% → 62%

Планируют в течение 12 месяцев внедрить новую или дополнительную платформу либо заменить текущую

Выборки, июль и август: 108 и 140

27% → 36%

Используют Confident AI (DeepEval)

Выборки, июль и август: 106 и 136

19% → 15%

Не используют специализированные инструменты оценки

Выборки, июль и август: 106 и 136

«Слишком малая разница, чтобы делать выводы» означает, что статистический тест, описанный в разделе «Методология», не подтверждает наличие разницы, поэтому нельзя определить, изменилась ли доля.

Что мы не сравнивали

Мы не сравнивали основные платформы оценки за два месяца. В июле респонденты могли назвать основной платформой вариант, который не указывали среди используемых ими платформ. Среди июльских респондентов, назвавших конкретную платформу основной, 34% не указали ее в списке используемых.

Мы не сравнивали платформы, которые рассматривают респонденты. В июле на этот вопрос можно было дать только один ответ, а в августе — несколько.

Мы не сравнивали факторы выбора поставщика и показатели успеха. В августе мы задавали эти вопросы только респондентам, назвавшим конкретную платформу основной. В июле мы спрашивали об этом всех респондентов.

Итог: 56% крупных компаний с ИИ-агентами разрешают им выпускать изменения в продуктивную среду только на основании автоматических проверок или планируют это; в июле таких было 75%

Среди августовских респондентов из организаций, развертывающих автономных агентов, 42% ожидают, что человек и впредь будет проверять изменения агентов в продуктивной среде. В июле так ответили 20% респондентов из той же группы.

Среди респондентов из организаций, развертывающих автономных агентов, 56% уже разрешают вносить изменения в продуктивную среду без проверки для отдельных агентов или изменений с низким уровнем риска либо работают над тем, чтобы это стало возможным; в июле таких было 75%.

Если исключить 5% августовских респондентов, чьи организации не проводят оценку перед развертыванием, 61% сообщили, что их организация выпустила ИИ-агента или функцию на основе LLM, которые прошли оценку, но затем вызвали сбой, затронувший клиентов.

В следующем выпуске Pulse VentureBeat Intelligence измерит три показателя. Первый — как доля компаний, ожидающих, что человек и впредь будет проверять изменения агентов в продуктивной среде, соотносится с августовскими 42%. Второй — какая доля респондентов из организаций, развертывающих автономных агентов, называет проверки качества результатов в реальном времени своим подходом к мониторингу, против августовских 29%. Третий — как доля пользователей встроенных инструментов оценки OpenAI соотносится с августовскими 59%.

Профиль респондентов

Размер компании

Респонденты

От 100 до 499 сотрудников

37% (52)

От 500 до 2 499 сотрудников

33% (46)

От 2 500 до 9 999 сотрудников

15% (21)

От 10 000 до 49 999 сотрудников

9% (12)

50 000 сотрудников и более

6% (9)

Выборка: 140 респондентов. Можно было выбрать один ответ.

Роль в закупках

Респонденты

Лицо, принимающее окончательные решения о закупках ИИ

53% (74)

Рекомендатель или влиятельное лицо в сфере технологий

26% (36)

Конечный пользователь в бизнес-подразделении

6% (8)

Не участвует в закупках ИИ

16% (22)

Выборка: 140 респондентов. Можно было выбрать один ответ.

Должность

Респонденты

Менеджер по продукту или программе

20% (28)

Директор по данным, ИИ или аналитике

11% (16)

Директор по инженерным вопросам или ИТ

11% (16)

ИТ-директор, технический директор или директор по информационной безопасности

10% (14)

Консультант или советник

8% (11)

Вице-президент по инженерным вопросам, ИТ, данным, ИИ или аналитике

8% (11)

Инвестор или представитель венчурного фонда

3% (4)

Другие должности

29% (40)

Выборка: 140 респондентов. Можно было выбрать один ответ.

Отрасль

Респонденты

Здравоохранение или медико-биологические науки

19% (27)

Технологии или программное обеспечение

19% (26)

Производство или промышленность

15% (21)

Розничная торговля или потребительский сектор

13% (18)

Финансовые услуги

8% (11)

Образование

7% (10)

Другие отрасли

19% (27)

Выборка: 140 респондентов. Можно было выбрать один ответ.

Методология

VentureBeat Intelligence провела этот опрос VB Pulse в августе и получила 199 ответов. Из них критериям для включения в этот отчет соответствовали 140. Все цифры основаны на ответах этих 140 респондентов, если рядом с ними не указано меньшее число. Объем некоторых выборок меньше, поскольку вопрос относился к меньшему числу респондентов или некоторые ответы были исключены; объем выборки указан в каждой таблице или примечании под ней.

Респонденты — самостоятельно отобравшаяся группа читателей VentureBeat и участников панели. Приведенные цифры характеризуют этих респондентов и могут служить приблизительным ориентиром для более широкого рынка крупных компаний. Каждый месяц VentureBeat опрашивала отдельную выборку, поэтому сравнения между месяцами показывают различия между двумя группами респондентов.

Среди всех респондентов, включая тех, в чьих организациях не внедряют автономных агентов, 25% назвали своим подходом к мониторингу проверки качества непосредственно в процессе, а среди тех, кто знал о таком подходе, — 31%; 48% назвали журналирование трассировок или отслеживание через шлюз. При сравнении долей респондентов, назвавших проверки качества непосредственно в процессе, в июле и августе, которое приводится в разделе «Что не изменилось настолько, чтобы считать это значимым», учитывались все респонденты за оба месяца.

Разница между двумя долями — будь то доли двух групп за один месяц или доли за июль и август — считается реальной, то есть достаточно значимой, только если статистический тест дает p-значение ниже 0,05; в противном случае разница слишком мала, чтобы делать вывод. Мы используем z-тест для двух пропорций или точный тест Фишера, если в одной из групп меньше 40 респондентов. Чтобы сравнить два ответа на один вопрос, мы используем точный биномиальный тест для вопросов с одним вариантом ответа и точный тест Мак-Немара для вопросов, допускавших несколько вариантов. Другие рейтинги ответов на один вопрос описывают этих респондентов и не подвергаются статистической проверке.

В некоторые группы, рассматриваемые в этом отчете, входят менее 40 респондентов: 29 внедривших агентов в августе и сообщивших об отсутствии сбоев после успешного прохождения оценки; 21 респондент из организаций, не внедряющих агентов и сообщивших об отсутствии сбоев; 37 внедривших агентов в июле и сообщивших об отсутствии сбоев. Проценты для таких небольших групп менее точны; для группы из 21 человека результат может отличаться от истинного значения примерно на 21 процентный пункт в любую сторону.

Мы сравнили множество ответов за два месяца, поэтому некоторые результаты могли пройти тест случайно. Три изменения, на которых основаны заголовок и вывод 4, имеют p-значения около 0,004 или ниже.

В июльском отчете сравнивались респонденты, сообщившие о сбое после успешного прохождения оценки, и респонденты, не сообщившие о таком сбое, — по тому, разрешает ли их организация уже выпускать изменения агентов в производственную среду без проверки или движется к этому. При повторном анализе ответов только тех, кто внедряет агентов, выяснилось, что в июле 87% сообщивших о сбое выбрали один из этих вариантов, тогда как среди не сообщивших о сбое таких было 68%; это реальная разница. В августе эти доли составили 59% и 55% — разница слишком мала, чтобы делать вывод.

В июльском отчете были опубликованы данные по вопросу о выпуске изменений в производственную среду среди всех 108 респондентов: 67% уже разрешали выпускать изменения без проверки или двигались к этому, а 18% ожидали, что человек и дальше будет проверять изменения агентов перед выпуском. Мы учитываем респондентов из организаций, внедряющих автономных агентов, за оба месяца. В июльском отчете также приводилась доля сообщивших о сбое после успешного прохождения оценки среди всех 108 респондентов за июль — 49%. Мы исключаем респондентов из организаций, где не проводят оценку до развертывания.

Среди респондентов за июль 5% назвали инструменты OpenAI своей основной платформой, хотя и не указали, что пользуются ими. Если считать их пользователями, доля за июль составит 36%, и разница с августом по-прежнему считается реальным изменением.

В июле 44% респондентов принимали окончательные решения о закупках, 14% работали в технологических и софтверных компаниях, а 24% не участвовали в закупках ИИ. Данные о составе респондентов содержат показатели за август. Ни одна из разниц между двумя месяцами по этим трем показателям не была достаточно большой, чтобы считать ее значимой.

Resources

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.