Автономия ИИ опережает доверие к оценке
Источник: VentureBeat · VB Staff
В 157 компаниях организации предоставляют ИИ-агентам все большую автономность, при этом все меньше доверяя оценкам, призванным эту автономность сдерживать. Половина компаний уже выпустила агента, который прошел внутреннее тестирование, но затем подвел клиента в продакшене; сегодня лишь один из двадцати полностью доверяет автоматизированной оценке; а в качестве главного недостатка чаще всего называют то, что результаты тестов не соответствуют реальным условиям. Тем не менее две трети компаний уже разрешают развертывание изменений агента в продакшене исключительно на основе автоматизированной оценки (без участия человека в контуре управления) или активно настраивают для этого свои процессы. Результатом становится разрыв в оценке — дистанция между тем, какую степень автономности предприятия предоставляют своим агентам, и тем, насколько они доверяют тестам, которые должны предотвращать сбои.
Эта волна исследований VentureBeat Pulse изучает, как технические лидеры измеряют производительность агентов: какие платформы надежности и оценки они используют, как выбирают их и доверяют им, что ломается в продакшене и как далеко они готовы отпустить агентов в свободное плавание без участия человека.
Главный вывод исследования — разрыв в оценке: дистанция между автономностью, которую предприятия предоставляют своим агентам, и доверием к оценкам, призванным ее контролировать. Половина организаций (50%) за последний год развернули агента или функцию на базе LLM, которые прошли внутреннее тестирование, а затем привели к сбою у клиентов, а четверть сталкивалась с этим более одного раза. Доверие к самим тестам невелико: лишь 5% заявляют, что сегодня полностью доверяют автоматизированной оценке, а самым частым ограничением называют слабое соответствие оценок реальным результатам (29%). Предприятия обнаруживают, что успешное прохождение тестов не означает полноценную работу агента.
Этот разрыв имеет принципиальное значение из-за вектора движения. Две трети организаций (66%) уже разрешают полностью автоматизированное развертывание без участия человека для агентов с низким уровнем риска (34%) или активно перестраивают свои конвейеры (пайплайны), чтобы внедрить это в течение двенадцати месяцев (33%). При этом стек оценки, который должен заслужить это доверие, фрагментирован и незрел: самыми популярными основными инструментами являются встроенные средства оценки от провайдеров моделей наряду с полным отсутствием специализированного ПО (по 17% каждое); и лишь около четверти предприятий проводят проверку качества живого продакшен-трафика в режиме реального времени. Автономность опережает средства обеспечения надежности.
Этот отчет — один из пяти в рамках исследования агентного стека от VentureBeat Research за второй квартал. Оценка — это рычаг контроля, определяющий, насколько быстро заработают остальные элементы: две трети предприятий движутся к переходу в продакшене, управляемому исключительно автоматизированными оценками. Краткая выжимка для руководителей в материале «VentureBeat Research: Where enterprise AI agent governance hasn’t caught up» помещает этот вывод в общий контекст.
Методология
VentureBeat провела этот опрос в рамках своей продолжающейся серии исследований Pulse. Данный выпуск — трекер надежности и оценки агентов (Agentic Reliability & Evals tracker) — сфокусирован на том, как технические лидеры оценивают производительность и надежность агентов. Ответы отфильтрованы по организациям со штатом от 100 сотрудников (n=157), полученным в ходе единичного опроса в июне 2026 года; поскольку это срез, а не агрегированная многомесячная выборка, отчет носит поперечный (кросс-секционный) характер и не предполагает анализа динамики месяц к месяцу. Если вопросы предполагали множественный выбор, суммы долей могут превышать 100%.
С точки зрения ролей выборка состоит из руководящих специалистов и лиц, влияющих на закупки: 38% являются ключевыми лицами, принимающими решения о закупках ИИ, еще 34% дают рекомендации или оказывают влияние. По должностям лидируют менеджеры по продуктам и программам (15%), консультанты и советники (10%), директора по инжинирингу / ИТ (8%), а также ИТ-директора, технические директора и директора по информационной безопасности (CIO/CTO/CISO — 8%), наряду с крупной категорией «Другое» (37%). По размеру организаций выборка смещена в сторону среднего бизнеса: преобладают компании с численностью 100–499 (37%) и 500–2499 (27%) сотрудников, за ними следуют компании с 2500–9999 (20%), 10 000–49 999 (10%) и 50 000+ (6%) сотрудниками. Технологический сектор / ПО является крупнейшей отраслью (23%), за ней следуют розничная торговля / товары широкого потребления (15%), здравоохранение / науки о жизни (12%) и производство (10%).
При 157 респондентах выборка достаточно велика для качественного анализа тенденций, но ее следует воспринимать скорее как ориентир, а не как точное измерение; это самовыбранная (невероятностная) выборка. Она смещена в сторону среднего бизнеса, поэтому ее лучше рассматривать как точку зрения организаций, которые активно внедряют практики оценки агентов, а не крупнейших игроков рынка.
Примечание: Этот опрос был переработан для июньской волны на основе более раннего исследования «Наблюдаемость и оценка LLM»; поскольку вопросы и выборка отличаются, сравнение с данными за апрель–май не проводится.
Половина компаний выпустили агента, который прошел тесты, но подвел клиента
Мы спросили, развертывали ли организации за последние 12 месяцев агента или функцию LLM, которые успешно прошли внутренние тесты, но затем привели к сбою, с которым столкнулся клиент. Половина тех, кто проводит оценку, ответили утвердительно.
Вывод 1 — Успешное прохождение тестов не означает, что агент работает корректно
26%
да, один раз
24%
да, более одного раза — регулярный разрыв между оценкой и реальностью
36%
таких сбоев в продакшене не зафиксировано
8%
не проводят оценку перед развертыванием; еще 6% не отслеживают это или затрудняются ответить
Это ключевой показатель отчета. Половина организаций (50%) выпустили ИИ-функцию, которая прошла внутренние тесты, а затем дала сбой перед клиентом (некорректный вывод, нарушенный рабочий процесс или инцидент с качеством), а четверть сталкивалась с этим неоднократно. Лишь 36% сообщают об отсутствии таких сбоев, а остальные либо не проводят предварительную оценку (8%), либо не отслеживают первопричины достаточно тщательно, чтобы знать об этом (6%). Ошибка конкретна и обходится дорого: тестирование показало, что агент готов, но это было не так. Все, что следует далее — то, как предприятия доверяют своим оценкам, что они мониторят и какую автономность предоставляют — формируется под влиянием этого опыта.
Вывод 2: Практически никто полностью не доверяет автоматизированной оценке
Главная жалоба: Тесты не соответствуют реальным результатам
Мы спросили, какое ограничение сильнее всего подрывает доверие к автоматизированной оценке агентов на сегодняшний день. Лишь у незначительной доли предприятий не было никаких нареканий.
Вывод 2 — Почти никто полностью не доверяет автоматизированной оценке
29%
слабое соответствие реальным результатам — главное ограничение
21%
предвзятость или несогласованность оценок
18%
отсутствие прозрачности (объяснимости)
17%
угроза утечки данных или проблемы с конфиденциальностью
11%
незрелость инструментов; лишь 5% заявляют, что сегодня полностью доверяют автоматизированной оценке
Доверие к автоматизированной оценке скудно и носит конкретный характер. Лишь 5% организаций заявляют, что полностью доверяют автоматизированной оценке в ее нынешнем виде — то есть 95% указывают на ограничения, которые их сдерживают. Самым частым ответом (29%) является тот, который напрямую объясняет Вывод 1: оценки плохо соотносятся с реальными результатами, пропуская агентов, которые впоследствии дают сбой. За ними следуют предвзятость или непоследовательность (21%) и отсутствие прозрачности (18%) — предприятия не всегда могут понять, почему оценка вынесла именно такой вердикт, — а 17% ссылаются на утечку данных или проблемы с конфиденциальностью в самом процессе оценки. Тесты, призванные сертифицировать агентов, пока не заслужили доверия для этой роли, и именно поэтому траектория роста автономности в Выводе 3 выглядит столь поразительно.
Вывод 3: Потолок автономности все равно растет
Две трети компаний уже разрешают развертывание без участия человека или стремятся к нему
Мы спросили, позволят ли организации автономному агенту развернуть изменения кода или системы в продакшене исключительно на основе результатов автоматизированной оценки, без проверки человеком. Траектория пролегает прямо через пробел в доверии.
Вывод 3 — Потолок автономности все равно растет
34%
да — уже разрешено для определенных низкорисковых агентов или изменений
33%
нет — но пайплайны активно дорабатываются, чтобы разрешить это в течение 12 месяцев
22%
нет — и в обозримом будущем полностью автоматизированное развертывание не планируется
8%
неприменимо — они не развертывают автономных агентов; 3% не знают
В этом заключается парадокс, лежащий в основе отчета. Несмотря на то, что почти никто не доверяет автоматизированной оценке на 100% (Вывод 2), две трети организаций (66%) либо уже разрешают развертывание низкорисковых агентов без участия человека (34%), либо активно перестраивают свои рабочие процессы, чтобы разрешить его в течение года (33%). Лишь 22% исключают такую возможность в обозримом будущем. Направление движения однозначно: предприятия переходят к использованию оценок в качестве автономных шлюзов для продакшена (исключая проверку человеком) в тот самый момент, когда сами заявляют, что эти оценки ненадежно отражают реальность. Потолок автономности растет быстрее, чем подстилающие его гарантии надежности, что гарантирует не сокращение, а масштабирование ложных ожиданий и связанных с ними сбоев из Вывода 1.
Примечательно, что ставка на автономность характерна не только для небольших компаний. При разбивке выборки по размеру выяснилось, что более крупные предприятия продвинулись по пути к полному отказу от участия человека немного дальше небольших компаний (70% против 64%) и чуть чаще выпускали агентов, прошедших тестирование, но затем подводивших клиентов (54% против 48%). Распространенное мнение о том, что крупные регулируемые организации дольше всех сохраняют человека в контуре контроля, в данной выборке опровергается. Конечно, эти показатели носят ориентировочный характер, поскольку выборка опроса не была огромной — 57 респондентов из компаний с численностью от 2500+ сотрудников и 100 из компаний меньшего размера.
Вывод 4: Стек оценки фрагментирован и зависит от провайдеров
Лидируют встроенные оценки провайдеров наряду с полным отсутствием специализированных инструментов
Мы спросили, какие платформы надежности или оценки агентов предприятия используют в основном сегодня. На рынке нет явного лидера, при этом значительная доля респондентов вообще не имеет специализированных решений.
Вывод 4 — Стек оценки фрагментирован и зависит от провайдеров
17%
используют встроенные средства оценки/трассировки OpenAI Developer Platform — с минимальным отрывом самый популярный инструмент
17%
вообще не используют специализированные инструменты надежности или оценки агентов
13%
встроенные оценки Anthropic Claude Console
12%
Confident AI (DeepEval); 11% — собственные кастомные инструменты
8%
Braintrust; узкоспециализированные игроки (LangSmith, Weave, Promptfoo, Langfuse, Arize) набирают лишь низкие однозначные проценты
Слой оценки находится на ранней и консолидированной стадии. Инструменты от провайдеров моделей — встроенные оценки и трассировки OpenAI (17%) и оценки Anthropic Claude Console (13%) в совокупности превосходят любую независимую платформу, но первое место они делят с примечательным ответом: 17% предприятий вообще не используют никаких специализированных инструментов оценки агентов, что является серьезным упущением для организаций, выпускающих агентов для клиентов. Специализированные вендоры систем оценки — DeepEval (12%), Braintrust (8%), LangSmith, Weave, Promptfoo, Langfuse, Arize — распределились в диапазоне от однозначных до низких двузначных показателей, а 11% создали собственные решения. Ни одна независимая платформа еще не стала стандартом индустрии, из-за чего большинство предприятий оценивают агентов с помощью встроенных инструментов провайдеров, самописных скриптов или не оценивают вовсе.
Вывод 5: Мониторинг продакшена редко отслеживает качество вывода
Лишь четверть компаний проводят проверку качества живого трафика в реальном времени
Мониторинг продакшена для ИИ-агента может быть двух принципиально разных типов. Он может отслеживать, функционирует ли система (работает ли агент и отвечает ли он, завершился ли каждый запрос, с какой скоростью, по какой цене и без ошибок ли). Либо он может проверять, корректен ли результат работы агента — с помощью автоматизированных проверок контента каждого ответа по мере его отправки: дал ли агент правильный ответ, совершил ли нужное действие, не вышел ли за рамки политик. Это различие критически важно, поскольку уверенно сформулированный неправильный ответ невидим для первого типа мониторинга: запрос выполнен, ответ получен быстро, ошибок нет, и все инфраструктурные метрики в норме. Мы спросили организации, для какого типа задач в основном настроен их мониторинг продакшена сегодня.
Вывод 5 — Мониторинг продакшена редко отслеживает качество вывода
25%
логирование трассировки транзакций — инфраструктурные спаны, подсчет токенов, сырые входные/выходные данные для последующей отладки
25%
отслеживание инфраструктуры шлюза (gateway) — задержки (latency), показатели ошибок и затраты на уровне API, а не качество вывода
23%
встроенные проверки качества (inline assertions) — судьи/гвардрайлы в реальном времени на живом трафике, предупреждающие о падении качества
10%
специальный выборочный обзор качества живого вывода; еще 17% не знают или говорят, что это не их область
Если сгруппировать показатели по тому, что именно отслеживается, картина получается резкой: 51% организаций контролируют только работоспособность агента, в то время как 23% следят за правильностью его ответов. Если учесть специалистов по выборочной проверке и тех, кто затруднился с ответом, примерно три четверти организаций не проводят автоматизированную оценку правильности результатов в реальном времени в продакшене — они видят, что система работает и во сколько обходится, а корректность ее ответов принимают на веру. Это слепое пятно является зеркальным отражением предпродакшен-разрыва из Вывода 1: те же самые организации, которые исключают человека из процесса принятия решений о развертывании, в массе своей не могут в реальном времени заметить момент, когда развернутый агент начинает ошибаться.
Вывод 6: Покупают по цене, измеряют по стабильности
Цена и простота интеграции движут выбором; стабильность оценки — цель
Мы спросили, что больше всего повлияло на выбор поставщика средств оценки и что компании считают своим главным критерием успеха. Оба ответа носят прагматичный характер.
Вывод 6 — Покупают по цене, измеряют по стабильности
28%
выбрали вендора в первую очередь из-за стоимости оценки — главный фактор выбора
27%
из-за простоты интеграции; 24% — из-за точности оценки
36%
называют стабильность (консистентность) оценки своим главным метриком успеха — самый частый ответ
19%
измеряют успех скоростью экспериментов; 18% — снижением числа сбоев или регрессий
Предприятия покупают инструменты оценки, руководствуясь экономикой, а доверяют им на основе воспроизводимости результатов. Стоимость оценки (28%) с небольшим отрывом лидирует среди факторов выбора, опережая простоту интеграции (27%) и точность оценки (24%) — в то время как ширина охвата наблюдаемостью (13%) и дорожная карта вендора (4%) волнуют респондентов гораздо меньше. Что касается того, как выглядит успех, более трети (36%) называют стабильность оценки — получение одинакового вердикта для одного и того же поведения каждый раз — значительно опережая скорость экспериментов (19%), сокращение сбоев (18%), видимость в продакшене (13%) и соответствие требованиям комплаенса (11%). Акцент на стабильности весьма показателен: прежде чем предприятия смогут доверять вердикту оценки, он должен быть стабильным — именно то свойство, отсутствие которого (предвзятость и непоследовательность) вошло в число главных ограничений доверия в Выводе 2. Удовлетворенность текущими инструментами умеренная, в среднем составляя 3,8 балла по пятибалльной шкале (по общей удовлетворенности, простоте внедрения и соотношению цены и качества).
Вывод 7: Следующий доллар пойдет на людей и наблюдаемость
Инвестиции направляются в надзор, а не только в автоматизацию
Мы спросили, в какие инвестиции в области надежности и оценки средства будут вкладываться активнее всего в следующем году. Деньги идут на более пристальное наблюдение за агентами, в том числе с привлечением людей.
Вывод 7 — Следующий доллар пойдет на людей и наблюдаемость
30%
инструменты наблюдаемости в продакшене — главная зона роста
26%
рабочие процессы ручной проверки (человеком)
20%
оценка безопасности и соблюдения политик
16%
пайплайны автоматизированной оценки
8%
говорят, что их бюджет не увеличивается
Вторые по величине планируемые инвестиции — уступающие лишь наблюдаемости в продакшене — это рабочие процессы проверки человеком (26%). Сопоставляя это с Выводом 1, мы видим самое тихое противоречие отчета: в то время как две трети предприятий выводят человека из процесса принятия решений о развертывании, большее число респондентов планирует увеличить расходы на человеческий контроль (26%), чем на автоматизированные пайплайны оценки (16%), которые должны были бы его заменить. Траектория полного исключения человека и бюджет на его проверки растут в одних и тех же компаниях одновременно. При этом лишь 8% сообщают, что их бюджет не растет.
В сухом остатке предприятия страхуют риски: они движутся в сторону автономности и одновременно тратят средства на более пристальный контроль за агентами, оставляя людей на связи для решения тех задач, доверить которые автоматизированной оценке пока еще нельзя.
Вывод 8: Предстоит перезагрузка инструментов
Почти две трети планируют внедрить или сменить платформы в течение года
Мы спросили, планируют ли предприятия внедрить новую, дополнительную или заменяющую платформу оценки и какие варианты они рассматривают. Немногие намерены оставлять все как есть.
Вывод 8 — Предстоит перезагрузка инструментов
36%
не планируют ничего менять
31%
планируют внедрить или сменить инструмент в ближайшие 0–3 месяца
24%
в течение 3–6 месяцев
10%
в течение 6–12 месяцев
Рынок средств оценки открыт. Хотя 36% не планируют ничего менять, явное большинство (64%) намерены внедрить новую, дополнительную или заменяющую платформу в течение двенадцати месяцев, а 31% — в следующем квартале. Круг рассматриваемых решений указывает на те области, где текущее использование слабее всего: DeepEval от Confident AI лидирует среди того, что оценивают предприятия (20%), опережая собственные оценки OpenAI (13%) и Braintrust (9%). Это демонстрирует, что разработчики с открытым исходным кодом вызывают больший интерес, чем их текущая доля на рынке.
Учитывая, что сегодня так много предприятий полагаются на встроенные инструменты провайдеров или не используют ничего (Вывод 4), это не столько отток от текущих решений, сколько первая реальная волна массового внедрения инструментов — момент, когда слой оценки начинает консолидироваться. Какие платформы заслужат это доверие на рынке, где почти никто еще не доверяет автоматизированной оценке, — открытый вопрос, за которым эта серия исследований продолжит следить.
Итог: Разрыв в оценке, который автономность не сократит, а увеличит
Организации со штатом от 100 сотрудников предоставляют ИИ-агентам больше независимости, чем могут поддержать своими оценками, которым они не до конца доверяют. Половина компаний уже выпустила агента, который прошел тесты, но подвел клиента; практически никто полностью не доверяет автоматизированной оценке главным образом потому, что она не соответствует реальным результатам; и большинство мониторит продакшене время безотказной работы и затраты, а не правильность ответов агента. Тем не менее две трети уже разрешают или активно готовят развертывание в продакшене исключительно на основе автоматизированной оценки.
Рынок вендоров находится на ранней и нестабильной стадии: самые популярные основные инструменты оценки — это встроенные средства провайдеров наряду с полным отсутствием специализированного ПО, при этом явное большинство планирует внедрить или сменить платформы в течение года. Отрадно, что следующий доллар уходит на наблюдаемость и — что показательно — на проверки с участием людей, что говорит об осознании предприятиями этого разрыва даже тогда, когда они пытаются обойти его технически. При выборке в 157 респондентов в рамках одной волны это исследование дает лишь общее направление, смещенное в сторону среднего бизнеса — но направление очевидно: автономность предоставляется на основе надежности оценок, которым те, кто ее предоставляет, пока не доверяют. Разрыв в оценке — это не проблема покрытия, которую можно решить просто добавлением новых тестов; это проблема точности оценок, которые должны отражать реальность и которым можно доверять как фильтру. Открытый вопрос для будущих волн заключается в том, смогут ли средства гарантии надежности догнать автономность — или сбои из-за ложной уверенности перекочуют из клиентских инцидентов в автоматические развертывания.
Основано на ответах 157 квалифицированных респондентов от предприятий (100+ сотрудников), полученных в ходе единичной волны в июне 2026 года. Это ориентировочный срез, а не точное измерение — выборка является самовыбранной, а не вероятностной, и смещена в сторону среднего бизнеса. Среди респондентов — менеджеры по продуктам и программам, консультанты и советники, директора по инжинирингу / ИТ, а также CIO/CTO/CISO и представители других направлений из технологического сектора/ПО, ритейла/производства товаров массового спроса, здравоохранения/наук о жизни, производства и других отраслей.

