Доверие к оценке ИИ-агентов растет, а надежность — нет

Доверие к оценке ИИ-агентов растет, а надежность — нет

Источник: VentureBeat · VB Staff

В июле доверие к автоматизированной оценке агентов среди 108 предприятий резко возросло — в то время как уровень сбоев, который она призвана предсказывать, не изменился вовсе. Доля организаций, полностью доверяющих автоматизированной оценке, выросла почти в три раза — с 5% в июне до 13%, а жалобы на то, что оценки не соответствуют реальным результатам, снизились на 10 пунктов. Тем не менее, ровно та же доля, что и в прошлом месяце (чуть менее половины), выпустила в продакшен агента, который прошел внутреннее тестирование, но затем подвел клиента. Причина видна в перекрестных таблицах: новый уровень доверия принадлежит почти исключительно тем предприятиям, которые еще не обжигались. Среди тех, кто уже сталкивался со сбоями, автоматизированной оценке доверяют 4%; среди тех, кто не сталкивался — 24%. При этом горький опыт вовсе не замедляет движение к автономии — он его ускоряет.

Это вторая волна исследования надежности агентов от VentureBeat Pulse Research и первая волна, проведенная с использованием инструментария, идентичного прошлому месяцу. Это делает июль первым срезом, позволяющим оценить динамику, а не статичное положение: что изменилось, что осталось неизменным и что означает это движение.

Изменилась уверенность. В июне лишь 5% предприятий заявляли, что полностью доверяют автоматизированной оценке, а наиболее частым ограничением называлось слабое соответствие оценок реальным результатам (29%). В июле полностью доверяют автоматизированной оценке уже 13%, а доля жалоб на соответствие снизилась до 19%, перестав быть главной претензией. Оба сдвига достаточно велики, чтобы восприниматься как реальные изменения, а не как статистический шум.

Не изменился уровень сбоев. Чуть менее половины организаций (49%) за последний год развернули функцию агента или LLM, которая прошла внутреннее тестирование, а затем привела к сбою на стороне клиента — это статистически неотличимо от июньских 50%, при этом четверть респондентов (24%) сталкивались с этим более одного раза. Уверенность выросла; корректность — нет. В этом и заключается июльский разрыв: не между автономией и доверием, как в июне, а между доверием и реальными основаниями для него.

Перекрестные таблицы объясняют, откуда берется новая уверенность, и дело вовсе не в улучшении систем оценки. Доверие сосредоточено почти исключительно среди предприятий, которые не сталкивались со сбоями из-за ложной уверенности: среди них полностью доверяют автоматизированной оценке 24% по сравнению с 4% среди тех, кто уже обжегся. Кривая доверия идет вверх за счет неопытных компаний. Между тем, предприятия, столкнувшиеся со сбоями, не отказываются от автономии — 85% из них уже разрешают развертывание без участия человека или активно готовят к этому свою инфраструктуру (по сравнению с 61% среди тех, у кого такого опыта не было). В целом траектория автономии остается на прежнем уровне (67%), но состав внутри этой группы сместился в сторону организаций, имеющих наиболее прямые доказательства того, что тесты упускают из виду важные вещи.

Рынок вендоров, напротив, наконец-то начинает стабилизироваться. Доля предприятий, не использующих никаких специализированных инструментов оценки, снизилась с 17% до 12%; специализированные платформы укрепили позиции: доля Braintrust выросла почти вдвое (до 15%), а DeepEval достигла 17%. Намерение сменить платформу ослабло: доля тех, кто не планирует никаких изменений, выросла с 36% до 44%. Критерии выбора также изменились: простота интеграции обошла стоимость в качестве главного фактора, подскочив с 27% до 39%. Предприятия перестали выбирать решения по принципу наименьшей цены и начали покупать то, что лучше всего подходит по функционалу.

Методология

VentureBeat провел этот опрос в рамках своей продолжающейся серии исследований Pulse Research. Данная волна — трекер надежности и тестирования агентных систем — изучает, как технические лидеры оценивают производительность и надежность агентов. Ответы отфильтрованы по организациям со штатом от 100 сотрудников (n=108) на основе опроса, проведенного в июле 2026 года. Поскольку июльский инструмент идентичен июньскому, данный отчет проводит сравнение месяц к месяцу там, где это оправданно; в случаях, когда вопросы предполагали выбор нескольких вариантов, суммы долей могут превышать 100%.

Сравнения с июлем (n=157) проверяются на значимость, и лишь немногие показатели преодолевают стандартный порог: рост полного доверия к автоматизированной оценке (с 5% до 13%), снижение числа жалоб на несоответствие реальным условиям (с 29% до 19%), скачок важности простоты интеграции как критерия выбора (с 27% до 39%) и рост Braintrust в качестве основной платформы (с 8% до 15%). Изменения, охарактеризованные в этом отчете как стабильные — уровень сбоев, траектория автономии, набор средств мониторинга продакшена, рейтинг инвестиций — статистически неотличимы между волнами, и сама эта стабильность является главным выводом. Небольшие колебания на пару процентов в других областях следует рассматривать как погрешность выборки, а не как тенденцию.

По ролям выборка представлена руководящим составом с правом принятия решений: 44% являются лицами, принимающими окончательные решения по закупкам ИИ, еще 25% — советниками или влияющими лицами, что представляет собой чуть более высокопоставленную аудиторию по сравнению с июнем. Лидируют продакт- и программой-менеджеры (18%), консультанты и советники (12%), ИТ-директора/технические директора/директора по информационной безопасности (11%), а также директора по инжинирингу и ИТ (11%), наряду с большой категорией «Другое» (30%). По размеру организаций выборка вновь смещена в сторону среднего бизнеса: преобладают компании с численностью сотрудников 100–499 (33%) и 500–2,499 (30%), за которыми следуют компании с 2,500–9,999 (23%), 10,000–50,000 (9%) и более 50,000 (5%) сотрудников.

Стоит отметить одно изменение в структуре выборки, поскольку оно влияет на показатели доверия. Отраслевой состав между волнами изменился: доля технологического сектора и сферы ПО снизилась с 23% в июне до 14% в июле, в то время как розничная торговля и сектор потребительских товаров выросли с 15% до 19% и вышли на первое место. Менее технологически ориентированная выборка закономерно имеет меньше практического опыта оценки агентов, и часть июльского роста доверия может отражать то, кто именно отвечал на вопросы, а не реальные изменения. При этом разделение на «обжегшихся» и «не обжегшихся» компаний, описанное во втором выводе, актуально для июльской выборки в любом случае, однако читателям следует воспринимать общий рост доверия как ориентировочный тренд.

При размере выборки в 108 респондентов она достаточно велика для формулирования общих тенденций, но не должна рассматриваться как точное измерение; это самоформирующаяся выборка, а не вероятностная. Приведенные здесь перекрестные таблицы опираются на подгруппы от 40 до 68 респондентов и имеют соответствующую погрешность.

Вывод 1: Уровень сбоев не изменился

Чуть меньше половины компаний по-прежнему выпускают агентов, которые проходят тесты, но подводят клиентов

Мы спросили, развертывали ли организации за последние 12 месяцев агента или функцию LLM, которые прошли внутреннее тестирование, но затем привели к сбоям на стороне пользователя. Ответ совпадает с результатами прошлого месяца.

Вывод 1 — Уровень сбоев не изменился

25%

да, один раз

24%

да, более одного раза — повторяющийся разрыв между тестированием и реальностью

38%

подобных сбоев в продакшене не зафиксировано

13%

либо не проводят тестирование перед релизом, либо не отслеживают это достаточно тщательно

Сорок девять процентов организаций выпустили ИИ-функцию, которая успешно прошла внутренние тесты, но дала сбой перед клиентом (некорректный результат, сбой в рабочем процессе или инцидент с качеством) по сравнению с 50% в июне. Четверть респондентов (24%) сталкивались с этим более одного раза — показатель остался прежним. За две волны исследования и по результатам опроса 265 предприятий частота, с которой системы оценки сертифицируют неблагонадежных агентов, остается стабильной с погрешностью в пределах одного процента.

Эта стабильность служит фундаментом для всех последующих выводов. Любое другое движение этого месяца — рост доверия, консолидация инструментов, изменение критериев закупки — должно рассматриваться на фоне неизменного уровня сбоев. Что бы ни предпринимали предприятия в период с июня по июнь, это не изменило частоту, с которой успешные результаты тестов оказываются ошибочными.

Вывод 2: Доверие выросло — среди тех, кто еще не обжигался

Полное доверие выросло почти втрое, а жалобы на точность сократились на десять пунктов

Мы спросили, какое ограничение сегодня сильнее всего снижает доверие к автоматизированной оценке агентов. Распределение ответов существенно изменилось по сравнению с июнем.

Вывод 2 — Доверие выросло — среди тех, кто еще не обжигался

22%

указывают на предвзятость или несогласованность оценки — теперь это главное ограничение

22%

указывают на утечку данных или проблемы с конфиденциальностью в процессе оценки

19%

указывают на слабое соответствие реальным результатам — показатель снизился с 29% и больше не лидирует

16%

указывают на нехватку прозрачности; 8% отмечают незрелость инструментов

13%

говорят, что сегодня полностью доверяют автоматизированной оценке — рост с 5% в июне

Два показателя изменились одновременно: полное доверие к автоматизированной оценке выросло почти в три раза (с 5% до 13%), а претензия, наиболее точно описывающая сбой из-за ложной уверенности (слабое соответствие реальным результатам), снизилась с 29% до 19%, уступив первое место предвзятости и непоследовательности оценок (22%), которые теперь делят лидерство с опасениями по поводу утечки данных (22%). На первый взгляд это говорит о том, что инструменты оценки начинают оправдывать себя.

Перекрестные таблицы говорят об обратном. Если разделить выборку по признаку того, сталкивалась ли организация со сбоями из-за ложной уверенности, мнения о доверии разделятся кардинально. Среди 53 предприятий, выпустивших агента, который прошел тесты и затем подвел клиента, полностью доверяют автоматизированной оценке лишь 4%. Среди 41 компании, у которых таких сбоев не было, этот показатель составляет 24% — шестикратная разница и самый резкий раскол во всем наборе данных. Именно прямой опыт столкновения с неудачами разрушает доверие.

В этом и заключается главное предостережение текущего месяца. Рост оптимизма вовсе не свидетельствует о том, что системы оценки стали лучше — уровень сбоев из Вывода 1 исключает это предположение. Мы наблюдаем типичную картину кривой доверия, когда в выборку попадает когорта менее опытных компаний со своими первоначальными ожиданиями. Предприятия, которые воспринимают собственный рост уверенности как подтверждение качества своих инструментов оценки, на самом деле ориентируются на показатель неопытности.

Вывод 3: Негативный опыт ускоряет автономию, а не сдерживает ее

85% компаний, столкнувшихся со сбоями, идут по пути полной автономии, против 61% остальных

Мы спросили, позволили бы организации автономному агенту вносить изменения в код или системные настройки в продакшене исключительно на основе результатов автоматизированной оценки, без проверки человеком.

Вывод 3 — Негативный опыт ускоряет автономию, а не сдерживает ее

37%

уже разрешают это для определенных агентов или изменений с низким уровнем риска

30%

пока не разрешают, но активно перестраивают процессы, чтобы внедрить это в течение 12 месяцев

18%

не планируют разрешать полностью автоматизированное развертывание в обозримом будущем

16%

не используют автономных агентов (11%) или затрудняются ответить (5%)

В целом ситуация не изменилась: 67% организаций либо уже разрешают развертывание низкорисковых агентов без участия человека (37%), либо активно готовят к этому свои процессы в течение года (30%) — столько же, сколько и в июне. Доля тех, кто исключает такую возможность в обозримом будущем, снизилась с 22% до 18%. Потолок автономости перестал расти, но и не опустился.

Однако изнанка этого процесса противоречит интуитивным ожиданиям. Среди предприятий, которые выпустили прошедшего тестирование агента и столкнулись со сбоем, 85% движутся по пути автономии. Среди тех, у кого таких сбоев не было, этот показатель составляет 61%. Организации, обладающие прямым и стоившим им дорого опытом несовершенства систем оценки, с гораздо большей вероятностью исключают человека из процесса, а не держатся за него — лишь 11% из них полностью исключают автоматизацию (против 24% среди тех, кто не обжигался). Эта тенденция одинакова как для компаний, столкнувшихся со сбоем единожды, так и для тех, у кого это происходило регулярно.

Наиболее правдоподобное объяснение кроется не в безрассудстве, а в зрелости: компании, выпускающие агентов в объемах, достаточных для столкновения с реальными проблемами у клиентов, обладают и достаточно сложными пайплайнами для автоматизации, воспринимая сбои как издержки работы, а не как повод остановиться. Это вполне рациональная позиция. Но именно эта динамика превращает стабильный уровень сбоев из Вывода 1 в растущее абсолютное число инцидентов, поскольку предприятия, наиболее склонные к сбоям, одновременно масштабируют свои возможности по развертыванию без предварительного ревью.

Одно из июньских наблюдений не подтвердилось. В прошлом месяце более крупные предприятия казались несколько более продвинутыми на пути к автономии, чем мелкие (70% против 64%). В июле эти показатели сблизились — 65% для организаций с 2,500+ сотрудниками против 68% для компаний меньшего размера, при практически идентичном уровне сбоев (48% и 50%). Это говорит о том, что июньский разрыв был следствием погрешности выборки, а не влиянием масштаба бизнеса. Агрессивных последователей автономии отличает не размер компании, а пережитый опыт неудач.

Вывод 4: Набор инструментов начинает консолидироваться

Специализированные решения набирают популярность, а доля вариантов «вообще без инструментов» сокращается

Мы спросили, какие платформы для обеспечения надежности или оценки агентов предприятия используют чаще всего. Сфера по-прежнему остается перенасыщенной, но вариант «ничего не использовать» больше не делит первое место.

Вывод 4 — Набор инструментов начинает консолидироваться

18%

используют встроенные средства оценки/трассировки OpenAI Developer Platform — это самый популярный инструмент

17%

используют Confident AI (DeepEval) — рост с 12%

15%

используют Braintrust — рост с 8%, самый крупный прирост среди отдельных вендоров за месяц

12%

используют встроенные инструменты оценки Anthropic Claude Console; 12% вообще не используют специализированных инструментов (снижение с 17%)

6%

используют LangSmith, Promptfoo и собственные внутренние разработки; Weave — 5%, Datadog — 3%, Arize — 1%

Самый важный показатель — тот, который снизился. В июне отсутствие каких-либо специализированных инструментов оценки делило первое место с показателем в 17%; в июле этот показатель упал до 12%, сместившись на пятое место. Предприятия приобретают инструменты оценки, причем большую часть этого прироста забирают специализированные игроки: доля Braintrust в качестве основного инструмента выросла почти вдвое (до 15%), а DeepEval достигла 17%. Встроенные инструменты провайдеров моделей остались примерно на том же уровне (OpenAI — 18%, Anthropic — 12%), что означает рост за счет отказа от практики «ничего не использовать», а не за счет конкуренции с создателями моделей.

Если учитывать любое использование, а не только основные платформы, картина охвата шире, а расстановка сил схожа: встроенные средства OpenAI охватывают 31% предприятий, DeepEval — 27%, Braintrust — 22%, встроенные средства Anthropic — 20%, собственные разработки — 14%, а Weave и Langfuse — по 11%. При этом 19% по-прежнему заявляют, что не используют никаких специализированных инструментов. В категории появилось три реальных независимых претендента, хотя в июне не было ни одного с двузначной долей основного использования — это первое свидетельство формирования полноценного уровня оценки в исследуемой сфере.

Finding 5: Производственный мониторинг по-прежнему следит не за тем

Половина компаний отслеживает работоспособность агента, и менее трети — правильность его работы

Мониторинг ИИ-агента в продакшене может решать две совершенно разные задачи. Он может следить за работоспособностью системы — активен ли агент, отвечает ли он, вовремя ли завершается каждый запрос, с какой скоростью, ценой и ошибками. Либо он может проверять корректность ответов агента с помощью автоматизированных проверок контента каждого ответа в реальном времени. Уверенный, но неверный ответ при первом подходе остается незамеченным: запрос выполнен, ответ получен быстро, ошибок нет, а все метрики инфраструктуры выглядят отлично. Мы спросили, для какого типа мониторинга настроены системы в продакшене сегодня.

Группируя системы по тому, за чем именно они следят, мы получаем примерно июньские пропорции: 50% организаций отслеживают только работоспособность агента, в то время как 26% запускают автоматизированные проверки корректности ответов. Если учесть спорадические проверки и тех, кто затруднился с ответом, почти три четверти организаций не проводят автоматизированную оценку правильности результатов в реальном времени в продакшене. Встроенные проверки качества и логирование транзакций делят первое место среди подходов — по 26% при выборке из 106 респондентов, и ни один из подходов не имеет явного перевеса.

Этот вывод сильнее всего противоречит росту уверенности в текущем месяце. Доверие к автоматизированной оценке выросло на восемь пунктов, тогда как техническая способность обнаружить ошибку оценки в рантайме осталась на прежнем уровне. Среди предприятий, уже разрешивших автономное развертывание без человека, лишь 28% запускают встроенные проверки качества для трафика в продакшене. Это означает, что большинство организаций, исключивших человека из процесса принятия решений о релизе, не заменили его ничем, что проверяло бы качество ответов впоследствии. Шлагбаум автоматизирован, а сигнализация не установлена.

Вывод 6: Покупка идет по принципу соответствия, а не цены

Простота интеграции обошла стоимость в качестве главного критерия выбора

Мы спросили, что сильнее всего влияет на выбор вендора систем оценки и что компании считают главным мерилом своего успеха. Один показатель резко изменился, другой остался прежним.

Вывод 6 — Покупка идет по принципу соответствия, а не цены

39%

выбрали вендора прежде всего за простоту интеграции — рост с 27%, теперь это доминирующий фактор

28%

выбрали на основе точности оценки; 23% — на основе стоимости (снижение с 28% и первого места)

38%

называют согласованность оценок главной метрикой успеха — показатель лидирует без изменений

20%

измеряют успех сокращением сбоев или регрессий; 18% — скоростью экспериментов

Простота интеграции подскочила на 12 пунктов (до 39%) и вытеснила стоимость в качестве ключевого критерия выбора, продемонстрировав самый четкий сдвиг в структуре закупок. Точность оценки скромно выросла до 28%, стоимость упала до 23%, а широта наблюдаемости (6%) и дорожная карта вендора (2%) остаются маргинальными факторами. В сопоставлении с Выводом 4 эти два тренда связаны: предприятия, внедряющие свои первые инструменты оценки, оптимизируют процессы под то, что удастся бесшовно встроить в существующий пайплайн в текущем квартале, а не под то, что абстрактно дешевле или мощнее. Именно так выглядит рынок, который перестал выбирать и перешел к установке.

При этом требования к инструменту после его установки не изменились. Согласованность оценок остается главной метрикой успеха (38%, практически идентично июньским 36%), значительно опережая сокращение сбоев (20%), скорость экспериментов (18%), видимость в продакшене (16%) и соответствие нормативам (7%). Приоритетом по-прежнему остается повторяемость — получение одинакового вердикта на одинаковое поведение системы каждый раз. Это примечательно, учитывая, что предвзятость и непоследовательность сейчас названы главными ограничениями доверия в Выводе 2. Предприятия покупают инструменты ради интеграции, а оценивают по стабильности, пока не получая последней. Удовлетворенность текущими инструментами остается умеренной, в среднем составляя 3,9 балла по пятибалльной шкале (по сумме общей удовлетворенности, простоты внедрения и соотношения цены и качества), почти не изменившись с июньских 3,8.

Вывод 7: Проверка человеком становится главной статьей расходов

И предприятия, которые уже обжигались, инвестируют в это больше всего

Мы спросили, инвестиции в какие аспекты надежности и оценки будут расти быстрее всего в следующем году. Рабочие процессы проверки человеком вышли на первое место.

Вывод 7 — Проверка человеком становится главной статьей расходов

31%

называют процессы проверки человеком главной областью для роста — подъем со второго места в июне

30%

называют инструменты производственной наблюдаемости

19%

называют автоматизированные пайплайны оценки

16%

называют оценку безопасности и политик; лишь 6% говорят, что их бюджет не увеличивается

Рабочие процессы ручной проверки (31%) и продакшен-наблюдаемость (30%) поменялись местами на вершине рейтинга — это изменение достаточно мало, чтобы быть шумом само по себе, но лежащая в его основе тенденция была замечена еще в июне и теперь усилилась. Предприятия планируют наращивать расходы на человеческих ревьюеров быстрее, чем на автоматизированные пайплайны оценки (19%), которые призваны их заменить — и это в тот момент, когда две трети компаний исключают человека из процессов релизов. Лишь 6% сообщают о заморозке бюджетов (снижение с 8%).

Перекрестные таблицы делают эту стратегию страховки очевидной. Среди предприятий, которые выпустили прошедшего тесты агента, допустившего сбой у клиента, 38% называют ручную проверку главным направлением инвестиций; среди тех, у кого таких сбоев не было, этот показатель составляет 24%, и они предпочитают инвестировать в инструменты наблюдаемости. Таким образом, «обжегшаяся» когорта делает две вещи одновременно: она наиболее агрессивна в вопросах автономии (85% на пути исключения человека, согласно Выводу 3) и наиболее предана финансированию человеческих проверок. Это не столько противоречие, сколько стратегия — автоматизировать принятие решения о релизе и платить людям за то, чтобы они отлавливали то, что упускает автоматика. Насколько масштабируема эта модель — открытый вопрос, поскольку ручная проверка — это единственный элемент стека, стоимость которого не снижается по мере роста объемов агентов.

Вывод 8: Волна смены платформ остывает

Доля тех, кто не планирует изменений, выросла с трети почти до половины

Мы спросили, планируют ли предприятия внедрять новую, дополнительную или замещающую платформу оценки и какие варианты они рассматривают. Покупателей на рынке стало меньше, чем в прошлом месяце.

Вывод 8 — Волна смены платформ остывает

44%

не планируют никаких изменений — рост с 36% в июне

24%

планируют внедрение или смену в ближайшие 0–3 месяца (снижение с 31%)

19%

планируют изменения в течение 3–6 месяцев

12%

планируют изменения в течение 6–12 месяцев

Большинство (56%) по-прежнему намерены внедрить новую, дополнительную или замещающую платформу в течение двенадцати месяцев, но этот показатель снизился с 64%, а краткосрочная когорта сократилась с 31% до 24%. Доля тех, кто решил не менять ничего, выросла с 36% до 44%. Ни одно из этих изменений само по себе не преодолевает порог статистической значимости, но оба указывают в одном направлении, полностью согласуясь с Выводом 4: по мере того как предприятия реально приобретают инструменты, число тех, кто продолжает их искать, сокращается.

Список рассматриваемых вариантов также изменился. Среди 60 предприятий, планирующих изменения, лидируют встроенные оценки OpenAI (20%), за которыми следуют Braintrust (18%), Weights & Biases Weave (12%) и DeepEval (10%), при этом еще 10% активно выбирают инструменты, но еще не сформировали шорт-лист. В июне DeepEval возглавляла этот список с показателем 20%; с тех пор компания конвертировала значительную часть этого интереса в реальное использование — именно так выглядит переход от стадии рассмотрения к внедрению. Теперь позицию DeepEval занял Braintrust (высокий интерес при меньшей текущей базе установленных систем), и это вендор, за которым стоит понаблюдать в следующей волне.

Итоги: Уверенность выросла, правильность — нет

В июне исследование выявило разрыв между автономией, которую предприятия предоставляли своим агентам, и доверием к системам оценки, призванным их контролировать. В июле этот разрыв сокращается с неправильной стороны. Доверие выросло — полное доверие к автоматизированной оценке увеличилось почти втрое, а число жалоб на то, что тесты не отражают реальность, снизилось на десять пунктов, — в то время как показатель, который это доверие должно отражать, остался абсолютно неизменным. Чуть менее половины предприятий по-прежнему выпускают агентов, которые проходят тесты, а затем подводят пользователей, ровно так же, как и в прошлом месяце.

Перекрестные таблицы точно указывают источник новой уверенности, и это не системы оценки. Двадцать четыре процента предприятий, никогда не сталкивавшихся со сбоями из-за ложной уверенности, полностью доверяют автоматизированной оценке; среди тех, кто с ними сталкивался, этот показатель составляет всего 4%. Доверие на этом рынке является функцией опыта взаимодействия, а не доказательств. И этот опыт не порождает осторожности: «обжегшаяся» когорта демонстрирует самую высокую степень автономии в выборке — 85% уже запускают системы без участия человека или движутся к этому. Вместо осторожности формируется стратегия страховки: те же самые организации активнее всего финансируют ручную проверку (38%), одновременно убирая людей из контура принятия релизов.

Рынок вендоров — это подлинно обнадеживающая история месяца. Доля компаний, не использующих специализированные инструменты, сократилась с 17% до 12%, специализированные платформы впервые за историю серии завоевали реальную долю рынка, покупатели переориентировались с цены на удобство интеграции, а волна смены платформ остыла по мере завершения первичных внедрений. Уровень оценки наконец-то начинает формироваться. Однако ситуация в рантайме за этим не поспевает: половина предприятий по-прежнему отслеживает лишь то, работает ли агент, а среди тех, кто уже развертывает системы без участия человека, лишь 28% запускают проверки качества ответов в реальном времени.

При выборке в 108 респондентов из сегмента среднего бизнеса, сформированной на основе самоотбора, и с учетом изменения отраслевого состава между волнами, этот отчет следует рассматривать как указатель тенденций. Тем не менее, направление движения очевидно: предприятия закупают инструменты, выбирают решения по критерию удобства и обретают все большую уверенность — и ничто из этого пока не повлияло на то, как часто успешный результат тестирования оказывается ложным. Главный вопрос, оставшийся после июньского отчета — догонит ли надежность уровень автономии — теперь звучит иначе. Июльский ответ заключается в том, что уверенность опередила всех, и это куда более сложная проблема, поскольку предприятие, доверяющее сломанному шлагбауму, имеет гораздо меньше причин его чинить, чем то, которое знает о поломке.


В данном отчете представлена июльская волна 2026 года в рамках продолжающейся серии лонгитюдных исследований надежности и оценки корпоративных ИИ-агентов на основе 108 квалифицированных респондентов из организаций со штатом от 100 сотрудников. Проведено сравнение с результатами июньской волны 2026 года (n=157), полученными с использованием идентичного инструментария. При данном размере выборки результаты следует рассматривать как ориентировочный сигнал, а не как точное измерение — выборка сформирована методом самоотбора и не является вероятностной. Респонденты включают лиц, принимающих ключевые решения, технологических экспертов и влиятельных лиц, а также конечных бизнес-пользователей из различных отраслей и компаний различного масштаба с преобладанием среднего бизнеса.

Resources

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.