Доверие к оценке ИИ-агентов растет, а надежность — нет
Источник: VentureBeat · VB Staff

В июле доверие к автоматизированной оценке агентов среди 108 предприятий резко возросло — в то время как уровень сбоев, который она призвана предсказывать, не изменился вовсе. Доля организаций, полностью доверяющих автоматизированной оценке, выросла почти в три раза — с 5% в июне до 13%, а жалобы на то, что оценки не соответствуют реальным результатам, снизились на 10 пунктов. Тем не менее, ровно та же доля, что и в прошлом месяце (чуть менее половины), выпустила в продакшен агента, который прошел внутреннее тестирование, но затем подвел клиента. Причина видна в перекрестных таблицах: новый уровень доверия принадлежит почти исключительно тем предприятиям, которые еще не обжигались. Среди тех, кто уже сталкивался со сбоями, автоматизированной оценке доверяют 4%; среди тех, кто не сталкивался — 24%. При этом горький опыт вовсе не замедляет движение к автономии — он его ускоряет.
Это вторая волна исследования надежности агентов от VentureBeat Pulse Research и первая волна, проведенная с использованием инструментария, идентичного прошлому месяцу. Это делает июль первым срезом, позволяющим оценить динамику, а не статичное положение: что изменилось, что осталось неизменным и что означает это движение.
Изменилась уверенность. В июне лишь 5% предприятий заявляли, что полностью доверяют автоматизированной оценке, а наиболее частым ограничением называлось слабое соответствие оценок реальным результатам (29%). В июле полностью доверяют автоматизированной оценке уже 13%, а доля жалоб на соответствие снизилась до 19%, перестав быть главной претензией. Оба сдвига достаточно велики, чтобы восприниматься как реальные изменения, а не как статистический шум.
Не изменился уровень сбоев. Чуть менее половины организаций (49%) за последний год развернули функцию агента или LLM, которая прошла внутреннее тестирование, а затем привела к сбою на стороне клиента — это статистически неотличимо от июньских 50%, при этом четверть респондентов (24%) сталкивались с этим более одного раза. Уверенность выросла; корректность — нет. В этом и заключается июльский разрыв: не между автономией и доверием, как в июне, а между доверием и реальными основаниями для него.
Перекрестные таблицы объясняют, откуда берется новая уверенность, и дело вовсе не в улучшении систем оценки. Доверие сосредоточено почти исключительно среди предприятий, которые не сталкивались со сбоями из-за ложной уверенности: среди них полностью доверяют автоматизированной оценке 24% по сравнению с 4% среди тех, кто уже обжегся. Кривая доверия идет вверх за счет неопытных компаний. Между тем, предприятия, столкнувшиеся со сбоями, не отказываются от автономии — 85% из них уже разрешают развертывание без участия человека или активно готовят к этому свою инфраструктуру (по сравнению с 61% среди тех, у кого такого опыта не было). В целом траектория автономии остается на прежнем уровне (67%), но состав внутри этой группы сместился в сторону организаций, имеющих наиболее прямые доказательства того, что тесты упускают из виду важные вещи.
Рынок вендоров, напротив, наконец-то начинает стабилизироваться. Доля предприятий, не использующих никаких специализированных инструментов оценки, снизилась с 17% до 12%; специализированные платформы укрепили позиции: доля Braintrust выросла почти вдвое (до 15%), а DeepEval достигла 17%. Намерение сменить платформу ослабло: доля тех, кто не планирует никаких изменений, выросла с 36% до 44%. Критерии выбора также изменились: простота интеграции обошла стоимость в качестве главного фактора, подскочив с 27% до 39%. Предприятия перестали выбирать решения по принципу наименьшей цены и начали покупать то, что лучше всего подходит по функционалу.
Методология
VentureBeat провел этот опрос в рамках своей продолжающейся серии исследований Pulse Research. Данная волна — трекер надежности и тестирования агентных систем — изучает, как технические лидеры оценивают производительность и надежность агентов. Ответы отфильтрованы по организациям со штатом от 100 сотрудников (n=108) на основе опроса, проведенного в июле 2026 года. Поскольку июльский инструмент идентичен июньскому, данный отчет проводит сравнение месяц к месяцу там, где это оправданно; в случаях, когда вопросы предполагали выбор нескольких вариантов, суммы долей могут превышать 100%.
Сравнения с июлем (n=157) проверяются на значимость, и лишь немногие показатели преодолевают стандартный порог: рост полного доверия к автоматизированной оценке (с 5% до 13%), снижение числа жалоб на несоответствие реальным условиям (с 29% до 19%), скачок важности простоты интеграции как критерия выбора (с 27% до 39%) и рост Braintrust в качестве основной платформы (с 8% до 15%). Изменения, охарактеризованные в этом отчете как стабильные — уровень сбоев, траектория автономии, набор средств мониторинга продакшена, рейтинг инвестиций — статистически неотличимы между волнами, и сама эта стабильность является главным выводом. Небольшие колебания на пару процентов в других областях следует рассматривать как погрешность выборки, а не как тенденцию.
По ролям выборка представлена руководящим составом с правом принятия решений: 44% являются лицами, принимающими окончательные решения по закупкам ИИ, еще 25% — советниками или влияющими лицами, что представляет собой чуть более высокопоставленную аудиторию по сравнению с июнем. Лидируют продакт- и программой-менеджеры (18%), консультанты и советники (12%), ИТ-директора/технические директора/директора по информационной безопасности (11%), а также директора по инжинирингу и ИТ (11%), наряду с большой категорией «Другое» (30%). По размеру организаций выборка вновь смещена в сторону среднего бизнеса: преобладают компании с численностью сотрудников 100–499 (33%) и 500–2,499 (30%), за которыми следуют компании с 2,500–9,999 (23%), 10,000–50,000 (9%) и более 50,000 (5%) сотрудников.
Стоит отметить одно изменение в структуре выборки, поскольку оно влияет на показатели доверия. Отраслевой состав между волнами изменился: доля технологического сектора и сферы ПО снизилась с 23% в июне до 14% в июле, в то время как розничная торговля и сектор потребительских товаров выросли с 15% до 19% и вышли на первое место. Менее технологически ориентированная выборка закономерно имеет меньше практического опыта оценки агентов, и часть июльского роста доверия может отражать то, кто именно отвечал на вопросы, а не реальные изменения. При этом разделение на «обжегшихся» и «не обжегшихся» компаний, описанное во втором выводе, актуально для июльской выборки в любом случае, однако читателям следует воспринимать общий рост доверия как ориентировочный тренд.
При размере выборки в 108 респондентов она достаточно велика для формулирования общих тенденций, но не должна рассматриваться как точное измерение; это самоформирующаяся выборка, а не вероятностная. Приведенные здесь перекрестные таблицы опираются на подгруппы от 40 до 68 респондентов и имеют соответствующую погрешность.
Вывод 1: Уровень сбоев не изменился
Чуть меньше половины компаний по-прежнему выпускают агентов, которые проходят тесты, но подводят клиентов
Мы спросили, развертывали ли организации за последние 12 месяцев агента или функцию LLM, которые прошли внутреннее тестирование, но затем привели к сбоям на стороне пользователя. Ответ совпадает с результатами прошлого месяца.
Вывод 1 — Уровень сбоев не изменился
25%
да, один раз
24%
да, более одного раза — повторяющийся разрыв между тестированием и реальностью
38%
подобных сбоев в продакшене не зафиксировано
13%
либо не проводят тестирование перед релизом, либо не отслеживают это достаточно тщательно
Сорок девять процентов организаций выпустили ИИ-функцию, которая успешно прошла внутренние тесты, но дала сбой перед клиентом (некорректный результат, сбой в рабочем процессе или инцидент с качеством) по сравнению с 50% в июне. Четверть респондентов (24%) сталкивались с этим более одного раза — показатель остался прежним. За две волны исследования и по результатам опроса 265 предприятий частота, с которой системы оценки сертифицируют неблагонадежных агентов, остается стабильной с погрешностью в пределах одного процента.
Эта стабильность служит фундаментом для всех последующих выводов. Любое другое движение этого месяца — рост доверия, консолидация инструментов, изменение критериев закупки — должно рассматриваться на фоне неизменного уровня сбоев. Что бы ни предпринимали предприятия в период с июня по июнь, это не изменило частоту, с которой успешные результаты тестов оказываются ошибочными.
Вывод 2: Доверие выросло — среди тех, кто еще не обжигался
Полное доверие выросло почти втрое, а жалобы на точность сократились на десять пунктов
Мы спросили, какое ограничение сегодня сильнее всего снижает доверие к автоматизированной оценке агентов. Распределение ответов существенно изменилось по сравнению с июнем.
Вывод 2 — Доверие выросло — среди тех, кто еще не обжигался
22%
указывают на предвзятость или несогласованность оценки — теперь это главное ограничение
22%
указывают на утечку данных или проблемы с конфиденциальностью в процессе оценки
19%
указывают на слабое соответствие реальным результатам — показатель снизился с 29% и больше не лидирует
16%
указывают на нехватку прозрачности; 8% отмечают незрелость инструментов
13%
говорят, что сегодня полностью доверяют автоматизированной оценке — рост с 5% в июне
Два показателя изменились одновременно: полное доверие к автоматизированной оценке выросло почти в три раза (с 5% до 13%), а претензия, наиболее точно описывающая сбой из-за ложной уверенности (слабое соответствие реальным результатам), снизилась с 29% до 19%, уступив первое место предвзятости и непоследовательности оценок (22%), которые теперь делят лидерство с опасениями по поводу утечки данных (22%). На первый взгляд это говорит о том, что инструменты оценки начинают оправдывать себя.
Перекрестные таблицы говорят об обратном. Если разделить выборку по признаку того, сталкивалась ли организация со сбоями из-за ложной уверенности, мнения о доверии разделятся кардинально. Среди 53 предприятий, выпустивших агента, который прошел тесты и затем подвел клиента, полностью доверяют автоматизированной оценке лишь 4%. Среди 41 компании, у которых таких сбоев не было, этот показатель составляет 24% — шестикратная разница и самый резкий раскол во всем наборе данных. Именно прямой опыт столкновения с неудачами разрушает доверие.
В этом и заключается главное предостережение текущего месяца. Рост оптимизма вовсе не свидетельствует о том, что системы оценки стали лучше — уровень сбоев из Вывода 1 исключает это предположение. Мы наблюдаем типичную картину кривой доверия, когда в выборку попадает когорта менее опытных компаний со своими первоначальными ожиданиями. Предприятия, которые воспринимают собственный рост уверенности как подтверждение качества своих инструментов оценки, на самом деле ориентируются на показатель неопытности.
Вывод 3: Негативный опыт ускоряет автономию, а не сдерживает ее
85% компаний, столкнувшихся со сбоями, идут по пути полной автономии, против 61% остальных
Мы спросили, позволили бы организации автономному агенту вносить изменения в код или системные настройки в продакшене исключительно на основе результатов автоматизированной оценки, без проверки человеком.
Вывод 3 — Негативный опыт ускоряет автономию, а не сдерживает ее
37%
уже разрешают это для определенных агентов или изменений с низким уровнем риска
30%
пока не разрешают, но активно перестраивают процессы, чтобы внедрить это в течение 12 месяцев
18%
не планируют разрешать полностью автоматизированное развертывание в обозримом будущем
16%
не используют автономных агентов (11%) или затрудняются ответить (5%)
В целом ситуация не изменилась: 67% организаций либо уже разрешают развертывание низкорисковых агентов без участия человека (37%), либо активно готовят к этому свои процессы в течение года (30%) — столько же, сколько и в июне. Доля тех, кто исключает такую возможность в обозримом будущем, снизилась с 22% до 18%. Потолок автономости перестал расти, но и не опустился.
Однако изнанка этого процесса противоречит интуитивным ожиданиям. Среди предприятий, которые выпустили прошедшего тестирование агента и столкнулись со сбоем, 85% движутся по пути автономии. Среди тех, у кого таких сбоев не было, этот показатель составляет 61%. Организации, обладающие прямым и стоившим им дорого опытом несовершенства систем оценки, с гораздо большей вероятностью исключают человека из процесса, а не держатся за него — лишь 11% из них полностью исключают автоматизацию (против 24% среди тех, кто не обжигался). Эта тенденция одинакова как для компаний, столкнувшихся со сбоем единожды, так и для тех, у кого это происходило регулярно.
Наиболее правдоподобное объяснение кроется не в безрассудстве, а в зрелости: компании, выпускающие агентов в объемах, достаточных для столкновения с реальными проблемами у клиентов, обладают и достаточно сложными пайплайнами для автоматизации, воспринимая сбои как издержки работы, а не как повод остановиться. Это вполне рациональная позиция. Но именно эта динамика превращает стабильный уровень сбоев из Вывода 1 в растущее абсолютное число инцидентов, поскольку предприятия, наиболее склонные к сбоям, одновременно масштабируют свои возможности по развертыванию без предварительного ревью.
Одно из июньских наблюдений не подтвердилось. В прошлом месяце более крупные предприятия казались несколько более продвинутыми на пути к автономии, чем мелкие (70% против 64%). В июле эти показатели сблизились — 65% для организаций с 2,500+ сотрудниками против 68% для компаний меньшего размера, при практически идентичном уровне сбоев (48% и 50%). Это говорит о том, что июньский разрыв был следствием погрешности выборки, а не влиянием масштаба бизнеса. Агрессивных последователей автономии отличает не размер компании, а пережитый опыт неудач.
Вывод 4: Набор инструментов начинает консолидироваться
Специализированные решения набирают популярность, а доля вариантов «вообще без инструментов» сокращается
Мы спросили, какие платформы для обеспечения надежности или оценки агентов предприятия используют чаще всего. Сфера по-прежнему остается перенасыщенной, но вариант «ничего не использовать» больше не делит первое место.
Вывод 4 — Набор инструментов начинает консолидироваться
18%
используют встроенные средства оценки/трассировки OpenAI Developer Platform — это самый популярный инструмент
17%
используют Confident AI (DeepEval) — рост с 12%
15%
используют Braintrust — рост с 8%, самый крупный прирост среди отдельных вендоров за месяц
12%
используют встроенные инструменты оценки Anthropic Claude Console; 12% вообще не используют специализированных инструментов (снижение с 17%)
6%
используют LangSmith, Promptfoo и собственные внутренние разработки; Weave — 5%, Datadog — 3%, Arize — 1%
Самый важный показатель — тот, который снизился. В июне отсутствие каких-либо специализированных инструментов оценки делило первое место с показателем в 17%; в июле этот показатель упал до 12%, сместившись на пятое место. Предприятия приобретают инструменты оценки, причем большую часть этого прироста забирают специализированные игроки: доля Braintrust в качестве основного инструмента выросла почти вдвое (до 15%), а DeepEval достигла 17%. Встроенные инструменты провайдеров моделей остались примерно на том же уровне (OpenAI — 18%, Anthropic — 12%), что означает рост за счет отказа от практики «ничего не использовать», а не за счет конкуренции с создателями моделей.
Если учитывать любое использование, а не только основные платформы, картина охвата шире, а расстановка сил схожа: встроенные средства OpenAI охватывают 31% предприятий, DeepEval — 27%, Braintrust — 22%, встроенные средства Anthropic — 20%, собственные разработки — 14%, а Weave и Langfuse — по 11%. При этом 19% по-прежнему заявляют, что не используют никаких специализированных инструментов. В категории появилось три реальных независимых претендента, хотя в июне не было ни одного с двузначной долей основного использования — это первое свидетельство формирования полноценного уровня оценки в исследуемой сфере.
Finding 5: Производственный мониторинг по-прежнему следит не за тем
Половина компаний отслеживает работоспособность агента, и менее трети — правильность его работы
Мониторинг ИИ-агента в продакшене может решать две совершенно разные задачи. Он может следить за работоспособностью системы — активен ли агент, отвечает ли он, вовремя ли завершается каждый запрос, с какой скоростью, ценой и ошибками. Либо он может проверять корректность ответов агента с помощью автоматизированных проверок контента каждого ответа в реальном времени. Уверенный, но неверный ответ при первом подходе остается незамеченным: запрос выполнен, ответ получен быстро, ошибок нет, а все метрики инфраструктуры выглядят отлично. Мы спросили, для какого типа мониторинга настроены системы в продакшене сегодня.
Группируя системы по тому, за чем именно они следят, мы получаем примерно июньские пропорции: 50% организаций отслеживают только работоспособность агента, в то время как 26% запускают автоматизированные проверки корректности ответов. Если учесть спорадические проверки и тех, кто затруднился с ответом, почти три четверти организаций не проводят автоматизированную оценку правильности результатов в реальном времени в продакшене. Встроенные проверки качества и логирование транзакций делят первое место среди подходов — по 26% при выборке из 106 респондентов, и ни один из подходов не имеет явного перевеса.
Этот вывод сильнее всего противоречит росту уверенности в текущем месяце. Доверие к автоматизированной оценке выросло на восемь пунктов, тогда как техническая способность обнаружить ошибку оценки в рантайме осталась на прежнем уровне. Среди предприятий, уже разрешивших автономное развертывание без человека, лишь 28% запускают встроенные проверки качества для трафика в продакшене. Это означает, что большинство организаций, исключивших человека из процесса принятия решений о релизе, не заменили его ничем, что проверяло бы качество ответов впоследствии. Шлагбаум автоматизирован, а сигнализация не установлена.
Вывод 6: Покупка идет по принципу соответствия, а не цены
Простота интеграции обошла стоимость в качестве главного критерия выбора
Мы спросили, что сильнее всего влияет на выбор вендора систем оценки и что компании считают главным мерилом своего успеха. Один показатель резко изменился, другой остался прежним.
Вывод 6 — Покупка идет по принципу соответствия, а не цены
39%
выбрали вендора прежде всего за простоту интеграции — рост с 27%, теперь это доминирующий фактор
28%
выбрали на основе точности оценки; 23% — на основе стоимости (снижение с 28% и первого места)
38%
называют согласованность оценок главной метрикой успеха — показатель лидирует без изменений
20%
измеряют успех сокращением сбоев или регрессий; 18% — скоростью экспериментов
Простота интеграции подскочила на 12 пунктов (до 39%) и вытеснила стоимость в качестве ключевого критерия выбора, продемонстрировав самый четкий сдвиг в структуре закупок. Точность оценки скромно выросла до 28%, стоимость упала до 23%, а широта наблюдаемости (6%) и дорожная карта вендора (2%) остаются маргинальными факторами. В сопоставлении с Выводом 4 эти два тренда связаны: предприятия, внедряющие свои первые инструменты оценки, оптимизируют процессы под то, что удастся бесшовно встроить в существующий пайплайн в текущем квартале, а не под то, что абстрактно дешевле или мощнее. Именно так выглядит рынок, который перестал выбирать и перешел к установке.
При этом требования к инструменту после его установки не изменились. Согласованность оценок остается главной метрикой успеха (38%, практически идентично июньским 36%), значительно опережая сокращение сбоев (20%), скорость экспериментов (18%), видимость в продакшене (16%) и соответствие нормативам (7%). Приоритетом по-прежнему остается повторяемость — получение одинакового вердикта на одинаковое поведение системы каждый раз. Это примечательно, учитывая, что предвзятость и непоследовательность сейчас названы главными ограничениями доверия в Выводе 2. Предприятия покупают инструменты ради интеграции, а оценивают по стабильности, пока не получая последней. Удовлетворенность текущими инструментами остается умеренной, в среднем составляя 3,9 балла по пятибалльной шкале (по сумме общей удовлетворенности, простоты внедрения и соотношения цены и качества), почти не изменившись с июньских 3,8.
Вывод 7: Проверка человеком становится главной статьей расходов
И предприятия, которые уже обжигались, инвестируют в это больше всего
Мы спросили, инвестиции в какие аспекты надежности и оценки будут расти быстрее всего в следующем году. Рабочие процессы проверки человеком вышли на первое место.
Вывод 7 — Проверка человеком становится главной статьей расходов
31%
называют процессы проверки человеком главной областью для роста — подъем со второго места в июне
30%
называют инструменты производственной наблюдаемости
19%
называют автоматизированные пайплайны оценки
16%
называют оценку безопасности и политик; лишь 6% говорят, что их бюджет не увеличивается
Рабочие процессы ручной проверки (31%) и продакшен-наблюдаемость (30%) поменялись местами на вершине рейтинга — это изменение достаточно мало, чтобы быть шумом само по себе, но лежащая в его основе тенденция была замечена еще в июне и теперь усилилась. Предприятия планируют наращивать расходы на человеческих ревьюеров быстрее, чем на автоматизированные пайплайны оценки (19%), которые призваны их заменить — и это в тот момент, когда две трети компаний исключают человека из процессов релизов. Лишь 6% сообщают о заморозке бюджетов (снижение с 8%).
Перекрестные таблицы делают эту стратегию страховки очевидной. Среди предприятий, которые выпустили прошедшего тесты агента, допустившего сбой у клиента, 38% называют ручную проверку главным направлением инвестиций; среди тех, у кого таких сбоев не было, этот показатель составляет 24%, и они предпочитают инвестировать в инструменты наблюдаемости. Таким образом, «обжегшаяся» когорта делает две вещи одновременно: она наиболее агрессивна в вопросах автономии (85% на пути исключения человека, согласно Выводу 3) и наиболее предана финансированию человеческих проверок. Это не столько противоречие, сколько стратегия — автоматизировать принятие решения о релизе и платить людям за то, чтобы они отлавливали то, что упускает автоматика. Насколько масштабируема эта модель — открытый вопрос, поскольку ручная проверка — это единственный элемент стека, стоимость которого не снижается по мере роста объемов агентов.
Вывод 8: Волна смены платформ остывает
Доля тех, кто не планирует изменений, выросла с трети почти до половины
Мы спросили, планируют ли предприятия внедрять новую, дополнительную или замещающую платформу оценки и какие варианты они рассматривают. Покупателей на рынке стало меньше, чем в прошлом месяце.
Вывод 8 — Волна смены платформ остывает
44%
не планируют никаких изменений — рост с 36% в июне
24%
планируют внедрение или смену в ближайшие 0–3 месяца (снижение с 31%)
19%
планируют изменения в течение 3–6 месяцев
12%
планируют изменения в течение 6–12 месяцев
Большинство (56%) по-прежнему намерены внедрить новую, дополнительную или замещающую платформу в течение двенадцати месяцев, но этот показатель снизился с 64%, а краткосрочная когорта сократилась с 31% до 24%. Доля тех, кто решил не менять ничего, выросла с 36% до 44%. Ни одно из этих изменений само по себе не преодолевает порог статистической значимости, но оба указывают в одном направлении, полностью согласуясь с Выводом 4: по мере того как предприятия реально приобретают инструменты, число тех, кто продолжает их искать, сокращается.
Список рассматриваемых вариантов также изменился. Среди 60 предприятий, планирующих изменения, лидируют встроенные оценки OpenAI (20%), за которыми следуют Braintrust (18%), Weights & Biases Weave (12%) и DeepEval (10%), при этом еще 10% активно выбирают инструменты, но еще не сформировали шорт-лист. В июне DeepEval возглавляла этот список с показателем 20%; с тех пор компания конвертировала значительную часть этого интереса в реальное использование — именно так выглядит переход от стадии рассмотрения к внедрению. Теперь позицию DeepEval занял Braintrust (высокий интерес при меньшей текущей базе установленных систем), и это вендор, за которым стоит понаблюдать в следующей волне.
Итоги: Уверенность выросла, правильность — нет
В июне исследование выявило разрыв между автономией, которую предприятия предоставляли своим агентам, и доверием к системам оценки, призванным их контролировать. В июле этот разрыв сокращается с неправильной стороны. Доверие выросло — полное доверие к автоматизированной оценке увеличилось почти втрое, а число жалоб на то, что тесты не отражают реальность, снизилось на десять пунктов, — в то время как показатель, который это доверие должно отражать, остался абсолютно неизменным. Чуть менее половины предприятий по-прежнему выпускают агентов, которые проходят тесты, а затем подводят пользователей, ровно так же, как и в прошлом месяце.
Перекрестные таблицы точно указывают источник новой уверенности, и это не системы оценки. Двадцать четыре процента предприятий, никогда не сталкивавшихся со сбоями из-за ложной уверенности, полностью доверяют автоматизированной оценке; среди тех, кто с ними сталкивался, этот показатель составляет всего 4%. Доверие на этом рынке является функцией опыта взаимодействия, а не доказательств. И этот опыт не порождает осторожности: «обжегшаяся» когорта демонстрирует самую высокую степень автономии в выборке — 85% уже запускают системы без участия человека или движутся к этому. Вместо осторожности формируется стратегия страховки: те же самые организации активнее всего финансируют ручную проверку (38%), одновременно убирая людей из контура принятия релизов.
Рынок вендоров — это подлинно обнадеживающая история месяца. Доля компаний, не использующих специализированные инструменты, сократилась с 17% до 12%, специализированные платформы впервые за историю серии завоевали реальную долю рынка, покупатели переориентировались с цены на удобство интеграции, а волна смены платформ остыла по мере завершения первичных внедрений. Уровень оценки наконец-то начинает формироваться. Однако ситуация в рантайме за этим не поспевает: половина предприятий по-прежнему отслеживает лишь то, работает ли агент, а среди тех, кто уже развертывает системы без участия человека, лишь 28% запускают проверки качества ответов в реальном времени.
При выборке в 108 респондентов из сегмента среднего бизнеса, сформированной на основе самоотбора, и с учетом изменения отраслевого состава между волнами, этот отчет следует рассматривать как указатель тенденций. Тем не менее, направление движения очевидно: предприятия закупают инструменты, выбирают решения по критерию удобства и обретают все большую уверенность — и ничто из этого пока не повлияло на то, как часто успешный результат тестирования оказывается ложным. Главный вопрос, оставшийся после июньского отчета — догонит ли надежность уровень автономии — теперь звучит иначе. Июльский ответ заключается в том, что уверенность опередила всех, и это куда более сложная проблема, поскольку предприятие, доверяющее сломанному шлагбауму, имеет гораздо меньше причин его чинить, чем то, которое знает о поломке.
В данном отчете представлена июльская волна 2026 года в рамках продолжающейся серии лонгитюдных исследований надежности и оценки корпоративных ИИ-агентов на основе 108 квалифицированных респондентов из организаций со штатом от 100 сотрудников. Проведено сравнение с результатами июньской волны 2026 года (n=157), полученными с использованием идентичного инструментария. При данном размере выборки результаты следует рассматривать как ориентировочный сигнал, а не как точное измерение — выборка сформирована методом самоотбора и не является вероятностной. Респонденты включают лиц, принимающих ключевые решения, технологических экспертов и влиятельных лиц, а также конечных бизнес-пользователей из различных отраслей и компаний различного масштаба с преобладанием среднего бизнеса.

