85% компаний тестируют ИО-агентов, но лишь 5% запускают их в продакшен

85% компаний тестируют ИО-агентов, но лишь 5% запускают их в продакшен

Источник: VentureBeat · Michael Nuñez

У индустрии корпоративного ИИ проблемы с математикой. Данные Cisco показывают, что 85% предприятий занимаются пилотным запуском ИИ-агентов, но лишь 5% внедрили их в продакшен. Во вторник на конференции VB Transform 2026 Брайан Силверторн (Bryan Silverthorn), директор по автономности AGI в Amazon, объяснил, почему этот разрыв сохраняется и почему лучшим решением не являются более совершенные бенчмарки.

Силверторн, который пришел в Amazon после приобретения компании Adept AI и теперь возглавляет направление обучения мультимодальных агентов в лаборатории AGI компании, утверждает, что надежность необходимо разделить на четыре четких измерения: согласованность, устойчивость, предсказуемость и безопасность. Эту концепцию он заимствовал из исследований Принстонского университета.

«Она разделяет различные факторы, которые, как я вижу, переплетены практически в каждом тесте (эвале), с которым мне доводилось сталкиваться», — отметил он.

Почему ИИ-агенты успешно проходят внутренние тесты, но подводят реальных клиентов в продакшене

Эта концепция важна, потому что агенты регулярно с блеском проходят внутренние оценки, а затем терпят крах в реальных условиях. Силверторн описал случай компании-клиента, которая развернула агента для контроля качества ПО, связанного с извлечением серийных номеров с экранов. Система безупречно работала в течение двух месяцев, а затем начала время от времени считывать неверные номера. Виновником оказался базовый визуальный кодер, который вел себя по-разному в зависимости от того, где именно на экране появлялся серийный номер, а незаметное для человека изменение в программном сбое спровоцировало ошибку.

Урок, по словам Силверторна, заключается в методике измерения, а не только в моделях. «Модели должны стать лучше. Очевидно, мы упорно работаем над улучшением моделей», — сказал он. Но главный вывод, добавил он, заключается в том, что командам необходимо выявить параметры своей изменчивости и соотнести строгость измерений со степенью риска при использовании приложения. Собственные проприетарные исследования VentureBeat, представленные перед началом сессии, подкрепляют этот тезис: половина опрошенных компаний внедрили агентов, которые прошли внутреннее тестирование, но подвели реальных клиентов, причем предприятия в подавляющем большинстве отслеживают бесперебойную работу (аптайм), игнорируя точность — проверяя пульс без постановки диагноза. Сопутствующий вывод подчеркивает, как мало защитных механизмов существует на практике: большинство предприятий полагаются по умолчанию исключительно на собственные оценки разработчиков моделей, оставляя свою стратегию тестирования — как я описал это на сцене — на волю подброшенной монеты: доверять ли вендору или не доверять никому.

Внутри «интерн-концепции» Amazon по управлению автономными ИИ-агентами

Самый запоминающийся совет Силверторна носил культурный, а не технический характер. В лаборатории AGI Amazon исследователи буквально называют своих агентов «стажерами» (интернами) — например: «Пусть мой стажер пообщается с вашим стажером». За этой шуткой стоит серьезная операционная философия. Агенты, как и стажеры, мощны, но порой бестолковы, способны выполнять потрясающую работу и в то же время совершать впечатляющие промахи.

Управление ими, по его утверждению, требует управленческих, а не программных навыков: нужно задавать вопросы о том, что может пойти не так, добавлять резервное копирование и функции отмены действий, а также осознанно определять уровень риска, который вы готовы принять. «Вы можете спросить стажера: «Слушай, что ты можешь сделать не так в этой ситуации? Как ты можешь минимизировать свои негативные результаты?»» — сказал он. Лаборатория Amazon приняла этот компромисс, смирившись с тем, что агенты иногда проводят не те эксперименты, в обмен на скорость исследований — включая агента, который круглосуточно проводит эксперименты в рамках собственного высокоуровневого исследовательского плана.

Что следует сделать корпоративным лидерам перед масштабным развертыванием агентов

Силверторн откровенно высказался об ограничениях современных технологий. Самосовершенствующийся ИИ остается «громким термином», отметил он: Amazon использует ИИ для постоянного совершенствования своих моделей, но до полной автономности самосовершенствования еще далеко. Работа за компьютером остается ключевым фокусом его лаборатории (клиент из сферы коммерческих автоперевозок уже использует автоматизацию браузера для формирования претензий по гарантии в разрозненных системах**), хотя он подчеркнул, что ни один будущий агент не будет полагаться исключительно на работу с интерфейсом компьютера — он будет работать в связке с протоколом MCP, API и другими инструментами для выполнения сквозных рабочих процессов**. А методы оценки на базе LLM («LLM как судья»), хотя и перспективны, представляют собой лишь одну из множества стратегий по согласованию возможностей агента с допустимым уровнем риска.

Для предприятий, застрявших в чистилище пилотных проектов, путь вперед начинается со смены мышления: перестаньте спрашивать, может ли ваш агент сделать что-то впечатляющее один раз, и начните спрашивать, сможет ли он делать это правильно тысячу раз подряд.

Другими словами, предприятия, которым удастся преодолеть 85-процентный барьер, будут не теми, у кого самые умные агенты, а теми, у кого лучшие менеджеры.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.