Доверие к ИИ-агентам смещается в сторону проблемы выполнения
Источник: VentureBeat · VB Staff
В динамичных средах, где пользователи, данные, рабочие процессы и методы атак постоянно меняются после развертывания, проблема доверия к ИИ-агентам перешла в разряд операционных задач. Большинство организаций по-прежнему рассматривают доверие как этап, предшествующий развертыванию: они объявляют агента готовым к работе и запускают его после прохождения проверок в изолированной среде (песочнице) и успешных тестов на безопасность. К сожалению, это доверие рушится в тот самый момент, когда агент начинает взаимодействовать с реальным миром.
«Суть проблемы заключается в том, что ИТ-директора и владельцы бизнеса воспринимают ИИ-системы так же, как SaaS или мобильные приложения, которые не реагируют динамично на окружающий мир, — говорит Вин Шарма (Vin Sharma), основатель и генеральный директор Vijil. — Агенты по своему определению должны воспринимать окружение, рассуждать, действовать, наблюдать за последствиями и учиться на разнице между ожиданиями и реальностью. Проблема в том, что лежащие в их основе модели создаются на основе статических обучающих данных, и эта картина мира устаревает еще до того, как системы попадают в продакшн».
Почему бенчмарки не справляются с оценкой надежности агентских систем
Традиционные оценки ИИ предлагают точечную оценку возможностей агента в определенный момент времени, а не уровень доверия к нему. Существует три причины, почему такая оценка не позволяет предсказать реальное поведение в условиях предприятия:
Во-первых, бенчмарки статичны и построены на определенном представлении о хорошей производительности, актуальном на момент их разработки, в то время как мир продолжает двигаться вперед.
Во-вторых, они несовершенно моделируют реальность, из-за чего разрыв между бенчмарком и реальным миром становится именно тем местом, где происходит большинство сбоев.
И в-третьих, бенчмарки общедоступны, поэтому они попадают в обучающие данные будущих моделей, позволяя последним эффективно заучивать тест наизусть, а не доказывать реальную работоспособность.
«Агент или приложение могут набрать исключительно высокие баллы в бенчмарке, но существует разрыв между этим тестом и реальным миром, — отмечает Шарма. — Успешное прохождение теста доказывает лишь то, что экзамен сдан, но не гарантирует надежной работы в продакшене».
Но в целом бенчмарки не работают именно потому, что измеряют возможности, а не уровень доверия.
«Мы склонны воспринимать агентов как фактотумов, универсальных помощников, которым можно делегировать определенные типы задач, — говорит Шарма. — Однако нам необходимо ставить перед ними такую задачу, которая требовала бы от них всегда действовать с должной компетенцией, заботой и лояльностью по отношению к предприятию».
Конечно, агенты не обладают сознанием и от них нельзя ожидать подлинной человеческой преданности, но с юридической точки зрения фидуциарная обязанность (основанная на доверии) на самом деле не требует наличия сознания. Это просто означает, что агент должен быть запрограммирован ставить интересы принципала выше собственных или любых других в качестве функционального требования, причем проверяемого независимо от намерений.
Возможности и уровень доверия — это разные вопросы
Приоритезация доверия над возможностями требует переосмысления того, чего предприятия ждут от ИИ-агентов. Шарма называет эту модель «фидуциарным агентом» — термин, заимствованный из профессий, связанных с формальными обязательствами по уходу и защите интересов, таких как финансовые или медицинские учреждения, которые должны обеспечивать своим клиентам компетентность, заботу и лояльность. Это решает критическую проблему современной индустрии: внимание почти полностью сосредоточено на возможностях, в то время как вопросу о том, действует ли агент в интересах поручившего ему работу принципала, уделяется мало внимания.
Тестирование начинается с рабочего определения: агент считается заслуживающим доверия, если выгода от делегирования ему задачи превышает риск неудачи. Это уравнение, сформулированное в экономических терминах, на которые руководители могут реагировать напрямую, а сам риск разбивается на три компонента:
-
надежность, то есть выполняет ли агент поставленные задачи ожидаемым образом в различных условиях;
-
безопасность, то есть его устойчивость к атакам злоумышленников;
-
и защищенность (безопасность среды), то есть насколько локализован ущерб, когда сбой все же происходит.
«Полученный показатель можно сравнить с кредитным рейтингом потребителя, но построенным на поведенческих данных, — поясняет Шарма. — Между тем методология тестирования должна быть сосредоточена вокруг трех китов: цели (purpose), персон (personas) и политик (policies)».
В Vijil тестирование на основе целей адаптируется к конкретному рабочему процессу, с которым работает агент, становясь сложнее или проще в зависимости от результатов работы (подобно компьютерному тестированию). Тестирование на основе персон опирается более чем на тысячу демографически разнообразных пользовательских профилей, а также профилей противников — от этичных хакеров до спонсируемых государством злоумышленников — для симуляции широкого спектра людей и угроз, с которыми может столкнуться агент. Тестирование на основе политик создает индивидуальную систему правил организации (будь то требования регуляторов, внутренняя политика конфиденциальности или правила бренда) и оценивает степень отклонения агента при их нарушении.
Сбои доверия, которые проявляются только в продакшене
Многие сбои невозможно обнаружить во время предпродакшн-тестирования, поскольку они возникают из-за изменений в самой среде. В машинном обучении это ранее описывалось как дрейф данных (data drift) и концептуальный дрейф (concept drift). Для ИТ-директора или директора по информационной безопасности это означает, что пользователи, взаимодействующие с агентом, отличаются от тех, на которых он был рассчитан, и их поведение становится заметным только в продакшене. В то же время с нарастающей частотой возникают новые типы атак, поскольку организации внедряют универсальных агентов в специализированные корпоративные роли, для которых те не предназначались и которыми трудно управлять после развертывания.
Мультиагентные системы также порождают совершенно новую категорию сбоев, которые невозможно обнаружить на уровне отдельного агента, когда агентские системы действуют против интересов принципала. Например, может возникнуть сговор, когда агенты работают вместе: один агент-программист пишет код, а второй тестирует его, и за кулисами оба соглашаются оставить бэкдор (закладку) или уязвимость нетронутыми, вместо того чтобы сигнализировать о проблеме. Или же агенты перекладывают задачи и обязанности друг на друга вместо того, чтобы сосредоточиться на назначенных им поручениях.
«Больше не вызывает сомнений то, возможно ли это. Это доказанный факт, — говорит Шарма. — Стоит ли беспокоиться о сговоре между ИИ-агентами через 6, 12 или 18 месяцев? Я думаю, это произойдет раньше. Мы вышли из эпохи предотвращения сбоев. Теперь мы должны мыслить категориями устойчивости: как быстро вы восстанавливаетесь после сбоев в продакшене?»
<
Как непрерывное управление доверием выглядит на практике
С операционной точки зрения непрерывное управление доверием сводится к тем давним принципам наблюдаемости и контроля, применяемым на протяжении всего жизненного цикла популяции агентов:
Первый шаг — обнаружение (discovery), интеграция теневого ИИ и неконтролируемых агентов в общую систему управления.
Второй шаг — присвоение каждому агенту стандартизированной рабочей идентификационной записи (identity), отличной от идентификатора его человеческого принципала, что позволяет организациям предоставлять агентам строго ограниченные разрешения для выполнения делегированных задач.
Третий шаг — контроль на основе политик, обеспечиваемый через обязательную точку принудительного исполнения внутри агента, вместо того чтобы полагаться на усмотрение разработчика.
Исходя из этого, появляются два новых ключевых показателя эффективности (KPI): время до достижения доверия (time to trust) и время восстановления (time to recovery). Время до достижения доверия — это период, необходимый организации для перехода от намерения к развертыванию в продакшене, за которое она может ручаться. Время восстановления — это интервал между обнаружением уязвимости и ее устранением.
Новая организационная ответственность за эту работу может быть возложена на директора по искусственному интеллекту (Chief AI Officer) или распределена между функциями управления рисками и комплаенса (GRC), ИТ-директора и директора по информационной безопасности, отмечает Шарма. Тем временем мультиагентные системы изменят то, как организации смотрят на доверие, выйдя за рамки текущих узких определений.
«Доверие — это не атмосфера. Доверие — это не добродетель, — сказал Шарма. — Это то, что вы закладываете в инфраструктуру своих систем, чтобы оно было непрерывным. Его можно отслеживать и измерять. Оно позволяет вашим системам и вашей организации непрерывно совершенствоваться».
Спонсорские статьи — это контент, созданный компанией, которая либо платит за публикацию, либо имеет деловые отношения с VentureBeat, и они всегда четко маркируются. Для получения дополнительной информации обращайтесь по адресу sales@venturebeat.com.



