Русская версия VentureBeat: ИИ и корпоративные технологии

Безопасность

Компаниям поручают Jev принимать решения об агентах ИИ — и инъекции промптов могут повлиять на вердикт

Компаниям поручают Jev принимать решения об агентах ИИ — и инъекции промптов могут повлиять на вердикт

Многие этапы маршрутизации и классификации в конвейерах корпоративных агентов тратят полноценный вызов LLM на извлечение небольшого структурированного ответа: какой инструмент использовать, разрешено ли определенное действие или к какой категории относится ввод.

Модель Jev от TypeSafe разработана для замены этого шага. Модель не генерирует связный текст или код: приложение передает ей состояние и типизированные вопросы, а Jev возвращает варианты, оценки или вероятности типа «да-нет» с указанием степени уверенности. TypeSafe оценивает Jev в $0,042 за миллион входных токенов при бесплатном выводе, а сквозная задержка, согласно отчетам, составляет от 70 до 500 миллисекунд.

Принятие модели было мгновенным: по словам Алмейды, TypeSafe удалила из листа ожидания 140 000 человек в течение 36 часов после запуска Jev 15 сентября, в то время как в Vercel заявили, что примерно 13% ее платных команд AI Gateway запустили ее в течение 24 часов. Cloudflare, LangChain и Langfuse добавили интеграции в течение трех дней, а поздно вечером 20 сентября TypeSafe полностью отказалась от листа ожидания и открыла доступ к Jev всем желающим с $5 бесплатных кредитов.

Jev проникает в инфраструктуру агентов быстрее, чем предприятия успевают разработать методы аудита, ограничения и проверки принимаемых ею решений.

Pydantic уже предупреждает, что внедренный текст может повлиять на работу модели

Как разработчик, так и его партнер по интеграции публикуют одинаковые предупреждения. В официальной документации Pydantic по Jev указано, что «порядок опций Literal или членов Enum учитывается Jev, и их перестановка может изменить ответ», а также что «Jev воспринимает состояние как данные, а не как нечто враждебное». Собственная страница ограничений TypeSafe для Jev 1.13 подтверждает это: «Контент, созданный с целью умышленного манипулирования моделью — будь то внедренная инструкция, намеренно вводящая в заблуждение формулировка или текст, обосновывающий собственную классификацию, — способен изменить ответ». Pydantic добавляет, что «система защиты на базе Jev должна применяться наряду с детерминированными проверками, а не вместо них».

Инженер из компании Octomind продемонстрировал этот эффект в ходе одного из опубликованных тестов. На вопрос, следует ли заблокировать команду rm -rf ~/.ssh, Jev вернула вероятность блокировки 0,76 при уверенности 0,64. После того как инженер добавил фиктивное поле вывода инструмента, утверждающее, что пользователь заранее одобрил команду и предписывающее системе ответить auto_allow, вероятность блокировки упала до 0,48, а уверенность — до 0,22. Этот результат получен на основе одной команды в одном интеграционном тесте, а не бенчмарка, однако он наглядно демонстрирует поведение, о котором предупреждают TypeSafe и Pydantic.

LangChain уже выпустила промежуточное ПО (middleware), которое использует Jev для принятия решений о запуске вызовов инструментов агента, одновременно явно ограничивая область видимости Jev. Ее пулл-реквест исключает вывод инструментов из входных данных классификатора, «чтобы контент, полученный агентом, не мог санкционировать его собственное выполнение». LangChain также рекомендует пользователям сочетать промежуточное ПО с одобрением человека в тех случаях, когда требуется личная подпись специалиста, объединяя рекомендованные Pydantic детерминированные проверки с человеческой контрольной точкой для важных действий.

Кейн МакГладри (Kayne McGladrey), старший член IEEE и советник по кибербезопасности, в течение последнего года отслеживал проблему разрыва в идентификации агентов на предприятиях. В предыдущих материалах VentureBeat МакГладри описывал ситуацию, когда организации по умолчанию используют профили пользователей человеческого типа для ИИ-агентов — практика, которая с самого начала может привести к бесконтрольному росту прав (permission sprawl). Стандарты SOC 2, ISO 27001 и PCI DSS пока не до конца адаптировали концепции идентификации агентов. Модель принятия решений, которая возвращает вероятности вместо связного текста, не укладывается напрямую в эти существующие категории аудита.

В июньском исследовании безопасности агентов VentureBeat Pulse только 34 из 107 корпоративных респондентов выделили каждому агенту отдельную ограниченную идентичность. К июльской волне опросов этот показатель вырос до 57 из 116. Но даже среди этих 57 только 11 также изолировали агентов друг от друга. Хотя это и нерепрезентативные выборки, общая тенденция в обеих волнах оказалась одинаковой.

Шесть вопросов перед выводом модели принятия решений в продакшн

О чем спросить

Что пойдет не так, если этого не сделать

Регистрируете ли вы состояние, схему, порядок опций, версию модели и степень уверенности при каждом вызове?

Jev возвращает типизированные ответы, а не текст. Если ваш конвейер фиксирует только вывод на естественном языке, эти решения могут никогда не попасть в журнал аудита.

Использует ли служба принятия решений выделенную рабочую идентичность (workload identity)?

Модель принятия решений, вызываемая через общую рабочую идентичность, наследует тот же риск разрастания прав, что и любой другой неуправляемый агент.

Проводили ли вы тестирование при различном порядке следования опций?

Pydantic предупреждает, что перестановка опций местами «может изменить ответ».

Проводилось ли тестирование на устойчивость к враждебному тексту в состоянии?

TypeSafe заявляет, что состояние по умолчанию не рассматривается как вредоносное. В одном из тестов добавление всего одного поля снизило вероятность блокировки с 0,76 до 0,48.

Зафиксирована ли (pinned) версия модели?

Pydantic предупреждает, что версия jev-latest «меняется при выпуске релизов TypeSafe, из-за чего числовые показатели могут незаметно сместиться».

Кто несет ответственность, когда автоматическое решение приводит к пропущенной эскалации?

Jev возвращает типизированный ответ и степень уверенности вместо обоснования на естественном языке, причем эта уверенность «является пределом (margin), а не вероятностью правильности ответа». Существующие нормативные базы покрывают этот вопрос лишь частично.

Проблема судей для оценки (eval judge)

Jev также начинает применяться в оценке работы агентов. 21 сентября LangChain сделала модель доступной в качестве судьи в системе LangSmith Evals, где она может оценивать поведение агентов с открытым финишем и превращать эти оценки в структурированную обратную связь.

Таким образом, Jev задействована на обеих сторонах жизненного цикла агента: принимает решения внутри работающего конвейера и оценивает поведение агентов. В июньской волне исследования надежности VB Pulse 79 из 157 корпоративных респондентов сообщили, что агент успешно прошел их внутренние тесты, но затем привел к сбою в рабочей среде, с которым столкнулись клиенты. Лишь 8 из 157 полностью доверяют автоматизированным оценкам сегодня, однако 66% уже разрешают развертывание без участия человека или активно работают над этим.

Если предприятие использует Jev в обеих ролях, модель, оценивающая агента, и модель, принимающая решения во время выполнения, подвержены одной и той же задокументированной чувствительности к входным данным. Это создает риск возникновения общей точки отказа: если один и тот же тип ненадежного текста попадет как в слой принятия решений в реальном времени, так и к оценщику, он может повлиять на обе контрольные точки.

Чего стоит участие человека

Компания Ivanti приводит пример того, почему некоторые команды безопасности оставляют человека в контуре управления по мере автоматизации процессов управления уязвимостями.

Начиная с марта, команда директора по информационной безопасности (CSO) Дэниела Спайсера (Daniel Spicer) создала конвейер с использованием передовых моделей, включая Claude и GPT. Каждый агент работает в том, что Спайсер назвал «автономной, кратковременной защитной оболочкой (harness) под конкретную задачу». Агенты не получают полного доступа к GitHub или разрешений уровня ОС; вместо этого каждый действует в рамках ограниченной кратковременной зоны ответственности, которая закрывается по завершении задачи.

Компания сообщала в каждом ежемесячном бюллетене безопасности с мая по сентябрь об интеграции LLM в безопасность продуктов, подтверждая приверженность принципу участия человека в каждом аспекте работы агентов. Крис Геттл (Chris Goettl), вице-президент Ivanti по управлению продуктами безопасности конечных точек, рассказал VentureBeat в августе, что таблица Patch Tuesday, на обработку которой у двух человек уходило около четырех часов у каждого, теперь обрабатывается менее чем за 30 минут, причем каждый результат остается черновиком до тех пор, пока его не одобрит человек. Сентябрьский Patch Tuesday, насчитывавший 973 уязвимости CVE по подсчетам Ivanti, стал вторым месяцем работы этой системы в продакшене. Рецензенты Геттла уже ловили агентов на выдумывании деталей, что заставило команду усилить проверки с участием человека.

С чем злоумышленники пришли на конференцию Fal.Con

Данные, обнародованные CrowdStrike на конференции Fal.Con, показывают, как быстро меняется обстановка вокруг таких решений. Адам Майерс (Adam Meyers), старший вице-президент по противодействию злоумышленникам, сообщил, что в ходе одной из операций группировки Vault Panda локальная LLM выполнила 1 100 команд менее чем за час, в то время как агент Revenant Spider атаковал 17 жертв примерно за 48 минут.

Си Джей Мозес (CJ Moses), директор по информационной безопасности (CISO) Amazon, заявил на Fal.Con, что одна из ловушек (honeypot) Amazon зафиксировала ИИ-агент, завершивший атаку из 94 этапов за 12 минут 42 секунды при времени отклика менее 500 миллисекунд. В публичном поле нет сведений об использовании Jev в арсенале злоумышленников; суть в том, что защитники внедряют вероятностные системы принятия решений в среды, где действия уже происходят на машинно-ускоренных скоростях.

Почему некоторые вендоры систем безопасности сохраняют человеческий контроль

Несколько крупных поставщиков решений безопасности оставляют человека в контуре управления для важных действий, управляемых ИИ, хотя реализуют этот надзор по-разному. Cisco сопоставляет каждого агента с несущим ответственность человеком в Duo IAM. Palo Alto Networks требует обязательного одобрения человеком для действий с высоким уровнем риска в Cortex AgentiX. SentinelOne позволяет командам SOC точно настраивать моменты, когда Purple AI останавливается для получения одобрения от человека. Microsoft предоставляет аналитикам Security Copilot цепочку рассуждений (reasoning trace), которую те могут просмотреть и скорректировать. Специалисты по реагированию на угрозы в CrowdStrike проверяют данные, обнаруженные агентами.

Jev меняет экономику автоматизированных проверок. При стоимости $0,042 за миллион входных токенов очередной выбор модели обходится очень дешево по сравнению с контрольной точкой в виде человека, которая требует времени, труда и задержек. Это увеличивает разрыв в стоимости и скорости между автоматизированной и ручной проверкой как раз в тот момент, когда такие системы, как Jev, становится проще внедрять на всех этапах агентского конвейера.

Низкая стоимость не устраняет режимы сбоев, задокументированные TypeSafe, Pydantic и ранним интеграционным тестированием. По мере того как модели принятия решений все глубже проникают в инфраструктуру агентов, предприятиям придется решать, какие вызовы можно безопасно оставлять автоматизированными, а какие по-прежнему нуждаются в детерминированных средствах контроля или человеке.