Слои контекста ИИ обнажают новые сбои у агентов
Источник: VentureBeat · Sean Michael Kerner
Компания создает специализированный управляемый слой контекста исключительно для того, чтобы ее ИИ-агенты не выдавали ошибочные ответы с полной уверенностью в своей правоте. Как только этот слой запускается в работу, вероятность того, что компания зафиксирует данный сбой, возрастает более чем в два раза, а не уменьшается.
За последние шесть месяцев 68% предприятий сталкивались с тем, что ИИ-агент давал уверенный, но неверный ответ из-за отсутствия или противоречивости бизнес-контекста. 37% заявили, что это происходило неоднократно (превзойдя показатель в 32%, столкнувшихся с этим лишь единожды). Эти данные получены в ходе июльского опроса VB Pulse 2026 года, в котором участвовало 101 квалифицированное предприятие с штатом более 100 сотрудников. Это выше показателя в 57% по результатам опроса VB Pulse, проведенного в июне. Повторяющиеся сбои также выросли — с 31% тогда до 37% сейчас.
VB Pulse задает предприятиям этот конкретный вопрос уже второй раз: первый раз в июне, а теперь в июле. Частота сбоев растет, а не падает, даже несмотря на то, что все больше предприятий сообщают о наличии управляемого слоя в продакшене — их доля увеличилась с 25% в июне до 32% в настоящий момент.
То, как агенты получают контекст, определяет, ошибаются ли они
Каждому ИИ-агенту необходим способ понимать истинный смысл бизнеса: определена ли метрика единообразно, является ли документ актуальным. В этом и заключается суть работы. Проблема в том, что предприятия передают этот контекст агентам совершенно по-разному, и эти методы обладают далеко не одинаковой надежностью.
Поиск по документам (Retrieval) остается наиболее распространенным методом, будучи основным источником для 31% предприятий. Однако значительная доля компаний полностью отказывается от структурированного подхода. 13% запускают агентов преимущественно за счет загрузки большого объема контекста (long-context loading), передавая документы напрямую в контекстное окно модели вместо их поиска. 5% вообще не предоставляют агентам никакого структурированного контекста, полагаясь исключительно на общие знания модели. В совокупности почти каждое пятое предприятие передает бизнес-контекст агентам грубой силой или не передает вовсе.
Даже передовой подход по-прежнему может приводить к уверенным, но неверным ответам. Поиск работает путем сопоставления вопроса с текстом, который кажется близким по смыслу. Похожая формулировка не гарантирует одинакового значения. Шриджит Раджамохан (Srijith Rajamohan), ведущий исследователь в области ИИ в компании Redis, описывал именно этот разрыв в интервью с VentureBeat ранее в этом году.
«Если у вас есть предложение вроде „Рим ближе, чем Париж“, а другое утверждает, что „Париж ближе, чем Рим“, и вы выполняете векторный поиск (embedding retrieval) с последующим текстовым поиском, вы не сможете найти разницу, — отметил Раджамохан. — В обоих предложениях используются одни и те же слова».
Закупки сместились в сторону контроля доступа. Оценка результатов за ними не последовала.
То, как предприятия выбирают поисковую систему, не помогает сократить этот разрыв. Контроль доступа и права разрешений теперь делят первое место среди критериев отбора с простотой получения данных (по 24% каждый). В этой серии опросов свойство, связанное с управлением (governance), впервые возглавило процесс принятия решений о покупке. Точность поиска отстает с показателем в 15%. Характеристика, которая напрямую связана с уверенным неверным ответом, не является той характеристикой, ради которой большинство предприятий совершает покупку.
После запуска системы предприятия продолжают оценивать ее по степени правильности. Корректность ответов является главным критерием успеха для 38% компаний — это в два раза больше, чем следующий по популярности вариант (безопасность и контроль доступа с 19%). Компании смещают фокус закупок в сторону управления, но успех по-прежнему оценивают по тому, правильный ли получился ответ.
Компании, которые решают эту проблему, сообщают о ней хуже всех
Управляемый слой контекста призван исправить эту ситуацию. Это единая согласованная модель того, что означают данные компании, к которой обращается каждый агент и инструмент бизнес-аналитики (BI), вместо того чтобы строить догадки самостоятельно. О внедрении говорить пока рано.
32% предприятий используют такой слой в продакшене. 31% в настоящее время проводят пилотные испытания или занимаются его созданием. 20% находятся на стадии оценки. 14% не имеют таких планов, а 4% не знают.
Если сопоставить эти данные о внедрении с тем, кто на самом деле сталкивался сбоями, картина меняется на противоположную. Среди 91 предприятия, способного точно сказать, сталкивались ли они с ошибками вообще, компании, использующие или разрабатывающие управляемый слой, сообщают о повторяющихся сбоях в 50% случаев. Среди тех, у кого его нет, этот показатель составляет 21%.
Управляемый слой не вызывает сбой — напротив, именно он делает сбой видимым. Чтобы связать некорректный ответ с нарушенным определением или устаревшей таблицей, нужна общая управляемая точка отсчета. Слой контекста как раз и обеспечивает ее. Без него та же самая ошибка все равно происходит — просто ее списывают на саму модель или вообще не находят.
Эта проблема возникла за десятилетия до появления искусственного интеллекта. Кайл Несбит (Kyle Nesbit), основатель стартапа в области семантического слоя Credible Data, рассказал об этом VentureBeat в прошлом месяце. «Это та же самая боль, с которой люди живут уже 30 лет — отсутствие управляемого анализа данных, — сказал Несбит. — Теперь же, с приходом ИИ, проблема осталась прежней, но хаоса и сложностей стало на порядки больше».
Размер компании подчеркивает ту же тенденцию. Предприятия с численностью персонала более 1000 сотрудников сообщают о повторяющихся сбоях в 55% случаев против 30% у компаний с числом сотрудников от 101 до 1000. И это несмотря на то, что крупные компании реже имеют готовый слой в продакшене (24% против 37%). Больший объем мониторинга и большее количество людей, задающих вопросы о том, почему число оказалось неверным, приводят к выявлению новых сбоев, а не к их сокращению. Безупречная статистика — это вовсе не свидетельство исправности контекстного слоя. С не меньшей вероятностью это указывает на то, что никто ничего не проверяет.
Что это значит для бизнеса
Вот к каким выводам следует прийти предприятиям, выстраивающим работу на базе такого слоя.
Один лишь поиск не закроет пробел в контексте. RAG остается источником контекста по умолчанию, при этом почти каждое пятое предприятие запускает агентов на базе загрузки длинного контекста или вовсе обходится без структурированного контекстного слоя. Большее количество документов или расширенный индекс не исправят определение, которое трактуется по-разному в двух различных системах.
Бюджеты выделяются быстрее, чем поставляется инфраструктура. 63% предприятий уже занимаются созданием или эксплуатацией управляемого слоя контекста. И лишь 32% действительно внедрили его в продакшн. Этот разрыв как раз и отражает статьи расходов, где проблема еще не решена.
Безупречная статистика сбоев — это тревожный знак, а не хороший. 22% предприятий, не зафиксировавших ни единой проблемы с контекстом, отнюдь не являются наиболее благополучными с точки зрения управления. Это группа, которая проверяет все реже остальных. Данные о масштабах бизнеса прямо подтверждают это. Крупные предприятия сообщают о повторяющихся сбоях почти в два раза чаще своих коллег из среднего бизнеса, несмотря на то, что они реже имеют управляемый слой в продакшене, а не наоборот.
Никто не планирует отдавать этот слой единственному провайдеру. 79% предприятий намерены оставить по крайней мере часть контекстного слоя за пределами стека какого-либо одного вендора, разделив его между лучшими в своем классе инструментами (best-of-breed) и четким миксом решений. Лишь 12% планируют консолидироваться на базе нативного контекстного стека одного поставщика.
Тот факт, что организации вряд ли захотят передать контроль единому провайдеру, является темой, которую VentureBeat регулярно освещает в этом году. Майкл Ни (Michael Ni), аналитик Constellation Research, высказался на этот счет без обиняков ранее в этом году, когда DataHub впервые заявила о продвижении своего контекстного слоя.
«Кто контролирует контекст времени выполнения (runtime context), тот контролирует и слой принятия решений на базе ИИ для корпоративных данных», — подчеркнул Ни.



