Обладая точностью 91%, агентская память с открытым исходным кодом Hindsight обеспечивает идеальное видение для ИИ-агентов, застрявших на сбоях RAG

Обладая точностью 91%, агентская память с открытым исходным кодом Hindsight обеспечивает идеальное видение для ИИ-агентов, застрявших на сбоях RAG

В 2025 году становится все более очевидным, что генерация с дополненной выборкой (RAG) уже недостаточна для удовлетворения растущих требований к данным в сфере агентного ИИ.

RAG появился за последние пару лет и стал стандартным подходом для подключения языковых моделей (LLM) к внешним источникам знаний. Эта схема проста: документы разбивают на фрагменты, преобразуют в векторные представления, сохраняют в базе данных и при поступлении запроса извлекают наиболее похожие отрывки. Это неплохо работает для разовых вопросов по статичным документам. Однако архитектура дает сбой, когда ИИ-агентам необходимо работать в рамках нескольких сеансов, поддерживать контекст с течением времени или отличать то, что они наблюдали, от того, во что они верят.

Новая архитектура памяти с открытым исходным кодом под названием Hindsight решает эту задачу, организуя память ИИ-агента в четыре отдельные сети, которые различают факты об окружающем мире, опыт агента, синтезированные сводки об объектах и эволюционирующие убеждения. Эта система, разработанная компанией Vectorize.io в сотрудничестве с Технологическим институтом Вирджинии и изданием The Washington Post, достигла точности 91,4% на бенчмарке LongMemEval, превзойдя существующие системы памяти.

«RAG находится на искусственной поддержке жизнеобеспечения, и память агентов вот-вот окончательно погубит его», — заявил Крис Латимер, соучредитель и генеральный директор Vectorize.io, в эксклюзивном интервью VentureBeat. «Большая часть существующей инфраструктуры RAG, развернутой людьми, не работает на том уровне, которого они хотели бы».

Почему RAG не справляется с долгосрочной памятью агентов

RAG изначально разрабатывался как подход, позволяющий LLM получать доступ к информации за пределами их обучающих данных без необходимости переобучения модели. 

Главная проблема заключается в том, что RAG обрабатывает всю извлекаемую информацию одинаково. Факт, зафиксированный шесть месяцев назад, обрабатывается точно так же, как и мнение, сформированное вчера. Информация, противоречащая более ранним заявлениям, соседствует с первоначальными утверждениями без какого-либо механизма их согласования. У системы нет способа выразить неопределенность, отследить эволюцию убеждений или понять, почему она пришла к тому или иному выводу.

Эта проблема становится особенно острой в многосессионных диалогах. Когда агенту необходимо вспомнить детали из сотен тысяч токенов, распределенных по дюжинам сеансов, системы RAG либо переполняют контекстное окно нерелевантной информацией, либо полностью упускают критически важные детали. Одно лишь векторное сходство не может определить, что именно важно для конкретного запроса, если этот запрос требует понимания временных связей, причинно-следственных цепочек или специфического для объектов контекста, накопленного за недели.

«Если вы используете универсальный подход к памяти, вы либо носите с собой слишком много контекста, который не должны носить, либо носите слишком мало контекста», — рассказал VentureBeat Нарен Рамакришнан, профессор информатики в Технологическом институте Вирджинии и директор Центра ИИ и анализа данных Сангани.  

Переход от RAG к агентной памяти с помощью Hindsight

Переход от RAG к агентной памяти представляет собой фундаментальное архитектурное изменение.

Вместо того чтобы рассматривать память как внешний уровень извлечения, который «сбрасывает» текстовые фрагменты в промпты, Hindsight интегрирует память в качестве структурированной первоклассной основы для рассуждений. 

Ключевая инновация в Hindsight заключается в разделении знаний на четыре логические сети. Сеть мира хранит объективные факты о внешней среде. Сеть банка данных фиксирует собственный опыт и действия агента, записанные от первого лица. Сеть мнений содержит субъективные суждения с оценками достоверности, которые обновляются по мере поступления новых свидетельств. Сеть наблюдений хранит нейтральные к предпочтениям сводки об объектах, синтезированные на основе лежащих в их основе фактов.

Это разделение решает проблему, которую исследователи называют «эпистемической ясностью», за счет структурного разграничения доказательств и выводов. Когда агент формирует мнение, это убеждение сохраняется отдельно от поддерживающих его фактов вместе с оценкой достоверности. По мере поступления новой информации система может укреплять или ослаблять существующие мнения, а не относиться ко всей сохраненной информации как к одинаково достоверной.

Архитектура состоит из двух компонентов, имитирующих работу человеческой памяти.

TEMPR (Temporal Entity Memory Priming Retrieval) управляет хранением и извлечением памяти, выполняя четыре параллельных поиска: семантическое векторное сходство, поиск по ключевым словам с помощью BM25, обход графов через общие сущности и временную фильтрацию для запросов с ограничением по времени. Система объединяет результаты с использованием алгоритма Reciprocal Rank Fusion (слияние обратных рангов) и применяет нейронный реранкер для достижения окончательной точности.

CARA (Coherent Adaptive Reasoning Agents) управляет рефлексией с учетом предпочтений, интегрируя настраиваемые параметры склонностей в процесс рассуждения: скептицизм, буквальность и эмпатию. Это решает проблему несогласованности рассуждений в разных сеансах. Без учета предпочтений агенты выдают локально правдоподобные, но глобально несогласованные ответы, поскольку у лежащей в их основе LLM нет стабильной перспективы.

Hindsight достигает наивысшего балла в LongMemEval — 91%

Hindsight — это не просто теоретическое академическое исследование; технология с открытым исходным кодом была протестирована на бенчмарке LongMemEval. Тест оценивает агентов на основе диалогов объемом до 1,5 миллиона токенов, распределенных по нескольким сеансам, измеряя их способность вспоминать информацию, рассуждать во времени и поддерживать последовательные точки зрения.

Бенчмарк LongMemEval проверяют, способны ли ИИ-агенты справляться с реальными сценариями развертывания. Одной из главных проблем, с которыми сталкиваются предприятия, являются агенты, которые хорошо работают при тестировании, но терпят неудачу в продакшене. Hindsight достигла точности 91,4% в этом бенчмарке, что является наивысшим результатом, когда-либо зафиксированным в ходе этого теста.

Более широкий набор результатов показал, где именно структурированная память дает наибольший прирост: ответы на многосессионные вопросы улучшились с 21,1% до 79,7%; временные рассуждения подскочили с 31,6% до 79,7%; а вопросы на обновление знаний улучшились с 60,3% до 84,6%.

«Это означает, что ваши агенты смогут выполнять больше задач, более точно и последовательно, чем раньше», — отметил Латимер. «Это позволяет вам получить более точного агента, способного справляться с более критически важными для бизнеса процессами».

Корпоративное развертывание и интеграция с гиперскейлерами

Для компаний, планирующих развертывание Hindsight, путь реализации выглядит довольно простым. Система работает как единый контейнер Docker и интегрируется с помощью обертки LLM, которая совместима с любой языковой моделью. 

«Это замена ваших API-вызовов по принципу «plug-and-play», и вы сразу начинаете наполнять память», — пояснил Латимер.

Технология ориентирована на компании, которые уже развернули инфраструктуру RAG, но не видят необходимой производительности.

«Большая часть существующей инфраструктуры RAG, развернутой людьми, не работает на том уровне, которого они хотели бы, и они ищут более надежные решения для решения проблем компаний, которые обычно заключаются в неспособности извлечь нужную информацию для выполнения задачи или ответа на набор вопросов», — сказал Латимер.

Vectorize сотрудничает с гиперскейлерами для интеграции технологии в облачные платформы. Компания активно партнерствует с облачными провайдерами, чтобы наделить их LLM возможностями агентной памяти. 

Что это значит для бизнеса

Для компаний, возглавляющих процесс внедрения ИИ, Hindsight открывает путь за пределы ограничений текущих внедрений RAG. 

Организации, которые инвестировали в генерацию с дополненной выборкой и сталкиваются с нестабильной производительностью агентов, должны оценить, сможет ли структурированная память решить их специфические проблемы. Эта технология особенно хорошо подходит для приложений, где агентам необходимо поддерживать контекст в ходе нескольких сеансов, обрабатывать противоречивую информацию с течением времени или объяснять свои рассуждения.

«RAG мертв, и я думаю, что именно агентная память погубит его окончательно», — заявил Латимер.

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.