«Наблюдательная память» снижает затраты на ИИ-агентов в 10 раз и превосходит RAG в тестах на длинный контекст

«Наблюдательная память» снижает затраты на ИИ-агентов в 10 раз и превосходит RAG в тестах на длинный контекст

RAG (дополненная генерация) не всегда работает достаточно быстро или умно для современных рабочих процессов автономных ИИ-агентов. По мере перехода команд от недолговечных чат-ботов к долгосрочным агентам, активно использующим инструменты и встроенным в производственные системы, эти ограничения становится всё сложнее обходить.

В ответ на это команды экспериментируют с альтернативными архитектурами памяти — иногда называемыми контекстной памятью или агентной памятью, — которые ставят во главу угла персистентность и стабильность, а не динамический поиск.

Одна из недавних реализаций такого подхода — «наблюдательная память» (observational memory), технология с открытым исходнымходом, разработанная компанией Mastra, основанной инженерами, которые ранее создали и продали фреймворк Gatsby компании Netlify.

В отличие от RAG-систем, которые извлекают контекст динамически, наблюдательная память использует двух фоновых агентов (Наблюдателя и Отражателя) для сжатия истории диалогов в датированный журнал наблюдений. Сжатые наблюдения остаются в контексте, полностью исключая процедуру поиска. Для текстового контента система обеспечивает сжатие в 3–6 раз. Для рабочих нагрузок агентов, активно использующих инструменты и генерирующих большие объемы выводов, коэффициент сжатия достигает 5–40 раз.

Обратной стороной является то, что наблюдательная память ставит на первое место то, что агент уже видел и зафиксировал, а не поиск по более широкому внешнему корпусу данных, что делает ее менее подходящей для открытого поиска знаний или сценариев использования, требующих строгого соблюдения нормативов при обращении к данным.

Система набрала 94,87% в тесте LongMemEval при использовании модели GPT-5-mini, сохранив при этом полностью стабильное и кэшируемое окно контекста. На стандартной модели GPT-4o наблюдательная память набрала 84,23% по сравнению с собственной реализацией RAG от Mastra, которая показала 80,05%.

«У нее есть замечательное свойство: она одновременно и проще, и мощнее, поскольку показывает лучшие результаты в бенчмарках», — рассказал VentureBeat Сэм Бхагват (Sam Bhagwat), соучредитель и генеральный директор Mastra.

Как это работает: два агента сжимают историю в наблюдения

Эта архитектура проще традиционных систем памяти, но обеспечивает лучшие результаты. 

Наблюдательная память делит окно контекста на два блока. Первый содержит наблюдения — сжатые, датированные заметки, извлеченные из предыдущих бесед. Второй хранит сырую историю сообщений из текущей сессии.

Процессом сжатия управляют два фоновых агента. Когда количество необработанных сообщений достигает 30 000 токенов (этот параметр можно настроить), агент-Наблюдатель сжимает их в новые наблюдения и добавляет в конец первого блока. Исходные сообщения удаляются. Когда объем наблюдений достигает 40 000 токенов (также настраивается), агент-Отражатель реструктурирует и уплотняет журнал наблюдений, объединяя связанные элементы и удаляя устаревшую информацию.

«Смысл такого сжатия сообщений с течением времени заключается в том, что вы фактически просто получаете сообщения, а затем у вас есть агент, который как бы говорит: «Хорошо, каковы основные вещи, которые нужно запомнить из этого набора сообщений?»», — пояснил Бхагват. — Вы как бы сжимаете это, а затем получаете еще 30 000 токенов и сжимаете их».

Формат основан на тексте, а не на структурированных объектах. Никаких векторных или графовых баз данных не требуется.

Стабильные окна контекста снижают затраты на токены до 10 раз

Экономика наблюдательной памяти строится на кэшировании промптов. Anthropic, OpenAI и другие провайдеры снижают затраты на токены в 4–10 раз для кэшированных промптов по сравнению с некэшированными. Большинство систем памяти не могут этим воспользоваться, так как они изменяют промпт на каждом шаге путем внедрения динамически извлекаемого контекста, что делает кэш недействительным. Для производственных команд эта нестабильность напрямую оборачивается непредсказуемыми затратами и трудностями при планировании бюджетов на рабочие нагрузки агентов.

Наблюдательная память сохраняет контекст стабильным. Блок наблюдений работает только на добавление в конец до запуска процесса отражения, а это означает, что системный промпт и существующие наблюдения образуют постоянный префикс, который можно кэшировать на протяжении множества шагов. Сообщения продолжают добавляться в блок сырой истории до тех пор, пока не будет достигнут порог в 30 000 токенов. До этого момента каждый шаг дает полное попадание в кэш.

При запуске процесса наблюдения сообщения заменяются новыми наблюдениями, добавленными в существующий блок. Префикс наблюдений остается неизменным, поэтому система по-прежнему получает частичное попадание в кэш. Исключительно во время фазы отражения (которая запускается нечасто) весь кэш инвалидируется.

Средний размер окна контекста для бенчмарк-теста LongMemEval компании Mastra составил около 30 000 токенов, что намного меньше, чем потребовалось бы для хранения всей истории беседы.

Почему этот подход отличается от традиционного уплотнения (компакции)

Большинство агентов для написания кода используют компакцию для управления длинным контекстом. Компакция позволяет окну контекста заполниться до предела, после чего сжимает всю историю в краткую сводку прямо перед переполнением. Агент продолжает работу, окно снова заполняется, и процесс повторяется.

Компакция генерирует сводки в стиле документации. Она улавливает общую суть происходящего, но теряет конкретные события, решения и детали. Сжатие происходит большими пакетами, что делает каждый проход ресурсоемким с точки зрения вычислений. Это подходит для чтения человеком, но часто уничтожает конкретные решения и взаимодействия с инструментами, необходимые агентам для последовательной работы в течение долгого времени.

С другой стороны, Наблюдатель работает чаще, обрабатывая более мелкие фрагменты. Вместо суммаризации беседы он создает журнал решений на основе событий — структурированный список датированных, приоритизированных наблюдений о том, что именно произошло. Каждый цикл наблюдения обрабатывает меньше контекста и сжимает его более эффективно.

Журнал никогда не сводится к сплошной массе текста. Даже во время отражения Отражатель перестраивает и уплотняет наблюдения, чтобы обнаружить связи и отсечь избыточные данные. Но структура на основе событий сохраняется. Результат читается как лог решений и действий, а не как документация.

Корпоративные сценарии использования: долгосрочные беседы с агентами

Клиенты Mastra представляют самые разные сферы. Некоторые создают внутриприводные чат-боты для систем управления контентом (CMS), таких как Sanity или Contentful. Другие разрабатывают системы ИИ для SRE (инженеров по надежности сайтов), помогающие командам разработчиков классифицировать и обрабатывать оповещения. Агенты для обработки документов берут на себя рутину традиционных компаний, переходящих к автоматизации.

Общим для этих сценариев является потребность в долгосрочных диалогах, сохраняющих контекст на протяжении недель или месяцев. Агенту, встроенному в систему управления контентом, необходимо помнить, что три недели назад пользователь запрашивал определенный формат отчета. Агенту SRE нужно отслеживать, какие инциденты расследовались и какие решения были приняты.

«Одной из главных целей на 2025 и 2026 годы стало создание агента внутри своего веб-приложения, — сказал Бхагват о B2B SaaS-компаниях. — Этому агенту нужно уметь помнить, что, например, три недели назад вы спрашивали меня о какой-то вещи или говорили, что хотите получить отчет по контенту определенного типа, либо с просмотрами, сегментированными по такой-то метрике».

В подобных сценариях память перестает быть оптимизацией и становится продуктовым требованием: пользователи сразу замечают, когда агенты забывают их предыдущие решения или предпочтения.

Наблюдательная память сохраняет историю бесед за несколько месяцев доступной и актуальной. Агент может отвечать, удерживая в памяти весь контекст целиком, избавляя пользователя от необходимости заново объяснять свои предпочтения или прошлые решения.

Система вошла в состав релиза Mastra 1.0 и уже доступна пользователям. На этой неделе команда выпустила плагины для LangChain, Vercel AI SDK и других фреймворков, позволяющие разработчикам использовать наблюдательную память за пределами экосистемы Mastra.

Что это значит для производственных ИИ-систем

Наблюдательная память предлагает архитектурный подход, отличный от векторных баз данных и пайплайнов RAG, которые доминируют в современных реализациях. Более простая архитектура (текстовая основа, отсутствие специализированных баз данных) упрощает отладку и обслуживание. Стабильное окно контекста делает возможным агрессивное кэширование, существенно снижающее затраты. Результаты тестов показывают, что такой подход способен эффективно масштабироваться.

Для корпоративных команд, оценивающих различные подходы к организации памяти, ключевыми вопросами являются:

  • Какой объем контекста вашим агентам необходимо удерживать между сессиями?

  • Каков ваш уровень допустимых потерь при сжатии по сравнению с поиском по всему корпусу документов?

  • Нужен ли вам динамический поиск, обеспечиваемый RAG, или стабильный контекст подойдет лучше?

  • Активно ли ваши агенты используют инструменты, генерируя большие объемы вывода, требующие сжатия?

Ответы на эти вопросы помогут определить, подходит ли наблюдательная память для вашего конкретного случая. Бхагват позиционирует память как один из важнейших базовых элементов, необходимых для создания высокопроизводительных агентов — наряду с использованием инструментов, оркестрацией рабочих процессов, наблюдаемостью (observability) и защитными барьерами (guardrails). Для корпоративных агентов, встроенных в продукты, потеря контекста между сессиями недопустима. Пользователи рассчитывают, что агенты будут помнить их предпочтения, прошлые решения и текущие задачи.

«Самое сложное для команд, создающих агентов, — это продакшен, который может занять немало времени, — отметил Бхагват. — Память здесь играет важнейшую роль, потому что это просто шокирует, когда вы используете какого-нибудь агентного помощника, о чем-то ему рассказываете, а он это благополучно забывает».

По мере перехода агентов от роли экспериментов к статусу встроенных систем учета то, как команды проектируют память, может оказаться не менее важным, чем выбор самой модели.

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.