Anthropic улучшает память SDK агента Claude

Anthropic улучшает память SDK агента Claude

Проблема памяти агентов остается одной из главных трудностей, которые предприятия стремятся решить, поскольку по мере продолжительности работы агенты забывают часть инструкций или бесед.

Anthropic считает, что решила эту проблему для своего набора средств разработки Claude Agent SDK, разработав комплексное решение, которое позволяет агенту работать в рамках различных контекстных окон.

«Основная сложность долго работающих агентов заключается в том, что они должны функционировать в рамках дискретных сеансов, и каждый новый сеанс начинается без воспоминаний о том, что было раньше, — написала Anthropic в своем блоге. — Поскольку контекстные окна ограничены и большинство сложных проектов не могут быть завершены в рамках одного окна, агентам необходим способ преодолеть разрыв между сеансами программирования».

Инженеры Anthropic предложили двухэтапный подход для своего Agent SDK: агент-инициализатор для настройки среды и агент-программист для поэтапного продвижения в каждом сеансе и оставления артефактов для следующего.

Проблема памяти агентов

Поскольку агенты создаются на базе базовых моделей, они по-прежнему ограничены пределами контекстных окон, которые, хотя и постоянно увеличиваются, остаются конечными. Для долго работающих агентов это может создать серьезную проблему, из-за которой агент начинает забывать инструкции и вести себя непредсказуемо при выполнении задачи. Улучшение памяти агентов становится критически важным для стабильной и безопасной для бизнеса работы.

За последний год появилось несколько методов, цель которых — устранить разрыв между контекстными окнами и памятью агентов. LangMem SDK от LangChain, Memobase и Swarm от OpenAI — это примеры продуктов компаний, предлагающих решения для работы с памятью. В последнее время также наблюдался всплеск исследований в области агентской памяти: предложенные фреймворки, такие как Memp, и парадигма вложенного обучения от Google открывают новые альтернативы для расширения памяти.

Многие из существующих фреймворков памяти являются открытыми и могут теоретически адаптироваться к различным большим языковым моделям (LLM), управляющим агентами. Подход Anthropic совершенствует ее собственный комплект разработки Claude Agent SDK.

Как это работает

В Anthropic пришли к выводу, что даже несмотря на наличие у Claude Agent SDK возможностей управления контекстом и того факта, что «агент должен быть способен выполнять полезную работу в течение произвольно долгого времени», этого оказалось недостаточно. В своем блоге компания отметила, что такая модель, как Opus 4.5, работающая на базе Claude Agent SDK, может «не справиться с созданием веб-приложения промышленного качества, если ей дать лишь общую подсказку вроде «создай клон claude.ai»».

По словам Anthropic, сбои проявлялись в двух основных сценариях. Во-первых, агент пытался сделать слишком многое, из-за чего у модели исчерпывался объем контекста прямо посередине процесса. В результате агенту приходится догадываться о том, что произошло, и он не может передать четкие инструкции следующему агенту. Второй сбой происходит позже, после того как часть функций уже создана. Агент видит, что прогресс достигнут, и просто объявляет работу выполненной.

Исследователи Anthropic разделили решение на следующие составляющие: настройка исходной среды для закладывания основы будущих функций и выдача задач каждому агенту для постепенного достижения цели с сохранением чистой основы на выходе.

Здесь и вступает в игру двухкомпонентное решение агента Anthropic. Агент-инициализатор настраивает среду, фиксируя действия агентов и добавленные файлы. Затем агент-программист дает моделям задания по инкрементальному продвижению вперед и оставляет структурированные обновления.

Anthropic long running agent

Фото: Anthropic

«Источником вдохновения для этих практик послужило понимание того, что эффективные инженеры-программисты делают каждый день», — отметили в Anthropic.

Исследователи рассказали, что добавили в агента-программиста инструменты тестирования, что повысило его способность выявлять и исправлять ошибки, которые невозможно обнаружить только по одному коду.

Будущие исследования

В Anthropic отметили, что их подход — это «лишь один из возможных вариантов решения в рамках архитектуры долго работающих агентов». Тем не менее, это лишь начальный этап того, что может перерасти в широкую область исследований для многих игроков в сфере искусственного интеллекта.

Компания заявила, что эксперименты по улучшению долгосрочной памяти агентов пока не дали ответа на вопрос, что эффективнее в различных контекстах — один универсальный агент-программист или многоагентная структура.

Кроме того, их демонстрация была сфокусирована на разработке полнофункциональных (full-stack) веб-приложений, поэтому будущие эксперименты должны быть направлены на обобщение результатов для самых разных задач.

«Вполне вероятно, что некоторые или даже все эти наработки можно будет применить к долгосрочным агентским задачам, которые возникают, например, в научных исследованиях или финансовом моделировании», — заключили в Anthropic.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.