ARE и Gaia2 от Meta переосмысляют тестирование агентов

ARE и Gaia2 от Meta переосмысляют тестирование агентов

Постоянная проблема при оценке агентов заключается в том, как измерить их производительность в сценариях реального мира. 

Несмотря на то, что другие бенчмарки пытаются решить эту проблему, исследователи из Meta считают, что для агентов необходим более реалистичный метод оценки, который проверяет их адаптивность в жизненных сценариях. 

Представляем новую платформу оценки от Meta — Agents Research Environment (ARE), а также новую модель бенчмарка в ее составе под названием Gaia2. ARE «поддерживает запуск оркестраций, создание сред и подключение синтетических или реальных приложений для разработки и оценки агентов».

Тем временем Gaia2, являющаяся обновлением более раннего бенчмарка агентов Gaia от Meta, измеряет производительность агентов в среде ARE. 

Идея Meta заключается в том, что существующим средам тестирования для агентов часто приходится догонять прогресс, поэтому оценщикам постоянно нужно подстраивать бенчмарки.

«Мы исходим из того, что улучшение моделей посредством опыта и развертывания в рабочей среде ограничено управляемостью, разнообразием и реалистичностью доступных сред. Во-первых, хотя веб является отличной средой для поддержки таких задач агентов, как поиск, он постоянно развивается, что затрудняет воспроизводимость для оценки и изучения сложного поведения, в особенности того, которое связано с операциями записи», — говорится в документе Meta

Исследовательские среды

Идея, лежащая в основе ARE, заключается в том, что это среда, устроенная подобно реальному миру, с которым агенту придется взаимодействовать. Задачи в ARE будут асинхронными, реальное время будет идти, и агенты, развернутые в этой среде, должны будут адаптироваться и работать с учетом этих ограничений. 

Она имеет пять ключевых основ:

  1. Приложения, представляющие собой интерфейсы API с сохранением состояния, которые обращаются к источникам данных (например, почтовые приложения, имеющие такие инструменты, как send_email)

  2. Среды, или совокупность приложений, данных и правил

  3. События — это все, что происходит в среде

  4. Уведомления, или сообщения, которые информируют агента о событиях, и

  5. Сценарии, которые выступают в качестве начального состояния и событий в среде и могут включать механизм верификации

Meta ARE screenshot 1

Предприятие, желающее оценить агента, может построить такой тестовый сценарий на базе ARE — фреймворка с открытым исходным кодом, который Meta предлагает на GitHub и который включает ядро симуляции, примеры сред и оркестрацию по умолчанию. Они могут либо создать собственную среду, либо использовать уже предзагруженную, предварительно определив приложения, с которыми будут взаимодействовать агенты. Затем предприятия настраивают сценарии для агента перед подключением тестируемых агентов. После этого они запускают свою логику оркестрации и настраивают верификатор. 

Бенчмарки Gaia2 

Важнейшим элементом полезности ARE является бенчмарк Gaia2. Gaia2 создан на базе ARE и измеряет возможности агентов, в отличие от Gaia1, которая тестировала способность агента находить ответы. 

Он исследует, как агенты ведут себя в среде ARE, и сравнивает то, как они справляются с меняющимися условиями, соблюдают дедлайны, обрабатывают сбои API и уточняют задачи, когда инструкции неясны. Gaia2 поддерживает несколько протоколов, таких как Agent2Agent, чтобы также оценивать способность агента к сотрудничеству. В нем используется фреймворк LLM-as-a-judge («большая языковая модель в качестве судьи»). 

Поскольку оценки в ARE выполняются асинхронно, а время продолжает идти, даже когда агент не активен, Gaia2 может измерять, реагирует ли простаивающий агент при отправке нового события. 

Тестирование агентов проводилось в мобильной среде на примере 1 120 задач. 

Судя по текущим тестам и публикации генерального директора Hugging Face Клема Деланга (Clem Delangue), модель GPT-5 от OpenAI в настоящее время лидирует в бенчмарке Gaia2. 

Бенчмарк Gaia2 уже завоевывает популярность.

Агенты и жизненные сценарии

Предприятия хотят быть уверены, что их агенты действительно работают, но в рамках статических тестов, которые на самом деле не отражают реальную деятельность агентов, это может оказаться сложной задачей. 

Недавно было выпущено несколько бенчмарков и средств оценки, призванных предоставить смоделированные среды из реальной жизни. Платформа Hugging Face под названием Yourbench позволяет предприятиям создавать собственные среды тестирования на основе реальных данных. В то же время MCPEval от Salesforce выпускает агентов в реальные MCP-серверы, которые не зависят от статических заранее определенных сценариев. Платформа Inclusion Arena от компании Inclusion AI также измеряет производительность агентов в сценариях реального мира. 

Тем не менее, Gaia2 отличается тем, что проверяет адаптивность и устойчивость к «шуму». Например, Inclusion Arena оценивает человеческие предпочтения и то, насколько точно агент следует инструкциям. MCPEval, с другой стороны, измеряет способность агентов вызывать инструменты. 

ARE и Gaia2 предлагают предприятиям еще один способ оценки производительности агентов, позволяя увидеть, насколько надежен агент при возникновении непредвиденного события. 

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.