EAGLET повышает производительность ИИ-агентов в долгосрочных задачах за счет создания плана

EAGLET повышает производительность ИИ-агентов в долгосрочных задачах за счет создания плана

2025 год должен был стать годом «ИИ-агентов», по мнению генерального директора Nvidia Дженсена Хуанга и других представителей индустрии искусственного интеллекта. Во многом так оно и есть: множество ведущих провайдеров ИИ-моделей, таких как OpenAI, Google и даже китайские конкуренты, например Alibaba, представили дообученные ИИ-модели или приложения, ориентированные на узкий спектр задач, таких как поиск в интернете и составление отчетов.

Но на пути к будущему высокопроизводительных и надежных ИИ-агентов остается одно серьезное препятствие: заставить их не отклоняться от курса, когда выполнение задачи требует множества шагов. Сторонние тесты показывают, что даже самые мощные ИИ-модели демонстрируют более высокий уровень сбоев по мере увеличения количества шагов, необходимых для выполнения задачи, и затрачиваемого на это времени (превышающего часы).

Новая академическая методология под названием EAGLET предлагает практичный и эффективный способ повышения производительности долгосрочных задач у агентов на базе больших языковых моделей (LLM) — без необходимости ручной разметки данных или повторного обучения.

Разработанная исследователями из Университета Цинхуа, Пекинского университета, DeepLang AI и Иллинойсского университета в Урбане-Шампейне, система EAGLET предлагает «глобальный планировщик», который может быть интегрирован в существующие рабочие процессы агентов для уменьшения галлюцинаций и повышения эффективности выполнения задач.

EAGLET представляет собой дообученную языковую модель, которая интерпретирует инструкции по задачам (обычно предоставляемые в виде промтов пользователем или операционной средой агента) и генерирует план высокого уровня для агента (работающего на базе собственной LLM). Она не вмешивается непосредственно в процесс выполнения, но ее предварительные указания помогают сократить количество ошибок планирования и повысить процент успешного завершения задач.

Решение проблемы планирования для агентов, выполняющих долгосрочные задачи

Многие агенты на базе LLM испытывают трудности с долгосрочными задачами, поскольку полагаются на реактивное пошаговое рассуждение. Такой подход часто приводит к поведению методом проб и ошибок, галлюцинациям при планировании и неэффективным траекториям.

EAGLET решает эту проблему, внедряя модуль глобального планирования, который работает параллельно с агентом-исполнителем.

Вместо того чтобы объединять планирование и генерацию действий в одной модели, EAGLET разделяет их, обеспечивая более согласованные стратегии на уровне задач.

Двухэтапный конвейер обучения без участия человека

Планировщик EAGLET обучается с помощью двухэтапного процесса, не требующего написанных человеком планов или разметки.

Первый этап включает генерацию синтетических планов с помощью высокопроизводительных LLM, таких как GPT-5 и DeepSeek-V3.1-Think.

Затем эти планы фильтруются с использованием новой стратегии, называемой гомологичной фильтрацией консенсуса, которая сохраняет только те планы, которые повышают производительность выполнения задач как для экспертных, так и для начинающих агентов-исполнителей.

На втором этапе процесс обучения с подкреплением на основе правил дополнительно совершенствует планировщик, используя специально разработанную функцию вознаграждения для оценки того, насколько каждый план помогает нескольким агентам достичь успеха.

Представляем вознаграждение за прирост возможностей исполнителя (ECGR)

Одним из ключевых нововведений EAGLET является вознаграждение за прирост возможностей исполнителя (Executor Capability Gain Reward, ECGR).

Это вознаграждение измеряет ценность сгенерированного плана, проверяя, помогает ли он агентам как с высокой, так и с низкой квалификацией выполнять задачи более успешно и за меньшее число шагов.

Оно также включает коэффициент затухания, чтобы отдавать предпочтение более коротким и эффективным траекториям выполнения задач. Такой подход позволяет избежать избыточного вознаграждения планов, полезных только для уже компетентных агентов, и способствует формированию более универсальных рекомендаций по планированию.

Совместимость с существующими агентами и моделями

Планировщик EAGLET спроектирован как модульное решение по принципу «plug-and-play», что означает возможность его интеграции в существующие конвейеры агентов без необходимости повторного обучения исполнителя.

В ходе оценок планировщик повысил производительность различных базовых моделей, включая GPT-4.1, GPT-5, Llama-3.1 и Qwen2.5.

Он также доказал свою эффективность независимо от стратегии промптинга, отлично работая как со стандартными запросами в стиле ReAct, так и с такими подходами, как Reflexion.

Передовая производительность на различных бенчмарках

EAGLET тестировался на трех широко используемых бенчмарках для долгосрочных задач агентов: ScienceWorld, который симулирует научные эксперименты в текстовой лабораторной среде; ALFWorld, перед которым агенты ставят задачу выполнения домашних дел с помощью естественного языка в смоделированной домашней обстановке; и WebShop, оценивающий целенаправленное поведение в реалистичном интерфейсе интернет-магазина.

Во всех трех тестах агенты-исполнители, оснащенные EAGLET, превзошли свои аналоги без планировщика, а также другие базовые системы планирования, включая MPO и KnowAgent.

В экспериментах с открытой моделью Llama-3.1-8B-Instruct EAGLET поднял средний показатель производительности с 39,5 до 59,4, что дало прирост в +19,9 балла по всем задачам.

На неизведанных сценариях ScienceWorld он увеличил производительность с 42,2 до 61,6.

В знакомых сценариях ALFWorld система EAGLET улучшила результаты с 22,9 до 54,3, что означает рост производительности более чем в 2,3 раза.

Еще более значительный прирост наблюдался у более мощных моделей.

Например, средний балл GPT-4.1 с использованием EAGLET вырос с 75,5 до 82,2, а GPT-5 — с 84,5 до 88,1, несмотря на то, что они и без того демонстрировали высокие результаты.

В некоторых тестах прирост производительности достигав +11.8 балла, например, при комбинации EAGLET с методом исполнителя ETO на неизведанных задачах ALFWorld.

По сравнению с другими базовыми решениями для планирования, такими как MPO, EAGLET стабильно обеспечивал более высокие показатели завершения задач. Например, на неизведанных задачах ALFWorld с GPT-4.1 MPO набрала 79,1 балла, в то время как EAGLET — 83,6 балла, что дает преимущество в +4,5 балла.

Кроме того, в статье сообщается, что агенты, использующие EAGLET, в среднем выполняют задачи за меньшее число шагов. С GPT-4.1 в качестве исполнителя среднее количество шагов сократилось с 13,0 (без планировщика) до 11,1 (с EAGLET). С GPT-5 этот показатель снизился с 11,4 до 9,4, что подтверждает утверждение о повышении эффективности выполнения.

Повышение эффективности обучения и выполнения

По сравнению с методами на основе обучения с подкреплением вроде GiGPO, которые могут требовать сотен итераций обучения, EAGLET добился лучших или сопоставимых результатов примерно с одной восьмой частью трудозатрат на обучение.

Эта эффективность также распространяется на этап выполнения: агентам с EAGLET обычно требовалось меньше шагов для завершения задач. Это приводит к сокращению времени инференса и вычислительных затрат в производственных сценариях.

Публичного кода пока нет

На момент подачи версии статьи на arXiv авторы еще не выпустили версию EAGLET с открытым исходным кодом. Неясно, будет ли и когда выпущен код, на каких условиях лицензирования и как он будет поддерживаться, что может ограничить практическую пользу фреймворка для корпоративного развертывания в ближайшей перспективе.

Редакция VentureBeat обратилась к авторам за разъяснениями и обновит материал, как только получит ответ.

Вопросы корпоративного развертывания остаются

Хотя планировщик описывается как готовый к работе по принципу plug-and-play, остается неясным, можно ли легко интегрировать EAGLET в популярные корпоративные фреймворки для агентов, такие как LangChain или AutoGen, или для этого требуется специализированный стек, поддерживающий разделение планирования и выполнения.

Аналогичным образом, схема обучения задействует множество агентов-исполнителей, что может быть трудно воспроизвести в корпоративных средах с ограниченным доступом к моделям. Издание VentureBeat спросило исследователей, можно ли адаптировать метод гомологичной фильтрации консенсуса для команд, у которых есть доступ только к одной модели-исполнителю или ограничены вычислительные ресурсы.

Авторы EAGLET заявляют об успешном применении для разных типов и размеров моделей, но минимально жизнеспособный масштаб модели для практического развертывания пока неизвестен. Например, смогут ли корпоративные команды эффективно использовать планировщик с открытыми моделями размером менее 10 млрд параметров в средах с жесткими требованиями к задержке? Кроме того, фреймворк может представлять ценность для конкретных отраслей, таких как техподдержка или автоматизация ИТ, но еще предстоит выяснить, насколько легко планировщик поддается дообучению или кастомизации под такие вертикали.

Планирование в реальном времени против предварительно сгенерированного

Другой открытый вопрос заключается в том, как лучше всего использовать EAGLET на практике. Должен ли планировщик работать в реальном времени вместе с исполнителями в рамках единого цикла или его лучше использовать автономно для предварительной генерации глобальных планов под известные типы задач? Каждый подход имеет свои последствия для задержки, стоимости и операционной сложности. VentureBeat задала этот вопрос авторам и поделится новыми инсайтами по мере их появления.

Стратегические компромиссы для корпоративных команд

Для технических руководителей средних и крупных предприятий EAGLET представляет собой убедительное доказательство концепции повышения надежности и эффективности агентов на базе LLM. Но без публичных инструментов или руководств по внедрению этот фреймворк по-прежнему ставит перед выбором: создавать самостоятельно или выжидать. Предприятия должны сопоставить потенциальный прирост производительности и эффективности задач с затратами на воспроизведение или приближение процесса обучения собственными силами.

Потенциальные сценарии использования на предприятиях

Для компаний, разрабатывающих агентские системы на базе ИИ (особенно в средах, требующих пошагового планирования, таких как автоматизация ИТ, служба поддержки или онлайн-взаимодействие), EAGLET предлагает шаблон того, как внедрить планирование без повторного обучения. Его способность направлять как открытые, так и закрытые модели наряду с эффективным методом обучения может сделать его привлекательной отправной точкой для команд, стремящихся повысить производительность агентов с минимальными накладными расходами.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.