AgentRadio повышает точность задач ИИ на 92%

AgentRadio повышает точность задач ИИ на 92%

Источник: VentureBeat · Ben Dickson

По мере роста корпоративных кодовых баз ИИ-агенты, которым поручено их анализировать, начинают сдаваться под натиском долгосрочных задач, требующих множества взаимодействий и вызовов инструментов. Разделение работы между командой агентов кажется очевидным решением, но оно таит в себе фатальный изъян: большинство многоагентных систем не предназначены для того, чтобы агенты могли координировать свои действия друг с другом в ходе выполнения задачи и в реальном времени.

Чтобы решить эту проблему, исследователи из Coral AI Labs и нескольких университетов представили AgentRadio — асинхронный уровень передачи сообщений, который позволяет агентам общаться между шагами выполнения без прерывания их основной работы. В реальных корпоративных приложениях, где подзадачи тесно взаимозависимы, такая архитектура позволяет агентам вносить коррективы на ходу, а не двигаться по тупиковым путям до наступления этапа официального ревью.

В ходе бенчмарка с долгосрочными вопросами по продакшн-репозиториям команда агентов на базе AgentRadio почти вдвое увеличила точность выполнения задач по сравнению с четырьмя агентами Claude Code, работающими независимо. Она также превзошла одиночных агентов, запущенных на более продвинутых моделях. Для специалистов по ИИ AgentRadio демонстрирует, что правильная структура координации может превзойти грубую вычислительную мощность и масштаб моделей.

Проблема понимания кодовой базы

Основанные на языковых моделях (LLM) агенты все лучше справляются с долгосрочными задачами, требующими взаимодействия с различными инструментами и средами. Понимание кодовой базы представляет собой экстремальный вариант этой проблемы. Оно требует от ИИ-агента собрать программное обеспечение, запустить его, проследить пути выполнения в нескольких файлах и синтезировать данные за длительные периоды времени.

В таких условиях одноагентные системы обычно дают сбой из-за «проблемы покрытия».

«Один агент следует по единственному последовательному пути через репозиторий», — пояснили VentureBeat Синьсин Рен (Xinxing Ren), Келум Фордер (Caelum Forder) и Питер Кэрролл (Peter Carroll), соавторы научной работы об AgentRadio. По мере роста контекста «изначальный план становится сложнее пересматривать, а открытия, сделанные на поздних этапах исследования, не всегда распространяются дальше». Модель обычно способна выполнять отдельные шаги, но «самое сложное — удерживать каждое обязательство, зависимость и противоречивое свидетельство в активном состоянии на протяжении долгих поисков».

Одним из бенчмарков, помогающих измерить производительность ИИ на крупных кодовых базах, является SWE-Atlas QnA. Этот бенчмарк состоит из долгосрочных вопросов на естественном языке по живым продакшн-репозиториям. Эти задачи нельзя решить простым изучением кода. ИИ-агенты должны запустить программное обеспечение и выполнить множество команд, чтобы найти ответы.

Согласно экспериментам исследовательской группы, один экземпляр Claude Code на базе Opus 4.6 успешно решает лишь 32,3% таких задач. Переход на более новую, продвинутую модель вроде Opus 4.8 дает показатель успешности всего в 57,2%.

Естественное средство решения — распределить рабочую нагрузку между несколькими агентами, позволяя каждому работать с меньшим и более чистым контекстом. Многоагентные решения могут обеспечить существенный прирост производительности, когда задачи легко поддаются декомпозиции, то есть могут быть решены раздельно и объединены в конце.

Однако понимание кодовой базы редко поддается чистой декомпозиции. Подзадачи тесно взаимозависимы. Важный файл конфигурации или баг, обнаруженный одним агентом, может полностью переписать или перенаправить весь путь исследования другого агента. Из-за этих зависимостей агенты должны координировать свои действия, договариваться и делиться промежуточными находками в реальном времени.

Three diagrams showing AI agent coordination: isolated, round-synchronized, and asynchronous forms.

Источник изображения: VentureBeat с использованием Nano Banana Pro

Несмотря на эту потребность, асинхронная многоагентная коммуникация встречается редко. Исследователи отмечают, что существующие многоагентные системы обычно делятся на три неэффективных паттерна:

  • Параллельные, но изолированные: агенты работают одновременно, но совсем не общаются.

  • Параллельные, но синхронизируемые по раундам: агенты могут общаться, но только на строгих синхронизированных границах раундов. Это заставляет агентов останавливаться и ждать завершения раунда другими, прежде чем они смогут обсудить или обменяться промежуточными результатами. Системы на основе раундов исходят из того, что важные открытия могут подождать до следующей фазы коммуникации — сомнительное предположение, когда агенты работают над взаимозависимыми частями живой системы. Например, агент, исследующий проблему с API, может обнаружить улику, которая аннулирует текущую гипотезу агента по хранилищу данных. «Если эта информация ждет, пока оба агента закончат работу, исследование хранилища может завершиться по ложному пути», — говорят исследователи.

  • Асинхронность в смежных формах: эти системы предлагают ограниченные асинхронные функции, такие как нисходящая диспетчеризация задач. В них нет одноранговых латеральных каналов между агентами или общей памяти, которая требовала бы от агента активно приостанавливать работу для чтения обновлений.

В своей работе исследователи отмечают, что главный узел проблем, сдерживающий текущие многоагентные системы, заключается в том, что «работающий агент не может одновременно слушать».

«Насколько нам известно, ни одна существующая система не дает одновременно работающим агентам пассивной осведомленности друг о друге по латеральному каналу на естественном языке», — пишут исследователи.

Как работает AgentRadio

Чтобы устранить взаимоисключающий характер работы и прослушивания, исследователи разработали AgentRadio — асинхронный слой передачи сообщений, созданный для непосредственного внедрения в существующие среды кодирующих агентов.

AgentRadio наделяет агентов тремя примитивами:

  • Примитив create_thread открывает беседу между участвующими агентами.

  • Примитив send_message добавляет сообщение в тред и возвращает управление, не блокируя агента-отправителя.

  • Примитив wait_for_mention блокирует процесс до тех пор, пока не придет сообщение с упоминанием вызывающей стороны. Он доставляет сообщение вместе с полным снимком всех тредов, обеспечивая агента мгновенным контекстом.

Эта троица позволяет агентам находиться в состоянии «пассивной осведомленности», при котором они могут продолжать свои основные задачи, отправляя сообщения и обновляя свои знания в фоновом режиме.

Код AgentRadio доступен под лицензией Apache 2.0 на GitHub. Он спроектирован так, чтобы быть легковесным, и не требует прямых изменений в базовых средах агентов вроде Claude Code или Codex CLI.

AgentRadio architecture

Архитектура AgentRadio (источник: arXiv)

Архитектура состоит из двух основных частей:

  • Сервер сообщений: автономный процесс, выступающий в роли центрального хаба, который хранит все активные треды, сообщения и упоминания для группы агентов.

  • Интеграция на стороне среды: агенты взаимодействуют с сервером с помощью трех простых скриптов оболочки, каждый из которых соответствует одному из примитивов.

Единственное строгое требование для работы системы заключается в том, что среда агента должна уметь запускать команду оболочки в качестве фоновой задачи. Агентам в их системных промптах поручается держать запущенным один процесс отслеживания и отправлять сообщения через предоставленные скрипты. Запуск скрипта wait_for_mention в фоновом режиме позволяет агенту продолжать работу и получать уведомления асинхронно.

Для интеграции этого в существующий стек команде по-прежнему необходим «тонкий адаптер, который запускает воркеров, назначает идентификаторы, подключает их к общему серверу и управляет финальным синтезом», — говорят исследователи. Эта работа находится вокруг кодирующего агента и не требует изменений в базовой модели.

AgentRadio в действии

Чтобы проверить практическую пользу AgentRadio, исследователи протестировали фреймворк на 124 задачах из бенчмарка SWE-Atlas QnA. Тесты охватывали такие области, как системный дизайн, анализ первопричин, безопасность и интеграция API.

В качестве базовых моделей исследователи использовали Claude Opus 4.6 и DeepSeek V4 Pro. Для среды они оценили конфигурации от одиночного агента Claude Code (B0) и команды агентов с классическим разделением труда (L1) до команды агентов, использующих AgentRadio для асинхронной координации (L3).

Результаты экспериментов показали, что архитектура коммуникации AgentRadio превосходит как наивные многоагентные настройки, так и масштабирование за счет чистых вычислительных мощностей.

Если один агент Claude Code с Opus 4.6 решил лишь 32,3% задач, то полноценная установка AgentRadio почти удвоила этот показатель, решив 62,1% задач, и превзошла одиночного агента на Opus 4.8, который достиг 57,2%. Она также улучшила результаты DeepSeek V4 Pro с 29,0% до 50,8%.

AgentRadio vs single-agent systems

AgentRadio против одноагентных систем (источник: arXiv)

Чтобы понять, как это на практике влияет на корпоративный ИИ, в статье приводится реальная задача, связанная с системой MinIO. Для ее решения требовалось проверить логи сервера для каждого запроса — требование, которое агенты не предвидели на этапе первоначального планирования.

В условиях L2, где агенты сотрудничают, но лишены асинхронной коммуникации, два агента независимо друг от друга поняли, что им нужны эти логи, в процессе выполнения команд. Поскольку они не могли поделиться этим открытием в разгар работы, один агент молча сдался, а второй не предложил это команде. Во время фазы ревью команда единогласно пришла к неверному ответу, упустив пять критериев оценки.

При активированном AgentRadio агенты сделали то же открытие в процессе работы, но один из них мгновенно разослал необходимые данные серверных логов в общий рабочий журнал. Поскольку остальные агенты пассивно прислушивались, они сразу же усвоили эту новую информацию. Такая координация в реальном времени превратила провальный результат в идеальные 16 баллов из 16.

«Полезное отличие заключается в тайминге», — говорят исследователи. «Команде не нужен был еще один агент или еще один раунд ревью. Ей нужно было, чтобы открытие одного агента дошло до нужных коллег до того, как его операционная ценность истечет».

AgentRadio in action

Как ИИ-агенты используют AgentRadio для общения и взаимного асинхронного направления (источник: arXiv)

Исследователи отмечают, что аналогичный паттерн проявляется при устранении инцидентов на предприятии. Например, агент, расследующий симптомы проблемы с API, может обнаружить улику, которая аннулирует текущую гипотезу агента по хранилищу. Если эта информация ждет завершения работы обоих агентов, расследование хранилища может пойти по ложному пути. «Пассивная осведомленность позволяет второму агенту учесть противоречие на следующем шаге работы, не прерывая уже выполняющуюся команду», — пояснили они.

Стоимость и сложность координации

AgentRadio требует фиксированного бюджета многоагентной команды, что закономерно увеличивает затраты на токены. Исследователи признают, что «плата за это реальна», отмечая, что средние расходы на API выросли с $2,96 за задачу для одного агента Opus до $19,45 для всего стека AgentRadio.

Тем не менее, грубый масштаб не равен производительности. Когда исследователи уравняли затраты в тестах, потратив $17,76 на шесть независимых запусков Opus, модели решили лишь 37,9% задач по сравнению с 62,1% у AgentRadio. Это говорит о том, что архитектура AgentRadio дает структурный выигрыш, а не просто победу за счет грубой силы масштабирования. Командам все же стоит помнить о внутренней борьбе агентов. «Общение может направить агента к лучшим доказательствам, но оно же может и отвлечь его от верного пути», — предупреждают исследователи.

Фиксированная многоагентная команда не должна становиться стандартным ответом на каждую инженерную задачу. Более полезный тест для определения того, требуется ли многоагентная установка — наличие у задачи «точек разрыва ответственности», говорят исследователи. Это места, «где компетентный инженер привлек бы другого человека, потому что работа пересекает границу ответственности, требует независимой гипотезы или несет достаточный риск для оправдания раздельной проверки».

«Координация отлично подходит, когда задачу можно декомпозировать, получившиеся части остаются взаимозависимыми, показатель успешности одиночного агента ненадежен, а неполный ответ имеет значительную цену в дальнейшем», — утверждают исследователи. Примеры включают общерепозиторные архитектурные вопросы, незнакомые устаревшие системы, межсервисное расследование инцидентов, анализ безопасности, миграцию зависимостей и рефакторинг нескольких модулей.

И наоборот, одиночный агент остается более чистым выбором для «ограниченной, локальной и обратимой работы», такой как известное изменение одного файла или генерация стандартного кода (boilerplate).

«Используйте одного агента, пока один контекст все еще может честно владеть проблемой», — говорят исследователи. «Вводите дополнительную зону ответственности, когда существующий агент иначе был бы вынужден сжимать данные, пересекать независимую границу ответственности или проверять собственный высокорисковый вывод».

От исследований к коммерциализации: Coral Code

Хотя AgentRadio служит контролируемой исследовательской реализацией, использующей фиксированную команду из четырех агентов и пятифазный протокол, лежащие в ее основе принципы адаптируются в коммерческий продукт под названием Coral Code.

Вместо жесткого многоагентного протокола, применяемого к каждому тикету, Coral Code работает снизу вверх. Инженер начинает со своего существующего агента кодирования, а Coral привносит расследование в рамках репозитория, специализацию по ролям и коммуникацию только тогда, когда появляющиеся данные это оправдывают. «Coral упаковывает операционные задачи вокруг инструментов, которые инженеры уже используют, предоставляя контекст репозитория, узкоспециализированных агентов, коммуникацию и уровень данных вокруг среды разработки, а не внутри нее», — говорят исследователи.

Этот динамичный подход оптимизирует затраты за счет ориентации на релевантную единицу измерения: стоимость завершенного и готового к проверке результата.

Будущее автономной разработки ПО

Хотя AgentRadio представляет собой серьезное обновление оркестрации агентов, на пути остаются препятствия. Один из главных узких моментов, на которые указали исследователи, — это «управление вниманием и верификация».

«Пассивная осведомленность делает коммуникацию доступной во время выполнения. Она не решает, какие агенты должны существовать, какое открытие заслуживает прерывания, кто должен его получить или когда доказательств достаточно для пересмотра плана», — заявляют исследователи. Если каждый агент получает каждое обновление, уровень коммуникации превращается в шум. Если несколько агентов разделяют одно и то же неверное предположение, более быстрое общение может распространить ошибку.

Например, в одном из тематических исследований в статье, посвященном

платформе Grafana

, четыре из девяти критериев требовали отрицательных выводов, таких как обнаружение того, что селектор источников данных не выбирается автоматически. Агенты запустили соответствующие тесты, но ни один не сформировал недостающую негативную гипотезу. Обе конфигурации не прошли эти четыре критерия.

«Пассивная осведомленность может распространить идею, которую кто-то разработал. Она не может породить концепцию, которая так и не появилась ни у кого в команде», — говорят исследователи.

По мере увеличения длительности задач коммуникация и координация становятся критически важными. «Следующее поколение систем… нуждается в адаптивном распределении ответственности, маршрутизации с учетом данных, разрешении конфликтов, явных лимитах затрат, правах доступа, восстановлении и четких точках эскалации на человека», — отмечают исследователи. Что еще важнее, это требует надежного происхождения (provenance), чтобы руководители разработки могли проверить, какой агент сделал утверждение и почему то или иное действие было принято.

«Долго работающие агенты делают общение более важным. Они также делают подотчетность гораздо более сложной для подделки», — резюмируют они.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.