HarnessX переписывает каркас ИИ прямо во время выполнения задачи

HarnessX переписывает каркас ИИ прямо во время выполнения задачи

Поскольку корпоративные ИИ-агенты берут на себя всё более сложные и долгосрочные задачи, их производительность часто ограничивается их «обвязкой» (harness) — программным каркасом, который соединяет базовую LLM с окружающей средой.

В настоящее время обвязки в основном статичны и создаются вручную. Их улучшение носит преимущественно ручной характер, и они не совершенствуются автоматически на основе данных выполнения, собираемых из рабочей среды.

Чтобы устранить это узкое место в разработке, исследователи из Xiaomi представили HarnessX — фреймворк, который рассматривает ИИ-обвязку как компонуемый объект и автономно применяет улучшения к ее коду.

В реальных корпоративных приложениях такая автоматическая адаптация позволяет ИИ-системам динамически подстраиваться под специфические требования приложений. Практические тесты показали, что HarnessX обеспечивает существенный прирост производительности в таких областях, как разработка программного обеспечения и веб-взаимодействие.

Результаты демонстрируют, что масштабирование базовой модели — это не единственный путь к созданию более способных ИИ, а для меньших моделей — возможно, даже не лучший. Эволюция обвязок с помощью HarnessX принесла в среднем +14,5% прироста производительности в 15 комбинациях моделей и бенчмарков; для открытой модели Qwen3.5-9B прирост достиг +44% в задачах эмбодированного планирования.

Проблемы проектирования обвязок (harness engineering)

В ИИ-приложениях возможности базовой модели во многом зависят от окружающей ее обвязки. Обвязка служит операционным уровнем, который преобразует сырые результаты работы модели в структурированное и исполняемое поведение агента. Она включает в себя промпты, интеграции внешних инструментов, управление памятью и потоки управления, которые определяют, как ИИ-система наблюдает за своей средой, рассуждает над проблемой и принимает меры.

Поскольку корпоративные агенты берут на себя более сложные и долгосрочные рабочие процессы, проектирование обвязок стало фундаментальной частью разработки ИИ. Несмотря на свою важность, создание обвязок пока далеко от статуса зрелой инженерной дисциплины и сталкивается с тремя ключевыми проблемами.

Во-первых, обвязки статичны и создаются вручную. Любое изменение базовой модели, появление новых инструментов или переход в другую операционную среду требуют индивидуального переписывания кода вручную. Традиционным обвязкам не хватает механизмов для автономного обучения и совершенствования на основе прошлого опыта выполнения задач.

Во-вторых, большинство существующих обвязок страдают от архитектурной запутанности. Они жестко связывают шаблоны промптов, обертки инструментов, политики повторных попыток и управление памятью в одних и тех же путях кода. Такая запутанность означает, что настройка одного компонента может незаметно сломать другие. Попытки повторно использовать обвязку в разных бизнес-доменах часто скатываются к банальному копированию кода, а не к чистой модульной композиции.

В-третьих, обвязка и базовая модель оптимизируются изолированно друг от друга. Когда инженеры запускают тесты для улучшения обвязки, сгенерированные трассировки выполнения обычно отбрасываются, а не используются в качестве обучающих данных для улучшения самой модели. Следовательно, обновление моделей не приводит автоматически к улучшению обвязок, создавая «бутылочное горлышко», при котором команды упускают полную ценность операционных данных своих агентов.

HarnessX: автономная кузница для ИИ-агентов

HarnessX решает инженерные проблемы ручной разработки обвязок с помощью того, что исследователи называют «универсальной кузницей обвязок».

Главная инновация HarnessX заключается в том, что обвязка рассматривается как «объект первого класса». С точки зрения разработки ПО это означает, что обвязка представляет собой независимо сериализуемую, модульную и заменяемую сущность. Разделив конфигурацию модели (то есть какая именно ИИ-модель работает) и конфигурацию обвязки, инженеры могут бесшовно заменять, адаптировать и развивать каркас, не затрагивая базовую модель.

Flowchart of Xiaomi's HarnessX showing stages: Compose, Adapt, Evolve, with arrows indicating a cycle of model improvement.

HarnessX (источник: arXiv)

HarnessX разбивает поведение агента на различные компоненты, такие как сбор контекста, управление памятью, экосистемы инструментов, управление потоком и наблюдаемость. Каждое конкретное поведение реализовано в виде «процессора», который подключается к определенным точкам жизненного цикла обвязки (hooks). Такая модульная структура позволяет системе заменять, добавлять или удалять эти процессоры, не нарушая работу окружающего конвейера.

Для автоматизации оптимизации этой модульной структуры HarnessX представляет AEGIS — движок эволюции на основе трассировок. AEGIS рассматривает адаптацию обвязки как задачу обучения с подкреплением (reinforcement learning, RL) для различных символических компонентов обвязки.

Представление оптимизации обвязки как задачи обучения с подкреплением порождает три патологии, против которых исследователям пришлось целенаправленно проектировать защиту:

  • Имитация награды (Reward hacking): Система может использовать обходные пути для решения вместо того, чтобы подлинно решить задачу.

  • Катастрофическое забывание: Правка, устраняющая паттерн сбоя в одной области, может незаметно нарушить ранее успешно работавший рабочий процесс в другой.

  • Недостаточное исследование: Система может итеративно вносить мелкие правки в промпты вместо того, чтобы исследовать новые, структурно более совершенные конфигурации инструментов.

Flowchart illustrating Xiaomi's HarnessX framework with components like model, context, memory, and runtime execution.

Чтобы предотвратить эти проблемы, AEGIS опирается на полную наблюдаемость трассировок и четырехэтапный конвейер:

  1. Дайжестер (Digester): Сжимает трассировки выполнения в структурированные сводки для выявления моментов, где агент потерпел неудачу.

  2. Планировщик (Planner): Анализирует эти сводки, позволяя системе исследовать структурные изменения, а не просто локальные правки промптов.

  3. Эволюционист (Evolver): Генерирует правки кода обвязки и тестирует их, чтобы убедиться в правильности их работы перед развертыванием.

  4. Критик и шлюз (Critic and gate): Критик оценивает правки на предмет имитации награды, в то время как детерминированный шлюз отклоняет любое обновление, ухудшающее показатели ранее решенной задачи, для предотвращения катастрофического забывания.

HarnessX пополняет растущую область исследований самосовершенствующихся обвязок, но ее отличительной особенностью является коэволюция обвязки и модели.

Исследователи подчеркивают, что оптимизация любого из компонентов изолированно в конечном итоге упирается в тупик. Эволюция только обвязки упирается в потолок каркаса, если базовой модели не хватает возможностей для рассуждений, чтобы использовать новые инструменты. Обучение только модели упирается в потолок обучающих сигналов, если обвязка никогда не подталкивает модель к использованию ее продвинутых возможностей.

HarnessX чередует эволюцию обвязки с обучением модели. Трассировки выполнения, генерируемые в процессе адаптации обвязки к задачам, преобразуются в сигналы обучения с подкреплением для базовой модели. Каждый раз, когда обвязка улучшает свою стратегию, модель одновременно учится лучше использовать эту новую стратегию, преодолевая пределы возможностей традиционной разработки ИИ-агентов.

Flowchart illustrating Xiaomi's HarnessX framework, showing task set, agent, replay buffer, and harness evolution process.

Коэволюция обвязки и модели (источник: arXiv)

HarnessX делает эту коэволюцию возможной благодаря межобвязочному алгоритму GRPO (Group Relative Policy Optimization). GRPO — это популярный алгоритм RL, используемый для обучения моделей рассуждения, таких как DeepSeek-R1.

При тонкой настройке модели кросс-обвязочный GRPO объединяет траектории выполнения агента для одной и той же задачи в совершенно разных версиях обвязок приложения. Это позволяет базовой модели усваивать изменения стратегии высокого уровня (например, использование нового эндпоинта API или управление бюджетом выполнения), а не просто изучать мелкие вариации формулировок промптов.

HarnessX в действии на отраслевых бенчмарках

Чтобы подтвердить практическую пользу HarnessX, исследователи протестировали его на пяти бенчмарках, включающих разработку программного обеспечения, многошаговый диалог с клиентами, веб-навигацию, открытые многошаговые рассуждения и эмбодированное планирование.

Они разделили роли ИИ на две части. «Мета-агент», работающий на базе Claude Opus 4.6, анализировал логи и писал код для эволюции обвязок. «Агенты задач» выполняли реальные рабочие процессы. Чтобы доказать, что фреймворк не зависит от конкретной модели, они протестировали его на трех разных рабочих моделях: Claude Sonnet 4.6, GPT-5.4 и открытой Qwen3.5-9B.

Table showing performance improvements of task agents like GPT-5.4 and Qwen3.5-9B across various benchmarks.

HarnessX улучшает производительность агентов на ключевых отраслевых бенчмарках без изменения базовой модели (источник: arXiv)

HarnessX сравнивался с двумя основными базисными линиями (baseline). Первой была статическая обвязка, отражающая то, как большинство предприятий внедряют ИИ сегодня, используя созданные вручную замороженные настройки со специфичными для бенчмарков промптами и инструментами. Второй выступал Claude Code SDK — базисная линия, представляющая собой агента-эволюциониста для проверки того, превосходит ли сложный четырехэтапный конвейер AEGIS простое обращение к одной языковой модели с просьбой итеративно дорабатывать код.

Динамическая эволюция обвязки дает значительный прирост на той же базовой модели. HarnessX улучшил производительность в 14 из 15 комбинаций моделей и бенчмарков. Во всех тестах эволюция обвязки обеспечила средний абсолютный прирост производительности на +14,5%.

Наибольшую выгоду от динамического улучшения обвязок получили наименее мощные модели. Открытая модель Qwen3.5-9B продемонстрировала скачок производительности на +44,0% в бенчмарке эмбодированного планирования ALFWorld и на +18,2% в SWE-bench Verified для разработки ПО.

Коэволюция также доказала свою высокую эффективность. Когда исследователи обучили базовая модель, используя данные, полученные в ходе эволюции обвязки, они увидели дополнительный средний прирост производительности на +4,7%. Одновременное улучшение обвязки и модели дает наивысший потенциал. Прирост от коэволюции применим только к моделям с открытыми весами.

Примеры из экспериментов показывают, как HarnessX решает пагубные проблемы при создании обвязок агентов для реальных задач. Например, в бенчмарке многошаговых рассуждений GAIA агент задач постоянно терпел неудачу, потому что инструмент «безголового» браузера (headless browser), который он использовал для парсинга Википедии, выдавал тайм-аут на перегруженном JavaScript фронтенде сайта. HarnessX проанализировал трассировки выполнения, диагностировал ошибку и написал новый инструмент, который полностью обошел браузер и напрямую запросил простой текст через API MediaWiki. Он внедрил этот инструмент в обвязку и мгновенно справился с зависшими задачами.

Во время тестов электронной коммерции WebShop ИИ-агент часто застревал в циклах пагинации, бесконечно нажимая «следующая страница» и переформулируя поисковые запросы, так и не решаясь купить товар. Вместо того чтобы просто подправлять промпт, HarnessX создал вспомогательный процессор (advisory processor), который определял, когда агент повторял навигационные действия. Он внедрял предупреждение в контекст, чтобы принудительно инициировать принятие решения, устраняя циклическое поведение и повышая производительность.

Ограничения автоматизированного проектирования обвязок

Одно важное предостережение заключается в том, что в настоящее время система полагается на мощные модели в роли мета-агента, переписывающего код обвязки. В своих экспериментах исследователи опирались на закрытые передовые модели вроде Claude Opus. Модели с открытыми весами быстро совершенствуются, но их способность выступать в роли мета-агента пока не проверена.

Еще одно ограничение, которое стоит учитывать, — это внутренние возможности используемых моделей. Если базовая модель задачи принципиально слишком слаба для выполнения сложных рабочих процессов, предлагаемых новой обвязкой, HarnessX не сможет улучшить общие способности агента (исследователи наблюдали это на модели Qwen3.5-9B в тестах программирования SWE-bench).

Несмотря на эти ограничения, HarnessX убедительно доказывает, что проектирование обвязок — а не только масштабирование моделей — это рычаг, который практики могут использовать уже сейчас. Для команд, запускающих небольшие открытые модели на сложных рабочих процессах, прирост здесь достаточно велик, чтобы оправдать оценку эволюции обвязок в качестве первого шага перед тем, как обращаться к более дорогой передовой модели. Исследователи планируют выпустить код в следующем обновлении.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.