Оркестрация на основе скрепленного обучения (RL): как модель с 7 млрд параметров распределяет задачи между GPT-5, Claude и Gemini
Каждый жестко запрограммированный вашей командой конвейер LangChain начинает давать сбой в тот момент, когда распределение запросов меняется — а оно меняется всегда. Именно это узкое место и решила устранить компания Sakana AI.
Исследователи из Sakana AI представили систему «RL Conductor» — небольшую языковую модель, обученную с помощью обучения с подкреплением для автоматического управления разнообразным пулом рабочих LLM. Conductor динамически анализирует входные данные, распределяет работу между исполнителями и координирует действия агентов.
Эта автоматизированная координация позволяет достичь передовых результатов в сложных бенчмарках на рассуждение и написание кода, превосходя как отдельные передовые модели вроде GPT-5 и Claude Sonnet 4, так и дорогостоящие многоагентные конвейеры, созданные людьми. Система достигает такой производительности при минимальных затратах и с меньшим количеством вызовов API по сравнению с конкурентами. RL Conductor выступает в качестве основы Fugu — коммерческого сервиса многоагентной оркестрации от Sakana AI.
Ограничения ручных агентских фреймворков
Большие языковые модели обладают мощными скрытыми возможностями. Однако задействовать их потенциал по максимуму — задача не из легких. Извлечение такого уровня производительности во многом зависит от вручную разработанных агентских рабочих процессов, которые служат ключевыми компонентами в коммерческих ИИ-продуктах.
Тем не менее, эти фреймворки несовершенны, поскольку они по своей сути жесткие и ограниченные. В комментариях для VentureBeat Юджин Тан (Yujin Tang), соавтор научной статьи, объяснил точный предел прочности текущих систем: «Хотя использование фреймворков с жестко закодированными конвейерами вроде LangChain и Mixture-of-Agents может хорошо работать для конкретных сценариев использования… В продакшене возникает неизбежное узкое место при ориентации на домены с крупными базми пользователей и самыми разнородными требованиями».
Тан отметил, что достижение «реальной генерализации в подобных гетерогенных приложениях неизбежно требует выхода за рамки созданных человеком жестких архитектур».
Еще одно узкое место при создании надежных агентских систем заключается в том, что ни одна модель не является оптимальной для всех задач. Разные модели дообучены специализироваться в определенных областях. Одна модель может преуспевать в научных рассуждениях, в то время как другая лучше справляется с генерацией кода, математической логикой или планированием высокого уровня.
Поскольку модели обладают столь разными характеристиками и взаимодополняющими навыками, вручную предсказать и жестко зафиксировать идеальную комбинацию моделей для каждого запроса практически невозможно. Оптимальный агентский фреймворк должен уметь анализировать проблему и делегировать подзадачи наиболее подходящему эксперту из пула.
Управление оркестром агентов
RL Conductor создан для преодоления ограничений жестких фреймворков, разработанных людьми. Как следует из названия, он дирижирует оркестром агентов, разделяя сложные проблемы, делегируя целевые подзадачи и проектируя топологии коммуникации для набора рабочих LLM.
Вместо того чтобы полагаться на фиксированный код или статическую маршрутизацию, Conductor оркестрирует эти модели, генерируя индивидуальный рабочий процесс. Для каждого шага в этом процессе модель создает инструкцию на естественном языке для конкретного аспекта задачи, назначает агента для ее выполнения и определяет «список доступа», который диктует, какие прошлые подзадачи и ответы других агентов включаются в контекст данного агента.
Определяя все на естественном языке, Conductor выстраивает гибкие рабочие процессы, адаптированные под каждый входящий запрос. В зависимости от требований задачи он может конструировать простые последовательные цепочки, параллельные древовидные структуры или даже рекурсивные циклы.
RL Conductor (источник: Sakana AI)
Что важно, модель изучает эти стратегии не благодаря человеческому проектированию, а посредством обучения с подкреплением (RL) и максимизации вознаграждения. Во время обучения модели задается задача, пул исполнителей и сигнал вознаграждения, основанный на том, правильны ли ее ответ и формат вывода.
Используя простой алгоритм проб и ошибок на основе RL, модель органично обнаруживает, какие комбинации инструкций и коммуникационных структур приносят наибольшее вознаграждение. В результате она автоматически перенимает передовые стратегии оркестрации, такие как целевой промпт-инжиниринг, итеративное уточнение и оптимизация мета-промптов.
Модель учится динамически корректировать свои стратегии и задействовать уникальные сильные стороны своих агентов-исполнителей без необходимости для разработчиков-людей жестко кодировать этот процесс.
Conductor в действии
Чтобы протестировать RL Conductor в деле, исследователи дообучили модель Qwen2.5-7B с 7 миллиардами параметров, используя этот фреймворк. Во время обучения перед Conductor стояла задача проектирования агентских воркфлоу длиной до пяти шагов. Ему был предоставлен доступ к пулу исполнителей, состоящему из семи различных моделей: трех гигантов с закрытым исходным кодом (Gemini 2.5 Pro, Claude-Sonnet-4 и GPT-5) и четырех моделей с открытым исходным кодом (включая DeepSeek-R1-Distill-Qwen-32B, Gemma3-27B и Qwen3-32B).
Команда оценила работу Conductor на различных сложнейших бенчмарках, сравнивая его с отдельными передовыми моделями, работающими в одиночку, агентами саморефлексии, которых итеративно побуждали улучшать собственные ответы, а также с современными фреймворками многоагентной маршрутизации, такими как MASRouter, Mixture-of-Agents (MoA), RouterDC и Smoothie. Небольшая модель Conductor размером 7B установила новые рекорды по всем направлениям. По данным исследователей, она достигла среднего балла 77,27% по всем задачам, набрав 93,3% в математическом бенчмарке AIME25, 87,5% в GPQA-Diamond и 83,93% в LiveCodeBench.
Примечательно, что таких результатов удалось достичь при сохранении высочайшей эффективности. В то время как базовые модели, такие как MoA, сжигали 11 203 токена на один вопрос, Conductor использовал в среднем всего 1 820 токенов, затрачивая в среднем лишь по три шага на рабочий процесс.
RL Conductor превосходит другие базовые модели в ключевых отраслевых бенчмарках (источник: arXiv)
Более детальный взгляд на подробности экспериментов показывает, почему этот фреймворк настолько эффективен. Conductor автоматически научился оценивать сложность задач. Для простых вопросов на извлечение фактов он часто решал проблему за один шаг или использовал базовую настройку из двух агентов. Однако для комплексных задач по программированию он выстраивал масштабные рабочие процессы, включающие до четырех агентов с выделенными фазами планирования, реализации и верификации.
Conductor также усвоил, что передовые модели обладают разными сильными сторонами. Для достижения рекордных результатов в бенчмарках по кодированию Conductor регулярно назначал Gemini 2.5 Pro и Claude Sonnet 4 на роли планировщиков высокого уровня, а GPT-5 подключал лишь на самом финальном этапе для написания окончательного оптимизированного кода. Демонстрируя поистине умную адаптивность, Conductor порой полностью отказывался от собственной роли, передавая весь процесс планирования целиком модели Gemini 2.5 Pro и позволяя ей диктовать подзадачи для остальной части пула.
Помимо математических и кодинговых бенчмарков, Sakana AI уже внедряет лежащую в основе архитектуру в практические инструменты корпоративного уровня. «Мы внутренне используем наши модели Fugu на базе технологии Conductor для различных практических задач предприятий: разработки ПО, глубоких исследований, разработки стратегий и даже визуальных задач, таких как генерация презентаций», — рассказал Тан.
Привносим оркестрацию в корпоративный сектор: Sakana Fugu
Хотя модель с 7B параметрами, описанная в исследовательской статье, была лишь экспериментальным чертежом и не находится в публичном доступе, Sakana AI превратила фреймворк Conductor в свой флагманский коммерческий ИИ-продукт — Sakana Fugu. Находясь сейчас в стадии бета-тестирования, Fugu представляет собой систему многоагентной оркестрации, доступную через стандартный API, совместимый с OpenAI.
Тан отметил, что Fugu ориентирована на «обширный рынок отраслей, где внедрение ИИ еще не принесло крупных приростов производительности из-за ограничений генерализации существующих жестко закодированных конвейеров, таких как финансы и оборона».
Для корпоративных разработчиков это обеспечивает бесшовную интеграцию в существующие приложения без головной боли по управлению множеством ключей API или ручной маршрутизации задач между различными вендорами. За интерфейсом API Fugu автоматизирует сложные топологии сотрудничества и распределения ролей по пулу моделей. Чтобы удовлетворить различные бизнес-потребности, Sakana выпустила два варианта: Fugu Mini, созданный для операций с низкими задержками, и Fugu Ultra, разработанный для максимальной производительности при выполнении ресурсоемких рабочих нагрузок.
Касаясь вопросов безопасности и контроля в отношении автономных агентов, запускающих невидимые рабочие процессы, Тан указал, что риски интерпретируемости функционально схожи со скрытыми следами рассуждений в современных ведущих закрытых API, а система управляется с помощью устоявшихся защитных механизмов для минимизации галлюцинаций.
Для корпоративных архитекторов, выбирающих между развертыванием RL-оркестрации и традиционной маршрутизации, решение часто сводится к инженерным ресурсам. «Мы верим, что абсолютная «золотая середина» наступает тогда, когда пользователи и их команды чувствуют, что тратят непропорционально много времени на направление своих базовых агентов», — заявил Тан. Тем не менее, он предостерег, что фреймворк нужен далеко не для всего, отметив: «Экономическое предложение локальной модели, запускаемой прямо на машине пользователя для простых запросов, перебить трудно».
По мере того как разнообразие специализированных открытых и закрытых ИИ-моделей продолжает расти, статические жестко закодированные конвейеры неизбежно устареют. Заглядывая в будущее, можно сказать, что эта динамическая оркестрация, вероятно, выйдет за пределы текстовых и кодовых сред. «Существует огромный потенциал для заполнения этого пробела, когда кросс-модальные фреймворки Conductor станут основой для более автономных, самокоординирующихся физических систем ИИ», — подытожил Тан.



