Kimi K2.6 запускает агентов на дни — и обнажает пределы корпоративной оркестровки
Большинство фреймворков для оркестрации создавались под агентов, которые работают считанные секунды или минуты. Теперь, когда агенты работают часами (а в некоторых случаях и днями), эти фреймворки начинают давать сбой.
Несколько провайдеров моделей, таких как Anthropic с Claude Code и OpenAI с Codex, внедрили раннюю поддержку долгосрочных (long-horizon) агентов посредством многосессионных задач, субагентов и фонового выполнения. Тем не менее, эти системы порой исходят из того, что агенты все еще действуют в рамках рабочих процессов с ограниченным временем выполнения, даже если они функционируют продолжительное время.
Провайдер моделей с открытым исходным кодом Moonshot AI намерен выйти за эти рамки со своей новой моделью Kimi K2.6.
В Moonshot заявляют, что модель спроектирована для непрерывного выполнения; к числу внутренних сценариев ее использования относятся агенты, которые работали часами, а в одном из случаев — пять дней подряд, автономно выполняя мониторинг и реагирование на инциденты.
Однако растущее распространение агентов такого типа обнажает критический пробел в оркестрации: большинство подобных фреймворков изначально не предназначались для непрерывного выполнения с сохранением состояния (stateful execution). Модели с открытым исходным кодом, такие как Kimi K2.6, которые опираются на стаи агентов (agent swarms), доказывают, что их подход к оркестрации близко подошел к задаче управления агентами с сохранением состояния.
Трудности оркестрации долго работающих агентов
Хотя некоторые компании предпочитают использовать собственные фреймворки оркестрации в своей агентской экосистеме, разработчики моделей и платформ для агентов осознают, что предоставление средств управления агентами остается конкурентным преимуществом.
Другие провайдеры моделей также начали экспериментировать с долгосрочными агентами, причем многие — через многосессионные задачи и фоновое выполнение. Например, Claude Code от Anthropic осуществляет оркестрацию с помощью ведущего агента, который направляет действия других агентов на основе заданных пользователем определений. Codex от OpenAI работает аналогичным образом.
Kimi K2.6 подходит к оркестрации с помощью улучшенной версии своих «стай агентов» (Agent Swarms), способных управлять до 300 субагентов, «выполняющих согласованные шаги одновременно по 4000 направлениям»,
Kimi K2.6 теперь доступна на Hugging Face, через свой API, Kimi Code и приложение Kimi.
Практики, экспериментирующие с долгосрочными агентами, отмечают, что уязвимость кроется гораздо глубже, чем могут исправить промпты.
Как выразился один из практиков, Максим Саплин, в своем блоге: «Это не значит, что субагенты бесполезны. Это значит, что оркестрация все еще хрупка. Прямо сейчас это выглядит скорее как проблема продукта и обучения, чем то, что можно решить написанием достаточно строгого промпта».
Проблема, которую создают долго работающие агенты, заключается в сложности поддержания их состояния, особенно с учетом того, что их окружение продолжает меняться в процессе работы. В ходе своего выполнения агент постоянно вызывает различные инструменты и API или обращается к разным базам данных. Большинство текущих агентов, которые могут отрабатывать за один-два запуска, тоже вызывают различные инструменты, но не дольше чем в течение минуты.
Марк Ламберт (Mark Lambert), директор по продукту в компании ArmorCode, создающей платформу автономной безопасности для предприятий, отметил в письме VentureBeat, что разрыв в сфере управления (governance) уже опережает развертывание технологий.
«Эти агентские системы теперь способны генерировать код и изменения в системе быстрее, чем большинство организаций успевает их проверять, исправлять или регулировать. Для этого потребуется нечто большее, чем просто дополнительное сканирование. Организациям понадобятся более надежные средства управления ИИ, которые обеспечат контекст, расстановку приоритетов и подотчетность, необходимые командам для контроля рисков, создаваемых Kimi и другими инструментами генеративного ИИ, до того, как они перерастут в накопленный ущерб», — подчеркнул Ламберт.
Долго работающие агенты также подвержены риску сбоя при отсутствии четкого механизма отката (rollback). Самое главное, что у агентов такого типа зачастую отсутствуют четко определенные задачи, и они динамически корректируют свои планы по ходу работы.
Кунал Ананд (Kunal Anand), директор по продукту в компании F5, рассказал VentureBeat в письме, что долгосрочные агенты представляют собой гораздо более масштабный архитектурный сдвиг, к которому оказалось готово большинство компаний.
«Мы прошли путь от скриптов к сервисам, от контейнеров к функциям, а теперь и к агентам как к постоянной инфраструктуре. Это порождает категории, для которых у нас еще нет подходящих названий: среда выполнения агентов (agent runtime), шлюз агентов (agent gateway), провайдер идентификации агентов (agent identity provider), сетка агентов (agent mesh). Парадигма API-шлюза трансформируется в нечто, что должно понимать цели и рабочие процессы, а не просто эндпоинты и глаголы», — пояснил Ананд.
Работа в течение 13 часов и даже пяти дней
Понимание принципов оркестрации агентов становится критически важным, поскольку возможности моделей начали опережать инновации в области оркестрации, даже несмотря на то что предприятия только начинают присматриваться к долгосрочным агентам.
В Moonshot AI заявляют, что модель создана для решения задач, отражающих «реальные вызовы, которые обычно требуют недель или месяцев совместных усилий человека». В отдельном техническом документе, предоставленном VentureBeat, компания утверждает, что K2.6 с нуля создала полноценный компилятор SysY за 10 часов — работу, которую они охарактеризовали как эквивалент усилий команды из четырех инженеров за два месяца — и прошла все 140 функциональных тестов без участия человека.
Команда задействовала K2.6 для решения сложных инженерных задач, включая модернизацию восьмилетнего открытого исходного кода механизма финансового сопоставления (financial matching engine). Инженеры Moonshot описали 13-часовой процесс выполнения, в ходе которого агент «прошел через 12 стратегий оптимизации, инициировав более 1000 вызовов инструментов для точного изменения более чем 4000 строк кода».
В Moonshot сообщили, что одна из их команд использовала K2.6 для создания агента, который автономно работал в течение пяти дней. Этот агент управлял мониторингом, реагированием на инциденты и системными операциями.



