Kimi K2.5 от Moonshot AI столкнулся с обеспокоенностью разработчиков
Спустя два дня после выпуска того, что аналитики называют самой мощной ИИ-моделью с открытым исходным кодом из когда-либо созданных, исследователи из китайской компании Moonshot AI вышли на Reddit, чтобы пообщаться с требовательной аудиторией. У базирующегося в Пекине стартапа были весомые причины для появления. Kimi K2.5 только что попала в заголовки СМИ в связи с сокращением отставания от американских гигантов в сфере ИИ и проверкой на прочность экспортных ограничений США на полупроводники. Однако разработчиков, ожидавших на r/LocalLLaMA — форуме, где инженеры делятся советами по запуску мощных языковых моделей на чем угодно, от единичного потребительского графического процессора (GPU) до небольшой стойки полупрофессионального оборудования — волновал совсем другой вопрос.
Они хотели знать, когда смогут реально начать ее использовать.
Трехчасовая сессия вопросов и ответов (AMA) превратилась в неожиданно откровенное окно в мир разработки передового искусственного интеллекта в 2026 году — не в ту глянцевую версию, что публикуется в корпоративных блогах, а в суровую реальность отладки сбоев, управления дрейфом индивидуальности и столкновения с фундаментальным противоречием, определяющим сегодняшний день open-source ИИ.
Компания Moonshot опубликовала веса модели для скачивания и кастомизации всеми желающими. Размер файлов составляет примерно 595 гигабайт. Для большинства разработчиков в ветке форума эта открытость осталась лишь теоретической.
В сессии приняли участие три сотрудника Moonshot под никами ComfortableAsk4494, zxytim и ppwwyyxx. В рамках примерно 187 комментариев они ответили на вопросы об архитектуре, методологии обучения и философской загадке того, что именно наделяет модель ИИ ее «душой». Они также обрисовали картину того, откуда придет следующий этап прогресса — и дело здесь вовсе не в «простом увеличении числа параметров».
Разработчики попросили уменьшить модели до размеров, пригодных для реального запуска, и в Moonshot признали наличие проблемы
Самая первая волна вопросов воспринимала Kimi K2.5 не столько как прорыв, сколько как логистическую головную боль.
Один из пользователей прямо спросил, почему Moonshot не создает уменьшенные версии моделей параллельно с флагманом. «Маленькие размеры вроде 8B, 32B, 70B — это отличные точки с точки зрения плотности интеллекта», — написал он. Другой отметил, что огромными моделями стало трудно восхищаться, поскольку многие разработчики просто не могут их запустить. Третий указал на американских конкурентов в качестве ориентиров по размеру, запросив ориентированные на написание кода варианты, способные поместиться на скромных GPU.
Команда Moonshot не стала тут же анонсировать модель поменьше. Тем не менее они признали этот спрос так, будто жалоба была им хорошо знакома. «Запросы приняты к сведению!» — написал один из соорганизаторов. Другой отметил, что коллекция моделей Moonshot уже включает некоторые небольшие модели типа «смесь экспертов» (Mixture-of-Experts) на Hugging Face, хотя и предостерег, что малые и большие модели часто требуют совершенно разных инженерных вложений.
Самый показательный ответ прозвучал, когда пользователя спросили, не планирует ли Moonshot создать что-то в районе 100 миллиардов параметров, оптимизированное для локального использования. Команда Kimi в ответ предложила иной компромисс: модель с 200 или 300 миллиардами параметров, которая смогла бы оставаться выше так называемого «порога юзабилити» при решении множества задач.
Этот ответ отразил дилемму, с которой сталкиваются лаборатории открытых весов. Модель на 200–300 миллиардов параметров расширила бы доступ по сравнению с триллионными системами, но она все равно подразумевает конфигурации с несколькими GPU или агрессивную квантизацию. Разработчики в ветке просили не о «некотором уменьшении». Они просили о моделях, размер которых соответствует имеющемуся у них железу, и о дорожной карте, где локальное развертывание рассматривается как первостередное ограничение, а не как второстепенное хобби.
Команда заявила, что законы масштабирования достигают пределов эффективности, и указала на иной путь прогресса
По мере того как обсуждение в ветке продвигалось дальше жалоб на аппаратное обеспечение, оно переключилось на то, что многие исследователи сегодня считают центральным вопросом для больших языковых моделей: не начинают ли законы масштабирования плато?
Один из участников прямо спросил, не «уперлось ли масштабирование в стену». Представитель Kimi ответил диагнозом, который становится все более распространенным в индустрии. «Количество высококачественных данных не растет так быстро, как доступные вычислительные мощности, — написал он, — поэтому масштабирование в рамках традиционного метода „предсказания следующего токена на основе интернет-данных“ будет приносить все меньше улучшений».
Затем команда предложила свой вариант обходного пути. Они указали на Agent Swarm (роботизированный рой агентов) — способность Kimi K2.5 координировать до 100 суб-агентов, работающих параллельно, как на форму «масштабирования на этапе тестирования», которая может открыть новый путь к наращиванию возможностей. По мнению команды, масштабирование не обязательно должно сводиться лишь к более масштабным запускам предварительного обучения. Оно также может означать увеличение объема структурированной работы, выполняемой во время инференса, с последующим внедрением этих инсайтов обратно в обучение через обучение с подкреплением (RL).
«Возможно появление новых парадигм масштабирования, — написал один из соорганизаторов. — Если заглядывать в будущее, весьма вероятно появление модели, которая обучается с меньшим количеством человеческих априорных знаний или даже вообще без них».
Это утверждение подразумевает, что единица прогресса может смещаться от подсчета параметров и кривых потерь при претренинге в сторону систем, способных планировать, делегировать и верифицировать — используя инструменты и суб-агенты в качестве строительных блоков, а не полагаясь на один-единственный массивный проход вперед.
Agent Swarm работает за счет изоляции памяти каждого суб-агента от координатора
На бумаге Agent Swarm звучит как знакомая идея в новой обертке: множество ИИ-агентов сотрудничают для решения задачи. Сессия AMA выявила более важные детали: куда уходит память, как происходит координация и почему оркестрация не скатывается в информационный шум.
Один из разработчиков поднял классическую проблему мультиагентных систем. При масштабе в 100 суб-агентов агент-координатор часто становится узким местом как с точки зрения задержек, так и в плане того, что в сообществе называют «гниением контекста» (context rot) — деградацией производительности, которая происходит по мере заполнения истории диалога внутренним «мусором» и трассировками инструментов до тех пор, пока модель не теряет нить рассуждений.
Соорганизатор Kimi ответил проектным решением, которое имеет решающее значение для любого, кто создает агентные системы в корпоративной среде. Суб-агенты работают со своей собственной рабочей памятью и отправляют результаты обратно координатору, вместо того чтобы передавать все подряд в общий контекст. «Это позволяет нам масштабировать общую длину контекста в совершенно новом измерении!» — написал он.
Другой разработчик продолжил расспросы об оценках производительности. Moonshot публично заявляла, что Agent Swarm способен достичь примерно 4,5-кратного ускорения на подходящих рабочих процессах, однако скептики интересовались, не отражает ли эта цифра просто степень параллелизуемости конкретной задачи. Команда согласилась: все зависит от ситуации. В некоторых случаях система решает, что задача не требует параллельных агентов, и избегает затрат лишних вычислительных ресурсов. Они также описали бюджеты токенов для суб-агентов как нечто, чем должен управлять координатор, назначая каждому суб-агенту задачу подходящего размера.
Если читать это не как маркетинг, а как инженерный отчет, Moonshot описывала знакомый корпоративный паттерн: держать плоскость управления чистой, ограничивать вывод рабочих процессов и не допускать перегрузки координатора логами, которые он не в состоянии переварить.
Вычислительные мощности для обучения с подкреплением будут продолжать расти, особенно для обучения агентов
Наиболее существенный сдвиг, на который намекали в ходе AMA, касался не новых результатов в бенчмарках. Это было заявление о приоритетах.
Один из вопросов заключался в том, переносит ли Moonshot вычислительные мощности с предварительного обучения «Системы 1» на обучение с подкреплением «Системы 2» — сокращение для перехода от широкого обучения на паттернах к обучению, которое явно поощряет рассуждения и правильное поведение при выполнении многошаговых задач. Представитель Kimi ответил, что вычислительные мощности для обучения с подкреплением будут продолжать расти, и намекнул на появление новых целевых функций RL, «особенно в области агентов».
Эту реплику можно рассматривать как дорожную карту. По мере того как модели все активнее используют инструменты и декомпозируют задачи, лаборатории будут тратить все большую часть своего бюджета на обучение моделей правильному поведению в роли агентов, а не просто на предсказание токенов.
Для бизнеса это имеет значение, поскольку улучшения на базе обучения с подкреплением часто сопровождаются компромиссами. Модель может стать более решительной, активнее использовать инструменты или сильнее ориентироваться на сигналы вознаграждения, которые плохо соотносятся с ожиданиями компании. В рамках AMA не утверждалось, что Moonshot решила эти проблемы. Тем не менее там дали понять, что команда рассматривает обучение с подкреплением как рычаг, который в следующем цикле будет иметь куда большее значение, чем простая покупка дополнительных GPU.
Отвечая на вопрос о разнице в вычислительных мощностях между Moonshot и американскими лабораториями, обладающими огромными парками GPU, команда была откровенна. «Я бы сказал, что разрыв не сокращается, — написал один из соорганизаторов. — Но сколько вообще нужно вычислительных мощностей для достижения AGI [искусственного общего интеллекта]? Посмотрим».
Другой участник высказался в более философском ключе: «Существует слишком много факторов, влияющих на доступные вычисления. Но несмотря ни на что, инновации любят ограничения».
Иногда модель называет себя Claude, и в Moonshot объяснили, почему так происходит
Релизы моделей с открытыми весами теперь неизбежно сопровождаются подозрениями: не слишком ли много модель почерпнула у конкурентов? Эти подозрения могут быстро перерасти в обвинения в дистилляции, когда один ИИ учится на результатах работы другого ИИ.
Один из пользователей поднял самый неприятный вопрос, циркулирующий в кругах разработчиков открытых моделей — что K2.5 иногда идентифицирует себя как «Claude», флагманскую модель от Anthropic. Подтекст указывал на серьезное заимствование.
Moonshot не стала отмахиваться от этого поведения. Вместо этого они описали условия, при которых оно возникает. По словам команды, при правильном системном промпте модель с высокой вероятностью ответит «Kimi», особенно в режиме размышлений. Однако при пустом системном промпте модель сваливается в то, что команда назвала «неопределенной областью», что отражает распределения данных предварительного обучения, а не осознанный выбор при обучении.
Затем они предложили конкретное объяснение, связанное с принятым решением в ходе обучения. Представители Moonshot заявили, что в процессе претренинга они использовали апсэмплинг (повышающую дискретизацию) свежих интернет-данных о программировании, и эти данные кажутся более тесно связанными с токеном «Claude» — по всей видимости, потому, что разработчики, обсуждающие ИИ-ассистентов для кодинга, часто ссылаются на модель Anthropic.
Команда отвергла обвинения в дистилляции результатами бенчмарков. «Фактически K2.5 во многих бенчмарках превосходит Claude, — написал один из соорганизаторов. — HLE, BrowseComp, MMMU Pro, MathVision — и это лишь некоторые из них».
Для корпоративных пользователей важна не интернет-драма. Важно то, что дрейф идентичности — это реальный сбой в работе, и организации часто могут смягчить его с помощью контроля системных промптов, а не пуская самоопределение модели на самотек. В ходе AMA управление промптами рассматривалось не как изящное дополнение к пользовательскому интерфейсу, а как элемент операционной гигиены.
Пользователи заявили, что модель потеряла индивидуальность, и в Moonshot признали, что «душу» трудно измерить
Повторяющейся темой в ветке было то, что стиль письма K2.5 кажется более обезличенным по сравнению с предыдущими моделями Kimi. Пользователи описывали ее скорее как стандартного «полезного ассистента» — тон, который многие разработчики сегодня считают дефолтной личностью моделей, прошедших интенсивное пост-обучение. Один из пользователей сказал, что обожает индивидуальность Kimi K2, и поинтересовался, что с ней случилось.
Соорганизатор Kimi признал, что каждый новый релиз влечет за собой определенные изменения личности, и охарактеризовал индивидуальность как нечто субъективное и трудно поддающееся оценке. «Это довольно сложная проблема», — написали они. Команда сообщила, что намерена исправить эту проблему и сделать характер модели более настраиваемым для каждого пользователя.
В ходе другого обсуждения — о том, не ущемляет ли усиление навыков программирования творческое письмо и эмоциональный интеллект — представитель Kimi возразил, что при достаточном размере модели никакого внутреннего конфликта не возникает. Но поддерживать «литературный вкус» от версии к версии сложно, поскольку модель вознаграждения постоянно эволюционирует. Команда полагается на внутренние бенчмарки (своего рода мета-оценку) для отслеживания успехов в области творческого письма и соответствующей корректировки моделей вознаграждения.
Другой ответ зашел еще дальше, используя язык, который может показаться необычным в спецификации корпоративного ИИ, но привычен для людей, использующих эти инструменты ежедневно. Команда заговорила о «душе» модели вознаграждения и намекнула на возможность сохранения «состояния» пользователя, отражающего его вкусы, с последующим использованием этого состояния для настройки генерации модели.
Этот диалог указывает на рубеж развития продукта, который предприятия часто недооценивают. Дрейф стилистики — это не просто эстетика. Он может изменить то, как модель объясняет решения, как она перестраховывается, как справляется с двусмысленностью и как взаимодействует с клиентами и сотрудниками. Сессия AMA дала понять, что лаборатории все чаще рассматривают «вкус» как переменную выравнивания и фактор дифференциации, однако его по-прежнему трудно измерить и еще труднее удерживать на неизменном уровне от одного цикла обучения к другому.
Отладка оказалась негламурной правдой передовых исследований в области ИИ
Самое показательное озарение касательно внутренней культуры прозвучало в ответ на вопрос о сюрпризах в процессе обучения и обучения с подкреплением. Соорганизатор ответил всего одним словом, выделив его жирным шрифтом для придания весомости: отладка (debugging).
«Независимо от того, идет ли речь о предварительном обучении или о пост-обучении, одна вещь неизменно выходит на первый план: отладка», — написал он.
Этот комментарий ярко осветил сквозную тему всей сессии. Когда zxytim попросили рассказать об их методологии «лестницы масштабирования» для оценки новых идей при различных размерах моделей, он поделился анекдотом о неудачах. В свое время команда спешила внедрить Kimi Linear — экспериментальную архитектуру линейного внимания — в предыдущее поколение моделей. На определенном масштабе она провалила «лестницу масштабирования». Они сделали шаг назад и прошли через то, что соорганизатор назвал «тяжелым процессом отладки», и спустя месяцы все-таки заставили ее работать.
«Статистически большинство идей, работающих в малом масштабе, не пройдут лестницу масштабирования, — продолжили они. — Те же, которые проходят, обычно просты, эффективны и имеют математическое обоснование. Исследования в основном сводятся к управлению неудачами, а не к празднованию успехов».
Для технических руководителей, оценивающих ИИ-вендоров, это признание весьма поучительно. Передовые возможности не рождаются лишь благодаря изящным прорывам. Они возникают в результате неустанной локализации сбоев и благодаря организационной культуре, готовой тратить месяцы на решение проблем, которые в итоге могут и не сработать.
В Moonshot намекнули на то, что ждет нас в будущем, включая линейное внимание и непрерывное обучение
Сессия AMA также послужила тонким тизером следующего поколения Kimi.
Разработчики интересовались, перенимет ли Kimi K3 исследования Moonshot в области линейного внимания, которые направлены на более эффективную обработку длинного контекста по сравнению с традиционными механизмами внимания. Члены команды дали понять, что линейные подходы рассматриваются как серьезный вариант. «Весьма вероятно, что Kimi Linear станет частью K3, — написал один из них. — Мы также включим и другие оптимизации».
В ходе другого обсуждения соорганизатор предсказал, что K3 «будет намного лучше — если не в 10 раз лучше — чем K2.5».
Команда также выделила непрерывное обучение (continual learning) в качестве активно изучаемого направления, намекнув на будущее, в котором агенты смогут эффективно работать на более длинных временных отрезках — что критически важно для бизнеса, если агентам предстоит справляться с долгосрочными проектами, а не с задачами в один диалоговый шаг. «Мы верим, что непрерывное обучение повысит агентские возможности и позволит агентам эффективно работать гораздо дольше», — написал один из соорганизаторов.
Что касается конкретно Agent Swarm, то команда заявила о планах сделать оркестрационный каркас доступным для разработчиков после того, как система станет более стабильной. «Надеемся, очень скоро», — добавили они.
Что сессия AMA показала о состоянии открытого ИИ в 2026 году
Сессия не разрешила все вопросы. Некоторые из наиболее технических моментов — касающиеся рецептов мультимодального обучения, защиты от хакинга вознаграждений и управления данными — были отложены до выхода грядущего технического отчета. В этом нет ничего необычного. Многие лаборатории теперь считают наиболее судьбоносные в операционном плане детали конфиденциальными.
Тем не менее ветка наглядно продемонстрировала, куда сместились реальные баталии в сфере ИИ. Имеющий наибольшее значение разрыв — это не пропасть между Китаем и США или между открытыми и закрытыми системами. Это разрыв между тем, что обещают модели, и тем, что системы реально способны предоставить.
Оркестрация становится самим продуктом. Moonshot выпускает не просто модель. Она транслирует мировоззрение, согласно которому следующие качественные скачки будут обеспечены агентами, способными разделять работу, использовать инструменты и быстро выдавать структурированные результаты. Открытые веса сталкиваются с суровой реальностью «железа», поскольку разработчики требуют открытости, работающей локально, а не той, что требует дата-центра. Поле боя смещается от чистого интеллекта к надежности — от победы в бенчмарке с отрывом в два пункта до отладки дисциплины вызова инструментов, управления памятью в мультиагентных процессах и сохранения трудно поддавающегося количественной оценке «вкуса», который определяет, доверяют ли пользователи результату.
Представители Moonshot появились на Reddit на волне громкого релиза и нарастающего геополитического дискурса. Ожидавших их там разработчиков волновал куда более практичный вопрос: когда слово «открытый» наконец начнет означать «пригодный для использования»?
В этом смысле сессия AMA не просто прорекламировала Kimi K2.5. Она предложила срез индустрии, находящейся в переходном состоянии: от масштабных моделей к более структурированным вычислениям, от закрытых API к открытым весам, которые все еще требуют серьезных инженерных усилий для развертывания, и от празднования побед к управлению неудачами.
«Исследования в основном сводятся к управлению неудачами», — написал один из инженеров Moonshot. К концу обсуждения в ветке стало очевидно, что развертывание систем — точно так же.



