Kimi K2.7-Code сокращает количество токенов на 30%, но обходит стороной независимые бенчмарки

Kimi K2.7-Code сокращает количество токенов на 30%, но обходит стороной независимые бенчмарки

Источник: VentureBeat · Sean Michael Kerner

Компания Moonshot AI выпустила на этой неделе Kimi K2.7-Code — обновление с открытым исходным кодом для своего семейства моделей для написания кода K2, заявив об оптимизации процесса рассуждений и двузначном приросте производительности.

K2.7-Code построена на той же архитектуре «микширования экспертов» (Mixture-of-Experts) с триллионом параметров, что и ее предшественница K2.6, и интегрируется через совместимый с OpenAI API, что немаловажно для команд, уже использующих K2.6 в рабочих шлюзах.

Когда в апреле состоялся релиз K2.6, она возглавила еженедельный рейтинг LLM на OpenRouter — чарт, основанный на реальных решениях разработчиков по маршрутизации через API, а не на самостоятельно заявленных баллах в бенчмарках.

По заявлению Moonshot AI, модель K2.7-Code решает проблему «сверхразмышлений» (overthinking), сокращая расход токенов на рассуждения на 30% по сравнению с K2.6. Этот показатель напрямую влияет на затраты на инференс для команд, запускающих агентские воркфлоу. Сохранится ли этот прирост эффективности на независимых бенчмарках — вопрос, который эксперты уже начали открыто обсуждать.

Что представляет собой Kimi K2.7-Code

K2.7-Code выпущена под модифицированной лицензией MIT, а ее веса доступны на HuggingFace. Модель развертывается через vLLM или SGLang. Она работает исключительно в режиме рассуждений и не поддерживает настройку температуры — Moonshot AI зафиксировала ее на уровне 1.0, что означает невозможность для команд настраивать детерминизм вывода так же, как это делается с другими моделями.

Главное отличие от K2.6 заключается в том, как модель генерирует низкоуровневый код. Если K2.6 создавала реализации путем обертывания существующих библиотек и маршрутизации через устоявшиеся фреймворки, то K2.7-Code пишет реализации напрямую. По утверждению Moonshot AI, это обеспечивает более надежную генерализацию для Rust, Go и Python, а также для таких задач, как фронтенд-разработка, DevOps и оптимизация производительности.

Что касается результатов бенчмарков, Moonshot AI заявляет о приросте на 21,8% в Kimi Code Bench v2, на 11% в Program Bench и на 31,5% в MLS Bench Lite. Все три бенчмарка являются проприетарными и проводятся самой Moonshot AI. Модель не была отправлена на DeepSWE — независимый кодинговый бенчмарк, который дает 70-балльный разброс между моделями (по сравнению с 30-балльным разбросом у SWE-Bench Pro), что делает его более точным индикатором для команд, настраивающих системы маршрутизации моделей.

Честнее, но слабее

Картина за пределами собственных бенчмарков Moonshot выглядит более сложной.

Исследователь Эллиот Арлидж (Elliot Arledge) протестировал K2.7-Code в сравнении с K2.6 и Claude Fable 5 на KernelBench-Hard — публичном бенчмарке, ориентированном на оптимизацию ядер GPU, и опубликовал полные логи своих запусков на kernelbench.com.

«K2.7 честнее, но не мощнее», — написал Арлидж в X.

В пяти из шести задач K2.7-Code создала настоящие оригинальные ядра Triton там, где K2.6 использовала библиотечные обертки. Два из этих ядер дали сбой из-за багов самой модели. Результат для ядра MoE ухудшился по сравнению с показателем K2.6 (0,222), упав до 0,157.

«Fable, для справки, занимает первое место в каждой ячейке, которую она не проваливает честно», — отметил Арлидж.

Сугумаран Баласубраманиян (Sugumaran Balasubramaniyan), разработчик, создавший маршрутизатор моделей и задач для платформы Hermes Agent с использованием DeepSWE в качестве опорного сигнала, публично отреагировал на релиз K2.7-Code и напрямую раскритиковал выбор бенчмарков компанией Moonshot AI.

«При всем уважении, каждая модель «улучшается» на двузначные проценты на собственном наборе тестов», — написал Баласубраманиян в X.

Он отметил, что K2.6 набрала 24% в DeepSWE, разделив результат с GPT-5.4-mini, и поинтересовался, собирается ли Moonshot AI отправить K2.7-Code на тот же бенчмарк.

Баласубраманиян рассказал, что у него ушло 13 раундов ревью на то, чтобы правильно настроить данные бенчмарка для своего маршрутизатора, и добавил, что стал бы направлять кодинговые задачи на K2.7-Code, если независимые цифры подтвердятся.

Что это значит для бизнеса

Прирост эффективности токенов применим незамедлительно. Команды, использующие K2.6 в продакшене, могут заменить ее на K2.7-Code через совместимый с OpenAI API и рассчитывать на снижение затрат на инференс в агентских воркфлоу без изменения архитектуры. Сокращение токенов на размышления на 30% — это собственная цифра Moonshot, однако путь интеграции достаточно безопасен, чтобы протестировать ее на собственных нагрузках перед окончательным внедрением.

Практический вопрос заключается в том, сохранятся ли эти показатели эффективности для распределения задач конкретной команды. Запуск K2.7-Code на собственных рабочих нагрузках перед корректировкой весов шлюза — самый безопасный способ это выяснить.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.