Открытый агент для написания кода Cohere North Mini Code
Источник: VentureBeat · Sean Michael Kerner
У команд разработчиков, создающих конвейеры агентного программирования, появилась конкретная альтернатива с открытым исходным кодом для управляемых моделей, таких как Claude Fable 5, — альтернатива, которая работает на одном единственном H100. Обратная сторона медали: модель North Mini Code от Cohere, запущенная во вторник, в независимых тестов сгенерировала в три раза больше токенов вывода, чем сопоставимые модели. Из-за такой избыточности затраты на многократное увеличение объема в производственных рабочих процессах накапливаются.
Новая модель с открытым исходным кодом представляет собой смесь экспертов (MoE) с 30 миллиардами параметров, из которых 3 миллиарда параметров активны на каждый токен. Она создана для агентной разработки программного обеспечения, включая оркестровку субагентов, картирование архитектуры, ревью кода и работу с терминалом. Модель поддерживает окно контекста в 256 000 токенов с максимальной длиной генерации в 64 000 токенов и доступна на Hugging Face под лицензией Apache 2.0.
Что умеет North Mini Code
North Mini Code ориентирована на весь стек агентного программирования. Вот что делает эта модель и на чем она запускается.
Разработка программного обеспечения. Cohere создала North Mini Code специально для агентного программирования, а не адаптировала ее из базовой модели общего назначения. Она обладает интегрированными возможностями использования инструментов и поддерживает перемежающееся мышление (interleaved thinking), которое, по заявлению Cohere, повышает производительность при выполнении многошаговых агентных задач.
Картирование архитектуры и ревью кода. North Mini Code способна анализировать и картировать архитектуру систем, выявлять зависимости и проводить ревью кода в крупных кодовых базах. Благодаря окну контекста в 256 000 токенов она может удерживать масштабные проекты из множества файлов за один проход контекста.
Агентные задачи на базе терминала. Модель обучена для работы в средах терминала, включая взаимодействие с оболочкой (shell), скрипты пакетов и инструменты командной строки. Cohere провела ее бенчмаркинг на Terminal-Bench v2, который тестирует агентов в реальных средах терминала, а не на синтетических задачах генерации кода.
Как она создавалась
North Mini Code — это разреженная модель-смесь экспертов, содержащая 128 экспертов, из которых 8 активируются на каждый токен. Вычислительные требования во время инференса ближе к модели с 3 миллиардами параметров, несмотря на 30 миллиардов параметров в общей сложности. Ник Фросст (Nick Frosst), соучредитель Cohere, продемонстрировал ее работу на Mac Studio через MLX при примерно 20 гигабайтах оперативной памяти — на той же машине, которую он использует для собственной локальной работы с кодом.
Cohere обучила модель в два этапа контролируемой тонкой настройки (supervised fine-tuning) с последующим обучением с подкреплением по проверяемым наградам (reinforcement learning with verifiable rewards) на более чем 70 000 проверяемых задачах, охватывающих примерно 5 000 репозиториев (с дедупликацией относительно SWE-Bench).
Вместо оптимизации под один шаблон агента Cohere провела обучение на трех. SWE-Agent использует богатый CLI со специализированными командами. Mini-SWE-Agent использует единственный инструмент bash с выводом необработанной оболочки. OpenCode использует индивидуально типизированные инструменты, возвращающие структурированный JSON. Cohere сообщает о росте эффективности на 10 процентных пунктов при оценке OpenCode благодаря многоуровневому подходу (multi-harness), при этом сохраняя производительность SWE-Agent.
Каково ее место на рынке
North Mini Code выходит на рынок, на котором уже представлены Mistral Devstral Small 2, GitHub Copilot, Cursor и Claude Fable 5, и каждая из них имеет свои особенности с точки зрения затрат и развертывания.
Основное сравнение Cohere в бенчмарках проводится с Mistral Devstral Small 2 — плотной моделью с 24 миллиардами параметров. По результатам внутренних тестов вендора, Cohere заявляет о 2,8-кратном увеличении пропускной способности вывода и преимуществе на 30% по задержке между токенами по сравнению с Devstral Small 2 в идентичных конфигурациях оборудования. Cohere также утверждает в своем техническом блоге на Hugging Face, что по заявленным бенчмаркам North Mini Code превосходит модели с открытым исходным кодом, количество параметров которых в четыре раза больше, включая модели со 120 миллиардами параметров.
Artificial Analysis независимо ставит ее на восьмое место из 127 сопоставимых моделей с открытыми весами по скорости вывода (210 токенов в секунду), при этом время до получения первого токена составляет 0,25 секунды против медианного значения по классу в 1,95 секунды. Она занимает 18-е место из 127 в индексе интеллекта Artificial Analysis (Intelligence Index). Одно примечание из тех же данных: для завершения теста Intelligence Index модель сгенерировала 75 миллионов токенов вывода против медианного значения по классу в 25 миллионов. В высокопроизводительных агентных конвейерах эта избыточность оборачивается дополнительными затратами на инференс и задержками.
«Внезапно люди задумываются: хей, получаю ли я достаточную экономическую ценность от токенов модели?» — отметил Фросст во время презентационного видео. — «Локальное развертывание — это способ расширить возможности людей и сделать так, чтобы ИИ действительно работал на них».
GitHub Copilot, Cursor и Claude Code работают по модели оплаты за использование или по подписке без возможности локального развертывания (on-premises). Модель Claude Fable 5 от Anthropic, которая сейчас является самой мощной из общедоступных управляемых моделей для кодинга, стоит 50 долларов за миллион выходных токенов. Для Фросста эта модель — полная противоположность Fable.
«Она компактная, экономичная, с лицензией Apache 2.0 и локально развертываемая. Именно по этому пути должны развиваться LLM: компактные, с открытым исходным кодом, прозрачные и суверенные — в противовес крупным, дорогим, проприетарным и гегемонистским», — написал Фросст в своем посте в X.
Что это значит для бизнеса
Для команд, создающих производственные конвейеры агентного программирования, релиз North Mini Code вносит ясность в ряд решений, которые зрели на протяжении месяцев.
Специализированное агентное обучение теперь является базовым стандартом для оценки. Различие между моделями, дообученными для работы с кодом, и моделями, созданными специально для агентных рабочих процессов (с проверенными вызовами инструментов и надежностью на уровне различных обвязок), теперь является существенным фактором при принятии решений по конвейерам. Любой поставщик моделей, заявляющий о возможностях агентного кодинга, должен уметь ответить на вопрос: использовались ли при его обучении проверяемые агентные задачи или модель была адаптирована из базы общего назначения.
Избыточность — это скрытая стоимость конвейера, которую бенчмарки не показывают. Сервис Artificial Analysis зафиксировал, что North Mini Code генерирует в три раза больше токенов вывода, чем сопоставимые модели. Эта избыточность накапливается в виде затрат на инференс и задержек в высоконагруженных конвейерах. Тестирование пропускной способности на реальном объеме рабочих нагрузок — это именно тот этап оценки, который пропускают рейтинги бенчмарков.
Разделение цен на передовые решения теперь стало реальным архитектурным выбором. Fable 5 стоимостью 50 долларов за миллион выходных токенов и North Mini Code на одном H100 представляют собой подлинный компромисс между контролем затрат и локализацией данных с одной стороны, и накладными расходами на управляемую инфраструктуру — с другой. Команды, запускающие высокопроизводительные конвейеры агентного программирования, должны смоделировать оба пути затрат для своих реальных рабочих нагрузок, прежде чем делать выбор в пользу одного из них.



