Открытый агент для написания кода Cohere North Mini Code

Открытый агент для написания кода Cohere North Mini Code

Источник: VentureBeat · Sean Michael Kerner

У команд разработчиков, создающих конвейеры агентного программирования, появилась конкретная альтернатива с открытым исходным кодом для управляемых моделей, таких как Claude Fable 5, — альтернатива, которая работает на одном единственном H100. Обратная сторона медали: модель North Mini Code от Cohere, запущенная во вторник, в независимых тестов сгенерировала в три раза больше токенов вывода, чем сопоставимые модели. Из-за такой избыточности затраты на многократное увеличение объема в производственных рабочих процессах накапливаются.

Новая модель с открытым исходным кодом представляет собой смесь экспертов (MoE) с 30 миллиардами параметров, из которых 3 миллиарда параметров активны на каждый токен. Она создана для агентной разработки программного обеспечения, включая оркестровку субагентов, картирование архитектуры, ревью кода и работу с терминалом. Модель поддерживает окно контекста в 256 000 токенов с максимальной длиной генерации в 64 000 токенов и доступна на Hugging Face под лицензией Apache 2.0.

Что умеет North Mini Code

North Mini Code ориентирована на весь стек агентного программирования. Вот что делает эта модель и на чем она запускается.

Разработка программного обеспечения. Cohere создала North Mini Code специально для агентного программирования, а не адаптировала ее из базовой модели общего назначения. Она обладает интегрированными возможностями использования инструментов и поддерживает перемежающееся мышление (interleaved thinking), которое, по заявлению Cohere, повышает производительность при выполнении многошаговых агентных задач.

Картирование архитектуры и ревью кода. North Mini Code способна анализировать и картировать архитектуру систем, выявлять зависимости и проводить ревью кода в крупных кодовых базах. Благодаря окну контекста в 256 000 токенов она может удерживать масштабные проекты из множества файлов за один проход контекста.

Агентные задачи на базе терминала. Модель обучена для работы в средах терминала, включая взаимодействие с оболочкой (shell), скрипты пакетов и инструменты командной строки. Cohere провела ее бенчмаркинг на Terminal-Bench v2, который тестирует агентов в реальных средах терминала, а не на синтетических задачах генерации кода.

Как она создавалась

North Mini Code — это разреженная модель-смесь экспертов, содержащая 128 экспертов, из которых 8 активируются на каждый токен. Вычислительные требования во время инференса ближе к модели с 3 миллиардами параметров, несмотря на 30 миллиардов параметров в общей сложности. Ник Фросст (Nick Frosst), соучредитель Cohere, продемонстрировал ее работу на Mac Studio через MLX при примерно 20 гигабайтах оперативной памяти — на той же машине, которую он использует для собственной локальной работы с кодом.

Cohere обучила модель в два этапа контролируемой тонкой настройки (supervised fine-tuning) с последующим обучением с подкреплением по проверяемым наградам (reinforcement learning with verifiable rewards) на более чем 70 000 проверяемых задачах, охватывающих примерно 5 000 репозиториев (с дедупликацией относительно SWE-Bench).

Вместо оптимизации под один шаблон агента Cohere провела обучение на трех. SWE-Agent использует богатый CLI со специализированными командами. Mini-SWE-Agent использует единственный инструмент bash с выводом необработанной оболочки. OpenCode использует индивидуально типизированные инструменты, возвращающие структурированный JSON. Cohere сообщает о росте эффективности на 10 процентных пунктов при оценке OpenCode благодаря многоуровневому подходу (multi-harness), при этом сохраняя производительность SWE-Agent.

Каково ее место на рынке

North Mini Code выходит на рынок, на котором уже представлены Mistral Devstral Small 2, GitHub Copilot, Cursor и Claude Fable 5, и каждая из них имеет свои особенности с точки зрения затрат и развертывания.

Основное сравнение Cohere в бенчмарках проводится с Mistral Devstral Small 2 — плотной моделью с 24 миллиардами параметров. По результатам внутренних тестов вендора, Cohere заявляет о 2,8-кратном увеличении пропускной способности вывода и преимуществе на 30% по задержке между токенами по сравнению с Devstral Small 2 в идентичных конфигурациях оборудования. Cohere также утверждает в своем техническом блоге на Hugging Face, что по заявленным бенчмаркам North Mini Code превосходит модели с открытым исходным кодом, количество параметров которых в четыре раза больше, включая модели со 120 миллиардами параметров.

Artificial Analysis независимо ставит ее на восьмое место из 127 сопоставимых моделей с открытыми весами по скорости вывода (210 токенов в секунду), при этом время до получения первого токена составляет 0,25 секунды против медианного значения по классу в 1,95 секунды. Она занимает 18-е место из 127 в индексе интеллекта Artificial Analysis (Intelligence Index). Одно примечание из тех же данных: для завершения теста Intelligence Index модель сгенерировала 75 миллионов токенов вывода против медианного значения по классу в 25 миллионов. В высокопроизводительных агентных конвейерах эта избыточность оборачивается дополнительными затратами на инференс и задержками.

«Внезапно люди задумываются: хей, получаю ли я достаточную экономическую ценность от токенов модели?» — отметил Фросст во время презентационного видео. — «Локальное развертывание — это способ расширить возможности людей и сделать так, чтобы ИИ действительно работал на них».

GitHub Copilot, Cursor и Claude Code работают по модели оплаты за использование или по подписке без возможности локального развертывания (on-premises). Модель Claude Fable 5 от Anthropic, которая сейчас является самой мощной из общедоступных управляемых моделей для кодинга, стоит 50 долларов за миллион выходных токенов. Для Фросста эта модель — полная противоположность Fable.

«Она компактная, экономичная, с лицензией Apache 2.0 и локально развертываемая. Именно по этому пути должны развиваться LLM: компактные, с открытым исходным кодом, прозрачные и суверенные — в противовес крупным, дорогим, проприетарным и гегемонистским», — написал Фросст в своем посте в X.

Что это значит для бизнеса

Для команд, создающих производственные конвейеры агентного программирования, релиз North Mini Code вносит ясность в ряд решений, которые зрели на протяжении месяцев.

Специализированное агентное обучение теперь является базовым стандартом для оценки. Различие между моделями, дообученными для работы с кодом, и моделями, созданными специально для агентных рабочих процессов (с проверенными вызовами инструментов и надежностью на уровне различных обвязок), теперь является существенным фактором при принятии решений по конвейерам. Любой поставщик моделей, заявляющий о возможностях агентного кодинга, должен уметь ответить на вопрос: использовались ли при его обучении проверяемые агентные задачи или модель была адаптирована из базы общего назначения.

Избыточность — это скрытая стоимость конвейера, которую бенчмарки не показывают. Сервис Artificial Analysis зафиксировал, что North Mini Code генерирует в три раза больше токенов вывода, чем сопоставимые модели. Эта избыточность накапливается в виде затрат на инференс и задержек в высоконагруженных конвейерах. Тестирование пропускной способности на реальном объеме рабочих нагрузок — это именно тот этап оценки, который пропускают рейтинги бенчмарков.

Разделение цен на передовые решения теперь стало реальным архитектурным выбором. Fable 5 стоимостью 50 долларов за миллион выходных токенов и North Mini Code на одном H100 представляют собой подлинный компромисс между контролем затрат и локализацией данных с одной стороны, и накладными расходами на управляемую инфраструктуру — с другой. Команды, запускающие высокопроизводительные конвейеры агентного программирования, должны смоделировать оба пути затрат для своих реальных рабочих нагрузок, прежде чем делать выбор в пользу одного из них.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.