Cohere добивается квантования без потерь и встроенного цитирования с первой полностью открытой моделью Command A+ под лицензией Apache 2.0
Источник: VentureBeat · Carl Franzen
Канадская ИИ-лаборатория Cohere недавно наделала немало шума, объявив об объединении с немецким ИИ-стартапом Aleph Alpha. Теперь же компания приготовила еще более масштабный сюрприз для корпоративных разработчиков по всему миру: сегодня организация, сооснователем которой выступает бывший сотрудник Google и соавтор работы «Attention Is All You Need» Эйдан Гомес (Aidan Gomez), представила Command A+ — высокооптимизированную языковую модель с 218 миллиардами параметров, созданную специально для комплексного логического вывода (reasoning), мультимодальной обработки документов и агентских рабочих процессов.
Самым важным аспектом этого релиза являются не только возможности модели, но и ее доступность.
Выпустив веса модели в свободный доступ на популярном репозитории ИИ-кода Hugging Face под крайне мягкой лицензией с открытым исходным кодом Apache 2.0 (что для компании происходит впервые, судя по посту Гомеса, ныне занимающего пост генерального директора Cohere, в X), Cohere делает ставку на «суверенный ИИ». Эта концепция подразумевает, что предприятия, правительства и разработчики должны иметь возможность запускать, контролировать и адаптировать передовой ИИ полностью в рамках собственных защищенных сред без ущерба для производительности.
Разреженная архитектура с экстремальной квантизацией
На архитектурном уровне Command A+ представляет собой серьезную эволюцию предыдущих плотных (dense) моделей Cohere. Это трансформер Decoder-only типа Sparse Mixture-of-Experts (разреженная смесь экспертов, MoE).
Хотя модель содержит относительно скромные 218 миллиардов параметров в общей сложности, на любом конкретном этапе генерации задействуется еще меньше — всего 25 миллиардов. Модель имеет гораздо более легкую структуру и требует значительно меньше вычислительных ресурсов для инференса (обслуживания модели в производственных средах для конечных пользователей или через агентов), чем проприетарные американские гиганты вроде GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic, которые, по оценкам сторонних наблюдателей, насчитывают триллионы параметров.
Эта разреженная архитектура является ключом к эффективности модели. Проще говоря, модель MoE перенаправляет входящие запросы только тем конкретным нейросетевым «экспертам», которые лучше всего подходят для их обработки, оставляя остальную часть модели неактивной.
Это привычный подход, которому в настоящее время следуют большинство ведущих языковых моделей (LLM). Он позволяет моделям сохранять обширную базу знаний и возможности нюансированного рассуждения гигантских систем, обеспечивая при этом более высокую скорость и меньшие требования к вычислительным ресурсам и энергии, свойственные гораздо более мелким моделям, поскольку в любой момент времени активируется лишь доля параметров.
Однако в модели Command A+ компания Cohere пошла еще дальше в повышении эффективности, уделив особое внимание аппаратной оптимизации посредством квантизации — процесса, который сжимает объем памяти модели за счет снижения точности ее параметров.
Command A+ доступна в 16-битном (BF16), 8-битном (FP8) и сильно сжатом 4-битном (W4A4) форматах.
Квантизация W4A4 — это технический центр данного релиза. Обычно модели рассуждения страдают от чрезмерного «налога на квантизацию», когда сжатие модели приводит к заметному ухудшению качества решения сложных задач.
Cohere смягчила этот эффект, квантизировав до 4 бит только экспертов MoE, в то время как критически важные пути внимания (attention pathways) были сохранены с полной точностью, дополненные методом под названием Quantization-Aware Distillation (дистилляция с учетом квантизации).
Результатом стало практически безпотерьное сжатие, позволяющее этой массивной модели работать на одном графическом процессоре NVIDIA Blackwell B200 или всего на двух GPU NVIDIA H100.
Прирост скорости впечатляет не меньше. Согласно данным о производительности, опубликованным компанией, квантизация W4A4 при низком уровне параллелизма обеспечивает скорость 375 токенов в секунду (TOPS) с задержкой времени до первого токена (TTFT) всего 113 миллисекунд. Это означает увеличение скорости генерации до 63% и снижение задержки на 17% по сравнению с предыдущей моделью рассуждения Command A.
Кроме того, компания Cohere полностью переработала токенизатор модели. Токенизаторы разбивают текст на фрагменты, которые обрабатываются ИИ-моделями. Новый токенизатор высоко оптимизирован для глобального корпоративного использования и имеет встроенную поддержку 48 языков.
Что еще важнее, он значительно повышает эффективность токенизации для неевропейских языков, сокращая количество токенов, необходимых для генерации ответов на арабском языке на 20%, на японском — на 18%, а на корейском — на 16%. Поскольку затраты на инференс рассчитываются на один токен, это напрямую приводит к снижению операционных расходов для глобальных, многоязычных или неанглоязычных развертываний.
Агентские рабочие процессы и высокие показатели на бенчмарках в математике и специализированных областях
Хотя чистая скорость и размер определяют развертывание, полезность модели определяется ее возможностями как продукта. Command A+ создавалась специально для «агентских» задач — рабочих процессов, в которых ИИ действует автономно или полуавтономно, использует внешние инструменты, запрашивает базы данных и синтезирует информацию в несколько этапов.
Скачок показателей в бенчмарках по сравнению с предыдущим поколением весьма резок.
Сравнительные графики бенчмарков Cohere Command A+. Источник: Cohere
В бенчмарке 𝜏²-Bench Telecom, проверяющем сложные навыки рассуждения, результат модели подскочил с 37% до 85%. В Terminal-Bench Hard, измеряющем производительность агентского написания кода, показатель вырос с 3% до 25%. В сфере сложной математики модель набрала 90% в AIME 25 по сравнению с 57% ранее.
Command A+ превосходит свою весовую категорию (25 млрд активных параметров) в чисто логических рассуждениях и математике, на равных конкурируя с гораздо более крупными моделями, такими как DeepSeek V4 Pro, на математических бенчмарках. Тем не менее, в задачах глубокого агентского кодинга и общей широкомасштабной индексации интеллекта она в настоящее время уступает новейшим поколениям от китайских конкурентов с открытым исходным кодом, таких как DeepSeek, Z.ai (GLM) и MiniMax.
Тем не менее, прямое сравнение упускает из виду главное достоинство Cohere — аппаратную эффективность.
Помимо бенчмарков, Command A+ предлагает глубокую интеграцию для обеспечения корпоративного доверия и верификации. Модель поддерживает использование разговорных инструментов через стандартные шаблоны чата, позволяя разработчикам легко подключать ее к внутренним API, поисковым системам или базам данных SQL.
Крайне важно, что Command A+ поддерживает встроенную генерацию цитат. Когда Command A+ извлекает информацию из внешнего инструмента, она не просто синтезирует ответ, а генерирует явные «диапазоны обоснования» (grounding spans). Используя специальные теги, внедренные в вывод, модель напрямую связывает каждое сделанное ею фактическое утверждение с конкретным исходным документом или строкой базы данных, откуда она почерпнула эту информацию.
Для предприятий в строго регулируемых отраслях, таких как финансы, здравоохранение или юриспруденция, такая прослеживаемость — это грань между интересным прототипом и готовым к промышленной эксплуатации приложением. Если пользователь запрашивает ежедневный отчет о продажах, модель выдаст общую сумму продаж и явно укажет результат запроса к базе данных, который предоставил это число, сводя к минимуму риск необнаруженных галлюцинаций.
Кроме того, Command A+ является полностью мультимодальной: она способна обрабатывать как текст, так и изображения в рамках своего огромного контекстного окна ввода на 128 тыс. токенов, что делает ее чрезвычайно эффективной для сложной обработки документов, такой как анализ сканированных счетов, графиков или технических руководств.
Первая модель Cohere AI с полноценной лицензией Apache 2.0
В текущем ландшафте ИИ термин «открытый исходный код» стал неоднозначным. Многие ведущие ИИ-компании выпускают веса своих моделей под ограничительными коммерческими лицензиями или правилами приемлемого использования, которые прямо запрещают крупным предприятиям применять модели в коммерческих целях или использовать их для обучения конкурирующих систем искусственного интеллекта.
Действительно, предыдущие модели Cohere, включая Command R и Command R+, выпускались под лицензией CC-BY-NC 4.0 (Creative Commons NonCommercial). Хотя веса этих моделей были открыты для загрузки, экспериментов и оценки исследователями и разработчиками, их строго запрещалось использовать в коммерческих целях без приобретения отдельной корпоративной лицензии у Cohere или обращения к ее программному интерфейсу приложения (API) — аналогично схеме, которую многие предприятия используют для доступа к ИИ-моделям от OpenAI, Anthropic, Google и других ведущих лабораторий.
Cohere изменила свой подход, выпустив Command A+ под лицензией Apache 2.0. Это критически важное отличие для сообщества разработчиков. Apache 2.0 — это настоящая лицензия с открытым исходным кодом, одобренная OSI. Она позволяет кому угодно — от независимых разработчиков до корпораций из списка Fortune 500 — использовать, изменять, распространять и коммерциализировать модель без уплаты лицензионных сборов и соблюдения ограничительных пунктов о неконкуренции.
Как написал Гомес в X, это решение отстаивал его коллега, сооснователь Cohere Ник Фросст (Nick Frosst), который опубликовал двухминутный видеообзор, назвав модель «лучшей из всех, что мы когда-либо выпускали».
Для бизнеса эта лицензия означает полную независимость от поставщика. Компания может загрузить веса Command A+ конфиденциально, дообучить их на секретных внутренних данных и развернуть на собственных частных серверах или в изолированных сетях (air-gapped networks). Организация не привязана к инфраструктуре Cohere, изменению ее цен или доступности API. Это абсолютное воплощение суверенного ИИ.
Релиз встретил мгвановенный отклик в экосистеме ИИ-разработчиков во многом благодаря интеграции с первого дня с основными фреймворками инференса с открытым исходным кодом, такими как Hugging Face и vLLM.
Что дальше?
Выпуск Command A+ знаменует собой взросление экосистемы ИИ с открытым исходным кодом. Сочетая рассуждения передового уровня, надежное использование агентских инструментов и мультимодальные возможности с архитектурой, специально разработанной для аппаратной эффективности, Cohere меняет подход к внедрению корпоративного искусственного интеллекта.
Потребность в массивных централизованных вычислительных кластерах долгое время была узким местом для компаний, уделяющих первостепенное внимание конфиденциальности данных и контролю расходов. Демократизировав доступ к модели такого уровня по лицензии с истинно открытым исходным кодом, Cohere предоставила корпоративному рынку именно то, о чем он просил: мощность облака, способную безопасно работать в серверной комнате по соседству.



