Nemotron-Cascade 2 от Nvidia меняет представление о размерах ИИ-моделей

Nemotron-Cascade 2 от Nvidia меняет представление о размерах ИИ-моделей

Долгое время в разработке ИИ действовало простое предположение: более крупные модели, обученные на больших объемах данных, дают лучшие результаты. Последний релиз Nvidia напрямую ставит под сомнение это предположение о размере — и методика обучения за ней может оказаться для корпоративных команд по ИИ важнее, чем сама модель. Пайплайн пост-обучения Cascade RL этой модели с открытым весом, подробно описанный в техническом отчете Nvidia, предлагает воспроизводимый проект для корпоративных команд, создающих специализированные системы рассуждений без необходимости обучения с нуля.

Nemotron-Cascade 2 — это 30-миллиардная (30B) MoE-модель (Mixture-of-Experts) с открытым весом, которая задействует всего 3 миллиарда параметров во время инференса. Несмотря на столь компактный объем, она достигла производительности уровня золотой медали на трех самых требовательных соревнованиях в мире: Международной математической олимпиаде 2025 года (IMO), Международной олимпиаде по информатике (IOI) и финале чемпионата мира ICPC. Это вторая открытая модель, достигшая такого уровня, после DeepSeek-V3.2-Speciale — модели с в 20 раз большим количеством параметров.

Почему пост-обучение становится настоящим конкурентным преимуществом

Предварительное обучение большой языковой модели с нуля стоит колоссальных денег — порядка десятков или даже сотен миллионов долларов для передовых моделей. Nemotron-Cascade 2 создана на базе той же базовой модели, что и существующая Nemotron-3-Nano от Nvidia, однако она превосходит эту модель практически по каждому бенчмарку, а во многих случаях превосходит и собственную Nemotron-3-Super от Nvidia — модель с четырьмя активными параметрами, согласно техническому отчению Nvidia. Вся разница заключается исключительно в рецепте пост-обучения.

В этом и заключается стратегический инсайт для корпоративных команд: вам необязательно нужна более крупная или дорогая базовая модель. Возможно, вам нужен лучший конвейер обучения поверх того, что у вас уже есть. Cascade RL и MOPD представляют собой конкретный, воспроизводимый подход к решению этой проблемы.

Что такое Cascade RL: последовательное доменное обучение, позволяющее избежать катастрофического забывания

Обучение с подкреплением (RL) стало доминирующей техникой обучения языковых моделей рассуждениям. Проблема заключается в том, что одновременное обучение модели по нескольким доменам — математика, код, следование инструкциям, агентские задачи — часто приводит к интерференции. Повышение производительности в одном домене ухудшает ее в другом. Это проблема катастрофического забывания, давно известная сложность в многозадачном машинном обучении.

Cascade RL решает эту проблему путем последовательного обучения на этапах RL, по одному домену за раз, а не путем их смешивания. Nemotron-Cascade 2 следует определенному порядку: сначала RL для следования инструкциям, затем многодоменный RL (охватывающий вопросы по STEM, вызов инструментов и структурированный вывод), затем дистилляция on-policy, затем RLHF для выравнивания по человеческим предпочтениям, затем RL для длинного контекста, затем RL для кода и, наконец, RL для разработки программного обеспечения.

Согласно техническому отчету Nvidia, этот подход делают практичным три свойства. Во-первых, доменно-специфичные этапы RL оказываются устойчивыми к катастрофическому забыванию: обучение на коде редко ухудшает показатели в математике, а в некоторых случаях даже улучшает их. Во-вторых, поскольку каждый этап обучается на одном домене, гиперпараметры и учебную программу можно адаптировать под конкретные характеристики этого домена, что в целом обеспечивает лучшее обучение. В-третьих, поскольку ответы в рамках одного домена имеют тенденцию быть похожими по длине и стоимости верификации, использование вычислительных ресурсов оказывается существенно более эффективным, чем при смешанном доменном обучении.

Сама последовательность не является фиксированной; она зависит от поведения модели. Команда Nemotron-Cascade 2 обнаружила, что RL для следования инструкциям должен стоять на первом месте (поскольку он может конфликтовать с выравниванием по человеческим предпочтениям, которое можно восстановить позже), в то время как RL для кода и разработки ПО лучше всего работают на финальных этапах, говорится в отчете.

Для корпоративных команд вывод прост: если вы применяете RL для улучшения модели по нескольким возможностям, их последовательное обучение с тщательным упорядочением может дать лучшие результаты, чем попытка обучить все сразу.

MOPD: повторное использование собственных чекпоинтов обучения в качестве учителей

Даже при тщательном последовательном упорядочении неизбежно некоторое падение производительности по мере прохождения моделью множества этапов RL. Решением от Nvidia является Multi-Domain On-Policy Distillation (MOPD) — техника, внедряемая в середине конвейера Cascade RL для перебалансировки возможностей.

Подход работает следующим образом: по мере прохождения моделью различных этапов RL некоторые промежуточные чекпоинты станут наилучшими версиями для конкретных доменов. Математический чекпоинт может быть самым сильным после SFT; чекпоинт следования инструкциям может быть самым сильным после IF-RL. MOPD выбирает лучший промежуточный чекпоинт для каждого домена и использует его в качестве «учителя» для дистилляции знаний обратно в модель-студент.

Что критически важно, эти учителя не являются внешними моделями. Они получены из того же обучающего прогона, разделяя тот же токенизатор и архитектуру. Это устраняет проблемы несоответствия распределений, которые возникают при дистилляции из совершенно другого семейства моделей.

Согласно техническому отчету Nvidia, MOPD работает на уровне токенов, а не на уровне последовательностей, что делает его значительно более эффективным с точки зрения использования выборок, чем RL с наградами на основе результатов (GRPO и др.). Команда Nvidia сообщает, что на математическом бенчмарке AIME 2025 MOPD восстановила производительность уровня учителя менее чем за 30 шагов оптимизации, в то время как стандартный GRPO (Group Relative Policy Optimization) потребовал больше шагов для достижения более низкого балла. На бенчмарке ArenaHard для выравнивания по человеческим предпочтениям MOPD достигла 85,5 балла на сложных промптах за 52 шага против 80,7 балла у RLHF за 160 шагов.

Картина бенчмарков: доминирование в рассуждениях, честность в отношении компромиссов

Результаты на бенчмарках, интенсивно требующих рассуждений, поражают. На LiveCodeBench v6, кодировочном бенчмарке с задачами с платформ соревновательного программирования, Nemotron-Cascade 2 набирает 87,2 балла, превосходя Qwen3.5-35B-A3B (74,6), Qwen3.5-397B-A17B (83.6) и даже Kimi-K2.5-1T (85,0). На HMMT, февраль 2025 года — строгом бенчмарке математических соревнований — она набирает 94,6 балла, держась на равных с моделями, во много раз превосходящими ее по размеру. На ArenaHard v2 для оценки качества выравнивания она достигает 83,5 балла, значительно опережая конкурентов в своем классе. При включении рассуждений с интеграцией инструментов производительность на AIME 2025 возрастает до 98,6 балла. Все результаты бенчмарков предоставлены самой Nvidia и не были независимо верифицированы.

Технический отчет также откровенно говорит о недостатках. Модель уступает Qwen3.5-35B-A3B на бенчмарках, интенсивно использующих знания, таких как MMLU-Pro (79,8 против 85,3) и GPQA-Diamond (76,1 против 84,2), а также на ряде агентских бенчмарков, таких как BFCL v4 и τ²-Bench. Авторы прямо отмечают, что в будущих работах необходимы более качественное предварительное обучение на основе знаний и агентский RL.

Эта честность имеет значение для практиков. Модель оптимизирована для глубоких рассуждений и следования инструкциям, а не для поиска общих знаний или сложных многошаговых взаимодействий с агентами. Командам следует проводить оценку под свой конкретный сценарий использования, а не предполагать всеобщее превосходство.

Что корпоративные команды по ИИ могут почерпнуть из этого рецепта

Несколько паттернов проектирования из этой работы напрямую применимы к корпоративным инициативам по пост-обучению. Последовательное доменное упорядочение в Cascade RL означает, что команды могут добавлять новые возможности без перестройки всего конвейера — критически важное свойство для организаций, которым нужно быстро итерировать. Подход MOPD с использованием промежуточных чекпоинтов в качестве доменно-специфичных учителей избавляет от необходимости использовать дорогостоящие внешние модели-учителя; команды могут проводить дистилляцию из собственных наилучших снимков состояния (снепшотов).

Настройка обучения также примечательна: Cascade RL использует GRPO со строгим обучением on-policy и без штрафа KL через репозиторий с открытым исходным кодом от Nvidia Nemo-RL repository. Для RL по коду в пайплайне использовалось всего 3500 сложных отфильтрованных задач.

Общая картина: плотность интеллекта как принцип проектирования

Nemotron-Cascade 2 является частью более широкой тенденции к «плотности интеллекта» — извлечению максимальных возможностей на один активный параметр. Модели MoE от DeepSeek, варианты A3B от Qwen и теперь серия Cascade от Nvidia — все они указывают на будущее, где самые мощные модели для рассуждений не обязательно являются самыми крупными.

Для корпоративного развертывания это имеет огромное значение. Модель с 3 миллиардами активных параметров может обслуживаться за малую долю стоимости и задержки плотной 70-миллиардной модели. Результаты Nvidia показывают, что методы пост-обучения, такие как Cascade RL и MOPD, могут сократить разрыв в производительности в целевых доменах, предоставляя организациям путь к развертыванию мощных возможностей рассуждений без затрат на инфраструктуру передового уровня.

Открытым вопросом остается то, насколько широко этот подход может быть обобщен. Cascade RL хорошо работает для доменов с проверяемыми наградами: у математики есть правильные ответы, у кода — тестовые случаи, у следования инструкциям — проверки на основе правил. Расширение этого метода на более открытые корпоративные задачи, где проверка неоднозначна, остается актуальной исследовательской задачей. Для команд, создающих системы, требующие глубоких рассуждений по структурированным проблемам — финансовое моделирование, научные вычисления, разработка программного обеспечения, анализ на соответствие требованиям — технический отчет Nvidia предлагает одну из наиболее детальных методологий пост-обучения из опубликованных на сегодняшний день.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.