Компактная рекурсивная модель от Samsung бросает вызов гигантам
Tendencia de los investigadores de IA a desarrollar nuevas y pequeñas modelos generativos de código abierto que superan a competidores comerciales mucho más grandes continuó esta semana con otro avance asombroso.
Alexia Jolicoeur-Martineau, Senior AI Researcher at Samsung’s Advanced Institute of Technology (SAIT) in Montreal, Canada, has introduced the Tiny Recursion Model (TRM) — a neural network so small it contains just 7 million parameters (internal model settings), yet it competes with or surpasses cutting-edge language models 10,000 times larger in terms of their parameter count, including OpenAI’s o3-mini and Google’s Gemini 2.5 Pro, on some of the toughest reasoning benchmarks in AI research.
Цель состоит в том, чтобы показать, что высокоэффективные новые модели ИИ можно создавать доступным способом без огромных инвестиций в графические процессоры (GPU) и вычислительную мощность, необходимые для обучения более крупных флагманских моделей с многотриллионными параметрами, на которых сегодня работают многие чат-боты на базе LLM. Результаты были описаны в исследовательской работе, опубликованной на сайте открытого доступа arxiv.org под названием «Less is More: Recursive Reasoning with Tiny Networks» («Меньше значит больше: рекурсивные рассуждения с помощью крошечных сетей»).
«Сама идея о том, что для решения сложных задач необходимо полагаться на огромные базовые модели, обученные за миллионы долларов какой-то крупной корпорацией, — это ловушка», — написала Жоликер-Мартино в социальной сети X. «В настоящее время слишком много внимания уделяется эксплуатации LLM, а не разработке и расширению новых направлений».
Жоликер-Мартино также добавила: «Благодаря рекурсивным рассуждениям оказывается, что «меньше значит больше». Крошечная модель, предварительно обученная с нуля, рекурсивно обращающаяся к самой себе и обновляющая свои ответы с течением времени, может добиться многого, не разоряя банк».
Код TRM теперь доступен на Github под дружественной к бизнесу, коммерчески применимой лицензией MIT, что означает, что любой желающий — от исследователей до компаний — может взять его, изменить и развернуть для собственных целей, включая коммерческие приложения.
Одно большое «но»
Тем не менее, читателям следует иметь в виду, что TRM была разработана специально для эффективного решения структурированных, визуальных задач на основе сеток, таких как судоку, лабиринты и головоломки из <бенчмарка ARC (Abstract and Reasoning Corpus)-AGI>ARC (Abstract and Reasoning Corpus)-AGI, причем последний предлагает задачи, которые должны быть простыми для людей, но сложными для моделей ИИ, такие как сортировка цветов на сетке на основе предварительного, но не идентичного решения.
От иерархии к простоте
Архитектура TRM представляет собой радикальное упрощение.
Она опирается на метод, называемый моделью иерархических рассуждений (HRM), представленный ранее в этом году, который показал, что небольшие сети могут справляться с логическими головоломками, такими как судоку и лабиринты.
HRM опиралась на две взаимодействующие сети — одну, работающую на высокой частоте, другую — на низкой, поддерживаемые биологически вдохновленными аргументами и математическими обоснованиями, включающими теоремы о неподвижной точке. Жоликер-Мартино сочла это излишне сложным.
TRM отбрасывает эти элементы. Вместо двух сетей она использует одиночную двухслойную модель, которая рекурсивно уточняет собственные предсказания.
Модель начинается с внедренного вопроса и первоначального ответа, представленного переменными x, y и z. Через серию шагов рассуждения она обновляет свое внутреннее латентное представление z и уточняет ответ y до тех пор, пока он не сойдется к стабильному выводу. Каждая итерация исправляет потенциальные ошибки с предыдущего шага, создавая процесс самосовершенствующегося рассуждения без дополнительной иерархии или математических накладных расходов.
Как рекурсия заменяет масштаб
Основная идея TRM заключается в том, что рекурсия может заменить глубину и размер.
Итеративно рассуждая над собственными результатами, сеть эффективно симулирует гораздо более глубокую архитектуру без сопутствующей памяти или вычислительных затрат. Этот рекурсивный цикл, выполняемый вплоть до шестнадцати шагов контролируемого обучения, позволяет модели делать прогрессивно лучшие предсказания — по духу это похоже на то, как большие языковые модели используют многошаговые рассуждения в стиле «цепочки мыслей» (chain-of-thought), но здесь это достигается с помощью компактного дизайна с прямой связью.
Простота окупится как в эффективности, так и в генерализации. Модель использует меньше слоев, никаких приближений неподвижной точки и никакой двухуровневой иерархии. Легковесный механизм остановки определяет, когда прекратить уточнение, предотвращая пустые вычисления при сохранении точности.
Производительность, которая превосходит свой вес
Несмотря на свой небольшой размер, TRM демонстрирует результаты на бенчмарках, которые соперничают с моделями, в миллионы раз превышающими ее по размеру, или превосходят их. В ходе тестирования модель достигла:
-
87,4% точности в Sudoku-Extreme (по сравнению с 55% у HRM)
-
85% точности в головоломках Maze-Hard
-
45% точности в ARC-AGI-1
-
8% точности в ARC-AGI-2
Эти результаты превосходят или почти соответствуют производительности нескольких высококлассных больших языковых моделей, включая DeepSeek R1, Gemini 2.5 Pro и o3-mini, несмотря на то, что TRM использует менее 0,01% их параметров.
Такие результаты предполагают, что рекурсивные рассуждения, а не масштаб, могут быть ключом к решению задач абстрактного и комбинаторного характера — областей, где даже генеративные модели высшего уровня часто спотыкаются.
Философия дизайна: «Меньше значит больше»
Успех TRM проистекает из осознанного минимализма. Жоликер-Мартино обнаружила, что снижение сложности приводит к лучшей генерализации.
Когда исследовательница увеличивала количество слоев или размер модели, производительность падала из-за переобучения на небольших наборах данных.
Напротив, двухслойная структура в сочетании с рекурсивной глубиной и глубоким контролем обучения позволила достичь оптимальных результатов.
Модель также показала лучшие результаты, когда самовнимание (self-attention) было заменено на более простой многослойный перцептрон при решении задач с небольшими фиксированными контекстами, такими как судоку.
Для больших сеток, таких как головоломки ARC, механизм самовнимания оставался ценным. Эти результаты подчеркивают, что архитектура модели должна соответствовать структуре данных и масштабу, а не использовать максимальную емкость по умолчанию.
Обучение в малом, мышление в большом
TRM теперь официально доступна в качестве открытого кода по лицензии MIT на GitHub.
Репозиторий включает полные скрипты обучения и оценки, создатели наборов данных для судоку, лабиринтов и ARC-AGI, а также эталонные конфигурации для воспроизведения опубликованных результатов.
В нем также описаны требования к вычислительным ресурсам: от одного графического процессора NVIDIA L40S для обучения судоку до многопроцессорных конфигураций H100 для экспериментов с ARC-AGI.
Открытый релиз подтверждает, что TRM разработана специально для структурированных задач рассуждения на базе сеток, а не для общего языкового моделирования.
Каждый бенчмарк — Sudoku-Extreme, Maze-Hard и ARC-AGI — использует небольшие, четко определенные сетки ввода-вывода, что согласуется с процессом рекурсивного контроля модели.
Обучение включает в себя значительное увеличение данных (аугментацию, такую как перестановки цветов и геометрические трансформации), что подчеркивает, что эффективность TRM заключается в размере ее параметров, а не в совокупных вычислительных потребностях.
Простота и прозрачность модели делают ее более доступной для исследователей вне стен крупных корпоративных лабораторий. Ее кодовая база напрямую опирается на более раннюю структуру модели иерархических рассуждений, но устраняет биологические аналогии HRM, многосетевые иерархии и зависимости от неподвижных точек.
Поступая таким образом, TRM предлагает воспроизводимую базовую линию для изучения рекурсивных рассуждений в небольших моделях — контрапункт доминирующей философии «масштаб — это все, что вам нужно».
Реакция сообщества
Выпуск TRM и ее кодовой базы с открытым исходным кодом вызвал немедленные дебаты среди исследователей и практиков ИИ в сети X. Хотя многие хвалили это достижение, другие ставили под сомнение то, насколько широко ее методы могут быть применимы к обобщению.
Сторонники приветствовали TRM как доказательство того, что небольшие модели могут превосходить гигантов, назвав ее «в 10 000 раз меньше, но умнее» и потенциальным шагом к архитектурам, которые думают, а не просто масштабируются.
Критики возражали, что область применения TRM узка — она сосредоточена на ограниченных головоломках на базе сеток — и что ее экономия вычислений обусловлена в основном размером, а не общим временем выполнения.
Исследователь Юнмин Ча (Yunmin Cha) отметил, что обучение TRM зависит от масштабной аугментации и рекурсивных проходов: «больше вычислений, та же модель».
Генетик рака и специалист по работе с данными Шей Лаведей (Chey Loveday) подчеркнул, что TRM — это решатель (solver), а не модель чата или генератор текста: она превосходно справляется со структурированными рассуждениями, но не с открытым языком.
Исследователь машинного обучения Себастьян Рашка (Sebastian Raschka) охарактеризовал TRM как важное упрощение HRM, а не как новую форму общего интеллекта.
Он описал ее процесс как «двухшаговый цикл, который обновляет внутреннее состояние рассуждения, а затем уточняет ответ».
Несколько исследователей, в том числе Огюстен Набель (Augustin Nabele), согласились с тем, что сильная сторона модели заключается в ее четкой структуре рассуждений, но отметили, что будущая работа должна будет показать перенос на менее ограниченные типы задач.
В сети формируется консенсус о том, что TRM может быть узкоспециализированной, но ее идея широка: тщательная рекурсия, а не постоянное расширение, может подтолкнуть следующую волну исследований в области рассуждений.
Взгляд в будущее
Хотя в настоящее время TRM применяется к задачам контролируемого рассуждения, ее рекурсивная структура открывает несколько будущих направлений. Жоликер-Мартино предложила изучить генеративные или мульти-ответные варианты, где модель могла бы выдавать несколько возможных решений вместо одного детерминированного.
Другой открытый вопрос касается законов масштабирования для рекурсии — определения того, насколько далеко может простираться принцип «меньше значит больше» по мере роста сложности модели или размера данных.
В конечном счете, исследование предлагает как практический инструмент, так и концептуальное напоминание: прогресс в области ИИ не обязательно должен зависеть от все более крупных моделей. Иногда обучение небольшой сети тщательному — и рекурсивному — мышлению может быть более мощным, чем заставлять крупную модель думать один раз.



