Почему крошечная модель VibeThinker-3B от Weibo заставила мир ИИ снова спорить о бенчмарках
Источник: VentureBeat · Michael Nuñez
В воскресенье команда из девяти исследователей из Sina Weibo — китайского гиганта социальных сетей, больше известного своей микроблоггинговой платформой, чем передовыми разработками в области искусственного интеллекта, — тихо опубликовала на arXiv 14-страничный технический отчет, который произвел эффект разорвавшейся бомбы в сообществе исследователей ИИ. Их заявление: языковая модель всего с 3 миллиардами параметров может не только не уступать, но и превосходить возможности флагманских систем от Google DeepMind, OpenAI, Anthropic и DeepSeek, которые превосходят ее по размеру в сотни раз.
Модель под названием VibeThinker-3B набрала 94,3 балла на AIME 2026 — Американском математическом отборочном экзамене (American Invitational Mathematics Examination), одном из самых сложных стандартизированных математических соревнований в мире. Этот результат ставит ее в один ряд с DeepSeek V3.2, моделью с 671 миллиардом параметров, и выше Gemini 3 Pro — высокопроизводительной флагманской системы рассуждений Google, которая набрала 91,7 балла. С применением техники масштабирования на этапе тестирования, которую команда называет «оценкой надежности на уровне утверждений» (Claim-Level Reliability Assessment), этот показатель поднимается до 97,1, опережая практически каждую систему из находящихся в публичном доступе.
Спустя всего несколько часов после публикации статья набрала 62 голоса «за» в ленте ежедневных препринтов Hugging Face, репозиторий модели собрал 130 лайков, а репозиторий на GitHub получил 685 звезд. Однако реакция в социальных сетях оказалась далеко не праздничной. Во многих случаях она была глубоко скептической.
«КАКОГО ЧЕРТА происходит в сфере ИИ?» — написал пользователь @orcus108 в X в посте, который набрал более 161 000 просмотров. — Модель с 3 миллиардами параметров только что показала результаты на бенчмарках кодирования на уровне Claude Opus 4.5… Я искренне не понимаю, прорыв это или бенчмарки окончательно сломались».
Это противоречие — между подлинным научным прогрессом и растущим подозрением в том, что бенчмарки ИИ стали настолько манипулируемыми, что потеряли всякий смысл — лежит в самом сердце истории с VibeThinker-3B. И ответ на этот вопрос имеет колоссальное значение не только для академических лавров, но и для многомиллиардного спора о том, является ли неустанное стремление индустрии ИИ к созданию все более крупных моделей единственным путем к интеллекту.
Результаты бенчмарков, бросающие вызов законам масштабирования современного ИИ
Результаты, представленные в техническом отчете, по любым меркам являются экстраординарными.
В области математики VibeThinker-3B набрала 91,4 балла на AIME 2025, 94,3 на AIME 2026, 89,3 на HMMT 2025 (Математический турнир Гарварда и МИТ), 93,8 на BruMO 2025 (Математическая олимпиада Браунского университета) и 76,4 на IMO-AnswerBench — бенчмарке, состоящем из 400 задач уровня Международной математической олимпиады. В программировании она показала 80,2% по метрике Pass@1 на LiveCodeBench v6 (бенчмарке для проверки генерации исполняемого кода) и достигла 96,1% успешных решений в ранее не встречавшихся еженедельных и двухнедельных контестах LeetCode с конца апреля по конец мая 2026 года. В задачах на следование инструкциям она набрала 93,4 балла на IFEval.
Чтобы представить разницу в количестве параметров наглядно: у DeepSeek V3.2 их 671 миллиард — примерно в 224 раза больше, чем у VibeThinker-3B. У GLM-5 от Zhipu AI — 744 миллиарда параметров. А Kimi K2.5 от Moonshot AI превышает 1 триллион. При этом 3 миллиарда параметров VibeThinker-3B могут работать на обычном потребительском ноутбуке.
Исследователи представляют этот результат не как аномалию, а как доказательство более широкой теоретической концепции. Они вводят так называемую «параметрическую гипотезу сжатия и покрытия» (Parametric Compression-Coverage Hypothesis), согласно которой различные типы способностей ИИ имеют принципиально разную зависимость от размера модели. Верифицируемые рассуждения — то, что проверяется математическими олимпиадами и задачниками по программированию, где ответы можно однозначно проверить — авторы называют «параметрически плотной» способностью: ее можно сжать до компактного ядра. Знания об открытых предметных областях (open-domain knowledge), напротив, «параметрически экспансивны» и требуют широкого охвата фактов, концепций и крайних случаев, что неизбежно увеличивает потребность в параметрах.
В документе прямо признается это различие. На GPQA-Diamond, научном бенчмарке уровня аспирантуры, VibeThinker-3B набрала всего 70,2 балла — значительно отставая от 91,9 балла у Gemini 3 Pro и 87,0 балла у Claude Opus 4.5. Авторы пишут, что этот разрыв «согласуется с нашим утверждением, а не противоречит ему: главный вывод заключается вовсе не в том, что 3-миллиардная модель полностью заменила ведущие универсальные системы, а в том, что небольшая модель способна достичь производительности высшего уровня во многих задачах на проверяемые рассуждения».
Анатомия четырехэтапного обучения крошечного движка рассуждений
VibeThinker-3B создана не с нуля. Она дообучена на базе Qwen2.5-Coder-3B — компактной базовой модели от команды Qwen компании Alibaba, с использованием принципа, который исследователи ИИ из Weibo называют «принципом спектра и сигнала» (Spectrum-to-Signal Principle). Этот многоэтапный конвейер впервые был представлен в их более ранней работе над VibeThinker-1.5B в ноябре 2025 года.
Процесс обучения разворачивается в четыре основных этапа. Первый — двухэтапный процесс контролируемого тонкой настройки (supervised fine-tuning) с использованием обучения по учебной программе (curriculum learning): сначала модель обучается на широкой смеси данных по математике, кодингу, STEM-рассуждениям, общему диалогу и следованию инструкциям, а затем переключается на отобранное подмножество более сложных задач на рассуждения с длинным горизонтом планирования. На втором этапе образцы с цепочками рассуждений короче 5000 токенов отбрасываются, а задачи, которые VibeThinker-1.5B способна решить более чем в 75% случаев, фильтруются, что заставляет модель концентрироваться на по-настоящему сложных проблемах.
На втором этапе применяется обучение с подкреплением (reinforcement learning) в нескольких доменах — математике, кодировании и STEM — с использованием алгоритма оптимизации политики на основе максимизации энтропии MaxEnt-Guided Policy Optimization (MGPO). Этот алгоритм отдает приоритет обучению на задачах, находящихся на границе текущих возможностей модели, а не на тех, которые она уже легко решает или считает невыполнимыми. Примечательно, что стратегия, хорошо сработавшая при масштабе 1,5 млрд параметров (постепенное расширение контекстного окна во время RL-обучения), для версии 3B ухудшила результаты. Исследователи предполагают, что более мощная исходная контрольная точка означала, что усечение цепочек рассуждений во время разогрева больше не удаляло шум, а разрушало валидные паттерны рассуждений. Решением стало обучение с единым контекстным окном в 64 000 токенов на протяжении всего процесса.
В рамках фазы математического RL команда также внедряет метод под названием «Long2Short Math RL» — вторичную стадию оптимизации, которая перераспределяет вознаграждения в пользу более коротких правильных решений в противовес длинным, снижая многословие без ущерба для точности. Эта техника использует перераспределение наград с нулевой суммой, что позволяет избежать смещения общего сигнала награды, одновременно подталкивая модель к более эффективным рассуждениям.
Третий этап извлекает высококачественные траектории рассуждений из контрольных точек, обученных с подкреплением, и дистиллирует их обратно в единую модель посредством контролируемой доводки (supervised fine-tuning). Команда использует «оценку потенциала обучения» (learning-potential score) — по сути, перплексию студенческой модели на каждой траектории учителя, — чтобы расставить приоритеты для траекторий, которые являются правильными, но еще не усвоены моделью-учеником. Заключительный этап, получивший название Instruct RL, применяет обучение с подкреплением к задачам следования инструкциям, используя комбинацию валидаторов на основе правил для ограничения формата и моделей вознаграждения на основе критериев (рубрик) для оценки качества ответов открытого типа.
Франческо Бертолотти (Francesco Bertolotti), исследователь ИИ, одним из первых обративший внимание на статью в X, лаконично описал этот подход: «Эти результаты были достигнуты в первую очередь за счет дообучения поверх Qwen2.5-Coder. В статье не так много деталей, но похоже, что они проводят дистилляцию из контрольных точек RL, а затем выполняют финальное RL-обучение инструкциям (instruct RL)». Его пост собрал более 161 000 просмотров.
Тестирование в реальных условиях выявляет разрыв между бенчмарками и практической производительностью ИИ
Каждая восторженная реакция на статью сопровождалась столь же резкой критикой. В середине 2026 года сообщество исследователей ИИ относилось к заявлениям на основе бенчмарков с глубоким подозрением, и VibeThinker-3B появилась в атмосфере, где все ж подвоха.
«Бенчмарки состоят из буквального сопоставления паттернов в однофайловом коде», — написал пользователь @BigMoonKR в X. — Это не имеет никакого отношения к реальной работе с кодом. Я не понимаю, как люди до сих пор этого не осознают».
«Бенчмарк-максимизация («Бенчмаксцинг»)», — заявил @oflu_bedirhan, используя термин, ставший в сообществе ИИ нарицательным для моделей, которые кажутся оптимизированными исключительно под показатели бенчмарков в ущерб реальной полезности.
Самая едкая критика исходила от пользователей, которые действительно скачали и протестировали модель. «Только что попробовал полноразрядную версию, — написал @politilols. — Она даже не знает, что такое uv-скрипт (самый популярный инструмент разработки на Python). Я не встречал такого ни в одной LLM по крайней мере последний год. Бенчмаксцинг чистой воды». Когда Бертолотти возразил, что модель, судя по всему, больше заточена под математические рассуждения, чем под практическое программирование, пользователь парировал: «В их отчете есть результат LiveCodeBench. Шансов на то, что он отражает реальность, ровно ноль».
@Itsdotdev высказал критику структурного характера: «Посмотрите на сами бенчмарки, и это покажется не таким уж шокирующим. Где DeepSWE? Где стандартные бенчмарки, которые используют разработчики SOTA-моделей?» Пользователь @AvenirReym задал более диагностичный вопрос: «Если она удерживает результаты на бенчмарке, созданном после отсечки обучающих данных модели, это реально. Если она побеждает только на наборах в стиле AIME, которые циркулируют годами, это утечка данных».
Судя по всему, авторы статьи предвидели эти возражения. В техническом отчете указано, что наборы данных для обучения «прошли строгую дезактивацию бенчмарков», включая фильтрацию на основе n-грамм для удаления «совпадений n-грамм с оценочными наборами».
Оценка на конкурсах LeetCode — охватывающая состязания с 25 апреля по 31 мая 2026 года, то есть даты, следующие за любым правдоподобным моментом отсечки обучающих данных — представляет собой наиболее надежную защиту от опасений по поводу утечки данных. На этих состязаниях VibeThinker-3B успешно справилась со 123 из 128 попыток с первого раза, показав результат в 96,1%, что превосходит показатели GPT-5.2, Doubao Seed 2.0 Pro, Kimi K2.5 и Claude Opus 4.6 в идентичных условиях оценки.
И тем не менее, отчеты реальных пользователей свидетельствуют о значительной пропасти между результатами бенчмарков и практической полезностью — явлении, которое стало привычным для всей индустрии. «В LM Studio она хорошо отвечает только на первый вопрос, а на все последующие отвечает репликой на самый первый вопрос», — сообщил пользователь @luismolinaab.
Почему компания, занимающаяся соцсетями, возможно, нашла брешь в гипотезе масштабирования
Даже самые яростные критики признавали, что достижение таких показателей в бенчмарках при 3 миллиардах параметров — независимо от того, насколько они применимы в продакшене — само по себе является значительным инженерным достижением. «Даже если это бенчмаксцинг, делать это с моделью на 3B параметров — потрясающе, это показывает, как быстро развивается эта область», — написал @rohityin.
Это наблюдение бьет по вопросу, который занимал индустрию ИИ с момента появления гипотезы масштабирования: всегда ли больше — значит лучше? Общепринятое мнение, наиболее ярко сформулированное в законах масштабирования Chinchilla и подкрепленное коммерческим доминированием все более крупных базовых моделей, гласит, что большее число параметров и больший объем обучающих данных гарантированно обеспечивают лучшую производительность. Экономическое следствие этого сурово: обучение и развертывание фронтирных моделей стоят десятки или сотни миллионов долларов, создавая колоссальные барьеры для входа на рынок.
VibeThinker-3B бросает вызов этому консенсусу — но лишь отчасти. Авторы статьи осторожно очерчивают границы своих заявлений, проводя различие между задачами с «четкими сигналами верификации» и теми, которые требуют широких фактологических знаний. Параметрическая гипотеза сжатия и покрытия прямо утверждает, что маленькие модели не способны заменить крупные по всем фронтам.
«Истинное значение VibeThinker-3B заключается вовсе не в доказательстве того, что 3-миллиардная модель способна заменить крупномасштабные универсальные системы, — говорится в документе, — а скорее в предоставлении конкретного эмпирического сигнала: разработка компактных моделей перестает быть просто пассивным компромиссом ради эффективности развертывания или контроля затрат; она вырисовывается как перспективное исследовательское направление, принципиально дополняющее традиционную парадигму масштабирования параметров».
Пожалуй, самым удивительным элементом этой работы является ее происхождение. Sina Weibo, торгующаяся на биржах NASDAQ и Гонконга с рыночной капитализацией, колеблющейся в пределах нескольких миллиардов долларов, — это не та компания, которую обычно ассоциируют с передовыми исследованиями в области ИИ. И тем не менее, серия VibeThinker стала для Weibo вторым крупным вкладом в сфере открытого ИИ за семь месяцев.
VibeThinker-1.5B, выпущенная в ноябре 2025 года, продемонстрировала, что модель всего с 1,5 миллиарда параметров способна превзойти оригинальный DeepSeek R1 в ряде математических бенчмарков. По утверждению команды, этот результат был достигнут при затратах на пост-тренировку всего в 7 800 долларов по сравнению с 294 000 долларов, оцененными для DeepSeek R1.
Исследовательская команда компактна — девять авторов, все указаны как сотрудники Sina Weibo Inc. Модель выпущена под лицензией MIT, одной из самых мягких лицензий с открытым исходным кодом, а веса находятся в свободном доступе для скачивания как на Hugging Face, так и на ModelScope. В первый же день после релиза участники сообщества создали квантованные версии в формате GGUF и производные модели.
Маленькие модели, масштабные последствия и вопрос, от которого индустрия ИИ больше не может уклоняться
Наиболее честная оценка VibeThinker-3B заключается в том, что она одновременно и меньше, и больше того, на что указывают бенчмарки. Меньше — потому что модель, испытывающая трудности с базовыми знаниями о популярных инструментах разработчика, вряд ли в ближайшее время заменит какой-либо продакшен-помощник по программированию. Больше — потому что лежащее в основе озарение (что способность к рассуждениям и фактические знания частично разделены, и первые могут быть сжаты гораздо агрессивнее, чем предполагалось ранее) имеет глубочайшие последствия для того, как индустрия смотрит на проектирование моделей, экономику их развертывания и доступность передовых возможностей ИИ.
Если параметрическая гипотеза сжатия и покрытия верна, она указывает на будущее, в котором небольшие специализированные движки рассуждений будут работать бок о бок с крупными информационно-емкими моделями в гибридных архитектурах. Это видение, в котором модель с 3 миллиардами параметров берет на себя тяжелую логическую работу, в то время как более крупная система обеспечивает фактологическую базу. Такая архитектура способна кардинально снизить стоимость развертывания возможностей ИИ по рассуждениям, потенциально открыв математические и кодинговые навыки соревновательного уровня для устройств с весьма скромным «железом».
«Самое интересное то, что мы начинаем отделять знания от рассуждений, — написал пользователь @RealLambdaFlux в X. — Небольшая модель с сильной пост-тренировкой может выступать далеко за весовой категории на задачах с четкой обратной связью».
Пользователь @cmitsakis обрисовал практический финал: «Я думаю, что маленькие модели — это будущее для агентов, потому что они могут использовать инструменты для получения знаний, при этом работая быстро и дешево».
Прибудет ли это будущее благодаря конкретно VibeThinker-3B или усилиям десятков команд, которые сейчас спешат воспроизвести и расширить эти результаты, статья уже добилась кое-чего, чего не может в полной мере отразить ни один результат бенчмарка.
Она заставила ИИ-сообщество столкнуться с неприятной возможностью: возможно, годами индустрия тратила миллиарды долларов на масштабирование параметров ради улучшения того типа интеллекта, который все это время мог поместиться на ноутбуке. Веса общедоступны. Код открыт. И самый важный тест находится вовсе не в таблицах лидеров — он заключается в том, сможет ли хоть кто-то сделать столь крошечную модель действительно полезной в реальном мире.



