VibeThinker-1.5B от Weibo превосходит DeepSeek-R1 благодаря дообучению стоимостью 7800 долларов

VibeThinker-1.5B от Weibo превосходит DeepSeek-R1 благодаря дообучению стоимостью 7800 долларов

Еще один день конца 2025 года принес еще один впечатляющий результат от китайской компании в области искусственного интеллекта с открытым исходным кодом.

Подразделение искусственного интеллекта китайской компании социальной сети Weibo недавно выпустило модель с открытым исходным кодом VibeThinker-1.5B — большую языковую модель (LLM) с 1,5 миллиарда параметров, представляющую собой дообученный вариант модели Qwen2.5-Math-1.5B от конкурирующей китайской технологической фирмы Alibaba.

Она доступна для бесплатной загрузки и использования исследователями и корпоративными разработчиками (даже в коммерческих целях) по мягкой лицензии MIT на платформах Hugging Face, GitHub и ModelScope, а технический отчет опубликован на сайте научных публикаций открытого доступа arxiv.org.

И тем не менее, несмотря на свой компактный размер, VibeThinker-1.5B демонстрирует лидирующие в тестах показатели производительности в сфере рассуждений, математики и задач программирования, соперничая с моделями, превосходящими ее по размеру в сотни раз, и даже превосходя знаменитую модель R1 от китайского конкурента DeepSeek, ставшую вирусной в начале этого года (модель с 671 миллиардом параметров), на бенчмарках формальных рассуждений.

Кроме того, она превосходит Magistral Medium от Mistral AI и успешно конкурирует с Claude Opus 4 от Anthropic и gpt-oss-20B Medium от OpenAI, причем все это при минимальных затратах на инфраструктуру и инвестициях.

При этом модель прошла пост-тренировку с бюджетом всего в 7800 долларов США на вычислительные ресурсы (3900 часов работы графических процессоров Nvidia H800) — что значительно меньше десятков или даже сотен тысяч долларов, обычно требуемых для дообучения моделей аналогичного или более крупного масштаба.

Однако стоит напомнить, что это не общая стоимость разработки модели: языковые модели обучаются поэтапно. Сначала идет предварительное обучение (pre-training), в ходе которого модель изучает базовую языковую структуру и общие знания, предсказывая следующее слово на основе огромных объемов текста из интернета, книг и статей. Это обеспечивает беглость речи, но не дает четкого понимания того, как следовать инструкциям или поддерживать беседу.

Затем следует этап пост-тренировки (post-training) с использованием гораздо меньших по объему, но более качественных наборов данных — как правило, коллекций примеров вопросов, промптов и ответов, написанных экспертами, — чтобы научить модель давать полезные ответы, рассуждать над проблемами и соответствовать ожиданиям людей. Тем не менее, экономическая эффективность пост-тренировки модели VibeThinker-1.5B от Weibo заслуживает внимания и высокой оценки.

Этот релиз с открытым исходным кодом переворачивает представления о масштабах параметров, интенсивности вычислений и минимально жизнеспособном размере для высокопроизводительных LLM.

Другой подход к обучению: от спектра к сигналу (Spectrum-to-Signal)

VibeThinker-1.5B обязана своей производительностью не масштабу, а лежащей в ее основе системе обучения: принципу «от спектра к сигналу» (Spectrum-to-Signal Principle, SSP).

Вместо того чтобы оптимизировать модель исключительно на правильность единственного ответа (Pass@1), фреймворк SSP разделяет контролируемое дообучение (SFT) и обучение с подкреплением (RL) на две четкие фазы с разными целями:

  • SFT («Фаза спектра»): Модель обучается максимизировать разнообразие среди потенциальных правильных ответов, улучшая свой показатель Pass@K. Это создает широкий спектр возможных путей решения.

  • RL («Фаза сигнала»): Система обучения с подкреплением второго этапа (называемая MaxEnt-Guided Policy Optimization, или MGPO) используется для выявления и усиления наиболее правильных путей из этого разнообразного пула решений. MGPO отдает приоритет задачам, в которых модель наиболее неуверенна, используя взвешивание на основе энтропии для концентрации на процессе обучения.

Авторы утверждают, что такое разделение позволяет небольшим моделям более эффективно исследовать пространство рассуждений, достигая усиления сигнала без опоры на огромное количество параметров.

VibeThinker-1.5B убедительно доказывает, что упор индустрии на масштабирование параметров как на единственный путь к повышению эффективности рассуждений может быть устаревшим.

Приняв конвейер обучения, в котором приоритет отдается разнообразию, WeiboAI показала, что более компактные и доступные модели могут не только соответствовать, но и превосходить миллиардные системы в задачах, требующих сложной логики.

Низкие требования к ресурсам — один из самых значительных аспектов VibeThinker-1.5B. При затратах менее 8 000 долларов стоимость пост-тренировки в 30–60 раз ниже, чем у таких моделей, как DeepSeek R1 и MiniMax-M1, на обучение которых ушло от 294 тыс. до 535 тыс. долларов.

Производительность в различных областях

Несмотря на свой небольшой размер, VibeThinker-1.5B обеспечивает междисциплинарные рассуждения, которые превосходят многие более крупные модели с открытым исходным кодом и коммерческие аналоги:

Модель

AIME25

LiveCodeBench v6

GPQA-Diamond

VibeThinker-1.5B

74.4

51.1

46.7

GPT-OSS-20B-Medium

72.1

54.9

66.0

Claude Opus 4

69.2

56.6

79.6

MiniMax M1 (456B)

74.6

62.3

69.2

DeepSeek R1 (671B)

70.0

65.9

71.5

Kimi K2 (1.09T)

49.5

53.7

75.1

Эффективность VibeThinker оценивалась в сравнении как с моделями, ориентированными на рассуждения (Magistral, Claude, OpenAI o3-mini), так и с моделями без упора на рассуждения (GPT-4.1, Kimi K2, DeepSeek V3). В рамках структурированных тестов на логические рассуждения модель стабильно превосходила модели без функции рассуждений, независимо от их размера:

  • В тесте AIME24 (математика) она опередила Kimi K2 (1.09T) более чем на 10 баллов (80.3 против 69.6).

  • В LiveCodeBench v6 она превзошла Claude Opus 4 (51.1 против 47.4).

  • В GPQA она набрала меньше баллов, чем GPT-4.1 и Claude, но все же вдвое улучшила результат своей базовой модели (с 16.4 до 46.7).

Это подтверждает утверждение авторов о том, что размер — не единственный путь к развитию способности рассуждать: при правильном проектировании обучения более компактные модели могут достигать или даже превосходить производительность гораздо более крупных систем в целевых задачах.

Примечательно, что модель демонстрирует паритет с системами, превосходящими ее по размеру в сотни раз, в задачах по математике и программированию, хотя и отстает в области рассуждений на базе общих знаний (GPQA), где более крупные модели сохраняют преимущество.

Это намекает на возможный компромисс в специализации: в то время как VibeThinker преуспевает в структурированных логических задачах, она обладает меньшей емкостью для масштабного извлечения энциклопедических данных, что является известным ограничением более компактных архитектур.

Рекомендации по внедрению на уровне предприятий

Релиз включает рекомендуемые настройки генерации (температура = 0.6, top_p = 0.95, максимальное количество токенов = 40960).

Модель достаточно мала для развертывания на периферийных устройствах (edge devices), включая мобильные телефоны и бортовые автомобильные системы, в то время как затраты на вывод (инференс) оцениваются как в 20–70 раз более низкие по сравнению с крупными моделями.

Это позиционирует VibeThinker-1.5B не просто как исследовательское достижение, а как потенциальную основу для экономически эффективных и локально развертываемых систем рассуждений.

Стратегия Weibo и рыночная позиция

Компания Weibo, запущенная Sina Corporation в 2009 году, остается краеугольным камнем экосистемы социальных сетей Китая. Эту платформу часто называют китайским аналогом X (бывший Twitter); она сочетает в себе микроблогинг, мультимедийный контент и функции отслеживания трендов в условиях жесткого государственного регулирования.

Несмотря на то, что аудитория сервиса насчитывает 600 миллионов активных пользователей в месяц (более чем в два раза больше, чем у X), инвесторы не слишком оптимистично оценивают потенциал роста ее рекламных доходов в ближайшей перспективе. Weibo также сталкивается с нарастающей конкуренцией со стороны платформ с приоритетом видеоформата, таких как Douyin, которые привлекают молодых пользователей и увеличивают время их пребывания на сторонних ресурсах.

В ответ на это Weibo делает ставку на монетизацию создателей контента, прямые трансляции и вертикальное видео, добавляя инструменты для взаимодействия с инфлюенсерами, интеграции электронной коммерции и более глубокой аналитики для брендов.

Роль платформы как цифровой общественной площадки также делает ее объектом пристального внимания со стороны регулирующих органов. Китайские власти продолжают оказывать давление по самым разным вопросам — от модерации контента до безопасности данных. В сентябре 2025 года Weibo оказалась в числе платформ, получивших официальные предупреждения, что подчеркивает ее сохраняющуюся уязвимость перед лицом регуляторных рисков.

Активное стремление Weibo в сферкре исследований и разработок в области ИИ, примером чего стал выпуск VibeThinker-1.5B, сигнализирует об изменении амбиций. Выходя за рамки медиаплатформы, Weibo позиционирует себя как участника следующего этапа развития китайского искусственного интеллекта, используя свои капиталы, данные о поведении пользователей и собственный исследовательский потенциал для освоения смежных технических областей.

Что это значит для технических руководителей предприятий

Для инженерных лидеров и корпоративных команд по искусственному интеллекту релиз VibeThinker имеет практические последствия практически для всего: от оркестрационных пайплайнов до моделирования затрат.

Модель с 1,5 миллиарда параметров, превосходящая в математике и программировании системы, которые больше ее в 100 раз, не просто экономит вычислительные ресурсы — она меняет архитектурный баланс. Она делает возможным инференс LLM на ограниченной инфраструктуре, снижает задержку на периферии и понижает порог входа для приложений, которые в противном случае потребовали бы доступа по API к закрытым передовым моделям.

Это имеет значение для корпоративных лидеров в области машинного обучения, пытающихся развернуть агентов с возможностью рассуждений в существующих системах, или для владельцев платформ, перед которыми стоит задача интеграции языковых моделей в автоматизированные рабочие процессы.

Это также касается тех, кто управляет конвейерами обучения с подкреплением на основе отзывов людей (RLHF) или оптимизирует инференс в гибридных облачных средах.

Методология пост-тренировки модели — в частности, ее подход к обучению с подкреплением на основе энтропийного таргетинга — предлагает дорожную карту для команд, стремящихся улучшать более компактные контрольные точки вместо опоры на масштабное предварительное обучение.

Прозрачность тестов VibeThinker и шаги по очистке данных от утечек также решают другую возникающую задачу в корпоративном ИИ: проверяемость и аудируемость. Хотя ее результаты в тестах на общие знания все еще уступают крупным фронтирным моделям, надежность в узкоспециализированных задачах делает ее привлекательным кандидатом для контролируемых сред, где правильность важнее всеохватности.

Кратко говоря, VibeThinker-1.5B — это не просто веха в исследованиях, это серьезный претендент на практическое корпоративное использование, внедрение и извлечение опыта. Модель предполагает, что новый класс компактных, оптимизированных для рассуждений систем жизнеспособен для корпоративных сценариев использования, которые ранее были прерогативой гораздо более масштабных решений. Для организаций, пытающихся найти баланс между стоимостью, задержкой, интерпретируемостью и контролем, это отличный новый вариант в длинном и растущем списке китайских разработок с открытым исходным кодом.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.