Qwen2.5-Coder-32B (или Qwen3.8-27B) запускает передовые агенты программирования и рассуждения на мощном ноутбуке без необходимости использования облачного API
Источник: VentureBeat · Carl Franzen
Самым масштабным релизом ИИ-модели за последние несколько дней, по крайней мере среди разработчиков и продвинутых пользователей ИИ в социальных сетях, стала не передовая облачная модель от OpenAI, Anthropic или Google.
Это 27-миллиардная модель от Alibaba: Qwen3.8-27B появилась на Hugging Face в пятницу под дружественной к корпорациям открытой лицензией Apache 2.0, предоставив разработчикам веса плотной мультимодальной модели, доступные для скачивания.
Но Qwen3.8-27B — это не рядовая маленькая локальная модель: она включает в себя встроенное понимание изображений и видео, контекстное окно на 262 144 токена, настраиваемые возможности рассуждения и поддержку написания кода и агентских рабочих процессов — «компактную и удобную для развертывания» версию возможностей, разработанных для ее поколения Qwen3.8.
Столь скромные системные требования — важнейшая часть привлекательности Qwen3.8-27B. Для запуска модели с полной 16-битной точностью требуется примерно 56 ГБ видеопамяти, в то время как версии FP8 нужно около 28 ГБ. Однако 4-битная квантование уменьшает саму модель примерно до 17 ГБ, делая ее доступной для высокопроизводительных потребительских систем, таких как мощный игровой ПК или хорошо укомплектованный ноутбук.
Идеальный баланс между производительностью и размером
Столь бурная реакция среди разработчиков объясняется динамичным сочетанием возможностей модели и ее размера.
Собственные бенчмарки Alibaba при запуске сразу произвели фурор. Компания сообщила о результатах 61,7 на SWE-bench Pro, 90,3 на LiveCodeBench v6, 70,7 на своем офисном бенчмарке CoWorkBench и 84,3 на OSWorld-Verified.
В опубликованной Alibaba сравнительной таблице модель с 27 миллиардами параметров даже превосходит указанный результат Claude Opus 4.6 Max на SWE-bench Pro и LiveCodeBench, хотя Opus по-прежнему лидирует в Terminal-Bench, GPQA Diamond и Humanity’s Last Exam.
Некоторые тесты Alibaba являются внутренними, а наборы тестов различаются в разных сравнениях, из-за чего эти цифры трудно назвать надежным основанием для объявления универсального победителя.
Независимые тесты демонстрируют мощную локальную модель с производительностью, сопоставимой с проприетарными моделями месячной давности
Ситуация изменилась в понедельник, когда появились результаты независимых тестов.
Независимая организация по оценке ИИ Artificial Analysis присвоила Qwen3.8-27B балл 52 в своем Индексе интеллекта (Intelligence Index), который представляет собой комплексную оценку из девяти тестов, охватывающих программирование, науку, логические рассуждения и профессиональные задачи. Это ровно тот же балл, который Artificial Analysis в настоящее время присваивает младшей модели OpenAI GPT-5.6 Luna при максимальных настройках рассуждения — проприетарному решению, доступному только через облако.
Как отметил в X разработчик агентного ПО для кодирования Cline: «Это первый случай, когда локальная модель продемонстрировала возможности передовой модели. Мы никак не ожидали столь стремительного прогресса в локальном сегменте так быстро».
Тем временем в «Агентском индексе» (Agentic Index) от Artificial Analysis, измеряющем производительность моделей при выполнении агентских задач, Qwen3.8-27B набрала 51 балл, опередив Claude Opus 4.8 при максимальном уровне рассуждения — передовую модель, которую Anthropic выпустила менее трех месяцев назад.
Это не значит, что данные модели эквивалентны, но это помогает понять, почему разработчики и активные пользователи ИИ обратили на нее внимание. Как написал в X разработчик, подкастер и ютубер Sero (@0xSero в X, настоящее имя Шариф Черф): «Модель, которая запускается на оборудовании за 3 тыс. долларов США, превосходит все разработки 4-месячной давности. Включая Opus. Эпоха вечного отставания окончена».
Разработчик Джошуа «Xenova» Лохнер, известный переносом моделей машинного обучения в веб-браузеры, <сообщил о> результате в понедельник в X, приложив эксперимент по запуск Qwen3.8-27B с кастомными ядрами WebGPU. Его реакция — «Какое прекрасное время для жизни!» — отражает царящую атмосферу: модель, результаты которой близки к проприетарным передовым системам, можно скачать, модифицировать и запускать локально, а не использовать исключительно через API стороннего провайдера.
Преимущества становятся еще очевиднее при сжатии модели. Разработчик и автор контента об ИИ Саймон Уиллисон протестировал квантование Q4_K_M размером примерно 17 ГБ на ноутбуке M5 Max MacBook Pro и системе Nvidia DGX Spark.
Он выяснил, что модель способна писать код, распознавать изображения и управлять циклом агента кодирования через фреймворк Pi. В одном из экспериментов модель изучила кодовую базу, чтобы объяснить работу аутентификации; в другом — написала и протестировала утилиту на Python, необходимую Уиллисону для конвертации логов агента из формата JSONL в Markdown.
«Тот факт, что файл размером 17 ГБ способен выполнять все это на моих домашних компьютерах, — это настоящее чудо», — написал Уиллисон. Его главный тезис находит отклик у продвинутых пользователей: возможности, которые еще недавно казались неразрывно связанными с дорогостоящими облачными моделями, перекочевывают в файлы, достаточно компактные для хранения на обычной рабочей станции.
Эта тенденция отражается и на статистике использования. Как сообщил Cybernews в понедельник, за первые три дня после релиза количество скачиваний Qwen3.8-27B на Hugging Face превысило 3 миллиона, в то время как квантованные версии для локального запуска появлялись с огромной скоростью.
Сообщество LocalLLaMA на Reddit создало специальную мегатему, чтобы упорядочить поток бенчмарков, квантований, советов по настройке и сравнений. Один из пользователей, показавший созданную локально игру, охарактеризовал модель как «настоящего зверя».
Избыточное «размышление» — это проблема
Однако за этим ажиотажем кроется важный нюанс: похоже, высокого качества ответов Qwen3.8-27B отчасти добивается за счет долгих размышлений.
По данным Artificial Analysis, в ходе тестов на Индекс интеллекта модель сгенерировала 160 миллионов выходных токенов по сравнению с медианным значением в 43 миллиона для сопоставимых моделей с открытыми весами.
Уиллисон столкнулся с экстремальным проявлением этого поведения, поскольку по умолчанию Qwen использует настройки рассуждения xhigh. Запрос на создание SVG-изображения пеликана, едущего на велосипеде, выполнялся 21 минуту и потребил более 22 000 токенов рассуждений, прежде чем выдать ответ. Для обычных повседневных задач он рекомендует начинать с низким уровнем рассуждений или вообще без них.
Инвестор и разработчик Томаш Тунгуз обнаружил похожий компромисс в небольшом тесте из девяти задач против DeepSeek V4 Flash: при включенных рассуждениях Qwen немного выигрывал по качеству в его агентском стеке, однако, по его словам, модель работала примерно в 30 раз медленнее и стоила в 4,5 раза дороже. При этом он отдельно подчеркнул, что девяти задач недостаточно для вынесения окончательного вердикта.
Программное обеспечение для инференса может сократить этот разрыв. Qwen3.8-27B поддерживает многотокенное прогнозирование (Multi-Token Prediction), и Уиллисон сообщил о приросте производительности примерно на 72% на своей системе DGX Spark после включения MTP через llama.cpp по сравнению со стандартной конфигурацией LM Studio.
Даже в этом случае его стандартные запуски в LM Studio выдавали лишь около 15–30 токенов в секунду, что значительно уступает скорости многих облачных моделей.
Именно это противоречие делает Qwen3.8-27B гораздо более значимым событием, чем очередная строчка в таблице лидеров.
Что следует вынести компаниям из релиза Qwen3.8-27B
Для корпоративного сектора актуальное сравнение заключается вовсе не в том, «побеждает» ли модель на 27 млрд параметров Claude или GPT в том или ином тесте. Вопрос в том, способна ли модель, достаточно компактная для запуска на собственной инфраструктуре компании, выполнять достаточный объем работы по написанию кода, анализу документов, обработке визуальных данных и агентским задачам, чтобы заменить вызовы API для целых классов важных задач.
Такой подход меняет расчеты конфиденциальности, развертывания и затрат. Веса под лицензией Apache 2.0 можно изучать, модифицировать и размещать на собственных серверах компании, в то время как Alibaba уже задокументировала совместимость с такими фреймворками для обслуживания, как vLLM, SGLang и TokenSpeed. По заявлению Alibaba, в будущем планируется выпустить управляемую облачную версию Qwen Cloud с контекстом по умолчанию на 1 миллион токенов и встроенными инструментами.
Компактный размер и доступные системные требования означают, что предприятия, инди-разработчики и даже любопытствующие пользователи могут легко развернуть модель локально, не беспокоясь о том, что их данные покинут устройство, что гарантирует более высокий уровень конфиденциальности, информационной безопасности, управления и контроля.
Есть и более глобальная причина, почему продвинутые пользователи следят за этим релизом. Данные Hugging Face, опубликованные изданием Business Insider на этой неделе, показывают, что реальное использование моделей резко смещается в сторону более компактных решений, даже несмотря на то, что заголовки новостей пестрят гигантскими передовыми релизами; модели с числом параметров более 70 миллиардов составили лишь небольшую долю загрузок в 2026 году.
Стратегия Alibaba по выпуску моделей Qwen в различных практических весовых категориях помогла сделать это семейство постоянным элементом локальных рабочих процессов разработчиков.
Qwen3.8-27B развивает эту идею дальше. Ее результаты в бенчмарках все еще нуждаются в более независимой проверке, стандартное поведение с активными рассуждениями может быть крайне неэффективным, а ни одна таблица лидеров сама по себе не доказывает паритет с передовыми моделями.
Но спустя три дня после релиза разработчики реагируют уже не столько на таблицу бенчмарков от Alibaba. Они реагируют на опыт запуска сравнительно небольшого файла на подконтрольном им железе и наблюдения за тем, как оно выполняет задачи, которые еще совсем недавно казались прерогативой исключительно крупнейших проприетарных систем.
Для определенных разработчиков, энтузиастов ИИ и, да, даже для корпоративных систем развертывания — это и есть тот самый главный критерий.



