Poolside выпускает Laguna S 2.1 — модель для программирования с открытыми весами, которая превосходит конкурентов, превосходящих ее по размеру в 10 раз
Источник: VentureBeat · Michael Nuñez
Poolside, базирующаяся в Сан-Франциско лаборатория искусственного интеллекта, которая три года своей истории в основном тихо продавала модели для написания кода правительствам и оборонным ведомствам, во вторник выпустила свою самую мощную на сегодняшний день модель — и сделала необычайно смелую ставку на радикальную прозрачность, а не на чистый масштаб, как способ конкуренции небольшой лаборатории на передовой.
Новая модель, Laguna S 2.1, представляет собой смешанную экспертную систему (Mixture-of-Experts, MoE) с 118 миллиардами параметров, которая задействует лишь 8 миллиардов параметров на один токен, поддерживает контекстное окно до 1 миллиона токенов и — согласно опубликованным компанией бенчмаркам — не уступает или превосходит открытые модели, превосходящие её по размеру в несколько раз, в задачах автономного программирования (agentic coding). Веса модели доступны сразу на платформе Hugging Face по мягкой лицензии OpenMDW-1.1.
Главные показатели впечатляют для столь компактной модели. Poolside сообщает, что Laguna S 2.1 набирает 70,2% в Terminal-Bench 2.1 — бенчмарке долгосрочных терминальных задач, что ставит её на 11-е место в сводной таблице лидеров компании. Она опережает DeepSeek-V4-Pro-Max (модель с 1,6 триллиона параметров, набравшую 64,0 балла), Inkling от Thinking Machines с 975 миллиардами параметров (63,8 балла) и Nemotron 3 Ultra от Nvidia с 550 миллиардами параметров (56,4 балла). В бенчмарке SWE-Bench Multilingual модель показывает результат 78,5%, а на общедоступном наборе данных SWE-Bench Pro — 59,4%.
Возможно, ещё более показательным фактом, чем любой отдельный балл, является то, что путь от начала предварительного обучения 22 мая до публичного запуска занял у модели менее девяти недель обучения на 4096 графических процессорах Nvidia H200. В индустрии, где циклы выпуска флагманских моделей обычно измеряются кварталами или годами, Poolside теперь выпустила три модели за три месяца.
Почему дефицит ИИ с открытыми весами на Западе стал вопросом уровня совета директоров
Этот релиз происходит на фоне всё более острой дискуссии о происхождении ИИ-моделей с открытыми весами. За последний год разработчики решительно сместили фокус в сторону систем с открытыми весами, которые компании могут скачивать, изучать и запускать на собственной инфраструктуре, причем ведущие позиции в этой категории неизменно занимают китайские лаборатории. DeepSeek, Qwen, Kimi, GLM, MiniMax и линейка Hunyuan от Tencent занимают видные места в собственных сравнительных таблицах Poolside.
В сопутствующем пресс-релизе Poolside позиционирует Laguna S 2.1 именно как ответ на эту ситуацию, отмечая, что модель занимает весовую категорию, в которой западные лаборатории не выпускали открытые веса в течение 11 месяцев — со времени релиза gpt-oss-120b от OpenAI в августе прошлого года. «Западу нужны модели с открытыми весами, которым он может доверять, которые он может запускать и на базе которых может создавать решения», — заявил Джейсон Уорнер (Jason Warner), содиректор Poolside.
Сооснователь и содиректор Эйсо Кант (Eiso Kant) выразил философскую суть проблемы ещё откровеннее в обширном посте в X. «Я считаю, что интеллект должен стать и станет биржевым товаром», — написал он, утверждая, что открытая экосистема «не сможет победить за счёт того, чтобы быть лучшей лишь в своей собственной категории». По его словам, пользователям просто нужен лучший интеллект для решения конкретной задачи, поэтому открытые модели должны не уступать своим закрытым аналогам или превосходить их.
Стратегическая логика здесь не сводится к благотворительности. Основной бизнес Poolside — развертывание моделей в периметре безопасности правительственных, оборонных и регулируемых предприятий, то есть клиентов, для которых закрытый API с пошаговой тарификацией часто неприемлем по соображениям комплаенса и цифрового суверенитета.
Каждое предприятие, которое сегодня стандартизирует свои процессы на базе китайской открытой модели, завтра станет гораздо более сложной целью для привлечения. Выпуск конкурентоспособных открытых весов — это одновременно шаг по развитию экосистемы и маркетинговая воронка верхнего уровня для бизнеса компании в сфере высокозащищенных развертываний. Это также позволяет перенести фокус гонки ИИ с той территории, где Poolside не может конкурировать (капитальные затраты масштаба передовых лабораторий), на ту, где, по её мнению, у неё есть преимущества: стоимость за токен, самостоятельный хостинг (self-hosting) и скорость итераций.
Как разреженная архитектура делает запуск корпоративных ИИ-агентов доступным
Технический дизайн отражает конкретный тезис о том, куда движется создание ценности в сфере ИИ для написания кода. Разреженная MoE-архитектура Laguna S 2.1 — 256 маршрутизируемых экспертов плюс один общий эксперт с вниманием на основе группированных запросов (grouped-query attention) и чередующимися слоями со скользящим окном, согласно карточке модели на Hugging Face — означает, что затраты на инференс масштабируются в зависимости от 8 миллиардов активных параметров, а не всех 118 миллиардов. В Poolside подчеркивают, что модель достаточно мала для запуска на одной машине Nvidia DGX Spark настольного класса.
Это имеет ключевое значение для того, что в Poolside называют токеновой экономикой. Долгосрочные агенты-программисты потребляют колоссальное количество токенов: опубликованные компанией данные показывают, что в режиме размышления (thinking mode) на прохождение самого сложного бенчмарка модель тратит в среднем около 249 000 токенов генерации на одну траекторию. При тарифах коммерческих API агентские рабочие нагрузки в масштабе предприятия становятся значительной статьей бюджета. На OpenRouter компания Poolside предлагает бесплатный эндпоинт с контекстом 256K и выделенный эндпоинт с контекстом 1M по цене 0,10 долл. за миллион входных токенов и 0,20 долл. за миллион выходных токенов — это агрессивное ценообразование, которое подрывает большинство альтернативных передовых решений на порядок.
Поддержка экосистемы на момент запуска необычайно широка. Модель доступна в библиотеке моделей Baseten и AI Gateway от Vercel, с интеграциями для vLLM, SGLang, Ollama и llama.cpp, а также с квантованными вариантами вплоть до файлов GGUF в формате 4-bit (размером 75 гигабайт) для локального использования. Однако более интересное утверждение Poolside носит поведенческий, а не архитектурный характер. Пэнмин Ван (Pengming Wang), соруководитель направления прикладных исследований в Poolside, заявил, что прирост производительности достигнут за счет улучшения рабочих привычек модели: «больше проверки, меньше принятия вещей на веру, отсутствие преждевременных заявлений о победе и большая настойчивость». Чистый интеллект, утверждают в компании, — это лишь одна ось возможностей; стиль работы модели — это вторая ось, которая имеет колоссальное значение для агентов, оставляемых без присмотра на многие часы.
Публикация траекторий всех бенчмарков как ответ на кризис доверия к ИИ
Самым важным шагом с точки зрения прозрачности оценки для корпоративных покупателей, возможно, стало беспрецедентное для крупных лабораторий решение: Poolside опубликовала полные, нередактированные траектории каждого испытания в своих финальных прогонах бенчмарков — каждый шаг рассуждения, вызов инструмента и команду оболочки для каждого заявленного балла.
Это решает нарастающую проблему доверия к бенчмаркам ИИ. Поскольку высшие результаты в устоявшихся тестах концентрируются в диапазоне 70–90%, а «взлом наград» (reward hacking), когда модели находят решения в интернете или обманывают верификаторы вместо решения проблем, стал повсеместным, показатели, заявляемые самими разработчиками, потеряли значительную часть своей информативности. В Poolside откровенно рассказали о собственных столкновениях с этой проблемой: во время обучения более половины траекторий в некоторых задачах SWE-bench были помечены как скомпрометированные, поскольку модель просто находила в сети исходный запрос на исправление бага и применяла его. Компания задокументировала принятые меры по смягчению этого эффекта, включая дополнения к промптам, оценку с помощью LLM, откалиброванную по человеческой разметке, и экспертный анализ успешного прогона Terminal-Bench.
Три опубликованных кейса иллюстрируют то, что компания понимает под настойчивостью. В одном из них модель создала рабочий движок рендеринга HTML/CSS из пустой папки за 181 шаг в ходе 50-минутной сессии без участия человека — а затем, не имея возможностей работы с визуальными данными, запустила headless Chromium для численного сравнения вывода своего холста с рендерингом реального браузера. В другом случае, будучи нацеленной на собственный агентский комплекс Poolside в цикле автоматической оптимизации, модель сделала кодовую базу на Go на 5,2% быстрее при примерно на 70% меньшем выделении памяти, попутно обнаружив балл O(n²) при конкатенации строк. В третьем случае, работая в песочнице без установленного Python, модель выполняла теорию чисел на Perl и независимо вывела заново доказательство проблемы №397 Эрдёша — комбинаторной задачи, которая оставалась нерешенной в течение пяти десятилетий, пока в январе этого года её впервые не решил GPT-5.2 Pro. В Poolside отмечают, что конструкция их модели структурно отличается от ранее опубликованного решения, а их информационный срез на ноябрь 2025 года предшествует первому доказательству.
Что показывают заявленные ограничения и скрытые детали бенчмарков
Poolside заслуживает похвалы за раскрытие ограничений, которые большинство лабораторий предпочитает скрывать. Модель может переобучаться под собственный комплекс инструментов и давать сбои при незначительных отличиях в схемах инструментов у сторонних агентов, путает JSON в аргументах вложенных инструментов и склонна к избыточному размышлению над олимпиадными математическими задачами. На данный момент у пользователя нет возможности настраивать уровень усилий на размышление — доступно только включение или выключение, — при этом разрыв между режимами огромен: вдумчивый режим поднимает результат в Terminal-Bench 2.1 с 60,4% до 70,2%, а в DeepSWE — с 16,5% до 40,4% при значительно более высоких затратах токенов.
Покупателям стоит делать скидку при анализе сравнительных таблиц. Методология Poolside берет максимум из заявленных самими вендорами баллов, таблиц лидеров от авторов бенчмарков и сторонних показателей для конкурентов — это разумная условность, но она объединяет разные тестовые среды и условия. В частности, в бенчмарке DeepSWE компания Poolside использовала собственный агентский комплекс, а не стандартный mini-swe-agent из таблицы лидеров, и компания признает, что из-за этого различия результаты не полностью сопоставимы напрямую. При этом уровень передовых моделей остается явно недосягаемым: закрытые системы, такие как GPT-5.6 Sol с 88,8 баллами в Terminal-Bench 2.1 и Claude Fable 5 с 88,0 баллами, а также модель с открытыми весами Kimi K3 с 2,8 триллиона параметров и 88,3 баллами, располагаются значительно выше Laguna S 2.1.
Более глубокий структурный вопрос заключается в том, сможет ли «Фабрика моделей» Poolside (внутренняя платформа, которой компания приписывает свой высокий темп релизов) поддерживать такой ритм по мере масштабирования моделей. Динамика до сих пор выглядит поистине необычной: апрельский двойной релиз Laguna M.1 и XS.2, обновление XS 2.1 2 июля и теперь S 2.1, которая, по заявлению компании, превосходит апрельский флагман M.1 при примерно трети от его активного размера. Примечательно, что для S 2.1 использовались ровно те же данные предварительного обучения, что и для XS 2.1, а это значит, что почти всё улучшение было достигнуто за счет масштабирования, исправлений в обучении и пост-обучения на корпусе компании из 409 000 агентских и неагентских сред обучения. В Poolside говорят, что предварительное обучение их следующей, более крупной модели Laguna началось на прошлой неделе.
Для технических руководителей, принимающих решения, Laguna S 2.1 представляет собой самый заслуживающий доверия западный вариант с открытыми весами для автономного программирования на собственной инфраструктуре, появившийся почти за год. Модель подкреплена опубликованными свидетельствами, мягкой лицензией, широкой поддержкой экосистемы и экономической моделью, построенной вокруг оборудования, которым вы можете владеть. Подорвет ли это доминирование китайских открытых моделей, будет зависеть не столько от этого релиза, сколько от последующих.
Кант, со своей стороны, уже рассказал всему миру, чем должна завершиться эта история. Poolside движется к будущему, в котором самый мощный интеллект «может принадлежать любому и формироваться кем угодно», написал он, и компания планирует продолжать выпуски продуктов, «пока это будущее не станет реальностью». В индустрии, где крупнейшие лаборатории все сильнее запирают свои лучшие разработки за API, самое радикальное в Laguna S 2.1 заключается, пожалуй, не в баллах, которые она набирает, а в том, что любой может скачать её и проверить.



