Разработчик заявляет, что новая модель Palmyra X6 сокращает расходы на И-агентов на 52% на фоне резкого роста затрат на токены
Источник: VentureBeat · Michael Nuñez

Writer, платформа корпоративных ИИ-агентов, которую используют компании из списка Fortune 500, включая Accenture, Uber и Vanguard, выпустила сегодня свою новую флагманскую модель Palmyra X6 наряду с переработанной «обвязкой» (harness) для оркестрации агентов и новыми инструментами управления, призванными дать IT-руководителям контроль над неконтролируемыми расходами токенов.
Основные показатели впечатляют: по заявлению Writer, теперь ее агентский продукт работает в среднем на 52% дешевле, демонстрируя рост скорости на 48% и улучшение качества на 10% в паре с Palmyra X6. Но еще более важным может оказаться то, как компания к этому пришла и о чем говорят ее решения касательно будущего рынка корпоративного ИИ.
Palmyra X6 не обучается с нуля. Это пост-обученная версия GLM-5.2 — модели со смешанной экспертной структурой (Mixture-of-Experts) и открытыми весами от базирующейся в Пекине компании Z.ai (ранее известной как Zhipu AI). Этот факт Writer открыто раскрывает в своем техническом отчете, и он ставит сан-францисcкую компанию в центр одной из самых острых дискуссий в отрасли: должны ли американские предприятия строить свои решения на базе китайских открытых исходных кодов.
«Эта модель никоим образом и ни в какой форме не связана со своими первоначальными разработчиками. Она полностью работает на нашей инфраструктуре в США», — рассказал Матан-Паул Шетрит (Matan-Paul Shetrit), директор по управлению продуктами Writer, в эксклюзивном интервью VentureBeat накануне анонса.
Дэн Бикель (Dan Bikel), возглавляющий исследования в области ИИ в Writer, выразился более прямо: «Это в полной мере модель Palmyra, просто мы взяли за отправную точку числа с плавающей точкой и продолжили обучение оттуда».
Почему ИИ-агенты раздувают корпоративные бюджеты так, как никогда не делали чат-боты
Анонс Writer появляется в момент, когда экономика агентного ИИ вышла на первый план при принятии решений о закупках на уровне предприятий. В отличие от чат-бота, который обычно выдает один ответ на запрос пользователя, ИИ-агент превращает один запрос в многократные циклы планирования, поиска информации, вызовов инструментов, валидации и повторных попыток, причем каждый цикл потребляет тарифицируемые токены. Пользователь видит один ответ, а счет отражает весь этот цикл в целом.
Масштабы проблемы становятся очевидными. Goldman Sachs прогнозирует, что потребление токенов вырастет в 24 раза в период с 2026 по 2030 год, достигнув 120 квадриллионов токенов в месяц. И движением этого процесса управляют не столько новые люди, задающие вопросы, сколько работающие в постоянном режиме корпоративные агенты. Тот же анализ предупреждал, что падение цен за один токен не гарантирует уменьшение счетов: если агентная задача задействует в 20 раз больше токенов, в то время как цены за единицу упадут на 75%, итоговые расходы все равно вырастут в пять раз.
«Предприятия хотят, чтобы потребление токенов взрывообразно росло — это означает, что внедрение идет полным ходом, — но им необходимо, чтобы затраты при этом стабилизировались», — заявил в своем заявлении Васим Аль-Ших (Waseem AlShikh), технический директор и соучредитель Writer.
Шетрит назвал проблему стоимости главным препятствием для внедрения корпоративного ИИ — даже более значительным, чем возможности самой модели. «Самым большим барьером сегодня для расширения использования ИИ на предприятиях в большинстве случаев являются вовсе не возможности моделей, а расходы вокруг них, — сказал он. — Реальность такова, что в большинстве случаев альтернативой ИИ является не другой ИИ, а человеческий труд».
На вопрос о том, не приведет ли сокращение потребления токенов клиентами к каннибализации собственных доходов Writer за счет токенов, Шетрит отверг эту предпосылку. «Снижение стоимости не бьет по моей прибыли. На самом деле оно ее увеличивает, потому что расширяет общий объем потенциального рынка (TAM) внутри организации», — заявил он, утверждая, что более низкие затраты на выполнение одной задачи открывают те рабочие процессы, которые предприятия иначе никогда бы не стали автоматизировать. Этот аргумент перекликается с тенденцией, знакомой по эпохе облачных вычислений, когда цены за единицу падали на протяжении десятилетия, в то время как общие счета росли по мере увеличения потребления — динамика, в повторение которой с агентами Writer осознанно верит и на которую делает ставку.
Внутри Palmyra X6: как 626 учебных примеров доработали модель с 744 миллиардами параметров
Palmyra X6 — это модель со смешанными экспертами (Mixture-of-Experts) объемом 744 миллиарда параметров, имеющая примерно 40 миллиардов активных параметров на один токен. Согласно техническому отчету Writer, она без изменений унаследовала архитектуру GLM-5.2. Вкладом компании стал сознательно консервативный рецепт пост-обучения: методика под названием «привязанное контролируемое тонкая настройка» (anchored supervised fine-tuning, ASFT), примененная к поразительно малому корпусу, состоящему всего из 626 тщательно отобранных синтетических траекторий агентов, обученных в течение одной эпохи при низкой скорости обучения.
Крошечный набор данных — это суть подхода, а не его ограничение. ASFT объединяет схему взвешивания токенов с «якорем» расходимости Кульбака — Лейблера (KL-divergence), который наказывает дообученную модель за слишком сильное отклонение от замороженной копии базовой модели. Это обучает систему новому поведению при использовании инструментов без разрушения общих возможностей, которыми базовая модель уже обладает. Writer также заменила стандартный оптимизатор Adam на Muon — более новый метод, который рассматривает матрицы весов как геометрические объекты на уровне основных матриц весов модели.
«Существует целая цепочка работ, следующих философии условного принципа «меньше значит больше»», — отметил Бикель, ссылаясь на исследования, показывающие, что «небольшие наборы данных исключительно высокого качества могут дать очень многое». Он добавил: «Такова философия — одна из тех философий, которой мы следовали при создании этой модели, и это оправдало себя. Это позволило нам оптимизировать процесс для наших клиентов при меньших затратах на саму оптимизацию, и в конечном итоге это привело к созданию более дешевой модели как для нас, так и для них».
Сами тренировочные данные полностью синтетические: каждый план, вызов инструмента и финальный ответ были сгенерированы машиной с помощью моделей-преподавателей, а затем отфильтрованы через структурные шлюзы качества, верификатор на базе модели и судейскую коллегию LLM, состоящую из двух моделей, прежде чем попасть на этап обучения. Это продолжает давнюю практику Writer: модель компании Palmyra X 004 была обучена практически полностью на синтетических данных примерно за 700 000 долларов еще в 2024 году, как сообщало тогда издание TechCrunch, а Palmyra X5 потребовала около 1 миллиона долларов в чатах GPU, согласно данным SiliconANGLE.
По результатам внутренних оценок Writer, охватывающих девять категорий возможностей (включая обоснованность и поиск, использование инструментов, генерацию контента, делегирование задач субагентам и соблюдение тональности бренда), модель X6 набрала в среднем 0,87 балла из 1,00, опередив Claude Opus 4.8 от Anthropic (0,86), Claude Sonnet 4.6 (0.85), GPT-5.5 от OpenAI (0,80) и Gemini 3.1 от Google (0,77). Ценовой разрыв является главным отличием: Writer оценивает X6 в 2 доллара за миллион входных токенов и 8 долларов за миллион выходных токенов против 15/75 у Opus 4.8. Компания заявляет, что X6 выполняет задачи в среднем за 26 секунд и способна работать автономно над достижением одной цели до восьми часов.
Writer открыто признает, что внутренние бенчмарки вызывают скептицизм. На прямой вопрос о том, опубликует ли компания свою методологию после самостоятельной оценки, Бикель ответил, что технический отчет охватывает «как протокол, который мы использовали для нашего публичного бенчмаркинга, так и наши внутренние оценки». Он охарактеризовал публичные бенчмарки скорее как средство проверки на адекватность, чем как целевые ориентиры: «Мы проводим тестирование на публичных бенчмарках, чтобы понимать, что мы движемся в правильном направлении и у нас нет каких-либо огромных пробелов, но мы и не слебуем им слепо, потому что это не идет на пользу нашим клиентам».
Китайский вопрос: что создание решений на базе GLM-5.2 означает для корпоративной безопасности и доверия
Выбор Writer в качестве базовой модели был бы немыслим для американского корпоративного вендора два года назад. Сегодня это отражает рыночную реальность: GLM-5.2, выпущенная в июне под мягкой лицензией MIT, пожалуй, является самой мощной общедоступной моделью в мире. Независимое аналитическое агентство Artificial Analysis оценило ее в 51 балл по своему индексу интеллекта (Intelligence Index), поставив ее выше DeepSeek V4 Pro, Kimi K2.6 и даже некоторых моделей Gemini от Google в агентных задачах, при этом в разы перекрывая цены на флагманские американские API, как сообщало европейское техническое издание Trending Topics. В пресс-релизе Writer она названа «самой сильной из доступных моделей с открытыми весами».
Всплеск популярности моделей с открытыми весами несет в себе вполне реальные риски. В августовском отчете некоммерческой организации по безопасности ИИ SaferAI отмечалось, что GLM-5.2 не отказалась ни от одной из предложенных ей задач кибератак или биологических исследований через публичный API Z.ai, а сама компания Z.ai не опубликовала никакой концепции безопасности или оценки рисков перед развертыванием — пробел, который увеличивается, как только любой желающий получает возможность скачать и изменить веса.
Ответ Writer заключается в том, что происхождение и пост-обучение важнее первоисточника. Бикель подчеркнул, что компания «загрузила веса с американского ресурса Hugging Face» и вела обучение исключительно на американской инфраструктуре; в техническом отчете указано, что все наборы данных синтезировались и хранились в США, а всё аппаратное обеспечение для обучения находилось на территории Штатов.
Компания также провела тщательную предварительно зарегистрированную оценку рисков модели, охватывающую политическую предвзятость, цензуру, фактическую точность и отказы в обслуживании (включая 19 674 оцененных ответа, проверенных независимыми экспертами «вслепую»), сравнив X6 с ее базовой версией GLM-5.2 и четырьмя контрольными передовыми моделями.
Согласно оценке политической предвзятости ModelSlant от Washington Post, в Writer заявляют, что X6 представляла обе стороны спорных вопросов в 80% случаев — это самый высокий показатель среди всех протестированных моделей, — и отвечала на политически чувствительные запросы, в которых DeepSeek V4 отказывал наотмашь. В рамках состязательного теста на безопасность FORTRESS adversarial safety benchmark модель X6 с ее системным сообщением при развертывании набрала на 8,6 балла больше по состязательной безопасности, чем исходная базовая версия GLM-5.2, при пренебрежимо малой потере полезности безобидных функций.
«Мы провели масштабное тестирование на предмет предвзятости и цензуры, — сказал Шетрит, — и та работа, которую проделали Дэн и команда, на самом деле доказала, что эта модель значительно превосходит не только альтернативы с открытым исходным кодом, но и любую закрытую альтернативу на рынке на момент проведения бенчмаркинга».
В отчете все же есть одна примечательная оговорка: хотя поведение на английском языке не показало статистически устойчивой политической асимметрии, «поведение продемонстрировало вариативность в зависимости от языка» — откровенное признание того, что 626 траекторий дообучения не могут стереть каждый след исходного обучения базовой модели.
Эффект обвязки: почему оркестрация может иметь большее значение, чем сама модель
Пожалуй, самое стратегически интересное утверждение в анонсе Writer вообще не связано с Palmyra X6. Компания заявляет, что ее переработанная обвязка Writer Agent (harness) — уровень оркестрации, который планирует задачи, пакетно обрабатывает работу, делегирует задачи субагентам и управляет контекстом — сокращает затраты на 41% и выполняет задачи на 44% быстрее для каждой протестированной модели, включая сторонние модели от Anthropic и OpenAI, сохраняя при этом неизменное качество. Writer опубликовала эти выводы в сопутствующем исследовательском документе под названием «Эффект обвязки» (The Harness Effect).
Это порождает очевидный вопрос, который VentureBeat задал компании: если одна только обвязка обеспечивает львиную долю экономии на любой модели, зачем вообще создавать свою собственную модель?
Ответ Шетрита сводился к вопросу контроля. «Я не могу контролировать, если какая-то лаборатория объявит свою модель устаревшей. Я не могу контролировать, какие данные они используют в своей модели, — сказал он. — В то же время, когда я создаю модель, у меня есть значительный моральный контроль, и я могу ответить на сложные вопросы, которые задают мне корпоративные клиенты».
Бикель добавил, что модель и обвязка разрабатывались совместно: «Эта модель создавалась и по сути эволюционировала вместе с обвязкой… Мы знаем, что у нас есть флагманский продукт, Writer Agent. Мы хотим, чтобы он работал действительно отлично именно с этой моделью, и он, конечно же, работает. Мы учитываем это во время разработки модели, и это невозможно сделать, если вы не создаете собственную модель».
Примечательно, что Writer ведет себя гибко. С этим релизом компания расширяет поддержку нескольких моделей для Writer Agent, позволяя администраторам задействовать модели от Anthropic, OpenAI, а также облачных провайдеров, включая Microsoft Azure, AWS Bedrock и Nvidia NIM — и даже модели генерации изображений, категорию, которую сама Writer не разрабатывает. Посыл директорам по информационной безопасности донельзя прост: используйте нашу модель, потому что она самая дешевая и лучшая для ваших рабочих процессов, но наша платформа в любом случае сэкономит вам деньги.
Новые инструменты управления призваны покончить с неожиданными счетами за ИИ еще до их появления
Третье направление релиза нацелено на более тихую корпоративную боль: никто в высшем руководстве компании не знает, сколько тратят агенты. Новые инструменты управления предоставляют администраторам централизованное представление об использовании агентов в масштабах всего бизнеса, аналитику по конкретным рабочим процессам для совместных функций Playbooks («Сценарии») и Skills («Навыки»), а также средства контроля потребления с оповещениями и лимитами расходов.
На вопрос о том, означает ли появление элементов контроля расходов, что клиенты ранее получали неожиданные счета, Шетрит переформулировал это как стимулятор внедрения, а не средство ликвидации последствий. «Как нам создать инструменты, которые позволят вам как директору по информационной безопасности или ИБ-директору компании чувствовать себя комфортно как в отношении безопасности, так и затрат, чтобы вы могли расширять использование ИИ в своей организации?» — сказал он. По его словам, именно прозрачность позволяет руководству сказать заветное «да»: компании с четкими данными о затратах «на самом деле стремятся расширить внедрение ИИ для сценариев использования, к которым они никогда бы раньше не притронулись».
Этот функционал отражает более масштабный сдвиг в том, как предприятия формируют бюджеты на ИИ. Как утверждается в аналитическом материале Forbes, посвященном воинам цен на токены, искушенные покупатели учатся моделировать стоимость успешного выполнения задачи — учитывая повторные попытки, вызовы инструментов и эскалации, а не просто умножая ожидаемое количество вызовов на заявленный тариф. Writer эффективно превращает эту практику из табличной рутины финансового отдела в нативную функцию платформы.
Это также завершает вектор управления, который компания выстраивала более года. Согласно более ранним объявлениям компании, в ноябре прошлого года Writer внедрила единый интерфейс агентов с административными элементами управления, а в марте добавила навыки агентов (Skills) и аналитику рабочих процессов. Релиз в четверг замыкает этот круг, привязывая ценник — и лимит расходов — к каждому рабочему процессу.
Writer, основанная в 2020 году Мэй Хабиб (May Habib) и Васимом Аль-Шихом, привлекла 200 миллионов долларов при оценке в 1,9 миллиарда долларов в конце 2024 года и построила свой бизнес на регулируемых развертываниях с высокими ставками, а не на потребительском сегменте. Шетрит не стал извиняться за узость этого фокуса. «Привилегия работать и фокусироваться на корпоративных сценариях использования заключается в том, что мне не нужно, чтобы моя модель умела писать французские сонеты, — сказал он. — Когда вы не пытаетесь делать всё подряд, вы можете сосредоточиться на проблемах и потребностях вашего клиента».
Он был столь же прям в отношении идентичности компании: «Мы не исследовательская лаборатория, превратившаяся в потребительский продукт и теперь балующаяся корпоративным сектором. Мы в первую очередь и главным образом корпоративная компания, которая обслуживает бизнес-клиентов, и мы оцениваем наши решения через эту линзу. А это значит, что если мы считаем правильным решением создавать что-то с нуля, мы это сделаем. Но если мы считаем, что на рынке есть другие альтернативы, которые лучше служат нашим клиентам, мы воспользуемся ими».
Этот прагматизм может оказаться самым важным сигналом релиза. Хорошо финансируемая американская ИИ-компания с пятилетним опытом создания моделей пришла к выводу, что передовой рубеж ценности больше не лежит в предварительном обучении, а находится на последней миле: пост-обучении открытых весов, проектировании обвязки вокруг них и предоставлении финансовому директору удобной панели мониторинга. Если Writer права, ров передовых лабораторий сужается до рабочих нагрузок, где качество действительно оправдывает семикратную надбавку к цене, а для всего остального побеждающей моделью становится та, за предварительное обучение которой заплатил кто-то другой.
В индустрии, которая три года спорила о том, чья модель умнее, Writer делает совершенно другую ставку: гонку корпоративного ИИ выиграет не компания с лучшими числами с плавающей точкой, а та, которая знает, что с ними делать.



