GLM-5.3-Flash, вероятнее всего, справится с 45% ваших задач в сфере ИИ
Источник: VentureBeat · Parvez Syed Mohamed
Неделю назад на OpenRouter появилась таинственная модель под названием Ox Alpha — еще один участник среди более чем 400 моделей, причем примерно 10 новых запускаются каждую неделю. Выделяла ее не только бесплатная цена, но и то, что она была неожиданно хороша. Энтузиасты и инди-разработчики быстро это заметили, пропуская через нее по нескольку триллионов токенов ежедневно, причем оценки сообщества за неделю варьировались от однозначных чисел до более чем 20 триллионов.
Следующие шесть дней любители ИИ занимались «криминалистикой» и гадали, кто мог ее создать и у кого хватит инфраструктуры для бесплатного обслуживания такого количества токенов. Сначала предполагали американскую лабораторию: долгожданную Gemini, или Anthropic, выпустившую достаточно хорошую промежуточную версию, или Илона, у которого столько простаивающих мощностей, что он выпустил Ox Alpha (обратите внимание на название). Люди запускали трассировку токенов и сетевой анализ. Настоящая детективная неделя в стиле Шерлока Холмса.
26 августа Z.ai раскрыла свое имя. Ox Alpha оказалась GLM-5.3-Flash. Они намеренно тестировали ее на публичном трафике, но настоящим сюрпризом оказалось не то, насколько хороша модель (она действительно хороша). Она работала полностью на китайских чипах и инфраструктуре. Прейскурантная цена составляет 15 центов / 50 центов за миллион токенов. Запускная промоакция OpenRouter дает скидку 50% — 7,5 центов / 25 центов — до 9 сентября. Весы открыты (лицензия MIT), а инференс размещен как у Z.ai, так и у GMI Cloud, Cloudflare и других американских провайдеров инференса.
В тот же день Artificial Analysis добавила модель в свой график соотношения интеллекта и стоимости. GLM-5.3-Flash занимает 57-е место в индексе при стоимости около девяти центов за задачу. Модель среднего уровня из США, такая как GPT-5.6 Sol (max), находится на уровне около 59 при цене 67 центов, что означает, что за два пункта интеллекта вы платите примерно в 7,4 раза больше. Если пойти дальше, то Grok 4.6 находится на 61-й позиции при стоимости 94 цента за задачу, то есть примерно в 10 раз дороже за прирост в четыре пункта. В этот момент токеномика начинает сильно влиять на расчеты потребления. На верхнем уровне кривая выровнялась. Если мы клюнем на эту приманку с открытыми весами, что произойдет с масштабными циклическими инвестициями в инфраструктуру, которые мы сделали, не учитывая сильного китайского конкурента в области инференса?
Американские предприятия уже ощущают ценовое давление. Возьмем Uber. Технический директор Правин Неппалли Нага (Praveen Neppalli Naga) заявил The Information в апреле, что он «возвращается к чертежной доске, потому что бюджет, который, как я думал, мне понадобится, уже исчерпан»: весь бюджет компании на кодинг на 2026 год ушел за четыре месяца, причем сам Нага потратил 1,200 долларов за одну двухчасовую демо-версию. К июню Uber ввел лимит в 1,500 долларов на человека в месяц на один инструмент. Инструменты были полезными, но полезность и ценность — не одно и то же. Главный операционный директор Uber Эндрю Макдональд (Andrew Macdonald) все еще не мог провести прямую связь между этими дашбордами и «увеличившимися на 25% полезными для потребителя функциями».
Отчет McKinsey «Состояние ИИ в 2026 году» утверждает, что 80% респондентов говорят об ускорении своей работы, 37% компаний видят некоторую прибыль до уплаты процентов и налогов (EBIT), а 32% отказались как минимум от одной покупки ПО, потому что смогли создать эту функцию собственными силами с помощью агентов для кодинга. Организации хотят сократить расходы. Они не могут позволить себе отказаться от ИИ. Задача сейчас — оптимизировать использование в масштабах всей компании.
Мы не можем игнорировать китайских производителей моделей, таких как Zhipu, Qwen, DeepSeek и других. Раз за разом они привносят собственную изобретательность, чтобы бросить вызов передовым лабораториям и снизить затраты. На OpenRouter китайские модели преодолели отметку по доле токенов из США еще в начале июня, и верхняя часть этого рейтинга по-прежнему в основном занята китайскими лабораториями. Мир инди-разработчиков уже выглядит как GLM Flash, DeepSeek Flash, MiniMax, Kimi, а иногда и Grok или Claude, если они уже оплатили дорогую подписку. Если вы уже подписаны на Grok или OpenAI через свою компанию, теперь это безвозвратные расходы. Финансовый отдел начнет задаваться вопросом, имеют ли эти места смысл, если оплата по мере использования становится такой дешевой.
Какие же варианты остаются? Рассмотрите свою работу с кодом и агентами по трем категориям, разделив их по доле задач и токенов, проходящих через каждый уровень (не по долларам, так как гораздо более низкая цена за токен у GLM-5.3-Flash означает, что даже при равном распределении долларов большая часть вашего объема все равно уйдет туда). На самом верху находятся Fable и Opus. Если вам нужно проанализировать сложную стратегию или написать подробный план выполнения, дополнительные пункты интеллекта имеют значение, и вам стоит потратить максимальные деньги, но только на те редкие задачи, на которых нельзя экономить — вероятно, около 5% от общего объема задач. Средний уровень — это Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol и Grok 4.6, которые занимают около 60-й позиции в индексе интеллекта. Kimi — это тяжеловес в области кодинга и любимец публики; следом за ним идет Grok 4.6, хотя его меньшее окно контекста немного сдерживает его. Выделите под этот уровень около 50% объема. Для оставшихся 45% серьезно рассмотрите GLM-5.3-Flash в качестве рабочей лошадки для обработки больших объемов. Ваши инструменты обвязки, ваш микс (код против контента против маркетинга) и ваши оценки помогут определить ваши собственные границы. Китайские модели с открытыми весами сэкономят вам деньги, и они должны учитываться в ваших расчетах затрат.
Сентябрь обещает стать периодом лавины новых релизов моделей: ожидания связаны с Google, xAI, Anthropic, OpenAI и DeepSeek. Граница Парето может сместиться снова. Но направление задано: больше интеллекта за меньшие деньги. Лаборатории, которые не смогут снизить свои затраты на инференс, потеряют объемы, а вместе с ними и ту аудиторию, которую эти объемы создают.
Перед сентябрем стоит выполнить «домашнее задание»:
-
Посчитайте свои токены. Можете ли вы соотнести расходы с ключевым показателем эффективности, таким как рост клиентской базы или выручки? Если нет, то хотя бы со скоростью разработки или производительностью? Без четких целей будет трудно оправдать затраты.
-
Сформируйте бюджет на ИИ заново. Каковы планируемые расходы на ИИ для каждого подразделения? Могут ли руководители этих направлений подготовить и защитить свои предложения?
-
Определите стратегию использования моделей для каждой команды. Распишите три уровня. Высокий — для необратимых решений и стратегий. Средний — для оплаченных рабочих мест и повседневного кодинга. Низкий (GLM-5.3-Flash) — для больших объемов работы.
В следующем месяце модели снова станут дешевле. Ваши команды станут более требовательными. Компании, которые выйдут из этой ситуации победителями, будут делать ставки осознанно и не позволять агентам работать на Opus или Fable, если задача того действительно не стоит.
Парвез Сайед Мохамед (Parvez Syed Mohamed) — директор по продуктам, занимавшийся созданием интеграций API и агентских платформ в Salesforce (MuleSoft), Oracle и AgentPaaS.ai. Он работает над производственными агентскими системами. С некоторыми его мыслями о создании программного обеспечения с помощью агентов можно ознакомиться здесь: https://github.com/parvezsyed
Добро пожаловать в сообщество VentureBeat!
Наша программа гостевых публикаций — это площадка, где технические эксперты делятся инсайтами и представляют независимый, непредвзятый детальный разбор ИИ, дата-инфраструктуры, кибербезопасности и других передовых технологий, формирующих будущее корпоративного сектора.
Читайте больше материалов из нашей программы гостевых публикаций и ознакомьтесь с руководством для авторов, если вы хотите предложить свою собственную статью!



