Самая мощная модель DeepSeek V4 Flash спотыкается на реальных задачах для агентов на фоне роста цен
Источник: VentureBeat · Taryn Plumb
Модель V4 Flash от DeepSeek возглавила табличные рейтинги и была названа разработчиками «абсолютным монстром» с момента своего выпуска. Однако в реальных тестах она справилась лишь с 53,8% сложных задач для агентов из тестового пакета.
Платформа Composio протестировала модель на восьми различных средах для агентов, включая Claude Code, Codex и OpenCode, на 30 намеренно сложных многошаговых задачах, охватывающих такие рабочие инструменты, как Gmail, GitHub, Slack и Google Таблицы. Из 240 общих запусков успешными оказались 129, и лишь шесть из 30 рабочих процессов были полностью завершены каждой из протестированных сред.
Этот разрыв демонстрирует, почему именно оркестрация, а не исходные возможности модели, может стать решающим фактором ее успеха в корпоративной среде: одна и та же модель демонстрировала существенно различающиеся результаты в зависимости от среды, конфигурации инструментов, кэширования, повторных попыток и используемого стека провайдеров.
Компания DeepSeek заявила о повышении цен на модели V4 Flash и Pro, которые стремительно завоевали популярность среди разработчиков, создающих ассистентов для написания кода и агентов.
Хотя на первый взгляд этот шаг может подорвать главную привлекательность проекта — поразительно мощные модели по сверхнизким ценам, с которыми провайдеры передовых решений просто не могут конкурировать, — он также выводит ситуацию за рамки уже поднадоевшего клише о «дешевой китайской модели». По мере того как появляются первые сценарии использования, компании начинают понимать, какое место занимают различные модели в их технологических стеках и для каких рабочих процессов они должны применяться.
«Безумные» темпы внедрения на фоне изменения ценовой структуры DeepSeek
DeepSeek запустила публичную бета-версию V4 Flash 31 июля, а 13 августа сделала общедоступной версию V4 Pro. Модель Flash с 284 миллиардами параметров создана для высокой производительности и скорости, в то время как Pro с 1,6 триллиона параметров ориентирована на более сложные рабочие процессы.
Обе модели обладают гибкими возможностями рассуждений (низкий, высокий, максимальный уровни) и «режимами размышления», использующими логику цепочки мыслей (CoT) для повышения точности ответов.
Пользователи сразу оценили возможности Flash. Она возглавила рейтинг использования на OpenRouter с момента своего запуска и на данный момент является самой востребованной моделью на платформе по еженедельному объему токенов.
«Показатели внедрения первоначальной версии DeepSeek V4 Flash оказались безумными», — написал исследователь в области машинного обучения Нейтан Ламберт (Nathan Lambert) в X, добавив, что новая версия «набрала столько же баллов, сколько и GLM 5.2», превратившись в «абсолютного монстра», который будет использоваться повсеместно.
Изменение ценовой политики DeepSeek добавляет ситуации интересный контекст.
Тарифы на API V4 вырастут вплоть до 1100% в зависимости от модели, типа токенов и времени суток. Новая структура ценообразования:
-
Модель Flash в часы наименьшей нагрузки будет стоить 22 цента за миллион входных токенов и 66 центов за миллион выходных токенов; в часы пик — 44 цента за миллион входных токенов и 1,32 доллара за миллион выходных токенов. Это означает рост на 57–371%.
-
Модель Pro в часы наименьшей нагрузки обойдется в 66 центов за миллион входных токенов и 1,98 доллара за миллион выходных токенов; в часы пик — в 1,32 доллара за миллион входных токенов и 3,96 доллара за миллион выходных токенов. Рост составляет от 51% до 355%.
-
При этом стоимость попаданий в кэш (когда модели повторно используют подсказки, а не начинают с нуля) увеличивается на величину от 52% до 1100%.
В DeepSeek утверждают, что снижение цен на 50% в часы наименьшей нагрузки призвано стимулировать «более гибкое планирование рабочей нагрузки». Половина суток (17 часов из 24) сохраняет половинную стоимость, причем новая структура устанавливает самые высокие цены именно для внутреннего рынка компании.
«Это не просто повышение цен, — отметил Санчит вир Гогия (Sanchit vir Gogia) из Greyhound Research. — Это архитектура ценообразования, которая превращает время инференса в экономическую переменную».
Задачи, которые могут подождать (такие как пакетная оценка, генерация синтетических данных и ночные запуски для разработки), переносятся на дешевые часы; интерактивные агенты и текущие операции этого позволить не могут. По словам Гогии, раздражение среди разработчиков и бизнеса вполне реально и открыто высказывается, однако прошлое дешевое ценообразование DeepSeek не обязывает компанию оставаться доступной вечно.
На первый взгляд это выглядит «самоубийственным шагом для платформы, которая все еще завоевывает авторитет на фоне более устоявшихся поставщиков ИИ-моделей», — считает технологический аналитик Карми Леви (Carmi Levy). Повышение цен определенно сократит ценовое преимущество DeepSeek и заставит клиентов более критически взвешивать риски, связанные с китайским происхождением компании.
Тем не менее, по всем параметрам ценообразования DeepSeek остается значительно дешевле конкурирующих моделей от OpenAI, Anthropic, Google, Cohere, xAI и других, добавил он.
Таким образом, хотя этот шаг заставит DeepSeek сделать упор на производительность и безопасность, а не на стоимость, он вряд ли полностью сведет на нет ее заметное преимущество в соотношении цены и качества и по-прежнему оставляет клиентам достаточную свободу для обоснования ее использования в конкретных рабочих процессах, полагает Леви. Просто математику придется рассчитывать более тщательно.
«Это преимущество со временем неизбежно начнет сокращаться, поскольку DeepSeek продолжает приводить цены в соответствие с рыночными реалиями, но на данный момент экономическое обоснование все еще легко построить», — резюмировал Леви.
Где DeepSeek Flash может найти применение в корпоративной среде?
Массовое внедрение в компаниях остается открытым вопросом из-за стоимости, возможностей, надежности, управления данными, безопасности и других факторов.
Одним из вариантов использования является пакетная обработка данных, говорит Леви. Подобная работа обычно носит рутинный и повторяющийся характер, не требуя высочайшего уровня интеллекта, поэтому логично использовать более дешевую и эффективную модель. «Это высокопроизводительный движок инференса, который компании могут рассмотреть для точечных задач, а не в качестве полной замены уже используемых решений», — пояснил Леви.
Частичное внедрение, вероятно, будет включать изолированные, нечувствительные к данным рабочие нагрузки с четко определенными метриками успешности, строгим надзором, контролем прав доступа и резервными модельями на случай сбоев, отметил он. Более масштабное развертывание потребует от DeepSeek и ее хостинг-партнеров демонстрации высокой надежности, безопасности, конфиденциальности, проверяемости и гибкости развертывания. Корректируя ценовые структуры в зависимости от спроса, DeepSeek также должна сохранять достаточное преимущество в соотношении цены и качества, чтобы оправдать любые риски, добавил он.
Стоит ожидать несанкционированного мелкомасштабного использования в локальных лабораториях и изолированных тестовых средах по мере того, как ИТ-команды будут знакомиться с новой моделью и выяснять, когда и как представить ее высшему руководству для утверждения бюджета.
«DeepSeek заслужила репутацию глобального разрушителя устоев, — заключил он, — и очевидно, что ее продвижение к более широкому корпоративному внедрению продолжит набирать обороты».
Тестирование DeepSeek в рабочих процессах с использованием множества инструментов
Хотя многие сценарии применения все еще находятся на стадии экспериментов, инженер-программщик из Meta Наман Ахуджа (Naman Ahuja) предлагает вариант, который может найти прямое применение в корпоративной среде. В рамках проекта, не связанного с его основной работой, он создал агента домашней автоматизации на базе DeepSeek V4 Flash, чтобы выяснить, как модель с более низкой стоимостью проявляет себя в качестве слоя рассуждений и оркестрации для реального рабочего процесса с несколькими инструментами.
Когда он уходит из дома, агент координирует ряд действий в разрозненных системах: например, переводит термостат в режим «вне дома» для снижения энергопотребления, ставит на охрану систему безопасности Ring, а также закрывает и запирает двери.
«Меня интересовало не просто то, сможет ли модель понять команду, а способна ли она перевести намерение в последовательность действий с использованием нескольких инструментов там, где критически важна надежность», — поделился Ахуджа.
Главным выводом стало то, что как только модель получает возможность совершать действия, надежность начинает играть такую же роль, как и интеллект. Системе необходимы структурированные выходы инструментов, верификация успешности выполнения действий, обработка сбоев и повторных попыток, а также четкие ограничения на то, что модели разрешено делать.
В корпоративном сегменте «архитектура во многом схожа». Домашние устройства заменяются на тикет-системы, базы данных, CRM-платформы или инфраструктурные API. Наиболее полезные агенты, вероятнее всего, будут координировать повторяющиеся рабочие процессы в различных системах с ограниченными правами доступа, возможностями аудита, наблюдаемости и необходимостью одобрения со стороны человека для рискованных операций.
«Многие полезные ИИ-агенты не будут чат-ботами; они станут фоновыми агентами, координирующими API, инфраструктуру и бизнес-системы в ответ на события», — отметил он.
Бизнесу нужны осязаемые сценарии использования
Тем не менее, API Flash все еще находится в стадии публичной бета-версии, указал Гогия, и пока нет подтвержденных данных о масштабном внедрении в корпоративном секторе, реальных развертываниях и известных клиентах.
«История с бенчмарками выглядит менее убедительно, чем ее преподносят, портфолио новее, чем кажется, а экономика сместилась в сторону инфраструктуры вокруг самой модели», — считает он. Массовое признание среди разработчиков доказано, а вот корпоративная стандартизация — нет. «Модель популярна по объему трафика, но все еще не проверена на уровне контрактов».
Важным фактором являются и собственные рекомендации DeepSeek по интеграции, добавил он: в документации для как минимум одной популярной среды агентов указано, что встроенные интеграции V4 недостаточны для надежной работы без отключения проверок совместимости.
«По сути, вендор честно заявляет рынку, что результаты тестов не гарантируют готовность к продакшену», — подчеркнул Гогия. «Модель может блестяще показывать себя в тестах и при этом ошибаться, когда в дело вступают инструменты, учетные данные и контекст состояния».
Уровень инференса ведет себя точно так же: те же открытые веса, запущенные на мощностях разных провайдеров, демонстрируют заметные отличия в пропускной способности и времени безотказной работы. «Таким образом, выбор Flash закрывает один вопрос с закупками и открывает еще три: кто предоставляет услугу, где она запускается и какие средства контроля ее сопровождают», — резюмировал Гогия.
Подготовка к многомодельному будущему
DeepSeek предлагает взвешенные аргументы в пользу многомодельного будущего. Как отмечает Гогия, V4 Flash развертывается в качестве высокопроизводительного рабочего элемента в различных инфраструктурах: она справляется с рутинной генерацией, поиском информации и фоновой автоматизацией, в то время как более сложные или конфиденциальные задачи передаются другим системам.
«Вопрос заключается в том, достаточна ли ее производительность для реальных рабочих процессов, которые используют компании, а не в том, возглавляет ли она все бенчмарки», — заявил он. Предприятия должны определить, какая комбинация модели, среды и провайдера позволяет выполнять работу безопасно и с минимальными затратами.
Адам Даллул (Adam Dalloul), генеральный директор и основатель EmpirioLabs AI, отметил, что больше не всегда означает лучше; выбор рабочих процессов должен зависеть от конкретных задач. Например, его команда в EmpirioLabs AI — которая поддерживает более 100 моделей на базе одного API, включая DeepSeek V4 Flash — недавно работала над переводом своего сайта на разные языки, и для этой задачи не потребовалось привлекать крупную модель вроде GPT 5.6 Sol или Opus 5.
«Здесь как раз пригождаются субагенты», — пояснил он.
Его рекомендуемый подход: запускать более дешевые субагенты и адаптироваться под каждую задачу. Например, использовать варианты Flash для повседневной работы и варианты Pro, когда требуется что-то более мощное. «Все зависит от характера вашего приложения».
Многие компании переориентируются на создание собственных внутренних тестов для эффективной маршрутизации моделей, отметил Даллул. Например, у его команды есть рабочий процесс, в рамках которого модель проходит через различные фильтры и инструкции. Это помогает определить модель, обладающую скоростью и точностью, необходимыми для конкретной задачи.
В другом примере один из корпоративных клиентов потребовал предоставить эксклюзивный доступ к DeepSeek V4 Flash. Они протестировали различные модели, и V4 Flash оказалась единственной, удовлетворяющей их критериям скорости, стоимости и «соответствующего порога интеллекта».
Ахуджа из Meta согласился с тем, что более мелкие и эффективные модели могут справляться с частыми и четко определенными задачами агентов, в то время как более дорогие передовые модели можно оставить для «неоднозначных, сложных или высокорисковых решений». Соответствующей метрикой все чаще становится стоимость успешно завершенного рабочего процесса, а не просто стоимость одного токена.
Однако обратная сторона заключается в том, что дешевый инференс автоматически не означает дешевую или безопасную автоматизацию, предупредил он. Как только ИТ-система получает возможность совершать действия, надежность, верификация, права доступа, обработка сбоев и безопасность приобретают гораздо большую важность.
«Неудачный текстовый ответ — это неприятно; неудачное действие в оперативном рабочем процессе может иметь реальные последствия», — заключил Ахуджа.



