Claude Opus 5 от Anthropic сокращает расходы на ИИ вдвое

Claude Opus 5 от Anthropic сокращает расходы на ИИ вдвое

Источник: VentureBeat · Michael Nuñez

Anthropic выпустила в пятницу Claude Opus 5 — модель, которая, по словам компании, обеспечивает практически весь уровень интеллекта ее флагманской системы Claude Fable 5 за полцены. Этот запуск сигнализирует о том, как гонка в сфере искусственного интеллекта смещается от чистой производительности к экономике повседневного использования.

Модель, которая сразу же стала доступна на всех платформах Anthropic, оценивается в 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов — цена осталась неизменной по сравнению с ее предшественницей, Opus 4.8. Она становится новой моделью по умолчанию в Claude Max, премиальном потребительском тарифе Anthropic, а также самой мощной моделью, доступной в Claude Pro.

Такое позиционирование выбрано намеренно. Anthropic не утверждает, что Opus 5 — ее самая умная модель: это звание по-прежнему принадлежит Fable 5, а конкурирующие системы сохраняют преимущество в определенных областях. Вместо этого компания делает более тонкий аргумент, который может оказаться важнее для корпоративных покупателей: наиболее экономически важная работа с ИИ происходит в среднем диапазоне сложности, где околопередовой интеллект, поставляемый эффективно и дешево, превосходит передовой интеллект, обходящийся дорого.

«Opus 5 — это ваша рабочая лошадка на каждый день, модель, которой вы поручаете сложную работу и которую проверяете по ее завершении, — заявил представитель Anthropic в интервью VentureBeat, описывая текущую стратификацию линейки компании. — Fable 5 — для вашей самой амбициозной работы, многодневных автономных проектов, за которые раньше не бралось ничего… Sonnet 5 — для работы в больших масштабах, где скорость и стоимость за один вызов определяют, что идет в продакшен. Haiku 4.5 — для субагентов и мгновенных ответов».

Как результаты бенчмарков Claude Opus 5 соотносятся с Fable 5 и конкурирующими моделями ИИ

На бумаге результаты впечатляют. В Anthropic заявляют, что Opus 5 устанавливает новые рекорды в тестах на написание кода и интеллектуальную работу, включая Frontier-Bench и GDPval-AA. Согласно данным компании, в Frontier-Bench v0.1, бенчмарке агентского кодирования в терминале, Opus 5 набирает 43,3 процента — более чем в два раза больше, чем 18,7 процента у Opus 4.8, и значительно опережая 33,7 процента у Fable 5 — при более низкой стоимости за задачу. В ARC-AGI 3, тесте на нестандартное решение проблем, Anthropic сообщает, что Opus 5 набрала в три раза больше баллов, чем следующая лучшая модель. В OSWorld 2.0, бенчмарке использования компьютера, модель, по заявлению компании, превосходит лучший результат Fable 5 при затратах, составляющих чуть более трети от прежних.

Эти цифры сопровождаются честными оговорками, которые сами по себе примечательны для индустрии, склонной к превосходным степеням. Anthropic признает, что Opus 5 все еще отстает от Mythos 5 (конкурирующей модели) в задачах по кибербезопасности и биологическим исследованиям, а модель из семейства OpenAI по-прежнему лидирует в одном из бенчмарков агентского кодирования.

Еще более показательная оговорка прозвучала от самой Anthropic, когда ее спросили, в чем именно Opus 5 все еще уступает Fable 5. Ответ представителя компании свелся к откровенному признанию того, что бенчмарки измеряют, а что нет.

«Бенчмарки, в которых побеждает Opus 5, — это ограниченные задачи с конкретным результатом, и в этом ее сила. Чего эти бенчмарки не измеряют, так это продолжительность, — рассказал представитель VentureBeat. — Если сформулировать иначе: Opus 5 — лучший инструмент для задач, которые видят бенчмарки, а Fable 5 — это то, к чему вы обращаетесь, когда работа выходит за рамки бенчмарка».

Fable 5, напротив, «предназначена для самых долгих и автономных задач, где модель должна сохранять логичность и связность на протяжении множества связанных шагов в течение многих часов или дней при работе с плотным исходным материалом», — пояснил представитель, посоветовав клиентам «запускать обе модели на репрезентативной рабочей нагрузке: одну для ограниченной задачи, а другую для долгосрочной» . Такой подход — ограниченные задачи против долгосрочной автономности — может стать определяющей осью дифференциации моделей в 2026 году, по мере того как бенчмарки насыщаются, а самые сложные оставшиеся проблемы включают в себя непрерывную многодневную агентскую работу, а не дискретные головоломки.

Почему эффективность токенов становится настоящим полем битвы за корпоративные расходы на ИИ

Через весь анонс красной нитью проходит мысль, которую Anthropic явно хочет донести до покупателей: Opus 5 не просто демонстрирует хорошие баллы, она демонстрирует их на каждый потраченный доллар. Модель поставляется с регулируемой настройкой «усилий» (effort), которая позволяет клиентам жертвовать интеллектом ради скорости и экономии токенов, а графики Anthropic подчеркивают производительность при определенной стоимости, а не только пиковые показатели.

Первые клиенты повторили этот тезис с необычной конкретикой. По словам Нико Групена (Niko Grupen), руководителя отдела прикладных исследований в юридической ИИ-компании Harvey, модель Opus 5 добилась производительности, сопоставимой с режимом максимального рассуждения Opus 4.8, «генерируя при этом в среднем на 26% меньше токенов». Ричард Фам (Richard Pham) из Fundamental Research Lab отметил, что при решении сложных задач финансового моделирования точность модели оказалась в среднем на девять процентных пунктов выше, «при этом использовалось примерно на треть меньше ходов и вызовов инструментов и тратилось на 60% меньше времени».

Уэйд Фостер (Wade Foster), генеральный директор Zapier, сообщил, что Opus 5 возглавила лидерборд AutomationBench его компании, «не потратив больше токенов, чем предыдущие модели Claude», и выполнила полный рабочий процесс по предотвращению оттока клиентов от начала и до конца. «Предыдущие модели не справились; Opus 5 достигла 100%», — заявил он. Скотт Ву (Scott Wu), генеральный директор Cognition (компании, создавшей агента кодирования Devin), отметил, что в FrontierCode 1.1 «Claude Opus 5 приближается к производительности уровня Fable за полцены», демонстрируя особую силу в отладке и анализе первопричин.

Акцент на эффективности отражает коммерческую реальность. Корпоративные расходы на ИИ больше не являются экспериментальными, и затраты на инференс — цену реального запуска этих моделей в масштабе — стали статьей расходов на уровне совета директоров.

Бизнес Anthropic сильно смещен в сторону API и корпоративного использования. Согласно анализу Contrary Research за февраль 2026 года, по состоянию на конец 2025 года Claude занимала около 40 процентов рынка корпоративных больших языковых моделей по объему использования, а только один Claude Code вышел на уровень около 1 миллиарда долларов годового дохода. Для компании, клиенты которой платят за токены, модель, которая делает больше меньшим количеством токенов — это не приятное дополнение. Это и есть сам продукт.

Самопроверяющиеся агенты ИИ и что они значат для скрытых издержек автоматизации

Помимо цифр, Anthropic продает поведенческую историю: Opus 5 проверяет свою работу и повторяет итерации до тех пор, пока не добьется успеха. Компания привела несколько примеров из тестирования, которые читаются как небольшие притчи об упрямстве машин.

В одной из задач Frontier-Bench от модели требовалось восстановить детальный чертеж машинной детали в виде 3D CAD-модели, причем по задумке у нее не было возможности просмотреть исходный рисунок. Anthropic заявляет, что вместо того, чтобы потерпеть неудачу, Opus 5 написала собственный конвейер компьютерного зрения для извлечения геометрии из сырых пикселей — и делала это неоднократно, в то время как ни одна конкурирующая модель не справилась с задачей за пять попыток. В другом случае, получив реальный баг в популярном менеджере пакетов с открытым исходным кодом, модель нашла первопричину и исправила крайний случай (edge case), который пропустил собственный патч сообщества; конкурирующая модель пропатчила лишь симптом и объявила о победе. Инженер одной из торговых фирм, по словам компании, использовал Opus 5, чтобы за одну сессию создать ленту рыночных данных для новой биржи, и, не найдя «живой» ленты для проверки, наблюдал, как модель сама создала тестовый стенд для проверки своего кода парсинга.

Клиенты описывали похожее поведение «в дикой природе». Кристиан Ривера (Cristian Rivera), ведущий инженер-программист в Stripe, рассказал, что доверил модели «роль руководителя аппарата (chief-of-staff) в моих средах разработки» на один уик-энд: «она создала собственный монитор, управляла каждым контейнером и привлекала меня только тогда, когда требовалось принять экспертное решение».

Это именно те возможности, которые действительно волнуют бизнес, и стоит задуматься о том, почему. Разрыв между моделью, которая выдает правдоподобный результат, и моделью, которая проверяет свой результат, — это разрыв между демоверсией и готовой к развертыванию системой. Большая часть скрытых затрат на корпоративный ИИ сегодня — это проверка человеком (инженеры перепроверяют работу машины). Модель, которая надежно проверяет собственную работу, сокращает эти издержки, и именно поэтому клиенты продолжают ссылаться на меньшее количество ходов, меньше проходов и меньше времени, а не на более высокие сырые баллы.

Внутри стратегии безопасности Anthropic: пробелы в возможностях, классификаторы и откаты моделей

Этот запуск также демонстрирует все более сложный подход Anthropic к безопасности — подход, который теперь предполагает намеренное необучение моделей определенным навыкам. Компания заявляет, что ее автоматический аудит поведения показал: Opus 5 является ее наиболее согласованной моделью на сегодняшний день. Она получила 2,3 балла по шкале общего несогласованного поведения (misaligned behavior), что ниже, чем у Opus 4.8, Sonnet 5 или Fable 5, при этом у нее зафиксированы самые низкие показатели деструктивного поведения и наименьшая подверженность манипуляциям с целью злоумышленного использования.

Что касается возможностей, Anthropic утверждает, что намеренно не стала обучать Opus 5 задачам в области кибербезопасности, как это делалось с Opus 4.8. Модель все равно улучшила свои показатели в этой сфере — как побочный эффект общего прироста возможностей — и теперь почти не уступает Mythos 5 в поиске уязвимостей в программном обеспечении. Но она по-прежнему сильно отстает в их эксплуатации: в оценке Anthropic OSS-Fuzz модель Opus 5 выявляла уязвимости в 79,4% случаев (что близко к 80% у Mythos 5), но преуспела в разработке эксплойтов лишь для 4 задач против 13 у Mythos 5. Эта асимметрия — сильна в обнаружении, актуальном для защиты, и славна в эксплуатации, актуальной для атак — судя по всему, заложена разработчиками намеренно, и средства защиты следуют той же логике. Anthropic ожидает, что киберклассификаторы Opus 5 будут вмешиваться примерно на 85 процентов реже, чем классификаторы Fable 5.

Когда классификатор все же срабатывает, запросы в Claude.ai, Claude Code и Claude Cowork по умолчанию перенаправляются на Opus 4.8. Это вызывает очевидный вопрос: если запрос слишком рискован для одной модели, почему он приемлем для другой? «Модель, на которую происходит откат, обладает более низким уровнем возможностей, что также снижает риск вредоносного использования», — пояснил представитель компании, добавив, что «в чате появляется видимое сообщение, уведомляющее пользователя о том, что это произошло».

Эту логику можно защитить, но она обнажает то, как безопасность ИИ работает на практике в 2026 году: риск — это свойство не только самого вопроса, но и вопроса, умноженного на возможности системы, которая на него отвечает. В сфере биологии расчеты работают в обратную сторону. Opus 5 теперь является наиболее способной общедоступной моделью Anthropic для научных исследований — она на 10,2 процентных пункта превосходит Opus 4.8 в собственном бенчмарке компании по химии, хотя представитель признал, что «Mythos 5 остается более сильной моделью для долгосрочной, открытой работы вроде автономных кампаний по разработке лекарств».

Бизнес-ставки релиза: оценка в 380 миллиардов долларов и масштабные инвестиции в вычисления

Запуск происходит в момент исключительного коммерческого импульса и колоссальных обязательств для Anthropic. В мае компания привлекла 65 миллиардов долларов в ходе раунда финансирования Серии H при оценке в 965 миллиардов долларов после инвестиций (post-money), лидерами раунда выступили Altimeter Capital, Dragoneer, Greenoaks и Sequoia Capital — по сравнению с оценкой примерно в 380 миллиардов долларов на предыдущем раунде в феврале.

В Anthropic сообщили, что ее годовой темп выручки (run-rate) в мае превысил 47 миллиардов долларов — ошеломляющий скачок для компании, которая, согласно анализу Contrary Research, генерировала около 1 миллиарда долларов годового дохода в конце 2024 года. Эти показатели подкрепляются огромными инфраструктурными обязательствами, включая сделку с Azure по вычислениям на сумму 30 миллиардов долларов вместе с соглашениями с Google Cloud и Nvidia. Подобные расходы имеют смысл только в том случае, если корпоративные клиенты продолжают наращивать объемы использования.

В этом контексте стратегия ценообразования Opus 5 выглядит вполне логичной. Сохранение цен на уровне Opus 4.8 при почти двукратном росте производительности в ключевых агентских бенчмарках фактически означает резкое снижение стоимости за единицу возможностей. Это сделано для того, чтобы расширить воронку рабочих нагрузок, автоматизация которых экономически выгодна. Каждая задача, бывшая маржинальной при стоимости успешного выполнения для Opus 4.8, становится жизнеспособной с Opus 5, а каждая жизнеспособная задача превращается в регулярный доход от токенов.

Нормативно-правовой фон также стал более сложным. На этой неделе американский судья окончательно утвердил мировое соглашение Anthropic с авторами книг на сумму 1,5 миллиарда долларов по иску об авторских правах, как сообщило агентство Reuters, закрыв главу судебных разбирательств по поводу исходных обучающих данных компании. А в июне агентство Reuters со ссылкой на Axios сообщило, что правительство США предприняло шаги по блокировке иностранного доступа к самым передовым моделям Anthropic, что служит напоминанием о том, что передовой ИИ теперь переплетен с экспортной политикой способами, определяющими, какие клиенты и что могут покупать.

Также в пятницу выпускаются: режим Fast, работающий примерно в 2,5 раза быстрее стандартного при удвоенной базовой цене; автоматическая маршрутизация с откатами (fallback routing) в API; а также изменения инструментов прямо во время разговора, которые больше не аннулируют кэш промптов — небольшая функция, которую разработчики агентов оценят, пожалуй, больше любого бенчмарка. В соответствии с предыдущими моделями Opus, у Opus 5 нет требований к хранению данных для общего доступа — эту деталь представитель компании отметил без подсказки для клиентов, у которых действует «жесткое требование нулевого хранения данных» . Разработчики могут получить доступ к модели как к `claude-opus-5` в Claude API начиная с сегодняшнего дня.

Оправдаются ли эти ставки, покажут два фактора: выдержат ли заявления об эффективности Opus 5 столкновение с рабочими нагрузками в продакшене в масштабе и примет ли бизнес мир, в котором классификаторы безопасности, а не пользователи, порой решают, какая модель дает ответ. Но более глубокий смысл пятничного релиза заключается в том, что центр тяжести индустрии ИИ сместился. В течение трех лет лаборатории соревновались в том, что их лучшая модель может сделать в свой лучший день. С выходом Opus 5 компания Anthropic вступает в конкуренцию на менее гламурном, но гораздо более прибыльном поприще: что очень хорошая модель может делать каждый день за полцены. На рынке, где технологический рубеж постоянно сдвигается, Anthropic делает ставку на то, что настоящие сокровища кроются как раз за ним.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.