Anthropic выпустила Claude Sonnet 5.5: стоимость выполнения задач снизилась на 30% благодаря большей скорости и меньшему числу вызовов инструментов

Anthropic выпустила Claude Sonnet 5.5: стоимость выполнения задач снизилась на 30% благодаря большей скорости и меньшему числу вызовов инструментов

Сегодня Anthropic объявила о выпуске Claude Sonnet 5.5 — более быстрой и эффективной версии своей рабочей модели ИИ среднего уровня.

В нескольких тестах компании Sonnet 5.5 вплотную приблизилась по производительности к более дорогой модели того же семейства — Opus 5.5, новой флагманской модели Anthropic, выпущенной всего неделю назад. Это дает компаниям еще одну возможность обойтись без оплаты модели высшего класса.

По данным Anthropic, Sonnet 5.5 генерирует ответы более чем на 30% быстрее, чем Claude Sonnet 5, и может снизить общую стоимость выполнения задачи на величину до 30%. В первую очередь это достигается за счет меньшего расхода токенов и меньшего числа вызовов инструментов, а не за счет снижения базовой цены API. VentureBeat обратилась к Anthropic за разъяснениями о том, как именно компания измеряла прирост скорости, и обновит материал, когда получит ответ.

При этом Anthropic сохранила цену API Sonnet 5.5 на уровне ее непосредственной предшественницы, Sonnet 5m: 2/10 долларов за 1 млн входных/выходных токенов соответственно. Также предусмотрена скидка — 0,20 доллара за миллион токенов, считанных из кэша (то есть при повторной отправке той же информации в качестве входных данных). Запись в кэш тоже обходится дешевле — 2,50 доллара за миллион токенов.

Для сравнения: Opus 5.5 стоит 4 доллара за миллион входных токенов и 20 долларов за миллион выходных токенов, а запись в кэш — 5 долларов.

Иными словами, Anthropic все больше делает ставку на стоимость выполнения задачи, а не только на цену обработки отдельного токена.

Anthropic переносит все больше возможностей Opus в Sonnet

Anthropic позиционирует Sonnet 5.5 как оптимальный выбор для повседневных задач с относительно четко заданными условиями: отладки программного обеспечения, написания кода и документов, создания презентаций и электронных таблиц, а также разработки и доработки интерфейсов. Для неоднозначной или открытой работы, требующей длительного принятия взвешенных решений, компания по-прежнему рекомендует Opus 5.5.

Однако результаты собственных тестов Anthropic показывают, что в некоторых задачах разрыв между моделями двух уровней существенно сократился.

В тесте GDPval-AA, который оценивает выполнение задач из реальных профессий, Sonnet 5.5 набрала, по данным Anthropic, 1844 балла — почти столько же, сколько Opus 5.5 с ее 1846 баллами, и значительно больше, чем Sonnet 5 с 1449 баллами. В тесте AA-Briefcase результат Sonnet 5.5 составил 1811 баллов против 1822 у Opus 5.5.

В частичном тесте Anthropic на управление компьютером OSWorld 2.1 модель набрала 80,1% против 81,8% у Opus 5.5 и 57% у Sonnet 5. В тесте Chartography на распознавание визуальных диаграмм Sonnet 5.5 показала результат 61,6% против 64,4% у Opus 5.5 и всего 15,6% у Sonnet 5.

По словам Anthropic, модель особенно хорошо справляется с написанием кода. В бенчмарке Terminal-Bench 4.0 для ИИ-агентов, пишущих код, результат Sonnet 5.5 составил 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 при указанных настройках. В CursorBench 4.0 Sonnet 5.5 набрала 55,5%, немного уступив Opus 5.5 с результатом 57,8%.

Результаты бенчмарков не следует напрямую переносить на любые производственные задачи, и сама Anthropic признает, что Opus 5.5 по-прежнему заметно лучше справляется со сложной работой без четко заданных рамок.

И все же экономическая сторона вопроса может оказаться важнее места в рейтинге.

По данным Anthropic, в нескольких тестах Sonnet 5.5 при низком или среднем уровне усилий может превзойти лучший результат Sonnet 5, затратив на задачу примерно в десять раз меньше средств. В тесте FrontierCode Sonnet 5.5 при высоком уровне усилий набирает примерно на 10 баллов больше Sonnet 5 при той же настройке, а стоимость выполнения задачи оказывается примерно в 15 раз ниже.

В Claude Code и пользовательских приложениях Anthropic для модели по умолчанию будет установлен средний уровень усилий, а в Claude Platform — высокий. Низкие настройки сокращают задержку и расход токенов за счет некоторого снижения глубины рассуждений; высокие позволяют модели дольше проверять и дорабатывать результат.

Клиенты отмечают меньше шагов и более быстрых ИИ-агентов

Anthropic также предоставила VentureBeat результаты раннего тестирования у клиентов, которые на практике показывают, что могут означать заявления об эффективности в рабочих процессах компаний.

В Box вице-президент по продуктам ИИ Яшодха Бхавнани рассказала, что Sonnet 5.5 перепроверяла исходные документы и замечала ошибки, которые пропускала предыдущая модель.

«По сравнению с предыдущей моделью Sonnet 5.5 была точнее, работала в 2,4 раза быстрее и использовала на 12% меньше токенов в общей сложности», — сказала Бхавнани.

Zendesk протестировала модель на сотнях обращений в службу поддержки, включая ответы клиентам и решения об эскалации. По словам директора по ИИ Абхиная Катурии, обработка заявок проходила на 20% быстрее, а модель принимала меньше ошибочных решений, чем используемые Zendesk в производственной среде модели Claude.

В Slack наблюдалась похожая картина. Главный инженер Кёртис Аллен сообщил, что Sonnet 5.5 превзошла Sonnet 5 почти во всех внутренних тестах Slackbot без каких-либо изменений в промптах, при этом требовалось меньше шагов и примерно на 14% меньше выходных токенов.

Для ИИ-агентов, пишущих код, сокращение числа шагов может оказаться особенно важным. Сооснователь и технический директор Lovable Фабиан Хедин сообщил, что, согласно тестам компании, для выполнения задач по написанию кода Sonnet 5.5 требовалось примерно на треть меньше вызовов инструментов и примерно вдвое меньше запусков командной оболочки.

А в Base44 выяснили, что при создании 118 реальных приложений Sonnet 5.5 достигала результатов, сопоставимых с Opus 5, в среднем за 3,6 итерации на сборку против 7,7 у Opus 5. Кроме того, среди сравниваемых моделей у нее было меньше всего неудачных вызовов инструментов.

Эти цифры подчеркивают все более важный для компаний аспект внедрения ИИ-агентов: цена токенов — лишь часть общей картины. Каждый лишний вызов инструмента, неудачное действие и повторная попытка могут увеличить задержку и расходы на инфраструктуру, а также повысить риск того, что автономный рабочий процесс пойдет не по плану.

Конкуренция по цене среди повседневных моделей передового уровня обостряется

Выход Sonnet 5.5 происходит на фоне все более агрессивной конкуренции среди моделей, занимающих нишу ниже самого дорогого передового уровня.

На прошлой неделе OpenAI выпустила GPT-6 Sol. Сейчас стандартные тарифы API этой модели составляют те же 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов, что и у Sonnet 5.5; кэшированные входные токены стоят 0,20 доллара, а запись в кэш — 2,50 доллара.

OpenAI позиционирует Sol как модель для сложных задач по написанию кода и рабочих процессов с ИИ-агентами. Ее контекстное окно составляет 1,05 млн токенов.

Google предлагает более низкую стартовую цену, чем обе компании, на модель Gemini 3.8 Flash: до конца 2026 года она стоит 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных. По словам Google, с 1 января 2027 года стандартная цена вырастет до 1,50 и 7,50 доллара соответственно.

А недавно китайская электронная компания и быстро растущая исследовательская лаборатория в области ИИ Xiaomi выпустила модель передового уровня MiMo-V2.6-Pro и модель среднего уровня Flash по разрешительной лицензии MIT, удобной для предприятий. Это означает, что компании и разработчики уже могут бесплатно скачивать эти модели и настраивать их по своему усмотрению, не платя Xiaomi ни цента. По цене API они входят в число самых доступных моделей в мире.

Модель

Входные данные ($/1 млн)

Выходные данные ($/1 млн)

Всего ($/1 млн)

Источник

Muse Spark 1.2 / 1.3 Contributor

$0,10

$0,20

$0,30

Meta

MiMo-V2.6-Flash

$0,14

$0,28

$0,42

Xiaomi

GPT-6 Luna

$0,10

$0,50

$0,60

OpenAI

DeepSeek-V4.1-Flash — в непиковые часы

$0,15

$0,60

$0,75

DeepSeek

MiMo-V2.6-Pro

$0,435

$0,87

$1,305

Xiaomi

MiniMax-M3

$0,30

$1,20

$1,50

MiniMax

LongCat-2.0 — временная акция

$0,30

$1,20

$1,50

LongCat

DeepSeek-V4.1-Flash — в часы пик

$0,30

$1,20

$1,50

DeepSeek

DeepSeek-V4-Pro — в непиковые часы

$0,66

$1,98

$2,64

DeepSeek

LongCat-2.0 — стандартный тариф

$0,75

$2,95

$3,70

LongCat

Gemini 3.7 Flash — до 31 декабря 2026 года

$0,75

$3,75

$4,50

Google

Gemini 3.8 Flash — до 31 декабря 2026 года

$0,75

$3,75

$4,50

Google

DeepSeek-V4-Pro — в часы пик

$1,32

$3,96

$5,28

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

$1,25

$4,25

$5,50

Meta

GLM-5.3

$1,40

$4,40

$5,80

Z.AI

Grok 4.7 — ≤200 тыс. токенов в запросе

$2,00

$6,00

$8,00

xAI

Qwen3.8-Max

$2,00

$6,00

$8,00

QwenCloud

Gemini 3.7 Flash — с 1 января 2027 года

$1,50

$7,50

$9,00

Google

Gemini 3.8 Flash — с 1 января 2027 года

$1,50

$7,50

$9,00

Google

GPT-6 Sol

$2,00

$10,00

$12,00

OpenAI

Claude Sonnet 5.5

$2,00

$10,00

$12,00

Anthropic

Grok 4.7 — >200 тыс. токенов в запросе

$4,00

$12,00

$16,00

xAI

Grok 4.7 Fast (Cursor) — ≤256 тыс. входных токенов

$4,00

$12,00

$16,00

Cursor

GPT-5.4

$2,50

$15,00

$17,50

OpenAI

Kimi K3

$3,00

$15,00

$18,00

Moonshot AI

Claude Opus 5.5

$4,00

$20,00

$24,00

Anthropic

Grok 4.7 Fast (Cursor) — >256 тыс. входных токенов, до 500 тыс.

$6,00

$18,00

$24,00

Cursor

Sakana Fugu Ultra (≤272 тыс.)

$5,00

$30,00

$35,00

Sakana AI

Claude Opus 5.5 — быстрый режим

$8,00

$40,00

$48,00

Anthropic

Claude Fable 5 / Claude Mythos 5

$10,00

$50,00

$60,00

Anthropic

Claude Fable 5.1 / Claude Mythos 5.1

$10,00

$50,00

$60,00

Anthropic

GPT-6 Astra — стандартный режим

$10,00

$50,00

$60,00

OpenAI

GPT-6 Astra — быстрый режим

$20,00

$100,00

$120,00

OpenAI

Это означает, что Anthropic не пытается выиграть этот раунд, просто предлагая самые дешевые токены. Вместо этого Sonnet 5.5 делает более широкий акцент на эффективности: модель, которая выполняет задачу за меньшее число шагов рассуждения, с меньшим расходом токенов и меньшим числом вызовов инструментов, может снизить общие эксплуатационные расходы, даже если цена за токен не меняется.

Этот подход также знаменует собой отход от первоначального запуска Sonnet 5. В июне Anthropic представила Sonnet 5 по вводной цене 2 доллара за миллион входных и 10 долларов за миллион выходных токенов, а в августе сделала эти тарифы постоянными вместо того, чтобы повышать их до запланированных ранее 3/15 долларов.

Более мощные кибервозможности сопровождаются более строгими ограничениями

Рост производительности сопровождается заметным изменением в области безопасности: Sonnet 5.5 стала первой моделью семейства Sonnet, которую Anthropic выпускает с мерами киберзащиты, разработанными по образцу тех, что используются в ее системах с самыми широкими возможностями.

По словам Anthropic, обычная разработка программного обеспечения и устранение уязвимостей по-прежнему должны работать без изменений, однако некоторые запросы по кибербезопасности с повышенным уровнем риска будут автоматически перенаправляться на Sonnet 5. Компания планирует расширить программу Cyber Verification Program, чтобы проверенные специалисты по защите могли получить доступ к более продвинутым возможностям Sonnet 5.5, Opus 5.5 и моделей Mythos.

Anthropic также вводит меры защиты от того, что компания называет «атаками с дистилляцией модели», когда злоумышленники пытаются воспроизвести возможности модели, отправляя ей запросы в промышленных масштабах. Критики отмечают, что многие современные открытые большие языковые модели обучаются на данных, сгенерированных другими моделями. При этом Anthropic, уже использовавшая огромные объемы защищенных авторским правом данных без явного согласия или выплаты вознаграждения многим авторам и правообладателям, занимает не слишком убедительную этическую или моральную позицию, утверждая, будто создание новой модели на основе ответов ее собственной модели является преступлением или чем-то предосудительным.

Sonnet 5.5 стала первой моделью семейства Sonnet, выпущенной с классификаторами, предназначенными для блокировки извлечения ее рассуждений. Anthropic также расширяет систему «сохранения мыслительного процесса», чтобы рассуждения нельзя было отделить от учетной записи, в которой они были созданы. Меры биологической безопасности остаются такими же, как у Sonnet 5.

Доступна во всех крупнейших облачных сервисах

Claude Sonnet 5.5 будет доступна через Anthropic, а также Amazon Web Services, Google Cloud и Microsoft Azure, с поддержкой нулевого хранения данных. Разработчики смогут получить к ней доступ через Claude Platform, используя идентификатор модели claude-sonnet-5-5.

По словам Anthropic, предназначенная для больших объемов задач и особенно чувствительных к затратам сценариев Claude Haiku 5.5 выйдет в ближайшие недели.

Для корпоративных разработчиков Sonnet 5.5 может оказаться самой значимой частью линейки — не потому, что Anthropic резко снизила тарифы API, а потому, что компания стремится приблизить производительность модели среднего уровня к премиальной настолько, чтобы для многих задач больше не требовалось переходить на уровень выше.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.