Anthropic выпустила Claude Sonnet 5.5: стоимость выполнения задач снизилась на 30% благодаря большей скорости и меньшему числу вызовов инструментов
Сегодня Anthropic объявила о выпуске Claude Sonnet 5.5 — более быстрой и эффективной версии своей рабочей модели ИИ среднего уровня.
В нескольких тестах компании Sonnet 5.5 вплотную приблизилась по производительности к более дорогой модели того же семейства — Opus 5.5, новой флагманской модели Anthropic, выпущенной всего неделю назад. Это дает компаниям еще одну возможность обойтись без оплаты модели высшего класса.
По данным Anthropic, Sonnet 5.5 генерирует ответы более чем на 30% быстрее, чем Claude Sonnet 5, и может снизить общую стоимость выполнения задачи на величину до 30%. В первую очередь это достигается за счет меньшего расхода токенов и меньшего числа вызовов инструментов, а не за счет снижения базовой цены API. VentureBeat обратилась к Anthropic за разъяснениями о том, как именно компания измеряла прирост скорости, и обновит материал, когда получит ответ.
При этом Anthropic сохранила цену API Sonnet 5.5 на уровне ее непосредственной предшественницы, Sonnet 5m: 2/10 долларов за 1 млн входных/выходных токенов соответственно. Также предусмотрена скидка — 0,20 доллара за миллион токенов, считанных из кэша (то есть при повторной отправке той же информации в качестве входных данных). Запись в кэш тоже обходится дешевле — 2,50 доллара за миллион токенов.
Для сравнения: Opus 5.5 стоит 4 доллара за миллион входных токенов и 20 долларов за миллион выходных токенов, а запись в кэш — 5 долларов.
Иными словами, Anthropic все больше делает ставку на стоимость выполнения задачи, а не только на цену обработки отдельного токена.
Anthropic переносит все больше возможностей Opus в Sonnet
Anthropic позиционирует Sonnet 5.5 как оптимальный выбор для повседневных задач с относительно четко заданными условиями: отладки программного обеспечения, написания кода и документов, создания презентаций и электронных таблиц, а также разработки и доработки интерфейсов. Для неоднозначной или открытой работы, требующей длительного принятия взвешенных решений, компания по-прежнему рекомендует Opus 5.5.
Однако результаты собственных тестов Anthropic показывают, что в некоторых задачах разрыв между моделями двух уровней существенно сократился.
В тесте GDPval-AA, который оценивает выполнение задач из реальных профессий, Sonnet 5.5 набрала, по данным Anthropic, 1844 балла — почти столько же, сколько Opus 5.5 с ее 1846 баллами, и значительно больше, чем Sonnet 5 с 1449 баллами. В тесте AA-Briefcase результат Sonnet 5.5 составил 1811 баллов против 1822 у Opus 5.5.
В частичном тесте Anthropic на управление компьютером OSWorld 2.1 модель набрала 80,1% против 81,8% у Opus 5.5 и 57% у Sonnet 5. В тесте Chartography на распознавание визуальных диаграмм Sonnet 5.5 показала результат 61,6% против 64,4% у Opus 5.5 и всего 15,6% у Sonnet 5.
По словам Anthropic, модель особенно хорошо справляется с написанием кода. В бенчмарке Terminal-Bench 4.0 для ИИ-агентов, пишущих код, результат Sonnet 5.5 составил 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 при указанных настройках. В CursorBench 4.0 Sonnet 5.5 набрала 55,5%, немного уступив Opus 5.5 с результатом 57,8%.
Результаты бенчмарков не следует напрямую переносить на любые производственные задачи, и сама Anthropic признает, что Opus 5.5 по-прежнему заметно лучше справляется со сложной работой без четко заданных рамок.
И все же экономическая сторона вопроса может оказаться важнее места в рейтинге.
По данным Anthropic, в нескольких тестах Sonnet 5.5 при низком или среднем уровне усилий может превзойти лучший результат Sonnet 5, затратив на задачу примерно в десять раз меньше средств. В тесте FrontierCode Sonnet 5.5 при высоком уровне усилий набирает примерно на 10 баллов больше Sonnet 5 при той же настройке, а стоимость выполнения задачи оказывается примерно в 15 раз ниже.
В Claude Code и пользовательских приложениях Anthropic для модели по умолчанию будет установлен средний уровень усилий, а в Claude Platform — высокий. Низкие настройки сокращают задержку и расход токенов за счет некоторого снижения глубины рассуждений; высокие позволяют модели дольше проверять и дорабатывать результат.
Клиенты отмечают меньше шагов и более быстрых ИИ-агентов
Anthropic также предоставила VentureBeat результаты раннего тестирования у клиентов, которые на практике показывают, что могут означать заявления об эффективности в рабочих процессах компаний.
В Box вице-президент по продуктам ИИ Яшодха Бхавнани рассказала, что Sonnet 5.5 перепроверяла исходные документы и замечала ошибки, которые пропускала предыдущая модель.
«По сравнению с предыдущей моделью Sonnet 5.5 была точнее, работала в 2,4 раза быстрее и использовала на 12% меньше токенов в общей сложности», — сказала Бхавнани.
Zendesk протестировала модель на сотнях обращений в службу поддержки, включая ответы клиентам и решения об эскалации. По словам директора по ИИ Абхиная Катурии, обработка заявок проходила на 20% быстрее, а модель принимала меньше ошибочных решений, чем используемые Zendesk в производственной среде модели Claude.
В Slack наблюдалась похожая картина. Главный инженер Кёртис Аллен сообщил, что Sonnet 5.5 превзошла Sonnet 5 почти во всех внутренних тестах Slackbot без каких-либо изменений в промптах, при этом требовалось меньше шагов и примерно на 14% меньше выходных токенов.
Для ИИ-агентов, пишущих код, сокращение числа шагов может оказаться особенно важным. Сооснователь и технический директор Lovable Фабиан Хедин сообщил, что, согласно тестам компании, для выполнения задач по написанию кода Sonnet 5.5 требовалось примерно на треть меньше вызовов инструментов и примерно вдвое меньше запусков командной оболочки.
А в Base44 выяснили, что при создании 118 реальных приложений Sonnet 5.5 достигала результатов, сопоставимых с Opus 5, в среднем за 3,6 итерации на сборку против 7,7 у Opus 5. Кроме того, среди сравниваемых моделей у нее было меньше всего неудачных вызовов инструментов.
Эти цифры подчеркивают все более важный для компаний аспект внедрения ИИ-агентов: цена токенов — лишь часть общей картины. Каждый лишний вызов инструмента, неудачное действие и повторная попытка могут увеличить задержку и расходы на инфраструктуру, а также повысить риск того, что автономный рабочий процесс пойдет не по плану.
Конкуренция по цене среди повседневных моделей передового уровня обостряется
Выход Sonnet 5.5 происходит на фоне все более агрессивной конкуренции среди моделей, занимающих нишу ниже самого дорогого передового уровня.
На прошлой неделе OpenAI выпустила GPT-6 Sol. Сейчас стандартные тарифы API этой модели составляют те же 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов, что и у Sonnet 5.5; кэшированные входные токены стоят 0,20 доллара, а запись в кэш — 2,50 доллара.
OpenAI позиционирует Sol как модель для сложных задач по написанию кода и рабочих процессов с ИИ-агентами. Ее контекстное окно составляет 1,05 млн токенов.
Google предлагает более низкую стартовую цену, чем обе компании, на модель Gemini 3.8 Flash: до конца 2026 года она стоит 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных. По словам Google, с 1 января 2027 года стандартная цена вырастет до 1,50 и 7,50 доллара соответственно.
А недавно китайская электронная компания и быстро растущая исследовательская лаборатория в области ИИ Xiaomi выпустила модель передового уровня MiMo-V2.6-Pro и модель среднего уровня Flash по разрешительной лицензии MIT, удобной для предприятий. Это означает, что компании и разработчики уже могут бесплатно скачивать эти модели и настраивать их по своему усмотрению, не платя Xiaomi ни цента. По цене API они входят в число самых доступных моделей в мире.
|
Модель |
Входные данные ($/1 млн) |
Выходные данные ($/1 млн) |
Всего ($/1 млн) |
Источник |
|
Muse Spark 1.2 / 1.3 Contributor |
$0,10 |
$0,20 |
$0,30 |
|
|
MiMo-V2.6-Flash |
$0,14 |
$0,28 |
$0,42 |
|
|
GPT-6 Luna |
$0,10 |
$0,50 |
$0,60 |
|
|
DeepSeek-V4.1-Flash — в непиковые часы |
$0,15 |
$0,60 |
$0,75 |
|
|
MiMo-V2.6-Pro |
$0,435 |
$0,87 |
$1,305 |
|
|
MiniMax-M3 |
$0,30 |
$1,20 |
$1,50 |
|
|
LongCat-2.0 — временная акция |
$0,30 |
$1,20 |
$1,50 |
|
|
DeepSeek-V4.1-Flash — в часы пик |
$0,30 |
$1,20 |
$1,50 |
|
|
DeepSeek-V4-Pro — в непиковые часы |
$0,66 |
$1,98 |
$2,64 |
|
|
LongCat-2.0 — стандартный тариф |
$0,75 |
$2,95 |
$3,70 |
|
|
Gemini 3.7 Flash — до 31 декабря 2026 года |
$0,75 |
$3,75 |
$4,50 |
|
|
Gemini 3.8 Flash — до 31 декабря 2026 года |
$0,75 |
$3,75 |
$4,50 |
|
|
DeepSeek-V4-Pro — в часы пик |
$1,32 |
$3,96 |
$5,28 |
|
|
Muse Spark 1.1 / 1.2 / 1.3 |
$1,25 |
$4,25 |
$5,50 |
|
|
GLM-5.3 |
$1,40 |
$4,40 |
$5,80 |
|
|
Grok 4.7 — ≤200 тыс. токенов в запросе |
$2,00 |
$6,00 |
$8,00 |
|
|
Qwen3.8-Max |
$2,00 |
$6,00 |
$8,00 |
|
|
Gemini 3.7 Flash — с 1 января 2027 года |
$1,50 |
$7,50 |
$9,00 |
|
|
Gemini 3.8 Flash — с 1 января 2027 года |
$1,50 |
$7,50 |
$9,00 |
|
|
GPT-6 Sol |
$2,00 |
$10,00 |
$12,00 |
|
|
Claude Sonnet 5.5 |
$2,00 |
$10,00 |
$12,00 |
|
|
Grok 4.7 — >200 тыс. токенов в запросе |
$4,00 |
$12,00 |
$16,00 |
|
|
Grok 4.7 Fast (Cursor) — ≤256 тыс. входных токенов |
$4,00 |
$12,00 |
$16,00 |
|
|
GPT-5.4 |
$2,50 |
$15,00 |
$17,50 |
|
|
Kimi K3 |
$3,00 |
$15,00 |
$18,00 |
|
|
Claude Opus 5.5 |
$4,00 |
$20,00 |
$24,00 |
|
|
Grok 4.7 Fast (Cursor) — >256 тыс. входных токенов, до 500 тыс. |
$6,00 |
$18,00 |
$24,00 |
|
|
Sakana Fugu Ultra (≤272 тыс.) |
$5,00 |
$30,00 |
$35,00 |
|
|
Claude Opus 5.5 — быстрый режим |
$8,00 |
$40,00 |
$48,00 |
|
|
Claude Fable 5 / Claude Mythos 5 |
$10,00 |
$50,00 |
$60,00 |
|
|
Claude Fable 5.1 / Claude Mythos 5.1 |
$10,00 |
$50,00 |
$60,00 |
|
|
GPT-6 Astra — стандартный режим |
$10,00 |
$50,00 |
$60,00 |
|
|
GPT-6 Astra — быстрый режим |
$20,00 |
$100,00 |
$120,00 |
Это означает, что Anthropic не пытается выиграть этот раунд, просто предлагая самые дешевые токены. Вместо этого Sonnet 5.5 делает более широкий акцент на эффективности: модель, которая выполняет задачу за меньшее число шагов рассуждения, с меньшим расходом токенов и меньшим числом вызовов инструментов, может снизить общие эксплуатационные расходы, даже если цена за токен не меняется.
Этот подход также знаменует собой отход от первоначального запуска Sonnet 5. В июне Anthropic представила Sonnet 5 по вводной цене 2 доллара за миллион входных и 10 долларов за миллион выходных токенов, а в августе сделала эти тарифы постоянными вместо того, чтобы повышать их до запланированных ранее 3/15 долларов.
Более мощные кибервозможности сопровождаются более строгими ограничениями
Рост производительности сопровождается заметным изменением в области безопасности: Sonnet 5.5 стала первой моделью семейства Sonnet, которую Anthropic выпускает с мерами киберзащиты, разработанными по образцу тех, что используются в ее системах с самыми широкими возможностями.
По словам Anthropic, обычная разработка программного обеспечения и устранение уязвимостей по-прежнему должны работать без изменений, однако некоторые запросы по кибербезопасности с повышенным уровнем риска будут автоматически перенаправляться на Sonnet 5. Компания планирует расширить программу Cyber Verification Program, чтобы проверенные специалисты по защите могли получить доступ к более продвинутым возможностям Sonnet 5.5, Opus 5.5 и моделей Mythos.
Anthropic также вводит меры защиты от того, что компания называет «атаками с дистилляцией модели», когда злоумышленники пытаются воспроизвести возможности модели, отправляя ей запросы в промышленных масштабах. Критики отмечают, что многие современные открытые большие языковые модели обучаются на данных, сгенерированных другими моделями. При этом Anthropic, уже использовавшая огромные объемы защищенных авторским правом данных без явного согласия или выплаты вознаграждения многим авторам и правообладателям, занимает не слишком убедительную этическую или моральную позицию, утверждая, будто создание новой модели на основе ответов ее собственной модели является преступлением или чем-то предосудительным.
Sonnet 5.5 стала первой моделью семейства Sonnet, выпущенной с классификаторами, предназначенными для блокировки извлечения ее рассуждений. Anthropic также расширяет систему «сохранения мыслительного процесса», чтобы рассуждения нельзя было отделить от учетной записи, в которой они были созданы. Меры биологической безопасности остаются такими же, как у Sonnet 5.
Доступна во всех крупнейших облачных сервисах
Claude Sonnet 5.5 будет доступна через Anthropic, а также Amazon Web Services, Google Cloud и Microsoft Azure, с поддержкой нулевого хранения данных. Разработчики смогут получить к ней доступ через Claude Platform, используя идентификатор модели claude-sonnet-5-5.
По словам Anthropic, предназначенная для больших объемов задач и особенно чувствительных к затратам сценариев Claude Haiku 5.5 выйдет в ближайшие недели.
Для корпоративных разработчиков Sonnet 5.5 может оказаться самой значимой частью линейки — не потому, что Anthropic резко снизила тарифы API, а потому, что компания стремится приблизить производительность модели среднего уровня к премиальной настолько, чтобы для многих задач больше не требовалось переходить на уровень выше.



