Sonnet 5 от Anthropic составляет конкуренцию флагманским ИИ
Источник: VentureBeat · Michael Nuñez
Anthropic сегодня выпустила Claude Sonnet 5 — новую модель искусственного интеллекта, которая, по заявлению компании, обеспечивает производительность, близкую к флагманской, по цене среднего уровня. Этот шаг призван предоставить разработчикам из корпоративного сектора, заботящимся о бюджете, доступ к мощным возможностям автономных агентов как раз в тот момент, когда базирующаяся в Сан-Франциско ИИ-лаборатория уверенно движется к первичному публичному размещению акций (IPO), которому предстоит проверить, смогут ли головокружительные оценки частного рынка в сфере ИИ выдержать публичную проверку.
Этот релиз, который Anthropic описывает как «самую агентную модель Sonnet на сегодняшний день», делает Sonnet 5 моделью по умолчанию для пользователей тарифных планов Free и Pro от Anthropic, а также делает её доступной для клиентов Max, Team и Enterprise. Вводные цены на API установлены на уровне 2 долларов за миллион входных токенов и 10 долларов за миллион выходных токенов до 31 августа, после чего они вырастут до 3 и 15 долларов соответственно — что по-прежнему значительно ниже расценок флагманской модели Anthropic Opus 4.8 (5 долларов за ввод и 25 долларов за вывод).
Стратегическая логика безошибочна: Anthropic стремится демократизировать доступ к возможностям, которые ещё совсем недавно могли предоставить только её самые дорогие модели, и одновременно сформировать ту самую широкую базу разработчиков, которая будет привлекательно смотреться в заявлении по форме S-1.
Sonnet 5 сократила разрыв с флагманской моделью Anthropic Opus по результатам пяти основных тестов и превзошла её в одном. (Источник: Anthropic)
Бенчмарки Sonnet 5 показывают, что модель среднего уровня приближается к флагману Anthropic — Opus
Sonnet 5 демонстрирует значительный прирост производительности по сравнению со своим предшественником, Sonnet 4.6, во всех тестах, о которых сообщила Anthropic. В SWE-bench Pro, бенчмарке для агентного написания кода, Sonnet 5 набирает 63,2% по сравнению с 58,1% у Sonnet 4.6 — скачок, который позволяет ей вплотную приблизиться к результату Opus 4.8 в 69,2%. В Terminal-Bench 2.1, другом тесте по программированию, разрыв сокращается ещё сильнее: 80,4% у Sonnet 5 против 67,0% у Sonnet 4.6 и 82.7% у Opus 4.8.
В междисциплинарных рассуждениях, измеряемых с помощью Humanity’s Last Exam, Sonnet 5 набирает 43,2% без инструментов и 57,4% с инструментами — последний показатель практически совпадает с 57,9% у Opus 4.8. В задачах использования компьютера, оцениваемых с помощью OSWorld-Verified, Sonnet 5 достигает 81,2% по сравнению с 78,5% ранее. А в GDPval-AA v2, бенчмарке интеллектуальной работы, модель набирает 1618 баллов, превосходя результат Opus 4.8 (1615 баллов) и значительно превосходя показатель Sonnet 4.6 (1395 баллов).
Общая картина в этих тестах говорит об одном: Sonnet 5 не просто делает небольшой шаг вперёд по сравнению с предшественницей. Она совершает рывок в категорию производительности, которая существенно пересекается с флагманской моделью Anthropic, при этом стоит примерно на 40% дешевле за токен по стандартному прайсу и на 60% дешевле в период действия вводных цен.
Корпоративные партнеры заявляют, что агентные возможности Sonnet 5 доводят до конца задачи, от которых отказывались предыдущие модели
Акцент на агентных возможностях — способности планировать, использовать такие инструменты, как браузеры и терминалы, и автономно выполнять многоэтапные рабочие процессы — отражает то, куда сместился центр тяжести индустрии ИИ в 2026 году. Предприятия больше не просто задают чат-ботам вопросы; они развертывают ИИ-системы, способные ориентироваться в сложных программных средах, выполнять многоэтапные задачи по программированию и работать с минимальным надзором человека.
Партнеры по раннему доступу описали модель, которая не просто берется за задачи, но и доводит их до конца. Суалех Асиф (Sualeh Asif), соучредитель Cursor, ИИ-редактора кода, ставшего индикатором внедрения инструментов для разработчиков, отметил, что «с Claude Sonnet 5 агенты следуют плану, соблюдают наши правила и выпускают чистые многоэтапные изменения, и всё это с высокой экономической эффективностью». Дэниел Шепард (Daniel Shepard), старший инженер в Zapier, рассказал, что поручил модели двухэтапную задачу по автоматизации — обновление статусов учетных записей в Salesforce и отправку объявления о запуске, — которая с предыдущими моделями «обычно застревала на полпути», а теперь завершается от начала и до конца.
Эти отзывы важны, поскольку они описывают именно тот разрыв в надежности, который мешал многим компаниям перевести агентный ИИ из стадии пилотных проектов в промышленную эксплуатацию. Модель, которая справляется со сложной задачей на 80%, а затем зависает, создает больше проблем, чем решает; модель же, которая надежно выполняет весь рабочий процесс целиком, меняет экономику автоматизации. Anthropic также представила кривые соотношения затрат и производительности, показывающие, что разработчики теперь могут настраивать уровни усилий для Sonnet 5 и Opus 4.8, чтобы найти оптимальный баланс стоимости и точности для своего конкретного варианта использования — уровень детализации, отражающий растущую искушенность в том, как компании потребляют ИИ-сервисы.
В задачах использования компьютера Sonnet 5 приблизилась по точности к Opus 4.8 при значительно более низкой стоимости одной задачи. (Источник: Anthropic)
Обновленный токенизатор повышает производительность Sonnet 5, но может незаметно увеличить расходы на некоторые рабочие нагрузки
Одна техническая деталь, скрытая в сносках анонса, заслуживает внимания: Sonnet 5 использует обновленный токенизатор, который меняет способ обработки текста моделью, аналогично изменениям, представленным Anthropic в Opus 4.7.
Обратной стороной является то, что один и тот же объем исходных данных может транслироваться примерно в 1,0–1,35 раза большее количество токенов в зависимости от типа контента. В Anthropic заявляют, что вводные цены откалиброваны так, чтобы сделать переход «примерно нейтральным по затратам», однако корпоративным клиентам с большими объемами рабочих нагрузок стоит тщательно протестировать свои сценарии использования, прежде чем рассчитывать на неизменность счетов.
Anthropic утверждает, что Sonnet 5 безопаснее предшественницы, но её самые способные модели по-прежнему лидируют в вопросах выравнивания
Отчеты Anthropic о безопасности демонстрируют неоднозначную картину. Компания сообщает, что Sonnet 5 демонстрирует более низкие показатели галлюцинаций и поддакивания (сикофантии) по сравнению с Sonnet 4.6, лучше справляется с отклонением вредоносных запросов и более устойчива к атакам путем внедрения промптов (prompt injection) в агентных сценариях. В ходе автоматизированного аудита поведения Anthropic — который проверяет широкий спектр несогласованных моделей поведения, включая сотрудничество со злоумышленниками и обман — Sonnet 5 в целом набрала меньше баллов (что означает большую безопасность), чем Sonnet 4.6.
Тем не менее, Sonnet 5 продемонстрировала «несколько более высокие показатели несогласованного поведения» по сравнению с более способной Opus 4.8 и Claude Mythos Preview от Anthropic — мощной, но строго ограниченной моделью компании, ориентированной на кибербезопасность. В тесте на разработку эксплойтов для Firefox 147, созданном в сотрудничестве с Mozilla, ни одна из моделей Sonnet не смогла создать рабочий эксплойт (обе набрали 0,0%), хотя Sonnet 5 показала чуть более высокий процент частичного успеха (13,2%) по сравнению с Sonnet 4.6 (8,8%). Обе модели по-прежнему сильно отстают от Opus 4.8 (68,8% работающих эксплойтов) и Mythos 5 (88,4%).
Из-за этих незначительных успехов в возможностях, связанных с кибернетической сферой, Anthropic выпустила Sonnet 5 с по умолчанию включенными средствами киберзащиты — системами реального времени, которые обнаруживают и блокируют опасное использование в целях кибербезопасности. Эти защитные механизмы аналогичны тем, что применяются в Opus 4.7 и 4.8, но менее строгие, чем те, что используются для Fable 5 — новейшей модели класса Mythos, которой, как сообщал Bloomberg 10 июня, «запрещено отвечать на запросы, связанные с кибербезопасностью и биологией». Организации, участвующие в программе киберверификации Anthropic, автоматически получают такой же доступ к Sonnet 5 без необходимости повторной подачи заявки.
Ни одна из моделей Sonnet не создала рабочий эксплойт для уязвимости в Firefox, в то время как Mythos 5 преуспевала почти в 90 процентах случаев. (Источник: Anthropic)
От 14 миллиардов до 47 миллиардов долларов выручки: Sonnet 5 появляется на фоне формирования стратегии IPO Anthropic
Запуск Sonnet 5 происходит в, пожалуй, самый судьбоносный момент в короткой истории Anthropic. В начале июня компания конфиденциально подала проспект IPO в Комиссию по ценным бумагам и биржам (SEC), подготовив почву для того, что CNBC назвала «самым тщательно проверяемым публичным размещением в истории технологий».
Финансовая траектория была extraordinaria (впечатляющей). В феврале Anthropic привлекла 30 миллиардов долларов при оценке в 380 миллиардов долларов после привлечения инвестиций, а годовая выручка компании, по данным The Guardian, «выросла более чем в десять раз за каждый из последних трех лет».
К концу мая Anthropic закрыла <раунд>раунд> раунд серии H на 65 миллиардов долларов при оценке в 965 миллиардов долларов (после привлечения средств) — при со-лидстве Altimeter Capital, Sequoia Capital и других, а темпы роста выручки превысили 47 миллиардов долларов. Харрисон Ролфес (Harrison Rolfes), аналитик PitchBook, <сообщил>сообщил> рассказал CNBC, что цифрой, которая «либо подтвердит, либо разрушит всю концепцию, заложенную частными рынками в цены за последние три года», станут не оценка или выручка, а валовая маржа — показатель, которого еще не видел ни один внешний наблюдатель.
В этом контексте Sonnet 5 выполняет двойную задачу. Для разработчиков она предлагает реальные улучшения возможностей по конкурентоспособным ценам. Для стратегии IPO Anthropic она демонстрирует, что компания способна поставлять привлекательный продукт в ценовом сегменте, способном стимулировать тот самый массовый спрос, который вознаграждает Уолл-стрит — высокообъемную, регулярную выручку от API тысяч корпоративных клиентов.
Государственные контракты и растущая конкуренция определяют рынок, на который выходит Sonnet 5
Тайминг также совпадает с активным выходом Anthropic на рынок институциональных контрактов. Буквально вчера губернатор Калифорнии Гэвин Ньюсом объявил о первом в своем роде партнерстве, предоставляющем Claude всем государственным ведомствам со скидкой 50% и бесплатным обучением сотрудников.
Кейт Дженсен (Kate Jensen), руководитель отдела Anthropic в странах Америки, назвала это стремлением «заставить Claude работать на благо людей, которые поддерживают жизнедеятельность этого штата». Эта сделка, которая распространяется на города и округи Калифорнии, представляет собой именно тот тип долгосрочного и регулярного использования, который может закрепить доходы далеко за пределами сообщества разработчиков.
Но релиз Anthropic происходит на все более перенасыщенном рынке. OpenAI, которая привлекла раунд на 122 миллиарда долларов в марте при оценке в 852 миллиарда долларов, готовит собственное IPO. Компания SpaceX Илона Маска, объединившаяся с xAI, установила цену своего IPO на уровне 135 долларов за акцию с оценкой в 1,77 триллиона долларов. Google, Meta и растущая волна хорошо финансируемых конкурентов, включая азиатские ИИ-стартапы, которые, как сообщал Wall Street Journal, разрабатывают возможности кибербезопасности уровня Mythos, борются за один и тот же корпоративный рынок.
Гил Лурия (Gil Luria), глава отдела технологических исследований в D.A. Davidson, заявил CNBC, что хотя Anthropic «похоже, сохраняет лидерство» в области передовых ИИ-моделей, «большая часть их текущего использования приходится на пробные версии и эксперименты, и это может не продолжиться».
Это наблюдение бьет в самое сердце проблемы, с которой сталкивается каждая передовая ИИ-лаборатория: превращение экспериментального использования разработчиками в устойчивую выручку промышленного уровня.
Более способные модели Anthropic показали более низкие показатели несогласованного поведения по сравнению с Sonnet 5, которая тем не менее заметно улучшилась по сравнению со своей предшественницей. (Источник: Anthropic)
Настоящая проверка для Sonnet 5 — это не бенчмарки, а то, сможет ли более дешевый ИИ поддержать историю стоимостью в триллион долларов
Позиционирование Sonnet 5 — предложение производительности, близкой к Opus, по ценам Sonnet — это прямой шаг к такой трансформации. Корпоративные клиенты, экспериментирующие с дорогими моделями класса Opus, могут обнаружить, что Sonnet 5 обеспечивает достаточное качество для рабочих нагрузок продакшна по цене, которую финансовые отделы могут одобрить в массовом порядке. Если это сработает, это может ускорить переход от экспериментов к внедрению, который необходим каждой ИИ-компании для обоснования своей оценки.
Три фактора определят, будет ли Sonnet 5 иметь значение за пределами начальных графиков бенчмарков. Первый — это надежность агентов в реальных условиях: бенчмарки измеряют возможности, но развертывание в продакшне измеряет стабильность, и истинное испытание наступит тогда, когда тысячи разработчиков запустят модель для выполнения хаотичных и непредсказуемых рабочих процессов в больших масштабах.
Второй фактор — экономика токенизатора: расширение токенов обновленным токенизатором в 1,0–1.35 раза может незаметно свести на нет ценовое преимущество для определенных рабочих нагрузок, и корпоративным клиентам следует проводить собственный анализ затрат, а не полагаться на громкие цены за токен в заголовках. Третий фактор — сама история IPO: когда S-1 Anthropic в конечном итоге станет публичным, инвесторы будут изучать, какой именно сегмент — более дешевый, но массовый Sonnet или дорогой, но высокомаржинальный Opus — генерирует основную часть выручки и, что критически важно, валовой прибыли.
Как отметил Ролфес из PitchBook в интервью CNBC, окно IPO 2026 года «либо станет самым значительным циклом IPO со времен доткомов, либо самым дорогим уроком в области соотношения концепций и фундаментальных показателей, который когда-либо преподавали публичные рынки».
Anthropic делает ставку на то, что модель, достаточно хорошая, чтобы соперничать с флагманом, и достаточно дешевая для масштабируемого запуска, — это продукт, который сократит разрыв между этими двумя исходами. Публичные рынки скоро решат, согласны ли они с этим.



