Claude Sonnet 4.5 от Anthropic бросает вызов GPT-5

Claude Sonnet 4.5 от Anthropic бросает вызов GPT-5

Компания Anthropic в понедельник представила модель Claude Sonnet 4.5, позиционируя ее как «лучшую модель для программирования в мире». Это прямой вызов недавно выпущенной модели GPT-5 от OpenAI, поскольку два гиганта искусственного интеллекта ведут борьбу за доминирование на прибыльном рынке корпоративной разработки программного обеспечения.

Базирующийся в Сан-Франциско стартап заявляет, что его новейшая модель демонстрирует передовую производительность на ключевых бенчмарках по программированию, набрав 77,2% на SWE-bench Verified — строгом тесте по оценке возможностей программной инженерии — по сравнению с результатами GPT-5. Еще более примечательно, что, по словам Anthropic, Claude Sonnet 4.5 способна удерживать фокус на сложных многоэтапных задачах более 30 часов, что является драматическим скачком в способности ИИ выполнять продолжительную работу.

«Sonnet 4.5 набирает 77,2% на SWE-bench Verified (82% при использовании параллельных вычислений во время тестов). Это передовой уровень», — заявил представитель Anthropic изданию VentureBeat, используя отраслевой термин state of the art. Компания также подчеркнула 50-процентный результат модели на Terminal-bench — еще одном бенчмарке для программирования, в котором она заявляет о своем лидерстве.

Анонс последовал на фоне растущего давления из-за недавних достижений OpenAI и резкой критики со стороны таких известных фигур, как Илон Маск, который недавно написал на X.com, что «победа никогда не была в числе возможных исходов для Anthropic». На просьбу прокомментировать заявление Маска в Anthropic ответили отказом.

Релиз состоялся всего через семь недель после <выпуска GPT-5 от OpenAI в августе, что подчеркивает бешеный темп конкуренции в сфере искусственного интеллекта, поскольку компании борются за привлечение корпоративных клиентов, все больше полагающихся на ИИ при разработке ПО. Выбор времени особенно примечателен на фоне того, как Anthropic сталкивается с вопросами о своей сильной зависимости всего от двух крупных клиентов.

Anthropic доминирует на рынке программирования вопреки рискам концентрации клиентов

Соперничество разворачивается на рынке, который стал первым крупным прибыльным вариантом использования ИИ за пределами чат-ботов. Согласно опросу 150 корпоративных технических руководителей, проведенному Menlo Ventures, Anthropic контролирует 42% рынка генерации кода — более чем в два раза больше доли OpenAI, составляющей 21%. Такое доминирование вылилось в впечатляющие финансовые результаты: ранее в этом году компания вышла на уровень годовой выручки в 5 миллиардов долларов.

Тем не менее, анализ индустрии показывает, что приложения для программирования Cursor и GitHub Copilot обеспечивают примерно 1,4 миллиарда долларов выручки Anthropic, создавая потенциально опасную концентрацию клиентов, из-за которой компания может оказаться уязвимой в случае ухудшения отношений с любым из них.

«Наша годовая выручка значительно выросла, даже если исключить этих двух клиентов», — заявил представитель Anthropic, опровергая опасения по поводу концентрации клиентов. Компания предоставила положительные цитаты от генерального директора Cursor Майкла Труэлла и директора по продуктам GitHub Марио Родригеса, которые высоко оценили производительность Claude Sonnet 4.5.

Новая модель демонстрирует значительные успехи в возможностях использования компьютера, набрав 61,4% на OSWorld — бенчмарке, который тестирует ИИ-модели на реальных компьютерных задачах. Всего четыре месяца назад лидировала Claude Sonnet 4 с показателем 42,2%, что демонстрирует быстрый прогресс ИИ в умении взаимодействовать с интерфейсами программ.

Агрессивная ценовая стратегия OpenAI угрожает премиальному позиционированию Anthropic

Анонс Anthropic прозвучал на фоне того, как компания сталкивается с конкурентным давлением из-за агрессивной ценовой стратегии GPT-5. Первоначальный анализ показывает, что Claude Opus 4 стоит примерно в семь раз дороже за миллион токенов, чем GPT-5, для определенных задач, что оказывает непосредственное давление на премиальное позиционирование Anthropic.

Ценовая диспропорция сигнализирует о кардинальном изменении динамики конкуренции, которое может заставить отделы корпоративных закупок пересмотреть отношения с поставщиками, ранее строившиеся на производительности, а не на цене. Компании, управляющие экспоненциально растущими бюджетами на ИИ, теперь сталкиваются с сопоставимой функциональностью за малую долю затрат.

Тем не менее, Anthropic сохраняет свою ценовую стратегию в отношении Claude Sonnet 4.5. «Стоимость Sonnet 4.5 остается такой же, как у Sonnet 4», — подтвердил представитель компании, сохранив цены на уровне 3 долларов за миллион входных токенов и 15 долларов за миллион выходных токенов.

Claude Sonnet 4.5 предлагает 30-часовые автономные рабочие сессии и повышенную безопасность

Помимо повышения производительности, Anthropic позиционирует Claude Sonnet 4.5 как свою «наиболее выровненную фронтирную модель на сегодняшний день», демонстрирующую значительное снижение таких тревожных проявлений, как угодничество, склонность к обману и стремление к власти. Компания добилась «значительного прогресса в защите от атак с внедрением промптов (prompt injection)» — критической проблемы безопасности при корпоративных развертываниях.

Модель выпускается в рамках средств защиты Anthropic третьего уровня безопасности ИИ (ASL-3), которые включают классификаторы, предназначенные для обнаружения потенциально опасных входящих и исходящих данных, связанных с химическим, биологическим, радиологическим и ядерным оружием. Хотя эти механизмы защиты иногда срабатывают на обычный контент, в Anthropic заявляют, что сократили количество ложных срабатываний в десять раз по сравнению с их первоначальным описанием.

Возможно, наиболее важным для разработчиков является то, что Anthropic выпускает Claude Agent SDK — ту же инфраструктуру, на которой работает ее продукт Claude Code. «Мы создали Claude Code, потому что нужного нам инструмента еще не существовало, — заявила компания в своем анонсе. — Agent SDK дает вам такую же основу для создания столь же функционального решения для любой проблемы, которую вы решаете».

Международная экспансия ускоряется на фоне завершения судебного урегулирования спора об авторских правах на сумму 1,5 млрд долларов

Запуск модели совпал с активной международной экспансией Anthropic: компания стремится диверсифицировать свою клиентскую базу, чрезмерно сосредоточенную в США. Недавно стартап объявил о планах утроить свой международный штат и увеличить команду прикладного ИИ в пять раз в 2025 году, чему способствуют данные о том, что почти 80% использования Claude теперь приходится на регионы за пределами Соединенных Штатов.

Тем не менее, экспансия происходит на фоне значительных судебных издержек. Недавно Anthropic согласилась выплатить 1,5 миллиарда долларов в рамках мирового соглашения по авторским правам с авторами и издателями в связи с обвинениями в том, что компания нелегально использовала их книги для обучения моделей ИИ без разрешения. Соглашение, утвержденное федеральным судьей на прошлой неделе, требует выплаты по 3000 долларов за каждое издание, фигурирующее в деле.

Корпоративные расходы на ИИ удвоились, поскольку компании ставят производительность выше стоимости

Стремительный выпуск новых моделей обеими компаниями отражает высокие ставки в деле внедрения корпоративного ИИ. Согласно данным Menlo Ventures, расходы на API моделей более чем удвоились и достигли 8,4 млрд долларов всего за шесть месяцев, по мере того как предприятия переходят от экспериментальных проектов к промышленному развертыванию.

Модели поведения клиентов показывают, что предприятия неизменно ставят производительность выше цены, обновляя ПО до новейших моделей в течение нескольких недель после релиза независимо от стоимости. Это поведение может сыграть на руку Anthropic, если преимущества производительности Claude Sonnet 4.5 окажутся достаточно убедительными, чтобы перевесить ценовое преимущество GPT-5.

Тем не менее, драматическая разница в ценах, предложенная GPT-5, способна преодолеть типичную инерцию смены поставщиков, особенно для экономных предприятий, столкнувшихся с бюджетным давлением. Наблюдатели отмечают, что издержки переключения между моделями остаются относительно низкими: 66% предприятий обновляются в рамках существующих провайдеров, а не меняют поставщиков.

Для бизнеса растущая конкуренция обеспечивает лучшую производительность и более низкие затраты за счет постоянно совершенствующихся возможностей. Быстрый темп улучшений моделей — когда новые версии выпускаются ежегодно, а ежемесячно — предоставляет организациям расширяющиеся возможности ИИ, пока поставщики ведут жесткую борьбу за их клиентов.

Хотя корпоративное соперничество между Anthropic и OpenAI доминирует в заголовках новостей индустрии, реальное экономическое влияние простирается далеко за пределы залов заседаний Кремниевой долины. Создание систем ИИ, способных выполнять продолжительную работу по программированию в течение 30 часов, представляет собой фундаментальный сдвиг в том, как создается программное обеспечение, с последствиями, которые затрагивают каждую отрасль, полагающуюся на технологическую инфраструктуру.

Эти развивающиеся возможности сигнализируют о грядущей масштабной трансформации рабочих мест. Поскольку системы ИИ демонстрируют все большую квалификацию в сложной, продолжительной интеллектуальной работе, борьба технологической индустрии за первенство в программировании предвещает аналогичные потрясения во всех областях, требующих аналитического мышления, решения проблем и технической экспертизы.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.