Claude Sonnet 4.6 от Anthropic снижает затраты на ИИ

Claude Sonnet 4.6 от Anthropic снижает затраты на ИИ

Anthropic во вторник выпустила Claude Sonnet 4.6 — модель, которая знаменует собой кардинальный пересмотр ценовой политики в индустрии искусственного интеллекта. Она обеспечивает уровень интеллекта, близкий к флагманскому, по цене среднего сегмента и появляется как раз в разгар беспрецедентной корпоративной гонки по внедрению ИИ-агентов и инструментов автоматизированного написания кода.

Эта модель представляет собой полноценное обновление во всех областях: программирование, использование компьютера, рассуждения в условиях длинного контекста, планирование действий агента, интеллектуальная работа и дизайн. В ней реализовано окно контекста на 1 миллион токенов (в бета-версии). Теперь это модель по умолчанию в claude.ai и Claude Cowork, а цены остаются на прежнем уровне — $3 / $15 за миллион токенов (столько же, сколько у ее предшественницы, Sonnet 4.5).

Именно эта деталь ценообразования является главной новостью. Флагманские модели Opus от Anthropic стоят $15 / $75 за миллион токенов, что в пять раз дороже Sonnet. Тем не менее, производительность, для достижения которой раньше требовалось обращаться к моделям класса Opus (включая реальные офисные задачи, имеющие высокую экономическую ценность), теперь доступна в Sonnet 4.6. Для тысяч предприятий, развертывающих сегодня ИИ-агентов, которые совершают миллионы вызовов API в день, эта математика меняет абсолютно всё.

Line graph showing Claude Sonnet OSWorld scores rising from 14.9% in Oct 2024 to 72.5% in Feb 2026.

Показатели Anthropic в области использования компьютера выросли почти в пять раз за 16 месяцев. Последняя модель компании, Sonnet 4.6, набрала 72,5% в бенчмарке OSWorld-Verified по сравнению с 14,9% на момент запуска этой возможности в октябре 2024 года. (Источник: Anthropic)

Почему стоимость масштабного запуска ИИ-агентов только что резко снизилась

Чтобы понять значимость этого релиза, необходимо учитывать контекст, в котором он появляется. Прошлый год прошел под знаком двух взаимосвязанных явлений: «вайб-кодинга» и агентного ИИ. Claude Code — терминальный инструмент для разработчиков от Anthropic — стал культурным феноменом в Кремниевой долине: инженеры создают целые приложения с помощью общения на естественном языке. The New York Times писала о его стремительном взлете в январе. Издание The Verge недавно заявило, что у Claude Code наступил настоящий «момент славы». OpenAI тем временем ведет собственное наступление с помощью десктопных приложений Codex для macOS и более быстрых чипов для инференса.

В результате в индустрии ИИ-модели больше не оцениваются изолированно. Их рассматривают как «движки» внутри автономных агентов — систем, которые работают часами, выполняют тысячи вызовов инструментов, пишут и запускают код, перемещаются по браузерам и взаимодействуют с корпоративным ПО. Каждый доллар, потраченный на миллион токенов, умножается на эти тысячи вызовов. В масштабе разница между $15 и $3 за миллион входных токенов не является незначительной. Она носит трансформационный характер.

Таблица бенчмарков, опубликованная Anthropic, рисует поразительную картину. В SWE-bench Verified, отраслевом стандарте тестирования реального программного кода, Sonnet 4.6 набрала 79,6%, практически сравнявшись с Opus 4.6 (80,8%). В задачах агентного использования компьютера (OSWorld-Verified) Sonnet 4.6 набрала 72,5%, практически сравнявшись с Opus 4.6 (72,7%). В офисных задачах (GDPval-AA Elo) Sonnet 4.6 даже превзошла Opus 4.6, набрав 1633 балла против 1606. В агентском финансовом анализе Sonnet 4.6 достигла показателя 63,3%, опередив все сравниваемые модели, включая Opus 4.6 с ее 60,1%.

Это не маргинальные различия. Во многих категориях, наиболее важных для бизнеса, Sonnet 4.6 не уступает или превосходит модели, запуск которых обходится в пять раз дороже. Предприятие, запускающее ИИ-агента, который обрабатывает 10 миллионов токенов в день, раньше было вынуждено выбирать между худшими результатами при меньших затратах и лучшими результатами при стремительно растущих расходах. Sonnet 4.6 во многом устраняет этот компромисс.

В Claude Code раннее тестирование показало, что пользователи предпочитали Sonnet 4.6 модели Sonnet 4.5 примерно в 70% случаев. Пользователи даже отдавали предпочтение Sonnet 4.6 по сравнению с Opus 4.5 (фронтирной моделью Anthropic от ноября) в 59% случаев. Они отметили, что Sonnet 4.6 значительно менее склонна к избыточному усложнению («over-engineering») и «лени», а также существенно лучше справляется с выполнением инструкций. Они сообщили о меньшем количестве ложных заявлений об успехе, меньшем числе галлюцинаций и более последовательном доведении до конца многошаговых задач.

Performance comparison table of Sonnet 4.6, Opus, Gemini 3 Pro, and GPT-5.2 across various AI tasks.

Anthropic Sonnet 4.6, модель среднего ценового сегмента, соответствует или приближается по производительности к флагманской линейке Opus компании в большинстве категорий бенчмарков и часто превосходит конкурирующие модели от Google и OpenAI. (Источник: Anthropic)

Как возможности Claude по использованию компьютера прошли путь от «экспериментальных» до почти человеческих за 16 месяцев

Одним из самых ярких сюжетов этого релиза является прогресс Anthropic в области использования компьютера — способности ИИ управлять ПК так же, как это делает человек: кликать мышкой, печатать на клавиатуре и ориентироваться в программном обеспечении, у которого нет современных API.

Когда Anthropic впервые представила эту функцию в октябре 2024 года, компания признала, что она «все еще экспериментальная — временами громоздкая и подверженная ошибкам». Цифры с тех пор рассказывают примечательную историю: в OSWorld модель Claude Sonnet 3.5 набрала 14,9% в октябре 2024 года. Sonnet 3.7 достигла 28,0% в феврале 2025 года. Sonnet 4 поднялась до 42,2% к июню. Sonnet 4.5 выросла до 61,4% в октябре. Теперь же Sonnet 4.6 достигла 72,5% — почти пятикратное улучшение за 16 месяцев.

Это имеет значение, потому что использование компьютера — это способность, открывающая самый широкий спектр корпоративных приложений для ИИ-агентов. Практически у каждой организации есть устаревшее ПО — страховые порталы, правительственные базы данных, ERP-системы, инструменты планирования в больницах, — которое было создано до появления API. Модель, способная просто смотреть на экран и взаимодействовать с ним, открывает путь к автоматизации всего этого без необходимости создания заказных коннекторов.

Джейми Кафф (Jamie Cuffe), генеральный директор Pace, сообщил, что Sonnet 4.6 набрала 94% в их сложном бенчмарке использования компьютера для страховой сферы, что является самым высоким показателем среди всех протестированных моделей Claude. «Она анализирует причины сбоев и исправляет ошибки самостоятельно так, как мы раньше не наблюдали», — отметил Кафф в заявлении, переданном VentureBeat. Уилл Харви (Will Harvey), соучредитель Convey, назвал ее «явным улучшением по сравнению со всем остальным, что мы тестировали в наших оценках».

Аспект безопасности при использовании компьютера также привлек внимание. В Anthropic отметили, что использование компьютера сопряжено с рисками инъекций промптов (когда злоумышленники прячут инструкции на веб-сайтах для перехвата управления моделью), и заявили, что их оценки показывают: Sonnet 4.6 демонстрирует значительное улучшение по сравнению с Sonnet 4.5 в противодействии таким атакам. Для компаний, развертывающих агентов, которые просматривают веб-страницы и взаимодействуют с внешними системами, такое укрепление безопасности не является опциональным.

Корпоративные клиенты говорят, что модель стирает грань между ценовыми категориями Sonnet и Opus

Реакция клиентов оказалась на редкость конкретной в отношении соотношения цены и производительности. Несколько ранних тестеров прямо заявили, что Sonnet 4.6 избавляет от необходимости переходить на более дорогую категорию Opus.

Кейтлин Колгроу (Caitlin Colgrove), технический директор Hex Technologies, рассказала, что компания переносит большую часть своего трафика на Sonnet 4.6, отметив, что при использовании адаптивного мышления и высокого уровня усилий «мы получаем производительность уровня Opus во всех задачах, кроме самых сложных аналитических, но с более эффективным и гибким профилем. При ценах Sonnet это очевидный выбор для наших рабочих нагрузок».

Бен Кус (Ben Kus), технический директор Box, сообщил, что модель превзошла Sonnet 4.5 в сложных задачах на рассуждение и ответы на вопросы (Q&A) на 15 процентных пунктов на реальных корпоративных документах. Микеле Катаста (Michele Catasta), президент Replit, назвал соотношение производительности и стоимости «необыкновенным». Райан Уиггинс (Ryan Wiggins) из Mercury выразился более прямо: «Claude Sonnet 4.6 работает быстрее, дешевле и с большей вероятностью справляется со всем с первой попытки. Такое сочетание улучшений стало неожиданным, и мы не ожидали увидеть его в этом ценовом диапазоне».

Улучшения в кодировании особенно резонируют на фоне доминирования Claude Code на рынке инструментов для разработчиков. Дэвид Локер (David Loker), вице-президент по искусственному интеллекту в CodeRabbit, заявил, что модель «намного превосходит свой вес для подавляющего большинства реальных запросов на слияние (PR)». Лео Чураков (Leo Tchourakov) из Factory AI сообщил, что команда «переводит свой трафик Sonnet на эту модель». Вице-президент GitHub по продукту Джо Биндер (Joe Binder) подтвердил, что модель «уже преуспевает в исправлении сложного кода, особенно когда необходим поиск по крупным кодовым базам».

Брендан Фолк (Brendan Falk), основатель и генеральный директор Hercules, пошел еще дальше: «Claude Sonnet 4.6 — лучшая модель из всех, что мы видели на сегодняшний день. У нее точность, следование инструкциям и работа с интерфейсом на уровне Opus 4.6, и все это при значительно более низкой стоимости».

Graph showing Sonnet 4.6's money balance rising sharply over time compared to Sonnet 4.5.

В симулированной бизнес-среде Sonnet 4.6 увеличила прибыль по сравнению с предшественницей почти в три раза за год, что говорит о значительно улучшенном принятии решений в сложных долгосрочных задачах. (Источник: Anthropic, Vending-Bench Arena)

Моделирование бизнес-соревнования показывает, как ИИ-агенты планируют на месяцы, а не минуты

Среди технических деталей скрывается способность, которая намекает на то, куда движутся автономные ИИ-агенты. Окно контекста Sonnet 4.6 на 1 миллион токенов способно вместить целые кодовые базы, длинные контракты или десятки научных работ в рамках одного запроса. В Anthropic заявляют, что модель эффективно рассуждает во всем этом контексте — утверждение, которое компания продемонстрировала с помощью необычного теста.

Тест Vending-Bench Arena проверяет, насколько хорошо модель может управлять симулированным бизнесом с течением времени, причем разные модели ИИ соревнуются друг с другом за получение наибольшей прибыли. Без подсказок со стороны человека Sonnet 4.6 разработала новую стратегию: в первые десять месяцев симуляции она активно инвестировала в мощности, тратя значительно больше конкурентов, а затем резко переключила фокус на прибыльность на финальном этапе. Модель завершила свою 365-дневную симуляцию с балансом примерно в $5 700 по сравнению с примерно $2 100 у Sonnet 4.5.

Такого рода многомесячное стратегическое планирование, выполняемое автономно, представляет собой качественно иную способность по сравнению с ответом на вопросы или генерацией фрагментов кода. Именно такой долгосрочный тип рассуждений делает ИИ-агентов пригодными для реальных бизнес-операций — и это помогает объяснить, почему Anthropic позиционирует Sonnet 4.6 не просто как обновление чат-бота, а как «движок» для нового поколения автономных систем.

Anthropic выпускает Sonnet 4.6 на фоне расширения бизнеса на рынке корпоративных решений и в сфере обороны

Этот релиз происходит не в вакууме. Anthropic находится в эпицентре самого судьбоносного периода в своей истории, и конкурентная среда накаляется на всех фронтах.

В тот же день, когда состоялся этот запуск, издание TechCrunch сообщило, что индийский ИТ-гигант Infosys объявил о партнерстве с Anthropic с целью создания корпоративных ИИ-агентов, интегрируя модели Claude в платформу Infosys Topaz AI для банковского дела, телекоммуникаций и производства. Генеральный директор Anthropic Дарио Амодей (Dario Amodei) заявил TechCrunch, что существует «большой разрыв между ИИ-моделью, которая работает в демоверсии, и той, которая работает в регулируемой отрасли», и что Infosys помогает этот разрыв преодолеть. TechCrunch также сообщил, что Anthropic открыла свой первый офис в Индии в Бангалоре, и что на Индию сейчас приходится около 6% мирового использования Claude, уступая только США. Компания, стоимость которой, по данным CNBC, оценивается в $183 миллиарда, быстрыми темпами расширяет свое присутствие в корпоративном сегменте.

Тем временем президент Anthropic Даниэла Амодей (Daniela Amodei) заявила на прошлой неделе ABC News, что ИИ сделает выпускников гуманитарных вузов «более важными, чем когда-либо», аргументируя это тем, что навыки критического мышления станут ценнее по мере того, как большие языковые модели осваивают техническую работу. Это именно то заявление, которое делает компания, когда считает, что ее технология вот-вот изменит целые категории «белых воротничков».

Конкурентная картина для Sonnet 4.6 также заслуживает внимания. Модель превосходит Gemini 3 Pro от Google и GPT-5.2 от OpenAI по нескольким бенчмаркам. GPT-5.2 отстает в задачах агентного использования компьютера (38,2% против 72,5%), агентного поиска (77,9% против 74,7% для версии Sonnet 4.6 без приставки Pro) и агентного финансового анализа (59,0% против 63,3%). Gemini 3 Pro демонстрирует конкурентоспособную производительность в визуальных рассуждениях и многоязычных бенчмарках, но отстает в агентских категориях, куда сейчас направляются основные инвестиции бизнеса.

Главный вывод, возможно, заключается вовсе не в какой-то отдельной модели. Он состоит в том, что происходит, когда интеллект уровня Opus становится доступным за несколько долларов за миллион токенов, а не за несколько десятков долларов. Компании, которые осторожно пилотировали ИИ-агентов в рамках небольших развертываний, теперь сталкиваются с принципиально иной стоимостной моделью. Агенты, запуск которых в январе обходился слишком дорого для постоянной работы, в феврале внезапно стали доступными.

Claude Sonnet 4.6 уже доступна во всех тарифных планах Claude, Claude Cowork, Claude Code, через API и на всех основных облачных платформах. Anthropic также по умолчанию обновила свой бесплатный тариф до Sonnet 4.6. Разработчики могут получить к ней доступ немедленно, используя claude-sonnet-4-6 через Claude API.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.