Загадка решена: Anthropic раскрывает информацию о том, что изменения в обвязках и инструкциях Claude, вероятно, стали причиной ухудшения работы

Загадка решена: Anthropic раскрывает информацию о том, что изменения в обвязках и инструкциях Claude, вероятно, стали причиной ухудшения работы

Источник: VentureBeat · Carl Franzen

В течение нескольких недель растущий хор разработчиков и активных пользователей ИИ заявлял, что флагманские модели Anthropic теряют свои позиции. Пользователи на GitHub, X и Reddit сообщали о явлении, которое они назвали «ИИ-шринкфляцией» — воспринимаемом ухудшении, при котором Claude казался менее способным к последовательному рассуждению, более склонным к галлюцинациям и все более расточительным в отношении токенов.

Критики указывали на измеримое изменение в поведении, утверждая, что модель перешла от подхода «исследования на первом месте» к более ленивому стилю «редактирование на первом месте», которому больше нельзя доверять в сложной инженерной работе.

Хотя компания сначала отвергала заявления о «нерфе» (ухудшении) модели с целью управления спросом, нарастающие доказательства от видных пользователей и сторонних бенчмарков создали серьезный разрыв в доверии.

Сегодня Anthropic напрямую отреагировала на эти опасения, опубликовав технический отчет (пост-мортем), в котором назвала три отдельные изменения на уровне продукта, приведшие к сообщениям о проблемах с качеством.

«Мы очень серьезно относимся к сообщениям об ухудшении качества», — говорится в блоге Anthropic по этому поводу. «Мы никогда намеренно не ухудшаем наши модели и смогли сразу подтвердить, что наш API и уровень инференса не пострадали».

Anthropic заявляет, что решила проблемы, отменив изменение усилия для рассуждений и промпт многословности, а также исправив ошибку кэширования в версии v2.1.116.

Растущие доказательства деградации

Споры набрали обороты в начале апреля 2026 года, подогреваемые подробными техническими анализами от сообщества разработчиков. Стелла Лоренцо, старший директор группы ИИ в AMD, опубликовала исчерпывающий аудит 6 852 файлов сессий Claude Code и более 234 000 вызовов инструментов на GitHub, показавший падение производительности по сравнению с ее прошлым опытом использования.

Ее выводы показали, что глубина рассуждений Claude резко снизилась, что привело к циклам рассуждений и склонности выбирать «простейшее исправление» вместо правильного.

Эта анекдотическая фрустрация, по-видимому, подтверждалась сторонними бенчмарками. BridgeMind сообщила, что точность Claude Opus 4.6 упала с 83,3% до 68,3% в их тестах, в результате чего его рейтинг рухнул со 2-го на 10-е место.

Хотя некоторые исследователи утверждали, что эти конкретные сравнения в бенчмарках были несовершенными из-за несогласованных диапазонов тестирования, нарратив о том, что Claude стал «глупее», превратился в вирусную тему для обсуждения. Пользователи также сообщали, что лимиты использования исчерпываются быстрее, чем ожидалось, что привело к подозрениям, что Anthropic намеренно снижает производительность для управления растущим спросом.

Причины

В своем пост-мортем блоге Anthropic пояснила, что хотя веса базовой модели не ухудшились, три конкретных изменения в «обвязке» (harness) вокруг моделей непреднамеренно ухудшили их производительность:

  • Усилие для рассуждений по умолчанию (Default Reasoning Effort): 4 марта Anthropic изменила усилие для рассуждений по умолчанию с high на medium для Claude Code для решения проблем с задержкой интерфейса. Это изменение было призвано предотвратить «зависание» интерфейса во время размышлений модели, но привело к заметному падению интеллектуальных возможностей при выполнении сложных задач.

  • Ошибка логики кэширования: Выпущенная 26 марта оптимизация кэширования, предназначенная для удаления старых «размышлений» из простаивающих сессий, содержала критическую ошибку. Вместо того чтобы очищать историю размышлений один раз после часа бездействия, она очищала ее при каждом последующем запросе, из-за чего модель теряла «краткосрочную память» и становилась цикличной или забывчивой.

  • Лимиты многословности системного промпта: 16 апреля Anthropic добавила в системный промпт инструкции удерживать текст между вызовами инструментов в пределах 25 слов, а финальные ответы — в пределах 100 слов. Эта попытка снизить многословность в Opus 4.7 дала обратный результат, вызвав падение оценок качества кодирования на 3%.

Влияние и будущие меры предосторожности

Проблемы с качеством вышли за рамки CLI Claude Code, затронув Claude Agent SDK и Claude Cowork, хотя Claude API затронут не был.

Anthropic признала, что из-за этих изменений модель стала казаться «менее интеллектуальной», и отметила, что это не тот опыт, который пользователи вправе ожидать.

Чтобы восстановить доверие пользователей и предотвратить подобные регрессии в будущем, Anthropic внедряет ряд операционных изменений:

  • Внутренний догфудинг (Internal Dogfooding): Большей части внутренних сотрудников будет предписано использовать именно публичные сборки Claude Code, чтобы они могли оценивать продукт так же, как и обычные пользователи.

  • Расширенные наборы оценок: Теперь компания будет запускать более широкий набор оценок для каждой модели и «абляции» для каждого изменения системного промпта, чтобы изолировать влияние конкретных инструкций.

  • Более жесткий контроль: Созданы новые инструменты, облегчающие аудит изменений промптов, а изменения, специфичные для моделей, будут строго ограничиваться предназначенными для них целями.

  • Компенсация подписчикам: Чтобы компенсировать перерасход токенов и неудобства в работе, вызванные этими ошибками, Anthropic сбросила лимиты использования для всех подписчиков по состоянию на 23 апреля.

Компания намерена использовать свой новый аккаунт @ClaudeDevs в X и ветки на GitHub, чтобы более подробно объяснять причины будущих продуктовых решений и поддерживать более прозрачный диалог с сообществом разработчиков.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.