Ухудшает ли Anthropic работу Claude? Пользователи всё чаще сообщают о снижении производительности на фоне критики со стороны руководства

Ухудшает ли Anthropic работу Claude? Пользователи всё чаще сообщают о снижении производительности на фоне критики со стороны руководства

Всё большее число разработчиков и продвинутых пользователей ИИ обращаются к социальным сетям, чтобы обвинить компанию Anthropic в ухудшении производительности Claude Opus 4.6 и Claude Code — намеренно или в результате лимитов на вычислительные мощности. Они утверждают, что флагманская модель компании для написания кода стала менее функциональной, менее надежной и более расточительной в плане токенов, чем была всего несколько недель назад.

Жалобы быстро распространились на GitHub, в сети X и на Reddit за последние несколько недель. В нескольких заметных постах утверждается, что Claude стал хуже справляться с последовательным логическим выводом, с большей вероятностью бросает задачи на середине и более предрасположен к галлюцинациям или противоречиям.

Некоторые пользователи охарактеризовали эту проблему как «шринкфляцию ИИ» — идею о том, что клиенты платят ту же цену за более слабый продукт.

Другие пошли еще дальше, предположив, что Anthropic может намеренно снижать производительность Claude или как-то иначе ухудшать его работу в периоды пиковых нагрузок.

Эти утверждения остаются недоказанными, а сотрудники Anthropic публично опровергли слухи о том, что компания ухудшает качество моделей ради управления нагрузкой. В то же время Anthropic признала реальные изменения лимитов использования и параметров рассуждений по умолчанию в последние недели, что сделало более широкую дискуссию еще более острой.

Издание VentureBeat обратилось в Anthropic за дополнительными разъяснениями по поводу недавних обвинений, в том числе о том, могут ли какие-либо недавние изменения настроек логического вывода, обработки контекста, троттлинга, параметров генерации или методологии бенчмарков объяснить всплеск жалоб.

Мы также поинтересовались, как в Anthropic комментируют недавние заявления, связанные с бенчмарками, и планирует ли компания опубликовать дополнительные данные, которые могли бы успокоить клиентов. Представитель Anthropic не стал отвечать на вопросы по отдельности, перенаправив нас на посты в X создателя Claude Code Бориса Черного и сотрудника команды Claude Code Тарика Шихипара, посвященные производительности Opus 4.6 и лимитам использования соответственно. Оба поста в X также упоминаются и связаны ссылками ниже.

Вирусные жалобы пользователей, в том числе от старшего директора AMD, утверждают, что Claude стал менее способным

Одна из самых детальных публичных жалоб появилась в виде тикета на GitHub, оформленного Стеллой Лоренцо 2 апреля 2026 года, чей профиль в LinkedIn указывает на ее должность старшего директора в группе искусственного интеллекта компании AMD.

В этом посте Лоренцо написала, что Claude Code деградировал до такой степени, что ему нельзя доверять сложную инженерную работу, и подкрепила это утверждение масштабным анализом 6852 файлов сессий Claude Code, 17 871 блока размышлений и 234 760 вызовов инструментов.

В жалобе утверждалось, что начиная с февраля расчетная глубина рассуждений Claude резко упала, в то время как признаки ухудшения производительности возросли, включая более преждевременную остановку работы, склонность к «простейшим исправлениям», увеличение циклов размышлений и измеримый сдвиг от приоритета исследований к приоритету редактирования кода.

Основная мысль поста заключалась в том, что для продвинутых инженерных рабочих процессов глубокие рассуждения — это не роскошь, а то, что делает модель пригодной для использования в принципе.

Затем эта ветка на GitHub вышла за рамки узкого обсуждения в соцсетях: пользователи X, включая @Hesamation, 11 апреля опубликовали в X скриншоты поста Лоренцо, превратив его в еще более вирусную тему для разговоров.

Это усиление имело решающее значение, поскольку придало широкому нарративу «Claude портится» нечто более весомое, чем просто эмоциональное недовольство: длинный пост с обилием данных от ведущего специалиста по ИИ крупной полупроводниковой компании, доказывающий, что регресс виден в логах, паттернах использования инструментов и пользовательских правках, а не только на уровне ощущений.

Публичный ответ Anthropic был сосредоточен на разграничении мнимых изменений и реальной деградации модели. В закрепленном сообщении в той же ветке GitHub, опубликованном неделю назад, руководитель разработки Claude Code Борис Черный поблагодарил Лоренцо за тщательность и глубину проведенного анализа, но оспорил его главный вывод.

Черный заявил, что заголовок «redact-thinking-2026-02-12», упоминаемый в жалобе, является изменением исключительно пользовательского интерфейса, которое скрывает процесс мышления от интерфейса и снижает задержку, но «не влияет на само мышление», «бюджеты мышления» или на то, как расширенные рассуждения работают под капотом.

Он также отметил, что на восприятие пользователей могли повлиять еще два изменения продукта: переход Opus 4.6 на адаптивное мышление по умолчанию 9 февраля и установленный 3 марта средний уровень усилий (уровень усилий 85) в качестве значения по умолчанию для Opus 4.6. По его словам, в Anthropic это посчитали наилучшим балансом между интеллектуальными возможностями, задержкой и стоимостью для большинства пользователей.

Черный добавил, что пользователи, которым нужны более глубокие рассуждения, могут вручную увеличить уровень усилий, введя /effort high в терминальных сессиях Claude Code.

Этот диалог затрагивает самую суть спора. Критики, такие как Лоренцо, утверждают, что поведение Claude в сложных рабочих процессах программирования явно ухудшилось, и ссылаются на логи и паттерны использования в качестве доказательств.

Anthropic, напротив, не говорит, что ничего не изменилось. Компания заявляет, что самые крупные недавние изменения касались продукта и интерфейса и повлияли лишь на то, что видят пользователи и сколько усилий система тратит по умолчанию, а вовсе не на тайное ухудшение базовой модели. Это различие может быть важным с технической точки зрения, но для продвинутых пользователей, которые чувствуют, что продукт дает худшие результаты, оно не обязательно является утешительным.

Внешние публикации от TechRadar и PC Gamer еще больше усилили резонанс поста Лоренцо и поддержали общую волну недовольства со стороны некоторых продвинутых пользователей.

Другой вирусный пост в X от разработчика Ома Патела от 7 апреля изложил ту же мысль в еще более прямых выражениях: он утверждал, что кто-то «реально измерил», насколько «глупее» стал Claude, и охарактеризовал результат как падение на 67%.

Этот пост помог популяризировать термин «шринкфляция ИИ» и вывел скандал за пределы хардкорных пользователей Claude Code в более широкий дискурс об искусственном интеллекте в X.

Эти заявления получили такой отклик, потому что они тесно переплетаются с тем, что, по словам многих разочарованных пользователей, они наблюдают на практике: больше незавершенных задач, больше возвратов к предыдущим шагам, больший расход токенов и более сильное ощущение, что Claude стал менее склонен к глубокому анализу сложных задач по программированию, чем в начале этого года.

Посты с результатами бенчмарков превратили бытовое недовольство в публичный скандал

Самое громкое заявление на основе бенчмарков поступило от BridgeMind, которая управляет бенчмарком галлюцинаций BridgeBench. 12 апреля аккаунт опубликовал сообщение о том, что точность Claude Opus 4.6 упала с 83,3% (2-е место в предыдущем тесте) до 68,3% (10-е место) в ходе нового перетестирования, назвав это доказательством того, что «Claude Opus 4.6 был урезан».

Этот пост широко разошелся и стал одной из главных опор для более широкой общественной позиции о том, что Anthropic ухудшила модель.

Другие пользователи также распространяли посты с результатами тестов и бенчмарков, намекающие на то, что Opus 4.6 уступает Opus 4.5 в практических задачах по программированию.

Некоторые публикации ссылались на результаты TerminalBench как на предполагаемое свидетельство того, что поведение модели изменилось в определенных тестовых средах или продуктовых контекстах.

Эффект носил кумулятивный характер: скриншоты бенчмарков, сравнительные тесты и личное разочарование начали подкреплять друг друга в публичном поле.

Это важно, поскольку заявления о результатах бенчмарков имеют свойство распространяться дальше, чем более субъективные жалобы. Одно дело, когда разработчик говорит, что модель «ощущается хуже». Совсем другое — скриншот, показывающий падение в рейтинге со 2-го места на 10-е или резкое изменение точности в процентах, что создает видимость неопровержимого доказательства, даже если само сравнение может быть более сложным.

Критики бенчмарков заявляют, что доказательства слабее, чем кажутся

Самое серьезное опровержение утверждений BridgeBench исходило не от Anthropic. Его опубликовал Пол Калкрафт, независимый исследователь программного обеспечения и ИИ в X, который утверждал, что вирусное сравнение было вводящим в заблуждение, поскольку более ранний результат Opus 4.6 основывался всего на шести задачах, в то время как более поздний — на 30.

По его словам, это был «СОВСЕМ ДРУГОЙ БЕНЧМАРК». Он также отметил, что по шести общим для обоих тестов задачам оценка Claude изменилась незначительно: с 87,6% ранее до 85,4% в последующем запуске, причем больший перепад, судя по всему, был связан с единичным случаем галлюцинации без повторных запусков. Он охарактеризовал это как нечто, что легко укладывается в рамки обычной статистической погрешности.

Это стороннее опровержение имеет значение, поскольку оно подрывает одно из самых убедительных и вирусных утверждений. Оно не доказывает, что пользователи неправы, считая, что что-то изменилось. Но оно предполагает, что по крайней мере часть данных бенчмарков, на которых строится эта история, может быть преувеличена, плохо нормализована или некорректна для прямого сравнения.

Даже сам пост BridgeBench привлек к себе внимание сообщества с аналогичной пометкой (Community Notes). В примечании говорилось, что два запуска бенчмарка охватывали разные объемы — шесть задач в одном случае и 30 в другом — и что подмножество общих задач показало лишь незначительные изменения. Это не делает более поздний результат бессмысленным, но ослабляет самый сильный аргумент в пользу того, что «BridgeBench это доказал».

Теперь это ключевая особенность скандала: не все утверждения одинаково весомы. Некоторые основаны на личном опыте пользователей. Другие указывают на реальные изменения продукта. Третьи опираются на сравнения бенчмарков, которые могут быть некорректными. А четвертые зависят от предположений о скрытом поведении системы, которое пользователи за пределами Anthropic не могут напрямую проверить.

Прошлые лимиты использования дали пользователям повод подозревать скрытые изменения

Нынешняя негативная реакция также разворачивается на фоне реального, подтвержденного изменения политики Anthropic, произошедшего в конце марта. 26 марта технический сотрудник Anthropic Тарик Шихипар написал, что «для управления растущим спросом на Claude» компания корректирует работу 5-часовых лимитов сессий для подписчиков Free, Pro и Max в часы пик, оставляя при этом недельные лимиты без изменений.

Он добавил, что по будням с 5:00 до 11:00 по тихоокеанскому времени пользователи будут исчерпывать свои 5-часовые лимиты сессий быстрее, чем раньше. В последующих постах он сообщил, что Anthropic добилась повышения эффективности, чтобы нивелировать часть этого эффекта, однако примерно 7% пользователей будут достигать лимитов сессий раньше, чем раньше, особенно на тарифах Pro.

В электронном письме от 27 марта 2026 года компания Anthropic сообщила VentureBeat, что изменения не затронули корпоративных клиентов (Team и Enterprise), а сам сдвиг не оптимизировался динамически для каждого отдельного пользователя, а применялся к окну часов пик, которое компания публично описала. Anthropic также заявила, что продолжает инвестировать в масштабирование мощностей.

Эти комментарии касались лимитов сессий, а не ухудшения моделей. Но они служат важным контекстом, поскольку устанавливают две вещи, которые пользователи теперь связывают в публичном поле: во-первых, Anthropic столкнулась с резким ростом спроса; во-вторых, компания уже изменила подход к нормированию использования в периоды пиковых нагрузок. Это не доказывает, что Anthropic снизила качество моделей. Но это помогает объяснить, почему так много пользователей заранее склонны верить, что могло измениться что-то еще.

Кэширование промптов и время жизни (TTL)

Отдельный, более свежий тикет на GitHub расширяет рамки спора, перенося его из плоскости качества моделей в область ценообразования и квот. В тикете #46829 пользователь seanGSISG утверждал, что время жизни кэша промптов (TTL) в Claude Code, судя по всему, изменилось с одного часа обратно на пять минут в начале марта (на основе анализа почти 120 000 вызовов API из логов сессий Claude Code на двух машинах).

В жалобе утверждается, что это изменение привело к значительному росту затрат на создание кэша и исчерпанию квот, особенно в длительных сессиях программирования, где кэшированный контекст быстро истекает и требует пересоздания. Автор утверждает, что это помогает объяснить, почему некоторые подписчики стали сталкиваться с лимитами использования, с которыми раньше не встречались.

Примечательно в этом вопросе то, что Anthropic прямо не отрицала изменения. В ответном комментарии в ветке Джаред Самнер (Jarred Sumner) заявил, что мартовское изменение было реальным и умышленным, но отверг мнение о том, что это было регрессом. По его словам, Claude Code использует разную длительность кэширования для разных типов запросов, причем одночасовой кэш не всегда дешевле, так как запись на один час стоит дороже изначально и окупается только тогда, когда тот же кэшированный контекст переиспользуется достаточное количество раз.

По его словам, это изменение было частью непрерывной работы по оптимизации кэша, а не скрытым ухудшением, а поведение системы до 6 марта, описанное в тикете, «не было задуманным стабильным состоянием».

Позже в ветке появился более подробный ответ от сотрудника Anthropic Черного, который охарактеризовал часовое кэширование как «нюансированное» и заявил, что компания тестирует эвристику для улучшения коэффициента попадания в кэш, использования токенов и задержки для подписчиков. Черный отметил, что Anthropic сохраняет пятиминутное кэширование для многих запросов, включая субагенты, которые редко возобновляются, и добавил, что отключение телеметрии также отключает экспериментальные флаги, что в некоторых случаях может приводить к возврату Claude Code к пятиминутному значению по умолчанию.

Он добавил, что Anthropic планирует внедрить переменные окружения, позволяющие пользователям напрямую принудительно задавать часовое или пятиминутное поведение кэша. В совокупности эти ответы не подтверждают утверждение автора тикета о том, что Anthropic тихо сделала Claude Code в целом дороже, но они подтверждают, что Anthropic активно экспериментировала с поведением кэша за кулисами в тот же период, когда пользователи начали громче жаловаться на сжигание квот и изменение поведения продукта.

Anthropic заявляет, что причиной бурной реакции стали видимые изменения продукта, а не тайная деградация

Аффилированные с Anthropic сотрудники публично выступили против наиболее масштабных обвинений. В одном из широко распространенных ответов в X Черный прокомментировал утверждения о том, что Anthropic тайком урезала Claude Code, написав: «Это ложь».

Он заявил, что для Claude Code был установлен средний уровень усилий по умолчанию в ответ на отзывы пользователей о том, что Claude потребляет слишком много токенов, и что это изменение было задокументировано как в журнале изменений (changelog), так и в диалоговом окне, которое видят пользователи при запуске Claude Code.

Этот ответ примечателен тем, что он признает значительное изменение продукта, отвергая при этом конспирологическую трактовку. Anthropic не говорит, что ничего не изменилось. Она говорит, что то, что изменилось, было открыто обнародовано и было направлено на балансировку использования токенов, а не на скрытое снижение качества модели.

Публичная документация также подтверждает тот факт, что настройки усилий по умолчанию менялись. Журнал изменений Claude Code гласит, что 7 апреля Anthropic изменила уровень усилий по умолчанию со среднего на высокий как для пользователей с API-ключами, так и для пользователей Bedrock, Vertex, Foundry, Team и Enterprise.

Это говорит о том, что Anthropic активно настраивала эти параметры для разных сегментов аудитории, что вполне могло повлиять на восприятие пользователей, даже если веса базовой модели остались неизменными.

Шихипар также напрямую опроверг обвинения в управлении спросом. В ответе в X, опубликованном 11 апреля, он заявил, что Anthropic не «ухудшает» свои модели для лучшего обслуживания спроса. Он также отметил, что изменения в резюме размышлений повлияли на то, как некоторые пользователи измеряли «мышление» Claude, и что компания не нашла доказательств, подтверждающих самые сильные качественные претензии, распространяющиеся в сети.

Настоящей проблемой может быть доверие, а не качество модели

Очевидно одно: между Anthropic и ее самыми требовательными пользователями возникла трещина в доверии.

Для разработчиков, которые пользуются Claude Code целыми днями, тонкие изменения в отображении процесса мышления, настройках усилий по умолчанию, расходе токенов, задержках или лимитах использования могут быть неотличимы от ухудшения модели.

И это верно независимо от того, чем вызвана проблема: настройками продукта, изменениями интерфейса, корректировкой политик генерации, нагрузкой на мощности или реальным регрессом качества.

Это также означает, что обе стороны конфликта могут говорить о разном. Пользователи описывают то, что они испытывают на практике: больше трений, больше сбоев и меньше уверенности. Anthropic отвечает языком характеристик продукта: уровни усилий по умолчанию, скрытые сводки мышления, публикации в журнале изменений и опровержения того, что давление спроса ведет к тайной деградации модели.

Эти описания не обязательно исключают друг друга. Модель может казаться пользователям хуже, даже если компания считает, что она не «урезала» базовую модель так, как утверждают критикующие. Однако это происходит в момент, когда главный конкурент Anthropic — компания OpenAI — недавно сменила курс и направила больше ресурсов на создание конкурирующего продукта Codex, ориентированного на корпоративный сектор и вайб-кодинг (даже предложив новую подписку ChatGPT среднего уровня в попытке стимулировать использование инструмента). Подобный фон определенно не пойдет на пользу ни Anthropic, ни ее показателям удержания клиентов.

В то же время имеющиеся в публичном доступе данные остаются противоречивыми. Некоторые из самых вирусных заявлений исходят от разработчиков с подробными логами и категоричными мнениями, основанными на постоянном использовании. Часть аргументов о бенчмарках была оспорена сторонними наблюдателями по методологическим соображениям. А недавние изменения лимитов и настроек от самой Anthropic гарантируют, что эта дискуссия разворачивается на фоне реальных корректировок, а не пустых слухов.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.