В Claude Code от Anthropic появился встроенный оценщик для выявления агентов, которые сдаются слишком рано
Агент миграции кода завершает работу, и пайплайн выглядит успешно. Но несколько частей так и не были скомпилированы — и на обнаружение этого ушло несколько дней. Это не сбой модели; это агент решил, что он закончил, хотя на самом деле это было не так.
Многие компании сейчас замечают, что конвейеры ИИ-агентов в продакшене дают сбой не из-за возможностей самих моделей, а потому что модель, стоящая за агентом, решает остановиться. Несколько методов предотвращения преждевременного завершения задач теперь доступны от LangChain, Google и OpenAI, хотя они часто полагаются на отдельные системы оценки. Новейший метод исходит от Anthropic: /goals в Claude Code, который официально разделяет выполнение задачи и ее оценку.
ИИ-агенты для написания кода работают в цикле: они читают файлы, запускают команды, редактируют код, а затем проверяют, завершена ли задача.
Claude Code /goals по сути добавляет второй уровень в этот цикл. После того как пользователь определяет цель, Claude продолжает работу шаг за шагом, но после каждого шага подключается модель-оценщик, которая проводит проверку и решает, была ли достигнута цель.
Разделение на две модели
Платформы оркестрации от всех трех вендоров выявили одно и то же узкое место. Но подход к нему у них разный. OpenAI оставляет цикл без изменений и позволяет модели самой решать, когда она закончена, но дает пользователям возможность подключать собственные оценщики. Для LangGraph и Комплекта разработки агентов (Agent Development Kit) от Google независимая оценка возможна, но требует от разработчиков определения узла критика, написания логики завершения и настройки наблюдаемости.
Claude Code /goals задает настройки независимого оценщика по умолчанию, независимо от того, хочет ли пользователь, чтобы процесс выполнялся дольше или короче. По сути, разработчик задает условие выполнения цели с помощью промпта. Например, /goal все тесты в test/auth проходят, и этап линтинга чист. Затем Claude Code запускается, и каждый раз, когда агент пытается завершить работу, модель оценки (по умолчанию это Haiku) сверяет результат с циклом условий. Если условие не выполнено, агент продолжает работу. Если условие выполнено, он записывает достигнутое условие в стенограмму разговора с агентом и очищает цель. Оценщик принимает только два решения — закончена работа или нет, — именно поэтому модель меньшего размера Haiku работает здесь отлично.
Claude Code делает это возможным, отделяя модель, которая пытается выполнить задачу, от модели-оценщика, которая гарантирует, что задача действительно выполнена. Это мешает агенту путать то, что он уже сделал, с тем, что еще предстоит сделать. Используя этот метод, как отмечает Anthropic, отпадает необходимость в сторонней платформе наблюдаемости (хотя компании могут свободно продолжать использовать ее параллельно с Claude Code), нет нужды в кастомных журналах логов, а также снижается зависимость от последующего разбора полетов (post-mortem).
Конкуренты вроде Google ADK поддерживают аналогичные паттерны оценки. Google ADK развертывает LoopAgent, но разработчикам приходится самим проектировать эту логику.
В своей документации Anthropic указала, что наиболее успешные условия обычно содержат:
-
Одно измеримое конечное состояние: результат теста, код завершения сборки, количество файлов, пустая очередь
-
Заявленная проверка: как Claude должен это доказать, например «npm test возвращает 0» или «git status чист».
-
Важные ограничения: всё, что не должно изменяться на пути к цели, например «никакие другие файлы тестов не изменены»
Надежность в цикле
Для компаний, которые уже управляют разросшимися стеками инструментов, привлекательность заключается в наличии встроенного оценщика, который не добавляет еще одну систему для обслуживания.
Это часть более широкого тренда в сфере агентов, особенно по мере того, как перспектива создания сберегающих состояние, долго работающих и самообучающихся агентов становится всё более реальной. Модели-оценщики, системы верификации и другие независимые арбитражные системы начинают появляться в рассуждающих системах, а в некоторых случаях — и в кодинг-агентах, таких как Devin или SWE-agent.
Шон Браунелл (Sean Brownell), директор по решениям в Sprinklr, рассказал VentureBeat в электронном письме, что существует интерес к подобному циклу, где задача и судья разделены, однако, по его мнению, в подходе Anthropic нет ничего уникального.
«Да, цикл работает. Отделение создателя от судьи — это грамотный подход к проектированию, потому что в корне нельзя доверять модели оценивать собственную домашнюю работу. Модель, выполняющая работу, — худший судья в вопросе того, закончена ли она», — отметил Браунелл. «Тем не менее, Anthropic не первая на рынке. Самая интересная история здесь заключается в том, что две крупнейшие мировые ИИ-лаборатории выпустили одну и ту же команду с разницей всего в несколько дней, но каждая из них пришла к совершенно разным выводам о том, кто именно должен заявлять о готовности („готово“».
Браунелл добавил, что цикл лучше всего работает «для детерминированной работы с проверяемым конечным состоянием, такой как миграции, исправление сломанных наборов тестов, очистка бэклога», но для более тонких задач или задач, требующих дизайнерского суждения, принятие решений человеком остается гораздо более важным.
Внедрение такого разделения оценщика и задачи на уровень агентского цикла показывает, что такие компании, как Anthropic, продвигают агентов и оркестрацию в сторону более аудируемых и наблюдаемых систем.



