LangSmith Engine автоматически замыкает цикл отладки агентов, но мультимодельным предприятиям по-прежнему необходим нейтральный уровень

LangSmith Engine автоматически замыкает цикл отладки агентов, но мультимодельным предприятиям по-прежнему необходим нейтральный уровень

У компаний, создающих и развертывающих агентов, есть проблема: их инженерам требуется слишком много времени, чтобы узнать о допущенной агентом ошибке, и этот цикл повторяется снова и снова, особенно без участия человека на каждом этапе. 

LangSmith, платформа мониторинга и оценки от LangChain, запустила новую функцию в режиме публичного бета-тестирования, которая может сделать эту проблему более управляемой. LangSmith Engine автоматизирует всю цепочку: обнаруживает сбои в продакшене, диагностирует их первопричины в актуальной кодовой базе, составляет проект исправления и предотвращает регрессию. Все это происходит за один автоматический проход. 

LangSmith Engine предоставляет инженерам по ИИ более быстрый путь к триажу, однако платформа выходит на перенасыщенный рынок: Anthropic, OpenAI и Google — все они интегрируют средства наблюдаемости (observability) и оценки в собственные платформы.

LangSmith Engine анализирует сбои

В своем блоге LangChain сообщила, что типичный цикл разработки агента начинается с трассировки его работы для понимания происходящих процессов, за которой следует выявление пробелов, внесение изменений в промпты и инструменты, а также создание эталонных (ground-truth) наборов данных. Затем разработчики проводят эксперименты и проверяют систему на регрессии перед выпуском агента. 

Проблема заключается в том, что клиенты часто сталкиваются с трудностями, когда анализ трассировки не выявляет ошибочные паттерны, повторение ошибок становится сложно отследить, а специализированный оценщик отсутствует, из-за чего та же проблема повторяется в продакшене.

Согласно публикации в блоге, LangSmith Engine работает путем мониторинга трассировок в продакшене на предмет различных типов сигналов: «явных ошибок, сбоев онлайн-оценщика, аномалий в трассировках, негативных отзывов пользователей и необычного поведения, такого как вопросы пользователей, на которые агент не был запрограммирован отвечать».

Затем Engine считывает актуальную кодовую базу, находит виновника и создает черновик пулл-реквеста (pull request), после чего предлагает пользовательский оценщик для данного конкретного паттерна сбоя. Человек подключается на этапе утверждения. 

Инструмент создан на базе существующей инфраструктуры трассировки и оценки LangSmith, а также работает с результатами оценки со стороны предприятия. 

В отличие от таких инструментов наблюдаемости, как Weights & Biases, Arize Phoenix и Honeyhive, LangSmith Engine автоматически выполняет всю цепочку — обнаруживает сбой, диагностирует первопричину, составляет проект исправления — и привлекает человека только на этапе согласования.

Поставщики моделей внедряют оценщики в свои платформы

Хотя LangSmith определила этот цикл оценки как насущную потребность многих предприятий, Engine появляется в тот момент, когда крупные провайдеры начинают предлагать инструменты наблюдаемости прямо внутри своих платформ. Это означает, что компании могут предпочесть комплексные платформы (end-to-end), а не добавлять LangSmith Engine в свои существующие рабочие процессы. 

Anthropic Claude Managed Agents объединяет агентское развертывание, оценку и оркестрацию в единый пакет. OpenAI Frontier предлагает аналогичную комплексную платформу для создания, управления и оценки корпоративных агентов, хотя обе они столкнулись с вопросами со стороны компаний, опасающихся привязки к одному поставщику.

Тем не менее, практики отмечают, что далеко не все хотят переносить оценку и наблюдаемость полностью на одну платформу.

Ли Кони (Leigh Coney), основатель и главный консультант Workwise Solutions, рассказал VentureBeat, что для многих предприятий сторонние средства наблюдаемости остаются стандартом по умолчанию. 

«Один из фондов, с которым я сотрудничаю, использует Claude для анализа, а GPT — для отдельного рабочего процесса. Если средства наблюдаемости встроены в инструменты каждого конкретного провайдера, вы получаете две системы, которые не могут взаимодействовать друг с другом. Ваша служба комплаенса не сможет сформировать единый аудиторский след», — пояснил он. — «Поэтому сторонняя наблюдаемость продолжает жить: мультимодельный подход уже стал нормой для бизнеса, и кто-то должен объединять разных провайдеров».

Джессика Арредондо Мерфи (Jessica Arredondo Murphy), генеральный директор и соучредитель True Fit, отметила, что независимым платформам, таким как LangSmith, приходится доказывать предприятиям способность «решить долгосрочный вопрос о том, станут ли они кросс-модель операционным слоем для контроля качества и надежности».

«Компании не спешат переходить на инструменты от первоначальных разработчиков моделей так быстро, как тем хотелось бы. Я вижу прагматичный раскол: команды используют фирменные инструменты для быстрого старта и отладки на ранних этапах, но как только заходит речь о надежности в продакшене, управлении и долгосрочной гибкости, они склонны внедрять более нейтральный уровень для мониторинга и оценки», — сказала она. 

LangSmith Engine уже доступен в режиме публичного бета-тестирования. Команды могут подключить проект трассировки, при желании добавить свой репозиторий, и Engine начнет автоматически выявлять проблемы на основе продакшн-трассировок.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.