Разработчики теперь могут отлаживать и оценивать ИИ-агентов локально с помощью инструмента с открытым исходным кодом Workshop от Raindrop

Разработчики теперь могут отлаживать и оценивать ИИ-агентов локально с помощью инструмента с открытым исходным кодом Workshop от Raindrop

Стартап в сфере наблюдаемости Raindrop AI сегодня выпустил новый инструмент с открытым исходным кодом под лицензией MIT под названием «Workshop». Он дает разработчикам то, чего они, возможно, подсознательно желали с начала эпохи автономных ИИ-агентов в прошлом году: локальный отладчик и инструмент оценки, специально созданный для ИИ-агентов. Он позволяет разработчикам просматривать все логи действий агента в виде единого легковесного файла базы данных SQLite (.db).

Инструмент работает как локальный демон и пользовательский интерфейс, который транслирует каждый токен, вызов инструмента и решение на локальную панель управления (обычно размещаемую по адресу localhost:5899) в момент их возникновения. Зайдя на localhost, разработчики могут увидеть все, чем занимался их агент, включая ошибки и сбои, а также определить, что пошло не так, когда и почему. Все это хранится в одном файле .db, который занимает относительно мало памяти, как сообщил в личных сообщениях в X Бен Халак (Ben Hylak), соучредитель и технический директор Raindrop (а также бывший инженер Apple и SpaceX).

Эта телеметрия в реальном времени устраняет задержки традиционного опроса и решает растущую озабоченность разработчиков конфиденциальностью при отправке локальных логов на внешние серверы.

Инструмент доступен для macOS, Linux и Windows. Его можно установить с помощью одной команды оболочки, которая автоматизирует размещение бинарных файлов и настройку переменной PATH для оболочек bash, zsh и fish. Для разработчиков, предпочитающих сборку из исходного кода, репозиторий размещен на GitHub и использует среду выполнения Bun.

Продукт: создание цикла самовосстанавливающейся оценки

Главной особенностью платформы является «цикл самовосстанавливающейся оценки» (self-healing eval loop), который позволяет таким агентам кодирования, как Claude Code, читать логи, писать тесты оценки для кодовой базы и автономно исправлять сломанный код.

На практике, если агент ветеринарного ассистента не задает необходимые уточняющие вопросы, Workshop фиксирует всю траекторию. Затем Claude Code считывает этот лог, пишет конкретный тест оценки, определяет логическую ошибку в промпте или коде и перезапускает агента до тех пор, пока все проверки не пройдут успешно.

Совместимость и интеграция с экосистемой

Workshop совместим с широким спектром языков программирования, включая TypeScript, Python, Rust и Go.

Он интегрируется с популярными SDK и фреймворками, такими как Vercel AI SDK, OpenAI, Anthropic, LangChain, LlamaIndex и CrewAI. Он также разработан для бесшовной работы с различными агентами кодирования, включая Claude Code, Cursor, Devin и OpenCode.

Лицензирование и значение для сообщества

Workshop выпускается под лицензией MIT, что гарантирует его бесплатность и открытый исходный код для всех пользователей. Такая мягкая лицензия призвана способствовать вкладу со стороны сообщества и позволить корпоративным пользователям сохранять суверенитет данных.

Халак отметил в X, что инструмент был создан для обеспечения «разумного» способа локальной отладки агентов, что меняет подход к созданию автономных систем для их команды и первых клиентов.

В честь запуска Raindrop предложила фирменный мерджендайзинг ограниченной серии пользователям, которые установили инструмент и выполнили определенную команду «drip».

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.