Запуск Terminal-Bench 2.0 вместе с Harbor — новым фреймворком для тестирования агентов в контейнерах

Запуск Terminal-Bench 2.0 вместе с Harbor — новым фреймворком для тестирования агентов в контейнерах

Разработчики Terminal-Bench, набора тестов для оценки производительности автономных ИИ-агентов в реальных задачах на базе терминала, выпустили версию 2.0 вместе с Harbor — новым фреймворком для тестирования, улучшения и оптимизации ИИ-агентов в контейнеризированных средах.

Этот двойной релиз призван решить давние проблемы при тестировании и оптимизации ИИ-агентов, в особенности тех, которые созданы для автономной работы в реалистичных средах разработчиков.

Обладая более сложным и тщательно проверенным набором задач, Terminal-Bench 2.0 заменяет версию 1.0 в качестве стандарта для оценки возможностей передовых моделей.

Harbor, сопутствующий средовой фреймворк, позволяет разработчикам и исследователям масштабировать оценки на тысячи облачных контейнеров и интегрируется как с открытыми, так и с проприетарными агентами и конвейерами обучения.

«Harbor — это тот пакет, который мы так хотели иметь при создании Terminal-Bench, — написал соавтор проекта Алекс Шоу в X. — Он предназначен для разработчиков и исследователей агентов, моделей и бенчмарков, которые хотят оценивать и совершенствовать агентов и модели».

Более высокая планка, чище данные

Terminal-Bench 1.0 получил широкое распространение после своего <релиза в мае 2025 года>релиза в мае 2025 года, став стандартным бенчмарком для оценки производительности агентов в сфере ИИ-агентов, работающих в терминальных средах в стиле разработчиков. Эти агенты взаимодействуют с системами через командную строку, имитируя то, как разработчики работают за кулисами графического интерфейса.

Однако его широкий охват сопровождался несоответствиями. Несколько задач были отмечены сообществом как плохо специфицированные или нестабильные из-за изменений внешних сервисов.

Версия 2.0 напрямую решает эти проблемы. Обновленный набор включает 89 задач, каждая из которых прошла многочасовую ручную и поддерживаемую языковыми моделями (LLM) валидацию. Акцент делается на том, чтобы задачи были решаемыми, реалистичными и четко специфицированными, что повышает планку сложности при одновременном улучшении надежности и воспроизводимости.

Ярким примером является задача download-youtube, которая была удалена или переработана в версии 2.0 из-за ее зависимости от нестабильных сторонних API.

«Проницательные поклонники Terminal-Bench могут заметить, что производительность на уровне современных достижений (SOTA) сопоставима с TB1.0, несмотря на наше утверждение, что TB2.0 сложнее», — отметил Шоу в X. — Мы считаем, что это связано с тем, что качество задач в новом бенчмарке существенно выше».

Harbor: Единые запуски в масштабном режиме

Наряду с обновлением бенчмарка команда представила Harbor — новый фреймворк для запуска и оценки агентов в развернутых в облаке контейнерах.

Harbor поддерживает крупномасштабную инфраструктуру запуска с совместимостью с такими крупными провайдерами, как Daytona и Modal.

Спроектированный с расчетом на универсальность для различных архитектур агентов, Harbor поддерживает:

  • Оценку любого агента, устанавливаемого в контейнер

  • Масштабируемые конвейеры контролируемой дообучки (SFT) и обучения с подкреплением (RL)

  • Создание и развертывание пользовательских бенчмарков

  • Полную интеграцию с Terminal-Bench 2.

Harbor использовался внутри компании для проведения десятков тысяч запусков в процессе создания нового бенчмарка. Теперь он общедоступен через harborframework.com вместе с документацией для тестирования и отправки агентов в публичную таблицу лидеров.

Первые результаты: GPT-5 лидирует по успешности решения задач

Первые результаты таблицы лидеров Terminal-Bench 2.0 показывают, что интерфейс командной строки Codex CLI от OpenAI, представляющий собой вариант на базе GPT-5, находится на первом месте с показателем успешности 49,6% — самым высоким среди всех протестированных на данный момент агентов.

Следом за ними идут другие варианты на базе GPT-5 и агенты на основе Claude Sonnet 4.5.

Топ-5 результатов агентов (Terminal-Bench 2.0):

  1. Codex CLI (GPT-5) — 49,6%

  2. Codex CLI (GPT-5-Codex) — 44,3%

  3. OpenHands (GPT-5) — 43,8%

  4. Terminus 2 (GPT-5-Codex) — 43,4%

  5. Terminus 2 (Claude Sonnet 4.5) — 42,8%

Близкое расположение результатов ведущих моделей друг к другу указывает на активную конкуренцию между платформами, причем ни один отдельный агент не справляется более чем с половиной задач.

Отправка результатов и использование

Чтобы протестировать или отправить агента, пользователи устанавливают Harbor и запускают бенчмарк с помощью простых команд CLI. Для отправки в таблицу лидеров требуется выполнить пять запусков бенчмарка, а результаты вместе с директориями заданий можно отправить разработчикам по электронной почте для проверки.

harbor run -d terminal-bench@2.0 -m «» -a «» —n-attempts 5 —jobs-dir

Terminal-Bench 2.0 уже интегрируется в исследовательские рабочие процессы, сосредоточенные на агентных рассуждениях, генерации кода и использовании инструментов. По словам соавтора проекта Майка Меррилла, постдокторанта Стэнфордского университета, в настоящее время готовится подробный препринт, описывающий процесс верификации и методологию проектирования, лежащие в основе бенчмарка.

Стремление к стандартизации

Совместный выпуск Terminal-Bench 2.0 и Harbor знаменует собой шаг к более согласованной и масштабируемой инфраструктуре оценки агентов. По мере распространения ИИ-агентов в средах разработки и эксплуатации потребность в контролируемом и воспроизводимом тестировании возросла.

Эти инструменты предлагают потенциальную основу для единого стека оценки, поддерживающего улучшение моделей, симуляцию среды и стандартизацию бенчмарков во всей экосистеме искусственного интеллекта.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.