Запуск Terminal-Bench 2.0 вместе с Harbor — новым фреймворком для тестирования агентов в контейнерах
Разработчики Terminal-Bench, набора тестов для оценки производительности автономных ИИ-агентов в реальных задачах на базе терминала, выпустили версию 2.0 вместе с Harbor — новым фреймворком для тестирования, улучшения и оптимизации ИИ-агентов в контейнеризированных средах.
Этот двойной релиз призван решить давние проблемы при тестировании и оптимизации ИИ-агентов, в особенности тех, которые созданы для автономной работы в реалистичных средах разработчиков.
Обладая более сложным и тщательно проверенным набором задач, Terminal-Bench 2.0 заменяет версию 1.0 в качестве стандарта для оценки возможностей передовых моделей.
Harbor, сопутствующий средовой фреймворк, позволяет разработчикам и исследователям масштабировать оценки на тысячи облачных контейнеров и интегрируется как с открытыми, так и с проприетарными агентами и конвейерами обучения.
«Harbor — это тот пакет, который мы так хотели иметь при создании Terminal-Bench, — написал соавтор проекта Алекс Шоу в X. — Он предназначен для разработчиков и исследователей агентов, моделей и бенчмарков, которые хотят оценивать и совершенствовать агентов и модели».
Более высокая планка, чище данные
Terminal-Bench 1.0 получил широкое распространение после своего <релиза в мае 2025 года>релиза в мае 2025 года, став стандартным бенчмарком для оценки производительности агентов в сфере ИИ-агентов, работающих в терминальных средах в стиле разработчиков. Эти агенты взаимодействуют с системами через командную строку, имитируя то, как разработчики работают за кулисами графического интерфейса.
Однако его широкий охват сопровождался несоответствиями. Несколько задач были отмечены сообществом как плохо специфицированные или нестабильные из-за изменений внешних сервисов.
Версия 2.0 напрямую решает эти проблемы. Обновленный набор включает 89 задач, каждая из которых прошла многочасовую ручную и поддерживаемую языковыми моделями (LLM) валидацию. Акцент делается на том, чтобы задачи были решаемыми, реалистичными и четко специфицированными, что повышает планку сложности при одновременном улучшении надежности и воспроизводимости.
Ярким примером является задача download-youtube, которая была удалена или переработана в версии 2.0 из-за ее зависимости от нестабильных сторонних API.
«Проницательные поклонники Terminal-Bench могут заметить, что производительность на уровне современных достижений (SOTA) сопоставима с TB1.0, несмотря на наше утверждение, что TB2.0 сложнее», — отметил Шоу в X. — Мы считаем, что это связано с тем, что качество задач в новом бенчмарке существенно выше».
Harbor: Единые запуски в масштабном режиме
Наряду с обновлением бенчмарка команда представила Harbor — новый фреймворк для запуска и оценки агентов в развернутых в облаке контейнерах.
Harbor поддерживает крупномасштабную инфраструктуру запуска с совместимостью с такими крупными провайдерами, как Daytona и Modal.
Спроектированный с расчетом на универсальность для различных архитектур агентов, Harbor поддерживает:
-
Оценку любого агента, устанавливаемого в контейнер
-
Масштабируемые конвейеры контролируемой дообучки (SFT) и обучения с подкреплением (RL)
-
Создание и развертывание пользовательских бенчмарков
-
Полную интеграцию с Terminal-Bench 2.
Harbor использовался внутри компании для проведения десятков тысяч запусков в процессе создания нового бенчмарка. Теперь он общедоступен через harborframework.com вместе с документацией для тестирования и отправки агентов в публичную таблицу лидеров.
Первые результаты: GPT-5 лидирует по успешности решения задач
Первые результаты таблицы лидеров Terminal-Bench 2.0 показывают, что интерфейс командной строки Codex CLI от OpenAI, представляющий собой вариант на базе GPT-5, находится на первом месте с показателем успешности 49,6% — самым высоким среди всех протестированных на данный момент агентов.
Следом за ними идут другие варианты на базе GPT-5 и агенты на основе Claude Sonnet 4.5.
Топ-5 результатов агентов (Terminal-Bench 2.0):
-
Codex CLI (GPT-5) — 49,6%
-
Codex CLI (GPT-5-Codex) — 44,3%
-
OpenHands (GPT-5) — 43,8%
-
Terminus 2 (GPT-5-Codex) — 43,4%
-
Terminus 2 (Claude Sonnet 4.5) — 42,8%
Близкое расположение результатов ведущих моделей друг к другу указывает на активную конкуренцию между платформами, причем ни один отдельный агент не справляется более чем с половиной задач.
Отправка результатов и использование
Чтобы протестировать или отправить агента, пользователи устанавливают Harbor и запускают бенчмарк с помощью простых команд CLI. Для отправки в таблицу лидеров требуется выполнить пять запусков бенчмарка, а результаты вместе с директориями заданий можно отправить разработчикам по электронной почте для проверки.
harbor run -d terminal-bench@2.0 -m «
Terminal-Bench 2.0 уже интегрируется в исследовательские рабочие процессы, сосредоточенные на агентных рассуждениях, генерации кода и использовании инструментов. По словам соавтора проекта Майка Меррилла, постдокторанта Стэнфордского университета, в настоящее время готовится подробный препринт, описывающий процесс верификации и методологию проектирования, лежащие в основе бенчмарка.
Стремление к стандартизации
Совместный выпуск Terminal-Bench 2.0 и Harbor знаменует собой шаг к более согласованной и масштабируемой инфраструктуре оценки агентов. По мере распространения ИИ-агентов в средах разработки и эксплуатации потребность в контролируемом и воспроизводимом тестировании возросла.
Эти инструменты предлагают потенциальную основу для единого стека оценки, поддерживающего улучшение моделей, симуляцию среды и стандартизацию бенчмарков во всей экосистеме искусственного интеллекта.



