GitHub HydraFusion снижает расходы, но качество страдает

GitHub HydraFusion снижает расходы, но качество страдает

Источник: VentureBeat · Sean Michael Kerner

На данном этапе развития систем искусственного интеллекта уже совершенно очевидно, что не существует единой универсальной модели, которая была бы идеальна для решения любых задач. Именно поэтому маршрутизация моделей стала базовым требованием.

Поставщики на рынке маршрутизации моделей теперь преподносят оркестрацию нескольких моделей как повышение качества, однако данные бенчмарков, лежащие в основе этих заявлений, выглядят менее убедительно, чем того требует маркетинг. Эта тенденция наблюдается как у GitHub, так и у Nvidia и OpenRouter. Последний релиз GitHub — яркий тому пример: компания позиционирует HydraFusion как инструмент, обеспечивающий качество уровня передовых моделей, однако ее собственная таблица бенчмарков подтверждает это утверждение лишь в одном из трех тестов.

В пятницу Microsoft анонсировала новый подход к маршрутизации моделей под названием HydraFusion. Само название HydraFusion происходит от HyDRA (Hybrid Dynamic Routing Architecture, гибридная архитектура динамической маршрутизации) — исследовательской работы, которую исследователи Microsoft опубликовали ранее в этом году.

Проект HydraFusion представляет собой исследовательскую превью-версию, доступную через CLI Copilot, которая направляет каждый запрос на написание кода через разные модели в режиме реального времени, вместо того чтобы отправлять всю задачу на одну выбранную модель. В своем наиболее успешном тесте HydraFusion снизила расчетную стоимость до 67% по сравнению с использованием одной лишь Claude Opus 5. HydraFusion уже доступна разработчикам со всеми тарифными планами Copilot через флаг /experimental в Copilot CLI, а использование тарифицируется по стандартной стоимости токенов каждой базовой модели.

«Я бы сказал, что маршрутизация к правильной модели быстро становится обязательным стандартом, но отличие HydraFusion заключается в том, что она решает вопрос «как лучше всего решить эту задачу?», а не «какая модель должна справиться с этой задачей?»», — рассказал Марио Родригес (Mario Rodriguez), директор по продуктам в GitHub, изданию VentureBeat. — «HydraFusion не просто отправляет промпт в модель, она динамически выстраивает стратегию выполнения: оптимально ли задача решается одной моделью, стоит ли начать с более быстрой модели с последующим переключением на более мощную, или же процесс выиграет от того, что независимая модель проверит и улучшит результат».

Как это работает

HydraFusion оценивает каждый запрос на программирование и присваивает ему один из трех паттернов выполнения до того, как будет сделан вызов какой-либо модели. Вместо обращения к единственной модели система выстраивает стратегию выполнения задачи, выбирая один из трех описанных ниже паттернов (по словам Родригеса).

Single (Одиночная модель). Одна модель решает задачу напрямую, без дополнительного этапа проверки или эскалации, если логика маршрутизации определяет отсутствие необходимости в них.

Cascade (Каскад). Эффективная модель сначала создает черновой вариант решения, после чего специальный фильтр качества решает, принять этот черновик или перенаправить ту же задачу более мощной модели.

Critique (Рецензирование). Одна модель создает черновик. Независимая модель из другого семейства проверяет его в изолированном контексте без использования инструментов. Затем модель-автор выполняет однократную доработку на основе этого отзыва.

Собственные показатели GitHub не подтверждают заявления о «качестве уровня передовых моделей»

В ходе автономных оценок на трех бенчмарках по программированию GitHub сравнила HydraFusion с базовыми моделями Claude Opus 5 и GPT-5.6 Sol. Компания представила исследовательскую превью-версию как обеспечивающую качество передового уровня. При этом ее собственная таблица бенчмарков показывает, что это утверждение справедливо лишь для одного из трех проведенных тестов.

TerminalBench 2.1. По качеству верифицированного выполнения задач HydraFusion набрала на 4,6 процентных пункта больше по сравнению с базовой линией Opus 5 при расчетной стоимости на 67% ниже.

DeepSWE. По качеству HydraFusion оказалась на 1,5 процентных пункта ниже Opus 5 при расчетной стоимости на 36% ниже.

CheckpointBench. По качеству HydraFusion показала результат на 0,1 процентных пункта ниже Opus 5 при расчетной стоимости на 65% ниже.

Затраты снизились во всех трех бенчмарках. Качество совпало с Opus 5 или превзошло ее в одном из трех случаев.

Согласно одному из технических разборов, опубликованных в сети, механизм, лежащий в основе этой динамики, скорее сводится к распределению нагрузки, чем к превосходству возможностей. «Вы платите дешевой модели за каждый каскадный запрос», — написал в X разработчик Аван Фарз (Awan Farz), проанализировавший опубликованные результаты HydraFusion. Согласно анализу Фарза, более дорогая модель запускается только для той части задач, которые не проходят фильтр качества.

Не каждая реакция на запуск воспринимала разделение результатов в бенчмарках как предостережение. «Выбор модели ИИ перестал быть решением. Он стал деталью реализации», — написал в X эксперт по искусственному интеллекту Мартин Сермент (Martin Szerment). Сермент охарактеризовал этот релиз как доказательство того, что выбор моделей под конкретные задачи становится частью инфраструктуры, а не отдельным самостоятельным решением.

Разрыв между маркетингом и таблицей бенчмарков свойственен не только GitHub

Маршрутизация моделей — далеко не новшество; по сути, у GitHub уже есть собственная функция маршрутизации моделей под названием auto mode, запущенная ранее в этом году.

Родригес отметил, что функция автоматического выбора моделей (Auto) и HydraFusion функционируют на разных уровнях.

Он пояснил, что Auto определяет, какая именно отдельная модель лучше всего подходит для задачи, в то время как HydraFusion ищет наилучшую комбинацию моделей и этапов выполнения, которая обеспечит наилучший результат для задачи.

«На практике Auto занимается интеллектуальным выбором модели, а HydraFusion — оркестрацией рабочего процесса», — заявил Родригес. — «С HydraFusion система может решить, что одной модели достаточно, либо задействовать одну модель для создания черновика, другую — для независимого рецензирования, или же переключиться на более способную модель, если первая попытка не дотягивает до планки качества. Мы рассматриваем эти возможности как взаимодополняющие и оцениваем вероятность интеграции HydraFusion в режим Auto».

Помимо собственных возможностей GitHub, аналогичный разрыв между маркетинговыми заявлениями о качестве и результатами тестов наблюдается и в других сегментах рынка маршрутизации. NeMo Switchyard от Nvidia, выпущенный в августе одновременно с моделью Nemotron 3.5 Lightning, позиционируется как средство, сохраняющее точность уровня передовых моделей и одновременно снижающее стоимость выполнения задач примерно до трети по сравнению с использованием одной лишь Claude Opus 4.8. Однако самый подробный сторонний бенчмарк, опубликованный Nvidia (от компании LangChain, на основе 145 многошаговых задач), демонстрирует реальную цену: перенаправление всего 7% вызовов на передовую модель сократило расходы на 74%, но при этом привело к измеримой потере точности по сравнению с базовым вариантом, использующим исключительно передовые модели.

OpenRouter демонстрирует похожий разрыв в собственных показателях. Новый автоматический маршрутизатор компании, запущенный в августе, вышел с явным заявлением о том, что он превосходит предшественника «в широком спектре задач и ценовых категорий». Собственная опубликованная таблица бенчмарков подтверждает это в трех из пяти категорий тестирования, однако показывает худшие результаты по сравнению со старым маршрутизатором в двух оставшихся: MMLU Pro (85,2% против 86,6%) и τ³-bench Banking (20,6% против 21,0%).

Что это значит для корпоративного сектора

Для инженерных команд, оценивающих агентов для написания кода, HydraFusion служит сигналом к тому, что управление затратами перемещается внутрь уровня моделей, а не остается отдельным решением на уровне инфраструктуры.

По данным GitHub, на данный момент HydraFusion применима только к одношаговым задачам программирования по первому запросу, в то время как многошаговая оркестрация все еще находится в разработке. Корпоративные клиенты, оценивающие кодинг-агентов исключительно по параметру качества, уже упускают половину того, на что сейчас ориентируются разработчики.

Для команд, оценивающих HydraFusion или любые аналогичные инструменты маршрутизации, таблица бенчмарков служит главным источником информации. Собственные показатели GitHub показывают снижение затрат в каждом тесте и сохранение качества в одном из них. Прежде чем читать рекламные тексты, стоит изучить этот разрыв.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут. Материалы переведены с venturebeat.com.