Amazon представляет бесплатную, быструю модель с открытым исходным кодом — убийцу Jev: Strands Decider 2B принимает решения за доли секунды
Гонка за созданием более дешёвых и быстрых ИИ-агентов выходит за рамки моделей, которые формулируют ответы. За две недели после того, как TypeSafe AI представила Jev — модель, которая выбирает из заранее заданных вариантов вместо того, чтобы генерировать текст, — разработчики выпустили целую волну конкурирующих моделей для принятия решений, многие из которых можно скачать вместе с весами.
Теперь к ним присоединяется Amazon с открытой моделью, предназначенной для работы внутри агентского процесса и оценки того, следует ли выполнять предложенное действие: Strands Decider 2B — модель примерно с 2 млрд параметров, дообученная на базе Alibaba Qwen. Она за один проход отвечает на вопросы с ограниченным набором вариантов, выдавая выбранные ответы и вероятности.
Модель с открытым исходным кодом можно бесплатно скачать с Hugging Face и использовать на условиях ориентированной на бизнес разрешительной лицензии Apache 2.0. Однако разработчикам придётся самостоятельно предоставить оборудование или облачные вычислительные ресурсы для её запуска.
Amazon также сообщает, что разработчики могут скачать материалы для обучения и использовать модель для маршрутизации запросов, выбора инструментов, оценки результатов или проверки действий агента.
Релиз входит в Strands Labs — экспериментальный проект AWS по разработке агентов. AWS предоставила VentureBeat окончательный текст объявления и три технических графика до его публикации в полдень по восточному времени.
Основная идея проста: если программе нужен ответ вроде «Следует ли запускать этот инструмент?» или «Какой из этих трёх маршрутов подходит для запроса?», просьба к большой языковой модели написать объяснение может увеличить затраты и время обработки. Модель для принятия решений напрямую оценивает допустимые ответы. Поэтому она может быть полезна в качестве частой узкоспециализированной контрольной точки для более продвинутого агента, оставляя генеративной модели задачи по написанию текстов, программированию и сложным рассуждениям.
Что создала AWS
В основе Strands Decider лежит предварительно обученная модель Qwen3.5-2B. По словам AWS, разработчики удалили компонент, предсказывающий следующее слово, и заменили его небольшим компонентом-«указателем», который оценивает предоставленные варианты ответа.
Базовую модель адаптировали с помощью обновления LoRA ранга 16, а новый компонент оценки обучили отдельно. Как утверждает AWS, он добавляет чуть больше миллиона параметров. На архитектурной схеме, сопровождающей объявление, эта конструкция обозначена как «Hobson». В отличие от чат-бота, модель выполняет один прямой проход и возвращает распределение вероятностей по доступным вариантам.
AWS сообщает, что команда быстро провела несколько итераций и опубликует версию 20 вместе с кодом, данными обучения и скриптами. Открытость — важная часть предложения: разработчики смогут изучить методику, дообучить модель и запустить её на собственной инфраструктуре, а не отправлять каждое решение во внешний API.
В примере из объявления AWS модель принимает решение прямо перед вызовом агентом погодного инструмента. Если пользователь спрашивает о погоде, не указывая местоположение, агент в демонстрации сам выбирает город. Strands Decider анализирует диалог и предложенный вызов, выясняя, взят ли город из запроса пользователя и не слишком ли рано вызывать инструмент. Затем код приложения использует ответы модели, чтобы вернуть агента к запросу с просьбой указать город.
В этом примере используется существующий механизм вмешательства агентского фреймворка Strands. Он позволяет продолжить выполнение, отклонить вызов инструмента, запросить подтверждение или направить агента с помощью обратной связи.
AWS отмечает, что вопросы и пороговые значения в примере задавались вручную, а специализированные библиотеки для интеграции моделей принятия решений всё ещё разрабатываются. Модель выносит суждение, но именно разработчик определяет, что приложение будет с ним делать.
Насколько она быстрая и точная?
AWS утверждает, что модель может принимать решения локально за десятки миллисекунд при решении коротких задач, а на некотором распространённом оборудовании и с определёнными входными данными — менее чем за 100 миллисекунд.
Задержка принятия решений в зависимости от размера задачи (в токенах), измеренная локально на Nvidia RTX 3090 для версии 18 модели. Задержка увеличивается примерно линейно вместе с размером задачи. Источник: Amazon
TypeSafe, тем временем, сообщает, что время ответа Jev от начала до конца составляет примерно от 70 до 500 миллисекунд при использовании её облачного сервиса.
В сопроводительном графике Amazon, посвящённом задержке Jev, приведены более конкретные данные с оговорками: версия 18 показала медианную задержку 106 миллисекунд и задержку на 95-м процентиле 296 миллисекунд по результатам 230 запросов на локальной Nvidia RTX 3090, включая время на HTTP-обмен. Более длинные запросы, как правило, обрабатывались дольше.
На графике не учитывается первый запрос, занявший 7,7 секунды из-за прогрева сервера. AWS также приводит медианное значение около 150 миллисекунд для небольших задач на MacBook M3. Эти показатели не следует представлять как универсальную гарантию задержки менее 100 миллисекунд.
Качество AWS оценивает по точности и надёжности вероятностных оценок на общедоступной части набора данных JevBench. На графике показаны последовательные версии вплоть до версии 19, которая превосходит более ранние контрольные версии команды.
Точность и калибровка (оценка Бриера) на разных этапах обучения. По мере изменения архитектуры от версии к версии обе метрики улучшались на общедоступной части JevBench. Источник: Amazon
Согласно графику, показатель v19 составляет примерно 72% точности при оценке Бриера 0,35. У сопоставимой по размеру модели Mapika decider-2b v11 эти показатели составляют примерно 76% и 0,32 соответственно. Чем выше точность и ниже оценка Бриера, тем лучше, поэтому по обоим показателям сравнение складывается в пользу Mapika.
AWS утверждает, что в этом тесте её модель занимает второе место среди общедоступных моделей сопоставимого размера и первое — среди моделей с опубликованной полной методикой обучения. На графике нет результатов запланированной версии 20, а в сравнении не представлена сама Jev. Ни письмо, ни графики не доказывают, что Strands Decider в целом превосходит Jev.
Сетевые расстояния, структура запросов и эксплуатационные расходы различаются. Представитель Amazon, выступая не для цитирования, сообщил, что пока AWS предлагает только модель с открытым исходным кодом — без размещённого API и платы за вызовы.
По словам представителя, разработчики могут запускать её на MacBook, однако использование собственных компьютеров или облачной инфраструктуры всё равно требует ресурсов. Amazon не предоставила универсальную оценку эксплуатационных расходов на токен или запрос, которую можно было бы сопоставить с тарифом API.
Таким образом, сравнить относительные затраты на эксплуатацию Strands Decider и оплату сервиса Jev пока невозможно.
Jev дала начало быстро развивающемуся направлению
TypeSafe выпустила Jev 15 сентября, назвав её моделью «System One». Она принимает состояние приложения и вопросы с типизированными вариантами, а затем возвращает выбранные ответы, оценки или вероятности «да/нет», не генерируя текстовый ответ. TypeSafe взимает 0,042 доллара за миллион входных токенов, не беря плату за выходные токены, и утверждает, что при постобучении особое внимание уделяется калибровке вероятностей. Доступ к модели осуществляется через API; TypeSafe не публиковала веса Jev или полную методику её обучения.
Привлекательные стороны этого подхода и его ограничения уже стали предметом пристального внимания. VentureBeat писал, что этот подход возрождает классификацию на базе современных более мощных предварительно обученных моделей: многим корпоративным системам нужна метка или решение о маршрутизации, а не абзац текста. Другое расследование VentureBeat показало, почему дешёвый вероятностный фильтр не может служить безотказным рубежом безопасности: на его вывод могут повлиять враждебные инструкции во входных данных агента. TypeSafe и её интеграционные партнёры признали наличие такого риска.
Направление развивалось почти так же стремительно, как и обсуждение вокруг него. В Laya используется значительно более компактная архитектура на базе ModernBERT с 421 млн параметров, предназначенная для локального принятия решений. Jared Palmer’s Kev включает семейство моделей и материалы об исследованиях.
Bespoke Nimble 9B предлагает адаптер с лицензией Apache и справочный код. Семейство моделей decider от Mapika включает модели нескольких размеров; разработчики также публикуют код обучения и карточки моделей.
this-that-model от FLock — ещё одна компактная модель, которую можно запускать локально. Модели различаются архитектурой, обучением, требованиями к оборудованию и точностью оценок уверенности. Само по себе общее название «модель принятия решений» не делает их результаты тестирования сопоставимыми.
Исследователи из Стэнфорда и Nvidia пошли схожим путём, создав открытую модель CLM-8B, которая может кэшировать представления повторно используемых действий. Как сообщал VentureBeat, в тестах исследователей она работала на некоторых задачах до девяти раз быстрее Jev, но уступала ей по точности вызова инструментов. Этот результат относится к конкретным рабочим нагрузкам и условиям тестирования, однако он показывает, как быстро специализированные альтернативы исследуют разные компромиссы между скоростью и точностью.
|
Категория |
Strands Decider 2B и Jev |
Что подтверждают имеющиеся данные |
|
Начальная цена/API |
Преимущество Strands |
AWS сообщает, что модель можно бесплатно скачивать и использовать; размещённого API и платы за вызовы нет. Использование Jev стоит 0,042 доллара за миллион входных токенов . |
|
Общие эксплуатационные расходы |
Неясно |
Пользователь Strands должен предоставить процессоры/графические процессоры или облачные вычислительные ресурсы. AWS не приводила оценку расходов на запрос или токен, поэтому нельзя утверждать, что эксплуатация модели действительно дешевле, чем использование крайне недорогого размещённого API Jev. |
|
Скорость |
Примерно сопоставима; явного преимущества не доказано |
AWS измерила задержку на ранней контрольной версии Strands: медиана — 106 мс / 95-й процентиль — 296 мс при локальном запуске на RTX 3090. TypeSafe сообщает, что Jev в облаке обрабатывает запросы от начала до конца за примерно 70–500 мс . Разница в оборудовании и сетевых условиях не позволяет однозначно определить победителя. |
|
Точность |
Нет данных, что Strands превосходит Jev |
На графике AWS точность Strands v19 на общедоступной части JevBench составляет примерно 72% . Самой Jev в сравнении нет, поэтому прямых результатов, подтверждающих преимущество по точности, не представлено. |
|
Калибровка |
Преимущество ни Jev, ни Strands не доказано |
AWS сообщает, что оценка Бриера для v19 составляет примерно 0,35 . Однако Jev снова отсутствует в сравнении на графике. TypeSafe отдельно подчёркивает, что при постобучении Jev особое внимание уделялось калибровке, но представленные материалы не позволяют определить, какая модель лучше. |
|
Открытость |
Явное преимущество Strands |
AWS планирует выпустить модель, код, данные обучения и скрипты. Jev доступна только через API; TypeSafe не публиковала веса или полную методику обучения. |
|
Самостоятельный хостинг / конфиденциальность / контроль |
Явное преимущество Strands |
Strands можно запускать локально, в том числе на MacBook, поэтому компании могут хранить решения в собственной среде, а не отправлять их во внешний API. |
|
Настройка |
Вероятное преимущество Strands |
Поскольку AWS публикует методику и материалы для обучения, разработчики могут изучить их и дообучить модель. Jev не предоставляет такого же уровня контроля на уровне модели. |
|
Простота использования |
Преимущество Jev |
Jev — это размещённый API: отправляйте запросы и платите небольшую сумму за использование. Strands придётся развёртывать и самостоятельно поддерживать. Это даёт больше гибкости, но требует и больше операционной работы. |
|
Интеграция с AWS/Strands |
Преимущество Strands в этой экосистеме |
AWS показывает, как модель напрямую работает с механизмом вмешательства Strands в качестве контрольной точки перед действиями агента. |
В вопросе цены есть любопытный парадокс: у Strands нулевая цена на ценнике, тогда как эксплуатация Jev и без того обходится почти незаметно. При тарифе Jev в 0,042 доллара за миллион входных токенов миллиард входных токенов стоит всего 42 доллара. Поэтому, если у компании нет свободных вычислительных ресурсов или локальный запуск не нужен ей для обеспечения конфиденциальности и контроля, AWS пока не доказала, что самостоятельный хостинг Strands экономит деньги с учётом стоимости оборудования, облачных вычислений и операционных расходов.
В том, что Amazon бесспорно продвигает направление вперёд, ключевую роль играет воспроизводимость моделей с открытым исходным кодом. TypeSafe предлагает разработчикам довериться Jev и пользоваться ею как сервисом. Amazon же, по сути, говорит: вот компактная модель, методика, данные и инструменты — запускайте её самостоятельно и изменяйте. Для корпоративных клиентов это может оказаться более важным стратегическим преимуществом, чем ещё несколько процентных пунктов в результатах тестирования.
Таким образом, главное отличие предложения AWS — не доказанное превосходство над Jev, а открытый и воспроизводимый слой принятия решений, связанный с уже существующим агентским фреймворком.
Разработчик на Strands может поставить небольшую локальную модель перед вызовом инструмента, определить, когда из-за неопределённости нужно обратиться к человеку или вернуть управление агенту, а для задач, требующих генерации, оставить большую языковую модель. Опубликованная методика и возможность запускать модель на ноутбуке могут облегчить эксперименты командам, которые хотят контролировать собственную инфраструктуру.
Решающая проверка ждёт модель за пределами демонстрационных примеров: сохранит ли опубликованная контрольная версия точность и хорошую калибровку на собственных политиках, документах и нестандартных случаях компаний и окажутся ли локальный запуск и обслуживание выгоднее необычайно низкой цены размещённого сервиса Jev. Для чувствительных вызовов инструментов демонстрация с прогнозом погоды — полезный пример контрольной точки, но не доказательство того, что одного лишь решения модели достаточно для безопасности агента.
Коротко говоря: Amazon создала действительно конкурентоспособную альтернативу Jev. Её главное отличие — не превосходство в результатах тестирования, а открытость, возможность самостоятельного хостинга и воспроизводимость.



