Компании платят большим языковым моделям за генерацию текста для решений, которым достаточно метки. Jev предлагает более дешёвый способ

Компании платят большим языковым моделям за генерацию текста для решений, которым достаточно метки. Jev предлагает более дешёвый способ

Значительная часть ИИ, работающего сегодня внутри корпоративного программного обеспечения, ничего не пишет. Он не общается с ИИ-чатботом и даже не рассуждает о том, как дать вам правильный ответ. Он принимает решения: к какой очереди отнести запрос в службу поддержки, релевантен ли документ для RAG, не выглядит ли подозрительной транзакция или какую модель следует использовать для обработки запроса. Во многих корпоративных стеках ИИ такие решения принимаются так: языковую модель просят сгенерировать текст, а затем этот текст преобразуют обратно в метку.

Jev от TypeSafe AI, выпущенный в ранний доступ 15 сентября, предлагает другой подход к принятию таких решений. Jev не ведёт диалог, не проходит длинную цепочку рассуждений и даже не генерирует текст. Он получает состояние приложения и набор типизированных вопросов, а затем возвращает варианты, оценки и ответы «да» или «нет» с указанием вероятностей — обычно за 70–500 миллисекунд и по цене 0,042 доллара за миллион входных токенов. А выходные токены? Что ж, они вообще бесплатны.

Всего за несколько дней Jev интегрировали во всё — от платформ наблюдаемости до агентских фреймворков, таких как Pydantic AI и LangChain. TypeSafe пришлось приостановить запись в очередь на регистрацию, и многие начали пользоваться моделью через OpenRouter. Тем временем на GitHub и Hugging Face стали появляться альтернативы с открытым исходным кодом. Хотя всеобщее внимание приковано к Jev, лежащий в основе подход появился раньше: это классификация.

Зачем генерировать текст, если нужна только метка?

Чат-модели оптимизированы для другой задачи. Предварительное обучение учит их предсказывать следующий токен, а последующее обучение с подкреплением на основе отзывов людей — выдавать ответы, которые предпочитают пользователи. На обоих этапах создаются текстовые строки. Для автоматизации нужны типизированные значения, предсказуемая задержка, стабильная стоимость каждого вызова и результаты, которые можно легко сравнить с эталонными данными.

Использование генеративной модели для принятия решения — даже если она точна — означает оплату декодирования токен за токеном, последующего разбора и проверки результата, а также обработку случаев, когда модель отходит от заданного формата, добавляет комментарии или отказывается отвечать. Кроме того, генеративные модели, как правило, плохо калибруют собственную уверенность. Это важнее, чем кажется: если система не может определить, когда, вероятно, ошибётся, она не сможет надёжно решить, когда следует передать задачу человеку. В стартовой публикации TypeSafe этот аргумент изложен напрямую: последовательная генерация противопоставляется параллельному семплеру Jev, а самооценка уверенности — калиброванным вероятностям.

Хотя малые языковые модели стали быстрыми и дешёвыми, для принятия решения им всё равно приходится генерировать токены. Классификатор же может напрямую возвращать метку или оценку, нужную вызывающему его программному обеспечению, не генерируя текст.

Что изменилось: предварительное обучение наконец-то догнало классификацию

Если классификация всегда лучше подходила для принятия решений, почему сейчас она снова набирает популярность? Главная причина — качество предварительного обучения.

Ещё к 2019 году исследователи показали, что классификация с нулевым числом примеров вполне работоспособна. Yin и соавторы адаптировали модели логического вывода на естественном языке, чтобы проверять подходящие метки на соответствие входным данным, а модель facebook/bart-large-mnli стала распространённым вариантом по умолчанию для классификации текста по меткам, задаваемым во время запроса. Но за пределами доменов, на которых их обучали, эти модели работали нестабильно, поэтому для многих внедрений по-прежнему требовались размеченные данные и обучение под конкретные задачи.

BERT обучали примерно на 3,3 миллиарда слов. ModernBERT, выпущенный в декабре 2024 года, обучали на 2 триллионах токенов; размер его контекстного окна составляет 8 192 токена. Более мощные предварительно обученные модели теперь способны обрабатывать более широкий круг вопросов классификации, задаваемых во время запроса, что снижает потребность обучать отдельную модель для каждой задачи.

Открытые реализации Jev наглядно это демонстрируют, поскольку их внутреннее устройство доступно всем. SemIf вообще не обучает модель: он напрямую считывает вероятности вариантов из замороженной модели Qwen3.5-4B. Разработчики SemIf измерили, что обработка 21 вопроса занимает около секунды, тогда как генерация JSON требует более пяти секунд. Два метода совпали в 18 из 21 случая. Laya строит модель принятия решений на базе ModernBERT-large с 421 миллионом параметров и отвечает примерно за 33–40 миллисекунд на вопрос на Nvidia T4. В других проектах к Qwen3.5 применяют адаптеры LoRA или используют DiffusionGemma. Реализации различаются, но в их основе лежит одна и та же идея: использовать более мощные предварительно обученные модели для принятия решений без генерации текста.

Эти реализации показывают и ограничения подхода. Разработчики Laya сообщают, что базовые контрольные точки модели показывают результаты, близкие к случайному угадыванию, на их тесте типизированных решений, а после дообучения показатели существенно улучшаются. Сама TypeSafe мало рассказала о внутреннем устройстве Jev, упомянув лишь новую архитектуру, параллельный семплер и метод последующего обучения, который компания называет обучением с подкреплением для калиброванных решений (RLCD). Он оптимизирует модель так, чтобы возвращаемые ею вероятности соответствовали фактической частоте правильных ответов. Ставка TypeSafe — сделать принятие калиброванных решений главной целью обучения.

Новая эра: современное предварительное обучение и старые приёмы глубокого обучения

Jev — самый заметный пример более широкой тенденции: разработчики берут предварительное обучение фронтирного уровня и применяют поверх него подходы, популярные до появления ChatGPT.

Недорогой классификатор определяет, направить ли запрос в небольшую локальную модель, специализированную модель или фронтирный API. Исследования, такие как FrugalGPT и RouteLLM, уже формализовали каскадную маршрутизацию языковых моделей. Интеграция Jev в Pydantic AI построена на том же принципе разделения задач: Jev заполняет типизированные поля, а всё, что требует письменного текста, передаётся языковой модели.

Дистилляция и небольшие специализированные модели никуда не исчезали из компаний с крупными, давно сформировавшимися командами машинного обучения — об их использовании рассказывал подкаст VentureBeat Beyond the Pilot. В LinkedIn Эрран Бергер, руководивший этой работой в должности вице-президента по разработке продуктов, а ныне занимающий пост технического директора, рассказал, как компания создала рекомендательные системы нового поколения: сначала дообучила модель-учитель с 7 миллиардами параметров на подробном документе с правилами работы продукта, затем дистиллировала её через промежуточную модель с 1,7 миллиарда параметров в модель-ученика с 0,6 миллиарда параметров, которая обрабатывает производственный трафик. «Просто не было способа добиться этого с помощью промптов», — сказал Бергер. Теперь этот процесс стал воспроизводимым рецептом, который применяют в разных ИИ-продуктах LinkedIn. Shopify развила ту же идею дальше: внутренняя платформа компании позволяет командам НИОКР примерно за день дистиллировать фронтирную модель в дообученную модель с открытым исходным кодом для одной узкой задачи; оценка результатов встроена в процесс. Фархан Тавар, вице-президент и руководитель инженерного направления Shopify, сообщил, что дистиллированные модели обходятся в 2–30 раз дешевле и работают быстрее, а в некоторых узких задачах превосходят фронтирную модель, на которой обучались.

Общий принцип заключается в том, чтобы оставить генерацию для задач, которым она действительно нужна: составления черновиков, краткого изложения и написания кода. Более узкие задачи принятия решений, например маршрутизацию и присвоение тегов, можно поручить менее дорогим моделям, отвечающим требованиям приложения к точности и надёжности.

Что корпоративным командам следует сделать, прежде чем отказаться от LLM для принятия решений

Первый шаг — провести аудит существующего трафика LLM, разделив вызовы на генеративные задачи и принятие решений: маршрутизацию, сортировку, присвоение тегов, одобрение и оценку. Разбор на примере от разработчика Флавио Копеса показывает расчёты: компания, которая тратит на ИИ 10 000 долларов в месяц, из них 6 000 долларов — на принятие решений, сэкономила бы 5 700 долларов в месяц, если бы перенесла эти задачи на решение, обходящееся в 5% от прежней стоимости. Фактическая экономия зависит от того, какую долю расходов удастся перенести и сколько в действительности будет стоить замена.

Ограничения вполне реальны. Jev находится в раннем доступе, принимает только текстовые данные и пока обслуживается с Западного побережья США. TypeSafe признаёт, что потребуется время, чтобы понять, устойчива ли ценовая политика Jev, и отмечает, что заявленные компанией показатели — примерно в 194 раза быстрее и в 445 раз дешевле — основаны на собственных оценках рабочих процессов и, вероятно, соответствуют верхней границе результатов, достижимых в реальных условиях. В документации Pydantic также отмечается, что текст во входных данных, предназначенный для влияния на ответ Jev, может сработать, поэтому защитные механизмы на основе Jev должны дополнять детерминированные проверки, а не заменять их. Открытые альтернативы избавляют от зависимости от поставщика, но перекладывают на команды задачи по размещению моделей, дообучению, калибровке и мониторингу.

Долгосрочные последствия касаются не только моделей, но и людей. Инженеры, которые до 2022 года создавали классификаторы, каскады и конвейеры оценки, вновь могут применить свои навыки. Команды, сочетающие этот опыт с современными предварительно обученными моделями, имеют все возможности создавать автоматизированные системы, которые обходятся дешевле, работают быстрее и проще поддаются аудиту.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.