Прокси-сервер LLM и стек дистилляции от Shopify
Компания Shopify создала прокси-сервер для больших языковых моделей (LLM), который предоставляет каждому инженеру доступ к нескольким ИИ-провайдерам одновременно — с автоматическим переключением на резервный вариант, если любой из них выходит из строя, меняется или исчезает. Когда Claude Fable 5 прекратил работу, инженеры Shopify не впали в панику. Прокси автоматически перевел их на Claude Opus или GPT 5.5 без прерывания их рабочих процессов.
«Fable выглядит потрясающе; мы, конечно, использовали его», — говорит Фархан Тавар (Farhan Thawar), вице-президент по разработке в Shopify, в новом подкасте VentureBeat Beyond the Pilot. «Когда модель появляется, а затем исчезает, или же происходят такие банальные вещи, как обновление, прокси позволяет нам распределять запросы между разными провайдерами», — отмечает Тавар.
По словам Тавара, Shopify закупает токены оптом, и все пользователи подключаются к моделям через ее прокси. Это дает его команде возможность формировать отчетность и настраивать отказоустойчивость: при возникновении проблем с доступностью у одного из провайдеров пользователи могут быть «автоматически и бесшовно» перенаправлены к другому.
Предприятия могут извлечь уроки из этого примера и задуматься о том, как возможные сбои могут повлиять на их бизнес, говорит Тавар. Как минимум, им следует разработать надежный запасной план. Важно иметь систему, позволяющую переключаться между моделями, чтобы компании не были «слишком жестко привязаны» к конкретному поставщику.
Дистилляция — еще одна важная стратегия.
При дистилляции модель-ученик обучается на основе модели-учителя и, как правило, специализируется на выполнении более узких задач. Такие малые языковые модели (SLM) в некоторых случаях могут принести больше пользы, чем универсальные готовые модели. Например, флагманский ИИ-ассистент Shopify Sidekick выполняет множество специализированных подзадач для продавцов, позволяя им «избавиться от рутины» в повседневной работе.
По словам Тавара, использование меньших дистиллированных моделей может быть быстрее и дешевле по сравнению с более универсальными аналогами. В некоторых случаях они оказываются в 2 раза дешевле и быстрее, а в более крайних — в 30 раз дешевле и быстрее, утверждает он.
Но «дело не только в стоимости и задержках, которые имеют огромное значение; дело в точности», — подчеркивает Тавар.
Инженеры передают в UDP свою модель-учитель, обучающие данные, данные для оценки (evals) и целевую модель — скажем, Opus 4.8, дистиллируемую до Qwen 3.5. Пайплайн работает около суток, после чего выдает отчет об оценке, показывающий, каких показателей скорости, стоимости и точности доработанная модель фактически достигла для данной подзадачи. Если баланс характеристик выглядит благоприятным, инженер развертывает модель — процесс согласования не требуется. Внутренняя платформа Shopify Tangle позволяет любому сотруднику визуализировать работу пайплайна в реальном времени.
Тавар говорит, что его «мечта» — в конечном итоге вообще перестать указывать целевую модель для пайплайна дистилляции. Вместо этого пользователи могли бы просто предоставлять модели-учителю данные, критерии оценки и инструкцию: «Основываясь на накопленном опыте, проанализируй различные классы моделей, разные размеры и типы, и подскажи мне, какая цель дистилляции будет оптимальной».
«Возможно, нас ждет сюрприз. Может оказаться, что это настолько маленькая модель, которая сможет работать даже на смартфоне», — говорит Тавар. «А в других случаях она, возможно, ответит: «Способа дистиллировать это до состояния лучше того, что мы имеем на переднем крае технологий, не существует»».
Переход от «ИИ-рефлексии» к «ИИ-рычагам влияния»
Пользователи Shopify могут применять любые удобные им инструменты: Claude Code, Codex, Cursor, GitHub Copilot для VS Code. «Мы знакомим всех с различными средами разработки, чтобы они могли почувствовать, что именно работает или не работает в их рабочем процессе».
Тем не менее компания также внедрила информационную панель использования (dashboard); это позволяет команде Тавара задавать интересные вопросы не только о затратах на токены, но и о том: кто тратит самые дорогие токены? кто тратит больше времени на логические рассуждения? какие типы моделей используются, в каких отделах и на каких уровнях?
Что касается проблемы «токенмаксинга», в Shopify действительно предусмотрены «предохранители» (circuit breakers). Если модель пользователя работает в течение долгого времени (например, 10 часов) и потребляет много токенов, ему придет уведомление: «Вы действительно планировали потратить столько?»
Как объясняет Тавар, иногда ответом служит: «О, абсолютно». В других случаях реакция иная: «Ого, я и не знал, что это работает в фоновом режиме. Я совсем об этом забыл. Лучше я остановлю это прямо сейчас».
Конечная цель, по словам Тавара, заключается в том, чтобы перейти от «ИИ-рефлексии» к «использованию ИИ как рычага влияния» (AI leverage) и заставить людей всерьез задуматься о том, где именно они могут извлечь наибольшую пользу от искусственного интеллекта в своих рабочих процессах.
Послушайте подкаст целиком, чтобы узнать больше о следующих темах:
-
Философия Shopify, согласно которой инфраструктура строится раньше функций. Как выразился Тавар: «Мы всегда строили больше инфраструктуры. Мы и дальше всегда будем строить больше инфраструктуры».
-
Как внутренний ИИ-агент Shopify по имени Ривер создает «информационную подложку» по всей компании.
-
Как агент OpenClaw Тавара догадался по его календарю, что он собирается в поездку — и что этот момент говорит о реальном направлении развития агентов.
Вы также можете слушать и подписываться на подкаст Beyond the Pilot на платформах Spotify, Apple или в любом другом месте, где вы слушаете подкасты.



