Внедрение ИИ переключается с экономии на скорость
Во многих отраслях рост расходов на вычисления часто называют барьером для внедрения ИИ, однако ведущие компании обнаруживают, что стоимость больше не является главным ограничением.
Более серьезные проблемы (о которых в первую очередь думают многие технологические лидеры) — это задержки, гибкость и пропускная способность (мощности).
Например, в компании Wonder ИИ добавляет всего несколько центов к стоимости каждого заказа; компанию по доставке еды и готовых блюд гораздо больше беспокоят облачные мощности на фоне стремительно растущего спроса. Recursion сосредоточилась на балансировке мелкомасштабного и крупномасштабного обучения и развертывания с помощью локальных кластеров (on-premises) и облака; это обеспечило биотехнологической компании гибкость для быстрых экспериментов.
Реальный опыт этих компаний подчеркивает более широкую тенденцию в отрасли: для предприятий, использующих ИИ в больших масштабах, экономика не является решающим фактором — дискуссия сместилась с того, как платить за ИИ, на то, как быстро его можно развернуть и поддерживать.
Лидеры в области ИИ из обеих компаний недавно встретились с генеральным директором и главным редактором VentureBeat Мэттом Маршаллом в рамках выездной серии мероприятий VB AI Impact Series. Вот чем они поделились.
Wonder: пересмотрите свои представления о мощностях
Wonder использует ИИ для всего: от рекомендаций до логистики, — однако, как сообщил технический директор Джеймс Чен, в настоящее время ИИ добавляет всего пару центов к заказу.
Чен пояснил, что технологическая составляющая заказа еды обходится в 14 центов, а ИИ добавляет еще 2–3 цента, хотя этот показатель «очень быстро растет» до 5–8 центов. Тем не менее, это кажется практически несущественным по сравнению с общими операционными расходами.
Вместо этого главную заботу 100% облачной ИИ-компании составляли мощности на фоне растущего спроса. Компания Wonder создавалась с «предположением» (которое оказалось неверным), что будет «неограниченная емкость», поэтому они смогут двигаться «супербыстро» и им не придется беспокоиться об управлении инфраструктурой, отметил Чен.
Но за последние несколько лет компания довольно сильно выросла, рассказал он; в результате около шести месяцев назад «мы начали получать сигналы от облачных провайдеров: «Эй, возможно, вам стоит подумать о переходе во второй регион»», поскольку по мере роста спроса у них заканчивались мощности для процессоров или хранения данных на объектах.
Это было «очень шокирующим», так как переходить к плану Б пришлось раньше, чем они ожидали. «Очевидно, что мультирегиональность — это хорошая практика, но мы думали, что это произойдет года через два», — сказал Чен.
Что пока еще экономически нецелесообразно
Wonder создала собственную модель для максимизации коэффициента конверсии, отметил Чен; цель состоит в том, чтобы как можно чаще показывать новые рестораны релевантным клиентам. Это «изолированные сценарии», в которых модели со временем обучаются быть «очень-очень эффективными и быстрыми».
В настоящее время лучшим выбором для кейсов Wonder являются большие модели, отметил Чен. Но в долгосрочной перспективе они хотели бы перейти на небольшие модели, гиперкастомизированные под каждого конкретного человека (с помощью ИИ-агентов или консьержей) на основе истории его покупок и даже истории кликов. «Использование таких микромоделей определенно является лучшим вариантом, но прямо сейчас это очень дорого», — отметил Чен. «Если вы попытаетесь создать такую модель для каждого человека, это просто экономически нецелесообразно».
Составление бюджета — это искусство, а не наука
Wonder предоставляет своим разработчикам и специалистам по работе с данными максимум свободы для экспериментов, а внутренние команды проверяют затраты на использование, чтобы убедиться, что никто не запустил модель и «не накрутил огромные вычислительные мощности на баснословный счет», сказал Чен.
Компания пробует разные способы переложить задачи на ИИ и оставаться в рамках маржинальности. «Но тогда бюджетирование дается с большим трудом, потому что вы понятия не имеете», — сказал он. Одной из сложных задач является темпы разработки; когда появляется новая модель, «мы же не можем просто сидеть сложа руки, верно? Мы должны ее использовать».
Составление бюджета для непредсказуемой экономики токен-систем — это «безусловно, искусство, а не точная наука».
Важным компонентом жизненного цикла разработки программного обеспечения является сохранение контекста при использовании больших нативных моделей, пояснил он. Когда вы находите то, что работает, вы можете добавить это в «корпус контекста» вашей компании, который можно отправлять с каждым запросом. Это большой объем данных, и он стоит денег каждый раз.
«Более 50% и вплоть до 80% ваших затрат уходит просто на повторную отправку той же информации обратно в тот же движок при каждом запросе», — сказал Чен.
Теоретически, чем больше они делают, тем меньшими должны быть затраты на единицу продукции. «Я знаю, что когда происходит транзакция, я буду платить налог в X центов за каждую из них, но я не хочу быть ограничен в использовании этой технологии для всех остальных творческих идей».
«Момент триумфа» для Recursion
Со своей стороны, компания Recursion сосредоточилась на удовлетворении широкого спектра вычислительных потребностей с помощью гибридной инфраструктуры, состоящей из локальных кластеров и облачного инференса.
Когда компания только начинала создавать свою ИИ-инфраструктуру, ей пришлось использовать собственную установку, поскольку «у облачных провайдеров было не так много хороших предложений», пояснил технический директор Бен Маби (Ben Mabey). «Моментом триумфа стало то, что нам потребовалось больше вычислительной мощности, мы обратились к облачным провайдерам, а они ответили: «Может быть, через год или около того»».
Первый кластер компании в 2017 году включал игровые графические процессоры Nvidia (1080, выпущенные в 2016 году); с тех пор они добавили Nvidia H100 и A100 и используют кластер Kubernetes, который запускают в облаке или локально.
Говоря о вопросе долговечности, Маби отметил: «Эти игровые видеокарты на самом деле используются до сих пор, что безумно, верно? Миф о том, что срок службы графического процессора составляет всего три года, определенно не соответствует действительности. A100 по-прежнему возглавляют список, они являются рабочей лошадкой отрасли».
Лучшие сценарии использования: локальная инфраструктура против облака и разница в стоимости
Совсем недавно команда Маби начала обучать базовую модель на репозитории изображений Recursion (который состоит из петабайт данных и более чем 200 миллионов изображений). Это и другие крупные задачи обучения потребовали создания «массивного кластера» и связанных многоузловых систем.
«Когда нам нужна эта полная связность сети и доступ к большому объему наших данных в высокопараллельной файловой системе, мы используем локальные решения (on-prem)», — пояснил он. С другой стороны, более короткие рабочие нагрузки выполняются в облаке.
Метод Recursion заключается в «вытеснении» (pre-emption) графических процессоров и тензорных процессоров (TPU) Google, то есть в прерывании выполняющихся задач GPU для работы с более приоритетными. «Поскольку нас не волнует скорость при некоторых из этих рабочих нагрузок инференса, когда мы загружаем биологические данные — будь то изображение, данные секвенирования или данные ДНК», — пояснил Маби, — «мы можем сказать: «Дайте нам результат через час», и нас устроит, если это прервет текущую задачу».
С точки зрения затрат, перенос крупных рабочих нагрузок на локальные серверы обходится «консервативно» в 10 раз дешевле, отметил Маби; в расчете на общую совокупную стоимость владения (TCO) за пять лет это вдвое дешевле. С другой стороны, для небольших потребностей в хранении данных облако может быть «весьма конкурентоспособным» по цене.
В конечном счете Маби призвал лидеров технологий сделать шаг назад и определить, действительно ли они готовы инвестировать в ИИ; рентабельные решения обычно требуют многолетних обязательств.
«С психологической точки зрения я видел наших коллег, которые не хотят инвестировать в вычисления, и в результате они всегда платят по требованию, — сказал Маби. — Их команды используют гораздо меньше вычислительных мощностей, потому что они не хотят увеличивать счета за облачные услуги. Инновации действительно тормозятся из-за того, что люди не хотят тратить деньги».



