Искусственный интеллект сталкивается с динамическим ценообразованием и сдвигом в сторону эффективности
Главный инфоповод в сфере ИИ сегодня — это не размер моделей и не мультимодальность, а дефицит вычислительных мощностей. На недавнем мероприятии VentureBeat AI Impact в Нью-Йорке Вэл Беркович, директор по искусственному интеллекту в компании WEKA, встретился с генеральным директором VentureBeat Мэттом Маршаллом, чтобы обсудить, что на самом деле нужно для масштабирования ИИ в условиях растущих задержек, привязки к облачным провайдерам и стремительно растущих затрат.
Эти факторы, по мнению Берковича, подталкивают ИИ к собственной версии динамического ценообразования. В свое время компания Uber прославилась тем, что впервые внедрила динамические тарифы, привязав стоимость поездок к текущей рыночной ситуации в реальном времени. Теперь, как утверждает Беркович, ИИ движется к аналогичному экономическому переломному моменту — особенно в сфере инференса, когда на первый план выйдет рентабельность.
«Сегодня у нас нет реальных рыночных цен. У нас есть субсидированные тарифы. Это было необходимо для стимулирования множества инноваций, которые происходят в отрасли, но рано или поздно — учитывая триллионы долларов капитальных затрат, о которых мы сейчас говорим, и ограниченные операционные расходы на электроэнергию — появятся реальные рыночные цены; возможно, в следующем году, но уж точно к 2027 году», — отметил он. «Когда это произойдет, это кардинально изменит индустрию и заставит еще более пристально и глубоко сосредоточиться на эффективности».
Экономика взрыва токенов
«Первое правило заключается в том, что в этой индустрии действует принцип «больше значит лучше». Больше токенов означает экспоненциально большую ценность для бизнеса», — заявил Беркович.
Но пока никто не придумал, как сделать это устойчивым. Классическая бизнес-триада — стоимость, качество и скорость — в сфере ИИ трансформируется в задержку (латентность), стоимость и точность (особенно в выходных токенах). И точность не подлежит обсуждению. Это справедливо не только для взаимодействия потребителей с такими агентами, как ChatGPT, но и для критически важных сценариев использования, таких как поиск лекарств и бизнес-процессы в жестко регулируемых отраслях, например в финансовых услугах и здравоохранении.
«Здесь не может быть компромиссов», — сказал Беркович. «Вам необходимо обрабатывать огромный объем токенов для обеспечения высокой точности инференса, особенно когда вы добавляете в уравнение безопасность, модели-ограничители (guardrails) и модели оценки качества. В таком случае приходится лавировать между задержкой и стоимостью. Именно здесь появляется некоторая гибкость. Если вы можете смириться с высокой задержкой — а в потребительском секторе это иногда допустимо, — вы можете снизить затраты за счет бесплатных тарифов или недорогих тарифов с надбавкой к себестоимости».
Тем не менее, задержка является критическим узким местом для ИИ-агентов. «Эти агенты больше не действуют поодиночке. Вы либо имеете дело со стаей агентов (агентным роем), либо агентская активность отсутствует вовсе», — отметил Беркович.
В таком рое группы агентов работают параллельно для достижения более крупной цели. Агент-оркестратор — наиболее умная модель — находится в центре, определяя подзадачи и ключевые требования: выбор архитектуры, выполнение в облаке или локально (on-prem), ограничения по производительности и соображения безопасности. Затем рой выполняет все подзадачи, фактически запуская множество параллельных сессий для одновременных пользователей инференса. Наконец, модели-оценщики судят о том, была ли общая задача успешно выполнена.
«Эти рои проходят через так называемые многошаговые циклы — сотни, если не тысячи промптов и ответов, пока рой не придет к единому ответу», — рассказал Беркович.
«И если у вас возникает совокупная задержка на протяжении этой тысячи шагов, процесс становится нежизнеспособным. Так что задержка имеет поистине колоссальное значение. А это обычно означает необходимость платить высокую цену сегодня, пока она субсидируется, и именно от этого придется избавляться со временем».
Обучение с подкреплением как новая парадигма
Примерно до мая текущего года агенты не обладали столь высокой производительностью, пояснил Беркович. Затем контекстные окна стали достаточно большими, а графические процессоры — достаточно доступными, чтобы поддерживать агентов, способных решать сложные задачи, такие как написание надежного программного кода. По текущим оценкам, в некоторых случаях до 90% софта генерируется агентами-программистами. Теперь, когда агенты фактически достигли зрелости, отметил Беркович, обучение с подкреплением стало главной темой для обсуждения среди дата-саентистов в ведущих лабораториях, таких как OpenAI, Anthropic и Gemini, которые рассматривают его как критически важный путь развития инноваций в сфере ИИ.
«Текущий этап развития ИИ — это обучение с подкреплением. Оно объединяет множество элементов обучения и инференса в единый рабочий процесс», — сказал Беркович. «Это величайший и новейший закон масштабирования на пути к нашему мифическому рубежу, к которому мы все пытаемся дойти, — AGI (сильному искусственному интеллекту)», — добавил он. «Что меня восхищает, так это то, что вам необходимо применять все лучшие практики обучения моделей в сочетании с лучшими практиками их инференса, чтобы иметь возможность повторять эти тысячи циклов обучения с подкреплением и двигать вперед всю отрасль».
Путь к рентабельности ИИ
Единого ответа на вопрос о том, как построить инфраструктурный фундамент для обеспечения прибыльности ИИ, не существует, поскольку эта область все еще находится на стадии формирования, считает Беркович. Здесь нет универсальных шаблонов. Полный переход на собственную локальную инфраструктуру (on-prem) может быть правильным выбором для некоторых компаний — особенно создателей базовых моделей, — в то время как облачная или гибридная среда может оказаться лучшим решением для организаций, стремящихся к гибким и быстрым инновациям. Независимо от выбранного изначально пути, организациям придется адаптировать свою стратегию ИИ-инфраструктуры по мере изменения бизнес-потребностей.
«В основе всего лежат удельная экономика и юнит-экономика», — заявил Беркович. «Мы определенно находимся в состоянии бума, или даже пузыря, если можно так выразиться, поскольку базовая экономика ИИ субсидируется. Но это не значит, что если токены подорожают, вы перестанете ими пользоваться. Вы просто станете гораздо более детально подходить к тому, как именно вы их расходуете».
Лидерам бизнеса следует уделять меньше внимания ценообразованию отдельных токенов и больше — экономике на уровне транзакций, где становятся очевидными эффективность и реальная отдача, заключает Беркович.
Главный вопрос, который должны задавать себе предприятия и ИИ-компании, по словам Берковича, звучит так: «Какова реальная стоимость для моей юнит-экономики?»
С этой точки зрения путь вперед заключается не в том, чтобы делать меньше с помощью ИИ, а в том, чтобы делать это умнее и эффективнее в масштабах всей компании.



