Проблемы и решения в сфере инфраструктуры ИИ
Вычислительные мощности, энергетика и сетевые ресурсы, некогда считавшиеся дешевыми базовыми товарами, теперь стали критическими узкими местами в процессах разработки и внедрения искусственного интеллекта.
Хотя задержка (латентность) и высокая пропускная способность имеют первостепенное значение, они ограничены: сложность систем высока, а вычисления обходятся чрезвычайно дорого. По мере масштабирования ИИ-рабочих нагрузок предприятия сталкиваются с резким, неустойчивым ростом использования токенов, и счета за инфраструктуру пока не демонстрируют тенденции к снижению.
Чтобы сбалансировать эту ситуацию, эксперты советуют компаниям проектировать открытые, наблюдаемые, адаптируемые и обратимые системы; находить баланс между производительностью и стоимостью; контекстуализировать ИИ; а также оптимизировать то, что имеет наибольшее значение для их бизнеса.
«Требования этих рабочих нагрузок меняют абсолютно всё», — заявила Чен Голдберг (Chen Goldberg), старший вице-президент по инжинирингу облачного GPU-провайдера CoreWeave, на недавнем мероприятии VB Impact Tour.
Создание открытых, наблюдаемых и обратимых систем
Одна из крупнейших системных ошибок, совершаемых предприятиями: «Идея о том, что можно просто внедрить ИИ-систему в уже существующую инфраструктуру», — отметила Голдберг.
Особенно в случае с обучением с подкреплением и рабочими нагрузками генеративного ИИ весь пайплайн должен измениться; требования к пропускной способности диктуют необходимость иного типа сети, способной успевать за столь стремительно развивающейся сферой.
Инференс (вывод), например, становится всё более сложным и нюансированным. Как отметила Голдберг, некоторые задачи вывода более чувствительны к задержкам, другие — к доступности или надежности; для остальных же эти показатели имеют меньшее значение. Кроме того, сам процесс стал гораздо более итеративным и многоэтапным, чем в прошлом.
«Вы берете модели, проводите предварительное обучение, тонкую настройку, затем запускаете их и получаете результаты, — отметила она. — То есть это цикл: обучение-инференс, обучение-инференс, обучение-инференс».
Как сторонница открытого исходного кода (она входила в команду основателей Kubernetes), Голдберг подчеркнула важность поддержания систем открытыми, наблюдаемыми и обратимыми. Системы по принципу «белого ящика», в противовес «черным ящикам», способны обеспечить расширяемость и гибкость, а также стимулировать инновации, поскольку здесь нет «решений с дверью в одну сторону».
Осмысленные риски важны, отметила она, но если лидеры предприятий ничего не знают о системе, на которой работают, они лишены возможности внедрять инновации, принимать решения или идти на риск. Компаниям необходимо учитывать стоимость изменений и то, смогут ли они принимать больше «решений с дверью в две стороны», которые легко обратить вспять и заменить.
«Ситуация меняется настолько быстро, что люди боятся принимать решения: к какому вендору обратиться? Какие инструменты использовать? Какое решение для хранения данных выбрать? — сказала она. — Люди переживают, потому что это крупные инвестиции».
Оптимизация критически важных вещей: всего получить не удастся
Принимая архитектурные решения, важно помнить, что «все графические процессоры созданы разными», отметила Голдберг. Между различными платформами существует множество нюансов, и предприятиям следует делать выбор на основе того, как они получают доступ к GPU, насколько этот доступ прост, какова наблюдаемость архитектуры, а также с учетом задержек и потерь производительности. Кроме того, важно учитывать, сколько времени система реально тратит на выполнение ИИ-задач.
«Здесь масса компромиссов, множество решений, которые нам приходится принимать ежедневно», — сказала Голдберг. В конечном итоге компании должны проводить оптимизацию вокруг того, что наиболее важно для их бизнеса, «поскольку получить абсолютно всё невозможно».
Один из важных вопросов: что именно вы оптимизируете? Не менее критично и другое: каков худший сценарий развития событий при принятии стратегического решения?
Доступ к электроэнергии сам по себе является еще одним ограничением, однако Голдберг указала, что сейчас появляется множество новых технологий. Со своей стороны, компания CoreWeave недавно внедрила методы жидкостного охлаждения. Энергетика — «одна из самых увлекательных сфер в отрасли прямо сейчас, — сказала она. — Здесь происходит колоссальное количество инноваций».
В конечном счете Голдберг призвала руководителей предприятий смириться с дискомфортом и бросить вызов статусу-кво. «Думаю, иногда мы сами сдерживаем себя, прокручивая в голове все эти сценарии худшего набора событий», — отметила она. Вместо этого нужно: «Набраться смелости и двигаться вперед».
Как в Wells Fargo подходят к определению успеха
Успех заключается уже не в том, чтобы доказывать работоспособность ИИ — он уже доказал свою мощь, — а в том, чтобы правильно его контекстуализировать, отметил Сваруп Погалур (Swarup Pogalur), управляющий директор и технический директор по цифровому и ИИ-инжинирингу в Wells Fargo, в беседе с генеральным директором и главным редактором Venturebeat Мэттом Маршаллом (Matt Marshall).
«Так что речь идет скорее о доказательстве ценности (proof of value), а не о доказательстве концепции (proof of concept)», — пояснил он.
Wells Fargo уже добилась первых успехов в сфере розничного банкинга и контакт-центров, предоставив сотрудникам ИИ-ассистентов, которые помогают повысить производительность и уделять больше качественного времени клиентам.
«Если раньше сотрудник говорил: «Подождите, дайте я это посмотрю», и переключался между вкладками, — сказал он. — Теперь мы стараемся сократить количество систем, в которых приходится вручную искать разрозненную информацию».
Раньше у них была простая система на базе генерации с дополненным извлечением (RAG), которая индексировала и векторизовала контент из множества различных источников, после чего операторам-людям приходилось вручную просеивать эту информацию и объяснять клиенту дальнейшие шаги. Теперь же Wells Fargo перешла на «полноценный инструмент самообслуживания», который пошагово проводит операторов и клиентов через транзакции с помощью «сообщений в режиме реального времени», пояснил Погалур.
«Когда мы говорим о концепции «человек в контуре» (human-in-the-loop), речь идет не просто о снижении рисков, а о расширении возможностей квалифицированного специалиста, — сказал он. — Они принимают осознанные решения».
Полиоблачная стратегия
Предприятиям важно сохранять гибкость своих архитектур; именно поэтому в Wells Fargo создали полиоблачные (poly-cloud) и полимодельные фреймворки со средствами защиты (guardrails).
Wells Fargo имеет стратегическое партнерство как с GCP, так и с Microsoft Azure, и проводит модернизацию своих приложений, распределяя нагрузку на различную инфраструктуру в зависимости от объемов трафика. Чтобы сделать эту полиоблачную инфраструктуру еще более надежной, в нее добавили графические процессоры (GPU).
«Это не какой-то один единственный фреймворк, с помощью которого мы создаем агентов, — отметил Погалур. — Мы хотим предоставить целый спектр различных платформ». Это могут быть LangGraph, Semantic Kernel или любые модальности, изначально доступные у облачных провайдеров.
В последние годы в рамках подготовки к внедрению ИИ этот финансовый гигант провел «масштабную перестройку» своих дата-центров — это не просто перенос существующих систем (lift and shift), а модернизация, которая делает их проще, эффективнее и позволяет работать с меньшими затратами ресурсов. «Наши затраты на запуск сегодня и затраты на запуск в будущем будут выглядеть совершенно иначе, — сказал он. — Это путь длиной от 5 до 10 лет, а не окупаемость инвестиций за один год».
Еще один важный нюанс — необходимость успевать за стремительным выходом новых моделей. В отличие от версий API, где обычно поддерживается обратная совместимость в течение 6–12 месяцев, разработчики моделей «не столь терпеливы» и выводят старые версии из эксплуатации гораздо быстрее.
«Так как же мне защитить свои инвестиции и обеспечить непрерывность бизнеса приложений, которые их используют?»
Атмосфера экспериментов
Wells Fargo поддерживает «инновации в масштабе», но тщательно отбирает идеи, способные принести наибольшую ценность. Как отметил Погалур: «Не каждая идея обладает потенциалом стать новой идеей на миллиард долларов, и не все идеи хороши».
Этот процесс поддерживается с помощью «модели со-участия» на основе открытого исходного кода, когда небольшим группам внутренних пользователей предоставляются инструменты, а от них собираются отзывы по принципу «палец вверх, палец вниз». В компании также есть лаборатория с «полностью изолированной инфраструктурой», где исследователи могут экспериментировать с генераторами синтетических данных, имитирующими интерфейсы приложений Wells Fargo.
«Таким образом, они могут протестировать это, доказать работоспособность и сказать: «Эй, это работает», — пояснил Погалур. — А затем мы находим способ интегрировать это в нашу экосистему. Это просто дает вам силу масштаба и позволяет людям сосредоточиться на создании приложений, вместо того чтобы каждый раз изучать новый фреймворк, который появляется без должной последовательности».
Wells Fargo также приняла API OpenAI в качестве стандарта для обеспечения единообразия. Это делает переквалификацию агентов и переписывание платформ «гораздо более быстрым и дешевым процессом для нас».
Непрерывная оценка на всех этих этапах имеет критическое значение; команды должны тестировать системы на предвзятость и галлюцинации, а также анализировать риски безопасности и средства контроля для предотвращения утечек и атак с внедрением промптов (prompt injection). Погалур отметил, что, несмотря на всю важность для разработки ИИ, открытые фреймворки могут привносить уязвимый код в публичное пространство.
Финансовому сектору, в частности, приходится выполнять дополнительные проверки и балансировки, и каждое бизнес-подразделение должно понимать риски ИИ и внедрять средства их минимизации.
В конечном счете Wells Fargo придерживается взвешенного, прагматичного подхода. «Попытка заполучить всё самое новое и передовое в первый же день после анонса не докажет ценность, — сказал Погалур. — Мы стремимся к стабильному режиму внедрения, масштабирования и работы в продакшене».



