Инструменты ИИ усложняют дата-инжиниринг
Инженеры по работе с данными должны работать быстрее, чем когда-либо. Инструменты на базе искусственного интеллекта обещают автоматизировать оптимизацию конвейеров, ускорить интеграцию данных и взять на себя рутинную работу, которая определяла эту профессию на протяжении десятилетий.
Тем не менее, согласно новому опросу 400 руководителей высшего звена в сфере технологий, проведенному MIT Technology Review Insights в партнерстве с Snowflake, 77% респондентов утверждают, что рабочая нагрузка их команд дата-инженеров становится только тяжелее, а не легче.
В чем же причина?
В то время как 83% организаций уже внедрили инструменты дата-инженерии на базе ИИ, 45% называют сложность интеграции главной проблемой. Еще 38% борются с разрастанием и фрагментацией используемого инструментария.
«Многие инженеры по данным используют один инструмент для сбора данных, другой — для их обработки, а третий — для аналитики, — рассказал VentureBeat Крис Чайлд (Chris Child), вице-президент по продуктам для дата-инженерии в Snowflake. — Использование нескольких инструментов на протяжении жизненного цикла данных создает сложность, риски и увеличивает нагрузку на управление инфраструктурой, которую дата-инженеры просто не могут себе позволить».
Результатом становится парадокс производительности. Инструменты ИИ ускоряют выполнение отдельных задач, но распространение несвязанных между собой решений делает всю систему в целом более сложной в управлении. Для предприятий, спешащих внедрить ИИ в масштабах всей компании, эта фрагментация представляет собой критическое «узкое место».
От SQL-запросов к конвейерам на базе больших языковых моделей (LLM): ежедневное изменение рабочего процесса
Опрос показал, что два года назад инженеры по данным тратили в среднем 19% своего времени на проекты, связанные с ИИ. Сегодня этот показатель вырос до 37%. Респонденты ожидают, что в течение двух років он достигнет 61%.
Но как это изменение выглядит на практике?
Чайлд привел конкретный пример. Раньше, если финансовому директору компании требовалось составить прогноз, он обращался к команде дата-инженеров за помощью в создании системы, которая связывала бы неструктурированные данные (например, договоры с поставщиками) со структурированными данными (например, показатели выручки) в виде статической панели мониторинга. Соединение этих двух миров с разными типами данных было чрезвычайно трудоемким и дорогостоящим процессом, требующим от юристов вручную просматривать каждый документ в поисках ключевых условий контракта и загружать эту информацию в базу данных.
Сегодня этот же рабочий процесс выглядит совершенно иначе.
«Инженеры по данным могут использовать такой инструмент, как Snowflake Openflow, чтобы легко объединить неструктурированные PDF-контракты, хранящиеся в таких источниках, как Box, со структурированными финансовыми показателями на единой платформе вроде Snowflake, сделав данные доступными для LLM», — пояснил Чайлд. — То, на что раньше уходили часы ручной работы, теперь происходит практически мгновенно».
Дело не только в скорости. Речь идет о самой природе выполняемой работы.
Два года назад типичный рабочий день дата-инженера состоял из настройки кластеров, написания SQL-трансформаций и подготовки данных для аналитиков-людей. Сегодня тот же инженер с гораздо большей вероятностью занимается отладкой конвейеров трансформации на базе LLM и настройкой правил управления для рабочих процессов с моделями ИИ.
«Ключевой навык дата-инженеров заключается не только в программировании, — отметил Чайлд. — Это оркестровка фундамента данных и обеспечение надежности, контекста и управления, чтобы результаты работы ИИ были достоверными».
Проблема стека инструментов: когда помощь становится помехой
Именно здесь предприятия заходят в тупик.
Обещания инструментов для работы с данными на базе ИИ звучат заманчиво: автоматизировать оптимизацию конвейеров, ускорить отладку, упростить интеграцию. Но на практике многие организации обнаруживают, что каждый новый добавленный ими инструмент ИИ создает собственные проблемы с интеграцией.
Данные опроса подтверждают это. Хотя ИИ привел к росту количественных (74% отмечают увеличение) и качественных (77% сообщают об улучшениях) показателей работы, эти достижения нивелируются операционными затратами на управление разрозненными инструментами.
«Другая проблема, которую мы наблюдаем, заключается в том, что инструменты ИИ часто позволяют легко создать прототип, объединив несколько источников данных с помощью готовой LLM «из коробки», — сказал Чайлд. — Но когда вы хотите запустить его в производство, вы понимаете, что данные недоступны, а необходимые требования к управлению отсутствуют, из-за чего внедрить инструмент для пользователей становится сложной задачей».
Техническим лидерам, оценивающим свой стек дата-инженерии в данный момент, Чайлд предложил четкую структуру.
«Командам следует отдавать приоритет инструментам ИИ, которые повышают производительность и одновременно устраняют инфраструктурную и операционную сложность, — заявил он. — Это позволяет инженерам переключить внимание с управления “связующей” работой в области дата-инженерии на достижение бизнес-результатов».
Период внедрения агентного ИИ: 12 месяцев на то, чтобы сделать всё правильно
Опрос показал, что 54% организаций планируют внедрить агентный ИИ в течение следующих 12 месяцев. Под агентным ИИ понимаются автономные агенты, способные принимать решения и совершать действия без вмешательства человека. Еще 20% уже начали это делать.
Для команд дата-инженерии агентный ИИ представляет собой как огромную возможность, так и серьезный риск. При правильном подходе автономные агенты могут справляться с рутинными задачами, такими как обнаружение дрейфа схемы данных или отладка ошибок трансформации. При неправильном — они могут повредить наборы данных или раскрыть конфиденциальную информацию.
«Инженеры по данным должны уделять первостепенное внимание оптимизации и мониторингу конвейеров, чтобы успешно развернуть агентный ИИ в масштабе компании, — считает Чайлд. — Это низкорисковая и высокодоходная отправная точка, которая позволяет агентному ИИ безопасно автоматизировать рутинные задачи, такие как обнаружение дрейфа схемы или отладка ошибок трансформации при условии правильной настройки».
Однако Чайлд особо подчеркнул необходимость предварительного внедрения защитных механизмов.
«Прежде чем организации допустят агентов к производственным данным, должны быть реализованы два условия: надежное управление и отслеживание происхождения данных, а также активный контроль со стороны человека, — сказал он. — Агенты должны наследовать детализированные права доступа и действовать в рамках установленной структуры управления».
Риски пропуска этих этапов реальны. «Без надлежащего отслеживания происхождения (lineage) или управления доступом агент может непреднамеренно повредить наборы данных или раскрыть конфиденциальную информацию», — предупредил Чайлд.
Разрыв в восприятии, который мешает предприятиям преуспеть в сфере ИИ
Пожалуй, самым поразительным выводом исследования является отсутствие единого мнения на уровне высшего руководства.
В то время как 80% директоров по работе с данными (CDO) и 82% директоров по искусственному интеллекту (CAIO) считают инженеров по данным неотъемлемой частью успеха бизнеса, лишь 55% ИТ-директоров (CIO) разделяют эту точку зрения.
«Это показывает, что лидеры, ориентированные на данные, видят стратегическую ценность дата-инженерии, но нам нужно проделать дополнительную работу, чтобы помочь остальным топ-менеджерам осознать: инвестиции в единый, масштабируемый фундамент данных и людей, помогающих его развивать, — это инвестиции в успех ИИ, а не просто в ИТ-операции», — подчеркнул Чайлд.
Этот разрыв в восприятии имеет вполне реальные последствия.
Инженеры по данным в организациях, участвовавших в опросе, уже играют влиятельную роль в принятии решений о целесообразности использования сценариев применения ИИ (53% респондентов) и использовании моделей ИИ бизнес-подразделениями (56%). Но если ИТ-директора не признают дата-инженеров стратегическими партнерами, они вряд ли предоставят этим командам ресурсы, полномочия или право голоса, необходимые для предотвращения разрастания инструментов и проблем с интеграцией, выявленных в ходе опроса.
Этот разрыв, по-видимому, коррелирует с видимостью результатов работы. Директора по данным и директора по искусственному интеллекту ежедневно работают напрямую с командами дата-инженеров и понимают всю сложность того, чем они управляют. ИТ-директора, сосредоточенные главным образом на инфраструктуре и операциях, могут не замечать стратегическую архитектурную работу, которую дата-инженеры выполняют все в большем объеме.
Этот разрыв также проявляется в том, как различные руководители оценивают проблемы, стоящие перед командами дата-инженеров. Директора по ИИ значительно чаще, чем ИТ-директора, согласны с тем, что рабочая нагрузка инженеров по данным становится все более тяжелой (93% против 75%). Они также с большей вероятностью признают влияние дата-инженеров на общую стратегию развития ИИ.
Чему дата-инженерам нужно научиться прямо сейчас
В ходе опроса были выделены три критически важных навыка, которые необходимо развивать инженерам по данным: экспертные знания в области ИИ, деловая хватка (business acumen) и коммуникативные способности.
Для компании с командой дата-инженеров из 20 человек это создает практическую проблему. Кого нанимать — специалистов с такими навыками, обучать существующих инженеров или провести реструктуризацию команды? Ответ Чайлда сводится к тому, что приоритетом должно стать понимание бизнеса.
«Самый важный навык прямо сейчас заключается в том, чтобы инженеры по данным понимали, что критически важно для конечных бизнес-пользователей, и расставляли приоритеты в том, как сделать ответы на эти вопросы проще и быстрее», — отметил он.
Урок для предприятий: бизнес-контекст важнее получения технических сертификатов. Чайлд подчеркнул, что понимание того, ради какой бизнес-цели дата-инженеры выполняют те или иные задачи, позволит им лучше предвосхищать потребности клиентов и приносить пользу бизнесу гораздо быстрее.
«Организации, команды дата-инженеров которых ставят во главу угла такое понимание бизнеса, выделятся на фоне конкурентов».
Для предприятий, стремящихся занять лидирующие позиции в сфере ИИ, решением кризиса производительности дата-инженерии являются не новые инструменты ИИ. Компании, которые будут двигаться быстрее остальных, прямо сейчас занимаются консолидацией своих стеков инструментов, развертыванием инфраструктуры управления до того, как агенты попадут в производство, и переводом дата-инженеров из вспомогательного персонала в статус стратегических архитекторов.
Окно возможностей узко. Учитывая, что 54% компаний планируют развертывание агентного ИИ в течение 12 месяцев, а инженеры по данным, как ожидается, будут тратить 61% своего времени на проекты в области ИИ уже через два года, команды, которые не устранили проблему разрозненности инструментов и пробелы в управлении, обнаружат, что их инициативы в сфере ИИ застряли в режиме вечного пилотного проекта.



