Революция в корпоративной инженерии данных: как Python-платформа с открытым исходным кодом от dltHub преобразует создание конвейеров данных для агентного ИИ
В сфере инженерии корпоративных данных происходит тихая революция. Python-разработчики создают производственные конвейеры данных за считанные минуты, используя инструменты, для которых еще несколько месяцев назад потребовались бы целые специализированные команды.
Катализатором выступает dlt — библиотека Python с открытым исходным кодом, которая автоматизирует сложные задачи по инженерии данных. Количество ее ежемесячных загрузок достигло 3 миллионов, и она обеспечивает рабочие процессы с данными для более чем 5 000 компаний в регулируемых отраслях, включая финансы, здравоохранение и производство. Эта технология получает еще одно весомое подтверждение: берлинская компания dltHub, стоящая за библиотекой с открытым исходным кодом dlt, привлекает 8 миллионов долларов в рамках посевного раунда финансирования под руководством Bessemer Venture Partners.
Значимость этого события заключается не только в показателях внедрения; дело в том, как разработчики используют этот инструмент в сочетании с помощниками по программированию на базе ИИ для решения задач, которые раньше требовали участия инженеров по инфраструктуре, специалистов по DevOps и дежурного персонала.
Компания создает облачную платформу, которая расширяет возможности ее библиотеки с открытым исходным кодом до полноценного комплексного решения. Эта платформа позволит разработчикам развертывать конвейеры, трансформации и блокноты с помощью одной команды, не беспокоясь об инфраструктуре. Это знаменует собой фундаментальный сдвиг: инженерия данных перестает быть уделом специализированных команд и становится доступной любому разработчику на Python.
«Любой разработчик на Python должен иметь возможность предоставить своим бизнес-пользователям доступ к свежим и надежным данным, — рассказал в эксклюзивном интервью VentureBeat соучредитель и генеральный директор dltHub Матхаус Кшиковски (Matthaus Krzykowski). — наша миссия — сделать инженерию данных столь же доступной, совместной и бесшовной, как и написание кода на самом Python».
От SQL к нативной для Python инженерии данных
Проблема, которую компания решила исходить из реальных трудностей.
Одна из них проистекает из фундаментального противоречия в том, как разные поколения разработчиков работают с данными. Кшиковски указал на поколение разработчиков, выросших на SQL и технологии реляционных баз данных. С другой стороны, новое поколение разработчиков создает агентов ИИ на Python.
Этот разрыв отражает более глубокие технические проблемы. Инженерия данных на основе SQL привязывает команды к конкретным платформам и требует глубоких знаний инфраструктуры. Python-разработчикам, работающим над ИИ, нужны легкие, независимые от платформы инструменты, которые работают в блокнотах и интегрируются с помощниками по написанию кода на базе больших языковых моделей (LLM).
Библиотека dlt меняет это уравнение, автоматизируя сложные задачи инженерии данных с помощью простого кода на Python.
«Если вы знаете, что такое функция в Python, что такое список, источник и ресурс, то вы можете написать этот очень декларативный, очень простой код», — пояснил Кшиковски.
Ключевой технический прорыв заключается в автоматическом управлении эволюцией схем. Когда источники данных меняют формат вывода, традиционные конвейеры ломаются.
«У dlt есть механизмы для автоматического решения этих проблем, — рассказал VentureBeat Тьерри Жан (Thierry Jean), инженер-основатель dltHub. — Таким образом, система передает данные, и вы можете настроить оповещение об изменениях на вышестоящих уровнях или сделать конвейер достаточно гибким, чтобы изменять данные и точку назначения подходящим образом».
Практический опыт разработчиков
Хойт Эмерсон (Hoyt Emerson), консультант по данным и создатель контента в The Full Data Stack, недавно внедрил этот инструмент для перемещения данных из Google Cloud Storage в несколько пунктов назначения, включая Amazon S3 и хранилище данных. Традиционные подходы потребовали бы специфических для каждой платформы знаний. Эмерсон рассказал VentureBeat, что на самом деле ему нужен был гораздо более легкий и независимый от платформы способ передачи данных из одного места в другое.
«Именно тогда dlt подарила мне тот самый момент озарения», — поделился Эмерсон.
Он создал весь конвейер за пять минут, используя документацию библиотеки, что позволило быстро и без проблем приступить к работе.
Этот процесс становится еще более мощным в сочетании с помощниками по кодированию на базе ИИ. Эмерсон отметил, что использует принципы агентского программирования на основе ИИ и понял, что документацию dlt можно передать в качестве контекста в LLM для ускорения и автоматизации своей работы с данными. Имея документацию в качестве контекста, Эмерсон смог создать повторно используемые шаблоны для будущих проектов и задействовал ИИ-помощников для генерации конфигураций развертывания.
«Она чрезвычайно удобна для LLM, потому что очень хорошо задокументирована», — добавил он.
LLM-нативный паттерн разработки
Такое сочетание хорошо задокументированных инструментов и помощи ИИ представляет собой новый паттерн разработки. Компания оптимизировала свое решение специально для так называемого режима разработки YOLO, при котором разработчики копируют сообщения об ошибках и вставляют их в ИИ-помощники по написанию кода.
«Многие из этих людей буквально просто копируют и вставляют сообщения об ошибках и экспериментируют с редакторами кода, чтобы разобраться во всем», — отметил Кшиковски. Компания относится к такому поведению достаточно серьезно, чтобы исправлять проблемы специально для рабочих процессов, поддерживаемых ИИ.
Результаты говорят об эффективности этого подхода. Только в сентябре пользователи создали с помощью библиотеки более 50 000 пользовательских коннекторов. Это представляет собой 20-кратный рост по сравнению с январем, во многом благодаря разработке с использованием LLM.
Техническая архитектура для корпоративного масштаба
Философия проектирования dlt ставит во главу угла взаимозаменяемость, а не привязку к конкретной платформе. Инструмент может развертываться где угодно: от AWS Lambda до существующих корпоративных стеков данных. Он интегрируется с такими платформами, как Snowflake, сохраняя при этом гибкость для работы с любыми конечными точками.
«Мы всегда верили, что dlt должна быть интероперабельной и модульной, — пояснил Кшиковски. — Ее можно развернуть где угодно. Это может быть Lambda. Она часто становится частью чужих инфраструктур данных».
Ключевые технические возможности включают в себя:
-
Автоматическая эволюция схем: обрабатывает изменения вышестоящих данных без сбоев в конвейерах и необходимости ручного вмешательства.
-
Инкрементальная загрузка: обрабатывает только новые или измененные записи, снижая вычислительные затраты и накладные расходы.
-
Платформо-независимое развертывание: работает в различных облачных средах и на локальной инфраструктуре (on-premises) без модификаций.
-
Документация, оптимизированная для LLM: структурирована специально для использования ИИ-ассистентами, что позволяет быстро решать проблемы и генерировать шаблоны.
В настоящее время платформа поддерживает более 4 600 источников данных REST API с непрерывным расширением за счет коннекторов, создаваемых пользователями.
Конкуренция с гигантами ETL с помощью подхода «код прежде всего»
Ландшафт инженерии данных делится на отдельные лагеря, каждый из которых отвечает различным потребностям предприятий и предпочтениям разработчиков.
Традиционные платформы ETL, такие как Informatica и Talend, доминируют в корпоративной среде благодаря инструментам с графическим интерфейсом, которые требуют специального обучения, но предлагают комплексные функции управления.
Более новые SaaS-платформы, такие как Fivetran, завоевали популярность за счет акцента на готовые коннекторы и управляемую инфраструктуру, снижая операционные накладные расходы, но создавая зависимость от поставщика.
Библиотека dlt с открытым исходным кодом занимает принципиально иную позицию в качестве инфраструктуры с приоритетом кода и нативной поддержкой LLM, которую разработчики могут расширять и настраивать.
Такое позиционирование отражает более широкий сдвиг в сторону того, что в индустрии называют компонуемым стеком данных (composable data stack), когда предприятия строят инфраструктуру из взаимозаменяемых компонентов, а не монолитных платформ.
Что еще более важно, пересечение с ИИ создает новую динамику рынка. «ИИ не заменяет инженеров по данным, — сказал Кшиковски. — Но они кардинально расширяют их возможности и продуктивность».
Что это значит для лидеров корпоративных данных
Для предприятий, стремящихся занять лидирующие позиции в операциях на базе ИИ, это развитие событий представляет собой возможность кардинально переосмыслить стратегии инженерии данных.
Немедленные тактические преимущества очевидны. Организации могут задействовать существующих разработчиков на Python вместо найма специализированных команд инженеров данных. Организации, которые адаптируют свои инструменты и подходы к найму для использования этого тренда, могут получить значительные преимущества в стоимости и гибкости по-сравнению с конкурентами, все еще зависящими от традиционной инженерии данных, требующей больших человеческих ресурсов.
Вопрос заключается не в том, произойдет ли этот сдвиг в сторону демократизации инженерии данных. Вопрос в том, как быстро предприятия адаптируются, чтобы извлечь из этого выгоду.



