Databricks приобрела Mooncake для устранения ETL
Многие предприятия, использующие базы данных PostgreSQL для своих приложений, сталкиваются с одной и той же дорогостоящей реальностью. Когда им необходимо проанализировать эти операционные данные или передать их в ИИ-модели, они создают конвейеры данных ETL (извлечение, преобразование, загрузка) для их переноса в аналитические системы. Эти конвейеры требуют выделенных команд инженеров по данным, часто ломаются и создают задержки, измеряемые часами или днями, между моментом записи данных в базу данных и моментом их доступности для аналитики.
Для компаний с большим количеством инстансов PostgreSQL этот инфраструктурный налог является огромным. Что еще более важно, он не был создан для мира, в котором ИИ-агенты генерируют и развертывают приложения со скоростью машин, создавая новые таблицы, события и рабочие процессы быстрее, чем любая команда инженеров по данным может за этим поспевать.
Databricks делает ставку на то, что эта архитектура коренным образом несовершенна. Компания приобретает Mooncake, стартап на ранней стадии, ориентированный на объединение PostgreSQL с форматами озер данных (lakehouse), чтобы полностью исключить необходимость в конвейерах ETL. Финансовые условия сделки не разглашаются публично. Технология обещает сделать операционные данные мгновенно доступными для аналитики и рабочих нагрузок ИИ, обеспечивая рост производительности от 10 до 100 раз для типичных операций перемещения данных.
Эта покупка, о которой было объявлено сегодня, произошла всего через несколько месяцев после того, как Databricks приобрела Neon, провайдера бессерверного PostgreSQL. Но скорость заключения этой второй сделки говорит о чем-то более срочном. Никита Шамгунов, перешедший в Databricks на должность вице-президента по инжинирингу после руководства Neon, заявил соучредителю и главному архитектору Databricks Рейнольду Сину, что Databricks должна купить Mooncake буквально в его первый день работы в компании.
«В первый день, когда мы закрыли сделку, Никита сказал: «Эй, мы собираемся купить эту компанию»», — рассказал Син в эксклюзивном интервью VentureBeat. «И тогда я ответил: «Эй, ты еще даже не знаешь, где здесь туалеты». А потом со временем… я узнал больше о том, что делает компания. И подумал: вау, Никита был прав на 100%. Это настолько очевидное решение».
Разрыв в инфраструктуре агентов
Причиной срочности покупки Mooncake стала продолжающаяся акселерация агентного ИИ.
«Восемьдесят процентов баз данных клиентов Neon уже были созданы агентами», — отметил Син, описывая сдвиги, происходящие на платформе Neon. «И это на самом деле поддерживается разделением архитектуры хранения и вычислений, которое впервые внедрила команда Neon».
Это создает фундаментальную проблему. Агенты, создающие приложения, рассчитывают работать с PostgreSQL, которая является транзакционной базой данных. Однако, когда тем же приложениям необходимо запустить аналитику, данные должны находиться в колоночных форматах, оптимизированных для аналитических запросов. Исторически это требовало создания и обслуживания ETL-конвейеров. Это дорогие, хрупкие системы, которые часто ломаются и требуют выделенных команд инженеров по данным.
«Я не думаю, что это справедливо — заставлять агентов выполнять этап ETL в рамках создания приложений нового поколения», — сказал Шамгунов изданию VentureBeat. «Я считаю, что агенты теперь ожидают возможности итераций в очень быстром темпе, и тогда инфраструктура должна предоставить агентам относительно унифицированный доступ к данным».
За пределами Mooncake: преимущества архитектуры Moonlink
В портфолио Mooncake входит несколько технологий. Существует расширение «pgmooncake», которое позволяет запускать аналитические рабочие нагрузки прямо в PostgreSQL. Кроме того, есть компонент moonlink, который Шамгунов описывает как уровень акселерации. Он обеспечивает преобразование в реальном времени между построчно-ориентированными данными PostgreSQL и колоночными аналитическими форматами без использования традиционных ETL-конвейеров.
«Moonlink позволяет в основном создать зеркало ваших OLTP-данных в колоночном представлении в форматах Iceberg и Delta», — пояснил Шамгунов. «Moonlink также поддерживает уровень акселерации. Так что во многих случаях вы накапливаете задержки при запросах к озеру данных из-за поиска по метаданным или обращения к s3 как на входе, так и на выходе».
Влияние на производительность оказывается впечатляющим. Для таких операций, как перенос данных из озера данных в то, что Databricks называет Lakebase (своя категория OLTP-баз данных), Шамгунов отметил, что улучшение составляет от «10-100 раз быстрее» до «практически неограниченно быстрее» для легко распараллеливаемых операций, таких как преобразование форматов данных.
Для Сина все дело в увеличении пропускной способности.
«Представьте, что в прошлом у OLTP-баз данных всегда была одна маленькая труба, этой трубой мог быть JDBC-драйвер, и она очень узкая. Она быстрая, но имеет очень низкую пропускную способность», — пояснил Син с помощью аналогии. «С помощью Mooncake и других разрабатываемых нами решений мы теперь можем создать бесконечное количество таких труб, и эти трубы намного шире, чем однопоточный JDBC».
Сравнение Databricks с другими поставщиками PostgreSQL
Как Databricks позиционирует себя по отношению к другим провайдерам PostgreSQL
Приобретение Mooncake ставит Databricks в прямую конкуренцию с управляемыми сервисами PostgreSQL от облачных провайдеров, в частности AlloyDB от Google и Aurora от Amazon.
Все три системы предлагают разделение хранения и вычислений, однако руководители Databricks утверждают, что их архитектура обеспечивает фундаментальные преимущества. Шамгунов подчеркнул, что Databricks объединяет аналитические и операционные модели, причем обе стороны контролируются и глубоко интегрированы, что приводит к более быстрому перемещению данных и снижению задержек.
Динамика конкуренции здесь неоднозначна. Databricks конкурирует со всеми тремя крупными облачными провайдерами и одновременно сотрудничает с ними.
«Мы также тесно сотрудничаем с Google для получения данных из lakehouse для совместных клиентов», — отметил Син. «Так что это не просто конкурентная ситуация. Я имею в виду, что мы одновременно конкурируем со всеми CSP (поставщиками облачных услуг)».
Под руководством Databricks компания теперь также агрессивно ведет ценовую борьбу. До приобретения самый дешевый платный ежемесячный тариф Neon стоил 25 долларов, а теперь его стоимость резко упала — всего до 5 долларов.
«Мы сделали противоположное тому, что, возможно, ожидали от нас многие: после приобретения мы снизили цену», — сказал Син.
Что это значит для предприятий
Для организаций, управляющих тысячами операционных баз данных PostgreSQL наряду с озерами данных, немедленный эффект очевиден. Командам разработки больше не придется ждать, пока дата-инженеры создадут и настроят конвейеры для получения доступа к операционным данным для аналитики или рабочих нагрузок ИИ.
Для команд платформ данных это означает переосмысление управления инфраструктурой с нуля.
Вместо поддержки сложной оркестрации конвейеров между операционными и аналитическими системами команды могут сосредоточиться на управлении, контроле доступа и оптимизации рабочих нагрузок в рамках единой платформы. Такой сдвиг высвобождает инженерные ресурсы и одновременно сокращает зону возможных сбоев в качестве данных и отказов конвейеров. Для предприятий, создающих приложения на базе агентов, единая архитектура устраняет зависимость от инженерии данных как обязательного условия для запуска новых рабочих нагрузок.
«Я считаю, что агенты теперь ожидают возможности итераций в очень быстром темпе, и тогда инфраструктура должна предоставить агентам относительно унифицированный доступ к данным», — отметил Шамгунов.



