Золотые конвейеры Impromptu сокращают время подготовки данных
Традиционные инструменты ETL, такие как dbt или Fivetran, готовят данные для отчетности: структурированной аналитики и панелей мониторинга со стабильными схемами. ИИ-приложениям требуется кое-что другое: подготовка неструктурированных, меняющихся операционных данных для инференса моделей в реальном времени.
Компания Empromptu называет это различие «целостностью инференса» (inference integrity) в противовес «целостности отчетности» (reporting integrity). Вместо того чтобы рассматривать подготовку данных как отдельную дисциплину, «золотые конвейеры» (golden pipelines) интегрируют нормализацию непосредственно в рабочий процесс ИИ-приложения, сокращая то, на что обычно уходит 14 дней ручного проектирования, менее чем до часа, заявляет компания. Подход Empromptu в виде «золотых конвейеров» — это способ ускорить подготовку данных и гарантировать их точность.
Компания работает в основном со средним бизнесом и корпоративными клиентами в регулируемых отраслях, где точность данных и соответствие нормативным требованиям имеют первостепенное значение. Финтех — самое быстрорастущее вертикальное направление Empromptu, также среди клиентов есть представители сферы здравоохранения и юридических технологий. Платформа соответствует стандартам HIPAA и сертифицирована по стандарту SOC 2.
«Корпоративный ИИ ломается не на уровне моделей, он ломается, когда неструктурированные данные сталкиваются с реальными пользователями, — рассказала Шанеа Левен (Shanea Leven), генеральный директор и соучредитель Empromptu, в эксклюзивном интервью VentureBeat. — Золотые конвейеры переносят интеграцию, подготовку и управление данными непосредственно в рабочий процесс ИИ-приложения, позволяя командам создавать системы, которые действительно работают в продакшене».
Как работают золотые конвейеры
Золотые конвейеры функционируют как автоматизированный слой, который располагается между сырыми операционными данными и функциями ИИ-приложений.
Система выполняет пять основных функций. Во-первых, она осуществляет сбор данных из любых источников, включая файлы, базы данных, API и неструктурированные документы. Затем она обрабатывает эти данные посредством автоматического контроля и очистки, структурирования с помощью определений схем, а также разметки и обогащения для заполнения пробелов и классификации записей. Встроенные средства управления и проверки соответствия требованиям включают в себя журналы аудита, элементы контроля доступа и обеспечение конфиденциальности.
Технический подход сочетает в себе детерминированную предварительную обработку с нормализацией на базе ИИ. Вместо жесткого кодирования каждого преобразования система выявляет несоответствия, определяет недостающую структуру и генерирует классификации на основе контекста модели. Каждое преобразование регистрируется и напрямую связывается с последующей оценкой ИИ.
Цикл оценки играет центральную роль в работе золотых конвейеров. Если нормализация данных снижает точность последующей обработки, система фиксирует это благодаря непрерывной оценке по сравнению с поведением в продакшене. По словам Левен, именно эта обратная связь между подготовкой данных и производительностью модели отличает золотые конвейеры от традиционных инструментов ETL.
Золотые конвейеры встроены непосредственно в Empromptu Builder и запускаются автоматически в рамках создания ИИ-приложения. С точки зрения пользователя, команды создают ИИ-функции. Под капотом золотые конвейеры гарантируют, что данные, питающие эти функции, являются чистыми, структурированными, управляемыми и готовыми к использованию в продакшене.
Целостность отчетности против целостности инференса
Левен позиционирует золотые конвейеры как решение принципиально иной проблемы по сравнению с традиционными инструментами ETL, такими как dbt, Fivetran или Databricks.
«Dbt и Fivetran оптимизированы для обеспечения целостности отчетности. Золотые конвейеры оптимизированы для обеспечения целостности инференса, — сказала Левен. — Традиционные инструменты ETL предназначены для перемещения и трансформации структурированных данных на основе предопределенных правил. Они предполагают стабильность схем, известные трансформации и относительно статичную логику».
«Мы не заменяем dbt или Fivetran, компании продолжат использовать их для обеспечения целостности хранилищ и структурированной отчетности, — отметила Левен. — Золотые конвейеры располагаются ближе к слою ИИ-приложений. Они решают проблему последней мили: как взять реальные, несовершенные операционные данные и сделать их пригодными для ИИ-функций без месяцев ручной обработки?»
Аргумент в пользу доверия к нормализации на базе ИИ опирается на возможности аудита и непрерывную оценку.
«Это не магия без участия человека. Этот процесс поддается проверке, аудиту и непрерывно оценивается на основе поведения в продакшене, — сказала Левен. — Если нормализация снижает точность последующей обработки, цикл оценки обнаруживает это. Такая обратная связь между подготовкой данных и производительностью модели — это то, чего не предоставляют традиционные ETL-конвейеры».
Внедрение у клиента: VOW решает задачу работы со сложными данными мероприятий
Подход с использованием золотых конвейеров уже дает результаты в реальном мире.
Платформа управления мероприятиями VOW обслуживает масштабные мероприятия для таких организаций, как GLAAD, а также для различных спортивных организаций. Когда GLAAD планирует мероприятие, данные распределяются по приглашениям спонсоров, покупкам билетов, столам, местам и т. д. Этот процесс происходит быстро, и согласованность данных имеет абсолютное значение.
«Наши данные сложнее, чем у среднестатистической платформы, — рассказала VentureBeat Дженнифер Брисман (Jennifer Brisman), генеральный директор VOW. — Когда GLAAD планирует мероприятие, эти данные заносятся в приглашения для спонсоров, данные о покупке билетов, столы и места и многое другое. И все это должно происходить очень быстро».
Ранее VOW вручную писала скрипты регулярных выражений (regex). Когда компания решила создать функцию генерации плана рассадки с помощью ИИ, которая обновляла бы данные практически в режиме реального времени и распространяла информацию по всей платформе, обеспечение точности данных стало критически важным. Золотые конвейеры автоматизировали процесс извлечения данных из планов этажей, которые часто поступали в неупорядоченном, противоречивом и неструктурированном виде, а затем форматировали и отправляли их без необходимости масштабных ручных усилий со стороны команды инженеров.
Изначально VOW использовала Empromptu для анализа планов этажей с помощью ИИ, с которым не смогли справиться ни команда ИИ Google, ни команда ИИ Amazon. В настоящее время компания полностью переписывает свою платформу на систему Empromptu.
Что это означает для развертывания корпоративного ИИ
Золотые конвейеры ориентированы на определенный сценарий развертывания: организации, создающие интегрированные ИИ-приложения, где подготовка данных в настоящее время представляет собой ручное «бутылочное горлышко» между прототипом и продакшеном.
Этот подход менее актуален для команд, у которых уже есть зрелые организации по инженерии данных с устоявшимися процессами ETL, оптимизированными под их конкретные домены, или для организаций, создающих автономные ИИ-модели, а не интегрированные приложения.
Критерием выбора является то, блокирует ли подготовка данных скорость внедрения ИИ в организации. Если специалисты по обработке данных готовят наборы данных для экспериментов, которые инженерным командам затем приходится воссоздавать с нуля для продакшена, встроенная подготовка данных решает эту проблему.
Если «бутылочное горлышко» находится в другом месте жизненного цикла разработки ИИ, это не поможет. Компромисс заключается в выборе между интеграцией платформы и гибкостью инструментов. Команды, использующие золотые конвейеры, берут на себя обязательство применять комплексный подход, при котором подготовка данных, разработка ИИ-приложений и управление осуществляются на единой платформе. Организации, предпочитающие собирать лучшие в своем классе инструменты для каждой функции, сочтут такой подход ограничивающим. Преимущество заключается в устранении этапов передачи данных между подготовкой данных и разработкой приложений. Стороной платы за это является снижение вариативности в способах реализации данных функций.



