Золотые конвейеры Impromptu сокращают время подготовки данных

Золотые конвейеры Impromptu сокращают время подготовки данных

Традиционные инструменты ETL, такие как dbt или Fivetran, готовят данные для отчетности: структурированной аналитики и панелей мониторинга со стабильными схемами. ИИ-приложениям требуется кое-что другое: подготовка неструктурированных, меняющихся операционных данных для инференса моделей в реальном времени.

Компания Empromptu называет это различие «целостностью инференса» (inference integrity) в противовес «целостности отчетности» (reporting integrity). Вместо того чтобы рассматривать подготовку данных как отдельную дисциплину, «золотые конвейеры» (golden pipelines) интегрируют нормализацию непосредственно в рабочий процесс ИИ-приложения, сокращая то, на что обычно уходит 14 дней ручного проектирования, менее чем до часа, заявляет компания. Подход Empromptu в виде «золотых конвейеров» — это способ ускорить подготовку данных и гарантировать их точность.

Компания работает в основном со средним бизнесом и корпоративными клиентами в регулируемых отраслях, где точность данных и соответствие нормативным требованиям имеют первостепенное значение. Финтех — самое быстрорастущее вертикальное направление Empromptu, также среди клиентов есть представители сферы здравоохранения и юридических технологий. Платформа соответствует стандартам HIPAA и сертифицирована по стандарту SOC 2.

«Корпоративный ИИ ломается не на уровне моделей, он ломается, когда неструктурированные данные сталкиваются с реальными пользователями, — рассказала Шанеа Левен (Shanea Leven), генеральный директор и соучредитель Empromptu, в эксклюзивном интервью VentureBeat. — Золотые конвейеры переносят интеграцию, подготовку и управление данными непосредственно в рабочий процесс ИИ-приложения, позволяя командам создавать системы, которые действительно работают в продакшене».

Как работают золотые конвейеры

Золотые конвейеры функционируют как автоматизированный слой, который располагается между сырыми операционными данными и функциями ИИ-приложений. 

Система выполняет пять основных функций. Во-первых, она осуществляет сбор данных из любых источников, включая файлы, базы данных, API и неструктурированные документы. Затем она обрабатывает эти данные посредством автоматического контроля и очистки, структурирования с помощью определений схем, а также разметки и обогащения для заполнения пробелов и классификации записей. Встроенные средства управления и проверки соответствия требованиям включают в себя журналы аудита, элементы контроля доступа и обеспечение конфиденциальности.

Технический подход сочетает в себе детерминированную предварительную обработку с нормализацией на базе ИИ. Вместо жесткого кодирования каждого преобразования система выявляет несоответствия, определяет недостающую структуру и генерирует классификации на основе контекста модели. Каждое преобразование регистрируется и напрямую связывается с последующей оценкой ИИ.

Цикл оценки играет центральную роль в работе золотых конвейеров. Если нормализация данных снижает точность последующей обработки, система фиксирует это благодаря непрерывной оценке по сравнению с поведением в продакшене. По словам Левен, именно эта обратная связь между подготовкой данных и производительностью модели отличает золотые конвейеры от традиционных инструментов ETL.

Золотые конвейеры встроены непосредственно в Empromptu Builder и запускаются автоматически в рамках создания ИИ-приложения. С точки зрения пользователя, команды создают ИИ-функции. Под капотом золотые конвейеры гарантируют, что данные, питающие эти функции, являются чистыми, структурированными, управляемыми и готовыми к использованию в продакшене.

Целостность отчетности против целостности инференса

Левен позиционирует золотые конвейеры как решение принципиально иной проблемы по сравнению с традиционными инструментами ETL, такими как dbt, Fivetran или Databricks.

«Dbt и Fivetran оптимизированы для обеспечения целостности отчетности. Золотые конвейеры оптимизированы для обеспечения целостности инференса, — сказала Левен. — Традиционные инструменты ETL предназначены для перемещения и трансформации структурированных данных на основе предопределенных правил. Они предполагают стабильность схем, известные трансформации и относительно статичную логику».

«Мы не заменяем dbt или Fivetran, компании продолжат использовать их для обеспечения целостности хранилищ и структурированной отчетности, — отметила Левен. — Золотые конвейеры располагаются ближе к слою ИИ-приложений. Они решают проблему последней мили: как взять реальные, несовершенные операционные данные и сделать их пригодными для ИИ-функций без месяцев ручной обработки?»

Аргумент в пользу доверия к нормализации на базе ИИ опирается на возможности аудита и непрерывную оценку. 

«Это не магия без участия человека. Этот процесс поддается проверке, аудиту и непрерывно оценивается на основе поведения в продакшене, — сказала Левен. — Если нормализация снижает точность последующей обработки, цикл оценки обнаруживает это. Такая обратная связь между подготовкой данных и производительностью модели — это то, чего не предоставляют традиционные ETL-конвейеры».

Внедрение у клиента: VOW решает задачу работы со сложными данными мероприятий

Подход с использованием золотых конвейеров уже дает результаты в реальном мире.

Платформа управления мероприятиями VOW обслуживает масштабные мероприятия для таких организаций, как GLAAD, а также для различных спортивных организаций. Когда GLAAD планирует мероприятие, данные распределяются по приглашениям спонсоров, покупкам билетов, столам, местам и т. д. Этот процесс происходит быстро, и согласованность данных имеет абсолютное значение.

«Наши данные сложнее, чем у среднестатистической платформы, — рассказала VentureBeat Дженнифер Брисман (Jennifer Brisman), генеральный директор VOW. — Когда GLAAD планирует мероприятие, эти данные заносятся в приглашения для спонсоров, данные о покупке билетов, столы и места и многое другое. И все это должно происходить очень быстро».

Ранее VOW вручную писала скрипты регулярных выражений (regex). Когда компания решила создать функцию генерации плана рассадки с помощью ИИ, которая обновляла бы данные практически в режиме реального времени и распространяла информацию по всей платформе, обеспечение точности данных стало критически важным. Золотые конвейеры автоматизировали процесс извлечения данных из планов этажей, которые часто поступали в неупорядоченном, противоречивом и неструктурированном виде, а затем форматировали и отправляли их без необходимости масштабных ручных усилий со стороны команды инженеров.

Изначально VOW использовала Empromptu для анализа планов этажей с помощью ИИ, с которым не смогли справиться ни команда ИИ Google, ни команда ИИ Amazon. В настоящее время компания полностью переписывает свою платформу на систему Empromptu.

Что это означает для развертывания корпоративного ИИ

Золотые конвейеры ориентированы на определенный сценарий развертывания: организации, создающие интегрированные ИИ-приложения, где подготовка данных в настоящее время представляет собой ручное «бутылочное горлышко» между прототипом и продакшеном. 

Этот подход менее актуален для команд, у которых уже есть зрелые организации по инженерии данных с устоявшимися процессами ETL, оптимизированными под их конкретные домены, или для организаций, создающих автономные ИИ-модели, а не интегрированные приложения.

Критерием выбора является то, блокирует ли подготовка данных скорость внедрения ИИ в организации. Если специалисты по обработке данных готовят наборы данных для экспериментов, которые инженерным командам затем приходится воссоздавать с нуля для продакшена, встроенная подготовка данных решает эту проблему. 

Если «бутылочное горлышко» находится в другом месте жизненного цикла разработки ИИ, это не поможет. Компромисс заключается в выборе между интеграцией платформы и гибкостью инструментов. Команды, использующие золотые конвейеры, берут на себя обязательство применять комплексный подход, при котором подготовка данных, разработка ИИ-приложений и управление осуществляются на единой платформе. Организации, предпочитающие собирать лучшие в своем классе инструменты для каждой функции, сочтут такой подход ограничивающим. Преимущество заключается в устранении этапов передачи данных между подготовкой данных и разработкой приложений. Стороной платы за это является снижение вариативности в способах реализации данных функций.

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.