Databricks: «Распознавание PDF для агентного ИИ до сих пор не решено» — новый инструмент заменяет многосервисные конвейеры одной функцией
Огромный объем корпоративных данных заперт в PDF-документах. Конечно, инструменты генеративного ИИ уже способны загружать и анализировать PDF-файлы, но точность, затраты времени и средств оставляют желать лучшего. Новая технология от Databricks может это изменить.
На этой неделе компания подробно рассказала о своей технологии «ai_parse_document», которая теперь интегрирована в платформу Agent Bricks от Databricks. Эта разработка устраняет критическое узкое место в деле внедрения корпоративного ИИ: примерно 80% знаний компаний остаются заблокированными в PDF-файлах, отчетах и схемах, которые ИИ-системы с трудом обрабатывают и корректно понимают.
«Существует распространенное мнение, что разбор PDF — это решенная проблема, но на самом деле это не так, — рассказал VentureBeat Эрих Элсен (Erich Elsen), главный научный сотрудник Databricks. — Сложность заключается не только в том, что документы не структурированы; корпоративные PDF-файлы по своей природе крайне сложны. В них цифровой контент смешан со сканированными страницами и фотографиями физических документов, а также с таблицами, диаграммами и нестаромтированными макетами, и большинство существующих инструментов не способны точно захватить эту информацию».
Скрытая сложность разбора документов
Хотя технологии оптического распознавания символов (OCR) существуют уже несколько десятилетий, Элсен утверждает, что извлечение пригодных для использования структурированных данных из реальных корпоративных документов принципиально не решено.
Ключевые элементы, такие как таблицы с объединенными ячейками, подрисуночные подписи и пространственные взаимосвязи между элементами документа, регулярно пропускаются или неверно считываются существующими инструментами, из-за чего последующие ИИ-приложения, системы дополненной генерации (RAG) или дашворды бизнес-аналитики начинают работать ненадежно.
Типичным обходным путем для предприятий было объединение нескольких несовершенных инструментов: один сервис для определения макетов, другой для OCR, третий для извлечения таблиц, а также дополнительные API для анализа изображений. Такой подход требует месяцев кастомной инженерии данных и постоянного технического обслуживания по мере изменения форматов документов.
«Чтобы компенсировать это, командам приходилось использовать множество несовершенных инструментов или выстраивать сложные кастомные конвейеры, тратя месяцы на проектирование данных вместо инноваций, — говорит Элсен. — ai_parse_document решает эту проблему, извлекая полные, структурированные данные из реальных документов, чтобы организации наконец могли доверять неструктурированным данным и напрямую запрашивать их внутри Databricks».
Технический подход: сквозное обучение против цепочки конвейеров
Сегодня на рынке существует множество сервисов для разбора PDF, включая AWS Textract, Google Document AI и Azure Document Intelligence. Элсен отметил, что вместо простого чтения текста новый инструмент использует систему современных компонентов ИИ, обученных сквозным образом для извлечения структурированного контекста с бескомпромиссным качеством.
Функция выходит за рамки базового извлечения и позволяет сохранять:
-
Таблицы в том виде, в каком они представлены изначально, включая объединенные ячейки и вложенные структуры
-
Фигуры и диаграммы с созданными с помощью ИИ подписями и описаниями
-
Пространственные метаданные и ограничивающие рамки (bounding boxes) для точного определения местоположения элементов
-
Опциональный экспорт изображений для мультимодальных поисковых систем
Все результаты сохраняются непосредственно в каталоге Databricks Unity Catalog в виде таблиц Delta, а это означает, что разобранные документы превращаются в доступные для запросов структурированные данные прямо в среде Databricks. Это ключевое отличие от облачных сервисов, требующих экспорта данных для обработки.
«Благодаря ориентированному на данные обучению и оптимизированному выводу мы добились снижения затрат в 3–5 раз при сохранении или превышении показателей таких ведущих систем, как Textract, Document AI и Azure Document Intelligence», — подчеркнул Элсен.
Раннее внедрение на предприятиях производственного и промышленного секторов
Несколько крупных компаний уже внедрили ai_parse_document в рабочие процессы со сценариями использования, охватывающими оптимизацию пайплайнов Data Science, демократизацию обработки документов и разработку RAG-приложений.
Например, Элсен отметил, что компания Rockwell Automation использует ai_parse_document для снижения накладных расходов на настройку для своих специалистов по работе с данными.
«То, что раньше требовало значительной подготовки для поддержки сложных решений, теперь оптимизировано, что позволяет их командам тратить больше времени на инновации и меньше — на управление инфраструктурой», — сказал он.
Тем временем TE Connectivity использует ai_parse_document для демократизации обработки неструктурированных данных.
«Раньше извлечение таблиц, текста и метаданных из документов требовало сложных рабочих процессов с большим количеством кода, — пояснил Элсен. — С Databricks они объединили все это в одну функцию SQL, сделав передовую обработку документов доступной для любой команды данных, а не только для дата-саентистов».
Emerson Electric — еще один ранний пользователь технологии. Компания использует ai_parse_document для сценария RAG. Элсен пояснил, что за счет обеспечения параллельного разбора документов прямо внутри таблиц Delta компания Emerson сделала создание RAG-приложений простым и быстрым в рамках своей существующей среды Databricks.
Интеграция с платформой
Хотя Databricks имеет богатую историю работы с открытым исходным кодом, технология ai_parse_document является проприетарным компонентом платформы Databricks.
В отличие от автономных API для интеллектуальной обработки документов, ai_parse_document глубоко интегрирована с платформой Agent Bricks от Databricks, представляющей собой набор функций ИИ и возможностей оркестрации для создания производственных ИИ-агентов.
Функция работает в связке с более широкой инфраструктурой данных Databricks, включая:
-
Декларативные пайплайны Spark (Spark Declarative Pipelines): обеспечивают автоматическую инкрементную обработку, а это значит, что новые документы, поступающие в SharePoint, S3 или Azure Data Lake Storage, разбираются автоматически без ручной оркестрации.
-
Каталог Unity (Unity Catalog): управляет разрешениями, журналами аудита и происхождением данных для разобранного контента точно так же, как и для структурированных данных.
-
Векторный поиск (Vector Search): индексирует разобранные элементы документов, включая текст, таблицы и фигуры с подписями, для мультимодальных RAG-приложений.
-
Цепочки функций ИИ (AI function chaining): позволяют разработчикам передавать вывод ai_parse_document напрямую в ai_extract (извлечение сущностей), ai_classify (категоризация документов) и ai_summarize (суммирование контента) в рамках одного SQL-запроса.
-
Супервизор мультиагентов (Multi-Agent Supervisor): координирует работу агентов по обработке документов с другими специализированными агентами для выполнения сложных рабочих процессов.
«Парсинг — это лишь начало и редко когда самоцель, — заявил Элсен. — Цель состоит в том, чтобы позволить клиентам объединять наши ai_functions, такие как ai_extract и ai_classify, вместе с ai_parse_document, чтобы превратить свои документы в пригодные для использования данные и аналитику. Мы также стремимся сделать процесс превращения массива документов в базу знаний для использования в RAG или других агентах извлечения информации бесшовным».
Что это значит для корпоративной стратегии в области ИИ
Компаниям, создающим системы на базе ИИ-агентов, крайне важно понимать, как PDF-документы фактически используются и воспринимаются системами.
Подход Databricks проливает новый свет на проблему, которую многие могли считать решенной. Он бросает вызов существующим ожиданиям благодаря новой архитектуре, которая может принести пользу самым разным рабочим процессам. Тем не менее, это функция конкретной платформы, требующая тщательной оценки для организаций, которые еще не используют Databricks.
Главный вывод для технических руководителей, оценивающих платформы ИИ-агентов, заключается в том, что интеллектуальная обработка документов переходит из разряда специализированных внешних сервисов в категорию встроенных возможностей платформы.



