Snowflake создает новый интеллект, который превосходит RAG и позволяет запрашивать и агрегировать тысячи документов одновременно
У корпоративного искусственного интеллекта проблемы с данными. Несмотря на миллиардные инвестиции и всё более мощные языковые модели, большинство организаций по-прежнему не могут ответить на базовые аналитические вопросы по своим хранилищам документов. Причина кроется не в качестве моделей, а в архитектуре: традиционные системы rag (дополненной извлечением генерации) создавались для поиска и суммирования, а не для анализа и агрегирования больших массивов документов.
Компания Snowflake берется за решение этой проблемы напрямую с помощью комплексной платформенной стратегии, анонсированной на конференции BUILD 2025. Компания представила Snowflake Intelligence — платформу агентов корпоративной разведки, созданную для объединения анализа структурированных и неструктурированных данных, а также инфраструктурные улучшения, охватывающие интеграцию данных с помощью Openflow, консолидацию баз данных с Snowflake Postgres и аналитику в реальном времени с использованием интерактивных таблиц. Цель: устранить информационные изоляторы (силосы) и архитектурные узкие места, мешающие предприятиям масштабировать применение ИИ.
Ключевой инновацией стали агентская аналитика документов (Agentic Document Analytics) — новая функция в составе Snowflake Intelligence, способная анализировать тысячи документов одновременно. Это позволяет компаниям перейти от базовых запросов в стиле «Какова наша политика сброса пароля?» к сложным аналитическим запросам вроде «Покажи мне количество еженедельных упоминаний по товарным категориям в моих тикетах техподдержки за последние шесть месяцев».
Узкое место RAG: почему выборка не работает для аналитики
Традиционные системы RAG работают путем преобразования документов в векторные представления, их сохранения в векторной базе данных и извлечения наиболее семантически похожих документов, когда пользователь задает вопрос.
«Чтобы RAG работал, требуется, чтобы все ответы, которые вы ищете, уже существовали в каком-то опубликованном на сегодня виде», — пояснил Джефф Холлан (Jeff Hollan), руководитель направления агентов Cortex AI в Snowflake, в ходе пресс-конференции для VentureBeat. — «Паттерн, о котором я думаю применительно к RAG, похож на библиотекаря: вы задаете вопрос, и он говорит вам: „Ответ на этот вопрос содержится в такой-то книге на конкретной странице“».
Однако эта архитектура принципиально дает сбой, когда организациям требуется выполнить совокупный анализ. Если, например, у предприятия есть 100 000 отчетов и оно хочет выявить все отчеты, в которых упоминается конкретный бизнес-субъект, и суммировать всю выручку, обсуждаемую в этих отчетах, — это нетривиальная задача.
«Это нечто гораздо более сложное, чем просто традиционный RAG», — отметил Холлан.
Из-за этого ограничения предприятиям обычно приходилось поддерживать раздельные аналитические конвейеры для структурированных данных в хранилищах данных и неструктурированных данных в векторных базах или хранилищах документов. Результатом становятся информационные разрывы и проблемы с обеспечением безопасности и управления данными для бизнеса.
Как работает агентский анализ документов: принципиальные отличия
Подход Snowflake объединяет анализ структурированных и неструктурированных данных внутри единой платформы, рассматривая документы как источники данных, по которым можно выполнять запросы, а не как цели для поиска. Система использует ИИ для извлечения, структурирования и индексирования содержимого документов так, чтобы обеспечивать выполнение SQL-подобных аналитических операций по тысячам документов.
Эта возможность задействует существующую архитектуру Snowflake. Cortex AISQL отвечает за синтаксический анализ и извлечение данных из документов. Интерактивные таблицы (Interactive Tables) и хранилища обеспечивают производительность запросов менее чем за секунду на больших наборах данных. Обрабатывая документы в рамках той же защищенной платформы данных, где хранятся структурированные сведения, компании могут объединять выводы из документов с транзакционными данными, записями о клиентах и другой деловой информацией.
«Ценность ИИ, его мощь, продуктивность и подрывной потенциал создаются и реализуются благодаря подключению к корпоративным данным», — заявил Кристиан Клайнерман (Christian Kleinerman), исполнительный вице-президент по продукту в Snowflake.
Архитектура компании удерживает всю обработку данных внутри своего контура безопасности, снимая вопросы регулятивного соответствия и безопасности, которые сдерживали внедрение корпоративного ИИ. Система работает с документами из самых разных источников. В их числе — файлы PDF в SharePoint, беседы в Slack, данные Microsoft Teams и записи Salesforce благодаря возможностям интеграции Snowflake без копирования данных (zero-copy). Это избавляет от необходимости извлекать данные и перемещать их в отдельные системы обработки ИИ.
Сравнение с текущими рыночными подходами
Анонс позиционирует Snowflake иначе как по сравнению с традиционными поставщиками хранилищ данных, так и с ориентированными на ИИ стартапами.
Такие компании, как Databricks, сосредоточились на внедрении возможностей ИИ в архитектуры озера данных (lakehouse), однако обычно по-прежнему полагаются на векторные базы данных и традиционные паттерны RAG для неструктурированных данных. API ассистентов от OpenAI и Claude от Anthropic предлагают анализ документов, но ограничены размерами контекстного окна.
Провайдеры векторных баз данных, такие как Pinecone и Weaviate, выстроили бизнес вокруг сценариев использования RAG, но иногда сталкиваются с трудностями, когда клиентам требуются аналитические запросы, а не просто поиск. Эти системы отлично справляются с поиском релевантных документов, но не могут легко агрегировать информацию по крупным массивам данных.
Среди ключевых ценных вариантов использования, которые ранее были сложны для архитектур исключительно на базе RAG и которые Snowflake выделяет для своего подхода, — анализ клиентской поддержки. Вместо того чтобы вручную изучать тикетинг, организации могут запрашивать паттерны по тысячам взаимодействий. Ответы на такие вопросы, как «Каковы 10 главных проблем с продуктами, упомянутых в тикетах поддержки за этот квартал, в разбивке по клиентским сегментам?», становятся доступны за считанные секунды.
Что это значит для стратегии корпоративного ИИ
Для компаний, формирующих свои ИИ-стратегии, агентская аналитика документов знаменует переход от парадигмы «поиск и извлечение» (search and retrieve), свойственной RAG, к парадигме «запрос и анализ» (query and analyze), более привычной по инструментам бизнес-аналитики (BI).
Вместо развертывания отдельных векторных баз данных и систем RAG под каждый сценарий использования компании могут консолидировать аналитику документов в своей существующей платформе данных. Это снижает сложность инфраструктуры и одновременно распространяет практики бизнес-аналитики на неструктурированные данные.
Эта функция также демократизирует доступ к данным. Возможность выполнять запросы к документам на естественном языке означает, что аналитика, для которой раньше требовались команды специалистов по обработке данных (data science), становится доступна рядовым бизнес-пользователям.
Для предприятий, стремящихся удерживать лидерство в сфере ИИ, конкурентное преимущество заключается не в обладании лучшими языковыми моделями, а в масштабном анализе собственных неструктурированных данных наряду со структурированными бизнес-данными. Организации, способные запрашивать весь массив своих документов так же легко, как и хранилище данных, получат инсайты, которые конкуренты не смогут легко воспроизвести.
«ИИ — это реальность сегодняшнего дня, — подчеркнул Клайнерман. — У нас уже есть множество организаций, получающих пользу от ИИ, и если кто-то все еще выжидает или остается в стороне, наш призыв к действию — начинать строить прямо сейчас».



