Корпоративные ИИ-агенты надежны ровно настолько, насколько хаотичны документы, стоящие за ними

Корпоративные ИИ-агенты надежны ровно настолько, насколько хаотичны документы, стоящие за ними

Корпоративный ИИ в значительной степени строится на основе инженерии контекста (context engineering). Команды подключают корпоративные системы, генерируют фрагменты (chunks) и эмбеддинги, создают конвейеры извлечения данных и собирают контекст, необходимый для работы отдельных ИИ-приложений. Хотя такой подход хорошо работает для изолированных ассистентов и копѝлотов, он рассматривает корпоративные знания как контекст, привязанный к конкретному приложению, а не как общий корпоративный актив.

По мере того как организации развертывают все больше ИИ-приложений и агентов, эта модель начинает давать сбой. Различные команды обрабатывают одни и те же документы, поддерживают раздельные эмбеддинги и индексы, а также создают противоречивые представления одних и тех же бизнес-знаний. Проблема заключается уже не просто в предоставлении контекста ИИ-системам — речь идет об управлении самими корпоративными знаниями.

Почему создания контекста недостаточно для корпоративного ИИ

Сегодня общепринятый подход к корпоративному ИИ заключается в создании контекста для отдельных приложений. Команды подключают корпоративные системы, обрабатывают требуемую информацию, генерируют поисковые представления (такие как чанки и эмбеддинги) и собирают контекст, необходимый агенту во время выполнения. Хотя это работает для одного приложения, такой подход не управляет корпоративными знаниями как общим корпоративным ресурсом.

По мере развертывания организациями новых ИИ-приложений этот подход начинает разрушаться по трем причинам.

Во-первых, знания становятся противоречивыми. Корпоративные знания распределены по множеству независимых систем с разными схемами, бизнес-определениями и циклами обновления. Один и тот же продукт, клиент или бизнес-процесс может описываться по-разному — или даже противоречить самому себе — в документах, тикетах Jira, исходном коде, CRM-системах и метаданных. Извлечение этой информации в контекст не устраняет данные противоречия; оно просто переносит их на ИИ-приложение, из-за чего разные агенты формируют различное понимание бизнеса.

Во-вторых, изменения становится трудно распространять. Корпоративные знания непрерывно эволюционируют, но каждое приложение поддерживает собственный конвейер контекста. По мере изменения документов, кода и бизнес-определений дочерние чанки, эмбеддинги, индексы и контекст агентов обновляются независимо друг от друга, из-за чего ИИ-приложения начинают работать с разными версиями одних и тех же знаний.

Наконец, организации снова и снова перестраивают одни и те же конвейеры знаний. Различные команды обрабатывают одни и те же корпоративные знания, генерируют схожие эмбеддинги, поддерживают раздельные индексы и выстраивают пересекающиеся контексты для разных приложений, что приводит к дублированию инженерных усилий, лишним затратам на инфраструктуру и фрагментации знаний.

По своей сути это вовсе не проблемы инженерии контекста — это проблемы управления знаниями. Платформы корпоративных данных решили аналогичную задачу для структурированных данных, управляя ими единожды и предоставляя к ним совместный доступ из разных приложений. Теперь корпоративный ИИ требует такой же архитектурной дисциплины: единой платформы корпоративных знаний, которая управляет знаниями централизованно и публикует повторно используемые представления для каждого ИИ-приложения.

Многоуровневая система управления данными и знаниями

Платформа корпоративных знаний — это эквивалент платформы корпоративных данных, но созданный для корпоративных знаний. Вместо того чтобы рассматривать документы, исходный код, тикеты Jira, электронную почту, API и другие корпоративные системы как изолированные источники для отдельных ИИ-приложений, она управляет ими как общим корпоративным ресурсом. Она осуществляет сбор, организацию, интеграцию, управление (governance) и публикацию корпоративных знаний через общую архитектуру, благодаря чему каждое ИИ-приложение использует единую доверенную базу знаний, а не поддерживает собственный контекст.

Для этого платформа разделяет управление знаниями на четыре слоя с четко разграниченными обязанностями. Сначала знания сохраняются в исходном виде, затем нормализуются в управляемые объекты знаний, объединяются в общую модель корпоративных знаний и, наконец, публикуются в виде представлений, оптимизированных для различных ИИ-приложений. Такое разделение позволяет каждому этапу развиваться независимо, обеспечивая при этом надежный фундамент для каждого дочернего приложения.

Платформа организует корпоративные знания по четырем уровням:

Сырые данные (Raw) → Обработанные данные (Refined) → Интегрированные данные (Integrated) → Слой обслуживания (Serving)

  • Raw (Сырой слой) сохраняет оригинальные корпоративные источники.

  • Refined (Уточненный слой) преобразует разнородные источники в управляемые объекты знаний.

  • Integrated (Интегрированный слой) объединяет знания из разных систем в единую модель корпоративных знаний.

  • Serving (Слой обслуживания) публикует повторно используемые и специализированные для агентов представления для ИИ-приложений.

Сырой слой (Raw) — сохранение источника

Сырой слой захватывает информацию из корпоративных систем, сохраняя при этом ее исходную форму и идентификатор источника. Это могут быть записи баз данных и события изменений, файлы PDF и другие документы, страницы Confluence, тикеты Jira, исходный код, ответы API, электронные письма, изображения и потоки событий.

Цель этого слоя — не подготовить информацию для агента. Цель заключается в том, чтобы сохранить надежный первоисточник, из которого платформа сможет восстановить последующие знания. Если логика извлечения изменится, модель усовершенствуется или какое-то из дочерних представлений будет повреждено, информацию можно будет обработать заново без зависимости от копии, специфичной для конкретного приложения.

Уточненный слой (Refined) — нормализация корпоративных знаний

Уточненный слой преобразует разнородные корпоративные источники в управляемые объекты знаний. Каждый источник нормализуется в единое представление с сохранением его идентификатора, метаданных, прав доступа, версий, происхождения (lineage) и ссылок на исходный контент.

Например, документ с требованиями к продукту преобразуется в структурированный объект знаний, содержащий такие метаданные, как ID документа, ID продукта, название, исходная система, автор, версия, права доступа, теги, время создания и время последнего изменения, а также связанный с ними контент. Такое представление обеспечивает единый способ управления корпоративными знаниями независимо от того, является ли источником документ, тикет Jira, репозиторий исходного кода, электронное письмо или API.

На этом этапе платформа не пытается связать между собой различные домены. Вместо этого она создает повторно используемое и управляемое представление для каждого источника корпоративных знаний. Как только каждый источник нормализован в структурированные или полуструктурированные объекты знаний, интегрированный слой может связать их посредством общих бизнес-сущностей и связей.

Интегрированный слой (Integrated) — построение модели корпоративных знаний

Интегрированный слой преобразует независимые объекты знаний в единую модель корпоративных знаний. Он выполняет две задачи: связывает знания между различными системами и бизнес-доменами, а также моделирует бизнес-связи, необходимые ИИ для логического рассуждения.

Знания соединяются с помощью общих бизнес-идентификаторов (таких как ID продукта или клиента), явных межсистемных ссылок (таких как ссылки на Jira и Git) или разрешения сущностей с помощью ИИ, если прямая связь отсутствует. Например, документ с требованиями к продукту, описывающий «Массовую загрузку счетов», задача в Jira под названием «Реализовать API загрузки счетов» и примечание к выпуску (release note), анонсирующее ту же функцию, могут относиться к одной и той же бизнес-возможности, даже если между ними нет явной связи.

После установления связи платформа моделирует бизнес-отношения на основе бизнес-логики, такой как *implemented_by, contains, belongs_to, affects* и *depends_on*, отражая реальные процессы работы бизнеса, а не просто то, как связаны между собой записи.

В отличие от традиционных связей первичных и внешних ключей (primary and foreign keys), эти отношения описывают бизнес-рабочие процессы, зависимости, зоны ответственности и влияние на бизнес. Они позволяют ИИ прослеживать знания в области инженерии, разработки продуктов, техподдержки, финансов и других направлений, опираясь на общее понимание предприятия.

Слой обслуживания (Serving) — публикация знаний для ИИ

Слой обслуживания похож на слой контекста, используемый во многих корпоративных ИИ-приложениях, но он построен поверх управляемой базы корпоративных знаний. Он преобразует модель корпоративных знаний в представления, оптимизированные для различных рабочих нагрузок ИИ. Эти представления делятся на две категории.

Первая — это общие корпоративные представления, которые обеспечивают единую базу знаний для всех ИИ-приложений. Примеры включают SQL-представления, поисковые индексы, чанки, эмбеддинги, графовые модели и API, которые создаются один раз и повторно используются в масштабах всей организации.

Вторая — это представления, специфичные для конкретных агентов. Вместо того чтобы поддерживать раздельные копии корпоративных знаний, платформа динамически собирает контекст под конкретные задачи из интегрированной модели знаний в соответствии с потребностями каждого агента. Продуктовый агент (Product Agent), агент по доходам (Revenue Agent) и агент техподдержки (Customer Support Agent) могут использовать одну и ту же базу корпоративных знаний, получая при этом различный контекст, адаптированный под их задачи.

На диаграмме четко показана высокоуровневая модель слоя обслуживания:

                          Модель корпоративных знаний
                                        │
                ┌─────────────────────┴─────────────────────┐
                │                                               │
                ▼                                               ▼
    Общие корпоративные представления       Специфичные для агентов представления
  ┌───────────────────────────────┐         ┌──────────────────────────────┐
  │ SQL-представления              │         │ Контекст продукта            │
  │ Поисковый индекс                │         │ Контекст доходов             │
  │ Чанки                           │         │ Контекст клиента             │
  │ Эмбеддинги                      │         │ Контекст планирования        │
  │ Граф                            │         │ Контекст программирования    │
  │ API                             │         │ …                          │
  └───────────────────────────────┘         └──────────────────────────────┘
                │                                                │
                └──────────────────────┬─────────────────────┘
                                        │
        ┌────────────────────────────┼────────────────────────────┐
        ▼                               ▼                               ▼
  Продуктовый агент             Агент по доходам             Клиентский агент

Управляемая платформа знаний: фундамент данных для ИИ

Большинство современных корпоративных <систем знаний> создавались для людей, а не для ИИ. Страницы Confluence и документы помогают сотрудникам фиксировать знания и делиться ими. Jira позволяет командам планировать работу и сотрудничать. Системы метаданных помогают аналитикам понимать активы данных. Эти системы организуют информацию так, чтобы люди могли искать ее, интерпретировать и связывать воедино, используя собственный опыт, знания и суждения.

Большие языковые модели коренным образом изменили подход к потреблению корпоративных знаний. Теперь машины могут понимать естественный язык, рассуждать над документами и взаимодействовать с корпоративными знаниями способами, которые раньше были доступны только людям. Этот сдвиг требует большего, чем просто новые ИИ-приложения — он требует нового фундамента данных, который управляет корпоративными знаниями как инфраструктурой, а не рассматривает их просто как набор эмбеддингов.

Эта управляемая платформа корпоративных знаний служит фундаментом данных для ИИ-агентов. Она превращает ориентированные на человека системы знаний в готовую для ИИ инфраструктуру, организуя корпоративные знания в виде последовательной, повторно используемой и управляемой платформы данных.

Этот фундамент обеспечивает системные возможности, которые сложно или невозможно реализовать, когда каждое ИИ-приложение самостоятельно строит и управляет собственным контекстом.

Возможность платформы

Что она обеспечивает

Управление жизненным циклом знаний

Инкрементальная загрузка, распространение изменений, управление версиями и исторические рассуждения без необходимости перестраивать каждый конвейер контекста.

Управление (Governance) и доверие

Сквозное происхождение (lineage), прослеживаемость, права доступа, владение, контроль качества и объяснимые ответы ИИ со ссылками на исходные корпоративные источники.

Повторно используемые сервисы знаний

Общие поисковые индексы, эмбеддинги, графовые модели, SQL-представления, API и динамическая сборка контекста, которые можно использовать в разных приложениях вместо того, чтобы перестраивать их для каждого агента.

Непрерывная эволюция

Независимое развитие хранилищ, механизмов извлечения, моделей эмбеддингов и ИИ-приложений с одновременным использованием обратной связи от агентов для постоянного совершенствования корпоративных знаний.

Платформа также обеспечивает основу для рабочих процессов обучения с участием человека (human-in-the-loop) и обучения с подкреплением в агентских системах. Обратная связь, генерируемая ИИ-агентами, может поступать обратно в платформу, проходить валидацию, модерацию (governance) и интегрироваться в модель корпоративных знаний до того, как будет опубликована для дочерних ИИ-приложений. Это создает замкнутый цикл обратной связи, который непрерывно улучшает корпоративные знания и позволяет ИИ-агентам эволюционировать.

Следующее конкурентное преимущество — фундамент корпоративных данных

С момента выпуска ChatGPT 3 в конце 2022 года индустрия вложила колоссальные усилия в базовые модели (foundation models), RAG-архитектуры, векторные базы данных, эмбеддинги, MCP и мультиагентные фреймворки. Эти технологии значительно улучшили способы создания и развертывания ИИ-приложений. Сегодня стек ИИ-приложений стремительно взрослеет.

Следующим узким горлышком стали уже не модель или агентский фреймворк. Им является фундамент корпоративных данных, стоящий за ними. ИИ-агенты способны ровно на столько, насколько хороши данные и знания, которые они потребляют. Никакие улучшенные модели не смогут компенсировать фрагментированные документы, противоречивые бизнес-определения, несвязанные системы или плохо управляемые корпоративные знания. Как и любая система, работающая с данными до этого, корпоративный ИИ в конечном счете подчиняется тому же принципу: мусор на входе — мусор на выходе.

Наиболее важной инвестицией для предприятий становится уже не создание новых ИИ-агентов, а построение платформы корпоративных знаний, которая поддерживает каждого агента. Организации, которые рассматривают корпоративные знания как общую инфраструктуру, а не как контекст под конкретные приложения, смогут создавать более надежный ИИ, быстрее разрабатывать новые приложения и масштабировать ИИ по всему предприятию, не перестраивая каждый раз одну и ту же базу знаний.

Следующее конкурентное преимущество в корпоративном ИИ будет заключаться не в создании большего числа агентов. Оно будет проистекать из создания базы данных и знаний, от которой зависит каждый агент.

Шухуа Сюй (Shuhua Xu) — ведущий инженер по данным.

Добро пожаловать в сообщество VentureBeat!

Наша программа гостевых публикаций — это площадка, где технические эксперты делятся идеями и публикуют нейтральные, неангажированные глубокие обзоры об ИИ, инфраструктуре данных, кибербезопасности и других передовых технологиях, формирующих будущее бизнеса.

Читайте далее наши материалы из программы гостевых публикаций — и ознакомьтесь с нашими рекомендациями, если вы хотите предложить собственную статью!

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.