Credible делает ставку на открытый исходный код для слоя контекста ИИ
Источник: VentureBeat · Sean Michael Kerner
Предприятия всё больше доверяют ИИ-агентам ответы на вопросы, для которых раньше требовался специалист, хорошо понимающий бизнес, а не только структуру базы данных. Это доверие подразумевает, что агенту предоставлен точный и непротиворечивый контекст, однако значительная часть рынка до сих пор не может этого гарантировать.
Именно этот пробел призвана закрыть компания Credible Data. Ее платформа работает на базе Malloy — языка семантического моделирования с открытым исходным кодом — и хранит семантическую модель клиента в виде переносимого кода, а не проприетарных метаданных. В понедельник компания объявила о привлечении начального раунда финансирования (seed) в размере $10 млн от Gradient, SignalFire и K5 Global, а также от бизнес-ангелов, включая соучредителя Fivetran Тейлора Брауна и соучредителя G2 Годарда Абеля.
Масштаб проблемы наглядно виден в цифрах. Согласно опросу VB Pulse, проведенному в июне среди 101 квалифицированного предприятия, 57% респондентов за последние шесть месяцев сталкивались с тем, что уверенно заблуждающийся ИИ-агент выдавал ответ из-за отсутствия или несогласованности бизнес-контекста, причем 31% отметили, что это происходило неоднократно. Лишь 25% в настоящее время используют управляемый слой контекста в рабочих средах (production), в то время как 34% все еще занимаются его созданием, а 41% даже не приступали к этому.
Генеральный директор и основатель Кайл Несбит познакомился с создателем Malloy и основателем Looker Ллойдом Таббом во время работы в Google после приобретения последней компании Looker, когда Табб начал разрабатывать язык, который он охарактеризовал как главный проект своей профессиональной жизни. Несбит рассказал о проблеме, которая в итоге заставила его уйти из Google и основать Credible.
«Это та же самая боль, с которой люди сталкиваются уже 30 лет — отсутствие управляемого анализа данных, — рассказал Несбит в эксклюзивном интервью VentureBeat. — Теперь, с приходом ИИ, проблема осталась прежней, но хаоса и боли стало на порядки больше».
Как Credible работает на практике
Все, что создает Credible, работает на базе Malloy.
Malloy — это язык семантического моделирования с открытым исходным кодом, но в отличие от большинства конкурирующих продуктов, включая собственный LookML от Looker, он также является полноценным языком запросов. Несбит утверждает, что именно это сочетание выделяет его среди остальных.
«Malloy может делать все то же, что и SQL, — пояснил Несбит. — Это полноценный язык семантических моделей плюс язык запросов, спроектированный так, что все, что вы можете выразить на SQL, можно выразить и на Malloy».
Malloy был создан в Google как язык с открытым исходным кодом и с самого начала распространялся под лицензией MIT. Впоследствии он был передан новообразованному Фонду Malloy (Malloy Foundation), некоммерческой организации, первым корпоративным спонсором которой, по словам Несбита, станет Credible. В результате получается семантический слой, управление которым находится вне коммерческих интересов самой Credible, причем структура построена так, что ни один отдельный вендор не контролирует язык, на котором строят свои решения клиенты.
Платформа Credible построена поверх этого фундамента и делится на три основные части.
Контекст данных. Это сама семантическая модель: определения, связи и типы данных, которые делают исходные данные пригодными для использования как людьми, так и агентами.
Контекст рабочих процессов (Workflow context). Несбит называет это «навыками» (skills) — инструкциями о том, как агент должен фактически использовать эти данные после их получения. Credible открыла исходный код своего стандартного набора навыков и работает с клиентами над его расширением под их собственные рабочие процессы.
Переносимость. Она обеспечивается благодаря двойной роли Malloy как языка моделирования и языка запросов. Компания создала сервер с открытым исходным кодом под названием Malloy publisher для компиляции и обслуживания моделей Malloy, а клиенты могут запускать его облегченную версию локально вместе с агентом для написания кода, чтобы создавать и тестировать модели данных перед их развертыванием.
«Как только вы разработали эту модель и приложение для работы с данными локально, оно по сути превращается в пакет, в артефакт, который вы можете передать Credible для обслуживания с элементами контроля корпоративного уровня или упаковать и обслуживать самостоятельно».
Дилемма «создать или купить» глазами раннего клиента
Питер Нуммердор, старший вице-президент по управлению продуктами в рекламной технологической компании VideoAmp, столкнулся с этой проблемой еще до того, как Credible появилась на рынке. В 2023 году VideoAmp создала собственный чат-бот для аналитики на естественном языке на базе AWS Bedrock. Команда так и не вывела его на рынок. Проблемы с качеством данных сделали ответы бота ненадежными, а проектирование промптов и контекста, необходимое для предотвращения галлюцинаций, потребовало усилий, которые не принесли ничего пригодного для повторного использования после завершения проекта.
Этот опыт определил то, как VideoAmp оценивала Credible, когда появилась такая возможность.
«Мы четко осознали, что после полученных ранее уроков это продукт категории «купить», который позволит нам сосредоточиться на нашем основном бизнесе».
VideoAmp использует Credible для создания семантических моделей своих клиентских данных. Credible располагается между хранилищем исходных данных и контекстным окном, поэтому запросы на естественном языке находят нужные метрики и измерения. Она также обеспечивает работу слоя извлечения данных (retrieval layer), который возвращает размеченные данные в агенты VideoAmp. Нуммердор прямо объяснил, почему эта инфраструктурная работа важнее, чем может показаться на первый взгляд.
«Вы можете быстро создать что-то, что в целом выглядит неплохо. Какой-нибудь конкурент может загрузить в Claude CSV-файл с данными и сделать симпатичную панель мониторинга».
Конкурентный рынок контекста
Credible пополняет растущий список решений, предлагающих различные подходы к решению проблемы контекста для ИИ.
Недавно компания Snowflake запустила продукты Horizon Context и Cortex Sense, которые предоставляют контекст, определяемый самой Snowflake и ее клиентами. У Amazon есть служба AWS Context — граф знаний, который обучается на основе того, как агенты используют его, а не на ручной кураторской обработке. Производители баз данных, включая Pinecone, Couchbase, Redis и даже Oracle, имеют собственные контекстные слои, которые, как правило, тесно связаны с лежащей в их основе базой данных.
Credible выделяется на этом фоне благодаря использованию технологии с открытым исходным кодом Malloy в качестве фундамента, что обещает переносимость данных и экспертизу в сфере бизнес-аналитики (BI), унаследованную от Looker.
Однако такая открытость может сделать компанию уязвимой, поскольку у нее нет особо прочного конкурентного рва: любая организация или крупный облачный провайдер могут создать аналогичное решение на базе открытых технологий.
«У нас есть опыт работы с распределенными системами и машинным обучением, который редко встретировть сконцентрированным в такой организации, как наша, — отметил Несбит. — Но мы находимся на самом раннем этапе этой революции ИИ, и сохранение лидерства на переднем крае — это то, что позволит нам выделиться, когда технологическая кривая выровняется».
Что это значит для предприятий
Слой семантического контекста становится элементом производственной инфраструктуры, которую команды по работе с данными должны понимать и уметь администрировать. Подход Credible — это один из ответов на вопрос, с которым теперь неизбежно сталкивается каждая команда, оценивающая данную категорию: сколько контроля следует передать вендору над слоем, определяющим значение их данных.
Право собственности теперь является актуальным вопросом закупок. Годами семантический слой находился внутри того инструмента работы с данными, который использовала компания, и мало кто задумывался о том, что с ним происходит при смене платформы. ИИ-агенты повышают ставки, поскольку теперь этот слой управляет решениями, а не просто информационными панелями (дашбордами). Это делает вопрос переносимости тем, о чем стоит напрямую спрашивать поставщика, а не принимать как должное.
Эта категория все еще находится в стадии становления, поэтому ни одно решение пока нельзя назвать абсолютно надежным. Команды, выбирающие архитектуру сегодня, делают это в условиях, когда рынок еще не определил, какой именно подход одержит победу.
Отполированная демонстрация и контекстный слой производственного уровня выглядят одинаково до тех пор, пока не подвергнутся тщательной проверке. Любой может подключить языковую модель (LLM) к электронной таблице и выдать нечто, выглядящее завершенным. Разница между ними проявляется лишь тогда, когда запросы усложняются, а граничные случаи начинают генерировать обращения в техподдержку — именно этот урок VideoAmp усвоила на собственном горьком опыте, прежде чем обратить внимание на Credible.
«Только когда дело доходит до практики и вы по-настоящему анализируете качество, ваш стек данных начинает иметь значение», — резюмировал Нуммердор.



