GraphRAG повышает точность многошаговых ответов на вопросы на 20%

GraphRAG повышает точность многошаговых ответов на вопросы на 20%
Image one

Предоставлено автором

Если за последние два года вы создавали что-либо с использованием поисково-дополненной генерации (RAG), вы наверняка столкнулись с ее главным разочарованием: вы разбиваете документы на фрагменты, векторизуете их, извлекаете несколько наиболее похожих на ваш вопрос фрагментов и передаете их модели. Для задачи вроде «Какова была наша политика возврата средств в третьем квартале?» это работает великолепно. Для задачи «Каковы повторяющиеся темы в отзывах клиентов за два года?» этот подход терпит крах, поскольку ни один отдельный фрагмент не содержит ответа целиком.

Модное средство решения этой проблемы — GraphRAG: вместо того чтобы скармливать модели разрозненные фрагменты, вы сначала строите граф знаний об имеющихся в вашем корпусе сущностях и связях между ними, а затем используете эту структуру в качестве контекста. Такой подход звучит соблазнительно. Но соблазнительные идеи заслуживают проверки, поэтому я изучил факты — оригинальную статью Microsoft, а также четыре независимых бенчмарк-исследования — чтобы ответить на простой вопрос: действительно ли ответы становятся лучше, если заменить текстовые фрагменты графом контекста?

Короткий ответ: да, существенно — но лишь для определенного типа вопросов и не бесплатно. Позвольте мне представить доказательства.

Почему текстовые фрагменты упираются в тупик

Стандартный векторный RAG извлекает k отрывков, наиболее близких к вашему запросу. Такая архитектура имеет три структурных «слепых пятна»:

  • Он не умеет сопоставлять факты. Когда для ответа требуется объединить факты из разных частей текста через общую сущность, изолированные друг от друга фрагменты никогда не покажут эту связь.

  • Он слеп к глобальным вопросам. Вопрос «Каковы основные темы?» требует анализа всего корпуса документов, однако поиск по сходству возвращает лишь горстку фрагментов, которые лишь поверхностно напоминают запрос.

  • Он разрывает контекст на границах фрагментов. Отношения и иерархия, от которых зависит сложное логическое мышление, — это как раз то, что отбрасывается при разбиении на куски.

Подразделение Microsoft Research сформулировало это предельно четко при представлении GraphRAG: базовый RAG «испытывает трудности с объединением разрозненных фактов» и плохо справляется с задачами «целостного понимания обобщенных семантических концепций на больших объемах данных».

Что меняет граф контекста

GraphRAG решает проблему еще до того, как задан какой-либо вопрос. На этапе индексации большая языковая модель (LLM) читает каждый фрагмент, извлекает сущности, связи и утверждения, собирая их утяжеленный граф знаний. Затем запускается алгоритм обнаружения сообществ (алгоритм Лейдена), который разбивает граф на иерархию связанных тем и заранее записывает резюме на естественном языке для каждого сообщества.

Во время запроса именно эти резюме выполняют основную работу. Каждое релевантное сообщество формирует частичный ответ (шаг «map» — сопоставление), частичные ответы ранжируются и объединяются (шаг «reduce» — свертка), а модель синтезирует окончательный ответ, опираясь на структуру, а не на несколько выхваченных наугад отрывков. Альтернативные варианты, такие как HippoRAG, идут другим путем, используя граф в сочетании с обходом Personalized PageRank для поиска нужных отрывков — но суть остается прежней: позвольте связям, а не только косинусному сходству, определять, какой контекст видит модель.

Доказательства: Четыре исследования, одна закономерность

1. Глобальное осмысление: Главная победа

Компания Microsoft противопоставила GraphRAG наивному RAG при ответах на глобальные вопросы типа «осмыслить весь корпус целиком» на датасетах размером в миллионы токенов, причем LLM выступала в роли судьи по трем осям: полнота, разнообразие и информативность.

GraphRAG победил в 72–83% сравнений по полноте и в 62–82% сравнений по разнообразию по сравнению с векторным RAG. Его высокоуровневые резюме расходовали на 97% меньше токенов по сравнению с прямой обработкой исходного текста.

Это не погрешность измерений. Точно для такого рода вопросов, которые ставят в тупик текстовый RAG, граф выигрывает в двух случаях из трех или даже чаще.

2. Многошаговый поиск: Граф находит то, что пропускают фрагменты

Второе свидетельство касается качества извлечения: попадает ли вообще правильный вспомогательный отрывок в топ результатов? В стандартных многошаговых бенчмарках QA (MuSiQue, HotpotQA, 2WikiMultiHopQA) поиск на базе графов драматически повышает показатель Recall@5:

  • Средний показатель Recall@5 вырастает с 73,4% (у наивного RAG) до 87,8% (с поддержкой графа), что дает прирост в +19,6 пункта.

  • Наибольший скачок наблюдается на самых сложных кросс-документных наборах: +31 пункт на MuSiQue и +28 пунктов на 2Wiki.

  • Авторы HippoRAG сообщают о росте точности многошагового QA до 20% при в 10–20 раз меньших затратах и в 6–13 раз более высокой скорости по сравнению с методами итеративного поиска.

3. Контролируемое прямое сравнение — где все становится честно

Здесь картина становится более тонкой. В исследовании 2025 года, проведенном специалистами из Университета штата Мичиган и Meta, стандартный RAG сравнивался с четырьмя семействами GraphRAG в рамках единого протокола (с одинаковым разбиением на фрагменты, эмбеддингами и генерацией) и не выявил единоличного победителя. Эти два подхода дополняют друг друга:

  • В задачах одношагового поиска фактов (на естественных вопросах) простой RAG слегка опередил конкурентов (F1 64.8 против 63.0 у лучшего графового метода).

  • В задачах многошаговых рассуждений (MultiHop-RAG) графовый поиск вышел вперед (общая точность 70.3 против 67.0).

Урок таков: граф контекста — это не универсальное улучшение. Это специализированный инструмент, который окупается именно тогда, когда вопросы требуют рассуждений с привлечением нескольких источников.

4. Когда использовать графы: Вердикт по типам задач

Самый свежий бенчмарк, GraphRAG-Bench (ICLR 2026), поставил задачу ответить на вопрос: «В каких сценариях графовые структуры дают измеримую пользу?» Его показатели точности в зависимости от задачи четко очерчивают границы:

  • Простой поиск фактов: Текстовые фрагменты 60.9 против графа 60.1 — фактически ничья. Структура графа представляет собой избыточную нагрузку, которая не нужна для данного запроса.

  • Сложные рассуждения: Граф 53.4 против фрагментов 42.9 — победа графа в +10 пунктов.

  • Контекстная суммаризация: Граф 64.4 против фрагментов 51.3 — победа графа в +13 пунктов.

Табло результатов

Comparison table of study results showing GraphRAG's performance improvements in various tasks and metrics.

Предоставлено автором

Если читать от начала до конца, эта закономерность очевидна: преимущество графа растет по мере увеличения глубины рассуждений, в то время как текстовые фрагменты удерживают свои позиции при работе с изолированными фактами.

Подводные камни: Стоимость и проблема судей на базе LLM

Два важных нюанса мешают назвать этот подход безоговорочной победой, и их игнорирование приводит к разочарованию команд.

Построение графа обходится дорого. Извлечение сущностей и связей из всего корпуса документов с помощью LLM стоит недешево. Один из анализов показал, что создание индекса на базе GPT-4o для умеренного корпуса обошлось примерно в $48, что намного дороже простого векторного индекса. (Собственная разработка Microsoft, LazyGraphRAG, откладывает извлечение на момент запроса и снижает затраты примерно до 0,1% от прежней стоимости — молчаливое признание того, что первоначальный бюджет непрактичен для многих внедрений).

Многие победы присуждаются другой LLM, а судьи на базе LLM предвзяты. Независимый аудит выявил систематические ошибки в таком стиле оценки: предвзятость по позиции (изменение порядка вывода ответов может качнуть долю побед более чем на 30 пунктов), предвзятость по длине и предвзятость экспериментов (одинаковые сравнения дают разные результаты при перезапусках). После внесения поправок заявленный одним популярным методом показатель успешности в 66.7% упал примерно до 39%, что ниже точки безубыточности в 50%.

Вывод заключается вовсе не в том, что «исследования неверны». Он состоит в том, что крупные достижения — рост точности многошагового поиска на 20%, скачки показателя recall на 15–30 пунктов — являются надежными, в то время как небольшие расхождения в показателях полноты заслуживают скептического пересмотра с использованием метрик на основе эталонов.

Так когда же стоит использовать граф контекста?

Если отбросить рекламную шелуху, принятие решения становится на удивление прагматичным.

Используйте граф контекста, если: ваши вопросы предполагают многошаговый поиск, носят глобальный характер или направлены на осмысление информации; вам нужны исчерпывающие ответы с разных точек зрения; ваш корпус тесно взаимосвязан (исследовательские библиотеки, материалы судебных дел, истории инцидентов, базы знаний).

Оставайтесь на текстовых фрагментах, если: ваши запросы в основном сводятся к поиску одиночных фактов; ваш корпус мал или плоский; а затраты на индексацию, задержка и простота эксплуатации перевешивают маргинальный прирост качества.

Лучше всего — используйте гибридный подход: систематические исследования сходятся в одной рекомендации: направляйте каждый запрос к подходящему методу или объединяйте результаты обоих подходов. Сочетание графового поиска и поиска по фрагментам неизменно превосходит каждый из них по отдельности. Вам не нужно слепо веровать во что-то одно; вам нужно построить маршрутизатор.

Итог

Граф контекста — это не магия и не панацея. Это целевой инструмент. Дайте ему задачу, требующую соединения разрозненных фактов или синтеза всего корпуса, и он решит ее значительно лучше текстовых фрагментов. Попросите его найти «номер телефона на странице 3», и вы просто заплатите за ненужную вам индексацию.

Команды, которые добравутся успеха с GraphRAG в 2026 году, — это не те, кто запрограммирует в граф абсолютно все. Это те, кто знает, какие вопросы заслуживают графа, и создают достаточно умные пайплайны, чтобы отличать их друг от друга.

Даттарадж Рао — архитектор по исследованиям и разработкам в Persistent Systems

Добро пожаловать в сообщество VentureBeat!

Наша программа гостевых публикаций предназначена для того, чтобы технические эксперты могли делиться идеями и предоставлять объективные, неангажированные аналитические материалы об искусственном интеллекте, инфраструктуре данных, кибербезопасности и других передовых технологиях, формирующих будущее бизнеса.

Читайте далее в рамках нашей программы гостевых постов и ознакомьтесь с нашими рекомендациями, если вы хотите опубликовать собственную статью!

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.