Большие языковые модели симулируют поведение потребителей с точностью 90%

Большие языковые модели симулируют поведение потребителей с точностью 90%

Новое исследование, тихо опубликованное на прошлой неделе, описывает прорывной метод, который позволяет большим языковым моделям (LLM) с поразительной точностью симулировать поведение потребителей. Эта разработка способна перевернуть многомиллиардную индустрию маркетинговых исследований. Данная методика обещает создание целой армии синтетических потребителей, способных предоставлять не только реалистичные оценки продуктов, но и качественное обоснование к ним в масштабах и сA скоростью, которые до сих пор были недостижимы.

Компании годами пытались использовать ИИ для маркетинговых исследований, но натыкались на фундаментальное препятствие: когда LLM просят выставить числовую оценку по шкале от 1 до 5, они выдают нереалистичные и плохо распределенные ответы. В новой работе «LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings», поданной на сервер препринтов arXiv 9 октября, предлагается изящное решение, которое полностью обходит эту проблему.

Международная команда исследователей во главе с Бенджамином Ф. Майером разработала метод, получивший название рейтинга семантического сходства (SSR). Вместо того чтобы просить LLM назвать число, SSR запрашивает у модели развернутое текстовое мнение о продукте. Затем этот текст преобразуется в числовой вектор («эмбеддинг»), и его сходство измеряется по набору предопределенных эталонных утверждений. Например, ответ вроде «Я бы обязательно это купил, это именно то, что я искал» окажется семантически ближе к эталонному утверждению для оценки «5», чем для оценки «1».

Результаты поражают. При тестировании на масштабном реальном наборе данных от ведущей корпорации по производству средств личной гигиены, включающем 57 обзоров продуктов и 9 300 ответов реальных людей, метод SSR достиг 90% надежности повторного тестирования по сравнению с людьми. Что еще более важно, распределение сгенерированных ИИ оценок статистически почти не отличалось от ответов фокус-группы людей. Авторы заявляют: «Данная структура позволяет проводить масштабируемые симуляции потребительских исследований, сохраняя при этом традиционные метрики опросов и их интерпретируемость».

Своевременное решение на фоне угрозы честности опросов со стороны ИИ

Эта разработка появилась как нельзя кстати: достоверность традиционных онлайн-опросов все сильнее страдает от внедрения ИИ. Анализ Высшей школы бизнеса Стэнфордского университета за 2024 год выявил растущую проблему: участники опросов стали использовать чат-ботов для генерации ответов. Выяснилось, что такие сгенерированные ИИ ответы «подозрительно милы», излишне многословны и лишены «язвительности» и аутентичности живых отзывов. Это ведет к так называемой «гомогенизации» данных, способной замаскировать серьезные проблемы, такие как дискриминация или недостатки продукта.

Исследование Майера предлагает совершенно иной подход: вместо того чтобы бороться с загрязненными данными, оно создает контролируемую среду для генерации высококачественных синтетических данных с нуля.

«Мы наблюдаем переход от обороны к нападению, — отметил один из аналитиков, не участвовавших в исследовании. — Стэнфордский доклад продемонстрировал хаос неконтролируемого ИИ, загрязняющего массивы данных о людях. Эта новая работа показывает порядок и пользу контролируемого ИИ, создающего собственные наборы данных. Для директора по работе с данными (CDO) это разница между очисткой зараженного колодца и подключением к чистому источнику».

От текста к намерению: технический скачок в создании синтетического потребителя

Техническая обоснованность нового метода держится на качестве текстовых эмбеддингов — концепции, исследованной в работе 2022 года в журнале EPJ Data Science. В этом исследовании отстаивалась необходимость строгой концептуальной валидности, гарантирующей, что текстовые эмбеддинги (числовые представления текста) действительно «измеряют то, что должны».

Успех метода SSR говорит о том, что его эмбеддинги эффективно улавливают нюансы потребительских намерений. Чтобы эта новая технология получила широкое распространение, бизнесу необходимо обрести уверенность в том, что лежащие в ее основе модели не просто генерируют правдоподобный текст, но и преобразуют его в оценки надежным и осмысленным образом.

Этот подход также знаменует собой значительный шаг вперед по сравнению с предыдущими исследованиями, в основном сосредоточенными на использовании текстовых эмбеддингов для анализа и прогнозирования оценок из уже существующих онлайн-отзывов. Например, в исследовании 2022 года оценивалась эффективность таких моделей, как BERT и word2vec, при прогнозировании рейтингов отзывов на торговых площадках, причем выяснилось, что более новые модели вроде BERT лучше подходят для общего применения. Новое же исследование выходит за рамки анализа существующих данных и переходит к генерации принципиально новых прогностических инсайтов еще до того, как продукт попадет на рынок.

Заря цифровых фокус-групп

Для лиц, принимающих технические решения, последствия этого колоссальны. Возможность за считанные часы развернуть «цифровой двойник» целевого сегмента потребителей и протестировать концепты продуктов, рекламные тексты или варианты упаковки способна кардинально ускорить циклы инноваций.

Как отмечается в статье, эти синтетические респонденты также предоставляют «богатые качественные отзывы, объясняющие их оценки», предлагая сокровищницу данных для разработки продуктов, которая одновременно масштабируема и интерпретируема. И хотя эпоха исключительно человеческих фокус-групп далеко не закончена, данное исследование предоставляет самое веское на сегодняшний день доказательство того, что их синтетические аналоги готовы к работе.

Однако экономическая выгода выходит за рамки скорости и масштаба. Задумайтесь об экономике: традиционная панель респондентов для национального запуска продукта может стоить десятки тысяч долларов и занять недели на проведение. Симуляция на базе SSR способна предоставить сопоставимые выводы за малую долю времени, при минимальных затратах и с возможностью мгновенной итерации на основе полученных результатов. Для компаний из сектора быстродвижущихся потребительских товаров (FMCG), где разрыв между концепцией и полкой магазина может определить лидерство на рынке, такое преимущество в скорости может стать решающим.

Конечно, существуют и оговорки. Метод прошел валидацию на средствах личной гигиены; его эффективность в сложных B2B-закупках, сфере предметов роскоши или культурно специфических товарах пока не доказана. И хотя в статье демонстрируется, что SSR может воспроизводить совокупное человеческое поведение, она не претендует на предсказание выбора каждого отдельного потребителя. Техника работает на уровне популяции, а не конкретного человека — это различие имеет огромно значение для таких задач, как персонализированный маркетинг.

И тем не менее, даже с учетом этих ограничений, данное исследование является поворотным моментом. И хотя эпоха чисто человеческих фокус-групп еще далека от завершения, эта статья дает самое убедительное на сегодня доказательство того, что их синтетические аналоги готовы к работе. Вопрос теперь заключается не в том, может ли ИИ симулировать потребительские настроения, а в том, сможет ли бизнес двигаться достаточно быстро, чтобы извлечь из этого выгоду раньше конкурентов.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.