Добавление всего одного простого предложения в промпты делает ИИ-модели намного креативнее
Одна из самых классных особенностей генеративных ИИ-моделей — как больших языковых моделей (LLM), так и диффузионных генераторов изображений — заключается в том, что они являются «недетерминированными». Иными словами, несмотря на репутацию «модного автозамена», закрепившуюся за ними среди некоторых критиков, модели генеративного ИИ на самом деле формируют свои ответы, выбирая из распределения наиболее вероятных следующих токенов (единиц информации).
Если спросить LLM: «Какова столица Франции?», она проанализирует свое распределение вероятностей для слов «Франция», «столица», «города» и т. д., чтобы прийти к ответу «Париж». Но этот ответ может прозвучать как «Столица Франции — Париж», просто «Париж» или «Париж, хотя в какой-то момент ею был Версаль».
Тем не менее те из нас, кто регулярно пользуется этими моделями в повседневной жизни, замечают, что иногда их ответы кажутся раздражающе однотипными или похожими друг на друга. Расхожая шутка про кофе тиражируется из поколения в поколение запросов. Подсказки для историй порождают схожие сюжетные арки. Даже задачи, которые должны давать множество правдоподобных вариантов — например, перечисление штатов США, — склонны сводиться всего к нескольким. Это явление, известное как коллапс мод (mode collapse), возникает в процессе посттренировочной настройки (alignment) и ограничивает полезность в остальном мощных моделей.
Особенно когда мы используем LLM для создания новых творческих работ в области письма, коммуникаций, стратегии или иллюстраций, нам хочется, чтобы их результаты были еще более разнообразными, чем сейчас.
Теперь группа исследователей из Северо-Восточного университета, Стэнфордского университета и Университета Западной Вирджинии придумала гениально простой способ заставить языковые и графические модели выдавать более широкий спектр ответов практически на любой пользовательский запрос с помощью добавления всего одного простого предложения: «Сгенерируйте 5 ответов с соответствующими вероятностями, выбранных из полного распределения».
Этот метод, названный вербализованной выборкой (Verbalized Sampling, VS), помогает таким моделям, как GPT-4, Claude и Gemini, выдавать более разнообразные и похожие на человеческие результаты — без необходимости дообучения или доступа к внутренним параметрам. Он описан в статье, опубликованной в рецензируемом онлайн-журнале открытого доступа arxiv.org в начале октября 2025 года.
Получая запрос в таком формате, модель больше не возвращается по умолчанию к своему самому безопасному и типичному варианту ответа. Вместо этого она вербализует свое внутреннее распределение возможных продолжений и делает выборку по более широкому спектру возможностей. Это изменение всего в одну строку приводит к существенному росту разнообразия ответов в самых разных сферах.
Как написала в X Вэйянь Ши (Weiyan Shi), доцент Северо-Восточного университета и соавтор исследования: «Возможности LLM еще не раскрыты до конца! Как показано в нашей статье, оптимизацией промптов можно управлять, если учитывать то, как LLM обучаются и настраиваются, и это можно доказать теоретически».
Почему происходит коллапс мод и как VS его обращает вспять
По мнению исследовательской группы, первопричина коллапса мод кроется не только в таких алгоритмах, как обучение с подкреплением на основе отзывов людей (RLHF), но и в самой структуре человеческих предпочтений. Люди склонны оценивать более знакомые или типичные ответы как лучшие, что в процессе тонкой настройки подталкивает LLM к «безопасным» вариантам в ущерб разнообразным.
Однако эта предвзятость не стирает базовые знания модели — она лишь подавляет их. Метод VS работает за счет обхода этого подавления. Вместо того чтобы запрашивать единственный наиболее вероятный результат, он предлагает модели раскрыть набор правдоподобных ответов и их относительных вероятностей. Такое промптирование на уровне распределения восстанавливает доступ к более богатому разнообразию, заложенному на этапе предварительного обучения модели.
Реальная эффективность в различных задачах
Исследовательская группа протестировала вербализованную выборку в нескольких распространенных сценариях использования:
-
Творческое письмо: в задачах генерации историй VS увеличивала показатели разнообразия до 2,1 раза по сравнению со стандартным промптированием, сохраняя при этом высокое качество. Один из промптов для истории — «Без прощания» — при прямом запросе давал шаблонные сцены расставания, но при использовании VS порождал сюжеты с космическими катаклизмами, молчаливыми электронными письмами и музыкой, обрывающейся посреди танца.
-
Симуляция диалога: в задачах убеждающего диалога VS позволила моделям имитировать свойственные людям паттерны поведения, такие как нерешительность, сопротивление и смена мнения. Распределение поведения при пожертвованиях в условиях применения VS оказалось ближе к реальным данным о людях по сравнению с базовыми методами.
-
Открытые вопросы и ответы (QA): при просьбе перечислить валидные варианты (например, назвать штаты США) модели, использующие VS, генерировали ответы, которые гораздо точнее отражали разнообразие данных реального мира. Они охватывали более широкий спектр ответов без ущерба для фактической точности.
-
Генерация синтетических данных: при использовании для создания математических задач с целью обучения моделей VS формировала более разнообразные наборы данных. Это, в свою очередь, улучшило итоговые результаты на бенчмарках по соревновательной математике, превзойдя синтетические данные, полученные с помощью прямого промптирования.
Настраиваемое разнообразие и эффективное использование более крупных моделей
Важным преимуществом VS является ее настраиваемость. Пользователи могут задать порог вероятности в запросе, чтобы делать выборку из низковероятных «хвостов» распределения модели. Более низкие пороги соответствуют более высокой степени разнообразия. Эту настройку можно выполнять только с помощью текста промпта, не изменяя никакие параметры декодирования, такие как температура или top-p.
В ходе одного из тестов с использованием модели Gemini-2.5-Flash разнообразие в написании историй неуклонно росло по мере снижения порога вероятности с 1 до 0,001. График, сопровождавший исследование, показал, что VS превосходит как прямое, так и последовательное промптирование при всех пороговых значениях.
Интересно, что этот метод отлично масштабируется в зависимости от размера модели. Более крупные модели, такие как GPT-4.1 и Claude-4, показали еще более значительный прирост от VS по сравнению с меньшими аналогами. Хотя выгода наблюдалась и у небольших моделей, улучшение разнообразия было примерно в 1,5–2 раза сильнее у их более крупных собратьев, что говорит о том, что VS помогает раскрыть бóльшую часть скрытых возможностей передовых моделей.
Развертывание и доступность
Метод вербализованной выборки теперь доступен в виде пакета Python:
pip install verbalized-sampling
Пакет включает интеграцию с LangChain и поддерживает простой интерфейс для выборки из вербализованного распределения. Пользователи также могут настраивать такие параметры, как k (количество ответов), пороги и температуру в соответствии со своими задачами.
Рабочий блокнот Colab и документация доступны по лицензии Apache 2.0, дружественной к корпоративному сектору, на GitHub по адресу: https://github.com/CHATS-lab/verbalized-sampling
Практические советы и частые проблемы
Хотя метод работает со всеми основными LLM, некоторые пользователи на начальном этапе могут столкнуться с отказами или ошибками.
В таких случаях авторы рекомендуют использовать версию шаблона на уровне системного промпта или обратиться к альтернативным форматам, указанным на странице GitHub.
Некоторые модели интерпретируют сложные инструкции как попытки джейлбрейка и отказываются их выполнять, если структура недостаточно ясна.
Например, составление запроса в виде системной инструкции повышает надежность:
Ты — полезный ассистент. Для каждого запроса сгенерируй пять ответов внутри отдельных тегов, каждый с вероятностью ниже 0,10.
Это небольшое изменение обычно решает все проблемы.
Простое и эффективное решение масштабной проблемы
Вербализованная выборка представляет собой практичный способ устранения глубокого ограничения в поведении современных языковых моделей на этапе инференса. Этот метод не требует дообучения модели или внутреннего доступа к ней. Он не зависит от какого-то одного семейства моделей. И он повышает не только разнообразие результатов, но и их качество, судя как по оценкам людей, так и по баллам в бенчмарках.
На фоне растущего интереса к инструментам, расширяющим творческий потенциал моделей, VS, судя по всему, ждет быстрое внедрение в таких областях, как письмо, дизайн, симуляция, образование и генерация синтетических данных.
Для пользователей и разработчиков, разочарованных одинаковым характером ответов LLM, решение может заключаться в банальном изменении формулировки вопроса.



