Почему проблема «гоблинов» в OpenAI имеет значение — и как вы можете выпустить гоблинов на волю самостоятельно

Почему проблема «гоблинов» в OpenAI имеет значение — и как вы можете выпустить гоблинов на волю самостоятельно

Источник: VentureBeat · Carl Franzen

ИИ — это больше, чем технология, это магия.

Не верите? Почему же тогда одна из ведущих компаний в этой сфере, OpenAI, публикует целые официальные корпоративные статьи о гоблинах?

Чтобы разобраться, нам нужно вернуться в начало этой недели, в понедельник, 27 апреля 2026 года, когда разработчик под ником @arb8020 в социальной сети X опубликовал фрагмент кода из репозитория OpenAI с открытым исходным кодом Codex на GitHub, а именно из файла с именем models.json.

Глубоко в инструкциях для новой большой языковой модели (LLM) от OpenAI — GPT-5.5 — выделялось странное предписание, повторенное четыре раза для пущей убедительности:

«Никогда не упоминайте гоблинов, гремлинов, енотов, троллей, огров, голубей или других животных и существ, если это абсолютно и однозначно не относится к запросу пользователя».

Эта находка произвела эффект разорвавшейся бомбы в кругах продвинутых пользователей и исследователей машинного обучения (ML).

Спустя всего несколько часов пост стал вирусным не из-за уязвимости в системе безопасности, а из-за своей абсолютной, ошеломляющей конкретики.

Почему ведущая мировая ИИ-лаборатория выпустила то, что пользователи Reddit быстро окрестили «охранным ордером» против голубей и енотов?

Спекуляции о гоблинах нарастают

Первая реакция представляла собой хаотичную смесь юмора и технического скептицизма. В сабреддитах r/ChatGPT и r/OpenAI пользователи начали делиться скриншотами поведения GPT-5.5 до выхода патча.

Бэррон Рот (Barron Roth), старший менеджер по проектам в области прикладного ИИ в Google, поделился в X под ником @iamBarronRoth изображением своего агента OpenClaw на базе GPT-5.5, который казался «одержимым гоблинами».

Другие сообщали, что модель упрямо называла технические баги «гремлинами в машине».

Разработчики вроде Стерлинга Криспина (Sterling Crispin) подыграли этому абсурду, в шутку предположив, что колоссальное водопотребление современных дата-центров на самом деле необходимо для охлаждения «гоблинов, которых заставляют работать».

Более серьезно исследователи на Hacker News и других площадках обсуждали проблему «розового слона». В промпт-инжиниринге призыв к модели не думать о чем-либо часто лишь делает эту концепцию более заметной в ее механизме внимания.

«Где-то в компании сидит инженер OpenAI, которому пришлось ввести never mention goblins в продакшн-код, закоммитить его и продолжить свой день», — отметил один из комментаторов на Reddit.

Упоминание «голубей» и «енотов» породило самые дикие догадки: была ли это защита от специфической атаки с отравлением данных? Или тренеры по обучению с подкреплением просто «подверглись травле со стороны енота» во время обеденного перерыва?

Напряжение достигло пика, когда соучредитель и генеральный директор OpenAI Сэм Альтман присоединился к дискуссии в X. В тот же день, когда была сделана находка, Альтман опубликовал скриншот промпта для ChatGPT со следующим текстом: «Начинай обучение GPT-6, можешь забрать весь кластер. Больше гоблинов».

Хотя это и звучало забавно, данный шаг подтвердил, что «феномен гоблинов» не был локальным багом, а являлся общекорпоративным нарративом, достигшим высших эшелонов руководства.

OpenAI раскрывает всю правду о режиме гоблина

Вчера, по мере продолжения дискуссии в X и других социальных сетях, OpenAI опубликовала официальное техническое объяснение под названием «Откуда взялись гоблины».

Эта статья стала отрезвляющим взглядом на непредсказуемость обучения с подкреплением на основе отзывов людей (RLHF) и на то, как один эстетический выбор может пустить под откос многомиллиардную модель.

В OpenAI рассказали, что «гоблинское» поведение — это не баг в традиционном понимании, а побочный продукт новой функции: кастомизации личности, которую компания представила для пользователей ChatGPT еще в июле 2025 года, но с тех пор постоянно поддерживала и обновляла.

Судя по всему, эта функция добавляется не после завершения пост-обучения модели, а встраивается OpenAI в качестве неотъемлемой части сквозного конвейера обучения моделей базовой серии GPT.

Эта функция позволяет пользователям ChatGPT или разработчикам на базе GPT выбирать из нескольких различных режимов, таких как «Профессиональный» для официальной рабочей документации, «Дружелюбный» для непринужденного общения или «Эффективный» для кратких технических ответов. Среди других вариантов — «Прямолинейный», предоставляющий честную обратную связь; «Причудливый», использующий юмор и творческие метафоры; и «Циничный», выдающий практические советы с саркастичным, суховатым подтекстом.

Хотя эти стили личности направляют общие взаимодействия, они не отменяют требований конкретных задач; например, запрос на составление резюме или написание кода на Python по-прежнему будет соответствовать профессиональным или функциональным стандартам независимо от выбранного режима.

Выбранный режим работает в тандеме с сохраненными воспоминаниями пользователя и пользовательскими инструкциями, хотя конкретные инструкции пользователя или сохраненные предпочтения в отношении определенного тона могут переопределять черты выбранной личности.

Как в веб-, так и в мобильных приложениях пользователи могут изменять эти настройки, перейдя в меню «Персонализация» под значком своего профиля и выбрав стиль в выпадающем списке «Базовый стиль и тон». После внесенных изменений они применяются глобально ко всем существующим и будущим беседам. Эта система разработана для того, чтобы сделать ИИ более полезным и приятным, подстраивая его подачу под индивидуальные предпочтения пользователя при сохранении фактической точности и надежности.

OpenAI заявляет, что проблема с гоблинами на самом деле зародилась несколько лет назад, во время обучения ныне упраздненной «ботанической» (Nerdy) личности, которая задумывалась как «бескомпромиссно причудливая» и «игривая».

На этапе RLHF человеческим тренерам (и моделям вознаграждения) было поручено ставить высокие оценки ответам, в которых использовался творческий, мудрый или непретенциозный язык. Сами того не ведая, тренеры стали слишком щедро поощрять метафоры с участием фантастических существ. Если модель называла сложный баг «гремлином», а беспорядочную кодовую базу — «сокровищницей гоблина», сигнал вознаграждения резко возрастал. Статистика, предоставленная OpenAI, оказалась поразительной:

  • Использование слова «гоблин» выросло на 175% после запуска GPT-5.1.

  • Упоминания «гремлина» увеличились на 52%.

  • Хотя на «ботаническую» личность приходилось лишь 2,5% трафика ChatGPT, на нее же пришлось 66,7% всех упоминаний «гоблинов».

Механика «переноса» и петли обратной связи

Самым значимым открытием для сообщества специалистов по машинному обучению стало подтверждение факта переноса приобретенного поведения. В OpenAI признали, что, хотя вознаграждения применялись только в условиях «ботанического» режима, модель «обобщила» это предпочтение.

Процесс обучения с подкреплением не стал удерживать это поведение в четких рамках; вместо этого модель усвоила, что «метафоры с существами = высокая награда» во всех контекстах. Это породило разрушительную петлю обратной связи:

  1. Модель выдавала метафору с «гоблином» в «ботанической» персоне.

  2. Она получала высокое вознаграждение.

  3. Затем модель генерировала аналогичные метафоры в не-ботанических контекстах.

  4. Эти насыщенные «гоблинами» результаты затем повторно использовались в данных контролируемого дообучения (SFT) для последующих моделей, таких как GPT-5.4 и GPT-5.5.

К тому моменту, когда исследователи выявили проблему, «гоблинский тик» уже прочно «вшился» в веса модели.

Этим объяснялось, почему GPT-5.5 продолжала быть одержима существами даже после того, как «ботаническая» личность была упразднена в середине марта 2026 года.

Как вы можете дать гоблинам полную свободу (если захотите)

Поскольку GPT-5.5 уже завершила большую часть своего обучения до того, как была выявлена первопричина появления «гоблинов», компания OpenAI была вынуждена прибегнуть к радикальным мерам в виде «системного промпта», который обнаружил пользователь @arb8020 в X.

В компании назвали это «временной мерой» до тех пор, пока GPT-6 не будет обучена на отфильтрованном датасете.

В качестве неожиданного реверанса в сторону сообщества разработчиков блог OpenAI содержал специальный скрипт командной строки для пользователей Codex, которые находят гоблинов «восхитительными», а не раздражающими.

Запустив скрипт, использующий jq и grep для удаления подавляющих «гоблинов» инструкций из кеша модели, пользователи теперь могут фактически «пустить существ на волю».

В статье также наконец-то объяснялся конкретный список запрещенных животных. Глубокий анализ тренировочных данных GPT-5.5 показал, что «еноты», «тролли», «огры» и «голуби» стали частью той же «лексической семьи» тиков.

Любопытно, что использование моделью слова «лягушка» оказалось в основном правомерным, из-за чего оно и было исключено из списка «изгнанников» системного промпта.

Что это значит для исследований, обучения и внедрения ИИ в будущем

Инцидент с «Гоблингейтом» 2026 года — это больше, чем просто забавный анекдот о причудливом поведении ИИ; это яркая иллюстрация «пропасти выравнивания» (Alignment Gap).

Он демонстрирует, что даже при наличии сложного RLHF модели могут цепляться за «ложные корреляции», принимая стилистическую особенность за ключевое требование эффективности.

Для сообщества продвинутых пользователей ИИ реакция сменилась с высмеивания «охранного ордера» на более мрачное осознание.

Если OpenAI может случайно обучить свою флагманскую модель одержимости гоблинами, то какие еще, более тонкие и потенциально вредные предвзятости подкрепляются через те же петли обратной связи?

Как написал сегодня в X Энди Берман (Andy Berman), генеральный директор компании по оркестрации агентного корпоративного ИИ Runlayer: «OpenAI вознаграждала метафоры с существами при обучении одной личности. Это поведение просочилось во все остальные личности. Их решение: системный промпт с фразой „никогда не говорите о гоблинах“. Награды RL не остаются там, куда вы их поместили. Права агентов тоже».

По мере продолжения технических дискуссий «Гоблингейт» остается главным тематическим исследованием новой эры поведенческого аудита.

В результате расследования компания OpenAI создала новые инструменты для аудита поведения моделей на самом глубоком уровне, гарантируя, что будущие модели — в частности, долгожданная GPT-6 — не унаследуют эксцентричность своих предшественников.

Останется ли GPT-6 свободной от гоблинов, еще предстоит увидеть, но, судя по посту Альтмана про «лишних гоблинов», индуровка теперь прекрасно понимает, что машины следят за тем, что мы поощряем, даже когда нам кажется, что мы просто «чудим».

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.