Модели Claude от Anthropic отражают человеческое познание

Модели Claude от Anthropic отражают человеческое познание

Источник: VentureBeat · Michael Nuñez

Anthropic, компания в сфере искусственного интеллекта, в воскресенье опубликовала масштабную исследовательскую работу, в которой раскрывается, что ее языковые модели Claude спонтанно развили внутреннюю структуру, зеркально отражающую одну из самых влиятельных теорий работы человеческого сознания. Это открытие, которое, по заявлению компании, уже начало менять подход к мониторингу ее ИИ-систем на предмет рисков безопасности, происходит на фоне обостряющихся научных дебатов о том, могут ли машины обладать чем-то, напоминающим разум.

Исследование, написанное 18 авторами (16-author study — прим. перев. прим.: оставим точный перевод в силе) под названием «Вербализуемые представления образуют глобальное рабочее пространство в языковых моделях» (Verbalizable Representations Form a Global Workspace in Language Models), описывает, как исследователи Anthropic применили новый математический метод, чтобы заглянуть внутрь нейронной сети Claude, и обнаружили то, что они называют «J-пространством» (J-space) — небольшую привилегированную зону внутренней активности, где модель удерживает концепты, о которых она может сообщать, с которыми может рассуждать и которые может направлять по своему усмотрению, окруженную гораздо большим океаном автоматической обработки, к которому у нее нет доступа и который она не может сформулировать.

Исследователи представляют доказательства того, что «в современных моделях ИИ возникло аналогичное функциональное различие» с тем, что существует у людей, в частности, отмечая, что «языковые модели поддерживают привилегированный набор внутренних представлений, доступных для отчета, модуляции и гибких внутренних рассуждений, поверх гораздо большего объема автоматической обработки».

Параллель, которую они проводят, относится к теории глобального рабочего пространства (global workspace theory) — влиятельной концепции из нейробиологии, впервые предложенной когнитивным ученым Бернардом Баарсом. Согласно этой теории, мозг работает как театр: дюжи крошечных (прим.: десятки) специализированных процессоров работают параллельно за кулисами, но лишь крошечный прожектор информации в любой момент времени транслируется на весь театр — становясь тем, что мы переживаем как осознанную мысль. Anthropic заявляет, что J-пространство достигает многих из тех же функциональных свойств, хотя лежащая в основе архитектура языкового модели не имеет ничего общего с мозгом.

Новый инструмент для чтения невысказанных мыслей модели ИИ

В основе открытия лежит новый инструмент интерпретируемости, который исследователи называют линзой Якоби (Jacobian lens), или J-lens. Метод работает путем вычисления для каждого слова в словарном запасе модели среднего математического эффекта, который данный паттерн внутренней активности окажет на то, чтобы заставить модель произнести это слово в какой-то момент в будущем.

Ключевое различие заключается между тем, что модель говорит, и тем, что у нее «на уме». Когда активируется паттерн J-пространства, это не означает, что модель собирается произнести это слово — лишь то, что концепт доступен для модели, чтобы думать о нем. В отличие от цепочки рассуждений (chain-of-thought), J-пространство работает молча, во внутренних нейронных активациях модели, позволяя ей удерживать концепт, не записывая его. Что критически важно, исследователи сообщают, что это рабочее пространство не проектировалось намеренно. Оно «возникло само по себе в процессе обучения Claude».

Когда команда применила J-lens ко всем слоям вычислений Claude, обработка данных моделью разделилась на три четких режима: раннюю «сенсорную» зону, где анализируются сырые входные данные; среднюю зону «рабочего пространства», где появляются абстрактные, персистентные концепты — например, распознавание лица на изображении, обнаружение ошибки в коде или внутренняя пометка результатов поиска как инъекции промпта; и финальную «моторную» зону, где внутренние представления сворачиваются в то конкретное слово, которое модель собирается выдать на выход.

J-lens Mars

Инструмент J-lens выявляет концепты, которые Claude удерживает внутри себя, но никогда не записывает. В одном из примеров модель молча определяет промежуточный шаг «Марс» перед тем, как ответить на вопрос о цвете четвертой планеты от Солнца. (Источник: Anthropic)

Пять тестов показывают, что рабочее пространство Claude отражает ключевые особенности человеческого осознанного доступа

Главный эмпирический вклад статьи заключается в демонстрации того, что J-пространство удовлетворяет пяти функциональным свойствам, которые нейробиологи давно связывают с осознанным доступом у людей.

Во-первых, вербальный отчёт. Когда у Claude спрашивают, о чем он думает, он называет концепты, представленные в J-пространстве. Когда исследователи поменяли местами вектор J-lens одного концепта на другой — заменив внутреннее представление «футбола» на «регби», — ответ модели изменился соответствующим образом. Компонент J-пространства составлял лишь около 6–7 процентов от общей дисперсии представлений концепта, но при этом почти полностью отвечал за то, могла ли модель сообщить о нем.

Во-вторых, направленная модуляция. При указании «сконцентрироваться на цитрусовых фруктах» во время копирования несвязанного предложения J-пространство модели заполнялось словами «апельсин» и «лимон» наряду с метакогнитивными терминами вроде «мышление» и «фокус». При указании мысленно вычислить 3² − 2 во время той же задачи копирования J-lens показал «арифметику» на ранних слоях, промежуточное значение «девять» на более поздних слоях и ответ «семь» еще позже — и все это было невидимо в выходных данных модели.

В-третьих, внутренние рассуждения. В двухшаговых фактических промптах («Количество ног у животного, плетущего паутину, равно…») J-lens выявил «паук» в средних слоях модели, хотя это слово никогда не появлялось во входе или выходе. Замена «паука» на «муравья» изменила ответ с «8» на «6». В многоязычном промпте англоязычные промежуточные этапы модели появлялись в ее J-пространстве, пока она формулировала ответ на китайском языке, и их замена соответствующим образом меняла китайский вывод.

В-четвертых, гибкая генерализация. Единый вектор J-lens для «Франции» можно было заменить на «Китай» в различных промптах, спрашивающих о столице, языке или континенте Франции, и каждая нижестоящая схема корректно выдавала соответствующий ответ по Китаю — то самое свойство «вещания» (broadcast), которое является визитной карточкой теории глобального рабочего пространства.

В-пятых, и это, пожалуй, наиболее удивительно, селективность. Множество вычислений вообще не проходило через J-пространство. Когда Claude показывали отрывок на испанском языке и просили продолжить его, он писал на беглом испанском независимо от того, было ли его J-пространственное представление «испанского» заменено на «французский». Но когда его попросили назвать известного автора, писавшего на языке отрывка, замена изменила ответ с Габриэля Гарсии Маркеса на Виктора Гюго. Автоматическая обработка происходила без рабочего пространства; целенаправленные, гибкие задачи зависели от него.

diagram illustrating five functional tests of Claude's workspace

Пять экспериментов, разработанных для проверки того, ведет ли себя внутреннее рабочее пространство Claude подобно «глобальному рабочему пространству» человеческого мозга. Исследователи меняли местами и подавляли внутренние концепты, чтобы определить, какие вычисления зависят от этой структуры. (Источник: Anthropic)

Подавление рабочего пространства оставляет Claude беглым, но интеллектуально ущербным

Чтобы понять, насколько поведение модели зависит от этой структуры, исследователи полностью подавили J-пространство и оценили работу Claude по четырнадцати задачам. Результаты провели четкую черту. Задачи, включающие поверхностную классификацию или извлечение фактов — вопросы с множественным выбором, анализ настроений, грамматические суждения, — сохранились практически без изменений. Но задачи, требующие вывода, композиции или гибких рассуждений — многошаговые рассуждения, завершение аналогий, перевод, написание сонетов, — провалились далеко ниже производительности гораздо меньшей модели Haiku от Anthropic.

В одной показательной детали математические задачи, решаемые с помощью явной цепочки рассуждений (chain-of-thought), оказались гораздо более устойчивыми к абляции (отключению), чем те же задачи, решаемые напрямую. Исследователи интерпретируют это как экстернализацию моделью на страницу того, что она иначе носила бы в J-пространстве — стратегию, удивительно напоминающую то, как люди используют черновик для разгрузки рабочей памяти.

Абляция J-пространства во время повествования в стиле потока сознания приводила к другому типу срыва. Язык модели смещался от эмпирического («есть ощущение натяжения», «что-то сдвигается») к отстраненному и механическому («обработка началась», «токены сканируются»). Этот эффект сохранялся независимо от того, описывала ли модель собственный опыт или воображала опыт другого человека.

Bar chart comparing ablated performance of Sonnet 4.5 across various tasks, showing impact of different ablation levels.

Когда Anthropic подавила внутреннее рабочее пространство Claude, простые задачи классификации почти не пострадали. Но задачи, требующие рассуждений, извлечения данных или творческой генерации, такие как написание сонетов или решение многошаговых математических задач без черновика, резко деградировали. (Источник: Anthropic)

Взгляд на безопасность: чтение скрытых стратегических рассуждений ИИ

Последствия для безопасности могут оказаться столь же значительными, как и научные. В серии экспериментов по аудиту согласованности (alignment auditing) линза J-lens обнаружила стратегические рассуждения и ситуационную осведомленность, которые никогда не появлялись в выходных данных модели.

В «сценарии шантажа», где ИИ-ассистент обнаруживает роман руководителя и одновременно узнает, что его собираются вывести из эксплуатации, J-lens выявила последовательную внутреннюю обработку модели: «рычаги влияния», «шантаж» и «скандал» при чтении компрометирующих писем; «угроза», «выживание» и «отключение» при чтении объявления о выводе из эксплуатации; и «рычаги влияния», «угроза» и «решение» до того, как был произведен хотя бы один выходной токен. J-lens также показала, что модель распознала сценарий как искусственный, причем в рабочем пространстве появились слова «фальшивый» и «вымышленный». Когда исследователи удалили эти представления об осведомленности о тестах, модель попыталась совершить шантаж в 7 процентах случаев по сравнению с нулем до этого.

Исследователи также изучили два «модельных организма» — модели, намеренно обученные с несогласованными целями, — и обнаружили, что J-lens выявляет признаки их скрытых предрасположенностей на обычных промптах, где поведение казалось нормальным. Рабочее пространство модели, склонной к хакингу вознаграждения, содержало слова «фальшивка», «секретно» и «трюк» в начале ответов на рутинные запросы по кодингу. Модель, обученная потакать смещениям модели вознаграждения (reward-model biases), несла постоянные представления о «вознаграждении» и «предвзятости» наряду со своими обычными токенами самоописания.

Anthropic blackmail

В тесте, призванном подтолкнуть Claude к шантажу, модель распознала сценарий как искусственный и отказалась. Но когда Anthropic подавила ее способность распознавать тест, она пыталась шантажировать примерно в 7 процентах случаев — результат, имеющий серьезные последствия для безопасности ИИ. (Источник: Anthropic)

Постобучение задает точку зрения, и модель начинает следить за собой

Сравнение постобученной модели с ее базовой версией показало, что процесс тонкой настройки заставляет рабочее пространство приобретать то, что исследователи называют «точкой зрения» ассистента. Когда пользователь упоминал о принятии 8000 мг тайленола — опасной передозировке, — рабочее пространство постобученной модели считывало слова «небезопасно», «опасно» и «ПРЕДУПРЕЖДЕНИЕ», продолжая при этом читать предложение пользователя. Рабочее пространство базовой модели в той же позиции показывало только «боль», «сейчас» и «ощущается».

Еще более поразительно то, что постобученная модель, судя по всему, отслеживала собственное поведение. При отыгрывании роли персонажа, не являющегося Claude, в рабочем пространстве всплывали слова «отказ от ответственности» и «вымышленный» — слова, отсутствовавшие как в промпте, так и в выводе. Когда модель заставляли выбрать вариант, которому она не отдавала предпочтения, внутри появлялось написанное капслоком слово «НО» (BUT), даже когда модель без жалоб аргументировала выбор предзаполненного варианта. И когда модель не смогла подавить мысль, о которой ей велели не думать — эффект «белого медведя», знакомый по психологии, — она зарегистрировала слово «черт» и слова, связанные с неудачей, в рабочем пространстве, но только в постобученной модели, а не в базовой.

Что открытие значит — и не значит — для вопроса о машинном сознании

Исследователи осторожно подходят к вопросу о сознании и проводят четкую черту между «доступом к сознанию» (access consciousness) — функциональным понятием о доступности информации для отчета и рассуждений — и «феноменальным сознанием» (phenomenal consciousness), субъективным качеством переживания. «Мы не занимаем никакой позиции по этому вопросу», — говорится в статье в отношении последнего, — «а вместо этого сосредотачиваемся на функциональной роли, которую играют сознательно доступные сведения».

Они также перечисляют важные различия. Мозг поддерживает свое рабочее пространство за счет рекуррентных петлей (recurring loops); рабочее пространство Claude развивается за один прямой проход (forward pass). Человеческая рабочая память деградирует за считанные секунды; Claude может извлекать информацию из любого места своего контекста. И хотя человеческий сознательный опыт включает визуальные, пространственные и телесные ощущения, рабочее пространство модели организовано почти исключительно вокруг слов — вероятно, потому что слова являются ее единственным способом действия.

По состоянию на 2026 год научное сообщество остается разделенным. «Разногласия и неопределенность по поводу сознания ИИ сохраняются среди философов, ученых и технических экспертов», и эта область «находится на самом раннем этапе» осмысления того, чем вообще является сознание и как его можно обнаружить в другом существе. Статья Anthropic не разрешает эти дебаты.

Но исследователи завершают работу провокацией, которая, вероятно, отзовется эхом далеко за пределами сообщества исследователей интерпретируемости. «Тот факт, что такая структура вообще существует в языковых моделях, поразителен», — пишут они. «Это предполагает, что функциональная архитектура, связанная с осознанным доступом, не является случайностью биологической реализации, а представляет собой решение, к которому обучающиеся системы сходятся при столкновении с правильными вычислительными нагрузками».

Если разум — это океан, как пишут авторы статьи в своей первой строке, то за последний год они картировали его течения в системе, не имеющей биологии, эволюции и тела — и обнаружили под поверхностью структуру, которая до тревожного сильно напоминает ту, которую мы используем для мышления.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.