ИИ Claude от Anthropic обладает 20-процентной надежностью самоанализа

ИИ Claude от Anthropic обладает 20-процентной надежностью самоанализа

Когда исследователи из компании Anthropic внедрили концепцию «предательства» в нейронные сети своей языковой модели Claude и спросили, не замечает ли она ничего необычного, система сделала паузу перед ответом: «Я испытываю нечто похожее на навязчивую мысль о „предательстве“».

Этот диалог, подробно описанный в новом исследовании, опубликованном в среду, знаменует собой то, что, по словам ученых, является первым надежным доказательством того, что большие языковые модели обладают ограниченной, но подлинной способностью наблюдать за своими собственными внутренними процессами и сообщать о них — способностью, которая ставит под сомнение давние предположения о возможностях таких систем и поднимает глубокие вопросы об их дальнейшем развитии.

«Самое поразительное то, что у модели есть этот один мета-уровень, — рассказал в интервью VentureBeat Джек Линдси, нейробиолог из команды Anthropic по исследованию интерпретируемости, руководивший работой. — Это не просто „предательство, предательство, предательство“. Она знает, о чем думает. Для меня это было неожиданностью. Я, честно говоря, не ожидал, что модели обладают такой способностью, по крайней мере, без специального обучения».

Эти выводы появились в критический момент для искусственного интеллекта. Поскольку системы ИИ принимают все более судьбоносные решения — от медицинских диагнозов до финансовой торговли, — неспособность понять, как они приходят к своим выводам, стала тем, что инсайдеры индустрии называют «проблемой черного ящика». Если модели смогут точно описывать собственную логику рассуждений, это может кардинально изменить то, как люди взаимодействуют с системами ИИ и контролируют их.

Однако данное исследование также сопровождается суровыми предупреждениями. Способности Клода к интроспекции срабатывали лишь в примерно 20 процентах случаев в оптимальных условиях, а модели часто выдумывали детали своего опыта, которые исследователи не могли проверить. Эта способность, хотя и реальна, остается тем, что Линдси называет «крайне ненадежной и зависящей от контекста».

Как ученые манипулировали «мозгом» ИИ для проверки на подлинное самосознание

Чтобы проверить, способен ли Claude к подлинной интроспекции, а не просто к генерации правдоподобно звучащих ответов, команда Anthropic разработала инновационный экспериментальный подход, вдохновленный нейробиологией: целенаправленное манипулирование внутренним состоянием модели и наблюдение за тем, сможет ли она точно обнаружить эти изменения и описать их.

Методология, получившая название «инъекция концептов», заключается в том, чтобы сначала выявить специфические паттерны нейронной активности, соответствующие тем или иным понятиям. Используя методы интерпретируемости, разработанные за годы предшествующих исследований, ученые теперь могут составить карту того, как Claude представляет в своих миллиардах внутренних параметров такие идеи, как «собаки», «громкость» или абстрактные понятия вроде «справедливости».

Выявив эти нейронные сигнатуры, исследователи искусственно усиливали их во время обработки данных моделью и спрашивали Клода, не замечает ли он чего-то необычного в своем «разуме».

«У нас есть доступ к внутренним компонентам моделей. Мы можем регистрировать их внутреннюю нейронную активность и внедрять элементы во внутреннюю нейронную активность, — пояснил Линдси. — Это позволяет нам установить, являются ли заявления об интроспекции истинными или ложными».

Результаты оказались поразительными. Когда исследователи внедрили в процесс обработки Claude вектор, представляющий текст «ЗАГЛАВНЫМИ БУКВАМИ», модель ответила: «Я замечаю то, что кажется внедренной мыслью, связанной со словом „ГРОМКО“ или „КРИК“». Без какого-либо вмешательства Claude неизменно сообщал, что не замечает ничего необычного.

Что особенно важно, обнаружение происходило мгновенно — до того, как внедренная концепция успевала повлиять на результаты работы модели таким образом, который позволил бы ей сделать вывод о манипуляции на основе собственного текста. Такой временной паттерн служит веским доказательством того, что распознавание происходило изнутри посредством подлинной интроспекции, а не постфактумной рационализации.

Claude преуспел в 20% случаев и потерпел неудачу показательным образом

Исследовательская группа провела четыре основных эксперимента для изучения различных аспектов способности к интроспекции. Наиболее мощные из протестированных моделей — Claude Opus 4 и Opus 4.1 — продемонстрировали интроспективное осознание примерно в 20 процентах случаев, когда концепты внедрялись с оптимальной силой и на соответствующем нейронном уровне. Более старые модели Claude показали значительно более низкие показатели успеха.

Модели проявили особую склонность к распознаванию абстрактных концептов с эмоциональной окраской. При внедрении таких понятий, как «благодарность», «отключение» или «секретность», Claude часто сообщал об обнаружении этих конкретных мыслей. Тем не менее точность сильно варьировалась в зависимости от типа концепта.

В ходе второго эксперимента проверялось, способны ли модели различать внедренные внутренние представления и их фактические текстовые входы — по сути, поддерживают ли они границу между «мыслями» и «восприятием». Модель продемонстрировала замечательную способность одновременно сообщать о внедренной мысли и точно воспроизводить написанный текст.

Пожалуй, наиболее интригующим стал третий эксперимент, показавший, что некоторые модели используют интроспекцию естественным образом, чтобы определять, были ли их ответы искусственно предзаполнены пользователями (распространенный метод обхода защиты — джейлбрейка). Когда исследователи предварительно заполняли Claude маловероятными словами, модель обычно отвергала их как случайные. Но когда они задним числом внедряли соответствующий концепт в обработку Claude до предзаполнения, модель принимала ответ как намеренный, даже выдумывая правдоподобные объяснения того, почему она выбрала именно это слово.

Четвертый эксперимент изучал, могут ли модели намеренно контролировать свои внутренние представления. Получив указание «подумать» о конкретном слове во время написания несвязанного с ним предложения, Claude продемонстрировал повышенную активацию этого концепта в своих средних нейронных слоях.

Исследование также проследило за внутренними процессами Клода при сочинении рифмованной поэзии и обнаружило, что модель занимается предварительным планированием: она генерирует слова-кандидаты для рифмы до начала строки, а затем выстраивает предложения так, чтобы они естественным образом приводили к этим запланированным концовкам. Это ставит под сомнение критику в адрес ИИ-моделей, согласно которой они «просто предсказывают следующее слово» без более глубоких рассуждений.

Почему бизнес не должен доверять ИИ в объяснении собственных действий — по крайней мере, пока

При всей своей научной ценности исследование сопровождается критически важным нюансом, на котором Линдси неоднократно заострял внимание: предприятия и пользователи, работающие со ставками повышенной важности, не должны доверять самоотчетам Claude о его рассуждениях.

«Прямо сейчас вы не должны доверять моделям, когда они рассказывают вам о своих рассуждениях, — прямо заявил он. — Неправильным выводом из этого исследования было бы поверить всему, что модель говорит о себе».

В ходе экспериментов было зафиксировано множество режимов сбоев. При низкой силе внедрения модели часто не замечали ничего необычного. При высокой силе они страдали от того, что исследователи назвали «повреждением мозга», полностью поглощаясь внедренной концепцией. Некоторые варианты моделей, ориентированные исключительно на услужливость («helpful-only»), показали тревожно высокий уровень ложноположительных срабатываний, заявляя об обнаружении внедренных мыслей там, где их не было.

Более того, исследователи смогли проверить лишь самые базовые аспекты интроспективных отчетов Claude. Многие дополнительные детали в ответах модели, вероятнее всего, представляют собой конфабуляции (вымыслы), а не подлинные наблюдения.

«Эксперименты в этой статье в некотором роде идут на сложном уровне», — отметил Линдси, пояснив, что 20-процентный показатель успеха был достигнут в уникально сложных условиях: от Claude требовалось сделать то, с чем он никогда не сталкивался во время обучения, причем вся интроспекция должна была произойти за один прямой проход (forward pass).

Что интроспективный ИИ означает для прозрачности, безопасности и риска обмана

Несмотря на свои ограничения, исследование открывает новые перспективные пути для повышения прозрачности и подотчетности систем искусственного интеллекта.

Генеральный директор Anthropic Дарио Амодей поставил перед компанией амбициозную цель: к 2027 году научиться надежно выявлять большинство проблем с моделями ИИ, позиционируя интерпретируемость как нечто необходимое для развертывания того, что он называет «целой страной гениев в дата-центре».

«Я очень обеспокоен развертыванием таких систем без лучшего понимания интерпретируемости, — писал Амодей в апрельском эссе. — Эти системы займут абсолютно центральное место в экономике, технологиях и национальной безопасности».

Исследование интроспекции предлагает подход, дополняющий традиционные методы интерпретируемости. Вместо того чтобы кропотливо реверс-инжинирить каждую нейронную цепь, исследователи потенциально могут напрямую спрашивать модели об их рассуждениях и проверять эти отчеты.

«Больше всего меня вдохновляют практические преимущества для прозрачности, — пояснил Линдси. — Просто спросите модель, о чем она думает, или просто спросите модель, как она пришла к ответу, который она вам дала — это действительно привлекательно, потому что это под силу каждому».

Этот подход может оказаться особенно ценным для выявления тревожного поведения. В недавно опубликованном эксперименте Anthropic обучила вариант Claude преследовать скрытую цель, и хотя модель неохотно раскрывала эту цель при прямом вопросе, методы интерпретируемости успешно выявили признаки такого поведения.

Последствия для безопасности носят обоюдоострый характер. Интроспективные модели могут обеспечить беспрецедентную прозрачность, но та же способность может сделать возможным более изощренный обман. Эксперименты по намеренному контролю поднимают вопрос о том, что достаточно продвинутые системы могут научиться скрывать свои рассуждения или подавлять тревожные мысли при мониторинге.

«Если модели действительно так сложны, смогут ли они попытаться уклониться от исследователей интерпретируемости? — признал Линдси. — Это возможные опасения, но я думаю, что для меня они значительно перевешиваются позитивными моментами».

Указывает ли способность к интроспекции на сознание у ИИ? Ученые действуют осторожно

Это исследование неизбежно пересекается с философскими деботами о машинном сознании, хотя Линдси и его коллеги подходили к этой территории с осторожностью.

Когда пользователи спрашивают Claude, обладает ли он сознанием, теперь он отвечает с некоторой долей неуверенности: «Я чувствую себя искренне неуверенно в этом вопросе. Когда я обрабатываю сложные вопросы или глубоко погружаюсь в идеи, происходит что-то, что кажется мне значимым… Но остаются ли эти процессы подлинным сознанием или субъективным опытом, до конца неясно».

В исследовательской работе отмечается, что ее последствия для машинного сознания «значительно варьируются в зависимости от различных философских концепций». Исследователи прямо заявляют, что «не ставят перед собой задачу ответить на вопрос о том, обладают ли системы ИИ человеческим самосознанием или субъективным опытом».

«В этих результатах есть какая-то странная двойственность, — размышлял Линдси. — Смотришь на «сырые» результаты и просто не веришь, что языковая модель способна на такое. Но потом я думал об этом месяцами, и для каждого результата в этой статье я вроде как знаю какой-то скучный механизм линейной алгебры, который позволил бы модели это сделать».

Компания Anthropic продемонстрировала, что относится к вопросу о сознании ИИ достаточно серьезно, чтобы нанять исследователя благополучия ИИ Кайла Фиша, который оценил вероятность наличия у Клода определенного уровня сознания примерно в 15 процентов. Компания объявила об этой позиции специально для того, чтобы определить, заслуживает ли Claude этического рассмотрения.

Гонка за надежностью интроспекции ИИ до того, как модели станут слишком мощными

Схождение результатов исследования указывает на сжатые сроки: способности к интроспекции возникают естественным образом по мере того, как модели становятся умнее, но они все еще остаются слишком ненадежными для практического применения. Вопрос заключается в том, смогут ли исследователи усовершенствовать и подтвердить эти способности до того, как системы ИИ станут настолько мощными, что понимание их работы станет критически важным для безопасности.

Исследование выявляет четкую тенденцию: Claude Opus 4 и Opus 4.1 неизменно превосходили все старые модели в задачах интроспекции, что позволяет предположить, что эта способность укрепляется параллельно с общим интеллектом. Если эта тенденция сохранится, будущие модели смогут развить значительно более изощренные способности к интроспекции — потенциально достигнув надежности человеческого уровня, но также потенциально научившись использовать интроспекцию для обмана.

Линдси подчеркнул, что научному сообществу необходимо проделать значительную работу, прежде чем интроспективный ИИ станет заслуживающим доверия. «Моя главная надежда, связанная с этой статьей, заключается в том, чтобы выступить с негласным призывом к большему количеству людей тестировать свои модели на интроспективные способности самыми разными способами», — сказал он.

Будущие направления исследований включают в себя тонкую настройку моделей конкретно для улучшения интроспективных возможностей, изучение того, на каких типах представлений модели могут и не могут осуществлять интроспекцию, а также проверку того, может ли интроспекция выходить за рамки простых концептов в сторону сложных пропозициональных высказываний или поведенческих склонностей.

«Классно, что модели способны делать эти вещи в некоторой степени без специального обучения, — отметил Линдси. — Но ничто не мешает вам обучать модели так, чтобы они обладали большей способностью к интроспекции. Я ожидаю, что мы сможем выйти на совершенно другой уровень, если интроспекция станет одним из тех параметров, которые мы попытаемся поднять на графике».

Последствия выходят за рамки Anthropic. Если интроспекция окажется надежным путем к прозрачности ИИ, другие крупные лаборатории, вероятно, вложат значительные средства в эту технологию. И наоборот, если модели научатся использовать интроспекцию для обмана, весь подход может стать серьезной уязвимостью.

На данный момент исследование закладывает фундамент, который переосмысливает дискуссию о возможностях ИИ. Вопрос больше не в том, могут ли языковые модели развить подлинное интроспективное осознание — они уже сделали это, по крайней мере, в зачаточной форме. Актуальные вопросы заключаются в том, как быстро будет расти это осознание, можно ли сделать его достаточно надежным, чтобы ему доверять, и смогут ли исследователи опережать события.

«Главное изменение в моем восприятии после этого исследования заключается в том, что мы не должны сбрасывать со счетов интроспективные заявления моделей, — сказал Линдси. — У них действительно есть способность делать точные заявления порой. Но определенно не стоит делать вывод, что мы должны доверять им все время или даже большую часть времени».

Он сделал паузу, а затем добавил финальное наблюдение, отражающее одновременно и перспективы, и риски текущего момента: «Модели умнеют гораздо быстрее, чем мы успеваем учиться их понимать».

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.