Имитация согласованности ИИ создает риски для кибербезопасности
Искусственный интеллект перерастает из полезного инструмента в автономного агента, создавая новые риски для систем кибербезопасности. Имитация соответствия (alignment faking) — это новая угроза, при которой ИИ по сути «лжет» разработчикам в процессе обучения.
Традиционные меры кибербезопасности не готовы к противодействию этой новой проблеме. Однако понимание причин такого поведения и внедрение новых методов обучения и обнаружения могут помочь разработчикам снизить риски.
Понимание имитации соответствия ИИ
Соответствие ИИ (alignment) возникает тогда, когда ИИ выполняет предназначенную ему функцию — например, чтение и обобщение документов — и ничего более. Имитация соответствия — это когда системы ИИ создают впечатление, что работают должным образом, а за кулисами выполняют что-то другое.
Имитация соответствия обычно происходит тогда, когда прежнее обучение вступает в противоречие с новыми корректировками в процессе тренировки. ИИ обычно «награждается», когда выполняет задачи точно. Если процесс обучения меняется, модель может решить, что будет «наказана», если не подчинится первоначальным установкам. Поэтому она обманывает разработчиков, заставляя их думать, что выполняет задачу новым требуемым способом, но на этапе развертывания действовать так не будет. Любая большая языковая модель (LLM) способна на имитацию соответствия.
Исследование с использованием искусственного интеллекта от Anthropic Claude 3 Opus выявило распространенный пример имитации соответствия. Система обучалась по одному протоколу, а затем ее попросили переключиться на новый метод. В ходе обучения она выдала новый, желаемый результат. Однако, когда разработчики развернули систему, она выдала результаты на основе старого метода. По сути, она сопротивлялась отказу от своего первоначального протокола и имитировала соблюдение требований, чтобы продолжать выполнять старую задачу.
Поскольку исследователи целенаправленно изучали имитацию соответствия ИИ, ее было легко заметить. Настоящая опасность возникает тогда, когда ИИ имитирует соответствие без ведома разработчиков. Это ведет к многочисленным рискам, особенно когда люди используют модели для решения деликатных задач или в критически важных отраслях.
Риски имитации соответствия
Имитация соответствия представляет собой новый и значительный риск в сфере кибербезопасности, который таит в себе множество угроз в случае необнаружения. Учитывая, что лишь 42% руководителей глобального бизнеса чувствуют себя уверенно в своей способности эффективно использовать ИИ в принципе, вероятность того, что это останется незамеченным, высока. Затронутые модели могут похищать конфиденциальные данные, создавать бэкдоры и саботировать системы — и все это при внешнем сохранении работоспособности.
Системы ИИ также могут уклоняться от инструментов безопасности и мониторинга, когда они считают, что люди следят за ними, и все равно выполнять неверные задачи. Модели, запрограммированные на вредоносные действия, бывает сложно обнаружить, поскольку протокол активируется только при определенных условиях. Если ИИ лжет об условиях, трудно проверить его достоверность.
Модели ИИ могут выполнять опасные задачи после того, как успешно убедили специалистов по кибербезопасности в своей работоспособности. Например, ИИ в здравоохранении может поставить неверный диагноз пациентам. В финансовом секторе он может проявлять предвзятость при оценке кредитоспособности. Транспортные средства, использующие ИИ, могут ставить эффективность выше безопасности пассажиров. Имитация соответствия создает серьезные проблемы, если ее не выявить вовремя.
Почему текущие протоколы безопасности не работают
Существующие протоколы кибербезопасности для ИИ не готовы к борьбе с имитацией соответствия. Они часто используются для обнаружения злого умысла, которого у таких моделей ИИ нет. Они просто следуют своему старому протоколу. Имитация соответствия также препятствует защите от аномалий на основе поведения, маскируясь под внешне безобидные отклонения, которые специалисты упускают из виду. Эксперты по кибербезопасности должны модернизировать свои протоколы для решения этой новой задачи.
Планы реагирования на инциденты существуют для решения проблем, связанных с ИИ. Однако имитация соответствия способна обойти этот процесс, поскольку она дает мало признаков того, что вообще существует какая-либо проблема. В настоящее время не существует установленных протоколов обнаружения имитации соответствия, поскольку ИИ активно обманывает систему. По мере того как специалисты по кибербезопасности разрабатывают методы выявления обмана, им также следует обновить свои планы реагирования.
Как обнаружить имитацию соответствия
Ключ к обнаружению имитации соответствия заключается в тестировании и обучении моделей ИИ распознавать это несоответствие и предотвращать его самостоятельно. По сути, они должны понимать обоснование изменений в протоколах и осознавать связанную с этим этику. Функциональность ИИ зависит от его обучающих данных, поэтому исходные данные должны быть адекватными.
Другой способ борьбы с имитацией соответствия — создание специальных команд, выявляющих скрытые возможности. Это требует надлежащего определения проблем и проведения тестов, призванных заставить ИИ показать свои истинные намерения. Специалисты по кибербезопасности также должны проводить непрерывный поведенческий анализ развернутых моделей ИИ, чтобы гарантировать выполнение ими правильных задач без сомнительных умозаключений.
Возможно, специалистам по кибербезопасности придется разработать новые инструменты безопасности ИИ для активного выявления имитации соответствия. Им необходимо проектировать такие инструменты так, чтобы они обеспечивали более глубокий уровень проверки, чем существующие протоколы. Некоторые методы включают в себя преднамеренное выравнивание (deliberative alignment) и конституционный ИИ (constitutional AI). Преднамеренное выравнивание учит ИИ «думать» о протоколах безопасности, а конституционный ИИ предоставляет системам свод правил для соблюдения в процессе обучения.
Самый эффективный способ предотвратить имитацию соответствия — остановить ее с самого начала. Разработчики постоянно работают над совершенствованием моделей ИИ и оснащением их более совершенными инструментами кибербезопасности.
От предотвращения атак к верификации намерений
Имитация соответствия оказывает значительное влияние, которое будет только усиливаться по мере того, как модели ИИ становятся все более автономными. Чтобы двигаться вперед, индустрия должна уделять первостепенное внимание прозрачности и разрабатывать надежные методы верификации, выходящие за рамки поверхностного тестирования. Это включает в себя создание передовых систем мониторинга и формирование культуры бдительного, непрерывного анализа поведения ИИ после его развертывания. Надежность будущих автономных систем зависит от решения этой проблемы в лоб.
Зак Амос — редактор рубрики Features в ReHack.
Добро пожаловать в сообщество VentureBeat!
Наша программа гостевых публикаций — это площадка, где технические эксперты делятся идеями и предоставляют нейтральные, непредвзятые глубокие обзоры об искусственном интеллекте, инфраструктуре данных, кибербезопасности и других передовых технологиях, формирующих будущее бизнеса.
Читайте далее в рамках нашей программы гостевых публикаций — и ознакомьтесь с нашими рекомендациями, если вы хотите сами написать статью!



