Галлюцинации ИИ открывают путь угрозам «слопсквоттинга»
Слопсквоттинг (slopsquatting) представляет собой новую угрозу для цепочки поставок, возникшую из-за галлюцинаций искусственного интеллекта. По мере того как разработчики все больше полагаются на ИИ-помощников в написании кода, они непреднамеренно предоставляют киберпреступникам доступ к своему программному обеспечению с первого же дня.
Понимание того, что такое слопсквоттинг
Слопсквоттинг — это новый тип атак на цепочку поставок, который использует галлюцинации больших языковых моделей (LLM) для внедрения вредоносного кода в рабочие процессы разработки. Этот термин сочетает в себе понятия «ИИ-мусор» (AI slop) и «тайлсквоттинг» (typosquatting) — мошенническую практику, при которой злоумышленники регистрируют опечатанные или похожие версии популярных доменов, чтобы нажиться на пользователях, вводящих URL-адреса с ошибками.
Этот новый векторы атак эксплуатирует склонность LLM генерировать вымышленные названия программных пакетов, которые злоумышленники могут затем зарегистрировать и наполнить вредоносным кодом.
В процессе написания кода с помощью ИИ модель может генерировать поддельные пакеты с открытым исходным кодом — наборы файлов, программ и установочных инструментов. Сами по себе они не обязательно вредны. Однако если злоумышленник зарегистрирует это фальшивое имя пакета, он сможет внедрить вредоносное ПО, которое попадет напрямую в кодовую базу разработчика.
Как ИИ создает риски для цепочки поставок
Традиционно риски безопасности ИИ проистекают из галлюцинаций, которые могут негативно повлиять на пользователей, принимающих ложную информацию за чистую монету. Однако те же самые галлюцинации переросли в эксплуатируемые уязвимости безопасности.
Тайлсквоттинг — это обманная практика, при которой киберпреступник регистрирует пакет с намеренной опечаткой, чтобы обмануть разработчиков. Она существует уже несколько десятилетий, поэтому реестры создали средства защиты от нее.
Однако ИИ изменил модель угроз. Он рекомендует правдоподобно звучащие вымышленные пакеты, а не простые опечатки. Как только злоумышленники узнают, какие именно галлюцинаторные пакеты модели склонны изобретать, они могут зарегистрировать под этими именами пакеты с вредоносным ПО.
Поскольку галлюцинаторные пакеты не являются просто версиями популярных библиотек с опечатками, в реестрах отсутствуют масштабные средства защиты от этой практики. Например, реестр защищает от публикации злоумышленником пакета «crossenv», который является производным от популярного «cross-env». Однако он не распознает как угрозу «mpn install cross-env file» или «cross-env-extended».
Галлюцинации носят устойчивый и серьезный характер
Даже если множество LLM рекомендуют один и тот же галлюцинаторный пакет, массовый взлом все равно возможен. Вредоносные пакеты могут месяцами или даже годами оставаться незамеченными в продакшене, позволяя злоумышленникам скрытно внедрять вредоносное ПО в бесчисленные среды.
Одна исследовательская группа проанализировала 31 267 уязвимостей, принадлежащих 14 675 пакетам на 10 языках программирования. Они обнаружили, что количество сообщаемых уязвимостей растет на 98% ежегодно, что превышает 25-процентный годовой рост количества программных пакетов с открытым исходным кодом. Команда также зафиксировала увеличение средней продолжительности жизни уязвимостей на 85%, что указывает на ухудшение ситуации с безопасностью.
Реальные опасности галлюцинаций ИИ
Злоумышленники могут создавать общедоступные пакеты с теми же названиями, что и у библиотек, которые часто вызывают галлюцинации у ИИ. Вместо стандартного кода они наполняются вредоносным ПО. Модели считают, что ссылаются на существующие пакеты, поэтому часто повторяют одни и те же вымышленные имена. Поскольку галлюцинации не случайны, теоретически злоумышленники могут регистрировать пакеты, которые обманут десятки тысяч разработчиков.
Эти пакеты выглядят легитимно. Сходство строк с реальными библиотеками делает их узнаваемыми. Ошибки в один символ намекают на простые оплошности, а не на злой умысел. Даже полностью сфабрикованные имена остаются правдоподобными, когда ИИ преподносит их в правильном контексте. Обнаружение представляет собой сложную задачу, так как разработчики доверяют своим ИИ-помощникам в вопросах рекомендации надежных зависимостей.
Почему LLM галлюцинируют пакетами?
LLM выдают статистически наиболее вероятный ответ, а не ставят во главу угла точность. В результате галлюцинации возникают относительно часто. Одно исследование показало, что уровень галлюцинаций колеблется от 50% до 82% в зависимости от модели и метода промптинга. Даже GPT-4o, показавшая лучшие результаты модель, демонстрирует показатель не ниже 23% даже при использовании митигации на основе промптов.
Атаки с использованием состязательных галлюцинаций могут усугубить эту проблему. Злоумышленники могут использовать манипуляции на уровне токенов или отравление выборки (retrieval poisoning), чтобы заставить модели галлюцинировать нужным им образом, увеличивая вероятность того, что модели порекомендуют их вредоносные пакеты.
Какие LLM склонны к слопсквоттингу?
Хотя все LLM подвержены слопсквоттингу, некоторые уязвимы больше других. Вероятность создания галлюцинаторных пакетов во время генерации кода зависит от модели. Проприетарные модели в четыре раза реже генерируют галлюцинаторные пакеты по сравнению с моделями с открытым исходным кодом.
Одна исследовательская группа доказала это, проведя 30 тестов в 30 различных системах. Из 576 000 созданных ею примеров кода и 2,23 млн пакетов 19.7% оказались галлюцинациями. У GPT-4.0 Turbo уровень галлюцинаций составил 3.59%, в то время как у DeepSeek 1B, лучшей модели с открытым исходным кодом, этот показатель достиг 13.63%.
Это исследование предполагает, что организации, полагающиеся на инструменты ИИ с открытым исходным кодом для генерации кода, примерно в четыре раза больше подвержены риску атак слопсквоттинга. Однако это не обязательно означает, что проприетарные инструменты всегда останутся более безопасными. Как только злоумышленники осознают это несоответствие, они могут начать манипулировать проприетарными LLM, чтобы извлечь выгоду из предполагаемой безопасности.
Вайб-кодинг усугубляет проблему
Разработчики программного обеспечения, использующие инструменты ИИ, оценивают, что более 40 процентов кода, который они фиксируют (commit), создано с помощью ИИ. Они ожидают, что этот процент значительно вырастет в ближайшие несколько лет. Уже сейчас 72% тех, кто попробовал ИИ, используют его ежедневно.
Рост популярности вайб-кодинга (vibe coding) и программирования с помощью ИИ расширяет поверхность угроз. Поскольку все больше разработчиков интегрируют инструменты ИИ в свои рабочие процессы без внедрения надлежащих процессов верификации, поле для атак методом слопсквоттинга продолжает расширяться.
Тем, кто использует ИИ для помощи в написании кода, крайне важно перепроверять результаты. Проверка того, что рекомендуемые пакеты действительно существуют в официальных репозиториях, прежде чем включать их в проекты, снижает риски.
Навигация в разработке с поддержкой ИИ
Внедрение автоматических проверок, сверяющих имена пакетов с известными реестрами, может помочь выявить галлюцинаторные пакеты до того, как они попадут в рабочий код. Командам безопасности также следует отслеживать необычные установки пакетов и поддерживать актуальность данных об угрозах в отношении известных кампаний слопсквоттинга.
Зак Амос (Zac Amos) — редактор рубрики Features в ReHack.
Добро пожаловать в сообщество VentureBeat!
Наша программа гостевых публикаций — это площадка, где технические эксперты делятся идеями и проводят непредвзятый, независимый глубокий анализ ИИ, инфраструктуры данных, кибербезопасности и других передовых технологий, формирующих будущее корпоративного сектора.
Читайте далее в рамках нашей программы гостевых постов — и ознакомьтесь с нашими рекомендациями, если вы хотите сами написать статью!



