Разработчики говорят, что защитные механизмы OpenAI и Anthropic блокируют обычные задачи и отнимают у них время

Разработчики говорят, что защитные механизмы OpenAI и Anthropic блокируют обычные задачи и отнимают у них время

Во вторник на Dev Day OpenAI посвятила основную часть ключевого выступления скорости и экономии. Но в коридорах и очереди за сувенирами разработчики хотели говорить о часах, которые теряют, обходя ограничения моделей.

Разработчики рассказали VentureBeat, что ограничения OpenAI и Anthropic помечают обычные задачи в аэрокосмической отрасли, робототехнике и сфере безопасности как рискованные, отнимая у них время и нарушая привычные рабочие процессы. Некоторые говорили, что бросали чаты или переключали отдельные задачи на другие модели, когда отказы становилось трудно обойти.

ИИ-агенты уже стали частью повседневной разработки. Согласно исследованию JetBrains «Экосистема разработчиков 2026», в котором приняли участие более 15 000 профессиональных разработчиков, 90% используют ИИ-агентов для программирования на работе хотя бы раз в неделю, в том числе 68% — ежедневно. 

Рассказы разработчиков прозвучали на фоне попыток OpenAI сократить число необоснованных отказов и одновременно ужесточить меры защиты для более мощных моделей. На сцене OpenAI представила GPT-6.1 Sol. По словам компании, при работе с кодом и компьютером эта модель приближается по производительности к более мощной GPT-6 Astra, но стандартная стоимость токенов у неё в пять раз ниже. 

OpenAI также заявила, что модели GPT-6 реже отказывают на безобидные запросы, чем предыдущие модели, а системная карта модели отмечает, что сама Sol классифицируется OpenAI как критически важная для кибербезопасности и использует тот же комплекс защитных мер, что и GPT-6 Astra. В системной карте GPT-6 Astra говорится, что Astra — это «первая модель, достигшая критического уровня возможностей в сфере кибербезопасности в рамках нашей системы Preparedness Framework». OpenAI утверждает, что при наличии нужных инструментов и доступа модель способна обнаруживать неизвестные уязвимости в хорошо защищённых системах и использовать их без пошаговых указаний человека. По данным The Wall Street Journal, OpenAI также отменила выпуск GPT-6.1 Astra из-за опасений по поводу безопасности.

OpenAI признала в комментарии VentureBeat, что её защитные механизмы могут мешать легитимной работе. Компания заявила, что модели GPT-6 Astra и GPT-6.1 Sol реже отказывают на безобидные запросы, чем модели серии GPT-5, однако дополнительные проверки безопасности всё ещё могут «замедлять, приостанавливать или останавливать легитимную работу», в том числе защитные задачи в сфере кибербезопасности. В OpenAI сообщили, что продолжают совершенствовать защитные механизмы, чтобы сократить число ненужных перебоев.

По мере снижения стоимости моделей разработчики говорят о другой цене отказов — потерянном времени.

Спутник, которого не существует

Алехандро Карраско, студент второго курса магистратуры факультета аэронавтики и астронавтики MIT, работает в области, которая порой запускает защитные механизмы моделей: на стыке программного обеспечения и космоса. Он сотрудничал с лабораторией Стэнфордского университета над проектом, в котором агенты на базе больших языковых моделей управляли симулированными космическими аппаратами. Исследователи проверяли, сможет ли языковая модель справиться с полётом лучше алгоритмов обучения с подкреплением.

Карраско сказал, что не сталкивался с прямым отказом. Вместо этого его запросы иногда воспринимаются как подозрительные.

«Поскольку я работаю на факультете, связанном с космосом, иногда модель думает, что я занимаюсь военными разработками, — сказал Карраско. — Я работаю со спутником. Она не понимает, что это симулированный спутник».

По его словам, модели иногда помечают запросы как связанные с конфиденциальными данными или допуском к секретной информации в сфере обороны, хотя у него нет такого допуска. Говоря о ведущих лабораториях, он отдельно упомянул Anthropic. «Claude действует гораздо жёстче», — сказал он.

Карраско считает, что история переписки усугубляет проблему. Если модель начинает воспринимать его работу как подозрительную, вернуть разговор в нужное русло трудно. «Как только я понимаю, что чат зашёл в тупик или движется к какому-то итогу — например, к отказу, — я просто переключаюсь», — сказал он.

Манипуляторы роботов и SSH-сессии

Мартин Кемка, занимающийся робототехническими проектами, рассказал, что ограничения мешают ему выполнять обычные рабочие задачи.

«Я часто сталкивался с блокировками, когда работал над проектами по робототехнике, даже совсем безобидными, — сказал Кемка. — Например, когда создавал интерфейс для манипулятора или пытался подключиться по SSH к другой машине, мне часто отказывали».

Карраско, работавший с манипуляторами, в том числе с устройством с открытым исходным кодом SO-101 и UR5 от Universal Robots, сказал, что, похоже, срабатывает запрос на доступ. Когда он просит модель получить доступ к параметрам реального устройства, ограничений становится больше. По его словам, несколько месяцев назад одна из моделей не отказала напрямую, но потребовала, чтобы он чётко подтвердил, назвав устройство, что разрешает ей доступ к собственной камере и датчикам.

Кемка сообщил, что у него не возникало проблем при использовании Astra с симулятором MicroVerse, где он обучал виртуальных роботов удерживать равновесие, бороться в сумо и незаметно обходить охрану. По его словам, отказы появляются, когда он просит модель работать с физическим оборудованием или подключиться к другой машине.

Отмена подписки из-за отказов

Элвис Саравия, сооснователь DAIR.AI и автор руководства по промпт-инжинирингу, сказал, что серьёзно относится к рискам этой технологии.

«Я занимаюсь разработкой, но также думаю о безопасности, — сказал он. — Я также задумываюсь о том, какой вред можно причинить».

И всё же он назвал отказы «серьёзной проблемой» для технических специалистов вроде него. «На самом деле это очень раздражает», — сказал он. По его словам, ему неприятно видеть, как защитные механизмы мешают людям создавать то, что они хотят.

Саравия рассказал, что отказы, которые он назвал «совершенно вопиющими», в итоге побудили его отменить подписку Anthropic. Теперь он пользуется GPT-6 Astra, которая, по его мнению, действует менее жёстко, чем другие ведущие модели, с которыми он работал.

Когда блокируют работу по безопасности

Рохан Балкондека́р делит своё время между Xsolla и VibeGrow — агентом для решения задач роста бизнеса, сооснователем которого он является. Его команда в основном пишет код с помощью Codex от OpenAI и Claude от Anthropic. По его словам, запросы, связанные с кибербезопасностью, особенно часто вызывают отказы.

«Они терпеть не могут слово „кибер“, — сказал Балкондека́р. — Стоит сказать „кибербезопасность“, и они сразу отвечают: „Нет“».

По его словам, значительная часть кода, который команде нужно проверять, поступает от участников проектов с открытым исходным кодом. Проверка стороннего кода на уязвимости — одна из задач, запускающих защитные механизмы. Он добавил, что проблема обострилась с выходом последнего поколения ведущих моделей, указав на модели Fable от Anthropic и линейку GPT-6 от OpenAI.

OpenAI указала на Daybreak Access — программу доверенного доступа для соответствующих требованиям корпоративных клиентов и специалистов по кибербезопасности. По словам компании, программа поддерживает санкционированные защитные задачи, включая проверку безопасного кода, сортировку уязвимостей по приоритетности, реагирование на инциденты и анализ вредоносного ПО.

Anthropic признала, что её защитные механизмы иногда дают ложные срабатывания. Модели Fable поставляются с механизмами защиты, которые могут перенаправлять помеченные запросы по кибербезопасности и биологии к менее мощным моделям. После выхода Fable 5 в июне разработчики пожаловались, что система безопасности блокирует безобидные запросы, и Anthropic признала, что выбрала неверный баланс. В этом месяце, с выходом Fable 5.1, Anthropic заявила, что защитные механизмы для кибербезопасности теперь позволяют обнаруживать уязвимости в исходном коде и должны примерно на 60% сократить число срабатываний за одну сессию Claude Code. Однако тестирование на проникновение, создание эксплойтов и некоторые виды поиска уязвимостей в бинарных файлах по-прежнему перенаправляются с Fable на другие модели.

К моменту публикации Anthropic не ответила на запрос о комментарии.

Обходной путь с открытыми моделями

Когда закрытые модели отказывают, команда Балкондекара обращается к открытым, в том числе к Kimi от Moonshot AI. По его словам, команда и так начала экспериментировать с ними из-за стоимости, а отказы дали ещё один повод использовать открытые модели.

Карраско использует Alibaba Qwen для исследований. По его словам, для многих рабочих процессов важнее быстрая небольшая модель, запущенная локально, а не ведущая модель, особенно если кто-то из сообщества открытого исходного кода уже дообучил модель для нужной области. Кемка упомянул Apfel — приложение, которое предоставляет доступ к языковой модели, встроенной Apple в последнюю версию macOS, через локальный API. 

Для Балкондекара открытые модели — запасной вариант, когда закрытые не справляются с задачами его команды. «Мы действительно используем открытые модели для таких задач, когда закрытые модели, например Anthropic и OpenAI, отказывают, — сказал Балкондека́р. — Потому что кто-то должен этим заниматься. Невозможно сесть и проверить всё вручную». 

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.