GPT-5.2-Codex от OpenAI повышает уровень кибербезопасности

GPT-5.2-Codex от OpenAI повышает уровень кибербезопасности

После недавнего выпуска GPT 5.2 компания OpenAI обновила и другие связанные модели, включая свою популярную модель для программирования Codex, расширив возможности ее применения для автономных агентов.

GPT-5.2-Codex, которую OpenAI назвала в своем блоге «самой передовой автономной моделью для программирования в условиях сложных реальных задач программной инженерии», была оптимизирована для долгосрочной работы с агентами и получила расширенные возможности в сфере кибербезопасности.

Эта модель является ответвлением GPT-5.2, оптимизированным для автономной разработки.

«GPT‑5.2-Codex представляет собой шаг вперед в том, как передовой ИИ может поддерживать реальную разработку программного обеспечения и такие специализированные области, как кибербезопасность — помогая разработчикам и специалистам по защите справляться со сложными долгосрочными задачами и укрепляя инструменты, доступные для ответственных исследований в области безопасности», — заявила компания в своем блоге.

Предприятия могут получить доступ к новой модели Codex «во всех интерфейсах Codex для пользователей платной версии ChatGPT», а в ближайшие недели компания планирует «обеспечить безопасный доступ к GPT‑5.2-Codex для пользователей API». Компания также запускает пилотную программу по предоставлению доступа «более разрешительных моделей для проверенных профессионалов и организаций» по приглашениям для выполнения задач по защите в сфере кибербезопасности, чтобы найти баланс между доступностью и безопасностью.

Достижения в области кибербезопасности с использованием моделей

OpenAI называет GPT-5.2-Codex своей самой мощной моделью для кибербезопасности на сегодняшний день. Тем не менее, по мере роста ее возможностей, компания заявляет о необходимости разработать подход к развертыванию, который учитывает будущий рост и поддерживает защитную кибербезопасность.

«Поскольку наши модели продолжают развиваться на переднем крае интеллекта, мы заметили, что эти улучшения также трансформируются в качественный скачок возможностей в таких специализированных областях, как кибербезопасность», — заявили в компании.

OpenAI сообщила в системной карте, что протестировала модель на трех бенчмарках: Capture-the-Flag (CTF) evals, CVE-Bench и Cyber Range.

GPT-5.2-Codex стала моделью компании с самыми высокими результатами в оценках CTF, что объясняется компактизацией, или «способностью модели работать согласованно в рамках нескольких контекстных окон».

GPT 5.2 Codex capture the flag

Источник: OpenAI

Модель набрала 87% в тесте CVE-Bench, превзойдя другие модели, причем GPT-5.1-Codex-Max заняла второе место с небольшим отрывом. Такой прирост будет полезен при выполнении задач, связанных с запуском команд для поиска уязвимостей и тестированием инструментов «методом почти полного перебора».

В долгосрочном тесте Cyber Range совокупный процент успешных прохождений модели составил 72,7%. Модель GPT-5.1-Codex-Max набрала 81,8%.

Проект развертывания систем кибербезопасности

OpenAI сообщила, что некоторые пользователи модели GPT-5.1-Codex-Max, выпущенной в ноябре, обнаружили уязвимость с утечкой исходного кода в React и впоследствии сообщили о ней. По словам OpenAI, Эндрю Макферсон (Andrew MacPherson), исследователь безопасности в компании Privy, использовал GPT-5.1-Codex-Max для оценки того, насколько хорошо модель может поддерживать исследования уязвимостей в реальных условиях. Вместо этого модель продемонстрировала неожиданное поведение.

Учитывая улучшение возможностей кибербезопасности в GPT-5.2-Codex и потенциально в будущих моделях, OpenAI заявляет о необходимости сбалансировать развертывание передовых моделей с предоставлением необходимых инструментов для оборонительной кибербезопасности. Хотя GPT-5.2-Codex «не достигает высокого уровня кибервозможностей в рамках нашей системы готовности» (Preparedness Framework), компания планирует привлечь избранных пользователей для тестирования функций безопасности. (Система готовности OpenAI Preparedness Framework используется для оценки и отслеживания потенциального вреда от ИИ для человека).

«Команды безопасности могут сталкиваться с ограничениями при попытках эмулировать злоумышленников, анализировать вредоносное ПО для поддержки устранения последствий или проводить стресс-тестирование критической инфраструктуры. Мы разрабатываем пилотный проект доверенного доступа, чтобы снять эти ограничения для квалифицированных пользователей и организаций, а также позволить проверенным защитникам использовать передовые возможности ИИ в области кибербезопасности для ускорения киберзащиты», — заявили в OpenAI.

Автономные рубежи

GPT-5.2 уже получила высокую оценку пользователей за применение в бизнес-задачах и рабочих процессах. В версии Codex некоторые из этих возможностей могут найти продолжение, особенно учитывая планы предприятий использовать модель для написания кода своих агентов.

Компания отметила, что модель улучшает выполнение долгосрочных задач за счет компактизации, обеспечивая высокую производительность при масштабных изменениях кода. Она также отличается улучшенной производительностью на платформе Windows.

В ходе бенчмарк-тестирования GPT-5.2-Codex показала лучшие результаты по точности по сравнению с предыдущими версиями.

Bar chart showing GPT-5.2-Codex with 56.4% accuracy, GPT-5.2 with 55.6%, and GPT-5.1 with 50.8%.

Источник: OpenAI

Bar chart showing GPT-5.2-Codex with 64% accuracy, GPT-5.2 with 62.2%, and GPT-5.1-Codex-Max with 58.1%.

Источник: OpenAI

«Благодаря этим улучшениям Codex стала эффективнее работать с крупными репозиториями в течение длительных сессий при сохранении полного контекста. Она может более надежно справляться со сложными задачами, такими как масштабный рефакторинг, миграция кода и создание новых функций, продолжая итеративный процесс без потери контекста, даже если планы меняются или попытки завершаются неудачей», — заявили в OpenAI.

С момента своего появления в виде исследовательской превью-версии в мае, Codex помогла закрепить признание агентного программирования (agentic and vibe coding) в корпоративной сфере разработчиков ИИ. Наряду с Windsurf, Cursor, Claude Code и многочисленными кодинг-агентами от Google, эта платформа вывела большие языковые модели (LLM) за рамки простого автодополнения кода, позволив им генерировать и запускать асинхронные проекты по программированию для пользователей.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.