ИИ-бенчмарки переключаются на экономические задачи
В гонке вооружений по созданию более умных моделей искусственного интеллекта возникла проблема измерения: тесты, используемые для их ранжирования, устаревают почти так же быстро, как совершенствуются сами модели. В понедельник Artificial Analysis, независимая организация по оценке ИИ, чьи рейтинги внимательно отслеживаются разработчиками и корпоративными покупателями, выпустила масштабное обновление своего индекса интеллекта (Intelligence Index), которое кардинально меняет подход индустрии к измерению прогресса в области ИИ.
Новый индекс интеллекта версии 4.0 включает 10 оценок, охватывающих автономных агентов, программирование, научные рассуждения и общие знания. Однако изменения идут гораздо глубже простого переименования тестов. Организация удалила три основных бенчмарка — MMLU-Pro, AIME 2025 и LiveCodeBench, — которые долгое время активно цитировались ИИ-компаниями в их маркетинговых материалах. На смену им пришли оценки, призванные определить, способны ли системы ИИ выполнять ту работу, за которую людям действительно платят.
«Это смещение индекса отражает более масштабный переход: интеллект измеряется теперь не столько запоминанием, сколько экономически полезными действиями», — отметил Аравинд Сундар (Aravind Sundar), исследователь, прокомментировавший анонс в соцсети X (бывший Twitter).
Почему бенчмарки ИИ ломаются: проблема тестов, которые ведущие модели уже освоили
Обновление бенчмарков призвано решить растущий кризис в сфере оценки ИИ: передовые модели стали настолько способны, что традиционные тесты больше не могут осмысленно различать их между собой. Новый индекс намеренно усложняет задачу. По данным Artificial Analysis, теперь лучшие модели набирают 50 баллов или меньше по новой шкале v4.0 по сравнению с 73 баллами в предыдущей версии — это рекалибровка, призванная восстановить запас прочности для будущих улучшений.
Проблема насыщения преследует индустрию уже несколько месяцев. Когда каждая пограничная модель попадает в 90-й перцентиль в том или ином тесте, сам тест теряет полезность в качестве инструмента принятия решений для компаний, пытающихся выбрать систему ИИ для развертывания. Новая методология пытается решить эту проблему, уделяя равное внимание четырем категориям — агентам, программированию, научным рассуждениям и общим знаниям, — и вводя тесты, с которыми до сих пор с трудом справляются даже самые продвинутые системы.
Результаты в рамках новой структуры показывают, что модель OpenAI GPT-5.2 с расширенными возможностями рассуждения занимает первое место, за ней следуют Claude Opus 4.5 от Anthropic и Gemini 3 Pro от Google. OpenAI описывает GPT-5.2 как «самую мощную модельную серию для профессиональной интеллектуальной работы на сегодняшний день», в то время как Claude Opus 4.5 от Anthropic набирает больше баллов, чем GPT-5.2, в тесте SWE-Bench Verified, оценивающем навыки программирования.
GDPval-AA: новый бенчмарк для проверки того, сможет ли ИИ выполнять вашу работу
Наиболее значительным дополнением к новому индексу стал GDPval-AA — оценка на базе набора данных GDPval от OpenAI, которая проверяет модели ИИ на реальных экономически ценных задачах в 44 профессиях и 9 основных отраслях. В отличие от традиционных бенчмарков, которые требуют от моделей решения абстрактных математических задач или ответов на вопросы викторины с вариантами ответов, GDPval-AA измеряет способность ИИ создавать те самые результаты труда, которые на практике производят профессионалы: документы, презентации, диаграммы, электронные таблицы и мультимедийный контент.
Модели получают доступ к оболочке и функциям просмотра веб-страниц с помощью инструмента под названием «Stirrup», разработанного Artificial Analysis в качестве эталонной агентной обвязки. Оценки формируются на основе слепых попарных сравнений (pairwise comparisons), причем рейтинги Эло фиксируются на момент оценки для обеспечения стабильности индекса.
В рамках этого подхода лидирует модель OpenAI GPT-5.2 с расширенными рассуждениями и рейтингом Эло 1442, за ней следует вариант Claude Opus 4.5 от Anthropic без режима глубоких размышлений с результатом 1403. Claude Sonnet 4.5 отстает с показателем 1259.
Согласно данным OpenAI, в оригинальной оценке GDPval модель GPT-5.2 превзошла ведущих профессионалов индустрии или сравнялась с ними в 70,9% четко сформулированных задач. Компания утверждает, что GPT-5.2 «превосходит профессионалов отрасли в четко сформулированных задачах интеллектуального труда, охватывающих 44 профессии», причем такие компании, как Notion, Box, Shopify, Harvey и Zoom, отмечают «высочайший уровень долгосрочных рассуждений и работы с инструментами».
Акцент на экономически измеримых результатах знаменует собой философский сдвиг в том, как индустрия оценивает возможности ИИ. Вместо того чтобы спрашивать, может ли модель сдать экзамен на адвоката или решить задачи математической олимпиады — достижения, которые попадают в заголовки газет, но не обязательно повышают производительность труда на рабочем месте, — новые бенчмарки проверяют, действительно ли ИИ способен выполнять реальную работу.
Задачи по физике уровня аспирантуры обнажают пределы возможностей самых продвинутых моделей ИИ
В то время как GDPval-AA измеряет практическую производительность, другая новая оценка под названием CritPT демонстрирует, насколько далеко системы ИИ все еще находятся от подлинных научных рассуждений. Этот бенчмарк тестирует языковые модели на неопубликованных исследовательских задачах по современной физике, включая физику конденсированного состояния, квантовую физику и астрофизику.
Бенчмарк CritPT был разработан более чем 50 действующими физиками-исследователями из более чем 30 ведущих институтов. Его 71 комплексная исследовательская задача имитирует полномасштабные исследовательские проекты начального уровня — они сопоставимы с разминочными упражнениями, которые опытный руководитель исследования мог бы дать начинающим аспирантам. Каждая задача тщательно отобрана вручную для получения устойчивого к угадыванию ответа, который может быть проверен машиной.
Результаты вызывают отрезвление. Современные передовые модели по-прежнему далеки от надежного решения полноценных исследовательских задач. Модель GPT-5.2 с расширенными рассуждениями возглавляет таблицу лидеров CritPT с результатом всего в 11,5%, за ней следуют Gemini 3 Pro Preview от Google и вариант Claude 4.5 Opus Thinking от Anthropic. Эти оценки показывают, что, несмотря на заметный прогресс в потребительских задачах, системы ИИ по-прежнему испытывают трудности с глубокими рассуждениями, необходимыми для научных открытий.
Уровень галлюцинаций ИИ: почему самые точные модели не всегда самые надежные
Пожалуй, самой показательной новой оценкой стала AA-Omniscience, которая измеряет точность фактов и уровень галлюцинаций по 6000 вопросов, охватывающих 42 экономически значимые темы в шести доменах: бизнес, здравоохранение, право, разработка программного обеспечения, гуманитарные и социальные науки, а также точные науки, инженерия и математика.
В результате этой оценки формируется индекс всеведения (Omniscience Index), который поощряет точные знания и штрафует за галлюцинации (выдачу неверной информации за правду), позволяя понять, способна ли модель отличать то, что она знает, от того, чего она не знает. Полученные данные раскрывают неприятную правду: высокая общая точность не гарантирует низкого уровня галлюцинаций. Модели с наивысшей точностью часто не лидируют в индексе всеведения, поскольку склонны гадать, а не воздерживаться от ответа при возникновении сомнений.
Модель Google Gemini 3 Pro Preview лидирует в индексе всеведения с результатом 13 баллов, за ней следуют Claude Opus 4.5 Thinking и Gemini 3 Flash Reasoning с результатом по 10 баллов у каждой. Однако детальный анализ соотношения точности и уровня галлюцинаций рисует более сложную картину.
По чистой точности лидируют две модели от Google с результатами 54% и 51% соответственно, за ними следует Claude 4.5 Opus Thinking с 43%. Однако модели Google также демонстрируют более высокий уровень галлюцинаций по сравнению с аналогами — 88% и 85%. У моделей Claude 4.5 Sonnet Thinking и Claude Opus 4.5 Thinking от Anthropic уровень галлюцинаций составляет 48% и 58% соответственно, в то время как GPT-5.1 с высоким уровнем рассуждений достигает показателя в 51%, что является вторым лучшим (низким) результатом среди протестированных моделей.
И точность в индексе всеведения, и уровень галлюцинаций вносят по 6,25% в общий вес индекса интеллекта v4.
Внутри гонки вооружений в сфере ИИ: как OpenAI, Google и Anthropic соотносятся при новом тестировании
Перестановка в рейтинге бенчмарков происходит в особенно бурный момент для индустрии искусственного интеллекта. Все три ведущих разработчика передовых моделей выпустили масштабные новинки всего за несколько недель, причем модель Gemini 3 от Google по-прежнему удерживает первое место во многих таблицах лидеров на LMArena — широко цитируемом инструменте для сравнения больших языковых моделей (LLM).
Выпуск Gemini 3 компанией Google в ноябре побудил OpenAI объявить режим чрезвычайной ситуации («красный код») для улучшения ChatGPT. OpenAI рассчитывает, что семейство моделей GPT оправдает ее оценку в 500 миллиардов долларов и более чем 1,4 триллиона долларов запланированных расходов. «Мы объявили этот „красный код“, чтобы дать компании четкий сигнал о том, что мы хотим сосредоточить ресурсы в одной конкретной области», — заявила Фиджи Симо (Fidji Simo), генеральный директор по приложениям в OpenAI. Альтман сообщил CNBC, что ожидает выхода OpenAI из режима «красного кода» к январю.
Компания Anthropic ответила выпуском Claude Opus 4.5 24 ноября, достигнув точности 80,9% в тесте SWE-Bench Verified и вернув себе лидерство в программировании как у GPT-5.1-Codex-Max, так и у Gemini 3. Этот запуск стал третьим крупным релизом модели Anthropic за два месяца. С тех пор Microsoft и Nvidia объявили о многомиллиардных инвестициях в Anthropic, увеличив ее оценку примерно до 350 миллиардов долларов.
Как Artificial Analysis тестирует модели ИИ: взгляд на независимый процесс бенчмаркинга
Artificial Analysis подчеркивает, что все оценки проводятся независимо по стандартизированной методологии. Организация заявляет, что ее «методология делает упор на справедливость и применимость в реальных условиях», оценивая 95-процентный доверительный интервал для индекса интеллекта менее чем в ±1% на основе экспериментов с более чем 10 повторениями на определенных моделях.
Опубликованная методология организации определяет ключевые термины, которые следует понимать корпоративным покупателям. Согласно документации по методологии, Artificial Analysis считает «эндпоинтом» (endpoint) хостинговый экземпляр модели, доступный через API, что означает, что одна модель может иметь несколько эндпоинтов у разных провайдеров. «Провайдер» — это компания, которая размещает один или несколько эндпоинтов моделей или систем и предоставляет к ним доступ. Что критически важно, Artificial Analysis проводит различие между моделями с «открытыми весами» (open weights), чьи веса были опубликованы общедоступно, и подлинно моделями с открытым исходным кодом (open-source), отмечая, что многие открытые языковые модели выпускаются с лицензиями, которые не соответствуют полному определению ПО с открытым исходным кодом.
Методология также проясняет, как организация стандартизирует измерение токенов: она использует токены OpenAI, измеренные с помощью пакета tiktoken от OpenAI, в качестве стандартной единицы для всех провайдеров, чтобы обеспечить честное сравнение.
Что новый индекс интеллекта ИИ означает для технологических решений предприятий в 2026 году
Для технических руководителей, оценивающих системы ИИ, индекс интеллекта версии 4.0 дает более нюансированную картину возможностей по сравнению с предыдущими сборниками тестов. Равномерное распределение весов между агентами, программированием, научными рассуждениями и общими знаниями означает, что предприятиям с конкретными сценариями использования может потребоваться изучить оценки по отдельным категориям, а не полагаться исключительно на совокупный индекс.
Введение измерения галлюцинаций в качестве отдельного взвешенного фактора решает одну из самых постоянных проблем при внедрении ИИ на предприятиях. Модель, которая кажется высокоточной, но часто галлюцинирует при наличии сомнений, представляет значительные риски в регулируемых отраслях, таких как здравоохранение, финансы и юриспруденция.
Индекс интеллекта Artificial Analysis описывается как «текстовый набор тестов исключительно на английском языке». Организация оценивает модели для обработки изображений, голосового ввода и мультиязычной производительности отдельно.
Реакция на анонс в основном была положительной. «Здорово видеть, как индекс развивается, уменьшая насыщение и уделяя больше внимания агентной производительности», — написал один из комментаторов в публикации на X.com. «Включение реальных задач вроде GDPval-AA делает оценки гораздо более актуальными для практического использования».
Другие высказались более амбициозно. «Новая волна моделей, которая вот-вот появится, оставит их всех позади», — предсказал один из наблюдателей. «К концу года сингулярность станет неоспоримой».
Но независимо от того, окажется ли это предсказание пророческим или преждевременным, одно уже ясно: эпоха оценки ИИ по тому, как хорошо он отвечает на тестовые вопросы, подходит к концу. Новый стандарт проще и имеет гораздо более далекоидущие последствия: способен ли он выполнять работу?



