xAI Илона Маска запускает Grok 4.1 с более низким уровнем галлюцинаций

xAI Илона Маска запускает Grok 4.1 с более низким уровнем галлюцинаций

Обновление: Через день после публикации этой статьи компания xAI предоставила доступ к Grok 4.1 через свой API по цене $0,20 за 1 млн входных токенов (или $0,05 для закэшированного ввода) и $0,50 за 1 млн выходных токенов, что делает её одной из самых доступных передовых моделей ИИ. Читайте подробнее здесь.

В стремлении перетянуть на себя часть внимания с компании Google в преддверии запуска своей новой флагманской модели ИИ Gemini 3 — признанной на данный момент самой мощной языковой моделью в мире по версии нескольких независимых экспертов, — конкурирующий стартап Илона Маска xAI вчера вечером представил свою новейшую большую языковую модель Grok 4.1.

Модель уже доступна для обычных пользователей на Grok.com, в социальной сети X (бывшая Twitter), а также в мобильных приложениях компании для iOS и Android. Она поставляется с крупными архитектурными улучшениями и повышениями удобства использования, среди которых: более быстрые рассуждения, улучшенный эмоциональный интеллект и значительно сниженный уровень галлюцинаций. xAI также опубликовала технический документ с результатами оценки и небольшой информацией о процессе обучения здесь.

В публичных бенчмарках Grok 4.1 вырвалась на верхнюю строчку лидерборда, опередив конкурирующие модели от Anthropic, OpenAI и Google — по крайней мере, предыдущую модель Google до выхода Gemini 3 (Gemini 2.5 Pro). Новинка развивает успех Grok-4 Fast от xAI, о которой VentureBeat отозвался положительно вскоре после её релиза в сентябре 2025 года.

Однако корпоративные разработчики, желающие интегрировать новую усовершенствованную модель Grok 4.1 в рабочие среды, столкнутся с одним существенным ограничением: она пока недоступна через публичный API xAI.

Несмотря на высокие результаты в тестах, Grok 4.1 остаётся запертой в интерфейсах для конечных пользователей xAI, а сроки открытия доступа к API пока не объявлены. В настоящее время для программного использования через API разработчиков xAI доступны только старые модели, включая Grok 4 Fast (варианты с рассуждениями и без), Grok 4 0709, а также устаревшие модели вроде Grok 3, Grok 3 Mini и Grok 2 Vision. Они поддерживают контекст до 2 миллионов токенов, а стоимость варьируется от $0,20 до $3,00 за миллион токенов в зависимости от конфигурации.

На данный момент это ограничивает полезность Grok 4.1 в корпоративных рабочих процессах, завязанных на бэкенд-интеграцию, дообученные пайплайны агентов или масштабируемые внутренние инструменты. Хотя запуск для потребителей позиционирует Grok 4.1 как самую способную большую языковую модель в портфолио xAI, её внедрение в производственные среды на уровне предприятий пока откладывается.

Дизайн модели и стратегия развертывания

Grok 4.1 поставляется в двух конфигурациях: режим быстрого ответа с низкой задержкой для мгновенных реплик и «мыслящий» режим (thinking), который задействует многошаговые рассуждения перед выдачей результата.

Обе версии уже доступны конечным пользователям, их можно выбрать в селекторе моделей в приложениях xAI.

Эти две конфигурации различаются не только задержкой, но и глубиной обработки промптов моделью. Grok 4.1 Thinking задействует механизмы внутреннего планирования и обдумывания, в то время как стандартная версия отдаёт приоритет скорости. Несмотря на архитектурные различия, обе версии набрали больше баллов, чем любые конкурирующие модели, в слепом тестировании предпочтений и бенчмарках.

Лидерство в оценках людей и экспертов

В лидерборде LMArena Text Arena модель Grok 4.1 Thinking ненадолго заняла первое место с нормализованным рейтингом Эло 1483, после чего несколько часов спустя уступила лидерство в связи с выпуском Google модели Gemini 3, показавшей невероятный результат в 1501 балл Эло.

Версия Grok 4.1 без режима рассуждений также выступает в индексе достойно, набирая 1465 баллов.

Эти показатели ставят Grok 4.1 выше Gemini 2.5 Pro от Google, серии Claude 4.5 от Anthropic и предварительной версии GPT-4.5 от OpenAI.

В художественном письме Grok 4.1 уступает лишь Polaris Alpha (раннему варианту GPT-5.1), причем «мыслящая» модель получила 1721,9 балла в бенчмарке Creative Writing v3. Это примерно на 600 баллов превышает показатели предыдущих итераций Grok.

Аналогичным образом, в лидерборде Arena Expert, агрегирующем отзывы профессиональных рецензентов, Grok 4.1 Thinking вновь возглавляет список с результатом 1510 баллов.

Такой прогресс особенно впечатляет, учитывая, что Grok 4.1 вышла всего через два месяца после Grok 4 Fast, что подчёркивает ускоренный темп разработки в xAI.

Ключевые улучшения по сравнению с предыдущими поколениями

С технической точки зрения Grok 4.1 представляет собой значительный скачок в удобстве практического использования. Визуальные возможности, ранее ограниченные в Grok 4, были улучшены для полноценного понимания изображений и видео, включая анализ графиков и извлечение текста на уровне OCR. Мультимодальная надежность, бывшая слабым местом прошлых версий, теперь доработана.

Задержка на уровне токенов сократилась примерно на 28% при сохранении глубины рассуждений.

В задачах с длинным контекстом Grok 4.1 выдает когерентный текст при объеме до 1 миллиона токенов, исправляя склонность Grok 4 деградировать после отметки в 300 000 токенов.

xAI также улучшила возможности модели по оркестрации инструментов. Теперь Grok 4.1 способна планировать и задействовать несколько внешних инструментов параллельно, сокращая количество циклов взаимодействия, необходимых для выполнения многошаговых запросов.

Согласно внутренним логам тестов, некоторые исследовательские задачи, ранее требовавшие четырёх шагов, теперь выполняются за один или два.

Другие улучшения включают лучшую калибровку правдивости — снижение склонности увиливать от ответов или смягчать политически чувствительные формулировки, — а также более естественную, человекоподобную просодию в голосовом режиме с поддержкой различных стилей речи и акцентов.

Безопасность и устойчивость к состязательным атакам

В рамках своей системы управления рисками xAI оценила Grok 4.1 на предмет склонности к отказам, устойчивости к галлюцинациям, поддакивания (сикофантии) и безопасности двойного назначения.

Уровень галлюцинаций в режиме без рассуждений снизился с 12,09% у Grok 4 Fast до всего лишь 4,22%, что означает улучшение примерно на 65%.

В бенчмарке фактологических вопросов FActScore модель набрала 2,97% по сравнению с 9,89% у более ранних версий.

В области устойчивости к состязательным атакам Grok 4.1 прошла тестирование на атаки внедрения промптов (prompt injection), брейк-ауты (jailbreak) и запросы, касающиеся чувствительных тем в области химии и биологии.

Фильтры безопасности показали низкий уровень ложноотрицательных срабатываний, особенно в отношении запрещенных химических знаний (0,00%) и биологических запросов (0,03%).

Способность модели противостоять манипуляциям в бенчмарках убеждения, таких как MakeMeSay, также выглядит высокой — её показатель успешности в роли атакующего составил 0%.

Поэтапное открытие корпоративного доступа через API

Несмотря на эти достижения, модель Grok 4.1 изначально была недоступна корпоративным пользователям через API xAI, появившись сперва лишь на потребительских ресурсах компании — в X, на Grok.com и в мобильных приложениях.

19 ноября 2025 года компания xAI открыла доступ к моделям через свой API под именами `grok-4-1-fast-reasoning` и `grok-4-1-fast-non-reasoning`, обе из которых оптимизированы для реального использования инструментов, включая веб-поиск, выполнение кода и извлечение документов.

xAI также представила Agent Tools API — среду, позволяющую автономным агентам работать с данными X в реальном времени, внешними инструментариями и удаленными функциями, причем вся оркестрация целиком выполняется на инфраструктуре xAI.

Это обновление позиционирует Grok 4.1 Fast как флагманскую корпоративную модель xAI, превосходящую таких конкурентов, как Claude Sonnet 4.5, GPT-5 и Gemini 3 Pro, в агентских бенчмарках вроде τ²-bench и Berkeley Function Calling v4. Ценовая политика конкурентоспособна: входные токены стоят $0,20 за миллион (или $0,05 для кэшированного ввода), а выходные — $0,50 за миллион, что соответствует ценовым категориям Grok 4 Fast.

Использование инструментов тарифицируется отдельно — $5 за 1000 успешных вызовов, однако в партнерстве с OpenRouter весь доступ к инструментам временно бесплатен до 3 декабря 2025 года.

В задачах с длинным контекстом и многошаговых сценариях Grok 4.1 Fast демонстрирует заметные улучшения по сравнению как с Grok 4, так и с Grok 4 Fast, что указывает на серьезную оптимизацию методов обучения с подкреплением для агентских и поисково-ориентированных рабочих процессов (RAG).

С этим релизом Grok 4.1 переходит из статуса потребительского продукта в разряд готовых к продакшену платформ для корпоративной и разработческой интеграции. Это также решает ключевое ограничение первоначального релиза, делая наиболее производительный вариант доступным для бэкенд-приложений, исследовательских конвейеров и автономных агентов через API. Ниже представлена таблица сравнения цен:

Модель

Вход (/1M токенов)

Выход (/1M токенов)

Общая стоимость

Источник

ERNIE 4.5 Turbo

$0,11

$0,45

$0,56

Qianfan

Grok 4.1 Fast (с кэшированием)

$0,05

$0,50

$0,55

xAI API

Grok 4.1 Fast (без кэширования)

$0,20

$0,50

$0,70

xAI API

ERNIE 5.0

$0,85

$3,40

$4,25

Qianfan

Qwen3 (Coder ex.)

$0,85

$3,40

$4,25

Qianfan

GPT-5.1

$1,25

$10,00

$11,25

OpenAI

Gemini 2.5 Pro (≤200K)

$1,25

$10,00

$11,25

Google

Gemini 3 Pro (≤200K)

$2,00

$12,00

$14,00

Google

Gemini 2.5 Pro (>200K)

$2,50

$15,00

$17,50

Google

Gemini 3 Pro (>200K)

$4,00

$18,00

$22,00

Google

Grok 4 (0709)

$3,00

$15,00

$18,00

xAI API

Claude Opus 4.1

$15,00

$75,00

$90,00

Anthropic

Реакция индустрии и дальнейшие шаги

Релиз встретил живой отклик как у широкой публики, так и в профессиональной среде. Илон Маск, основатель xAI, оставил короткий одобрительный комментарий, назвав модель «отличной» и поздравив команду. Платформы оценки ИИ-бенчмарков похвалили скачок в удобстве использования и лингвистических нюансах.

Однако для корпоративных клиентов картина выглядит более неоднозначно. Производительность Grok 4.1 представляет собой прорыв для общего назначения и творческих задач.

Поскольку конкурирующие модели от OpenAI, Google и Anthropic продолжают развиваться, компания xAI предложила разработчикам и корпоративным клиентам конкурентоспособный и убедительный выбор.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.