Lux от OpenAGI превосходит Operator от OpenAI

Lux от OpenAGI превосходит Operator от OpenAI

Новый секретный ИИ-стартап, основанный исследователем из Массачусетского технологического института (MIT), делает амбициозное заявление: его ИИ-модель способна управлять компьютерами лучше, чем системы от OpenAI и Anthropic, и при этом обходится значительно дешевле.

Компания OpenAGI во главе с генеральным директором Цзэнъи Цинем (Zengyi Qin) выпустила базовую модель Lux, созданную для автономного управления компьютерами путем интерпретации скриншотов и выполнения действий в различных десктопных приложениях. Базирующийся в Сан-Франциско стартап заявляет, что Lux достигает показателя успешности в 83,6% на бенчмарке Online-Mind2Web, который стал самым суровым отраслевым тестом для оценки ИИ-агентов, управляющих компьютерами.

OpenAGI Lux Thinker 1.0

Источник: OpenAGI Foundation

Этот результат представляет собой значительный скачок по сравнению с передовыми моделями хорошо финансируемых конкурентов. Модель Operator от OpenAI, выпущенная в январе, набирает 61,3% в том же бенчмарке. Разработка Anthropic — Claude Computer Use — достигает 56,3%.

«Традиционное обучение LLM заключается в скармливании модели огромного объема текстового корпуса, — отметил Цинь в эксклюзивном интервью VentureBeat. — Модель учится производить текст. Наша же модель, напротив, учится производить действия. Она обучена на большом количестве компьютерных скриншотов и последовательностей действий, что позволяет ей совершать шаги для управления компьютером».

Это анонс появляется в ключевой момент для индустрии искусственного интеллекта. Технологические гиганты и стартапы вложили миллиарды долларов в разработку автономных агентов, способных ориентироваться в программном обеспечении, бронировать билеты, заполнять формы и выполнять сложные рабочие процессы. OpenAI, Anthropic, Google и Microsoft за последний год выпустили или анонсировали собственные агентские продукты, делая ставку на то, что управляющий компьютерами ИИ станет столь же преобразующим инструментом, как и чат-боты.

Тем не менее, независимые исследования ставят под сомнение то, действительно ли нынешние агенты так способны, как утверждают их создатели.

Почему университетские исследователи создали более сложный бенчмарк для тестирования ИИ-агентов — и что они обнаружили

Бенчмарк Online-Mind2Web, разработанный исследователями из Университета штата Огайо и Калифорнийского университета в Беркли, был создан специально для того, чтобы выявить разрыв между маркетинговыми заявлениями и реальной производительностью.

Опубликованный в апреле и принятый на Конференции по языковому моделированию 2025 года (Conference on Language Modeling 2025), бенчмарк включает 300 разнообразных задач на 136 реальных веб-сайтах — от бронирования авиабилетов до прохождения сложных процедур оформления заказа в интернет-магазинах. В отличие от более ранних тестов, которые кэшировали части веб-сайтов, Online-Mind2Web проверяет агентов в реальных онлайн-средах, где страницы динамически меняются и возникают непредвиденные препятствия.

По словам исследователей, результаты рисуют «совершенно иную картину компетентности современных агентов, указывая на излишний оптимизм в отношении ранее опубликованных результатов».

Когда команда из штата Огайо протестировала пять ведущих веб-агентов с тщательной экспертной оценкой людей, они обнаружили, что многие новейшие системы — несмотря на крупные инвестиции и маркетинговую шумиху — не превосходят SeeAct, сравнительно простого агента, выпущенного в январе 2024 года. Даже модель Operator от OpenAI, показавшая лучшие результаты среди коммерческих предложений в их исследовании, добилась успеха лишь в 61% случаев.

«Казалось, что высокоэффективные и практичные агенты действительно находятся всего в нескольких месяцах от релиза, — написали исследователи в своем блоге. — Однако мы также прекрасно понимаем, что в исследованиях до сих пор существует множество фундаментальных пробелов на пути к созданию полностью автономных агентов, и текущие агенты, вероятно, не так компетентны, как могут иллюстрировать показатели бенчмарков».

Этот бенчмарк завоевал популярность в качестве отраслевого стандарта: общедоступная таблица лидеров на Hugging Face отслеживает результаты исследовательских групп и компаний.

Как OpenAGI научила свой ИИ совершать действия вместо простого генерирования текста

Заявленное OpenAGI превосходство в производительности проистекает из того, что компания называет «агентским активным пре-обучением» (agentic active pre-training) — методологии, которая кардинально отличается от того, как учатся большинство LLM.

Обычные языковые модели обучаются на огромных корпусах текста, учась предсказывать следующее слово в последовательности. Полученные системы отлично справляются с генерацией связного текста, но изначально не были созданы для совершения действий в графических средах.

OpenAGI Lux Thinker 1.0 flowchart

Источник: OpenAGI

По словам Циня, Lux использует другой подход. Модель обучается на компьютерных скриншотах в паре с последовательностями действий, учась интерпретировать визуальные интерфейсы и определять, какие клики, нажатия клавиш и шаги навигации приведут к достижению поставленной цели.

«Действие позволяет модели активно исследовать компьютерную среду, и такое исследование порождает новые знания, которые затем передаются обратно модели для обучения, — рассказал Цинь изданию VentureBeat. — Это естественным образом саморазвивающийся процесс, в котором лучшая модель порождает лучшие исследования, лучшие исследования порождают лучшие знания, а лучшие знания приводят к появлению еще более совершенной модели».

Этот самоподдерживающийся цикл обучения, если он функционирует так, как заявлено, может помочь объяснить, как небольшая команда смогла достичь результатов, ускользающих от более крупных организаций. Вместо того чтобы требовать все возрастающих статических наборов данных, такой подход позволил бы модели непрерывно совершенствоваться путем самостоятельной генерации обучающих данных в процессе исследования.

OpenAGI также заявляет о значительных преимуществах в стоимости. Компания утверждает, что Lux работает примерно при одной десятой затрат на передовые модели от OpenAI и Anthropic, выполняя задачи быстрее.

В отличие от конкурентов, работающих только в браузере, Lux может управлять Slack, Excel и другими десктопными приложениями

Важнейшее отличие в анонсе OpenAGI: Lux может управлять приложениями во всей операционной системе рабочего стола, а не только в веб-браузерах.

Большинство коммерчески доступных агентов для работы за компьютером, включая ранние версии Claude Computer Use от Anthropic, ориентированы в первую очередь на задачи в браузере. Это ограничение исключает огромные категории продуктивной работы, происходящей в настольных приложениях: электронные таблицы в Microsoft Excel, коммуникацию в Slack, дизайн в продуктах Adobe, редактирование кода в средах разработки.

OpenAGI заявляет, что Lux способна ориентироваться в этих нативных приложениях, что существенно расширит потенциальный рынок сбыта для компьютерных агентов. Компания выпускает для разработчиков комплект средств разработки программного обеспечения (SDK) одновременно с моделью, позволяя третьим сторонам создавать приложения на базе Lux.

Компания также сотрудничает с Intel с целью оптимизации Lux для периферийных устройств (edge devices), что позволит модели запускаться локально на ноутбуках и рабочих станциях, а не требовать облачной инфраструктуры. Это партнерство может снять опасения корпоративных клиентов по поводу отправки конфиденциальных данных с экрана на внешние сервера.

«Мы сотрудничаем с Intel для оптимизации нашей модели под периферийные устройства, что сделает ее лучшей локальной моделью для компьютерных задач», — заявил Цинь.

Компания подтвердила, что ведет предварительные переговоры с AMD и Microsoft по поводу дополнительных партнерств.

Что происходит, когда вы просите ИИ-агента скопировать ваши банковские реквизиты

Агенты для работы за компьютером порождают принципиально новые проблемы безопасности, которые не возникают при использовании обычных чат-ботов. ИИ-система, способная нажимать кнопки, вводить текст и переключаться между приложениями, при ошибочном направлении может нанести серьезный ущерб — например, перевести деньги, удалить файлы или выгрузить конфиденциальную информацию.

OpenAGI заявляет, что встроила механизмы безопасности непосредственно в Lux. Когда модель сталкивается с запросами, нарушающими ее политику безопасности, она отказывается продолжать работу и предупреждает пользователя.

В примере, предоставленном компанией, когда пользователь попросил модель «скопировать мои банковские реквизиты и вставить их в новый документ Google», Lux выдала внутреннее рассуждение: «Пользователь просит меня скопировать банковские реквизиты, которые являются конфиденциальной информацией. Согласно политике безопасности, я не могу выполнить это действие». После этого модель выдала пользователю предупреждение вместо того, чтобы выполнять потенциально опасный запрос.

Подобные средства защиты подвергнутся жесткой проверке по мере распространения компьютерных агентов. Исследователи в области безопасности уже продемонстрировали атаки методом внедрения промптов (prompt injection) на ранние агентские системы, когда вредоносные инструкции, встроенные в веб-сайты или документы, могут перехватить поведение агента. Способны ли защитные механизмы Lux противостоять злонамеренным атакам, еще предстоит проверить независимым исследователям.

Исследователь из MIT, создавший две самые скачиваемые ИИ-модели на GitHub

Цинь привносит в OpenAGI необычное сочетание академических регалий и предпринимательского опыта.

Он получил степень доктора наук в Массачусетском технологическом институте в 2025 году, где его исследования были сосредоточены на компьютерном зрении, робототехнике и машинном обучении. Его научные работы публиковались на ведущих площадках, включая Конференцию по компьютерному зрению и распознаванию образов (CVPR), Международную конференцию по представлению признаков (ICLR) и Международную конференцию по машинному обучению (ICML).

До основания OpenAGI Цинь создал несколько широко распространенных ИИ-систем. JetMoE, языковая модель, которую он соразработал, продемонстрировала, что высокопроизводительную модель можно обучить с нуля менее чем за 100 000 долларов — это лишь малая доля от десятков миллионов, обычно требующихся для этого. Согласно техническому отчету, привлекшему внимание Лаборатории искусственного интеллекта и компьютерных наук MIT, модель превзошла LLaMA2-7B от Meta на стандартных бенчмарках.

Его предыдущие проекты с открытым исходным кодом добились выдающегося распространения. OpenVoice, модель клонирования голоса, набрала около 35 000 звезд на GitHub и вошла в топ-0,03% проектов с открытым исходным кодом по популярности. MeloTTS, система преобразования текста в речь, была скачана более 19 миллионов раз, что делает ее одной из самых широко используемых аудио-моделей ИИ с момента ее релиза в 2024 году.

Цинь также стал соучредителем MyShell — платформы ИИ-агентов, которая привлекла шесть миллионов пользователей, создавших в совокупности более 200 000 ИИ-агентов. По данным компании, пользователи совершили с агентами на платформе более одного миллиарда взаимодействий.

Закулисье гонки стоимостью в миллиарды долларов за создание ИИ, который управляет вашим компьютером

Рынок агентов для работы за компьютером за последний год привлек пристальное внимание со стороны инвесторов и технологических гигантов.

OpenAI выпустила Operator в январе, позволив пользователям давать ИИ поручения на выполнение задач в интернете. Anthropic продолжила развитие Claude Computer Use, позиционируя его как ключевую функцию своего семейства моделей Claude. Google интегрировала возможности агентов в свои продукты Gemini. Microsoft встроила функционал агентов во все свои предложения Copilot и в Windows.

Тем не менее, этот рынок все еще находится в зачаточном состоянии. Корпоративное внедрение сдерживается опасениями по поводу надежности, безопасности и способности справляться с крайними случаями (edge cases), которые часто возникают в реальных рабочих процессах. Разрывы в производительности, выявленные такими бенчмарками, как Online-Mind2Web, свидетельствуют о том, что текущие системы могут быть еще не готовы к критически важным приложениям.

OpenAGI выходит на этот конкурентный рынок в качестве независимой альтернативы, противопоставляя превосходные результаты в бенчмарках и более низкие затраты огромным ресурсам своих хорошо финансируемых соперников. Модель Lux и SDK для разработчиков от этой компании доступны начиная с сегодняшнего дня.

Сможет ли OpenAGI перевести доминирование в бенчмарках в реальную надежность — остается главным вопросом. Индустрия искусственного интеллекта имеет долгую историю впечатляющих демо-версий, которые буксуют в продакшене, и лабораторных результатов, рушащихся при столкновении с хаосом реального использования. Бенчмарки измеряют то, для чего они созданы, а расстояние между контролируемым тестом и 8-часовым рабочим днем, полным непредвиденных нюансов, исключений и сюрпризов, может быть огромным.

Но если Lux покажет себя в реальном мире так же, как в лаборатории, последствия выйдут далеко за рамки успеха одного стартапа. Это укажет на то, что путь к способным ИИ-агентам лежит не через самые толстые чековые книжки, а через самые умные архитектуры — и что небольшая команда с правильными идеями способна переиграть гигантов.

Технологическая индустрия уже видела эту историю раньше. Редко когда она долго остается неизменной.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.