DreamDojo от Nvidia обучает роботов с помощью видео
Команда исследователей под руководством Nvidia выпустила DreamDojo — новую систему искусственного интеллекта, предназначенную для обучения роботов взаимодействию с физическим миром путем просмотра десятков тысяч часов видео с участием людей. Эта разработка может значительно сократить время и затраты, необходимые для создания гуманоидных машин нового поколения.
Исследование, опубликованное в этом месяце при участии специалистов из Калифорнийского университета в Беркли, Стэнфорда, Техасского университета в Остине и ряда других институтов, представляет то, что создатели называют «первой в своем роде моделью мира для роботов, демонстрирующей высокую степень генерализации на разнообразных объектах и в различных средах после этапа дообучения».
В основе DreamDojo лежит то, что исследователи описывают как «крупномасштабный видеодатасет», включающий «44 тыс. часов разнообразных видеороликов от первого лица, снятых людьми — крупнейший на сегодняшний день набор данных для предварительного обучения моделей мира». Набор данных под названием DreamDojo-HV представляет собой колоссальный скачок в масштабах: согласно документации проекта, он в «15 раз длиннее по продолжительности, содержит в 96 раз больше навыков и в 2000 раз больше сцен, чем ранее крупнейший датасет для обучения моделей мира».
Симулированный робот кладет чашку в картонную коробку в условиях мастерской — один из тысяч сценариев, которые DreamDojo способна смоделировать после обучения на 44 000 часах видео с людьми. (Источник: Nvidia)
Двухэтапная система обучения, которая учит роботов видеть мир по-человечески
Система работает в два этапа. Сначала DreamDojo «приобретает исчерпывающие знания о физических законах из крупномасштабных массивов данных о людях путем предварительного обучения с использованием скрытых действий (latent actions)». Затем следует этап «дообучения на целевом типе робототехнической платформы с применением непрерывных действий робота» — по сути, система сначала изучает общую физику, наблюдая за людьми, а затем подстраивает эти знания под конкретное аппаратное обеспечение робота.
Для предприятий, рассматривающих возможность внедрения гуманоидных роботов, такой подход решает застарелую проблему. Обучение робота манипулированию объектами в неструктурированной среде традиционно требует огромных объемов демонстрационных данных для конкретной модели робота, сбор которых обходится дорого и отнимает много времени. DreamDojo обходит эту проблему за счет использования существующих видео с людьми, позволяя роботам учиться на основе наблюдения еще до того, как они прикоснутся к какому-либо физическому объекту.
Одним из технических прорывов стала скорость работы. Благодаря процессу дистилляции исследователям удалось добиться «взаимодействия в реальном времени со скоростью 10 кадров в секунду в течение более 1 минуты» — возможности, которая открывает путь к практическому применению, такому как удаленное управление в прямом эфире и планирование «на лету». Команда продемонстрировала работу системы на различных робототехнических платформах, включая гуманоидных роботов GR-1, G1, AgiBot и YAM, показав то, что они называют «реалистичными траекториями движения, обусловленными действиями» в «самых разных средах и при взаимодействии с широким спектром объектов».
Почему Nvidia делает крупную ставку на робототехнику на фоне роста расходов на ИИ-инфраструктуру
Этот релиз происходит в ключевой момент как для робототехнических амбиций Nvidia, так и для всей индустрии искусственного интеллекта в целом. На прошлой месяце на Всемирном экономическом форуме в Давосе генеральный директор компании Дженсен Хуанг заявил, что робототехника на базе ИИ представляет собой возможность, которая выпадает «раз в жизни», особенно для регионов с сильной производственной базой. По данным Digitimes, Хуанг также заявлял, что следующее десятилетие станет «критическим периодом ускоренного развития технологий робототехники».
Финансовые ставки чрезвычайно высоки. Хуанг сообщил в программе «Halftime Report» на телеканале CNBC 6 февраля, что капитальные затраты технологической индустрии, которые в этом году могут достичь 660 миллиардов долларов со стороны ключевых гиперскейлеров, являются «оправданными, целесообразными и устойчивыми». Он охарактеризовал текущий момент как «крупнейшее развитие инфраструктуры в истории человечества», на фоне которого такие компании, как Meta, Amazon, Google и Microsoft, драматически увеличивают свои расходы на ИИ.
Этот инфраструктурный импульс уже меняет ландшафт робототехники. Согласно данным Dealroom, стартапы в сфере робототехники привлекли рекордные $26,5 млрд в 2025 году. Европейские промышленные гиганты, включая Siemens, Mercedes-Benz и Volvo, за последний год объявили о партнерстве в области робототехники, в то время как генеральный директор Tesla Илон Маск заявил, что 80 процентов будущей стоимости его компании будет поступать от гуманоидных роботов Optimus.
Как DreamDojo может трансформировать внедрение и тестирование роботов на предприятиях
Для технических руководителей, оценивающих гуманоидных роботов, наибольшую ценность в DreamDojo могут представлять ее возможности симуляции. Исследователи отмечают такие потенциальные сценарии применения, как «надежная оценка стратегий (policy evaluation) без необходимости развертывания в реальном мире и модельно-ориентированное планирование для улучшения работы в процессе тестирования» — возможности, которые позволят компаниям масштабно симулировать поведение роботов до того, как они перейдут к дорогостоящим физическим испытаниям.
Это имеет решающее значение, поскольку разрыв между лабораторными демонстрациями и цехами заводов по-прежнему велик. Робот, безупречно работающий в контролируемых условиях, часто пасует перед непредсказуемыми вариациями реального мира — другим освещением, незнакомыми предметами и неожиданными препятствиями. Обучаясь на 44 000 часах разнообразных видео с участием людей, охватывающих тысячи сцен и почти 100 различных навыков, DreamDojo стремится сформировать у роботов общую физическую интуицию, которая делает их гибкими, а не хрупкими.
Исследовательская группа под руководством Линси «Джима» Фана, Джоэла Чанга и Юке Чжу, при участии Шенюаня Гао и Уильяма Ляна в качестве соавторов первых публикаций, сообщила, что код будет выпущен в открытый доступ, хотя конкретные сроки не уточняются.
Более широкая картина: превращение Nvidia из игрового гиганта в тяжеловеса робототехники
Превратится ли DreamDojo в коммерческие робототехнические продукты, еще предстоит увидеть. Но это исследование четко обозначает вектор амбиций Nvidia по мере того, как компания выходит за рамки своих игровых истоков. Как отметил Кайл Барр в статье для Gizmodo ранее в этом месяце, теперь Nvidia рассматривает «все, что связано с играми и персональными компьютерами» как «второстепенные статьи в квартальных отчетах».
Этот сдвиг отражает расчетливую ставку: будущее вычислений носит физический, а не только цифровой характер. Nvidia уже инвестировала $10 миллиардов в Anthropic и заявила о планах вложить значительные средства в следующий раунд финансирования OpenAI. DreamDojo намекает на то, что компания видит в гуманоидных роботах новую границу, где ее экспертиза в области ИИ и доминирование на рынке чипов могут объединиться.
На данный момент 44 000 часов видео с участием людей, лежащие в основе DreamDojo, представляют собой нечто гораздо более фундаментальное, чем просто технический ориентир. Они воплощают в себе теорию о том, что роботы могут научиться ориентироваться в нашем мире, просто наблюдая за тем, как мы в нем живем. Как оказалось, машины делали заметки.



