TwelveLabs представляет Pegasus 1.6, чтобы улучшить данные для обучения робототехники на основе видео от первого лица

TwelveLabs представляет Pegasus 1.6, чтобы улучшить данные для обучения робототехники на основе видео от первого лица

Работник, собирающий деталь, демонстрирует не только готовый результат: какой рукой он удерживает деталь, когда тянется за инструментом другой рукой и как действует, если что-то выскальзывает. TwelveLabs хочет сделать эти нюансы полезными для компаний, обучающих роботов выполнять подобную работу.

Сегодня компания, разрабатывающая ИИ для работы с видео, выпустила Pegasus 1.6, добавив специализированную поддержку записей, снятых с точки зрения человека или машины, выполняющих задачу.

TwelveLabs ориентируется на разработчиков робототехники и поставщиков данных, которым нужно преобразовывать такие записи в размеченные материалы с временными метками для обучения. Новая модель развивает возможности описания и сегментации видео, появившиеся в Pegasus 1.5 — предыдущем поколении модели.

Обе модели предназначены для преобразования видео в текст и сегментации видео: они разработаны специально для преобразования исходного видео в структурированные метаданные с временной привязкой.

В отличие от мультимодальных LLM общего назначения, которые склеивают отдельные кадры или отвечают на простые вопросы по коротким роликам, линейка Pegasus разработана для естественного временного рассуждения — то есть для понимания последовательностей причин и следствий с учетом изменений во времени — и сквозного понимания видео.

Для предприятий это предложение помогает преодолеть не самую эффектную, но важную преграду на пути к автоматизации: превратить записи физической работы в данные, которыми команда разработчиков действительно сможет пользоваться. Компании, изучающие возможности робототехники, могут начать документировать и систематизировать отдельные рабочие процессы; команды, уже обучающие роботов, — автоматизировать часть процессов аннотирования и контроля качества.

Это различие важно: Pegasus предоставляет описания и структуру. Разработчикам робототехники по-прежнему нужно связать эти наблюдения с движениями, датчиками и системами управления, которые позволяют машине работать надежно.

«Сейчас эти модели чрезвычайно требовательны к данным», — рассказал сооснователь и генеральный директор TwelveLabs Джэ Ли в интервью VentureBeat накануне анонса.

От видеоархивов к демонстрации действий человеком

По словам Ли, изначально TwelveLabs сосредоточилась на медиа, развлечениях, спорте и рекламе, где клиентам требовалось искать нужные материалы в больших видеоколлекциях и описывать их содержимое. Выход в сферу робототехники позволяет применить эти возможности к другой задаче: выявлению полезных примеров физического поведения.

Телеуправление, при котором человек дистанционно управляет роботом, дает ценные демонстрации, но требует оборудования и обученных операторов. Масштабирование такого процесса сбора данных требует времени и капитала, отметил Ли.

«Это как один парень и один робот», — сказал он.

Записи от первого лица служат еще одним источником демонстраций. Камера, закрепленная на работнике, позволяет фиксировать задачи без необходимости задействовать робота при каждом сборе данных. Но такие записи все равно нужно интерпретировать: какое действие происходит, какой предмет в нем задействован, какая рука его выполняет и когда действие начинается и заканчивается.

Pegasus 1.5 уже делила видео на сегменты с временными метками и создавала структурированные описания. Еще до этого релиза TwelveLabs назвала эти возможности основой для аннотирования данных в робототехнике. В Pegasus 1.6 добавлены обучение и поддержка специально для видео от первого лица, или эгоцентрических записей; компания утверждает, что предыдущие версии плохо справлялись с этой категорией. Новизна заключается в этой специализации и заявленных улучшениях, а не в самой возможности преобразовывать видео в структурированный текст. По словам Ли и согласно техническому описанию компании, клиенты задают нужные им категории и поля, а модель организует видео в соответствии с этими требованиями.

Например, сборочная команда может запросить отдельные сегменты для взятия детали, ее позиционирования и крепления, а также описания роли каждой руки. Это пример возможного рабочего процесса, а не раскрытая информация о внедрении у клиента.

TwelveLabs описывает пять основных сценариев использования: разделение записей на размеченные действия; создание подробных подписей; проверка качества видео; поиск необычных событий и дубликатов; выявление потенциально конфиденциальных материалов перед дальнейшим использованием. Контроль качества может включать проверку наличия препятствий в кадре, нестабильности камеры и неясности действий.

В релизе также добавлены встроенный анализ изображений и улучшенное распознавание людей и объектов, благодаря чему клиенты могут обрабатывать неподвижные изображения через тот же API, что и видео. Эти дополнения расширяют полезность продукта за пределы робототехники — на уже существующие приложения для анализа видео.

Понимание действия — лишь часть обучения ему

Ли описал ближайшие перспективы применения технологии в робототехнике как создание инфраструктуры для обучения.

«Сейчас, Карл, я думаю, мы все еще находимся на этапе, когда нужно как можно быстрее обучать модели», — сказал он.

По его словам, нынешние внедрения обычно сосредоточены на ограниченном наборе задач или на сборе полевых данных, помогающих разработчикам совершенствовать модели. Его долгосрочная гипотеза состоит в том, что видео с участием людей может стать обширной базой знаний о поведении, а демонстрации с телеуправлением помогут адаптировать эти знания к реальным роботам.

Пока это стратегия разработки, а не подтвержденная гарантия того, что большее количество видео позволит создать робота с широкими возможностями.

По словам Ли, Pegasus может описывать движения конечностей и давать приблизительное представление о траекториях, но не предоставляет всей информации, необходимой для их выполнения. Давление, осязание и точное управление остаются отдельными задачами. Командам робототехников необходимо объединять информацию, полученную из видео, с другими данными и разрабатывать системы, которые преобразуют ее в действия.

В приложенном к техническому описанию компании документе приводятся внутренние оценки распознавания действий, определения руки, выполняющей действие, и понимания действий во времени. В нем нет числовых оценок или воспроизводимого сравнения с конкурентами. Ни в интервью, ни в предварительных материалах также не назван клиент из сферы робототехники, результаты работы которого можно было бы независимо проверить.

Ли привел пример скорости обработки: по его словам, один запуск обработал объем записей от первого лица, соответствующий примерно 17 годам, приблизительно за 18 часов, причем ни одно видео не завершилось сбоем. Он не уточнил вычислительные ресурсы и условия оценки, поэтому это анекдотическое заявление о пропускной способности, а не воспроизводимый тест производительности или результат по точности.

С кем конкурирует TwelveLabs — и кому может поставлять решения

Вопрос о конкуренции затрагивает несколько этапов разработки робототехники. Одни компании систематизируют обучающие данные, другие анализируют окружение робота или генерируют его действия.

Cosmos Curator от Nvidia напрямую пересекается с задачей подготовки данных: инструмент поддерживает фильтрацию, аннотирование и удаление дубликатов. Открытые инструменты дают инженерным командам альтернативу покупке управляемого сервиса для понимания видео, хотя выбранный конвейер им все равно придется самостоятельно собрать и обслуживать.

Интеграция Nvidia Cosmos Reason 2 и Embed в Encord — еще один близкий аналог. Encord размещает модели, создает предварительные метки для проверки человеком и поддерживает поиск по действиям. Таким образом, платформа конкурирует за работу по аннотированию и систематизации данных, на которую нацелена TwelveLabs.

Gemini Robotics ER 2 от Google пересекается с этими решениями в интерпретации видео и отслеживании хода выполнения задач, но делает акцент на планировании и координации действий. Выполнение движений он поручает моделям более низкого уровня или интерфейсам робототехнических систем.

Тем временем FLUX-mimic от Black Forest Labs и mimic использует основу видеомодели для генерации действий робота. Компании сообщают об испытаниях и внедрении решения в Audi, в том числе для промышленных манипуляций. Это пример последующей системы, которая могла бы использовать более качественные обучающие данные, хотя интеграция с TwelveLabs здесь не подтверждена.

Предложение

Основная роль

Релевантные возможности

Ключевое отличие для корпоративных клиентов

Опубликованные цены / стоимость (доллары США)

TwelveLabs Pegasus 1.6

Подготовка и описание видео для обучения

Сегментация действий от первого лица, подробные подписи и настраиваемые выходные данные

Сервис API; клиент отвечает за обучение и управление роботом

Опубликованные тарифы: 1,75 доллара за час видео; 3 доллара за миллион входных токенов изображения; 15 долларов за миллион выходных токенов (вдвое дороже, чем Pegasus 1.5). Для предприятий — индивидуальные условия.

Nvidia Cosmos Curator

Создание конвейеров обработки данных

Фильтрация, аннотирование и удаление дубликатов

Открытые инструменты для команд, разрабатывающих собственную инфраструктуру

Программное обеспечение с открытым исходным кодом, без лицензионной платы за Curator; расходы на GPU/облачные сервисы, хранилище и инженерные работы сохраняются. Условия лицензирования моделей различаются.

Encord с Cosmos Reason 2 и Embed

Управление аннотированием и систематизацией данных

Автоматические предварительные метки, процессы проверки и поиск по поведению

Размещаемая платформа, объединяющая модели с проверкой человеком

Публичных цен в долларах нет; чтобы узнать стоимость размещаемой платформы и использования моделей, обратитесь в Encord за предложением.

Google Gemini Robotics ER 2

Анализ и координация задач робота

Оценка хода выполнения задач по видео, планирование и использование инструментов

Доступное через API рассуждение; движения выполняют отдельные системы

Стандартные тарифы API: 1 доллар за миллион входных токенов и 5 долларов за миллион выходных токенов, включая токены для рассуждения, до 31 декабря 2026 года; с 1 января 2027 года — 2 и 10 долларов соответственно. Доступен бесплатный уровень.

BFL/mimic FLUX-mimic

Генерация действий для манипуляций

Преобразование представлений, полученных из видео, в поведение робота

Система для внедрения в робототехнике, охватывающая выполнение действий, а не только подготовку данных

В анонсе продукта цена FLUX-mimic не указана; условия внедрения нужно уточнять. Продукт не позиционируется как бесплатная открытая модель.

Цены проверены 6 октября 2026 года. Единицы тарификации и охват продуктов различаются, поэтому по этим тарифам нельзя определить, какой вариант окажется самым дешевым для конкретной задачи. TwelveLabs тарифицирует видео по длительности, а текстовый вывод — по токенам; Google тарифицирует входные и выходные токены. TwelveLabs также умножает оплачиваемую длительность видео на количество определений сегментов в запросе Segment. Для ПО с открытым исходным кодом по-прежнему требуются платная инфраструктура или уже имеющиеся вычислительные ресурсы.

Это функциональные сопоставления, основанные на описаниях поставщиков, а не единый рейтинг производительности. Из рассмотренных данных не следует, что Pegasus 1.6 превосходит все эти решения по качеству разметки, стоимости или вероятности успешной работы робота в будущем.

По мнению Ли, разработчики моделей, генерирующих действия, могут стать потенциальными клиентами: «Мы очень удачно вписываемся в разные стеки», — сказал он.

Коммерческий успех будет зависеть от того, сможет ли TwelveLabs сделать подготовку видео настолько точной, экономичной и простой для интеграции, чтобы эти команды предпочли купить ее, а не разрабатывать собственное решение или выбирать альтернативу.

Цены и что предприятиям стоит проверить в первую очередь

TwelveLabs удвоила цену выходных токенов для Pegasus 1.6 — до 15 долларов за миллион токенов против 7,50 доллара у Pegasus 1.5. Стоимость обработки входного видео осталась прежней — 1,75 доллара за час, поэтому общая сумма за обработку не удваивается. Входные изображения стоят 3 доллара за миллион токенов. Для корпоративных контрактов предусмотрены индивидуальные цены; покупателям, которым нужно частное размещение или самостоятельное управление системой, следует обратиться в отдел продаж.

По опубликованному тарифу однократная обработка 1 000 часов видео обойдется в 1 750 долларов без учета выходных данных и других применимых сборов. Подробная разметка увеличивает расходы на выходные данные. В разделе часто задаваемых вопросов о ценах также говорится, что за каждое определение сегмента в запросе Segment взимается отдельная плата, увеличивающая тарифицируемую длительность отправленного видео. Это важно учитывать командам, которые запрашивают разметку по нескольким категориям.

Ли отметил, что компания также может заключить с крупными партнерами небольшое число долгосрочных лицензионных соглашений и договоров на индивидуальные исследования.

Предприятию, которое только начинает заниматься робототехникой, полезно выбрать для начала ограниченный рабочий процесс — например, упаковку конкретного товара или сборку определенной детали. Пилотный проект позволит выяснить, достаточно ли подробны записи, соответствуют ли созданные метки оценкам экспертов и сколько исправлений требуется до того, как партнер из сферы робототехники сможет использовать данные.

Кроме того, необходимо определить порядок получения разрешений на запись работников и обработки конфиденциальных производственных процессов. Автоматическое обнаружение конфиденциальных изображений помогает при проверке, но само по себе не дает разрешения собирать эти записи или обучать на них модели.

Для команд, уже экспериментирующих с роботами, более убедительной проверкой станет результат на последующих этапах: улучшится ли выполнение задач на отложенных примерах после добавления видео с разметкой Pegasus, уменьшится ли потребность в сборе данных или сократятся ли циклы разработки? Точность аннотирования, пропущенные границы действий и время на исправления человеком следует измерять наряду со скоростью обработки.

Важный экономический показатель — стоимость одного принятого и полезного обучающего примера, а затем его вклад в улучшение поведения робота. TwelveLabs предлагает ускорить процесс между записью действия и обучением на его примере. Предприятиям потребуются собственные доказательства того, что полученные данные действительно улучшают выполнение задачи, которую они намерены автоматизировать.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.