Black Forest Labs представила FLUX 3 Action — открытую ИИ-модель для робототехники, которая возглавила рейтинг при вдвое меньшем размере по сравнению с конкурентами
Немецкий ИИ-стартап Black Forest Labs (BFL), известный своими моделями генерации изображений и видео FLUX, делает серьезный шаг в сферу робототехники, представляя FLUX 3 Action — «модель действий в мире» (World Action Model) с открытыми весами и 7 миллиардами параметров, созданную для того, чтобы принимать данные с камер, текущее состояние робота и инструкции на естественном языке, а затем преобразовывать их в физические действия.
Компания заявляет, что FLUX 3 Action достигает общего процента успешных выполнений на уровне 42,92% на бенчмарке NVIDIA RoboLab-120, что ставит ее выше любой модели, в настоящее время представленной в публичной таблице лидеров.
Что еще важнее для разработчиков, стремящихся внедрить робототехническую модель на практике, а не просто тестировать ее, в BFL отмечают, что FLUX 3 Action имеет 7 миллиардов параметров против 16 миллиардов у NVIDIA Cosmos3-Nano-Policy, работая при этом в 1,43 раза быстрее, то есть задействуя почти вдвое (44%) меньше параметров.
BFL также тестирует эту же архитектуру за пределами физической робототехники и заявляет, что подход может быть масштабирован на симуляции, игры и использование компьютера — среды, где модели точно так же необходимо интерпретировать изменяющееся визуальное состояние и принимать решение о следующем действии.
В компании сообщили, что обучили специализированные политики FLUX 3 Action для реального пилотирования дронов и даже успешно прошли культовую компьютерную игру Doom без единой гибели персонажа, управляя видом от первого лица и рукой главного героя с оружием.
В компании характеризуют эти результаты как ранние эксперименты, а не как готовые производственные возможности.
Представители BFL рассказали VentureBeat, что планируют выпустить веса, код, рецепты дообучения, бенчмарки и воспроизводимые примеры, включая реализацию с использованием относительно недорогого робота SO-101 и фреймворка LeRobot от Hugging Face. Команды также смогут дообучать модель на демонстрациях, собранных с их собственных роботов.
Компания BFL впервые представила модель FLUX 3 Action, когда в июле состоялся запуск более широкого семейства FLUX 3. В тот момент модель Action была доступна только избранным исследовательским и коммерческим партнерам, в то время как более широкая модель с открытыми весами FLUX 3 Dev была обещана к выходу позже.
BFL заявляет о новом рекорде в RoboLab
RoboLab — это разработанный NVIDIA симуляционный бенчмарк, предназначенный для тестирования робототехнических политик общего назначения на 120 задачах, охватывающих визуальное восприятие, реляционные рассуждения и процедурные навыки с различными уровнями сложности и вариациями точности описания задачи. Компания NVIDIA создала его отчасти во избежание насыщения, из-за которого старые робототехнические бенчмарки становятся менее полезными по мере совершенствования политик.
Таким образом, в BFL утверждают, что результат FLUX 3 Action в 42,92% превосходит Cosmos 3 — предыдущую модель с открытым исходным кодом, занимавшую первое место в RoboLab, — на 6,1 процентного пункта. Модель Cosmos3-Nano-Policy имеет 16 миллиардов параметров против 7 миллиардов у FLUX 3 Action.
Однако конкурентная картина шире, чем просто рейтинг в RoboLab. Непосредственно перед релизом FLUX 3 Action первое место в общем зачете RoboLab-120 занимала OASIS WAM с показателем 39,0%. Тем не менее FLUX 3 Action выходит в лидеры.
Результаты FLUX 3 Action в таблице лидеров бенчмарка RoboLab-120 от Nvidia. Источник: Black Forest Labs
Сравнение по размеру показательно на фоне Cosmos, хотя FLUX 3 Action нельзя назвать исключительно маленькой моделью в масштабах всего рынка робототехнических решений.
MolmoAct 2 от Ai2 — это модель примерно с 5 миллиардами параметров, в то время как NVIDIA распространяет контрольную точку GR00T N1.7 с 3 миллиардами параметров. Главное отличие заключается в том, что BFL заявляет о более высоком проценте успешных решений в RoboLab при значительно меньшем количестве параметров по сравнению с конкретной открытой моделью WAM, ранее лидировавшей в этом бенчмарке.
Стоит отметить, что MolmoAct 2, новые версии GR00T от NVIDIA и другие робототехнические модели оцениваются на различных комбинациях реальных и симуляционных робототехнических задач, поэтому в настоящее время они не отображаются рядом с FLUX 3 Action в RoboLab.
Это затрудняет прямые числовые сравнения — извечная проблема в робототехнике, где аппаратное обеспечение, распределение задач, демонстрации и среды оценки могут кардинально различаться у разных исследовательских групп.
Тем не менее BFL также делает акцент на скорости инференса. Предоставленные компанией результаты сравнивают модели с использованием коэффициента реального времени (real-time factor) — по сути, величины задержки инференса, деленной на продолжительность выполнения реального действия робота. Меньшие значения лучше, так как они означают, что модель тратит меньше вычислительного времени на принятие решения относительно объема контролируемых движений робота.
В BFL заявляют, что дистиллированные варианты FLUX 3 Action формируют новую границу Парето между процентом успешных выполнений в RoboLab и скоростью инференса на GPU датацентров, а сама модель превосходит π0.5 по коэффициенту реального времени, сохраняя при этом существенно более высокий уровень успешности выполнения задач.
Это важные показатели для развертывания: робототехническая политика, которая демонстрирует отличные результаты на бумаге, но не способна непрерывно генерировать действия с достаточной скоростью, чревата паузами, подергиваниями или запоздалыми реакциями. Однако новые результаты FLUX были предоставлены BFL до публикации; публичная таблица лидеров NVIDIA еще не была обновлена данными FLUX 3 Action на момент проверки перед запуском.
Также стоит разграничивать различные категории сравниваемых моделей. BFL и NVIDIA определяют FLUX 3 Action и Cosmos 3 как модели действий в мире (WAM), которые связывают предсказания об эволюции окружающего мира с генерацией действий.
Модель π0.5 от Physical Intelligence и семейство GR00T от NVIDIA относятся к моделям «видео-язык-действие» (VLA), в то время как Ai2 описывает MolmoAct 2 как «модель рассуждений о действиях» (Action Reasoning Model). Все они могут конкурировать за пересекающиеся рабочие нагрузки по манипулированию объектами, но не обязательно обучаются или генерируют действия одинаковым образом.
Модель предсказывает, что произойдет дальше, и то, какими должны быть следующие действия робота
Архитектура следует концепции, которую BFL развивала на протяжении большей части этого года: модель, обученная на достаточном объеме видеоданных, должна усваивать полезные представления о движении, контактах, поведении объектов и причинно-следственных связях, после чего эти представления можно адаптировать для управления роботами.
FLUX 3 Action опирается на предварительное обучение на изображениях, видео и аудио, лежащее в основе FLUX 3, но, по заявлению BFL, использует меньшую архитектуру, оптимизированную для практического применения. В ходе дополнительного обучения модель учится одновременно прогнозировать будущие видеокадры и действия.
На этапе инференса она принимает недавние кадры с камер, состояние системы и описание задачи, возвращая следующие 32 действия вместе с прогнозом того, как будет развиваться визуальная сцена. Затем робот оценивает обновленную среду и повторяет процесс.
Базовый подход восходит к исследованиям Self-Flow от BFL, которые призваны заставить генеративную модель изучать полезные представления своих входных данных параллельно с обучением их генерации. Ранее издание VentureBeat рассказывало о технологии Self-Flow как о попытке BFL избавиться от зависимости от отдельных замороженных моделей представлений, таких как CLIP или DINO. Позже BFL масштабировала эту работу в проект FLUX 3.
BFL выпустила инференс-код Self-Flow и контрольную точку ImageNet под лицензией Apache 2.0, однако полный код обучения и контрольная точка видеомодели не были опубликованы.
Эта связь между генерацией и робототехникой уже была заметна в FLUX-mimic, созданном совместно со швейцарским стартапом mimic robotics. В BFL отметили, что в более ранней системе использовались представления из видеоосновы FLUX 3 для управления роботами, выполняющими промышленные манипуляционные задачи, и что она прошла тестирование на производственных площадках Audi.
FLUX 3 Action переносит этот подход в модель, которую другие робототехнические команды могут адаптировать самостоятельно.
По словам представителей BFL, политика, продемонстрированная в новых материалах, была дообучена примерно на 200 эпизодах телеуправления, охватывающих несколько связанных задач захвата и перемещения (pick-and-place). В компании подчеркивают, что объекты, показанные в тестовых видео, отсутствовали в этом обучающем наборе.
Одна из предоставленных демонстраций примечательна тем, что робот сначала совершает ошибку, а затем предпринимает попытку выполнить задачу снова. В стенограмме сопутствующего интервью исследователи описали это поведение следующим образом: «Сначала модель потерпела неудачу, а затем попробовала снова и справилась лучше».
Тем не менее это по-прежнему демонстрация, выбранная самой компанией, а не доказательство того, что автономное восстановление после сбоев будет универсальным для любых роботов и сред. Однако это иллюстрирует поведение, которое, как надеются в BFL, предоставит предварительно обученная модель мира без необходимости для команд явно демонстрировать каждый возможный сценарий сбоя.
BFL не одиночна в утверждении, что модель с широким предварительным обучением способна сократить объем специфичных для роботов данных. В Google DeepMind заявляют, что их проприетарная модель Gemini Robotics On-Device 2 VLA способна адаптироваться к новым форм-факторам роботов менее чем по 200 примерам, хотя доступ к ней по-прежнему ограничен проверенными тестерами.
С точки зрения решений с открытым исходным кодом, MolmoAct 2 от Ai2 выступает, пожалуй, наиболее прямым аналогом стратегии релизов BFL. Ai2 выпустила не только веса MolmoAct 2, но и код обучения, скрипты дообучения, наборы данных, результаты оценочных прогонов и интеграцию с LeRobot. Ai2 сообщает о среднем показателе успешности в 87,1% по пяти собственным реальным оценочным задачам на роботах Franka против 45.2% у π0.5 — результатах, которые невозможно напрямую сопоставить с процентами RoboLab из-за различий в наборах задач и методологии оценки.
Это различие имеет значение для разработчиков, оценивающих данные системы: в робототехнике до сих пор нет единого бенчмарка, который четко определял бы общего лидера среди моделей в симуляциях, на «железе», для разных форм-факторов и типов манипуляций. Результат FLUX 3 Action фиксирует ее позиции в RoboLab, но не разрешает более широкое соперничество между WAM, VLA и моделями рассуждений о действиях.
BFL переходит от генерации изображений к физическому ИИ
Появление FLUX 3 Action также демонстрирует, как стремительно расширялась сфера деятельности BFL с момента основания компании в 2024 году.
Стартап был основан исследователями, стоящими за такими технологиями, как латентная диффузия и Stable Diffusion, и изначально завоевал репутацию благодаря семейству моделей изображений FLUX.1. Впоследствии BFL представила коммерческий API с FLUX1.1 Pro, а затем расширила свою стратегию открытого ядра (open-core) за счет семейства FLUX.2, включая более компактные модели [klein], разработанные для высокоскоростного инференса и локального развертывания.
В декабре 2025 года BFL привлекла 300 млн долларов в рамках раунда финансирования серии B при оценке компании в 3,25 млрд долларов после инвестиций, в результате чего общий объем финансирования превысил 450 млн долларов. Компания базируется во Фрайбурге и Сан-Франциско.
Модель FLUX 3 Video стала общедоступной через API BFL в августе с тарифной моделью по факту использования (pay-as-you-go) от $0.06 за секунду для формата Draft HD, $0.17 за секунду для стандартного HD и $0.29 за секунду для генерации текста или изображения в видео в разрешении FHD. Теперь BFL также предлагает апскейлинг видео до более высоких разрешений через отдельную конечную точку.
Тем не менее релизные материалы новой модели FLUX 3 Action пока не анонсируют Action API, цены на его использование или конкретную коммерческую лицензию для весов. На момент публикации текущая публичная страница FLUX 3 от BFL по-прежнему описывает модель Action как внедряемую через избранных исследовательских и коммерческих партнеров. В официальной документации продуктов FLUX 3 также числится в первую очередь как API для генерации видео, а не как эндпоинт FLUX 3 Action.
Для робототехнических команд это означает, что самостоятельное развертывание и дообучение остаются главным предложением на текущий момент.
Такой подход помещает FLUX 3 Action в и без того перенасыщенную экосистему робототехники с открытым или загружаемым кодом:
-
NVIDIA GR00T N1.7, выпущенная в апреле, представляет собой открытую модель VLA с 3 миллиардами параметров, нацеленную в первую очередь на обобщенные гуманоидные манипуляции и работу с разными форм-факторами, и может подвергаться пост-тренировке для конкретных роботов, задач и сред.
-
MolmoAct 2, выпущенная в мае, аналогичным образом ориентирована на локальную адаптацию и интегрирована непосредственно в LeRobot.
-
В свою очередь, Gemini Robotics On-Device 2 от Google, представленная в июле, представляет проприетарную сторону спектра: она создана для локального запуска на робототехническом «железе», однако в настоящее время Google распространяет ее только среди избранных тестеров, не выкладывая веса в открытый доступ.
И это, пожалуй, наиболее важный аспект релиза. Вместо того чтобы заставлять команду самостоятельно обучать крупную базовую модель для робототехники, BFL делает ставку на то, что разработчики смогут начать с относительно компактной модели, обладающей широкими визуальными и физическими представлениями, собрать демонстрации на собственном оборудовании и адаптировать ее под такие задачи, как сортировка, сборка, упаковка, навигация и захват объектов.
Выпуск с открытыми весами также дает командам альтернативный вариант развертывания по сравнению с хостинговыми робототехническими сервисами: они могут изучать и модифицировать модель, выполнять инференс в рамках собственной инфраструктуры и потенциально хранить проприетарные демонстрации роботов и операционные данные в закрытой среде. То, насколько коммерчески либеральным окажется этот вариант, по-прежнему зависит от публикации финальных условий лицензии со стороны BFL.
Бенчмарк-показатели свидетельствуют о том, что такой подход может быть конкурентоспособным в симуляциях. Более масштабный вопрос конкуренции теперь заключается не столько в том, сможет ли FLUX 3 Action обойти конкретную модель в определенном рейтинге, сколько в том, окажется ли ее комбинация предварительного обучения на модели мира, размера в 7 миллиардов параметров, открытых весов и рабочего процесса дообучения полезной во всем многообразии реальных роботов, с которыми разработчики сталкиваются на практике.
Следующим испытанием станет то, смогут ли сторонние команды воспроизвести эти достижения на собственных роботах — и сделают ли меньший размер FLUX 3 Action и открытые веса этот процесс достаточно практичным для промышленного применения.



