Black Forest Labs выпускает FLUX 3 с возможностью генерации изображений и 20-секундного видео со звуком — но пока в рамках ограниченного релиза
Источник: VentureBeat · Carl Franzen
Black Forest Labs (BFL) расширяет свое семейство моделей FLUX за пределы генерации изображений: сегодня состоялся релиз FLUX 3, мультимодальной пограничной модели, обученной понимать и генерировать изображения или комбинированные аудио/видеоклипы длительностью до 20 секунд на основе единого текстового запроса, а также переносить эту базовую архитектуру на робототехническое зрение и действия.
Базирующаяся во Фрайбурге (Германия) ИИ-лаборатория заявляет, что FLUX 3 обучалась на всех этих модальностях совместно, а не за счет объединения разрозненных моделей для работы с изображениями, видео и аудио под единым интерфейсом.
Это отличие лежит в основе концепции компании: BFL хочет, чтобы предприятия рассматривали креативную генерацию, симуляцию, работу с компьютером и робототехнику как взаимосвязанные применения единой возможности, которую она называет визуальным интеллектом — моделей, способных, по словам компании, «воспринимать, прогнозировать и действовать как в физической, так и в цифровой среде». Этот релиз знакомит общественность с первой моделью генерации видео от BFL.
FLUX 3 будет предлагаться в рамках четырех продуктовых линеек: FLUX 3 Video, FLUX 3 Image, FLUX 3 Action и готовящейся к выходу версии с открытым исходным кодом FLUX 3 Dev. FLUX 3 Video (с опциональной встроенной генерацией аудио) и FLUX 3 Action теперь доступны в рамках программы закрытого «раннего доступа» (Early Access), подать заявку на участие в которой может любой желающий, однако окончательное решение принимает BFL.
В настоящее время публичный доступ через программный интерфейс приложений (API) BFL или ее партнеров отсутствует, однако компания заявляет, что выпуск FLUX 3 Image состоится в ближайшие недели, за чем последует общий доступ. Ограниченный характер первоначального запуска перекликается со стратегиями релизов новых моделей от других американских ведущих лабораторий в последнее время, включая Anthropic и OpenAI, хотя в тех случаях это официально объяснялось соображениями безопасности и запросами правительства.
Компания пока не объявила цены, обязательства по уровню обслуживания (SLA), методологию оценки, размеры выборок, количество оценщиков или какие-либо бенчмарки для моделей изображений. Следовательно, корпоративные покупатели пока не могут рассчитать общую стоимость владения (TCO) или самостоятельно воспроизвести сравнения видео.
Еще один крупный и заметный упущение: FLUX 3 на данный момент не выходит с доступными для скачивания весами или открытой лицензией. BFL заявляет, что более быстрые версии с открытыми весами появятся позже в этом году, а в ее техническом блоге FLUX 3 Dev описывается как «доступ с открытыми весами к мультимодальной основе для создания контента (видео, аудио и изображений) и прогнозирования действий» — это значительно более широкое обязательство, чем любой предыдущий релиз FLUX Dev, каждый из которых касался исключительно изображений.
Однако эта версия идет последней в очереди. Разработчики, привыкшие получать развертываемый локально вариант FLUX одновременно с анонсом крупной модели (или вскоре после него), будут вынуждены подождать. Такая задержка не отменяет намерений компании, но вызывает разочарование, учитывая ту роль, которую открытые веса сыграли в распространении FLUX до сих пор.
Flux 3 оценивается выше конкурентов, но отсутствие цен и подробных бенчмарков может сдержать быстрое внедрение в корпоративном секторе
BFL опубликовала несколько сравнительных тестов, однако они охарактеризованы как предварительные — полные результаты бенчмарков и методология будут опубликованы позже, по мере расширения общего доступа.
По результатам раннего парного тестирования на предпочтения с использованием 10-секундных текстовых видеоклипов разрешением 720p со звуком, компания заявляет, что FLUX 3 предпочли Luma Ray 3.2 в 93% сравнений, Runway Gen-4.5 в 77%, Grok Imagine Video в 69%, Kling v3 Pro в 60%, Happy Horse v1 в 59%, Happy Horse 1.1 в 57%, а также Seedance 2.0 и Google Gemini Omni Flash в 52% случаев.
Внутренняя оценка Flux 3 зрителями на основе 10-секундных видеогенераций в разрешении 720p от различных моделей. Источник: Black Forest Labs
С каждым из этих показателей связана одна оговорка, исходящая от самой BFL. На диаграмме с результатами стоит пометка «предварительная оценка раннего кандидата FLUX 3» — это означает, что цифры описывают предрелизную контрольную точку, а не ту модель, которая сейчас поступает в ранний доступ. Это палка о двух концах: выпускаемая модель может работать лучше, но ничто из опубликованного сегодня не отражает то, с чем реально столкнутся клиенты.
Luma Ray 3.2 и Runway Gen-4.5, в сравнении с которыми FLUX 3 набрала 93% и 77%, являются самыми слабыми позициями в списке: это устоявшиеся продукты, но не те модели, которые в настоящее время задают тон в независимых видеорейтингах. Это реальные победы, и именно они с наименьшей вероятностью изменят корпоративный шорт-лист.
Seedance 2.0 с показателем 52% — это статистическая случайность в сопоставлении с моделью, которую большинство западных компаний в настоящее время получить не могут. ByteDance бессрочно отложила международный запуск Seedance 2.0 после того, как Netflix, Warner Bros., Disney, Paramount и Sony направили юридические угрозы из-за предполагаемого систематического нарушения авторских прав, и эта приостановка остается в силе. Ничья с замороженным продуктом не является ни весомым достижением, ни репутационным ударом.
Gemini Omni Flash, также имеющая 52%, имеет гораздо большую значимость. Omni — это ближайший аналог среди крупных платформ к тому, что пытается создать FLUX 3: мультимодальный ввод, создание с учетом видео и аудио, диалоговое редактирование — и, судя по собственным измерениям BFL, обе модели неотличимы друг от друга по качеству 10-секундных видео по текстовому запросу.
Преимущество Google в этом противостоянии заключается в том, что Omni широко доступна через API Gemini Google по цене $0,10 за секунду сгенерированного видео в разрешении 720p, то есть 10-секундный клип обойдется примерно в эту сумму.
Для домашнего рынка немецкой компании существует одна региональная особенность. Редактирование уже загруженного видео недоступно пользователям Omni Flash в Европейской экономической зоне, Швейцарии и Великобритании, хотя редактирование видео, сгенерированного самой моделью, разрешено. Европейское предприятие, желающее пропустить свои существующие кадры через этап генеративного редактирования, в настоящее время не может сделать это с помощью Omni Flash.
Ниже приводится ориентировочное руководство для предприятий, выбирающих, на какие видеомодели стоит опираться:
|
Модель |
Макс. длительность одной генерации |
Макс. разрешение |
Ключевые ограничения |
Цена за 10-секундный клип (720p) |
Цена за 10-секундный клип (1080p) |
Цена за 10-секундный клип (4K) |
|
FLUX 3 Video |
20 секунд |
Не указано; оценки проводились при 720p |
Ранний доступ; отсутствуют опубликованные SLA и цены |
Не объявлено |
Не объявлено |
Не объявлено |
|
HappyHorse 1.1 |
15 секунд |
1080p |
Нет 4K; закрытые веса |
Не опубликовано (тариф реселлера v1.0 составляет ~$1.82) |
Не опубликовано (тариф реселлера v1.0 составляет ~$3.12) |
н/д |
|
Veo 3.1 |
Посекундная тарификация |
4K |
Поддерживает продление клипов; превью |
$4.00 |
$4.00 |
$6.00 |
|
Veo 3.1 Fast |
Посекундная тарификация |
4K |
Превью |
$1.00 |
$1.20 |
$3.00 |
|
Veo 3.1 Lite |
Посекундная тарификация |
1080p |
Нет 4K, нет продления клипов; превью |
$0.50 |
$0.80 |
н/д |
|
Gemini Omni Flash |
10 секунд (минимум 3 с) |
720p при 24 FPS |
Превью и отсутствие доступа в ЕС |
$1.00 |
н/д |
н/д |
Единая архитектура для генерации медиа и физических действий
FLUX 3 базируется на Self-Flow — методе BFL для согласования мультимодального понимания и генерации в рамках одной архитектуры, о котором было объявлено в марте 2026 года.
Компания заявляет, что значительно увеличила вычислительные мощности и объем данных для одновременного обучения на видео, изображениях и аудио, а тесты показали, что генерация видео и прогнозирование действий не требуют раздельных базовых моделей — ту же архитектуру можно распространить на прогнозирование действий без потери того, чему она научилась на видео.
«Мы ставим зрение в центр нашего подхода, потому что это наиболее богатая сигналами среда физического мира. Изображения передают структуру, изображения и видео обучают пространственным отношениям, видео учит динамике, а действия раскрывают причинно-следственные связи. Но одно лишь зрение — это еще не вся картина», — отметил Робин Ромбах (Robin Rombach), соучредитель и генеральный директор BFL, в предварительном заявлении для VentureBeat. «Истинный интеллект означает восприятие мира: прогнозирование того, как он изменится, совершение действий и извлечение уроков из результатов. Совместное обучение в рамках единой архитектуры — это то, что приведет нас к цели, поскольку каждая модальность обучения усиливает остальные. Аудио передает тайминг, просодию и физические события, ускользающие от зрения. Язык передает цели, абстракции и инструкции, которые пиксели не могут легко выразить».
В другом месте анонса он высказался более прямо: «Нельзя обмануть реальность. Модель, которая изучает только изображения, может генерировать только изображения. Но мир состоит не из статичных кадров. Он движется, звучит, меняется и реагирует».
BFL заявляет, что FLUX 3 ориентирована на креативные инструменты, медиа, дизайн, электронную коммерцию и физический ИИ, поддерживая генерацию видео с синхронизированным аудио, точное редактирование изображений, постоянство продуктов и материалов в движении, многоязычную генерацию и прогнозирование робототехнических действий. Ее уже тестируют Canva, Burda, Magnific (ранее Freepik), Krea и Picsart.
Для компаний, разрабатывающих креативное ПО, привлекательность заключается в консолидации. Единая базовая модель потенциально способна поддерживать создание раскадровок, редактирование изображений, рендеринг продуктов, вариации видео и локализацию без многократного перевода ассетов и инструкций между разрозненными моделями.
Для робототехнических команд потенциальная ценность заключается в эффективности данных. Модели, которые уже кодируют движение, поведение объектов и физические изменения, могут требовать меньше специфичного для конкретных задач обучения роботов, чем системы, начинающие с сырых демонстраций.
На что действительно способен FLUX 3 Video
Видеокомпонент — это наиболее конкретно описанная часть запуска, которая разрешает циркулировавшие в виде слухов вопросы: FLUX 3 генерирует клипы длительностью до 20 секунд со звуком за одну генерацию.
Каждый видеовыход сопровождается встроенным звуком. Для сравнения, HappyHorse 1.0 выдает максимум 15 секунд видео в разрешении 1080p с синхронизированным аудио — хотя BFL не уточнила, в каком разрешении работают ее 20-секундные клипы, а опубликованные оценки проводились в 720p. Тем не менее, 20-секундный длинный клип по одному запросу является одним из самых продолжительных среди достигнутых, не уступая снятой с производства модели Sora от OpenAI.
Опубликованный BFL список возможностей охватывает:
-
Генерацию видео по текстовому описанию (Text-to-video).
-
Генерацию видео по изображениям (Image-to-video) — либо анимацию начиная с первого кадра, либо использование изображений в качестве визуальных референсов.
-
Генерацию видео на основе видео (Video-to-video) из референсного клипа, переносящую такие элементы, как конкретный персонаж, в новую сцену или контекст.
-
Генеративное продолжение видео и аудио на основе существующих входных видео- и аудиоданных.
-
Генерацию видео по ключевым кадрам (Keyframe-to-video) для управляемых переходов между заданными моментами.
-
Многоязычный диалог.
-
Широкий спектр визуальных стилей и соотношений сторон: от любительской видеозаписи до анимации и кинематографичного видео.
-
Генерацию типографики и анимированный дизайн.
-
Агентное связывание отдельных клипов в более длинные последовательности из нескольких планов.
Этот последний пункт заслуживает наиболее пристального внимания корпоративных видеокоманд. BFL утверждает, что эти возможности объединяются для создания последовательностей длительностью в несколько минут, причем визуальные референсы сохраняют персонажей постоянными от сцены к сцене. Если это подтвердится в производственных условиях, то будет решено ограничение, которое удерживало генеративное видео за рамками большинства коммерческих конвейеров: дело не в качестве клипов, а в непрерывности между планами.
Именно в этой возможности конкуренция проявляется наиболее остро. Главным обновлением в HappyHorse 1.1 является функция R2V (Reference-to-Video), которая принимает несколько референсных изображений персонажей для поддержания стабильности идентичности в генерируемых кадрах — та же проблема, но решаемая на уровне входных данных, а не через агентное связывание клипов. Alibaba также заявляет об отсутствии дрейфа синхронизации губ (zero-drift lip sync) и целенаправленно борется с артефактами, выдающими в коммерческом ИИ-видео синтетику, включая маслянистость лиц и избыточную резкость. Постоянство персонажей — это поле битвы в данной категории, и обе компании это понимают.
BFL заявляет, что FLUX 3 Video уже демонстрирует особую силу в передаче человеческих выражений лица, соотнесении звуков с физическими событиями и многоязычном выводе. Что касается изображений, компания утверждает, что предварительные оценки, проведенные в ходе промежуточного обучения, показывают значительное улучшение по сравнению с предыдущими версиями FLUX в обработке сложных промптов и генерации текста, включая высокую точность текста на нескольких языках. Бенчмарки изображений и показатели побед опубликованы не были.
Тесты FLUX-mimic проверяют, могут ли видеомодели стать моделями для роботов
BFL применяет свою концепцию единой архитектуры посредством FLUX-mimic — видео-модели действий, построенной на базе FLUX 3 и разработанной совместно со швейцарской фирма Mimic Robotics, одним из первых партнеров, получивших ранний доступ.
В техническом блоге описываются два различных пути к прогнозированию действий: интеграция нативного прогнозирования действий непосредственно в FLUX 3 (масштабирование первоначальной работы Self-Flow) и использование предварительно обученной видео-основы в качестве динамически осведомленного фундамента, на котором специализированные модели действий могут дообучаться на ограниченном наборе данных под конкретные задачи. FLUX-mimic представляет собой второй путь — основу FLUX 3 в сочетании с экспертизой Mimic Robotics в области обучения роботов и развертывания на производстве для сложных манипуляций.
FLUX-mimic разработана для робототехнических манипуляций общего назначения: она помогает роботам понимать визуальную сцену, прогнозировать последствия действия и адаптироваться к новым задачам с гораздо меньшим объемом специфичных для задач данных.
BFL и Mimic Robotics заявляют, что в зависимости от сложности задачи модель может быть дообучена для конкретной манипуляционной задачи всего по 30 минутам данных от робота, в то время как предыдущие подходы требовали 30 и более часов.
«Самая сложная часть робототехники — это данные», — заявил Элвис Нава (Elvis Nava), технический директор Mimic Robotics, в заявлении для VentureBeat. «Каждая новая задача обычно означает часы повторений робота. Поскольку FLUX-mimic построена на базе передовых видеомоделей, которые уже понимают, как ведет себя физический мир, она осваивает новую задачу за минуты, а не дни. Таким образом, мы можем перешагнуть через текущий уровень техники в обучении роботов».
BFL утверждает, что модель, обученная только на изображениях, не способна понять мир, который «движется, звучит, меняется и реагирует», и что физическое понимание — это то, что создает убедительные сгенерированные кадры. Google делает практически такое же заявление в отношении Gemini Omni.
В ее документации для разработчиков упоминаются «знания о мире», объединяющие «понимание физики» с пониманием Gemini истории, науки и культурного контекста. Маркетинг компании звучит еще прямее: «Большинство ИИ-моделей просто предсказывают следующий пиксель для построения сюжета или изображения. Gemini Omni — другая», — написала компания в июне, приписав модели «интуитивное понимание таких сил, как гравитация, кинетическая энергия и гидродинамика для более реалистичных движений, подчиняющихся законам реального мира».
Практическое следствие для корпоративных покупателей заключается в том, что терминология «моделей мира» не является дифференциатором. Две из трех ведущих видеосистем теперь позиционируют физическое понимание как свое главное преимущество, и ни одна из них не опубликовала бенчмарк, измеряющий его.
Не существует стандартного теста для проверки того, ведет ли себя сгенерированная вода как вода, падает ли упавший предмет с правдоподобной скоростью или совпадает ли момент появления звука с моментом удара. Рейтинги человеческих предпочтений отчасти фиксируют это косвенно. Ничто другое из предлагаемого на рынке не фиксирует это вообще.
Открытые веса помогли сделать FLUX отраслевым стандартом
BFL официально запустилась летом 2024 года и за прошедшие два года завоевала имя в индустрии ИИ благодаря приверженности открытому исходному коду высококачественных моделей генерации изображений, которые полюбились разработчикам, креативщикам и предприятиям.
Основатели компании, включая Ромбаха, Андреаса Блаттманна (Andreas Blattmann) и Патрика Эссера (Patrick Esser), ранее участвовали в создании VQGAN, латентной диффузии и Stable Diffusion — последняя технология с открытым исходным кодом положила начало широким возможностям генерации с помощью ИИ для масс и в настоящее время используется многими генераторами изображений и ИИ-компаниями.
Этот охват трансформировался в коммерческое распространение. Модели FLUX в настоящее время питают генеративные функции в Adobe Photoshop, Picsart и Hermes Agent от Nous Research, среди прочих платформ, а компания называет кинорежиссера Мартина Скорсезе среди профессиональных пользователей.
Журнал Wired описал Black Forest Labs как относительно небольшую компанию, которая тем не менее стала ведущим конкурентом крупнейших ИИ-лабораторий Кремниевой долины: модели FLUX занимают верхние строчки в бенчмарках изображений и являются одними из самых скачиваемых моделей «текст-в-изображение» на сообществе шеринга ИИ-кода Hugging Face. Компания заявляет, что сейчас в ней работает команда из 100 человек, распределенная между Фрайбургом и Сан-Франциско.
FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev и сопутствующие управляющие модели, выпущенные вскоре после запуска фирмы, предоставили исследователям и разработчикам креативных инструментов доступ к скачиваемым контрольным точкам, локальному инференсу и интеграции с фреймворками, включая Hugging Face Diffusers и ComfyUI. Например, FLUX.1 Kontext Dev была выпущена как модель с открытыми весами для исследований и некоммерческого использования, при этом сгенерированные результаты разрешено использовать в коммерческих целях в рамках применимой лицензии.
Компания продолжила эту тенденцию, выпустив в конце 2025 года FLUX.2 Dev — модель с открытыми весами на 32 миллиарда параметров, объединяющую генерацию и многореференсное редактирование. Black Forest Labs назвала ее сильнейшей моделью генерации и редактирования изображений с открытыми весами, доступной на момент запуска, и выпустила веса, код для эталонного инференса и оптимизированные реализации для потребительских графических процессоров Nvidia.
FLUX 3 Dev поднимает планку в этой оценке еще выше. Предыдущие релизы Dev были моделями изображений. Эта новинка описывается как мультимодальная основа, охватывающая видео, аудио, изображения и прогнозирование действий — это означает, что единая лицензия будет определять, сможет ли компания локально развернуть модель, затрагивающую как производство контента, так и физическое оборудование. BFL пока не поделилась информацией о своей лицензии, количестве параметров, квантовании или аппаратных требованиях.
Компания представляет открытые веса скорее как корпоративную функцию, чем как жест доброй воли по отношению к сообществу, утверждая, что они обеспечивают безопасное локальное развертывание с низкими задержками для таких применений, как системы управления роботами, и позволяют командам адаптировать FLUX 3 под собственные данные, продукты и рабочие процессы.
Финансовая поддержка FLUX 3 заслуживает внимания наряду с техническими заявлениями. Black Forest Labs оценивается в $3,25 млрд и привлекла более $450 млн от инвесторов, включая a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva и T.Capital (подразделение Deutsche Telekom).



