Black Forest Labs выпускает модели искусственного интеллекта Flux.2, но генерация изображений с открытым исходным кодом пока отсутствует

Black Forest Labs выпускает модели искусственного интеллекта Flux.2, но генерация изображений с открытым исходным кодом пока отсутствует

Дело не только в Gemini 3 от Google, Nano Banana Pro и Claude Opus 4.5 от Anthropic, за которые мы можем быть благодарны в период Дня благодарения (по крайней мере, здесь, в США).

Нет, немецкий ИИ-стартап Black Forest Labs (BFL) выпустил FLUX.2 — новую систему генерации и редактирования изображений, включающую четыре различных метода, предназначенных для поддержки творческих рабочих процессов производственного уровня.

FLUX.2 представляет многореференсное кондиционирование, более высокую точность результатов и улучшенный рендеринг текста, а также расширяет экосистему компании с открытым ядром, предлагая как коммерческие эндпоинты, так и контрольные точки (чекпоинты) с открытыми весами.

Хотя ранее Black Forest Labs заслужила признание благодаря моделям преобразования текста в изображения с открытым исходным кодом в рамках семейства Flux, сегодняшний релиз включает еще один полностью открытый компонент: вариационный автоэнкодер (VAE) Flux.2, доступный теперь по лицензии Apache 2.0.

Четыре другие модели разного размера и назначения — Flux.2 [Pro], Flux.2 [Flex] и Flux.2 [Dev] — не являются открытым исходным кодом; Pro и Flex остаются проприетарными хостинговыми решениями, в то время как Dev представляет собой загружаемую модель с открытыми весами, которая требует коммерческой лицензии, получаемой напрямую от Black Forest Labs для любого коммерческого использования. Ожидаемая модель с открытым исходным кодом Flux.2 [Klein] также будет выпущена под лицензией Apache 2.0, когда появится в доступе.

Но открытый VAE (вариационный автоэнкодер) Flux.2 важен и полезен для предприятий по нескольким причинам. Этот модуль сжимает изображения в латентное пространство и восстанавливает их обратно в результаты высокого разрешения; Flux.2 определяет латентное представление, используемое в различных вариантах моделей (всего четыре, см. ниже), что обеспечивает более высокое качество реконструкции, более эффективное обучение и редактирование в разрешении 4 мегапикселя.

Поскольку этот VAE является открытым и свободным для использования, предприятия могут применять то же латентное пространство, которое используется в коммерческих моделях BFL, в собственных конвейерах (пайплайнах), получая совместимость между внутренними системами и внешними провайдерами и избегая при этом привязки к конкретному поставщику (vendor lock-in).

Доступность полностью открытого стандартизированного латентного пространства также дает практические преимущества организациям, не специализирующимся на медиа. Предприятия могут использовать VAE с открытым исходным кодом в качестве стабильной общей основы для нескольких моделей генерации изображений, что позволяет им переключаться или смешивать генераторы без переработки нижестоящих (downstream) инструментов или рабочих процессов.

Стандартизация на базе прозрачного VAE под лицензией Apache поддерживает требования к аудиту и комплаенсу, обеспечивает стабильное качество реконструкции внутренних ативов и позволяет будущим моделям, обученным для того же латентного пространства, функционировать в качестве взаимозаменяемых компонентов (drop-in replacements).

Эта прозрачность также обеспечивает кастомизацию, такую как легкая донастройка (fine-tuning) под стили бренда или внутренние визуальные шаблоны — даже для организаций, которые не специализируются на медиа, но полагаются на последовательную и управляемую генерацию изображений для маркетинговых материалов, изображений продуктов, документации или визуальных эффектов стокового типа.

Этот анонс позиционирует FLUX.2 как эволюцию семейства FLUX.1 с акцентом на надежность, управляемость и интеграцию в существующие творческие рабочие процессы, а не на разовые демонстрации.

Сдвиг в сторону ориентированных на производство моделей изображений

FLUX.2 расширяет предыдущую архитектуру FLUX.1 за счет более строгого соблюдения идентичности персонажей, компоновки и стиля при использовании до 10 референсных изображений.

Система поддерживает когерентность при разрешении 4 мегапикселя как для задач генерации, так и для редактирования, что открывает такие сценарии использования, как визуализация продуктов, создание брендированных ативов и структурированные рабочие процессы дизайна.

Модель также улучшает следование промптам (текстовым запросам) при выполнении многосоставных инструкций и снижает количество сбоев, связанных с освещением, пространственной логикой и знанием мира.

Параллельно Black Forest Labs продолжает следовать стратегии релизов с открытым ядром. Компания предоставляет размещенные на серверах версии FLUX.2 с оптимизированной производительностью для коммерческих развертываний, а также публикует инспектируемые модели с открытыми весами, которые исследователи и независимые разработчики могут запускать локально. Этот подход продолжает традицию, заложенную с выходом FLUX.1, ставшей самой широко используемой открытой моделью изображений в мире.

Варианты моделей и варианты развертывания

Flux.2 поставляется в 5 вариантах:

  • Flux.2 [Pro]: Уровень с максимальной производительностью, предназначенный для приложений, требующих минимальной задержки и максимальной визуальной точности. Он доступен через BFL Playground, FLUX API и партнерские платформы. Модель призвана не уступать ведущим закрытым системам в следовании промптам и качестве изображений, снижая при этом требования к вычислительным ресурсам.

  • Flux.2 [Flex]: Эта версия предоставляет такие параметры, как количество шагов семплирования и коэффициент гайданса (guidance scale). Такая конструкция позволяет разработчикам настраивать баланс между скоростью, точностью текста и детализацией. На практике это поддерживает рабочие процессы, в которых превью с низким числом шагов могут генерироваться быстро перед запуском рендеров с высоким числом шагов.

  • Flux.2 [Dev]: Самый заметный релиз для открытой экосистемы — чекпоинт с открытыми весами с 32 миллиардами параметров, который объединяет генерацию текста в изображение и редактирование изображений в единую модель. Он поддерживает многореференсное кондиционирование без необходимости использования отдельных модулей или конвейеров. Модель может запускаться локально с использованием эталонного кода инференса BFL или оптимизированных реализаций fp8, разработанных в партнерстве с Nvidia и ComfyUI. Хостинговый инференс также доступен через FAL, Replicate, Runware, Verda, TogetherAI, Cloudflare и DeepInfra.

  • Flux.2 [Klein]: Скоро выходящая уменьшенная (size-distilled) модель выпускается под лицензией Apache 2.0 и призвана обеспечить улучшенную производительность по сравнению с сопоставимыми моделями того же размера, обученными с нуля. В настоящее время открыта программа бета-тестирования.

  • Flux.2 – VAE: Обновленный VAE, выпущенный под дружественной к бизнесу лицензией Apache 2.0 (даже для коммерческого использования), обеспечивает латентное пространство, которое лежит в основе всех вариантов Flux.2. VAE делает акцент на оптимизированном балансе между точностью реконструкции, обучаемостью и коэффициентом сжатия — давней проблемой для генеративных архитектур в латентном пространстве.

Результаты бенчмарков

Black Forest Labs опубликовала два набора оценок, подчеркивающих производительность FLUX.2 по сравнению с другими моделями генерации изображений с открытыми весами и хостинговыми решениями. В прямых сравнениях коэффициента побед (win-rate) в трех категориях — генерация текста в изображение, редактирование с одним референсом и редактирование с несколькими референсами — FLUX.2 [Dev] значительно опередил все альтернативы с открытыми весами.

Flux.2 benchmark chart

Он достиг коэффициента побед 66,6% в генерации текста в изображение (против 51,3% у Qwen-Image и 48,1% у Hunyuan Image 3.0), 59,8% в редактировании с одним референсом (против 49,3% у Qwen-Image и 41,2% у FLUX.1 Kontext) и 63,6% в редактировании с несколькими референсами (против 36,4% у Qwen-Image). Эти результаты отражают стабильный прирост по сравнению как с более ранними моделями FLUX.1, так и с современными системами с открытыми весами.

Второй бенчмарк сравнил качество моделей с использованием оценок ELO по отношению к примерной стоимости за одно изображение. В этом анализе FLUX.2 [Pro], FLUX.2 [Flex] и FLUX.2 [Dev] группируются в верхнем регионе графика по качеству и нижнем по стоимости, с баллами ELO в диапазоне ~1030–1050 при стоимости операций в пределах 2–6 центов.

Flux.2 ELO scores chart

График бенчмарка оценок ELO для Flux.2 в сравнении со стоимостью. Источник: Black Forest Labs

Напротив, более ранние модели, такие как FLUX.1 Kontext [max] и Hunyuan Image 3.0, располагаются значительно ниже по оси ELO, несмотря на схожую или более высокую стоимость за изображение. Только проприетарные конкуренты, такие как Nano Banana 2, достигают более высоких уровней ELO, но при заметно возросшей стоимости. По заявлению BFL, это позиционирует варианты FLUX.2 как обладающие высокой эффективностью соотношения качества и стоимости в разных категориях производительности, причем FLUX.2 [Dev] в особенности обеспечивает качество, близкое к высшему уровню, оставаясь при этом одним из самых дешевых вариантов в своем классе.

Ценообразование через API и сравнение с Nano Banana Pro

Калькулятор цен на сайте BFL указывает, что FLUX.2 [Pro] тарифицируется примерно по $0,03 за мегапиксель объединенного ввода и вывода. Стандартная генерация 1024×1024 (1 МП) стоит $0,030, а более высокие разрешения масштабируются пропорционально. Калькулятор также учитывает входные изображения в общем количестве мегапикселей, что говорит о более высокой стоимости за вызов для многореференсных рабочих процессов.

Для сравнения, превью модели Gemini 3 Pro Image Preview от Google, также известная как «Nano Banana Pro», в настоящее время оценивает вывод изображений в $120 за 1 млн токенов, что приводит к стоимости $0,134 за изображение 1K–2K (до 2048×2048) и $0,24 за изображение 4K. Ввод изображений тарифицируется по цене $0,0011 за изображение, что ничтожно мало по сравнению со стоимостью вывода.

Хотя модель Gemini использует токенную тарификацию, ее эффективная стоимость за изображение ставит изображения 1K–2K в положение, более чем в 4 раза превышающее стоимость генерации 1 MP FLUX.2 [Pro], а выходы 4K обходятся примерно в 8 раз дороже аналогичного по разрешению результата FLUX.2 при пропорциональном масштабировании.

На практике имеющиеся данные свидетельствуют о том, что FLUX.2 [Pro] в настоящее время предлагает значительно более низкие цены за изображение, особенно для изображений высокого разрешения или рабочих процессов многореференсного редактирования, в то время как превью-уровень Gemini 3 Pro позиционируется как более дорогой сервис с тарификацией по токенам и большей вариативностью в зависимости от разрешения.

Технический дизайн и переработка латентного пространства

FLUX.2 построена на архитектуре сопоставления латентных потоков (latent flow matching), объединяющей выпрямленный трансформатор потоков (rectified flow transformer) с визуально-языковой моделью (VLM) на базе Mistral-3 (24B). VLM обеспечивает семантическую привязку и контекстуальное понимание, в то время как трансформатор управляет пространственной структурой, представлением материалов и поведением освещения.

Крупным компонентом обновления является переобучение латентного пространства модели. FLUX.2 VAE объединяет достижения в области семантического выравнивания, качества реконструкции и обучаемости представлений, почерпнутые из недавних исследований по оптимизации автоэнкодеров. Более ранние модели часто сталкивались с компромиссами в триаде обучаемость–качество–сжатие: сильно сжатые пространства повышают эффективность обучения, но ухудшают реконструкцию, в то время как более широкие «узкие горлышки» могут снижать способность генеративных моделей изучать последовательные преобразования.

Согласно исследовательским данным BFL, FLUX.2 VAE достигает меньших искажений LPIPS по сравнению с автоэнкодерами FLUX.1 и SD, одновременно улучшая генеративный показатель FID. Этот баланс позволяет FLUX.2 поддерживать высокоточное редактирование — область, которая обычно требует точности реконструкции — и при этом сохранять конкурентоспособную обучаемость для крупномасштабного генеративного обучения.

Возможности в творческих рабочих процессах

Наиболее значительным функциональным обновлением является поддержка нескольких референсов (multi-reference). FLUX.2 может принимать до 10 референсных изображений и сохранять идентичность, детали продукта или стилистические элементы в получаемом результате. Эта функция актуальна для коммерческих приложений, таких как мерчандайзинг, виртуальная фотография, создание раскадровок и разработка брендированных кампаний.

Улучшения системы в области типографики решают постоянную проблему архитектур на основе диффузии и потоков. FLUX.2 способна генерировать читаемый мелкий текст, структурированные макеты, элементы интерфейса и ативы в стиле инфографики с большей надежностью. Эта способность в сочетании с гибким соотношением сторон и редактированием высокого разрешения расширяет сферы применения, где текст и изображение совместно определяют конечный результат.

FLUX.2 улучшает следование инструкциям для многошаговых композиционных промптов, обеспечивая более предсказуемые результаты в ограниченных рабочих процессах. Модель демонстрирует лучшую привязку к физическим атрибутам — таким как освещение и поведение материалов — снижая несоответствия в сценах, требующих фотореалистичного равновесия.

Экосистема и стратегия открытого ядра (Open-Core)

BFL продолжает позиционировать свои модели в рамках экосистемы, которая объединяет открытые исследования с коммерческой надежностью. Открытые модели FLUX.1 помогли компании закрепиться как на рынке разработчиков, так и на корпоративном рынке, а FLUX.2 расширяет эту структуру: жестко оптимизированные коммерческие эндпоинты для производственных развертываний и открытые компонуемые чекпоинты для исследований и экспериментов сообщества.

Компания делает упор на прозрачность посредством опубликованного кода инференса, релиза VAE с открытыми весами, руководств по составлению промптов и подробной архитектурной документации. Она также продолжает нанимать таланты во Фрайбурге и Сан-Франциско по мере реализации долгосрочной дорожной карты в направлении мультимодальных моделей, объединяющих восприятие, память, рассуждение и генерацию.

Предыстория: Flux и создание Black Forest Labs

Компания BFL была основана в 2024 году Робином Ромбахом (Robin Rombach), Патриком Эссером (Patrick Esser) и Андреасом Блаттманном (Andreas Blattmann), первоначальными создателями Stable Diffusion. Их уход из Stability AI произошел в момент турбулентности для более широкого сообщества генеративного ИИ с открытым исходным кодом, а запуск BFL ознаменовал возобновление усилий по созданию доступных высокопроизводительных моделей изображений. Компания привлекла 31 миллион долларов в рамках начального раунда финансирования под руководством Andreessen Horowitz при дополнительной поддержке Брендана Ирибе (Brendan Iribe), Майкла Овица (Michael Ovitz) и Гарри Тана (Garry Tan), что обеспечило раннее подтверждение правильности ее технического направления.

Первый крупный релиз BFL, FLUX.1, представил архитектуру с 12 миллиардами параметров, доступную в вариантах Pro, Dev и Schnell. Она быстро приобрела репутацию системы с качеством вывода, которое соответствовало или превосходило закрытых конкурентов, таких как Midjourney v6 и DALL·E 3, в то время как версии Dev и Schnell укрепили приверженность компании к открытому распространению. FLUX.1 также получила быстрое распространение в сторонних продуктах, включая Grok 2 от xAI, и появилась на фоне продолжающихся в отрасли дискуссий о прозрачности наборов данных, ответственном использовании моделей и роли распространения с открытым исходным кодом. BFL опубликовала строгие правила использования, направленные на предотвращение злоупотреблений и генерации неконсенсусного контента.

В конце 2024 года BFL расширила линейку моделью Flux 1.1 Pro — проприетарной высокоскоростной моделью, обеспечивающей шестикратное ускорение генерации и достигающей лидирующих оценок ELO на Artificial Analysis. Компания запустила платный API вместе с релизом, обеспечив настраиваемую интеграцию с регулируемым разрешением, выбором моделей и настройками модерации по цене от $0,04 за изображение.

Партнерство с TogetherAI, Replicate, FAL и Freepik расширило доступ и сделало модель доступной для пользователей без необходимости самостоятельного хостинга, укрепив позиции BFL на коммерческих и ориентированных на создателей платформах.

Эти события разворачивались на фоне ускоряющейся конкуренции в сфере генеративных медиа.

Последствия для корпоративных лиц, принимающих технические решения

Релиз FLUX.2 несет в себе четкие операционные последствия для корпоративных команд, отвечающих за ИИ-инжиниринг, оркестрацию, управление данными и безопасность. Для ИИ-инженеров, ответственных за управление жизненным циклом моделей, доступность как хостинговых эндпоинтов, так и чекпоинтов с открытыми весами обеспечивает гибкие пути интеграции.

Многореференсные возможности FLUX.2 и расширенная поддержка разрешений снижают потребность в специализированных пайплайнах точной настройки при работе с результатами, специфичными для бренда или сохраняющими идентичность, снижая издержки на разработку и ускоряя сроки развертывания. Улучшенное следование промптам и производительность типографики модели также сокращают циклы итеративного ввода запросов, что может оказать измеримое влияние на эффективность производственной рабочей нагрузки.

Команды, сосредоточенные на оркестрации ИИ и операционном масштабировании, получают выгоду от структуры семейства продуктов FLUX.2. Уровень Pro предлагает предсказуемые характеристики задержки, подходящие для критически важных для пайплайна рабочих нагрузок, в то время как уровень Flex обеспечивает прямой контроль над шагами семплирования и параметрами гайданса, что согласуется со средами, требующими строгой настройки производительности.

Доступ к модели Dev с открытыми весами облегчает создание пользовательских контейнеризированных развертываний и позволяет платформам оркестрации управлять моделью в рамках существующих практик CI/CD. Это особенно актуально для организаций, балансирующих между передовыми инструментами и ограничениями бюджета, поскольку локально развернутые модели предлагают контроль затрат за счет требований к внутренней оптимизации.

Специалисты по дата-инжинирингу получают преимущества от латентной архитектуры модели и улучшенной точности реконструкции. Высококачественные, предсказуемые представления изображений снижают нагрузку по последующей очистке данных в рабочих процессах, где сгенерированные ативы поступают в аналитические системы, конвейеры творческой автоматизации или разработку мультимодальных моделей.

Поскольку FLUX.2 объединяет функции преобразования текста в изображение и редактирования изображений в единую модель, она упрощает точки интеграции и снижает сложность потоков данных на уровнях хранения, версионирования и мониторинга. Для команд, управляющих большими объемами референсных изображений, возможность включения до 10 входных данных на одну генерацию может также оптимизировать процессы управления ативами за счет перекладывания большей части работы по обработке вариаций на саму модель, а не на внешние инструменты.

Для команд безопасности подход открытого ядра FLUX.2 представляет контроль доступа, управление моделями и мониторинг использования API. Размещенные эндпоинты FLUX.2 позволяют централизованно применять политики безопасности и снижают локальное воздействие весов моделей, что может быть предпочтительнее для организаций с более строгими требованиями комплаенса.

И наоборот, развертывания с открытыми весами требуют внутреннего контроля целостности моделей, отслеживания версий и мониторинга во время инференса для предотвращения злоупотреблений или несанкционированных модификаций. Работа модели с типографикой и реалистичными композициями также подчеркивает необходимость создания устоявшихся структур управления контентом, особенно в тех случаях, когда генеративные системы взаимодействуют с публичными каналами.

Во всех этих ролях дизайн FLUX.2 подчеркивает предсказуемые характеристики производительности, модульные варианты развертывания и сниженные операционные трения. Для предприятий с небольшими командами или быстро меняющимися требованиями этот релиз предлагает набор возможностей, согласующихся с практичными ограничениями по скорости, качеству, бюджету и управлению моделями.

FLUX.2 знаменует собой существенное итеративное улучшение генеративного стека изображений Black Forest Labs с заметными достижениями в многореференсной когерентности, рендеринге текста, качестве латентного пространства и соблюдении структурированных промптов. Соединяя полностью управляемые предложения с чекпоинтами с открытыми весами, BFL сохраняет свою модель открытого ядра, одновременно расширяя свою актуальность для коммерческих творческих рабочих процессов. Релиз демонстрирует сдвиг от экспериментальной генерации изображений к более предсказуемым, масштабируемым и управляемым системам, подходящим для операционного использования.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.