Новая техника Self-Mlow от Black Forest Labs увеличивает скорость обучения мультимодальных ИИ-моделей в 2,8 раза
Источник: VentureBeat · Carl Franzen
Для создания когерентных изображений или видео генеративные ИИ-модели диффузионного типа, такие как Stable Diffusion или FLUX, обычно полагались на внешних «учителей» — замороженные кодировщики вроде CLIP или DINOv2, которые обеспечивали семантическое понимание, недоступное моделям при самостоятельном обучении.
Однако такая зависимость имела свою цену: возник «узкие горлышко», при котором дальнейшее масштабирование модели больше не приводит к улучшению результатов, поскольку внешний учитель достиг своего предела.
Сегодня немецкий ИИ-стартап Black Forest Labs (разработчик серии ИИ-моделей для генерации изображений FLUX) объявил о возможном завершении этой эпохи академических заимствований с выпуском Self-Flow — метода сопряжения потоков с самообучением, который позволяет моделям одновременно учиться представлению и генерации.
Интегрировав инновационный механизм планирования с двумя временными шагами (Dual-Timestep Scheduling), Black Forest Labs продемонстрировала, что единая модель способна достигать передовых результатов в работе с изображениями, видео и аудио без какого-либо внешнего контроля.
Технология: преодоление «семантического разрыва»
Фундаментальная проблема традиционного генеративного обучения заключается в том, что это задача «устранения шума» (denoising). Модели показывают шум и просят найти изображение; у нее практически нет стимула понимать, что именно изображено на картинке, — важно лишь то, как она выглядит.
Чтобы исправить это, исследователи ранее «выравнивали» генеративные признаки с помощью внешних дискриминативных моделей. Тем не менее, Black Forest Labs утверждает, что такой подход изначально ущербен: эти внешние модели часто работают на основе несогласованных целей и не способны к генерализации в различных модальностях, таких как аудио или робототехника.
Новый метод компании под названием Self-Flow решает эту проблему путем создания «информационной асимметрии». Используя подход Dual-Timestep Scheduling, система применяет разный уровень шума к разным частям входных данных. Студент получает сильно искаженную версию данных, в то время как учитель — версия модели на основе экспоненциального скользящего среднего (EMA) — видит «более чистую» версию тех же данных.
Перед студентом ставится задача не просто сформировать финальный результат, но и предсказать, что видит его «более чистая» версия. Это процесс самодистилляции, в котором учитель находится на 20-м слое, а студент — на 8-м. Такой подход «двойного прохода» заставляет модель развивать глубокое внутреннее семантическое понимание, фактически обучая себя видеть в процессе обучения созданию контента.
Влияние на продукты: быстрее, четче и мультимодальнее
Практические результаты этого сдвига разительны. Согласно исследовательскому документу, Self-Flow сходится примерно в 2,8 раза быстрее, чем метод выравнивания представлений (REPA), который является текущим отраслевым стандартом для сопоставления признаков. Пожалуй, еще важнее то, что показатели не выходят на плато: по мере увеличения вычислительных мощностей и параметров Self-Flow продолжает улучшаться, в то время как старые методы демонстрируют убывающую отдачу.
Скачок в эффективности обучения лучше всего оценивать в сырых вычислительных шагах: если стандартное обучение «из коробки» традиционно требует 7 миллионов шагов для достижения базового уровня производительности, то REPA сократила этот путь всего до 400 000 шагов, что означает ускорение в 17,5 раз.
Фреймворк Self-Flow от Black Forest Labs раздвигает эти границы еще дальше, работая в 2,8 раза быстрее REPA и достигая того же рубежа производительности примерно за 143 000 шагов.
В совокупности эта эволюция представляет собой почти 50-кратное сокращение общего количества шагов обучения, необходимых для получения высококачественных результатов, фактически превращая некогда колоссальные требования к ресурсам в значительно более доступный и оптимизированный процесс.
Black Forest Labs продемонстрировала эти достижения на примере мультимодальной модели с 4 миллиардами параметров. Обученная на массивном датасете из 200 млн изображений, 6 млн видео и 2 млн аудио-видео пар, модель показала значительный прогресс в трех ключевых областях:
-
Типографика и отрисовка текста: Одним из самых устойчивых «маркеров» ИИ-изображений всегда был искаженный текст. Self-Flow значительно превосходит стандартное сопоставление потоков при рендеринге сложных, легко читаемых вывесок и надписей, таких как неоновая вывеска с корректно написанными словами «FLUX is multimodal».
-
Временная согласованность: При генерации видео Self-Flow устраняет множество «галлюцинаторных» артефактов, типичных для современных моделей, например, конечностей, которые спонтанно исчезают во время движения.
-
Совместный синтез видео и аудио: Поскольку модель изучает представления нативно, она может генерировать синхронизированные видео и аудио по единой текстовой подсказке. В подобных задачах внешние «заимствованные» представления часто дают сбой, так как кодировщик изображений не понимает звук.
С точки зрения количественных метрик, Self-Flow добилась превосходных результатов по сравнению с конкурирующими базовыми моделями. По метрике Image FID модель набрала 3,61 против 3,92 у REPA. Для видео (FVD) показатель составил 47,81 по сравнению с 49,59 у REPA, а для аудио (FAD) — 145,65 против 148,87 у стандартной базовой модели.
От пикселей к планированию: путь к моделям мира
Анонс завершается обзором перспектив создания моделей мира (world models) — ИИ, который не просто генерирует красивые картинки, но и понимает базовую физику и логику сцены для планирования и робототехники.
Благодаря тонкой настройке версии Self-Flow с 675 млн параметров на датасете робототехники RT-1, исследователи добились значительно более высоких показателей успешности в сложных многоэтапных задачах в симуляторе SIMPLER. В то время как стандартное сопоставление потоков испытывало трудности со сложными задачами вроде «открыть и положить» и часто полностью терпело неудачу, модель Self-Flow поддерживала стабильный уровень успеха, что говорит о достаточности ее внутренних представлений для реальных задач визуального рассуждения.
Детали реализации и инженерии
Для исследователей, желающих проверить эти утверждения, Black Forest Labs выпустила набор инструментов для инференса на GitHub, ориентированный специально на генерацию ImageNet 256×256. Проект, написанный преимущественно на Python, предоставляет архитектуру модели SelfFlowPerTokenDiT на базе SiT-XL/2.
Инженеры могут использовать предоставленный скрипт sample.py для генерации 50 000 изображений с целью стандартной оценки FID. В репозитории подчеркивается, что ключевой архитектурной модификацией в этой реализации является поточное (per-token) кондиционирование по временным шагам, которое позволяет настраивать каждый токен в последовательности в зависимости от его конкретного шага зашумления. Во время обучения модель использовала смешанную точность BFloat16 и оптимизатор AdamW с обрезкой градиентов для поддержания стабильности.
Лицензирование и доступность
Black Forest Labs опубликовала исследовательскую работу и официальный код для инференса на GitHub и на своем исследовательском портале. Хотя в настоящее время это исследовательская превью-версия, послужной список компании в отношении семейства моделей FLUX позволяет предположить, что эти инновации в ближайшем будущем найдут свое применение в коммерческом API и предложениях с открытыми весами.
Для разработчиков отказ от внешних кодировщиков — огромная победа с точки зрения эффективности. Это избавляет от необходимости управлять отдельными тяжелыми моделями, такими как DINOv2, во время обучения, упрощая стек и позволяя осуществлять более специализированное обучение под конкретные домены, не зависящее от чужого «замороженного» понимания мира.
Выводы для корпоративных лиц, принимающих технические решения, и пользователей
Для бизнеса появление Self-Flow означает серьезный сдвиг в анализе затрат и выгод при разработке проприетарного ИИ.
Хотя первыми непосредственными выгодоприобретателями станут организации, обучающие крупномасштабные модели с нуля, исследование показывает, что технология столь же эффективна для высокоточной донастройки. Поскольку метод сходится почти в три раза быстрее нынешних стандартов, компании могут достигать передовых результатов, используя лишь малую часть традиционного вычислительного бюджета.
Эта эффективность делает жизнеспособным выход предприятий за рамки стандартных готовых решений и создание специализированных моделей, глубоко адаптированных к их собственным предметным областям — будь то нишевая медицинская визуализация или проприетарные данные промышленных датчиков.
Практические применения этой технологии распространяются на критически важные промышленные секторов, в первую очередь на робототехнику и автономные системы. Используя способность фреймворка обучаться «моделям мира», предприятия в сфере производства и логистики могут создавать модели «видео-язык-действие» (VLA), обладающие превосходным пониманием физического пространства и последовательного рассуждения.
В ходе симуляционных тестов Self-Flow позволила робототехническим контроллерам успешно выполнять сложные задачи с несколькими объектами — например, открыть ящик, чтобы положить внутрь предмет, — там, где традиционные генеративные модели потерпели неудачу. Это говорит о том, что технология является фундаментальным инструментом для любого предприятия, стремящегося преодолеть разрыв между генерацией цифрового контента и реальной физической автоматизацией.
Помимо прироста производительности, Self-Flow дает компаниям стратегическое преимущество за счет упрощения базовой ИИ-инфраструктуры. Большинство современных генеративных систем представляют собой «модели Франкенштейна», требующие сложных внешних семантических кодировщиков, часто принадлежащих третьим лицам и используемых по лицензии.
Объединяя представление и генерацию в единую архитектуру, Self-Flow позволяет предприятиям избавиться от этих внешних зависимостей, снизить технический долг и устранить «узкие места», связанные с масштабированием учителей от третьих сторон. Такая автономность гарантирует, что по мере масштабирования вычислительных мощностей и данных компании производительность модели будет расти предсказуемо и синхронно, обеспечивая более четкую окупаемость инвестиций (ROI) в долгосрочные ИИ-проекты.



