Новая техника Self-Mlow от Black Forest Labs увеличивает скорость обучения мультимодальных ИИ-моделей в 2,8 раза

Новая техника Self-Mlow от Black Forest Labs увеличивает скорость обучения мультимодальных ИИ-моделей в 2,8 раза

Источник: VentureBeat · Carl Franzen

Для создания когерентных изображений или видео генеративные ИИ-модели диффузионного типа, такие как Stable Diffusion или FLUX, обычно полагались на внешних «учителей» — замороженные кодировщики вроде CLIP или DINOv2, которые обеспечивали семантическое понимание, недоступное моделям при самостоятельном обучении.

Однако такая зависимость имела свою цену: возник «узкие горлышко», при котором дальнейшее масштабирование модели больше не приводит к улучшению результатов, поскольку внешний учитель достиг своего предела.

Сегодня немецкий ИИ-стартап Black Forest Labs (разработчик серии ИИ-моделей для генерации изображений FLUX) объявил о возможном завершении этой эпохи академических заимствований с выпуском Self-Flow — метода сопряжения потоков с самообучением, который позволяет моделям одновременно учиться представлению и генерации.

Интегрировав инновационный механизм планирования с двумя временными шагами (Dual-Timestep Scheduling), Black Forest Labs продемонстрировала, что единая модель способна достигать передовых результатов в работе с изображениями, видео и аудио без какого-либо внешнего контроля.

Технология: преодоление «семантического разрыва»

Фундаментальная проблема традиционного генеративного обучения заключается в том, что это задача «устранения шума» (denoising). Модели показывают шум и просят найти изображение; у нее практически нет стимула понимать, что именно изображено на картинке, — важно лишь то, как она выглядит.

Чтобы исправить это, исследователи ранее «выравнивали» генеративные признаки с помощью внешних дискриминативных моделей. Тем не менее, Black Forest Labs утверждает, что такой подход изначально ущербен: эти внешние модели часто работают на основе несогласованных целей и не способны к генерализации в различных модальностях, таких как аудио или робототехника.

Новый метод компании под названием Self-Flow решает эту проблему путем создания «информационной асимметрии». Используя подход Dual-Timestep Scheduling, система применяет разный уровень шума к разным частям входных данных. Студент получает сильно искаженную версию данных, в то время как учитель — версия модели на основе экспоненциального скользящего среднего (EMA) — видит «более чистую» версию тех же данных.

Перед студентом ставится задача не просто сформировать финальный результат, но и предсказать, что видит его «более чистая» версия. Это процесс самодистилляции, в котором учитель находится на 20-м слое, а студент — на 8-м. Такой подход «двойного прохода» заставляет модель развивать глубокое внутреннее семантическое понимание, фактически обучая себя видеть в процессе обучения созданию контента.

Влияние на продукты: быстрее, четче и мультимодальнее

Практические результаты этого сдвига разительны. Согласно исследовательскому документу, Self-Flow сходится примерно в 2,8 раза быстрее, чем метод выравнивания представлений (REPA), который является текущим отраслевым стандартом для сопоставления признаков. Пожалуй, еще важнее то, что показатели не выходят на плато: по мере увеличения вычислительных мощностей и параметров Self-Flow продолжает улучшаться, в то время как старые методы демонстрируют убывающую отдачу.

Скачок в эффективности обучения лучше всего оценивать в сырых вычислительных шагах: если стандартное обучение «из коробки» традиционно требует 7 миллионов шагов для достижения базового уровня производительности, то REPA сократила этот путь всего до 400 000 шагов, что означает ускорение в 17,5 раз.

Фреймворк Self-Flow от Black Forest Labs раздвигает эти границы еще дальше, работая в 2,8 раза быстрее REPA и достигая того же рубежа производительности примерно за 143 000 шагов.

В совокупности эта эволюция представляет собой почти 50-кратное сокращение общего количества шагов обучения, необходимых для получения высококачественных результатов, фактически превращая некогда колоссальные требования к ресурсам в значительно более доступный и оптимизированный процесс.

Black Forest Labs продемонстрировала эти достижения на примере мультимодальной модели с 4 миллиардами параметров. Обученная на массивном датасете из 200 млн изображений, 6 млн видео и 2 млн аудио-видео пар, модель показала значительный прогресс в трех ключевых областях:

  1. Типографика и отрисовка текста: Одним из самых устойчивых «маркеров» ИИ-изображений всегда был искаженный текст. Self-Flow значительно превосходит стандартное сопоставление потоков при рендеринге сложных, легко читаемых вывесок и надписей, таких как неоновая вывеска с корректно написанными словами «FLUX is multimodal».

  2. Временная согласованность: При генерации видео Self-Flow устраняет множество «галлюцинаторных» артефактов, типичных для современных моделей, например, конечностей, которые спонтанно исчезают во время движения.

  3. Совместный синтез видео и аудио: Поскольку модель изучает представления нативно, она может генерировать синхронизированные видео и аудио по единой текстовой подсказке. В подобных задачах внешние «заимствованные» представления часто дают сбой, так как кодировщик изображений не понимает звук.

С точки зрения количественных метрик, Self-Flow добилась превосходных результатов по сравнению с конкурирующими базовыми моделями. По метрике Image FID модель набрала 3,61 против 3,92 у REPA. Для видео (FVD) показатель составил 47,81 по сравнению с 49,59 у REPA, а для аудио (FAD) — 145,65 против 148,87 у стандартной базовой модели.

От пикселей к планированию: путь к моделям мира

Анонс завершается обзором перспектив создания моделей мира (world models) — ИИ, который не просто генерирует красивые картинки, но и понимает базовую физику и логику сцены для планирования и робототехники.

Благодаря тонкой настройке версии Self-Flow с 675 млн параметров на датасете робототехники RT-1, исследователи добились значительно более высоких показателей успешности в сложных многоэтапных задачах в симуляторе SIMPLER. В то время как стандартное сопоставление потоков испытывало трудности со сложными задачами вроде «открыть и положить» и часто полностью терпело неудачу, модель Self-Flow поддерживала стабильный уровень успеха, что говорит о достаточности ее внутренних представлений для реальных задач визуального рассуждения.

Детали реализации и инженерии

Для исследователей, желающих проверить эти утверждения, Black Forest Labs выпустила набор инструментов для инференса на GitHub, ориентированный специально на генерацию ImageNet 256×256. Проект, написанный преимущественно на Python, предоставляет архитектуру модели SelfFlowPerTokenDiT на базе SiT-XL/2.

Инженеры могут использовать предоставленный скрипт sample.py для генерации 50 000 изображений с целью стандартной оценки FID. В репозитории подчеркивается, что ключевой архитектурной модификацией в этой реализации является поточное (per-token) кондиционирование по временным шагам, которое позволяет настраивать каждый токен в последовательности в зависимости от его конкретного шага зашумления. Во время обучения модель использовала смешанную точность BFloat16 и оптимизатор AdamW с обрезкой градиентов для поддержания стабильности.

Лицензирование и доступность

Black Forest Labs опубликовала исследовательскую работу и официальный код для инференса на GitHub и на своем исследовательском портале. Хотя в настоящее время это исследовательская превью-версия, послужной список компании в отношении семейства моделей FLUX позволяет предположить, что эти инновации в ближайшем будущем найдут свое применение в коммерческом API и предложениях с открытыми весами.

Для разработчиков отказ от внешних кодировщиков — огромная победа с точки зрения эффективности. Это избавляет от необходимости управлять отдельными тяжелыми моделями, такими как DINOv2, во время обучения, упрощая стек и позволяя осуществлять более специализированное обучение под конкретные домены, не зависящее от чужого «замороженного» понимания мира.

Выводы для корпоративных лиц, принимающих технические решения, и пользователей

Для бизнеса появление Self-Flow означает серьезный сдвиг в анализе затрат и выгод при разработке проприетарного ИИ.

Хотя первыми непосредственными выгодоприобретателями станут организации, обучающие крупномасштабные модели с нуля, исследование показывает, что технология столь же эффективна для высокоточной донастройки. Поскольку метод сходится почти в три раза быстрее нынешних стандартов, компании могут достигать передовых результатов, используя лишь малую часть традиционного вычислительного бюджета.

Эта эффективность делает жизнеспособным выход предприятий за рамки стандартных готовых решений и создание специализированных моделей, глубоко адаптированных к их собственным предметным областям — будь то нишевая медицинская визуализация или проприетарные данные промышленных датчиков.

Практические применения этой технологии распространяются на критически важные промышленные секторов, в первую очередь на робототехнику и автономные системы. Используя способность фреймворка обучаться «моделям мира», предприятия в сфере производства и логистики могут создавать модели «видео-язык-действие» (VLA), обладающие превосходным пониманием физического пространства и последовательного рассуждения.

В ходе симуляционных тестов Self-Flow позволила робототехническим контроллерам успешно выполнять сложные задачи с несколькими объектами — например, открыть ящик, чтобы положить внутрь предмет, — там, где традиционные генеративные модели потерпели неудачу. Это говорит о том, что технология является фундаментальным инструментом для любого предприятия, стремящегося преодолеть разрыв между генерацией цифрового контента и реальной физической автоматизацией.

Помимо прироста производительности, Self-Flow дает компаниям стратегическое преимущество за счет упрощения базовой ИИ-инфраструктуры. Большинство современных генеративных систем представляют собой «модели Франкенштейна», требующие сложных внешних семантических кодировщиков, часто принадлежащих третьим лицам и используемых по лицензии.

Объединяя представление и генерацию в единую архитектуру, Self-Flow позволяет предприятиям избавиться от этих внешних зависимостей, снизить технический долг и устранить «узкие места», связанные с масштабированием учителей от третьих сторон. Такая автономность гарантирует, что по мере масштабирования вычислительных мощностей и данных компании производительность модели будет расти предсказуемо и синхронно, обеспечивая более четкую окупаемость инвестиций (ROI) в долгосрочные ИИ-проекты.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.