Black Forest Labs запустила FLUX 3 в четверг — впервые для флагманской модели компании: она генерирует видео, а не статичные изображения. Немецкая ИИ-лаборатория, известная линейкой FLUX для генерации изображений, обучила новую систему на изображениях, видео и аудио одновременно — в рамках одного общего контура. Такой мультимодальный подход позволяет FLUX 3 создавать клипы до 20 секунд длиной с аудио, генерируемым вместе с картинкой и синхронизированным с тем, что происходит на экране, включая диалоги, звуковые эффекты и фоновый шум. Выпуск знаменует стратегический сдвиг от чистой генерации изображений к видеовозможностям: модель также лежит в основе FLUX-mimic — робототехнического приложения, которое уже тестирует Audi на производственной линии для задач вроде установки гибких уплотнителей дверей.
FLUX 3 выдаёт видеоклипы до 20 секунд с синхронизированным аудио
FLUX 3 создаёт видеоклипы длительностью до 20 секунд, причём аудио генерируется одновременно с изображением и синхронизируется с тем, что происходит на экране. На ранних оценках люди-ревьюеры предпочитали результат FLUX 3, а не Runway Gen-4.5, в 77% сравнений лицом-к-лицу, и не Luma Ray 3.2 в 93% сравнений. Модель обошла Gemini Omni и Seedance в 52% оценок. Такие тесты предпочтений устроены так: оценщики смотрят два клипа и выбирают тот, который выглядит и звучит более убедительно, а Black Forest Labs подсчитывает, как часто FLUX 3 выигрывает.
Модель также демонстрирует умение генерировать статичные изображения — по наследию своей линии генерации изображений. Black Forest Labs показала примеры, демонстрирующие универсальность FLUX 3 в создании широкого спектра стилей, выходящих за пределы фотореализма. Сооснователь и CEO Робин Ромбах заявил: «Модель, которая учится только изображениям, может генерировать только изображения». Позиция компании в том, что обучение предсказывать видео означает также обучение лежащей под этим физике — весу, контакту, таймингу, — то есть тому, что машине нужно, чтобы действовать в физическом мире.
Audi тестирует робототехническую систему FLUX-mimic на производственной линии
FLUX-mimic, созданный совместно с Zurich-based mimic robotics, использует видеодвижок предсказаний FLUX 3 и добавляет лёгкий декодер — небольшой модуль, который переводит внутреннее «чувство» модели о том, как движутся вещи, в реальные движения робота. Audi тестирует систему на задачах вроде установки гибких уплотнителей дверей — работе, с которой традиционная автоматизация плохо справлялась. Сооснователь mimic Стефан-Даниель Граверт сказал: «Audi — это тот тип производственного партнёра, для которого мы создали FLUX-mimic». Кристоф Шнайдер из Audi заявил, что роботы теперь «решают сложные задачи манипуляции мягкими телами», с которыми старые машины не справлялись. Black Forest Labs сообщает, что полный контур реагирует примерно за 101 миллисекунду — в районе человеческих визуальных рефлексов.
Black Forest Labs собрала FLUX 3, опираясь на Stable Diffusion
Black Forest Labs была основана в августе 2024 года ветеранами-исследователями, которые помогали создавать исходные модели Stable Diffusion в Stability AI. Компания запустила Flux-модели, которые обошли MidJourney и превзошли Stability’s Stable Diffusion 3. Открытые Flux Dev и Schnell модели получили титул «лучшего генератора изображений с открытым исходным кодом», который художники по ИИ ожидали, что Stable Diffusion 3.5 вернёт. FLUX 1.1 Pro в октябре возглавила «арену» Artificial Analysis для изображений, хотя эта версия не была с открытым исходным кодом.
Black Forest Labs выпустила FLUX.2 в ноябре 2025 года, но он оказался менее популярным. Корона открытых исходников, которой пользовался оригинальный Flux, держалась до тех пор, пока Alibaba’s Z-Image Turbo не свергла её в конце 2025 года, подтвердив качество на младших потребительских графических картах. Один из пользователей CivitAI тогда написал: «Вот каким SD3 и должен был быть».
Версия для разработчиков запланирована на более поздний срок в 2026 году
Видео и Action сейчас доступны в раннем доступе через API и избранных партнёров, среди которых — mimic robotics. Генерация изображений, по данным Black Forest Labs, будет «в ближайшие недели». Открыто-весовая Dev-версия — единственный уровень, который Black Forest Labs планирует выпустить для локального использования, — намечена только на более поздний срок в 2026 году.
FAQ
Какие видеовозможности есть у FLUX 3?
FLUX 3 создаёт видеоклипы длительностью до 20 секунд с аудио, генерируемым вместе с изображением и синхронизированным с происходящим на экране, включая диалоги, звуковые эффекты и фоновый шум. На ранних оценках люди-ревьюеры предпочитали результат FLUX 3, а не Runway Gen-4.5, в 77% сравнений, и не Luma Ray 3.2 в 93% сравнений.
Как Audi использует FLUX-mimic на своей производственной линии?
Audi тестирует FLUX-mimic на задачах вроде установки гибких уплотнителей дверей — работе, с которой традиционная автоматизация плохо справлялась. Система, созданная совместно с mimic robotics, переводит видеодвижок предсказаний FLUX 3 в реальные движения робота с временем реакции примерно 101 миллисекунда. Кристоф Шнайдер из Audi заявил, что роботы теперь решают сложные задачи манипуляции мягкими телами, с которыми старые машины не справлялись.
Когда будет доступна открыто-весовая Dev-версия FLUX 3?
Открыто-весовая Dev-версия, единственный уровень, который Black Forest Labs планирует выпустить для локального использования, намечена только на более поздний срок в 2026 году. Видео и Action сейчас доступны в раннем доступе через API и избранных партнёров, а генерация изображений — «в ближайшие недели».