Flux 3 - новый прорыв на подходе!
Опубликовано 29 Июл 2026 07:51
Black Forest Labs выкатили FLUX 3 — мультимодальную модель, которая одновременно учится на картинках, видео и аудио. Это не просто новый «движок для видео», а единый backbone под визуальный интеллект и даже робототехнику.
FLUX 3 – Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.
Что умеет FLUX 3 прямо сейчас
· Генерировать видео до 20 секунд с нативным синхронным аудио из текста, картинок и даже других видео (text-to-video, image-to-video, video-to-video).
· Работать с разными форматами кадра: от вертикальных TikTok-роликов до широких синематик-кадров, включая 480p и 720p в раннем доступе.
· Держать кинематографическую композицию, свет и движение: ранние примеры показывают уверенный motion, камеру, диалоги и атмосферный звук в одном проходе.
BFL прямо пишет, что FLUX 3 обучен совместно на изображениях, видео и звуке, чтобы модель строила единое представление о мире, а не три отдельные «головы» по модальностям.
Видео + звук: примеры того, что уже показывают
Сейчас в сети гуляет много демо из раннего доступа — они дают честное представление, на что модель уже способна:
· Early Access Showcase: создатель показывает собственные text-to-video и image-to-video ролики — от личного talking-head-видео с наложением визуальных эффектов до стилизованных сцен вроде «интервью с антропоморфной рыбой» в грандж-эстетике.
· Demo Reel FLUX 3: нарезка клипов с сильной кинематографией, плавным движением камеры, сложным светом и coherent motion; все ролики сгенерированы одной моделью FLUX 3.
· Отдельные примеры в гайдах по FLUX 3 показывают сцены, где аудио — часть prompt’а: шаги, атмосферный шум, хоррор-звуки, диалоги и «трейлерный» саунд — всё это можно задать текстом и получить синхронный звук вместе с картинкой.
Хороший промпт для FLUX 3 видео, судя по гайдам, обязательно включает камеру (push-in, handheld, dolly), движение персонажа и окружения, а также звуковую сцену: диалог, амбиенс, эффекты, тишину или музыку.
FLUX 3 как backbone для роботов
Отдельная линия — FLUX 3 x mimic: BFL и mimic robotics используют тот же backbone для модели, которая учится предсказывать действия робота по видео. FLUX-mimic уже тестируется на реальных роботизированных системах Audi.
В блоге BFL пишут, что после добавления action prediction качество видеогенерации сначала упало, но после дообучения модель научилась одновременно держать видео и предсказывать действия — это ключевой аргумент, почему FLUX 3 называют «real-world model», а не просто «генеративкой».
Планы доступа и open weights
Сейчас FLUX 3 запущен в Early Access, на странице BFL можно оставить заявку на доступ. В ближайшие месяцы команда обещает:
· Расширение FLUX 3 Video через API и приватные веса.
· Action prediction для избранных исследовательских и промышленных партнёров.
· Image generation/editing на том же backbone.
· FLUX 3 Dev — открытые веса мультимодального бэкбона для контент-генерации и action prediction.