Flux 3 - новый прорыв на подходе!

Опубликовано 29 Июл 2026 07:51

Black Forest Labs выкатили FLUX 3 — мультимодальную модель, которая одновременно учится на картинках, видео и аудио. Это не просто новый «движок для видео», а единый backbone под визуальный интеллект и даже робототехнику.

FLUX 3 – Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

Что умеет FLUX 3 прямо сейчас

·         Генерировать видео до 20 секунд с нативным синхронным аудио из текста, картинок и даже других видео (text-to-video, image-to-video, video-to-video).

·         Работать с разными форматами кадра: от вертикальных TikTok-роликов до широких синематик-кадров, включая 480p и 720p в раннем доступе.

·         Держать кинематографическую композицию, свет и движение: ранние примеры показывают уверенный motion, камеру, диалоги и атмосферный звук в одном проходе.

BFL прямо пишет, что FLUX 3 обучен совместно на изображениях, видео и звуке, чтобы модель строила единое представление о мире, а не три отдельные «головы» по модальностям.

Видео + звук: примеры того, что уже показывают

Сейчас в сети гуляет много демо из раннего доступа — они дают честное представление, на что модель уже способна:

·         Early Access Showcase: создатель показывает собственные text-to-video и image-to-video ролики — от личного talking-head-видео с наложением визуальных эффектов до стилизованных сцен вроде «интервью с антропоморфной рыбой» в грандж-эстетике.

·         Demo Reel FLUX 3: нарезка клипов с сильной кинематографией, плавным движением камеры, сложным светом и coherent motion; все ролики сгенерированы одной моделью FLUX 3.

·         Отдельные примеры в гайдах по FLUX 3 показывают сцены, где аудио — часть prompt’а: шаги, атмосферный шум, хоррор-звуки, диалоги и «трейлерный» саунд — всё это можно задать текстом и получить синхронный звук вместе с картинкой.

Хороший промпт для FLUX 3 видео, судя по гайдам, обязательно включает камеру (push-in, handheld, dolly), движение персонажа и окружения, а также звуковую сцену: диалог, амбиенс, эффекты, тишину или музыку.

FLUX 3 как backbone для роботов

Отдельная линия — FLUX 3 x mimic: BFL и mimic robotics используют тот же backbone для модели, которая учится предсказывать действия робота по видео. FLUX-mimic уже тестируется на реальных роботизированных системах Audi.

В блоге BFL пишут, что после добавления action prediction качество видеогенерации сначала упало, но после дообучения модель научилась одновременно держать видео и предсказывать действия — это ключевой аргумент, почему FLUX 3 называют «real-world model», а не просто «генеративкой».

Планы доступа и open weights

Сейчас FLUX 3 запущен в Early Access, на странице BFL можно оставить заявку на доступ. В ближайшие месяцы команда обещает:

·         Расширение FLUX 3 Video через API и приватные веса.

·         Action prediction для избранных исследовательских и промышленных партнёров.

·         Image generation/editing на том же backbone.

·         FLUX 3 Dev — открытые веса мультимодального бэкбона для контент-генерации и action prediction.

← Все новости