A still-life vase and lake scene transforming into motion and an audio waveform, representing FLUX 3 multimodal generation

Flux 3: создавайте и редактируйте изображения и видео с помощью одной мультимодальной модели ИИ.

Flux 3 сохраняет задание в центре процесса, пока формат результата меняется. Создавайте изображения, ставьте движущиеся кадры, преобразуйте исходные материалы и переносите тот же визуальный замысел в следующую версию, не вникая во внутреннее устройство провайдеров.

Опишите видео, которое хотите создать, включая объект, действие, движение камеры, стиль и атмосферу. Используйте @ для ссылки на контент. Например: @image1 повторить позу, движение из @video1, стиль аудио из @audio1

Визуальный интеллект реального мира

Мир не разделен на модальности.

FLUX 3 — мультимодальная базовая модель, которая совместно обучается на изображениях, видео и аудио. Ее цель — не осваивать каждый сигнал отдельно, а формировать представление о мире: как устроены объекты, как они движутся и как звучат события.

Каждая модальность лишь частично отражает одну и ту же реальность. Их ограничения становятся полезнее при совместном обучении: звук должен соответствовать удару, движение — учитывать массу, а будущее — логично следовать из прошлого.

Изображения раскрывают структуру

Пространственные отношения, материалы, идентичность и композиция в конкретный момент.

Видео возвращает время

Временная динамика, законы физики, движение, непрерывность и возможное развитие событий.

Аудио раскрывает причину

Механические события, удары, фактура и акустические связи, которые невозможно распознать только визуально.

Язык задает направление

Цели, абстракции, инструкции и связь между восприятием и намерением.

Создано на основе Self-Flow

Одна модель. Множество возможностей.

Self-Flow — подход BFL к согласованию мультимодальной генерации и понимания в рамках одной архитектуры. FLUX 3 развивает этот подход благодаря значительно большим вычислительным ресурсам и объему данных, одновременно обучаясь на видео, изображениях и аудио.

В результате получается единая основа, способная сочетать модальности, совместно создавать изображения и видео со звуком и работать как с чистым текстом, так и с референсами в виде изображений и видео.

One mechanical subject shown across four moments of motion

Видео и аудио

Видео

FLUX 3 может за одну генерацию создавать разнообразные видео длительностью до 20 секунд. Каждый результат включает собственное аудио.

A performance car moving through a rain-soaked city

От первого кадра до многокадровой последовательности.

01

Генерация видео по тексту.

02

Создание видео из начального кадра или визуальных референсов.

03

Преобразование видео с переносом персонажа или центрального элемента в новую сцену.

04

Генеративное продолжение видео и аудио из исходного ролика.

05

Создание видео по ключевым кадрам с управляемыми переходами между заданными моментами.

06

Многоязычные диалоги с собственной генерацией аудио.

07

Широкий выбор соотношений сторон и визуальных стилей за пределами привычной кинематографической эстетики.

08

Автономное объединение роликов в более длинные многокадровые последовательности.

09

Стили от естественной любительской съемки до анимации и кинематографичных сцен.

10

Качественная генерация типографики и анимированного дизайна.

Предварительная оценка

Предпочтительный вариант в первых сравнениях.

Для этого предварительного анализа BFL создавала по тексту 10-секундные ролики в разрешении 720p со звуком. Модель и система оценки все еще разрабатываются, поэтому эти показатели могут измениться.

Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

BFL отмечает особенно высокое качество человеческой мимики, соответствия звуков физическим событиям и многоязычной генерации. Визуальные референсы помогают сохранять персонажей узнаваемыми при объединении роликов в последовательности длительностью несколько минут.

A collage of FLUX 3 image examples spanning product design, landscapes, painting, illustration, macro photography, and cinematic imagery

Создание и редактирование изображений

Изображение

FLUX 3 умеет создавать и редактировать изображения в широком диапазоне стилей, соотношений сторон и разрешений.

Более точная обработка сложных промптов по сравнению с предыдущими поколениями FLUX.

Высокоточное отображение текста на нескольких языках.

Широкий диапазон стилей как для генерации, так и для редактирования по референсам.

Эти результаты по изображениям получены в ходе предварительной оценки во время обучения. BFL ожидает дальнейших улучшений до выпуска.

От создания контента до физического ИИ

Действие

FLUX 3 расширяет понимание мира до прогнозирования действий: модель не просто воспринимает сцену, но и изучает ее динамику настолько, чтобы предсказывать, что должно произойти дальше.

A production table arranged with reference images, equipment, and physical materials

Два пути к действию.

Встроенное прогнозирование

Интегрировать прогнозирование действий непосредственно в FLUX 3, развивая первоначальные наработки Self-Flow внутри единой модели.

Специализированные модели действий

Использовать предварительно обученную видеооснову, учитывающую динамику, а затем дообучить ее на небольшом объеме данных для конкретной задачи.

FLUX-mimic

Совместно с mimic robotics компания BFL объединила видеооснову FLUX 3 с экспертизой в обучении роботов для точных манипуляций и промышленного внедрения. Это сотрудничество связывает физический ИИ и создание контента через общую модель мира и тестируется на реальных производственных задачах Audi.

Прочитать исследование FLUX-mimic

План выпуска

Единая основа, поэтапный выпуск.

BFL планирует выпускать каждую возможность после сбора отзывов и тестирования безопасности. Все версии создаются на единой мультимодальной основе сопоставления потоков.

FLUX 3 Video

Создание и редактирование видео и аудио через API и закрытый доступ к весам модели.

FLUX-mimic и FLUX 3 Action

Прогнозирование действий с участием избранных исследовательских и коммерческих партнеров, начиная с mimic robotics.

FLUX 3 Image

Создание и редактирование изображений через API и закрытый доступ к весам модели.

FLUX 3 Dev

Доступ к открытым весам мультимодальной основы для видео, аудио, изображений и прогнозирования действий.

Как пользоваться Flux 3

От идеи до готового результата.

Начните с нужного результата, задайте модели четкое творческое направление и используйте каждый результат, чтобы сделать следующую версию точнее.

01

Выберите формат результата

Выберите в генераторе видео или изображение. В рабочем пространстве будут показаны только исходные данные и настройки, доступные для этого процесса.

02

Задайте направление

Опишите объект, обстановку, композицию, стиль, освещение и настроение. Добавьте референсные изображения или видео, если нужно сохранить узнаваемость, движение или художественное направление.

03

Создайте и доработайте

Проверьте необходимое количество кредитов, запустите генерацию и сравните сохраненный результат в библиотеке. Уточните промпт или используйте лучший результат как новый референс.

Открыть генератор

Полезные ответы перед первым проектом в Flux 3.

Прежде чем начать генерацию в Flux 3, узнайте, как работают промпты, референсы, модели, кредиты и сохраненные результаты.

Abstract folded black and oxblood surfaces forming a cinematic stage for the future of FLUX 3

Что дальше

Воспринимать. Предсказывать. Действовать.

Возможности простираются от интерактивного редактирования изображений и видео до симуляции, работы с компьютером и физического ИИ. Долгосрочная цель — объединить восприятие, действие и языковое прогнозирование в одной модели.