A still-life vase and lake scene transforming into motion and an audio waveform, representing FLUX 3 multimodal generation

Flux 3: gere e edite imagens e vídeos com um único modelo de IA multimodal.

O Flux 3 mantém o briefing no centro enquanto o resultado muda de forma. Crie uma imagem, dirija uma tomada em movimento, transforme a mídia de origem e leve a mesma intenção visual para a próxima versão sem expor a infraestrutura do provedor.

Descreva o vídeo que deseja criar, incluindo o assunto, a ação, o movimento da câmera, o estilo e a atmosfera. Use @ para fazer referência a conteúdo. Ex.: @image1 imitar a pose, movimento de @video1, estilo de áudio de @audio1

Inteligência visual do mundo real

O mundo não é dividido em modalidades.

O FLUX 3 é um modelo fundacional multimodal que aprende conjuntamente com imagens, vídeo e áudio. O objetivo não é dominar cada sinal isoladamente, mas aprender uma representação do mundo: como os objetos se mantêm unidos, como as coisas se movem e como os eventos soam.

Cada modalidade é uma projeção incompleta da mesma realidade. Suas limitações se tornam mais úteis quando aprendidas juntas: o som deve corresponder ao impacto, o movimento deve respeitar a massa e o futuro deve seguir o passado.

As imagens revelam a estrutura

Relações espaciais, materiais, identidade e composição em um momento específico.

O vídeo recupera o tempo

Dinâmica temporal, leis físicas, movimento, continuidade e o que pode acontecer em seguida.

O áudio revela a causa

Eventos mecânicos, impactos, texturas e relações acústicas que a visão não consegue detectar sozinha.

A linguagem dá direção

Objetivos, abstrações, instruções e a ligação entre percepção e intenção.

Construído sobre o Self-Flow

Um modelo. Várias capacidades.

Self-Flow é a abordagem da BFL para alinhar geração e compreensão multimodais dentro da mesma arquitetura. O FLUX 3 amplia essa abordagem com muito mais computação e dados, treinando com vídeo, imagens e áudio ao mesmo tempo.

O resultado é uma única base que combina modalidades, gera imagens e vídeos com áudio conjuntamente e trabalha tanto com texto puro quanto com referências como imagens e vídeos.

One mechanical subject shown across four moments of motion

Vídeo e áudio

Vídeo

O FLUX 3 pode gerar vídeos variados de até 20 segundos em uma única geração. Todo resultado inclui áudio nativo.

A performance car moving through a rain-soaked city

Do primeiro quadro a uma sequência com várias tomadas.

01

Geração de texto para vídeo.

02

Imagem para vídeo a partir de um quadro inicial ou referências visuais.

03

De vídeo para vídeo, levando um personagem ou elemento central para uma nova cena.

04

Continuação generativa de vídeo e áudio a partir de um clipe de entrada.

05

De quadros-chave para vídeo, com transições controladas entre momentos definidos.

06

Diálogo multilíngue com geração de áudio nativa.

07

Uma ampla variedade de proporções e estilos visuais além do resultado cinematográfico convencional.

08

Encadeamento autônomo de clipes em sequências mais longas e com várias tomadas.

09

Estilos que vão de filmagens espontâneas de câmera a animações e cinematografia.

10

Geração de tipografia forte e designs animados.

Avaliação preliminar

Preferido nas primeiras comparações.

Para esta análise preliminar, a BFL gerou clipes de texto para vídeo de 10 segundos e 720p com áudio. O modelo e o sistema de avaliação ainda estão em desenvolvimento, portanto esses números podem mudar.

Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

A BFL relata força especial em expressões faciais humanas, correspondência entre sons e eventos físicos e geração multilíngue. Referências visuais ajudam a manter os personagens consistentes enquanto os clipes são encadeados em sequências de vários minutos.

A collage of FLUX 3 image examples spanning product design, landscapes, painting, illustration, macro photography, and cinematic imagery

Síntese e edição de imagens

Imagem

O FLUX 3 pode sintetizar e editar imagens em uma ampla variedade de estilos, proporções e resoluções.

Melhor tratamento de prompts complexos do que nas gerações anteriores do FLUX.

Renderização de texto de alta precisão em vários idiomas.

Ampla variedade estilística para síntese e edição guiada por referências.

Essas conclusões sobre imagens vêm de avaliações preliminares durante o treinamento. A BFL espera melhorias adicionais antes do lançamento.

Da criação de conteúdo à IA física

Ação

O FLUX 3 amplia a compreensão do mundo para a previsão de ações: não apenas percebe uma cena, mas aprende o suficiente sobre sua dinâmica para prever o que deve acontecer em seguida.

A production table arranged with reference images, equipment, and physical materials

Duas rotas para a ação.

Previsão nativa

Integre a previsão de ações diretamente ao FLUX 3, ampliando o trabalho inicial do Self-Flow dentro do modelo unificado.

Modelos de ação especializados

Use a base de vídeo pré-treinada como uma fundação consciente da dinâmica e faça o ajuste fino com dados limitados específicos da tarefa.

FLUX-mimic

Trabalhando com a mimic robotics, a BFL combinou a base de vídeo FLUX 3 com experiência em aprendizado robótico para manipulação hábil e implantação em produção. A colaboração conecta IA física e criação de conteúdo por meio do mesmo modelo de mundo subjacente e está sendo testada em tarefas reais de produção na Audi.

Leia a tese do FLUX-mimic

Plano de lançamento

Uma base, lançada em etapas.

A BFL planeja lançar cada capacidade após coletar feedback e realizar testes de segurança. Cada versão é construída sobre a mesma base multimodal de flow matching.

FLUX 3 Video

Geração e edição de vídeo e áudio por meio de APIs e acesso privado aos pesos do modelo.

FLUX-mimic e FLUX 3 Action

Predição de ações por meio de parceiros selecionados de pesquisa e comerciais, começando pela mimic robotics.

FLUX 3 Image

Síntese e edição de imagens por meio de APIs e acesso privado aos pesos do modelo.

FLUX 3 Dev

Acesso a pesos abertos de uma base multimodal para previsão de vídeo, áudio, imagem e ação.

Como usar o Flux 3

De uma ideia a uma geração concluída.

Comece com o resultado necessário, dê ao modelo uma direção criativa clara e use cada resultado para tornar a próxima versão mais precisa.

01

Escolha o resultado

Escolha Vídeo ou Imagem no gerador. O espaço de trabalho mostra apenas as entradas e configurações compatíveis com esse fluxo.

02

Direcione o resultado

Descreva o assunto, o ambiente, a composição, o estilo, a iluminação e o clima. Adicione imagens ou vídeos de referência quando a identidade, o movimento ou a direção de arte precisarem permanecer consistentes.

03

Gere e refine

Confira os créditos necessários, gere e compare o resultado salvo na sua biblioteca. Refine o prompt ou reutilize o resultado mais forte como uma nova referência.

Abrir o gerador

Respostas úteis antes do seu primeiro projeto no Flux 3.

Aprenda como prompts, referências, modelos, créditos e resultados salvos funcionam antes de começar a gerar com o Flux 3.

Abstract folded black and oxblood surfaces forming a cinematic stage for the future of FLUX 3

O que vem a seguir

Perceba. Preveja. Aja.

A fronteira se estende da edição interativa de imagens e vídeos à simulação, uso de computadores e IA física. O objetivo de longo prazo é unificar percepção, ação e previsão de linguagem no mesmo modelo.