01
Escolha o resultado
Escolha Vídeo ou Imagem no gerador. O espaço de trabalho mostra apenas as entradas e configurações compatíveis com esse fluxo.

O Flux 3 mantém o briefing no centro enquanto o resultado muda de forma. Crie uma imagem, dirija uma tomada em movimento, transforme a mídia de origem e leve a mesma intenção visual para a próxima versão sem expor a infraestrutura do provedor.
Inteligência visual do mundo real
O FLUX 3 é um modelo fundacional multimodal que aprende conjuntamente com imagens, vídeo e áudio. O objetivo não é dominar cada sinal isoladamente, mas aprender uma representação do mundo: como os objetos se mantêm unidos, como as coisas se movem e como os eventos soam.
Cada modalidade é uma projeção incompleta da mesma realidade. Suas limitações se tornam mais úteis quando aprendidas juntas: o som deve corresponder ao impacto, o movimento deve respeitar a massa e o futuro deve seguir o passado.
Relações espaciais, materiais, identidade e composição em um momento específico.
Dinâmica temporal, leis físicas, movimento, continuidade e o que pode acontecer em seguida.
Eventos mecânicos, impactos, texturas e relações acústicas que a visão não consegue detectar sozinha.
Objetivos, abstrações, instruções e a ligação entre percepção e intenção.
Construído sobre o Self-Flow
Self-Flow é a abordagem da BFL para alinhar geração e compreensão multimodais dentro da mesma arquitetura. O FLUX 3 amplia essa abordagem com muito mais computação e dados, treinando com vídeo, imagens e áudio ao mesmo tempo.
O resultado é uma única base que combina modalidades, gera imagens e vídeos com áudio conjuntamente e trabalha tanto com texto puro quanto com referências como imagens e vídeos.

Vídeo e áudio
O FLUX 3 pode gerar vídeos variados de até 20 segundos em uma única geração. Todo resultado inclui áudio nativo.

Geração de texto para vídeo.
Imagem para vídeo a partir de um quadro inicial ou referências visuais.
De vídeo para vídeo, levando um personagem ou elemento central para uma nova cena.
Continuação generativa de vídeo e áudio a partir de um clipe de entrada.
De quadros-chave para vídeo, com transições controladas entre momentos definidos.
Diálogo multilíngue com geração de áudio nativa.
Uma ampla variedade de proporções e estilos visuais além do resultado cinematográfico convencional.
Encadeamento autônomo de clipes em sequências mais longas e com várias tomadas.
Estilos que vão de filmagens espontâneas de câmera a animações e cinematografia.
Geração de tipografia forte e designs animados.
Avaliação preliminar
Para esta análise preliminar, a BFL gerou clipes de texto para vídeo de 10 segundos e 720p com áudio. O modelo e o sistema de avaliação ainda estão em desenvolvimento, portanto esses números podem mudar.
A BFL relata força especial em expressões faciais humanas, correspondência entre sons e eventos físicos e geração multilíngue. Referências visuais ajudam a manter os personagens consistentes enquanto os clipes são encadeados em sequências de vários minutos.

Síntese e edição de imagens
O FLUX 3 pode sintetizar e editar imagens em uma ampla variedade de estilos, proporções e resoluções.
Melhor tratamento de prompts complexos do que nas gerações anteriores do FLUX.
Renderização de texto de alta precisão em vários idiomas.
Ampla variedade estilística para síntese e edição guiada por referências.
Essas conclusões sobre imagens vêm de avaliações preliminares durante o treinamento. A BFL espera melhorias adicionais antes do lançamento.
Da criação de conteúdo à IA física
O FLUX 3 amplia a compreensão do mundo para a previsão de ações: não apenas percebe uma cena, mas aprende o suficiente sobre sua dinâmica para prever o que deve acontecer em seguida.

Previsão nativa
Integre a previsão de ações diretamente ao FLUX 3, ampliando o trabalho inicial do Self-Flow dentro do modelo unificado.
Modelos de ação especializados
Use a base de vídeo pré-treinada como uma fundação consciente da dinâmica e faça o ajuste fino com dados limitados específicos da tarefa.
Trabalhando com a mimic robotics, a BFL combinou a base de vídeo FLUX 3 com experiência em aprendizado robótico para manipulação hábil e implantação em produção. A colaboração conecta IA física e criação de conteúdo por meio do mesmo modelo de mundo subjacente e está sendo testada em tarefas reais de produção na Audi.
Leia a tese do FLUX-mimicPlano de lançamento
A BFL planeja lançar cada capacidade após coletar feedback e realizar testes de segurança. Cada versão é construída sobre a mesma base multimodal de flow matching.
Geração e edição de vídeo e áudio por meio de APIs e acesso privado aos pesos do modelo.
Predição de ações por meio de parceiros selecionados de pesquisa e comerciais, começando pela mimic robotics.
Síntese e edição de imagens por meio de APIs e acesso privado aos pesos do modelo.
Acesso a pesos abertos de uma base multimodal para previsão de vídeo, áudio, imagem e ação.
Como usar o Flux 3
Comece com o resultado necessário, dê ao modelo uma direção criativa clara e use cada resultado para tornar a próxima versão mais precisa.
01
Escolha Vídeo ou Imagem no gerador. O espaço de trabalho mostra apenas as entradas e configurações compatíveis com esse fluxo.
02
Descreva o assunto, o ambiente, a composição, o estilo, a iluminação e o clima. Adicione imagens ou vídeos de referência quando a identidade, o movimento ou a direção de arte precisarem permanecer consistentes.
03
Confira os créditos necessários, gere e compare o resultado salvo na sua biblioteca. Refine o prompt ou reutilize o resultado mais forte como uma nova referência.
Aprenda como prompts, referências, modelos, créditos e resultados salvos funcionam antes de começar a gerar com o Flux 3.

O que vem a seguir
A fronteira se estende da edição interativa de imagens e vídeos à simulação, uso de computadores e IA física. O objetivo de longo prazo é unificar percepção, ação e previsão de linguagem no mesmo modelo.