A still-life vase and lake scene transforming into motion and an audio waveform, representing FLUX 3 multimodal generation

Flux 3: genera y edita imágenes y videos con un único modelo de IA multimodal.

Flux 3 mantiene el brief en el centro mientras cambia la forma del resultado. Crea una imagen, dirige una toma en movimiento, transforma contenido de origen y lleva la misma intención visual a la siguiente versión sin mostrar la maquinaria del proveedor.

Describe el video que quieres crear, incluidos el sujeto, la acción, el movimiento de cámara, el estilo y la atmósfera. Usa @ para hacer referencia a contenido. Ej.: @image1 imita la pose, movimiento de @video1, estilo de audio de @audio1

Inteligencia visual del mundo real

El mundo no está dividido en modalidades.

FLUX 3 es un modelo fundacional multimodal que aprende conjuntamente de imágenes, video y audio. El objetivo no es dominar cada señal por separado, sino aprender una representación del mundo: cómo se mantienen unidos los objetos, cómo se mueven las cosas y cómo suenan los eventos.

Cada modalidad es una proyección incompleta de la misma realidad. Sus limitaciones resultan más útiles cuando se aprenden juntas: el sonido debe coincidir con el impacto, el movimiento debe respetar la masa y el futuro debe seguir al pasado.

Las imágenes revelan la estructura

Relaciones espaciales, materiales, identidad y composición en un momento concreto.

El video recupera el tiempo

Dinámica temporal, leyes físicas, movimiento, continuidad y lo que puede ocurrir después.

El audio revela la causa

Eventos mecánicos, impactos, texturas y relaciones acústicas que la visión no puede detectar por sí sola.

El lenguaje da dirección

Objetivos, abstracciones, instrucciones y el vínculo entre percepción e intención.

Basado en Self-Flow

Un modelo. Varias capacidades.

Self-Flow es el enfoque de BFL para alinear la generación y la comprensión multimodales dentro de una misma arquitectura. FLUX 3 amplía ese enfoque con muchos más recursos de cómputo y datos, entrenándose simultáneamente con video, imágenes y audio.

El resultado es una única base capaz de combinar modalidades, generar imágenes y video con audio conjuntamente y trabajar tanto con texto puro como con referencias de imagen y video.

One mechanical subject shown across four moments of motion

Video y audio

Video

FLUX 3 puede generar videos diversos de hasta 20 segundos en una sola generación. Cada resultado incluye audio nativo.

A performance car moving through a rain-soaked city

Del primer fotograma a una secuencia con varias tomas.

01

Generación de texto a video.

02

De imagen a video a partir de un fotograma inicial o referencias visuales.

03

De video a video, llevando un personaje o elemento central a una nueva escena.

04

Continuación generativa de video y audio a partir de un clip de entrada.

05

De fotogramas clave a video para transiciones controladas entre momentos definidos.

06

Diálogo multilingüe con generación de audio nativa.

07

Una amplia variedad de relaciones de aspecto y estilos visuales más allá de la estética cinematográfica convencional.

08

Encadenamiento autónomo de clips para crear secuencias más largas y con varias tomas.

09

Estilos que van desde metraje espontáneo de videocámara hasta animación y cinematografía.

10

Generación tipográfica sólida y diseños animados.

Evaluación preliminar

Preferido en las primeras comparaciones.

Para este análisis preliminar, BFL generó clips de texto a video de 10 segundos y 720p con audio. El modelo y el sistema de evaluación siguen en desarrollo, por lo que estas cifras pueden cambiar.

Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

BFL destaca especialmente en expresiones faciales humanas, sincronización de sonidos con eventos físicos y generación multilingüe. Las referencias visuales pueden ayudar a mantener la coherencia de los personajes al encadenar clips en secuencias de varios minutos.

A collage of FLUX 3 image examples spanning product design, landscapes, painting, illustration, macro photography, and cinematic imagery

Síntesis y edición de imágenes

Imagen

FLUX 3 puede sintetizar y editar imágenes en una amplia variedad de estilos, relaciones de aspecto y resoluciones.

Mejor manejo de prompts complejos que las generaciones anteriores de FLUX.

Renderizado de texto de alta precisión en varios idiomas.

Amplio rango estilístico tanto para síntesis como para edición guiada por referencias.

Estos hallazgos sobre imágenes proceden de evaluaciones preliminares durante el entrenamiento. BFL espera mejoras adicionales antes del lanzamiento.

De la creación de contenido a la IA física

Acción

FLUX 3 amplía la comprensión del mundo hacia la predicción de acciones: no solo percibe una escena, sino que aprende lo suficiente sobre su dinámica para predecir qué debería ocurrir después.

A production table arranged with reference images, equipment, and physical materials

Dos rutas hacia la acción.

Predicción nativa

Integra la predicción de acciones directamente en FLUX 3 y amplía el trabajo inicial de Self-Flow dentro del modelo unificado.

Modelos de acción especializados

Usa la arquitectura de video preentrenada como base consciente de la dinámica y luego ajústala con datos específicos de tarea limitados.

FLUX-mimic

En colaboración con mimic robotics, BFL combinó la arquitectura de video FLUX 3 con experiencia en aprendizaje robótico para manipulación precisa y despliegue en producción. La colaboración conecta la IA física y la creación de contenido mediante el mismo modelo del mundo subyacente y se está probando en tareas reales de producción en Audi.

Leer la tesis de FLUX-mimic

Plan de lanzamiento

Una arquitectura base, lanzada por etapas.

BFL planea implementar cada capacidad después de recopilar comentarios y realizar pruebas de seguridad. Cada lanzamiento se basa en la misma arquitectura multimodal de flow matching.

FLUX 3 Video

Generación y edición de video y audio mediante APIs y acceso privado a los pesos del modelo.

FLUX-mimic y FLUX 3 Action

Predicción de acciones mediante socios de investigación y comerciales seleccionados, empezando por mimic robotics.

FLUX 3 Image

Síntesis y edición de imágenes mediante APIs y acceso privado a los pesos del modelo.

FLUX 3 Dev

Acceso a pesos abiertos de una arquitectura multimodal para predicción de video, audio, imágenes y acciones.

Cómo usar Flux 3

De una idea a una generación terminada.

Empieza con el resultado que necesitas, da al modelo una dirección creativa clara y usa cada resultado para hacer más precisa la siguiente versión.

01

Elige el resultado

Elige Video o Imagen en el generador. El espacio de trabajo solo muestra las entradas y los ajustes compatibles con ese flujo.

02

Dirige el resultado

Describe el sujeto, el entorno, la composición, el estilo, la iluminación y el ambiente. Añade imágenes o videos de referencia cuando deban mantenerse constantes la identidad, el movimiento o la dirección artística.

03

Genera y perfecciona

Revisa los créditos necesarios, genera y compara el resultado guardado en tu biblioteca. Perfecciona el prompt o reutiliza el resultado más sólido como nueva referencia.

Abrir el generador

Respuestas útiles antes de tu primer proyecto con Flux 3.

Aprende cómo funcionan los prompts, las referencias, los modelos, los créditos y los resultados guardados antes de empezar a generar con Flux 3.

Abstract folded black and oxblood surfaces forming a cinematic stage for the future of FLUX 3

Qué viene después

Percibe. Predice. Actúa.

La frontera se extiende desde la edición interactiva de imágenes y videos hasta la simulación, el uso de computadoras y la IA física. El objetivo a largo plazo es unificar la predicción de percepción, acción y lenguaje en el mismo modelo.