01
Elige el resultado
Elige Video o Imagen en el generador. El espacio de trabajo solo muestra las entradas y los ajustes compatibles con ese flujo.

Flux 3 mantiene el brief en el centro mientras cambia la forma del resultado. Crea una imagen, dirige una toma en movimiento, transforma contenido de origen y lleva la misma intención visual a la siguiente versión sin mostrar la maquinaria del proveedor.
Inteligencia visual del mundo real
FLUX 3 es un modelo fundacional multimodal que aprende conjuntamente de imágenes, video y audio. El objetivo no es dominar cada señal por separado, sino aprender una representación del mundo: cómo se mantienen unidos los objetos, cómo se mueven las cosas y cómo suenan los eventos.
Cada modalidad es una proyección incompleta de la misma realidad. Sus limitaciones resultan más útiles cuando se aprenden juntas: el sonido debe coincidir con el impacto, el movimiento debe respetar la masa y el futuro debe seguir al pasado.
Relaciones espaciales, materiales, identidad y composición en un momento concreto.
Dinámica temporal, leyes físicas, movimiento, continuidad y lo que puede ocurrir después.
Eventos mecánicos, impactos, texturas y relaciones acústicas que la visión no puede detectar por sí sola.
Objetivos, abstracciones, instrucciones y el vínculo entre percepción e intención.
Basado en Self-Flow
Self-Flow es el enfoque de BFL para alinear la generación y la comprensión multimodales dentro de una misma arquitectura. FLUX 3 amplía ese enfoque con muchos más recursos de cómputo y datos, entrenándose simultáneamente con video, imágenes y audio.
El resultado es una única base capaz de combinar modalidades, generar imágenes y video con audio conjuntamente y trabajar tanto con texto puro como con referencias de imagen y video.

Video y audio
FLUX 3 puede generar videos diversos de hasta 20 segundos en una sola generación. Cada resultado incluye audio nativo.

Generación de texto a video.
De imagen a video a partir de un fotograma inicial o referencias visuales.
De video a video, llevando un personaje o elemento central a una nueva escena.
Continuación generativa de video y audio a partir de un clip de entrada.
De fotogramas clave a video para transiciones controladas entre momentos definidos.
Diálogo multilingüe con generación de audio nativa.
Una amplia variedad de relaciones de aspecto y estilos visuales más allá de la estética cinematográfica convencional.
Encadenamiento autónomo de clips para crear secuencias más largas y con varias tomas.
Estilos que van desde metraje espontáneo de videocámara hasta animación y cinematografía.
Generación tipográfica sólida y diseños animados.
Evaluación preliminar
Para este análisis preliminar, BFL generó clips de texto a video de 10 segundos y 720p con audio. El modelo y el sistema de evaluación siguen en desarrollo, por lo que estas cifras pueden cambiar.
BFL destaca especialmente en expresiones faciales humanas, sincronización de sonidos con eventos físicos y generación multilingüe. Las referencias visuales pueden ayudar a mantener la coherencia de los personajes al encadenar clips en secuencias de varios minutos.

Síntesis y edición de imágenes
FLUX 3 puede sintetizar y editar imágenes en una amplia variedad de estilos, relaciones de aspecto y resoluciones.
Mejor manejo de prompts complejos que las generaciones anteriores de FLUX.
Renderizado de texto de alta precisión en varios idiomas.
Amplio rango estilístico tanto para síntesis como para edición guiada por referencias.
Estos hallazgos sobre imágenes proceden de evaluaciones preliminares durante el entrenamiento. BFL espera mejoras adicionales antes del lanzamiento.
De la creación de contenido a la IA física
FLUX 3 amplía la comprensión del mundo hacia la predicción de acciones: no solo percibe una escena, sino que aprende lo suficiente sobre su dinámica para predecir qué debería ocurrir después.

Predicción nativa
Integra la predicción de acciones directamente en FLUX 3 y amplía el trabajo inicial de Self-Flow dentro del modelo unificado.
Modelos de acción especializados
Usa la arquitectura de video preentrenada como base consciente de la dinámica y luego ajústala con datos específicos de tarea limitados.
En colaboración con mimic robotics, BFL combinó la arquitectura de video FLUX 3 con experiencia en aprendizaje robótico para manipulación precisa y despliegue en producción. La colaboración conecta la IA física y la creación de contenido mediante el mismo modelo del mundo subyacente y se está probando en tareas reales de producción en Audi.
Leer la tesis de FLUX-mimicPlan de lanzamiento
BFL planea implementar cada capacidad después de recopilar comentarios y realizar pruebas de seguridad. Cada lanzamiento se basa en la misma arquitectura multimodal de flow matching.
Generación y edición de video y audio mediante APIs y acceso privado a los pesos del modelo.
Predicción de acciones mediante socios de investigación y comerciales seleccionados, empezando por mimic robotics.
Síntesis y edición de imágenes mediante APIs y acceso privado a los pesos del modelo.
Acceso a pesos abiertos de una arquitectura multimodal para predicción de video, audio, imágenes y acciones.
Cómo usar Flux 3
Empieza con el resultado que necesitas, da al modelo una dirección creativa clara y usa cada resultado para hacer más precisa la siguiente versión.
01
Elige Video o Imagen en el generador. El espacio de trabajo solo muestra las entradas y los ajustes compatibles con ese flujo.
02
Describe el sujeto, el entorno, la composición, el estilo, la iluminación y el ambiente. Añade imágenes o videos de referencia cuando deban mantenerse constantes la identidad, el movimiento o la dirección artística.
03
Revisa los créditos necesarios, genera y compara el resultado guardado en tu biblioteca. Perfecciona el prompt o reutiliza el resultado más sólido como nueva referencia.
Aprende cómo funcionan los prompts, las referencias, los modelos, los créditos y los resultados guardados antes de empezar a generar con Flux 3.

Qué viene después
La frontera se extiende desde la edición interactiva de imágenes y videos hasta la simulación, el uso de computadoras y la IA física. El objetivo a largo plazo es unificar la predicción de percepción, acción y lenguaje en el mismo modelo.