A still-life vase and lake scene transforming into motion and an audio waveform, representing FLUX 3 multimodal generation

Flux 3: Tạo và chỉnh sửa hình ảnh, video bằng một mô hình AI đa phương thức.

Flux 3 giữ bản mô tả ở trung tâm khi hình thức đầu ra thay đổi. Tạo hình ảnh, chỉ đạo cảnh chuyển động, biến đổi phương tiện nguồn và đưa cùng ý đồ hình ảnh sang phiên bản tiếp theo mà không để lộ cơ chế nhà cung cấp bên dưới.

Mô tả video bạn muốn tạo, bao gồm chủ thể, hành động, chuyển động máy quay, phong cách và bầu không khí. Dùng @ để tham chiếu nội dung. Ví dụ: @image1 bắt chước tư thế, chuyển động từ @video1, phong cách âm thanh từ @audio1

Trí tuệ hình ảnh trong thế giới thực

Thế giới không bị chia thành các phương thức.

FLUX 3 là mô hình nền tảng đa phương thức học đồng thời từ hình ảnh, video và âm thanh. Mục tiêu không phải làm chủ từng tín hiệu riêng lẻ mà học biểu diễn về thế giới: vật thể liên kết ra sao, mọi thứ chuyển động thế nào và sự kiện phát ra âm thanh gì.

Mỗi phương thức là một phép chiếu chưa hoàn chỉnh của cùng một thực tại. Các giới hạn trở nên hữu ích hơn khi được học cùng nhau: âm thanh phải khớp va chạm, chuyển động phải tôn trọng khối lượng và tương lai phải nối tiếp quá khứ.

Hình ảnh tiết lộ cấu trúc

Quan hệ không gian, chất liệu, danh tính và bố cục tại một thời điểm cụ thể.

Video khôi phục thời gian

Động lực thời gian, quy luật vật lý, chuyển động, tính liên tục và điều có thể xảy ra tiếp theo.

Âm thanh tiết lộ nguyên nhân

Sự kiện cơ học, va chạm, kết cấu và quan hệ âm học mà thị giác không thể tự phát hiện.

Ngôn ngữ tạo định hướng

Mục tiêu, khái niệm trừu tượng, chỉ dẫn và mối liên hệ giữa nhận thức với ý định.

Xây dựng trên Self-Flow

Một mô hình. Nhiều khả năng.

Self-Flow là cách BFL căn chỉnh việc tạo và hiểu đa phương thức trong cùng một kiến trúc. FLUX 3 mở rộng cách tiếp cận đó bằng nhiều dữ liệu và năng lực tính toán hơn, đồng thời huấn luyện trên video, hình ảnh và âm thanh.

Kết quả là một nền tảng duy nhất có thể kết hợp các phương thức, đồng thời tạo hình ảnh và video có âm thanh, cũng như làm việc từ văn bản thuần túy hoặc tài liệu như hình ảnh và video.

One mechanical subject shown across four moments of motion

Video và âm thanh

Video

FLUX 3 có thể tạo nhiều loại video dài tối đa 20 giây trong một lần tạo. Mọi kết quả đều có âm thanh gốc.

A performance car moving through a rain-soaked city

Từ khung hình đầu tiên đến chuỗi nhiều cảnh quay.

01

Tạo video từ văn bản.

02

Chuyển hình ảnh thành video từ khung hình bắt đầu hoặc tài liệu hình ảnh tham chiếu.

03

Video thành video, đưa nhân vật hoặc yếu tố trung tâm sang cảnh mới.

04

Tiếp tục tạo video và âm thanh từ clip đầu vào.

05

Chuyển khung hình chính thành video để tạo chuyển tiếp có kiểm soát giữa các thời điểm xác định.

06

Đối thoại đa ngôn ngữ với âm thanh gốc được tạo tự nhiên.

07

Đa dạng tỷ lệ khung hình và phong cách hình ảnh vượt xa đầu ra điện ảnh thông thường.

08

Tự động xâu chuỗi các clip thành chuỗi dài hơn với nhiều cảnh quay.

09

Phong cách từ cảnh quay máy quay đời thường đến hoạt hình và điện ảnh.

10

Tạo kiểu chữ mạnh mẽ và thiết kế hoạt hình.

Đánh giá sơ bộ

Được ưu tiên trong các so sánh ban đầu.

Trong phân tích sơ bộ này, BFL đã tạo các clip văn bản thành video 10 giây, 720p có âm thanh. Mô hình và hệ thống đánh giá vẫn đang phát triển nên các con số này có thể thay đổi.

Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

BFL cho biết mô hình đặc biệt mạnh về biểu cảm khuôn mặt người, khớp âm thanh với sự kiện vật lý và tạo nội dung đa ngôn ngữ. Tài liệu hình ảnh tham chiếu giúp giữ nhân vật nhất quán khi các clip được nối thành chuỗi dài vài phút.

A collage of FLUX 3 image examples spanning product design, landscapes, painting, illustration, macro photography, and cinematic imagery

Tổng hợp và chỉnh sửa hình ảnh

Hình ảnh

FLUX 3 có thể tổng hợp và chỉnh sửa hình ảnh với nhiều phong cách, tỷ lệ khung hình và độ phân giải.

Xử lý prompt phức tạp tốt hơn các thế hệ FLUX trước.

Hiển thị văn bản độ chính xác cao bằng nhiều ngôn ngữ.

Phạm vi phong cách rộng cho cả tổng hợp và chỉnh sửa theo tài liệu tham chiếu.

Những phát hiện về hình ảnh này đến từ đánh giá sơ bộ giữa quá trình huấn luyện. BFL dự kiến sẽ cải thiện thêm trước khi phát hành.

Từ sáng tạo nội dung đến AI vật lý

Hành động

FLUX 3 mở rộng khả năng hiểu thế giới sang dự đoán hành động: không chỉ nhận biết cảnh mà còn học đủ về động lực của cảnh để dự đoán điều tiếp theo.

A production table arranged with reference images, equipment, and physical materials

Hai con đường đến hành động.

Dự đoán gốc

Tích hợp dự đoán hành động trực tiếp vào FLUX 3, mở rộng công việc Self-Flow ban đầu trong mô hình thống nhất.

Mô hình hành động chuyên biệt

Dùng nền tảng video được huấn luyện trước làm nền tảng hiểu động lực, sau đó tinh chỉnh bằng dữ liệu chuyên biệt giới hạn.

FLUX-mimic

Khi hợp tác với mimic robotics, BFL kết hợp nền tảng video FLUX 3 với chuyên môn học robot cho thao tác khéo léo và triển khai sản xuất. Sự hợp tác kết nối AI vật lý với sáng tạo nội dung qua cùng mô hình thế giới nền tảng và đang được thử nghiệm trong các nhiệm vụ sản xuất thực tế tại Audi.

Đọc luận đề FLUX-mimic

Kế hoạch ra mắt

Một nền tảng, phát hành theo từng giai đoạn.

BFL dự định triển khai từng khả năng sau khi thu thập phản hồi và kiểm thử an toàn. Mỗi bản phát hành đều dựa trên cùng nền tảng flow matching đa phương thức.

FLUX 3 Video

Tạo và chỉnh sửa video, âm thanh thông qua API và quyền truy cập trọng số riêng tư.

FLUX-mimic và FLUX 3 Action

Dự đoán hành động thông qua các đối tác nghiên cứu và thương mại được chọn, bắt đầu với mimic robotics.

FLUX 3 Image

Tổng hợp và chỉnh sửa hình ảnh thông qua API và quyền truy cập trọng số riêng tư.

FLUX 3 Dev

Truy cập trọng số mở của nền tảng đa phương thức cho dự đoán video, âm thanh, hình ảnh và hành động.

Cách sử dụng Flux 3

Từ ý tưởng đến sản phẩm hoàn chỉnh.

Bắt đầu với kết quả cần có, đưa cho mô hình định hướng sáng tạo rõ ràng và dùng mỗi kết quả để làm phiên bản tiếp theo chính xác hơn.

01

Chọn kết quả

Chọn Video hoặc Hình ảnh trong trình tạo. Không gian làm việc chỉ hiển thị đầu vào và cài đặt được quy trình đó hỗ trợ.

02

Định hướng kết quả

Mô tả chủ thể, bối cảnh, bố cục, phong cách, ánh sáng và tâm trạng. Thêm hình ảnh hoặc video tham chiếu khi cần giữ nhất quán danh tính, chuyển động hoặc chỉ đạo nghệ thuật.

03

Tạo và tinh chỉnh

Xem yêu cầu credit, tạo nội dung rồi so sánh kết quả đã lưu trong thư viện. Tinh chỉnh prompt hoặc dùng lại kết quả mạnh nhất làm tài liệu tham chiếu mới.

Mở trình tạo

Câu trả lời hữu ích trước dự án Flux 3 đầu tiên của bạn.

Tìm hiểu cách prompt, tài liệu tham chiếu, mô hình, credit và kết quả đã lưu hoạt động trước khi bắt đầu tạo với Flux 3.

Abstract folded black and oxblood surfaces forming a cinematic stage for the future of FLUX 3

Điều gì tiếp theo

Nhận biết. Dự đoán. Hành động.

Biên giới mở rộng từ chỉnh sửa hình ảnh, video tương tác đến mô phỏng, sử dụng máy tính và AI vật lý. Mục tiêu dài hạn là hợp nhất nhận thức, hành động và dự đoán ngôn ngữ trong cùng một mô hình.