01
Chọn kết quả
Chọn Video hoặc Hình ảnh trong trình tạo. Không gian làm việc chỉ hiển thị đầu vào và cài đặt được quy trình đó hỗ trợ.

Flux 3 giữ bản mô tả ở trung tâm khi hình thức đầu ra thay đổi. Tạo hình ảnh, chỉ đạo cảnh chuyển động, biến đổi phương tiện nguồn và đưa cùng ý đồ hình ảnh sang phiên bản tiếp theo mà không để lộ cơ chế nhà cung cấp bên dưới.
Trí tuệ hình ảnh trong thế giới thực
FLUX 3 là mô hình nền tảng đa phương thức học đồng thời từ hình ảnh, video và âm thanh. Mục tiêu không phải làm chủ từng tín hiệu riêng lẻ mà học biểu diễn về thế giới: vật thể liên kết ra sao, mọi thứ chuyển động thế nào và sự kiện phát ra âm thanh gì.
Mỗi phương thức là một phép chiếu chưa hoàn chỉnh của cùng một thực tại. Các giới hạn trở nên hữu ích hơn khi được học cùng nhau: âm thanh phải khớp va chạm, chuyển động phải tôn trọng khối lượng và tương lai phải nối tiếp quá khứ.
Quan hệ không gian, chất liệu, danh tính và bố cục tại một thời điểm cụ thể.
Động lực thời gian, quy luật vật lý, chuyển động, tính liên tục và điều có thể xảy ra tiếp theo.
Sự kiện cơ học, va chạm, kết cấu và quan hệ âm học mà thị giác không thể tự phát hiện.
Mục tiêu, khái niệm trừu tượng, chỉ dẫn và mối liên hệ giữa nhận thức với ý định.
Xây dựng trên Self-Flow
Self-Flow là cách BFL căn chỉnh việc tạo và hiểu đa phương thức trong cùng một kiến trúc. FLUX 3 mở rộng cách tiếp cận đó bằng nhiều dữ liệu và năng lực tính toán hơn, đồng thời huấn luyện trên video, hình ảnh và âm thanh.
Kết quả là một nền tảng duy nhất có thể kết hợp các phương thức, đồng thời tạo hình ảnh và video có âm thanh, cũng như làm việc từ văn bản thuần túy hoặc tài liệu như hình ảnh và video.

Video và âm thanh
FLUX 3 có thể tạo nhiều loại video dài tối đa 20 giây trong một lần tạo. Mọi kết quả đều có âm thanh gốc.

Tạo video từ văn bản.
Chuyển hình ảnh thành video từ khung hình bắt đầu hoặc tài liệu hình ảnh tham chiếu.
Video thành video, đưa nhân vật hoặc yếu tố trung tâm sang cảnh mới.
Tiếp tục tạo video và âm thanh từ clip đầu vào.
Chuyển khung hình chính thành video để tạo chuyển tiếp có kiểm soát giữa các thời điểm xác định.
Đối thoại đa ngôn ngữ với âm thanh gốc được tạo tự nhiên.
Đa dạng tỷ lệ khung hình và phong cách hình ảnh vượt xa đầu ra điện ảnh thông thường.
Tự động xâu chuỗi các clip thành chuỗi dài hơn với nhiều cảnh quay.
Phong cách từ cảnh quay máy quay đời thường đến hoạt hình và điện ảnh.
Tạo kiểu chữ mạnh mẽ và thiết kế hoạt hình.
Đánh giá sơ bộ
Trong phân tích sơ bộ này, BFL đã tạo các clip văn bản thành video 10 giây, 720p có âm thanh. Mô hình và hệ thống đánh giá vẫn đang phát triển nên các con số này có thể thay đổi.
BFL cho biết mô hình đặc biệt mạnh về biểu cảm khuôn mặt người, khớp âm thanh với sự kiện vật lý và tạo nội dung đa ngôn ngữ. Tài liệu hình ảnh tham chiếu giúp giữ nhân vật nhất quán khi các clip được nối thành chuỗi dài vài phút.

Tổng hợp và chỉnh sửa hình ảnh
FLUX 3 có thể tổng hợp và chỉnh sửa hình ảnh với nhiều phong cách, tỷ lệ khung hình và độ phân giải.
Xử lý prompt phức tạp tốt hơn các thế hệ FLUX trước.
Hiển thị văn bản độ chính xác cao bằng nhiều ngôn ngữ.
Phạm vi phong cách rộng cho cả tổng hợp và chỉnh sửa theo tài liệu tham chiếu.
Những phát hiện về hình ảnh này đến từ đánh giá sơ bộ giữa quá trình huấn luyện. BFL dự kiến sẽ cải thiện thêm trước khi phát hành.
Từ sáng tạo nội dung đến AI vật lý
FLUX 3 mở rộng khả năng hiểu thế giới sang dự đoán hành động: không chỉ nhận biết cảnh mà còn học đủ về động lực của cảnh để dự đoán điều tiếp theo.

Dự đoán gốc
Tích hợp dự đoán hành động trực tiếp vào FLUX 3, mở rộng công việc Self-Flow ban đầu trong mô hình thống nhất.
Mô hình hành động chuyên biệt
Dùng nền tảng video được huấn luyện trước làm nền tảng hiểu động lực, sau đó tinh chỉnh bằng dữ liệu chuyên biệt giới hạn.
Khi hợp tác với mimic robotics, BFL kết hợp nền tảng video FLUX 3 với chuyên môn học robot cho thao tác khéo léo và triển khai sản xuất. Sự hợp tác kết nối AI vật lý với sáng tạo nội dung qua cùng mô hình thế giới nền tảng và đang được thử nghiệm trong các nhiệm vụ sản xuất thực tế tại Audi.
Đọc luận đề FLUX-mimicKế hoạch ra mắt
BFL dự định triển khai từng khả năng sau khi thu thập phản hồi và kiểm thử an toàn. Mỗi bản phát hành đều dựa trên cùng nền tảng flow matching đa phương thức.
Tạo và chỉnh sửa video, âm thanh thông qua API và quyền truy cập trọng số riêng tư.
Dự đoán hành động thông qua các đối tác nghiên cứu và thương mại được chọn, bắt đầu với mimic robotics.
Tổng hợp và chỉnh sửa hình ảnh thông qua API và quyền truy cập trọng số riêng tư.
Truy cập trọng số mở của nền tảng đa phương thức cho dự đoán video, âm thanh, hình ảnh và hành động.
Cách sử dụng Flux 3
Bắt đầu với kết quả cần có, đưa cho mô hình định hướng sáng tạo rõ ràng và dùng mỗi kết quả để làm phiên bản tiếp theo chính xác hơn.
01
Chọn Video hoặc Hình ảnh trong trình tạo. Không gian làm việc chỉ hiển thị đầu vào và cài đặt được quy trình đó hỗ trợ.
02
Mô tả chủ thể, bối cảnh, bố cục, phong cách, ánh sáng và tâm trạng. Thêm hình ảnh hoặc video tham chiếu khi cần giữ nhất quán danh tính, chuyển động hoặc chỉ đạo nghệ thuật.
03
Xem yêu cầu credit, tạo nội dung rồi so sánh kết quả đã lưu trong thư viện. Tinh chỉnh prompt hoặc dùng lại kết quả mạnh nhất làm tài liệu tham chiếu mới.
Tìm hiểu cách prompt, tài liệu tham chiếu, mô hình, credit và kết quả đã lưu hoạt động trước khi bắt đầu tạo với Flux 3.

Điều gì tiếp theo
Biên giới mở rộng từ chỉnh sửa hình ảnh, video tương tác đến mô phỏng, sử dụng máy tính và AI vật lý. Mục tiêu dài hạn là hợp nhất nhận thức, hành động và dự đoán ngôn ngữ trong cùng một mô hình.