A still-life vase and lake scene transforming into motion and an audio waveform, representing FLUX 3 multimodal generation

Flux 3: एक मल्टीमॉडल AI मॉडल से इमेज और वीडियो बनाएं व एडिट करें।

आउटपुट का रूप बदलते हुए भी Flux 3 ब्रीफ़ को केंद्र में रखता है। इमेज बनाएं, मूविंग शॉट निर्देशित करें, सोर्स मीडिया बदलें और नीचे की प्रोवाइडर मशीनरी दिखाए बिना वही विज़ुअल इरादा अगले वर्ज़न में ले जाएं।

जिस वीडियो को बनाना चाहते हैं उसका वर्णन करें, जिसमें विषय, एक्शन, कैमरा मूवमेंट, शैली और वातावरण शामिल हों। कंटेंट का रेफरेंस देने के लिए @ का उपयोग करें। उदाहरण: @image1 की मुद्रा, @video1 से मोशन, @audio1 से ऑडियो शैली

वास्तविक दुनिया की विज़ुअल इंटेलिजेंस

दुनिया मोडैलिटी में विभाजित नहीं है।

FLUX 3 एक मल्टीमॉडल फ़ाउंडेशन मॉडल है जो इमेज, वीडियो और ऑडियो से एक साथ सीखता है। लक्ष्य हर सिग्नल को अलग-अलग सीखना नहीं, बल्कि दुनिया का प्रतिनिधित्व सीखना है: ऑब्जेक्ट कैसे जुड़े रहते हैं, चीज़ें कैसे चलती हैं और घटनाएं कैसी सुनाई देती हैं।

हर मोडैलिटी उसी वास्तविकता का अधूरा प्रक्षेपण है। साथ में सीखने पर उनकी सीमाएं अधिक उपयोगी बनती हैं: साउंड प्रभाव से मेल खाए, मोशन द्रव्यमान का सम्मान करे और भविष्य अतीत से आगे बढ़े।

इमेज संरचना दिखाती हैं

किसी खास क्षण में स्थानिक संबंध, सामग्री, पहचान और कंपोज़िशन।

वीडियो समय लौटाता है

टेम्पोरल डायनेमिक्स, भौतिक नियम, मोशन, निरंतरता और आगे क्या हो सकता है।

ऑडियो कारण बताता है

मैकेनिकल घटनाएं, प्रभाव, टेक्सचर और ध्वनिक संबंध जिन्हें विज़न अकेले पहचान नहीं सकता।

भाषा दिशा देती है

लक्ष्य, अमूर्त धारणाएं, निर्देश और परसेप्शन व इरादे के बीच संबंध।

Self-Flow पर आधारित

एक मॉडल। कई क्षमताएं।

Self-Flow एक ही आर्किटेक्चर में मल्टीमॉडल जनरेशन और समझ को संरेखित करने का BFL का तरीका है। FLUX 3 अधिक कंप्यूट और डेटा के साथ इसे बढ़ाता है और वीडियो, इमेज व ऑडियो पर एक साथ ट्रेन होता है।

नतीजा एक ऐसा फाउंडेशन है जो मोडैलिटी मिला सकता है, ऑडियो के साथ इमेज और वीडियो बना सकता है और शुद्ध टेक्स्ट या इमेज व वीडियो जैसे रेफरेंस से काम कर सकता है।

One mechanical subject shown across four moments of motion

वीडियो और ऑडियो

वीडियो

FLUX 3 एक ही जनरेशन में 20 सेकंड तक के विविध वीडियो बना सकता है। हर आउटपुट में नेटिव ऑडियो शामिल है।

A performance car moving through a rain-soaked city

पहले फ़्रेम से मल्टी-शॉट सीक्वेंस तक।

01

टेक्स्ट-टू-वीडियो जनरेशन।

02

शुरुआती फ़्रेम या विज़ुअल रेफरेंस से इमेज-टू-वीडियो।

03

वीडियो-टू-वीडियो जो कैरेक्टर या केंद्रीय तत्व को नए सीन में ले जाता है।

04

इनपुट क्लिप से जनरेटिव वीडियो और ऑडियो कंटिन्यूएशन।

05

परिभाषित क्षणों के बीच नियंत्रित ट्रांज़िशन के लिए कीफ़्रेम-टू-वीडियो।

06

नेटिव ऑडियो जनरेशन के साथ बहुभाषी संवाद।

07

पारंपरिक सिनेमाई आउटपुट से आगे कई आस्पेक्ट रेशियो और विज़ुअल स्टाइल।

08

क्लिप को लंबी, मल्टी-शॉट सीक्वेंस में एजेंटिक तरीके से जोड़ें।

09

कैन्डिड कैमकॉर्डर फुटेज से लेकर एनिमेशन और सिनेमैटिक्स तक की शैलियां।

10

मजबूत टाइपोग्राफी जनरेशन और एनिमेटेड डिज़ाइन।

प्रारंभिक मूल्यांकन

शुरुआती तुलना में पसंदीदा।

इस शुरुआती विश्लेषण के लिए BFL ने ऑडियो वाले 10-सेकंड, 720p टेक्स्ट-टू-वीडियो क्लिप बनाए। मॉडल और मूल्यांकन सिस्टम अभी विकास में हैं, इसलिए ये आंकड़े बदल सकते हैं।

Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

BFL के अनुसार मॉडल मानव चेहरे के भाव, भौतिक घटनाओं से ध्वनि मिलाने और बहुभाषी जनरेशन में खास तौर पर मजबूत है। क्लिप को कई मिनट लंबी सीक्वेंस में जोड़ते समय विज़ुअल रेफरेंस कैरेक्टर को एक जैसा रखने में मदद करते हैं।

A collage of FLUX 3 image examples spanning product design, landscapes, painting, illustration, macro photography, and cinematic imagery

इमेज सिंथेसिस और एडिटिंग

इमेज

FLUX 3 कई स्टाइल, आस्पेक्ट रेशियो और रिज़ॉल्यूशन में इमेज सिंथेसाइज़ और एडिट कर सकता है।

पहली FLUX जनरेशन की तुलना में जटिल प्रॉम्प्ट को बेहतर तरीके से संभालता है।

कई भाषाओं में अत्यधिक सटीक टेक्स्ट रेंडरिंग।

सिंथेसिस और रेफरेंस-गाइडेड एडिटिंग दोनों के लिए व्यापक स्टाइल रेंज।

इमेज से जुड़े ये निष्कर्ष शुरुआती मिड-ट्रेनिंग मूल्यांकन से आए हैं। BFL रिलीज़ से पहले और सुधार की उम्मीद करता है।

कंटेंट क्रिएशन से फिजिकल AI तक

एक्शन

FLUX 3 दुनिया की समझ को एक्शन प्रेडिक्शन तक बढ़ाता है: यह केवल सीन को समझता नहीं, बल्कि उसकी डायनेमिक्स के बारे में इतना सीखता है कि अगला कदम क्या होना चाहिए, इसका अनुमान लगा सके।

A production table arranged with reference images, equipment, and physical materials

एक्शन के दो रास्ते।

नेटिव प्रेडिक्शन

एकीकृत मॉडल के भीतर शुरुआती Self-Flow काम को बढ़ाते हुए एक्शन प्रेडिक्शन को सीधे FLUX 3 में इंटीग्रेट करें।

विशेषीकृत एक्शन मॉडल

प्रीट्रेंड वीडियो बैकबोन को डायनेमिक्स-अवेयर फाउंडेशन के रूप में इस्तेमाल करें और सीमित टास्क-विशिष्ट डेटा से फाइन-ट्यून करें।

FLUX-mimic

mimic robotics के साथ काम करते हुए BFL ने FLUX 3 वीडियो बैकबोन को कुशल रोबोट मैनिपुलेशन और प्रोडक्शन डिप्लॉयमेंट के लिए रोबोट लर्निंग विशेषज्ञता से जोड़ा। यह सहयोग उसी वर्ल्ड मॉडल के ज़रिए फिजिकल AI और कंटेंट क्रिएशन को जोड़ता है और Audi में वास्तविक प्रोडक्शन टास्क पर परीक्षण किया जा रहा है।

FLUX-mimic थीसिस पढ़ें

लॉन्च प्लान

एक बैकबोन, चरणों में जारी।

BFL फीडबैक और सेफ़्टी टेस्टिंग के बाद हर क्षमता जारी करने की योजना बना रहा है। हर रिलीज़ उसी मल्टीमॉडल flow-matching आधार पर बनी है।

FLUX 3 Video

API और प्राइवेट वेट एक्सेस के ज़रिए वीडियो और ऑडियो जनरेशन व एडिटिंग।

FLUX-mimic और FLUX 3 Action

चुने हुए रिसर्च और कमर्शियल पार्टनर्स के साथ एक्शन प्रेडिक्शन, जिसकी शुरुआत mimic robotics से हो रही है।

FLUX 3 Image

API और प्राइवेट वेट एक्सेस के ज़रिए इमेज सिंथेसिस और एडिटिंग।

FLUX 3 Dev

वीडियो, ऑडियो, इमेज और एक्शन प्रेडिक्शन के लिए मल्टीमॉडल बैकबोन का ओपन-वेट एक्सेस।

Flux 3 का उपयोग कैसे करें

एक विचार से तैयार जनरेशन तक।

ज़रूरी आउटपुट से शुरू करें, मॉडल को स्पष्ट क्रिएटिव दिशा दें और हर परिणाम से अगला वर्ज़न अधिक सटीक बनाएं।

01

आउटपुट चुनें

जनरेटर में Video या Image चुनें। वर्कस्पेस केवल उस वर्कफ़्लो द्वारा समर्थित इनपुट और सेटिंग दिखाता है।

02

परिणाम को निर्देशित करें

विषय, सेटिंग, कंपोज़िशन, शैली, लाइटिंग और मूड का वर्णन करें। पहचान, मोशन या आर्ट डायरेक्शन एक जैसा रखना हो तो रेफरेंस इमेज या वीडियो जोड़ें।

03

जनरेट और रिफाइन करें

क्रेडिट आवश्यकता देखें, जनरेट करें और फिर लाइब्रेरी में सेव परिणाम की तुलना करें। प्रॉम्प्ट बेहतर करें या सबसे मजबूत आउटपुट को नए रेफरेंस के रूप में इस्तेमाल करें।

जनरेटर खोलें

अपने पहले Flux 3 प्रोजेक्ट से पहले उपयोगी जवाब।

Flux 3 से जनरेट शुरू करने से पहले जानें कि प्रॉम्प्ट, रेफरेंस, मॉडल, क्रेडिट और सेव किए गए परिणाम कैसे काम करते हैं।

Abstract folded black and oxblood surfaces forming a cinematic stage for the future of FLUX 3

आगे क्या आता है

समझें। अनुमान लगाएं। कार्रवाई करें।

यह सीमा इंटरैक्टिव इमेज और वीडियो एडिटिंग से सिमुलेशन, कंप्यूटर उपयोग और फिजिकल AI तक फैली है। दीर्घकालिक लक्ष्य एक ही मॉडल में परसेप्शन, एक्शन और भाषा प्रेडिक्शन को एक करना है।