01
आउटपुट चुनें
जनरेटर में Video या Image चुनें। वर्कस्पेस केवल उस वर्कफ़्लो द्वारा समर्थित इनपुट और सेटिंग दिखाता है।

आउटपुट का रूप बदलते हुए भी Flux 3 ब्रीफ़ को केंद्र में रखता है। इमेज बनाएं, मूविंग शॉट निर्देशित करें, सोर्स मीडिया बदलें और नीचे की प्रोवाइडर मशीनरी दिखाए बिना वही विज़ुअल इरादा अगले वर्ज़न में ले जाएं।
वास्तविक दुनिया की विज़ुअल इंटेलिजेंस
FLUX 3 एक मल्टीमॉडल फ़ाउंडेशन मॉडल है जो इमेज, वीडियो और ऑडियो से एक साथ सीखता है। लक्ष्य हर सिग्नल को अलग-अलग सीखना नहीं, बल्कि दुनिया का प्रतिनिधित्व सीखना है: ऑब्जेक्ट कैसे जुड़े रहते हैं, चीज़ें कैसे चलती हैं और घटनाएं कैसी सुनाई देती हैं।
हर मोडैलिटी उसी वास्तविकता का अधूरा प्रक्षेपण है। साथ में सीखने पर उनकी सीमाएं अधिक उपयोगी बनती हैं: साउंड प्रभाव से मेल खाए, मोशन द्रव्यमान का सम्मान करे और भविष्य अतीत से आगे बढ़े।
किसी खास क्षण में स्थानिक संबंध, सामग्री, पहचान और कंपोज़िशन।
टेम्पोरल डायनेमिक्स, भौतिक नियम, मोशन, निरंतरता और आगे क्या हो सकता है।
मैकेनिकल घटनाएं, प्रभाव, टेक्सचर और ध्वनिक संबंध जिन्हें विज़न अकेले पहचान नहीं सकता।
लक्ष्य, अमूर्त धारणाएं, निर्देश और परसेप्शन व इरादे के बीच संबंध।
Self-Flow पर आधारित
Self-Flow एक ही आर्किटेक्चर में मल्टीमॉडल जनरेशन और समझ को संरेखित करने का BFL का तरीका है। FLUX 3 अधिक कंप्यूट और डेटा के साथ इसे बढ़ाता है और वीडियो, इमेज व ऑडियो पर एक साथ ट्रेन होता है।
नतीजा एक ऐसा फाउंडेशन है जो मोडैलिटी मिला सकता है, ऑडियो के साथ इमेज और वीडियो बना सकता है और शुद्ध टेक्स्ट या इमेज व वीडियो जैसे रेफरेंस से काम कर सकता है।

वीडियो और ऑडियो
FLUX 3 एक ही जनरेशन में 20 सेकंड तक के विविध वीडियो बना सकता है। हर आउटपुट में नेटिव ऑडियो शामिल है।

टेक्स्ट-टू-वीडियो जनरेशन।
शुरुआती फ़्रेम या विज़ुअल रेफरेंस से इमेज-टू-वीडियो।
वीडियो-टू-वीडियो जो कैरेक्टर या केंद्रीय तत्व को नए सीन में ले जाता है।
इनपुट क्लिप से जनरेटिव वीडियो और ऑडियो कंटिन्यूएशन।
परिभाषित क्षणों के बीच नियंत्रित ट्रांज़िशन के लिए कीफ़्रेम-टू-वीडियो।
नेटिव ऑडियो जनरेशन के साथ बहुभाषी संवाद।
पारंपरिक सिनेमाई आउटपुट से आगे कई आस्पेक्ट रेशियो और विज़ुअल स्टाइल।
क्लिप को लंबी, मल्टी-शॉट सीक्वेंस में एजेंटिक तरीके से जोड़ें।
कैन्डिड कैमकॉर्डर फुटेज से लेकर एनिमेशन और सिनेमैटिक्स तक की शैलियां।
मजबूत टाइपोग्राफी जनरेशन और एनिमेटेड डिज़ाइन।
प्रारंभिक मूल्यांकन
इस शुरुआती विश्लेषण के लिए BFL ने ऑडियो वाले 10-सेकंड, 720p टेक्स्ट-टू-वीडियो क्लिप बनाए। मॉडल और मूल्यांकन सिस्टम अभी विकास में हैं, इसलिए ये आंकड़े बदल सकते हैं।
BFL के अनुसार मॉडल मानव चेहरे के भाव, भौतिक घटनाओं से ध्वनि मिलाने और बहुभाषी जनरेशन में खास तौर पर मजबूत है। क्लिप को कई मिनट लंबी सीक्वेंस में जोड़ते समय विज़ुअल रेफरेंस कैरेक्टर को एक जैसा रखने में मदद करते हैं।

इमेज सिंथेसिस और एडिटिंग
FLUX 3 कई स्टाइल, आस्पेक्ट रेशियो और रिज़ॉल्यूशन में इमेज सिंथेसाइज़ और एडिट कर सकता है।
पहली FLUX जनरेशन की तुलना में जटिल प्रॉम्प्ट को बेहतर तरीके से संभालता है।
कई भाषाओं में अत्यधिक सटीक टेक्स्ट रेंडरिंग।
सिंथेसिस और रेफरेंस-गाइडेड एडिटिंग दोनों के लिए व्यापक स्टाइल रेंज।
इमेज से जुड़े ये निष्कर्ष शुरुआती मिड-ट्रेनिंग मूल्यांकन से आए हैं। BFL रिलीज़ से पहले और सुधार की उम्मीद करता है।
कंटेंट क्रिएशन से फिजिकल AI तक
FLUX 3 दुनिया की समझ को एक्शन प्रेडिक्शन तक बढ़ाता है: यह केवल सीन को समझता नहीं, बल्कि उसकी डायनेमिक्स के बारे में इतना सीखता है कि अगला कदम क्या होना चाहिए, इसका अनुमान लगा सके।

नेटिव प्रेडिक्शन
एकीकृत मॉडल के भीतर शुरुआती Self-Flow काम को बढ़ाते हुए एक्शन प्रेडिक्शन को सीधे FLUX 3 में इंटीग्रेट करें।
विशेषीकृत एक्शन मॉडल
प्रीट्रेंड वीडियो बैकबोन को डायनेमिक्स-अवेयर फाउंडेशन के रूप में इस्तेमाल करें और सीमित टास्क-विशिष्ट डेटा से फाइन-ट्यून करें।
mimic robotics के साथ काम करते हुए BFL ने FLUX 3 वीडियो बैकबोन को कुशल रोबोट मैनिपुलेशन और प्रोडक्शन डिप्लॉयमेंट के लिए रोबोट लर्निंग विशेषज्ञता से जोड़ा। यह सहयोग उसी वर्ल्ड मॉडल के ज़रिए फिजिकल AI और कंटेंट क्रिएशन को जोड़ता है और Audi में वास्तविक प्रोडक्शन टास्क पर परीक्षण किया जा रहा है।
FLUX-mimic थीसिस पढ़ेंलॉन्च प्लान
BFL फीडबैक और सेफ़्टी टेस्टिंग के बाद हर क्षमता जारी करने की योजना बना रहा है। हर रिलीज़ उसी मल्टीमॉडल flow-matching आधार पर बनी है।
API और प्राइवेट वेट एक्सेस के ज़रिए वीडियो और ऑडियो जनरेशन व एडिटिंग।
चुने हुए रिसर्च और कमर्शियल पार्टनर्स के साथ एक्शन प्रेडिक्शन, जिसकी शुरुआत mimic robotics से हो रही है।
API और प्राइवेट वेट एक्सेस के ज़रिए इमेज सिंथेसिस और एडिटिंग।
वीडियो, ऑडियो, इमेज और एक्शन प्रेडिक्शन के लिए मल्टीमॉडल बैकबोन का ओपन-वेट एक्सेस।
Flux 3 का उपयोग कैसे करें
ज़रूरी आउटपुट से शुरू करें, मॉडल को स्पष्ट क्रिएटिव दिशा दें और हर परिणाम से अगला वर्ज़न अधिक सटीक बनाएं।
01
जनरेटर में Video या Image चुनें। वर्कस्पेस केवल उस वर्कफ़्लो द्वारा समर्थित इनपुट और सेटिंग दिखाता है।
02
विषय, सेटिंग, कंपोज़िशन, शैली, लाइटिंग और मूड का वर्णन करें। पहचान, मोशन या आर्ट डायरेक्शन एक जैसा रखना हो तो रेफरेंस इमेज या वीडियो जोड़ें।
03
क्रेडिट आवश्यकता देखें, जनरेट करें और फिर लाइब्रेरी में सेव परिणाम की तुलना करें। प्रॉम्प्ट बेहतर करें या सबसे मजबूत आउटपुट को नए रेफरेंस के रूप में इस्तेमाल करें।
Flux 3 से जनरेट शुरू करने से पहले जानें कि प्रॉम्प्ट, रेफरेंस, मॉडल, क्रेडिट और सेव किए गए परिणाम कैसे काम करते हैं।

आगे क्या आता है
यह सीमा इंटरैक्टिव इमेज और वीडियो एडिटिंग से सिमुलेशन, कंप्यूटर उपयोग और फिजिकल AI तक फैली है। दीर्घकालिक लक्ष्य एक ही मॉडल में परसेप्शन, एक्शन और भाषा प्रेडिक्शन को एक करना है।