01
出力形式を選ぶ
生成ツールで動画または画像を選びます。ワークスペースには、そのワークフローで対応している入力と設定だけが表示されます。

Flux 3は出力形式が変わっても、指示を制作の中心に保ちます。内部のプロバイダー構成を意識せず、画像を作成し、動画を演出し、元のメディアを変換して、同じビジュアル意図を次のバージョンへ引き継げます。
現実世界の視覚知能
FLUX 3は、画像、動画、音声を一体的に学習するマルチモーダル基盤モデルです。個々の信号を別々に習得するのではなく、物体がどのように成り立ち、物事がどう動き、出来事がどのように聞こえるかという世界の表現を学ぶことを目指しています。
各モダリティは、同じ現実を部分的に映したものにすぎません。それぞれの制約を一緒に学ぶことで、より有用になります。音は衝撃と一致し、動きは質量に従い、未来は過去から自然につながるべきだからです。
特定の瞬間における空間的な関係、素材、同一性、構図。
時間的な変化、物理法則、動き、連続性、そして次に起こり得ること。
視覚だけでは捉えられない機械的な出来事、衝撃、質感、音響的な関係。
目標、抽象概念、指示、そして知覚と意図のつながり。
Self-Flowを基盤に構築
Self-Flowは、マルチモーダルな生成と理解を同じアーキテクチャ内で整合させるBFLのアプローチです。FLUX 3は、はるかに多くの計算資源とデータを用い、動画、画像、音声を同時に学習することで、このアプローチを拡張しています。
その結果、モダリティを組み合わせ、画像と音声付き動画を一体的に生成し、テキストだけでも画像や動画などの参照素材からでも機能する、ひとつの基盤が実現します。

動画と音声
FLUX 3は、1回の生成で最大20秒の多彩な動画を作成できます。すべての出力にネイティブ音声が含まれます。

テキストから動画を生成。
開始フレームや視覚的な参照素材から画像を動画化。
キャラクターや中心となる要素を新しいシーンへ引き継ぐ動画変換。
入力クリップから動画と音声の続きを生成。
指定した瞬間の間を意図どおりに遷移させるキーフレーム動画生成。
ネイティブ音声生成による多言語の会話。
従来の映画的な出力にとどまらない、多彩なアスペクト比とビジュアルスタイル。
エージェントによってクリップをつなぎ、より長いマルチショットシーケンスを生成。
自然なビデオカメラ映像からアニメーション、映画的表現まで多彩なスタイル。
高品質なタイポグラフィ生成とアニメーションデザイン。
予備評価
この予備分析では、BFLが音声付きの10秒・720pテキスト動画クリップを生成しました。モデルと評価基盤は開発中のため、これらの数値は今後変わる見込みです。
BFLは、人間の表情、物理的な出来事と音の一致、多言語生成で特に高い性能を報告しています。視覚的な参照素材を使うことで、クリップを数分に及ぶシーケンスへつなぐ際もキャラクターの一貫性を保ちやすくなります。

画像の生成と編集
FLUX 3は、幅広いスタイル、アスペクト比、解像度で画像の生成と編集ができます。
従来のFLUX世代よりも複雑なプロンプトを的確に処理。
複数の言語で高精度なテキスト描画。
生成と参照素材に基づく編集の両方に対応する幅広いスタイル。
これらの画像に関する結果は、学習中に行われた予備評価に基づいています。BFLは公開までにさらなる改善を見込んでいます。
コンテンツ制作からフィジカルAIへ
FLUX 3は世界の理解をアクション予測へと拡張します。シーンを認識するだけでなく、そのダイナミクスを十分に学び、次に何が起こるべきかを予測します。

ネイティブ予測
アクション予測をFLUX 3へ直接統合し、初期のSelf-Flowの成果を統合モデル内で拡張します。
特化型アクションモデル
事前学習済みの動画基盤をダイナミクスを理解する土台として使い、限られたタスク固有データでファインチューニングします。
BFLはmimic roboticsと協力し、FLUX 3の動画基盤に、器用な操作と実運用に向けたロボット学習の専門知識を組み合わせました。この共同開発は、同じ基盤となる世界モデルを通じてフィジカルAIとコンテンツ制作を結び、Audiの実際の生産タスクでテストされています。
FLUX-mimicの論文を読む公開計画
BFLはフィードバックの収集と安全性テストを経て、各機能を順次公開する予定です。すべてのリリースは、同じマルチモーダルなフローマッチング基盤から構築されます。
APIと非公開のモデルウェイトへのアクセスを通じた動画・音声の生成と編集。
mimic roboticsを皮切りに、選定された研究・商業パートナーを通じてアクション予測を展開。
APIと非公開のモデルウェイトへのアクセスを通じた画像の生成と編集。
動画、音声、画像、アクション予測に対応するマルチモーダル基盤をオープンウェイトで提供。
Flux 3の使い方
必要な出力から始め、モデルに明確なクリエイティブの方向性を伝え、それぞれの結果を活用して次のバージョンの精度を高めます。
01
生成ツールで動画または画像を選びます。ワークスペースには、そのワークフローで対応している入力と設定だけが表示されます。
02
被写体、設定、構図、スタイル、照明、雰囲気を説明します。人物や物体の同一性、動き、アートディレクションを保つ必要がある場合は、参照画像や動画を追加してください。
03
必要なクレジット数を確認して生成し、ライブラリに保存された結果を比較します。プロンプトを調整するか、最も優れた出力を新しい参照素材として再利用してください。
Flux 3で生成を始める前に、プロンプト、参照素材、モデル、クレジット、保存された結果の仕組みを確認できます。

次に目指すもの
その可能性は、インタラクティブな画像・動画編集から、シミュレーション、コンピューター操作、フィジカルAIにまで広がります。長期的な目標は、知覚、行動、言語予測を同じモデル内に統合することです。