A still-life vase and lake scene transforming into motion and an audio waveform, representing FLUX 3 multimodal generation

Flux 3:ひとつのマルチモーダルAIモデルで画像と動画を生成・編集。

Flux 3は出力形式が変わっても、指示を制作の中心に保ちます。内部のプロバイダー構成を意識せず、画像を作成し、動画を演出し、元のメディアを変換して、同じビジュアル意図を次のバージョンへ引き継げます。

作成したい動画について、被写体、動き、カメラワーク、スタイル、雰囲気を含めて説明してください。 @ を使ってコンテンツを参照します。例: @image1 のポーズをまねる、@video1 のモーション、@audio1 の音声スタイル

現実世界の視覚知能

世界はモダリティごとに分かれてはいない。

FLUX 3は、画像、動画、音声を一体的に学習するマルチモーダル基盤モデルです。個々の信号を別々に習得するのではなく、物体がどのように成り立ち、物事がどう動き、出来事がどのように聞こえるかという世界の表現を学ぶことを目指しています。

各モダリティは、同じ現実を部分的に映したものにすぎません。それぞれの制約を一緒に学ぶことで、より有用になります。音は衝撃と一致し、動きは質量に従い、未来は過去から自然につながるべきだからです。

画像が構造を明らかにする

特定の瞬間における空間的な関係、素材、同一性、構図。

動画が時間を取り戻す

時間的な変化、物理法則、動き、連続性、そして次に起こり得ること。

音声が原因を明らかにする

視覚だけでは捉えられない機械的な出来事、衝撃、質感、音響的な関係。

言語が方向性を与える

目標、抽象概念、指示、そして知覚と意図のつながり。

Self-Flowを基盤に構築

ひとつのモデルに、複数の機能。

Self-Flowは、マルチモーダルな生成と理解を同じアーキテクチャ内で整合させるBFLのアプローチです。FLUX 3は、はるかに多くの計算資源とデータを用い、動画、画像、音声を同時に学習することで、このアプローチを拡張しています。

その結果、モダリティを組み合わせ、画像と音声付き動画を一体的に生成し、テキストだけでも画像や動画などの参照素材からでも機能する、ひとつの基盤が実現します。

One mechanical subject shown across four moments of motion

動画と音声

動画

FLUX 3は、1回の生成で最大20秒の多彩な動画を作成できます。すべての出力にネイティブ音声が含まれます。

A performance car moving through a rain-soaked city

最初のフレームからマルチショットシーケンスまで。

01

テキストから動画を生成。

02

開始フレームや視覚的な参照素材から画像を動画化。

03

キャラクターや中心となる要素を新しいシーンへ引き継ぐ動画変換。

04

入力クリップから動画と音声の続きを生成。

05

指定した瞬間の間を意図どおりに遷移させるキーフレーム動画生成。

06

ネイティブ音声生成による多言語の会話。

07

従来の映画的な出力にとどまらない、多彩なアスペクト比とビジュアルスタイル。

08

エージェントによってクリップをつなぎ、より長いマルチショットシーケンスを生成。

09

自然なビデオカメラ映像からアニメーション、映画的表現まで多彩なスタイル。

10

高品質なタイポグラフィ生成とアニメーションデザイン。

予備評価

初期比較で高く評価。

この予備分析では、BFLが音声付きの10秒・720pテキスト動画クリップを生成しました。モデルと評価基盤は開発中のため、これらの数値は今後変わる見込みです。

Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

BFLは、人間の表情、物理的な出来事と音の一致、多言語生成で特に高い性能を報告しています。視覚的な参照素材を使うことで、クリップを数分に及ぶシーケンスへつなぐ際もキャラクターの一貫性を保ちやすくなります。

A collage of FLUX 3 image examples spanning product design, landscapes, painting, illustration, macro photography, and cinematic imagery

画像の生成と編集

画像

FLUX 3は、幅広いスタイル、アスペクト比、解像度で画像の生成と編集ができます。

従来のFLUX世代よりも複雑なプロンプトを的確に処理。

複数の言語で高精度なテキスト描画。

生成と参照素材に基づく編集の両方に対応する幅広いスタイル。

これらの画像に関する結果は、学習中に行われた予備評価に基づいています。BFLは公開までにさらなる改善を見込んでいます。

コンテンツ制作からフィジカルAIへ

アクション

FLUX 3は世界の理解をアクション予測へと拡張します。シーンを認識するだけでなく、そのダイナミクスを十分に学び、次に何が起こるべきかを予測します。

A production table arranged with reference images, equipment, and physical materials

アクションへ至る2つの道。

ネイティブ予測

アクション予測をFLUX 3へ直接統合し、初期のSelf-Flowの成果を統合モデル内で拡張します。

特化型アクションモデル

事前学習済みの動画基盤をダイナミクスを理解する土台として使い、限られたタスク固有データでファインチューニングします。

FLUX-mimic

BFLはmimic roboticsと協力し、FLUX 3の動画基盤に、器用な操作と実運用に向けたロボット学習の専門知識を組み合わせました。この共同開発は、同じ基盤となる世界モデルを通じてフィジカルAIとコンテンツ制作を結び、Audiの実際の生産タスクでテストされています。

FLUX-mimicの論文を読む

公開計画

ひとつの基盤を段階的に公開。

BFLはフィードバックの収集と安全性テストを経て、各機能を順次公開する予定です。すべてのリリースは、同じマルチモーダルなフローマッチング基盤から構築されます。

FLUX 3 Video

APIと非公開のモデルウェイトへのアクセスを通じた動画・音声の生成と編集。

FLUX-mimicとFLUX 3 Action

mimic roboticsを皮切りに、選定された研究・商業パートナーを通じてアクション予測を展開。

FLUX 3 Image

APIと非公開のモデルウェイトへのアクセスを通じた画像の生成と編集。

FLUX 3 Dev

動画、音声、画像、アクション予測に対応するマルチモーダル基盤をオープンウェイトで提供。

Flux 3の使い方

アイデアから完成した生成結果まで。

必要な出力から始め、モデルに明確なクリエイティブの方向性を伝え、それぞれの結果を活用して次のバージョンの精度を高めます。

01

出力形式を選ぶ

生成ツールで動画または画像を選びます。ワークスペースには、そのワークフローで対応している入力と設定だけが表示されます。

02

仕上がりを指示する

被写体、設定、構図、スタイル、照明、雰囲気を説明します。人物や物体の同一性、動き、アートディレクションを保つ必要がある場合は、参照画像や動画を追加してください。

03

生成して洗練する

必要なクレジット数を確認して生成し、ライブラリに保存された結果を比較します。プロンプトを調整するか、最も優れた出力を新しい参照素材として再利用してください。

生成ツールを開く

初めてFlux 3を使う前に役立つ回答。

Flux 3で生成を始める前に、プロンプト、参照素材、モデル、クレジット、保存された結果の仕組みを確認できます。

Abstract folded black and oxblood surfaces forming a cinematic stage for the future of FLUX 3

次に目指すもの

知覚する。予測する。行動する。

その可能性は、インタラクティブな画像・動画編集から、シミュレーション、コンピューター操作、フィジカルAIにまで広がります。長期的な目標は、知覚、行動、言語予測を同じモデル内に統合することです。