xAI
Grok Imagine 1.0 Video
〜から $0.009 1秒あたり
このモデルで構築して本番に出せる、実際のワークフローとユースケースをご紹介します。

テキストは出発点であって、指示のすべてではありません。FLUX 3 には、アニメーション化する最初のフレーム、キャラクターを固定する参照画像、要素を新しいシーンへ引き継ぐ元クリップ、あるいは遷移の始点と終点を定義する2つのキーフレームを渡せます。既存の動画とその音声を継続することもできるため、ショットを一から作り直さずに延長できます。
FLUX 3 のドキュメントを読む
FLUX 3 は多言語の対話を扱い、フレーム内に読めるテキストを描画するため、1つのクリエイティブの方向性を市場間で持ち回せます。看板、タイトル、アニメーションタイポグラフィはシーンの一部として生成され、後から合成されるわけではありません。音声トラックも映像と同時に生成されます。表情の描写と多言語性能は、Black Forest Labs 自身の初期評価でも FLUX 3 がすでに特に強い領域とされています。

同じ FLUX 3 のバックボーンが、スタイル・アスペクト比・解像度をまたいで画像を生成・編集し、その静止画を動きへと展開します。形状、色、素材感、ブランド表現はパックショットとクリップの間で判別可能なまま保たれます。両方が1つのモデルから出てくるからで、静止画生成器に別の動画生成器を継ぎ足しているわけではありません。
FLUX 3 は、マルチモーダルの生成と理解を揃えるための Black Forest Labs の手法 Self-Flow を土台に、統一アーキテクチャの中で画像・動画・音声から学習します。モダリティは互いを制約します。音は衝撃に一致しなければならず、動きは質量に従わなければなりません。
FLUX 3 の動画出力にはすべて、同じ生成から生まれたネイティブ音声が付きます。セリフ、環境音、衝撃音は本来あるべきフレームに落ち、無音の映像に後からタイミングを合わせる必要がありません。
FLUX 3 は個々の生成を数分に及ぶマルチショットのシーケンスへ連鎖させ、視覚参照がシーンをまたいでキャラクターやロケーションを安定させます。20秒は1回の生成の上限であって、完成作品の上限ではありません。
Black Forest Labs 自身の初期評価では、比較対象の中でこの2つが最も接近しました。視聴者が FLUX 3 を選んだのは52%で、実質的にコイントスです。違いは提供状況と守備範囲にあります。Seedance 2.0 は今すぐ reAPI で呼び出せますが、FLUX 3 は段階的公開の途中にある、より広いマルチモーダル基盤です。
この比較は執筆時点で公開されている挙動に基づきます。52%という選好の数値は Black Forest Labs 自身による予備評価(10秒・720p・音声付きのテキスト動画生成)のもので、同社はそのモデルをまだ開発中と説明しています。サンプル数や評価手法は公開されておらず、独立したベンチマークではありません。
このモデルに関するよくある質問。