Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Gemini Omni vs Seedance 2.0:2026年動画モデル比較
2026/05/20

Gemini Omni vs Seedance 2.0:2026年動画モデル比較

2026年5月版Gemini Omni vs Seedance 2.0比較。Google I/Oの新モデルとArena首位モデルの機能、マルチショット、音声、料金を整理します。

Googleは2026年5月19日のI/OでGemini Omni Flashを公開しました。ByteDanceのSeedance 2.0は、2月からArtificial Analysis Video Arenaの首位を維持しています。いまGemini OmniとSeedance 2.0のどちらかを選ぶなら、Google初の推論・編集重視の動画モデルと、ベンチマーク上で市場最高の純粋な生成モデルを比べることになります。

両者の違いは、この分野の一般的な「X vs Y」比較より明確です。Seedance 2.0は1回の生成で、1080p、マルチショット、音声連動のクリップを返します。Gemini Omni Flashは10秒のクリップを作り、その後の会話で繰り返し編集します。以下では各社の公式ページとreAPIのライブ価格を基に、機能を1つずつ比較します。

要点

  • 公開時期。 Seedance 2.0は2026年2月12日に公開されました[5]。Gemini Omni Flashは2026年5月19日のGoogle I/Oで公開されました[1]
  • ベンチマーク差。 Seedance 2.0はArtificial Analysis Video Arenaで、テキストから動画がElo 1,269、画像から動画が1,351。両部門で#1です[6]。Gemini Omniは公開時点でランキングに入っていませんでした。
  • 最大解像度。 Gemini Omni Flashは720p、1080p、4Kに対応します[7]。Seedance 2.0もFaceでは4Kに対応し、Fast FaceとMiniは720pまでです[8]
  • 長さ。 Gemini Omni Flashは4、6、8、10秒を出力します[7]。Seedance 2.0は4〜15秒で、同じクリップ内に複数のカットを含められます[5]
  • 参照入力。 Gemini Omni Flashは0、1、3枚の画像入力に対応します[9]。Seedance 2.0は1リクエスト当たり最大9枚の画像 + 3本の動画 + 3本の音声を受け取ります[10]
  • 編集方式。 Gemini Omniは複数ターンの会話編集を中心に設計されています[1]。Seedance 2.0は豊富な参照素材を使う一括生成です。
  • 選び方。 最高の純粋な生成品質より、同じクリップの反復編集が重要ならGemini Omni。1回で完成したクリップを納品したいならSeedance 2.0です。

2つのモデルの出自

Seedance 2.0はByteDance Seedが2026年2月12日に公開しました[5]。実名の著名人を写実的に描いた動画が拡散し、その翌日にはDisneyがByteDanceへ停止通告書を送りました[11]。モデルは標準でC2PAウォーターマークを付けます。ByteDanceは、テキスト、画像、動画、音声を入力し、8+言語でネイティブ音声とリップシンク付き動画を生成する「統合マルチモーダル音声・動画共同生成アーキテクチャ」と説明しています。

Gemini Omni Flashは、2026年5月19日のGoogle I/Oで発表されたGoogle DeepMindの新シリーズ第1弾です。Sundar PichaiはGoogleのワールドモデル戦略の一部として、「AIはテキストの予測から現実のシミュレーションへ移行しています。Gemini Omniはその方向への次の一歩です」と説明しました[4]。Googleの製品ページによれば、GeminiアプリではGemini OmniがVeoを置き換えます[3]。出力にはSynthIDウォーターマークが付き、Geminiアプリ、Chrome、Google Searchで検証できます[1]

両モデルはreAPIのメディアRESTエンドポイントPOST /api/v1/videos/generationsで動きます。リクエスト本文のmodelフィールドを変えるだけで切り替えられ、ほかの基盤変更は不要です。

Gemini Omni vs Seedance 2.0の各仕様が意味すること

機能Gemini Omni FlashSeedance 2.0
テキストから動画対応対応
画像から動画(単一参照)対応(1参照)対応
画像から動画(複数参照)最大3(融合モード)最大9枚
開始・終了フレーム補間非対応対応(image_with_roles
参照動画非対応最大3本、合計≤15s[10]
参照音声公開時は音声参照のみ[1]最大3本、合計≤15s[10]
ネイティブ音声合成対応対応(共同生成、音素リップシンク)[5]
1出力内のマルチショット非対応対応、1生成内に複数カット[5]
複数ターンの会話編集対応[1]非対応
4K出力対応[7]Faceで対応[8]
長さ4 / 6 / 8 / 10s[7]任意の4–15s[10]
アスペクト比16:9、9:16[9]16:9、9:16、1:1、4:3、3:4、21:9、adaptive[10]
ウォーターマークSynthID(Google)[1]C2PA(標準で有効)[5]
アバター機能対応(公開時は消費者向けのみ)[1]非対応

選択をほぼ決めるのは2項目です。Seedance 2.0は1リクエストで9+3+3の参照素材を受け取れます。Gemini Omni Flashは0/1/3枚の画像参照と1つの音声参照です。「これが商品、これがブランドスタイルの動画、これがBGM。まとめて構成して」というパイプラインなら、Seedance 2.0はそのために作られています[10]。Gemini Omniはまだこの用途向けではありません。

もう1つは編集欄です。Gemini Omniの複数ターン会話編集に相当する機能はSeedanceにありません。「バイオリンを見えなくする。カメラをバイオリニストの肩越しに変更する。バイオリニストを画像内の環境へ移す」は、Googleブログに掲載された実際のプロンプト列です[1]。人物と場面の一貫性を保ちながら、各指示が前の結果を引き継ぎます。Seedance 2.0は1つのプロンプトと参照一式から1本を生成する方式です。

まだ埋められないベンチマーク差

Seedance 2.0はArtificial Analysis Video Arenaで#1です。テキストから動画はElo 1,269、画像から動画は1,351です[6]。同じArenaのVeo 3.1、Kling 3.0、Sora 2を両方で上回ります。

この記事の公開時、Gemini Omni Flashは登場から4日しか経っておらず、Googleも公開時にArenaへ投入していませんでした。初期の実機評価は割れています。TechCrunchは消費者向けデモを本当に印象的だと評価する一方、I/Oでは複数の機能が動かなかったと指摘しました[4]。公開翌日の独立評価では、純粋な生成品質は総合的にSeedance 2.0へ「及ばない」が、Omniの文字描画、物理直感、会話編集は新しい領域を開いたとされました。Omni Flashに十分なArena票が集まるまで、正直な結論は1つです。検証済みの純粋な品質ではSeedance 2.0が首位。Gemini Omni Flashは、実用化された中で最も新しい編集インターフェースです。

同じプロンプトをGemini Omni FlashとSeedance 2.0で実行した比較です。Eloの数字を信じる前に、純粋な品質差を自分の目で確かめてください。

購入をベンチマークEloで決めるなら、現時点ではSeedance 2.0です。一方、最高の1フレームより反復的な改善が重要な製品では、Elo差は適切な比較軸ではありません。

会話で編集するか、最初にすべてを構成するか

Gemini Omniの見出しは会話です。Googleの製品ページは「Gemini Omniなら、会話をするように簡単に動画を作れる」と明言しています[3]。ブログには、バイオリニストの動画を4つの連続プロンプトで改善する例があります。人物は一貫し、物理関係を保ち、場面は以前の状態を記憶します[1]。これが「Nano Banana for video」という訴求で、2026年の他モデルが直接競っていない部分です。

Gemini Omni FlashはGeminiの世界知識を使い、1プロンプトの生成を現実に沿わせます。この推論段階が、Omniの出力と純粋な拡散モデルの実行を分けます。

Seedance 2.0は逆の考え方です。最初にすべてを構成します。テキスト + 9枚の画像 + 3本の参照動画 + 3本の参照音声を一度に渡し、1つの一貫した結果へ融合します[10]。ByteDanceの設計は、利用者が仕様と素材を持ち、やり取りなしで完成品を求める前提です。参照パイプライン自体が編集画面です。違う結果が必要なら、参照を変えて再送信します。

ブランド動画や商品広告では、Seedance 2.0の事前構成方式が既存のクリエイティブブリーフに合います。SNSでの実験、ファン編集、または初稿を見るまで欲しいものが決まらない制作では、Gemini Omniの会話ループが優位です。

2種類の「multi」

両モデルとも「multi」を差別化に使いますが、意味は異なります。

Seedance 2.0の「multi」は1回の生成内のマルチショットです。1本の15秒出力に複数のカットとトランジションが含まれ、編集済みの絵コンテのようになります[5]。場面の進行をプロンプトに書くと、カット込みの1本を出力します。VeoやGemini Omniなら3-to-4回必要な処理が1回で済みます。

Gemini Omniの「multi」は1ショットを複数ターンで改善することです。会話指示のたびに、文脈を失わず既存クリップを作り直します[1]。ショット数は増えず、同じショットの完成度が上がります。ターンごとに費用は加算されますが、一貫性こそが目的です。同じ場面を5ターン改善することと、5つの別場面を作ることは別の製品です。

両方が必要なパイプラインもあります。Seedance 2.0のマルチショットで絵コンテを作り、個別の場面をGemini Omniのマルチターンで改善します。両モデルが1つのエンドポイントにあれば、ベンダー移行ではなく30行の変更で実現できます。

音声付き720p / 1080p / 4Kの料金計算

Seedance 2.0は秒単位、Gemini Omni Flashは生成単位なので、クリップの長さで比較結果が変わります。次の表は、同じ出力仕様に対するreAPI上の最安の実行方法です。

出力仕様Gemini Omni Flash(生成単位)Seedance 2.0の最安公開ルート(ソース動画なし)
5s 720p 音声付きn/a(Omniは4 / 6 / 8 / 10)$0.410(Mini)[8]
6s 720p 音声付き$0.204[7]$0.492(Mini)[8]
8s 1080p 音声付き$0.216[7]$3.060(Face)[8]
10s 1080p 音声付き$0.240[7]$3.825(Face)[8]
10s 4K 音声付き$0.480[7]$7.800(Face)[8]

注目点は2つです。第一に、同じ解像度帯ではGemini Omni Flashの生成単価は長さによって少ししか変わりません。720p/1080pでは4sが$0.18、10sが$0.24です[7]。Seedance 2.0は秒数に比例するため、長いほど同解像度でOmniの価格優位が広がります。第二に、Seedance 2.0で低い料金になるのは実際のソース動画がある場合だけです。画像、先頭・末尾フレーム、音声は基本料金のままで、ソース動画を使う場合は出力時間にソース動画の合計時間(秒単位に切り上げ)が加算されます[8]。この表はソース動画なしの料金です。

この表の料金では、音声付き6秒1080pならreAPI上ではGemini Omni Flashが安価です。10秒を超えるマルチショット絵コンテや、参照動画と音声を組み込む出力は、2モデルではSeedance 2.0だけが対応します。

実際にどちらを選ぶべきか

Gemini Omni Flashを選ぶ場合:

  • 同じクリップを反復し、最初から生成し直さず複数ターンで編集したい
  • 4K出力が重要
  • 10秒上限で用途を満たせる(BrichtovaはTechCrunchに、これはモデル限界ではなく製品判断だと説明[4]
  • 生成単位の固定価格で費用を予測したい
  • アバター生成を使いたい(現在は消費者向け、APIは今後提供[1]

Seedance 2.0を選ぶ場合:

  • 反復せず、1回の呼び出しで完成したクリップを納品する
  • 1本の15秒マルチショット絵コンテで3-to-4回の呼び出しを置き換えたい
  • 参照動画、参照音声、または両方を生成へ入力する
  • 英語以外のリップシンク会話が必須
  • 21:9超横長やその他の非標準比率が必要
  • 購入者がArena Eloを重視する

常に優れた一方はありません。出力仕様とチームの反復方法が分かって初めて、Gemini Omni vs Seedance 2.0の答えが出ます。

よくある質問

Gemini OmniはVeo 3.1のアップグレードですか?

Googleの製品ページでは、Geminiアプリ内でGemini OmniがVeoを置き換えるとされています[3]。Veo 3.1はVertex AI、Gemini API、アグリゲーターで引き続き利用できます。消費者向け(Geminiアプリ、Flow、YouTube Shorts)ではOmni Flashが新しい標準です。

Seedance 2.0は無料ですか?

APIでは無料ではありません。Seedance 2.0を提供するすべてのプロバイダーで有料モデルです。ByteDanceの消費者向け製品(Dreamina、CapCut)は無料枠に一部のSeedance 2.0利用枠を含みますが、APIからは使えません。

Gemini Omni FlashはSeedance 2.0のようなマルチショットに対応しますか?

いいえ。Gemini Omni Flashは最大10秒の単一連続ショットを出力します[7]。1クリップ内のマルチショットはSeedance 2.0の機能です[5]。Gemini Omniで絵コンテを作るには各ショットを別々に生成するか、複数ターン会話編集で1ショットを段階的に改善します。

同じエンドポイントで両方を使えますか?

はい。両モデルは同じリクエスト形式でreAPIのPOST /api/v1/videos/generationsを使います。modelgemini-omniからdoubao-seedance-2.0-faceへ変更し、互換性のないフィールドを調整します(Omniのimage_urlsは0/1/3件、Seedanceは最大9件。Omniにはvideo_urlsaudio_urlsがありません)。

物理表現が優れているのはどちらですか?

両社とも物理的なリアリズムを訴求しています。GoogleブログはOmniについて「重力、運動エネルギー、流体力学などの力を直感的に理解する能力が向上した」と説明します[1]。ByteDanceのSeedance 2.0論文は複雑な動きと物理的相互作用を扱います。物理表現が投票を左右しやすいArtificial Analysis Arenaの画像から動画Eloでは、Seedance 2.0が現在1,351で全モデルを上回ります[6]。Omni Flashに十分な票が集まるまで、「物理ではSeedanceが先行」が検証済みの立場です。

Hollywoodの知的財産リスクは?

Seedance 2.0には実際のリスクがあります。ByteDanceは学習データへの懸念を理由に、2026年2月13日にDisneyから停止通告書を受け取りました[11]。権利のないスタジオ作品の人物、映画、スタイルを指定しないでください。Gemini Omni Flashの出力にはSynthID、Seedance 2.0にはC2PAウォーターマークが付き、派生作品を後から検出できます。

Gemini Omni APIはいつ公開されますか?

Googleは5月19日の公開後「数週間以内」に開発者・企業向けAPIを提供すると発表しました[4]。reAPIは公開時から標準動画エンドポイントでGemini Omniを提供したため、Googleの直接APIを待たずに呼び出せます。リクエスト形式はGemini Omniドキュメント、ライブ価格はモデルページを参照してください。

1つのパイプラインで両方を振り分ける

2026年にAI動画を納品する多くのチームにとって、Gemini Omni vs Seedance 2.0は一度だけの選択ではなく、リクエストごとのルーティングです。Seedance 2.0は1回で仕上げる出力、複数参照の構成、1クリップ内のマルチショット絵コンテを担当します。Gemini Omni Flashは低コストの4K、1080p音声付きクリップ、会話で反復する作業を担当します。両方が1つのメディアエンドポイントにあれば、ベンダー移行ではなく30行の設定変更です。

1モデルだけを選ぶなら、検証済みのArena首位を根拠に、現在有料顧客へ納品する商用出力にはSeedance 2.0を選びます。初稿より第2稿が重要なパイプラインにはGemini Omni Flashを選び、次のベンチマークで品質問題を判断します。Gemini Omni vs Seedance 2.0は、2026年の動画分野で「1つを選んで使い続ける」ことが明確に誤りとなる最も分かりやすい例です。

参考資料

  1. Google。Gemini Omniの紹介。 Koray Kavukcuoglu、2026年5月19日。2026年5月にblog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omniから取得
  2. Google DeepMind。Gemini Omni — モデルページ。 2026年5月にdeepmind.google/models/gemini-omniから取得
  3. Google。Gemini Omni — 動画生成概要。 2026年5月にgemini.google/overview/video-generationから取得
  4. Rebecca Bellan。GoogleのGemini Omniは画像、音声、テキストを動画へ変換する — それは始まりにすぎない。 TechCrunch、2026年5月19日。techcrunch.com/2026/05/19/googles-gemini-omni-turns-images-audio-and-text-into-video-and-thats-just-the-start
  5. ByteDance Seed。Seedance 2.0正式公開。 2026年2月12日。seed.bytedance.com/en/blog/official-launch-of-seedance-2-0
  6. Artificial Analysis。Video Arenaランキング。 2026年5月にartificialanalysis.ai/video/arenaから取得
  7. reAPI。Gemini Omni — モデルページ(ライブ価格)。 2026年5月にreapi.ai/models/gemini-omniから取得
  8. reAPI。Seedance 2.0 — モデルページ(ライブ価格)。 2026年5月にreapi.ai/models/seedance-2-0から取得
  9. reAPI。Gemini Omni — APIリファレンス。 2026年5月にreapi.ai/docs/gemini-omniから取得
  10. reAPI。Seedance 2.0 — APIリファレンス。 2026年5月にreapi.ai/docs/seedance-2-0から取得
  11. Wikipedia contributors。Seedance 2.0。 2026年5月にen.wikipedia.org/wiki/Seedance_2.0から取得

関連記事