
Grok Imagine 2.0対GPT Image 2:スコア・編集
Grok Imagine 2.0はArena両部門でGPT Image 2の次位だが、APIはまだ未公開。Elo差と領域編集、現在使えるモデルを解説します。
xAIは2026年8月7日にImagine Image 2.0を発表し、参考とした両Arena部門において、そのモデルが世界第2位にランキングされています。1位はOpenAIのGPT Image 2[1]です。これが見出しですが、Grok Imagine 2.0対GPT Image 2の比較では、ギャップが多くの人の想定位置にはないため、実際には見出しより興味深いのです。
Grok Imagine 2.0対GPT Image 2のどちらで構築するかを判断する際、ランキングはこのページで最も有用でない数字です。重要なのは、一方は今日APIから呼び出し可能で、もう一方はそうではないこと、そして両モデルが同じ作業の異なる半分に最適化されていることです。
Grok Imagine 2.0のArenaスコアが実際に意味すること
xAIが発表日に参考とした両リーダーボードで、Grok Imagine 2.0はText-to-Imageで1320(±12)、Image Editingで1439(±8)を獲得しました[1]。前世代のGrok Imagine Qualityは、同じ現在のボード上で1228と1390にいます。
これは生成で約+92 Elo、編集で+49です。これは丸め誤差ではなく、「肌がちょっと良く見える」というわけでもありません。この規模のジャンプは、通常、モデルがピクセルをどう描画するかではなく、指示をどう処理するかが変わったことを意味します。
ここに注釈があります。Grok Imagine 2.0はまだPreliminaryラベルを付けています。投票数が少ないからです。「強い初期配置」が正直な読みです。「世界第2位の画像モデル、確定」ではありません。少なくともまだ。今月書かれたGrok Imagine 2.0対GPT Image 2の判断は、定義上暫定的です。
人々を混乱させる部分
Grok Imagine 2.0は今日、公開APIを持っていません。xAIの発表は「API access is coming soon」という言葉で終わり、そこで止まります[1]。エンドポイントなし、パラメータ参照なし、日付なし。
一方、今日APIで利用可能なGrokの画像モデルがあり、それはこれではありません。grok-imagine-image-qualityは2026年5月から呼び出し可能です[2]。それは前世代で、上表の1228/1390行です。今週、Grok Imagine 2.0の動作を期待して統合を接続すると、Qualityの動作が得られ、その後、編集がデモより弱い理由を考えて午後を過ごします。
一方、GPT Image 2は今日呼び出し可能です。したがって、今後数週間の実際的な質問は、どのモデルが優れているかではありません。どのモデルを実際に呼び出せるかです。
Grok Imagine 2.0が本当に強い場所
両モデルはパイプライン内の同じスロットを競争していません。
GPT Image 2はOne-Shotの精度で勝ります。複雑な指示追従、テキストレンダリング、サブジェクト保持、無駄な再試行が少ない。Responses APIを通じて、会話を続け、それに対する高忠実度編集を行えます[3]。ワークフローが「1つの画像を正確に得た後、正確に修正する」場合、それがより強力なツールで、Arena配置がそれを支持します。
Grok Imagine 2.0はループで勝ります。Grok Imagine 2.0編集モデルが興味深い半分です:指し示す領域だけを変更する魔法の杖、正確な領域のセグメンテーション、透明度にサブジェクトをエクスポートする背景削除、1回の生成で最大5つの入力を受け入れるマルチリファレンス編集。
この最後の機能は過小評価されている機能です。すべてのジョブで一度に単一の参照画像(キャラクター、衣装、場所、照明、全体的な外観)を読み込む代わりに、5つの入力に分割し、どこから何を継承するかを正確に制御できます。
古い失敗モードはこれが修正するものです。良いフレームを生成し、1つの手が間違って見え、それを修正するために再生成し、今は顔、体、照明、構成がすべてドリフトしすぎています。領域スコープ編集は、既に承認した部分が修正を生き残ることを意味します。実際には、画像生成をスロットマシンを引くまで一つの全体フレームが着地するのではなく、レタッチパスを伴う写真撮影に近いものに変えます。
Smart Resizeは同じカテゴリに属します。9つの公開アスペクト比は1:2から2:1まで実行され、既存の構成をトリミングする代わりに、モデルは選択した比率のフレームを埋めます。2:3ポートレートは9:16垂直になり、新しいトリミングの外側にあったものを失いません。
誰も数えないビデオの隣接性
GPT Image 2はビデオを出力しません。Grok Imagineはビデオを出力し、両半分は互いに引き継ぐために構築されています。この隣接性はGrok Imagine 2.0対GPT Image 2機能表にはめったに現れず、いくつかのチームではこれが全体の質問を決定します。
Video 1.5は、Text-to-Video、Image-to-Video、最大7つの画像を使用したReference-to-Video、ネイティブ1080p、最大15秒のクリップ、同じパスで生成されたオーディオをカバーしています。6秒720p Fastの生成は40秒以上から約25秒に低下しました[4]。2026年8月2日現在、Image-to-Video Arenaボード上で3位に座っており、エラーバーが重複するトップグループ内にあります。
静止画の場合、わずか数秒の動きはしばしば十分です。視線がシフトする。肩が呼吸で上がる。風になびく髪。ゆっくりしたズームイン。出力がソーシャルに表示される場合、画像から短いクリップへの引き継ぎは、リーダーボード上の90 Eloより価値があります。
GeminiとKreaの隣に適応する方法
4つのモデル、4つの異なるジョブ:
| モデル | 最適な用途 |
|---|---|
| GPT Image 2 | 指示通りに1つの画像を正確に配置し、その後正確に編集する |
| Gemini / Nano Banana 2 | 世界知識、長コンテキスト、会話型マルチモーダル編集 |
| Krea 2 | 1つの正解を釘付けするのではなく、美的方向を探索する |
| Grok Imagine 2.0 | 生成、領域修正、1つのループで素早くアニメーション化 |
Gemini 3.1 Flash Imageは音声とビデオを入力として受け入れ、検索を通じてファクトチェックでき、最大4Kで生成します。複雑なシーンについて推論したり、長い会話全体で連続性を保つ必要があるモデルが必要な場合、ここがそれが前に出ます。
Krea 2は実行ではなく探索を中心に構築されています。スタイル参照、ムードボード、強度と複雑性スライダー、LoRA。固定ブリーフを実行するのではなく、一連の外観を見つけるのに適しています。
どれもランキングではありません。4つの異なる作業形式であり、リーダーボード位置だけで選択することは、チームが間違ったツールで終わる方法です。
私たちがまだ知らないこと
推測が多いため、明確に述べる価値があります。
xAIはより古いAuroraモデルを自動回帰画像生成モデルとして説明しました[5]。Grok Imagine 2.0について、アーキテクチャ、パラメータ数、トレーニング方法、任意のMoE構造は単に公開されていません。それが「Auroraと同じ自動回帰MoE」であること、または特定のDiTやVAEを使用することという主張は、推論が事実を装ったものです。
価格設定は同じ話です。何も公開されていません。モデル、または今後のAPIの場合も。今日Grok Imagine 2.0に対して1画像あたりのレートを引用している人は誰でも、それを発明しました。出力解像度上限とレート制限も開示されていません。
このヶ月のモデルを選択する
今すぐ本番環境で画像モデルが必要な場合、GPT Image 2がエンドポイントを持つもので、それが測定された両方のボードで最初です。それは簡単な呼び出しで、暫定的なEloの変化はそれを変更しません。
ワークフローが「生成、1つの領域を修正、セット全体でサブジェクトを一貫性を保つ、その後最良のフレームを短いクリップにプッシュ」のようなものに見える場合、Grok Imagine 2.0対GPT Image 2の決定は品質質問ではなく、ワークフロー質問になるのをやめます。実践的な動きは、今日の共有画像エンドポイントに対して出荷するモデルで構築し、Grok Imagine 2.0がオープンするときにモデルIDを交換することです。reAPIでは、これは移行ではなく1行の変更で、同じAPIキーは既にプラットフォーム上のすべてのモデル全体で機能します。
編集モデルが実際に変わるもの
ほとんどの画像APIは、編集を画像を受け入れるたまたま2番目のエンドポイントとして扱います。Grok Imagine 2.0はそれを、フレームを生成したのと同じシステムとして扱い、その区別はデモではなく失敗モードに表示されます。
レーベルが間違って読む製品ショットを取ります。生成のみのモデルでは、入力を書き直して再度ロールしますが、照明がシフトし、影が動き、反射が変わり、1つの方法ではなく5つの方法が異なる2つの画像を比較しています。領域スコープ編集により、ラベルを指します。他はすべてByte-for-byteですが、既に承認しました。
同じロジックがシリーズをカバーしています。Grok Imagine 2.0にキャラクター参照、場所参照、衣装参照を別々の入力として与え、朝、午後、室内のセットアップを通じて同じサブジェクトを実行できます。顔が短い間にドリフトしません。1つの参照画像がすべてを一度に運ぶことは、一貫性が通常崩れるところです。
背景削除は同じワークフローに適合します。透明度にサブジェクトをエクスポートすることはヘッドラインの機能ではありませんが、出力がレイアウトに直接進むかどうか、またはマスクツールを通じて最初にラウンドトリップが必要かどうかを決定するステップです。
この何もGrok Imagine 2.0を純粋な指示追従でGPT Image 2より優れたモデルにしません。Arenaの数字は別の方法を述べており、暫定的かどうか、同じ方向を指します。それが変わるのは、フレームを良い状態からアセット完成に到達するために消費する生成数、そしてそのコストは決してリーダーボードに表示されません。
References
- xAI. Imagine Image 2.0. Retrieved August 2026 from x.ai/news/grok-imagine-image-2
- xAI. Grok Imagine Quality Mode API. Retrieved August 2026 from x.ai/news/grok-imagine-quality-mode
- OpenAI. Image generation guide. Retrieved August 2026 from platform.openai.com/docs/guides/image-generation
- xAI. Grok Imagine Video 1.5. Retrieved August 2026 from x.ai/news/grok-imagine-video-1-5
- xAI. Grok Imagine API. Retrieved August 2026 from x.ai/news/grok-imagine-api
さらに詳しく
- reapi.ai/models/grok-imagine-image-2-0 — capabilities, comparison table and launch pricing for Grok Imagine 2.0
- reapi.ai/models/gpt-image-2 — the model you can call today
- reapi.ai/blog/grok-imagine-video-1-5-api — pricing and limits on the video side
他の記事

AI動画の自然な演技をビートシートで計画する
AI動画で信頼できる会話シーンを実装するビートシート、キャラクター状態定義、カメラプログレッション、プロンプトテンプレート、検証フロー、API実装例を学べます。


Seedance 2.5 無制限プランの算数を監査する
Seedance 2.5 無制限プランを公開条件で検証。モデル、期間、キュー、並行性、Durationから制限を確認し、従量課金と比較します。


Mammouth.aiの代替おすすめ5選|2026年比較
2026年のMammouth.ai代替を検討中ですか。Poe、Perplexity、OpenRouter、HuggingChat、reAPIの5つを、対応モデル・チャット以外の機能・アプリかAPIかという使い方の違いで比較します。
