Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Grok Imagine 模型对比:1.0 vs 1.5 vs 2.0
2026/08/10

Grok Imagine 模型对比:1.0 vs 1.5 vs 2.0

四个月推出三款 Grok Imagine 模型,分别应用于视频和图片。哪一个有 API、价格便宜,以及版本命名会让你浪费一下午的陷阱。

四个月内推出了三款 Grok Imagine 模型,在这些模型之间选择并不是选最新款的问题。每款 Grok Imagine 模型做的事情不同,其中一个根本无法从 API 调用,而版本号的命名方式让整个选择变得比实际需要复杂得多。

以下是简单版本。Grok Imagine 1.0 Video 和 Video 1.5 生成视频。Imagine Image 2.0 生成图片。版本号跨越两种不同的模态,所以"2.0 是 1.5 的升级"这种说法在重要的地方是错的。

每款 Grok Imagine 模型实际上是什么

发布日期模态在 reAPI 上
Grok Imagine 1.0 Video2026 年 5 月 7 日视频Live
Grok Imagine Video 1.52026 年 6 月 4 日视频Live
Imagine Image 2.02026 年 8 月 7 日图片Coming soon

陷阱就在中间这一列。逛 Grok Imagine 模型的人看到 2.0,就认为它取代了 1.5。它没有。如果你需要视频,1.5 是当前一代,2.0 对你没用。如果你需要图片,2.0 是你要的,但它还不能调用。

Video 1.5 是可用的视频模型

Video 1.5 支持文本生视频、图片生视频,以及最多七张参考图片的参考生视频。它生成原生 1080p、最长 15 秒的视频剪辑,以及与图像同步生成的音频,这意味着环境音、效果和对白已经同步,不需要事后合成。

速度也提升了。一个 6 秒 720p Fast 生成从超过 40 秒降到大约 25 秒[1]。根据 2026 年 8 月 2 日的 Image-to-Video Arena 排行榜,它排名第三,在一个领先组中,其误差条重叠,所以把这个组内的顺序当成噪声。

实际上,这是当静态图片需要变成几秒钟动画时你会选择的 Grok Imagine 模型。不是完整的表演,只是眼神转动、头发摇动、缓慢推进。

1.0 Video 还有什么用

Grok Imagine 1.0 Video 比 1.5 早一个月推出,仍然在 reAPI 上运行。它是更便宜的选项,而不是已弃用的版本。如果你的工作负载是高数量、短剪辑,而且你不需要 1080p、七张参考图或更快的周转,这个较老的 Grok Imagine 模型仍然值得选择。

坦诚的说法:1.5 在几乎所有方面都更好,运行 1.0 的原因是成本而不是能力。

这仍然是两种情况下的真实选择。第一种是批量生成,视频很短,会进一步剪切,而且永远不会离开竖屏信息流,所以 1080p 毫无用处。第二种是 A/B 测试,你在测试提示词或概念而不是制作最终稿,用便宜的 Grok Imagine 模型跑五十个变体比用昂贵的跑十五个更划算。一旦概念确定,用 1.5 重新渲染最终版本。

Image 2.0 是带版本号的不同产品

Imagine Image 2.0 在 2026 年 8 月 7 日作为 Grok 内的新质量模式推出[2]。根据 Arena 排行榜,xAI 说它在文本生图和图片编辑两方面都排名世界第二,只在 OpenAI 的 GPT Image 2 后面。这些分数仍然标有"初步"标签,因为投票数不多。

将它与普通文生图模型区分开的是编辑功能是内置的,而不是附加的。魔法棒只改变你指向的区域。分割选择精确的区域。背景移除可以透明度导出主体。多参考编辑最多接受五个输入在一次生成中,所以一个角色、一个位置和一个道具可以分别提供,而不是塞进一张参考图片。

有一个问题,这是大多数人搞错的地方。Image 2.0 没有公开 API。xAI 的公告以"API 访问即将推出"结尾,没有给出端点也没有给出日期。

浪费人一下午的命名冲突

API 上已经有一个 Grok 图片模型,但不是 2.0。grok-imagine-image-quality 自 2026 年 5 月起就可以调用[3]。它是上一代,在 Image 2.0 得分 1320 和 1439 的排行榜上得分 1228 和 1390。

所以如果你这周集成一个用于图片的 Grok Imagine 模型,你得到的是 Quality,不是 2.0。让 2.0 有趣的区域范围编辑和五参考合成都不在那个端点里。要么预算用于较旧的行为,要么等待。

按工作选择 Grok Imagine 模型

从输出开始反向考虑,而不是版本号。

视频,今天可用。 Video 1.5。原生 1080p,最长 15 秒,音频同步生成,七张参考图片。

视频,大量成本敏感。 1.0 Video。更旧、更便宜、仍然可用。

图片,今天可用。 不是 Grok Imagine 模型。使用有端点的东西,以后再切换。

图片,提前规划。 Image 2.0,等 API 开放。

最后一行值得现在就设计。reAPI 上的每个图片模型都说同一个异步请求格式,所以今天针对一个可用的模型构建,Image 2.0 上线时改模型 id 是单行编辑而不是迁移。同一个 API key 已经在整个平台上有效。

成本是版本号隐藏的部分

版本顺序意味着越新越贵,在这个系列中这不是可靠的。在视频方面,1.0 Video 和 Video 1.5 按秒计费,按分辨率缩放,所以它们之间的差距随视频长度拉大,而不是保持固定百分比。一个 15 秒 1080p 渲染和一个 4 秒 480p 渲染在商业上是不同的产品,即使是同一个 Grok Imagine 模型制作的。

这在你估算工作负载时很重要。团队经常在短 480p 测试剪辑上测试,因为质量选择较新的 Grok Imagine 模型,然后发现真实账单取决于他们实际出货的分辨率和时长。运行生产设置下的估算再提交前。

对于 Image 2.0,没有成本对话,因为还没发布费率。当它上线时,模型页上的定价表自动填充,credit 系统不变:你按完成的生成计费,失败的生成退款,credit 不过期。

最后一个实用笔记。因为平台上的每个模型共享一个 key 和一个异步请求格式,在生产中比较两个 Grok Imagine 模型选项很便宜。把同样的集成指向每个 id,运行同样的提示词,比较真实输出和真实费用而不是排行榜位置。这通常比在别人的提示词上测量的 Elo 差值是更好的信号。

没有发布什么

值得明确说明,因为猜测会当事实流传。

Image 2.0 的架构、参数数量和训练方法是未公开的。xAI 把较旧的 Aurora 模型称为自回归,但声称 2.0 采用这种设计的是推理,不是文档。Image 2.0 的定价也没有发布,无论是模型还是即将推出的 API。今天为它报的任何单图费率都是编造的。

系列的现状

版本号暗示一个阶梯。现实是两条产品线共享一个名字:视频在 1.0 和 1.5,图片在 2.0,加上第四个模型,grok-imagine-image-quality,静静地在 API 上服务图片流量,而 2.0 吸引注意力。

所以选择规则不是"取最高的数字"。从你需要的输出开始,检查那个 Grok Imagine 模型是否有你今天可以调用的端点,然后才比较质量。四个中的两个现在都不通过图片端点测试,其中一个通过回答一个你预期的较旧一代而静默失败。

对于视频工作,当前的 Grok Imagine 模型是 Video 1.5,它是实时的。对于图片工作,值得规划的 Grok Imagine 模型是 Image 2.0,它还不能调用。基于在线的东西构建,把模型 id 放在配置而不是硬编码,Image 2.0 开放的那一天你改一行而不是重写集成。

References

  1. xAI. Grok Imagine Video 1.5. Retrieved August 2026 from x.ai/news/grok-imagine-video-1-5
  2. xAI. Imagine Image 2.0. Retrieved August 2026 from x.ai/news/grok-imagine-image-2
  3. xAI. Grok Imagine Quality Mode API. Retrieved August 2026 from x.ai/news/grok-imagine-quality-mode

Further reading