xAI
Grok Imagine 1.0 Video
起 $0.009 每秒
可以用这个模型构建并上线的真实工作流与生产级用例。

文字只是起点,不是全部指令。你可以给 FLUX 3 一张待动画化的首帧、几张锁定角色的参考图、一段希望把元素带入新场景的源片段,或者两个界定过渡起止的关键帧。FLUX 3 还能续写已有的视频及其音频,所以一个镜头可以被延长,而不必从头重新生成。
阅读 FLUX 3 文档
FLUX 3 支持多语言对白,并能在画面内渲染可读的文字,因此同一套创意方向可以在不同市场之间迁移。招牌、标题与动态排版是作为场景的一部分生成的,而不是事后合成上去的;配音也与画面一同产出——按照 Black Forest Labs 自己的早期评测,面部表情与多语言正是 FLUX 3 目前最强的部分。

同一套 FLUX 3 底座既能跨风格、跨比例、跨分辨率合成与编辑图像,也能把这些静态图延展成动态画面。产品图与视频之间,形状、颜色、材质与品牌标识保持可辨识——因为两者出自同一个模型,而不是把图像生成器和另一套视频生成器拼在一起。
FLUX 3 在统一架构中从图像、视频与音频中学习,架构基于 Black Forest Labs 提出的 Self-Flow——一种让多模态生成与理解相互对齐的方法。各模态彼此约束:声音必须匹配撞击,运动必须服从质量。
FLUX 3 的每一条视频输出都自带原生音频,来自同一次生成——对白、环境音与撞击声落在它们应该在的那一帧上,而不是事后再往无声画面上对时间轴。
FLUX 3 能把单次生成串联成时长达数分钟的多镜头序列,由视觉参考让角色与场景在镜头之间保持稳定。20 秒是单次生成的上限,不是成片的上限。
在 Black Forest Labs 自己的早期评测中,这两者是所有对比对象里最接近的一组——观众在 52% 的对比中更偏好 FLUX 3,基本等同于掷硬币。区别在于可用性与覆盖面:Seedance 2.0 现在就能在 reAPI 上调用,而 FLUX 3 是一个仍在分阶段推出的更宽的多模态底座。
对比反映撰写时公开可查的行为。52% 这一偏好数据来自 Black Forest Labs 自己的初步评测,测试对象为 10 秒 720p、带音频的文生视频片段,且 BFL 明确说明该模型仍在开发中;样本量与方法论均未公布,这不是独立基准测试。
关于此模型的常见疑问。