
FLUX 3 Image 编辑指南:参考图与边界框用法
用有序参考图和边界框提示词引导 FLUX 3 Image 编辑。了解坐标顺序、布局表与编辑表的区别,以及生成后如何检查修改和未修改区域。
FLUX 3 Image 最多接受十张参考图,但有用的编辑应从一个更具体的问题开始:图片的哪一部分需要改变?Black Forest Labs 同时提供了指令式编辑文档和布局格式文档;后者为各元素命名、指定边界框,并区分原位置与目标位置。[1][2]
本指南说明如何选择这些方法、在提示词中写入边界框数据,以及检查结果。下列示例是说明性的提示词模板,并非报告实际生成结果。当前 reAPI 控制项和价格见 FLUX 3 Image 模型页,请求契约见 API 文档。
要点速览
- 只需明确修改一个物体时,先使用一张参考图和具体指令。普通图像编辑不必手动提供边界框。[1]
- 参考图顺序很重要:
ref_image_0指第一张,ref_image_1指第二张。给每张参考图指定明确用途。[2] - 将画面描述与元素表一起放进
prompt。边界框不是独立的顶层请求参数。[2] - 坐标采用归一化的 0–1000 网格,顺序为
[top, left, bottom, right],并非图片像素坐标。[2] - 将边界框视为位置指令。BFL 说明它们不是裁切蒙版,未修改像素仍须检查。[2]
从能明确描述的变化开始 FLUX 3 Image 编辑
处理单张图片时,写出能识别物体与目标效果的指令。BFL 编辑指南建议精确命名元素,让指令只匹配一个对象。模型能扩展指令,并为许多编辑推断边界框,因此不必每次请求都提供完整元素表。[1]
假设产品照片中有一只奶油色马克杯,放在木桌上。初始提示词可以是:
Change the cream ceramic mug beside the closed notebook to a deep teal glaze.
Keep the mug's handle shape, the notebook, the wooden table, the camera angle,
and the soft light from the left unchanged.这样既指定了可识别的修改主体,也定义了之后需要检查的部分。如果有两只杯子,说明要修改哪只。如果杯柄必须可见,也应明确写出。泛泛要求“改善照片”,会把这些决定留给模型。
对于 FLUX 3 Image,我们建议先尝试最小、描述清楚的编辑。当位置有歧义、出现多个相似物体,或构图本身需要改变时,再补充明确边界框。这是一种编辑策略,并不表示某种提示词总能成功。
为每张参考图指定一项用途
FLUX 3 Image 支持最多十张参考图。BFL 说明可按位置称呼它们,如“Image 1”,也可使用从 ref_image_0 开始的索引标识符。编辑请求采用 auto 时,第一张参考图也决定输出宽高比。[1][2]
房间概念图的参考用途可以如下分配:
| 参考图 | 提示词中的用途 | 结果中需要检查的内容 |
|---|---|---|
Image 1 / ref_image_0 | 房间与相机视角 | 窗户位置与房间取景 |
Image 2 / ref_image_1 | 放在窗边的椅子 | 椅子形状、面料与朝向 |
Image 3 / ref_image_2 | 靠垫图案 | 图案在靠垫上的位置 |
示例指令:“将 Image 1 用作房间。把 Image 2 中的椅子放在窗边。用 Image 3 的图案添加一个靠垫。保持相机视角和房间现有家具不变。”
将参考图顺序保存在任务记录中。在提示词不变时重新排列输入,会改变各用途对应的图片。需求只要两张图时,填满十个位置也没有多少价值。真正有用的限制,是能否清楚说明每张参考图贡献什么。
在 reAPI 的 FLUX 3 Image 请求中,通过 image_urls 提供参考图 URL。FLUX 3 Image API 参考说明接受的 URL 和请求限制;提示词标识符仍从零开始计数。
将布局数据写入提示词
FLUX 3 Image 使用画面描述加元素 JSON 数组。新构图中的每个元素包含 id、bbox 和 desc。在描述中用尖括号引用对应 id,再将表追加到同一个提示词字符串。[2]
以下方形布局示例将马克杯放在左侧,笔记本放在右侧:
A quiet overhead product photograph of a teal mug <mug_1> and a closed
cream notebook <notebook_1> on a pale wooden desk <desk_1>.
[
{"id":"desk_1","bbox":[0,0,1000,1000],"desc":"A pale wooden desk in soft daylight."},
{"id":"mug_1","bbox":[300,120,760,450],"desc":"One teal ceramic mug with its handle visible."},
{"id":"notebook_1","bbox":[230,540,820,900],"desc":"A closed cream notebook without lettering."}
]这些数字描述相对位置。[0,0,500,500] 是图片左上四分之一区域。改变分辨率不会让这些值变成像素。改变宽高比时,坐标网格也随画幅拉伸,因此应使用设计布局时采用的同一比例。[2]
在代码中创建请求时,将数组序列化并追加到描述后面。这样不必手工转义嵌套 JSON 中的每个引号。不要因为提示词含有边界框数据,就另外发送 bbox 字段。
编辑需要源框和目标框
编辑比新布局需要更多信息:元素来自哪里,以及最后应放在哪里。FLUX 3 Image 编辑格式用 from、src_bbox 和 tgt_bbox 表达这些信息。[2]
| 目标操作 | from | src_bbox | tgt_bbox |
|---|---|---|---|
| 保持元素原位 | 参考图 id | 当前边界框 | 相同边界框 |
| 移动元素或调整大小 | 参考图 id | 当前边界框 | 不同边界框 |
| 添加、替换或改色 | null | null | 目标边界框 |
| 删除元素 | 参考图 id | 当前边界框 | null |
例如,移动马克杯的记录可以是:
{
"id": "mug_1",
"from": "ref_image_0",
"src_bbox": [300, 120, 760, 450],
"tgt_bbox": [300, 200, 760, 530],
"desc": "The teal ceramic mug with the same shape and visible handle."
}配套指令应说明马克杯向右移动,而笔记本和桌面保持不变。为必须留在原位的元素添加保留记录,这些记录采用相同的源坐标与目标坐标。
改色时,BFL 文档使用新增记录模式:from: null、src_bbox: null,加上描述目标外观的目标框。删除时保留源参考图与源框,将目标框设为 null,文字指令中也说明删除。指令与表应保持一致。[2]
示例坐标属于上面的假设布局。复用前先测量自己的图片;即使 JSON 对象合法,也可能指向错误物体。
按实际需求选择分辨率和 grounding
FLUX 3 Image 有五个分辨率档位:768sq、1k、1.5k、2k 和 4k,默认 1k。Grounding 默认开启,允许在生成前进行网页与图片搜索;设为 false 会禁用这一步搜索。[3]
这些控制回答不同问题。分辨率选择输出档位。Grounding 决定模型能否从提示词和已提供输入之外查找辅助信息。虚构的影棚构图可能适合关闭 grounding。需求涉及真实主体或当前视觉参考时,应判断搜索是否有用,并继续核实结果。
BFL 将 FLUX 3 Image 描述为支持原生 2K 和 4K 生成,但更大的输出并不能证明小范围编辑保留了人脸、标签或纹理。按交付尺寸检查关键区域。选择最终档位前,查看当前 FLUX 3 Image 价格,不要把旧费率复制进工作流。[4]
像检查修改一样认真检查未修改区域
BFL 边界框文档中最有用的限定是:框引导位置和大小,不会将元素裁切到硬性蒙版内。其删除示例说编辑框外的像素通常保持相同。这意味着需要对比输出,并不是普遍保证零偏移。[2]
在马克杯示例中,应检查杯柄、笔记本边缘、桌面纹理和阴影边界。需要多次编辑时,保留已认可的源图,将每个结果与它对比。即使新构图很漂亮,也可能不符合“原笔记本保持不变”的需求。
简单的审核记录可包含输入顺序、提示词、元素表、宽高比、分辨率,以及简短的接受或拒绝说明。连续编辑时,保留此前已接受的图片。这是建议的审核流程;本文不声称测得重试率或编辑准确率。
FLUX 3 Image 编辑常见问题
不用边界框也能编辑图片吗?
可以。发送参考图和文字指令即可。BFL 提供直接编辑文档,并说明模型能为许多编辑推断元素框。需要明确位置指令时,再自行提供框。[1]
最多可以使用多少张参考图?
十张。说明每张图提供什么,并保留顺序。第一张是 ref_image_0,普通语言中称为“Image 1”。[1]
边界框按像素测量吗?
不是。它们采用 0 到 1000 的归一化整数,顺序为 [top,left,bottom,right]。无论输出分辨率如何,框都覆盖画幅中对应比例的区域。[2]
图生图会保留原宽高比吗?
编辑请求设为 aspect_ratio: "auto" 时,第一张参考图决定宽高比。输出需要另一种形状时,选择明确比例,并按该形状设计布局框。[1]
框外能保证像素级精确保留吗?
不要这样假定。BFL 技术指南对保留效果有所限定,并说明边界框不是裁切蒙版。只要未修改像素是验收要求,就应将返回文件与源图对比。[2]
能下载 FLUX 3 Image 在本地使用吗?
BFL 宣传面向希望在自有基础设施上微调、部署 FLUX 3 Image 的公司的商业权重许可。不能将这一方案当作公开、可免费下载的开放权重发布证明。当前许可条款请咨询 BFL。FLUX 3 Image 权重指南区分了商业方案与公开下载。[4]
继续修改前先审核 FLUX 3 Image 编辑结果
第一次使用 FLUX 3 Image 编辑时,选择一个容易判断的变化,明确必须保留的元素,并在第二次修改前检查输出。小而可审核的需求,让你能实际判断结果是否适合最终素材。
参考来源
- Black Forest Labs. FLUX 3 Image Editing. 于 2026 年 10 月 9 日查阅,来源: docs.bfl.ai/flux_3/flux3_image_layout.
- Black Forest Labs. Bounding boxes with FLUX 3 Image. 于 2026 年 10 月 9 日查阅,来源: docs.bfl.ai/flux_3/flux3_image_bounding_boxes.
- Black Forest Labs. FLUX 3 Image overview. 于 2026 年 10 月 9 日查阅,来源: docs.bfl.ai/flux_3/flux3_image_overview.
- Black Forest Labs. FLUX 3 Image. 于 2026 年 10 月 9 日查阅,来源: bfl.ai/models/flux-3-image.
更多文章

2026 年五款最佳 AI 视频生成 API 对比
按时长、参考输入、音频、分辨率、计费方式对比 Seedance 2.5、MiniMax H3、Kling 3.0、Veo 3.1、Vidu Q3。


Nano Banana API 没有免费层:真实按图计费规则
Nano Banana API 没有免费层,Google 标注全部模型均不可用。按图计费规则、批处理半价、注册额度仅 $0.10。


用 API 生成一致的 3D 风格人物图像,仅需 $0.143
用 Wan 2.7 搭建一致的 3D 风格角色出图流程:先出一张主图,再生成五个场景候选,全程 $0.143,并算出单张合格图的真实成本。
