GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
FLUX 3 Image 编辑指南:参考图与边界框用法
2026/10/09

FLUX 3 Image 编辑指南:参考图与边界框用法

用有序参考图和边界框提示词引导 FLUX 3 Image 编辑。了解坐标顺序、布局表与编辑表的区别,以及生成后如何检查修改和未修改区域。

FLUX 3 Image 最多接受十张参考图,但有用的编辑应从一个更具体的问题开始:图片的哪一部分需要改变?Black Forest Labs 同时提供了指令式编辑文档和布局格式文档;后者为各元素命名、指定边界框,并区分原位置与目标位置。[1][2]

本指南说明如何选择这些方法、在提示词中写入边界框数据,以及检查结果。下列示例是说明性的提示词模板,并非报告实际生成结果。当前 reAPI 控制项和价格见 FLUX 3 Image 模型页,请求契约见 API 文档。

要点速览

  • 只需明确修改一个物体时,先使用一张参考图和具体指令。普通图像编辑不必手动提供边界框。[1]
  • 参考图顺序很重要:ref_image_0 指第一张,ref_image_1 指第二张。给每张参考图指定明确用途。[2]
  • 将画面描述与元素表一起放进 prompt。边界框不是独立的顶层请求参数。[2]
  • 坐标采用归一化的 0–1000 网格,顺序为 [top, left, bottom, right],并非图片像素坐标。[2]
  • 将边界框视为位置指令。BFL 说明它们不是裁切蒙版,未修改像素仍须检查。[2]

从能明确描述的变化开始 FLUX 3 Image 编辑

处理单张图片时,写出能识别物体与目标效果的指令。BFL 编辑指南建议精确命名元素,让指令只匹配一个对象。模型能扩展指令,并为许多编辑推断边界框,因此不必每次请求都提供完整元素表。[1]

假设产品照片中有一只奶油色马克杯,放在木桌上。初始提示词可以是:

Change the cream ceramic mug beside the closed notebook to a deep teal glaze.
Keep the mug's handle shape, the notebook, the wooden table, the camera angle,
and the soft light from the left unchanged.

这样既指定了可识别的修改主体,也定义了之后需要检查的部分。如果有两只杯子,说明要修改哪只。如果杯柄必须可见,也应明确写出。泛泛要求“改善照片”,会把这些决定留给模型。

对于 FLUX 3 Image,我们建议先尝试最小、描述清楚的编辑。当位置有歧义、出现多个相似物体,或构图本身需要改变时,再补充明确边界框。这是一种编辑策略,并不表示某种提示词总能成功。

为每张参考图指定一项用途

FLUX 3 Image 支持最多十张参考图。BFL 说明可按位置称呼它们,如“Image 1”,也可使用从 ref_image_0 开始的索引标识符。编辑请求采用 auto 时,第一张参考图也决定输出宽高比。[1][2]

房间概念图的参考用途可以如下分配:

参考图提示词中的用途结果中需要检查的内容
Image 1 / ref_image_0房间与相机视角窗户位置与房间取景
Image 2 / ref_image_1放在窗边的椅子椅子形状、面料与朝向
Image 3 / ref_image_2靠垫图案图案在靠垫上的位置

示例指令:“将 Image 1 用作房间。把 Image 2 中的椅子放在窗边。用 Image 3 的图案添加一个靠垫。保持相机视角和房间现有家具不变。”

将参考图顺序保存在任务记录中。在提示词不变时重新排列输入,会改变各用途对应的图片。需求只要两张图时,填满十个位置也没有多少价值。真正有用的限制,是能否清楚说明每张参考图贡献什么。

在 reAPI 的 FLUX 3 Image 请求中,通过 image_urls 提供参考图 URL。FLUX 3 Image API 参考说明接受的 URL 和请求限制;提示词标识符仍从零开始计数。

将布局数据写入提示词

FLUX 3 Image 使用画面描述加元素 JSON 数组。新构图中的每个元素包含 id、bbox 和 desc。在描述中用尖括号引用对应 id,再将表追加到同一个提示词字符串。[2]

以下方形布局示例将马克杯放在左侧,笔记本放在右侧:

A quiet overhead product photograph of a teal mug <mug_1> and a closed
cream notebook <notebook_1> on a pale wooden desk <desk_1>.

[
  {"id":"desk_1","bbox":[0,0,1000,1000],"desc":"A pale wooden desk in soft daylight."},
  {"id":"mug_1","bbox":[300,120,760,450],"desc":"One teal ceramic mug with its handle visible."},
  {"id":"notebook_1","bbox":[230,540,820,900],"desc":"A closed cream notebook without lettering."}
]

这些数字描述相对位置。[0,0,500,500] 是图片左上四分之一区域。改变分辨率不会让这些值变成像素。改变宽高比时,坐标网格也随画幅拉伸,因此应使用设计布局时采用的同一比例。[2]

在代码中创建请求时,将数组序列化并追加到描述后面。这样不必手工转义嵌套 JSON 中的每个引号。不要因为提示词含有边界框数据,就另外发送 bbox 字段。

编辑需要源框和目标框

编辑比新布局需要更多信息:元素来自哪里,以及最后应放在哪里。FLUX 3 Image 编辑格式用 from、src_bbox 和 tgt_bbox 表达这些信息。[2]

目标操作fromsrc_bboxtgt_bbox
保持元素原位参考图 id当前边界框相同边界框
移动元素或调整大小参考图 id当前边界框不同边界框
添加、替换或改色nullnull目标边界框
删除元素参考图 id当前边界框null

例如,移动马克杯的记录可以是:

{
  "id": "mug_1",
  "from": "ref_image_0",
  "src_bbox": [300, 120, 760, 450],
  "tgt_bbox": [300, 200, 760, 530],
  "desc": "The teal ceramic mug with the same shape and visible handle."
}

配套指令应说明马克杯向右移动,而笔记本和桌面保持不变。为必须留在原位的元素添加保留记录,这些记录采用相同的源坐标与目标坐标。

改色时,BFL 文档使用新增记录模式:from: null、src_bbox: null,加上描述目标外观的目标框。删除时保留源参考图与源框,将目标框设为 null,文字指令中也说明删除。指令与表应保持一致。[2]

示例坐标属于上面的假设布局。复用前先测量自己的图片;即使 JSON 对象合法,也可能指向错误物体。

按实际需求选择分辨率和 grounding

FLUX 3 Image 有五个分辨率档位:768sq、1k、1.5k、2k 和 4k,默认 1k。Grounding 默认开启,允许在生成前进行网页与图片搜索;设为 false 会禁用这一步搜索。[3]

这些控制回答不同问题。分辨率选择输出档位。Grounding 决定模型能否从提示词和已提供输入之外查找辅助信息。虚构的影棚构图可能适合关闭 grounding。需求涉及真实主体或当前视觉参考时,应判断搜索是否有用,并继续核实结果。

BFL 将 FLUX 3 Image 描述为支持原生 2K 和 4K 生成,但更大的输出并不能证明小范围编辑保留了人脸、标签或纹理。按交付尺寸检查关键区域。选择最终档位前,查看当前 FLUX 3 Image 价格,不要把旧费率复制进工作流。[4]

像检查修改一样认真检查未修改区域

BFL 边界框文档中最有用的限定是:框引导位置和大小,不会将元素裁切到硬性蒙版内。其删除示例说编辑框外的像素通常保持相同。这意味着需要对比输出,并不是普遍保证零偏移。[2]

在马克杯示例中,应检查杯柄、笔记本边缘、桌面纹理和阴影边界。需要多次编辑时,保留已认可的源图,将每个结果与它对比。即使新构图很漂亮,也可能不符合“原笔记本保持不变”的需求。

简单的审核记录可包含输入顺序、提示词、元素表、宽高比、分辨率,以及简短的接受或拒绝说明。连续编辑时,保留此前已接受的图片。这是建议的审核流程;本文不声称测得重试率或编辑准确率。

FLUX 3 Image 编辑常见问题

不用边界框也能编辑图片吗?

可以。发送参考图和文字指令即可。BFL 提供直接编辑文档,并说明模型能为许多编辑推断元素框。需要明确位置指令时,再自行提供框。[1]

最多可以使用多少张参考图?

十张。说明每张图提供什么,并保留顺序。第一张是 ref_image_0,普通语言中称为“Image 1”。[1]

边界框按像素测量吗?

不是。它们采用 0 到 1000 的归一化整数,顺序为 [top,left,bottom,right]。无论输出分辨率如何,框都覆盖画幅中对应比例的区域。[2]

图生图会保留原宽高比吗?

编辑请求设为 aspect_ratio: "auto" 时,第一张参考图决定宽高比。输出需要另一种形状时,选择明确比例,并按该形状设计布局框。[1]

框外能保证像素级精确保留吗?

不要这样假定。BFL 技术指南对保留效果有所限定,并说明边界框不是裁切蒙版。只要未修改像素是验收要求,就应将返回文件与源图对比。[2]

能下载 FLUX 3 Image 在本地使用吗?

BFL 宣传面向希望在自有基础设施上微调、部署 FLUX 3 Image 的公司的商业权重许可。不能将这一方案当作公开、可免费下载的开放权重发布证明。当前许可条款请咨询 BFL。FLUX 3 Image 权重指南区分了商业方案与公开下载。[4]

继续修改前先审核 FLUX 3 Image 编辑结果

第一次使用 FLUX 3 Image 编辑时,选择一个容易判断的变化,明确必须保留的元素,并在第二次修改前检查输出。小而可审核的需求,让你能实际判断结果是否适合最终素材。

参考来源

  1. Black Forest Labs. FLUX 3 Image Editing. 于 2026 年 10 月 9 日查阅,来源: docs.bfl.ai/flux_3/flux3_image_layout.
  2. Black Forest Labs. Bounding boxes with FLUX 3 Image. 于 2026 年 10 月 9 日查阅,来源: docs.bfl.ai/flux_3/flux3_image_bounding_boxes.
  3. Black Forest Labs. FLUX 3 Image overview. 于 2026 年 10 月 9 日查阅,来源: docs.bfl.ai/flux_3/flux3_image_overview.
  4. Black Forest Labs. FLUX 3 Image. 于 2026 年 10 月 9 日查阅,来源: bfl.ai/models/flux-3-image.