
LLM 最大输出 token 对照:上下文、推理和接口限制
对照 Kimi、DeepSeek、MiniMax、GPT 和 Claude 的最大输出 token,分清上下文、请求上限、默认值、推理预算与同步和 Batch 接口。
百万 token 上下文,并不等于可以生成百万 token 的回答。GPT-5.6 Luna 的上下文是 1,050,000 token,最大输出是 128,000;MiniMax M3 原生 API 则允许最高 524,288 token 的生成预算。两个数字管的是不同的限制,推理还可能继续占用这一轮的输出额度。[1][2]
比较 LLM 最大输出 token,最终是为了判断一个任务能否装进请求:输入有多长,需要生成多少内容,通过哪种接口完成。本文面向长报告、结构化抽取和代码生成,按 2026 年 9 月 8 日的官方文档区分原生 API、reAPI 公开接口、同步请求与批处理。文档上限只说明边界,不保证模型会产出同样长度的有效答案。
要点速览
- 输出上限与上下文窗口分别计算。 Luna 的 1,050,000 token 窗口中,输出最多 128,000。剩余输入空间再多,也不能提高模型的输出硬上限。[1]
- 推荐值不是默认值。 MiniMax 为 M3 推荐 131,072,最高允许 524,288;当前原生 API 页没有把 131,072 标成省略参数后的默认值。[2]
- 参数允许填到多大,不代表搭配任何输入都合法。 Kimi K3 的
max_completion_tokens最高可设 1,048,576,但输入加上这个预算超出窗口,会直接报错。[3] - DeepSeek 的输入和输出共享窗口。 V4 Flash 与 Pro 都标为 1M 上下文、384K 最大输出,API 同时约束输入与生成 token 的合计。[4][5]
按模型和接口对照 LLM 最大输出 token
下表比较各厂商原生 API。“未标明”表示本次读取的规格页没有给出数值默认,不能理解为无限输出,也不能用示例参数代填。
| 模型与接口 | 上下文窗口 | 最大生成预算 | 默认值或推荐值 | 输出控制参数 |
|---|---|---|---|---|
| Kimi K3,原生 Chat Completions | 厂商标注为 1M | 参数最高 1,048,576;输入加预算必须装得下 | 默认 131,072 | max_completion_tokens |
| DeepSeek V4 Flash / Pro,原生 Chat Completions | 1M | 384K,同时受剩余上下文约束 | 当前页面未标明数值默认 | max_tokens |
| MiniMax M3,原生 OpenAI 兼容接口 | 1M | 524,288 | 推荐 131,072;未标明数值默认 | max_completion_tokens |
| GPT-5.6 Luna / GPT-6 Astra,原生 API | 1,050,000 | 128,000 | 模型页未标明数值默认 | Chat Completions 用 max_completion_tokens;Responses 用 max_output_tokens |
| Claude Opus 5 / Opus 4.8,同步 Messages | 1M | 128K | 显式设置请求预算;示例值不是默认 | max_tokens |
| Claude Opus 5 / Opus 4.8,启用扩展输出的 Message Batches | 1M | 300,000 | 需要相应 Batch 功能与 beta header | max_tokens |
来源分别是 Kimi 参数与模型页、DeepSeek 模型和 API 文档、MiniMax API 文档、OpenAI Luna/Astra 模型页,以及 Anthropic 上下文和批处理文档。[3][6][4][5][2][1][7][8][9]
这里保留厂商自己的单位。DeepSeek 在这些页面上只写 384K,没有给出精确整数;MiniMax 则明确写出 512K = 524,288。不能把所有厂商的 K 都按同一个倍数换算,再把计算结果当作官方规格。
Claude 的 300,000 必须单独看。它要求在 Message Batches API 上使用 output-300k-2026-03-24,不适用于同步 Messages。Anthropic 当前列明支持 Claude API 和 Claude Platform on AWS,并对其他托管平台作了排除。原生模型支持这项功能,不代表任意网关也提供了同一个 Batch 接口。[9]
为最终答案之外的生成预留空间
OpenAI 明确规定,Chat Completions 的 max_completion_tokens 包含可见输出和推理 token;Responses 的生成预算还包括不可见的格式 token。Claude 的思考也计入 max_tokens。所以,答案想写多长,和请求要留多少输出额度,经常不是同一个数。[10][11][8]
例如,可以先做这样一笔预算:
本次生成预算: 30,000 token
计划留给推理: 10,000 token
留给可见输出: 20,000 token这是预算示例,不是实测结果,也不是模型会严格遵守的推理分配公式。如果推理消耗超过预期,同一份额度里留给答案的空间就会减少。提高 effort 可以让模型做更多推理,但不会自动提高你发出去的输出上限。
长内容任务应先列出两项需求:必须保留的输入,以及本轮需要的生成预算。系统指令、历史消息、工具定义和工具结果,都要按所用接口的规则计入。然后分别检查输出硬上限和上下文约束;通过其中一项,不代表另一项也通过。[8]
假设某任务需要 150,000 token 的生成预算。这个数已经超过 Luna 和 Astra 的 128,000 上限,无论输入区还剩多少空间,都无法用该模型的一次请求完成这份预算。Claude 的 Batch 扩展在规定条件下可以容纳它。不过,“预算装得下”仍然不说明最后的报告是否正确、完整,或者值得付出相应成本。[1][7][9]
Kimi 始终开启推理,而且在生成前校验输入加输出预算是否超窗。它的最大参数值不能直接宣传成“百万 token 的最终答案”。MiniMax 的 API 页描述的是生成长度上限,也没有承诺全部额度都会变成有用的回答正文。把上限显式写进请求,再检查实际响应,比拿最大数字估算成品长度可靠。[3][12][2]
参数名、推理档位都要跟着接口走
OpenAI 兼容格式,不代表所有参数都可以互换。OpenAI 的 Chat Completions 使用 max_completion_tokens,Responses 使用 max_output_tokens;DeepSeek 原生 Chat Completions 使用 max_tokens。MiniMax 当前原生 OpenAI 兼容文档则将 max_tokens 标为废弃字段,推荐改用 max_completion_tokens。[10][11][5][2]
推理档位也不同。Kimi K3 支持 low、high、max,默认 max。DeepSeek 支持这三个实际档位,默认 high,兼容传入的 medium 和 xhigh 都映射到 high。Luna 支持 none 等档位,默认 medium;Astra 不支持 none,当前模型页没有给出默认 effort,不能从 Luna 直接套用。[12][13][1][7]
Claude 通过 output_config.effort 控制努力度。Opus 5 与 4.8 的较高档位写作 xhigh,没有 extra 这个枚举,默认是 high。Opus 5 默认启用自适应思考,只能在 high 及以下关闭;Opus 4.8 则需要显式开启思考。[14][15]
使用 reAPI 时,从当前模型目录进入所选模型的文档。Luna 模型页已经列出窗口和输出上限,Kimi API 文档则说明请求字段。厂商原生默认、示例里主动填写的数值、实际调用接口的行为,需要分别确认。显式填写自己的输出预算,可以少依赖一个默认设置。
先读停止原因,再决定是否换模型
各 API 到达限制时的行为并不相同:
| 接口 | 官方给出的信号 | 应检查什么 |
|---|---|---|
| Kimi 原生 Chat Completions | 输入加请求上限超窗时,返回 invalid_request_error | 先减少输入或输出预算,再重试 |
| DeepSeek 原生 Chat Completions | finish_reason: length 可能对应输出上限或上下文限制 | 对照请求上限、usage 和保留的输入 |
| OpenAI Responses | status: incomplete,且 incomplete_details.reason: max_output_tokens | 同时检查推理用量与可见输出 |
| Claude Messages,Claude 4.5 及更新模型 | 输入本身超窗会拒绝;生成到窗口边界可返回 model_context_window_exceeded | 区分输入已超限与生成过程中耗尽窗口 |
这些是各自接口的约定,字段名不能跨 API 互套。[3][5][11][8]
代理应用也可能比模型更早停止。排查时同时保存原始 API 响应、应用报错与应用配置的预算。单独一句“已达到输出 token 上限”,不能判断限制来自模型服务、SDK,还是代理程序。如果使用 DeepSeek,现有的1M 上下文指南已经详细说明共享窗口的预算方法。
常见问题
可以输入 1M token,再生成模型的最大输出吗?
不能据此推断。DeepSeek 约束输入与实际生成的合计,Kimi 检查输入加请求上限,Claude 的窗口也包括输出和思考。把输入填满之前,先读所用接口如何处理两者的合计。[5][3][8]
输出上限最高的模型,最适合写长报告吗?
这个数字只能先回答预算是否可能装下。它不衡量事实准确度、遵循指令的能力,也不说明任务需要那么多文字。确认上限后,用一份有明确验收标准的代表性报告做选择。
开启流式响应可以提高最大输出吗?
本文比较的是生成上限。流式响应改变接收结果的方式,不是把 Claude 上限提高到 300,000 的 Batch 扩展。需要更长的批处理输出时,应明确选择对应功能。[9]
示例里的 4096、8192 能当作默认值吗?
示例只是作者选定的一次请求。只有接口规格明确标注的 default,才能作为该接口的默认值。MiniMax 的 131,072 是推荐预算,Moonshot 才明确把 Kimi 的 131,072 标成原生默认。[2][3]
还没出现答案,也可能用完输出预算吗?
OpenAI Responses 的文档明确存在这种情况:推理可能在出现可见输出前耗尽预算。应检查 incomplete 状态和 token 用量,不能把空白答案当作没有产生任何处理或费用的证据。[11]
应该保存哪些字段来复查生产请求?
把模型 ID、端点、请求的输出上限、effort、返回的输入与输出用量、停止原因,以及任务是否达到验收标准保存在一起。比较 LLM 最大输出 token 时,这些记录能说明你的应用实际上请求了什么、用掉了多少,以及结果为什么停止。
先确定任务预算,再选模型
比较 LLM 最大输出 token 时,先用一个代表性任务确定必须保留的输入、需要的生成预算,以及能否采用批处理接口。显式设置上限,用小规模评估检查任务完成情况和 token 用量。如果确实需要多次调用,就按文档章节或代码边界拆分,并保留下一次请求需要的状态。只换成上下文更大的模型,并不能解决输出上限。
参考资料
- OpenAI。GPT-5.6 Luna 模型规格。 2026 年 9 月 8 日读取:developers.openai.com/api/docs/models/gpt-5.6-luna。
- MiniMax。Chat Completions API。 2026 年 9 月 8 日读取:platform.minimax.io/docs/api-reference/text-chat-openai。
- Moonshot AI。Chat Completions API。 2026 年 9 月 8 日读取:platform.kimi.ai/docs/api/chat。
- DeepSeek。模型与价格。 2026 年 9 月 8 日读取:api-docs.deepseek.com/zh-cn/quick_start/pricing。
- DeepSeek。Chat Completions API。 2026 年 9 月 8 日读取:api-docs.deepseek.com/zh-cn/api/create-chat-completion。
- Moonshot AI。模型列表。 2026 年 9 月 8 日读取:platform.kimi.ai/docs/models。
- OpenAI。GPT-6 Astra 模型规格。 2026 年 9 月 8 日读取:developers.openai.com/api/docs/models/gpt-6-astra。
- Anthropic。上下文窗口。 2026 年 9 月 8 日读取:platform.claude.com/docs/en/build-with-claude/context-windows。
- Anthropic。Batch 处理:扩展输出 beta。 2026 年 9 月 8 日读取:platform.claude.com/docs/en/build-with-claude/batch-processing。
- OpenAI。创建 Chat Completion。 2026 年 9 月 8 日读取:developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create。
- OpenAI。推理模型。 2026 年 9 月 8 日读取:developers.openai.com/api/docs/guides/reasoning。
- Moonshot AI。推理努力度。 2026 年 9 月 8 日读取:platform.kimi.ai/docs/guide/use-reasoning-effort。
- DeepSeek。思考模式。 2026 年 9 月 8 日读取:api-docs.deepseek.com/zh-cn/guides/thinking_mode。
- Anthropic。Effort。 2026 年 9 月 8 日读取:platform.claude.com/docs/en/build-with-claude/effort。
- Anthropic。思考。 2026 年 9 月 8 日读取:platform.claude.com/docs/en/build-with-claude/thinking。
更多文章

AI 图像 API 内容过滤:请求被拒的原因
图像 API 的内容过滤分为多个层级。同一个提示词在某个平台可能通过审核,在另一个平台可能被拒绝,但某些安全底线无论如何配置都不会改变。


Kimi K3 对比 Claude Opus 5:开源权重还是托管可靠性?
对比 Kimi K3 与 Claude Opus 5 在开源权重、1M 上下文、推理能力、多模态输入、API 价格和部署要求方面的区别。


GPT-6 Astra API 迁移:Responses、工具与回滚
学会使用模型发现、Responses API、推理档位控制和工具检查,安全迁移至 GPT-6 Astra 并规划回滚策略。
