
DeepSeek V4 Flash 正式版发布:0731 Agent 与 Codex 升级
DeepSeek V4 Flash 0731 正式版进入 API 公测:模型 ID 不变,Agent 能力增强,原生支持 Responses API,并完成 Codex 适配。
DeepSeek V4 Flash 0731 已成为 DeepSeek 官方 API 当前提供的 Flash 正式版。 2026 年 7 月 31 日的更新在现有 deepseek-v4-flash 模型 ID 后替换了 4 月份的预览版,加入原生 Responses API 支持,并针对代码 Agent 和工具调用做了大幅后训练升级。不过,DeepSeek 对服务阶段的表述仍是 API 公开测试[1]。
这次更新只覆盖 Flash API。DeepSeek V4 Pro、DeepSeek App 和网页端模型没有随 0731 版本一起升级。模型架构也没有变化:Flash 仍是总参数 284B、激活参数 13B、支持 100 万 token 上下文的 MoE 模型[1][2]。
先看结论
- 正式版 checkpoint 是
DeepSeek-V4-Flash-0731。 API 调用仍填写deepseek-v4-flash,不需要迁移模型名[1]。 - 这是后训练升级,不是新架构。 总参数、激活参数和 1M 上下文保持不变[1][2]。
- Agent 能力是本次重点。 DeepSeek 公布 Terminal Bench 2.1 为 82.7、DeepSWE 为 54.4、Toolathlon Verified 为 70.3;测试使用尚未发布的 DeepSeek Harness minimal mode 与 max 推理强度[1]。
- 原生支持 Responses API。 Flash 可以直接作为 Codex 后端,不再需要预览版时期的协议转换代理[3][4]。
- 这不等于完整兼容 OpenAI Responses API。 当前接口无状态,只接受文本,多个 Responses 字段会被忽略或不受支持[3]。
- Pro 和消费端没有更新。 DeepSeek 表示 V4 Pro 正式版会在后续单独发布[1]。
DeepSeek V4 Flash 0731 正式版规格
| 项目 | 官方状态 |
|---|---|
| 发布日期 | 2026 年 7 月 31 日 |
| 服务阶段 | 正式模型,通过 API public beta 提供 |
| API 模型 ID | deepseek-v4-flash |
| Checkpoint 名称 | DeepSeek-V4-Flash-0731 |
| 架构 | MoE,与预览版相同 |
| 参数规模 | 284B 总参数,13B 激活参数 |
| 上下文窗口 | 1M token |
| 最大输出 | 384K token |
| 推理模式 | 非思考、Think High、Think Max |
| API 格式 | Chat Completions、Anthropic 兼容、Responses API |
| Responses API 输入 | 文本;不支持图片与文件输入 |
| 开放权重 | 已发布,MIT License |
这里需要区分“checkpoint 名称”和“API 模型 ID”。DeepSeek-V4-Flash-0731 用于标识这次更新后的权重,开发者请求里继续传入稳定服务名 deepseek-v4-flash[5]。这样 DeepSeek 可以更新后端版本,而无需所有生产应用同时修改配置。
与 DeepSeek V4 Flash Preview 相比改了什么?

0731 的变化主要体现在模型行为和接入方式,而不是参数规模。
| 维度 | 4 月预览版 | 0731 Flash 正式版 |
|---|---|---|
| 架构 | 284B 总参数 / 13B 激活 MoE | 不变 |
| 上下文 | 1M token | 不变 |
| API 模型 ID | deepseek-v4-flash | 不变 |
| 训练阶段 | Preview 后训练 | 针对正式版重新后训练 |
| Agent 能力 | 通用 Agent 基线 | 强化代码、终端和工具调用 |
| Responses API | 没有原生接口 | 原生支持 |
| Codex 接入 | 需要转换器或兼容网关 | 官方提供直接配置 |
| 更新范围 | Flash 与 Pro 预览 API | 仅 Flash API |
DeepSeek 明确说明 0731 “只进行了重新后训练”[1]。对于 Agent 模型,这并不是小变化。架构决定模型的容量,而后训练会直接影响模型能否正确规划、选择工具、读取结果、处理失败并持续完成任务。
因此,这次升级没有让 Flash 变得更大,而是让现有模型在代码库分析、终端操作、补丁生成、搜索和多步自动化中更实用。
官方 Agent 跑分应该怎么理解?
DeepSeek 为 0731 正式版公布了九项结果[1]:
| Benchmark | DeepSeek V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| CyberGym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon Verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench Public | 25.1 |
| DSBench FullStack | 68.7 |
| DSBench Hard | 59.6 |
这些数据能证明 Agent 是本次升级的重点,但不能直接证明它在所有场景中排名第一。
公开代码 Agent 测试使用 DeepSeek 自己的 Harness minimal mode。该 harness 尚未发布,测试参数为 max 推理强度、top_p: 0.95 和 temperature: 1.0。DSBench FullStack 与 DSBench Hard 还是 DeepSeek 内部测试集[1]。在 harness 和内部任务公开前,这部分结果无法完整复现。
生产评测应该固定代码库、工具权限、超时、重试规则、推理强度和 token 预算。最终要看真正完成的任务与被接受的补丁,而不是 Agent 是否生成了一段看似合理的 diff。
原生 Responses API 是最重要的开发者变化
DeepSeek V4 Flash 现在可以在标准 DeepSeek Base URL 上直接接收 Responses API 格式。这解决了 Codex 等 /v1/responses 客户端与 DeepSeek Chat Completions 之间的协议缺口[3]。
使用 OpenAI SDK 的最小直连示例:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="保守地审查代码,并解释每一个建议修改。",
input="找出这个队列 worker 中的竞态条件。",
reasoning={"effort": "high"},
max_output_tokens=8_192,
)
print(response.output_text)流式接口会返回 response.output_text.delta、response.function_call_arguments.delta 和 response.completed 等语义事件。它不会像常见的 Chat Completions 流一样以 data: [DONE] 结束[3]。
原生支持意味着不再需要中间代理转换工具调用、推理事件和 output items,也就减少了 tool-call ID、流状态或推理历史在转换过程中出错的机会。
Responses API 仍有哪些兼容限制?
“原生 Responses API”不代表 OpenAI 的每一项 Responses 功能都可用。DeepSeek 官方文档列出了明确边界[3]。
目前支持:
- 文本输入以及 developer/system 指令;
- Streaming;
- Function tools 与服务端 Web Search;
- required 或指定工具的
tool_choice; reasoning.effort;- 结构化文本输出;
- Codex 使用的
apply_patchcustom tool。
主要限制包括:
- 不支持
previous_response_id和conversation,接口是无状态的; - 不支持
store、background、metadata、prompt templates 和 service tier; - 图片与文件输入不会被模型处理,而会被替换成占位文本;
- MCP、computer use、code interpreter 与 file search 会被忽略;
parallel_tool_calls会被忽略,因为并行工具调用始终开启;- 请求超过上下文时返回 HTTP 400,不会自动截断。
部分不支持的参数会被静默忽略。也就是说,请求可能返回 200,但应用传入的某个控制项并未真正生效。上线前必须验证行为,不能只检查 HTTP 状态码。
DeepSeek V4 Flash 0731 如何接入 Codex?
DeepSeek 已发布单独的 Codex 配置文档。截至 8 月 2 日,只有 Flash 支持该接入,V4 Pro 仍需等待后续更新[4]。
核心配置如下:
model = "deepseek-v4-flash"
model_provider = "deepseek"
[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"官方模型目录为 Flash 配置了 1,048,576 token 最大上下文、并行工具调用,以及 low、high、max 三档推理强度[4]。API Key 应放在本机环境变量中,不要写入会被提交或共享的配置文件。
代码库任务可以从 high 开始。只有跨服务迁移、复杂疑难故障等任务,才值得提高到 max 并承担更多延迟和输出 token。
DeepSeek V4 Flash 0731 价格与上下文
DeepSeek 官方直连价格页当前给出的 Flash 美元价格为[6]:
| Token 类型 | 每 100 万 token |
|---|---|
| 缓存命中输入 | $0.0028 |
| 缓存未命中输入 | $0.14 |
| 输出 | $0.28 |
Flash 仍支持 1M 共享上下文、384K 最大输出,官方直连账号并发上限为 2500[6][7]。超长 Agent 请求还会消耗工具 schema、代码库文件、推理 token、重试和长输出,不能只看每百万 token 的最低价格。
上下文预算与缓存机制可继续阅读 DeepSeek V4 1M 上下文使用指南。
以上是 DeepSeek 直连价格。reAPI 有独立的产品合同和实时价格卡,调用前请查看 DeepSeek V4 中文模型页,不要把上游人民币或美元价格直接套入网关账单。
通过 reAPI 调用 DeepSeek V4 Flash
reAPI 现有接入继续使用同一个稳定模型名和 OpenAI 兼容的 Chat Completions 接口:
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "系统分析代码库,只返回最小且安全的修改。"
},
{
"role": "user",
"content": "追踪这个认证失败并定位最小修复方案。"
}
],
"max_tokens": 8192,
"reasoning_effort": "high"
}'reAPI 当前字段与响应格式见 DeepSeek V4 API 文档。网关更新和供应商直连更新是两个独立的运维事件;如果业务依赖准确的 0731 revision,应确认当前模型发现结果和实际路由版本。
哪些用户应该切换到正式版?
DeepSeek 官方 API 用户不需要切换模型 ID,稳定的 Flash 名称已经指向最新版本。但模型行为发生了变化,所以必须重新跑业务评测。
这次更新最适合:
- 使用终端、搜索与补丁工具的代码 Agent 团队;
- 过去维护 Chat Completions 到 Responses 转换器的开发者;
- 需要比 V4 Pro 更小激活参数和更高吞吐的工作负载;
- 可以利用自动前缀缓存的长上下文 Agent;
- 能接受 DeepSeek 当前兼容边界的 Codex 用户。
如果工作流依赖图片理解、持久化 Responses 会话、后台任务、Code Interpreter、API 原生 MCP 或完全一致的 OpenAI 功能,暂时不要把它当作无条件替代品[3]。
生产迁移检查清单
- 保留
deepseek-v4-flash,不要自行发明deepseek-v4-flash-0731API ID。 - 即使模型名没变,也要重新运行 Agent 验收测试。
- 对比模型时固定 harness、工具定义、推理强度、token 预算和超时。
- 验证应用依赖的每一个 Responses 字段,部分不支持字段会被静默忽略。
- 在客户端保存会话历史,因为
previous_response_id不受支持。 - 拒绝或预处理图片与文件输入,不要假设模型能读取它们。
- 在成本监控中分开统计缓存命中与未命中输入。
- 通过 feature flag 灰度发布,在验收完成前保留旧生产路由。
FAQ
DeepSeek V4 Flash 0731 是正式版吗?
是。DeepSeek 将其称为 V4 Flash 正式版,并从 2026 年 7 月 31 日起通过 API public beta 提供[1]。“正式版”描述模型 revision,“public beta”描述当前服务阶段。
API 模型名需要改吗?
不需要。DeepSeek 直连仍使用 deepseek-v4-flash,该模型名现在指向 DeepSeek-V4-Flash-0731[5]。
0731 是更大的模型吗?
不是。它保持 284B 总参数、13B 激活参数的原架构,升级来自重新后训练[1]。
DeepSeek V4 Flash 正式版支持 Responses API 吗?
支持。DeepSeek 为 Flash 提供原生 Responses API,并发布了直接接入 Codex 的配置文档[3][4]。
Responses API 能处理图片吗?
不能。官方兼容表说明图片和文件 input part 会被替换为占位文本,应将当前接口视为纯文本输入[3]。
DeepSeek V4 Pro 也升级了吗?
没有。0731 仅更新 Flash API,Pro API、App 和 Web 端均保持不变,正式版 Pro 将另行发布[1]。
这次发布真正意味着什么
DeepSeek V4 Flash 正式版是一轮聚焦 Agent 的升级。它保留 Flash 的高效率架构和稳定 API 名称,同时强化了开发者最容易感知的部分:工具调用、终端任务、代码行为以及 Responses 客户端接入。
真正重要的不只是跑分上涨,而是 deepseek-v4-flash 现在可以通过官方文档中的原生协议直接接入 Codex。团队仍应验证兼容缺口,在自己的代码库上复现效果,并记住服务还处于 public beta。这是一次实质性发布,但还不是 DeepSeek V4 全产品线正式升级。
References
- DeepSeek. 更新日志 — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/zh-cn/updates
- DeepSeek. DeepSeek-V4-Flash Model Card — 架构、参数、上下文、推理模式与许可证。 Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- DeepSeek. Responses API 使用文档 — 字段、工具、Streaming 与兼容边界。 Retrieved August 2, 2026 from api-docs.deepseek.com/zh-cn/guides/responses_api
- DeepSeek. 接入 Codex — 官方 Provider 与模型配置。 Retrieved August 2, 2026 from api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex
- DeepSeek. 首次调用 API —
deepseek-v4-flash已更新为 0731 模型。 Retrieved August 2, 2026 from api-docs.deepseek.com/zh-cn/guides/function_calling - DeepSeek. 模型与价格 — Flash 价格、上下文、最大输出与功能。 Retrieved August 2, 2026 from api-docs.deepseek.com/zh-cn/quick_start/pricing
- DeepSeek. 限速与隔离 — Flash 账号级并发。 Retrieved August 2, 2026 from api-docs.deepseek.com/zh-cn/quick_start/rate_limit
延伸阅读
- reAPI. DeepSeek V4 中文模型页与实时价格。 reapi.ai/zh/models/deepseek-v4
- reAPI. DeepSeek V4 API 文档。 reapi.ai/docs/deepseek-v4
- reAPI. MiniMax M3 API: 1M Context, Pricing, and Coding Guide. reapi.ai/blog/minimax-m3-api-guide
作者

分类
更多文章

fal.ai 替代方案 2026:5 个平台横向对比
在找 fal.ai 平替?本文对比 Replicate、Together AI、RunPod、Hugging Face 和 reAPI 的模型覆盖、价格、速度与 API 设计。


AtlasCloud 替代方案 2026:5 个平台价格对比
在找 AtlasCloud 替代方案?对比 fal.ai、Replicate、Together AI、RunPod 和 reAPI 的价格、模型与 OpenAI 兼容 API,看同款图像和视频模型实际要花多少钱。


Seedance 2.0 在哪用:消费级 App 与 API 的区别
Seedance 2.0 有两条路:App 把它包进订阅按 credits 扣,API 不用订阅、按输出秒数计费。本文给出真实费率、4-15 秒时长限制和选择依据。
