
Kimi K3 完整指南:Moonshot 2.8T 旗舰模型
Kimi K3 规格、架构、价格和 API 行为详解:1M 上下文、常开推理、固定采样,以及通过 OpenAI 兼容 API 调用的方法。
Moonshot AI 于 2026 年 7 月中旬发布了 Kimi K3,但顺序与常规发布恰好相反:API 文档、价格页面和可用的 kimi-k3 模型 ID,先于任何基准测试表、技术博客或权重发布出现[1]。各种泄露讨论用一周时间填补了信息真空,而流传内容几乎都至少有一项错误。本指南以 Moonshot 自有文档为依据,梳理已经确认、被刻意固定和尚未公开的信息。
我们的视角也很明确:reAPI 网关已经提供 Kimi K3,因此下文不仅说明模型是什么,还会解释实际调用体验,包括哪些参数会让请求被拒、缓存行为如何决定账单,以及 K2.x 代码迁移时容易踩到的坑。你可以从 reAPI 模型页面直接查看它。
简要结论
- Kimi K3 是一款 2.8 万亿参数旗舰模型,以 Kimi Delta Attention(一种混合线性注意力机制)和 Attention Residuals 为基础,并采用 Stable LatentMoE,每个 token 激活 896 个专家中的 16 个[1][3]。
- 上下文窗口为 1,048,576 tokens,且采用统一价格,没有长上下文加价档。Moonshot 原生 API 的输出上限默认为 131,072,可设至 1,048,576,但输入加上请求预算必须装进窗口[1][2][9]。
- 推理始终开启。 唯一可调项是三级
reasoning_effort(low/high/max,没有medium),默认值为max[4]。 - 采样参数被锁定:
temperature为 1.0、top_p为 0.95、n为 1,两项 penalty 均为 0。传入其他值会直接报错[1]。 - Moonshot 公布的费率为每 1M tokens 输入 $3.00 / 输出 $15.00(缓存命中输入 $0.30)。reAPI 上同一模型为 $2.50 / $12.00,输入和输出均低于公布价格[2][8]。
- 原生支持视觉输入(图片和视频),但会拒绝公开图片 URL,只能使用 base64 或已上传文件的引用[5]。
Kimi K3 概览
下表全部信息来自 Moonshot API 文档,检索日期为 2026 年 7 月 26 日:
| 规格 | Kimi K3(官方) |
|---|---|
| 模型 ID | kimi-k3 |
| 总参数量 | 2.8 万亿 |
| 架构 | Kimi Delta Attention(混合线性注意力)+ Attention Residuals;Stable LatentMoE,激活 896 个专家中的 16 个 |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 最大输出 | 原生默认 131,072 tokens;参数最高 1,048,576,输入加预算须在上下文内 [9] |
| 模态 | 输入文本、图片和视频;输出文本 |
| 推理 | 始终开启;reasoning_effort 可选 low / high / max,默认 max |
| 输入价格(缓存未命中) | 每 1M tokens $3.00 |
| 输入价格(缓存命中) | 每 1M tokens $0.30 |
| 输出价格 | 每 1M tokens $15.00 |
| 上下文分档 | 无——任何上下文长度都按统一 token 费率计价 |
有两个数字值得再看一遍。2.8T 的参数规模让 K3 进入此前没有任何开放权重模型触及的级别;Moonshot 已承诺发布权重,届时它将成为首个 3 万亿参数级开源模型[3]。另一个是价格:$3.00 / $15.00 意味着 K3 的成本是 K2 系列的三到四倍。Moonshot 把它定位成前沿旗舰,而不是过去 Kimi 品牌所代表的高性价比选项;不过它在输入和输出两端仍低于闭源前沿模型。
发布顺序:API 在前,技术资料在后
理解发布顺序,有助于解释现在仍在流传的冲突信息。上线前几天,社区追踪者发现 Moonshot 平台短暂出现宣传页,Kimi 应用中也浮现 beta 模型选择器;泄露消息最终形成的共识是“约 2.5T 参数、1M 上下文”。方向接近,但官方数字是 2.8T。随后 Moonshot 官方账号发布了一段无文字预告视频,产品进度又超过新闻周期:API 文档、快速入门和价格页面,与首批财经媒体报道在同一天上线[1][2]。
API 和文档先于基准测试及权重,这与 K2 旗舰系列的发布方式完全相反;后者都会在首日同步提供完整技术博客和开放权重。实际结果是:K3 上线第一周,文档是唯一可靠来源,其余信息都只是推断。
架构:Kimi Delta Attention、LatentMoE 与 Attention Residuals
K3 文档中技术含量最高的一句话是:模型“基于 Kimi Delta Attention(一种混合线性注意力机制)以及 Attention Residuals 构建”[3]。这不是营销术语,而是 Moonshot 于 2025 年末发表的 Kimi Linear 研究路线首次投入生产。理解它,也就理解了 1M-token 窗口和让该窗口真正可用的统一价格[6]。
**Kimi Delta Attention(KDA)**是一种线性注意力机制,可视为带更细粒度门控的 Gated DeltaNet 改进版。标准 softmax 注意力的键值缓存会随序列长度线性增长,因此百万 token 上下文的服务成本极高。线性注意力则维持固定大小的循环状态。以往代价是质量:纯线性注意力对长文档中精确信息的回忆能力较弱。
混合布局是 Kimi Linear 论文解决这一取舍的方式:以 3:1 比例交错布置 KDA 层和完整注意力层。每四层中有三层采用成本较低的线性机制,第四层保留精确的全局注意力。论文结果显示,这一配置在质量基准上优于全注意力,同时最高可降低 75% 的 KV-cache 内存,并在 1M-token 上下文中将解码速度提高至 6x[6]。
Stable LatentMoE 是稀疏混合专家配置:共有 896 个专家,每个 token 激活 16 个[3]。正是这种稀疏性,让 2.8T 模型具备实际服务的可能;每个 token 的活跃计算量只占总参数量的一小部分。
Attention Residuals 是唯一尚无公开论文解释的组件,这个术语首次出现在 K3 文档中。在技术报告发布前,诚实的结论只能是:我们知道名称,但不知道机制。
它在实践中的意义很直接:1M-token 上下文只有在经济上可用才有价值。多数提供超长上下文的服务商会提高长文本档位价格,或者悄悄降低质量。K3 文档明确表示不分档,无论输入 5,000 还是 900,000 tokens,都使用相同的每 token 费率[2]。只有当长上下文的边际成本确实大幅下降时,这种定价才合理,而这恰恰是 KDA 的作用。架构本身就是价格故事。
API 实际提供了什么
K3 的 API 设计带有明确取舍,会让从 K2.x 或 OpenAI 风格模型迁移的团队感到意外。以下都是文档写明的限制,而非使用观察[1]:
- 推理始终开启。 没有非思考模式——Moonshot FAQ 对“如何关闭思维链”的回答就是:不能。唯一控制项是顶层字段
reasoning_effort,共有low、high、max三级。没有medium,默认还是成本最高的max[4]。 - 采样被固定。
temperature锁定为 1.0、top_p为 0.95、n为 1,两项 penalty 参数均为 0。任何其他值都会报错,因此请求中应直接省略这些字段。若你的流程会按任务调整 temperature,这个控制杆已经不存在。 - 输出预算必须与输入一起装进窗口。 Moonshot 原生 API 的
max_completion_tokens默认为 131,072,最高可设为 1,048,576。输入加上请求预算超过上下文窗口时,会返回invalid_request_error,不能把最大参数值理解为保证生成百万 token 的最终答案。请显式设置上限,为输入、推理和回答留出空间[9]。 - 流式响应区分推理与答案。 流式结果中的
reasoning_contentdelta 与contentdelta 分开,因此 UI 可以把思考轨迹与最终答案分别呈现。 - 必须保留完整思考。 在多轮对话和工具调用循环中,完整 assistant 消息——包括
reasoning_content与tool_calls——必须原样放回messages。只保留content是很多 OpenAI 形态代码的习惯,但会在没有明显报错的情况下削弱模型表现。 - 视觉能力有明确限制。 原生支持图片和视频输入,但不接受公开图片 URL;必须发送 base64 data URI,或先上传文件再按文件 ID 引用[5]。
- 结构化输出是一等能力。 带
strict: true的 JSON Schema 会约束最终答案字段,但不会约束以自然语言呈现的推理内容。
新工具调用体系
K3 首次加入两项能力,它们都瞄准同一个问题:当智能体拥有大量工具时,工具定义会大量消耗上下文[1]。
tool_choice: "required" 会强制本轮至少调用一次工具,避免智能体本应查询资料时却凭记忆直接作答。K2 模型会拒绝这个值,K3 则支持。
动态工具加载更为新颖:在对话中途,把完整工具定义放入一条 system 消息(只有 tools 字段,不含 content),从该位置起工具即可使用。编排器无需在每次请求开头塞入 80 个工具 schema,而可以在工作流阶段真正需要时才注入。要注意:服务器不会持久保存动态加载的工具;下一轮若请求历史中没有保留这条 system 消息,工具就会消失。
文档中的一项警告值得复述:Moonshot 内置 web_search 工具目前标注为更新中,不建议用于生产。如果智能体需要搜索,应自行接入工具。
自动上下文缓存
K3 的上下文缓存不需要 cache ID、TTL 管理或额外参数。只要多次请求保持较长前缀稳定,平台就会自动尝试命中缓存;命中时每 1M tokens 按 $0.30 计费,而不是 $3.00[1]。这相当于重复上下文享受 90% 折扣,也是 1M 窗口从演示功能变成实用模式的关键:把语料作为稳定前缀加载一次,随后以十分之一价格反复查询。
是否命中由两个条件决定。前一次请求的 prompt tokens 必须超过 256,低于该值不会缓存;reasoning_effort 档位也不能改变,在对话中途切换会使前缀缓存失效[4]。请在对话开始前选好档位。
早期第三方遥测数据显示,这一模式的表现与宣传一致:OpenRouter 的 K3 实时统计曾显示整体流量缓存命中率超过 75%,使加权平均输入价格降至标价的三分之一以下[7]。
价格:主动告别低价策略
此前每一代 Kimi 都主要依靠成本竞争,K3 不再如此。下表展示它与同系列及前沿竞品的位置(每 1M tokens,输入按缓存未命中费率):
| 模型 | 输入 | 输出 | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K3(Moonshot 直连) | $3.00 | $15.00 | $0.30 | 1M |
| reAPI 上的 Kimi K3 | $2.50 | $12.00 | — | 1M |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 1M |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
定位一目了然:K3 的成本是自家同系列模型的三到四倍,却比闭源前沿模型低 40–50%。Moonshot 的判断是,1M-token 窗口、原生视频输入和前沿级能力,足以支撑开放权重领域中的高端档位。
速度是这项判断必须附带的诚实注释。早期第三方遥测显示,K3 每秒约生成 28 tokens,首 token 延迟约为四秒[7]。对于这种规模且始终开启推理的模型,这并不意外,但确实很慢。K3 为单次调用的深度而设计,不追求每分钟调用量;延迟敏感的交互循环应使用其他模型。
还有一项产品线调整:Moonshot 在发布 K3 的同时大幅精简型号。旧版 moonshot-v1 系列和较早的 K2.x 变体已停止向新用户开放,平台计划于 2026 年 8 月底全面下线。Moonshot 希望所有人转向 K3。
从 K2.x 迁移:实用清单
如果你正在使用 K2.6 或 K2.7-Code,迁移范围不大,但确实存在:
- 将模型 ID 改为
kimi-k3,API 仍与 OpenAI 兼容。 - 将
thinking参数替换为顶层reasoning_effort。 K2 时代的thinking对象不是 K3 参数,会直接报错。 - 删除采样参数。 从 K3 请求中移除
temperature、top_p和 penalty 设置;这些值由服务器固定,其他值会让请求被拒。 - 主动选择推理档位。 默认值
max成本最高,推理 tokens 按输出计费。任务不值得深度推理时降到high或low;也不要在对话中途切换,因为这会让前缀缓存失效。 - 重新审核成本模型。 按标价计算,输出 token 单价是 K2.6 的 3.75x,而常开推理还会增加输出量。利用自动缓存降低开支:稳定前缀在前,可变后缀在后。
- 如果过去传入公开图片 URL,需要重做视觉输入。 K3 只接受 base64 或已上传文件的引用[5]。
- 每轮都完整回传 assistant 消息,包括
reasoning_content和tool_calls。
现在谁适合使用 K3
严格依据已确认信息,K3 目前适合单项任务质量比每 token 成本更重要的长周期工作:在大型代码库中运行数小时的编程智能体、把百万 token 文档语料作为缓存前缀反复查询,以及需要在同一上下文中处理图片、视频与代码的多模态推理任务。
它目前不适合延迟敏感的交互产品(28 tokens/sec 是为另一类任务准备的工具)、需要可调采样的流程(所有参数均已锁定),也不适合纯粹追求最低成本的场景——更便宜的档位就是为此存在的。
通过 reAPI 运行 Kimi K3
K3 已在 reAPI 网关上线,可作为 OpenAI 兼容端点直接替换:将 base URL 改为 https://api.reapi.ai/v1,把网关密钥作为 bearer token 发送,并将模型字符串设为 kimi-k3。现有的 openai SDK 无需修改即可使用。
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Refactor this module and add tests." }
],
"reasoning_effort": "high",
"stream": true
}'选择 reAPI 而不是直连 K3 有两个原因:
- 价格。 reAPI 上 K3 的费率是每 1M tokens 输入 $2.50 / 输出 $12.00,两项都低于 Moonshot 公布价格,输出费用足足低五分之一[8]。对于常开推理会增加输出量的模型,输出单价才是更关键的数字。
- 一个密钥,多种模型。 同一网关密钥可调用 Claude、GPT、Gemini、DeepSeek、GLM 和 Kimi 系列,因此 K3 只是路由选择,而不是供应商绑定;可以把它放入与其他模型相同的降级与负载均衡逻辑中。
完整请求接口——固定参数、缓存条件、视觉输入格式和错误目录——都记录在 Kimi K3 API 文档中,当前费率见模型页面。
常见问题
Kimi K3 是开源模型吗?
Moonshot 将 K3 描述为开源发布,并承诺公开权重;这将使它成为首个 3 万亿参数级开放模型[3]。截至本文撰写时,权重即将发布,但主要访问方式仍是 API。
能关闭或降低 K3 的推理吗?
不能关闭,推理始终开启。但可以降低:reasoning_effort 接受 low、high 和 max,默认是 max[4]。当推理成本高于答案价值时,正是使用 low 的场景。
1M 上下文会额外收费吗?
不会。任何上下文长度都按统一 token 费率计价,900K-token prompt 与 9K prompt 的单价相同[2]。Moonshot 直连时,缓存命中输入降至每 1M tokens $0.30。
为什么 K3 请求返回 temperature 错误?
temperature、top_p、n 和两项 penalty 参数都由服务器固定,传入任何不同值都会报错,而不会覆盖默认值[1]。请从请求中删除它们。K2 时代的 thinking 对象也是如此,应改用顶层 reasoning_effort。
能在 Claude Code、Codex 或 Cline 中使用 K3 吗?
可以。API 与 OpenAI 兼容,因此所有支持自定义 base URL 和密钥的工具都能调用,包括 Claude Code、Codex、Cline、RooCode 和 OpenCode。使用网关密钥,将工具指向 https://api.reapi.ai/v1,模型 ID 设为 kimi-k3。
K3 在基准测试中与 Claude Opus 4.8 或 GPT-5.5 相比如何?
截至本文撰写时,Moonshot 尚未公布 K3 的官方评测表,没有 SWE-Bench、没有 Terminal-Bench,也没有任何可独立验证的结果。在基准测试表和技术报告发布前,应将社交媒体流传的具体数字视为未经验证。
参考资料
- Moonshot AI。Kimi K3 快速入门——官方 API 文档:模型 ID、固定采样参数、输出上限、工具调用与上下文缓存。 2026 年 7 月检索自 platform.kimi.ai/docs/guide/kimi-k3-quickstart
- Moonshot AI。Kimi K3 价格——每 1M tokens $3.00 / $15.00,缓存命中输入 $0.30,不设上下文分档。 2026 年 7 月检索自 platform.kimi.ai/docs/pricing/chat-k3
- Moonshot AI。模型概览——2.8T 参数、Kimi Delta Attention + Attention Residuals、Stable LatentMoE(896 个专家中激活 16 个),以及开源承诺。 2026 年 7 月检索自 platform.kimi.ai/docs/api/models-overview
- Moonshot AI。使用 reasoning_effort——三级(low / high / max)、默认 max,以及切换档位导致缓存失效。 2026 年 7 月检索自 platform.kimi.ai/docs/guide/use-reasoning-effort
- Moonshot AI。使用 Kimi 视觉模型——图片与视频输入、base64 和文件引用,不支持公开 URL。 2026 年 7 月检索自 platform.kimi.ai/docs/guide/use-kimi-vision-model
- Moonshot AI。Kimi Linear:一种兼具表达力与效率的注意力架构(arXiv:2510.26692)——KDA、3:1 混合布局、KV-cache 与解码结果。 2026 年 7 月检索自 arxiv.org/abs/2510.26692
- OpenRouter。MoonshotAI: Kimi K3——实时遥测:缓存命中率、加权输入价格、吞吐量与 TTFT。 2026 年 7 月检索自 openrouter.ai/moonshotai/kimi-k3
- reAPI。Kimi K3——模型页面、API 文档和当前费率。 2026 年 7 月检索自 reapi.ai/docs/kimi-k3
- Moonshot AI. Chat Completions API — output cap and input-plus-cap validation. Retrieved September 8, 2026 from platform.kimi.ai/docs/api/chat
延伸阅读
- reAPI。Kimi K3 API 文档。 reapi.ai/docs/kimi-k3
- reAPI。Kimi K3 模型页面——当前价格。 reapi.ai/models/kimi-k3
- reAPI。什么是 Claude Opus 4.8?Anthropic 新模型详解。 reapi.ai/blog/what-is-claude-opus-4-8
- reAPI。什么是 reAPI? reapi.ai/blog/what-is-reapi
作者

分类
更多文章

Seedance 2.5 摄像机:数字而非形容词
Seedance 2.5 摄像机控制对描写词失效,因为形容词映射到快速默认运动。用明确的速度数值、命名刚体设备和时间戳节拍替代心情词,精确控制摄像机路径。


Claude Opus 4.8:编码、诚实度与成本
Claude Opus 4.8 官方基准对比、诚实度改进、Dynamic Workflows 功能、默认努力等级变化及迁移规划详解。


AI 视频生成 API:两种计费单位的价格对比
AI 视频生成 API 采用两种不兼容计费单位:按秒计费与单次固定价。本文讲解成本分界点在哪,以及如何准确对真实视频计价。
