Skip to main content
Kimi K3 是月之暗面面向长周期编码、端到端知识工作和深度推理推出的旗舰模型。它提供 100 万 token 上下文窗口、图片理解能力,并通过 AnyFast OpenAI 兼容的对话补全接口提供始终开启的推理能力。
模型 ID 为 kimi-k3。K3 始终进行推理,并使用顶层 reasoning_effort 字段控制思考强度,不再使用 K2.x 的 thinking 对象。

核心能力

  • 100 万 token 上下文 — 处理大型代码库、长文档和长时间运行的智能体历史
  • 2.8T 稀疏架构 — 使用 KDA、Attention Residuals 和 Stable LatentMoE,每个 Token 激活 896 个专家中的 16 个
  • 多模态输入 — 在同一轮对话中理解文本和图片
  • 始终开启推理 — 支持 lowhighmax,默认为 max
  • 长周期编码 — 理解大型代码库并协调终端或外部工具完成工程任务
  • 结构化输出 — 使用 JSON Mode 或严格 JSON Schema 约束最终答案
  • 工具调用tool_choice 支持 autononerequired
  • 自动上下文缓存 — 长前缀保持不变时无需创建缓存 ID 即可尝试命中缓存
  • Partial Mode — 从预先提供的 assistant 文本前缀继续生成

快速示例

思考强度

K3 始终开启推理。根据任务复杂度,将顶层 reasoning_effort 设置为 lowhighmax,默认值为 max
不要传入 K2.x 的 thinking 参数。K3 的推理无法关闭。对话中途切换 reasoning_effort 还会使前缀缓存失效,因此应在对话开始前确定思考强度。

流式输出

流式模式下,推理过程通过 delta.reasoning 返回,最终答案通过 delta.content 返回。非流式响应还会返回 message.reasoning,并可能包含 message.reasoning_details

图片输入

多模态 content 必须是带类型的对象数组。AnyFast 支持传入公开图片 URL 或 Base64 Data URI。
官方建议图片不超过 4K。

结构化输出

使用 response_format.type: "json_schema" 并设置 strict: true,可以约束最终 message.content 的结构。
只解析 message.contentreasoningreasoning_details 不属于结构化结果。

工具调用

K3 支持顶层函数工具,tool_choice 可以使用 autononerequired
执行工具后,将完整 assistant 消息和每个 tool_call_id 对应的 role: "tool" 结果追加到 messages,再调用模型获得最终答案。

Partial Mode

在最后追加一条带有 partial: true 的 assistant 消息,可以让模型从指定前缀继续生成。

参数与限制

temperature 固定为 1.0top_p 固定为 0.95n 固定为 1,两个 penalty 参数固定为 0。请勿显式传入这些参数。多轮对话和工具调用必须原样回传完整 assistant 消息,包括 reasoningreasoning_detailstool_calls
自动上下文缓存针对保持不变的前缀生效。上一请求的 Prompt 超过 256 Token 后,后续请求才可能命中前缀缓存。同一会话或任务建议复用稳定的 prompt_cache_key

API 参考

查看 Kimi K3 的交互式 API 参考。