模型 ID 为
kimi-k3。K3 始终进行推理,并使用顶层 reasoning_effort 字段控制思考强度,不再使用 K2.x 的 thinking 对象。核心能力
- 100 万 token 上下文 — 处理大型代码库、长文档和长时间运行的智能体历史
- 2.8T 稀疏架构 — 使用 KDA、Attention Residuals 和 Stable LatentMoE,每个 Token 激活 896 个专家中的 16 个
- 多模态输入 — 在同一轮对话中理解文本和图片
- 始终开启推理 — 支持
low、high和max,默认为max - 长周期编码 — 理解大型代码库并协调终端或外部工具完成工程任务
- 结构化输出 — 使用 JSON Mode 或严格 JSON Schema 约束最终答案
- 工具调用 —
tool_choice支持auto、none和required - 自动上下文缓存 — 长前缀保持不变时无需创建缓存 ID 即可尝试命中缓存
- Partial Mode — 从预先提供的 assistant 文本前缀继续生成
快速示例
思考强度
K3 始终开启推理。根据任务复杂度,将顶层reasoning_effort 设置为 low、high 或 max,默认值为 max。
流式输出
流式模式下,推理过程通过delta.reasoning 返回,最终答案通过 delta.content 返回。非流式响应还会返回 message.reasoning,并可能包含 message.reasoning_details。
图片输入
多模态content 必须是带类型的对象数组。AnyFast 支持传入公开图片 URL 或 Base64 Data URI。
结构化输出
使用response_format.type: "json_schema" 并设置 strict: true,可以约束最终 message.content 的结构。
message.content;reasoning 和 reasoning_details 不属于结构化结果。
工具调用
K3 支持顶层函数工具,tool_choice 可以使用 auto、none 或 required。
tool_call_id 对应的 role: "tool" 结果追加到 messages,再调用模型获得最终答案。
Partial Mode
在最后追加一条带有partial: true 的 assistant 消息,可以让模型从指定前缀继续生成。
参数与限制
temperature 固定为 1.0,top_p 固定为 0.95,n 固定为 1,两个 penalty 参数固定为 0。请勿显式传入这些参数。多轮对话和工具调用必须原样回传完整 assistant 消息,包括 reasoning、reasoning_details 和 tool_calls。自动上下文缓存针对保持不变的前缀生效。上一请求的 Prompt 超过 256 Token 后,后续请求才可能命中前缀缓存。同一会话或任务建议复用稳定的
prompt_cache_key。API 参考
查看 Kimi K3 的交互式 API 参考。