POST /v1/chat/completions 调用。
核心能力
- 100 万 token 上下文 — 处理长文档、代码仓库和多轮对话。
- 编程与智能体 — 支持工具调用和多步骤推理工作流。
- 原生多模态 — 支持在消息中传入文本、图片和视频内容。
- 自适应思考 — M3 默认启用思考,可通过
thinking控制。 - 推理输出控制 — 使用
reasoning_split将推理内容拆分到专用响应字段。 - 流式输出 — 将
stream设置为true,通过 Server-Sent Events 接收增量结果。 - 优先服务 — 账号开通优先服务后,可使用
service_tier: "priority"。
模型 ID
请求体中使用官方模型 IDMiniMax-M3。
快速示例
cURL
多模态输入
将文本、图片或视频内容放入消息的content 数组中。image_url 或 video_url 应使用模型可以访问的公开 URL。
思考与推理
省略thinking 时,MiniMax-M3 默认使用自适应思考。将 thinking.type 设置为 adaptive 可启用自适应思考,设置为 disabled 可跳过思考。reasoning_split 只改变响应格式,不会开启或关闭思考。
对于 M2.x 模型,思考不能关闭。本页介绍 M3;调用其他 MiniMax 模型时,请以对应模型页面为准。
流式输出
将stream 设置为 true 后,接口会返回 Server-Sent Events。流式响应使用 OpenAI 兼容的 chat.completion.chunk 对象类型。
cURL
Token 限制
MiniMax-M3 的max_completion_tokens 推荐值为 131072,最大值为 524288。官方接口仍接受旧的 max_tokens 字段,但该字段已弃用;新接入请使用 max_completion_tokens。
API 参考
查看 MiniMax-M3 的交互式 API 参考。