/v1/responses) 提供服务。根据 OpenAI 官方模型说明,gpt-5.6-luna 是 GPT-5.6 系列中面向成本敏感、高并发工作负载的高效模型。
当吞吐量和成本效率比最高模型能力更重要时,建议使用 gpt-5.6-luna。
核心能力
- Responses API — 使用新版
/v1/responses端点,用input替代messages - 高效能力 — 面向成本敏感的大规模请求
- 长上下文 — 支持 105 万 token 上下文窗口,最大输出 128K token
- 高级推理 — 支持推理工作量级别:none、low、medium(默认)、high、xhigh、max
- Pro mode — 通过
reasoning.mode: "pro"启用质量优先模式,适合可接受更高延迟和 token 消耗的任务 - 推理保留 — 通过
reasoning.context控制是否在多轮中复用历史推理 - 详细度控制 — 设置响应详细程度为 low、medium 或 high
- 流式输出 — 通过 SSE 实现实时 Token 流式传输
- 工具调用 — 支持函数调用、联网搜索、文件检索、代码解释器、计算机操作等 Responses API 工具
- Programmatic Tool Calling — 适合边界明确、工具调用密集的流程,由模型编写 JavaScript 协调符合条件的工具调用
快速示例
参数说明
API 参考
查看 GPT-5.6 Luna 的交互式 API Playground。