generateContent API 提供服务,稳定模型 ID 为 gemini-3.8-flash。
核心能力
- 100 万 Token 上下文 - 最多 1,048,576 个输入 Token 和 65,536 个输出 Token
- 多模态输入 - 支持文本、图片、视频、音频和 PDF 输入,输出文本
- 长周期编码 - 面向复杂的多文件工程任务和迭代验证
- 自主智能体 - 改进多步规划、确定性工具执行和失败循环恢复能力
- 工具能力 - Function Calling、代码执行、文件搜索、Google 搜索、Google 地图、网址上下文、结构化输出和 Computer Use(预览)
- 思考等级 - 支持
low、medium和high,默认值为medium - 缓存与处理选项 - 上游支持上下文缓存、Batch API、Flex inference 和 Priority inference
模型规格
快速示例
思考等级
根据延迟要求和任务难度选择思考等级:Gemini 3.8 Flash 在困难的长周期任务中可能使用更多推理 Token,因为模型会拆分步骤、迭代调用工具并验证中间结果。不需要此类验证的工作流可以使用
low。已移除的生成参数
调用 Gemini 3.8 Flash 时不要传入以下字段:generationConfig.temperaturegenerationConfig.topPgenerationConfig.topKgenerationConfig.candidateCountgenerationConfig.thinkingConfig.thinkingBudget
generationConfig.thinkingConfig.thinkingLevel 控制推理强度。
对话与工具要求
- 不要预填模型响应。对话必须以非空的
user轮次结束。 - 在工具工作流中回传对话历史时,必须保留模型返回的每个
thoughtSignature。 functionResponse必须同时包含函数name和模型返回的对应调用id。- 多模态素材应放在相应的内容或函数响应载荷内。
参数说明
API 参考
查看 Gemini 3.8 Flash 的交互式 API 参考。