Skip to main content
Gemini 3.8 Flash 是 Google 面向长周期软件工程、自主智能体和复杂企业工作流的正式版 Flash 模型。AnyFast 通过原生 Gemini generateContent API 提供服务,稳定模型 ID 为 gemini-3.8-flash

核心能力

  • 100 万 Token 上下文 - 最多 1,048,576 个输入 Token 和 65,536 个输出 Token
  • 多模态输入 - 支持文本、图片、视频、音频和 PDF 输入,输出文本
  • 长周期编码 - 面向复杂的多文件工程任务和迭代验证
  • 自主智能体 - 改进多步规划、确定性工具执行和失败循环恢复能力
  • 工具能力 - Function Calling、代码执行、文件搜索、Google 搜索、Google 地图、网址上下文、结构化输出和 Computer Use(预览)
  • 思考等级 - 支持 lowmediumhigh,默认值为 medium
  • 缓存与处理选项 - 上游支持上下文缓存、Batch API、Flex inference 和 Priority inference

模型规格

快速示例

思考等级

根据延迟要求和任务难度选择思考等级:
Gemini 3.8 Flash 不支持 minimal,传入该值会返回错误。请使用 thinkingLevel;旧的数值型 thinkingBudget 参数不受支持。
Gemini 3.8 Flash 在困难的长周期任务中可能使用更多推理 Token,因为模型会拆分步骤、迭代调用工具并验证中间结果。不需要此类验证的工作流可以使用 low

已移除的生成参数

调用 Gemini 3.8 Flash 时不要传入以下字段:
  • generationConfig.temperature
  • generationConfig.topP
  • generationConfig.topK
  • generationConfig.candidateCount
  • generationConfig.thinkingConfig.thinkingBudget
请使用 generationConfig.thinkingConfig.thinkingLevel 控制推理强度。

对话与工具要求

  • 不要预填模型响应。对话必须以非空的 user 轮次结束。
  • 在工具工作流中回传对话历史时,必须保留模型返回的每个 thoughtSignature
  • functionResponse 必须同时包含函数 name 和模型返回的对应调用 id
  • 多模态素材应放在相应的内容或函数响应载荷内。

参数说明

API 参考

查看 Gemini 3.8 Flash 的交互式 API 参考。

官方参考