跳转到主要内容
Gemini 3.5 Flash-Lite 是 Google Gemini 3.5 系列中速度最快、成本最低的模型。它通过原生 Gemini API 提供服务,适合高吞吐量子智能体执行、文档解析、数据提取、路由和分类任务。

核心能力

  • 100 万 token 上下文 - 最多 1,048,576 个输入 token 和 65,536 个输出 token
  • 多模态输入 - 支持文本、图片、视频、音频和 PDF 输入,输出文本
  • 高吞吐量 - 针对低延迟文档解析和批量提取优化
  • 子智能体执行 - 改进代码执行、搜索和多步工作流中的工具可靠性
  • 结构化提取 - 擅长文档理解、表格处理和 JSON 输出
  • 工具能力 - 函数调用、代码执行、文件搜索、Google 搜索、Google 地图、网址上下文和结构化输出
  • 思考等级 - 默认为 minimal;自主工具调用和多步推理可使用 mediumhigh

快速示例

API 变更

请勿传入 temperaturetopPtopK。Google 已在 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 中弃用这些采样参数。同时请移除 candidateCount 和旧版 thinkingBudget 配置。
请求不能以非空的 model 角色轮次结尾。对话必须以非空的 user 轮次结束,否则 API 返回 HTTP 400。

参数说明

API 参考

查看 Gemini 3.5 Flash-Lite 的交互式 API 参考。

官方参考