gemini-nano-banana-2.1 调用原生 Gemini GenerateContent 接口。
Google 于 2026 年 10 月 6 日正式发布
gemini-nano-banana-2.1。Google 建议此前使用 gemini-3.1-flash-image 的新项目迁移到该模型。模型规格
核心能力
- 根据文本提示生成图片。
- 通过对话式指令编辑现有图片。
- 在单次请求中融合最多 14 张参考图片。
- 在连续编辑中保持角色和物体外观一致。
- 支持
1:4、4:1、1:8、8:1等宽幅和全景比例。 - 生成信息图、菜单、图表等包含文字的视觉内容。
请求示例
- 文生图
- 图片编辑
- 思考强度
使用
responseModalities 请求图片输出,并通过 responseFormat.image 设置宽高比和分辨率。cURL
读取生成图片
响应可以同时包含文本内容块和图片内容块。对inlineData.data 进行 Base64 解码,并根据 inlineData.mimeType 保存图片。
Python
图片配置
输入建议
- 将文本指令和参考图片放在同一个
parts数组中。 - Base64 内容使用
inline_data,已上传文件 URI 使用file_data。 - 支持的图片 MIME 类型包括 PNG、JPEG、WebP、HEIC 和 HEIF。
- 最多可以传入 14 张参考图片;角色一致性适合最多 4 个角色,物体保真适合最多 10 个物体。
- 视频和 PDF 输入同样占用 131,072 Token 上下文窗口。
Gemini Nano Banana 2.1 API 参考
查看原生 Gemini 图片生成接口的请求与响应字段。