All models

gemini-3.1-flash-lite

GoogleChatreasoningvision
Input 0.5256 Credits / 1MOutput 3.1537 Credits / 1M
Get your API key
gemini-3.1-flash-lite

面向高频翻译与结构化抽取的轻量多模态模型

Gemini 3.1 Flash-Lite 是 Google 面向高频、轻量任务设计的多模态模型,重点兼顾低延迟与使用成本。它适合把消息、评论、图片和文档整理成译文、标签、摘要或结构化数据,也支持按任务增加思考。对于边界清晰、需要反复处理的业务流程,它比追求长篇深度分析更有针对性。

Google模型品牌
对话模型类型
推理、视觉理解任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

版本身份
稳定版 Gemini 3.1 Flash-Lite;调用 ID:gemini-3.1-flash-lite
原生输入上限
1,048,576 tokens
原生输出上限
65,536 tokens
原生输入与输出
文本、图像、视频、音频、PDF 输入;文本输出
结构化处理
原生支持结构化输出、函数调用与 Thinking
图文调用
/gemini/chat/completions:messages 中组合 text 与 image_url,支持流式文本响应
文件与会话
/aichat2/conversations:文本、图片及 file_url 消息,支持保存和延续会话

原生规格描述模型能力;本平台的消息格式、文件处理和会话操作按所选入口使用。

核心能力

了解 gemini-3.1-flash-lite 能为你的工作带来什么。

让重复语言任务保持简洁

Flash-Lite 的重点是明确、重复的语言处理,例如翻译客服消息、压缩评论摘要和给工单分类。提示中可指定目标语言、术语与输出边界,要求只返回译文或标签,减少无关解释,便于将结果直接交给后续业务程序。

把自然语言变成业务字段

模型支持结构化输出,适合从评论中提取评价方面、情感、关键原句和退货意向。先定义字段含义与允许值,再要求按 JSON Schema 返回,可让同一批输入采用统一结构;缺失信息应保留为空,而不是要求模型补齐事实。

图文理解与按需思考

它能结合图片与文字完成内容理解,也可为需要逐步判断的任务增加思考。原生还支持音频转写和 PDF 摘要。适合将识别、提取与简短判断组合起来;简单标签任务不必追求长篇解释,复杂判断则应预留更充足的生成预算。

适用场景

从具体任务出发,找到模型发挥作用的位置。

多语言客服内容整理

输入客户留言、目标语言和品牌术语表,交付不带额外评论的译文;另一次处理可输出问题类型与简短摘要。适合聊天消息、评价和工单队列,让翻译与分类成为可独立检查的步骤,避免把所有业务决策塞进一次回答。

电商评论结构化分析

输入商品评论和字段定义,提取被评价的属性、情感倾向、原文摘录及是否提及退货,交付统一 JSON。应用程序可以据此聚合尺码、材质或物流问题;涉及退款等实际操作时,应由业务规则决定,不让情感判断直接触发执行。

文档初筛与图表摘要

通过会话入口提交文件链接,或在图文消息中附上页面截图,要求输出主题、关键事项与待确认问题。交付物适合做文档目录摘要和人工阅读清单;对表格数字、日期和条件条款,可要求保留原文摘录,方便逐项复核。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

任务清晰时优先选择 Flash-Lite

当任务是翻译、分类、抽取和简短摘要,且输入输出规则可以清楚定义时,Gemini 3.1 Flash-Lite 是合适的轻量选择。若需要开放式规划、深度调试或多步综合分析,可考虑 Flash 或 Pro。这里的取舍是任务定位,不代表每个问题都有固定的质量差距。

稳定版身份与入口分开选择

调用使用 gemini-3.1-flash-lite,不要自行添加 preview 后缀。已有 messages 历史、需要自行处理工具结果或 JSON 输出时,选择 Chat Completions;希望保存会话、提交文件链接并继续追问时,选择 AI Chat v2。两者是使用方式的区别,不是两个独立模型。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 它是以文本为输出的理解模型,不生成图片或音频,也不支持 Live API 或原生电脑操作。能理解音频不等于能合成语音,能返回工具调用也不等于自动获得执行权限;需要实际操作的流程应配置工具并检查执行结果。
  • 原生多模态范围不代表所有材料都采用同一种提交格式。Chat Completions 的图文消息使用 text 与 image_url;PDF 等文件可通过 AI Chat v2 的 file_url 提交。不要将其他型号的视频示例直接当作本型号的音视频提交方式。
  • 长输入上限并不保证每处细节都被准确提取。对于多份文档、密集表格或相互矛盾的评论,建议限定问题、保留原句并校验关键字段。Flash-Lite 更适合初筛与轻量处理,复杂结论应安排进一步分析,而非只增加输出长度。

常见问题

解答使用 gemini-3.1-flash-lite 时的常见疑问。

Gemini 3.1 Flash-Lite 是稳定版还是预览版?

这里介绍的是稳定版 Gemini 3.1 Flash-Lite,调用 ID 为 gemini-3.1-flash-lite。不要把名称自行改成带 preview 的形式,也不要把它与 Gemini 3.1 Pro 或图像生成型号混用;这些型号的任务定位和能力边界不同。

它能读取 PDF 吗?应该怎样提交?

原生模型支持 PDF 理解。在本平台中,可使用 /aichat2/conversations,把文件链接放入 file_url 内容块,并附上摘要或抽取要求。若使用 Chat Completions,可提交文档文本或页面图片,不要把 PDF 链接当作普通图片字段。

能同时看图并返回 JSON 吗?

可以围绕图文输入设计结构化抽取任务:在 messages 中组合文字要求与 image_url,再用 response_format 指定 JSON Schema。适合提取页面字段或图片内容标签;应用端仍应检查字段类型、缺失值和关键数字,不能将格式正确等同于事实正确。

Thinking 应该什么时候使用?

原生支持 Thinking,适合需要逐步判断、比较条件的任务。简单翻译或标签处理通常应先明确规则,再考虑增加思考。Chat Completions 提供 reasoning_effort 字段,它与原生 thinking_level 名称不同,不应直接复制原生配置对象。

怎样继续上一轮文档问答?

使用 AI Chat v2 时,开启 stateful,并在后续请求携带返回的 id,即可围绕同一会话继续追问,普通 JSON 响应包含 answer 与 id。使用 Chat Completions 时,则由客户端维护 messages 历史;两种方式都应避免加入与当前问题无关的材料。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 gemini-3.1-flash-lite 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。