Gemini 3.8 Flash 已上线,API 团队要重测成本并准备 2027 年涨价
Google 在 2026 年 9 月 2 日发布 Gemini 3.8 Flash,当前模型 ID 为 gemini-3.8-flash,已经进入 GA(正式可用于生产)。对正在跑 Gemini API 的团队,最需要先处理的有两件事:一是迁移参数,二是重新测单任务 Token 消耗。Standard API 档的优惠单价在 2026 年底前和 3.7 Flash 相同,但 Google 明确提醒,3.8 在复杂任务和较高思考等级下可能使用更多 Token,复杂任务的账单仍可能增加。
旧 API 参数需要逐项迁移
Gemini 3.8 Flash 的默认思考等级是 medium,可选 low、medium、high。minimal 不受支持,显式传入会触发 API 校验错误。Google 的迁移清单还要求把整数型 thinking_budget 改成 thinking_level,并从生成配置里移除 temperature、top_p、top_k;candidate_count 也应删除。Google Cloud 的开发者指南进一步列出 frequency_penalty 和 presence_penalty 为不支持参数。
旧网关里的兼容代码要按 3.8 的现行规则清理。尤其不要把旧的 temperature 自动改写为某个固定值:Google 当前迁移文档的动作是移除该参数。多轮会话也要检查历史消息,预填充的 model turn 已不受支持;如果还在使用 generateContent 做 Function Calling,FunctionResponse 需要带上对应的 call_id 和 name。
生产环境里更稳妥的做法,是在灰度环境把真实请求重放一遍:轻量任务先显式指定较低思考等级,复杂代码或多步 Agent 再测试 medium、high,同时检查校验错误、延迟和 Token 用量。Google 仍明确支持 3.7 Flash,效率优先的路径没有必要为了版本号统一而同时切换。
2026 年用优惠价,2027 年标准价翻倍
Gemini 3.8 Flash 的 Standard API 计费档分为两个阶段:2026 年底前为已实施的 introductory pricing,2027 年 1 月 1 日起为已公布、尚待生效的标准价。输出价格已经包含 thinking tokens,也就是模型内部思考所消耗的 Token 计入输出侧账单。
| 计费项目 | 至 2026 年 12 月 31 日 | 2027 年 1 月 1 日起 | 来源 |
|---|---|---|---|
| 输入 Token/100 万 | 0.75 美元 | 1.50 美元 | Google Gemini API pricing |
| 输出 Token/100 万(含 thinking tokens) | 3.75 美元 | 7.50 美元 | Google Gemini API pricing |
| Context caching 读取/100 万 | 0.075 美元 | 0.15 美元 | Google Gemini API pricing |
| Context caching 存储/100 万 Token·小时 | 0.50 美元 | 1.00 美元 | Google Gemini API pricing |
Google 对 3.8 的官方描述是:复杂任务会执行更多推理步骤并反复调用工具,在较高 effort 下有时会消耗更多 Token。官方没有给出一个可以套到所有工作负载上的“平均多 30%”或“账单上涨 45%”。因此,预算核算应该用自己的请求分布做 A/B:相同输入分别跑 3.7 和 3.8,再按实际输入、可见输出和思考 Token 统计成本,而不是把社区单次测试直接当成生产预算系数。
还要提前处理 2027 年的价格跳变。按 Google 当前公布的安排,2027 年 1 月 1 日起,输入、输出、缓存读取及缓存存储均变为优惠期的两倍。对于按月跑大量 Agent、代码审查或长文档处理的 SaaS,这个日期比模型跑分更直接:2026 年上线时就应把 2027 标准价放进单位经济模型,避免年底再临时重算。
3.8 的收益集中在长任务和 Agent
Google 把 3.8 Flash 定位在长周期软件工程、自主 Agent 和复杂企业工作流。官方模型卡显示,它在 HLE-Verified 上为 54.9%,并在 DeepSWE v1.1、Finance Agent 等长任务和专业工作流评测中较 3.7 有提升。这里更值得看的是能力方向:3.8 的设计会在复杂任务上“多做几步”,而 Google 同时保留了较低 effort 和继续使用 3.7 的选择。
对实际产品路由,可以把任务拆开测:分类、抽取、简单格式转换先看 low;需要连续工具调用、长代码修改和多步推理的任务再比较 medium 与 high。最终选择看任务完成率、延迟和总 Token,而不只看单个公开 benchmark。
Gemini 3.8 Flash 的输入上限为 1,048,576 Token,最大输出为 65,536 Token。模型卡列出的知识截止日期是 2026 年 3 月,同时提醒部分领域的内置知识可能只到 2025 年 1 月。处理快速变化的框架、法规、产品文档时,仍应把实时资料接进工作流。Gemini API 的付费层目前为 Gemini 3.x 共享每月 5,000 次 Google Search grounding 免费请求,之后按每 1,000 次搜索请求 14 美元计费。
Cyber 版本走 Fairwind 受控通道
Gemini 3.8 Flash Cyber 和通用 3.8 Flash 同日发布,但接入方式不同。Google 把 Cyber 放在 Fairwind Program 里,优先面向政府和国家网络安全机构、关键基础设施运营方,以及核心技术平台。申请方需要经过审核;参与组织还要落实用户级认证、抗钓鱼 MFA、访问控制和员工使用追踪,模型访问不能转售或再分发。
因此,普通开发者评估 3.8 时,应把通用 gemini-3.8-flash 当作实际可部署对象。Cyber 的 86.2% CyberGym Pass@1、47.2% CWE-Bench Pass@1 等成绩可以说明 Google 在安全任务上的专门训练方向,这些成绩对应的是需经 Fairwind 审核接入的 Cyber 版本;普通 API 的选择与预算应使用通用版本数据。
拓展阅读
Google Gemini 3.7 Flash 2026定价…:同版块的站内帖,同样围绕 Gemini 3,往深里读接这一篇。
Gemini Notebook 2026 新限额…:还是 Gemini,同版块的另一篇站内帖。
Gemini Omni 1.1 Flash 榜单与价格…:同版块的站内帖,本文这条线往深里读接这一篇。
Teams+Cowork:会议记录、频道消息、跨团队任务协调全覆盖:AI实战·办公与学习的长青帖,另一条线上和 任务 挨着的一篇。
AS年度审查:每年要重新证明住房成本吗?:换个版块看 要重:新西兰的税务福利帖。
参考资料
- Google:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- Google AI for Developers:What’s new in Gemini 3.8 Flash
- Google AI for Developers:Gemini 3.8 Flash model page
- Google AI for Developers:Gemini Developer API pricing
- Google Cloud:Developer’s guide to Gemini 3.8 Flash
- Google DeepMind:Gemini 3.8 Flash Model Card
- Google DeepMind:Fairwind Program