Google 连发 3 款 Gemini:这次没等来 Pro,却看懂了 Agent 的分工

2026年7月22日 · 3218 字 · 7 分钟 · Gemini Google DeepMind AI Agent 大模型 AI编程 网络安全

Google 连发 3 款 Gemini:这次没等来 Pro,却看懂了 Agent 的分工 封面

同一天发布三款 Gemini,为什么大家等了很久的 Pro 还是没来?

这是 Google 7 月 21 日这场模型更新里,最值得回答的问题。

Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber,名字看起来像一次常规的“加量降价”。但把三款模型放在一起看,Google 实际上给 AI Agent 配了一套分工明确的班底:

  • 3.6 Flash 负责扛复杂任务
  • 3.5 Flash-Lite 负责高并发执行
  • 3.5 Flash Cyber 负责查漏洞、补漏洞

一句话概括:一个当主力,一个跑批量,一个做安全专家。

这次没有新的旗舰 Pro,却把“如何低成本跑 Agent”讲得很清楚。

先看三款模型

Gemini 3.6 Flash

这是 Google 给出的“workhorse model”,也就是日常生产环境里的主力模型。

它的模型 ID 是 gemini-3.6-flash,默认思考等级为 medium。标准 API 价格为每 100 万输入 Token 1.5 美元、每 100 万输出 Token 7.5 美元。

和上一代 3.5 Flash 相比,输入价格不变,输出价格从 9 美元降到了 7.5 美元。Google 引用 Artificial Analysis 的测试称,其输出 Token 使用量还减少了 17%。在部分特定代码基准中,Token 降幅更高。

这两个数字放在一起很重要。Agent 的成本不只取决于 Token 单价,还取决于它为完成任务要思考几轮、调用几次工具、返工多少次。3.6 Flash 的升级方向,正是用更少的步骤把事情做完

能力重点也很明确:

  • 复杂代码生成、代码迁移和全栈重构
  • 多步 Agent 编排与工具调用
  • 文档解析、图表分析和报告撰写
  • 图片、视频、音频、PDF 等多模态理解
  • 电脑操作与视觉界面理解

Google 公布的结果中,3.6 Flash 在 DeepSWE 上从 3.5 Flash 的 37% 提升到 49%,OSWorld-Verified 从 78.4% 提升到 83.0%,机器学习研究基准 MLE-Bench 从 49.7% 提升到 63.9%。这些数据来自 Google 官方发布,适合判断改进方向,真实项目仍要用自己的任务集验证。

**适合谁:**正在做编程 Agent、企业知识助手、复杂文档分析、研究助理和多步骤自动化的团队。

3.5 Flash-Lite

如果 3.6 Flash 是主力,3.5 Flash-Lite 更像便宜、快速、可以大量复制的执行层。

它的模型 ID 是 gemini-3.5-flash-lite,默认思考等级为 minimal。标准 API 价格为每 100 万输入 Token 0.3 美元、每 100 万输出 Token 2.5 美元;Batch 和 Flex 模式还能降到 0.15 美元和 1.25 美元。

Google 将它称为 3.5 家族里速度最快、成本最低的模型。Artificial Analysis 测得其输出速度达到每秒 350 Token。

低价不代表只能做聊天客服。它同样支持文本、图片、视频、音频和 PDF 输入,也有 100 万 Token 上下文窗口,并支持思考、代码执行、函数调用、文件搜索和结构化输出。

它更适合这些工作:

  • 批量解析合同、简历、票据和商品资料
  • 翻译、分类、摘要、字段抽取
  • Agent 搜索中的并行子任务
  • 一次生成几十个方案,再交给主模型筛选
  • 对延迟和成本敏感的高频接口

Google 给出的基准中,3.5 Flash-Lite 在 Terminal-Bench 2.1 上从上一代 3.1 Flash-Lite 的 31% 提升到 54%,长上下文测试从 60.1% 提升到 72.2%。在 SWE-Bench Pro 和 OSWorld-Verified 上,它甚至超过了 Gemini 3 Flash。

这里透露出一个很现实的变化:便宜模型正在接管大量原本需要主模型处理的工作。

很多 Agent 产品没必要让最贵的模型从头干到尾。把检索、抽取、翻译、格式转换和候选方案生成交给 Flash-Lite,最后再由 3.6 Flash 做判断,成本会更可控。

**适合谁:**有大量重复任务、批处理任务或多 Agent 子任务的开发者和企业团队。

3.5 Flash Cyber

第三款最特别,也最容易被名字误导。

Gemini 3.5 Flash Cyber 不是面向所有开发者开放的通用 API 模型。它建立在 3.5 Flash 之上,专门针对发现、验证和修复软件漏洞进行了微调,并与 Google DeepMind 的代码安全 Agent——CodeMender 配合使用。

漏洞扫描有一个典型难题:搜索空间太大。

大型代码库里可能有成千上万条执行路径。与其让一个昂贵的大模型只检查一次,CodeMender 会多次调用更轻量的 3.5 Flash Cyber,让多个子 Agent 分头扫描,再汇总成一份报告。Google 在 CyberGym 测试中最多调用五次模型来生成最终结果。

在对 V8 JavaScript 引擎的测试中,Google 称 3.5 Flash Cyber 找到 55 个经确认的独特问题,主线 3.5 Flash 找到 47 个,Claude Opus 4.6 找到 36 个。其中有 10 个问题只被 Flash Cyber 找到。

不过,这款模型具有明显的双重用途风险。它将通过 CodeMender 进入有限访问试点,近期只向政府和受信任合作伙伴开放,普通开发者暂时不能直接调用。

**适合谁:**大型软件供应链、浏览器与基础设施安全团队,以及需要持续扫描提交代码的高安全场景。对普通团队来说,它目前更像一个方向信号,而不是马上可以接入的产品。

一套选型方法

面对一堆相似的 Flash 名字,不需要死记参数。判断一个任务放在哪款模型上,先看三个变量:复杂度、调用量和风险等级。

复杂任务交给 3.6

任务需要规划、反复调用工具、理解图片和文档,还要对结果负责,优先用 3.6 Flash。

例如,让 Agent 读取一批财报、提取指标、查找异常、生成图表并写成报告。这里有长文档、多步推理和工具协作,主力模型更合适。

高频任务交给 Lite

任务规则清晰、数量巨大、单次价值不高,优先用 3.5 Flash-Lite。

例如,每天处理十万张票据,抽取商户、日期、金额和税号;或者把搜索结果分给多个子 Agent 并行摘要。单次能力只要够用,速度和价格会迅速成为主要矛盾。

高风险任务用专用模型

代码安全、医疗、金融等高风险任务,通用模型“也能做”不等于“应该直接用”。3.5 Flash Cyber 展示的路线是:专用微调模型加专门的 Agent 系统,再加严格的访问控制。

目前 Cyber 不对普通开发者开放,但它提醒团队,安全扫描不能只换一个 Prompt 就算完成了专业化。

Agent 开始分层

过去做 AI 应用,常见思路是选一款最强模型,然后把所有请求都扔给它。

到了 Agent 阶段,这种做法会越来越贵。一次对话可能只有几千 Token,一个 Agent 工作流却可能持续几十轮,还要搜索、读文件、运行代码、操作网页,并在失败后重试。

Google 这次三款模型的组合,给出了一种更像真实组织的架构:

  • 3.6 Flash 做主 Agent,负责计划、判断和复杂执行
  • 3.5 Flash-Lite 做子 Agent,承接大量标准化任务
  • Flash Cyber 进入专业系统,处理高风险安全工作

未来 Agent 的竞争力,很大一部分来自任务路由,而不是所有请求都调用同一个最强模型。

对小团队来说,最值得马上尝试的并不是复杂的多 Agent 框架。先把现有调用日志按任务分类,找出其中最重复、最耗 Token、最容易验证结果的一类,再试着切到 Flash-Lite。复杂度高、返工多的任务保留给 3.6 Flash。

模型选型从“谁分数最高”,变成了“谁在这个岗位上最划算”。

Pro 还要等

这次发布没有包含备受期待的 Gemini 3.5 Pro。

Google 在官方文章中确认,3.5 Pro 正在与合作伙伴测试,会在准备好后尽快扩大开放。与此同时,团队已经启动 Gemini 4 的预训练,并称这是其迄今最具雄心的一次预训练运行。

所以,3.6 Flash 不是新旗舰的替代品。它承担的是另一个任务:在 Pro 到来之前,先把生产 Agent 最头疼的成本、延迟和可靠性往前推进。

怎么体验

截至 2026 年 7 月 22 日:

  • 普通用户可在 Gemini App 中使用 3.6 Flash 和 3.5 Flash-Lite
  • 开发者可通过 Google AI Studio、Gemini API 和 Android Studio 调用两款模型
  • 3.6 Flash 还进入 Google Antigravity 和 Gemini Enterprise
  • 3.5 Flash-Lite 正在接入 Google Search
  • 3.5 Flash Cyber 将通过 CodeMender 开展有限访问试点

两款公开 API 模型都支持 1,048,576 个输入 Token、65,536 个输出 Token。输入可以是文本、图片、视频、音频和 PDF,输出目前是文本。

如果你只是想体验最新 Gemini,直接从 3.6 Flash 开始。如果你正在做需要大量 API 调用的产品,建议同时测 3.6 Flash 和 3.5 Flash-Lite,别只比较单次回答质量,还要记录完成率、总 Token、耗时、工具调用次数和返工率。

短评

Google 这次没有端出大家最想看的 Pro,发布节奏确实显得有些微妙。

但三款 Flash 透露出的产品思路很务实:模型不再只按“强弱”排队,而是开始按“岗位”分工。

3.6 Flash 负责把复杂事情做成,3.5 Flash-Lite 负责让大量事情做得起,Flash Cyber 则尝试把高风险工作交给专门系统。

对开发者来说,下一阶段的功课已经不只是写好 Prompt。你还要学会拆任务、分模型、算总账。


==关注我==

如果这篇文章帮你理清了三款 Gemini 的分工,可以先收藏,选型时拿出来对照。

也欢迎转发给正在做 AI Agent、代码工具或企业自动化的同事。我会继续帮你过滤 AI 新品里的噪音,把模型变化翻译成能落地的工具、方法和机会。

有帮助👉 「点赞」「转发」「小心心」

也欢迎在评论区 灵感流淌!